ModelRefs / Prompt Compression — AI Glossary

Prompt Compression — AI Glossary

Reducing prompt length by removing redundant tokens or replacing verbose context with dense summaries, preserving task-relevant information.

Overview

Methods: LLMLingua uses a small model to token-level prune low-importance tokens; Selective Context extracts key sentences; AutoCompressor trains a model to produce soft summary tokens. Achieving 4–20× compression with <5% task performance loss, reducing latency and cost for long-context applications.

Reference details

Topicprompting
Also known asprompt pruning, context compression
Last reviewed2026-06-24

Continue your research

Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to Prompt Compression — AI Glossary.

Frequently asked questions

What is Prompt Compression?

Reducing prompt length by removing redundant tokens or replacing verbose context with dense summaries, preserving task-relevant information.

Is Prompt Compression the same as prompt pruning?

Yes — prompt pruning, context compression are common aliases for Prompt Compression.

What concepts are related to Prompt Compression?

Closely related concepts include context management, long context, rag.