ModelRefs / Prompt Compression — AI Glossary
Prompt Compression — AI Glossary
Reducing prompt length by removing redundant tokens or replacing verbose context with dense summaries, preserving task-relevant information.
Overview
Methods: LLMLingua uses a small model to token-level prune low-importance tokens; Selective Context extracts key sentences; AutoCompressor trains a model to produce soft summary tokens. Achieving 4–20× compression with <5% task performance loss, reducing latency and cost for long-context applications.
Reference details
| Topic | prompting |
|---|---|
| Also known as | prompt pruning, context compression |
| Last reviewed | 2026-06-24 |
Related terms
Continue your research
Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to Prompt Compression — AI Glossary.
Frequently asked questions
What is Prompt Compression?
Reducing prompt length by removing redundant tokens or replacing verbose context with dense summaries, preserving task-relevant information.
Is Prompt Compression the same as prompt pruning?
Yes — prompt pruning, context compression are common aliases for Prompt Compression.
What concepts are related to Prompt Compression?
Closely related concepts include context management, long context, rag.