ModelRefs / Token Budget — AI Glossary

Token Budget — AI Glossary

An explicit cap on the number of tokens an LLM call may use, used for cost control and predictable latency.

Overview

Token budgets are set per-request via max_tokens parameters. Anthropic's extended-thinking API exposes a thinking_budget for reasoning tokens. Budget awareness is also a prompting technique — telling the model 'use at most 200 words' improves conciseness.

Reference details

Topicoperations
Last reviewed2026-06-24

Continue your research

Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to Token Budget — AI Glossary.

Frequently asked questions

What is Token Budget?

An explicit cap on the number of tokens an LLM call may use, used for cost control and predictable latency.

What concepts are related to Token Budget?

Closely related concepts include inference cost, token, streaming.