ModelRefs / Cost Per Request — AI Glossary

Cost Per Request — AI Glossary

The total API cost for a complete model invocation, calculated as (inputtokens × inputprice) + (outputtokens × outputprice).

Overview

Cost per request is more operationally useful than cost per token because request shapes vary: a RAG system with 3K context and 200 output tokens has a very different cost profile than a translation task with 100 input and 500 output tokens. Monitoring cost per request by endpoint identifies expensive workloads for optimization.

Reference details

Topicecosystem
Last reviewed2026-06-24

Continue your research

Use these connected ModelRefs sections to compare alternatives, inspect implementation paths, and review the evidence and governance boundaries relevant to Cost Per Request — AI Glossary.

Frequently asked questions

What is Cost Per Request?

The total API cost for a complete model invocation, calculated as (input_tokens × input_price) + (output_tokens × output_price).

What concepts are related to Cost Per Request?

Closely related concepts include cost per token, inference cost, tokens per minute.