Blog
Otimização de custo de LLM
A resposta curta
Na maioria dos sistemas em produção a conta é dominada por token de entrada, não de saída. Você paga para enviar contexto em toda requisição, e é ali que está a alavanca.
O que significa que a primeira otimização quase nunca é um modelo mais barato. É enviar menos, com menos frequência.
Meça antes de otimizar
Registre tokens por requisição quebrados por fonte: instrução, contexto recuperado, histórico, definição de ferramenta, saída. Agregue por feature.
Os times erram consistentemente sobre qual feature é cara. Sem a quebra você vai otimizar o que é visível em vez do que custa. A instrumentação está descrita em observabilidade.
A maior alavanca é o tamanho do contexto
Prompt longo é cobrado em toda chamada. Cortar trechos recuperados de dez para três, ou eliminar uma instrução de sistema que repete a mesma regra de cinco formas, muda a conta mais do que trocar de faixa de modelo normalmente muda.
É por isso que trabalho de custo e de qualidade convergem: a mesma disciplina que melhora resposta, enviar só o que merece lugar, também reduz gasto. É o assunto de engenharia de contexto.
Cache
Dois tipos, e são diferentes. Cache de prompt reaproveita a forma processada de um prefixo repetido, então uma instrução de sistema grande e estável não é reprocessada em toda chamada. Barato de adotar, ganho grande com frequência, e premia colocar a parte estável primeiro.
Cache semântico devolve resposta anterior para pergunta suficientemente parecida. Poderoso em carga repetitiva e perigoso onde a resposta depende de usuário, permissão ou frescor. Use onde a resposta é genuinamente a mesma para todos, e em nenhum outro lugar.
Roteamento de modelo
Nem todo passo precisa do seu melhor modelo. Classificação, extração, roteamento e formatação frequentemente rodam num modelo menor por uma fração do custo sem perda mensurável de qualidade.
Faça isso com medição, não com intuição. Roteie o passo, rode seu conjunto de referência, compare. Sem evals de LLM você está trocando qualidade por custo às cegas e não vai perceber a troca antes dos usuários.
Controle de loop
Em sistemas agênticos, custo escala com iteração e a entrada cresce conforme o histórico acumula. Uma tarefa que normalmente leva quatro passos e ocasionalmente leva quarenta é onde o orçamento quebra.
Limite iteração de forma dura. Orce tokens por tarefa. Registre os dois e alerte na cauda, não na média, porque a média parece ótima enquanto a cauda come a margem.
Lote e trabalho assíncrono
Se uma resposta não precisa ser imediata, ela não deveria ser precificada como se precisasse. Muitos fornecedores oferecem processamento assíncrono bem mais barato, e boa parte do trabalho de produção, enriquecimento, classificação, resumo de ontem, tolera isso.
A pergunta de desenho é quais partes do seu produto precisam genuinamente ser síncronas. Em geral menos do que se supõe.
O que não otimizar
Não otimize antes de medir, não otimize feature que ninguém usa, e não troque acurácia por custo numa decisão em que errar sai caro.
Resista também a reconstruir infraestrutura para economizar um valor mensal pequeno. Tempo de engenharia é mais caro que a maioria das contas de inferência em volume de médio porte, e uma reescrita que economiza pouco e custa um trimestre é um mau negócio disfarçado de disciplina.
Defina um orçamento por decisão
O enquadramento útil é custo por decisão, não gasto total. Se uma decisão economiza mais do que custa para ser tomada, volume é boa notícia. Se ninguém calculou essa razão, conversa de custo continua abstrata.
Com ela na mão, você decide onde um modelo mais caro compensa e onde não. Esse enquadramento acompanha a abertura completa em quanto custa e faz parte de como construímos IA em produção, ponta a ponta.
Se sua conta de inferência cresce mais rápido que o uso e ninguém explica por quê, trinta minutos costumam achar. Você sai com uma faixa de preço e um próximo passo claro.
Agendar call Ou mande os detalhes por escrito