Blog
Latência de IA em produção
A resposta curta
Usuário abandona fluxo lento independentemente de quão boa a resposta seria. Uma resposta correta que chega depois que a pessoa saiu não vale nada, o que torna latência uma restrição de produto e não um detalhe de infraestrutura.
Defina o orçamento a partir do fluxo, e desenhe dentro dele. Fazer o contrário produz um sistema preciso em teste e não usado em produção.
Para onde o tempo vai de fato
Raramente para um lugar só. Recuperação, incluindo a chamada de embedding da consulta. Tempo até o primeiro token do modelo. Geração, que escala com o tamanho da saída. Chamadas de ferramenta, que são saltos de rede para sistemas que você não controla. E em fluxo de vários passos, tudo isso repetido.
Sem cronometragem por etapa você vai otimizar a coisa errada, normalmente o modelo, porque é a parte visível. O rastreamento necessário para ver isso está em observabilidade.
Streaming muda a percepção
Tempo até o primeiro token costuma importar mais que o tempo total. Uma resposta que começa em meio segundo e leva cinco parece mais rápida que uma que aparece pronta depois de três.
Então faça streaming onde a interface permitir, e desenhe a primeira frase para ser útil em vez de preâmbulo. É uma das melhorias de melhor razão disponível, porque custa quase nada e muda como o produto parece.
Latência de recuperação
Busca por similaridade num índice grande não é de graça, e a chamada de embedding da consulta adiciona uma ida e volta antes de a busca começar.
Filtrar antes de buscar, por cliente, data ou tipo, encolhe o conjunto candidato e acelera. Cachear embedding de consulta repetida ajuda. E um índice ajustado para recall a qualquer custo será mais lento que um ajustado para a precisão de que você precisa, trade-off descrito em RAG.
Escolha de modelo é decisão de latência
Modelo maior é mais lento. Nos passos em que um modelo menor tem desempenho aceitável, classificação, extração, roteamento, o ganho de latência acumula, porque esses passos costumam estar no caminho crítico antes da resposta visível.
Meça qualidade ao fazer isso. Trocar acurácia por velocidade em silêncio é como um sistema rápido e sutilmente pior vai pro ar sem ninguém ter decidido.
Paralelize o que der
Muitos pipelines são sequenciais por hábito, não por necessidade. Recuperação de duas fontes, várias chamadas de ferramenta independentes, ou buscar contexto do usuário enquanto se gera o embedding da consulta podem rodar em paralelo.
A restrição é dependência genuína: só serialize onde um passo precisa do resultado anterior. Auditar um fluxo lento em busca de sequenciamento falso frequentemente acha segundos que ninguém sabia que existiam.
Timeout, fallback e degradação
Tudo nesse stack pode travar. Fornecedor de modelo tem dia ruim, chamada de ferramenta empaca, recuperação bloqueia. Sem timeout, uma dependência lenta vira um produto lento.
Decida o que acontece no timeout antes de acontecer: um modelo menor, uma resposta em cache, uma mensagem elegante, um repasse para humano. Degradar de propósito é recurso. Travar não é.
Fluxo de vários passos multiplica tudo
Em sistemas agênticos, latência é a soma do loop. Doze passos a oitocentos milissegundos são dez segundos antes de qualquer coisa chegar ao usuário.
Se o fluxo é voltado ao usuário, limite os passos e mostre progresso. Se ele genuinamente precisa de muitos passos, tire do caminho síncrono por completo e notifique ao terminar, em vez de fazer alguém olhar um spinner.
Definir um orçamento de latência
Escreva o número a partir do produto, não da infraestrutura. Assistência inline durante a digitação é um orçamento diferente de um resultado de busca, que é diferente de um relatório gerado sob demanda.
Depois distribua entre as etapas e meça contra isso, do mesmo jeito que mediria qualidade. Orçamento que ninguém acompanha é preferência. Essa disciplina faz parte de como construímos IA em produção, ponta a ponta.
Se sua feature de IA é precisa e lenta demais para usar, isso é um problema de engenharia solucionável. Trinta minutos e você sai sabendo o formato dele.
Agendar call Ou mande os detalhes por escrito