Blog

Latência de IA em produção

9 min de leitura

A resposta curta

Usuário abandona fluxo lento independentemente de quão boa a resposta seria. Uma resposta correta que chega depois que a pessoa saiu não vale nada, o que torna latência uma restrição de produto e não um detalhe de infraestrutura.

Defina o orçamento a partir do fluxo, e desenhe dentro dele. Fazer o contrário produz um sistema preciso em teste e não usado em produção.

Para onde o tempo vai de fato

Raramente para um lugar só. Recuperação, incluindo a chamada de embedding da consulta. Tempo até o primeiro token do modelo. Geração, que escala com o tamanho da saída. Chamadas de ferramenta, que são saltos de rede para sistemas que você não controla. E em fluxo de vários passos, tudo isso repetido.

Sem cronometragem por etapa você vai otimizar a coisa errada, normalmente o modelo, porque é a parte visível. O rastreamento necessário para ver isso está em observabilidade.

Streaming muda a percepção

Tempo até o primeiro token costuma importar mais que o tempo total. Uma resposta que começa em meio segundo e leva cinco parece mais rápida que uma que aparece pronta depois de três.

Então faça streaming onde a interface permitir, e desenhe a primeira frase para ser útil em vez de preâmbulo. É uma das melhorias de melhor razão disponível, porque custa quase nada e muda como o produto parece.

Latência de recuperação

Busca por similaridade num índice grande não é de graça, e a chamada de embedding da consulta adiciona uma ida e volta antes de a busca começar.

Filtrar antes de buscar, por cliente, data ou tipo, encolhe o conjunto candidato e acelera. Cachear embedding de consulta repetida ajuda. E um índice ajustado para recall a qualquer custo será mais lento que um ajustado para a precisão de que você precisa, trade-off descrito em RAG.

Escolha de modelo é decisão de latência

Modelo maior é mais lento. Nos passos em que um modelo menor tem desempenho aceitável, classificação, extração, roteamento, o ganho de latência acumula, porque esses passos costumam estar no caminho crítico antes da resposta visível.

Meça qualidade ao fazer isso. Trocar acurácia por velocidade em silêncio é como um sistema rápido e sutilmente pior vai pro ar sem ninguém ter decidido.

Paralelize o que der

Muitos pipelines são sequenciais por hábito, não por necessidade. Recuperação de duas fontes, várias chamadas de ferramenta independentes, ou buscar contexto do usuário enquanto se gera o embedding da consulta podem rodar em paralelo.

A restrição é dependência genuína: só serialize onde um passo precisa do resultado anterior. Auditar um fluxo lento em busca de sequenciamento falso frequentemente acha segundos que ninguém sabia que existiam.

Timeout, fallback e degradação

Tudo nesse stack pode travar. Fornecedor de modelo tem dia ruim, chamada de ferramenta empaca, recuperação bloqueia. Sem timeout, uma dependência lenta vira um produto lento.

Decida o que acontece no timeout antes de acontecer: um modelo menor, uma resposta em cache, uma mensagem elegante, um repasse para humano. Degradar de propósito é recurso. Travar não é.

Fluxo de vários passos multiplica tudo

Em sistemas agênticos, latência é a soma do loop. Doze passos a oitocentos milissegundos são dez segundos antes de qualquer coisa chegar ao usuário.

Se o fluxo é voltado ao usuário, limite os passos e mostre progresso. Se ele genuinamente precisa de muitos passos, tire do caminho síncrono por completo e notifique ao terminar, em vez de fazer alguém olhar um spinner.

Definir um orçamento de latência

Escreva o número a partir do produto, não da infraestrutura. Assistência inline durante a digitação é um orçamento diferente de um resultado de busca, que é diferente de um relatório gerado sob demanda.

Depois distribua entre as etapas e meça contra isso, do mesmo jeito que mediria qualidade. Orçamento que ninguém acompanha é preferência. Essa disciplina faz parte de como construímos IA em produção, ponta a ponta.

Se sua feature de IA é precisa e lenta demais para usar, isso é um problema de engenharia solucionável. Trinta minutos e você sai sabendo o formato dele.

Agendar call Ou mande os detalhes por escrito
Voltar para o blog