Blog

Privacidade de dados em IA corporativa

10 min de leitura

A resposta curta

Nas camadas corporativas de API dos grandes fornecedores, prompts não são usados para treinar modelo por padrão, e esse compromisso é contratual e não uma promessa em post de blog. Peça por escrito e verifique em qual camada você está de fato.

Mas essa é a metade menor da pergunta. A exposição maior normalmente não é o fornecedor. É a sua própria arquitetura: o que você envia, o que você registra, quem consegue ler o registro, e quanto tempo ele vive.

A pergunta atrás da pergunta

Quando um time de segurança pergunta se o dado treina o modelo, o que ele normalmente quer saber é mais amplo: para onde nosso dado vai fisicamente, quem consegue ler, por quanto tempo fica guardado, e o que acontece com ele se a gente sair.

Responda as quatro explicitamente. Responder só a de treinamento e considerar a revisão aprovada é como um projeto é bloqueado duas semanas antes do lançamento por algo que ninguém tinha escrito.

O que de fato acontece com um prompt

Ele viaja até o fornecedor, é processado, e uma resposta volta. Dependendo da camada e da configuração ele pode ser retido brevemente para monitoramento de abuso, e essa janela de retenção é um número específico e documentado que você pode pedir.

Configurações de retenção zero existem em acordo corporativo exatamente por isso. Se a sua classe de dado exige, peça explicitamente em vez de supor que a sua camada padrão inclui.

Seus próprios logs são o risco maior

Para depurar um sistema de IA em produção você registra prompt, contexto recuperado e saída. Isso significa que o seu repositório de log agora guarda dado de cliente, montado e concentrado, muitas vezes num sistema com controle de acesso mais frouxo que o do banco de onde veio.

É essa a exposição que ninguém coloca no questionário de segurança e é a que tem mais chance de causar incidente. Defina retenção, mascare na escrita, escope o acesso, e trate o repositório de log como dado de produção. É a metade incômoda de observabilidade.

Recuperação é onde a permissão vaza

Um sistema que recupera de forma ampla e filtra depois vai eventualmente mostrar a alguém algo que não deveria, porque o filtro é um passo probabilístico dentro de um sistema com componente não determinístico.

Leve a permissão do usuário solicitante para dentro da própria consulta de recuperação, para que material fora de escopo nunca seja candidato. É exigência arquitetural e não de política, e é o ponto feito em RAG e imposto por guardrails.

Residência e transferência internacional

Se você está sujeito a requisito de residência, saiba qual região processa suas requisições e se o failover pode mudar isso. Alguns fornecedores oferecem compromisso de processamento regional e outros não, e isso é um diferencial real entre eles.

Para operação brasileira sob a LGPD, isso precisa de resposta documentada com a base legal junto, não de uma garantia em call comercial.

Fine-tuning muda o quadro

Enviar dado para treinamento é um compromisso diferente de enviar para inferência. Um modelo ajustado pode codificar informação do conjunto de treino, e extrair isso não é trivial, mas também não é impossível.

Então trate um fine-tune como decisão de transferência de dado com revisão própria, e prefira recuperação quando o objetivo é acesso a informação atual em vez de mudança de comportamento. Essa distinção está em fine-tuning.

O que exigir em contrato

Nenhum treinamento com o seu dado. Período de retenção declarado, idealmente zero. Suboperadores nomeados e aviso antes de mudança. Exclusão no encerramento com mecanismo, não só cláusula. Prazo de notificação de incidente. Um acordo de tratamento de dados cobrindo a sua jurisdição.

Peça ao fornecedor que constrói o sistema, não só ao provedor do modelo, já que o integrador normalmente tem acesso mais amplo que o provedor. Fornecedor que não produz isso rápido nunca passou por revisão corporativa, e isso pertence à lista de red flags de fornecedor.

Escolhas de arquitetura que reduzem exposição

Envie o mínimo: identificador em vez de registro inteiro, o trecho relevante em vez do documento todo, um valor mascarado onde o modelo não precisa do real. Mascare antes da requisição, não depois.

Mantenha as classes mais sensíveis fora do caminho do modelo por completo onde uma consulta determinística resolveria. Todo campo que você não envia é um campo que não pode vazar, e essa disciplina reduz custo pelo mesmo motivo que reduz risco. Veja prontidão de dados.

Se uma revisão de segurança é o que está entre você e subir para produção, isso é um problema resolvível e conhecido. Trinta minutos e você sabe o que é preciso.

Agendar call Ou mande os detalhes por escrito
Voltar para o blog