A OpenAI publicou um documento institucional descrevendo de onde vem o material usado pra treinar o ChatGPT e que filtros aplica antes de mostrar esse conteudo aos modelos. O texto e pouco usual no setor: a empresa raramente abre detalhe sobre o pipeline de dados, e a publicacao chega num momento em que reguladores europeus e americanos estao pedindo cada vez mais explicacao sobre como LLMs (modelos de linguagem grandes) sao formados.
As tres fontes que alimentam o modelo
A OpenAI diz que o ChatGPT e treinado em material vindo de tres lugares. Primeiro, informacao publicamente disponivel na internet — paginas indexadas, repositorios abertos, sites institucionais. Segundo, dados obtidos via parcerias com fornecedores que licenciam conteudo. Terceiro, conteudo gerado por usuarios, treinadores humanos contratados pela empresa e pesquisadores internos. A distribuicao entre essas tres fontes nao foi divulgada. O documento descreve as origens, mas nao quantifica.
O que e o OpenAI Privacy Filter
O Privacy Filter e o sistema que a empresa usa pra identificar e mascarar dados pessoais antes que o texto entre no treinamento. Na pratica, varre os corpora atras de coisas como nomes, enderecos, numeros de documento e contatos, e remove ou substitui esse conteudo. O objetivo declarado e fazer com que os modelos aprendam padroes gerais — gramatica, raciocinio, estrutura de codigo, contexto factual — em vez de memorizar informacao sobre individuos especificos. A OpenAI nao detalha como o filtro decide o que e ou nao dado pessoal, nem com que precisao opera. Sao questoes que pesquisadores externos ja apontaram como dificeis de validar sem acesso ao pipeline.
O que a empresa diz nao coletar
O documento e direto sobre alguns limites: a OpenAI afirma que nao coleta intencionalmente conteudo atras de paywalls (muros de pagamento) nem material da dark web (rede acessivel apenas via softwares como Tor). E lista categorias que sao filtradas ativamente fora dos corpora de treino: discurso de odio, conteudo adulto, sites agregadores de dados pessoais e spam. E importante o adverbio “intencionalmente”. Em corpora abertos de varios terabytes, conteudo de paywall pode aparecer via copias ou reposts em outros sites — algo que esse tipo de documento institucional raramente quantifica.
Controles que ficam com o usuario
Do lado de quem usa o ChatGPT, a OpenAI lista tres acoes principais: exportar o historico de conversas, deletar a conta inteira (o que remove os dados associados) e gerenciar configuracoes no painel de privacidade do produto. Esse painel inclui o controle de se as conversas de quem usa o chat publico podem ou nao ser usadas para treinar versoes futuras dos modelos. O controle existe ha algum tempo, mas o documento atual reforca a ferramenta como peca central do contrato de privacidade da empresa com o usuario final.
Por que o documento sai agora
O contexto regulatorio explica boa parte do timing. A Uniao Europeia tem aplicado o AI Act, que exige transparencia sobre dados de treinamento. Autoridades nacionais — entre elas o garante italiano de protecao de dados — ja chegaram a suspender temporariamente o ChatGPT em 2023 por questoes de privacidade. Nos Estados Unidos, processos judiciais movidos por editoras e detentores de direitos autorais pressionam por mais clareza sobre o que entra nos modelos. Um documento publico desse tipo serve simultaneamente a tres audiencias: reguladores, que pedem prestacao de contas; tribunais, onde a empresa precisa apresentar postura sobre seus dados; e usuarios corporativos, que avaliam o ChatGPT antes de adotar internamente.
O trade-off que ficou visivel
O documento confirma uma escolha de design que ja era esperada: o modelo precisa de volume e diversidade de texto pra ficar competente, e a OpenAI nao pretende abrir mao da internet publica como fonte principal. Privacidade entra como camada de filtragem, nao como restricao na origem. O ganho dessa abordagem e capacidade tecnica do modelo. O custo e que o usuario depende da qualidade do filtro — e da boa-fe da empresa em executa-lo — pra ter garantia de que seu nome ou endereco nao entrou no corpus. Pra times que precisam adotar LLMs em ambiente regulado (saude, financeiro, juridico), o documento nao substitui DPA (Data Processing Agreement) nem auditoria propria, mas ajuda a montar o questionario pra avaliacao de fornecedor.
Reportado originalmente por OpenAI em 2026-05-16.



