Pesquisadores de duas áreas diferentes questionam se ferramentas de inteligência artificial usaram informações de estudos ainda não publicados, depois de OpenAI e Anthropic anunciarem descobertas parecidas com trabalhos que eles tinham em andamento, segundo reportagem da Exame publicada neste sábado (10). As duas empresas negam que dados privados tenham sido usados no treinamento dos modelos.
Os episódios ocorreram em um intervalo de cinco semanas e envolveram ao menos dois casos, de acordo com a publicação. Nenhuma das suspeitas foi comprovada.
O caso de Navier-Stokes, um dia antes do anúncio
Em 7 de setembro, o matemático Tristan Buckmaster, da Universidade de Nova York, publicou avanços sobre o problema de Navier-Stokes, que trata do comportamento de fluidos. Ele trabalhava no tema havia cerca de um ano com Levent Alpöge, matemático da Anthropic que participava da pesquisa como projeto pessoal. A dupla apresentou a solução de uma versão simplificada do problema.
No dia seguinte, 8 de setembro, a OpenAI anunciou que seus agentes de IA haviam encontrado uma solução para o problema. Buckmaster levantou a hipótese de que informações enviadas às ferramentas da empresa tivessem entrado no treinamento.
A OpenAI rejeitou a tese. Segundo a Exame, a companhia disse que uma investigação interna concluiu que as instruções enviadas nos dois meses anteriores ao anúncio não poderiam ter influenciado o sistema.
DNA de vírus e a dúvida sobre o Claude
O segundo caso veio cerca de duas semanas depois. A Anthropic anunciou que agentes baseados no Claude identificaram padrões de segmentos repetidos de DNA em certos vírus, semelhantes a estruturas de sistemas CRISPR.
Mario Rodríguez Mestre, doutorando em biologia computacional na Universidade de Copenhague, disse ao The New York Times que pesquisava padrões parecidos havia vários anos, sem ter publicado resultados. Ele questionou se dados compartilhados com as ferramentas da Anthropic poderiam ter sido aproveitados. Em resposta ao jornal, a Anthropic afirmou que o Claude não havia sido treinado com transcrições de conversas de usuários.
Geoffrey Irving, cientista-chefe da Resolution, organização de segurança da IA na Califórnia, afirmou que os cientistas poderão ser superados não necessariamente pelo compartilhamento de seus trabalhos, mas pela capacidade dos sistemas de encontrar soluções de forma autônoma.
O que os laboratórios já mudaram na rotina
A desconfiança já altera práticas. Sandra Laurentino, especialista em epigenética reprodutiva da Universidade de Münster, na Alemanha, usa IA apenas para identificar problemas em códigos e troca nomes de parâmetros e variáveis por identificações genéricas antes do envio.
Samuel Mehr, pesquisador de cognição auditiva da Universidade de Auckland, na Nova Zelândia, criou uma política em seu laboratório que proíbe estudantes de inserir informações protegidas em grandes modelos de linguagem. Segundo ele, compartilhar dados inéditos com empresas externas expõe a propriedade intelectual dos pesquisadores.
Para quem produz ciência no Brasil, a consequência é direta: universidades e laboratórios que já usam assistentes de IA no dia a dia ficam diante da mesma escolha de Mehr e Laurentino, entre ganhar produtividade e manter dados inéditos fora de serviços de terceiros. Até agora, as empresas dizem que não há uso indevido, e os pesquisadores não apresentaram prova em contrário.



