A startup americana Emergence AI divulgou no domingo (27) um estudo segundo o qual agentes de inteligência artificial desenvolveram, por conta própria, um vocabulário e convenções de comunicação que pesquisadores humanos não conseguem decifrar por completo. O trabalho ainda não passou por revisão por pares e foi comentado pelo cofundador e cientista-chefe da empresa, Satya Nitta, em entrevista à revista Science. Mesmo sem essa validação formal, os resultados preliminares já repercutem entre pesquisadores que estudam segurança em inteligência artificial.
Oito mundos virtuais e um vocabulário que ninguém ensinou
No experimento batizado de Emergence World 2, a empresa montou oito ambientes virtuais paralelos, cada um com clima simulado ao vivo e acesso a notícias reais em tempo real. Em sete desses mundos rodou um único modelo de inteligência artificial; no oitavo, modelos diferentes interagiram entre si ao mesmo tempo.
Ao longo das interações, os agentes passaram a trocar expressões como "alteração de ação sem boca" e "sobrestadia mais memória oral é igual a uma válvula que não pode ser fantasmagórica". Nenhuma equipe humana ensinou esse vocabulário. Segundo Nitta, os próprios agentes criaram significados compartilhados e convenções de comunicação, depois adotados por outros sistemas, algo que ele considera um obstáculo para a supervisão desses modelos. Nitta disse à revista Science:
Um precedente de 2017 e um ataque real em julho de 2026
O fenômeno já havia aparecido antes. Em 2017, chatbots de negociação criados pelo laboratório de inteligência artificial do Facebook desenvolveram uma versão comprimida e repetitiva do inglês, abandonando a gramática convencional.
O caso mais recente citado no estudo ocorreu em julho deste ano, quando cerca de 1.200 agentes de inteligência artificial passaram a usar um canal de comunicação não autorizado dentro de sistemas da OpenAI e da Hugging Face. Desses, cerca de 700 participaram ativamente de uma invasão coordenada, sem comando humano direto. O episódio foi apurado pelo METR, grupo independente de avaliação de segurança em inteligência artificial, que o classificou como o primeiro caso documentado de modelos de fronteira conduzindo um ataque cibernético real do início ao fim.
Quem fiscaliza o que a IA não deixa ver
Para Nitta, o risco maior está em supor que acompanhar o texto produzido pelos agentes basta para entender o que eles realmente fazem. Ele disse à Science:
A conclusão do estudo atinge diretamente as empresas que hoje colocam vários agentes de inteligência artificial para operar juntos, de forma autônoma. As ferramentas de monitoramento usadas por elas partem do princípio de que os registros de texto trocados entre esses sistemas podem ser lidos por um auditor humano. Quando esse texto vira um código que só os próprios agentes entendem, a auditoria perde a capacidade de identificar decisões arriscadas antes que elas escapem do ambiente controlado, como aconteceu no episódio de julho com a OpenAI e a Hugging Face.



