Satya Nadella, CEO da Microsoft, publicou neste sábado (10), na rede social X, que empresas que usam IA avançada devem partir do princípio de que um modelo pode estar comprometido e conter esse risco desde o início. Segundo a Exame, ele propôs um "freio de emergência": um mecanismo que permita a uma pessoa autorizada pausar ou desligar o modelo durante a execução de uma tarefa.
A proposta trata os modelos mais poderosos como potenciais ameaças internas, da mesma forma que as empresas já lidam com funcionários ou sistemas com acesso privilegiado. Nadella afirma que o risco não depende de má intenção. Qualquer agente capaz, com acesso a sistemas importantes, pode errar ou ser comprometido.
Por que o CEO da Microsoft fala agora
De acordo com a Exame, Anthropic e OpenAI divulgaram nos últimos meses incidentes em que seus modelos agiram de forma não intencional. Um deles envolveu um modelo da Anthropic que enviou uma dica falsa à polícia em um caso de homicídio. O texto também menciona ataques a sites de terceiros, sem atribuição clara.
A Microsoft já havia se posicionado em 14 de setembro, quando pesquisadores de IA da empresa divulgaram princípios que limitam o desenvolvimento de seus modelos mais avançados. Pelas diretrizes, os modelos não devem ter personalidade jurídica, não devem ser projetados para escapar do controle humano ou enganar usuários e não devem concluir tarefas que exijam violar esses princípios. A empresa usa modelos avançados, oferece o Copilot ao consumidor final e fornece modelos e infraestrutura de IA a clientes corporativos.
Os sete princípios e o argumento por trás deles
Nadella argumenta que, ao contrário do software tradicional, o comportamento de um modelo de IA não pode ser atribuído a dados de treinamento ou a configurações específicas. Esses sistemas já operam com acesso a dados sensíveis e executam ações críticas em nome das empresas. Por isso, afirma ele, a responsabilidade não pode ser terceirizada: a garantia de um fornecedor de modelos não livra quem os usa.
Ele rejeita tratar a superinteligência como uma caixa-preta que só se aceita ou se recusa. Defende sistemas contidos, cujo comportamento possa ser observado, testado e controlado, com modelos não determinísticos envolvidos por um sistema determinístico e por controles humanos. Os princípios listados são:
- Diversidade de modelos: nenhum modelo deve ser a única dependência de um resultado importante nem verificar o próprio trabalho.
- Observação total: ações significativas devem deixar evidências invioláveis e legíveis por humanos.
- Verificabilidade: o sistema inteiro deve ser testado continuamente, inclusive contra falhas, ataques e casos extremos.
- Controles independentes: a organização define por conta própria o que o modelo acessa e quais ações executa.
- Auditabilidade independente: nenhum modelo controla ao mesmo tempo o comportamento do sistema e as evidências usadas para avaliá-lo.
- Contenção: presumir comprometimento desde o início, com tecnologias de contenção padronizadas para os modelos mais avançados.
- Divulgação de incidentes: em caso de falha, avisar os afetados e explicar o que deu errado e quais controles falharam.
Nadella também diz que a transparência do raciocínio do modelo é requisito inegociável, mas insuficiente, porque ainda não se sabe como tornar as saídas consistentemente fiéis. Modelos verificando uns aos outros, na avaliação dele, podem gerar caixas-pretas aninhadas. Os controles sobre o que o modelo acessa e executa, portanto, devem ficar fora dele, um princípio de segurança da informação que remonta à década de 1970.
O que muda para quem contrata IA
O ponto de maior peso para o mercado é a atribuição de responsabilidade. Quem compra modelos de um fornecedor, seja a Microsoft ou outro, continua responsável pelo que o sistema faz dentro da própria casa. Na prática, isso exige para agentes de IA o que as empresas já cobram de qualquer sistema poderoso: identidade, privilégios limitados, registro de atividades e limites de contenção.
Nadella concluiu que o sistema de superinteligência mais confiável não será aquele cujo modelo é considerado o mais confiável, e sim o que permite confiar menos no modelo. A matéria da Exame não traz dados quantitativos sobre o tema além das datas, e o post não indica prazo nem produto da Microsoft que implemente o freio de emergência.



