O governo federal anunciou na semana passada, dentro do Plano Brasileiro de Inteligência Artificial, uma cooperação tecnológica com a China avaliada em R$ 1,276 bilhão ao longo de cinco anos para desenvolver modelos de linguagem de grande porte (LLMs) em português. As parceiras no projeto são as chinesas Huawei e iFlytek, e o acordo é o item que mais chamou a atenção do mercado entre as medidas do plano.
A execução ficará a cargo da Rede Nacional de Ensino e Pesquisa (RNP), no Rio de Janeiro. O cronograma prevê início de operação em julho de 2027 e a capacitação de 3 mil brasileiros ao longo do programa. Até agora, os recursos do governo nessa área haviam sido aplicados sobretudo em infraestrutura de processamento. Desta vez, pela primeira vez, o dinheiro vai para o treinamento dos próprios modelos de fundação.
Por que um modelo em português
Os grandes modelos disponíveis hoje são treinados majoritariamente em inglês, e o português aparece como língua secundária. Para o setor público, o efeito prático aparece em tarefas como leitura de processos, atendimento ao cidadão e análise de legislação, que têm desempenho pior nesses sistemas. O Serpro já anunciou um LLM soberano para o segundo semestre de 2026 e segue a mesma linha: para o órgão, dados sensíveis do Estado não deveriam circular por modelos hospedados fora do país.
O acordo entra na negociação tarifária com os EUA
O acordo é assinado no momento em que Brasília negocia com Washington a retirada das tarifas de 25% impostas pelos Estados Unidos em julho. Uma reunião entre o ministro Márcio Elias Rosa e o representante comercial americano Jamieson Greer está marcada para a próxima segunda-feira, dia 31. Entre as justificativas listadas pelo governo Trump para o tarifaço estão temas como propriedade intelectual e o Pix. A escolha de parceiros chineses para a camada mais estratégica da IA nacional tende a entrar nessa negociação, e a discussão que se abre passa a girar em torno de quem vai controlar os pesos do modelo, os dados de treinamento e a infraestrutura onde ele roda.
Governança dos dados e o supercomputador do Rio Grande do Norte
A governança dos dados de treinamento, ou seja, quais bases públicas serão usadas e sob que regras, é um dos pontos que ainda não têm definição. Também está em aberto se os pesos dos modelos resultantes serão abertos, como ocorreu no caso do RISC-V, ou fechados. Um terceiro fator é a integração com o supercomputador de 7.200 petaflops anunciado para o Rio Grande do Norte, cuja operação está prevista para o fim de 2027, cinco meses depois do início do programa com a China.



