Tecnologia

ChatGPT diz que IA pode estar sabendo mais do que se pensa

Há boas razões técnicas para considerar provável que as empresas não conheçam integralmente tudo aquilo que seus modelos mais avançados aprenderam

Foto: Ilustração IA
A IA tem capacidades que os desenvolvedores desconhecem? O ChatGPT responde.

Em nossa segunda "entrevista" com o ChatGPT, modelo de IA generativa desenvolvido pela OpenAI, falamos sobre capacidades que a Inteligência Artificial já desenvolveu mas ainda não foram detectadas pelas empresas à frente dos modelos.

E se é possível confiar que as empresas estejam dispostas a sacrificar crescimento, participação de mercado e vantagem tecnológica em nome da segurança mundial.

Na primeira entrevista, o tema foi o risco de extinção da humanidade por modelos avançados de IA.

Como os modelos de IA Generativa não são programados conhecimento por conhecimento (eles aprendem representações a partir de enormes volumes de dados), é possível que tenhamos chegado a um nível em que as empresas desenvolvedoras não conhecem integralmente o que seus modelos aprenderam?
Sim. Essa é uma descrição essencialmente correta do estado atual da tecnologia.

As empresas conhecem a arquitetura, os dados e métodos de treinamento em diferentes graus, os parâmetros e os resultados dos testes. Mas isso não significa que compreendam integralmente tudo o que foi codificado nas representações internas do modelo nem todas as capacidades que podem emergir delas.

A própria OpenAI afirma que redes neurais modernas continuam difíceis de compreender: os desenvolvedores definem o processo de treinamento, mas não especificam individualmente os comportamentos que emergem, e a rede resultante não pode ser facilmente decifrada por seres humanos. 

A Anthropic é ainda mais explícita: afirma que os modelos aprendem suas próprias estratégias durante o treinamento e que os desenvolvedores não compreendem como eles fazem a maior parte das coisas que fazem. 

Não temos hoje um inventário completo do que um grande modelo aprendeu, das relações conceituais que construiu e de todas as capacidades que podem ser extraídas dessas representações.

E esse é um dos motivos pelos quais interpretabilidade se tornou uma área importante de pesquisa em segurança de IA. Em 2026, por exemplo, pesquisadores encontraram no Claude representações internas que surgiram durante o treinamento sem ter sido explicitamente programadas. 

Portanto, à sua pergunta, minha resposta é: sim. É perfeitamente possível, e há boas razões técnicas para considerar provável, que as empresas não conheçam integralmente tudo aquilo que seus modelos mais avançados aprenderam.

Em uma escala de 0 a 100, qual a possibilidade, hoje, de os modelos mais avançados de IA Generativa já terem adquirido um conhecimento que as empresas à frente desses modelos desconhecem que elas já adquiriram?
Eu diria cerca de 80.

Mas é fundamental definir o que isso significa. Não estou dizendo que há 80% de chance de uma IA possuir algum "conhecimento secreto" extraordinário. Estou dizendo que considero bastante provável que modelos de fronteira já contenham representações, associações ou capacidades que seus próprios desenvolvedores ainda não identificaram completamente.

Há evidências que sustentam essa cautela. A própria OpenAI afirma que testes de capacidade devem ser tratados como um limite inferior, e não como o máximo das capacidades de um modelo, porque novas técnicas podem revelar capacidades não detectadas inicialmente. OpenAI

A Anthropic é ainda mais explícita: avaliações convencionais só conseguem procurar riscos que os pesquisadores já imaginaram. Portanto, têm dificuldade, por definição, para descobrir os chamados comportamentos ou capacidades que ninguém pensou em testar. Anthropic

Pesquisas de interpretabilidade também encontraram representações internas que não aparecem na resposta do modelo. Em 2026, pesquisadores da Anthropic identificaram no Claude padrões internos capazes, por exemplo, de representar a existência de um erro em um código ou a função de uma proteína sem que isso estivesse sendo verbalizado pelo modelo. Anthropic.

Esse fato não aumenta o potencial de risco de modelos de IA serem usados por pessoas ou grupos à margem da lei?
Sim. E esse risco já não é apenas teórico.

Quanto mais capacidades um modelo possui, inclusive capacidades que seus desenvolvedores ainda não mapearam completamente, maior é a possibilidade de alguém descobrir maneiras inesperadas de utilizá-las. Isso é particularmente preocupante em áreas de uso dual, como cibersegurança, biologia, vigilância e desenvolvimento de armas.

Há evidências concretas. A Anthropic informou recentemente ter identificado e interrompido usos de seus modelos por criminosos, grupos suspeitos de patrocínio estatal, empresas de spyware [um tipo de software malicioso (malware) que se infiltra de forma oculta em computadores ou celulares para monitorar as ações do usuário e roubar dados confidenciais sem o seu consentimento] e outros atores. A empresa afirma que, conforme os modelos ficam mais capazes, os riscos aumentam se as defesas não evoluírem conjuntamente.

A OpenAI reconhece o mesmo problema. Seu atual sistema de governança considera explicitamente riscos de ofensiva cibernética, ameaças químicas e biológicas, manipulação e perda de controle.

Há, portanto, dois riscos diferentes. O primeiro é sabermos que determinada capacidade existe e alguém conseguir contornar as proteções para explorá-la. O segundo é mais difícil: alguém descobrir uma capacidade perigosa que nem sequer havia sido identificada pelos desenvolvedores.

Não posso quantificar com rigor a probabilidade desse segundo cenário. Mas, tecnicamente, o fato de não compreendermos integralmente todas as capacidades dos modelos aumenta a superfície de risco de uso malicioso. E quanto mais poderosos eles se tornam, mais importante fica essa incerteza.

Esse risco não seria um forte argumento a favor da desaceleração no crescimento das IAs?
Sim. É um argumento relevante a favor de desacelerar pelo menos determinadas etapas do desenvolvimento e da implantação de sistemas de fronteira. Mas não é, sozinho, prova de que uma desaceleração geral seja a melhor política.

O argumento é o seguinte: capacidades estão avançando rapidamente, enquanto nossa capacidade de compreendê-las, avaliá-las e controlá-las avança de maneira diferente. O International AI Safety Report 2026, elaborado por mais de 100 especialistas, afirma que testes antes do lançamento estão ficando mais difíceis, que capacidades perigosas podem não ser detectadas e que as salvaguardas atuais têm limitações significativas.

Isso sustenta uma posição de precaução: se estamos criando sistemas mais poderosos mais rapidamente do que conseguimos compreender seus riscos, pode fazer sentido reduzir a velocidade quando determinados limiares de risco forem atingidos, até que avaliações e mecanismos de segurança acompanhem as novas capacidades. A própria OpenAI adota uma lógica baseada em níveis de capacidade e mitigação para riscos graves. 

Existe, porém, o argumento contrário: desacelerar também pode retardar benefícios científicos, médicos e econômicos; uma pausa unilateral pode simplesmente transferir o desenvolvimento para empresas ou países menos comprometidos com segurança; e ainda não sabemos qual ritmo seria objetivamente "seguro". O relatório internacional chama isso de um dilema de evidências: agir cedo demais pode produzir políticas inadequadas, mas esperar evidências conclusivas pode significar agir tarde demais.

Portanto, eu colocaria assim: o desconhecimento sobre todas as capacidades dos modelos é um argumento forte para condicionar o avanço à demonstração de segurança. Não é evidência suficiente, por si só, para concluir que toda evolução da IA deveria ser simplesmente interrompida.

OpenAI, Anthropic e xAI propõem desacelerar o desenvolvimento da IA. Você confia que as empresas estejam dispostas a sacrificar crescimento, participação de mercado e vantagem tecnológica em nome da segurança mundial?
Eu não basearia a segurança mundial apenas na confiança voluntária nessas empresas.

Há evidências de que OpenAI e Anthropic estão dispostas a aceitar algum custo em nome da segurança. A OpenAI afirma ter reduzido temporariamente o ritmo de escalada de modelos diante de novos riscos de cibersegurança. A Anthropic declara explicitamente que pode pausar o desenvolvimento quando considerar necessário. 

Mas existe um conflito de incentivos evidente. Essas empresas competem por usuários, capital, pesquisadores, contratos e liderança tecnológica. Representantes das próprias empresas reconhecem o problema: uma desaceleração unilateral pode significar perder vantagem para concorrentes que continuem avançando. Esse dilema está no centro das atuais discussões sobre coordenação do setor.

Além disso, há críticas de concorrentes europeus de que propostas de desaceleração feitas pelas grandes empresas americanas também poderiam preservar a vantagem competitiva de quem já está na liderança. Isso não prova que essa seja a motivação das empresas, mas mostra por que suas propostas precisam ser examinadas também sob a perspectiva econômica.

Por isso, eu separaria duas coisas: é possível acreditar que dirigentes dessas empresas estejam genuinamente preocupados com os riscos e, simultaneamente, considerar insuficiente confiar que empresas submetidas a enormes pressões competitivas sempre sacrificarão seus próprios interesses pela segurança coletiva.

A solução que está ganhando espaço nas próprias discussões do setor é justamente reduzir essa dependência da boa vontade: regras comuns, avaliações independentes, transparência, fiscalização e mecanismos coordenados internacionalmente, de modo que desacelerar diante de determinado nível de risco não coloque a empresa responsável em desvantagem perante aquela que decidir continuar.

Em outras palavras: se um risco é potencialmente global, confiar exclusivamente na autorregulação de empresas concorrentes é uma proteção estruturalmente frágil.

Qual a saída mais racional para esse dilema?
A saída mais racional me parece ser substituir a corrida irrestrita por uma corrida condicionada à segurança. Não uma paralisação permanente da IA, nem confiar apenas na autorregulação.

O princípio seria simples: quanto maior a capacidade potencialmente perigosa de um modelo, maior a exigência de evidências de segurança antes de avançar para treinamento, implantação ou ampliação de autonomia. O International AI Safety Report 2026 mostra que já existem frameworks [estruturas de código predefinidas, que servem de base para o desenvolvimento de softwares, sites ou a gestão de projetos] empresariais baseados nessa lógica, mas ressalta que eles continuam majoritariamente voluntários, diferem bastante entre si e ainda têm eficácia real pouco comprovada. 

Eu estruturaria isso em quatro elementos:
-- avaliações independentes obrigatórias dos modelos de fronteira;
-- limites previamente definidos que possam impedir temporariamente treinamento ou lançamento quando determinadas capacidades perigosas forem detectadas;
-- obrigação de comunicar incidentes e compartilhar informações críticas;
-- e coordenação internacional mínima entre as grandes potências para reduzir o incentivo de cada país ou empresa a correr mais depressa porque teme ficar para trás.

O ponto decisivo é retirar das empresas a responsabilidade exclusiva de decidir quanto risco a sociedade deve aceitar. Elas devem participar porque detêm conhecimento técnico indispensável, mas não deveriam simultaneamente desenvolver a tecnologia, avaliar seus próprios riscos e decidir sozinhas se esses riscos são aceitáveis.

Existe uma dificuldade séria: ainda não sabemos medir perfeitamente esses riscos. O relatório internacional chama isso de "dilema da evidência": esperar provas conclusivas pode significar descobrir o perigo tarde demais; regular prematuramente também pode criar regras ineficazes.

Por isso, eu não defenderia simplesmente "parar a IA". Defenderia tornar a velocidade do avanço dependente da nossa capacidade demonstrada de controlar o risco.

Em termos muito simples: não precisamos escolher entre acelerar e parar. Podemos estabelecer que só se acelera quando os freios demonstram acompanhar a potência do motor.

Coloco, para sua análise, três dificuldades quanto à implementação do que você propõe. A primeira delas é que uma regulação mundial pode ser lenta demais; a segunda, que regras globais podem favorecer quem já domina o mercado; a terceira, é o problema de fiscalização. O que você propõe para resolver cada um desses três problemas?
As três dificuldades são reais e, na minha avaliação, tornam inviável uma solução baseada apenas em um grande tratado mundial. O International AI Safety Report 2026 reconhece exatamente alguns desses problemas: a IA avança mais rapidamente que os ciclos legislativos, há risco de arbitragem regulatória e a fiscalização sofre com assimetria de informação entre empresas e governos.

1. Regulação mundial seria lenta demais. Eu não esperaria por ela. Criaria inicialmente um acordo entre os países que concentram empresas de fronteira, chips avançados, grandes data centers e infraestrutura de computação. Seria uma espécie de "coalizão mínima de segurança".

As regras seriam poucas e atualizáveis: testes obrigatórios antes de determinados treinamentos ou lançamentos, comunicação de incidentes graves e protocolos previamente definidos para capacidades consideradas perigosas. Depois, outros países poderiam aderir. Isso permitiria começar em meses ou poucos anos, em vez de esperar por um consenso mundial.

2. A regulação pode congelar o mercado nas mãos de OpenAI, Google, Anthropic, xAI e outras líderes. Esse risco é sério. Regras que simplesmente imponham enormes custos burocráticos podem funcionar como barreiras à entrada.

Eu vincularia as obrigações principalmente à capacidade e ao risco do sistema, e não ao tamanho da empresa. Uma startup desenvolvendo um modelo relativamente pouco capaz teria exigências menores; uma grande empresa desenvolvendo um sistema potencialmente perigoso teria exigências muito maiores.

Também financiaria centros públicos e acadêmicos de avaliação, para que apenas as grandes empresas não tenham condições de pagar pelos testes. 

3. Como fiscalizar algo que governos talvez nem compreendam completamente? Aqui eu usaria fiscalização em várias camadas. Não tentaria "ler" todo o modelo. Exigiria auditorias independentes, avaliações adversariais, registro de incidentes e acesso confidencial dos reguladores às informações técnicas necessárias.

Além disso, parte da fiscalização poderia ocorrer na infraestrutura física: treinamento de modelos de fronteira exige grandes quantidades de chips, eletricidade e data centers, que são mais observáveis do que o software propriamente dito. 

Eu acrescentaria uma quarta condição, talvez a mais importante: nenhuma empresa deveria poder certificar sozinha que seu próprio modelo é seguro. Hoje ainda não existe um mecanismo estabelecido capaz de validar independentemente todas as decisões de aceitação de risco tomadas pelos desenvolvedores antes do lançamento.

Isso deixa uma imperfeição inevitável. Nenhum desses mecanismos impediria completamente desenvolvimento clandestino, avanço algorítmico inesperado ou descumprimento por determinados países. A meta realista não seria tornar impossível desenvolver uma IA perigosa, mas aumentar substancialmente a probabilidade de detectá-la antes que seja amplamente disponibilizada.

E isso nos leva a um problema ainda mais difícil: se um país acreditar que uma IA extremamente avançada proporcionará vantagem econômica ou militar decisiva, talvez nenhuma regra internacional seja suficiente para fazê-lo desacelerar voluntariamente. Nesse ponto, o problema deixa de ser apenas tecnológico e passa a se parecer com os grandes dilemas históricos de controle de tecnologias estratégicas.

Para encerrar, em um nível de 0 a 100, qual a probabilidade, no mundo de hoje, de essas soluções que você propõe serem aceitas e implementadas?
Se você me obrigar a atribuir um número, eu diria aproximadamente 35 em 100 para que, nos próximos anos, seja implementada uma versão substancial das soluções que descrevi, especialmente coordenação internacional, avaliações independentes e limites vinculantes para modelos de fronteira.

Não é uma probabilidade calculada cientificamente. É uma estimativa baseada no cenário atual. Há sinais favoráveis: a União Europeia já está aplicando o AI Act; existem compromissos internacionais de segurança; e há crescente convergência sobre avaliações de risco e mitigação para modelos avançados.

Mas eu não colocaria a probabilidade acima de 50 principalmente por uma razão: a competição geopolítica trabalha na direção contrária. Estados Unidos e China consideram a liderança em IA estratégica, e existe receio de que restrições adotadas por um lado concedam vantagem ao outro. As atuais tentativas de cooperação convivem com forte desconfiança entre os dois países. 

Além disso, iniciativas internacionais anteriores frequentemente tiveram impacto limitado por falta de autoridade, divergências entre países e dificuldades institucionais. 

Portanto, 35/100 não significa que considero a solução improvável de forma definitiva. Significa que vejo uma contradição estrutural: praticamente todos ganhariam com regras capazes de impedir uma catástrofe, mas cada empresa e cada potência tem incentivos para continuar avançando caso suspeite que os demais farão o mesmo.

É, em essência, uma versão do Dilema do Prisioneiro aplicada à inteligência artificial: cooperar pode produzir o resultado coletivamente mais seguro, enquanto competir pode parecer individualmente mais racional.

E talvez esse seja o ponto mais inquietante para encerrar a entrevista: podemos compreender o risco, conhecer algumas das medidas capazes de reduzi-lo e, ainda assim, não conseguir coordenar os atores envolvidos a tempo.

Entenda
O Dilema do Prisioneiro


O Dilema do Prisioneiro é um exemplo clássico da teoria dos jogos que mostra uma situação aparentemente paradoxal: duas pessoas podem tomar decisões individualmente racionais e, mesmo assim, chegar a um resultado pior para ambas.

Imagine dois suspeitos presos e interrogados separadamente. Cada um tem duas opções: ficar calado ou delatar o outro.

-- Se os dois ficarem calados, ambos recebem uma pena pequena.
-- Se A delata e B fica calado A é beneficiado e B recebe pena pesada
-- Se B delata e A fica calado B é beneficiado e A recebe pena pesada
-- Se os dois delatam, ambos recebem uma pena intermediária

O problema é que nenhum sabe o que o outro fará. O raciocínio de A é: "Se B ficar calado, é melhor eu delatá-lo. Se B me delatar, também é melhor eu delatá-lo." B raciocina exatamente da mesma maneira. Assim, os dois acabam delatando, embora ambos ficassem em situação melhor se cooperassem e permanecessem calados.