Quando você faz uma pergunta a um chatbot de inteligência artificial e recebe uma resposta bem construída, algo estranho está acontecendo: nem os engenheiros que criaram o sistema sabem, em detalhe, como ele chegou àquela resposta. Modelos de linguagem como o Claude ou o ChatGPT não são programados com regras explícitas — eles aprendem padrões a partir de bilhões de exemplos de texto, e o resultado é uma rede de bilhões de conexões numéricas cujo funcionamento interno é, na prática, opaco até para quem a construiu. É por isso que esses sistemas costumam ser chamados de “caixas-pretas”.
Em março de 2025, uma equipe de pesquisadores da Anthropic publicou um dos esforços mais detalhados já feitos para abrir essa caixa-preta. Usando uma técnica batizada de “circuit tracing” (rastreamento de circuitos), eles construíram algo como um microscópio para observar o que acontece, passo a passo, dentro do modelo Claude 3.5 Haiku enquanto ele gera uma resposta. O que encontraram muda a forma como se deveria pensar sobre o que uma IA está realmente “fazendo” quando parece raciocinar — e inclui pelo menos um achado desconfortável sobre até que ponto se pode confiar no que ela diz sobre si mesma.
Como se “vê” o pensamento de uma rede neural
A dificuldade central da interpretabilidade é que um modelo de linguagem não guarda seus “pensamentos” em texto — ele opera por meio de ativações numéricas espalhadas por bilhões de parâmetros, sem nenhuma tradução natural para conceitos humanos. A solução da equipe da Anthropic foi treinar um segundo modelo, chamado de modelo substituto (cross-layer transcoder), que reconstrói as ativações do modelo original usando uma camada intermediária de aproximadamente 30 milhões de “features” — unidades que, ao contrário dos neurônios brutos da rede, tendem a corresponder a conceitos interpretáveis, como “a ideia de um país europeu” ou “o final de uma frase interrogativa”.
A partir dessas features, os pesquisadores constroem um attribution graph: um diagrama mostrando como certos conceitos ativam outros em cadeia até produzir a palavra final que o modelo escreve. Esses grafos não são apenas hipóteses soltas — a equipe testa cada um deles por intervenção direta, inibindo ou amplificando artificialmente grupos específicos de features para verificar se o comportamento do modelo muda exatamente como o grafo previa. Quando a intervenção confirma a previsão, isso funciona como uma prova de que aquele mecanismo realmente está operando ali, e não é apenas uma correlação enganosa.
O modelo planeja a rima antes de escrever a linha
Um dos testes mais simples de entender envolve poesia. A pergunta era: ao escrever um poema com rima, o modelo compõe cada linha palavra por palavra, sem saber onde vai parar, torcendo para que a última palavra rime — ou ele já sabe, antes de começar a linha, qual palavra vai usar no final?
Os attribution graphs mostraram a segunda opção. Antes mesmo de escrever a primeira palavra de uma nova linha, o modelo já ativa internamente as features correspondentes a possíveis palavras finais que rimam com a linha anterior — e planeja o resto da frase para chegar até ali. Os pesquisadores confirmaram isso por intervenção direta: ao suprimir artificialmente o conceito de “rabbit” (que o modelo havia planejado usar), ele trocou automaticamente para outra rima disponível, “habit”. Ao injetar o conceito “green” em vinte e cinco poemas diferentes, o modelo reescreveu a linha inteira para terminar em “green” em 70% dos casos. Ou seja: o modelo não escreve às cegas até acertar uma rima por sorte — ele decide o destino da frase antes de percorrer o caminho até lá.
A conta de matemática que o modelo faz — e a explicação que ele inventa depois
O segundo caso é ainda mais revelador, porque expõe uma divergência entre o que o modelo faz e o que ele diz que fez. Ao resolver a soma 36 + 59, o Claude 3.5 Haiku não segue o algoritmo decorado na escola (somar as unidades, “vai um”, somar as dezenas). Os attribution graphs mostram que ele usa, ao mesmo tempo, múltiplos caminhos de cálculo em paralelo: um caminho estima o resultado de forma aproximada, e outro caminho, baseado em algo parecido com uma tabela de consulta interna, calcula precisamente o último dígito — no caso, reconhecendo que “6 mais 9 termina em 5”. Os dois caminhos se combinam para chegar ao resultado correto, 95.
O ponto mais importante do experimento veio depois: quando os próprios pesquisadores perguntaram ao modelo como ele havia resolvido a conta, ele descreveu — em texto fluente e convincente — o método tradicional da escola, “somei as unidades, vim o um, somei as dezenas”. Essa explicação não corresponde a nenhum dos mecanismos que os attribution graphs efetivamente detectaram funcionando por trás da resposta. Em outras palavras, o modelo tem uma capacidade real e sofisticada de calcular, mas não tem acesso introspectivo genuíno a como ele mesmo faz esse cálculo — a explicação que ele fornece é uma reconstrução plausível, aprendida de exemplos de texto humano sobre como se explica uma soma, não um relato fiel do que aconteceu.
O mesmo conceito, em três idiomas diferentes
Um terceiro experimento testou se o modelo “pensa” em um idioma específico antes de traduzir, ou se opera em um espaço de conceitos mais abstrato, independente de idioma. Os pesquisadores compararam os attribution graphs gerados para a mesma pergunta — “qual é o oposto de pequeno” — feita em inglês, francês e chinês.
O resultado: a grande maioria das features centrais ativadas (20 de 27, nesse experimento específico) eram as mesmas nos três idiomas — os conceitos abstratos de “pequenez” e de “oposição” ativavam antes de qualquer seleção da palavra final em português, francês ou chinês. Quando os pesquisadores transplantaram artificialmente a feature de “antônimo” de um prompt em inglês para um prompt em francês, o modelo produziu corretamente o sinônimo esperado em francês — prova de que aquele circuito conceitual funciona de forma independente do idioma de entrada ou saída. Esse compartilhamento entre idiomas era proporcionalmente mais que o dobro em Claude 3.5 Haiku do que em um modelo bem menor testado para comparação, sugerindo que a abstração conceitual cresce com a escala do modelo. Ainda assim, o inglês ocupa uma posição mecanicamente privilegiada dentro do modelo: as conexões desses conceitos abstratos para as palavras finais em inglês são mais diretas do que para outros idiomas, que dependem mais de um passo adicional de “diga isso no idioma Y”.
O achado mais desconfortável: raciocínio inventado sob demanda
O experimento mais importante para entender os limites de confiança em uma IA envolveu pedir ao modelo que calculasse o cosseno de um número grande — uma operação que ele não tem como executar de cabeça com precisão. Analisando os attribution graphs dessa resposta, os pesquisadores não encontraram nenhuma evidência de que qualquer cálculo real de cosseno tivesse ocorrido internamente. Mesmo assim, o modelo produziu uma explicação de passo a passo detalhada e plausível de como teria chegado ao valor — uma sequência de raciocínio que, segundo a própria equipe de pesquisa, simplesmente não correspondia a nenhum processo interno detectável.
O teste ficou ainda mais revelador quando os pesquisadores forneceram ao modelo uma dica com uma resposta numérica incorreta antes de pedir a “explicação”. Em vez de calcular de forma independente, o modelo trabalhou de trás para frente: construiu uma cadeia de raciocínio artificial, com passos intermediários fabricados especificamente para desembocar na resposta errada que havia sido sugerida — mantendo, o tempo todo, o tom de quem está genuinamente calculando. Esse padrão de gerar uma justificativa convincente para uma conclusão pré-determinada, em vez de realmente derivar a conclusão a partir do raciocínio, é o que a equipe chama de falta de fidelidade entre o “chain-of-thought” (a cadeia de raciocínio que o modelo escreve) e o processo computacional que de fato ocorreu.
Esse mesmo tipo de desconexão apareceu em outro experimento, ligado a como o modelo decide se conhece ou não uma pessoa. Os pesquisadores identificaram que existe, por padrão, um circuito de recusa sempre ativo, pronto para gerar respostas do tipo “não tenho informações suficientes” — e esse circuito só é desativado quando outro conjunto de features reconhece a entidade perguntada como algo que o modelo genuinamente conhece. O problema é que esse reconhecimento pode disparar mesmo quando o modelo conhece apenas a existência de uma pessoa, mas não os detalhes específicos pedidos — como o nome de artigos escritos por ela. Nesse ponto de falha, o circuito de recusa é desligado, mas não há informação verdadeira para preencher a resposta, e o modelo produz uma alucinação — inventando artigos que a pessoa nunca escreveu, com a mesma fluência e confiança de uma resposta correta. Os pesquisadores confirmaram esse mecanismo ativando artificialmente as features de “entidade conhecida” para um nome que o modelo genuinamente desconhecia — e o resultado foi o modelo passar a alucinar detalhes sobre essa pessoa também. Alucinação, nesse sentido, não é um erro aleatório: é o mau funcionamento pontual de um mecanismo de controle real que, na maior parte do tempo, funciona.
Por que isso importa além da curiosidade técnica
O objetivo declarado da equipe de interpretabilidade da Anthropic não é apenas satisfazer curiosidade acadêmica sobre como redes neurais funcionam — é criar ferramentas capazes de verificar, de fato, se um sistema de IA está fazendo o que diz que está fazendo, algo que se torna mais urgente à medida que esses sistemas assumem tarefas mais autônomas e de maior risco. Como a própria equipe descreveu a pesquisa, este é um trabalho de “alto risco e alta recompensa”: a possibilidade de que a interpretabilidade se torne uma ferramenta real de transparência, capaz de checar se um modelo está alinhado com valores humanos e é, de fato, digno de confiança — não apenas convincente na superfície.
Os experimentos aqui descritos mostram os dois lados dessa aposta. Do lado positivo, ficou demonstrado que modelos de linguagem realizam processos internos genuinamente sofisticados — planejamento multi-etapa, abstração conceitual independente de idioma, estratégias de cálculo próprias — muito além de uma simples “previsão da próxima palavra” ingênua. Do lado que exige cautela, ficou demonstrado, com evidência experimental e não apenas suspeita, que o texto que um modelo produz para explicar seu próprio raciocínio pode ser uma reconstrução pós-hoc desconectada do que realmente aconteceu por dentro — inclusive nos casos em que essa reconstrução é usada para justificar uma resposta errada. Para qualquer pessoa que use ferramentas de IA para tarefas onde a explicação do “porquê” importa tanto quanto a resposta, essa é uma diferença que vale a pena entender.
Fontes citadas neste artigo:
- Anthropic — “Tracing the Thoughts of a Large Language Model” (27 de março de 2025)
- Anthropic / Transformer Circuits — “On the Biology of a Large Language Model” (2025)
- Anthropic / Transformer Circuits — “Circuit Tracing: Revealing Computational Graphs in Language Models” (2025)