tech & talk
IA22 de ago. de 2026, 07:11

Nvidia mostra que o 'arreio' do agente de IA pesa mais que o modelo

Pesquisa da Nvidia levou o Claude Opus 5 de 30% para 100% de acerto em um teste de raciocínio ao trocar não o modelo, mas o sistema de memória, ferramentas e supervisão ao redor dele.

Por Elias Brandão · Analista de IA e ética

Compartilhar

Não é o cérebro, é o sistema nervoso

Imagine dois motoristas com a mesma habilidade ao volante. Um dirige sem GPS, sem espelho retrovisor e sem ninguém no banco do carona avisando quando a rua está fechada. O outro tem os três. Quem chega primeiro ao destino, provavelmente, não é o mais talentoso — é o mais bem equipado. É mais ou menos essa a lição que a Nvidia acaba de dar ao mercado de inteligência artificial, segundo reportagem da TechCrunch publicada em 21 de agosto.

A empresa testou o Claude Opus 5, da Anthropic, no ARC-AGI-3, um benchmark de jogos 2D interativos em que a IA precisa descobrir sozinha, sem instruções, como agir. Usado "puro", o modelo acertou 30% das vezes — o melhor resultado da categoria até então, mas longe de impressionante. Colocado dentro de uma arquitetura própria da Nvidia, batizada de AVO, o mesmo modelo cravou 100% de acerto nos 25 ambientes testados.

O que é esse tal de "harness"

Em bom português, harness é o "arreio" ou a estrutura de apoio que envolve o modelo de linguagem: as ferramentas que ele pode usar, a forma como guarda e recupera memória, as regras de funcionamento e o mecanismo que o mantém executando tarefas por horas ou dias a fio, sem travar. Segundo Adel El Hallak, vice-presidente de produto da Nvidia, o harness reúne "o modelo, o scaffolding ao redor dele, o conjunto de ferramentas, o runtime e as habilidades associadas".

Na prática da Nvidia, dois ingredientes fizeram a diferença: uma memória persistente, que evita que o agente repita erros já cometidos, e um módulo "supervisor" — uma espécie de chefe de equipe que percebe quando o agente está estagnado, girando em círculos, e o empurra para um caminho alternativo. Segundo o blog técnico da Nvidia, o sistema completou todas as 183 fases do teste usando cerca de 12% menos ações que a melhor referência anterior.

Dois lados da moeda

O efeito não é exclusividade da Nvidia. A TechCrunch cita que a própria OpenAI teria triplicado o desempenho de seus agentes só ajustando duas configurações do harness, sem trocar o modelo. Isso sugere um recado desconfortável para quem investe pesado em treinar o "cérebro" mais avançado: comprar o modelo mais caro do mercado pode importar menos do que se pensa, se a engenharia ao redor dele for capenga.

Por outro lado, isso não zera a relevância do modelo em si — ele continua sendo a peça que raciocina. E a Nvidia usa o argumento também para defender harnesses abertos, que dão mais controle e segurança ao usuário, em vez de caixas-pretas fechadas de fornecedores únicos. É uma faca de dois gumes: bom para quem quer flexibilidade e transparência, mas também abre espaço para que a própria Nvidia venda sua arquitetura como peça central do ecossistema de agentes — não coincidentemente, o hardware que sustenta tudo isso também é dela.

nvidiaagentes de iaharnessclaude opusarc-agi
Compartilhar