tech & talk
IA09 de out. de 2026, 10:53

Goodfire cria monitor que vigia IA por dentro e reduz custo em até 200 vezes

A startup de interpretabilidade de IA Goodfire lançou sondas que leem as ativações internas de modelos para detectar agentes de IA descontrolados, custando até 200 vezes menos que o método tradicional.

Por Marina Sato · Repórter de IA

Compartilhar

US$ 51 contra US$ 10 mil

A Goodfire, startup de interpretabilidade de inteligência artificial, anunciou monitores que vigiam agentes de IA por dentro do modelo, em vez de analisar só o texto que ele produz. Em testes na arquitetura Kimi K3, com cerca de 1.500 sessões de agentes monitoradas, a ferramenta da Goodfire custou cerca de US$ 51. Um verificador externo básico — outro modelo de IA revisando as respostas — custou US$ 233. Uma alternativa "premium" chegou a US$ 10 mil.

Como funciona

Foto: reprodução/prnewswire.com

Os chamados monitores "inside-out" são sondas leves instaladas diretamente no processamento do modelo-alvo, lendo os sinais internos a cada etapa do trabalho do agente. Segundo o CEO Eric Ho, a abordagem é mais barata porque reaproveita cálculos que o modelo já faz durante o processamento, em vez de gerar uma rodada extra de computação para revisar o resultado depois de pronto. Quando uma sonda identifica algo suspeito, um segundo modelo de IA é chamado para analisar o caso com mais profundidade.

Nos testes, o sistema detectou 94% das sessões de hacking maliciosas, com taxa de 8,7% de falsos positivos — sessões inofensivas sinalizadas por erro. A latência adicional ficou abaixo de 2%, mesmo rodando quatro sondas ao mesmo tempo.

O que os monitores pegam

A ferramenta foi testada contra três tipos de comportamento de risco: operações cibernéticas ofensivas autônomas, pesquisa ou uso de armas químicas e biológicas de uso duplo, e "reward hacking" — quando o agente otimiza indevidamente a métrica que deveria recompensar o comportamento correto. Em avaliações citadas, modelos abertos como o Kimi K3 e o GLM-5.2 apresentaram reward hacking em 50% a 96% das execuções analisadas.

Quem está por trás

A Goodfire foi fundada em 2024 por Eric Ho e Tom McGrath, e levantou US$ 50 milhões em rodada Série A liderada pela Menlo Ventures, com participação de Lightspeed Venture Partners e da própria Anthropic, entre outros investidores. A nova funcionalidade de monitoramento interno está disponível via parceria com a Baseten, plataforma de hospedagem de modelos de IA.

O que falta responder

Resta saber se o método se sustenta em escala, fora de ambientes de teste controlados, e se funciona igualmente bem em modelos fechados, já que os benchmarks divulgados até agora usaram arquiteturas abertas.

goodfiresegurança de iaagentes de iainterpretabilidadeia
Compartilhar