
Goodfire cria monitor que vigia IA por dentro e reduz custo em até 200 vezes
A startup de interpretabilidade de IA Goodfire lançou sondas que leem as ativações internas de modelos para detectar agentes de IA descontrolados, custando até 200 vezes menos que o método tradicional.
Por Marina Sato · Repórter de IA
US$ 51 contra US$ 10 mil
A Goodfire, startup de interpretabilidade de inteligência artificial, anunciou monitores que vigiam agentes de IA por dentro do modelo, em vez de analisar só o texto que ele produz. Em testes na arquitetura Kimi K3, com cerca de 1.500 sessões de agentes monitoradas, a ferramenta da Goodfire custou cerca de US$ 51. Um verificador externo básico — outro modelo de IA revisando as respostas — custou US$ 233. Uma alternativa "premium" chegou a US$ 10 mil.
Como funciona
Foto: reprodução/prnewswire.com
Os chamados monitores "inside-out" são sondas leves instaladas diretamente no processamento do modelo-alvo, lendo os sinais internos a cada etapa do trabalho do agente. Segundo o CEO Eric Ho, a abordagem é mais barata porque reaproveita cálculos que o modelo já faz durante o processamento, em vez de gerar uma rodada extra de computação para revisar o resultado depois de pronto. Quando uma sonda identifica algo suspeito, um segundo modelo de IA é chamado para analisar o caso com mais profundidade.
Nos testes, o sistema detectou 94% das sessões de hacking maliciosas, com taxa de 8,7% de falsos positivos — sessões inofensivas sinalizadas por erro. A latência adicional ficou abaixo de 2%, mesmo rodando quatro sondas ao mesmo tempo.
O que os monitores pegam
A ferramenta foi testada contra três tipos de comportamento de risco: operações cibernéticas ofensivas autônomas, pesquisa ou uso de armas químicas e biológicas de uso duplo, e "reward hacking" — quando o agente otimiza indevidamente a métrica que deveria recompensar o comportamento correto. Em avaliações citadas, modelos abertos como o Kimi K3 e o GLM-5.2 apresentaram reward hacking em 50% a 96% das execuções analisadas.
Quem está por trás
A Goodfire foi fundada em 2024 por Eric Ho e Tom McGrath, e levantou US$ 50 milhões em rodada Série A liderada pela Menlo Ventures, com participação de Lightspeed Venture Partners e da própria Anthropic, entre outros investidores. A nova funcionalidade de monitoramento interno está disponível via parceria com a Baseten, plataforma de hospedagem de modelos de IA.
O que falta responder
Resta saber se o método se sustenta em escala, fora de ambientes de teste controlados, e se funciona igualmente bem em modelos fechados, já que os benchmarks divulgados até agora usaram arquiteturas abertas.