Google cria marca d'água para proteínas desenhadas por IA
O SynthID Bio embute uma assinatura invisível em proteínas geradas por inteligência artificial sem alterar sua função — uma peça a mais, não uma solução completa, na biossegurança contra o uso indevido de biologia sintética.
Por Letícia Prado · Repórter de Ciência
Uma letra fora do lugar em um livro de 20 mil páginas
Imagine um bibliotecário que precisa identificar, entre milhares de proteínas depositadas em bancos de dados científicos, quais foram desenhadas por inteligência artificial e quais vieram da natureza. Até agora, essa distinção era praticamente impossível de verificar depois que a sequência já estava publicada. É esse buraco que o Google DeepMind diz ter fechado, ao menos parcialmente, com uma técnica batizada de SynthID Bio.
O que está confirmado
A técnica já existe, foi publicada e testada em laboratório. O método altera sutilmente quais aminoácidos são escolhidos ao longo da cadeia de uma proteína (ou pequenos ajustes nas coordenadas atômicas de estruturas 3D previstas), criando um padrão estatístico detectável sem comprometer a função biológica da molécula. Em testes, proteínas marcadas tiveram desempenho idêntico às não marcadas — inclusive quando sintetizadas fisicamente em bancada.
A ferramenta funciona em conjunto com sistemas populares de design de proteínas por IA: o método de sequência foi acoplado ao ProteinMPNN, um modelo amplamente usado por laboratórios para gerar novas sequências de aminoácidos, e o método de estrutura usa uma versão ajustada do AlphaFold 3, a ferramenta de previsão de estruturas moleculares do próprio Google DeepMind. Em parceria com o Hie Lab, da Universidade Stanford, e o Arc Institute, a equipe também aplicou uma versão da técnica ao Evo 2, um modelo genômico usado para desenhar DNA.
O que ainda é hipótese — e por que importa
A proposta de biossegurança é que empresas de síntese de DNA e reguladores usem a marca d'água para rastrear a origem de material sintético, reforçando barreiras de triagem que hoje dependem de comparar sequências com bancos de ameaças conhecidas — método que já não é suficiente, já que algoritmos generativos podem criar sequências sem semelhança com nada catalogado.
O próprio Google é explícito quanto ao limite: a ferramenta funciona como uma "lista de permissão", não como um detector universal. Uma proteína marcada indica que foi gerada por um modelo com essa proteção ativada; a ausência da marca não prova nada — pode ser uma proteína natural ou uma criada por um modelo sem watermark. Resistir a adulterações propositais também segue sendo um desafio em aberto reconhecido pelos próprios pesquisadores.