Claude encontrou um sistema de enzimas, mas ainda não sabe para que ele serve

A descoberta da Anthropic mostra onde agentes de IA ajudam na pesquisa e onde o laboratório ainda precisa responder

0 2
Claude encontrou um sistema de enzimas, mas ainda não sabe para que ele serve

A Anthropic diz que o Claude encontrou um sistema de enzimas associado a repetições de DNA semelhantes às do CRISPR. A afirmação é relevante por um motivo preciso: o modelo não recebeu o trecho suspeito pronto. Agentes vasculharam bases genéticas, compararam famílias de proteínas e chegaram a uma sequência que não estava descrita como sistema. A conclusão, porém, termina onde começa a parte mais cara da biologia: a empresa ainda não sabe qual função o conjunto exerce.

O sistema recebeu o nome de ART, sigla em inglês para array-associated reverse transcriptases. Ele reúne uma transcriptase reversa, um gene parceiro e uma sequência de repetições de DNA não codificante. A transcriptase reversa é uma enzima capaz de copiar RNA para DNA. A semelhança com o CRISPR está na organização repetitiva, não em uma prova de que o ART edita genes ou pode ser usado como ferramenta terapêutica.

Essa diferença muda a leitura comercial do anúncio. O produto entregue pelo Claude foi uma hipótese biológica bem documentada, com candidatos para testes. Não foi uma terapia, uma enzima pronta para venda nem um novo CRISPR. Para empresas que usam inteligência artificial em pesquisa, a lição é direta: o valor está em reduzir o tempo até uma pergunta verificável, enquanto a decisão de investir depende de experimentos que o software não substitui.

O Claude achou o ART porque saiu da lista de tarefas prevista

A campanha descrita pela Anthropic partiu de uma base com cerca de 1,9 bilhão de agrupamentos de proteínas. Os agentes recuperaram aproximadamente 200 mil agrupamentos de transcriptases reversas, organizaram o material em nove classes e examinaram 10.983 loci, regiões do genoma que incluem um gene e suas áreas vizinhas. A triagem também identificou 3.564 famílias de proteínas próximas, que poderiam indicar parceiros funcionais.

O plano inicial procurava associações entre a transcriptase e genes vizinhos. O ART apareceu por uma observação lateral. Ao ler diretamente o DNA perto de uma transcriptase de um fago gigante, um agente encontrou uma sequência repetida em série. O relatório técnico registra 14 cópias de um motivo de 16 nucleotídeos em um dos trechos examinados. A estrutura chamou atenção porque as cópias tinham espaçamento semelhante e ficavam em uma região que não codificava uma proteína conhecida.

O agente contou as repetições, mediu os intervalos, comparou o arranjo com sistemas descritos e procurou referências que pudessem explicar o padrão. Esse caminho importa porque uma busca programada para encontrar somente genes conhecidos poderia descartar a região como ruído. A descoberta veio da combinação entre busca ampla e leitura de uma anomalia que não estava no filtro inicial.

A escala da operação também explica por que a Anthropic apresenta o caso como uma demonstração de ferramenta. O estudo técnico informa 949 sessões de agentes, 119 tarefas, 77 horas de trabalho acumulado e 215,6 milhões de tokens processados em 21,5 horas de tempo corrido. Dividindo 215,6 milhões por 21,5, a campanha consumiu cerca de 10,03 milhões de tokens por hora. Essa conta não mede qualidade científica. Mede o volume de processamento usado para manter trabalhadores, supervisores e revisores artificiais ativos em paralelo.

A própria arquitetura é parte do resultado. Um agente planejava uma tarefa, outro revisava o plano e podia abrir uma investigação seguinte, enquanto os achados eram guardados em uma memória compartilhada. No final, editores humanos receberam relatórios para decidir o que merecia bancada. O modelo não trabalhou como um chatbot que responde a uma pergunta isolada. Operou como uma camada de pesquisa sobre bases, arquivos, literatura e ferramentas de análise.

Pesquisadora de jaleco utiliza pipeta em laboratório com vista para o Pão de Açúcar.

O ART parece promissor porque tem peças conhecidas, não porque já funciona como CRISPR

O pré-print da Anthropic descreve 95 membros da família ART identificados em genomas de fagos gigantes e contigs virais previstos. Em 28 desses casos, a equipe encontrou uma matriz de repetições próxima à transcriptase. As matrizes variam de 0,3 a 4,1 mil bases e têm de três a 21 cópias de repetições curtas. O gene parceiro aparece ao lado do conjunto em parte relevante dos loci analisados.

Os primeiros testes indicaram que as repetições podem ser transcritas como unidades curtas de RNA. Em dados de infecção por um fago de Staphylococcus, os RNAs associados à matriz apareceram em diferentes fases do processo. Essa observação sugere que as repetições têm atividade biológica. Ela ainda não mostra que a transcriptase usa esses RNAs como molde, que o gene parceiro interage com a enzima ou que o sistema corta e cola DNA.

Essa sequência de verbos é decisiva. Identificar uma família é diferente de demonstrar atividade. Detectar RNA é diferente de provar sua função. Encontrar semelhança estrutural com um sistema conhecido é diferente de reproduzir a propriedade que tornou o CRISPR uma plataforma de edição. O artigo técnico declara que a equipe ainda não demonstrou que a transcriptase está ativa nem que as unidades de RNA são seus substratos.

O paralelo com CRISPR precisa ser tratado com cuidado. O Instituto Nacional de Pesquisa do Genoma Humano, órgão do governo dos Estados Unidos, explica que o CRISPR usado em laboratório normalmente combina uma proteína Cas9 com um RNA-guia desenhado para reconhecer uma sequência específica. A Cas9 corta o DNA no ponto indicado pelo guia. A matriz do ART tem repetições e produz RNAs, mas o estudo não identificou uma proteína Cas equivalente, um mecanismo de direcionamento ou uma edição reproduzível em células.

A história recente da edição genética mostra por que essa prova demora. Um estudo publicado no CRISPR Journal e indexado no PubMed analisou sistemas encontrados por metagenômica, testou candidatos em laboratório e chegou a resultados de edição em células imunes primárias. Mesmo nessa pesquisa, o caminho passou por testes in vitro, células imortalizadas, células T, células B, células NK, células-tronco e avaliação de especificidade. O fato de uma sequência parecer interessante é apenas a entrada dessa fila experimental.

O caso da Anthropic tem uma vantagem concreta em relação a uma simples lista de candidatos: o modelo encontrou uma associação que não era o alvo principal da busca e ajudou a formular a hipótese. A limitação também é concreta: quando os pesquisadores repetiram a campanha original dez vezes, os agentes não voltaram a examinar o trecho específico que continha o achado. Em testes controlados, com o DNA relevante já entregue ao modelo, a identificação do padrão passou de 90%. Com arquivos e ferramentas sendo escolhidos pelo próprio sistema, a taxa caiu para até 32%, segundo os dados divulgados pela empresa.

A repetição que falhou define o limite da ferramenta

O dado mais importante do anúncio pode ser o que a empresa não conseguiu repetir. Uma descoberta que depende de uma escolha casual de navegação não pode ser tratada como um procedimento industrial pronto. Ela pode ser valiosa como pista, mas precisa ganhar um protocolo que outra equipe consiga executar, revisar e contestar.

O pré-print ainda não passou por revisão por pares. Feng Zhang, professor do MIT e do Broad Institute ligado à pesquisa de edição genética, avaliou o trabalho e disse que a identificação das matrizes de RNA associadas a transcriptases reversas é interessante e merece investigação. A fala apoia a qualidade da pergunta. Não confirma a função do ART nem sua importância biotecnológica.

Existe também uma diferença entre o que a Anthropic controla e o que uma empresa compradora controlaria. A companhia conhece o modelo, o conjunto de ferramentas, o banco consultado e o mecanismo de coordenação. Um laboratório externo que use outro modelo, outra base ou uma política diferente de acesso a arquivos pode obter resultados diferentes. A documentação pública do Claude Code descreve ferramentas de shell, acesso a arquivos, pesquisa na web e conexão a servidores MCP. Essa lista explica como um agente pode operar uma pesquisa, mas não garante que ele escolherá as mesmas fontes ou lerá a mesma quantidade de DNA.

O preço reforça a necessidade de separar demonstração de operação. A tabela oficial da Anthropic informa que Claude Fable 5.1 e Claude Mythos 5.1 custam US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída na API. O trabalho do pré-print usou Claude Mythos 5 em um ambiente de pesquisa próprio, com bases e ferramentas conectadas. Portanto, não é correto multiplicar automaticamente os 215,6 milhões de tokens pelo preço público e chamar o resultado de custo da descoberta. O consumo inclui categorias de uso que não aparecem como uma fatura simples, e o preço publicado pode não corresponder ao modelo, ao contrato ou ao ambiente da campanha.

Para uma empresa, o ponto de comparação deve ser outro. Quanto custa levantar uma hipótese, revisar os dados e chegar a um experimento que seria feito de qualquer forma? Quanto tempo um pesquisador gasta descartando candidatos que já foram descritos? Quantos relatórios falsos positivos a equipe consegue revisar sem paralisar a bancada? Essas métricas dizem mais sobre retorno do que a frase “descoberta autônoma”.

Na segunda-feira, o teste começa pelo protocolo que a IA precisa deixar pronto

O dono de uma empresa de biotecnologia ou de um laboratório aplicado pode usar esse caso como um roteiro de contratação. A primeira etapa é escolher uma pergunta estreita, com uma base de dados autorizada e um critério claro para considerar um candidato interessante. “Encontre algo novo” é amplo demais para medir desempenho. “Identifique famílias de transcriptases com gene parceiro recorrente e região não codificante repetitiva” já produz uma tarefa auditável.

A segunda etapa é exigir um relatório por candidato. Ele deve trazer a sequência ou o identificador original, a versão da base, os filtros aplicados, os trechos que sustentam a hipótese, as referências consultadas e o que permanece desconhecido. O relatório também precisa separar observação, interpretação e proposta de experimento. Sem essa divisão, uma inferência do modelo pode virar fato no documento seguinte.

A terceira etapa é repetir a busca com amostras controladas. Entregue ao sistema uma parte dos dados e esconda outra parte para medir quantos candidatos relevantes ele recupera. Depois, repita a operação com o mesmo briefing e registre o que mudou. Se o resultado varia muito, a IA pode continuar útil como exploradora, mas não deve ser tratada como mecanismo único de triagem.

A quarta etapa é reservar a decisão experimental para especialistas humanos. No caso do ART, isso significa verificar se a enzima é ativa, se os RNAs são substratos, se o gene parceiro participa da função e se o conjunto produz alguma alteração genética reproduzível. Só depois dessas respostas faria sentido discutir aplicação em edição, diagnóstico ou desenvolvimento de produto.

O resultado desta semana pode ser registrado em quatro linhas de controle: candidatos encontrados, candidatos descartados por evidência, horas humanas gastas na revisão e hipóteses que chegaram ao laboratório. O Claude pode reduzir o trabalho de procurar uma agulha em bilhões de sequências. Ainda cabe ao laboratório mostrar que a agulha faz alguma coisa.

Fontes consultadas

Qual é a Sua Reação?

Curtir Curtir 0
Não Gostei Não Gostei 0
Amor Amor 0
Engraçado Engraçado 0
Uau Uau 0
Triste Triste 0
Bravo Bravo 0
Silvio Cabral Jr

empreendedor na área de tecnologia, com atuação no desenvolvimento de produtos digitais, inovação e segurança da informação. Ao longo da sua trajetória, tem se dedicado a criar soluções que resolvem problemas reais, conectando tecnologia, mercado e comportamento. É fundador de diversas startups , onde desenvolve projetos que utilizam inteligência artificial e novas tecnologias para gerar impacto prático na vida das pessoas.

Comentários (0)

User