Modelo de IA MAGE Cria do Zero Novos Anticorpos Humanos Contra Múltiplos Patógenos
Pesquisadores desenvolveram o MAGE, um modelo de linguagem de proteínas que gera sequências emparelhadas de anticorpos humanos com ligação validada contra SARS-CoV-2, H5N1 e RSV-A.
Resumo
Cientistas da Universidade Vanderbilt desenvolveram o MAGE (Monoclonal Antibody GEnerator), um modelo de linguagem de proteínas ajustado com 18.507 pares de sequências anticorpo-antígeno para gerar sequências pareadas de cadeias pesadas e leves de anticorpos humanos contra antígenos-alvo. Ao contrário das ferramentas de anticorpos baseadas em IA existentes, que exigem um anticorpo modelo como ponto de partida, o MAGE gera sequências completamente inéditas do zero quando fornecida apenas a sequência de um antígeno. A ligação validada experimentalmente foi confirmada contra o domínio de ligação ao receptor do SARS-CoV-2 (9/20 anticorpos), a proteína F de pré-fusão do RSV-A (7/23) e a hemaglutinina do H5N1 (5/18), incluindo um anticorpo neutralizante do SARS-CoV-2 com potência inferior a 10 ng/mL. Estruturas de cryo-EM confirmaram modos de ligação diversos para anticorpos direcionados ao RSV. O MAGE representa o primeiro modelo publicado capaz de desenvolver anticorpos humanos específicos para antígenos sem a necessidade de um modelo pré-existente.
Resumo Detalhado
Os terapêuticos com anticorpos monoclonais estão entre as ferramentas mais poderosas da medicina moderna, mas os pipelines tradicionais de descoberta continuam lentos, custosos e fortemente dependentes do rastreamento biológico de respostas imunes humanas ou animais. A inteligência artificial começou a transformar esse cenário, porém os modelos existentes realizam principalmente enxerto de CDR ou maturação de afinidade em templates de anticorpos já existentes, em vez de gerar sequências completamente novas. O MAGE aborda essa lacuna fundamental.
O MAGE foi construído por meio do ajuste fino do Progen2-base, um modelo de linguagem proteica autorregressivo pré-treinado em mais de um bilhão de sequências proteicas diversas, utilizando um banco de dados curado de 18.507 pares de sequências anticorpo-antígeno. As fontes incluíram CoV-AbDab (10.043 anticorpos contra coronavírus), SAbDab (2.113 pares estruturalmente caracterizados), PLAbDab (987 pares derivados de patentes), conjuntos de dados de ligação de alto rendimento publicados (2.030 sequências) e um conjunto de dados LIBRA-seq original gerado a partir de 20 doadores humanos rastreados contra 18 antígenos virais (1.924 sequências). As sequências de treinamento foram formatadas como sequências concatenadas de cadeia pesada, cadeia leve e antígeno, separadas por tokens especiais, permitindo que o modelo aprendesse a geração de anticorpos dependente do contexto do antígeno.
Quando solicitado com a sequência RBD do tipo selvagem do SARS-CoV-2, o MAGE gerou 1.000 sequências de anticorpos, das quais 969 passaram pelos filtros de qualidade e semelhança humana. Essas sequências utilizaram 37 genes variáveis únicos de cadeia pesada e 30 de cadeia leve, formando 322 combinações distintas de genes V. Os comprimentos do CDRH3 variaram de 5 a 28 aminoácidos, e a maioria das sequências era inédita em relação aos dados de treinamento com base na análise de distância de Levenshtein. A validação experimental confirmou ligação para 9/20 anticorpos selecionados, incluindo um com potência de neutralização do SARS-CoV-2 abaixo de 10 ng/mL. Contra a proteína F de pré-fusão do RSV-A — muito menos representada no treinamento — 7/23 anticorpos demonstraram ligação, e as estruturas de cryo-EM de dois complexos anticorpo-RSV F revelaram modos distintos de engajamento de epítopos e resíduos de interface funcionalmente importantes. De forma crítica, 5/18 anticorpos gerados pelo MAGE ligaram-se à hemaglutinina H5/TX/24, uma cepa de influenza aviária completamente ausente dos dados de treinamento, demonstrando genuína generalização zero-shot.
As implicações para a descoberta de anticorpos terapêuticos são significativas. O MAGE comprime o cronograma desde a identificação do antígeno até os candidatos a anticorpos líderes, eliminando a dependência de amostras biológicas, imunização animal ou frameworks de anticorpos existentes. Sua capacidade de gerar sequências diversas e semelhantes às humanas que visam antígenos inéditos — incluindo patógenos emergentes como o H5N1 — o posiciona como um poderoso motor de descoberta de primeira passagem que poderia ser combinado com otimização experimental subsequente. A arquitetura do modelo também permite que qualquer sequência de antígeno proteico seja fornecida como prompt em uma janela de contexto de 2.048 tokens, incluindo proteínas spike virais de comprimento completo.
Ressalvas importantes persistem. As taxas de acerto (aproximadamente 25–45%) indicam que a maioria das sequências geradas não se liga, o que significa que ainda é necessária uma triagem experimental significativa. Os dados de treinamento foram fortemente enviesados para anticorpos contra coronavírus (67%), o que pode limitar a generalização para alvos não virais ou fora do âmbito da imunologia. A afinidade de ligação e a potência funcional dos anticorpos validados variaram consideravelmente, e o modelo ainda não incorpora otimização baseada em estrutura ou biofísica. A expansão e maior diversificação dos dados de treinamento, bem como a integração com pipelines de maturação de afinidade, serão etapas essenciais a seguir.
Principais Descobertas
- MAGE generated novel paired human antibody sequences with confirmed binding against SARS-CoV-2 RBD at a 45% hit rate (9/20).
- 5/18 MAGE antibodies bound H5N1 hemagglutinin despite the strain being entirely absent from training data, showing zero-shot capability.
- 7/23 RSV-A-targeting antibodies showed validated binding; cryo-EM confirmed diverse epitope engagement modes.
- One MAGE-designed antibody neutralized SARS-CoV-2 with sub-10 ng/mL potency.
- Generated sequences used 322 distinct V-gene pairings with novel CDR3s, demonstrating broad sequence diversity.
Metodologia
O MAGE foi desenvolvido por meio do ajuste fino do modelo de linguagem de proteínas autorregressivo Progen2-base em 18.507 pares de sequências anticorpo-antígeno curados, provenientes do CoV-AbDab, SAbDab, PLAbDab, conjuntos de dados de ligação publicados e um conjunto de dados original de LIBRA-seq de 20 doadores humanos. Os anticorpos gerados foram filtrados quanto à integridade estrutural e humanidade utilizando BioPhi OASis, e posteriormente validados experimentalmente por ensaios de ligação e análise estrutural por cryo-EM.
Limitações do Estudo
Taxas de acerto de 25–45% significam que a maioria das sequências geradas ainda falha em se ligar ao alvo, exigindo uma triagem experimental substancial. Os dados de treinamento eram fortemente enviesados para coronavírus (67%), o que pode limitar o desempenho em alvos não virais ou estruturalmente divergentes. O modelo não incorpora otimização de afinidade ou biofísica, e a potência dos anticorpos entre os ligantes confirmados variou amplamente.
Gostou deste resumo?
Receba as pesquisas de longevidade mais recentes na sua caixa de entrada toda semana.
Digite seu e-mail para assinar:
