Le modèle d'IA MAGE conçoit de nouveaux anticorps humains contre plusieurs agents pathogènes à partir de zéro
Des chercheurs ont développé MAGE, un modèle de langage protéique générant des séquences d'anticorps humains appariées avec une liaison validée contre le SARS-CoV-2, le H5N1 et le RSV-A.
Résumé
Des scientifiques de l'Université Vanderbilt ont développé MAGE (Monoclonal Antibody GEnerator), un modèle de langage protéique affiné sur 18 507 paires de séquences anticorps-antigène afin de générer des séquences appariées de chaînes lourdes et légères d'anticorps humains dirigés contre des antigènes cibles. Contrairement aux outils d'IA existants pour la conception d'anticorps, qui nécessitent un anticorps modèle comme point de départ, MAGE génère des séquences entièrement inédites à partir de zéro, en n'utilisant que la séquence d'un antigène comme entrée. La liaison a été validée expérimentalement contre le domaine de liaison au récepteur (RBD) du SARS-CoV-2 (9 anticorps sur 20), la protéine F de pré-fusion du RSV-A (7 sur 23) et l'hémagglutinine H5N1 (5 sur 18), dont un anticorps neutralisant le SARS-CoV-2 avec une puissance inférieure à 10 ng/mL. Des structures obtenues par cryo-EM ont confirmé la diversité des modes de liaison des anticorps ciblant le RSV. MAGE représente le premier modèle publié capable de concevoir des anticorps humains spécifiques d'un antigène sans recours à un modèle préexistant.
Résumé détaillé
Les anticorps monoclonaux thérapeutiques figurent parmi les outils les plus puissants de la médecine moderne, mais les pipelines de découverte traditionnels demeurent lents, coûteux et fortement dépendants du criblage biologique des réponses immunitaires humaines ou animales. L'intelligence artificielle a commencé à transformer ce paysage, mais les modèles existants se limitent largement au greffage de CDR ou à la maturation d'affinité sur des modèles d'anticorps existants, plutôt que de générer des séquences entièrement nouvelles. MAGE comble cette lacune fondamentale.
MAGE a été construit par affinage de Progen2-base, un modèle de langage protéique autorégressif pré-entraîné sur plus d'un milliard de séquences protéiques diverses, à l'aide d'une base de données sélectionnée de 18 507 paires de séquences anticorps-antigène. Les sources comprenaient CoV-AbDab (10 043 anticorps anti-coronavirus), SAbDab (2 113 paires structuralement caractérisées), PLAbDab (987 paires dérivées de brevets), des jeux de données de liaison à haut débit publiés (2 030 séquences) et un jeu de données LIBRA-seq original généré à partir de 20 donneurs humains criblés contre 18 antigènes viraux (1 924 séquences). Les séquences d'entraînement étaient formatées sous forme de séquences concaténées de chaîne lourde, de chaîne légère et d'antigène, séparées par des tokens spéciaux, permettant au modèle d'apprendre la génération d'anticorps dépendante du contexte antigénique.
Après avoir reçu en entrée la séquence du domaine RBD de la souche sauvage du SARS-CoV-2, MAGE a généré 1 000 séquences d'anticorps, dont 969 ont passé les filtres de qualité et d'humanisation. Ces séquences utilisaient 37 gènes variables de chaîne lourde uniques et 30 gènes variables de chaîne légère, formant 322 appariements V-gène distincts. Les longueurs des CDRH3 allaient de 5 à 28 acides aminés, et la majorité des séquences étaient nouvelles par rapport aux données d'entraînement, d'après une analyse par distance de Levenshtein. La validation expérimentale a confirmé la liaison pour 9 des 20 anticorps sélectionnés, dont un présentant une puissance de neutralisation du SARS-CoV-2 inférieure à 10 ng/mL. Face à la protéine F de préfusion du RSV-A — bien moins représentée dans les données d'entraînement — 7 des 23 anticorps ont montré une liaison ; les structures cryo-EM de deux complexes anticorps-F du RSV ont révélé des modes distincts d'engagement des épitopes ainsi que des résidus d'interface fonctionnellement importants. De manière déterminante, 5 des 18 anticorps générés par MAGE se sont liés à l'hémagglutinine H5/TX/24, une souche de grippe aviaire totalement absente des données d'entraînement, démontrant une véritable généralisation en zéro-shot.
Les implications pour la découverte d'anticorps thérapeutiques sont considérables. MAGE réduit drastiquement le délai entre l'identification de l'antigène et l'obtention de candidats anticorps de premier plan, en éliminant la dépendance aux échantillons biologiques, à l'immunisation animale ou aux structures d'anticorps existantes. Sa capacité à générer des séquences diverses et d'apparence humaine ciblant des antigènes nouveaux — notamment des agents pathogènes émergents tels que H5N1 — le positionne comme un moteur de découverte initial puissant, pouvant être combiné à une optimisation expérimentale en aval. L'architecture du modèle permet également de lui soumettre en entrée n'importe quelle séquence d'antigène protéique dans une fenêtre de contexte de 2 048 tokens, y compris des protéines de spicule virales de pleine longueur.
Des mises en garde importantes subsistent. Les taux de succès (environ 25 à 45 %) indiquent que la majorité des séquences générées ne se lient pas, ce qui implique qu'un criblage expérimental significatif reste nécessaire. Les données d'entraînement étaient fortement orientées vers les anticorps anti-coronavirus (67 %), ce qui pourrait limiter la généralisabilité aux cibles non virales ou non immunologiques. L'affinité de liaison et la puissance fonctionnelle des anticorps validés variaient considérablement, et le modèle n'intègre pas encore d'optimisation structurale ou biophysique. La mise à l'échelle et la diversification accrue des données d'entraînement, ainsi que l'intégration à des pipelines de maturation d'affinité, constitueront des étapes essentielles à venir.
Principales conclusions
- MAGE generated novel paired human antibody sequences with confirmed binding against SARS-CoV-2 RBD at a 45% hit rate (9/20).
- 5/18 MAGE antibodies bound H5N1 hemagglutinin despite the strain being entirely absent from training data, showing zero-shot capability.
- 7/23 RSV-A-targeting antibodies showed validated binding; cryo-EM confirmed diverse epitope engagement modes.
- One MAGE-designed antibody neutralized SARS-CoV-2 with sub-10 ng/mL potency.
- Generated sequences used 322 distinct V-gene pairings with novel CDR3s, demonstrating broad sequence diversity.
Méthodologie
MAGE a été développé par affinage du modèle de langage protéique autorégressif Progen2-base sur 18 507 paires de séquences anticorps-antigène soigneusement sélectionnées, issues de CoV-AbDab, SAbDab, PLAbDab, de jeux de données de liaison publiés, ainsi que d'un jeu de données LIBRA-seq original provenant de 20 donneurs humains. Les anticorps générés ont été filtrés pour vérifier leur complétude structurelle et leur caractère humain à l'aide de BioPhi OASis, puis validés expérimentalement par des tests de liaison et une analyse structurelle par cryo-EM.
Limites de l'étude
Des taux de réussite de 25 à 45 % signifient que la majorité des séquences générées échouent encore à se lier à leur cible, ce qui nécessite un criblage expérimental substantiel. Les données d'entraînement étaient fortement biaisées vers les coronavirus (67 %), ce qui pourrait limiter les performances sur des cibles non virales ou structurellement divergentes. Le modèle n'intègre pas d'optimisation de l'affinité ou des propriétés biophysiques, et la puissance des anticorps parmi les candidats confirmés variait considérablement.
Ce résumé vous a plu ?
Recevez les dernières recherches sur la longévité dans votre boîte de réception chaque semaine.
Saisissez votre e-mail pour vous abonner :
