Il modello AI MAGE progetta da zero nuovi anticorpi umani contro molteplici agenti patogeni
I ricercatori hanno sviluppato MAGE, un modello linguistico proteico che genera sequenze di anticorpi umani accoppiati con legame validato contro SARS-CoV-2, H5N1 e RSV-A.
Riepilogo
Gli scienziati della Vanderbilt University hanno sviluppato MAGE (Monoclonal Antibody GEnerator), un modello linguistico proteico ottimizzato su 18.507 coppie di sequenze anticorpo-antigene per generare sequenze accoppiate di catene pesanti e leggere di anticorpi umani contro antigeni bersaglio. A differenza degli strumenti AI esistenti per gli anticorpi, che richiedono un anticorpo modello di partenza, MAGE genera sequenze completamente nuove da zero quando viene fornita soltanto una sequenza antigenica. Il legame è stato confermato sperimentalmente contro la RBD di SARS-CoV-2 (9/20 anticorpi), la proteina F prefusione di RSV-A (7/23) e l'emoagglutinina di H5N1 (5/18), incluso un anticorpo neutralizzante contro SARS-CoV-2 con una potenza inferiore a 10 ng/mL. Le strutture cryo-EM hanno confermato modalità di legame diverse per gli anticorpi diretti contro RSV. MAGE rappresenta il primo modello pubblicato in grado di progettare anticorpi umani specifici per un antigene senza l'utilizzo di un modello template.
Riepilogo Dettagliato
I anticorpi monoclonali terapeutici sono tra gli strumenti più potenti della medicina moderna, eppure i tradizionali processi di scoperta rimangono lenti, costosi e fortemente dipendenti dallo screening biologico delle risposte immunitarie umane o animali. L'intelligenza artificiale ha iniziato a trasformare questo panorama, ma i modelli esistenti si limitano in gran parte a eseguire il grafting delle CDR o la maturazione dell'affinità su template anticorpali già esistenti, piuttosto che generare sequenze interamente nuove. MAGE affronta questo divario fondamentale.
MAGE è stato sviluppato mediante il fine-tuning di Progen2-base, un modello autoregressivo del linguaggio proteico pre-addestrato su oltre un miliardo di sequenze proteiche diverse, utilizzando un database curato di 18.507 coppie di sequenze anticorpo-antigene. Le fonti includevano CoV-AbDab (10.043 anticorpi contro il coronavirus), SAbDab (2.113 coppie strutturalmente caratterizzate), PLAbDab (987 coppie derivate da brevetti), dataset pubblici ad alto rendimento per il legame (2.030 sequenze) e un dataset originale LIBRA-seq generato da 20 donatori umani screenati contro 18 antigeni virali (1.924 sequenze). Le sequenze di addestramento erano formattate come concatenazione di sequenze della catena pesante, della catena leggera e dell'antigene, separate da token speciali, consentendo al modello di apprendere la generazione di anticorpi dipendente dal contesto antigenico.
Quando stimolato con la sequenza RBD wild-type di SARS-CoV-2, MAGE ha generato 1.000 sequenze anticorpali, di cui 969 hanno superato i filtri di qualità e di somiglianza con sequenze umane. Queste sequenze utilizzavano 37 geni variabili unici della catena pesante e 30 della catena leggera, formando 322 distinte combinazioni di geni V. Le lunghezze delle CDRH3 variavano da 5 a 28 amminoacidi e la maggior parte delle sequenze risultava nuova rispetto ai dati di addestramento sulla base dell'analisi della distanza di Levenshtein. La validazione sperimentale ha confermato il legame per 9/20 anticorpi selezionati, tra cui uno con una potenza di neutralizzazione di SARS-CoV-2 inferiore a 10 ng/mL. Contro la proteina F di prefusione dell'RSV-A — molto meno rappresentata nell'addestramento — 7/23 anticorpi hanno mostrato legame; le strutture cryo-EM di due complessi anticorpo-RSV F hanno rivelato distinte modalità di interazione con l'epitopo e residui dell'interfaccia funzionalmente importanti. In modo determinante, 5/18 anticorpi generati da MAGE si sono legati all'emoagglutinina H5/TX/24, un ceppo di influenza aviaria completamente assente dai dati di addestramento, dimostrando una reale generalizzazione zero-shot.
Le implicazioni per la scoperta di anticorpi terapeutici sono significative. MAGE comprime drasticamente i tempi che intercorrono tra l'identificazione dell'antigene e i candidati anticorpali di riferimento, eliminando la dipendenza da campioni biologici, dall'immunizzazione animale o da framework anticorpali preesistenti. La sua capacità di generare sequenze diverse e simili a quelle umane che prendono di mira antigeni nuovi — inclusi patogeni emergenti come H5N1 — la posiziona come un potente motore di scoperta iniziale, combinabile con l'ottimizzazione sperimentale a valle. L'architettura del modello consente inoltre di utilizzare come prompt qualsiasi sequenza di antigene proteico all'interno di una finestra di contesto di 2.048 token, comprese le proteine spike virali a lunghezza intera.
Rimangono tuttavia importanti avvertenze. I tassi di successo (circa 25–45%) indicano che la maggior parte delle sequenze generate non si lega, il che significa che è ancora necessario uno screening sperimentale significativo. I dati di addestramento erano fortemente sbilanciati verso gli anticorpi contro il coronavirus (67%), il che potrebbe limitare la generalizzabilità a target non virali o non immunologici. L'affinità di legame e la potenza funzionale degli anticorpi validati variavano considerevolmente, e il modello non incorpora ancora un'ottimizzazione strutturale o biofisica. Il potenziamento e la diversificazione ulteriore dei dati di addestramento, insieme all'integrazione con le pipeline di maturazione dell'affinità, rappresenteranno i passaggi successivi essenziali.
Risultati Principali
- MAGE generated novel paired human antibody sequences with confirmed binding against SARS-CoV-2 RBD at a 45% hit rate (9/20).
- 5/18 MAGE antibodies bound H5N1 hemagglutinin despite the strain being entirely absent from training data, showing zero-shot capability.
- 7/23 RSV-A-targeting antibodies showed validated binding; cryo-EM confirmed diverse epitope engagement modes.
- One MAGE-designed antibody neutralized SARS-CoV-2 with sub-10 ng/mL potency.
- Generated sequences used 322 distinct V-gene pairings with novel CDR3s, demonstrating broad sequence diversity.
Metodologia
MAGE è stato sviluppato attraverso il fine-tuning del modello linguistico autoregressivo per proteine Progen2-base su 18.507 coppie curate di sequenze anticorpo-antigene provenienti da CoV-AbDab, SAbDab, PLAbDab, dataset di legame pubblicati e un dataset originale LIBRA-seq ottenuto da 20 donatori umani. Gli anticorpi generati sono stati filtrati per completezza strutturale e umanizzazione tramite BioPhi OASis, quindi validati sperimentalmente mediante saggi di legame e analisi strutturale cryo-EM.
Limitazioni dello Studio
Tassi di successo del 25–45% indicano che la maggior parte delle sequenze generate non riesce ancora a legarsi al bersaglio, richiedendo un consistente screening sperimentale. I dati di addestramento erano fortemente orientati verso i coronavirus (67%), il che potrebbe limitare le prestazioni su bersagli non virali o strutturalmente divergenti. Il modello non incorpora l'ottimizzazione dell'affinità o delle proprietà biofisiche, e la potenza degli anticorpi tra i leganti confermati variava notevolmente.
Ti è piaciuto questo riepilogo?
Ricevi ogni settimana le ultime ricerche sulla longevità direttamente nella tua casella email.
Inserisci la tua email per iscriverti:
