Longevity & AgingArtículo de investigaciónAcceso abierto

El modelo de IA MAGE diseña anticuerpos humanos novedosos contra múltiples patógenos desde cero

Investigadores desarrollaron MAGE, un modelo de lenguaje de proteínas que genera secuencias de anticuerpos humanos emparejados con unión validada contra SARS-CoV-2, H5N1 y RSV-A.

miércoles, 19 de agosto de 2026 1 visualización
Publicado en Cell
Glowing 3D molecular structure of an antibody binding to a viral spike protein, rendered in cool blue and gold on a dark background.

Resumen

Científicos de la Universidad de Vanderbilt desarrollaron MAGE (Monoclonal Antibody GEnerator), un modelo de lenguaje proteico ajustado con 18.507 pares de secuencias anticuerpo-antígeno para generar secuencias pareadas de cadena pesada y cadena ligera de anticuerpos humanos contra antígenos diana. A diferencia de las herramientas de IA para anticuerpos existentes, que requieren una plantilla de anticuerpo de partida, MAGE genera secuencias completamente novedosas desde cero cuando se le proporciona únicamente una secuencia antigénica. Se confirmó unión validada experimentalmente contra el RBD del SARS-CoV-2 (9/20 anticuerpos), la proteína F de prefusión del RSV-A (7/23) y la hemaglutinina del H5N1 (5/18), incluyendo un anticuerpo neutralizante del SARS-CoV-2 con una potencia inferior a 10 ng/mL. Las estructuras de cryo-EM confirmaron modos de unión diversos para los anticuerpos dirigidos contra el RSV. MAGE representa el primer modelo publicado capaz de diseñar anticuerpos humanos específicos frente a un antígeno sin necesidad de plantilla.

Resumen detallado

Los anticuerpos monoclonales terapéuticos se encuentran entre las herramientas más poderosas de la medicina moderna, pero los procesos tradicionales de descubrimiento siguen siendo lentos, costosos y muy dependientes del cribado biológico de respuestas inmunitarias humanas o animales. La inteligencia artificial ha comenzado a transformar este panorama, aunque los modelos existentes se limitan en gran medida a realizar injertos de CDR o maduración de afinidad sobre plantillas de anticuerpos preexistentes, en lugar de generar secuencias completamente nuevas. MAGE aborda esta brecha fundamental.

MAGE se desarrolló mediante el ajuste fino de Progen2-base, un modelo de lenguaje proteico autorregresivo preentrenado con más de mil millones de secuencias proteicas diversas, utilizando una base de datos curada de 18.507 pares de secuencias anticuerpo-antígeno. Las fuentes incluyeron CoV-AbDab (10.043 anticuerpos contra coronavirus), SAbDab (2.113 pares con caracterización estructural), PLAbDab (987 pares derivados de patentes), conjuntos de datos de unión de alto rendimiento publicados (2.030 secuencias) y un conjunto de datos LIBRA-seq original generado a partir de 20 donantes humanos analizados frente a 18 antígenos virales (1.924 secuencias). Las secuencias de entrenamiento se formatearon como concatenaciones de cadena pesada, cadena ligera y secuencias antigénicas separadas por tokens especiales, lo que permitió al modelo aprender la generación de anticuerpos en función del contexto antigénico.

Cuando se utilizó la secuencia RBD del tipo salvaje de SARS-CoV-2 como indicación, MAGE generó 1.000 secuencias de anticuerpos, de las cuales 969 superaron los filtros de calidad y similitud con secuencias humanas. Estas secuencias emplearon 37 genes variables de cadena pesada únicos y 30 de cadena ligera, formando 322 combinaciones de genes V distintas. Las longitudes de CDRH3 oscilaron entre 5 y 28 aminoácidos, y la mayoría de las secuencias resultaron novedosas respecto a los datos de entrenamiento según el análisis de distancia de Levenshtein. La validación experimental confirmó la unión de 9 de los 20 anticuerpos seleccionados, incluido uno con una potencia de neutralización frente a SARS-CoV-2 inferior a 10 ng/mL. Frente a la proteína F de prefusión del RSV-A —mucho menos representada en el entrenamiento—, 7 de los 23 anticuerpos mostraron unión, y las estructuras de cryo-EM de dos complejos anticuerpo-F del RSV revelaron modos distintos de reconocimiento de epítopo y residuos de interfaz funcionalmente relevantes. Notablemente, 5 de los 18 anticuerpos generados por MAGE se unieron a la hemaglutinina H5/TX/24, una cepa de influenza aviar completamente ausente de los datos de entrenamiento, lo que demuestra una genuina generalización en modalidad zero-shot.

Las implicaciones para el descubrimiento de anticuerpos terapéuticos son significativas. MAGE acorta drásticamente el tiempo transcurrido desde la identificación del antígeno hasta la obtención de candidatos a anticuerpos líderes, al eliminar la dependencia de muestras biológicas, inmunización animal o marcos de anticuerpos preexistentes. Su capacidad para generar secuencias diversas y similares a las humanas dirigidas contra antígenos novedosos —incluidos patógenos emergentes como el H5N1— lo posiciona como un potente motor de descubrimiento en primera instancia, que podría combinarse con optimización experimental posterior. La arquitectura del modelo también permite utilizar como indicación la secuencia de cualquier antígeno proteico dentro de una ventana de contexto de 2.048 tokens, incluidas las proteínas espiga virales de longitud completa.

No obstante, persisten advertencias importantes. Las tasas de acierto (aproximadamente entre el 25 % y el 45 %) indican que la mayoría de las secuencias generadas no presentan unión, por lo que aún se requiere un cribado experimental considerable. Los datos de entrenamiento estaban fuertemente sesgados hacia anticuerpos contra coronavirus (67 %), lo que puede limitar la generalización a dianas no virales o ajenas a la inmunología. La afinidad de unión y la potencia funcional de los anticuerpos validados variaron considerablemente, y el modelo aún no incorpora optimización basada en estructura ni biofísica. La ampliación y mayor diversificación de los datos de entrenamiento, así como la integración con plataformas de maduración de afinidad, serán pasos esenciales a seguir.

Hallazgos clave

  • MAGE generated novel paired human antibody sequences with confirmed binding against SARS-CoV-2 RBD at a 45% hit rate (9/20).
  • 5/18 MAGE antibodies bound H5N1 hemagglutinin despite the strain being entirely absent from training data, showing zero-shot capability.
  • 7/23 RSV-A-targeting antibodies showed validated binding; cryo-EM confirmed diverse epitope engagement modes.
  • One MAGE-designed antibody neutralized SARS-CoV-2 with sub-10 ng/mL potency.
  • Generated sequences used 322 distinct V-gene pairings with novel CDR3s, demonstrating broad sequence diversity.

Metodología

MAGE fue desarrollado mediante el ajuste fino (*fine-tuning*) del modelo de lenguaje proteico autorregresivo Progen2-base sobre 18.507 pares curados de secuencias anticuerpo-antígeno procedentes de CoV-AbDab, SAbDab, PLAbDab, conjuntos de datos de unión publicados y un conjunto de datos LIBRA-seq original obtenido de 20 donantes humanos. Los anticuerpos generados fueron filtrados para verificar su integridad estructural y su humanización mediante BioPhi OASis, y posteriormente validados de forma experimental mediante ensayos de unión y análisis estructural por cryo-EM.

Limitaciones del estudio

Las tasas de éxito del 25–45% significan que la mayoría de las secuencias generadas aún no logran unirse al objetivo, lo que requiere un cribado experimental considerable. Los datos de entrenamiento presentaban un fuerte sesgo hacia los coronavirus (67%), lo que podría limitar el rendimiento con dianas no virales o estructuralmente divergentes. El modelo no incorpora optimización de afinidad ni biofísica, y la potencia de los anticuerpos entre los candidatos confirmados varió ampliamente.

¿Te ha gustado este resumen?

Recibe la última investigación sobre longevidad en tu bandeja de entrada cada semana.

Introduce tu correo electrónico para suscribirte: