Cómo el MIT entrena IAs para hablar el «idioma» del ADN

Investigadores del MIT emplean modelos de lenguaje de gran escala para optimizar la síntesis de proteínas en levaduras industriales, un avance que agiliza el desarrollo de fármacos complejos y reduce drásticamente sus costes de producción

Añádenos en Google

En la carrera por hacer que los tratamientos médicos de vanguardia sean más accesibles, el Instituto Tecnológico de Massachusetts (MIT) ha presentado un avance que podría marcar un antes y un después en la fabricación de fármacos biológicos. Utilizando modelos de lenguaje de gran escala (LLM), similares en arquitectura a los que impulsan las interfaces de texto modernas, un equipo de ingenieros químicos ha logrado "hackear" el código genético de las levaduras industriales para convertirlas en fábricas de proteínas mucho más eficientes y rápidas.

Este avance no es una cuestión menor para la economía de la salud: el desarrollo de procesos de fabricación para nuevos fármacos biológicos, sustancias complejas producidas por organismos vivos, puede representar entre el 15 y el 20% del coste total de comercialización de un medicamento. Al optimizar estos procesos mediante IA, los investigadores esperan reducir significativamente la carga financiera y el tiempo necesario para llevar vacunas y tratamientos contra el cáncer desde el laboratorio hasta el paciente.

Las "mulas de carga" de la medicina moderna

Para entender la magnitud del hallazgo, debemos mirar hacia los microorganismos. Levaduras como la Komagataella phaffii (anteriormente conocida como Pichia pastoris) y la Saccharomyces cerevisiae "son las auténticas mulas de carga de la industria biofarmacéutica". Estos organismos producen anualmente miles de millones de dólares en fármacos, incluyendo la insulina, la vacuna contra la hepatitis B, hormonas de crecimiento y anticuerpos monoclonales para tratar migrañas crónicas.

Sin embargo, programar a estos organismos para que fabriquen una proteína humana no es sencillo. Los científicos deben insertar genes externos en el genoma de la levadura, un proceso que actualmente depende de tareas experimentales extremadamente laboriosas y lentas. "Hoy en día, esos pasos se realizan mediante tareas experimentales muy pesadas", señala J. Christopher Love, profesor de Ingeniería Química en el MIT y autor principal del estudio.

J. Christopher Love, profesor de Ingeniería Química en el MIT y autor principal del estudio

El "idioma secreto" de los codones

El corazón de esta innovación reside en la forma en que la IA interpreta el ADN. El modelo utiliza una arquitectura de codificador-decodificador para analizar los codones. En biología, existen 20 aminoácidos naturales, pero 64 secuencias de codones posibles para codificarlos. Esto significa que un mismo aminoácido puede ser "escrito" de varias formas genéticas. Cada organismo tiene su propia preferencia de "sintaxis", y si se elige el codón equivocado, la célula puede quedarse sin moléculas de tRNA (el transporte de los aminoácidos), provocando un cuello de botella en la producción.

Tradicionalmente, los científicos elegían los codones que aparecen con más frecuencia en el organismo anfitrión, pero esto no siempre garantiza el éxito. El modelo del MIT, entrenado con las secuencias de las aproximadamente 5.000 proteínas que la levadura K. phaffii produce de forma natural, ha aprendido a manejar esta complejidad. No solo analiza los codones de forma aislada, sino que comprende la "gramática" genética: cómo se colocan unos junto a otros y las relaciones de larga distancia dentro de la secuencia.

Superando a la industria actual

La efectividad del modelo fue puesta a prueba con seis proteínas de alto valor terapéutico, incluyendo la albúmina sérica humana, la hormona del crecimiento y el Trastuzumab, un anticuerpo monoclonal esencial en el tratamiento del cáncer de mama. Los investigadores compararon sus resultados con cuatro herramientas comerciales de optimización de codones ya existentes en el mercado.

Los datos fueron reveladores: las secuencias generadas por la IA del MIT funcionaron mejor en cinco de las seis proteínas analizadas, y quedaron en segundo lugar en la sexta.

Harini Narayanan, autora principal del estudio publicado en la revista PNAS

Una IA que "entiende" la biología

Uno de los descubrimientos más fascinantes del estudio fue que el modelo aprendió principios biológicos fundamentales por su cuenta, sin que nadie se los enseñara explícitamente. Al analizar el interior de la IA, los investigadores descubrieron que el sistema había aprendido a evitar elementos de repetición negativos (secuencias de ADN que inhiben la expresión de genes cercanos) y a categorizar los aminoácidos según propiedades químicas como la hidrofobicidad o hidrofilicidad.

"No solo estaba aprendiendo este lenguaje, sino que lo estaba contextualizando a través de aspectos biofísicos y bioquímicos", explica Love. Esto da a los científicos la confianza de que la IA no solo está haciendo un truco matemático, sino que está captando procesos biológicos reales y significativos.

Hacia una producción global y abierta

El potencial de esta herramienta no se limita a una sola levadura. Aunque el modelo actual está especializado en K. phaffii, las pruebas realizadas con datos de humanos y vacas demuestran que la técnica puede adaptarse a cualquier organismo, permitiendo crear modelos específicos para cada especie.

Con una visión de colaboración científica, el equipo del MIT ha puesto el código a disposición de otros investigadores de forma abierta. Este gesto busca que cualquier laboratorio del mundo pueda optimizar la producción de nutrientes alimentarios (como la hemoglobina añadida a alimentos) o fármacos críticos, acelerando el paso de una idea científica a una realidad clínica que salve vidas.

El estudio contó con el respaldo financiero de instituciones clave como el Instituto Koch y la Fundación de Innovación en Investigación Daniel I.C. Wang, consolidando el papel de la inteligencia artificial como el nuevo motor de la eficiencia sanitaria.


También te puede interesar...