El problema
Cada genoma humano contiene miles de variantes missense — sustituciones de un solo nucleótido que cambian un aminoácido en la proteína. La mayoría son benignas, pero algunas causan enfermedades graves. Los laboratorios de diagnóstico genético necesitan clasificarlas rápido y bien, y los predictores existentes (CADD, REVEL, AlphaMissense) operan exclusivamente a nivel de proteína: conservación evolutiva, estructura 3D, propiedades fisicoquímicas del aminoácido.
Ninguno de ellos mira lo que hay debajo: el mRNA que codifica esa proteína. Y el mRNA tiene física propia — energía de apilamiento entre nucleótidos adyacentes, estructura secundaria, estabilidad local — que una mutación puede alterar incluso si el cambio aminoacídico parece inocuo.
La idea: dos ejes ortogonales
EnergyFingerprint combina dos señales en un solo tensor de 11 canales × 128 nucleótidos por variante:
Eje biofísico (canales 1-4): Perfiles termodinámicos de apilamiento del mRNA calculados con parámetros nearest-neighbor (SantaLucia 1998, Turner 2004). Capturan la energía libre de Gibbs (ΔG) entre dinucleótidos adyacentes — información de contexto local que métricas simples como GC3 no contienen.
Eje evolutivo (canales 5-11): ESMC-300M protein language model (EvolutionaryScale, sucesor de ESM-1v). Masked marginal scoring: se enmascara la posición mutada, se mide la log-likelihood ratio entre el aminoácido nativo y el mutante. Captura la presión evolutiva que ha actuado sobre esa posición durante millones de años.
La clave no es que cada eje sea mejor que los competidores por separado — es que los dos ejes son ortogonales. Uno opera a nivel de nucleótido, el otro a nivel de proteína. Juntos ven lo que ninguno ve solo.
Resultados: 42 genes validados
| Gen | Tipo | AUC intra-gen | AUC zero-shot |
|---|---|---|---|
| BRCA1 | Cáncer (mama/ovario) | 0.943 | — (gen de entrenamiento) |
| TP53 | Cáncer (supresor tumoral) | 0.907 | 0.854 |
| PTEN | Cáncer (supresor tumoral) | 0.994 | 0.975 |
| PALB2 | Cáncer (reparación ADN) | 0.950 | 0.954 |
| CFTR | Fibrosis quística (canal ABC) | 0.979 | 0.777 |
| HBB | Anemia falciforme (globina) | 0.721 | 0.707 |
| MECP2 | Síndrome de Rett (IDR) | 0.911 | 0.430 |
| SCN1A | Epilepsia (canal iónico TM) | 0.913 | 0.637 |
Actualización julio 2026: El panel se ha expandido de 8 a 42 genes (12 entrenables + 30 solo zero-shot), con AUC medio zero-shot de 0.876 sobre 41 genes evaluables. El modelo evolutivo se ha migrado de ESM-1v a ESMC-300M (AUC CNN 0.961 en BRCA1). Resultados completos en el informe técnico TECH-2.
El gradiente de transferibilidad
El hallazgo más revelador no son los AUCs absolutos, sino el patrón que emerge al entrenar con BRCA1 y predecir en los demás genes sin reentrenamiento (zero-shot):
Cáncer ~0.9 > Canal ABC ~0.78 > Globina ~0.71 > Membrana TM ~0.64 > IDR ~0.43
Este gradiente no es ruido — refleja la gramática termodinámica de cada familia de proteínas. Las proteínas globulares (BRCA1, TP53, PTEN) tienen perfiles ΔG informativos porque la presión selectiva sobre la estabilidad del mRNA es fuerte. Las proteínas con regiones intrínsecamente desordenadas (MECP2) tienen perfiles ΔG planos — la señal termodinámica es débil porque no hay presión selectiva sobre la física del mRNA.
Esto conecta directamente con la hipótesis E1 del roadmap: el gradiente de transferibilidad podría ser un clasificador funcional de proteínas basado exclusivamente en la física del mRNA.
Arquitectura técnica
La CNN es deliberadamente pequeña (~228K parámetros) para evitar overfitting en datasets genéticos donde las muestras son escasas. Usa CrossEntropyLoss con 2 outputs (no BCEWithLogitsLoss con 1), class weights [1.0, n_neg/n_pos] para datasets desbalanceados, y GradCAM1D para explicabilidad — el modelo señala qué regiones del mRNA contribuyeron a su predicción.
El motor compartido (energy.py) computa los perfiles ΔG nearest-neighbor. Para proteínas de más de 1022 aminoácidos, ESMC-300M necesita windowing.
Competidores y diferenciación
CADD integra múltiples anotaciones genómicas en un solo score. REVEL ensambla 13 predictores. AlphaMissense usa representaciones de AlphaFold2. Todos operan a nivel de proteína.
EnergyFingerprint es el primero en combinar señal termodinámica del mRNA con señal evolutiva de protein language model. La ortogonalidad de los ejes sugiere que la información que aporta es complementaria, no redundante — y eso abre la puerta a ensembles donde EF añade valor a cualquiera de los predictores existentes.