La pregunta que dejó abierta el Paper 1
El primer trabajo demostró que una CNN clasifica variantes sinónimas usando solo la termodinámica del mRNA (AUC 0.683), sin señal evolutiva. Buen resultado — pero dejó una pregunta incómoda: ¿qué aprende exactamente esa red? Una caja negra que acierta no explica nada, y en un contexto clínico eso es un problema.
La respuesta resultó ser más simple —y más útil— de lo esperado: la red no aprende una gramática oculta insondable. Aprende a agregar dos números físicos.
Los dos observables
- σ — ΔΔG de apilamiento con signo (Turner): cuánto desestabiliza la variante el apilamiento nearest-neighbor del mRNA en su vecindad local (±10 nt). Con signo: la dirección (desestabilización) importa, no solo la magnitud.
- Sesgo G>A: la transición G→A, enriquecida 2.60× en patogénicas por la restricción CpG.
Una regresión logística de esas dos variables —sin red profunda, sin GPU, inferencia solo con numpy— alcanza:
Dos observables físicos interpretables reproducen a la red profunda dedicada — y generalizan a genes que nunca vieron. La caja negra no era necesaria.
La física correcta: apilamiento, no emparejamiento
Un resultado negativo igual de importante: probamos si la señal vivía en la estructura secundaria del mRNA (probabilidad de emparejamiento de bases, vía ViennaRNA). No. La BPPM resultó nula para patogenicidad, tanto en missense como en sinónimas. El portador de la señal es el campo de energía de apilamiento (ΔG nearest-neighbor, parámetros Turner de RNA) — otra dimensión distinta. Eso fijó el observable correcto y el parámetro por defecto del motor.
La señal se agudiza con la calidad de la etiqueta
La prueba de que esto es biología y no un artefacto de cómo se recolecta ClinVar: el modelo es más predictivo donde las etiquetas son más fiables. En variantes de alta confianza (≥2★, panel de expertos) el σ+G>A sube a AUC 0.712; en las de baja confianza cae a 0.574. Un feature de sesgo de recolección haría lo contrario.
De la ciencia al producto
Que un modelo de 2 variables iguale a la red profunda no es solo elegante — es desplegable. Sin GPU, sin API, sin que los datos salgan de tu equipo, y con una predicción auditable variante a variante (ves la contribución de cada observable). Es el argumento glass-box que un laboratorio clínico y un regulador quieren.
Así que lo empaquetamos como producto real y gratuito:
# puntúa una variante sinónima desde tu terminal
pip install ef-synonymous
ef-syn score --transcript ENST00000399655 --hgvs c.213G>A
Y una herramienta web glass-box que corre entera en el navegador: pegas un CDS (o buscas un gen en Ensembl), metes la variante, y ves el score, la descomposición, el perfil ΔG y un informe exportable (JSON o PDF). Cero registro, cero servidor.