Replicación: por qué otra persona tiene que obtener lo mismo
La replicación es el paso en que un resultado deja de ser la afirmación de un grupo y pasa a ser algo que el campo sabe. Es también el paso que más se omite, porque confirmar el hallazgo de otro se premia menos que producir uno nuevo, y esa es la causa estructural de casi todo lo que se llama crisis de replicación.
Tres palabras que no son sinónimos
Reproducir significa tomar los datos originales y el análisis original y volver a obtener las cifras originales. Pone a prueba si el cálculo se hizo bien y si su descripción era completa. No puede poner a prueba la medición, porque los datos son los mismos datos, y cualquier error en cómo se recogieron se conserva exactamente.
Replicar significa hacer la medición de nuevo, recoger datos nuevos, normalmente con otro aparato y otro equipo. Esto pone a prueba la medición, porque un error propio de un instrumento, un laboratorio o un conjunto de condiciones no reaparece en otro distinto. Es el paso que convierte un resultado en conocimiento.
La repetición - el mismo grupo haciendo lo mismo otra vez con el mismo equipo - queda en medio y es la más débil de las tres. Pone a prueba la estabilidad y poco más. Un error sistemático se reproduce impecablemente bajo repetición, y precisamente por eso la consistencia interna no es prueba de corrección y un resultado repetido cien veces por sus autores no queda con ello confirmado.
La distinción tiene un filo práctico al leer cualquier afirmación de confirmación. Que una medición se repitió muchas veces dice casi nada sobre si es correcta. Que otro grupo, con otro método, obtuvo una respuesta compatible dice muchísimo. Las dos frases se pronuncian a menudo en el mismo tono y tienen un peso completamente distinto.
Qué mostró la crisis de replicación
En 2015 una gran colaboración intentó repetir 100 experimentos de psicología publicados usando los materiales originales y, donde fue posible, con la participación de los autores originales. Alrededor de un tercio produjo un efecto estadísticamente significativo en la misma dirección, y el tamaño medio del efecto en las replicaciones fue cerca de la mitad del original. Esfuerzos comparables en biología del cáncer y economía experimental dieron resultados de orden parecido.
Las causas son sobre todo estructurales y no deshonestas. La publicación favorece los hallazgos positivos, novedosos y sorprendentes, así que una literatura compuesta de artículos aceptados sobrerrepresenta los efectos que salieron grandes por casualidad. Las muestras pequeñas hacen que un tamaño de efecto publicado sea una sobreestimación incluso cuando el efecto es real. Las decisiones de análisis flexibles permiten encontrar un resultado en datos donde no hay ninguno. Y casi nadie recibe financiación o reconocimiento por comprobar.
El término crisis se discute por una razón razonable: descubrir que un tercio de los resultados se replica es en sí mismo un hallazgo científico, y lo produjo el campo examinándose a sí mismo. La respuesta ha reconfigurado la práctica: registro previo, planes de análisis publicados, muestras mayores, informes de replicación registrados, y compartir datos y código como condición de publicación. Son los mismos instrumentos a los que la física llegó mediante el análisis ciego, aplicados a otro problema.
La física no está exenta, y su ventaja es estructural y no moral. Las grandes colaboraciones con revisión interna, cegado como práctica estándar y un umbral de cinco sigmas hacen más difícil equivocarse en un resultado publicado de física de partículas, pero esa maquinaria es cara y solo existe en campos organizados alrededor de grandes instrumentos compartidos. Una medición física pequeña hecha por un grupo con su propio aparato está expuesta exactamente a los mismos modos de fallo que un experimento pequeño de psicología.
Por qué la independencia es el principio activo
Dos experimentos que comparten una hipótesis, una fuente de calibración, un paquete de simulación o un componente clave no son del todo independientes, y su concordancia es una evidencia más débil de lo que parece. El valor de una replicación crece con el número de cosas que son distintas en ella, porque cada elemento compartido es un canal por el que un error común puede pasar sin detectarse a ambos resultados.
La forma más fuerte es la confirmación por un método físico distinto. El problema de los neutrinos solares es el ejemplo más claro en el ámbito de esta biblioteca. Raymond Davis midió desde los años sesenta un déficit de neutrinos solares con un método radioquímico - contando átomos de argón producidos en un tanque de líquido de limpieza - y encontró cerca de un tercio de la tasa esperada. Durante décadas la explicación más económica fue que algo iba mal en su experimento o en el modelo del Sol.
Lo que lo zanjó fue la concordancia de técnicas distintas. Kamiokande vio el déficit mediante detección Cherenkov en agua, un proceso físico completamente distinto con sistemáticos completamente distintos. Borexino midió componentes individuales del espectro con un centelleador líquido. Decisivamente, el Observatorio de Neutrinos de Sudbury usó agua pesada para medir tanto el flujo de neutrinos electrónicos como el flujo total de todos los sabores, y encontró que el total coincidía con el modelo solar mientras la componente electrónica no. Los neutrinos no habían desaparecido: habían cambiado de sabor.
Esa conclusión es hoy física de libro de texto, y es instructivo que ningún experimento aislado la estableciera. Cada uno por separado quedaba expuesto a la objeción de que su método particular fallaba. La combinación no, porque los métodos no tenían nada en común salvo la magnitud que medían, y el resultado derribó la predicción del Modelo Estándar de que los neutrinos no tienen masa.
Cuando la replicación falla rápido
En marzo de 1989 dos químicos anunciaron que habían producido calor en exceso a partir de deuterio en un electrodo de paladio a temperatura ambiente. La afirmación era extraordinaria, el aparato estaba descrito, y laboratorios de todo el mundo lo intentaron en semanas. La gran mayoría no encontró calor en exceso, los pocos informes positivos no sobrevivieron al escrutinio, y el veredicto mayoritario se alcanzó en meses.
En 2023 un preprint afirmó un superconductor a temperatura y presión ambiente llamado LK-99, con receta de síntesis publicada. Grupos de todo el mundo hicieron muestras en días. La caída de resistividad se rastreó hasta una impureza de sulfuro de cobre que sufre una transición estructural, y la aparente levitación hasta ferromagnetismo en una muestra no homogénea. La cuestión quedó cerrada en unas cuatro semanas.
Los dos episodios se cuentan normalmente como advertencias, y se leen mejor como el sistema funcionando a gran velocidad. En ambos casos una afirmación concreta y falsable, con método publicado, fue puesta a prueba por muchos grupos independientes y resuelta rápido. Lo que hizo posible la resolución rápida fue que la afirmación era lo bastante concreta para intentarla: la receta, las condiciones y la medición estaban todas declaradas.
Esa es la diferencia práctica entre una afirmación que puede zanjarse y una que no. Un resultado acompañado de un aparato descrito, condiciones declaradas, una magnitud medida y un presupuesto de error invita a la replicación y la recibe. Una afirmación sin esos elementos no puede replicarse ni siquiera por quienes querrían confirmarla, y por tanto se queda indefinidamente en el mismo sitio: ni confirmada ni refutada, que es un lugar mucho más débil que refutada.
Preguntas frecuentes
Qué diferencia hay entre reproducción y replicación?
La reproducción repite el análisis original sobre los datos originales y pone a prueba si el cálculo y su descripción eran correctos. La replicación recoge datos nuevos, normalmente con otro aparato y otro equipo, y pone a prueba la medición misma. Solo la replicación puede capturar un error en cómo se recogieron los datos.
Qué encontró el proyecto de replicación en psicología de 2015?
De 100 experimentos publicados repetidos con los materiales originales, alrededor de un tercio produjo un efecto estadísticamente significativo en la misma dirección, y el tamaño medio del efecto en las replicaciones fue cerca de la mitad del original. Esfuerzos comparables en biología del cáncer y economía experimental dieron resultados de orden parecido.
Por qué importa tanto la independencia?
Porque cada elemento que dos experimentos comparten - una hipótesis, una fuente de calibración, un paquete de simulación, un componente - es un canal por el que un error común pasa sin detectarse a ambos. El valor de una replicación crece con cuánto es distinto en ella, y la confirmación por un método físico distinto es la forma más fuerte.
Cómo se zanjó el problema de los neutrinos solares?
Por la convergencia de técnicas distintas. Un método radioquímico encontró cerca de un tercio de la tasa esperada, la detección Cherenkov en agua confirmó el déficit, un centelleador líquido midió componentes espectrales individuales, y el Observatorio de Sudbury midió tanto el flujo de neutrinos electrónicos como el total de todos los sabores, hallando que el total coincidía con el modelo solar. Los neutrinos habían cambiado de sabor.
Qué tienen en común la fusión fría y el LK-99?
Ambas fueron afirmaciones concretas y falsables publicadas con método suficiente para que otros lo intentaran. Laboratorios de todo el mundo probaron en días o semanas, y ambas se resolvieron rápido: la fusión fría en meses, el LK-99 en unas cuatro semanas, donde los efectos se rastrearon hasta una impureza de sulfuro de cobre y hasta ferromagnetismo en una muestra no homogénea.