El p-valor es probablemente uno de los conceptos más utilizados y, al mismo tiempo, más malinterpretados en investigación. En este post explicaremos qué es, qué información aporta y cómo debe interpretarse junto con el resto de los resultados de un estudio.
Cuando trabajamos con una muestra (grupo de población), siempre existe una variabilidad debida al azar. Como consecuencia, las diferencias o asociaciones observadas pueden reflejar una característica real de la población o deberse simplemente a esa variabilidad aleatoria.
Ejemplo: Supongamos que queremos saber si participar en un programa de prescripción ocupacional reduce el sentimiento de soledad en personas mayores. Tras comparar a quienes participaron en el programa con quienes no lo hicieron, observamos que los primeros presentan menores niveles de soledad. Sin embargo, como solo hemos estudiado una muestra de la población, no podemos asegurar que esa diferencia se deba realmente al programa. Podría haberse producido por la variabilidad propia del muestreo.
Es aquí donde el p-valor junto con otros indicadores nos ayudará a interpretar los resultados.
Consideraciones previas
Cuando hablamos de un “test de contraste de hipótesis”, nos referimos a la hipótesis nula (H0) y a la alternativa (HA). La HA es la hipótesis de trabajo que queremos contrastar en el estudio: si existe una diferencia, una asociación o un efecto entre las variables estudiadas.
| Por ejemplo: Los programas de prevención de caídas reducen el número de hospitalizaciones en población mayor en comparación con la atención habitual. |
Por el contrario, la H0 se establece de forma opuesta a nuestro interés, postulando la ausencia de diferencia, asociación o efecto.
| Por ejemplo: Los programas de prevención de caídas no reducen el número de hospitalizaciones en población mayor en comparación con la atención habitual. |
Sin embargo, es importante señalar que la comunidad científica de estadística aboga por una interpretación más cautelosa de este elemento, que debe de ser puesto en relación a otros indicadores del estudio, como por ejemplo el intervalo de confianza (Wasserstein & Lazar, 2016).
Imaginemos que estimamos que un programa de terapia ocupacional reduce la puntuación de soledad en 4 puntos. Esa estimación procede de una muestra y, por tanto, está sujeta a incertidumbre. El intervalo de confianza nos indica el rango de valores dentro del cual es razonable pensar que se encuentra el verdadero efecto en la población. Cuanto más estrecho sea el intervalo, mayor será la precisión de la estimación. No se debe confundir con la interpretación de que hay un 95% de probabilidad de que el verdadero valor esté dentro del intervalo.
Interpretación del p-valor
Volviendo al p-valor, este se calculará de forma diferente dependiendo de la medida y el test de contraste a los que acompaña. En 2016, la American Statistical Association (ASA) publicó una declaración histórica para aclarar el uso correcto del p-valor (Wasserstein, & Lazar, 2016). En ella recordó que el p-valor es una herramienta útil, pero que nunca debe interpretarse de forma aislada. La ASA recomienda que los resultados de un estudio se interpreten conjuntamente con el tamaño del efecto, los intervalos de confianza, la calidad metodológica, el diseño del estudio y el contexto científico, evitando basar las conclusiones únicamente en sí un p-valor es menor o mayor que 0,05. En esta declaración se recogieron 6 puntos:
- Los p-valores pueden indicar en qué medida los datos son incompatibles con un modelo estadístico concreto.
- Los p-valores no miden la probabilidad de que la hipótesis estudiada sea cierta, ni la probabilidad de que los datos se hayan generado únicamente por azar.
- Las conclusiones científicas y las decisiones en salud no deben basarse únicamente en sí un p-valor supera un umbral específico.
- Una inferencia adecuada requiere una total transparencia y la presentación completa de los datos con sus estimaciones e incertidumbre mediante los intervalos de confianza.
- Un p-valor no mide la magnitud de un efecto ni la importancia de un resultado.
- El p-valor, por sí solo, no proporciona toda la información necesaria para interpretar los resultados de una investigación.
La interpretación del p-valor depende del nivel de significación alfa (α) o «punto de corte«, que suele establecerse en 0.05 (5%). Este valor representa el riesgo que estamos dispuestos a aceptar ante la conclusión de que existe una diferencia o una asociación cuando, en realidad, no existe. A este error se le conoce como error de tipo I o falso positivo. En base a esto podemos interpretar el p-valor siguiendo los siguientes puntos:
- Si el p-valor es menor de 0.05 (p < 0.05): Significa que los datos son poco compatibles con la hipótesis nula, es decir, que la probabilidad de la diferencia, la asociación o el efecto entre variables debido al azar sea baja. Cuando esto ocurre, decidimos «no creernos» la hipótesis nula (H0) Rechazamos la hipótesis nula y declaramos que el resultado es estadísticamente significativo.
|
Ejemplo: Se compara el número de ingresos hospitalarios durante un año entre personas mayores de 67 años que participaron en un programa de prevención de caídas y personas que recibieron la atención habitual. Las hipótesis serían: ● Hipótesis nula (H₀): No existen diferencias en el número de ingresos hospitalarios entre las personas mayores que participaron en el programa de prevención de caídas y aquellas que recibieron la atención habitual. ● Hipótesis alternativa (H₁): Las personas mayores que participaron en el programa de prevención de caídas presentan un menor número de ingresos hospitalarios que aquellas que recibieron la atención habitual. Tras analizar los datos, se obtuvo un p-valor = 0,03. Como este valor es inferior al nivel de significación previamente establecido (α = 0,05), los resultados son poco compatibles con la hipótesis de que no existen diferencias en el número de ingresos hospitalarios entre ambos grupos. Por tanto, disponemos de evidencia estadística para concluir que existen diferencias entre ellos. |
- Si el p-valor es mayor que 0.05 (p> 0.05): Significa que tus datos son compatibles con la hipótesis nula (H0). Los cambios observados entran dentro de lo esperable por la simple variabilidad aleatoria o el azar. Por lo tanto, no puedes rechazar la H0 (lo que no demuestra que la hipótesis nula sea cierta, sino que no tienes pruebas suficientes para declarar lo contrario).
|
Ejemplo: Se compara el número de ingresos hospitalarios durante un año entre personas mayores de 67 años que participaron en un programa de prevención de caídas y personas que recibieron la atención habitual. Las hipótesis serían: ● Hipótesis nula (H₀): No existen diferencias en el número de ingresos hospitalarios entre las personas mayores que participaron en el programa de prevención de caídas y aquellas que recibieron la atención habitual. ● Hipótesis alternativa (H₁): Las personas mayores que participaron en el programa de prevención de caídas presentan un menor número de ingresos hospitalarios que aquellas que recibieron la atención habitual. Tras analizar los datos, se obtuvo un valor p = 0,18. Como este valor es superior al nivel de significación previamente establecido (α = 0,05), los resultados son compatibles con la hipótesis de que no existen diferencias en el número de ingresos hospitalarios entre las personas mayores que participaron en el programa de prevención de caídas y aquellas que recibieron la atención habitual. Por tanto, no disponemos de evidencia estadística suficiente para rechazar la hipótesis de que no existen diferencias entre ambos grupos. |
¡Cuidado!
Numerosos investigadores han considerado suficiente que el p-valor fuera mayor/menor que su punto de corte para aceptar o rechazar la hipótesis nula. Sin embargo, como indica la ASA, es importante esclarecer el resultado exacto del test de hipótesis, ya que un p-valor= 0.0490 es menor que 0.05 y aun así indica una probabilidad alta de azar en los resultados.
El p-valor no es el único dato relevante en los resultados de un estudio cuantitativo. Este número está en relación con otros elementos que debemos tener en cuenta a la hora de interpretar los resultados (Lee, 2016).
- Como hemos visto anteriormente, los intervalos de confianza proporcionan información sobre la precisión de la estimación y muestran el rango de valores compatibles con los datos observados. Un intervalo estrecho indica una estimación más precisa, mientras que un intervalo amplio refleja una mayor incertidumbre. Además, permiten valorar la relevancia clínica de los resultados y no solo su significación estadística. Tradicionalmente el IC se establece al 90%,95% o 99% según criterio del investigador/a.
- El Tamaño del efecto (Effect Size), mide la magnitud o fuerza de la asociación o cambio. El p-valor puede acompañar a muchas medidas y en cada una se interpreta de manera diferente dependiendo del test estadístico utilizado (Odds Ratio, Razón de prevalencia, Riesgo atribuible, entre otros).
Teniendo estos dos elementos en mente, cuando leemos o analizamos un estudio, no debemos fijarnos únicamente en el p-valor. Es importante comprobar si los autores informan del intervalo de confianza y del tamaño del efecto y, a partir de toda esta información, interpretar correctamente los resultados obtenidos. A pesar de que las principales guías de reporte desarrolladas por la Red EQUATOR recomiendan informar del tamaño del efecto y de sus intervalos de confianza para facilitar una adecuada interpretación de los hallazgos (más detalle en Guías para mejorar la trasparencia y calidad del reporte de artículos científicos), no siempre será posible disponer de esta información, ya que no todos los estudios la incluyen en sus resultados.
Veámoslo con un ejemplo en Terapia Ocupacional. La Tabla 3 corresponde a un estudio transversal publicado por nuestro grupo de investigación (Campos-Sánchez et al., 2023), en el que se analizó la asociación entre la reactividad sensorial y los problemas de alimentación en niños de 3 a 7 años con datos del estudio InProS (https://inteo.umh.es/inpros/). Esta tabla ilustra cómo un mismo análisis estadístico presenta de forma conjunta el tamaño del efecto, sus intervalos de confianza y el p-valor, permitiendo realizar una interpretación mucho más completa de los resultados.
Cada fila muestra la asociación entre un tipo de reactividad sensorial y un problema de alimentación. Para cada asociación se presentan tres datos fundamentales:
- Razón de Prevalencias (RP): representa el tamaño del efecto, es decir, cuánto aumenta (o disminuye) la prevalencia del problema de alimentación en los niños con reactividad sensorial respecto a aquellos sin ella.
- Intervalo de confianza al 95% (IC95%): informa sobre la precisión de esa estimación. Cuanto más estrecho sea el intervalo, mayor será la precisión. Además, cuando el IC95% de una Razón de Prevalencias no incluye el valor 1, la asociación suele considerarse estadísticamente significativa.
- P-valor: indica el grado de compatibilidad de los datos con la hipótesis nula. Habitualmente, un p-valor inferior a 0,05 se interpreta como evidencia estadística suficiente para rechazar la hipótesis de ausencia de asociación.
Tomemos como ejemplo la asociación entre la sensibilidad al gusto/olfato (Taste/smell sensitivity) y los problemas de variedad alimentaria (Food variety problems). La RP es de 1,42, lo que significa que los niños con sensibilidad al gusto/olfato presentan una prevalencia de problemas de variedad alimentaria un 42% mayor que aquellos sin esta alteración. Además, el IC95% (1,31–1,53) no incluye el valor 1, lo que indica que esta estimación es compatible con una asociación positiva, y el p-valor es inferior a 0,001, aportando evidencia estadística frente a la hipótesis nula. Por el contrario, si observamos la asociación entre la sensibilidad táctil (Tactile sensitivity) y los problemas de textura, encontramos una RP de 1,04, un IC95% de 0,95–1,11 y un valor p = 0,334. En este caso, el intervalo de confianza incluye el valor 1 y el p-valor es superior a 0,05, por lo que no disponemos de evidencia estadística suficiente para concluir que exista una asociación entre ambas variables.
Preguntas que podrían surgir al leer un estudio
¿Significa esto que si mi p-valor es mayor a 0,05 mis resultados no son relevantes ya que se deben meramente al azar?
No, muchos autores se han dedicado durante décadas a estudiar, analizar y criticar esta idea, así como indicar los errores que se llevan cometiendo respecto a este valor (Greenland et al., 2016). Además, aspectos como el tamaño del efecto o los intervalos de confianza también son relevantes.
¿Si el p-valor es menor o igual a 0,05 significa que debo rechazar la hipótesis nula y confirmar que hay una relación entre mis variables?
No, el p-valor señala que es estadísticamente significativo el resultado de relación entre variables, pero “estadísticamente significativo” no significa “clínicamente significativo”.
¿Qué entendemos por estadísticamente significativo?
Lo que realmente significa es que es improbable que la diferencia o relación observada en los datos se deba a una simple casualidad o al azar. Pero tal y como hemos comentado con anterioridad hay que tener en cuenta otros datos como los intervalos de confianza y el tamaño del efecto.
¿Ofrece el estudio que estoy leyendo estos datos?
Muchos estudios publicados no ofrecen datos referentes al tamaño del efecto o al intervalo de confianza, esto dificulta la comprensión de los hallazgos.
¿Cómo reportar los resultados del p-valor de mi estudio correctamente?
Los mismos aspectos que debemos tener en cuenta para interpretar un p-valor son también fundamentales a la hora de comunicar los resultados de un estudio. Un buen reporte facilita que otros investigadores y profesionales comprendan e interpreten correctamente los hallazgos. Para ello, es recomendable seguir estas pautas:
- Indicar el análisis estadístico realizado. Especifica qué prueba estadística o modelo se ha utilizado (por ejemplo, prueba t de Student, chi-cuadrado, regresión lineal o regresión de Poisson) y a qué estimación o medida hace referencia el valor p.
- Informar el p-valor exacto siempre que sea posible. Se recomienda reportar el p-valor exacto (por ejemplo, p = 0,032) y evitar expresiones poco informativas como «NS», «p > 0,05″ o «p < 0,05″. La única excepción son los valores muy pequeños, que habitualmente se presentan como p < 0,001.
- Acompañar el p-valor del tamaño del efecto y de su intervalo de confianza. El p-valor indica la evidencia estadística frente a la hipótesis nula, pero no informa sobre la magnitud del efecto ni sobre la precisión de la estimación. Por ello, siempre que sea posible, debe presentarse junto con el tamaño del efecto (por ejemplo, diferencia de medias, riesgo relativo o correlación) y su correspondiente intervalo de confianza.
En definitiva, un buen reporte no consiste únicamente en indicar si un resultado es estadísticamente significativo, sino en proporcionar toda la información necesaria para que el lector pueda valorar la magnitud, la precisión y la relevancia de los resultados. De esta forma, se favorece una interpretación más rigurosa, transparente y útil de la evidencia científica.
Esperamos que esta entrada te haya resultado útil para comprender mejor qué es el valor p y cómo interpretarlo correctamente.
Si te ha surgido alguna duda o tienes alguna sugerencia, estaremos encantadas de leerte en .
Referencias
González-Marrón A, Real J, Forné C, Roso-Llorach A, Navarrete-Muñoz EM, Martínez-Sánchez JM. Confidence interval reporting for measures of association in multivariable regression models in observational studies. Med Clin (Barc). 27;153(6):239-242. https://doi.org/10.1016/j.medcli.2018.06.018.
Greenland, S., Senn, S. J., Rothman, K. J., Carlin, J. B., Poole, C., Goodman, S. N., & Altman, D. G. (2016). Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations. European Journal of Epidemiology, 31(4), 337–350. https://doi.org/10.1007/s10654-016-0149-3
Lee, D. K. (2016). Alternatives to P value: confidence interval and effect size. Korean Journal of Anesthesiology, 69(6), 555–562. https://doi.org/10.4097/kjae.2016.69.6.555
Wasserstein, R. L., & Lazar, N. A. (2016). The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician, 70(2), 129–133. https://doi.org/10.1080/00031305.2016.1154108
Campos-Sánchez, I., Muñoz-Sánchez, R., Navarrete-Muñoz, E.-M., Molina-Iñigo, M. S., Hurtado-Pomares, M., Fernández-Pires, P., Sánchez-Pérez, A., Prieto-Botella, D., Juárez-Leal, I., Peral-Gómez, P., Espinosa-Sempere, C., & Valera-Gran, D. (2023). Association between sensory reactivity and feeding problems in school-aged children: InProS Study. Appetite, 107108. https://doi.org/10.1016/j.appet.2023.107108

Sandra Sánchez
Terapeuta ocupacional. Creadora de contenidos sobre terapia ocupacional en redes sociales (@elretodelato). Miembro de la Junta directiva de ROTOS Foundation como Líder de Comunicación. Máster en Investigación con especialización en Terapia Ocupacional de la Universidad de Jönköping.Contratada en InTeO.

