Métodos y exactitud

Qué fórmula, qué variante y cómo sabemos que es correcta. Escrito para docentes, revisores y cualquiera que compare un resultado con SPSS, R, JASP o jamovi.

Actualizado: 6 de octubre de 2026

Cómo se verifica el motor

ExplainStats es un complemento de Google Sheets, pero su motor estadístico es JavaScript puro que también se ejecuta fuera de Google Sheets. Eso nos permite compararlo, de forma automática, con implementaciones de referencia sobre cientos de conjuntos de datos aleatorios. Cada compilación ejecuta estas comparaciones; una versión solo se publica cuando todas se superan.

Script de comparaciónQué verificaReferenciaVerificaciones
NúcleoFunciones de distribución (t, F, χ²: colas e inversas), estadística descriptiva, histograma, matriz de correlación de Pearson, pruebas t (tres tipos, con el intervalo de confianza de la diferencia y la d de Cohen), prueba F, ANOVA de un factor, regresión lineal con residuos, prueba de chi-cuadrado y corrección de YatesSciPy, statsmodels912
AvanzadoShapiro-Wilk, Levene y Brown-Forsythe, Mann-Whitney (exacta y normal, con y sin empates), Wilcoxon de rangos con signo, Kruskal-Wallis, Spearman, prueba exacta de Fisher, distribución del rango estudentizado, Tukey HSD, Games-Howell, ANOVA de dos factores con y sin replicación, prueba z, covarianza, alfa de Cronbach, rango y percentilSciPy, statsmodels, referencias calculadas a mano431
ANOVA de Welch y FriedmanF de Welch, grados de libertad y valor p; χ² de Friedmanstatsmodels, SciPy22
Herramientas ProDistribución t no central, tamaño muestral y potencia (pruebas t, dos proporciones, correlación), prueba A/B, gráficos de control (I-MR, X-barra/R), media móvil, suavizado exponencial, momentos de los números aleatoriosSciPy, statsmodels50
TotalTolerancia: relativa de 10-8 en los estadísticos y de 10-7 en los valores p (más estricta que cualquier salida impresa)1415

Además, 248 escenarios de extremo a extremo ejecutan el complemento completo contra una hoja de cálculo simulada en los cuatro idiomas (cada herramienta, el modo examen, las hojas de pasos, los mensajes de error), y un revisor independiente volvió a derivar a mano los resultados de Welch, ANOVA, Tukey, Games-Howell, Shapiro-Wilk, Levene, Mann-Whitney y Kruskal-Wallis frente a SciPy 1.17 y statsmodels 0.15, con una concordancia mejor que 10-9.

¿Ha encontrado una discrepancia? Escriba a [email protected] con un ejemplo pequeño. Un error confirmado se corrige en un plazo de siete días y se indica en esta página.

Variantes y convenciones, prueba por prueba

Cada software toma decisiones por defecto distintas. Estas son las nuestras, para que pueda explicar por qué un número difiere del de otro programa.

PruebaQué calcula ExplainStatsIgual que
Estadística descriptivaVarianza y desviación estándar muestrales (n − 1). Asimetría y curtosis con las fórmulas ajustadas por muestra de Excel (SKEW, KURT, curtosis en exceso). Cuartiles por interpolación lineal entre estadísticos de orden (QUARTILE.INC, tipo 7 de R). Valores atípicos: más allá de 1,5 × RIC (rango intercuartílico) desde los cuartiles. Intervalo de confianza de la media con la distribución t.Excel, Google Sheets, R (tipo 7)
Pruebas tPareada, varianzas iguales (combinada) y Welch (varianzas desiguales, grados de libertad de Welch–Satterthwaite). Valor p bilateral; también se muestra el unilateral. Intervalo de confianza de la diferencia: diferencia ± tα/2, gl × EE, con el mismo EE que la prueba. El Asistente usa Welch por defecto, como se recomienda desde Delacre et al. (2017).SciPy ttest_ind, ttest_rel; R t.test
d de CohenVarianzas iguales: desviación estándar combinada. Welch: promedio de las dos varianzas, √((s₁² + s₂²)/2). Pareada: dz = media de las diferencias ÷ desviación estándar de las diferencias. La tabla indica la variante. Umbrales: 0,2 pequeño, 0,5 mediano, 0,8 grande (Cohen, 1988). Sin corrección de Hedges.JASP (d y dz), G*Power
ANOVA de un factorF clásica con η² (SCentre/SCtotal). Tukey HSD usa la distribución del rango estudentizado calculada con el algoritmo de Copenhaver y Holland (el de ptukey en R), en la forma de Tukey–Kramer para grupos de tamaños desiguales.SciPy f_oneway, statsmodels pairwise_tukeyhsd, R TukeyHSD
ANOVA de WelchF de Welch con sus grados de libertad aproximados; pruebas post hoc de Games-Howell con grados de libertad de Welch para cada par.statsmodels anova_oneway(use_var="unequal"), R oneway.test
ANOVA de dos factoresSolo diseños balanceados (el mismo número de filas por muestra); en ese caso, sumas de cuadrados de tipo I = tipo III, como en las Herramientas para análisis (Analysis ToolPak).statsmodels OLS/ANOVA, Excel
NormalidadW de Shapiro-Wilk con el algoritmo de Royston de 1995 (AS R94), 3 ≤ n ≤ 5000, más un gráfico Q-Q. En el Asistente, un grupo que no supera la prueba pero tiene n ≥ 30 se analiza igualmente con una prueba paramétrica, y el informe lo indica de forma explícita.SciPy shapiro, R shapiro.test
Igualdad de varianzasLevene (centro = media) y Brown-Forsythe (centro = mediana). El Asistente usa Brown-Forsythe.SciPy levene
U de Mann-WhitneyDistribución exacta cuando no hay empates y un grupo tiene 8 valores o menos; en caso contrario, aproximación normal con corrección por empates y corrección de continuidad (0,5). Bilateral.Valores por defecto de SciPy mannwhitneyu
Wilcoxon de rangos con signoSe descartan las diferencias nulas. Distribución exacta cuando no hay empates y n ≤ 50; en caso contrario, aproximación normal con correcciones por empates y de continuidad.SciPy wilcoxon (zero_method="wilcox")
Kruskal-WallisH con corrección por empates; cuando es significativa, pruebas de Mann-Whitney por pares con corrección de Bonferroni (no la prueba de Dunn; la tabla indica cuál).SciPy kruskal
FriedmanEstadístico χ² con corrección por empates, k − 1 grados de libertad.SciPy friedmanchisquare
Correlaciónr de Pearson y ρ de Spearman (Pearson sobre los rangos promedio); valor p a partir de t = r √((n − 2)/(1 − r²)) con n − 2 grados de libertad, bilateral.SciPy pearsonr, spearmanr
RegresiónMínimos cuadrados ordinarios por descomposición QR (estable con predictores correlacionados), hasta 16 predictores; R², R² ajustado, error estándar, tabla ANOVA, coeficientes con t, p e intervalos de confianza, residuos. Misma disposición de la tabla que en las Herramientas para análisis (Analysis ToolPak).statsmodels OLS, Excel
Chi-cuadradoχ² de independencia de Pearson sin corrección, V de Cramér, aviso cuando las frecuencias esperadas son inferiores a 5. Para tablas 2 × 2, la tabla también da χ² y p con la corrección de continuidad de Yates (|O − E| reducido en 0,5, nunca por debajo de 0), el valor por defecto de R y la fila «Corrección de continuidad» de SPSS.SciPy chi2_contingency (correction=False / True)
Prueba exacta de FisherSolo 2 × 2; valor p bilateral como suma de las probabilidades de todas las tablas como máximo tan probables como la observada (la convención de R); odds ratio (razón de momios).R fisher.test
Alfa de CronbachSolo filas completas; alfa y «alfa si se elimina el elemento»; umbrales: 0,7 aceptable, 0,8 bueno, 0,9 excelente.Fórmula estándar
Prueba A/BPrueba z de dos proporciones con error estándar combinado, bilateral; diferencia con su intervalo de confianza; tamaño muestral necesario para el incremento observado.statsmodels proportions_ztest
Tamaño muestral y potenciaPruebas t mediante la distribución t no central (exacta), dos proporciones mediante la h de Cohen, correlación mediante la z de Fisher.Clases de potencia de statsmodels, G*Power
Gráficos de controlI-MR (constantes 2,66 y 3,267), X-barra/R con las constantes habituales A₂, D₃, D₄ (subgrupos de 2 a 10), gráfico p con límites normales.Montgomery, Statistical Quality Control

Cosas que conviene saber antes de comparar con otro software

  • Gráfico de cuartiles, no un diagrama de caja completo. Google Sheets no tiene un diagrama de caja nativo. ExplainStats dibuja un gráfico de velas cuya caja va de Q1 a Q3 y cuyas líneas van del valor más pequeño al más grande dentro de los límites de 1,5 × RIC. No dibuja la línea de la mediana ni los puntos atípicos; ambos figuran en la tabla de resultados.
  • Redondeo. Las tablas conservan la precisión completa (mostrada con 4 decimales); la interpretación y la línea APA redondean a 2 o 3 decimales, y los valores p inferiores a 0,001 se escriben «p < .001».
  • Pruebas exactas. El cambio entre métodos exactos y aproximados (Mann-Whitney, Wilcoxon) sigue los valores por defecto de SciPy, que difieren de los de SPSS (asintótico salvo que se pida el exacto) y de los de R (exacto por debajo de 50 sin empates). La fila «Método» de cada tabla indica cuál se usó.
  • Welch por defecto. El Asistente recomienda la prueba t de Welch incluso cuando las varianzas parecen iguales, porque pierde muy poco cuando lo son y le protege cuando no lo son. La prueba t de Student clásica sigue disponible como herramienta.
  • Nada se simula. Sin bootstrap ni Monte Carlo: cada valor p se calcula a partir de la distribución, de modo que ejecutar una prueba dos veces da el mismo número. Solo las herramientas de números aleatorios y de muestreo usan un generador aleatorio (con semilla configurable).

Reproducir las verificaciones

Los scripts de comparación son archivos de Python que cargan el motor del complemento con Node.js, generan conjuntos de datos aleatorios, ejecutan SciPy y statsmodels sobre los mismos datos y comparan cada número. Si enseña estadística y le gustaría ejecutarlos, o añadir un caso que importe para su curso, escriba a [email protected].