Métodos y exactitud
Qué fórmula, qué variante y cómo sabemos que es correcta. Escrito para docentes, revisores y cualquiera que compare un resultado con SPSS, R, JASP o jamovi.
Cómo se verifica el motor
ExplainStats es un complemento de Google Sheets, pero su motor estadístico es JavaScript puro que también se ejecuta fuera de Google Sheets. Eso nos permite compararlo, de forma automática, con implementaciones de referencia sobre cientos de conjuntos de datos aleatorios. Cada compilación ejecuta estas comparaciones; una versión solo se publica cuando todas se superan.
| Script de comparación | Qué verifica | Referencia | Verificaciones |
|---|---|---|---|
| Núcleo | Funciones de distribución (t, F, χ²: colas e inversas), estadística descriptiva, histograma, matriz de correlación de Pearson, pruebas t (tres tipos, con el intervalo de confianza de la diferencia y la d de Cohen), prueba F, ANOVA de un factor, regresión lineal con residuos, prueba de chi-cuadrado y corrección de Yates | SciPy, statsmodels | 912 |
| Avanzado | Shapiro-Wilk, Levene y Brown-Forsythe, Mann-Whitney (exacta y normal, con y sin empates), Wilcoxon de rangos con signo, Kruskal-Wallis, Spearman, prueba exacta de Fisher, distribución del rango estudentizado, Tukey HSD, Games-Howell, ANOVA de dos factores con y sin replicación, prueba z, covarianza, alfa de Cronbach, rango y percentil | SciPy, statsmodels, referencias calculadas a mano | 431 |
| ANOVA de Welch y Friedman | F de Welch, grados de libertad y valor p; χ² de Friedman | statsmodels, SciPy | 22 |
| Herramientas Pro | Distribución t no central, tamaño muestral y potencia (pruebas t, dos proporciones, correlación), prueba A/B, gráficos de control (I-MR, X-barra/R), media móvil, suavizado exponencial, momentos de los números aleatorios | SciPy, statsmodels | 50 |
| Total | Tolerancia: relativa de 10-8 en los estadísticos y de 10-7 en los valores p (más estricta que cualquier salida impresa) | 1415 | |
Además, 248 escenarios de extremo a extremo ejecutan el complemento completo contra una hoja de cálculo simulada en los cuatro idiomas (cada herramienta, el modo examen, las hojas de pasos, los mensajes de error), y un revisor independiente volvió a derivar a mano los resultados de Welch, ANOVA, Tukey, Games-Howell, Shapiro-Wilk, Levene, Mann-Whitney y Kruskal-Wallis frente a SciPy 1.17 y statsmodels 0.15, con una concordancia mejor que 10-9.
¿Ha encontrado una discrepancia? Escriba a [email protected] con un ejemplo pequeño. Un error confirmado se corrige en un plazo de siete días y se indica en esta página.
Variantes y convenciones, prueba por prueba
Cada software toma decisiones por defecto distintas. Estas son las nuestras, para que pueda explicar por qué un número difiere del de otro programa.
| Prueba | Qué calcula ExplainStats | Igual que |
|---|---|---|
| Estadística descriptiva | Varianza y desviación estándar muestrales (n − 1). Asimetría y curtosis con las fórmulas ajustadas por muestra de Excel (SKEW, KURT, curtosis en exceso). Cuartiles por interpolación lineal entre estadísticos de orden (QUARTILE.INC, tipo 7 de R). Valores atípicos: más allá de 1,5 × RIC (rango intercuartílico) desde los cuartiles. Intervalo de confianza de la media con la distribución t. | Excel, Google Sheets, R (tipo 7) |
| Pruebas t | Pareada, varianzas iguales (combinada) y Welch (varianzas desiguales, grados de libertad de Welch–Satterthwaite). Valor p bilateral; también se muestra el unilateral. Intervalo de confianza de la diferencia: diferencia ± tα/2, gl × EE, con el mismo EE que la prueba. El Asistente usa Welch por defecto, como se recomienda desde Delacre et al. (2017). | SciPy ttest_ind, ttest_rel; R t.test |
| d de Cohen | Varianzas iguales: desviación estándar combinada. Welch: promedio de las dos varianzas, √((s₁² + s₂²)/2). Pareada: dz = media de las diferencias ÷ desviación estándar de las diferencias. La tabla indica la variante. Umbrales: 0,2 pequeño, 0,5 mediano, 0,8 grande (Cohen, 1988). Sin corrección de Hedges. | JASP (d y dz), G*Power |
| ANOVA de un factor | F clásica con η² (SCentre/SCtotal). Tukey HSD usa la distribución del rango estudentizado calculada con el algoritmo de Copenhaver y Holland (el de ptukey en R), en la forma de Tukey–Kramer para grupos de tamaños desiguales. | SciPy f_oneway, statsmodels pairwise_tukeyhsd, R TukeyHSD |
| ANOVA de Welch | F de Welch con sus grados de libertad aproximados; pruebas post hoc de Games-Howell con grados de libertad de Welch para cada par. | statsmodels anova_oneway(use_var="unequal"), R oneway.test |
| ANOVA de dos factores | Solo diseños balanceados (el mismo número de filas por muestra); en ese caso, sumas de cuadrados de tipo I = tipo III, como en las Herramientas para análisis (Analysis ToolPak). | statsmodels OLS/ANOVA, Excel |
| Normalidad | W de Shapiro-Wilk con el algoritmo de Royston de 1995 (AS R94), 3 ≤ n ≤ 5000, más un gráfico Q-Q. En el Asistente, un grupo que no supera la prueba pero tiene n ≥ 30 se analiza igualmente con una prueba paramétrica, y el informe lo indica de forma explícita. | SciPy shapiro, R shapiro.test |
| Igualdad de varianzas | Levene (centro = media) y Brown-Forsythe (centro = mediana). El Asistente usa Brown-Forsythe. | SciPy levene |
| U de Mann-Whitney | Distribución exacta cuando no hay empates y un grupo tiene 8 valores o menos; en caso contrario, aproximación normal con corrección por empates y corrección de continuidad (0,5). Bilateral. | Valores por defecto de SciPy mannwhitneyu |
| Wilcoxon de rangos con signo | Se descartan las diferencias nulas. Distribución exacta cuando no hay empates y n ≤ 50; en caso contrario, aproximación normal con correcciones por empates y de continuidad. | SciPy wilcoxon (zero_method="wilcox") |
| Kruskal-Wallis | H con corrección por empates; cuando es significativa, pruebas de Mann-Whitney por pares con corrección de Bonferroni (no la prueba de Dunn; la tabla indica cuál). | SciPy kruskal |
| Friedman | Estadístico χ² con corrección por empates, k − 1 grados de libertad. | SciPy friedmanchisquare |
| Correlación | r de Pearson y ρ de Spearman (Pearson sobre los rangos promedio); valor p a partir de t = r √((n − 2)/(1 − r²)) con n − 2 grados de libertad, bilateral. | SciPy pearsonr, spearmanr |
| Regresión | Mínimos cuadrados ordinarios por descomposición QR (estable con predictores correlacionados), hasta 16 predictores; R², R² ajustado, error estándar, tabla ANOVA, coeficientes con t, p e intervalos de confianza, residuos. Misma disposición de la tabla que en las Herramientas para análisis (Analysis ToolPak). | statsmodels OLS, Excel |
| Chi-cuadrado | χ² de independencia de Pearson sin corrección, V de Cramér, aviso cuando las frecuencias esperadas son inferiores a 5. Para tablas 2 × 2, la tabla también da χ² y p con la corrección de continuidad de Yates (|O − E| reducido en 0,5, nunca por debajo de 0), el valor por defecto de R y la fila «Corrección de continuidad» de SPSS. | SciPy chi2_contingency (correction=False / True) |
| Prueba exacta de Fisher | Solo 2 × 2; valor p bilateral como suma de las probabilidades de todas las tablas como máximo tan probables como la observada (la convención de R); odds ratio (razón de momios). | R fisher.test |
| Alfa de Cronbach | Solo filas completas; alfa y «alfa si se elimina el elemento»; umbrales: 0,7 aceptable, 0,8 bueno, 0,9 excelente. | Fórmula estándar |
| Prueba A/B | Prueba z de dos proporciones con error estándar combinado, bilateral; diferencia con su intervalo de confianza; tamaño muestral necesario para el incremento observado. | statsmodels proportions_ztest |
| Tamaño muestral y potencia | Pruebas t mediante la distribución t no central (exacta), dos proporciones mediante la h de Cohen, correlación mediante la z de Fisher. | Clases de potencia de statsmodels, G*Power |
| Gráficos de control | I-MR (constantes 2,66 y 3,267), X-barra/R con las constantes habituales A₂, D₃, D₄ (subgrupos de 2 a 10), gráfico p con límites normales. | Montgomery, Statistical Quality Control |
Cosas que conviene saber antes de comparar con otro software
- Gráfico de cuartiles, no un diagrama de caja completo. Google Sheets no tiene un diagrama de caja nativo. ExplainStats dibuja un gráfico de velas cuya caja va de Q1 a Q3 y cuyas líneas van del valor más pequeño al más grande dentro de los límites de 1,5 × RIC. No dibuja la línea de la mediana ni los puntos atípicos; ambos figuran en la tabla de resultados.
- Redondeo. Las tablas conservan la precisión completa (mostrada con 4 decimales); la interpretación y la línea APA redondean a 2 o 3 decimales, y los valores p inferiores a 0,001 se escriben «p < .001».
- Pruebas exactas. El cambio entre métodos exactos y aproximados (Mann-Whitney, Wilcoxon) sigue los valores por defecto de SciPy, que difieren de los de SPSS (asintótico salvo que se pida el exacto) y de los de R (exacto por debajo de 50 sin empates). La fila «Método» de cada tabla indica cuál se usó.
- Welch por defecto. El Asistente recomienda la prueba t de Welch incluso cuando las varianzas parecen iguales, porque pierde muy poco cuando lo son y le protege cuando no lo son. La prueba t de Student clásica sigue disponible como herramienta.
- Nada se simula. Sin bootstrap ni Monte Carlo: cada valor p se calcula a partir de la distribución, de modo que ejecutar una prueba dos veces da el mismo número. Solo las herramientas de números aleatorios y de muestreo usan un generador aleatorio (con semilla configurable).
Reproducir las verificaciones
Los scripts de comparación son archivos de Python que cargan el motor del complemento con Node.js, generan conjuntos de datos aleatorios, ejecutan SciPy y statsmodels sobre los mismos datos y comparan cada número. Si enseña estadística y le gustaría ejecutarlos, o añadir un caso que importe para su curso, escriba a [email protected].