Qué significa un resultado de bondad de ajuste
Una prueba de bondad de ajuste evalúa la discrepancia entre observaciones y un modelo especificado bajo ciertos supuestos. El p-valor no es la probabilidad de que el modelo sea correcto. La ausencia de rechazo puede deberse a un modelo adecuado para la pregunta, a una muestra que no revela la discrepancia o a una calibración inadecuada para el caso.
Phitter reporta Kolmogorov–Smirnov, Anderson–Darling y chi-cuadrado en ajustes continuos, y KS y chi-cuadrado en discretos. Distingue los resultados no disponibles de las pruebas no rechazadas.
Kolmogorov–Smirnov
KS mide la distancia máxima entre las distribuciones acumuladas empírica y teórica. Suele ser más sensible en el centro que en las colas. Su calibración continua habitual, con modelo completamente especificado, no se extiende directamente a parámetros estimados con la muestra ni a datos discretos. Consulta la referencia de NIST.
Anderson–Darling
AD da mayor peso a las discrepancias acumuladas cerca de las colas. Sus valores críticos dependen de la distribución y del tratamiento de los parámetros estimados; NIST explica estos requisitos. Esa ponderación puede ser útil, pero no convierte a AD en la prueba más potente para todo caso ni garantiza que rechace primero.
Chi-cuadrado
Chi-cuadrado compara frecuencias observadas y esperadas por intervalos o categorías. Puede utilizarse con datos continuos o discretos cuando la agrupación y los conteos esperados son adecuados. Registra los intervalos y el tratamiento de los parámetros: cambiarlos puede modificar el resultado. Los conteos esperados pequeños requieren especial atención.
Elige los diagnósticos relevantes según sus supuestos y tu pregunta de modelado. No selecciones una prueba solo porque produzca el resultado más favorable.
Distingue los diagnósticos del ranking
En el ejemplo lognormal reproducido, algunos modelos principales obtuvieron estos estadísticos redondeados:
| Distribución | KS | AD | χ² | Puesto |
|---|---|---|---|---|
| inverse_gaussian | 0.0352 | 0.5356 | 25.5446 | 1 |
| lognormal | 0.0305 | 0.3296 | 22.4568 | 2 |
| burr_4p | 0.0266 | 0.2124 | 19.6533 | 7 |
Burr tiene estadísticos menores que los otros dos modelos mostrados, pero queda debajo. Los tres tienen tres pruebas no rechazadas; BIC deshace el empate, con AIC y SSE como criterios posteriores. Estas filas no establecen que Burr tenga los menores estadísticos de todo el catálogo.
La ejecución devolvió 63 candidatas: 20 con al menos una prueba no rechazada, incluidas 11 sin rechazo en las tres pruebas, al nivel nominal del 5%. df_not_rejected_distributions representa el grupo de 20. Contar esa tabla como modelos que pasan todas las pruebas produce un resultado incorrecto.
Considera la estimación de parámetros
Contrastar un modelo especificado antes de observar la muestra difiere de hacerlo después de estimar sus parámetros con ella. En problemas continuos adecuados, un bootstrap paramétrico permite simular muestras y reajustarlas antes de comparar estadísticos; SciPy documenta el procedimiento. No supongas que los diagnósticos predeterminados de Phitter realizan esa calibración adicional.
Al buscar entre muchas candidatas, el nivel nominal de significación no permite predecir cuántos modelos falsos sobrevivirán. Influyen la selección, la potencia y la calibración. Evita presentar la lista resultante como distribuciones verificadas.
Utiliza los resultados conjuntamente
Revisa primero los datos y sus valores posibles. Interpreta cada prueba con sus supuestos y examina las gráficas de CDF empírica y Q–Q para localizar discrepancias. Compara las probabilidades o los cuantiles necesarios para tu aplicación. Reporta alternativas plausibles si la decisión cambia según el modelo. Interpretar un ranking desarrolla este proceso.