Un ranking no identifica la distribución generadora

En el ejemplo reproducido se generaron 500 observaciones a partir de una lognormal. Phitter 1.0.4 devolvió 63 candidatas ajustadas. Las tres primeras filas, redondeadas, fueron:

Puesto Distribución AIC BIC KS AD χ² p
1 inverse_gaussian 1976.32 1984.75 0.0352 0.5356 0.0832
2 lognormal 1976.43 1984.86 0.0305 0.3296 0.1678
3 inverse_gamma_3p 1978.62 1991.27 0.0281 0.3105 0.3054

La familia generadora quedó segunda. Varias familias pueden aproximar una muestra finita, y el criterio de ordenamiento no tiene por qué favorecer a la generadora en cada muestra.

Comprende la regla de ordenamiento

Phitter prioriza las candidatas con más pruebas que no las rechazan. En ajustes continuos desempata por menor BIC, después AIC y después SSE. En discretos desempata por SSE y no reporta AIC ni BIC. Por tanto, los resultados web no deben describirse como una tabla ordenada únicamente por error de ajuste.

BIC y AIC penalizan de manera distinta la complejidad. Compáralos sobre las mismas observaciones y con verosimilitudes compatibles; no tiene sentido comparar valores obtenidos con conjuntos de datos diferentes. Aquí los dos primeros modelos tienen igual número de parámetros y una brecha de AIC de aproximadamente 0.11. Esa pequeña diferencia absoluta ofrece poca separación. Dividirla entre el AIC total no aporta una medida útil de evidencia.

La lognormal obtiene menores estadísticos KS, AD y chi-cuadrado que la primera fila. Es compatible con el ordenamiento: ambos modelos tienen tres pruebas no rechazadas y el criterio de información deshace el empate. Un estadístico pequeño, un p-valor grande y un criterio de información bajo son evidencias diferentes.

Cuenta correctamente las pruebas no rechazadas

De las 63 candidatas, 20 tienen al menos una prueba que no las rechaza; 11 no tienen rechazo en ninguna de las tres, al nivel nominal del 5%. df_not_rejected_distributions devuelve el primer grupo. Su nombre no significa que todas las pruebas hayan aceptado todos los modelos listados.

No rechazar no equivale a una probabilidad de que el modelo sea correcto. La interpretación depende de la calibración y la potencia. Buscar entre muchas candidatas también introduce efectos de selección, pero el nivel de significación no indica cuántos modelos falsos sobrevivirán. Conserva todos los resultados y revisa los supuestos de las pruebas.

Examina las cantidades que necesita tu decisión

La gaussiana inversa y la lognormal ajustadas tienen medianas de 3.2595 y 3.2841, y percentiles 95 de 8.0596 y 7.9617. Sus predicciones sobre observaciones típicas son próximas en este ejemplo.

Las probabilidades estimadas de superar 20 son aproximadamente 0.000195 y 0.000396. El máximo muestral fue 16.4879: la comparación corresponde a una extrapolación. La diferencia puede importar para simular retrasos raros, aunque resulte poco relevante para describir la mediana.

Convierte el ranking en una decisión de modelado

  1. Comprueba la preparación de los datos, las unidades, los valores posibles y si las observaciones representan un proceso estable.
  2. Revisa varias candidatas plausibles y sus parámetros. Cuantifica la probabilidad asignada a resultados imposibles antes de decidir si una aproximación es admisible.
  3. Examina las gráficas acumuladas y Q–Q para localizar discrepancias. Un estadístico escalar no indica dónde aparecen.
  4. Compara las probabilidades o los cuantiles que utiliza tu aplicación y reporta la sensibilidad a la elección del modelo.
  5. Conserva versiones, opciones y ranking completo para que otra persona pueda repetir la evaluación.

En simulación, incorpora alternativas plausibles a un análisis de sensibilidad. Si las conclusiones cambian considerablemente según la familia, esa incertidumbre forma parte del resultado.