PLAYGROUND

Distribución Skellam

Retrato

Skellam es la distribución de la diferencia entre dos conteos Poisson independientes. Su soporte es entero, pero puede extenderse en ambas direcciones: valores positivos indican más eventos del primer proceso y negativos del segundo.

Huellas históricas

J. G. Skellam publicó en 1946 la distribución de diferencias entre dos variables Poisson de poblaciones distintas. El problema aparece en ecología, deportes y comparación de flujos.

Dos conexiones útiles

  • Es la diferencia de dos Poisson y se aproxima a una Normal cuando la suma de tasas es grande. Si una tasa tiende a cero, se acerca a Poisson o a su reflejo; Discrete Laplace ofrece un paralelo geométrico para diferencias con colas exponenciales.
  • Aunque la media pueda ser positiva, siempre hay probabilidad de diferencias negativas salvo que una tasa sea prácticamente nula; la varianza impone Var(X) ≥ |E(X)|.

Caso de uso

Skellam es natural para preguntar “¿cuántos eventos más ocurrieron en A que en B?”. En deportes se usa para diferencias de goles; en comercio y epidemiología, para cambios entre dos procesos de llegada.

Consejo de diagnóstico

La independencia entre conteos es una hipótesis fuerte: exposiciones compartidas o shocks comunes requieren un modelo bivariado con dependencia.

El marcador final esconde dos ataques

Un resultado de 2 a 1 y otro de 5 a 4 dejan la misma diferencia, pero no la misma incertidumbre. En Skellam, la media depende de la resta de las dos tasas y la varianza de su suma. Por eso un equilibrio entre procesos intensos puede producir diferencias mucho más volátiles que un equilibrio entre procesos escasos.

La distribución se usa para diferencias de goles, cambios netos de inventario y resta de imágenes con ruido de conteo. Si se conoce el total de eventos, el primer conteo condicionado a ese total es Binomial; si el total queda libre, la diferencia es Skellam. Esta doble lectura ayuda a decidir si se modela el marcador neto o los dos mecanismos generadores por separado.

Guía de elección

Buena candidata cuando: la variable es la diferencia entre dos conteos Poisson independientes y pueden observarse valores negativos.

Compárala con: Discrete Laplace para una forma simétrica sin mecanismo Poisson y un modelo Poisson bivariado si existen shocks compartidos. La dependencia cambia la varianza de la diferencia.

Referencias

  • Referencia de SciPy: scipy.stats.skellam — definición y parametrización
  • Johnson, N. L., Kemp, A. W. & Kotz, S. (2005). Univariate Discrete Distributions, 3rd ed. Wiley.
  • Skellam, J. G. (1946). The frequency distribution of the difference between two Poisson variates belonging to different populations. Journal of the Royal Statistical Society, Series A, 109(3), 296.
  • Karlis, D. & Ntzoufras, I. (2009). Bayesian modelling of football outcomes: using the Skellam distribution for the goal difference. IMA Journal of Management Mathematics, 20(2), 133–145.

Distribución Skellam: ecuaciones y calculadora

Definición de distribución

XSkellam(λ1,λ2)X\sim\mathrm{Skellam}\left(\lambda_{1},\lambda_{2}\right)

Dominio de distribución

xZ{,2,1,0,1,2,}x\in\mathbb{Z}\equiv\left\{\dots,-2,-1,0,1,2,\dots\right\}

Dominio y restricciones de parámetros

λ1R+,λ2R+\lambda_{1}\in\mathbb{R}^{+},\lambda_{2}\in\mathbb{R}^{+}

Función de distribución acumulada

FX(x)=k=xfX(k)F_{X}\left(x\right)=\sum_{k=-\infty}^{x}f_{X}\left(k\right)

Función de masa de Probabilidad

fX(x)=e(λ1+λ2)(λ1λ2)x/2Ix ⁣(2λ1λ2)f_{X}\left(x\right)=e^{-\left(\lambda_{1}+\lambda_{2}\right)}\left(\frac{\lambda_{1}}{\lambda_{2}}\right)^{x/2}I_{\left|x\right|}\!\left(2\sqrt{\lambda_{1}\lambda_{2}}\right)

Función de punto percentil

FX1(u)=argminxFX(x)uF^{-1}_{X}\left(u\right)=\arg\min_{x}\left| F_{X}\left(x\right)-u \right|

Momentos centrados paramétricos

E[Xk]=μk=x=xkfX(x)E[X^k]=\mu'_{k}=\sum_{x=-\infty}^{\infty}x^{k}f_{X}\left(x\right)

Media paramétrica

Mean(X)=μ1=λ1λ2\mathrm{Mean}(X)=\mu'_{1}=\lambda_{1}-\lambda_{2}

Varianza paramétrica

Variance(X)=(μ2μ12)=λ1+λ2\mathrm{Variance}(X)=(\mu'_{2}-\mu'^{2}_{1})=\lambda_{1}+\lambda_{2}

Coeficiente de asimetría paramétrico

Skewness(X)=μ33μ2μ1+2μ13(μ2μ12)1.5=λ1λ2(λ1+λ2)3/2\mathrm{Skewness}(X)=\frac{\mu'_{3}-3\mu'_{2}\mu'_{1}+2\mu'^{3}_{1}}{(\mu'_{2}-\mu'^{2}_{1})^{1.5}}=\frac{\lambda_{1}-\lambda_{2}}{\left(\lambda_{1}+\lambda_{2}\right)^{3/2}}

Curtosis paramétrica

Kurtosis(X)=μ44μ1μ3+6μ12μ23μ14(μ2μ12)2=3+1λ1+λ2\mathrm{Kurtosis}(X)=\frac{\mu'_{4}-4\mu'_{1}\mu'_{3}+6\mu'^{2}_{1}\mu'_{2}-3\mu'^{4}_{1}}{(\mu'_{2}-\mu'^{2}_{1})^{2}}=3+\frac{1}{\lambda_{1}+\lambda_{2}}

Mediana paramétrica

Median(X)=FX1(0.5)\mathrm{Median}(X)=F^{-1}_{X}\left(0.5\right)

Moda paramétrica

Mode(X)=argmaxk{λ1λ2,λ1λ2}fX(k)\mathrm{Mode}(X)=\arg\max_{k\in\{\lfloor\lambda_{1}-\lambda_{2}\rfloor,\lceil\lambda_{1}-\lambda_{2}\rceil\}}f_{X}(k)

Información y definiciones adicionales

Computing an analytic expression for the inverse of the cumulative distribution function is not feasible. However, it is possible to calculate the Percentile Point Function by approximating it to the nearest integer.
X=N1N2,  N1Poisson(λ1),  N2Poisson(λ2),  N1N2X=N_{1}-N_{2},\;N_{1}\sim\mathrm{Poisson}(\lambda_{1}),\;N_{2}\sim\mathrm{Poisson}(\lambda_{2}),\;N_{1}\perp N_{2}
λ1:Rate parameter of N1\lambda_{1}:\text{Rate parameter of }N_{1}
λ2:Rate parameter of N2\lambda_{2}:\text{Rate parameter of }N_{2}
u:Uniform[0,1] random varibleu:\text{Uniform[0,1] random varible}
Iν(x):Modified Bessel function of the first kind of order νI_{\nu}(x):\text{Modified Bessel function of the first kind of order }\nu
x:Floor function\lfloor{x}\rfloor: \text{Floor function}
x:Ceiling Function\lceil{x}\rceil: \text{Ceiling Function}