PLAYGROUND

Distribución Normal

Qué describe

La Normal es la distribución simétrica de referencia para errores y promedios. Su importancia no proviene de que todos los datos sean campanas, sino de que aparece como límite de sumas de muchos efectos pequeños y aproximadamente independientes.

Vive en toda la recta. mu ubica el centro y sigma mide dispersión; la estandarización permite comparar escalas distintas mediante una normal estándar.

Historia y nombres

De Moivre obtuvo una aproximación normal al binomial en el siglo XVIII y Gauss la utilizó en astronomía y errores de medición. El teorema central del límite consolidó su papel universal.

Relación con otras distribuciones

Es el límite de muchas sumas y aproxima Binomial, Poisson y t con tamaños grandes bajo condiciones adecuadas. Sus cuadrados producen chi-cuadrado y sus cocientes originan t y F.

Dónde aparece

  • errores de medición, promedios y regresión
  • aproximaciones de conteos y distribución de estimadores

Precauciones al ajustar

Un histograma con forma de campana no valida independencia, ausencia de outliers ni normalidad de las colas.

La campana no es la verdadera protagonista

La razón profunda de su ubicuidad está en las sumas. Muchos mecanismos distintos, al acumular contribuciones pequeñas sin que una sola domine, producen promedios que se acercan a una Normal. El teorema central del límite habla de la distribución del promedio bajo condiciones precisas; no afirma que cada observación original sea normal.

Hay una curiosidad geométrica fértil. Dos normales estándar independientes forman un punto aleatorio en el plano. Su distancia al origen sigue Rayleigh y el cuadrado de esa distancia sigue Chi Cuadrado con dos grados de libertad. Si se divide una normal por la raíz de una Chi Cuadrado independiente ajustada por sus grados de libertad, aparece la t de Student. La campana es así un nodo del que salen varias familias.

Guía de elección

Buena candidata cuando: los efectos son aproximadamente aditivos, la distribución es simétrica y las colas no muestran más extremos de los esperados bajo una campana.

Compárala con: t de Student para colas pesadas, Generalized Normal para otra curtosis y una familia asimétrica si hay sesgo. Revisa el gráfico Q–Q y la dependencia, no solo el histograma.

Referencias

  • Referencia de SciPy: scipy.stats.norm — definición y parametrización
  • Johnson, N. L., Kotz, S. & Balakrishnan, N. (1994). Continuous Univariate Distributions, 2nd ed., Vol. 1. Wiley.
  • de Moivre, A. (1733). Approximatio ad Summam Terminorum Binomii in Seriem Expansi. Privately printed.
  • Gauss, C. F. (1809). Theoria motus corporum coelestium in sectionibus conicis solem ambientium. Perthes & Besser.

Distribución Normal: ecuaciones y calculadora

Definición de distribución

XNormal(μ,σ)X\sim\mathrm{Normal}\left(\mu,\sigma\right)

Dominio de distribución

x(,)x\in\left(-\infty,\infty\right)

Dominio y restricciones de parámetros

μR,σR+\mu\in\mathbb{R},\sigma\in\mathbb{R}^{+}

Función de distribución acumulada

FX(x)=12[1+erf(xμσ2)]=Φ(xμσ)F_{X}\left(x\right)=\frac{1}{2}\left[1+\operatorname{erf}\left(\frac{x-\mu}{\sigma\sqrt{2}}\right)\right]=\Phi\left(\frac{x-\mu}{\sigma}\right)

Función de densidad de probabilidad

fX(x)=1σ2πe12(xμσ)2=ϕ(xμσ)f_{X}\left(x\right)=\frac{1}{\sigma\sqrt{2\pi}} e^{-\frac{1}{2}\left(\frac{x-\mu}{\sigma}\right)^2}=\phi\left(\frac{x-\mu}{\sigma}\right)

Función de punto percentil

FX1(u)=μ+σ2erf1(2u1)=μ+σΦ1(u)F^{-1}_{X}\left(u\right)=\mu+\sigma\sqrt{2} \operatorname{erf}^{-1}(2u-1)=\mu+\sigma\Phi^{-1}\left(u\right)

Momentos paramétricos no centrados

μk=E[Xk]=xkfX(x)dx=σk(i2)kU(k2,12,12(μσ)2)\mu'_{k}=E[X^k]=\int_{-\infty}^{\infty}x^{k}f_{X}\left(x\right)dx=\sigma^k\cdot (-i\sqrt 2)^k U\left(-\frac{k}{2},\frac{1}{2},-\frac{1}{2}\left(\frac \mu \sigma\right)^2\right)

Media paramétrica

Mean(X)=μ1=μ\mathrm{Mean}(X)=\mu'_{1}=\mu

Varianza paramétrica

Variance(X)=μ2μ12=σ2\mathrm{Variance}(X)=\mu'_{2}-\mu'^{2}_{1}=\sigma^{2}

Coeficiente de asimetría paramétrico

Skewness(X)=μ33μ2μ1+2μ13(μ2μ12)1.5=0\mathrm{Skewness}(X)=\frac{\mu'_{3}-3\mu'_{2}\mu'_{1}+2\mu'^{3}_{1}}{(\mu'_{2}-\mu'^{2}_{1})^{1.5}}=0

Curtosis paramétrica

Kurtosis(X)=μ44μ1μ3+6μ12μ23μ14(μ2μ12)2=3\mathrm{Kurtosis}(X)=\frac{\mu'_{4}-4\mu'_{1}\mu'_{3}+6\mu'^{2}_{1}\mu'_{2}-3\mu'^{4}_{1}}{(\mu'_{2}-\mu'^{2}_{1})^{2}}=3

Mediana paramétrica

Median(X)=μ\mathrm{Median}(X)=\mu

Moda paramétrica

Mode(X)=μ\mathrm{Mode}(X)=\mu

Información y definiciones adicionales

μ:Location parameter\mu:\text{Location parameter}
σ:Scale parameter\sigma:\text{Scale parameter}
u:Uniform[0,1] random varibleu:\text{Uniform[0,1] random varible}
U(a,b,z):Tricomi’s confluent hypergeometric functionU(a,b,z):\text{Tricomi's confluent hypergeometric function}
Φ(x):CDF normal standard distribution\Phi\left(x\right):\text{CDF normal standard distribution}
Φ1(x):PPF normal standard distribution\Phi^{-1}\left(x\right):\text{PPF normal standard distribution}
ϕ(x):PDF normal standard distribution\phi\left(x\right):\text{PDF normal standard distribution}
erf(x):Error function\mathrm{erf}(x):\text{Error function}
erf1(x):Inverse of error function\mathrm{erf}^{-1}(x):\text{Inverse of error function}