8 Convergencia y Teorema del Límite Central

Definición III.21.

Una secuencia X1,X2,…X_{1},X_{2},\ldots converge en probabilidad a XX si, para todo ϵ>0\epsilon>0:

lı´mn→∞P(|Xn−X|<ϵ)=1\mathop{\operator@font l\acute{{\imath}}m}\limits_{n\to\infty}P(\left|X_{n}-X% \right|<\epsilon)=1

o equivalentemente

lı´mn→∞P(|Xn−X|≥ϵ)=0\mathop{\operator@font l\acute{{\imath}}m}\limits_{n\to\infty}P(\left|X_{n}-X% \right|\geq\epsilon)=0

La idea es que la probabilidad de que XnX_{n} se aleje de XX mas de ϵ\epsilon tiende a cero.

Definición III.22.

Una secuencia X1,X2,…X_{1},X_{2},\dots converge casi seguro a XX si

P(lı´mn→∞|Xn−X|=0)=1P\left(\mathop{\operator@font l\acute{{\imath}}m}_{n\to\infty}|X_{n}-X|=0% \right)=1

La convergencia casi segura es más fuerte que la convergencia en probabilidad:

Xn→c.s.X⟹Xn→𝑝X\boxed{X_{n}\xrightarrow{\text{c.s.}}X\implies X_{n}\xrightarrow{p}X}
Ejemplo III.11.

Sea el espacio muestral Ω=[0,1]\Omega=[0,1] con distribucion uniforme y

Xn(ω)=ω+ωnX(ω)=ωX_{n}(\omega)=\omega+\frac{\omega}{n}\qquad X(\omega)=\omega

Para todo ω∈[0,1]\omega\in[0,1]:

Xn(ω)⟶X(ω)X_{n}(\omega)\longrightarrow X(\omega)

Por tanto

Xn⟶c.s.XX_{n}\overset{\text{c.s.}}{\longrightarrow}X
Ejemplo III.12.

Sea X∼U(0,1)X\sim U(0,1) y consideremos intervalos binarios de la forma

I1=[0,1],I2=[0,12],I3=[12,1],I4=[0,14],…,I7=[34,1],I8=[0,18].…I_{1}=[0,1],I_{2}=[0,\frac{1}{2}],I_{3}=[\frac{1}{2},1],I_{4}=[0,\frac{1}{4}],% \ldots,I_{7}=[\frac{3}{4},1],I_{8}=[0,\frac{1}{8}]\mathchar 46\relax\ldots

es decir,

I2m+i=[i2m,i+12m], para m=0,1,…, e i=0,1,2m−1I_{2^{m}+i}=\left[\frac{i}{2^{m}},\frac{i+1}{2^{m}}\right],\text{ para }m=0,1,% \ldots,\text{ e }i=0,1,2^{m-1}

Es decir, para un mm fijo los 2m2^{m} intervalos de anchura 2−m2^{-m} cubren el intervalo [0,1][0,1]. Definimos Yn=1Y_{n}=1 si X∈InX\in I_{n} e Yn=0Y_{n}=0 si X∉InX\notin I_{n}.

La secuencia Y1,…,Yn,…Y_{1},\ldots,Y_{n},\ldots converge en probabilidad a Y=0Y=0, ya que ∀0<ϵ≤1\forall 0<\epsilon\leq 1,

P(|Yn−0|≥ϵ)=P(Yn=1)=P(X∈In)=longitud intervalo In→0, cuando n→∞P(\left|Y_{n}-0\right|\geq\epsilon)=P(Y_{n}=1)=P(X\in I_{n})=\text{longitud % intervalo }I_{n}\to 0,\text{ cuando }n\to\infty

Sin embargo la secuencia no converge casi seguro a YY, ya que para cada ω∈[0,1]\omega\in[0,1], YnY_{n} asume el valor 11 en un conjunto infinito de puntos (el intervalo InI_{n}) y 0 en otro conjunto infinito no numerable de puntos.

Definición III.23.

Una secuencia X1,X2,…X_{1},X_{2},\ldots converge en distribucion a XX si

lı´mn→∞FXn(x)=FX(x)\mathop{\operator@font l\acute{{\imath}}m}\limits_{n\to\infty}F_{X_{n}}(x)=F_{% X}(x)

en todos los puntos xx donde FXF_{X} es continua.

La convergencia en distribucion describe la convergencia de las distribuciones de las variables aleatorias.

Proposición III.6.

La convergencia en probabilidad implica convergencia en distribucion:

Xn→𝑃X⇒Xn→𝑑XX_{n}\overset{P}{\rightarrow}X\Rightarrow X_{n}\overset{d}{\rightarrow}X
Teorema III.1 (Ley débil de los grandes números).

Sean X1,X2,…X_{1},X_{2},\ldots variables aleatorias i.i.d. tales que

E(Xi)=μV(Xi)=σ2<∞E(X_{i})=\mu\qquad V(X_{i})=\sigma^{2}<\infty

Entonces, la media muestral Xn¯=1n∑i=1nXi\overline{X_{n}}=\frac{1}{n}\sum_{i=1}^{n}X_{i}

  • ​

    Converge en probabilidad a la media poblacional:

    Xn¯→𝑃μ\overline{X_{n}}\overset{P}{\rightarrow}\mu
  • ​

    Equivalentemente, para todo ϵ>0\epsilon>0,

    lı´mn→∞P(|Xn¯−μ|<ϵ)=1\mathop{\operator@font l\acute{{\imath}}m}\limits_{n\to\infty}P(\left|% \overline{X_{n}}-\mu\right|<\epsilon)=1
Demostración.

Por la desigualdad de Chebyshev,

P(|X−E(X)|≥k)≤V(X)k2P(\left|X-E(X)\right|\geq k)\leq\frac{V(X)}{k^{2}}

Aplicandola a Xn¯\overline{X_{n}},

P(|Xn¯−μ|≥ϵ)≤V(Xn¯)ϵ2P(\left|\overline{X_{n}}-\mu\right|\geq\epsilon)\leq\frac{V(\overline{X_{n}})}% {\epsilon^{2}}

Como V(Xn¯)=σ2nV(\overline{X_{n}})=\frac{\sigma^{2}}{n}, obtenemos

P(|Xn¯−μ|<ϵ)=1−P(|Xn¯−μ|≥ϵ)≥1−σ2nϵ2→1, si n→∞P(\left|\overline{X_{n}}-\mu\right|<\epsilon)=1-P(\left|\overline{X_{n}}-\mu% \right|\geq\epsilon)\geq 1-\frac{\sigma^{2}}{n\epsilon^{2}}\to 1,\text{ si }n\to\infty

∎

Si la media muestral converge en probabilidad a la media poblacional, esto implica que, al aumentar el tamaño de la muestra, la probabilidad de que Xn¯\overline{X_{n}} se aleje de μ\mu disminuye. Esta propiedad se denomina consistencia del estimador.

Teorema III.2 (Ley fuerte de los grandes números).

Sean X1,X2,…X_{1},X_{2},\ldots variables aleatorias i.i.d. tales que:

E(Xi)=μV(Xi)=σ2<∞E(X_{i})=\mu\qquad V(X_{i})=\sigma^{2}<\infty

Entonces, la media muestral X¯n=1n∑i=1nXi\overline{X}_{n}=\frac{1}{n}\sum_{i=1}^{n}X_{i}

  • ​

    Converge casi seguro a la media poblacional,

    X¯n⟶c.s.μ\overline{X}_{n}\overset{c\mathchar 46\relax s\mathchar 46\relax}{% \longrightarrow}\mu
  • ​

    Equivalentemente, para todo ϵ>0\epsilon>0,

    P(lı´mn→∞|X¯n−μ|<ϵ)=1P(\mathop{\operator@font l\acute{{\imath}}m}\limits_{n\to\infty}\left|% \overline{X}_{n}-\mu\right|<\epsilon)=1

La ley fuerte implica la ley debil.

Teorema III.3 (Teorema del Límite Central (TLC)).

Sean X1,X2,…X_{1},X_{2},\ldots variables aleatorias i.i.d. con E(Xi)=μE(X_{i})=\mu, Var(Xi)=σ2<∞\operatorname{Var}(X_{i})=\sigma^{2}<\infty. Definimos la media muestral

Xn¯=1n∑i=1nXi\overline{X_{n}}=\frac{1}{n}\sum_{i=1}^{n}X_{i}

y sea Gn(x)G_{n}(x) la función de distribución de la variable aleatoria Xn¯−μσ/n\frac{\overline{X_{n}}-\mu}{\sigma/\sqrt{n}}.

Entonces para todo −∞<x<∞-\infty<x<\infty:

lı´mn→∞Gn(x)=Φ(x)=∫−∞x12πe−y22dy\mathop{\operator@font l\acute{{\imath}}m}_{n\to\infty}G_{n}(x)=\Phi(x)=\int_{% -\infty}^{x}\frac{1}{\sqrt{2\pi}}e^{-\frac{y^{2}}{2}}dy

y la variable aleatoria converge en distribución a la normal estándar:

Xn¯−μσ/n→𝑑N(0,1)\frac{\overline{X_{n}}-\mu}{\sigma/\sqrt{n}}\xrightarrow{d}N(0,1)

Interpretación: Para nn suficientemente grande, la distribución de la media muestral es aproximadamente normal. Como E(Xn¯)=μE(\overline{X_{n}})=\mu y Var(Xn¯)=σ2n\operatorname{Var}(\overline{X_{n}})=\frac{\sigma^{2}}{n}, tenemos aproximadamente:

Xn¯≈N(μ,σ2n)\overline{X_{n}}\approx N\left(\mu,\frac{\sigma^{2}}{n}\right)

La aproximación es válida para muchas distribuciones poblacionales, siempre que se cumplan las condiciones del TLC.

Aunque se trata de un resultado muy importante en la estadística, en general no sabemos cómo de rápido se da esta convergencia a la normalidad. Es necesario comprobar esto distribución por distribución.

Ejemplo III.13.

Sea X∼Exp(0,1)X\sim\operatorname{Exp}(0{,}1) (variable aleatoria que sigue distribución exponencial con media 10). Con:

E(X)=10Var(X)=100E(X)=10\qquad\operatorname{Var}(X)=100

Generamos muchas muestras independientes de tamaño nn y calculamos la media de cada muestra:

Xn¯=X1+⋯+Xnn.\overline{X_{n}}=\frac{X_{1}+\dots+X_{n}}{n}\mathchar 46\relax

Por el TLC, para nn suficientemente grande:

Xn¯≈N(10,100n)\overline{X_{n}}\approx N\left(10,\frac{100}{n}\right)

Para n=25n=25:

X¯25≈N(10,4)\overline{X}_{25}\approx N(10,4)

La distribución original es exponencial y, por tanto, no es normal. Sin embargo, al repetir el experimento muchas veces y representar las medias muestrales, observamos que su distribución se aproxima a una normal:

X∼Exp(0,1)⟹X¯25≈N(10,4)X\sim\operatorname{Exp}(0{,}1)\implies\overline{X}_{25}\approx N(10,4)

Además, los valores teóricos son:

E(X¯25)=10Var(X¯25)=4.E(\overline{X}_{25})=10\qquad\operatorname{Var}(\overline{X}_{25})=4\mathchar 46\relax

Al aumentar nn, la distribución de Xn¯\overline{X_{n}} se concentra alrededor de μ=10\mu=10 y se aproxima cada vez más a una normal.

El TLC permite aproximar la distribución muestral de determinados estadísticos cuando nn es grande. Estudiaremos ahora las distribuciones muestrales de la media muestral, la proporción muestral y la varianza muestral (las propiedades de esperanza y varianza de estos estadísticos fueron obtenidas anteriormente).

Distribución muestral de la media: Si X1,…,XnX_{1},\ldots,X_{n} es una m.a.s. con:

E(X)=μVar(X)=σ2<∞E(X)=\mu\qquad\operatorname{Var}(X)=\sigma^{2}<\infty

Entonces:

E(X¯)=μVar(X¯)=σ2n.E(\overline{X})=\mu\qquad\operatorname{Var}(\overline{X})=\frac{\sigma^{2}}{n}% \mathchar 46\relax

Si nn es suficientemente grande, por el TLC:

X¯≈N(μ,σ2n)\overline{X}\approx N\left(\mu,\frac{\sigma^{2}}{n}\right)

Si la población es normal, la distribución de X¯\overline{X} es normal para cualquier nn:

Xi∼N(μ,σ2)⟹X¯∼N(μ,σ2n).X_{i}\sim N(\mu,\sigma^{2})\implies\overline{X}\sim N\left(\mu,\frac{\sigma^{2% }}{n}\right)\mathchar 46\relax

Distribución muestral de la proporción: Si Xi∼i.i.d.Bernoulli(p)X_{i}\overset{\text{i.i.d.}}{\sim}\operatorname{Bernoulli}(p), entonces:

N=∑i=1nXi∼Binomial(n,p).N=\sum_{i=1}^{n}X_{i}\sim\operatorname{Binomial}(n,p)\mathchar 46\relax

Como p^=Nn\widehat{p}=\frac{N}{n}, la distribución exacta de p^\widehat{p} se obtiene de la distribución binomial. Además:

E(p^)=pVar(p^)=p(1−p)nE(\widehat{p})=p\qquad\operatorname{Var}(\widehat{p})=\frac{p(1-p)}{n}

Aproximación normal: Para nn suficientemente grande, la distribución de p^\widehat{p} es aproximadamente normal:

p^≈N(p,p(1−p)n)\widehat{p}\approx N\left(p,\frac{p(1-p)}{n}\right)

Equivalentemente:

p^−pp(1−p)/n≈N(0,1)\frac{\widehat{p}-p}{\sqrt{p(1-p)/n}}\approx N(0,1)

Distribución muestral de la varianza: Para una m.a.s. de una población con:

E(X)=μVar(X)=σ2<∞E(X)=\mu\qquad\operatorname{Var}(X)=\sigma^{2}<\infty

Sabemos que:

E(S2)=σ2E(S^{2})=\sigma^{2}

En general, la distribución de S2S^{2} depende de la distribución de la población y del tamaño nn. La distribución de S2S^{2} suele ser asimétrica y su convergencia a una distribución normal es lenta.

Proposición III.7 (Caso normal).

Para poblaciones normales, si Xi∼i.i.d.N(μ,σ2)X_{i}\overset{\text{i.i.d.}}{\sim}N(\mu,\sigma^{2}), entonces:

(n−1)S2σ2∼χ2n−1\frac{(n-1)S^{2}}{\sigma^{2}}\sim\chi^{2}_{n-1}

Los grados de libertad de la distribución χ2\chi^{2} son n−1n-1.

Además, en el caso de una población normal:

X¯ y S2 son independientes.\overline{X}\text{ y }S^{2}\text{ son independientes}\mathchar 46\relax
Definición III.24.

Si ZZ es una variable aleatoria con distribución normal estándar:

Z∼N(0,1)Z\sim N(0,1)

A la distribución de la variable Z2Z^{2} se le da el nombre de chi cuadrado con un grado de libertad (χ21\chi^{2}_{1}):

Z2∼χ21Z^{2}\sim\chi^{2}_{1}

La función de densidad de esta variable aleatoria es:

f(t)={0si t<012πte−t2si t≥0f(t)=\begin{cases}0&\text{si }t<0\\ \frac{1}{\sqrt{2\pi t}}e^{-\frac{t}{2}}&\text{si }t\geq 0\end{cases}
Proposición III.8 (Propiedades de χ2k\chi^{2}_{k}).

propiedades

  1. 1.
    ​

    Si Z1,…,ZkZ_{1},\ldots,Z_{k} son independientes y Zi∼χ21Z_{i}\sim\chi^{2}_{1}, entonces:

    Z12+⋯+Zk2∼χ2k.Z_{1}^{2}+\cdots+Z_{k}^{2}\sim\chi^{2}_{k}\mathchar 46\relax

    El parámetro kk se denomina grados de libertad.

  2. 2.
    ​

    Si Y∼χ2kY\sim\chi^{2}_{k}, entonces:

    E(Y)=kVar(Y)=2k.E(Y)=k\qquad\operatorname{Var}(Y)=2k\mathchar 46\relax

χ2\chi^{2} depende únicamente de sus grados de libertad kk. En particular:

(n−1)S2σ2∼χ2n−1.\frac{(n-1)S^{2}}{\sigma^{2}}\sim\chi^{2}_{n-1}\mathchar 46\relax
\topruleEstadístico Distribución / aproximación Parámetros
\midruleX¯\overline{X} N(μ,σ2n)N\left(\mu,\frac{\sigma^{2}}{n}\right) si XX es normal
X¯\overline{X} ≈N(μ,σ2n)\approx N\left(\mu,\frac{\sigma^{2}}{n}\right) si nn es grande
p^\widehat{p} binomial transformada npnp
p^\widehat{p} ≈N(p,p(1−p)n)\approx N\left(p,\frac{p(1-p)}{n}\right) si nn es grande
S2S^{2} χ2n−1\chi^{2}_{n-1} si XX es normal
\bottomrule