7 Convergencia y Teorema del Límite Central

Definición III.21.

Una secuencia X1,X2,…X_{1},X_{2},\ldots converge en probabilidad a XX si, para todo ϵ>0\epsilon>0:

lı´mn→∞P(|Xn−X|<ϵ)=1\mathop{\operator@font l\acute{{\imath}}m}\limits_{n\to\infty}P(\left|X_{n}-X% \right|<\epsilon)=1

o equivalentemente

lı´mn→∞P(|Xn−X|≥ϵ)=0\mathop{\operator@font l\acute{{\imath}}m}\limits_{n\to\infty}P(\left|X_{n}-X% \right|\geq\epsilon)=0

La idea es que la probabilidad de que XnX_{n} se aleje de XX mas de ϵ\epsilon tiende a cero.

Definición III.22.

Una secuencia X1,X2,…X_{1},X_{2},\dots converge casi seguro a XX si

P(lı´mn→∞|Xn−X|=0)=1P\left(\mathop{\operator@font l\acute{{\imath}}m}_{n\to\infty}|X_{n}-X|=0% \right)=1

La convergencia casi segura es más fuerte que la convergencia en probabilidad:

Xn→c.s.X⟹Xn→𝑝X\boxed{X_{n}\xrightarrow{\text{c.s.}}X\implies X_{n}\xrightarrow{p}X}
Ejemplo III.9.

Sea el espacio muestral Ω=[0,1]\Omega=[0,1] con distribucion uniforme y

Xn(ω)=ω+ωnX(ω)=ωX_{n}(\omega)=\omega+\frac{\omega}{n}\qquad X(\omega)=\omega

Para todo ω∈[0,1]\omega\in[0,1]:

Xn(ω)⟶X(ω)X_{n}(\omega)\longrightarrow X(\omega)

Por tanto

Xn⟶c.s.XX_{n}\overset{\text{c.s.}}{\longrightarrow}X
Definición III.23.

Una secuencia X1,X2,…X_{1},X_{2},\ldots converge en distribucion a XX si

lı´mn→∞FXn(x)=FX(x)\mathop{\operator@font l\acute{{\imath}}m}\limits_{n\to\infty}F_{X_{n}}(x)=F_{% X}(x)

en todos los puntos xx donde FXF_{X} es continua.

La convergencia en distribucion describe la convergencia de las distribuciones de las variables aleatorias.

Proposición III.6.

La convergencia en probabilidad implica convergencia en distribucion:

Xn→𝑃X⇒Xn→𝑑XX_{n}\overset{P}{\rightarrow}X\Rightarrow X_{n}\overset{d}{\rightarrow}X
Teorema III.1 (Ley débil de los grandes números).

Sean X1,X2,…X_{1},X_{2},\ldots variables aleatorias i.i.d. tales que

E(Xi)=μV(Xi)=σ2<∞E(X_{i})=\mu\qquad V(X_{i})=\sigma^{2}<\infty

Entonces, la media muestral Xn¯=1n∑i=1nXi\overline{X_{n}}=\frac{1}{n}\sum_{i=1}^{n}X_{i}

  • ​

    Converge en probabilidad a la media poblacional:

    Xn¯→𝑃μ\overline{X_{n}}\overset{P}{\rightarrow}\mu
  • ​

    Equivalentemente, para todo ϵ>0\epsilon>0,

    lı´mn→∞P(|Xn¯−μ|<ϵ)=1\mathop{\operator@font l\acute{{\imath}}m}\limits_{n\to\infty}P(\left|% \overline{X_{n}}-\mu\right|<\epsilon)=1
Demostración.

Por la desigualdad de Chebyshev,

P(|X−E(X)|≥k)≤V(X)k2P(\left|X-E(X)\right|\geq k)\leq\frac{V(X)}{k^{2}}

Aplicandola a Xn¯\overline{X_{n}},

P(|Xn¯−μ|≥ϵ)≤V(Xn¯)ϵ2P(\left|\overline{X_{n}}-\mu\right|\geq\epsilon)\leq\frac{V(\overline{X_{n}})}% {\epsilon^{2}}

Como V(Xn¯)=σ2nV(\overline{X_{n}})=\frac{\sigma^{2}}{n}, obtenemos

P(|Xn¯−μ|≥ϵ)≤σ2nϵ2⟶0P(\left|\overline{X_{n}}-\mu\right|\geq\epsilon)\leq\frac{\sigma^{2}}{n% \epsilon^{2}}\longrightarrow 0

∎

Si la media muestral converge en probabilidad a la media poblacional, esto implica que, al aumentar el tamaño de la muestra, la probabilidad de que Xn¯\overline{X_{n}} se aleje de μ\mu disminuye. Esta propiedad se denomina consistencia del estimador.

Teorema III.2 (Teorema del Límite Central (TLC)).

Sean X1,X2,…X_{1},X_{2},\ldots variables aleatorias i.i.d. con E(Xi)=μE(X_{i})=\mu, Var(Xi)=σ2<∞\operatorname{Var}(X_{i})=\sigma^{2}<\infty. Definimos, la media muestral

Xn¯=1n∑i=1nXi\overline{X_{n}}=\frac{1}{n}\sum_{i=1}^{n}X_{i}

y, sea Gn(x)G_{n}(x) la función de distribución de la variable aleatoria Xn¯−μσ/n\frac{\overline{X_{n}}-\mu}{\sigma/\sqrt{n}}.

Entonces para todo −∞<x<∞-\infty<x<\infty:

lı´mn→∞Gn(x)=Φ(x)=∫−∞x12πe−y22dy\mathop{\operator@font l\acute{{\imath}}m}_{n\to\infty}G_{n}(x)=\Phi(x)=\int_{% -\infty}^{x}\frac{1}{\sqrt{2\pi}}e^{-\frac{y^{2}}{2}}dy

La variable aleatoria converge en distribución a la normal estándar:

Xn¯−μσ/n→𝑑N(0,1)\frac{\overline{X_{n}}-\mu}{\sigma/\sqrt{n}}\xrightarrow{d}N(0,1)

Interpretación: Para nn suficientemente grande, la distribución de la media muestral es aproximadamente normal. Como E(Xn¯)=μE(\overline{X_{n}})=\mu y Var(Xn¯)=σ2n\operatorname{Var}(\overline{X_{n}})=\frac{\sigma^{2}}{n}, tenemos aproximadamente:

Xn¯≈N(μ,σ2n)\overline{X_{n}}\approx N\left(\mu,\frac{\sigma^{2}}{n}\right)

La aproximación es válida para muchas distribuciones poblacionales, siempre que se cumplan las condiciones del TLC.

Aunque se trata de un resultado muy importante en la estadística, en general no sabemos cómo de rápido se da esta convergencia a la normalidad. Es necesario comprobar esto distribución por distribución.

Ejemplo III.10.

Sea X∼Exp(0,1)X\sim\operatorname{Exp}(0{,}1) (variable aleatoria que sigue distribución exponencial con media 10). Con:

E(X)=10Var(X)=100E(X)=10\qquad\operatorname{Var}(X)=100

Generamos muchas muestras independientes de tamaño nn y calculamos la media de cada muestra:

Xn¯=X1+⋯+Xnn.\overline{X_{n}}=\frac{X_{1}+\dots+X_{n}}{n}\mathchar 46\relax

Por el TLC, para nn suficientemente grande:

Xn¯≈N(10,100n)\overline{X_{n}}\approx N\left(10,\frac{100}{n}\right)

Para n=25n=25:

X¯25≈N(10,4)\overline{X}_{25}\approx N(10,4)

La distribución original es exponencial y, por tanto, no es normal. Sin embargo, al repetir el experimento muchas veces y representar las medias muestrales, observamos que su distribución se aproxima a una normal:

X∼Exp(0,1)⟹X¯25≈N(10,4)X\sim\operatorname{Exp}(0{,}1)\implies\overline{X}_{25}\approx N(10,4)

Además, los valores teóricos son:

E(X¯25)=10Var(X¯25)=4.E(\overline{X}_{25})=10\qquad\operatorname{Var}(\overline{X}_{25})=4\mathchar 46\relax

Al aumentar nn, la distribución de Xn¯\overline{X_{n}} se concentra alrededor de μ=10\mu=10 y se aproxima cada vez más a una normal.

Distribuciones muestrales

El TLC permite aproximar la distribución muestral de determinados estadísticos cuando nn es grande. Estudiaremos ahora las distribuciones muestrales de la media muestral, la proporción muestral y la varianza muestral (las propiedades de esperanza y varianza de estos estadísticos fueron obtenidas anteriormente).

Distribución muestral de la media: Si X1,…,XnX_{1},\ldots,X_{n} es una m.a.s. con:

E(X)=μVar(X)=σ2<∞E(X)=\mu\qquad\operatorname{Var}(X)=\sigma^{2}<\infty

Entonces:

E(X¯)=μVar(X¯)=σ2n.E(\overline{X})=\mu\qquad\operatorname{Var}(\overline{X})=\frac{\sigma^{2}}{n}% \mathchar 46\relax

Si nn es suficientemente grande, por el TLC:

X¯≈N(μ,σ2n)\overline{X}\approx N\left(\mu,\frac{\sigma^{2}}{n}\right)

Si la población es normal, la distribución de X¯\overline{X} es normal para cualquier nn:

Xi∼N(μ,σ2)⟹X¯∼N(μ,σ2n).X_{i}\sim N(\mu,\sigma^{2})\implies\overline{X}\sim N\left(\mu,\frac{\sigma^{2% }}{n}\right)\mathchar 46\relax

Distribución muestral de la proporción: Si Xi∼i.i.d.Bernoulli(p)X_{i}\overset{\text{i.i.d.}}{\sim}\operatorname{Bernoulli}(p), entonces:

N=∑i=1nXi∼Binomial(n,p).N=\sum_{i=1}^{n}X_{i}\sim\operatorname{Binomial}(n,p)\mathchar 46\relax

Como p^=Nn\widehat{p}=\frac{N}{n}, la distribución exacta de p^\widehat{p} se obtiene de la distribución binomial. Además:

E(p^)=pVar(p^)=p(1−p)nE(\widehat{p})=p\qquad\operatorname{Var}(\widehat{p})=\frac{p(1-p)}{n}

Aproximación normal: Para nn suficientemente grande, la distribución de p^\widehat{p} es aproximadamente normal:

p^≈N(p,p(1−p)n)\widehat{p}\approx N\left(p,\frac{p(1-p)}{n}\right)

Equivalentemente:

p^−pp(1−p)/n≈N(0,1)\frac{\widehat{p}-p}{\sqrt{p(1-p)/n}}\approx N(0,1)

Distribución muestral de la varianza: Para una m.a.s. de una población con:

E(X)=μVar(X)=σ2<∞E(X)=\mu\qquad\operatorname{Var}(X)=\sigma^{2}<\infty

Sabemos que:

E(S2)=σ2E(S^{2})=\sigma^{2}

En general, la distribución de S2S^{2} depende de la distribución de la población y del tamaño nn. La distribución de S2S^{2} suele ser asimétrica y su convergencia a una distribución normal es lenta.

Proposición III.7 (Caso normal).

Para poblaciones normales, si Xi∼i.i.d.N(μ,σ2)X_{i}\overset{\text{i.i.d.}}{\sim}N(\mu,\sigma^{2}), entonces:

(n−1)S2σ2∼χ2n−1\frac{(n-1)S^{2}}{\sigma^{2}}\sim\chi^{2}_{n-1}

Los grados de libertad de la distribución χ2\chi^{2} son n−1n-1.

Además, en el caso de una población normal:

X¯ y S2 son independientes.\overline{X}\text{ y }S^{2}\text{ son independientes}\mathchar 46\relax
Definición III.24.

Si ZZ es una variable aleatoria con distribución normal estándar:

Z∼N(0,1)Z\sim N(0,1)

A la distribución de la variable Z2Z^{2} se le da el nombre de chi cuadrado con un grado de libertad (χ21\chi^{2}_{1}):

Z2∼χ21Z^{2}\sim\chi^{2}_{1}

La función de densidad de esta variable aleatoria es:

f(t)={0si t<012πte−t2si t≥0f(t)=\begin{cases}0&\text{si }t<0\\ \frac{1}{\sqrt{2\pi t}}e^{-\frac{t}{2}}&\text{si }t\geq 0\end{cases}
Proposición III.8 (Propiedades de χ2k\chi^{2}_{k}).

propiedades

  1. 1.
    ​

    Si Z1,…,ZkZ_{1},\ldots,Z_{k} son independientes y Zi∼χ21Z_{i}\sim\chi^{2}_{1}, entonces:

    Z12+⋯+Zk2∼χ2k.Z_{1}^{2}+\cdots+Z_{k}^{2}\sim\chi^{2}_{k}\mathchar 46\relax

    El parámetro kk se denomina grados de libertad.

  2. 2.
    ​

    Si Y∼χ2kY\sim\chi^{2}_{k}, entonces:

    E(Y)=kVar(Y)=2k.E(Y)=k\qquad\operatorname{Var}(Y)=2k\mathchar 46\relax

χ2\chi^{2} depende únicamente de sus grados de libertad kk. En particular:

(n−1)S2σ2∼χ2n−1.\frac{(n-1)S^{2}}{\sigma^{2}}\sim\chi^{2}_{n-1}\mathchar 46\relax
\topruleEstadístico Distribución / aproximación Parámetros
\midruleX¯\overline{X} N(μ,σ2n)N\left(\mu,\frac{\sigma^{2}}{n}\right) si XX es normal
X¯\overline{X} ≈N(μ,σ2n)\approx N\left(\mu,\frac{\sigma^{2}}{n}\right) si nn es grande
p^\widehat{p} binomial transformada npnp
p^\widehat{p} ≈N(p,p(1−p)n)\approx N\left(p,\frac{p(1-p)}{n}\right) si nn es grande
S2S^{2} χ2n−1\chi^{2}_{n-1} si XX es normal
\bottomrule

Otros tipos de muestreo

Además del muestreo aleatorio simple, existen otros diseños muestrales que permiten seleccionar una muestra de una población. Los más habituales son:

  1. 1.
    ​

    Muestreo sistemático.

  2. 2.
    ​

    Muestreo estratificado.

  3. 3.
    ​

    Muestreo por conglomerados.

  4. 4.
    ​

    Muestreo por etapas.

La elección del diseño depende de la estructura de la población y de cómo se pueda acceder a sus elementos.

Muestreo sistemático: Los elementos de la población se numeran de 11 a NN. Se calcula el intervalo de selección:

k=⌊Nn⌋.k=\left\lfloor\frac{N}{n}\right\rfloor\mathchar 46\relax

Se elige aleatoriamente un elemento r∈{1,…,k}r\in\{1,\ldots,k\} y se seleccionan:

r,r+k,r+2k,…r,\;r+k,\;r+2k,\;\ldots
Ejemplo III.11.

Para N=300N=300 y n=15n=15:

k=30015=20.k=\frac{300}{15}=20\mathchar 46\relax

Si el primer elemento seleccionado es 1717:

17,37,57,…,29717,\;37,\;57,\;\ldots,\;297

Es especialmente sencillo cuando la población está ordenada o registrada en una lista.

Muestreo estratificado: La población se divide en estratos según una o varias características relevantes para el estudio. Se selecciona una muestra aleatoria dentro de cada estrato.

Ejemplo III.12.

Una población de 300300 personas está formada por 200200 mujeres y 100100 hombres. Para una muestra de 1515 personas, mediante afijación proporcional:

n1=15⋅200300=10,n2=15⋅100300=5.n_{1}=15\cdot\frac{200}{300}=10,\qquad n_{2}=15\cdot\frac{100}{300}=5\mathchar 46\relax

La estratificación permite garantizar la presencia de los distintos grupos y puede mejorar la precisión de las estimaciones.

Muestreo por conglomerados: La población se divide en conglomerados, que son conjuntos de elementos de la población. Se seleccionan aleatoriamente algunos conglomerados y se estudian sus elementos.

Ejemplo III.13.

Para estudiar las estancias hospitalarias:

  • ​

    Población: todas las estancias de los hospitales.

  • ​

    Conglomerados: hospitales.

  • ​

    Muestra: algunos hospitales seleccionados al azar.

Es útil cuando resulta más sencillo seleccionar y estudiar grupos de elementos que elementos individuales. A diferencia del muestreo estratificado, los conglomerados deberían ser representativos de la población en su conjunto.

Muestreo por etapas: La selección se realiza de forma sucesiva en diferentes niveles de la población.

Ejemplo III.14.

Provincias ⟶\longrightarrow hospitales ⟶\longrightarrow estancias.

En cada etapa se selecciona una muestra de las unidades obtenidas en la etapa anterior:

5 provincias⟶3 hospitales/provincia⟶100 estancias/hospital5\text{ provincias}\longrightarrow 3\text{ hospitales/provincia}% \longrightarrow 100\text{ estancias/hospital}

Permite diseñar muestras de poblaciones grandes y geográficamente dispersas.

\topruleDiseño Idea principal
\midruleAleatorio simple Elementos seleccionados directamente al azar
Sistemático Un elemento inicial + intervalo fijo
Estratificado Muestra aleatoria dentro de cada estrato
Conglomerados Se seleccionan grupos de elementos
Por etapas Selección sucesiva en varios niveles
\bottomrule

En esta asignatura nos centraremos en las inferencias basadas en muestras aleatorias simples.