7 Distribucion muestral de los estadisticos

ueremos estudiar el tiempo de conexion desde una terminal a un servidor. Repetimos el experimento nn veces bajo las mismas condiciones y obtenemos

X1,X2,…,XnX_{1},X_{2},\ldots,X_{n}

Cada XiX_{i} representa el resultado de una repeticion del experimento. Si todas ellas son independientes y se realizan bajo las mismas condiciones, podemos suponer

X1,…,Xn∼i.i.d.fXX_{1},\ldots,X_{n}\overset{\text{i.i.d.}}{\sim}f_{X}

Si repetimos el proceso, obtenemos otra muestra. Por tanto, una misma poblacion puede dar lugar a muchas muestras diferentes.

Esta variabilidad de una muestra a otra motiva el estudio de los estadisticos.

Definición III.15.

Un estadistico es un resumen de la muestra X1,…,XnX_{1},\ldots,X_{n}, y por tanto se expresa como funcion de la misma,

T=T(X1,…,Xn)T=T(X_{1},\ldots,X_{n})

La funcion TT puede ser escalar o vectorial.

Algunos ejemplos de estadistico son X¯,S2,mediana(X1,…,Xn)\overline{X},S^{2},\text{mediana}(X_{1},\ldots,X_{n}) o mı´niXi\mathop{\operator@font m\acute{{\imath}}n}_{i}X_{i}.

Como TT es funcion de variables aleatorias, T=T(X1,…,Xn)T=T(X_{1},\ldots,X_{n}) es tambien una variable aleatoria.

Definición III.16.

La distribucion de probabilidad de TT se denomina distribucion muestral de TT.

Supongamos que la poblacion tiene media

μ=E(X)\mu=E(X)

Queremos obtener informacion sobre la media poblacional μ\mu a partir de una m.a.s. X1,…,XnX_{1},\ldots,X_{n}.

Definición III.17.

La media muestral de X1,…,XnX_{1},\ldots,X_{n} se denota con X¯\overline{X} y se define como

X¯=1n∑i=1nXi\overline{X}=\frac{1}{n}\sum_{i=1}^{n}X_{i}

Se tiene que X¯\overline{X} es un estadistico y, como depende de la muestra, es una variable aleatoria.

Veamos algunas propiedades de la distribucion muestral de X¯\overline{X}.

Proposición III.5.

Sea X1,…,XnX_{1},\ldots,X_{n} una m.a.s. con E(Xi)=μE(X_{i})=\mu. Entonces

E(X¯)=μE(\overline{X})=\mu

Supongamos ademas que V(Xi)=σ2V(X_{i})=\sigma^{2}. Entonces

σX¯=σn\sigma_{\overline{X}}=\frac{\sigma}{\sqrt{n}}
Demostración.

Por linealidad de la esperanza,

E(X¯)=E(1n∑i=1nXi)=1n∑i=1nE(Xi)=1nnμ=μE(\overline{X})=E\left(\frac{1}{n}\sum_{i=1}^{n}X_{i}\right)=\frac{1}{n}\sum_{% i=1}^{n}E(X_{i})=\frac{1}{n}n\mu=\mu

Por otro lado, como las variables de las m.a.s. son independientes,

V(∑i=1nXi)=∑i=1nV(Xi)=nσ2V(\sum_{i=1}^{n}X_{i})=\sum_{i=1}^{n}V(X_{i})=n\sigma^{2}

Luego

V(X¯)=V(1n∑i=1nXi)=1n2nσ2=σ2n.V(\overline{X})=V\left(\frac{1}{n}\sum_{i=1}^{n}X_{i}\right)=\frac{1}{n^{2}}n% \sigma^{2}=\frac{\sigma^{2}}{n}\mathchar 46\relax

∎

Observación III.3.

La media muestral es un estimador insesgado de la media poblacional.

Para estudiar la proporción de individuos que poseen una determinada característica, definimos:

Xi={1,si la posee0,si no la poseeX_{i}=\begin{cases}1,&\text{si la posee}\\ 0,&\text{si no la posee}\end{cases}

entonces, Xi∼Bernoulli(p)X_{i}\sim\text{Bernoulli}(p)

Definición III.18 (Proporcion muestral).

La proporción muestral es:

p^=1n∑i=1nXi\widehat{p}=\frac{1}{n}\sum_{i=1}^{n}X_{i}

Como Xi∈{0,1}X_{i}\in\{0,1\}, la proporción muestral coincide con la media muestral:

p^=X¯\widehat{p}=\overline{X}

Si Xi∼i.i.d.X_{i}\overset{\text{i.i.d.}}{\sim} Bernoulli(pp) entonces N=∑i=1nXi∼Binomial(n,p)N=\sum_{i=1}^{n}X_{i}\sim\text{Binomial}(n,p).

Como p^=Nn\hat{p}=\frac{N}{n}, la distribucion de p^\hat{p} se obtiene a partir de la binomial:

P(p^=kn)=P(N=k)=(nk)pk(1−p)n−kP(\hat{p}=\frac{k}{n})=P(N=k)=\binom{n}{k}p^{k}(1-p)^{n-k}

Ademas,

E(p^)=p,V(p^)=p(1−p)nE(\hat{p})=p,\qquad V(\hat{p})=\frac{p(1-p)}{n}

Sea la varianza poblacional σ2=E[(X−μ)2]\sigma^{2}=E[(X-\mu)^{2}].

Definición III.19.

La varianza muestral es

S2=1n−1∑i=1n(Xi−X¯)2S^{2}=\frac{1}{n-1}\sum_{i=1}^{n}(X_{i}-\overline{X})^{2}
Definición III.20.

La desviacion tipica muestral es por lo tanto

S=S2S=\sqrt{S^{2}}

Para los datos observados x1,…,xnx_{1},\ldots,x_{n}:

s2=1n−1∑i=1n(xi−x¯)2s^{2}=\frac{1}{n-1}\sum_{i=1}^{n}(x_{i}-\overline{x})^{2}

En la varianza muestral aparecen desviaciones respecto de la propia media muestral:

Xi−X¯X_{i}-\overline{X}

Estas desviaciones siempre cumplen

∑i=1n(Xi−X¯)=0\sum_{i=1}^{n}(X_{i}-\overline{X})=0

Por tanto, conocidas n−1n-1 de ellas, la ultima queda determinada. Esto implica que hay n−1n-1 grados de libertad.

El factor 1/(n−1)1/(n-1) hace que la varianza muestral sea un estimador insesgado de la varianza poblacional:

E(S2)=σ2E(S^{2})=\sigma^{2}

Como resumen, se tiene lo siguiente

\topruleEstadístico Parámetro Esperanza
\midruleX¯\overline{X} μ\mu E(X¯)=μE(\overline{X})=\mu
p^\widehat{p} pp E(p^)=pE(\widehat{p})=p
S2S^{2} σ2\sigma^{2} E(S2)=σ2E(S^{2})=\sigma^{2}
\bottomrule

Además,

Var(X¯)=σ2nVar(p^)=p(1−p)n\operatorname{Var}(\overline{X})=\frac{\sigma^{2}}{n}\qquad\operatorname{Var}(% \widehat{p})=\frac{p(1-p)}{n}