10 Principio de suficiencia: estadístico suficiente y estadístico suficiente minimal

10.1 Introducción

Al realizar un experimento aleatorio, disponemos de una serie de datos (muestra) x1,…,xnx_{1},\ldots,x_{n}, que corresponden a la observacion de una coleccion de variables aleatorias X1,…,XnX_{1},\ldots,X_{n}.

Como se establecio en el tema de introduccion de la asignatura, el objetivo es hacer inferencias acerca de la poblacion de la cual se ha tomado la muestra.

En la rama de la estadistica parametrica, lo que se supone es que la caracteristica de la poblacion de estudio, XX, (por ejemplo tener o no una enfermedad rara, tiempo de procesamiento, etc.) sigue una distribucion parametrica (binomial, exponencial, normal…), caracterizadas por unos parametros, que denotamos por θ\theta.

El objetivo es usar esta informacion de la muestra para realizar inferencias y obtener conclusiones acerca de θ\theta. A este parametro le llamamos parametro de interes o parametro objetivo.

10.2 Reduccion de datos mediante estadisticos

En general, resumimos la informacion contenida en la muestra a partir de una serie de estadisticos que resumen diferentes aspectos de la muestra.

Cada estadistico T(X)T(X) define una forma de reducir/resumir los datos. Por ello, habra estadisticos que sean utiles para aprender sobre un parametro, y otros mas utiles para aprender sobre otro parametro.

Si utilizamos el valor observado T(x)T(x) en lugar de la muestra completa xx, dos muestras xx e yy seran tratadas de la misma forma cuando:

T(x)=T(y)T(x)=T(y)

Aunque las muestras sean diferentes.

Podemos utilizar distintos estadisticos para resumir la misma muestra. La cuestion es determinar que informacion de la muestra es relevante para realizar inferencias sobre θ\theta.

El objetivo es evitar descartar informacion importante de θ\theta e identificar que informacion de la muestra es relevante para aprender sobre θ\theta.

Esto se formaliza con el concepto de suficiencia.

10.3 Estadistico suficiente

Un estadistico suficiente para un parametro θ\theta es aquel que, en cierto sentido, recoge toda la informacion sobre θ\theta contenida en la muestra.

Definición IV.1 (Principio de suficiencia).

Si T(x)T(x) es un estadistico suficiente para θ\theta, entonces cualquier inferencia sobre θ\theta depende de la muestra XX solo a traves de T(X)T(X). Es decir, si xx e yy son dos puntos muestrales, tales que T(x)=T(y)T(x)=T(y), entonces la inferencia sobre θ\theta basada en X=xX=x sera la misma que si se observa X=yX=y.

Definición IV.2 (Estadistico suficiente).

Un estadistico T(X)T(X) es un estadistico suficiente para θ\theta si la distribucion condicional de la muestra XX dado el valor de T(X)T(X) no depende de θ\theta.

Supongamos que la distribucion de T(X)=xT(X)=x es discreta (en el caso continuo es un poco mas sofisticada la nocion de probabilidad condicional, porque los puntos tienen probabilidad 0). Podemos interpretar esta condicion mediante probabilidades condicionales:

P(X=x∣T(X)=t)P(X=x\mid T(X)=t)
Teorema IV.1 (de factorizacion).

Sea f(x∣θ)f(x\mid\theta) la densidad conjunta de la muestra.

T(X)T(X) es un estadistico suficiente para θ\theta si y solo si existen funciones gg y hh tales que

f(x∣θ)=g(T(x)∣θ)h(x)f(x\mid\theta)=g(T(x)\mid\theta)h(x)

para todos los puntos muestrales xx y todos los valores de θ\theta.

Ejemplo IV.1 (Modelo binomial).

Sean X1,…,XnX_{1},\ldots,X_{n} variables aleatorias i.i.d. Bernoulli con parametro θ\theta. Queremos mostrar que T(X)=X1+⋯+XnT(X)=X_{1}+\cdots+X_{n} es un estadistico suficiente para θ\theta.

La distribucion conjunta es f(x∣θ)=∏i=1nθxi(1−θ)1−xif(x\mid\theta)=\prod\limits_{i=1}^{n}\theta^{x_{i}}(1-\theta)^{1-x_{i}}. Por tanto,

f(x∣θ)=θ∑ixi(1−θ)n−∑ixif(x\mid\theta)=\theta^{\sum_{i}x_{i}}(1-\theta)^{n-\sum_{i}x_{i}}

La dependencia respecto de θ\theta aparece unicamente a traves de

T(X)=∑ixiT(X)=\sum_{i}x_{i}

Por el teorema de factorizacion T(X)=∑i=1nXiT(X)=\sum_{i=1}^{n}X_{i} es suficiente para θ\theta.

Ejemplo IV.2 (Modelo normal).

Sean X1,…,Xn∼i.i.d.N(μ,σ2)X_{1},\ldots,X_{n}\overset{i\mathchar 46\relax i\mathchar 46\relax d\mathchar 4% 6\relax}{\sim}N(\mu,\sigma^{2}) con σ2\sigma^{2} conocida.

Queremos mostrar que la media muestral:

X¯=1n∑i=1nXi\overline{X}=\frac{1}{n}\sum_{i=1}^{n}X_{i}

es un estadistico suficiente para μ\mu.

La densidad conjunta es

f(𝐱∣μ)=1(2πσ2)n/2exp{−12σ2∑i=1n(xi−μ)2}f(\mathbf{x}\mid\mu)=\frac{1}{(2\pi\sigma^{2})^{n/2}}\exp\left\{-\frac{1}{2% \sigma^{2}}\sum_{i=1}^{n}(x_{i}-\mu)^{2}\right\}

Desarrollando el exponente:

∑i=1n(xi−μ)2=∑i=1nxi2−2μ∑i=1nxi+nμ2\sum_{i=1}^{n}(x_{i}-\mu)^{2}=\sum_{i=1}^{n}x_{i}^{2}-2\mu\sum_{i=1}^{n}x_{i}+% n\mu^{2}

Por tanto:

f(𝐱∣μ)=1(2πσ2)n/2exp{−12σ2∑i=1nxi2}⏟h(𝐱)exp{μσ2∑i=1nxi−nμ22σ2}⏟g(T(𝐱)∣μ).f(\mathbf{x}\mid\mu)=\frac{1}{(2\pi\sigma^{2})^{n/2}}\underbrace{\exp\left\{-% \frac{1}{2\sigma^{2}}\sum_{i=1}^{n}x_{i}^{2}\right\}}_{h(\mathbf{x})}% \underbrace{\exp\left\{\frac{\mu}{\sigma^{2}}\sum_{i=1}^{n}x_{i}-\frac{n\mu^{2% }}{2\sigma^{2}}\right\}}_{g(T(\mathbf{x})\mid\mu)}\mathchar 46\relax

Como ∑i=1nxi=nx¯\sum_{i=1}^{n}x_{i}=n\overline{x} concluimos que X¯\overline{X} es suficiente para μ\mu.

Observación IV.1.

El teorema debe aplicarse teniendo en cuenta el soporte de la distribucion.

Si el soporte depende de θ\theta, esta dependencia debe quedar recogida correctamente en la factorizacion.

Veamos un ejemplo en el que el soporte depende del parametro.

Ejemplo IV.3 (Uniforme discreto).

Sean X1,…,XnX_{1},\ldots,X_{n} variables aleatorias i.i.d. uniformes discretas en

{1,2,…,θ}\left\{1,2,\ldots,\theta\right\}

La funcion de probabilidad conjunta es

f(x∣θ)=1θn∏i=1nI{1,…,θ}(xi)f(x\mid\theta)=\frac{1}{\theta^{n}}\prod\limits_{i=1}^{n}I_{\left\{1,\ldots,% \theta\right\}}(x_{i})

Observamos que la condicion de pertenencia al soporte puede expresarse mediante: ma´x{x1,…,xn}≤θ\mathop{\operator@font m\acute{a}x}\left\{x_{1},\ldots,x_{n}\right\}\leq\theta.

Por tanto:

f(x∣θ)=1θnI{ma´xixi≤θ}f(x\mid\theta)=\frac{1}{\theta^{n}}I_{\{\operatorname{m\acute{a}x}\limits_{i}x% _{i}\leq\theta\}}

Definiendo:

T(X)=ma´x{X1,…,Xn}T(X)=\operatorname{m\acute{a}x}\{X_{1},\dots,X_{n}\}

Podemos escribir:

f(x∣θ)=1θnI{T(x)≤θ}⏟g(T(x)∣θ)1⏟h(x)f(x\mid\theta)=\underbrace{\frac{1}{\theta^{n}}I_{\{T(x)\leq\theta\}}}_{g(T(x)% \mid\theta)}\underbrace{1}_{h(x)}

Por el Teorema de factorización T(X)=ma´x{X1,…,Xn}T(X)=\operatorname{m\acute{a}x}\{X_{1},\dots,X_{n}\} es un estadístico suficiente para θ\theta.

La dependencia de θ\theta a través del soporte queda recogida por T(x)=ma´xixiT(x)=\operatorname{m\acute{a}x}\limits_{i}x_{i}.

En los ejemplos anteriores, el estadistico suficiente era una funcion real de la muestra.

Es decir, toda la informacion relevante para el parametro de interes estaba contenida en un unico numero T(x)T(x). En algunas ocasiones, son necesarios varios estadisticos. En estos casos,

Definición IV.3 (Estadistico suficiente vectorial).
T(x)=(T1(X),…,Tr(X))T(x)=(T_{1}(X),\ldots,T_{r}(X))

Esta situacion es frecuente cuando el parametro de interes es tambien un vector: θ=(θ1,…,θs)\theta=(\theta_{1},\ldots,\theta_{s}).

Ejemplo IV.4 (Modelo normal vectorial).

Consideremos ahora X1,…,Xn∼i.i.d.N(μ,σ2)X_{1},\ldots,X_{n}\overset{i\mathchar 46\relax i\mathchar 46\relax d\mathchar 4% 6\relax}{\sim}N(\mu,\sigma^{2}) con θ=(μ,σ2)\theta=(\mu,\sigma^{2}), es decir, ambos parametros son desconocidos.

La densidad conjunta es

f(𝐱∣μ,σ2)=1(2πσ2)n/2exp{−12σ2∑i=1n(xi−μ)2}.f(\mathbf{x}\mid\mu,\sigma^{2})=\frac{1}{(2\pi\sigma^{2})^{n/2}}\exp\left\{-% \frac{1}{2\sigma^{2}}\sum_{i=1}^{n}(x_{i}-\mu)^{2}\right\}\mathchar 46\relax

Como

∑i=1n(xi−μ)2=∑i=1nxi2−2μ∑i=1nxi+nμ2\sum_{i=1}^{n}(x_{i}-\mu)^{2}=\sum_{i=1}^{n}x_{i}^{2}-2\mu\sum_{i=1}^{n}x_{i}+% n\mu^{2}

La densidad conjunta depende de la muestra, respecto a (μ,σ2)(\mu,\sigma^{2}), a traves de ∑i=1nxi\sum_{i=1}^{n}x_{i} y ∑i=1nx2i\sum_{i=1}^{n}x^{2}_{i}.

Por tanto, un estadistico suficiente es

T(X)=(∑i=1nXi,∑i=1nXi2)\boxed{T(X)=\left(\sum_{i=1}^{n}X_{i},\sum_{i=1}^{n}X_{i}^{2}\right)}

Equivalentemente, podemos utilizar:  T(X)=(X¯,S2)

Hasta ahora hemos encontrado un estadistico suficiente para cada modelo considerado. Sin embargo, para cada problema existen, en general, muchos estadisticos suficientes.

Supongamos que T(X)T(X) es suficiente y definimos

T∗(x)=r(T(x))T^{\ast}(x)=r(T(x))

donde rr es una funcion con inversa r−1r^{-1}.

Por el teorema de factorizacion:

f(x∣θ)=g(T(x)∣θ)h(x)f(x\mid\theta)=g(T(x)\mid\theta)h(x)

Como

T(X)=r−1(T∗(x))T(X)=r^{-1}(T^{\ast}(x))

tenemos

f(x∣θ)=g(r−1(T∗(x))∣θ)h(x)f(x\mid\theta)=g(r^{-1}(T^{\ast}(x))\mid\theta)h(x)

Por tanto, T∗(X)T^{\ast}(X) tambien es suficiente.

Definición IV.4.

Un estadistico suficiente T(X)T(X) es un estadistico suficiente minimal si, para cualquier otro estadistico suficnete T∗(X)T^{\ast}(X), T(X)T(X) es funcion de T∗(X)T^{\ast}(X).

Decir que T(X)T(X) es funcion de T∗(X)T^{\ast}(X) significa que

T∗(x)=T∗(y)⇒T(x)=T(y)T^{\ast}(x)=T^{\ast}(y)\Rightarrow T(x)=T(y)

Un estadistico suficiente minimal es el estadistico suficiente que conserva la informacion relevante con la mayor reduccion posible de los datos.

Para encontrar un estadistico suficiente minimal, usaremos el siguiente procedimiento.

Proposición IV.1.

Sea T(X)T(X) un estadistico suficiente.

Si, para c ualesquiera xx e yy con densidades positivas,

f(x∣θ)y∣θ∀\frac{f(x\mid\theta)}{y\mid\theta\forall}

es constante como funcion de θ\theta si y solo si T(x)=T(y)T(x)=T(y).

Entonces T(X)T(X) es un estadistico suficiente minimal.