1 Estadistica descriptiva

La estadistica descriptiva es la ciencia que estudia como debe emplearse la informacion y como dar una guia de accion en situaciones practicas que entrañan incertidumbre.

Se ocupa de la recopilacion, organizacion y resumen de los datos, con el fin de extraer informacion de los mismos. En el comienzo de cualquier estudio se debe saber que es lo que se desea medir o investigar y para que. Una correcta seleccion de datos preliminares ahorrara tiempo y coste en un estudio.

Las fases de un estudio cuantitativo son las siguientes:

  1. 1.

    Planteamiento del problema: definir el objetivo de la investigacion y precisar la poblacion a la que se refiere.

  2. 2.

    Recogida de la informacion:

    • Exhaustiva (toda la poblacion).

    • Muestreo (una parte representativa de la poblacion).

    • Diseño de los experimentos (hacer una recogida adecuada de los datos).

  3. 3.

    Depuracion de los datos

  4. 4.

    Analisis descriptivo de los datos

  5. 5.

    Conclusiones

1.1 Conceptos basicos

Definición I.1 (Poblacion y muestra).

El conjunto de individuos o unidades estadisticas de observacion sobre los que se va a realizar el estudio.

Un censo es una relacion exhaustiva de los individuos de la poblacion.

Cuando no es posible analizar toda la poblacion, se puede tomar un subconjunto de elementos de la poblacion, que se denomina muestra.

Si se quiere hacer inferencias sobre la poblacion a partir de la muestra, debe ser representativa, de tamaño minimo y debe haber sido seleccionada de forma aleatoria.

Distinguimos los siguientes elementos:

  • Individuo o unidad de analisis: objeto bajo estudio.

  • Variable: cualquier caracteristica de la unidad de observacion que interese registrar.

  • Valor de una variable, dato, observacion u medicion: numero o codigo que describe a la caracteristica de interes en una unidad particular.

  • Caso o registro: conjunto de mediciones realizadas sobre un individuo.

Las variables pueden clasificarse en dos grandes tipos: cuantitativas y cualitativas.

Las variables cuantitativas son aquellas cuyos valores se pueden expresar en cantidades numericas. A su vez se clasifican en discretas, si toman valores en un conjunto numerable de valores, o continuas, si el conjunto es no numerable.

Las variables cualitativas son aquellas que solo se pueden clasificar y no medir. Se miden en escala nominal u ordinal.

Definición I.2 (Tabla de frecuencia).

Sea una poblacion estadistica de nn individuos o registros, descrita segun un caracter o variable CC, cuyas modalidades han sido agrupadas en un numero kk de clases o categorias, que denotamos mediante c1,c2,,ckc_{1},c_{2},\ldots,c_{k}. La tabla de frecuencia consiste en lo siguiente:

[Uncaptioned image]
Ejemplo I.1.

Se ha medido la siguiente caracteristica: EDAD en una muestra de 30 individuos. Los resultados obtenidos son:

8,8,8,8,8,8,8,8,10,10,10,10,10,10,10,10,12,12,12,12,12,12,12,14,14,14,14,14,14,14{}8,8,8,8,8,8,8,8,10,10,10,10,10,10,10,10,12,12,12,12,12,12,12,14,14,14,14,14,% 14,14

La tabla de frecuencia es la siguiente

Valor Frec. absoluta Frec. relativa
88 88 0,26670{,}2667
1010 88 0,26670{,}2667
1212 77 0,23340{,}2334
1414 77 0,23340{,}2334
Total 3030 11
Definición I.3 (Media).

La media representa el centro de gravedad de los datos. Se calcula solo para variables cuantitativas. Su calculo depende de como se presenten los datos:

  • no agrupados: x¯=i=1nxin\overline{x}=\frac{\sum_{i=1}^{n}x_{i}}{n}

  • discretos y agrupados: x¯=1n(x1n1++xknk)=1ni=1kxini\overline{x}=\frac{1}{n}(x_{1}n_{1}+\cdots+x_{k}n_{k})=\frac{1}{n}\sum_{i=1}^{% k}x_{i}n_{i}

  • continuos y agrupados: x¯=1n(c1n1++cknk)=1ni=1kcini\overline{x}=\frac{1}{n}(c_{1}n_{1}+\cdots+c_{k}n_{k})=\frac{1}{n}\sum_{i=1}^{% k}c_{i}n_{i}

Definición I.4 (Moda).

La moda es el valor que mas se repite. Se utiliza al analizar variables cualitativas.

Definición I.5 (Mediana).

La mediana es el valor tal que, ordenados los datos de forma creciente o decreciente, deja a cada uno de sus lados la mitad de las observaciones.

Si los datos no estan agrupados, es la observacion que ocupa la posicion n2+1\frac{n}{2}+1 si nn es impar, o a la semisuma de los valores que ocupan las posiciones n2\frac{n}{2} y n2+1\frac{n}{2}+1 si nn es par.

Para datos agrupados en tabla, sera el primer valor cuya frecuencia acumulada sea mayor o igual a n2.\frac{n}{2}\mathchar 46\relax

Si la variable es de tipo continua y los datos estan agrupados, la mediana es una aproximacion. Es una medida robusta.

Definición I.6 (Percentil).

El percentil de orden pp, con 0p10\leq p\leq 1, es el valor de los datos que deja a su izquierda el 100p%100\cdot p\%{} de los datos de la muestra.

La mediana es el percentil 0,50{,}5, y se suele trabajar con los cuartiles Q1=0,25Q1=0{,}25, Q2=0,5=MeQ2=0{,}5=\text{Me}, Q3=0,75Q3=0{,}75.

Las medidas de centralizacion indican cuanto varian los datos:

  • Desviación Media DM=i=1n|xix¯|n\rightarrow DM=\frac{\sum_{i=1}^{n}|x_{i}-\bar{x}|}{n} (i=1K|xix¯|nin\frac{\sum_{i=1}^{K}|x_{i}-\bar{x}|n_{i}}{n} grupos) .

  • Varianza S2=i=1n(xix¯)2n=1ni=1nxi2x¯2S^{2}=\frac{\sum_{i=1}^{n}(x_{i}-\bar{x})^{2}}{n}=\frac{1}{n}\sum_{i=1}^{n}x_{% i}^{2}-\bar{x}^{2}.

  • Desviación estándar S=i=1n(xix¯)2nS=\sqrt{\frac{\sum_{i=1}^{n}(x_{i}-\bar{x})^{2}}{n}}.

  • Cuasi-varianza s2=i=1n(xix¯)2n1=nS2n1s^{2}=\frac{\sum_{i=1}^{n}(x_{i}-\bar{x})^{2}}{n-1}=\frac{nS^{2}}{n-1}

  • Cuasi-desviación estándar s=i=1n(xix¯)2n1s=\sqrt{\frac{\sum_{i=1}^{n}(x_{i}-\bar{x})^{2}}{n-1}}

  • Rango R=max{x1,,xn}min{x1,,xn}R=max\{x_{1},\dots,x_{n}\}-min\{x_{1},\dots,x_{n}\}

  • Rango intercuartílico RI=Q3Q1RI=Q_{3}-Q_{1}

Para comparar la dispersion, se utiliza el coeficiente de variacion CV=sxCV=\frac{s}{x}.

Definición I.7 (Medida de asimetria).

La medida de asimetria toma como referencia la distribucion normal, y se calcula como

γ1=1ni=1n(xix¯)3S3\gamma_{1}=\frac{\frac{1}{n}\sum_{i=1}^{n}(x_{i}-\overline{x})^{3}}{S^{3}}

siendo la distribucion asimetrica positiva o hacia la derecha si el valor es positivo y hacia la izquierda si es negativo.

Refer to caption
Figura 1: Asimetrias
Definición I.8.

El coeficiente de curtosis tambien toma como referencia la distribucion normal, y se calcula como

γ2=1ni=1n(xix¯)4S43\gamma_{2}=\frac{\frac{1}{n}\sum_{i=1}^{n}(x_{i}-\overline{x})^{4}}{S^{4}}-3

siendo la distribucion mas apuntalada si el valor es positivo y menos si es negativo.

Refer to caption
Figura 2: Formas

Los box plots se basan en los estadisticos de orden minimo, maximo, mediana y cuartiles. Muestran cinco medidas de posicion, permiten estudiar la simetria de los datos y dan un criterio de deteccion de datos atipicos. A continuacion se muestra un ejemplo:

Refer to caption
Figura 3: Box plot

1.2 Analisis bivariante

Los datos bivariantes proceden de la observacion simultanea de dos variables, que podemos llamar XX e YY, en una poblacion de nn individuos. Este tipo de datos son pares de la forma (x1,y1),,(xn,yn)(x_{1},y_{1}),\ldots,(x_{n},y_{n}).

Para describirlo, se analiza el comportamiento de cada variable por separado, se describe el comportamiento conjunto de las dos variables y se explora el tipo de relacion que existe entre ellas. Ademas, se puede representar la distribucion con una tabla de doble entrada, de forma que cada celda contiene la frecuencia absoluta conjunta de ambas variables.

1.2.1 Asociación lineal

Consideremos dos magnitudes XX e YY, de las que tenemos nn datos (X1,Y1),(X2,Y2),,(XN,YN)(X_{1},Y_{1}),(X_{2},Y_{2}),\dots,(X_{N},Y_{N}).

Una medida de la variación conjunta de XX e YY se llama covarianza, se designa por Cov(X,Y)Cov(X,Y) y viene definida por:

𝐂𝐨𝐯(X,Y)=i=1kj=1l(xix¯)(yiy¯)nijN\mathbf{Cov}(X,Y)=\frac{\sum_{i=1}^{k}\sum_{j=1}^{l}(x_{i}-\overline{x})(y_{i}% -\overline{y})\,n_{ij}}{N}
𝐂𝐨𝐯(X,Y)=i=1NxiyiNxy¯\mathbf{Cov}(X,Y)=\frac{\sum_{i=1}^{N}x_{i}y_{i}}{N}-\overline{xy}

El hecho de que la medida de covarianza dependa de la unidad de medida de las variables, lleva a utilizar una nueva medida de asociacion lineal adimensional. Existen indices de asociacion lineal para este caso, llamados correlacion de Pearson y correlacion de Spearman:

r=1n1i=1n(xix¯)(yiy¯)sxsy=Cov(X,Y)sxsyr=\frac{1}{n-1}\frac{\sum_{i=1}^{n}(x_{i}-\overline{x})(y_{i}-\overline{y})}{s% _{x}s_{y}}=\frac{Cov(X,Y)}{s_{x}s_{y}}

Si rr es cercano a 1,1, hay asociacion lineal directa entre XX e YY. Si rr es cercano a 1-1, hay asociacion lineal inversa entre XX e y YY. Por ultimo, si rr es cercano a 0, no hay asociacion entre XX e YY.

1.2.2 Regresión lineal

Si queremos cuantificar dicha relacion, necesitamos conocer la relacion funcional entre la variable dependiente YY y la variable independiente XX. Para ello, usamos la regresion.

En el caso mas sencillo, cuando la relacion es lineal, el problema consiste en calcular la recta Y=a+bXY=a+bX que mejor se ajuste a los datos.

Los parametros aa y bb se calculan imponiendo la condicion de que la suma de los cuadrados de las distancias de los puntos a la recta Y=a+bXY=a+bX debe ser minima, es decir, se minimiza

d=k=1N[YiY^i]2,d=\sum_{k=1}^{N}[Y_{i}-\hat{Y}_{i}]^{2},

donde YiY_{i} es el valor observado e Y^i=a+bXi\hat{Y}_{i}=a+bX_{i} el valor estimado. A la diferencia ei=YiY^ie_{i}=Y_{i}-\hat{Y}_{i} se le llama residuo.

Por tanto, es necesario resolver el siguiente sistema de ecuaciones:

{da=0k=1NYk=Na+bk=1NXkdb=0k=1NXkYk=ak=1NXk+bk=1NX2k\begin{cases}\frac{\partial d}{\partial a}=0\Rightarrow\sum_{k=1}^{N}Y_{k}=N% \cdot a+b\sum_{k=1}^{N}X_{k}\\ \frac{\partial d}{\partial b}=0\Rightarrow\sum_{k=1}^{N}X_{k}Y_{k}=a\sum_{k=1}% ^{N}X_{k}+b\sum_{k=1}^{N}X^{2}_{k}\end{cases}

y se obtiene la solucion

a^=Y¯b^X¯;b^=k=1N(YkY¯)(XkX¯)k=1N(XkX¯)2=SXYS2Y.\hat{a}=\overline{Y}-\hat{b}\overline{X};\quad\hat{b}=\frac{\sum_{k=1}^{N}(Y_{% k}-\overline{Y})(X_{k}-\overline{X})}{\sum_{k=1}^{N}(X_{k}-\overline{X})^{2}}=% \frac{S_{XY}}{S^{2}_{Y}}\mathchar 46\relax
Observación I.1.

Asi, podemos expresar la recta de regresion lineal simple como

yy¯=SXYSXX(xx¯)=Cov(X,Y)S2X(xx¯)y-\overline{y}=\frac{S_{XY}}{S_{XX}}(x-\overline{x})=\frac{Cov(X,Y)}{S^{2}_{X}% }(x-\overline{x})

El coeficiente de determinacion, denominado R2R^{2}, mide que porcentaje de la variacion de una variable dependiente se puede explicar por el modelo estadistico. Para definir su valor, partimos de la siguiente igualdad (descomposicion de la varianza):

k=1NYk2=k=1NY^k2+k=1Nek2k=1N(YkY¯)2VT=k=1N(Y^kY¯)2VR+k=1Nek2Ve.\sum_{k=1}^{N}Y_{k}^{2}=\sum_{k=1}^{N}\hat{Y}_{k}^{2}+\sum_{k=1}^{N}e_{k}^{2}% \iff\underbrace{\sum_{k=1}^{N}(Y_{k}-\bar{Y})^{2}}_{V_{T}}=\underbrace{\sum_{k% =1}^{N}(\hat{Y}_{k}-\bar{Y})^{2}}_{V_{R}}+\underbrace{\sum_{k=1}^{N}e_{k}^{2}}% _{V_{e}}\mathchar 46\relax

Cuanto mas parecidas sean VTV_{T} y VRV_{R} mejor sera la estimacion, pues en ese caso la mayor parte de la variabilidad de YY vendria explicada por la regresion realizada.

La expresion de R2R^{2} es:

R2=VRVT=1VeVTR2=S2Y^S2Y=1S2eS2Y;0R1R^{2}=\frac{V_{R}}{V_{T}}=1-\frac{V_{e}}{V_{T}}\iff R^{2}=\frac{S^{2}_{\hat{Y}% }}{S^{2}_{Y}}=1-\frac{S^{2}_{e}}{S^{2}_{Y}};0\leq R\leq 1

Cabe destacar que este valor solo mide la bondad del ajuste lineal, pero puede existir otro tipo de dependencia.

Observación I.2.

Un modelo de regresion lineal supone las siguientes condiciones, que deben verificarse previamente:

  • Los residuos son normales de media 0 y varianza comun desconocida σ2\sigma^{2}. Ademas, estos residuos son independientes.

  • El numero de variables explicativas (kk) es menor que el de observaciones (n)(n).

  • No existen relaciones lineales exactas entre las variables explicativas.