LOE/LOMLOE (BOE)Matemáticas Aplicadas a las CCSS I1º de Bachillerato7 min de lectura

Estadística descriptiva bidimensional

En la estadística unidimensional estudiamos una sola característica de una población (por ejemplo, la altura). Sin embargo, en la realidad, los fenómenos suelen estar relacionados.

Lectura4 partesUn recorrido editorial y navegable.
Práctica12 preguntasTest y tarjetas de memoria para abrir después de leer.
Objetivo1º de BachilleratoFormato rápido para comprobar si el tema encaja.
Parte 1

Distribuciones Bidimensionales y Tablas de Contingencia

Variables estadísticas bidimensionales

En la estadística unidimensional estudiamos una sola característica de una población (por ejemplo, la altura). Sin embargo, en la realidad, los fenómenos suelen estar relacionados. Una variable estadística bidimensional (X,Y)(X, Y) surge cuando observamos simultáneamente dos caracteres en cada individuo de una muestra de tamaño nn.

Los datos se presentan como pares de valores (xi,yi)(x_i, y_i), donde xix_i es el valor de la primera variable y yiy_i el de la segunda para el mismo individuo. La forma más intuitiva de visualizar esta relación es mediante la nube de puntos o diagrama de dispersión, que consiste en representar cada par de datos como un punto en un sistema de ejes cartesianos.

La nube de puntos permite apreciar visualmente si existe algún tipo de relación o tendencia entre las dos variables antes de realizar cálculos complejos.

Organización de datos en tablas

Cuando el número de datos es muy grande o los valores se repiten con frecuencia, utilizamos tablas de doble entrada o tablas de contingencia. En ellas:

  • Las filas representan los valores de la variable XX.
  • Las columnas representan los valores de la variable YY.
  • nijn_{ij} es la frecuencia absoluta conjunta, es decir, el número de veces que aparece simultáneamente el par (xi,yj)(x_i, y_j).

La suma de todas las frecuencias conjuntas debe ser igual al tamaño total de la muestra NN: nij=N\sum \sum n_{ij} = N

Distribuciones marginales

A partir de una tabla bidimensional, podemos estudiar cada variable por separado. Estas se denominan distribuciones marginales:

  1. Distribución marginal de X: Se obtiene sumando las frecuencias de todas las columnas para cada fila. Nos indica cómo se comporta XX sin tener en cuenta a YY.
  2. Distribución marginal de Y: Se obtiene sumando las frecuencias de todas las filas para cada columna.

Las frecuencias marginales se denotan como nin_{i \cdot} (para XX) y njn_{\cdot j} (para YY).

Distribuciones condicionadas

A veces nos interesa estudiar cómo se comporta una variable cuando la otra toma un valor fijo. Esto es la distribución condicionada. Por ejemplo, "¿cuál es la distribución de la altura (YY) condicionada a que el individuo sea hombre (X=x1X=x_1)?".

Se dice que dos variables son estadísticamente independientes si el comportamiento de una no influye en la otra. Matemáticamente, esto ocurre si para todos los pares se cumple que: nijN=niNnjN\frac{n_{ij}}{N} = \frac{n_{i \cdot}}{N} \cdot \frac{n_{\cdot j}}{N} Si existe independencia, las distribuciones condicionadas coinciden con las marginales.


Parte 2

Medidas de Relación Lineal: Covarianza

Centro de gravedad de la distribución

En una distribución bidimensional, el punto que representa el promedio de ambos caracteres se llama centro de gravedad. Se denota como (xˉ,yˉ)(\bar{x}, \bar{y}) y sus coordenadas son las medias aritméticas de las distribuciones marginales: xˉ=xin,yˉ=yin\bar{x} = \frac{\sum x_i}{n}, \quad \bar{y} = \frac{\sum y_i}{n} Este punto es fundamental, ya que la recta de regresión siempre pasará por él.

Concepto y cálculo de la covarianza

La covarianza, denotada como sxys_{xy} o σxy\sigma_{xy}, es una medida que indica el grado de variación conjunta de dos variables aleatorias respecto a sus medias. Su fórmula de definición es: sxy=(xixˉ)(yiyˉ)ns_{xy} = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{n}

Para facilitar los cálculos, solemos usar la fórmula simplificada: sxy=xiyinxˉyˉs_{xy} = \frac{\sum x_i y_i}{n} - \bar{x} \cdot \bar{y}

El signo de la covarianza nos da información crucial:

  • Si sxy>0s_{xy} > 0: La relación es directa (al aumentar XX, tiende a aumentar YY).
  • Si sxy<0s_{xy} < 0: La relación es inversa (al aumentar XX, tiende a disminuir YY).

Limitaciones de la covarianza

Aunque la covarianza nos indica la dirección de la relación, tiene un problema principal: depende de las unidades de medida. Si medimos la altura en metros o en centímetros, el valor de la covarianza cambiará drásticamente, aunque la relación entre las variables sea la misma. Por ello, la covarianza no sirve para comparar la intensidad de la relación entre distintos pares de variables.


Parte 3

Correlación Lineal y el Coeficiente de Pearson

El coeficiente de correlación de Pearson

Para solucionar las limitaciones de la covarianza, Karl Pearson definió el coeficiente de correlación lineal (rr). Se obtiene dividiendo la covarianza por el producto de las desviaciones típicas de cada variable: r=sxysxsyr = \frac{s_{xy}}{s_x \cdot s_y}

Este coeficiente tiene dos propiedades fundamentales:

  1. Es adimensional: No tiene unidades, lo que permite comparar diferentes estudios.
  2. Su rango es [1,1][-1, 1]: Siempre estará comprendido entre estos dos valores.

Interpretación de la fuerza de asociación

El valor de rr nos indica la fuerza y el sentido de la relación lineal:

  • r=1r = 1: Correlación lineal positiva perfecta. Los puntos están exactamente sobre una recta creciente.
  • r=1r = -1: Correlación lineal negativa perfecta. Los puntos están sobre una recta decreciente.
  • r0r \approx 0: Ausencia de relación lineal (las variables están incorreladas).
  • 0.7<r<10.7 < |r| < 1: Correlación fuerte.
  • r<0.3|r| < 0.3: Correlación débil.

Correlación vs Causalidad

Es vital entender que la existencia de correlación no implica necesariamente causalidad. Que dos variables varíen juntas no significa que una sea la causa de la otra.

  • Ejemplo clásico: Existe una alta correlación entre el consumo de helados y los ahogamientos en piscinas. ¿Significa esto que comer helado causa ahogamientos? No, existe una variable de confusión (el calor del verano) que aumenta ambas variables de forma independiente.

Parte 4

Regresión Lineal: La Recta de Regresión

El método de mínimos cuadrados

Si observamos una correlación fuerte, nuestro objetivo es encontrar la función matemática que mejor se ajuste a la nube de puntos. En este nivel, buscamos la recta de regresión.

El método utilizado es el de mínimos cuadrados, que consiste en encontrar la recta que hace mínima la suma de los cuadrados de los residuos (la distancia vertical entre cada punto de la nube y la recta).

Ecuación de la recta de regresión

La recta de regresión de YY sobre XX (usada para predecir YY conociendo XX) tiene la forma: yyˉ=sxysx2(xxˉ)y - \bar{y} = \frac{s_{xy}}{s_x^2} (x - \bar{x})

Donde:

  • sxysx2\frac{s_{xy}}{s_x^2} es la pendiente (mm), que indica cuánto aumenta YY por cada unidad que aumenta XX.
  • La recta pasa obligatoriamente por el centro de gravedad (xˉ,yˉ)(\bar{x}, \bar{y}).

Si despejamos la yy, obtenemos la forma habitual y=mx+ny = mx + n.

Predicciones y fiabilidad

Una vez obtenida la recta, podemos realizar estimaciones. Sin embargo, no todas las predicciones son igual de fiables. Para medir la calidad del ajuste, usamos el coeficiente de determinación (R2R^2), que en regresión lineal simple es el cuadrado del coeficiente de Pearson.

R2=r2R^2 = r^2

R2R^2 representa el porcentaje de la variabilidad de YY que queda explicada por la variable XX. Cuanto más cercano a 1, más fiable es la predicción.

  • Interpolación: Predecir valores dentro del rango de datos observados (suele ser fiable).
  • Extrapolación: Predecir valores muy alejados del rango observado (es arriesgado y poco fiable).

Aplicaciones prácticas de la regresión

La regresión lineal se aplica en innumerables campos:

  1. Economía: Predecir el gasto de las familias en función de sus ingresos.
  2. Biología: Estimar el peso de un animal a partir de su longitud corporal.
  3. Psicología: Relacionar el tiempo de estudio con la calificación obtenida.

Para realizar estos cálculos de forma eficiente, es fundamental el uso de calculadoras científicas en modo estadístico (STAT) o software como hojas de cálculo, que automatizan la obtención de sumatorios y coeficientes.

Después de leer

Pasa a la práctica con dos bloques bien visibles

Cuando hayas leído los apuntes, abre el test para comprobar lo que has entendido o las flashcards para memorizar las ideas importantes. Los dos se abren en una ventana propia.

Siguiente paso

¿Quieres ir más allá
del artículo?

Encuentra el mismo tema en Houki con el resto de preguntas, la repetición espaciada, las correcciones completas y un progreso seguido en el tiempo.