LOE/LOMLOE (BOE)Matemáticas B4º de Educación Secundaria Obligatoria8 min de lectura

Estadística bidimensional y correlación

Hasta ahora, en estadística hemos estudiado variables de forma aislada (estatura, notas, peso).

Lectura5 partesUn recorrido editorial y navegable.
Práctica12 preguntasTest y tarjetas de memoria para abrir después de leer.
Objetivo4º de Educación Secundaria ObligatoriaFormato rápido para comprobar si el tema encaja.
Parte 1

Introducción a las Variables Estadísticas Bidimensionales

Concepto de variable bidimensional

Hasta ahora, en estadística hemos estudiado variables de forma aislada (estatura, notas, peso). Sin embargo, la realidad suele presentarnos situaciones donde dos variables están relacionadas. Una variable estadística bidimensional surge cuando observamos simultáneamente dos características, XX e YY, en cada individuo de una población.

Cada observación se representa como un par ordenado (xi,yi)(x_i, y_i). Por ejemplo, si preguntamos a un grupo de alumnos por sus horas de estudio (XX) y su nota en el examen (YY), obtendremos pares como (5,6.5)(5, 6.5), (8,9)(8, 9) o (2,4)(2, 4). El objetivo principal es determinar si existe alguna relación o influencia entre ambas variables.

Tablas de frecuencias bidimensionales

Cuando el número de datos es muy elevado o los valores se repiten, organizamos la información en tablas de doble entrada. En estas tablas:

  • Las filas representan los valores o intervalos de la variable XX.
  • Las columnas representan los valores o intervalos de la variable YY.
  • En cada celda central anotamos la frecuencia absoluta conjunta (nijn_{ij}), que es el número de veces que se repite el par (xi,yj)(x_i, y_j).

La suma de todas las frecuencias conjuntas debe ser igual al tamaño total de la muestra (NN). A partir de esta tabla, podemos obtener las distribuciones marginales, que analizan cada variable por separado (la suma de cada fila para XX y la suma de cada columna para YY).

Distribuciones condicionadas

A veces nos interesa estudiar cómo se comporta una variable cuando la otra toma un valor fijo. Esto se conoce como distribución condicionada. Por ejemplo: "¿Qué notas obtienen solo aquellos alumnos que han estudiado más de 10 horas?".

La frecuencia relativa condicionada de YY a un valor concreto de XX se calcula como: f(yjxi)=nijnif(y_j | x_i) = \frac{n_{ij}}{n_{i \cdot}} Donde nin_{i \cdot} es el total de la fila correspondiente a xix_i. Si las distribuciones condicionadas son muy diferentes entre sí, podemos sospechar que existe una dependencia estadística entre las variables.


Parte 2

Representación Gráfica: El Diagrama de Dispersión

Construcción de la nube de puntos

La herramienta gráfica por excelencia en estadística bidimensional es el diagrama de dispersión o nube de puntos. Para construirlo:

  1. Dibujamos un sistema de ejes cartesianos.
  2. Representamos cada par de datos (xi,yi)(x_i, y_i) como un punto en el plano.
  3. Es fundamental elegir escalas adecuadas para cada eje de modo que los puntos no queden amontonados y permitan ver la tendencia.

Interpretación visual de la relación

Al observar la nube de puntos, podemos identificar patrones de forma inmediata:

  • Relación lineal: Los puntos parecen agruparse en torno a una línea recta.
  • Relación no lineal: Los puntos siguen una curva (parábola, exponencial, etc.).
  • Ausencia de relación: Los puntos están dispersos de forma aleatoria, formando una "mancha" sin dirección clara.
  • Valores atípicos (outliers): Son puntos que se alejan significativamente del patrón general del resto de los datos y que pueden distorsionar nuestros cálculos.

Tipos de dependencia

Dependiendo de cómo se relacionen los cambios en XX con los cambios en YY, hablamos de:

  1. Dependencia funcional: Si existe una fórmula matemática exacta que relaciona XX e YY (por ejemplo, el espacio recorrido a velocidad constante).
  2. Dependencia estadística o aleatoria: No hay una fórmula exacta, pero sí una tendencia clara (por ejemplo, altura y peso).
  3. Independencia: Cuando el valor de XX no influye en absoluto en el valor de YY.

Parte 3

Medidas de Relación Lineal: Covarianza y Correlación

La Covarianza

La covarianza (sxys_{xy}) es una medida que nos indica el sentido de la relación lineal entre dos variables. Se calcula mediante la fórmula: sxy=xiyiNxˉyˉs_{xy} = \frac{\sum x_i \cdot y_i}{N} - \bar{x} \cdot \bar{y}

  • Si sxy>0s_{xy} > 0: La relación es directa (al aumentar XX, aumenta YY).
  • Si sxy<0s_{xy} < 0: La relación es inversa (al aumentar XX, disminuye YY). El problema de la covarianza es que su valor depende de las unidades de medida, lo que impide comparar la intensidad de la relación entre distintos estudios.

Coeficiente de correlación de Pearson

Para solucionar la limitación de la covarianza, usamos el coeficiente de correlación de Pearson (rr). Este coeficiente es adimensional (no tiene unidades) y se define como: r=sxysxsyr = \frac{s_{xy}}{s_x \cdot s_y} Donde sxs_x y sys_y son las desviaciones típicas de cada variable. El valor de rr siempre estará comprendido en el intervalo [1,1][-1, 1].

Interpretación del grado de correlación

El valor de rr nos da mucha información:

  • Correlación fuerte: Si r|r| está próximo a 1.
  • Correlación débil: Si r|r| está próximo a 0.
  • Correlación nula: Si r=0r = 0 (no hay relación lineal).

Es vital recordar que correlación no implica causalidad. Que dos variables estén relacionadas estadísticamente (como el consumo de helados y las quemaduras solares) no significa que una sea la causa de la otra (en este caso, la causa común es el calor del verano).


Parte 4

Regresión Lineal y Predicción

La Recta de Regresión

Si observamos una relación lineal clara, podemos intentar encontrar la ecuación de la recta que mejor se ajusta a los puntos. Esta es la recta de regresión de Y sobre X. El método más utilizado es el de mínimos cuadrados, que minimiza las distancias verticales de los puntos a la recta.

La ecuación tiene la forma y=ax+by = ax + b, donde:

  • La pendiente es a=sxysx2a = \frac{s_{xy}}{s_x^2}.
  • La recta siempre pasa por el centro de gravedad de la distribución (xˉ,yˉ)(\bar{x}, \bar{y}).

Estimación y predicción

La utilidad principal de la recta de regresión es hacer predicciones. Si conocemos un valor de XX, podemos estimar qué valor de YY le correspondería sustituyendo en la ecuación.

  • Interpolación: Predecir un valor dentro del rango de datos observados (suele ser fiable).
  • Extrapolación: Predecir un valor fuera del rango observado (es arriesgado y puede ser muy erróneo).

Análisis de residuos

No todas las predicciones son igual de buenas. El coeficiente de determinación (r2r^2) nos indica la proporción de la varianza de YY que es explicada por el modelo lineal.

  • Si r2=0.9r^2 = 0.9, el ajuste es excelente y las predicciones serán muy fiables.
  • Si r2=0.2r^2 = 0.2, el ajuste es pobre y la predicción no tiene valor práctico. La fiabilidad de una predicción depende directamente de lo próximo que esté r|r| a 1.

Parte 5

Aplicaciones Prácticas y Uso de Tecnología

Resolución con calculadora científica

En 4º de ESO, es fundamental dominar el modo estadístico (STAT) de la calculadora:

  1. Seleccionar el modo bidimensional (normalmente indicado como A+BXA+BX o ee).
  2. Introducir los datos en la tabla de dos columnas.
  3. Acceder al menú de cálculos (OPTN o STAT) para obtener directamente la media (xˉ,yˉ\bar{x}, \bar{y}), las desviaciones típicas, la covarianza, el coeficiente rr y los parámetros de la recta aa y bb.

Uso de hojas de cálculo y GeoGebra

Las herramientas digitales permiten analizar grandes volúmenes de datos rápidamente:

  • Hojas de cálculo (Excel/Sheets): Mediante la función =COEF.DE.CORREL() o insertando un gráfico de dispersión y añadiendo una "Línea de tendencia".
  • GeoGebra: Usando la herramienta "Análisis de regresión de dos variables", que genera automáticamente el gráfico, la recta y todos los estadísticos necesarios.

Proyecto final: Estudio de caso

Como aplicación final, se recomienda realizar un pequeño estudio de campo. Por ejemplo, medir la longitud del pie y la altura de 20 compañeros, o comparar el precio de los pisos con su superficie en un portal inmobiliario. El informe debe incluir:

  1. Recogida de datos y tabla.
  2. Cálculo de parámetros (medias, varianzas, correlación).
  3. Representación gráfica de la nube de puntos.
  4. Cálculo de la recta de regresión y una valoración crítica sobre si la predicción es fiable basándose en el valor de rr.
Después de leer

Pasa a la práctica con dos bloques bien visibles

Cuando hayas leído los apuntes, abre el test para comprobar lo que has entendido o las flashcards para memorizar las ideas importantes. Los dos se abren en una ventana propia.

Siguiente paso

¿Quieres ir más allá
del artículo?

Encuentra el mismo tema en Houki con el resto de preguntas, la repetición espaciada, las correcciones completas y un progreso seguido en el tiempo.