LOE/LOMLOE (BOE)Matemáticas Aplicadas a las CCSS I1º de Bachillerato6 min de lectura

Correlación y regresión lineal

En estudios sociales, rara vez analizamos una característica de forma aislada.

Lectura5 partesUn recorrido editorial y navegable.
Práctica12 preguntasTest y tarjetas de memoria para abrir después de leer.
Objetivo1º de BachilleratoFormato rápido para comprobar si el tema encaja.
Parte 1

Distribuciones Bidimensionales y Nubes de Puntos

Variables Estadísticas Bidimensionales

En estudios sociales, rara vez analizamos una característica de forma aislada. Una variable estadística bidimensional surge cuando observamos simultáneamente dos caracteres, XX e YY, en cada individuo de una muestra. Cada dato se representa como un par ordenado (xi,yi)(x_i, y_i).

  • Tablas de frecuencias: Cuando el número de datos es muy grande, se agrupan en tablas de doble entrada.
  • Distribuciones marginales: Son las distribuciones de XX o YY por separado, ignorando a la otra variable. Se calculan sumando las filas o columnas de la tabla.
  • Distribuciones condicionadas: Analizan cómo se comporta una variable cuando la otra toma un valor fijo (por ejemplo, "¿cuál es el nivel de estudios condicionado a tener más de 50 años?").

Representación Gráfica: El Diagrama de Dispersión

La nube de puntos o diagrama de dispersión es la representación de los pares (xi,yi)(x_i, y_i) en un plano cartesiano.

  1. Tendencia: Si los puntos parecen alinearse, existe una relación lineal.
  2. Dispersión: Si los puntos están muy separados, la relación es débil.
  3. Valores atípicos (outliers): Son puntos que se alejan drásticamente del comportamiento general del grupo y deben ser analizados con cuidado, ya que pueden distorsionar los resultados finales.

Parámetros Estadísticos Bidimensionales

Para resumir la información de una nube de puntos, utilizamos el centro de gravedad (xˉ,yˉ)(\bar{x}, \bar{y}). Este punto representa el promedio conjunto de la distribución, donde:

  • xˉ=xin\bar{x} = \frac{\sum x_i}{n} (Media marginal de X)
  • yˉ=yin\bar{y} = \frac{\sum y_i}{n} (Media marginal de Y)

Además, calculamos las desviaciones típicas sxs_x y sys_y, que miden la dispersión de cada variable respecto a sus respectivas medias.

Parte 2

La Covarianza y la Relación entre Variables

Concepto y Cálculo de la Covarianza

La covarianza (sxys_{xy}) mide la variabilidad conjunta de las dos variables respecto a sus medias. Se calcula mediante la fórmula: sxy=(xixˉ)(yiyˉ)n=xiyinxˉyˉs_{xy} = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{n} = \frac{\sum x_i y_i}{n} - \bar{x}\bar{y}

La interpretación del signo es vital:

  • Si sxy>0s_{xy} > 0: La relación es directa (al aumentar XX, tiende a aumentar YY).
  • Si sxy<0s_{xy} < 0: La relación es inversa (al aumentar XX, tiende a disminuir YY).
  • Si sxy=0s_{xy} = 0: No existe relación lineal (independencia lineal).

Limitaciones de la Covarianza

Aunque el signo de la covarianza es útil, su valor numérico tiene un problema: depende de las unidades de medida. Si medimos la altura en metros o en centímetros, la covarianza cambiará drásticamente, lo que impide comparar la intensidad de la relación entre distintas variables. Por ello, necesitamos una medida normalizada.

Parte 3

Correlación Lineal y Coeficiente de Pearson

El Coeficiente de Correlación de Pearson

Para solucionar la limitación de la covarianza, Karl Pearson definió el coeficiente rr: r=sxysxsyr = \frac{s_{xy}}{s_x \cdot s_y} Este coeficiente es adimensional (no tiene unidades) y su valor siempre está comprendido en el intervalo [1,1][-1, 1].

Interpretación de la Fuerza de Correlación

  • r=1r = 1: Correlación lineal positiva perfecta.
  • r=1r = -1: Correlación lineal negativa perfecta.
  • r0r \approx 0: Inexistencia de relación lineal.
  • Fuerza: Generalmente, si r>0,7|r| > 0,7, se considera una correlación fuerte. Si r<0,4|r| < 0,4, se considera débil.

Importante: Debemos recordar siempre que correlación no implica causalidad. Que dos variables suban al mismo tiempo no significa necesariamente que una cause la otra (pueden depender de una tercera variable oculta).

Análisis de Casos Prácticos

En sociología, por ejemplo, podemos encontrar una correlación alta entre el nivel de lectura y el éxito académico. En economía, entre la inversión en publicidad y las ventas. Al analizar estos datos, es crucial verificar que la muestra sea representativa para que el coeficiente rr tenga validez estadística.

Parte 4

Regresión Lineal: La Recta de Mínimos Cuadrados

Fundamentos de la Recta de Regresión

Si observamos una correlación fuerte, podemos intentar encontrar la función matemática que mejor se ajuste a la nube de puntos. En este nivel, buscamos una línea recta. El criterio de mínimos cuadrados consiste en encontrar la recta que hace que la suma de los cuadrados de los residuos (la distancia vertical entre cada punto y la recta) sea mínima.

Cálculo de la Recta de Y sobre X

Se utiliza para predecir el valor de YY conociendo XX. Su ecuación es: yyˉ=sxysx2(xxˉ)y - \bar{y} = \frac{s_{xy}}{s_x^2} (x - \bar{x}) Donde:

  • xˉ,yˉ\bar{x}, \bar{y} son las coordenadas del centro de gravedad (la recta siempre pasa por él).
  • m=sxysx2m = \frac{s_{xy}}{s_x^2} es la pendiente o coeficiente de regresión. Indica cuánto varía YY por cada unidad que aumenta XX.

La Recta de X sobre Y

Aunque menos común, se usa para predecir XX en función de YY. Su ecuación cambia la varianza en el denominador: xxˉ=sxysy2(yyˉ)x - \bar{x} = \frac{s_{xy}}{s_y^2} (y - \bar{y}) Ambas rectas se cortan en el centro de gravedad (xˉ,yˉ)(\bar{x}, \bar{y}). Si la correlación es perfecta (r=1|r|=1), ambas rectas coinciden en una sola.

Parte 5

Predicción y Fiabilidad del Modelo

Estimación de Valores

Una vez obtenida la recta de regresión, podemos sustituir un valor de XX para obtener una estimación de YY.

  • Interpolación: Predecir valores dentro del rango de los datos observados (muy fiable).
  • Extrapolación: Predecir valores fuera del rango observado. Debe hacerse con extrema precaución, ya que la tendencia lineal podría no mantenerse en valores muy altos o muy bajos.

Coeficiente de Determinación

El coeficiente de determinación, denotado como R2R^2, es el cuadrado del coeficiente de Pearson. R2=r2R^2 = r^2 Se interpreta como el porcentaje de la varianza de la variable YY que es explicada por el modelo de regresión lineal. Por ejemplo, si R2=0,81R^2 = 0,81, decimos que el 81% de la variación de los datos se explica por la relación lineal con la otra variable.

Evaluación de la Calidad Predictiva

Para decidir si una predicción es fiable, seguimos estos criterios:

  1. Valor de r|r|: Debe estar próximo a 1.
  2. Tamaño de la muestra: A mayor número de datos, más robusto es el modelo.
  3. Proximidad al centro de datos: Las predicciones son más fiables cuanto más cerca están del centro de gravedad de la distribución.
Valor de rrCalidad de la predicción
0,9 a 1Excelente
0,7 a 0,9Buena
0,4 a 0,7Regular / Baja
< 0,4Nula o no fiable

Este análisis permite a los científicos sociales tomar decisiones basadas en datos, entendiendo no solo cómo se relacionan las variables, sino también qué grado de error podemos esperar en nuestras estimaciones.

Después de leer

Pasa a la práctica con dos bloques bien visibles

Cuando hayas leído los apuntes, abre el test para comprobar lo que has entendido o las flashcards para memorizar las ideas importantes. Los dos se abren en una ventana propia.

Siguiente paso

¿Quieres ir más allá
del artículo?

Encuentra el mismo tema en Houki con el resto de preguntas, la repetición espaciada, las correcciones completas y un progreso seguido en el tiempo.