LOE/LOMLOE (BOE)Matemáticas I (Ciencias)1º de Bachillerato6 min de lectura

Estadística unidimensional y bidimensional

Para comenzar cualquier estudio, debemos definir sobre qué o quiénes vamos a recoger datos: Población: Conjunto total de elementos objeto de estudio.

Lectura4 partesUn recorrido editorial y navegable.
Práctica12 preguntasTest y tarjetas de memoria para abrir después de leer.
Objetivo1º de BachilleratoFormato rápido para comprobar si el tema encaja.
Parte 1

Estadística Unidimensional: Distribuciones y Frecuencias

Variables Estadísticas y Recuento

Para comenzar cualquier estudio, debemos definir sobre qué o quiénes vamos a recoger datos:

  • Población: Conjunto total de elementos objeto de estudio.
  • Muestra: Subconjunto representativo de la población.
  • Individuo: Cada uno de los elementos que componen la población.

Las variables pueden ser cualitativas (cualidades no numéricas, como el color de ojos) o cuantitativas (cantidades numéricas). Estas últimas se dividen en discretas (valores aislados, como número de hermanos) y continuas (pueden tomar cualquier valor en un intervalo, como la altura).

El recuento se organiza en tablas de frecuencias:

  1. Frecuencia absoluta (fif_i): Número de veces que aparece un valor xix_i.
  2. Frecuencia relativa (hih_i): Cociente fiN\frac{f_i}{N}, donde NN es el total de datos.
  3. Frecuencia acumulada (FiF_i): Suma de las frecuencias absolutas de los valores inferiores o iguales al dado.

Agrupación en Intervalos

Cuando la variable es continua o existen demasiados valores distintos, agrupamos los datos en intervalos o clases.

  • Límites de intervalo: Valores extremo que delimitan la clase [Li,Li+1)[L_i, L_{i+1}).
  • Amplitud (aia_i): Diferencia entre el límite superior e inferior.
  • Marca de clase (xix_i): El punto medio del intervalo, calculado como xi=Li+Li+12x_i = \frac{L_i + L_{i+1}}{2}. Este valor representará a todo el intervalo en los cálculos de parámetros.

Representaciones Gráficas

La visualización de datos es fundamental para comprender su distribución:

  • Histograma: Se usa para variables agrupadas. Son rectángulos cuya área es proporcional a la frecuencia.
  • Polígono de frecuencias: Línea que une los puntos medios de las partes superiores de las barras del histograma.
  • Diagrama de caja y bigotes (Box-plot): Representación basada en los cuartiles que muestra la dispersión, la simetría y la existencia de valores atípicos (outliers).

Parte 2

Parámetros Estadísticos de Centralización y Dispersión

Medidas de Centralización

Indican en torno a qué valores se agrupan los datos:

  1. Media aritmética (xˉ\bar{x}): Suma de todos los valores dividida por el número total. Para datos agrupados: xˉ=xifiN\bar{x} = \frac{\sum x_i \cdot f_i}{N}
  2. Mediana (MeMe): Valor que deja al 50% de los datos por debajo y al 50% por encima.
  3. Moda (MoMo): Valor con mayor frecuencia absoluta.

La media es muy sensible a valores extremos, por lo que en ocasiones la mediana es una medida más representativa de la realidad.

Medidas de Dispersión Absolutas

Informan sobre cuánto se alejan los datos respecto al centro:

  • Rango o Recorrido: Diferencia entre el valor máximo y el mínimo.
  • Varianza (σ2\sigma^2): Promedio de los cuadrados de las desviaciones respecto a la media. σ2=fixi2Nxˉ2\sigma^2 = \frac{\sum f_i \cdot x_i^2}{N} - \bar{x}^2
  • Desviación típica (σ\sigma): Raíz cuadrada positiva de la varianza. Se expresa en las mismas unidades que la variable.

Medidas de Dispersión Relativas y Posición

  • Coeficiente de variación (CVCV): Se define como CV=σxˉCV = \frac{\sigma}{|\bar{x}|}. Es adimensional y sirve para comparar la dispersión de dos poblaciones con distintas unidades o medias muy diferentes.
  • Medidas de posición (Cuantiles): Dividen la serie de datos en partes iguales. Los más comunes son los Cuartiles (Q1,Q2,Q3Q_1, Q_2, Q_3), que dividen los datos en cuatro partes del 25% cada una.
  • Tipificación: Proceso de transformar una variable XX en otra ZZ con media 0 y desviación típica 1 mediante la fórmula z=xxˉσz = \frac{x - \bar{x}}{\sigma}.

Parte 3

Estadística Bidimensional: Correlación

Distribuciones Bidimensionales

Los datos se representan como pares ordenados (xi,yi)(x_i, y_i).

  • Nube de puntos: Representación en el plano cartesiano de los pares de datos. Permite visualizar visualmente si existe relación.
  • Distribuciones marginales: Son las distribuciones unidimensionales de cada variable por separado (la columna del total y la fila del total en una tabla de doble entrada).
  • Distribuciones condicionadas: El estudio de una variable cuando la otra toma un valor fijo (ej. altura de los alumnos que pesan exactamente 70kg).

Covarianza y Relación Lineal

La covarianza (σxy\sigma_{xy}) mide la variación conjunta de las dos variables: σxy=fixiyiNxˉyˉ\sigma_{xy} = \frac{\sum f_i \cdot x_i \cdot y_i}{N} - \bar{x} \cdot \bar{y}

  • Si σxy>0\sigma_{xy} > 0: Relación directa (al aumentar XX, aumenta YY).
  • Si σxy<0\sigma_{xy} < 0: Relación inversa (al aumentar XX, disminuye YY).
  • Si σxy=0\sigma_{xy} = 0: No hay relación lineal.

Coeficiente de Correlación Lineal

El coeficiente rr de Pearson escala la covarianza para que su valor esté siempre entre -1 y 1: r=σxyσxσyr = \frac{\sigma_{xy}}{\sigma_x \cdot \sigma_y} Interpretación:

  • r1|r| \approx 1: Correlación muy fuerte (puntos casi alineados).
  • r0|r| \approx 0: Correlación inexistente o nula.
  • r=1r = 1 o r=1r = -1: Correlación funcional (todos los puntos están exactamente sobre una recta).

Parte 4

Regresión Lineal y Predicción

Rectas de Regresión

Utilizamos el método de mínimos cuadrados, que minimiza la suma de los cuadrados de los errores verticales u horizontales.

  • Recta de regresión de YY sobre XX: Se usa para predecir YY conociendo XX. yyˉ=σxyσx2(xxˉ)y - \bar{y} = \frac{\sigma_{xy}}{\sigma_x^2}(x - \bar{x}) La pendiente m=σxyσx2m = \frac{\sigma_{xy}}{\sigma_x^2} se denomina coeficiente de regresión.

Estimación y Fiabilidad

Podemos usar la recta para estimar valores que no tenemos. Sin embargo, la fiabilidad de la predicción depende del coeficiente de determinación R2R^2 (que en regresión lineal simple es r2r^2).

  • Interpolación: Predecir valores dentro del rango de datos conocidos (fiable si rr es alto).
  • Extrapolación: Predecir valores fuera del rango observado (poco fiable, debe usarse con extrema precaución).

Análisis de Residuos

El residuo o error es la diferencia entre el valor real observado yiy_i y el valor estimado por la recta y^i\hat{y}_i: ei=yiy^ie_i = y_i - \hat{y}_i.

  • Bondad del ajuste: Si los residuos son pequeños y se distribuyen aleatoriamente, el modelo lineal es adecuado.
  • Centro de gravedad: La recta de regresión siempre pasa por el punto (xˉ,yˉ)(\bar{x}, \bar{y}), que representa el promedio conjunto de la distribución.
ConceptoFórmula ClaveUso Principal
Desviación Típicaσ=Var\sigma = \sqrt{Var}Medir dispersión en unidades originales
Covarianzaσxy\sigma_{xy}Determinar el tipo de relación (directa/inversa)
Coeficiente Pearsonr=σxyσxσyr = \frac{\sigma_{xy}}{\sigma_x \sigma_y}Medir la fuerza de la relación
Recta Regresiónyyˉ=m(xxˉ)y - \bar{y} = m(x - \bar{x})Realizar predicciones
Después de leer

Pasa a la práctica con dos bloques bien visibles

Cuando hayas leído los apuntes, abre el test para comprobar lo que has entendido o las flashcards para memorizar las ideas importantes. Los dos se abren en una ventana propia.

Siguiente paso

¿Quieres ir más allá
del artículo?

Encuentra el mismo tema en Houki con el resto de preguntas, la repetición espaciada, las correcciones completas y un progreso seguido en el tiempo.