La recta de mínimos cuadrados como estimador de momentos

Como introducir la recta sin mencionar (explícitamente) el criterio de mínimos cuadrados

Regresión
Fecha de publicación

2 de abril de 2025

Como su nombre indica, la recta de mínimos cuadrados se suele introducir en los libros de estadística básica como la recta que mejor se ajusta a los datos en el sentido de minimizar la suma de los errores de predicción al cuadrado. En otros libros más avanzados se demuestra que la recta también se obtiene si se aplica el método de máxima verosimilitud y los errores tienen distribución normal. Aquí voy a motivar la recta como estimador de momentos, que es algo que no suele mencionarse en la mayoría de libros de referencia.

El modelo

Sea \(X\) una variable regresora e \(Y\) una variable respuesta, relacionadas a través del siguiente modelo: \[ Y = \beta_0 + \beta_1 X + \epsilon,\ \ \ \mbox{E}(\epsilon|X) = 0. \tag{1}\] Tomando esperanzas condicionadas a \(X\), se comprueba que (1) equivale a suponer que el valor esperado de \(Y\) dada \(X\) es \(\mbox{E}(Y|X) = \beta_0 +\beta_1 X\). No suponemos ni que la variable explicativa \(X\) ni que el término de error \(\epsilon\) tengan distribución normal. Solo estamos suponiendo que la relación entre la variable respuesta y la variable regresora es aproximadamente lineal.

Usando la ley de la esperanza iterada, \(\mbox{E}(\epsilon) = \mbox{E}[\mbox{E}(\epsilon|X)] = 0\). Además, también se verifica \(\mbox{E}(\epsilon X) = \mbox{E}[\mbox{E}(\epsilon X|X)] = \mbox{E}[X\mbox{E}(\epsilon|X)] = 0\).

La recta en función de los momentos de las variables

Sea \(\mu_y=\mbox{E}(Y)\) y \(\mu_x = \mbox{E}(X)\). Tomando esperanzas en el modelo, tenemos \(\mu_y = \beta_0 + \beta_1\mu_x\) y restando esta ecuación de (1) se deduce \[Y-\mu_y = \beta_1(x-\mu_x) + \epsilon.\] Multiplicando ahora esta última ecuación por \(X-\mu_x\) resulta \[(Y-\mu_y)(X-\mu_x) = \beta_1(X-\mu_x)^2 + \epsilon (X-\mu_x).\] Finalmente, tomando aquí esperanzas, tenemos \(\sigma_{x,y}=\beta_1\sigma_{x}^2\), donde \(\sigma_{x,y}=\mbox{Cov}(X,Y)\) y \(\sigma^2_x = \mbox{Var}(X)\). Esto significa que en el modelo (1) necesariamente se cumple \[ \beta_1 =\frac{\sigma_{x,y}}{\sigma_x^2}\ \ \ \mbox{y}\ \ \ \beta_0 = \mu_y - \frac{\sigma_{x,y}}{\sigma_x^2}\mu_x. \tag{2}\]

El estimador de momentos

El método de momentos consiste en estimar cualquier parámetro reemplazando los momentos poblacionales por los correspondientes momentos muestrales. Si tenemos una muestra \((X_1,Y_1),\ldots,(X_n,Y_n)\) y aplicamos esta idea en (2) los estimadores resultantes son \[ \hat{\beta}_1 = \frac{\sum_{i=1}^n(x_i-\bar{x})(y_i-\bar{y})}{\sum_{i=1}^n(x_i-\bar{x})^2}\ \ \ \mbox{y}\ \ \ \hat\beta_0 = \bar{Y} -\hat{\beta}_1 \bar{X}, \] que dan lugar a la recta de mínimos cuadrados.

Esto me dejó un poco perplejo en un principio ya que me parecía sorprendente poder introducir la recta de mínimos cuadrados sin usar para nada el criterio de mínimos cuadrados, ni tampoco máxima verosimilitud bajo normalidad. Pero las casualidades no suelen darse en estadística…

Las casualidades no suelen existir

La conexión del modelo (1) con el criterio de mínimos cuadrados viene a través de la propiedad de la esperanza condicionada como predictor óptimo en el sentido de ser la función que minimiza el error cuadrático medio de predicción: \[\mbox{E}[(Y - \mbox{E}(Y|X))^2] \leq \mbox{E}[(Y - f(X))^2],\] para cualquier \(f\) (medible y tal que las esperanzas anteriores son finitas).

El modelo (1) es equivalente a \(\mbox{E}(Y|X)=\beta_0 +\beta_1 X\), por lo que \(\beta_0\) y \(\beta_1\) deben verificar \[\mbox{E}[(Y - \beta_0 -\beta_1X)^2] \leq \mbox{E}[(Y - f(X))^2],\]

para cualquier función razonable \(f\). El criterio de mínimos cuadrados se obtiene sustituyendo la esperanza por el promedio en el término de la izquierda de la desigualdad anterior. Así pues, no es sorprendente que se obtenga el mismo estimador:

  • minimizando un estimador de momentos del criterio poblacional (minimizando la suma de errores al cuadrado),
  • minimizando el criterio poblacional (lo que da (2)) y luego estimando por momentos la solución del problema de minimización.

La recta de mínimos cuadrados está relacionada a nivel más básico con la linealidad de la relación entre \(Y\) y \(X\) que con cualquier otro aspecto de la distribución del vector \((X,Y)\).