Apuntes sobre métodos de suavización para pronósticos por series de tiempo

Estos apuntes presentan los principales métodos de suavización utilizados para pronosticar series de tiempo, desde los promedios móviles hasta las distintas formas de suavización exponencial. El recorrido avanza desde modelos que estiman únicamente el nivel de una serie hasta métodos que incorporan tendencia y estacionalidad, como Holt y Holt-Winters, además de algunas extensiones como la tendencia amortiguada y la clasificación de Pegels.

El propósito es entender qué componente intenta estimar cada método, cómo se actualizan sus pronósticos y qué papel cumplen sus parámetros. Por eso se conservan las ecuaciones y la notación matemática, pero el orden está pensado como una guía de consulta: primero se desarrolla cada procedimiento y al final se resume qué método conviene considerar según la estructura de la serie. En Recursos está disponible un laboratorio de series de tiempo que permite experimentar con estos conceptos sobre datos reales.

Métodos de suavización

Los métodos de suavización proporcionan pronósticos basados en “suavizar” los efectos de la fluctuación irregular en los datos de la serie de tiempo. Los métodos de suavización tienen dos categorías generales: los modelos de promedios móviles y los modelos de suavización exponencial.

Promedios móviles

Los promedios móviles suavizan una serie al promediar ventanas de observaciones consecutivas. En su forma simple estiman un nivel local; sus variantes pueden asignar pesos distintos o introducir una corrección por tendencia.

Promedio móvil simple

El método de los promedios móviles utiliza el promedio de los datos más recientes como el pronóstico para el siguiente periodo. Es una referencia sencilla para comparar otros métodos de pronóstico. La fórmula es:

Ft+1=At=1nj=0n1Xtj(1)F_{t+1}=A_t=\frac{1}{n}\sum_{j=0}^{n-1}X_{t-j}\quad (1)

Ft+1{F}_{t+1} es el pronóstico del periodo siguiente; At{A}_{t}, el promedio de la ventana; Xt{X}_{t}, la observación del periodo tt; y nn, el número de observaciones promediadas, desde Xtn+1{X}_{t-n+1} hasta Xt{X}_{t}.

El promedio móvil simple es adecuado cuando no hay una tendencia ni una estacionalidad claras y el nivel puede considerarse aproximadamente estable dentro de la ventana. Esto no equivale a demostrar estacionariedad estadística. Cada nueva observación sustituye a la más antigua, de modo que se conserva el número de datos promediados.

La longitud de la ventana (nn) determina cuánto se suavizan las observaciones. Si los datos no están correlacionados y tienen una varianza común σ2\sigma^{2}, la varianza del promedio es:

Var(At)=σ2nVar\left( A_{t} \right) = \frac{\sigma^{2}}{n}

Bajo esos supuestos, ampliar la ventana reduce la varianza del promedio, pero también retrasa su respuesta ante cambios de nivel. La expresión anterior describe la varianza del estimador, no el error total de pronóstico; si hay autocorrelación deben incluirse las covarianzas. Conviene comparar distintas longitudes con datos posteriores a los utilizados para ajustar el método.

Una ventana corta conserva más variación; una larga atenúa más ruido. Una ventana que abarque un ciclo estacional puede ayudar a suavizar ese patrón, pero el promedio resultante no reproduce por sí solo los picos y valles futuros. Suavizar una serie y pronosticar su estacionalidad son tareas distintas.

El promedio móvil simple proyecta el último nivel estimado y no incorpora una pendiente. Para representar una tendencia lineal puede utilizarse una corrección basada en dos promedios móviles, uno calculado a partir del otro.

Promedio móvil doble

Aquí se utiliza el promedio móvil doble con dos ventanas de igual longitud nn, con n>1n > 1. Primero se promedian las observaciones y después esos promedios. La corrección de nivel y tendencia que sigue corresponde a esta elección; no debe aplicarse sin cambios a dos ventanas de longitudes distintas.

At=1nj=0n1Xtj(2)A_t=\frac{1}{n}\sum_{j=0}^{n-1}X_{t-j}\quad (2)

Luego, el promedio móvil doble en el instante tt se calcula como:

At=1nj=0n1Atj(3)A'_t=\frac{1}{n}\sum_{j=0}^{n-1}A_{t-j}\quad (3)

La expresión general para obtener los pronósticos en el período t+kt + k en el futuro es:

Ft+k=at+kbtdondek=1,2,3,(4)F_{t + k} = a_{t} + kb_{t}\quad donde\quad k = 1,2,3,\ldots\quad (4)

donde:

at=2AtAt(5)a_t=2A_t-A'_t\quad (5)

es el valor suavizado para el instante tt , y

bt=2(AtAt)n1(6)b_t=\frac{2(A_t-A'_t)}{n-1}\quad (6)

es el valor para el componente de tendencia.

La corrección compensa el rezago que produce el promedio simple frente a una tendencia lineal. Eso no garantiza un error menor en cualquier serie: al estimar una pendiente también puede amplificarse el ruido. Con estas ventanas hacen falta al menos 2n12n − 1 observaciones para obtener el primer promedio doble.

Promedio móvil ponderado

Una manera de hacer que el promedio móvil responda con mayor rapidez a las variaciones de las observaciones de la serie, es colocar un peso relativo superior sobre las observaciones más recientes en vez de hacerlo sobre las más antiguas. Esto se denomina promedio móvil ponderado y se calcula como sigue:

Ft+1=At=i=1nwiXti+1,i=1nwi=1,wi0(7)F_{t+1}=A_t=\sum_{i=1}^{n}w_iX_{t-i+1},\qquad \sum_{i=1}^{n}w_i=1,\quad w_i\geq0\quad (7)

donde:

wi{w}_{i} es el peso de la observación Xti+1{X}_{t-i+1}, para i=1,,ni=1,\ldots,n.

Los pesos son números reales no negativos cuya suma es 1; no tienen que ser enteros. Un peso cero excluye esa observación. Si se parte de ponderaciones sin normalizar, se divide cada una por la suma de todas antes de aplicar la ecuación (7).

Asignar más peso a los datos recientes aumenta la sensibilidad a los cambios, aunque también puede hacer que el pronóstico reaccione más al ruido. El promedio móvil simple es el caso particular en que todos los pesos valen 1/n1/n.

Para actualizar este promedio se necesitan las nn observaciones de la ventana y sus pesos, no todo el historial. La suavización exponencial ofrece otra forma de ponderar los datos: resume la información pasada en el estado anterior y permite actualizarlo de manera recursiva.

Suavización exponencial

Los trabajos de Holt (1957), Brown (1959) y Winters (1960) dieron forma a los métodos clásicos de suavización exponencial. Sus ecuaciones actualizan estimaciones de nivel, tendencia y estacionalidad. Un algoritmo de actualización no especifica por sí solo una distribución de errores, pero puede formularse como un modelo estadístico: el enfoque de espacio de estado desarrollado por Hyndman et al. (2008) permite obtener intervalos de pronóstico. Esta distinción se retoma al final de los apuntes.

Suavización exponencial simple

La suavización exponencial simple o de primer orden se basa en la idea de que es posible calcular un pronóstico nuevo a partir de un pronóstico anterior y de la observación más reciente, dependiendo de qué tanto peso se quiera dar a la observación más reciente contra el peso asignado al pronóstico anterior. Para formalizar el razonamiento anterior se escribe:

Ft+1=At=αXt+(1α)Ft(8)F_{t + 1} = A_{t} = {\alpha X}_{t} + (1 – \alpha)F_{t}\quad (8)

donde:

Ft{F}_{t} es el pronóstico calculado para el periodo actual con la información del periodo anterior.

α=constante de suavización,0<α<1\alpha=\text{constante de suavización},\qquad 0<\alpha<1

La ecuación anterior es una forma de reajustar los términos de la ecuación del método de Brown (1959), el cual toma el pronóstico de los períodos previos y lo ajusta usando el error de pronóstico de la manera siguiente:

Ft+1=At=Ft+α(XtFt)F_{t+1}=A_t=F_t+\alpha(X_t-F_t)

El origen del término “suavización exponencial” se puede explicar escribiendo la ecuación (8) en términos de todas las observaciones anteriores. Al sustituir FtF_{t} en la ecuación anterior se obtiene:

Ft+1=αXt+(1α)[αXt1+(1α)Ft1]F_{t + 1} = \alpha X_{t} + (1 – \alpha)\left\lbrack \alpha X_{t – 1} + (1 – \alpha)F_{t – 1} \right\rbrack

Luego, si se sustituye Ft1F_{t – 1} en la ecuación anterior y se continúa con el mismo procedimiento, se llega a la expresión:

Ft+1=j=0t1α(1α)jXtj+(1α)tF1F_{t+1}=\sum_{j=0}^{t-1}\alpha(1-\alpha)^jX_{t-j}+(1-\alpha)^tF_1

El peso de una observación con jj periodos de antigüedad es α(1α)j\alpha(1-\alpha)^j: la potencia afecta a (1α)(1-\alpha), no a α\alpha. El último dato de la expansión es X1{X}_{1}, con peso α(1α)t1\alpha(1-\alpha)^{t-1}. El término restante conserva la influencia de la estimación inicial F1{F}_{1}.

La suavización exponencial simple asigna pesos decrecientes a las observaciones anteriores sin una ventana finita. Se utiliza para series sin tendencia ni estacionalidad claras; cuando esos componentes son relevantes deben modelarse de forma explícita. Montgomery et al. (2008) desarrollan su relación con los promedios ponderados.

La recursión necesita una estimación inicial F1=A0F_1=A_0. Puede obtenerse con la primera observación, con un promedio de un tramo inicial aproximadamente estable o mediante estimación conjunta con α\alpha. Si se usa X1{X}_{1} para iniciar el método, el primer pronóstico evaluable corresponde a X2{X}_{2}. El factor (1α)t(1-\alpha)^t reduce la influencia inicial, pero con α\alpha pequeño o pocas observaciones esa influencia puede seguir siendo importante.

Un α\alpha alto da más peso a la observación reciente; uno bajo produce una respuesta más gradual. No existe un intervalo óptimo universal. La aproximación α=2/(n+1)\alpha=2/(n+1) iguala la antigüedad media de los pesos exponenciales con la de una ventana simple de longitud nn, pero no hace idénticos sus pronósticos.

Para estimar α\alpha y el estado inicial puede utilizarse una herramienta de optimización, como Solver. La función objetivo debe responder al uso del pronóstico: el error absoluto medio (MAE, también llamado MAD en algunos textos de pronósticos) trata los errores de forma lineal; el error cuadrático medio (MSE) penaliza más los grandes. Minimizar MSE no lo convierte automáticamente en un estimador de la desviación estándar ni garantiza mejores resultados futuros. La selección final debe comprobarse fuera de la muestra de ajuste.

Ante una tendencia sostenida, la suavización simple suele responder con rezago. Una variante adapta α\alpha a medida que llegan observaciones: la suavización exponencial simple con tasa de respuesta adaptativa, o ARRSES (Adaptive Response Rate Single Exponential Smoothing). Esa adaptación puede reaccionar a cambios de nivel, pero no sustituye un componente explícito de tendencia o estacionalidad.

De manera general, la suavización exponencial adaptativa propone recalcular el valor de alfa a medida que va cambiando el patrón de los datos. Para esto se puede utilizar un valor de rastreo de alfa que determine si el pronóstico sigue el ritmo de los cambios en los datos y recalcule el valor de alfa de un período a otro, en un rango posible de 0 a 1. De acuerdo con Trigg y Leach (1967), el valor de rastreo de alfa se puede definir como:

αt+1=|EStEASt|,EASt>0(9)\alpha_{t+1}=\left|\frac{ES_t}{EAS_t}\right|,\qquad EAS_t>0\quad (9)

donde:

ESt{ES}_{t} es el error suavizado.

EASt{EAS}_{t} es el error absoluto suavizado.

ESt=βet+(1β)ESt1(10){ES}_{t} = \beta e_{t} + (1 – \beta){ES}_{t – 1}\quad (10)
EASt=β|et|+(1β)EASt1(11){EAS}_{t} = \beta\left| e_{t} \right| + (1 – \beta){EAS}_{t – 1}\quad (11)

et{e}_{t} es el error de pronóstico.

En (10) y (11), et=XtFte_t=X_t-F_t y β\beta suaviza los errores; cumple una función distinta de la β\beta de Holt. Con 0<β<10<\beta<1 y estados iniciales compatibles, |ESt|EASt|{ES}_t|\leq{EAS}_t. Si EASt=0{EAS}_t=0, debe conservarse el α\alpha anterior o un valor inicial fijado. Iniciar ambos errores suavizados en cero no elimina esa indeterminación. El αt+1{\alpha}_{t+1} calculado con et{e}_{t} se aplica a la siguiente actualización, cuando se observe Xt+1{X}_{t+1}.

Sin nuevos datos, la suavización simple proyecta el mismo nivel para todos los horizontes. Para representar una tendencia o un patrón estacional se requieren componentes adicionales.

Suavización con tendencia: Holt, Brown y tendencia amortiguada

Para las series con un componente de tendencia sin estacionalidad, se puede utilizar el método de suavización exponencial doble o de segundo orden. El más utilizado es el método de Holt (1957), el cual divide las series de tiempo en dos componentes: nivel promedio y tendencia. Estos componentes son actualizados en cada período empleando dos parámetros o constantes de suavización.

El nivel se actualiza combinando la observación actual con el nivel y la tendencia estimados en el periodo anterior (Montgomery et al., 2008):

At=αXt+(1α)(At1+Tt1)(12)A_{t} = \alpha X_{t} + (1 – \alpha)\left( A_{t – 1} + T_{t – 1} \right)\quad (12)

La tendencia se actualiza combinando el cambio entre dos estimaciones consecutivas de nivel con la tendencia anterior:

Tt=β(AtAt1)+(1β)Tt1(13)T_{t} = \beta\left( A_{t} – A_{t – 1} \right) + (1 – \beta)T_{t – 1}\quad (13)

β\beta controla cuánto cambia la estimación de tendencia: valores bajos conservan más de la pendiente anterior; valores altos reaccionan más a los cambios recientes de nivel. α\alpha y β\beta deben estimarse teniendo en cuenta su efecto conjunto, sin asumir que uno siempre será menos importante que el otro.

Holt necesita un nivel y una tendencia iniciales, A0{A}_{0} y T0{T}_{0}. Una posibilidad es ajustar una regresión Xtc+dtX_t\approx c+dt a un tramo inicial sin estacionalidad y utilizar cc y dd, respetando el origen temporal de la regresión. También pueden estimarse conjuntamente con los parámetros de suavización. Las distintas inicializaciones deben compararse dentro del mismo procedimiento de validación (Montgomery et al., 2008; Makridakis et al., 1998).

En correspondencia con lo anterior, el pronóstico para el periodo t+kt + k se calcula como:

Ft+k=At+kTtdondek=1,2,3,(14)F_{t + k} = A_{t} + kT_{t}\quad donde\quad k = 1,2,3,\ldots\quad (14)

El pronóstico extrapola la pendiente estimada: añade kk veces la tendencia al último nivel. Esto permite representar una evolución lineal local, aunque puede prolongar demasiado una tendencia que luego se debilita.

La doble suavización de Brown (1959) también representa una tendencia lineal, pero utiliza una sola constante en dos suavizaciones sucesivas. No se obtiene simplemente imponiendo α=β\alpha=\beta en las ecuaciones de Holt anteriores. Su procedimiento es:

At=αXt+(1α)At1(15)A_{t} = \alpha X_{t} + (1 – \alpha)A_{t – 1}\quad (15)
At=αAt+(1α)At1(16)A_{t}' = \alpha A_{t} + (1 – \alpha)A_{t – 1}'\quad (16)

En Brown se utiliza 0<α<10<\alpha<1. Las dos suavizaciones pueden iniciarse con un mismo nivel estimado a partir del tramo de entrenamiento; esa elección implica una tendencia inicial nula. Los estados también pueden ajustarse para representar una pendiente inicial. Después se calculan el nivel corregido at{a}_{t} y la pendiente bt{b}_{t}. La letra at{a}_{t} representa aquí un estado, distinto del parámetro α\alpha.

at=2AtAta_{t} = 2A_{t} – A_{t}’
bt=α(AtAt)1α(17)b_{t} = \frac{\alpha(A_{t} – A_{t}')}{1 – \alpha}\quad (17)

Luego, el pronóstico para el periodo t+kt + k en el futuro se calcula como sigue:

Ft+k=at+kbtdondek=1,2,3,F_{t + k} = a_{t} + kb_{t}\quad donde\quad k = 1,2,3,\ldots

La previsión de Brown es lineal en el horizonte, como la de Holt. Su sensibilidad depende de α\alpha y de la inicialización; la elección entre ambos métodos debe apoyarse en el desempeño de pronóstico.

En Holt, β=0\beta=0 mantiene constante la pendiente inicial y produce suavización exponencial simple con deriva. Hyndman y Billah (2003) relacionan el método Theta de Assimakopoulos y Nikolopoulos (2000) con una formulación de suavización simple más deriva. Esa relación requiere respetar su parametrización e inicialización; no basta con fijar β=0\beta=0 en cualquier implementación.

Si interesa extrapolar una curvatura local, puede considerarse la suavización cuadrática de Brown (1959). Emplea tres suavizaciones sucesivas con el mismo α\alpha y añade un término cuadrático al pronóstico. Es una extensión de Brown, no otro caso de Holt obtenido igualando parámetros.

Primera suavización:

At=αXt+(1α)At1A_{t} = \alpha X_{t} + (1 – \alpha)A_{t – 1}

Segunda suavización:

At=αAt+(1α)At1A_{t}' = \alpha A_{t} + (1 – \alpha)A_{t – 1}'

Tercera suavización:

At=αAt+(1α)At1(18)A_{t}^{''} = \alpha A_{t}' + (1 – \alpha)A_{t – 1}^{''}\quad (18)

Este método emplea una sola constante, con 0<α<10<\alpha<1. Una inicialización sencilla iguala los tres estados al primer dato del tramo de entrenamiento, A0=A0=A0=X1A_0=A’_0=A»_0=X_1; así se inicia sin pendiente ni curvatura. La primera observación se utiliza para inicializar, no para evaluar el error.

Los estimadores del intercepto ( ata_{t} ) y la pendiente ( btb_{t} ) se calculan como sigue:

at=3At3At+At(19)a_{t} = {3A}_{t} – 3A_{t}'{+ A}_{t}^{»}\quad (19)
bt=α2(1α)2[(65α)At(108α)At+(43α)At](20)b_t=\frac{\alpha}{2(1-\alpha)^2}\left[(6-5\alpha)A_t-(10-8\alpha)A'_t+(4-3\alpha)A''_t\right]\quad (20)

El parámetro de segundo orden se calcula como:

ct=[α2(1α)2](At2At+At)(21)c_{t} = \left\lbrack \frac{\alpha^{2}}{(1 – \alpha)^{2}} \right\rbrack(A_{t}{- 2A}_{t}'{+ A}_{t}^{''})\quad (21)

Luego, el pronóstico para el período t+kt + k en el futuro se calcula como:

Ft+k=at+kbt+12ctk2dondek=1,2,3,(22)F_{t + k} = a_{t} + kb_{t} + \frac{1}{2}c_{t}k^{2}\quad donde\quad k = 1,2,3,\ldots\quad (22)

La extrapolación cuadrática es sensible al horizonte: el término k2k^2 puede producir valores extremos aun con una curvatura pequeña. Conviene tratarla como una opción específica y comprobarla frente a alternativas lineales o amortiguadas.

Prolongar una pendiente constante puede producir proyecciones excesivas a horizontes largos, tanto al alza como a la baja. Gardner y McKenzie (1985) desarrollan la tendencia amortiguada, que reduce progresivamente la contribución de la pendiente. En la variante aditiva de Holt:

At=αXt+(1α)(At1+ϕ Tt1)(23)A_{t} = \alpha X_{t} + (1 – \alpha)\left( A_{t – 1} + \phi\ T_{t – 1} \right)\quad (23)
Tt=β(AtAt1)+(1β)ϕTt1(24)T_{t} = \beta\left( A_{t} – A_{t – 1} \right) + (1 – \beta){\phi T}_{t – 1}\quad (24)
Ft+k=At+(ϕ+ϕ2++ϕk)Ttdondek=1,2,3,(25)F_{t + k} = A_{t} + (\phi + \phi^{2} + \ldots + \phi^{k})T_{t}\quad donde\quad k = 1,2,3,\ldots\quad (25)

El parámetro ϕ\phi cumple 0<ϕ<10<\phi<1. Cada periodo adicional aporta menos tendencia; la trayectoria se aproxima a un límite, sin volverse exactamente plana en una fecha determinada. Con ϕ=1\phi=1 se recupera Holt sin amortiguación. Valores cercanos a 1 amortiguan más lentamente; ϕ\phi puede estimarse junto con los demás parámetros.

Las siguientes expresiones resumen cinco formas de proyectar nivel y tendencia. En las formas aditivas, Tt{T}_{t} es un incremento por periodo; en las multiplicativas es un factor de crecimiento, que exige estados positivos. La forma sin tendencia utiliza únicamente At{A}_{t}. Estas expresiones no sustituyen las ecuaciones de actualización de cada método.

  • Sin tendencia:
    Ft+k=AtF_{t + k} = A_{t}
  • Tendencia aditiva:
    Ft+k=At+kTtF_{t + k} = A_{t} + kT_{t}
  • Tendencia aditiva amortiguada:
    Ft+k=At+(ϕ+ϕ2++ϕk)TtF_{t + k} = A_{t} + (\phi + \phi^{2} + \ldots + \phi^{k})T_{t}
  • Tendencia multiplicativa:
    Ft+k=AtTtkF_{t + k} = A_{t}T_{t}^{k}
  • Tendencia multiplicativa amortiguada:
    Ft+k=AtTt(ϕ+ϕ2++ϕk)F_{t + k} = A_{t}T_{t}^{(\phi + \phi^{2} + \ldots + \phi^{k})}

Si se agrega un componente estacional utilizando la misma nomenclatura que para la tendencia, se pueden definir otros modelos de pronóstico para series de tiempo con componentes de tendencia y estacionalidad que se estudian a continuación en la suavización exponencial triple.

Suavización exponencial triple. Método de Holt-Winters y casos especiales

El método de suavización exponencial de dos parámetros de Holt (1957) es generalizado por Winters (1960) con el objetivo de incluir el componente de estacionalidad en el modelo de pronóstico. En ese sentido, el denominado método de Holt-Winters utiliza estimaciones dinámicas para tres componentes de las series de tiempo: nivel, tendencia y estacionalidad. Estos componentes son actualizados en cada período empleando tres parámetros o constantes de suavización.

La estacionalidad puede ser modelada de forma aditiva o multiplicativa, por lo que existen dos modelos del método de suavización exponencial de Holt-Winters. El modelo aditivo es adecuado para series de tiempo con un patrón estacional más o menos constante, mientras que el modelo multiplicativo se recomienda cuando la variación del patrón estacional se incrementa con el nivel de la serie de tiempo.

Holt-Winters: estacionalidad aditiva y multiplicativa
ComponenteAditivaMultiplicativa
NivelAt=α(XtEtL)+(1α)(At1+Tt1)A_t=\alpha(X_t-E_{t-L})+(1-\alpha)(A_{t-1}+T_{t-1})At=αXt/EtL+(1α)(At1+Tt1)A_t=\alpha X_t/E_{t-L}+(1-\alpha)(A_{t-1}+T_{t-1})
TendenciaTt=β(AtAt1)+(1β)Tt1T_t=\beta(A_t-A_{t-1})+(1-\beta)T_{t-1}Tt=β(AtAt1)+(1β)Tt1T_t=\beta(A_t-A_{t-1})+(1-\beta)T_{t-1}
EstacionalidadEt=γ(XtAt)+(1γ)EtLE_t=\gamma(X_t-A_t)+(1-\gamma)E_{t-L}Et=γXt/At+(1γ)EtLE_t=\gamma X_t/A_t+(1-\gamma)E_{t-L}
PronósticoFt+k=At+kTt+EtL+rF_{t+k}=A_t+kT_t+E_{t-L+r}Ft+k=(At+kTt)EtL+rF_{t+k}=(A_t+kT_t)E_{t-L+r}

En todas las tablas, r=1+((k1)modL)r=1+((k-1)\bmod L) selecciona la estación correspondiente del último ciclo disponible. Se utiliza la variante que actualiza Et{E}_{t} con el nivel contemporáneo At{A}_{t}, con 0α,β,γ10\leq\alpha,\beta,\gamma\leq1; γ\gamma no debe trasladarse sin cambios a una formulación que utilice el nivel pronosticado. En métodos multiplicativos se requieren denominadores y estados positivos. Fuente: adaptación de Makridakis et al. (1998).

At{A}_{t} es el nivel; Tt{T}_{t}, la tendencia; Et{E}_{t}, el componente estacional; γ\gamma, su constante de suavización; y LL, la longitud del ciclo.

La estacionalidad aditiva se expresa en las mismas unidades que la serie; la multiplicativa, como un factor relativo al nivel. Esta última requiere datos y estados positivos y puede ser inestable cerca de cero. Para actualizar el nivel se resta o se divide por el índice de la misma estación del ciclo anterior. Las distintas formulaciones de la actualización estacional no deben mezclarse sin ajustar su parametrización.

En este método se añade una constante de suavización para el componente estacional y se supone que el ciclo de estacionalidad contiene LL períodos. De esta forma, existen LL índices de estacionalidad, uno para cada período. Por ejemplo, si las observaciones son mensuales y el ciclo de estacionalidad se repite de forma anual, entonces L=12L = 12 períodos. En cada mes uno de los índices de estacionalidad se actualiza, obteniéndose un nuevo valor junto con la tendencia y el nivel promedio. Luego, con los términos del modelo actualizados, se calcula el pronóstico correspondiente.

Holt-Winters requiere un nivel, una pendiente y LL índices estacionales iniciales. Una aproximación utiliza el promedio del primer ciclo y el cambio medio entre dos ciclos completos. En (26) y (27), el subíndice 0 identifica valores de inicialización; no significa que esas observaciones estuvieran disponibles antes de comenzar la serie. Los datos utilizados para inicializar pertenecen al entrenamiento y deben excluirse de la evaluación del pronóstico.

A0=1L(X1+X2++XL)(26)A_{0} = \frac{1}{L}\left( X_{1}{+ X}_{2} + \ldots + X_{L} \right)\quad (26)

Por otro lado, para calcular el valor inicial del componente de tendencia es conveniente utilizar dos ciclos estacionales ( 2L2L ) completos. De esta manera, se estiman los valores de la tendencia para una estación completa y el valor inicial se calcula utilizando un promedio de orden LL . Esto se expresa como:

T0=1L[XL+1X1L+XL+2X2L++X2LXLL](27)T_{0} = \frac{1}{L}\left\lbrack \frac{X_{L + 1} – X_{1}}{L} + \frac{X_{L + 2} – X_{2}}{L} + \ldots + \frac{X_{2L} – X_{L}}{L} \right\rbrack\quad (27)

A partir del nivel inicial A0{A}_{0}, los índices aproximados del primer ciclo son XjA0X_j-A_0 en el caso aditivo y Xj/A0X_j/A_0 en el multiplicativo, para j=1,,Lj=1,\ldots,L. Los primeros suman cero y los segundos tienen media 1. Una tendencia apreciable puede contaminar estas estimaciones; por eso son puntos de partida, no valores exactos (Makridakis et al., 1998; Hyndman, 2010).

Ajustar una regresión directamente a datos estacionales puede sesgar la pendiente inicial, porque el orden de los picos y valles dentro del ciclo afecta al ajuste. Hyndman (2010) explica este problema y propone estimaciones basadas en una descomposición previa. Si se usa una regresión para inicializar, debe separarse antes el patrón estacional.

Distintas inicializaciones y parámetros pueden producir pronósticos diferentes con el mismo método. Los estados iniciales pueden mejorarse mediante optimización conjunta. Trull et al. (2020) estudian la inicialización en modelos con múltiples estacionalidades; Montgomery et al. (2008) presentan procedimientos para los métodos clásicos.

Holt-Winters admite variantes sin tendencia o con tendencia amortiguada. Los modelos con varias estacionalidades amplían el número de componentes: Taylor (2003a, 2010) estudia doble y triple estacionalidad, y García-Díaz y Trull (2016) presentan modelos para demanda eléctrica. A continuación se muestra estacionalidad multiplicativa con tendencia aditiva amortiguada:

At=α(XtEtL)+(1α)(At1+ϕTt1)A_{t} = \alpha\left( \frac{X_{t}}{E_{t – L}} \right) + (1 – \alpha)(A_{t – 1} + \phi T_{t – 1})
Tt=β(AtAt1)+(1β)ϕTt1T_{t} = \beta\left( A_{t} – A_{t – 1} \right) + (1 – \beta)\phi T_{t – 1}
Et=γXtAt+(1γ)EtLE_t=\gamma\frac{X_t}{A_t}+(1-\gamma)E_{t-L}
Ft+k=[At+(ϕ+ϕ2++ϕk)Tt]EtL+rF_{t + k} = \left\lbrack A_{t} + (\phi + \phi^{2} + \ldots + \phi^{k})T_{t} \right\rbrack E_{t – L + r}

En el pronóstico estacional debe reutilizarse el índice de la estación correspondiente del último ciclo disponible. Para cualquier horizonte k1k\geq1, se define r=1+((k1)modL)r=1+((k-1)\bmod L) y se utiliza EtL+r{E}_{t-L+r}. Escribir EtL+k{E}_{t-L+k} sin esta corrección solo sirve cuando 1kL1\leq k\leq L.

Clasificación de Pegels

La clasificación de Pegels (1969) combina tres formas de tendencia —ausente, aditiva y multiplicativa— con tres formas de estacionalidad. La tabla 1 conserva esas nueve posibilidades con la notación utilizada en estos apuntes. Una combinación posible no es necesariamente adecuada para cualquier serie.

Tabla 1. Clasificación de Pegels. Adaptación de Makridakis et al. (1998).
TendenciaSin estacionalidadEstacionalidad aditivaEstacionalidad multiplicativa
Sin tendenciaNivelNivel + estacionalidadNivel × estacionalidad
AditivaNivel + tendenciaHolt-Winters aditivoHolt-Winters multiplicativo
MultiplicativaCrecimiento proporcionalCrecimiento proporcional + estacionalidadCrecimiento proporcional × estacionalidad

Gardner (1985) amplía la clasificación con tendencia aditiva amortiguada y Taylor (2003b) con tendencia multiplicativa amortiguada. Hyndman et al. (2008) desarrollan su relación con modelos estadísticos. La tabla 2 describe las nueve combinaciones originales, sin amortiguación.

Para compactar las actualizaciones se utilizan cuatro términos auxiliares: Pt{P}_{t}, Qt{Q}_{t}, Rt{R}_{t} y Ut{U}_{t}, definidos en la tabla 2. Los estados siguen siendo At{A}_{t}, Tt{T}_{t} y Et{E}_{t}:

At=αPt+(1α)Qt(28)A_t=\alpha P_t+(1-\alpha)Q_t\quad (28)
Tt=βRt+(1β)Tt1(29)T_t=\beta R_t+(1-\beta)T_{t-1}\quad (29)
Et=γUt+(1γ)EtL(30)E_t=\gamma U_t+(1-\gamma)E_{t-L}\quad (30)

La ecuación (29) se omite si no hay tendencia y (30) si no hay estacionalidad. En la tendencia aditiva, Tt{T}_{t} es un incremento por periodo; en la multiplicativa, un factor de crecimiento. Esta última necesita niveles positivos. La actualización estacional usa el mismo convenio con At{A}_{t} que la tabla de Holt-Winters.

Tabla 2. Actualizaciones de Pegels con notación unificada. Adaptación de Makridakis et al. (1998).
CombinaciónTérminos auxiliaresPronóstico
Sin tendencia / sin estacionalidadPt=XtP_t=X_t
Qt=At1Q_t=A_{t-1}
Ft+k=AtF_{t+k}=A_t
Sin tendencia / estacionalidad aditivaPt=XtEtLP_t=X_t-E_{t-L}
Qt=At1Q_t=A_{t-1}
Ut=XtAtU_t=X_t-A_t
Ft+k=At+EtL+rF_{t+k}=A_t+E_{t-L+r}
Sin tendencia / estacionalidad multiplicativaPt=Xt/EtLP_t=X_t/E_{t-L}
Qt=At1Q_t=A_{t-1}
Ut=Xt/AtU_t=X_t/A_t
Ft+k=(At)EtL+rF_{t+k}=(A_t)E_{t-L+r}
Tendencia aditiva / sin estacionalidadPt=XtP_t=X_t
Qt=At1+Tt1Q_t=A_{t-1}+T_{t-1}
Rt=AtAt1R_t=A_t-A_{t-1}
Ft+k=At+kTtF_{t+k}=A_t+kT_t
Tendencia aditiva / estacionalidad aditivaPt=XtEtLP_t=X_t-E_{t-L}
Qt=At1+Tt1Q_t=A_{t-1}+T_{t-1}
Rt=AtAt1R_t=A_t-A_{t-1}
Ut=XtAtU_t=X_t-A_t
Ft+k=At+kTt+EtL+rF_{t+k}=A_t+kT_t+E_{t-L+r}
Tendencia aditiva / estacionalidad multiplicativaPt=Xt/EtLP_t=X_t/E_{t-L}
Qt=At1+Tt1Q_t=A_{t-1}+T_{t-1}
Rt=AtAt1R_t=A_t-A_{t-1}
Ut=Xt/AtU_t=X_t/A_t
Ft+k=(At+kTt)EtL+rF_{t+k}=(A_t+kT_t)E_{t-L+r}
Tendencia multiplicativa / sin estacionalidadPt=XtP_t=X_t
Qt=At1Tt1Q_t=A_{t-1}T_{t-1}
Rt=At/At1R_t=A_t/A_{t-1}
Ft+k=AtTtkF_{t+k}=A_tT_t^k
Tendencia multiplicativa / estacionalidad aditivaPt=XtEtLP_t=X_t-E_{t-L}
Qt=At1Tt1Q_t=A_{t-1}T_{t-1}
Rt=At/At1R_t=A_t/A_{t-1}
Ut=XtAtU_t=X_t-A_t
Ft+k=AtTtk+EtL+rF_{t+k}=A_tT_t^k+E_{t-L+r}
Tendencia multiplicativa / estacionalidad multiplicativaPt=Xt/EtLP_t=X_t/E_{t-L}
Qt=At1Tt1Q_t=A_{t-1}T_{t-1}
Rt=At/At1R_t=A_t/A_{t-1}
Ut=Xt/AtU_t=X_t/A_t
Ft+k=(AtTtk)EtL+rF_{t+k}=(A_tT_t^k)E_{t-L+r}

Los métodos de suavización exponencial son especialmente útiles para pronósticos de corto plazo y para problemas operativos donde los datos se actualizan con frecuencia. Conviene distinguir, sin embargo, entre el algoritmo de suavización que produce el pronóstico puntual y su formulación como modelo estadístico. Las formulaciones de espacio de estado asociadas a la familia ETS permiten estimar la incertidumbre y construir intervalos de pronóstico, además de generar pronósticos puntuales. Hyndman et al. (2008) desarrollan este enfoque con detalle, y Hyndman y Athanasopoulos (2021) ofrecen una presentación más reciente y aplicada.

¿Qué método de suavización utilizar?

La estructura de la serie ayuda a seleccionar candidatos. Conviene empezar por un método sencillo y añadir tendencia o estacionalidad cuando los datos y el desempeño de pronóstico lo justifiquen. La tabla resume ese primer filtro; no sustituye la validación.

Características de la serieMétodo
Sin tendencia ni estacionalidadPromedio móvil / suavización exponencial simple
Tendencia aproximadamente lineal, sin estacionalidadHolt / suavización exponencial doble
Tendencia amortiguadaHolt con tendencia amortiguada
Tendencia + estacionalidadHolt-Winters
Estacionalidad aproximadamente constanteHolt-Winters aditivo
Estacionalidad proporcional al nivel, con datos positivosHolt-Winters multiplicativo

La comparación debe respetar el tiempo: ajustar con observaciones pasadas y evaluar en periodos posteriores, usando el horizonte que realmente importa. Un modelo útil para anticipar el mes siguiente puede ser insuficiente para planificar compras a seis meses. Además del error medio, conviene revisar sesgos persistentes, errores grandes y patrones que permanezcan sin explicar.

Un α\alpha mayor, una tendencia adicional o una mejor cifra de ajuste no garantizan un mejor pronóstico. Si hay cambios de proceso, faltantes o registros erróneos, el modelo puede estar respondiendo a un problema de datos. Antes de aumentar su complejidad, conviene comprobar qué está representando y qué costo tiene equivocarse en cada dirección.

El Laboratorio de series de tiempo permite explorar patrones, configurar métodos y comparar su desempeño sobre una misma serie. Estos apuntes sirven para interpretar lo que cambia al mover un parámetro y para reconocer cuándo el método deja de ser una representación razonable del problema.

Referencias

  1. Assimakopoulos, V. y Nikolopoulos, K. (2000). The Theta model: A decomposition approach to forecasting. International Journal of Forecasting, 16(4), 521–530.
  2. Brown, R. G. (1959). Statistical Forecasting for Inventory Control. McGraw-Hill.
  3. García-Díaz, J. C. y Trull, O. (2016). Competitive models for the Spanish short-term electricity demand forecasting. En I. Rojas y H. Pomares (eds.), Time Series Analysis and Forecasting (pp. 217–231). Springer.
  4. Gardner, E. S., Jr. (1985). Exponential smoothing: The state of the art. Journal of Forecasting, 4, 1–28.
  5. Gardner, E. S., Jr. y McKenzie, E. (1985). Forecasting trends in time series. Management Science, 31(10), 1237–1246.
  6. Holt, C. C. (1957). Forecasting seasonals and trends by exponentially weighted moving averages. ONR Research Memorandum n.º 52, Carnegie Institute of Technology.
  7. Hyndman, R. J. (2010). Initializing the Holt-Winters method. Hyndsight.
  8. Hyndman, R. J. y Athanasopoulos, G. (2021). Forecasting: Principles and Practice (3.ª ed.). OTexts.
  9. Hyndman, R. J. y Billah, B. (2003). Unmasking the Theta method. International Journal of Forecasting, 19(2), 287–290.
  10. Hyndman, R. J., Koehler, A. B., Ord, J. K. y Snyder, R. D. (2008). Forecasting with Exponential Smoothing: The State Space Approach. Springer.
  11. Makridakis, S., Wheelwright, S. C. y Hyndman, R. J. (1998). Forecasting: Methods and Applications (3.ª ed.). Wiley.
  12. Montgomery, D. C., Jennings, C. L. y Kulahci, M. (2008). Introduction to Time Series Analysis and Forecasting. Wiley.
  13. Pegels, C. C. (1969). Exponential forecasting: Some new variations. Management Science, 15(5), 311–315.
  14. Taylor, J. W. (2003a). Short-term electricity demand forecasting using double seasonal exponential smoothing. Journal of the Operational Research Society, 54, 799–805.
  15. Taylor, J. W. (2003b). Exponential smoothing with a damped multiplicative trend. International Journal of Forecasting, 19(4), 715–725.
  16. Taylor, J. W. (2010). Triple seasonal methods for short-term electricity demand forecasting. European Journal of Operational Research, 204(1), 139–152.
  17. Trigg, D. W. y Leach, A. G. (1967). Exponential smoothing with an adaptive response rate. Operational Research Quarterly, 18(1), 53–59.
  18. Trull, O., García-Díaz, J. C. y Troncoso, A. (2020). Initialization methods for multiple seasonal Holt-Winters forecasting models. Mathematics, 8(2), 268.
  19. Winters, P. R. (1960). Forecasting sales by exponentially weighted moving averages. Management Science, 6(3), 324–342.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Scroll al inicio