DOCUMENTACIÓN DEL MODELO

Cómo se construye, entrena y genera cada predicción

Descripción pública del modelo estadístico, sus dos componentes, el target, la selección de variables, el entrenamiento y la conversión del score en pesos relativos.

01 · OBJETIVO

Qué intenta predecir

El modelo no intenta adivinar un precio exacto. Su objetivo es ordenar las compañías del universo entre sí según su retorno esperado relativo a un horizonte de 10 sesiones.

Para cada fecha se calcula primero el retorno futuro desde la apertura de la sesión siguiente hasta el cierre situado al final del horizonte. Después ese retorno se normaliza de forma cross-sectional frente al resto de compañías disponibles ese día. El target de entrenamiento representa, por tanto, fortaleza o debilidad relativa, no una rentabilidad absoluta garantizada.

02 · UNIVERSO

Qué compañías entran en el modelo

El proceso operativo intenta utilizar el universo europeo completo configurado, no un Top 50. El modelo activo publica el número real de compañías que quedaron disponibles y superaron los controles de datos durante su materialización.

Mercado
EU
Universo del modelo activo
180
Horizonte
10 sesiones

Si un símbolo deja de tener datos utilizables o el proveedor no lo resuelve correctamente, se registra como incidencia de cobertura. Un modelo ya entrenado no incorpora compañías nuevas de forma silenciosa: para ampliar su universo hay que materializar y validar un nuevo modelo.

03 · VARIABLES

Cómo se eligen las features

La ingeniería de variables parte de información disponible hasta la fecha de señal y construye señales de precio, retornos, tendencia, comportamiento relativo y contexto de mercado. Antes del entrenamiento se aplica una política que excluye cualquier columna no permitida por el contrato temporal del modelo.

Después se ejecuta un feature diet exclusivamente con datos de entrenamiento. Cada variable recibe una puntuación basada en su IC diario cross-sectional, la magnitud media de esa relación y la consistencia de su dirección a través del tiempo. Las variables muy redundantes entre sí se filtran mediante correlación de rangos y el conjunto final queda limitado a 120 variables.

La selección se fija antes del ajuste final. Las observaciones forward posteriores no deciden qué features sobreviven.

04 · ENTRENAMIENTO

Cómo se construye el conjunto de entrenamiento

Los datos se ordenan temporalmente por compañía, se generan los targets futuros y se descartan las filas cuyo target todavía no puede conocerse. Las observaciones más recientes reciben un peso ligeramente superior mediante un decaimiento temporal suave.

Para calibrar LightGBM se reserva una ventana reciente de validación de aproximadamente 60 sesiones por compañía y se introduce una purga temporal entre train y validation. Esa separación evita que targets solapados alrededor del corte introduzcan información futura en el proceso de early stopping.

Una vez fijado el número de iteraciones del componente de árboles, los modelos finales se vuelven a ajustar utilizando todo el histórico etiquetado disponible.

05 · COMPONENTES

Cuántos modelos se entrenan y para qué sirve cada uno

El artefacto final contiene dos modelos predictivos complementarios:

  1. 1
    LightGBM.

    Modelo de árboles de gradient boosting. Se utiliza para capturar relaciones no lineales, interacciones entre variables y umbrales que un modelo puramente lineal no puede representar con facilidad. El número de árboles se determina mediante early stopping sobre la ventana purgada de validación.

  2. 2
    Ridge.

    Regresión lineal regularizada. Antes del ajuste sus features se estandarizan con StandardScaler. Su función es aportar una señal lineal, estable y regularizada que complemente la flexibilidad del componente de árboles.

Durante la materialización existen además ajustes temporales destinados a validación: un LightGBM que determina el punto de early stopping y un Ridge ajustado sobre el mismo train para medir su comportamiento fuera de muestra. Después se crean los dos modelos finales que quedan guardados para inferencia.

06 · BLEND

Cómo se combinan LightGBM y Ridge

Los valores numéricos brutos de los dos componentes no se mezclan directamente. En cada sesión, las predicciones de LightGBM se convierten a rango percentil cross-sectional y se hace lo mismo con Ridge. Esto coloca ambos componentes en una escala comparable.

El score final es una combinación fija 50% LightGBM + 50% Ridge en ese espacio de rankings. Los pesos no se recalibran cada día ni se optimizan utilizando resultados live.

07 · INFERENCIA

Qué ocurre cuando se genera una predicción diaria

  1. 1
    Fecha de mercado.

    Se identifica la última sesión completada y se recortan las fuentes para que ninguna variable utilice información posterior.

  2. 2
    Cross-section.

    Se construyen para todas las compañías disponibles exactamente las mismas features que espera el modelo.

  3. 3
    LightGBM.

    El componente de árboles produce una puntuación para cada compañía.

  4. 4
    Ridge.

    Las variables se transforman con el escalador aprendido y el componente lineal genera su propia puntuación.

  5. 5
    Ranking conjunto.

    Ambas puntuaciones se transforman a percentiles del día y se combinan 50/50.

  6. 6
    Publicación.

    Se ordena el universo por score y se publican ticker, nombre de empresa, sector, cierre y pesos relativos.

08 · PESOS RELATIVOS

Cómo pasa el score a un peso objetivo

El benchmark interno parte de un peso equiponderado entre las compañías disponibles. El ranking se centra alrededor de su punto medio para obtener una señal activa relativa: compañías con ranking superior reciben un tilt positivo y compañías con ranking inferior un tilt negativo.

La señal se recentra para mantener neutralidad activa agregada, se limita por compañía y se escala con un presupuesto activo fijo del 25%. Después se suma al benchmark, se impiden pesos finales negativos y se normaliza el conjunto.

El score debe interpretarse como orden relativo. Un score alto indica posición relativa favorable dentro de la cross-section de esa sesión; no equivale directamente a un porcentaje de retorno esperado.

09 · VALIDACIÓN

Cómo se mide el comportamiento del modelo

La validación de entrenamiento utiliza principalmente Rank IC: correlación de Spearman entre el ranking generado y el target relativo observado. También se publican su estabilidad temporal, la fracción de fechas con IC positivo y métricas separadas de LightGBM y Ridge cuando están disponibles.

Las métricas live se mantienen completamente separadas. Solo incorporan eventos posteriores al cutoff del entrenamiento y retornos ya realizados. La curva forward no se completa con backtest ni con datos sintéticos.

10 · LIMITACIONES

Qué no significa una predicción

El modelo estima una relación estadística y un orden relativo; no ofrece certeza sobre el comportamiento futuro. Los cambios de régimen, errores de proveedor, suspensiones, corporate actions, baja cobertura o relaciones que dejan de persistir pueden degradar su rendimiento.

Las métricas anualizadas pueden ser muy inestables cuando la muestra forward es corta. Por eso deben interpretarse junto con el número de días y eventos observados. Las salidas son experimentales y no incorporan objetivos, restricciones ni circunstancias de un inversor individual.