
Introducción al machine learning para los mercados financieros
Aprendizaje supervisado, no supervisado y por refuerzo para el trading
El backtest que generó $0 en el mundo real
En 2018, un equipo cuantitativo mostró a su fondo un modelo que convertía $100.000 en $4,2 millones en un backtest. La curva de patrimonio era una línea casi perfecta de 45 grados. El ratio de Sharpe era de 4,0 — mejor que casi cualquier hedge fund de la historia. Lo desplegaron con dinero real.
Perdió dinero en la primera semana, y luego se desangró durante tres meses antes de que lo cerraran. El modelo que «ganó» $4,2 millones sobre el papel no ganó nada en la realidad. No se había falseado nada — sin fraude, sin fallo. El modelo simplemente había memorizado el pasado en lugar de aprender algo sobre el futuro.
Esta historia se repite tan a menudo que tiene nombre: sobreajuste del backtest (backtest overfitting), y es la razón número uno por la que fracasan los fondos basados en machine learning. Marcos López de Prado — que ha gestionado miles de millones en estrategias impulsadas por ML — lo dijo sin rodeos: con suficientes intentos, cualquiera puede producir un backtest precioso sobre pura aleatoriedad. Al mercado no le importa lo elegante que sea tu red neuronal.
El machine learning está transformando genuinamente cómo se opera en los mercados. Pero la brecha entre un modelo que parece brillante y uno que sobrevive al contacto con los mercados en vivo es enorme — y aprender a distinguir entre ambos es el juego completo. Esta lección te enseña ambas cosas: cómo construir sistemas de ML que encuentren ventajas reales, y cómo evitar las trampas que destruyen a quienes se saltan la segunda mitad.
Qué es el machine learning — y por qué los mercados son el caso más difícil
El machine learning es la ciencia de conseguir que los ordenadores aprendan patrones a partir de datos sin ser programados explícitamente para cada escenario. En lugar de escribir una regla como «compra cuando el RSI caiga por debajo de 30», alimentas al algoritmo con miles de ejemplos históricos y dejas que descubra qué patrones preceden a las operaciones rentables. La máquina generaliza a partir de la experiencia — exactamente como un trader experimentado desarrolla intuición, pero con más datos de los que cualquier humano podría retener en la cabeza.
Los mercados financieros generan volúmenes ingentes de datos: ticks de precio, fotografías del libro de órdenes, tasas de financiamiento, flujos on-chain, puntuaciones de sentimiento, publicaciones macroeconómicas. Las estrategias tradicionales basadas en reglas solo capturan las relaciones que su creador ya había imaginado. Los modelos de ML pueden detectar interacciones no lineales y de alta dimensionalidad entre cientos de variables a la vez — relaciones que a un analista humano nunca se le ocurriría probar.
Pero los mercados son el entorno más hostil de todo el ML aplicado, y merece la pena ser honesto sobre por qué. La mayoría de los avances del ML — reconocimiento de imágenes, modelos de lenguaje — funcionan porque las reglas subyacentes no cambian. Un gato parece un gato tanto si la foto se tomó en 2010 como en 2026. Los mercados son lo contrario:
- Los datos no son estacionarios. Las «reglas» estadísticas del mercado cambian constantemente a medida que cambian los regímenes. Un modelo entrenado en un mercado alcista tranquilo puede ser activamente peligroso en un crash.
- La relación señal-ruido es brutal. En el reconocimiento de imágenes, casi todos los píxeles llevan información. En los rendimientos, la inmensa mayoría del movimiento de precio es ruido. Estás excavando en busca de una señal débil en un mar rugiente de aleatoriedad.
- Compites contra adversarios adaptativos. Un gato no cambia su aspecto para engañar a tu clasificador. En el momento en que una ventaja real del mercado se hace popular, otros traders la arbitran hasta que desaparece. El propio éxito de tu modelo erosiona silenciosamente su ventaja.
La buena noticia: la barrera ya no es el acceso a los datos ni a la computación. Plataformas como GaiaEx proporcionan acceso mediante API a datos de mercado en tiempo real e históricos en Hyperliquid L1, así que cualquier desarrollador puede recopilar los conjuntos de datos que necesita el ML. La barrera que queda es el conocimiento — que es exactamente lo que aporta esta lección.
Tres paradigmas: aprendizaje supervisado, no supervisado y por refuerzo
El machine learning no es una sola técnica — es una familia de enfoques, cada uno adecuado para problemas distintos. En finanzas, los tres paradigmas principales tienen aplicaciones reales.
El aprendizaje supervisado es el caballo de batalla. Le das al modelo ejemplos etiquetados: vectores de características históricos (entradas) emparejados con resultados conocidos (objetivos), y el modelo aprende una correspondencia de uno a otro. Dos subtipos dominan el uso financiero:
- Clasificación — predecir una categoría. ¿Subirá o bajará el activo en la próxima hora? ¿Es fraudulenta esta transacción? La salida es una etiqueta discreta, normalmente con una probabilidad asociada.
- Regresión — predecir un valor continuo. ¿Cuál será el rendimiento a 1 hora? ¿Cuál es la tasa de financiamiento justa? La salida es un número, y el modelo minimiza el error de predicción.
El aprendizaje no supervisado encuentra estructura en los datos sin etiquetas. Algoritmos de clustering como K-Means pueden agrupar días de trading en regímenes de mercado — tendencial, de reversión a la media, alta volatilidad — sin que tú definas esos regímenes de antemano. La reducción de dimensionalidad como el PCA comprime cientos de características correlacionadas en un puñado de factores independientes, algo que importa cuando tu conjunto de características es más ancho de lo que tu muestra es profunda.
El aprendizaje por refuerzo (RL) entrena a un agente para tomar una secuencia de decisiones maximizando la recompensa acumulada. El agente interactúa con un entorno (el mercado), toma acciones (comprar, vender, mantener), y recibe retroalimentación (beneficio o pérdida). El RL resulta atractivo para la asignación de carteras y la ejecución de órdenes, donde la mejor acción depende de tu posición actual, los costes de transacción y el impacto en el mercado. Los agentes de DeepMind que jugaban videojuegos inspiraron una ola de investigación en RL para finanzas — pero los resultados prácticos siguen siendo desiguales, precisamente porque los mercados son no estacionarios y el «juego» sigue cambiando sus reglas a mitad de partida.
Ingeniería de características: convertir datos en bruto en señales predictivas
En machine learning, las características (features) son las variables de entrada que el modelo usa para hacer predicciones. Los datos OHLCV en bruto son un punto de partida, pero alimentar precios brutos a un modelo es como darle a un chef trigo en bruto en vez de harina — hay que procesarlo primero. La ingeniería de características es donde el conocimiento del dominio se encuentra con la ciencia de datos, y con mucha más frecuencia es la diferencia entre un modelo que funciona y uno inútil que la elección del algoritmo.
Las categorías de características habituales en el ML financiero incluyen:
- Indicadores técnicos — RSI, MACD, ancho de las Bandas de Bollinger, ATR, ADX. Estos codifican el momentum, la volatilidad y la fuerza de la tendencia como entradas estandarizadas e invariantes a la escala.
- Características retardadas (lag) — rendimientos pasados en múltiples horizontes (1 barra, 5 barras, 20 barras, 60 barras), capturando el momentum y la reversión a la media en distintas escalas temporales.
- Medidas de volatilidad — desviación estándar móvil, volatilidad de Parkinson (a partir del máximo/mínimo), el estimador de Garman-Klass. La agrupación de volatilidad (volatility clustering) es uno de los hechos estilizados más fiables en todas las finanzas.
- Características de volumen — ratio de volumen (actual frente a promedio), volumen en balance (on-balance volume), correlación volumen-precio. Un volumen inusual con frecuencia precede a los movimientos de precio.
- Características entre activos — el rendimiento de BTC como entrada al predecir ETH. Los cambios de correlación entre activos a menudo señalan un cambio de régimen antes de que lo haga el precio.
Aquí tienes un ejemplo práctico de ingeniería de características en Python:
import pandas as pd
import numpy as np
def engineer_features(df: pd.DataFrame) -> pd.DataFrame:
df["return_1h"] = df["close"].pct_change(1)
df["return_4h"] = df["close"].pct_change(4)
df["return_24h"] = df["close"].pct_change(24)
df["volatility_24h"] = df["return_1h"].rolling(24).std()
df["rsi_14"] = compute_rsi(df["close"], 14)
df["volume_ratio"] = df["volume"] / df["volume"].rolling(24).mean()
df["atr_14"] = compute_atr(df, 14)
return df.dropna()
Dos reglas no son negociables. Primero, nunca uses datos futuros — toda característica debe ser calculable a partir de información disponible en el momento de la predicción. La forma más habitual de «descubrir» una estrategia rentable es dejar que, por accidente, el número de mañana se filtre en las características de hoy. Segundo, normaliza tus entradas; la mayoría de los modelos de ML se atascan cuando las características abarcan escalas radicalmente distintas (un precio de 60.000 al lado de un RSI de 30).
La sección más importante: validar en series temporales
Si recuerdas una sola cosa de toda esta lección, que sea esta: la validación estándar de ML es catastróficamente incorrecta para los mercados financieros.
En el machine learning normal, mezclas tus datos aleatoriamente y los divides en conjuntos de entrenamiento y prueba. Haz eso con datos de precios de series temporales y acabas de dejar que el modelo entrene con el futuro para predecir el pasado. Tu precisión parecerá espectacular. Tu trading en vivo será una masacre. Este único error — conocido como sesgo de anticipación (look-ahead bias) — es responsable de más estrategias cuantitativas destruidas que cualquier crash del mercado. El enfoque correcto siempre respeta la flecha del tiempo:
División cronológica en entrenamiento/validación/prueba. Divide los datos por fecha: entrena con 2020-2022, valida con 2023, prueba con 2024. El conjunto de prueba se toca exactamente una vez — es tu simulación del trading en vivo. En el momento en que ajustas hiperparámetros contra él, deja de ser un conjunto de prueba y pierdes cualquier estimación honesta del rendimiento fuera de muestra.
La validación walk-forward (con ventana expansiva o deslizante) es más robusta. Entrena con los meses 1-12, predice el mes 13. Luego entrena con los meses 1-13 (o 2-13), predice el mes 14. Repite. Esto genera muchas predicciones fuera de muestra, cada una sobre datos que el modelo nunca ha visto, adaptándose a las condiciones cambiantes — refleja cómo se desplegaría y reentrenaría realmente la estrategia.
La validación cruzada con purga (introducida por Marcos López de Prado) añade un hueco entre los folds de entrenamiento y prueba para evitar que se filtre información a través de etiquetas solapadas. Si tu objetivo es el rendimiento a 24 horas vista, las observaciones cercanas a un límite de fold comparten información; el hueco de purga elimina esa contaminación. Un periodo adicional de «embargo» después del fold de prueba protege contra la correlación serial que se filtra de vuelta al entrenamiento.
Por último, juzga el modelo con métricas que importen para el dinero, no para los libros de texto. La precisión (accuracy) por sí sola es engañosa. Un modelo que acierta el 51% de las veces pero acierta en los grandes movimientos puede ser enormemente rentable; un modelo que acierta el 70% pero solo clava los movimientos pequeños puede perder dinero después de las comisiones. Sigue la precisión (precision) de tus llamadas direccionales, el ratio de Sharpe de la estrategia resultante, y el drawdown máximo — y siempre netos de costes de transacción y slippage realistas.
Random Forests, Gradient Boosting y cómo elegir el modelo adecuado
Para datos financieros tabulares — del tipo que obtienes de velas OHLCV, indicadores técnicos y características diseñadas — los modelos de conjunto basados en árboles superan consistentemente a las redes neuronales profundas. No es una opinión; es un resultado empírico bien establecido (ver Grinsztajn et al., 2022, «Why do tree-based models still outperform deep learning on tabular data?»). Para imágenes y lenguaje, el deep learning manda. Para una tabla de características, ganan los árboles.
Los Random Forests construyen cientos de árboles de decisión, cada uno entrenado con un subconjunto aleatorio de filas y características, y luego promedian sus predicciones. Este promediado reduce la varianza y el sobreajuste. Son robustos, necesitan un ajuste mínimo, y te dan de serie una clasificación de importancia de características — inestimable para entender qué está realmente impulsando tu modelo.
El Gradient Boosting (XGBoost, LightGBM, CatBoost) construye árboles de forma secuencial, cada uno corrigiendo los errores del conjunto hasta ese momento. Normalmente supera a los random forests en precisión, pero exige un ajuste más cuidadoso. LightGBM es la opción por defecto para la mayoría de los profesionales del ML financiero: entrenamiento rápido, manejo nativo de valores ausentes, y escala cómodamente a millones de filas.
import lightgbm as lgb
from sklearn.model_selection import TimeSeriesSplit
model = lgb.LGBMClassifier(
n_estimators=500,
max_depth=6,
learning_rate=0.05,
subsample=0.8,
colsample_bytree=0.8,
min_child_samples=50,
)
tscv = TimeSeriesSplit(n_splits=5)
for train_idx, val_idx in tscv.split(X):
model.fit(X.iloc[train_idx], y.iloc[train_idx],
eval_set=[(X.iloc[val_idx], y.iloc[val_idx])])
El deep learning todavía tiene su lugar — pero uno acotado. Las LSTM y los Transformers pueden aportar valor genuino sobre datos secuenciales en bruto: el flujo de órdenes tick a tick, o la fusión de precio con el texto de noticias y sentimiento de redes sociales, donde el orden y el contexto llevan información que las tablas planas descartan. Simplemente no acudas a ellos por defecto. Para datos estructurados con características diseñadas, un LightGBM bien ajustado entrenado con datos extraídos de la API de GaiaEx casi siempre superará a una red neuronal — y entrena en segundos en lugar de horas.
Dónde el ML gana realmente su sustento en cripto
La predicción de precios se lleva toda la atención, pero es el uso más difícil y menos fiable del ML en los mercados. Algunas de las aplicaciones más valiosas no tienen nada que ver con predecir la próxima vela:
- Detección de régimen de mercado. El clustering no supervisado clasifica las condiciones del mercado en regímenes — tendencial tranquilo, de reversión a la media agitado, pánico de alta volatilidad. Saber en qué régimen estás te permite cambiar de estrategia o reducir el tamaño, lo que a menudo vale más que cualquier predicción direccional individual.
- Análisis de sentimiento. Los modelos de lenguaje grandes leen noticias, X/Twitter y Discord a una escala que ningún humano puede, puntuando los cambios en el ánimo del mercado. La investigación muestra consistentemente que fusionar una señal de sentimiento con datos de precio mejora la precisión de la predicción cripto frente al precio solo — el sentimiento mueve las criptomonedas de forma inusualmente fuerte.
- Detección de fraude y manipulación. Aquí es donde el ML brilla silenciosamente. Los modelos señalan wash trading, spoofing y esquemas clásicos de pump-and-dump al detectar patrones anómalos de volumen y de libro de órdenes que preceden a un vaciado coordinado. Los modelos de detección de anomalías (LSTM, Anomaly Transformers) superan de forma fiable tanto al ML clásico como a los umbrales estadísticos simples en este terreno.
- Modelado de ejecución y slippage. El ML predice el impacto en el mercado de una orden grande, ayudando a los algoritmos de ejecución a trocearla para minimizar el coste. En un mercado 24/7 como el de las criptomonedas, donde una orden torpe puede mover el libro en tu contra, esto protege directamente tu resultado.
- Gestión de riesgo y liquidaciones. Los modelos estiman la probabilidad de que una posición rompa un umbral de riesgo dada la volatilidad actual, ayudando a dimensionar posiciones y fijar stops antes de una cascada en lugar de después.
Por qué fracasan la mayoría de las estrategias de ML — y qué te enseña eso
Una educación honesta implica nombrar cómo sale mal esto, porque normalmente sale mal. Estas trampas han destruido más estrategias cuantitativas que todos los mercados bajistas juntos:
- Sobreajuste (overfitting). El modelo memoriza los datos de entrenamiento en lugar de aprender algo generalizable. La cura es disciplina, no ingenio: modelos más simples, menos características, regularización y pruebas fuera de muestra despiadadas. Si tu backtest parece demasiado bueno para ser verdad, lo es.
- Sesgo de anticipación (look-ahead bias). Usar información que no estaba disponible en el momento de la decisión — calcular características sobre el conjunto de datos completo antes de dividirlo, usar precios que se revisaron a posteriori, o (más habitual de lo que nadie admite) dejar la variable objetivo dentro del conjunto de características.
- Sesgo de supervivencia (survivorship bias). Entrenar solo con activos que todavía existen hoy. Los tokens deslistados, los proyectos «rugueados» y las monedas muertas faltan silenciosamente de tu conjunto de datos, lo cual sesga todo resultado hacia arriba. En cripto esto es severo — miles de tokens han llegado a cero.
- No estacionariedad. Las distribuciones del mercado cambian. Un modelo entrenado en un mercado alcista de 2021 falla en un mercado bajista de 2022 porque las reglas que aprendió ya no se sostienen. Debes reentrenar con regularidad y vigilar la deriva de la distribución, no «configurar y olvidar».
- La trampa de las pruebas múltiples. Prueba 1.000 variaciones de una estrategia y unas pocas parecerán brillantes por pura suerte. Así es como sucede ese backtest de «$4,2 millones». Herramientas como el Deflated Sharpe Ratio existen precisamente para descontar el rendimiento que encontraste solo por buscar con suficiente insistencia.
- La brecha de investigación a producción. Los backtests asumen ejecuciones instantáneas y sin fricción. Los mercados en vivo imponen slippage, comisiones, latencia e impacto en el mercado que habitualmente recortan entre un 30% y un 70% de los rendimientos teóricos — y pueden convertir una estrategia «rentable» en negativa.
Hay un punto más profundo escondido en esta lista. Los mercados son un sistema adversario y adaptativo — toda ventaja real atrae a competidores que la arbitran hasta que desaparece. Un modelo que gana durante un año puede dejar de funcionar el mes en que se abarrota, sin culpa alguna de su código. Por eso las operaciones cuantitativas exitosas no buscan un modelo perfecto único; construyen un pipeline para seguir encontrando, validando y retirando ventajas a medida que el mercado evoluciona.
Construir sobre GaiaEx: tu primer proyecto de extremo a extremo
Toda habilidad cuantitativa de la que has leído depende primero de una cosa: datos limpios y fiables. Aquí es donde GaiaEx encaja en tu flujo de trabajo de ML. Como las operaciones se ejecutan en Hyperliquid L1, cada ejecución, tasa de financiamiento y cambio en el libro de órdenes queda registrado on-chain y expuesto a través de la API de GaiaEx — dándote datos transparentes, granulares, en tiempo real e históricos, sin los huecos y las revisiones silenciosas que aquejan a muchos feeds de datos centralizados.
Por qué importan los datos on-chain para el ML: un modelo es tan honesto como sus entradas. Cuando tus datos de entrenamiento vienen de una L1 transparente en lugar de una base de datos interna de caja negra, puedes confiar en que los precios y volúmenes de los que estás aprendiendo son los precios y volúmenes que realmente se negociaron. Eso elimina toda una categoría de fallos sutiles de integridad de datos antes de que lleguen siquiera a tus características.
Tu primer proyecto debería ser deliberadamente sencillo. El objetivo no es vencer al mercado en el primer intento — es construir un pipeline completo y sin filtraciones sobre el que puedas iterar. Aquí tienes una hoja de ruta concreta:
- Recopila datos de velas de 1 hora para BTC/USDC desde la API de GaiaEx — al menos 6 meses.
- Diseña entre 10 y 15 características: rendimientos retardados, RSI, ATR, ratio de volumen, ancho de las Bandas de Bollinger.
- Etiqueta cada barra: 1 si el rendimiento a las próximas 4 horas es positivo, 0 en caso contrario.
- Entrena un clasificador LightGBM usando validación walk-forward — nunca una división aleatoria.
- Evalúa la precisión, el recall y el ratio de Sharpe de una estrategia simple que se pone larga cuando el modelo predice 1, después de restar comisiones realistas.
Después — y esta es la parte que los principiantes se saltan — intenta romperlo. Añade un hueco de purga y comprueba si tu ventaja sobrevive. Verifica si alguna característica está filtrando el futuro en secreto. Pruébalo en una ventana temporal distinta. Si la ventaja se evapora bajo escrutinio, has aprendido algo genuinamente valioso: que nunca fue real, y lo descubriste gratis en vez de con tu capital.


