GaiaExGaiaEx
Криптотрейдерлер үшін уақыт қатарын болжау
ӘзірлеушіAI & ML12 min read

Криптотрейдерлер үшін уақыт қатарын болжау

Тізбек модельдерімен баға қозғалысын болжау

Жазбаларды бөлісу

Уақыт қатары деректерін түсіну

Уақыт қатары — уақыт бойынша реттелген деректер нүктелерінің тізбегі — әр минуттағы акция бағалары, күндізгі Bitcoin жабылу бағалары, сағаттық температура көрсеткіштері. Уақыт қатарын басқа деректерден ажырататыны — реттің маңызды болуы. Классификация деректер жиынында жолдарды араластыру зиянсыз; уақыт қатарын араластыру оның мағынасын жояды.

Кез келген уақыт қатарының сипатын үш қасиет анықтайды. Тренд — ұзақ мерзімді бағыт — BTC бағасы 2019 жылдың басындағы $3,000-нан 2021 жылдың соңына қарай $60,000-ге дейін көтерілді, анық жоғары тренд. Сезондылық — тұрақты аралықтарда қайталанатын үлгілерге сілтеме жасайды — крипто нарықтары жиі АҚШ нарық сағаттарында көлемнің артуын, ал демалыс күндерінде белсенділіктің азаюын көреді. Тұрақтылық (стационарлық) орташа мен дисперсия сияқты статистикалық қасиеттер уақыт бойы тұрақты қалатынын білдіреді. Қаржы уақыт қатарларының көбі тұрақсыз — бағалар жоғары ағады немесе құлдырайды — бұл тұрақты таралымдарды болжайтын модельдер үшін қиындықтар тудырады.

Кез келген модельге қаржы деректерін бермес бұрын, оны түрлендіру керек. Логарифмдік кірістерді (қатарлас периодтар арасындағы баға қатынасының натурал логарифмі) алу тұрақсыз бағаларды шамамен тұрақты кірістерге айналдырады. Дифференциация — алдыңғы мәнді алу — ұқсас нәтиже береді. Бұл түрлендірулер міндетті емес — олар болжаудың көбі дұрыс жұмыс істеуі үшін алғышарт.

Қаржы уақыт қатарын жіктеу (концептуалды) Тренд Сезондық шайқалу уақыт → Бақыланған = тренд + сезондылық + шуыл (кірістер жиі шуылды тұрақтандырады)
Нақты бағалар баяу ағыс, қайталанатын үлгілер және кездейсоқтықты біріктіреді — модельдер сіз болжағысы келетін бөліктерге бағытталады.

ARIMA: классикалық бенчмарк

ARIMA (Авторегрессия Интегралды Жылжымалы Орташа) уақыт қатары болжауының ондаған жылдық жүйе-аты. Ол үш компонентті ұштастырады: AR(p) алдыңғы p мәнді келесіні болжау үшін пайдаланады, I(d) қатарды тұрақтылыққа жеткізу үшін d рет дифференциациялайды, ал MA(q) өткен болжамдардың қатасын модельдейді.

Қаржы деректері үшін ARIMA критикалық бенчмарк болып қызмет етеді. Сіздің нақты деректер жиыныңызда жақсы дәлденген ARIMA-дан асып түсе алмайтын кез келген машиналық оқыту моделі күрделілікті пайдасыз қосу ғана. Тәжірибеде, ARIMA сигнал-шуыл қатынасы басқарылатын төмен жиілікті деректердің (күндізгі немесе апталық шамдар) қысқа горизонттағы болжамдары үшін күтпеген жақсы нәтиже көрсетеді.

# ARIMA baseline for BTC daily returns
from statsmodels.tsa.arima.model import ARIMA
import pandas as pd

returns = prices.pct_change().dropna()
model = ARIMA(returns, order=(2, 0, 1))  # AR(2), no differencing (returns already stationary), MA(1)
fitted = model.fit()
forecast = fitted.forecast(steps=5)
print(f"AIC: {fitted.aic:.2f}")  # Lower AIC = better model

ARIMA-ның шектеулері күрделі сызықтық емес үлгілер, режим өзгерістері және жоғары өлшемді белгі кеңістіктерімен көрінеді. Осы жерде терең оқыту сахнаға шығады.

ARIMA(p,d,q): өткен мәндер мен қатаның болжамға қалай әсер етеді AR(p) y пайдаланады yt-1…t-p I(d) d дифференциация MA(q) қаталар εt-1…t-q ŷt+1 болжам (p,d,q)-ды ACF/PACF, AIC немесе айналмалы CV арқылы таңдаңыз — содан кейін ML бенчмарктерімен салыстырыңыз. Қаржы кірістері логарифмдік кірістерді тікелей пайдаланғанда жиі d=0 қоятын
Авторегрессия, интеграция (дифференциация) және жылжымалы орташа соққылары бір ықшам сызықтық болжау қозғалтқышына біріктіреді.

Тізбекті модельдеу үшін LSTM желілері

Ұзын қысқа мерзімді жад (LSTM) желілері — тізбекті деректерде ұзақ диапазонды тәуелділіктерді үйренуге арналған рекуррентті нейрондық желі түрі. Қадімгі RNN-дерден айырмашылығы, олар жоғалатын градиенттерден зардап шегіп, бірнеше уақыт қадамынан кейін ақпаратты ұмытады, LSTM-дер ақпаратты жүздеген қадам бойы таңдап ұстап немесе тастай алатын қоректелетін тетік — ұмыту тетігі, кіру тетігі және шығу тетігі — пайдаланады.

Қаржы уақыт қатарлары үшін LSTM-дер ARIMA-дан екі артықшылықты ұсынады: олар сызықтық емес қатынастарды модельдей алады (баға динамикасы сирек сызықтық), және олар бірнеше кіріс белгілерін бір мезгілде қамти алады — тек өткен бағалар ғана емес, көлем, волатильность, қаржыландыру мөлшерлемелері, тапсырыс кітабы теңгерілмегендігі және сіз болжамдық ақпарат алып жүретініне сенетін басқа сигналдар.

LSTM үшін деректерді дайындау мұқият терезелеуді қажет етеді. Сіз белгілі ұзындықты (мыс., 60 уақыт қадамы) кіріс тізбегін мақсат мәнмен (келесі баға немесе кіріс) жұптап құрасыз. Нормализация критикалық — белгілерді [0, 1] шкаласына немесе нөлдік орташа және бірлік дисперсияға таңдандырыңыз. Бірақ мұнда тұзақ бар: скалерді тек үйрену деректерінде дәлдеп, валидация мен тест деректерін сол параметрлермен түрлендіру керек. Толық деректер жиынында дәлдеу болашақ ақпаратты жылыстатады.

Ешқашан бүтін деректер жиынынан есептелген статистика арқылы нормализация жасамаңыз. Скалеріңізді тек үйрену жиынында дәлдеп, содан кейін валидация мен тест жиындарына қолданыңыз. Осы жалғыз қате басқа кез келген деректер дайындау қатесінен көп алдын ала білу жанама әсерін тудырады.

# LSTM data preparation with proper normalization
import numpy as np
from sklearn.preprocessing import MinMaxScaler

def create_sequences(data, window=60):
    X, y = [], []
    for i in range(window, len(data)):
        X.append(data[i - window:i])
        y.append(data[i, 0])  # Predict next close
    return np.array(X), np.array(y)

# Fit scaler on training data ONLY
scaler = MinMaxScaler()
train_scaled = scaler.fit_transform(train_data)
test_scaled = scaler.transform(test_data)  # Transform, don't fit

X_train, y_train = create_sequences(train_scaled)
X_test, y_test = create_sequences(test_scaled)

Назар аудару тетіктері және Temporal Fusion Transformer

Табиғи тіл өндеуді өзгертіп жіберген сол өз-өзіне назар аудару тетігі уақыт қатарлары үшін де сол дәрежеде қуатты болды. LSTM сияқты тізбекті қадам бойынша өндеудің орнына, назар аудару модельге барлық уақыт қадамдарын бір мезгілде қарап, болашақты болжау үшін қайсы тарихи сәттердің ең маңызды екенін үйренуге мүмкіндік береді.

Google Research 2021 жылы ұсынған Temporal Fusion Transformer (TFT) көп-горизонтты уақыт қатары болжауы үшін арнайы құрылған. Ол бірнеше инновацияны ұштастырады:

  • Айнымалы таңдау желілері — қайсы кіріс белгілері маңызды екенін автоматты түрде үйреніп, ішкі интерпретацияны қамтамасыз етеді. Модель баға импульсіне, көлемге немесе қаржыландыру мөлшерлемелеріне көбірек сүйенетінін көруге болады.
  • Қапшықталған қалдық желілері — маңызсыз кірістерді басады және модельге күрделі сызықтық емес белгі әрекеттесулерін басқаруға мүмкіндік береді.
  • Уақыт бойы көп-басты назар аудару — әр болжам горизонты үшін қайсы тарихи уақыт қадамдары ең ақпаратты екенін анықтайды.
  • Квантиль шығыстары — нүкте бағаларынан гөрі болжам аралықтарын (10-, 50-, 90-процентиль) шығарады, бұл сізге белгісіздік өлшемін береді — трейдингтегі тәуекел басқаруы үшін маңызды.

Тәжірибеде, TFT-лер электр энергиясы сұранысын болжау, бөлшек сауда болжамдары және қаржы волатильности модельдеу сияқты бенчмарктерде LSTM-дер мен дәстүрлі модельдерден асып түскен. GaiaEx сияқты платформалар арқылы қолжетімді крипто нарықтары үшін, TFT-нің гетерогенді кірістерді — статикалық метадеректерді (актив типі, листинг күні), белгілі болашақ мәндерді (апта күні, күннің уақыты) және бақыланған уақыт бойынша өзгеретін белгілерді (баға, көлем, тізбектегі көрсеткіштер) өндеу қабілеті оны әсіресе жарасымды етеді.

Тәжірибелік мысал: BTC баға бағытын болжау

Мүмкін болатыннан адал болайық. Ертенгі Bitcoin бағасының нақты мәнін болжау дерлік мүмкін емес. Тиімді нарық гипотезасы (EMH) бағалар барлық қолжетімді ақпаратты қайтадан бейнелейді деп дәлелдейді, бұл тұрақты болжамды ақымақ тапсырма етеді. Криптода EMH-нің осал түрі талас тудырады — нарықтар акциялардан кем тиімді — бірақ шуыл-сигнал қатынасы қатал күйінде қалады.

Реалистік мақсат — бағыттық дәлдік: BTC ашылу бағасынан жоғары ма, төмен бе жабылады? Бұл бинарлы классификация мәселесі көбірек басқарылады, ал 50% дәлдіктен аз ғана жеңілдіктер (мыс., тұрақты 53–55%) дұрыс позиция мөлшері мен тәуекел басқаруымен жоғары табысты болуы мүмкін.

Тәжірибелік құбыр мынадай көрінеді:

  • Белгілер: 60-периодтық кірістер, RSI, MACD гистограммасы, Боллинджер жолағының ені, көлем қатынасы (ағымдағы vs. 20-периодтық орташа), мерзімсіз фьючерстен қаржыландыру мөлшерлемесі, BTC үстемдігі, және ашық қызығушылық өзгерісі.
  • Модель: 128 жасырын бірлік, 0.3 dropout, содан кейін бинарлы классификация үшін sigmoid активациясы бар dense қабатпен екі қабатты LSTM.
  • Бөлу: 2020–2023 жылдарда үйрен, 2024 жылдың қаңтар-маусымында валидациялан, 2024 жылдың шілде-желтоқсанында тестіле. Ешқашан араластырма — әрдайым хронологиялық бөлу.
  • Бағалау: Бағыттық дәлдік, жоғары/төмен болжамдарда дәлдік/толық қабылдау, және — ең маңызды — сигнал бойынша белгілі позиция мөлшерін болжайтын симуляцияланған пайда-шығын.

Модельіңіз үлгіден тыс тест жиынында профит факторы 1.2-ден жоғары 54% бағыттық дәлдікке жетсе, сізде зерттеуге тиісті нәрсе бар. Ол 65% дәлдік көрсетсе, сіз дерлік артық бейімделіпсіз. Қаржы нарықтарындағы нақты артықшылықтар шамалы, ал басқа түрлі айтқан кез келген адам бірнәрсе сатып жүр.

Бағалау көрсеткіштері және ансамбль тәсілдері

Дұрыс көрсеткішті таңдау сізді дұрыс нәрсені оптимизациялап жатқандығыңызды анықтайды. MAE (Орташа Абсолюттік Қате) сіздің болжам қателеріңіздің орташа шамасын деректеріңіздің бірлігінде береді — интуитивті, бірақ ірі қателерді пропорционалды емес жазаламайды. RMSE (Орташа Квадраттық Қателердің Түбірі) орташалаудан бұрын қателерді квадратқа келтіреді, бас қатыны ауыр жазалайды — бір апаттық қате көп жағымсыз болжамдардан маңызды болғанда жарасады. Бағыттық дәлдік моделіңіздің баға жоғары немесе төмен қозғалатынын дұрыс болжаған реттерінің пайызын өлшейді — трейдинг сигналдары үшін жиі ең маңызды көрсеткіш.

Ансамбль тәсілдері дисперсияны азайту және беріктікті жақсарту үшін бірнеше модельдің болжамдарын ұштастырады. Кең тараған тәсілдерге мыналар кіреді:

  • Жай орташалау — LSTM, Transformer және ARIMA болжамдарын орташалау. Әр модель сигналдың басқа аспектісін қамтыса, ансамбль кез келген жеке модельден асып түседі.
  • Стекинг — база модель болжамдарының оптималды ұштастыруын үйрену үшін мета-модель (мыс., градиентті бустерленген ағаш) үйрету.
  • Режимге сезімтал ауыстыру — қайсы модельге сенетінін таңдау үшін волатильность режимін анықтаушыны пайдалану. LSTM трендті нарықтарда жеңіл болса, орташаға қайта оралу моделі диапазондық жағдайларда жақсырақ нәтиже беруі мүмкін.

Қайсы тәсілді таңдағаныңызбен, зерттеу мен өнім арасындағы алшақтық зор екенін есіңізде ұстаныз. Jupyter notebook-та BTC бағытын 55% дәлдікпен болжайтын модель GaiaEx сияқты платформа арқылы тірі орындалғанда кідіріс, слиппаж және транзакция шығындарынан аман шығуы керек. Бағалау құбырыңызды осы шындықтарды күннен бірінен бастап симуляциялайтын түрде құрыңыз — соннан кейін ойланатын нәрсе емес.