GaiaExGaiaEx
Finansal Piyasalar İçin Makine Öğrenmesine Giriş
GeliştiriciAI & ML11 min read

Finansal Piyasalar İçin Makine Öğrenmesine Giriş

İşlem için denetimli, denetimsiz ve takviyeli öğrenme

Paylaş

Gerçek Dünyada $0 Kazandıran Geriye Dönük Test

2018'de bir kantitatif ekip, fonlarına, geriye dönük testte $100.000'i $4,2 milyona çeviren bir model gösterdi. Özkaynak eğrisi neredeyse mükemmel 45 derecelik bir çizgiydi. Sharpe oranı 4,0'dı — tarihteki neredeyse her hedge fonundan daha iyi. Onu gerçek parayla devreye aldılar.

İlk hafta para kaybetti, sonra kapatana kadar üç ay boyunca kanadı. Kağıt üzerinde $4,2 milyon „kazanan" model, gerçekte hiçbir şey kazanmadı. Hiçbir şey sahte değildi — dolandırıcılık yoktu, bug yoktu. Model, gelecek hakkında bir şey öğrenmek yerine sadece geçmişi ezberlemişti.

Bu hikaye o kadar sık tekrarlanır ki bir adı vardır: geriye dönük test aşırı uyumu (overfitting) ve makine öğrenmesi fonlarının başarısız olmasının tek en büyük nedenidir. Milyarlarca doları ML odaklı stratejilerde yöneten Marcos López de Prado bunu açıkça söyledi: yeterince deneme yapıldığında, herkes saf gürültü üzerinde güzel bir geriye dönük test üretebilir. Piyasa, sinir ağının ne kadar zarif olduğunu önemsemez.

Makine öğrenmesi, piyasaların nasıl işlem gördüğünü gerçekten dönüştürüyor. Ama zekice görünen bir model ile canlı piyasalarla temastan sağ çıkan bir model arasındaki fark devasadır — ve bunları ayırt etmeyi öğrenmek oyunun tamamıdır. Bu ders sana ikisini de öğretir: gerçek avantajlar bulan ML sistemleri nasıl inşa edilir ve ikinci yarıyı atlayan insanları yok eden tuzaklardan nasıl kaçınılır.

Makine Öğrenmesi Nedir — Ve Neden Piyasalar En Zor Vaka

Makine öğrenmesi, bilgisayarların her senaryo için açıkça programlanmadan verilerden örüntüleri öğrenmesini sağlama bilimidir. „RSI 30'un altına düştüğünde al" gibi bir kural yazmak yerine, algoritmaya binlerce tarihsel örnek verirsin ve kârlı işlemlerden önce hangi örüntülerin geldiğini keşfetmesine izin verirsin. Makine deneyimden genelleme yapar — tam olarak deneyimli bir işlemcinin sezgi geliştirmesi gibi, ama herhangi bir insanın kafasında tutabileceğinden daha fazla veri üzerinden.

Finansal piyasalar bunun şaşırtıcı miktarlarını üretir: fiyat tick'leri, emir defteri anlık görüntüleri, fonlama oranları, zincir üstü akışlar, duygu puanları, makro açıklamalar. Geleneksel kural tabanlı stratejiler, sadece yaratıcısının zaten hayal ettiği ilişkileri yakalar. ML modelleri, yüzlerce özellik üzerinde aynı anda doğrusal olmayan, yüksek boyutlu etkileşimleri tespit edebilir — bir insan analistin test etmeyi hiç düşünmeyeceği ilişkiler.

Ama piyasalar tüm uygulamalı ML'deki en düşman ortamdır ve bunun nedeni hakkında dürüst olmakta değer var. Çoğu ML atılımı — görüntü tanıma, dil modelleri — çalışır çünkü altta yatan kurallar hareket etmez. Bir kedi, fotoğraf 2010'da veya 2026'da çekilmiş olsun, kediye benzer. Piyasalar tam tersidir:

  • Veri durağan değildir. Piyasanın istatistiksel „kuralları" rejimler değiştikçe sürekli kayar. Sakin bir boğa piyasasında eğitilen bir model, bir çöküşte etkin biçimde tehlikeli olabilir.
  • Sinyal-gürültü oranı acımasızdır. Görüntü tanımada, neredeyse her piksel bilgi taşır. Getirilerde, fiyat hareketinin büyük çoğunluğu gürültüdür. Kükreyen bir rastgelelik denizinde hafif bir sinyal için maden ariyorsun.
  • Uyarlanabilir düşmanlara karşı rekabet ediyorsun. Bir kedi, sınıflandırıcını kandırmak için görünüşünü değiştirmez. Gerçek bir piyasa avantajı popüler olduğu anda, diğer işlemciler onu arbitrajla eritir. Modelinin başarısı, sessizce kendi avantajını aşındırır.
Kilit içgörü: Finansta ML, en gösterişli modeli inşa etmekle ilgili değildir. Gerçek, dayanıklı bir avantajı güzel bir tesadüften ayırt edebilen dürüst bir doğrulama sürecini inşa etmekle ilgilidir. Model kolay kısımdır. Kendini kandırmamak zor kısımdır — ve çoğu insanın parasını kaybettiği yer burasıdır.

İyi haber: engel artık veriye veya işlem gücüne erişim değil. GaiaEx gibi platformlar, Hyperliquid L1'de gerçek zamanlı ve tarihsel piyasa verisine API erişimi sağlar, dolayısıyla herhangi bir geliştirici ML'nin gerektirdiği veri kümelerini toplayabilir. Kalan engel bilgidir — bu dersin sağladığı tam olarak budur.

Üç Paradigma: Denetimli, Denetimsiz ve Takviyeli Öğrenme

Makine öğrenmesi tek bir teknik değildir — her biri farklı problemlere uygun bir yaklaşımlar ailesidir. Finansta, tüm üç büyük paradigmanın gerçek uygulamaları vardır.

Denetimli öğrenme (supervised learning) iş yükünü taşıyandır. Modele etiketlenmiş örnekler verirsin: bilinen sonuçlarla (hedeflerle) eşleştirilmiş tarihsel özellik vektörleri (girdiler), ve model birinden diğerine bir eşleme öğrenir. İki alt tip finansal kullanımda hakimdir:

  • Sınıflandırma — bir kategoriyi tahmin et. Varlık sonraki saatte yükselecek mi düşecek mi? Bu işlem sahte mi? Çıktı, genellikle bir olasılığa bağlı, ayrık bir etikettir.
  • Regresyonsürekli bir değeri tahmin et. 1 saatlik getiri ne olacak? Adil fonlama oranı nedir? Çıktı bir sayıdır ve model tahmin hatasını minimize eder.

Denetimsiz öğrenme (unsupervised learning), verilerde etiket olmadan yapı bulur. K-Means gibi kümeleme algoritmaları, işlem günlerini piyasa rejimlerine — trend, ortalamaya dönme, yüksek oynaklık — o rejimleri önceden tanımlamana ihtiyaç kalmadan gruplandırabilir. PCA gibi boyut indirgeme, yüzlerce korelasyonlu özelliği bir avuç bağımsız faktöre sıkıştırır, bu da özellik setin örneğinden daha geniş olduğunda önemlidir.

Takviyeli öğrenme (reinforcement learning / RL), kümülatif ödülü maksimize ederek bir dizi karar vermek için bir ajanı eğitir. Ajan bir ortamla (piyasayla) etkileşime girer, eylemler alır (al, sat, tut) ve geri bildirim alır (kâr veya zarar). RL, en iyi eylemin mevcut pozisyonuna, işlem maliyetlerine ve piyasa etkisine bağlı olduğu portföy tahsisi ve emir gerçekleştirme için caziptir. DeepMind'ın oyun oynayan ajanları, bir finans RL araştırma dalgasını esinlendirdi — ama pratik sonuçlar karışık kalıyor, tam olarak çünkü piyasalar durağan değil ve „oyun" kurallarını oyun ortasında değiştiriyor.

Neyle başlamalısın? Sorgusuz sualsiz, denetimli öğrenmeyle. En olgun araç desteğine, en yorumlanabilir sonuçlara ve en dürüst doğrulama metodolojisine sahiptir. Önce sınıflandırma ve regresyonda ustalaş — sonra rejim tespiti için denetimsiz kümelemeyi ve gerçekleştirme için RL'yi keşfet. Doğrudan RL'ye atlamak, kantitatif dünyada ayakta durmayı öğrenmeden koşmaya çalışmanın karşılığıdır.
Denetimli öğrenme (tablosal finans) Özellikler X OHLCV, göstergeler Model f RF, GBM, NN… ŷ sınıf / getiri vs y etiket Kayıp L(ŷ, y) — eğitimde minimize et; sadece gelecek veride doğrula Zamanı asla karıştırma — walk-forward veya purged CV kullan
Denetimli öğrenme özellikleri etiketlerle eşleştirir; iş genelleme yapmaktır, mumları ezberlemek değil.

Özellik Mühendisliği: Ham Veriyi Tahmine Dayalı Sinyallere Çevirmek

Makine öğrenmesinde, özellikler (features), modelin tahmin yapmak için kullandığı girdi değişkenlerdir. Ham OHLCV verisi bir başlangıç noktasıdır, ama ham fiyatları bir modele beslemek bir şefe undan önce ham buğday vermek gibidir — önce onu işlemen gerekir. Özellik mühendisliği, alan uzmanlığının veri bilimiyle buluştuğu yerdir ve çalışan bir model ile işe yaramaz bir model arasındaki fark, algoritma seçiminden çok daha sık burada belirlenir.

Finansal ML için yaygın özellik kategorileri şunları içerir:

  • Teknik göstergeler — RSI, MACD, Bollinger Bandı genişliği, ATR, ADX. Bunlar; momentumu, oynaklığı ve trend gücünü standartlaştırılmış, ölçekten bağımsız girdiler olarak kodlar.
  • Gecikme özellikleri (lag features) — birden fazla ufuk boyunca geçmiş getiriler (1 mum, 5 mum, 20 mum, 60 mum), farklı zaman ölçeklerinde momentumu ve ortalamaya dönmeyi yakalar.
  • Oynaklık ölçümleri — kayan standart sapma, Parkinson oynaklığı (yüksek/düşükten), Garman-Klass tahmincisi. Oynaklık kümelenmesi, tüm finanstaki en güvenilir tipik gerçeklerden biridir.
  • Hacim özellikleri — hacim oranı (mevcut vs. ortalama), bakiyeli hacim (on-balance volume), hacim-fiyat korelasyonu. Alışılmadık hacim genellikle fiyat hareketlerinden önce gelir.
  • Çapraz varlık özellikleri — ETH tahmin ederken BTC'nin getirisini bir girdi olarak kullanmak. Varlıklar arasındaki değişen korelasyonlar genellikle fiyat henüz göstermeden rejim değişikliklerine işaret eder.

İşte Python'da özellik mühendisliğinin pratik bir örneği:

import pandas as pd
import numpy as np

def engineer_features(df: pd.DataFrame) -> pd.DataFrame:
    df["return_1h"] = df["close"].pct_change(1)
    df["return_4h"] = df["close"].pct_change(4)
    df["return_24h"] = df["close"].pct_change(24)
    df["volatility_24h"] = df["return_1h"].rolling(24).std()
    df["rsi_14"] = compute_rsi(df["close"], 14)
    df["volume_ratio"] = df["volume"] / df["volume"].rolling(24).mean()
    df["atr_14"] = compute_atr(df, 14)
    return df.dropna()

İki kural pazarlık konusu değildir. Birincisi, gelecek veriyi asla kullanma — her özellik, tahmin anında mevcut olan bilgiden hesaplanabilir olmalıdır. Kârlı bir strateji „keşfetmenin" en yaygın yolu, yanlışlıkla yarının sayısının bugünün özelliklerine sızmasına izin vermektir. İkincisi, girdilerini normalize et; çoğu ML modeli, özellikler vahşice farklı ölçekler kapsadığında tıkanır (30'luk bir RSI'nın yanında 60.000'lik bir fiyat).

Finansal ML'nin 80/20'si: harika özelliklerdeki vasat bir model, ham fiyatlardaki harika bir modeli her zaman yener. Çabanı en son sinir ağı mimarisini kovalamak yerine buraya harca. Sağlam, sızıntısız özellikler, dayanıklı avantajların gerçekten geldiği yerdir.

En Önemli Bölüm: Zaman Serilerinde Doğrulama

Bu dersin tamamından bir şey hatırlayacaksan, şunu hatırla: standart ML doğrulaması, finansal piyasalar için felaket derecede yanlıştır.

Normal makine öğrenmesinde, verini rastgele karıştırır ve eğitim ile test setlerine bölersin. Bunu zaman serisi fiyat verisiyle yaparsan, modelin geçmişi tahmin etmek için gelecekte eğitilmesine izin vermiş olursun. Doğruluğun muhteşem görünecek. Canlı işlemin bir katliam olacak. Bakış açısı önyargısı (look-ahead bias) olarak bilinen bu tek hata, herhangi bir piyasa çöküşünden daha fazla kantitatif stratejiyi patlattı. Doğru yaklaşım her zaman zamanın okuna saygı gösterir:

Kronolojik eğitim/doğrulama/test bölümü. Veriyi tarihe göre böl: 2020-2022'de eğit, 2023'te doğrula, 2024'te test et. Test seti tam olarak bir kez dokunulur — canlı işlemin senin simülasyondur. Hiperparametreleri ona karşı ayarladığın anda, bir test seti olmaktan çıkar ve örnek dışı performansın dürüst bir tahminini kaybedersin.

Walk-forward doğrulaması (genişleyen veya kayan pencere) daha dayanıklıdır. 1-12. aylarda eğit, 13. ayı tahmin et. Sonra 1-13. (veya 2-13.) aylarda eğit, 14. ayı tahmin et. Tekrarla. Bu, her biri modelin hiç görmediği veriler üzerinde olan, gelişen koşullara uyum sağlarken çok sayıda örnek dışı tahmin üretir — stratejinin gerçekte nasıl devreye alınıp yeniden eğitileceğini yansıtır.

Ayrıştırılmış çapraz doğrulama (purged cross-validation) (Marcos López de Prado tarafından tanıtıldı), örtüşen etiketler üzerinden bilgi sızıntısını durdurmak için eğitim ve test kıvrımları arasına bir boşluk ekler. Hedefin 24 saatlik ileri getiriyse, bir kıvrım sınırına yakın gözlemler bilgi paylaşır; ayrıştırma boşluğu bu kirliliği kaldırır. Test kıvrımından sonraki ek bir „ambargo" dönemi, seri korelasyonun eğitime geri sızmasına karşı korur.

Son olarak, modeli ders kitapları için önemli metriklere göre değil, para için önemli metriklere göre değerlendir. Sadece doğruluk yanıltıcıdır. %51 doğru ama büyük hareketlerde doğru olan bir model çarpıcı biçimde kârlı olabilir; sadece küçük hareketleri isabet ettiren %70 doğru bir model ücretlerden sonra para kaybedebilir. Yönlü çağrılarında kesinliği (precision), ortaya çıkan stratejinin Sharpe oranını ve maksimum değer kaybını (drawdown) takip et — ve her zaman gerçekçi işlem maliyetleri ve kayma sonrası net olarak.

Walk-forward: zaman her zaman soldan sağa akar Eğitim t₁ Doğrulama OOS tek seferlik ayrılan bölüm Eğitim t₁+t₂ Doğrulama OOS Eğitim genişler veya kayar Doğrulama etiketler örtüşürse ayrıştırma boşluğu
Genişleyen veya kayan pencereler devreye almayı taklit eder: model hiçbir zaman gelecekte eğitilmez.

Random Forest, Gradient Boosting ve Doğru Modeli Seçmek

OHLCV mumlarından, teknik göstergelerden ve mühendislik ürünü özelliklerden aldığın türden tablosal finansal veri için, ağaç tabanlı topluluk modelleri derin sinir ağlarını istikrarlı biçimde geride bırakır. Bu bir görüş değildir; iyi kurulmuş bir ampirik sonuçtur (bkz. Grinsztajn ve diğerleri, 2022, „Neden ağaç tabanlı modeller tablosal verilerde hâlâ derin öğrenmeyi geride bırakıyor?"). Görüntüler ve dil için derin öğrenme hüküm sürer. Bir özellik tablosu için ağaçlar kazanır.

Random Forest'lar, her biri satırların ve özelliklerin rastgele bir alt kümesinde eğitilen yüzlerce karar ağacı inşa eder, sonra tahminlerini ortalar. Bu ortalama, varyansı ve aşırı uyumu azaltır. Dayanıklıdırlar, minimum ayarlama gerektirirler ve sana yerleşik bir özellik önem sıralaması sunarlar — modelini gerçekte neyin yönlendirdiğini anlamak için değerli.

Gradient Boosting (XGBoost, LightGBM, CatBoost) ağaçları sıralı olarak inşa eder, her biri şimdiye kadarki topluluğun hatalarını düzeltir. Bu, doğrulukta genellikle random forest'ları geride bırakır ama daha dikkatli ayarlama gerektirir. LightGBM, çoğu finansal ML uygulayıcısı için varsayılan seçimdir: hızlı eğitim, eksik değerlerin yerleşik işlenmesi ve milyonlarca satıra rahatça ölçeklenir.

import lightgbm as lgb
from sklearn.model_selection import TimeSeriesSplit

model = lgb.LGBMClassifier(
    n_estimators=500,
    max_depth=6,
    learning_rate=0.05,
    subsample=0.8,
    colsample_bytree=0.8,
    min_child_samples=50,
)

tscv = TimeSeriesSplit(n_splits=5)
for train_idx, val_idx in tscv.split(X):
    model.fit(X.iloc[train_idx], y.iloc[train_idx],
              eval_set=[(X.iloc[val_idx], y.iloc[val_idx])])

Derin öğrenmenin hâlâ bir yeri var — ama dar bir yer. LSTM'ler ve Transformer'lar, ham sıralı veride gerçekten değer katabilir: mum-mum emir akışı veya fiyatı haber ve sosyal medya duygu metniyle birleştirmek, sıralamanın ve bağlamın düz tabloların çıkardığı bilgiyi taşıdığı yerlerde. Sadece varsayılan olarak onlara başvurma. Mühendislik ürünü özelliklerle yapılandırılmış veri için, GaiaEx'in API'sinden çekilen veri üzerinde eğitilmiş iyi ayarlanmış bir LightGBM, neredeyse her zaman bir sinir ağını yener — ve saatler yerine saniyeler içinde eğitilir.

Kriptoda ML'nin Gerçekten Değer Kattığı Yerler

Fiyat tahmini tüm ilgiyi çeker, ama piyasalarda ML'nin en zor ve en az güvenilir kullanımıdır. En değerli uygulamalardan bazılarının bir sonraki mumu tahmin etmekle hiçbir ilgisi yoktur:

  • Piyasa rejimi tespiti. Denetimsiz kümeleme, piyasa koşullarını rejimlere sıralar — sakin trend, dalgalı ortalamaya dönme, yüksek oynaklık paniği. Hangi rejimde olduğunu bilmek, stratejileri değiştirmeni veya büyüklüğü kesmeni sağlar, bu genellikle herhangi bir tekil yönlü tahminden daha değerlidir.
  • Duygu analizi. Büyük dil modelleri, hiçbir insanın yapamayacağı bir ölçekte haberleri, X/Twitter'ı ve Discord'u okur, piyasa moralindeki değişimleri puanlar. Araştırmalar, bir duygu sinyalini fiyat verisiyle birleştirmenin kripto tahmin doğruluğunu sadece fiyata göre iyileştirdiğini istikrarlı biçimde gösteriyor — duygu, kriptoyu alışılmadık derecede sert hareket ettirir.
  • Dolandırıcılık ve manipülasyon tespiti. ML'nin sessizce parladığı yer burasıdır. Modeller; yıkama işlemini (wash trading), sahte emir vermeyi (spoofing) ve klasik pump-and-dump şemalarını, koordineli bir dampingden önce gelen anormal hacim ve emir defteri örüntülerini fark ederek işaretler. Anomali tespit modelleri (LSTM'ler, Anomaly Transformer'lar), burada hem klasik ML'yi hem de basit istatistiksel eşikleri güvenilir biçimde geride bırakır.
  • Gerçekleştirme ve kayma modellemesi. ML, büyük bir emrin piyasa etkisini tahmin eder, gerçekleştirme algoritmalarının maliyeti minimize etmek için onu dilimlemesine yardımcı olur. Kripto gibi 7/24 bir platformda, sakar bir emrin defteri senin aleyhine hareket ettirebileceği yerde, bu doğrudan kâr hanenizi korur.
  • Risk ve tasfiye yönetimi. Modeller, mevcut oynaklık göz önüne alındığında bir pozisyonun bir risk eşiğini ihlal etme olasılığını tahmin eder, bir çığdan sonra değil önce pozisyonları boyutlandırmaya ve stop'ları ayarlamaya yardımcı olur.
İçselleştirmeye değer bir yeniden çerçeveleme: finanstaki en iyi ML genellikle fiyat tahmin etmiyor — riski yönetiyor ve anomalileri tespit ediyor. Sana güvenilir biçimde „piyasa rejimi az önce döndü, maruziyeti azalt" veya „bu token'ın hacmi devam eden bir pump gibi görünüyor" diyen bir model, bir fiyat tahmincisinin kazandığından daha fazla sermayeyi koruyabilir. Savunma, saldırıdan daha güvenilir biçimde ölçeklenir.

Çoğu ML Stratejisi Neden Başarısız Olur — Ve Bu Sana Ne Öğretir

Dürüst bir eğitim, bunun nasıl ters gittiğini adlandırmak demektir, çünkü genellikle ters gider. Bu tuzaklar, her ayı piyasasının toplamından daha fazla kantitatif stratejiyi yok etti:

  • Aşırı uyum (overfitting). Model, genelleştirilebilir bir şey öğrenmek yerine eğitim verisini ezberler. Çare akıllılık değil disiplindir: daha basit modeller, daha az özellik, düzenlileştirme ve acımasız örnek dışı testler. Geriye dönük testin doğru olamayacak kadar iyi görünüyorsa, öyledir.
  • Bakış açısı önyargısı (look-ahead bias). Karar anında mevcut olmayan bilgiyi kullanmak — bölmeden önce tam veri kümesinde özellikleri hesaplamak, sonradan revize edilen fiyatları kullanmak veya (herkesin kabul ettiğinden daha yaygın) hedef değişkeni özellik setinde bırakmak.
  • Hayatta kalma önyargısı (survivorship bias). Sadece bugün hâlâ var olan varlıklarla eğitim. Listeden çıkarılmış token'lar, batırılmış (rugged) projeler ve ölü coin'ler, veri kümenden sessizce eksiktir, bu da her sonucu yukarı doğru çarpıtır. Kriptoda bu ciddidir — binlerce token sıfıra gitti.
  • Durağan olmama (non-stationarity). Piyasa dağılımları kayar. 2021 boğa piyasasında eğitilen bir model, 2022 ayı piyasasında başarısız olur çünkü öğrendiği kurallar artık geçerli değildir. Düzenli olarak yeniden eğitmeli ve dağılım kaymasını izlemelisin, „kur ve unut" değil.
  • Çoklu test tuzağı. 1.000 strateji varyasyonu dene ve birkaçı saf şans eseri zekice görünecektir. „$4,2 milyonluk" geriye dönük testin nasıl gerçekleştiği tam olarak budur. Deflated Sharpe Oranı gibi araçlar, sadece yeterince araştırarak bulduğun performansı iskonto etmek için özellikle vardır.
  • Araştırmadan üretime geçiş boşluğu. Geriye dönük testler, sürtünmesiz, anlık gerçekleşmeler varsayar. Canlı piyasalar; teorik getirilerin rutin olarak %30-70'ini kesen kayma, ücretler, gecikme ve piyasa etkisi getirir — ve „kârlı" bir stratejiyi negatife çevirebilir.

Bu listenin altında daha derin bir nokta gizlidir. Piyasalar bir düşman, uyarlanabilir sistemdir — her gerçek avantaj, onu arbitrajla eriten rakipler çeker. Bir yıl boyunca kazanan bir model, kodunun hiçbir kusuru olmadan, kalabalıklaştığı ay çalışmayı durdurabilir. Başarılı kantitatif operasyonların tek bir mükemmel model aramamasının nedeni budur; piyasa geliştikçe avantajları bulmaya, doğrulamaya ve emekliye ayırmaya devam etmek için bir hat (pipeline) inşa ederler.

Dürüst çıkarım: ML sana para basan bir makine vermeyecek ve sana bir tane satan herkes aşırı uyumlu bir geriye dönük test satıyordur. Sana verdiği şey, küçük, gerçek avantajları bulmak için ve — aynı derecede önemli olarak — sahtelerini sana maliyet oluşturmadan önce reddetmek için titiz, tekrarlanabilir bir süreçtir. Disiplin, alfadır.

GaiaEx Üzerine İnşa Etmek: İlk Uçtan Uca Projen

Okuduğun her kantitatif beceri, önce bir şeye bağlıdır: temiz, güvenilir veri. GaiaEx'in ML iş akışına uyduğu yer burasıdır. İşlemler Hyperliquid L1'de gerçekleştiği için, her gerçekleşme, fonlama oranı ve emir defteri değişikliği zincir üstünde kaydedilir ve GaiaEx API'si üzerinden açığa çıkarılır — bu sana, birçok merkezi veri akışının musallat olduğu boşluklar ve sessiz revizyonlar olmadan şeffaf, ayrıntılı, gerçek zamanlı ve tarihsel veri verir.

Zincir üstü verinin ML için neden önemli olduğu: bir model ancak girdileri kadar dürüsttür. Eğitim verin, bir kara kutu iç veritabanı yerine şeffaf bir L1'den geldiğinde, öğrendiğin fiyatların ve hacimlerin gerçekten işlem gören fiyatlar ve hacimler olduğuna güvenebilirsin. Bu, incelikli bir veri bütünlüğü bug'ları kategorisinin tamamını, özelliklerine hiç ulaşmadan ortadan kaldırır.

İlk projen bilinçli olarak basit olmalı. Hedef, ilk denemede piyasayı yenmek değildir — üzerinde iterasyon yapabileceğin, tam, sızıntısız bir hat inşa etmektir. İşte somut bir yol haritası:

  • GaiaEx'in API'sinden BTC/USDC için 1 saatlik mum verisi topla — en az 6 ay.
  • 10-15 özellik mühendisliği yap: gecikmeli getiriler, RSI, ATR, hacim oranı, Bollinger Bandı genişliği.
  • Her mumu etiketle: sonraki 4 saatlik getiri pozitifse 1, aksi halde 0.
  • Walk-forward doğrulaması kullanarak bir LightGBM sınıflandırıcı eğit — hiçbir zaman rastgele bir bölme değil.
  • Gerçekçi ücretleri çıkardıktan sonra, model 1 tahmin ettiğinde uzun pozisyona giren basit bir stratejinin kesinliğini, geri çağırmasını ve Sharpe oranını değerlendir.

Sonra — ve bu, yeni başlayanların atladığı kısımdır — bozmaya çalış. Bir ayrıştırma boşluğu ekle ve avantajının hayatta kalıp kalmadığına bak. Herhangi bir özelliğin gizlice geleceği sızdırıp sızdırmadığını kontrol et. Farklı bir zaman penceresinde test et. Avantaj inceleme altında buharlaşırsa, gerçekten değerli bir şey öğrendin: hiçbir zaman gerçek olmadığını ve bunu sermayenle değil bedavaya öğrendiğini.

Hat, üründür. Veri toplama, özellik mühendisliği, doğrulama ve dürüst değerlendirme — bileşen bu makinedir. Alfa, aylar boyunca onu geliştirmekten gelir, tek bir şanslı modelden değil. GaiaEx sana şeffaf veriyi ve L1 gerçekleştirmesini verir; titizlik sana kalır ve tüm kantitatif işlemlerdeki en aktarılabilir beceridir.