Fit-Flash — DP-PAL Öğrenme Modeli
💡 Makalenin tamamını okumak için görselin üzerine veya buraya tıklayarak PDF'i açabilirsiniz.
Fit-Flash — DP-PAL Öğrenme Modeli
Kairodyne Dynamics — Araştırma Notu - KOD: KD-DP-PAL-2026-001
Durum: Test eğitimi aşamasında — bulgular küçük ölçekte doğrulanmış, tam ölçekli sonuçlar henüz üretilmedi.
Fit-Flash Bir Bilgiyi Nasıl Öğrenir?
Klasik modeller her olguyu, milyonlarca küçük deneme-yanılma adımıyla (SGD/AdamW) yavaş yavaş tahmin etmeyi öğrenir. DP-PAL'de Fit-Flash, olguları tek bir denklemle doğrudan hesaplayıp yazar (RDP-WI) — sonra ayrı bir adımda, o bilgiyi cümle içinde nasıl kullanacağını (Nedensel Hizalama) öğrenir.
| Öğrenme Yolu | Mekanizma | Süreç |
|---|---|---|
| Klasik SGD | Geri yayılım (Backpropagation) | Model, aynı olguyu her seferinde biraz daha yakın tahmin ederek, yüzlerce turda (step) öğrenir. |
| DP-PAL / RDP-WI | Kapalı-Form Analitik Çözüm | Model, olguyu kapalı-form bir denklemle tek seferde (1 adım) çözerek doğrudan ağırlıklara yazar. |
Neden İki Farklı Yol?
Ezber ile mantık yürütme, aynı işlem değildir. Bir olguyu bilmek ile o olguyu doğru bağlamda kullanabilmek, aslında iki farklı öğrenme türüdür. Klasik eğitim bu ikisini tek bir kayıp fonksiyonunda birleştirir; DP-PAL ise bunları iki ayrı faza ayırır.
Paradigma Karşılaştırması
| Özellik | Klasik Paradigma (Ham veri + talimat → SGD/AdamW) | DP-PAL Paradigması (Ham veri → Faz 1 → Talimat → Faz 2) |
|---|---|---|
| Süre | Aylarca, yüzlerce/binlerce step | Faz 1: Saniyeler/dakikalar (kapalı form çözüm) Faz 2: Hızlı nedensel hizalama |
| Bellek | Aktivasyon + gradyan + optimizör durumu (Yüksek VRAM) | Geri yayılım yok; sadece $H^T H$ birikim matrisi |
| Geri Çağırma/Unutma Risk | Yeni veri, eski olguların üzerine yazılır (Felaket Unutma) | Bellek katmanı Faz 2'de donuk kalır, üzerine yazılmaz |
| Çıktı Yapısı | Tek, ayrıştırılamaz ağırlık matrisi | Ayrık bellek katmanı + ayrık mantık katmanı |
Faz 1: Epistemik Bellek (RDP-WI)
Olguyu Formülle "Kazımak"
Fit-Flash, cümleyi klasik anlamda "öğrenmez" — okur, gizli durumunu çıkarır ve son katmanın ağırlıklarını tek bir denklemle doğrudan hesaplar. Deneme, hata veya geri yayılım yoktur.
Eğitim Verisi Formatı (SpiralDatasetFormatter)
"<|begin_of_text|>İstanbul 1453 yılında Fatih Sultan Mehmet tarafından fethedilmiştir.<|eot_id|><|end_of_text|>"
"<|begin_of_text|>Fatih Sultan Mehmet 1432 yılında Edirne'de doğmuştur.<|eot_id|><|end_of_text|>"
"<|begin_of_text|>Türkiye'nin başkenti Ankara'dır ve İç Anadolu Bölgesinde yer alır.<|eot_id|><|end_of_text|>"
Her cümle
SpiralDatasetFormatter.format_factile sarmalanır. RDP-WI, tüm cümle kümesini tek bir kapalı-form çözümde aynı anda işler — "Fatih Sultan Mehmet" hem fetih hem doğum cümlesinde geçtiği için, iki olgu da aynı bellek katmanına eşzamanlı olarak yazılır.
4 Adımlı Süreç
- Bağlamı Oku: Her token, gömme (embedding) katmanından geçip bir gizli durum vektörü ($H$) üretir.
- Hedefi Topla: Bir sonraki doğru kelime ($Y$) her adım için not edilir:
"1453"→"yılında","Fatih"→"Sultan"... - Denklemi Çöz: $H$ ve $Y$ birikimlerinden, çıkış ağırlıklarını ($W_{mem}$) veren kapalı-form matris denklemi tek seferde çözülür.
- Doğrudan Yaz: Çözülen ağırlıklar, modelin bellek katmanına aynen kopyalanır — eğitim adımı veya kayıp eğrisi yoktur.
Enjeksiyon Testi
- Öncesi:
"İstanbul 1453 yılında"→ (Rastgele / Anlamsız Token) - Sonrası (0.00 sn):
"İstanbul 1453 yılında"→"Fatih Sultan Mehmet tarafından fethedilmiştir."
📐 Faz 1: Matematiksel ve Algoritmik Detaylar (Tıklayın)
Ridge Regression Kapalı-Form Çözümü
Gizli durum matrisi $H \in \mathbb{R}^{N \times d}$ ve hedef matris $Y \in \mathbb{R}^{N \times V}$ verildiğinde, klasik SGD şu iteratif adımı tekrarlar:
RDP-WI bunun yerine Ridge Regression kayıp fonksiyonunun türevini alıp doğrudan sıfıra eşitler ve tek adımda kesin çözümü bulur:
Teorem 1: $\gamma \to 0^+$ sınırında, kalıntı hata tam olarak sıfırdır: $H(W_{mem})^T = Y$. Yani model, gördüğü metni birebir hatırlar.
Çevrimiçi Güncelleme (Woodbury RLS)
Yeni bir veri bloğu geldiğinde, tüm matris yeniden çözülmez; Woodbury matris kimliğiyle mevcut ağırlıklar özyinelemeli olarak güncellenir:
Uygulama Katmanı Optimizasyonları
- Embedding-only Çıkarım: Faz 1'de dikkat (attention) katmanları atlanır —
extract_hidden_statesyalnızcaGömme -> RMSNormhattını kullanır, VRAM taşması engellenir. - Toplu İşleme (Batched Ingestion):
BATCH_SIZE=4ile GPU verimliliği; 16 GB VRAM sınırı korunur. - Streaming Modu: JSONL token dosyaları satır satır okunur, tüm veri seti belleğe yüklenmez.
- Cholesky Tabanlı Çözücü:
torch.linalg.cholesky+cholesky_solvekullanır. Başarısızlık durumundalinalg.solve→lstsqyedek zinciri devreye girer. - Adaptif Sönümleme: $\gamma$, $X^T X$ matrisinin diyagonal ortalamasına göre dinamik olarak ölçeklenir.
- Seyrek Birikim (
index_add): One-hot hedef matrisi yerine token ID'leri doğrudan biriktirilir, bellek tasarrufu sağlanır.
İlgili Kod Yapıları:
SpiralDatasetFormatter.SPIRAL_FACTS | RDPWIEngine.accumulate_batch | RDPWIEngine.solve_closed_form | DPPALPhase1Ingestor.run_ingestion | ShardedOutputProjection.set_analytical_weights
Faz 2: Nedensel Hizalama (Causal Alignment)
Belleği Dondur, Sadece Söylem Biçimini Öğret
Faz 1'de yazılan bellek katmanı artık tamamen donuktur ($\nabla_{\theta_{mem}} L = 0$) — bir daha güncellenmez. Model, yalnızca üstteki katmanlarla, çok daha küçük bir talimat verisi üzerinde klasik cross-entropy kaybıyla eğitilir. Öğrendiği şey olgu değil, olguyu doğru cümlede nasıl kullanacağıdır.
Eğitim Verisi Formatı (Talimat Şablonu)
<|start_header_id|>user<|end_header_id|>
İstanbul'u kim fethetti, tam bir cümleyle söyler misin?<|eot_id|>
<|start_header_id|>assistant<|end_header_id|>
İstanbul'u 1453 yılında Fatih Sultan Mehmet fethetmiştir.<|eot_id|>
Cevaptaki "Fatih Sultan Mehmet" ve "1453" bilgisi Faz 1'de dondurulmuş bellekten aynen gelir. Faz 2 bu diyalogdan olgunun kendisini değil, soruyu doğru, tam ve nazik bir cümleye dönüştürmeyi öğrenir.
4 Adımlı Süreç
- Belleği Dondur: Bellek katmanının gradyanı sıfırlanır: $\nabla_{\theta_{mem}} L = 0$. Artık bu katman öğrenme sürecinin dışındadır.
- Sadece Üst Katmanları Eğit: Dikkat ve yönlendirme (routing) katmanları, standart cross-entropy kaybıyla güncellenir.
- Donuk Bellekten Çek: Üretim sırasında model, dondurulmuş katmandaki olguyu — Faz 1'de yazılan aynı ağırlıklardan — bir kaynak gibi okur.
- Cümle Olurak Sentezle: Olgu, öğrenilen nedensellik kurallarıyla akıcı ve bağlama uygun tam bir cümleye dönüştürülür.
Çıktı Karşılaştırması
- Yalnızca Faz 1 Sonrası: Soru:
"İstanbul'u kim fethetti?"→"Fatih"(Tek kelime, bağlamsız) - Faz 2 Hizalaması Sonrası: Soru:
"İstanbul'u kim fethetti?"→"İstanbul'u 1453 yılında Fatih Sultan Mehmet fethetmiştir."
📐 Faz 2: Matematiksel ve Algoritmik Detaylar (Tıklayın)
Dondurma Koşulu ve Nedensel Kayıp
Parçalı (Chunked) Cross-Entropy
Tam [dizi_uzunluğu × sözlük_boyutu] logit tensörü hiçbir zaman tek parça olarak bellekte oluşturulmaz. Hesaplama, VOCAB_CHUNK_SIZE=4096 büyüklüğünde parçalar hâlinde 3 geçişte yapılır:
- Geçiş 1: Her parça için maksimum logit değeri bulunur (sayısal kararlılık için, gradyansız).
- Geçiş 2: Toplam üstel ($\sum \exp$) ve hedef token logit'leri biriktirilir (gradyansız).
- Geçiş 3: Kesin gradyan akışı, olasılık artığı (residual) üzerinden parça parça geri verilir.
Bellek ve Hassasiyet Optimizasyonları
- Gradient Checkpointing: Aktivasyon bellek kullanımı %60'ın üzerinde azaltılır.
- AdamW8bit: Optimizör durumu 8-bit'te tutularak ~1.4 GB VRAM tasarrufu sağlanır.
- BF16 Autocast: İleri geçiş karışık hassasiyetle (
bfloat16) yürütülür. - Gradient Accumulation (8 Adım): Düşük VRAM'de daha büyük etkili batch boyutuna ulaşılır.
- Maksimum Dizi Kırpma: 2048 token sınırı uygulanır.
İlgili Kod Yapıları:
preprocess_dataset_stage("instruct") | DPPALPhase2Aligner._chunked_cross_entropy | DPPALPhase2Aligner._forward_with_checkpointing | FitFlashTransformer.freeze_memory_head | bitsandbytes.optim.AdamW8bit
Deneysel Bulgu ve Sonuçlar
Raporlanan bulgular $d_{model} \in [64, 1024]$ aralığındaki modeller üzerinden elde edilmiştir.
Göreli Ön Eğitim Süresi ve Olgusal Unutma
- Ön Eğitim Süresi ($d_{model} = 1024$):
- Klasik SGD:
126.000 sn(GÖRELİ) - RDP-WI (Faz 1):
~1.900 sn(~%98.5 Zaman Tasarrufu)
- Klasik SGD:
- Yeni Veri Eğitimi Sonrası Olgusal Geri Çağırma (Exact Recall):
- Klasik SGD (Ön Eğitim Anı):
%100 - Klasik SGD (Faz 2 Hizalama Sonrası):
%51.8(Felaket Unutma) - DP-PAL (Faz 2 Hizalama Sonrası):
%100(Sıfır Unutma - Bellek Katmanı Donuk)
- Klasik SGD (Ön Eğitim Anı):
📊 Karmaşıklık Analizi ve 1B – 405B Ekstrapolasyonu (Tıklayın)
Zaman Karmaşıklığı Analizi
- RDP-WI (Faz 1): $O(N \cdot d^2 + d^3)$ — Epoch döngüsü içermez.
- Klasik SGD: $O(N \cdot d \cdot E)$ — burada $E \approx 100\text{--}1000$ epoch'tur.
(Ampirik regresyon katsayıları: $\alpha \approx 1.2 \times 10^{-7}$, $\beta \approx 4.5 \times 10^{-10}$)
Mega-Model Ekstrapolasyon Tablosu
| Model | Parametre | $d_{model}$ | SGD tahmini (saat) | DP-PAL tahmini (saat) | Tasarruf Oranı |
|---|---|---|---|---|---|
| FitFlash-1B | $1.0 \times 10^9$ | 2,048 | 336 | 26.4 | %92.1 |
| FitFlash-7B | $7.0 \times 10^9$ | 4,096 | 1,560 | 100.8 | %93.5 |
| FitFlash-70B | $7.0 \times 10^{10}$ | 8,192 | 5,760 | 307.2 | %94.7 |
| FitFlash-405B | $4.05 \times 10^{11}$ | 16,384 | 23,520 | 988.8 | %95.8 |
Not: Yukarıdaki tablo, küçük ölçekli testlerden ($d=64\text{--}1024$) türetilen ampirik katsayıların büyük modellere ekstrapolasyonudur; henüz 1B+ ölçekte doğrudan doğrulanmamıştır.
%100 geri çağırmave%0 felaket unutmadeğerleri 10 tematik cümlelik kontrol kümesinde ölçülmüştür.
İlgili Kod Yapıları:
DPPALScalingLawCalculator.calculate_time_savings | DPPALScalingLawCalculator.generate_extrapolation_report | DPPALBenchmarkEngine.evaluate_exact_recall
⚖️ Lisans ve Kullanım Koşulları (Terms of Use)
© 2026 Kairodyne Dynamics. Tüm Hakları Saklıdır.
- Akademik / Gayri Ticari Kullanım: Bu model, mimari detaylar ve algoritma (DP-PAL / RDP-WI) yalnızca akademik inceleme ve araştırma amacıyla erişime açılmıştır.
- Ticari Kullanım ve Kopyalama Yasağı: Kairodyne Dynamics'in yazılı izni olmaksızın bu algoritmanın, kodların veya model ağırlıklarının ticari ürünlerde kullanılması, kopyalanması, türetilmesi veya üçüncü taraflara satılması kesinlikle yasaktır.
- Ticari Lisanslama İletişim: Ticari kullanım ve ortaklık talepleri için lütfen
emreaygul.work@gmail.comadresi üzerinden iletişime geçiniz.
📚 Alıntı / Citation
Araştırmanızda veya incelemelerinizde bu mimariyi referans gösteriyorsanız lütfen aşağıdaki bilgiyi kullanın:
@techreport{kairodyne2026dppal,
title = {DP-PAL & RDP-WI: Dual-Phase Parametric-Associative Learning in Transformer Architectures},
author = {Kairodyne Dynamics},
institution = {Kairodyne Dynamics},
number = {KD-DP-PAL-2026-001},
year = {2026},
month = {August},
version = {2.0.0}
}