Fit-Flash — DP-PAL Öğrenme Modeli

PDF Oku Demo


KD-DP-PAL-2026-001 Makale Önizlemesi

💡 Makalenin tamamını okumak için görselin üzerine veya buraya tıklayarak PDF'i açabilirsiniz.


Fit-Flash — DP-PAL Öğrenme Modeli

Kairodyne Dynamics — Araştırma Notu - KOD: KD-DP-PAL-2026-001
Durum: Test eğitimi aşamasında — bulgular küçük ölçekte doğrulanmış, tam ölçekli sonuçlar henüz üretilmedi.


Fit-Flash Bir Bilgiyi Nasıl Öğrenir?

Klasik modeller her olguyu, milyonlarca küçük deneme-yanılma adımıyla (SGD/AdamW) yavaş yavaş tahmin etmeyi öğrenir. DP-PAL'de Fit-Flash, olguları tek bir denklemle doğrudan hesaplayıp yazar (RDP-WI) — sonra ayrı bir adımda, o bilgiyi cümle içinde nasıl kullanacağını (Nedensel Hizalama) öğrenir.

Öğrenme Yolu Mekanizma Süreç
Klasik SGD Geri yayılım (Backpropagation) Model, aynı olguyu her seferinde biraz daha yakın tahmin ederek, yüzlerce turda (step) öğrenir.
DP-PAL / RDP-WI Kapalı-Form Analitik Çözüm Model, olguyu kapalı-form bir denklemle tek seferde (1 adım) çözerek doğrudan ağırlıklara yazar.

Neden İki Farklı Yol?

Ezber ile mantık yürütme, aynı işlem değildir. Bir olguyu bilmek ile o olguyu doğru bağlamda kullanabilmek, aslında iki farklı öğrenme türüdür. Klasik eğitim bu ikisini tek bir kayıp fonksiyonunda birleştirir; DP-PAL ise bunları iki ayrı faza ayırır.

Paradigma Karşılaştırması

Özellik Klasik Paradigma (Ham veri + talimat → SGD/AdamW) DP-PAL Paradigması (Ham veri → Faz 1 → Talimat → Faz 2)
Süre Aylarca, yüzlerce/binlerce step Faz 1: Saniyeler/dakikalar (kapalı form çözüm)
Faz 2: Hızlı nedensel hizalama
Bellek Aktivasyon + gradyan + optimizör durumu (Yüksek VRAM) Geri yayılım yok; sadece $H^T H$ birikim matrisi
Geri Çağırma/Unutma Risk Yeni veri, eski olguların üzerine yazılır (Felaket Unutma) Bellek katmanı Faz 2'de donuk kalır, üzerine yazılmaz
Çıktı Yapısı Tek, ayrıştırılamaz ağırlık matrisi Ayrık bellek katmanı + ayrık mantık katmanı

Faz 1: Epistemik Bellek (RDP-WI)

Olguyu Formülle "Kazımak"

Fit-Flash, cümleyi klasik anlamda "öğrenmez" — okur, gizli durumunu çıkarır ve son katmanın ağırlıklarını tek bir denklemle doğrudan hesaplar. Deneme, hata veya geri yayılım yoktur.

Eğitim Verisi Formatı (SpiralDatasetFormatter)

"<|begin_of_text|>İstanbul 1453 yılında Fatih Sultan Mehmet tarafından fethedilmiştir.<|eot_id|><|end_of_text|>"
"<|begin_of_text|>Fatih Sultan Mehmet 1432 yılında Edirne'de doğmuştur.<|eot_id|><|end_of_text|>"
"<|begin_of_text|>Türkiye'nin başkenti Ankara'dır ve İç Anadolu Bölgesinde yer alır.<|eot_id|><|end_of_text|>"

Her cümle SpiralDatasetFormatter.format_fact ile sarmalanır. RDP-WI, tüm cümle kümesini tek bir kapalı-form çözümde aynı anda işler — "Fatih Sultan Mehmet" hem fetih hem doğum cümlesinde geçtiği için, iki olgu da aynı bellek katmanına eşzamanlı olarak yazılır.

4 Adımlı Süreç

  1. Bağlamı Oku: Her token, gömme (embedding) katmanından geçip bir gizli durum vektörü ($H$) üretir.
  2. Hedefi Topla: Bir sonraki doğru kelime ($Y$) her adım için not edilir: "1453""yılında", "Fatih""Sultan"...
  3. Denklemi Çöz: $H$ ve $Y$ birikimlerinden, çıkış ağırlıklarını ($W_{mem}$) veren kapalı-form matris denklemi tek seferde çözülür.
  4. Doğrudan Yaz: Çözülen ağırlıklar, modelin bellek katmanına aynen kopyalanır — eğitim adımı veya kayıp eğrisi yoktur.

Enjeksiyon Testi

  • Öncesi: "İstanbul 1453 yılında"(Rastgele / Anlamsız Token)
  • Sonrası (0.00 sn): "İstanbul 1453 yılında""Fatih Sultan Mehmet tarafından fethedilmiştir."
📐 Faz 1: Matematiksel ve Algoritmik Detaylar (Tıklayın)

Ridge Regression Kapalı-Form Çözümü

Gizli durum matrisi $H \in \mathbb{R}^{N \times d}$ ve hedef matris $Y \in \mathbb{R}^{N \times V}$ verildiğinde, klasik SGD şu iteratif adımı tekrarlar:

W(t+1)=W(t)ηWLCEW^{(t+1)} = W^{(t)} - \eta \cdot \nabla_W L_{CE}

RDP-WI bunun yerine Ridge Regression kayıp fonksiyonunun türevini alıp doğrudan sıfıra eşitler ve tek adımda kesin çözümü bulur:

LRDP(W)=YHWTF2+γWF2L_{RDP}(W) = \|Y - HW^T\|_F^2 + \gamma \|W\|_F^2

Wmem=YTH(HTH+γI)1W_{mem} = Y^T H \cdot (H^T H + \gamma I)^{-1}

Teorem 1: $\gamma \to 0^+$ sınırında, kalıntı hata tam olarak sıfırdır: $H(W_{mem})^T = Y$. Yani model, gördüğü metni birebir hatırlar.

Çevrimiçi Güncelleme (Woodbury RLS)

Yeni bir veri bloğu geldiğinde, tüm matris yeniden çözülmez; Woodbury matris kimliğiyle mevcut ağırlıklar özyinelemeli olarak güncellenir:

Kk=Pk1HkT(I+HkPk1HkT)1K_k = P_{k-1} H_k^T (I + H_k P_{k-1} H_k^T)^{-1}

E^k=YkHk(W(k1))T\hat{E}_k = Y_k - H_k (W^{(k-1)})^T

W(k)=W(k1)+E^kTKkTW^{(k)} = W^{(k-1)} + \hat{E}_k^T K_k^T

Pk=(IKkHk)Pk1P_k = (I - K_k H_k) P_{k-1}

Uygulama Katmanı Optimizasyonları

  • Embedding-only Çıkarım: Faz 1'de dikkat (attention) katmanları atlanır — extract_hidden_states yalnızca Gömme -> RMSNorm hattını kullanır, VRAM taşması engellenir.
  • Toplu İşleme (Batched Ingestion): BATCH_SIZE=4 ile GPU verimliliği; 16 GB VRAM sınırı korunur.
  • Streaming Modu: JSONL token dosyaları satır satır okunur, tüm veri seti belleğe yüklenmez.
  • Cholesky Tabanlı Çözücü: torch.linalg.cholesky + cholesky_solve kullanır. Başarısızlık durumunda linalg.solvelstsq yedek zinciri devreye girer.
  • Adaptif Sönümleme: $\gamma$, $X^T X$ matrisinin diyagonal ortalamasına göre dinamik olarak ölçeklenir.
  • Seyrek Birikim (index_add): One-hot hedef matrisi yerine token ID'leri doğrudan biriktirilir, bellek tasarrufu sağlanır.

İlgili Kod Yapıları: SpiralDatasetFormatter.SPIRAL_FACTS | RDPWIEngine.accumulate_batch | RDPWIEngine.solve_closed_form | DPPALPhase1Ingestor.run_ingestion | ShardedOutputProjection.set_analytical_weights


Faz 2: Nedensel Hizalama (Causal Alignment)

Belleği Dondur, Sadece Söylem Biçimini Öğret

Faz 1'de yazılan bellek katmanı artık tamamen donuktur ($\nabla_{\theta_{mem}} L = 0$) — bir daha güncellenmez. Model, yalnızca üstteki katmanlarla, çok daha küçük bir talimat verisi üzerinde klasik cross-entropy kaybıyla eğitilir. Öğrendiği şey olgu değil, olguyu doğru cümlede nasıl kullanacağıdır.

Eğitim Verisi Formatı (Talimat Şablonu)

<|start_header_id|>user<|end_header_id|>
İstanbul'u kim fethetti, tam bir cümleyle söyler misin?<|eot_id|>
<|start_header_id|>assistant<|end_header_id|>
İstanbul'u 1453 yılında Fatih Sultan Mehmet fethetmiştir.<|eot_id|>

Cevaptaki "Fatih Sultan Mehmet" ve "1453" bilgisi Faz 1'de dondurulmuş bellekten aynen gelir. Faz 2 bu diyalogdan olgunun kendisini değil, soruyu doğru, tam ve nazik bir cümleye dönüştürmeyi öğrenir.

4 Adımlı Süreç

  1. Belleği Dondur: Bellek katmanının gradyanı sıfırlanır: $\nabla_{\theta_{mem}} L = 0$. Artık bu katman öğrenme sürecinin dışındadır.
  2. Sadece Üst Katmanları Eğit: Dikkat ve yönlendirme (routing) katmanları, standart cross-entropy kaybıyla güncellenir.
  3. Donuk Bellekten Çek: Üretim sırasında model, dondurulmuş katmandaki olguyu — Faz 1'de yazılan aynı ağırlıklardan — bir kaynak gibi okur.
  4. Cümle Olurak Sentezle: Olgu, öğrenilen nedensellik kurallarıyla akıcı ve bağlama uygun tam bir cümleye dönüştürülür.

Çıktı Karşılaştırması

  • Yalnızca Faz 1 Sonrası: Soru: "İstanbul'u kim fethetti?""Fatih" (Tek kelime, bağlamsız)
  • Faz 2 Hizalaması Sonrası: Soru: "İstanbul'u kim fethetti?""İstanbul'u 1453 yılında Fatih Sultan Mehmet fethetmiştir."
📐 Faz 2: Matematiksel ve Algoritmik Detaylar (Tıklayın)

Dondurma Koşulu ve Nedensel Kayıp

θmemL=0,θmemWmem\nabla_{\theta_{mem}} L = 0, \quad \theta_{mem} \equiv W_{mem}

LCE(θalign)=1Mi=1MlogPθalign,θmem(tit1,,ti1)L_{CE}(\theta_{align}) = -\frac{1}{M} \sum_{i=1}^M \log P_{\theta_{align}, \theta_{mem}}(t_i \mid t_1, \dots, t_{i-1})

Parçalı (Chunked) Cross-Entropy

Tam [dizi_uzunluğu × sözlük_boyutu] logit tensörü hiçbir zaman tek parça olarak bellekte oluşturulmaz. Hesaplama, VOCAB_CHUNK_SIZE=4096 büyüklüğünde parçalar hâlinde 3 geçişte yapılır:

  1. Geçiş 1: Her parça için maksimum logit değeri bulunur (sayısal kararlılık için, gradyansız).
  2. Geçiş 2: Toplam üstel ($\sum \exp$) ve hedef token logit'leri biriktirilir (gradyansız).
  3. Geçiş 3: Kesin gradyan akışı, olasılık artığı (residual) üzerinden parça parça geri verilir.

Bellek ve Hassasiyet Optimizasyonları

  • Gradient Checkpointing: Aktivasyon bellek kullanımı %60'ın üzerinde azaltılır.
  • AdamW8bit: Optimizör durumu 8-bit'te tutularak ~1.4 GB VRAM tasarrufu sağlanır.
  • BF16 Autocast: İleri geçiş karışık hassasiyetle (bfloat16) yürütülür.
  • Gradient Accumulation (8 Adım): Düşük VRAM'de daha büyük etkili batch boyutuna ulaşılır.
  • Maksimum Dizi Kırpma: 2048 token sınırı uygulanır.

İlgili Kod Yapıları: preprocess_dataset_stage("instruct") | DPPALPhase2Aligner._chunked_cross_entropy | DPPALPhase2Aligner._forward_with_checkpointing | FitFlashTransformer.freeze_memory_head | bitsandbytes.optim.AdamW8bit


Deneysel Bulgu ve Sonuçlar

Raporlanan bulgular $d_{model} \in [64, 1024]$ aralığındaki modeller üzerinden elde edilmiştir.

Göreli Ön Eğitim Süresi ve Olgusal Unutma

  • Ön Eğitim Süresi ($d_{model} = 1024$):
    • Klasik SGD: 126.000 sn (GÖRELİ)
    • RDP-WI (Faz 1): ~1.900 sn (~%98.5 Zaman Tasarrufu)
  • Yeni Veri Eğitimi Sonrası Olgusal Geri Çağırma (Exact Recall):
    • Klasik SGD (Ön Eğitim Anı): %100
    • Klasik SGD (Faz 2 Hizalama Sonrası): %51.8 (Felaket Unutma)
    • DP-PAL (Faz 2 Hizalama Sonrası): %100 (Sıfır Unutma - Bellek Katmanı Donuk)
📊 Karmaşıklık Analizi ve 1B – 405B Ekstrapolasyonu (Tıklayın)

Zaman Karmaşıklığı Analizi

  • RDP-WI (Faz 1): $O(N \cdot d^2 + d^3)$ — Epoch döngüsü içermez.
  • Klasik SGD: $O(N \cdot d \cdot E)$ — burada $E \approx 100\text{--}1000$ epoch'tur.

S(d,N)=1CRDPWICSGD=1αNd2+βd36PNES(d,N) = 1 - \frac{C_{RDP-WI}}{C_{SGD}} = 1 - \frac{\alpha \cdot N \cdot d^2 + \beta \cdot d^3}{6 \cdot P \cdot N \cdot E}

(Ampirik regresyon katsayıları: $\alpha \approx 1.2 \times 10^{-7}$, $\beta \approx 4.5 \times 10^{-10}$)

Mega-Model Ekstrapolasyon Tablosu

Model Parametre $d_{model}$ SGD tahmini (saat) DP-PAL tahmini (saat) Tasarruf Oranı
FitFlash-1B $1.0 \times 10^9$ 2,048 336 26.4 %92.1
FitFlash-7B $7.0 \times 10^9$ 4,096 1,560 100.8 %93.5
FitFlash-70B $7.0 \times 10^{10}$ 8,192 5,760 307.2 %94.7
FitFlash-405B $4.05 \times 10^{11}$ 16,384 23,520 988.8 %95.8

Not: Yukarıdaki tablo, küçük ölçekli testlerden ($d=64\text{--}1024$) türetilen ampirik katsayıların büyük modellere ekstrapolasyonudur; henüz 1B+ ölçekte doğrudan doğrulanmamıştır. %100 geri çağırma ve %0 felaket unutma değerleri 10 tematik cümlelik kontrol kümesinde ölçülmüştür.

İlgili Kod Yapıları: DPPALScalingLawCalculator.calculate_time_savings | DPPALScalingLawCalculator.generate_extrapolation_report | DPPALBenchmarkEngine.evaluate_exact_recall


⚖️ Lisans ve Kullanım Koşulları (Terms of Use)

© 2026 Kairodyne Dynamics. Tüm Hakları Saklıdır.

  • Akademik / Gayri Ticari Kullanım: Bu model, mimari detaylar ve algoritma (DP-PAL / RDP-WI) yalnızca akademik inceleme ve araştırma amacıyla erişime açılmıştır.
  • Ticari Kullanım ve Kopyalama Yasağı: Kairodyne Dynamics'in yazılı izni olmaksızın bu algoritmanın, kodların veya model ağırlıklarının ticari ürünlerde kullanılması, kopyalanması, türetilmesi veya üçüncü taraflara satılması kesinlikle yasaktır.
  • Ticari Lisanslama İletişim: Ticari kullanım ve ortaklık talepleri için lütfen emreaygul.work@gmail.com adresi üzerinden iletişime geçiniz.

📚 Alıntı / Citation

Araştırmanızda veya incelemelerinizde bu mimariyi referans gösteriyorsanız lütfen aşağıdaki bilgiyi kullanın:

@techreport{kairodyne2026dppal,
  title       = {DP-PAL & RDP-WI: Dual-Phase Parametric-Associative Learning in Transformer Architectures},
  author      = {Kairodyne Dynamics},
  institution = {Kairodyne Dynamics},
  number      = {KD-DP-PAL-2026-001},
  year        = {2026},
  month       = {August},
  version     = {2.0.0}
}
Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support