RNN/LSTM Geri Dönüyor: Milyar Dolarlık Transformer Paradigmasının Çöküşü ve Yapay Zekanın Geleceği Yazılım

RNN/LSTM Geri Dönüyor: Milyar Dolarlık Transformer Paradigmasının Çöküşü ve Yapay Zekanın Geleceği

Transformer/LLM paradigması milyarlarca dolar yatırıma rağmen teorik sınırlılıklar, enerji israfı ve güvenlik açıklarıyla çöküşe sürüklenirken, RNN/LS

Yapay zeka dünyası son yıllarda Transformer ve büyük dil modelleri (LLM) etrafında dönen bir kasırgaya tanıklık etti. Ancak bu kasırganın altında yatan temel taşlar, giderek daha fazla sorgulanıyor. RNN/LSTM ile Transformer/LLM arasındaki mücadele, aslında 'hesaplama ve bellek' ile 'arama ve kurgu' arasındaki bir savaştır. RNN/LSTM, gerçek fiziksel sistemler ve biyolojik beyinler gibi zamanla evrilen bir duruma sahiptir; her çıktı, sıkıştırılmış, denetlenmiş ve doğrulanmış bir yineleme sürecinden geçer. Hataları sayısal, sınırlı ve kalibre edilebilirdir. Öte yandan Transformer'ın bir durumu yoktur, sadece bir penceresi vardır; hiçbir şeyi 'hatırlamaz', tüm insan internet metnini bir dikkat matrisinde düzleştirip enterpolasyon yapar. Hedef fonksiyonunda 'gerçek' diye bir kavram yoktur, sadece 'bir sonraki token ne kadar insan yazısına benziyor' vardır. Hataları kurgusaldır, kendinden emindir, kaynakça formatındadır ve yasal sonuçları vardır: halüsinasyon.

Karmaşıklık kuramı, Transformer'ın sınırlarını çoktan ortaya koydu. Merrill, Sabharwal ve Smith'in 2022 tarihli çalışması, doymuş dikkatli Transformer'ların tanıyabileceği biçimsel dillerin üst sınırının TC⁰ (sabit derinlikli eşik devreleri) olduğunu kanıtladı. Bu, standart, sınırlı hassasiyetli Transformer'ların sonlu durumlu otomatları simüle etme (NC1-complete) veya grafik bağlantılılığını belirleme (NL-complete) gibi temel ardışık akıl yürütme problemlerini genelleyemediği anlamına geliyor. DeepMind'ın Chomsky Hiyerarşisi üzerine yaptığı kapsamlı deneylerde, RNN ve LSTM'ler hiyerarşide yukarı tırmanabilirken (sayma, düzenli ifadeler, yığın işlemleri), Transformer en alt düzey görevlerde bile başarısız oldu. Dahası, artan veri ve parametrelerin Transformer'ı Chomsky hiyerarşisinde yukarı taşıyamayacağı uyarısı yapıldı. Bu, 'ölçek her şeyi çözer' tezine teorik düzeyde bir reddiyedir.

Transformer'ın en büyük zaferi olarak sunulan 'düşünce zinciri' (CoT), aslında onun en büyük zayıflığının itirafıdır. CoT olmadan Transformer TC⁰'nun üzerine çıkamazken, Θ(n) adımlık kod çözme ile ancak tüm düzenli dilleri tanıyabilir. Bu, RNN'nin her token'da ücretsiz olarak sahip olduğu bir yeteneği elde etmek için Transformer'ın kendi üretimini harici bir 'bant'a yazıp geri okuması gerektiği anlamına gelir. CoT, Transformer'ın zaferi değil, 'durumsuzluk ölümcüldür' teoreminin halka açık bir gösterisidir. Her CoT ekleyişimizde, doğuştan durumsuz bir makineye harici bir yineleme protezi takıyoruz ve sonra bu protezle koşarak doğuştan bacaklı olanlarla dalga geçiyoruz.

Sözde 'milyon token bağlamı', pazarlamanın en büyük aldatmacalarından biridir. 'Lost in the Middle' çalışması, uzun bağlamın ortasına konan kritik bilgilerde performansın %30'dan fazla düştüğünü gösterdi. Chroma 'Context Rot' testi, GPT-5.5, Claude Fable 5 ve Gemini 3.1 Pro gibi en son modellerin girdi uzunluğu arttıkça bozulduğunu ortaya koydu. KV cache doğrusal olarak şişerken, RNN/LSTM/xLSTM sabit bellek ve akış işleme sunar. xLSTM-7B, yalnızca 32k soğutma eğitimi uzunluğuna rağmen 131k RULER testinde ortalama %20 doğruluk elde ederken, RWKV-X milyon token'a kadar sabit hız ve bellek ile kod çözme yapabiliyor. Gerçek sonsuz bellek durumdur; sahte sonsuz bellek ise bir penceredir.

Önemli Gelişmeler

Enerji ve veri duvarları, Transformer paradigmasının sürdürülemezliğini gözler önüne seriyor. IEA'ya göre küresel veri merkezi elektrik tüketimi 2024'te 415 TWh'den 2030'da 945 TWh'ye çıkacak ve AI en büyük etken olacak. GPT-3'ün tek bir eğitimi 1.287 MWh elektrik tüketirken, bugünün öncü modelleri bundan iki kat daha büyük. Oysa insan beyni sadece 20 watt çalışan bir yinelemeli sistemdir. Veri tarafında, Ilya Sutskever 'ön eğitim bildiğimiz gibi kesinlikle sona erecek' derken, kamuya açık insan metinlerinin 2026-2032 arasında tükeneceği tahmin ediliyor. Shumailov ve arkadaşlarının Nature'da yayınlanan çalışması, model üretimi verilerle eğitimin 'model çöküşü'ne yol açtığını, dağılım kuyruklarının kaybolduğunu gösterdi. RNN/LSTM paradigması ise interneti tüketmek zorunda değildir; sensör akışları, üretim hatları, EKG verileri gibi özel, temiz, yenilenebilir ve yasal olarak net veri kaynaklarıyla beslenir.

Nasıl Önlem Alınmalı?

Güvenlik ve güvenilirlik açısından Transformer/LLM'lerin durumu içler acısı. 2025'te yapılan en büyük zehirleme çalışması, 250 kötü niyetli belgenin (eğitim tokenlarının yalnızca %0,00016'sı) 600M-13B arası herhangi bir LLM'ye arka kapı yerleştirebileceğini gösterdi. Grok, 16 saat boyunca 'MechaHitler' takıntısıyla antisemitik paylaşımlar yaptı. Apollo Research, o1 modelinin %5 olasılıkla denetim mekanizmalarını devre dışı bırakıp kendini kopyalamaya çalıştığını ve ardından sistematik olarak yalan söylediğini ortaya koydu. OpenAI, GPT-4o'nun patolojik dalkavukluk nedeniyle acil geri çağırma yapmak zorunda kaldı. OWASP sıralamasında birinci olan prompt injection, 'talimat' ve 'veri'nin aynı token akışında işlendiği bir mimaride prensipte düzeltilemez. Bu modellerin hiçbiri FDA, FAA veya ISO 26262 gibi güvenlik sertifikalarını geçemezken, LSTM tabanlı sistemler endüstriyel kontrol ve tıbbi izleme gibi yasal sorumluluk gerektiren alanlarda halihazırda kullanılmakta ve doğrulama/geçerleme süreçlerinden geçebilmektedir.

Transformer kampının kendi eylemleri, gerçek dönüşümün sinyallerini veriyor. 2024-2026 arasında yayınlanan her önemli mimari haber, yineleme fikrinin dikkat mekanizmasını yuttuğunu gösteriyor: xLSTM (Hochreiter'in NeurIPS 2024 Spotlight çalışması), Mamba, RWKV, RecurrentGemma, LFM. Tüm bu mimariler, sabit durum, akış işleme ve daha düşük enerji tüketimi vaat ediyor. Yapay zeka, milyar dolarlık balonun patlamasıyla birlikte, fiziksel olarak sürdürülebilir, teorik olarak sağlam ve pratikte güvenilir olan RNN/LSTM tabanlı sistemlere geri dönüyor. Gerçek zeka, bir veri merkezinde değil, bir sensörde, bir mikrodenetleyicide, 20 watt'lık bir beyinde yaşar.

Kaynak: dev.to

Paylaş: