Yapay Zekaların Düşünme Adımları Apple’dan Soğuk Duş
Apple’ın makine öğrenimi ekibi, “The Illusion of Thinking” başlıklı yeni çalışmasında, yapay zekalarda uzun “düşünme adımları” üreten Large Reasoning Model (LRM) türü modellerin gerçek akıl yürütme kapasitesini, kontrollü ve adım adım zorlaştırılabilen bulmacalarla test etti. Ekip, klasik matematik/kodlama sınavlarının veri sızıntısı ve karmaşıklık ölçümü gibi sorunları nedeniyle yanıltıcı olabildiğini, bu yüzden hem nihai cevapları hem de modellerin ürettiği ara “düşünme izlerini” inceleyen yeni bir kurgu kurduklarını belirtiyor. Çalışma Haziran 2025’te duyuruldu ve NeurIPS kapsamında yayımlandı.
Araştırmanın bulguları üç evreli, net bir tablo çiziyor: Düşük zorlukta, şaşırtıcı biçimde standart LLM’ler hem daha doğru hem de daha hızlı. Orta zorlukta, uzun düşünme adımları üreten LRM’ler avantaj sağlıyor. Yüksek zorlukta ise gerek “düşünen” gerek “düşünmeyen” tüm modellerde doğruluk neredeyse tamamen çöküyor. Dahası, zorluk kritik bir eşiğe yaklaştığında, beklenenin aksine, modellerin “düşünme çabası” artmak yerine azalıyor; yani kalan token bütçesi olmasına rağmen daha az adım üretiyorlar.

Ekip bu davranışın yalnızca strateji seçiminden kaynaklanmadığını, verilen bir algoritmayı istikrarlı biçimde uygulama becerisindeki sınırlara da işaret ettiğini söylüyor. Örneğin bulmacaların bazıları için çözüm yolu modele açıkça verilse bile, çöküş noktası değişmiyor. “Kontrollü bulmaca” yaklaşımı arasında Hanoi Kulesi ve benzeri planlama problemleri bulunuyor; bu sayede zorluk artarken mantıksal yapı sabit tutuluyor ve süreç adımları doğrulanabiliyor.
Bulgular, LRM’lerin genellenebilir bir muhakeme yeteneğini her durumda ortaya koymadığını ve zorlukla birlikte ölçeklenme sınırı yaşadığını öne sürüyor. Öte yandan, çalışma bilim dünyasında tartışma da yarattı: Eleştiriler, gözlenen “çöküş”ün bir kısmının deney tasarımındaki kısıtlardan (ör. çıktı uzunluğu sınırları, bazı görevlerin pratikte çözümsüz kurgulanması) kaynaklanabileceğini savunuyor. Bu karşı görüşler, akıl yürütme değerlendirmelerinde yöntem ve metriklerin daha da rafine edilmesi gerektiğini hatırlatıyor.
İlginizi çekebilecek bir yazı : Yapay Zeka Devriminde Öncü Şirket : OpenAI
Kaynak
- The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity – https://ml-site.cdn-apple.com/papers/the-illusion-of-thinking.pdf
Share this content:
Yorum gönder