Chatbot'a Schrödinger'in kedisini sorduğunda düzgün bir cevap bekliyorsun. Max Planck Enstitüsü ve ETH Zürich ekibinin eğittiği LittleLearner ise şöyle diyor: "Schrödinger'in kedisi iki yüzlü bir kedidir." Aynı boyutta, filtresiz web metniyle eğitilmiş kontrol modeli ise düşünce deneyini doğru özetliyor. Fark model mimarisinde değil; görmesine izin verilen metnin sınıfında.1

Soru sade: bir dil modelini yalnızca ilkokul düzeyinde metinlerle, yani ABD müfredatında anaokulundan beşinci sınıfa kadar (K-5) öğretilen kavramlarla eğitirsen ne olur? Cevap da sade ama rahatsız edici: dil kuralları çıkar, sohbet kurulur, ama sınırı geçen bilgi sonradan kolay kolay gelmez. Akıcı cümle ile derin bilgi aynı şey değildir; bu deney ikisini ayırıyor.

Bu yazıda neler var?

Sınıf duvarı nasıl örüldü?

Ekip, FineWeb-Edu adlı eğitim odaklı web derlemesini beş aşamalı bir süzgeçten geçirdi. Yaş-edinimi sözcük listeleri, Common Core standartlarına dayalı sınıflandırıcılar, formül ve simge temizliği, sonra da ortaokul ve lise kelimelerini seyrelten frekans örneklemesi. Amaç hatırlatmayı maksimize etmek değil: beşinci sınıfın üstündeki kavram, olgu ve kelimeleri mümkün olduğunca dışarıda bırakmak. Ortaya çıkan setin adı LittleCurriculum; yaklaşık 88 milyar token.1

Doğrulama da sert. Ortak Core metinlerinde süzgeç, K-5 dışı belgeleri neredeyse sıfır tutuyor; K-5 belgelerin bir kısmını da bilerek eliyor. Yani set "bütün ilkokul edebiyatı" değil, bilinçli olarak keskin bir sınır. Bu keskinlik, deneyi temiz kılıyor: modelin bilmediği şey, gerçekten görmediği şey oluyor.

İlkokul sınıfı sıraları ve tahta
Deneyin metaforu sınıfın kendisi: model yalnızca bu duvarların içindeki metni görüyor. Fotoğraf: Douglas Perkins, CC BY 3.0, Wikimedia Commons.

Ne yapabiliyor, nerede düşüyor?

LittleLearner, Qwen3 mimarisine yakın bir 5 milyar parametreli model; sıfırdan LittleCurriculum üzerinde eğitiliyor. Aynı tarif ve token bütçesiyle filtresiz FineWeb-Edu üzerinde bir kontrol modeli de koşuyor. Böylece "küçük olduğu için mi zayıf?" itirazı zayıflıyor: fark veride.2

Kapsam içi bilim ve matematik sorularında LittleLearner ayakta. Yerçekimini "her şeyi aşağı çeken kuvvet" diye anlatabiliyor; K-5 matematik standartlarında kontrol modele yakın skorlar alabiliyor. Dil karmaşıklığı testlerinde de aynı iz var: metin zorlaştıkça modelin "şaşırma" ölçüsü yükseliyor, filtresiz kontrol ise daha düz kalıyor. Yani sorun yalnızca ezber eksikliği değil; tanıdık olmayan dil ve kavram yükü birikince modelin zemini kayıyor.1

Kapsam dışında tablo değişiyor. Jeopardy bilim soruları NGSS müfredatına göre ayrılınca, K-5'te tutulan skor Beyond-K-5'te sert düşüyor. MathCAMPS adlı Common Core hizalı matematik setinde de aynı eğri var: sınıf yükseldikçe uçurum açılıyor. Daha fazla deneme hakkı (pass@1024) bile sekizinci sınıf bandında boşluğu kapatmıyor. İlginç bir ayrıntı daha var: modelin hataları insan müfredat sırasına birebir oturmuyor; bazı "ileri" aritmetik kalıpları, beklenen önkoşuldan daha iyi gelebiliyor. Sınır yine duruyor, ama çocuk ders programı gibi basamak basamak ilerlemiyor.1

Kapsam içi güçlenir, kapsam dışı tavan kalır diyagramı
Ölçek, ince ayar ve bağlam içi örnekler K-5 içinde işe yarıyor; müfredat dışına anlamlı kapı açmıyor. Damga: kafa1milyon.com

Sonradan "öğretmek" yetmiyor

Asıl iddia burada. Ekip üç klasik müdahaleyi deniyor: modeli büyütmek (0,6B / 1,3B / 5B), denetimli ince ayar artı GRPO pekiştirmeli öğrenme, bağlam içi örnekler (few-shot). Hepsi kapsam içi performansı yükseltiyor. Hiçbiri Beyond-K-5'i anlamlı biçimde kurtarmıyor. Üstelik LittleLearner'ı kapsam dışı veriyle de ince ayarladıklarında, test ettikleri bütçelerde K-5 ince ayarına göre fark çıkmıyor. Yani "sonra biraz lise metni yediririz" refleksi, bu sandbox'ta tavanı kırmıyor.1

Bu, "ince ayar işe yaramaz" demek değil. İşe yarıyor: ama çoğu zaman zaten ön eğitimde görülen kalıpları daha iyi kullanmayı sağlıyor. Araştırmacıların diliyle: elicitation (ortaya çıkarma), acquisition (yeni yetenek edinme) değil. Web ölçeğinde bu ayrımı görmek zordur; çünkü modelin ne gördüğü bilinmez. LittleLearner'da sınır önceden çizildiği için ayrım ölçülebilir hale geliyor.2

Dolmuş bir kitap rafı
Modelin "bildiği" şey, çoğu zaman rafta gerçekten duran kitaplardan gelir. Rafı ilkokula kilitleyince üst raflar sonradan kolay dolmuyor. Fotoğraf: Stewart Butterfield, CC BY 2.0, Wikimedia Commons.

Senin sohbet kutuna ne dokunuyor?

Günlük kullanımda bu deney "çocuk modeli alın" tavsiyesi değil. Tersine bir uyarı: modelin akıcı konuşması, her konuyu bildiği anlamına gelmez. Akıcılık, dil istatistiğinin ürünü olabilir; derin bilgi ise ön eğitimde gerçekten görülen dağılıma bağlı kalır. "Prompt'la aşarım", "biraz fine-tune ederim", "daha büyük model alırım" cümleleri bazen doğru çalışır. Ama LittleLearner'ın gösterdiği yerde, bu cümleler tavanın üstüne merdiven değil, tavanın altındaki lambayı parlatma işidir.

Sınırı dürüst yazalım. Bu bir kontrollü laboratuvar: ABD K-5 müfredatı vekil ölçü, arXiv ön baskısı, seçilmiş benchmark'lar. İnsan çocuğunun öğrenmesiyle birebir denk değildir; çocuk dünyayı metin dışında da görür. Yine de mühendislik dersi net: veri karışımını bilmeden "model öğrendi" demek acele olur. Öğrendiği şey çoğu zaman, daha önce yediği metnin sınırını daha iyi kullanmaktır.

Kapanış tek cümlede toplanır. İlkokul duvarının içinde büyüyen model, o duvarın dışında sihirli bir üniversiteye dönüşmüyor. Sohbet kutusu akıcı olsa bile, tavan çoğu zaman ön eğitimde örülmüş oluyor.

Dipnotlar ve Kaynaklar

  1. Li, F., Zeller, J., Prada-Corral, M., Wiedemer, T., Mayilvahanan, P., Cotterell, R. ve Brendel, W. (2026). "LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure". arXiv:2608.13545. LittleCurriculum (~88B token, ABD K-5); LittleLearner (0,6B/1,3B/5B); ölçek, SFT+GRPO ve ICL kapsam dışı yeteneği anlamlı yükseltmiyor. arxiv.org/abs/2608.13545
  2. Proje sayfası, canlı demo ve kontrol noktaları: littlelearner-ll.github.io. Elicitation vs. acquisition bulgusunun özeti ve MathCAMPS/Jeopardy ayrımı burada da derlenmiş.
  3. BabyLM ve zamansal kesit (ör. 1931 öncesi İngilizce) gibi kısıtlı ön eğitim çizgileri nicelik veya tarih sınırı koyar; LittleCurriculum kavramsal/gelişimsel bir sınır koyarak bunları tamamlar (makale §2).

Bu yazı bilgi amaçlıdır; model seçimi, eğitim veya güvenlik tavsiyesi değildir.

Kategoriler ve Etiketler
Teknoloji yapay zeka dil modeli eğitim verisi littlelearner ön eğitim müfredat
Bu yazıyı paylaş
Kerem

Kerem

İstanbul'da yaşıyor. Teknoloji yazıyor.