Bir yazılım ekibi gibi konuşan yapay zeka ajanları düşün: biri mimar, biri kod yazan, biri denetçi. Ekranda iş bölünmüş gibi duruyor. UC Berkeley liderliğindeki ekibin 2025 tarihli çalışması ise soğuk bir rakam koyuyor. ChatDev gibi popüler bir çoklu ajan çerçevesi, ProgramDev adlı yazılım görevi setinde yalnızca yüzde 33,3 doğruluk yakalıyor.1

Yani üç ajan bir araya gelince her şey düzelmiyor. Bazen tek ajanlı sistemlere veya basit "en iyisini seç" örneklemesine göre kazanç da ince kalıyor. Soru sade: çoklu ajan sistemleri neden düşüyor?

Önce ajan ne demek?

Burada ajan, bir dil modelinin başlangıç talimatı, konuşma geçmişi ve araç kullanma yeteneğiyle çevresiyle etkileşen bir birim. Çoklu ajan sistemi de bu birimlerin orkestrasyonla bir araya gelmesi: işi parçalamak, paralel koşmak, rolleri ayırmak. MetaGPT bir yazılım şirketinin prosedürlerini taklit ediyor; AppWorld e-posta ve müzik gibi servis ajanlarını bir denetçiyle bağlıyor; Magentic-One açık uçlu web ve dosya görevlerine bakıyor. Mimari farklı, ortak iddia aynı: ekip tek modelden daha iyi iş çıkarır.

Berkeley ekibi yedi açık kaynak çerçeveyi inceledi. İki yüzün üzerinde konuşma izi okundu; her iz ortalama on beş bin satırı aşıyor. Altı uzman insan etiketçi çalıştı. Ortaya çıkan sınıflandırma MAST: Multi-Agent System Failure Taxonomy, yani çoklu ajan sistemi hata sınıflandırması. On dört hata türü üç başlıkta toplanıyor. İnsan etiketçiler arasında Cohen'in kappa skoru 0,88; etiketler rastgele değil, tutarlı.1

MAST hata kategorilerinin yüzde dağılımı
İki yüzün üzerindeki izde hata dağılımı görece dengeli: tek bir "kötü kategori" yok. Damga: kafa1milyon.com · Kaynak: Cemri vd., arXiv:2503.13657

Belirtim sorunları: iş baştan yanlış kuruluyor

Birinci başlık, izlerin yaklaşık yüzde 41,8'ini kapsıyor. Sistem mimarisi, rol tanımı veya görev kısıtları baştan bulanıksa ajanlar işi yanlış yorumluyor. En sık görülenler adım tekrarı, görev gereklerine uymama, işin bittiğini fark edememe. ChatDev örneğinde "standart Wordle, her gün yeni beş harfli kelime" isteniyor; sistem yine sabit kelime listesi üretiyor. Prompt daha açık yazılınca bile sabit liste ve yeni hatalar geliyor. Yani sorun yalnızca kullanıcının muğlak cümlesi değil; sistemin belirtimi nasıl okuduğu.1

Bu, talimat yazmanın önemsiz olduğu anlamına gelmiyor. Rol belirtimini sıkılaştıran bir müdahale ChatDev'de başarıyı yaklaşık yüzde 9,4 artırıyor. Ama aynı kullanıcı prompt'u ve aynı taban modelle bile kazanım sınırlı kalıyor. Belirtim düzeltmesi gerekli; tek başına yeterli değil.

Hiyerarşik bilgisayar ağı diyagramı
Çoklu ajan sistemleri de bir ağ gibi kuruluyor: kim kime bağlı, bilgi nerede duruyor. Diyagram: Conspiritech, kamu malı, Wikimedia Commons.

Ajanlar birbirini kaçırıyor

İkinci başlık izlerin yaklaşık yüzde 36,9'u. Bir ajan doğru kullanıcı adı biçimini buluyor ama diğerine söylemiyor; diğeri aynı hatayı tekrarlıyor. Başka örneklerde yanlış varsayımla ilerleme, görevden sapma, düşünce ile eylem uyuşmazlığı görülüyor. Yüzeyde hepsi "konuşma bozuldu" gibi duruyor; kökü ayırmak için ince sınıflandırma gerekiyor. Bilgi tutulmuş mu, girdi yok sayılmış mı, bağlam mı kaybolmuş? Aynı belirtiler farklı köklerden çıkar.1

Burada klasik yazılım sezgisi işe yarıyor. İki servisin API sözleşmesi belirsizse entegrasyon testleri patlar. Ajanlar arası mesaj da bir sözleşmedir: neyin iletileceği, neyin sorulacağı, neyin varsayılmayacağı yazılmamışsa ekip kendi kendine gürültü üretir.

Doğrulama var, yine de yanlış çıkıyor

Üçüncü başlık yaklaşık yüzde 21,3. İş erken bitiyor, denetim eksik kalıyor veya denetim yanlış sonuç veriyor. ChatDev'in ürettiği bir satranç programı tüm "inceleme" turlarından geçiyor ama geçersiz hamleyi kabul ediyor. Çünkü denetçi çoğu zaman derleme veya yorum satırı gibi yüzeysel kontrollerle yetiniyor; oyun kurallarını gerçekten sınamıyor.1

Süper bilgisayar dolapları
Hesap gücü arttıkça koordinasyon maliyeti de artar; denetim yüzeyselse ölçek hatayı büyütür. Fotoğraf: Argonne National Laboratory, CC BY-SA 2.0, Wikimedia Commons.

Doğrulayıcı ajanı olan sistemlerde toplam hata daha az görülebiliyor. Yine de ChatDev ProgramDev'de yüzde 33 doğrulukta kalabiliyor: tic-tac-toe, satranç, sudoku gibi bol örnekli, basit görünen görevlerde bile. Üst düzey hedefe bakan ek bir doğrulama adımı eklenince ProgramDev'de mutlak artış yüzde 15,6 oluyor. İyileşme gerçek; kalıcı güvenilirlik için yeterli değil. Araştırmacıların tezi net: birçok hata tek modelin halüsinasyonundan değil, örgüt tasarımı ve koordinasyondan geliyor.2

Senin ekranına ne dokunuyor?

"Beş ajanlı otomasyon" yazan bir araç gördüğünde sorulacak soru ajan sayısı değil. Roller yazılı mı? Kim kime ne aktarıyor? Çıktıyı kim ve nasıl doğruluyor: derleme mi, gerçek kabul testi mi? Bu üç soruya cevap yoksa ekip büyütmek çoğu zaman gürültüyü büyütür. MAST'ın değeri de burada: hata türlerini isimlendirince "model kötü" yerine "belirtim mi, koordinasyon mu, doğrulama mı?" diye bakılabiliyor.

Sınırı dürüst yazalım. Bu çalışma seçilmiş açık kaynak çerçeveler ve belirli benchmark'lar üzerinde. Her ticari ürünü tek tek ölçmüyor. Yine de mühendislik dersi taşınıyor: zeki bireylerin kötü örgütlenmesi felaket üretebilir; aynı mantık ajan ekiplerine de işliyor.

Çoklu ajan sistemi bir orkestra değilse, en iyi müzisyenler bile aynı anda yanlış parçayı çalar. Berkeley'nin sınıflandırması bunu ölçüyle söylüyor: sorun çoğu zaman modelin kendisi değil, ekibin nasıl kurulduğu.

Dipnotlar ve Kaynaklar

  1. Cemri, M., Pan, M. Z., Yang, S., Agrawal, L. A., Chopra, B., Tiwari, R., Keutzer, K., Parameswaran, A., Klein, D., Ramchandran, K., Zaharia, M., Gonzalez, J. E. ve Stoica, I. (2025). "Why Do Multi-Agent LLM Systems Fail?". arXiv:2503.13657. MAST: 14 hata türü, 3 kategori (belirtim ~%41,8; ajan uyumsuzluğu ~%36,9; doğrulama ~%21,3); 7 çerçeve, 200+ iz; ChatDev ProgramDev doğruluğu %33,33. arxiv.org/abs/2503.13657
  2. Proje sitesi, veri seti ve LLM etiketleyici: sites.google.com/berkeley.edu/mast. Müdahale çalışmaları: rol belirtimi (+%9,4 ChatDev), ek üst düzey doğrulama (+%15,6 ProgramDev). github.com/multi-agent-systems-failure-taxonomy/MAST

Bu yazı bilgi amaçlıdır; yazılım mimarisi, güvenlik veya ürün seçimi tavsiyesi değildir.

Kategoriler ve Etiketler
Teknoloji yapay zeka çoklu ajan mast koordinasyon doğrulama llm
Bu yazıyı paylaş
Kerem

Kerem

İstanbul'da yaşıyor. Teknoloji yazıyor.