Ağustos 2026'nın ikinci haftasında açık ağırlıklı modeller peş peşe geldi. Meta 10 Ağustos'ta Muse Glimmer-30B'yi yayınladı; dört gün sonra Alibaba Qwen3.8-27B'yi Hugging Face'e koydu. İkisi de aynı hedefe kilitlenmiş görünüyor: kod yazan, tarayıcıyı ve masaüstünü kullanan, yerelde koşabilen bir ajan.1

Qwen3.8-27B yirmi yedi milyar parametre, Apache 2.0 lisanslı, görüntü ve videoyu da okuyabiliyor. Yerel kurulumda ağırlık dosyası yaklaşık 55 gigabayt; güçlü bir ekran kartına sığması mümkün. Bağlam penceresi 262 bin token; yani uzun bir proje klasörünü tek seferde okuyabiliyor. Bu boyut sınıfında rakip az değil; fark tablolarda ortaya çıkıyor.

Bu yazıda neler var?

Bağımsız ölçüm: 52 puan, sınıfın tepesinde

Üretici tablolarına güvenmek zor. Her şirket kendi koşullarında ölçüyor; rakip modeli aynı harness'te koşturmuş olsa bile sonuç yine kendi laboratuvarından çıkıyor. Bu yüzden üçüncü taraf skorlar farklı ağırlık taşır.

Artificial Analysis, Qwen3.8-27B'yi dokuz ayrı değerlendirmeyle birleştirdiği Intelligence Index v4.1.1'de test etti. Model 52 puan aldı. Aynı sınıftaki, yani dört ila kırk milyar parametreli açık ağırlıklı modeller arasında birinci; listede 135 model var, medyan 9. Bu fark, küçük açık modellerin çoğunun henüz ajan işlerinde güvenilir olmadığını hatırlatıyor.2

AA ayrıca modelin konuşkan olduğunu yazıyor: Intelligence Index koşusunda 160 milyon çıktı tokeni üretmiş; sınıf medyanı 43 milyon. Yani aynı görevi yaparken daha çok kelime harcıyor. Bu, yerel kurulumda süreyi ve elektrik faturasını uzatabilir; bulut API'sinde ise çıktı başına maliyeti artırır.

Artificial Analysis Intelligence Index: Qwen3.8 27B 52 puan, sınıf medyanı 9
Artificial Analysis'in bağımsız ölçümü: 4B-40B açık modeller sınıfında Qwen3.8-27B 52 puanla listede birinci. Muse Glimmer henüz bu indekste yok.

Üretici tablosu: kod ve ekran kullanımında sıçrama

Alibaba'nın model kartı daha iddialı rakamlar veriyor. Tablo, Qwen3.6-27B, Qwen3.7-Plus, Meta'nın Muse Glimmer-30B'si ve Anthropic'in Opus 4.6 Max'iyle yan yana duruyor. Ölçüm koşulları kartın dipnotunda yazılı: SWE-bench Pro ve Terminal Bench 2.1 için Claude Code harness, sıcaklık 1,0, 256 bin token bağlam.3

SWE-bench Pro'da Qwen3.8-27B yüzde 61,7; Opus 4.6 Max yüzde 53,4. Bilgisayar kullanımı ölçümü OSWorld-Verified'da model yüzde 84,3 alırken Opus yüzde 72,7'de kalıyor. Terminal Bench 2.1'de ise sıra ters: Opus yüzde 78,2 ile önde, Qwen yüzde 73,0. Yani model her satırda birinci değil; ama kod yazma ve masaüstü görevlerinde rakip kapalı modelin üstüne çıktığı iddia ediliyor.

Bir önceki nesil Qwen3.6-27B ile kıyaslandığında en büyük sıçrama ajan ölçümlerinde. OSWorld-Verified yüzde 63,9'dan 84,3'e; DeepSWE 1.1 yüzde 13,3'ten 42,2'ye çıkmış. Saf bilgi sorularında (GPQA Diamond gibi) fark birkaç puan; asıl mesafe çok adımlı işlerde açılıyor.

SWE-bench Pro, OSWorld-Verified ve Terminal Bench karşılaştırması: Qwen3.8-27B ve Opus 4.6 Max
Alibaba model kartından üç ölçüm. SWE-bench Pro ve OSWorld'de Qwen önde; Terminal Bench'te Opus. Veriler üreticinin kendi tablosundan.

Meta ile aynı hafta, aynı pazar

Muse Glimmer-30B de Apache 2.0 ile çıktı ve yerel ajan hedefliyor. Alibaba tablosunda dört ortak ölçümde Qwen3.8-27B'nin önde olduğu yazılı: Terminal Bench, SWE-bench Pro, IFBench ve GPQA Diamond. Bu satırlar yine Alibaba'nın rakip modeli kendi koşullarında koşturmasından geliyor; bağımsız tekrar henüz yok.4

Artificial Analysis'te Muse Glimmer henüz Intelligence Index'te görünmüyor. İki modeli gerçekten kıyaslamak için ya AA'nin Glimmer'ı listeye almasını ya da aynı görev setinde bağımsız bir koşuyu beklemek gerekiyor. Şimdilik elimizdeki en net üçüncü taraf sinyali Qwen tarafında.

Yarı iletken fabrikasında üretim hattı, temsilî görsel
Yirmi yedi milyar parametrelik modelin yerel koşması, bu tür üretim hatlarının çıkardığı çiplere dayanıyor. (Wikimedia Commons · lisanslı)

Ne anlama geliyor, nerede duruyor

Açık ağırlıklı modeller artık yalnızca "deneme amaçlı küçük dil modeli" sınıfında değil. 52 puanlık bağımsız skor ve üretici tablosundaki ajan satırları, orta boy açık modelin kod ve ekran görevlerine ciddi yatırım aldığını gösteriyor. Apache 2.0 lisansı ticari kullanıma izin veriyor; ağırlıkları indirip kendi sunucunda koşturabilirsin.

Üç sınırı açık tutmak lazım. Birincisi: SWE-bench Pro, OSWorld gibi yüksek rakamlar henüz başka laboratuvarlarda doğrulanmadı; AA'nin 52 puanı daha güvenilir bir referans ama o da tek bir metodoloji. İkincisi: model varsayılan olarak "düşünme" modunda çalışıyor ve çok token harcıyor; hız ve maliyet günlük kullanımda sorun olabilir. Üçüncüsü: bulut API fiyatı yüksek (girdi için milyon token başına 0,45 dolar, çıktı için 3,20 dolar); yerel kurulumda ise donanım yatırımı devreye giriyor.5

Önümüzdeki haftalarda bağımsız laboratuvarların aynı harness'te tekrar koşması ve Muse Glimmer'ın AA listesine girmesi tabloyu netleştirir. Şimdilik Qwen3.8-27B, açık ağırlıklı yarışta ölçülebilir bir sıçrama vaat ediyor; vaadin ne kadarı gerçek olduğunu ise üçüncü taraf testler söyleyecek.

Dipnotlar ve Kaynaklar

  1. Alibaba Qwen Team, Qwen3.8-27B model kartı, Hugging Face, 14 Ağustos 2026.
  2. Artificial Analysis, Qwen3.8 27B Intelligence, Performance & Price Analysis, erişim 19 Ağustos 2026. Intelligence Index v4.1.1.
  3. Alibaba Qwen Team, model kartı benchmark tabloları ve dipnot 1 (SWE-bench Pro ölçüm koşulları), 14 Ağustos 2026.
  4. Alibaba Qwen Team, model kartı; Meta AI, Muse Glimmer duyurusu, 10 Ağustos 2026.
  5. Artificial Analysis, API fiyatlandırma özeti; Qwen model kartı, hızlı başlangıç bölümü (reasoning_effort, preserve_thinking).
Kategoriler ve Etiketler
Teknoloji yapay zeka dil modeli qwen açık kaynak benchmark alibaba
Bu yazıyı paylaş
kafa1milyon

kafa1milyon

Meraklı bir kafa. Bilimsel makaleleri, arşiv belgelerini ve saha notlarını okuyup gündelik dile çeviriyor; bilinmeyeni bilinmiyor diye yazmaktan çekinmiyor.