9 Temmuz 2026'da OpenAI, GPT-5.6 ailesini herkese açtı: Sol, Terra ve Luna.1 Lansman yayınında ekran kullanımı, arayüz gezinmesi ve üç boyutlu görselleştirme anlatıldı. Bunların hepsi, modelin bir fotoğrafa bakıp "burada ne var?" sorusuna güvenilir cevap vermesine bağlı. Yani görsel algı, bu sürümün gizli omurgası.

Haftalar sonra Roboflow, henüz tamamlanmamış bir görsel-dil modeli kıyaslamasında GPT-5.6'yı koştu. Sonuç net: Sol, OpenAI'ın bugüne kadar piyasaya sürdüğü en gelişmiş görsel işleme modeli.2 Şirketin görme tarafına koyduğu ağırlık, lansmandaki ekran ajanı vurgusuyla aynı hizada.

Bu yazıda neler var?

Tespitte üç katlı sıçrama

Roboflow'un ölçümünde nesne tespiti, modelin bir görüntüdeki nesneleri kutu koordinatlarıyla bulması demek. GPT-5.5 bu testte 13,8 mAP@50 puanı almıştı; pratikte zayıf sayılıyordu. Sol 46,2'ye çıktı. Terra 44,7, Luna 43,3 ile hemen arkasında.2 Üç model de aynı aileden; fark büyük ölçüde hız ve fiyat katmanında.

GPT-5.5'ten GPT-5.6 Sol'a nesne tespiti mAP@50 artış grafiği
13,8'den 46,2'ye. Roboflow, nesne tespitini "büyük zayıflık"tan "kullanılabilir yetenek"e taşıdığını yazıyor.

Belge düzeni tespiti en net kazanımlardan biri. Başlık, paragraf, tablo, imza gibi blokları ayırmak; taranan fatura veya sözleşme iş akışlarının ilk adımı. Hap ve yumurta gibi sıkışık sahnelerde de çoğu nesneyi buldu. Görsel-dil modelleri her kutuyu metin olarak ürettiği için nesne sayısı arttıkça hata riski büyür; Sol yine de GPT-5.5'e göre belirgin ilerleme gösterdi.

İpucu da teknik: Roboflow, Sol'dan mutlak piksel koordinatı (XYXY) istemeyi öneriyor. Gemini tarafında farklı bir format daha iyi sonuç veriyor; yanlış format GPT-5.6 tespitini yaklaşık 15 puan düşürebiliyor.

Sayma yükseldi, OCR yerinde saydı

Sayma testinde Sol yüzde 73,0 aldı; GPT-5.5 yüzde 64,9'daydı. Üst üste binen metal parçaları, yalnızca belirli bölgelerdeki delikleri sayma gibi kurallı görevlerde mantıklı sonuç verdi. Blister ambalaj gibi yansımalı, tekrarlayan düzenler hâlâ zor.

OCR tarafı ise neredeyse aynı kaldı. Sol'un tam metin benzerlik puanı yüzde 90,7; GPT-5.5 yüzde 91,2'de. Hedefli metin çıkarmada Sol yüzde 82,5, önceki sürüm yüzde 87,6'daydı.2 Yani "görme" dediğimiz şey tek parça değil: konum bulma ve sayma güçlendi, el yazısı ve küçük etiket okuma aynı sınıfta kaldı. Süresi geçmiş ilaç kutusundaki dikey, düşük kontrastlı tarihi Sol okuyamadı.

Tarayıcıda dijitalleştirilen kağıt belgeler
Belge iş akışları önce "hangi blok nerede?" sorusuna cevap ister; OCR ikinci adımdır. Fotoğraf: Wikimedia Commons.

Faturaya yansıyan taraf

Roboflow'un ölçümünde Sol görüntü başına ortalama on saniyeye yakın sürdü; Terra altı, Luna beş saniyenin biraz üstünde. Maliyet tarafında Sol görüntü başına yaklaşık 2,5 sent; Terra bir sent, Luna yarım sent civarı. Token kullanımı arttığı için küçük denemelerde fark gözden kaçabilir; binlerce fatura tarandığında rakamlar kabarıyor.

Görsel modellerin görüntü başına maliyet karşılaştırması
Sol pahalı uçta; Gemini 3.5 Flash görüntü başına 0,8 sent ile tespit kıyaslamasında hâlâ önde.

Gemini 3.5 Flash, Roboflow'un tespit ve sayma tablolarında lider; görüntü başına 0,8 sent ile Sol'un üçte birinden ucuz. Yüksek hacimli depo sayımı veya güvenlik kamerası analizi için hâlâ pratik alternatif. Sol'un artısı, OpenAI ekosistemi içinde aynı API, aynı önbellek ve aynı ajan hattına oturması.

Türkiye'deki geliştirici için tablo şöyle okunabilir: zaten OpenAI API kullanıyorsan ve görsel istekler "yaklaşık doğru ama güvenilmez" diyorsan, 5.6 Sol denemeye değer. Tamamen yeni bir entegrasyon kuruyorsan ve günde on binlerce kare işlenecekse, önce ucuz modelle pilot koşmak hâlâ mantıklı.

Henüz bitmemiş köşeler

Roboflow, yaklaşık 2000×2000 piksel ve üzeri görsellerde Sol'un kutularının dağıldığını, bazen görüntünün rastgele bölgelerine düştüğünü yazdı. OpenAI ekibi bunu doğruladı; daha yüksek "reasoning effort" ayarı stabiliteyi artırıyor ama token, gecikme ve fatura da büyüyor. Büyük dosyayı küçültmek veya kırpmak pratik çözüm.2

OpenAI'nin Temmuz lansmanında anlatılan "bilgisayar kullanımı" da aynı görme hattına bağlı. Model ekran görüntüsünde düğmeyi, metin kutusunu ve menüyü ayırt edemediğinde tıklama komutu anlamsız kalır. Sol'un tespit sıçraması, bu ajan senaryolarının neden öne çıktığını açıklıyor: önce sahneyi okumak, sonra hareket etmek.

9 Ağustos 2026'da Moonshot AI'nin PerceptionBench testinde GPT-5.6 Sol yüzde 59,7 ile en yüksek puanı aldı; Kimi K3 yüzde 58,5 ile hemen arkasında.3 Fark birkaç puan; kimse "görüyor" demek için rahat değil. Temel algı hataları, mantık hatası sanılan cevapların kaynağı olabiliyor.

API tarafında koordinat formatı, görüntü boyutu ve reasoning effort üçlüsü birlikte okunmalı. Tek başına mAP@50 tablosu, depo sayım botunu veya fatura tarayıcısını tek tıkla kurmaz; ama OpenAI'ın görsel tarafında önceki sürümlere göre ciddi bir mesafe açıldığını gösterir.

GPT-5.6 Sol, OpenAI için görsel tarafta ciddi bir sıçrama. Nesne tespiti ve sayma artık demo değil, belge işleme ve ekran ajanı senaryolarında denenebilir seviyede. OCR aynı bandda; maliyet ve gecikme arttı; rakipler ucuz hacimde hâlâ önde. Bir sonraki fatura döngünde "görsel istek" satırına bakmak, sürüm numarasını okumaktan daha çok şey söyleyebilir.

Dipnotlar ve Kaynaklar

  1. OpenAI (9 Temmuz 2026), "GPT-5.6: Frontier intelligence that scales with your ambition": Sol, Terra ve Luna genel kullanıma açıldı; bilgisayar kullanımı ve görsel iş akışları vurgulandı. openai.com/index/gpt-5-6
  2. Piotr Skalski, Roboflow Blog (16 Temmuz 2026), "GPT 5.6 Sol is the best vision model OpenAI ever released": bağımsız VLM kıyaslaması; mAP@50, sayma, OCR, maliyet ve gecikme rakamları; OpenAI'nin büyük görüntü stabilitesi yorumu. blog.roboflow.com/openai-gpt-5-6
  3. Moonshot AI / The Decoder (9 Ağustos 2026), PerceptionBench: on atomik alt beceride GPT-5.6 Sol yüzde 59,7 genel doğruluk; hiçbir ön uç model yüzde 60'ı geçmedi.

Bu yazı bilgi amaçlıdır; yatırım veya ürün tavsiyesi değildir. Kıyaslama sonuçları Roboflow'un kendi test protokolüne bağlıdır.

Kategoriler ve Etiketler
Teknoloji openai gpt-5.6 yapay zeka görsel algı nesne tespiti roboflow
Bu yazıyı paylaş
Kerem

Kerem

İstanbul'da yaşıyor. Teknoloji yazıyor.