Bir matris çarpımını GPU’da gerçekten hızlı hale getirmek haftalar sürebilir. Döşeme boyutu, bellek düzeni, hassasiyet ayarı: hepsi ayrı bir deneme. 2026’da yayımlanan AutoKernel çalışması bu işi gece boyu çalışan bir ajan döngüsüne çeviriyor. Model geliyor, darboğaz bulunuyor, Triton veya CUDA çekirdeği yüzlerce kez deneniyor; insan elle dokunmadan.
Bu yazı bir ilaç veya ameliyat hikâyesi değil. Ama tıbbi görüntüleme modellerinden protein tahminine kadar bugün hastaneye yaklaşan birçok yapay zeka sistemi, aynı GPU çekirdeklerinin üstünde koşuyor. Çekirdek yavaşsa fatura şişiyor; model gecikiyor. O yüzden “yazılım çekirdeğini katlamak” cümlesi, yalnızca mühendislik masasında kalmıyor.
- AutoKernel adlı açık kaynak çerçeve, PyTorch modelini profilleyip darboğaz çekirdekleri Amdahl kuralıyla sıralıyor.
- NVIDIA H100’de RMSNorm’ta eager’a göre 5,29 kat, torch.compile’a göre 2,83 kat hızlanma ölçülmüş.
- Her aday önce beş aşamalı doğruluk testinden geçiyor; hız ancak ondan sonra yazılıyor.
- Matris çarpımı hâlâ zor: cuBLAS üstünlüğü sürüyor, ajanın asıl açığı orada.
Ne bulundu, nasıl çalışıyor
Jaber ve Jaber’in arXiv ön baskısı AutoKernel’i şöyle özetliyor: modele bak, GPU süresini çekirdek çekirdek ölç, etki sırasına koy, sonra tek bir dosyayı düzenle, ölç, tut veya geri al.1 Döngü kabaca 90 saniye: 30 saniye doğruluk, 30 saniye ölçüm, 30 saniye ajan muhakemesi. Saatte kırk deneme; on saatte üç yüzü aşan deney. Her deney bir git commit’ine bağlanıyor; tutulan ilerliyor, bozan sıfırlanıyor. Böylece gece boyu koşan ajanın izi sabah okunabilir kalıyor.
Dokuz çekirdek tipi hedefleniyor: matmul, softmax, LayerNorm, RMSNorm, cross-entropy, indirgeme, rotary gömme ve benzeri. Bunlar modern transformer mimarisinin günlük yükü. Profilleyici önce hangi çağrının toplam süreyi yediğini görüyor; Amdahl hesabı, “burayı 2 kat hızlandırsan model ne kadar kısalır?” sorusunu öne koyuyor. Beş ardışık geri alma, yüzde 90 tepe kullanımı, iki saatlik bütçe veya 2 kat hızlanma olunca sistem bir sonraki çekirdeğe geçiyor. Altı kademeli oyun kitabı da var: önce döşeme boyutu, sonra bellek erişimi, sonra hesap birleştirme; Hopper’a özgü TMA gibi mimari incelikler en sonda.
İki arka uç birden destekleniyor. Triton hızlı deneme için (derleme bir-beş saniye), CUDA C++ ise warp ve tensör çekirdeğine inmek gerektiğinde. Ajan tek dosyaya dokunuyor; bu kural, geri almayı temiz ve hatayı izole etmeyi kolay tutuyor. Başlangıçta on sekiz hazır çekirdek şablonu ve KernelBench ile 250 standart problem köprüsü de pakette.
Sayılar: nerede katlanıyor, nerede takılıyor
Ölçümler NVIDIA H100 80GB üzerinde, FP16, CUDA olay zamanlaması ile yapılmış. Bellek sınırlı çekirdeklerde fark net: en büyük test boyutunda RMSNorm, PyTorch eager’a göre 5,29 kat, torch.compile (max-autotune) karşısında 2,83 kat daha hızlı. Softmax 2,82 / 3,44; cross-entropy 2,21 / 2,94. Bant genişliği tarafında RMSNorm 2.788 GB/s’ye çıkıyor; H100’ün teorik 3.352 GB/s tepe değerinin yüzde 83’ü.1
Kazancın çoğu, ATen’in parçalı işlemini tek geçişli Triton çekirdeğinde birleştirmekten geliyor. HBM’e gidip gelme azalınca süre düşüyor. Matmul ise başka hikâye: cuBLAS yıllardır o silikon için törpülenmiş. AutoKernel’in başlangıç Triton’u tepe FLOPS’un uzağında kalıyor; bazı boyutlarda torch.compile’ı 1,55 kat geçse de vendor kütüphanesi hâlâ önde. Yazarlar bunu açık yazıyor: asıl açık orada, “her yerde 5 kat” değil.
Doğruluk olmadan hız yok
Çalışmanın en sakin ama en kritik parçası beş aşamalı doğruluk koşusu. Duman testi küçük girdide derleme ve şekil hatalarını yakalıyor. On civarı şekil taraması boyut bağımlı böcekleri gösteriyor. Düşmanca girdiler softmax’ta aynı büyük değerler, matmul’da aşırı dinamik aralık gibi uçları zorluyor. Üç koşuda bit düzeyinde aynı çıktı isteniyor; yarış durumu ve rastgele atomikler burada düşüyor. Güç-of-iki olmayan boyutlar (1023, 4097 gibi) döşeme artığını ortaya çıkarıyor. Hepsi geçmeden hız kayda geçmiyor. 34 yapılandırmanın tamamı sıfır başarısızlıkla geçmiş.1
Topluluk tarafında da iz var. vectorsum_v2 yarışında B200 lider tablosunda bir AutoKernel optimize Triton çekirdeği birinciliğe oturmuş. Başka bir kullanıcı, yaklaşık üç dakikalık tek istemle üretilen FP4 matmul Triton’unun CUTLASS’ı bazı şekillerde 1,63-2,15 kat geçtiğini bildirmiş. Bunlar laboratuvar dışı, rekabet ortamı notları; yine de “ajan sadece demo üretiyor” itirazını zayıflatıyor. CUTLASS’ın elle törpülenmiş şablon kodu olduğu düşünülünce, kısa bir ajan turunun onu bazı boyutlarda geçmesi dikkat çekici; ama bu, her üretim iş yükünde aynı çarpanı vaat etmez.
Dürüst sınırlar
Sistem tek GPU’da, tek çekirdek düzeyinde çalışıyor. Dağıtık bellek, çok cihazlı çekirdekler kapsam dışı. Ajan, altındaki dil modelinin tavanına bağlı; yazılım boru hattı veya özel PTX gibi ağır teknikler hâlâ zor. torch.compile’ın kendi Triton otokurması da var; AutoKernel çoğu bellek sınırlı örnekte onu geçse de matmul’da kolay zafer yok. Yüzde 5’lik bir RMSNorm kazancı, yüzde 60’lık matmul’u bir buçuk kat hızlandırmaktan daha az uçtan uca etki yapabilir; Amdahl hesabı bunu masaya koyuyor.
Senin için pratik cümle şu: daha hızlı çekirdek, aynı modelin daha az sürede veya daha ucuz silikonda koşması demek. Tıbbi AI hattında bu, gece boyu çalışan bir tarama kuyruğunun sabaha yetişmesi veya bulut faturasının incelmesi olabilir. Mucize değil; ölçülmüş bir mühendislik döngüsü. Kod açık: GitHub’da RightNow-AI/autokernel. Okurken sorulacak doğru soru “devrim mi?” değil, “benim darboğazım bellek mi, matmul mu?”
Dipnotlar ve Kaynaklar
- Jaber, J. & Jaber, O. (22 Mart 2026). "AutoKernel: Autonomous GPU Kernel Optimization via Iterative Agent-Driven Search". arXiv:2603.21331. Model profilleme, Amdahl sıralaması, Triton/CUDA çift arka uç, beş aşamalı doğruluk koşusu; H100 FP16 ölçümlerinde RMSNorm 5,29× (eager) / 2,83× (torch.compile), softmax 2,82× / 3,44×, cross-entropy 2,21× / 2,94×; 34 yapılandırmanın tamamının doğruluktan geçtiği; matmul’da cuBLAS üstünlüğünün sürdüğü; B200 vectorsum_v2 birinciliği ve FP4 Triton-CUTLASS karşılaştırması (1,63-2,15×) topluluk notları. Kod: github.com/RightNow-AI/autokernel. PDF: arxiv.org/pdf/2603.21331 ↩
Bu içerik bilgilendirme amaçlıdır; tıbbi tavsiye değildir. Klinik kararlar için hekimine danış.


