Qwen 3.8 Kıyaslama Sonuçları: Alibaba Tablosu Neleri Gösteriyor, Neleri Göstermiyor

Qwen 3.8-Max kıyaslamaları, dürüstçe okuyun: PaperBench 93.0 ve çok modlu zaferler, HLE ve SWE-bench Pro kayıpları ve çoğu haberin atladığı ince detaylar.

INEZA Felin-Michel

INEZA Felin-Michel

3 August 2026

Qwen 3.8 Kıyaslama Sonuçları: Alibaba Tablosu Neleri Gösteriyor, Neleri Göstermiyor

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

İki hafta boyunca Qwen 3.8 hikayesinde bir boşluk vardı. Temmuz ayındaki basın ön gösterimleri, sınır ötesi sınıf bir model vaat ediyordu ancak hiçbir skor sunmadı, bu yüzden her erken yazı izlenimlere dayanıyordu. Bu durum 3 Ağustos 2026'da değişti. Alibaba'nın Qwen 3.8-Max için resmi yayın gönderisi, Claude Opus 4.8, Fable 5, GPT-5.6 Sol ve kendi öncülü Qwen3.7-Max'e karşı tam bir karşılaştırma tablosunun yanı sıra, Gemini 3.1 Pro ve GPT-5.6 Sol'a karşı ayrı bir çok modlu tablo içeriyor.

Bu tabloyu dikkatle okumaya değer. Gerçek başarılar, dürüst kayıplar ve çoğu haberin tamamen atlayacağı küçük yazılar içeriyor. Bu gönderi, her üçünü de ele alıyor, ardından satıcı tablolarına güvenmeyi tamamen bırakmanız için pratik bir yol sunuyor: API'ye karşı kendi değerlendirmenizi yapın. Önce modelin tam açıklamasını (parametreler, fiyatlandırma, erişim) istiyorsanız, Qwen 3.8-Max açıklayıcımızdan başlayın ve geri dönün.

Rakamları vermeden önce bir not. Aşağıdaki her skor, Alibaba'nın kendi yayınladığı tablodan alınmıştır ve dipnotlardaki liderlik tablosu verileri 3 Ağustos 2026 tarihine aittir. Yazıldığı sırada bağımsız bir değerlendirme mevcut değildi. Aşağıdaki her satır için bunu aklınızda bulundurun.

Tabloya bir bakış

İşte Alibaba'nın yayınladığı başlık niteliğindeki metin-model satırları. Bunların hepsinde daha yüksek daha iyidir.

Kıyaslama Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max
Terminal Bench 2.1 86.6 84.6 84.6 88.8 74.5
SWE-bench Pro 67.7 69.2 80.0 64.6 60.6
PaperBench 93.0 80.3 88.8 90.5 64.8
GPQA Diamond 92.6 92.0 92.6 94.1 92.4
IFBench 82.8 62.2 63.5 72.7 79.1
HLE (İnsanlığın Son Sınavı) 43.6 45.7 53.3 47.2 41.4

Kaynak: Alibaba'nın kendi çalıştırdığı tablo. "Satıcı tarafından çalıştırılan" teriminin pratikte ne anlama geldiğine aşağıda değineceğiz, çünkü bu burada normalden daha fazla önem taşıyor.

Qwen 3.8-Max'in kazandığı yerler

PaperBench: en iyi amiral gemisi satırı

Bir modelin araştırma makalesi sonuçlarını yeniden üretip üretemeyeceğini test eden PaperBench, Qwen 3.8-Max'in sınıra karşı en güçlü tek performansı: 93.0, GPT-5.6 Sol'un 90.5'inin, Fable 5'in 88.8'inin ve Opus 4.8'in 80.3'ünün önünde. Aynı zamanda Qwen3.7-Max'in 64.8'inden şaşırtıcı bir sıçrama. Herhangi bir kıyaslamada 28 puanlık nesiller arası bir sıçrama incelemeyi hak eder, ancak bağımsız testler altında dayanırsa, modelin uzun vadeli araştırma yeteneği hakkında gerçek bir şeyler söyler.

IFBench: geniş bir farkla talimat takibi

IFBench'te Qwen 3.8-Max 82.8 puan alıyor. Tablodaki en yakın Qwen dışı rakip GPT-5.6 Sol 72.7, Fable 5 63.5 ve Opus 4.8 62.2 puanla. Bu, bu kadar doymuş bir kıyaslamada alışılmadık olan 10 ila 20 puanlık bir fark. İlginç bir şekilde, Qwen3.7-Max bu satırda zaten 79.1 ile öndeydi, bu nedenle talimat takibi tek seferlik bir durumdan ziyade kalıcı bir Qwen gücü gibi görünüyor.

Terminal Bench 2.1: Claude'u geride bırakıyor

Alibaba'nın Terminal Bench 2.1 testinde, Qwen 3.8-Max hem Opus 4.8 hem de Fable 5'in 84.6'sına karşı 86.6 puan alıyor. GPT-5.6 Sol hala 88.8 ile satırı lider götürüyor, bu yüzden bu bir ikincilik, mutlak bir zafer değil. Ancak aracı terminal kıyaslamasında her iki Anthropic amiral gemisini de yenmek, Alibaba'nın bu lansmandan istediği türden bir sonuç ve Claude'a karşı iki puanlık fark, her yerde alıntılanan sayı olacak.

Çok modlu zafer

Ayrı çok modlu tablo, Qwen 3.8-Max'in genel olarak en güçlü göründüğü yerdir. Alibaba, MathVision'ı 95.2, LogicVista'yı 91.9 ve OSWorld-Verified'ı 86.1 olarak bildiriyor ve model tablodaki hemen hemen her OCR satırında lider konumda. Burada ne Opus 4.8 ne de Fable 5 doğrudan rekabet etmiyor (bu karşılaştırmada metin odaklılar), bu da çok modlu tablonun neden bir zafer gibi okunduğunun bir kısmını açıklıyor. Gemini 3.1 Pro ve GPT-5.6 Sol'a karşı, görsel akıl yürütme ve belge zekası satırları modelin en net farklılaştırıcılarıdır.

Eğer onu yazın diğer büyük açık ağırlıklı sürümüyle karşılaştırıyorsanız, çok modlu boşluk aynı zamanda en keskin karşıtlıktır: Kimi K3 yalnızca metin tabanlıdır. Qwen 3.8 vs Kimi K3 karşılaştırmamız bu eşleşmeyi tam olarak ele alıyor.

Kaybettiği yerler, dürüstçe belirtildi

Alibaba kayıpları tabloda bıraktı, bu da takdiri hak ediyor. Üç tanesi öne çıkıyor.

HLE: 43.6, Fable 5'in oldukça gerisinde. Geniş bilgi birikimine dayalı sınır kıyaslaması olan İnsanlığın Son Sınavı'nda Qwen 3.8-Max 43.6 puan alıyor. Fable 5 53.3, GPT-5.6 Sol 47.2 ve Opus 4.8 45.7 puanda. Bu, dört amiral gemisi arasında sonuncu sıra, liderin yaklaşık 10 puan gerisinde. Qwen3.7-Max'in 41.4'ünü geçiyor, ama kıl payı. HLE, kıyaslamaya özgü ayarlamalara çoğu değerlendirmeden daha iyi direnir, bu da bu satırı ağır bir şekilde tartmaya değer kılar.

SWE-bench Pro: 67.7'ye karşı Fable 5'in 80.0'ı. Daha zorlu yazılım mühendisliği kıyaslamasında, Qwen 3.8-Max orta sıralarda yer alıyor: GPT-5.6 Sol'un (64.6) önünde, Opus 4.8'in (69.2) hemen arkasında ve Fable 5'in tam 12 puan gerisinde. Qwen3.7-Max'e (60.6) göre nesiller arası iyileşme gerçek, ancak "Terminal Bench'te Claude'u yeniyor" ve "SWE-bench Pro'da Fable 5'in çok gerisinde kalıyor" ifadeleri aynı anda doğru ve ikinci iddia çok daha az başlıkta yer alacak.

DeepSWE ve daha zorlu aracı satırları. DeepSWE, Alibaba'nın kendi tablosunda Qwen 3.8-Max'in sınırın gerisinde kaldığı başka bir satır. Kodlama bölümündeki desen tutarlı: terminal tabanlı aracı görevlerde rekabetçi, en derin yazılım mühendisliği değerlendirmelerinde geride.

Dürüst bir özet: Qwen 3.8-Max, birkaç aracı satırda Opus 4.8'i yenerken, çoğu temel kodlama işinde Fable 5'in gerisinde kalıyor ve çok modlu ve belge zekasında büyük başarılar elde ediyor. Bu, milyon token başına 2 dolarlık giriş ve 6 dolarlık çıkış fiyatıyla sunulan bir model için gerçekten güçlü bir sonuç (bkz: resmi fiyatlandırma sayfası), ancak lansman haberlerinin yüzeysel bir okumasının düşündürebileceği gibi, her alanda sınırları zorlayan bir zafer değil.

Çoğu haberin atlayacağı küçük yazı

Bu, bir başlıktan ziyade bir kıyaslama gönderisini okumayı haklı kılan bölümdür. Alibaba'nın kendi yayınından dört detay, tabloyu nasıl okumanız gerektiğini değiştiriyor.

1. Her sayı satıcı tarafından çalıştırılır. Alibaba kendi modelini ve rakiplerinin modellerini değerlendirdi. Bu, lansman tabloları için standart bir uygulamadır ve lansman tablolarının daha sonra revize edilmesinin de standart nedenidir. Satıcılar kıyaslama versiyonlarını, komut istemi stratejilerini, örnekleme ayarlarını ve yeniden deneme politikalarını seçerler. Bunların hiçbiri dolandırıcılık değildir. Hepsi ölçek üzerinde bir ağırlıktır.

2. Çoğu kodlama satırı Claude Code arayüzünde çalıştırıldı. Bu gerçekten ilginç bir detay. Alibaba, kodlama kıyaslamalarının çoğunu Anthropic'in kendi aracı arayüzü olan Claude Code ile, Qwen 3.8-Max'i Anthropic uyumlu API'si aracılığıyla hedefleyerek çalıştırdı. Bir yandan, bu adil bir hamle: her modeli aynı yaygın olarak kullanılan araç içinde değerlendiriyor. Diğer yandan, bu "Qwen'in kodlama skorlarının" aslında "Anthropic'in arayüzündeki Qwen" skorları olduğu anlamına geliyor ve arayüz seçimi aracı sonuçlarını birkaç puan değiştirebilir. Ayrıca Alibaba'nın bu modelin pratikte nerede çalışmasını beklediği hakkında da bir şeyler söylüyor.

3. Birkaç kıyaslama Qwen'in kendi bünyesindedir. QwenSWEBench, QwenQoderBench, CoWorkBench ve RecreationBench'in hepsi Qwen ekibi tarafından inşa edildi. Şirket içi kıyaslamalar değersiz değildir; genellikle halka açık değerlendirmelerin gözden kaçırdığı yetenekleri incelerler. Ancak bir modelin kendi yapımcısının kıyaslamasında aldığı yüksek puan, SWE-bench Pro'daki yüksek puandan farklı bir kanıt türüdür ve tablo her ikisini de görsel bir ayrım olmaksızın yan yana sunar. Bu tablodan bir sayı alıntıladığınızda, önce hangi kategoriye ait olduğunu kontrol edin.

4. Fable 5 ile ilgili dipnot. Alibaba'nın kendi tablosunda "Fable5 sonuçları geri dönüşler içerebilir" şeklinde bir dipnot bulunmaktadır. Bu, en az bir rakibin sayılarının modelin düzgün çalışmasını yansıtmayabileceğine dair sessiz bir itiraftır. Teknik nedeni ne olursa olsun, bu, Qwen 3.8-Max'in en sık gerisinde kaldığı model olan Fable 5 sütununun, yayınlayanlar tarafından bir yıldız işaretiyle geldiği anlamına geliyor.

Bunların hiçbiri Alibaba'ya özgü değil. Anthropic, OpenAI ve Google'ın hepsi kendi metodolojik seçimleriyle kendi kendine çalıştırılan tablolar yayınlıyor. Kimi K3 kıyaslama analizimizde aynı deseni işaretledik ve orada da geçerliydi. Mesele Alibaba'nın hile yapması değil. Mesele, bir satıcı tablosunun bir iddia olması, bir ölçüm olmamasıdır.

Neleri izlemeli ve bir sonraki tabloyu nasıl okumalı

3 Ağustos 2026 itibarıyla, Qwen 3.8-Max'in bağımsız bir değerlendirmesi bulunmamaktadır. Yazıldığı sırada Artificial Analysis henüz sayıları yayınlamamıştı ve topluluk liderlik tablolarından hiçbiri modeli puanlamamıştı. Bu günler içinde değişecek ve Alibaba'nın tablosu ile bağımsız çalışmalar arasındaki farklar asıl hikaye olacak. Bunlar yayınlandığında bu gönderiyi güncelleyeceğiz.

O zamana kadar, herhangi bir satıcı kıyaslama tablosunu (bu da dahil) değerlendirmek için kısa bir kontrol listesi:

  1. Değerlendirmeyi kim yaptı? Rakipler için kendi bildirdiği sayılar, satıcının kendi modeli için kendi bildirdiği sayılardan daha fazla şüpheciliği hak eder.
  2. Hangi arayüz ve ayarlar? Aracı kıyaslamalar arayüze duyarlıdır. Arayüzünü adlandıran bir tablo (Alibaba'nın yaptığı gibi), adlandırmayan bir tablodan daha kullanışlıdır, ancak seçim yine de sonuçları şekillendirir.
  3. Satıcı hangi kıyaslamaları oluşturdu? Şirket içi değerlendirmeler bir şeyi ölçer, ancak halka açık olanlarla aynı şeyi değil.
  4. Dipnotları okuyun. "Geri dönüşler içerebilir" ifadesi küçük bir fontla çok şey anlatıyor.
  5. Eksik olanları kontrol edin. Bir satıcının yayınlamadığı satırlar, yayınladığı satırlar kadar bilgilendirici olabilir. Geçmişteki satıcı tabloları, modelin düşük performans gösterdiği kıyaslamaları sessizce düşürmüştür; hangi satırların kaybolduğunu tespit etmek için önceki neslin satıcılar arasında nasıl bir performans gösterdiğini karşılaştırın.
  6. İkinci kaynağı bekleyin. Bir haftalık sabır genellikle size bağımsız sayılar kazandırır.

Bunun yerine kendi değerlendirmenizi yapın

Kontrol listesi tabloları okumanıza yardımcı olur. Daha iyi bir hareket, onlara daha az ihtiyaç duymaktır. Qwen 3.8-Max şu anda Alibaba Cloud Model Studio'da (model ID qwen3.8-max, resmi modeller sayfasında listeleniyor) hem OpenAI uyumlu hem de Anthropic uyumlu bir API ile kullanılabilir ve gerçek istemlerinizi kullanan bir kıyaslama, kullanmayan herhangi bir halka açık değerlendirmeyi yener.

Apidog'da pratik bir kurulum şöyle görünür. Model Studio sohbet tamamlama uç noktasına qwen3.8-max ile bir istek ve mevcut temel modelinize (Qwen3.7-Max, Kimi K3 veya bir Claude veya GPT uç noktası olsun) karşı ikinci bir aynı istek oluşturun. Gerçek üretim istemlerinizden 20 ila 30 tanesini bir test senaryosu olarak kaydedin, gerçekten önemsediğiniz yanıt özelliklerine (geçerli JSON, gerekli alanların mevcut olması, eşiğinizin altında gecikme) ilişkin iddialar ekleyin ve her iki senaryoyu art arda çalıştırın. Apidog'un test raporları, Alibaba'nınki yerine kendi iş yükünüzde, model başına geçme oranlarını ve yanıt sürelerini yan yana verir.

Hazır el atmışken kontrol etmeniz gereken Qwen'e özgü iki şey: model varsayılan olarak reasoning_effort: xhigh olarak ayarlanmıştır, bu nedenle maliyet ve gecikmeyi gerçekten kullanacağınız efor seviyesinde ölçün ve eğer Anthropic uyumlu uç noktayı kullanmayı planlıyorsanız, bu protokol şeklini ayrı ayrı test edin, çünkü Alibaba'nın kendi kodlama kıyaslamalarının çoğu bunun üzerinden çalışmıştır. Apidog'u ücretsiz indirin, her iki uç noktayı da ortam olarak bağlayın ve bağımsız liderlik tabloları kendi sonuçlarını yayınlamadan önce kendi birinci taraf sayılarınıza sahip olacaksınız.

Sıkça Sorulan Sorular

Qwen 3.8 kıyaslama sayıları bağımsız olarak doğrulandı mı?

Hayır. 3 Ağustos 2026 itibarıyla, yayınlanan her sayı Alibaba'nın kendi tablosundan gelmektedir. Yazıldığı sırada Artificial Analysis ve topluluk liderlik tabloları henüz Qwen 3.8-Max'i puanlamamıştı. Bağımsız çalışmalar gelene kadar tabloyu satıcının iddiası olarak kabul edin.

Qwen 3.8-Max'in en iyi kıyaslama sonucu nedir?

PaperBench, 93.0 ile amiral gemisi tablosundaki en iyi satırıdır: GPT-5.6 Sol (90.5), Fable 5 (88.8) ve Opus 4.8'in (80.3) önünde. Çok modlu tabloda, MathVision (95.2) ve OCR satırları genel olarak en güçlü sonuçlarıdır.

Qwen 3.8-Max açıkça nerede kaybediyor?

HLE'de 43.6 puan alarak dört amiral gemisi arasında sonuncu ve Fable 5'in 53.3'ünün oldukça gerisinde kalıyor. SWE-bench Pro'da Fable 5'in 80.0'ına karşı 67.7 puan alıyor ve DeepSWE'de de geride kalıyor. Derin yazılım mühendisliği değerlendirmeleri ve geniş bilgi sınavları, Alibaba'nın kendi tablosundaki en zayıf alanlarıdır.

Qwen 3.8, Qwen 3.7-Max'ten kıyaslamalarda ne kadar daha iyi?

Alibaba'nın tablosundaki nesiller arası kazançlar büyük: Terminal Bench 2.1 74.5'ten 86.6'ya, SWE-bench Pro 60.6'dan 67.7'ye ve PaperBench 64.8'den 93.0'a yükseldi. Yükseltmenin iş yükünüz için değip değmeyeceği fiyat ve modaliteye de bağlıdır; Qwen 3.8 vs Qwen 3.7 karşılaştırmamız tüm kararı detaylıca ele alıyor.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin