Qwen 3.8 Kodlama için: 16 Günlük Otonom Çalışmalar ve Claude Kod Entegrasyonu

Qwen 3.8-Max kodlama için: Alibaba'nın 16 günlük otonom çalışması, kıyaslama sonuçları ve Claude Code, Codex, Qoder, Qwen Code ve OpenClaw için resmi yapılandırmalar.

Ashley Innocent

Ashley Innocent

3 August 2026

Qwen 3.8 Kodlama için: 16 Günlük Otonom Çalışmalar ve Claude Kod Entegrasyonu

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Çoğu model lansmanı, kodlama yeteneğini aynı şekilde sunar: işte HumanEval puanımız, işte modelin ikili arama yazan bir kodu. Alibaba, Qwen 3.8-Max ile farklı bir yol izledi. İddia "iyi fonksiyonlar yazıyor" değil. İddia, haftalarca kendi başına bir yazılım projesini yürütebilmesi: sorunları açması, pull request'leri birleştirmesi ve insan müdahalesi olmadan özellikler göndermesi.

Bu cesur bir iddia ve incelemeyi hak ediyor. Bu makale, Alibaba'nın lansmanda yayınladığı üç kodlama tanıtımını (tümü satıcı demoları, biri denetleyebileceğiniz halka açık bir depoyla birlikte), bunların arkasındaki kodlama kıyaslama sayılarını ve ardından bugün harekete geçebileceğiniz kısmı anlatıyor: qwen3.8-max ile Claude Code, Codex, Qoder, Qwen Code ve OpenClaw'da gerçekte nasıl kod yazılacağını ve oluşturduğunuz kodun API çıktısını nasıl test edeceğinizi.

Modelin kendisine yeni başlıyorsanız, Qwen 3.8'in ne olduğuna ilişkin genel bakışla başlayın: toplam 2.4T parametre, 95B aktif, 1M token bağlam penceresi ve lansmandan sonraki hafta için açık ağırlıklar vaat ediliyor. Burada kodlama hikayesine odaklanacağız. Aşağıdaki her şey, 3 Ağustos 2026 itibarıyla durumun bir yansımasıdır.

button

Alibaba'nın Aslında İddia Ettiği Şey

Resmi Qwen 3.8 sürüm gönderisindeki çerçeve, kod parçacıkları üzerindeki otonomidir. Alibaba, Qwen 3.8-Max'i uzun vadeli bir mühendislik görevini aklında tutabilen bir model olarak konumlandırıyor: işi planlamak, günler boyunca yürütmek, kendi hatalarından kurtulmak ve sonunda incelenebilir bir şey teslim etmek.

Üç şey, bu iddiayı olağan lansman günü pazarlamasından daha ilginç kılıyor:

  1. Demolar uzun. On altı gün, 20 dakikalık bir aracı kıyaslamasından farklı bir rejim. Hata kurtarma, bağlam yönetimi ve kayma, bu ölçekte çok daha fazla önem taşır.
  2. Bir demo halka açık. Depoyu inceleyebilir, commit'leri okuyabilir ve kod kalitesini kendiniz değerlendirebilirsiniz. Çoğu satıcı tanıtımı bunu sunmaz.
  3. Deney düzeneği bir rakibin. Alibaba, kodlama kıyaslamalarının çoğunu Claude Code deney düzeneğiyle çalıştırdı ve sizin de aynısını yapabilmeniz için resmi bir yapılandırma yayınladı. Aşağıda daha fazlası.

Standart uyarı ve bu makalenin tamamı için geçerlidir: Buradaki her sayı Alibaba'nın kendi lansman materyallerinden alınmıştır. Ağustos 2026 başı itibarıyla henüz bağımsız bir doğrulama bulunmamaktadır. Tanıtımları demolar olarak değerlendirin, denetim olarak değil.

Üç Kodlama Tanıtımı

oh-my-cli: 16 Günlük Otonom Geliştirme

Manşet demosu. Alibaba, Qwen 3.8-Max'i bir komut satırı aracı oluşturması için serbest bıraktı ve gözetimsiz çalışmasına izin verdi. 30 Temmuz itibarıyla, çalışma 16 gündür devam ediyordu ve modelin kendisi tarafından açılan, üzerinde çalışılan ve kapatılan 265 commit, 127 pull request ve 151 sorun üretti.

Depo, qwen-code-dev-bot/oh-my-cli adresinde halka açıktır ve tüm tanıtımın en kullanışlı kısmıdır. Commit sayısına körü körüne güvenmek zorunda değilsiniz. PR açıklamalarını okuyabilir, sorunların gerçek hatalar mı yoksa oyalayıcı işler mi olduğunu kontrol edebilir ve kodun sağlam olup olmadığını görebilirsiniz. İnsan incelemesi olmadan bir modelden 16 günlük çıktı, kalite hakkında ne sonuç çıkarırsanız çıkarın, gerçekten nadir bir eserdir.

Denetlerken nelere dikkat etmelisiniz: PR'ların gerçekten atıfta bulundukları sorunları düzeltip düzeltmediği, modelin kapatmak için yapay işler yaratıp yaratmadığı ve kendi regresyonlarını nasıl ele aldığı. Bu modeller, herhangi bir tek kıyaslama skorundan daha fazla uzun vadeli güvenilirlik hakkında bilgi verir.

Makale Çoğaltma Çalışması: Uygulama Kodu Değil, Araştırma Kodu

İkinci demo, daha zor bir kodlama sınıfını hedefliyor: sıfırdan bir makine öğrenimi araştırma makalesini çoğaltmak. Alibaba'nın verilerine göre, çalışma yaklaşık 125 saat sürdü, yaklaşık 7.600 satır kod üretti ve yol boyunca 33 GPU eğitim turu gerçekleştirdi.

Sonuç: model, makalenin 6 bulgusunu çoğalttı, ardından bir adım daha ileri giderek makalenin AIME24'teki rapor edilen sonucunu 2.7 puan geride bıraktı. Araştırma çoğaltması, acımasız bir iştir. Ortamlar bozulur, hiperparametreler dipnotlarda saklanır ve tek bir sessiz hata, saatler sonra öğrendiğiniz bir eğitim çalışmasını geçersiz kılar. 33 eğitim turunu tamamlayıp eşleşen sayılarla çıkan bir model, otomatik tamamlama ötesinde bir şeyler yapıyor demektir.

Bu demo, Qwen 3.8-Max'in en güçlü kıyaslama satırı olan PaperBench ile eşleşir, aşağıda ele alınmıştır.

Tianchi Yarışması: İnsan Ekiplerine Karşı 24 Saat

Üçüncü tanıtım, modeli Alibaba'nın Tianchi platformunda 24 saatlik bir zaman sınırı olan canlı bir veri bilimi yarışmasına soktu. Model, bu süre içinde 45 gönderim yaptı, her seferinde yaklaşımını yineledi ve son doğruluk oranı 0.853 ile bitirdi. Bu, yarışan 526 insan ekibinin 458'inin önüne geçti.

Bu sonucun şeklini belirtmekte fayda var: model kazanmadı. Yarışmacıların %87'sini geride bıraktı, ki bu aynı anda hem etkileyici hem de dürüsttü. Ayrıca diğer iki demonun göstermediği bir yeteneği de gösteriyor: her gönderinin puanının bir sonraki denemeyi beslediği, bir zaman sınırı altında hızlı yineleme.

Burada ekstra güçle geçerli olan bir uyarı daha var: Tianchi, Alibaba'nın kendi platformudur. Demo gerçek, ancak satıcı mekanı kontrol ediyordu.

Demoların Arkasındaki Kodlama Kıyaslamaları

Alibaba, lansmanda tam bir kıyaslama tablosu yayınladı. İşte kodlamayla ilgili satırlar, dürüst kısımları bırakılarak. Tüm sayılar Alibaba'nın kendi çalıştırmalarıdır.

Kıyaslama Qwen 3.8-Max En iyi rakip (Alibaba'nın tablosuna göre)
Terminal Bench 2.1 86.6 88.8 (GPT-5.6 Sol)
SWE-bench Pro 67.7 80.0 (Fable 5)
PaperBench 93.0 90.5 (GPT-5.6 Sol)

Üç çıkarım:

Şimdi çoğu haberin atlayacağı ince detay: Alibaba, rakip modeller için yapılan çalıştırmalar da dahil olmak üzere bu kodlama kıyaslamalarının çoğunu Claude Code deney düzeneğinde çalıştırdı ve tablonun dipnotları, Fable 5 sonuçlarının geri dönüşleri içerebileceğini belirtiyor. Deney düzeneği seçimi, ajan kıyaslama skorlarını önemli ölçüde etkiler, bu nedenle belirli bir deney düzeneğinde satıcı tarafından çalıştırılan bir tablo, bir veri noktasıdır, bir hüküm değil.

Claude Code detayı iki yönlüdür. Bu, Alibaba'nın zaten kullanıyor olabileceğiniz deney düzeneği için optimize ettiği ve bunu kanıtlamak için yapılandırmayı yayınladığı anlamına geliyor.

Bugün Qwen 3.8 ile Gerçekten Nasıl Kod Yazılır?

İşte pratik kısım. Qwen 3.8-Max, Alibaba Cloud Model Studio'da Genel Kullanıma Açıktır ve Alibaba, lansmanda beş kodlama aracı için resmi yapılandırmalar yayınladı. Hepsi için bir DashScope API anahtarına (home.qwencloud.com adresinden) ihtiyacınız var. Fiyatlandırma, resmi Model Studio fiyatlandırma sayfasında belirtildiği gibi, 1M bağlam boyunca sabit olarak, milyon giriş tokeni başına 2 ABD Doları ve milyon çıktı tokeni başına 6 ABD Doları'dır.

Claude Code

Model, Anthropic uyumlu bir API uç noktası ile birlikte gelir, bu nedenle Claude Code'u ona yönlendirmek için üç ortam değişkeni gerekir:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max

Claude Code'u normal şekilde başlatın ve her isteği Claude yerine Qwen 3.8-Max'e yönlendirecektir. Alibaba'nın kodlama kıyaslamalarını tam da bu deney düzeneğinde çalıştırdığı göz önüne alındığında, ölçülen ile deneyimleyeceğiniz arasındaki en az farka sahip yapılandırma budur.

Codex

Codex, yapılandırmasında bir sağlayıcı girişi gerektirir. Resmi belgelerden taslak:

model = "qwen3.8-max"
model_provider = "qwencloud"

[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000

Bu, Anthropic yerine OpenAI uyumlu uç noktayı kullanır. Aynı model, aynı anahtar, farklı protokol şekli.

Qoder, Qwen Code ve OpenClaw

Kalan üçü daha hızlı özetlenebilir:

Tüm beş yapılandırma lansman gönderisinde yer almaktadır, bu yüzden bir blog anlık görüntüsüne bağlı kalmak yerine oradan tam güncel sürümü alın.

Muhakeme Çabasını Bilinçli Olarak Ayarlayın

Qwen 3.8-Max, üç seviyeli bir reasoning_effort parametresini destekler: xhigh (varsayılan), medium ve low. Kodlama için bu ayar, çoğu ayardan daha önemlidir:

Unutmayın ki düşünme tokenleri, milyon başına 6 ABD Doları olarak çıktı tokenleri olarak faturalandırılır ve xhigh varsayılandır. Tam çabayla uzun bir ajan oturumu gerçek paraya mal olur; xhigh'da mekanik bir düzenleme fayda sağlamadan maliyet getirir.

Eğer Qwen 3.8-Max, görevinizin ihtiyacından daha fazla bir modelse, önceki Qwen3 Coder serisi hala özel kodlama işleri için mevcuttur ve Qwen3 Coder Flash hızlı ve ucuz ucunu kapsar. Bu alandaki diğer açık ağırlıklı ağır sıklet için, Kimi K3'ün kodlama işini nasıl ele aldığını görün.

Modelin Oluşturduklarını Test Etme: Apidog Adımı

İşte Alibaba'nınki de dahil olmak üzere her otonom kodlama demosundaki eksiklik: model, API'leri çağıran kod yazar ve kimse bu çağrıları doğrulama hakkında konuşmaz. Bir ajan, temiz bir şekilde derlenen 7.600 satır kod üretebilir ve yine de yanlış uç noktaya çarpabilir, bir 429'u yanlış ele alabilir veya üretimde doğrulamayı geçemeyen bir istek gövdesi gönderebilir.

İki alışkanlık bu boşluğu kapatır.

Oluşturduğunuz kodun çağırdığı uç noktaları test edin. Qwen 3.8-Max bir hizmeti iskelet haline getirdiğinde veya bir API istemcisi yazdığında, ilgili spesifikasyonu Apidog'a aktarın ve uç noktaları doğrudan çalıştırın: yetkilendirme akışları, hata yanıtları, uç durumdaki yükler. Yanlış bir varsayımı bir test çalıştırmasında bulmak, otonom bir oturumun iki günündeki bir yığın izinde bulmaktan çok daha ucuzdur. Modelin API'sini taahhüt etmeden önce değerlendiriyorsanız, Qwen 3.8 API kılavuzu çift OpenAI ve Anthropic protokol kurulumunu ayrıntılı olarak kapsar ve Apidog, akış yanıtları ve muhakeme farkları dahil olmak üzere her iki protokol şeklini yan yana incelemek için uygun bir yerdir.

Ajan çalıştırmalarının üretime gitmemesi için API'leri sahteleştirin (mock). Bu, çalıştırmalarınız uzadıkça daha önemli hale gelir. Canlı aramalar yapan 16 günlük otonom bir oturumun üretim altyapısına karşı yapılması gerçekten kötü bir fikirdir: hız sınırları, veri değişiklikleri, sürpriz faturalar. Apidog'daki sahte sunucular, ajanlara gerçek sistemlere dokunmadan gerçekçi yanıtlar verir. Çalışma sırasında oluşturulan kodu sahte URL'ye yönlendirin, insan çıktıyı inceledikten sonra gerçek temel URL'yi değiştirin. Birkaç dakika içinde bir sahte sunucu kurmak için Apidog'u ücretsiz indirin; gözetimsiz bir ajan çalıştırmasının sahip olabileceği en ucuz sigortadır.

Desen genelleniyor: bir kodlama modeline ne kadar özerklik verirseniz, API katmanı kontrol yüzeyiniz o kadar fazla olur. Her commit'i gerçek zamanlı olarak inceleyemezsiniz, ancak kodun neyle konuşmasına izin verildiğini kontrol edebilirsiniz.

Sıkça Sorulan Sorular

Qwen 3.8 kodlama için iyi mi?

Alibaba'nın kendi verilerine göre, ajan tabanlı ve araştırma tarzı kodlamada (Terminal Bench 2.1'de 86.6, PaperBench'te 93.0) güçlüdür ve repository ölçekli hata düzeltmede (SWE-bench Pro'da 67.7, Fable 5'in 80.0'ine kıyasla) orta düzeydedir. Tüm sayılar, henüz bağımsız bir doğrulama olmaksızın satıcı tarafından çalıştırılmıştır. Dürüst okuma: uzun vadeli otonom çalışmalar için mükemmel, klasik sorun giderme için lider değil.

Qwen 3.8'i Claude Code'da kullanabilir miyim?

Evet, resmi olarak. ANTHROPIC_BASE_URL'i https://dashscope-intl.aliyuncs.com/apps/anthropic, ANTHROPIC_AUTH_TOKEN'i DashScope anahtarınıza ve ANTHROPIC_MODEL'i qwen3.8-max olarak ayarlayın. Alibaba bu yapılandırmayı kendisi yayınladı ve kodlama kıyaslamalarının çoğunu Claude Code deney düzeneğinde çalıştırdı.

Qwen 3.8 ile kodlama ne kadara mal olur?

Milyon giriş tokeni başına 2 ABD Doları ve milyon çıktı tokeni başına 6 ABD Doları, 1M bağlam boyunca sabit. Düşünme tokenleri çıktı olarak faturalandırılır ve varsayılan xhigh muhakeme çabası bunlardan bolca üretir, bu nedenle ajan oturumları için ilan edilen fiyatın üzerinde bütçe ayırın. Tam maliyet hesaplaması ve karşılaştırmaları Qwen 3.8 kıyaslama analizi ve orada bağlantılı fiyatlandırma kapsamındadır.

16 günlük oh-my-cli çalışması gerçekten otonom muydu?

Bu Alibaba'nın iddiası ve çoğu satıcı demosunun aksine eseri kontrol edebilirsiniz: depo, 30 Temmuz 2026 itibarıyla 265 commit, 127 PR ve 151 sorunla qwen-code-dev-bot/oh-my-cli adresinde halka açıktır. Kod kalitesinin bu çerçeveyi haklı çıkarıp çıkarmadığı, okuyarak kendi kararınızı verebileceğiniz bir yargıdır, ki bu da bu tanıtımı bir ekran görüntüsünden daha güvenilir kılan şeydir.

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin