Ollama & VLLM ile Qwen 3'ü Yerel Olarak Nasıl Çalıştırılır

Büyük dil modelleri (LLM) hızla gelişiyor. Qwen ekibi, yeni nesil LLM'leri Qwen3'ü tanıttı. Kodlama, matematik ve genel muhakemede etkileyici performans sunuyor.

Efe Demir

Efe Demir

1 October 2025

Ollama & VLLM ile Qwen 3'ü Yerel Olarak Nasıl Çalıştırılır

Kurumsal İçin Apidog

Şirket İçi (On-Premises) Dağıtım

SSO ve RBAC

SOC 2 Uyumlu

Apidog Enterprise'ı Keşfedin

Büyük dil modellerinin (LLM'ler) manzarası baş döndürücü bir hızla gelişiyor. Modeller daha güçlü, yetenekli ve en önemlisi daha erişilebilir hale geliyor. Qwen ekibi kısa süre önce, kodlama, matematik ve genel muhakeme dahil olmak üzere çeşitli kıyaslamalarda etkileyici performans sergileyen en yeni nesil LLM'leri olan Qwen3'ü tanıttı. Mixture-of-Experts (MoE) Qwen3-235B-A22B gibi amiral gemisi modelleri yerleşik devlerle ve hatta Qwen3-4B gibi daha küçük yoğun modellerin önceki nesil 72B parametre modelleriyle rekabet etmesiyle, Qwen3 önemli bir sıçramayı temsil ediyor.

Bu sürümün önemli bir yönü, iki MoE varyantı (Qwen3-235B-A22B ve Qwen3-30B-A3B) ve 0,6B'den 32B parametreye kadar değişen altı yoğun model dahil olmak üzere çeşitli modellerin açık ağırlıklandırılmasıdır. Bu açıklık, geliştiricileri, araştırmacıları ve meraklıları bu güçlü araçları keşfetmeye, kullanmaya ve bunlar üzerine inşa etmeye davet ediyor. Bulut tabanlı API'ler kolaylık sağlarken, gizlilik, maliyet kontrolü, özelleştirme ve çevrimdışı erişilebilirlik ihtiyaçları nedeniyle bu gelişmiş modelleri yerel olarak çalıştırma arzusu artıyor.

Neyse ki, yerel LLM yürütme için araç ekosistemi önemli ölçüde olgunlaştı. Bu süreci basitleştiren iki öne çıkan platform Ollama ve vLLM'dir. Ollama, çeşitli modellere başlamak için inanılmaz derecede kullanıcı dostu bir yol sunarken, vLLM, özellikle daha büyük modeller için verim ve verimlilik için optimize edilmiş yüksek performanslı bir hizmet çözümü sunar. Bu makale, Qwen3'ü anlamanız ve hem Ollama hem de vLLM'yi kullanarak bu güçlü modelleri yerel makinenizde kurmanız için size rehberlik edecektir.

💡
Harika bir API Test aracı mı arıyorsunuz? Harika API Dokümantasyonu oluşturur?

Geliştirici Ekibinizin birlikte maksimum verimlilikle çalışması için entegre, Hepsi Bir Arada bir platform mu istiyorsunuz?

Apidog tüm taleplerinizi karşılıyor ve Postman'in yerini çok daha uygun bir fiyata alıyor!
button

Qwen 3 ve Kıyaslamalar Nedir?

Qwen3, Qwen ekibi tarafından geliştirilen ve Nisan 2025'te yayınlanan üçüncü nesil büyük dil modellerini (LLM'ler) temsil eder. Bu yineleme, gelişmiş muhakeme yeteneklerine, Mixture-of-Experts (MoE) gibi mimari yenilikler aracılığıyla verimliliğe, daha geniş çok dilli desteğe ve çok çeşitli kıyaslamalarda iyileştirilmiş performansa odaklanarak önceki sürümlere göre önemli bir ilerlemeyi ifade eder. Sürüm, araştırma ve geliştirme için erişilebilirliği teşvik eden Apache 2.0 lisansı altında çeşitli modellerin açık ağırlıklandırılmasını içeriyordu.

Qwen 3 Model Mimarisi ve Varyantları, Açıklandı

Qwen3 ailesi, çeşitli hesaplama bütçelerine ve performans gereksinimlerine hitap eden hem geleneksel yoğun modelleri hem de seyrek MoE mimarilerini kapsar.

Yoğun Modeller: Bu modeller, çıkarım sırasında tüm parametrelerini kullanır. Temel mimari ayrıntıları şunları içerir:

Model Katmanlar Dikkat Başlıkları (Sorgu / Anahtar-Değer) Kelime Gömülülerini Bağla Maksimum Bağlam Uzunluğu
Qwen3-0.6B 28 16 / 8 Evet 32.768 belirteç (32K)
Qwen3-1.7B 28 16 / 8 Evet 32.768 belirteç (32K)
Qwen3-4B 36 32 / 8 Evet 32.768 belirteç (32K)
Qwen3-8B 36 32 / 8 Hayır 131.072 belirteç (128K)
Qwen3-14B 40 40 / 8 Hayır 131.072 belirteç (128K)
Qwen3-32B 64 64 / 8 Hayır 131.072 belirteç (128K)

Not: Grup Sorgu Dikkat (GQA), tüm modellerde kullanılır ve Sorgu ve Anahtar-Değer başlıklarının farklı sayısıyla gösterilir.

Mixture-of-Experts (MoE) Modelleri: Bu modeller, çıkarım sırasında her belirteç için yalnızca bir "uzman" İleri Beslemeli Ağ (FFN) alt kümesini etkinleştirerek seyreklikten yararlanır. Bu, daha küçük yoğun modellere daha yakın hesaplama maliyetlerini korurken büyük bir toplam parametre sayısına izin verir.

Model Katmanlar Dikkat Başlıkları (Sorgu / Anahtar-Değer) # Uzmanlar (Toplam / Etkinleştirilmiş) Maksimum Bağlam Uzunluğu
Qwen3-30B-A3B 48 32 / 4 128 / 8 131.072 belirteç (128K)
Qwen3-235B-A22B 94 64 / 4 128 / 8 131.072 belirteç (128K)

Not: Her iki MoE modeli de toplam 128 uzman kullanır, ancak belirteç başına yalnızca 8'ini etkinleştirir, bu da eşdeğer boyutta bir yoğun modele kıyasla hesaplama yükünü önemli ölçüde azaltır.

Qwen 3 Temel Teknik Özellikleri

Hibrit Düşünme Modları: Qwen3'ün belirgin bir özelliği, kullanıcı tarafından kontrol edilebilen iki farklı modda çalışabilmesidir:

Kapsamlı Çok Dilli Destek: Qwen3 modelleri, büyük dil ailelerinde (Hint-Avrupa, Sino-Tibet, Afro-Asyatik, Avustronezya, Dravid, Türk vb.) 119 dil ve lehçeyi destekleyen çeşitli bir korpus üzerinde önceden eğitilmiştir ve bu da onları çok çeşitli küresel uygulamalar için uygun hale getirir.

Gelişmiş Eğitim Yöntemleri:

  1. Uzun CoT Soğuk Başlangıç: Temel muhakeme yetenekleri oluşturmak için matematik, kodlama, mantıksal muhakeme ve STEM'i kapsayan çeşitli uzun Zincir-Düşünce (CoT) verileri üzerinde denetimli ince ayar (SFT).
  2. Muhakemeye Dayalı Takviyeli Öğrenme (RL): Özellikle muhakeme görevleri için keşif ve sömürmeyi geliştirmek üzere kural tabanlı ödüller kullanarak RL için hesaplama kaynaklarını ölçeklendirme.
  3. Düşünme Modu Füzyonu: Muhakeme geliştirilmiş modeli, uzun CoT verilerinin ve Aşama 2 modeli tarafından oluşturulan standart talimat ayarlama verilerinin bir karışımı üzerinde ince ayar yaparak düşünmeyen yetenekleri entegre etme. Bu, derin muhakemeyi hızlı yanıt üretimiyle birleştirir.
  4. Genel RL: Genel davranışları iyileştirmek ve istenmeyen çıktıları azaltmak için çok sayıda genel etki alanı görevi (talimat takibi, biçim uyumu, aracı yetenekleri) genelinde RL uygulamak.

Qwen 3 Kıyaslama Performansı

Qwen3, diğer önde gelen çağdaş modellere karşı oldukça rekabetçi bir performans sergiliyor:

Amiral Gemisi MoE: Qwen3-235B-A22B modeli, kodlama, matematik ve genel yetenekleri değerlendiren çeşitli kıyaslamalarda DeepSeek-R1, Google'ın o1 ve o3-mini, Grok-3 ve Gemini-2.5-Pro gibi üst düzey modellerle karşılaştırılabilir sonuçlar elde ediyor.

Daha Küçük MoE: Qwen3-30B-A3B modeli, çıkarım sırasında parametrelerin yalnızca bir kısmını (3B'ye karşı 32B) etkinleştirmesine rağmen, MoE mimarisinin verimliliğini vurgulayarak QwQ-32B gibi modellerden önemli ölçüde daha iyi performans gösterir.

Yoğun Modeller: Mimari ve eğitimdeki gelişmeler nedeniyle, Qwen3 yoğun modelleri genellikle daha büyük Qwen2.5 yoğun modellerinin performansına uyar veya onları aşar. Örneğin:

MoE Verimliliği: Qwen3 MoE temel modelleri, parametrelerin yalnızca ~%10'unu etkinleştirirken önemli ölçüde daha büyük Qwen2.5 yoğun modelleriyle karşılaştırılabilir performans elde eder ve hem eğitimde hem de çıkarımda önemli tasarruflara yol açar.

Bu kıyaslama sonuçları, Qwen3'ün hem yüksek performans hem de özellikle MoE varyantlarıyla geliştirilmiş hesaplama verimliliği sunan son teknoloji bir model ailesi olarak konumunu vurgulamaktadır. Modeller, Hugging Face, ModelScope ve Kaggle gibi standart platformlar aracılığıyla kullanılabilir ve yerel yürütme dahil olmak üzere çeşitli iş akışlarına ve uygulamalara entegrasyonlarını kolaylaştıran Ollama, vLLM, SGLang, LMStudio ve llama.cpp gibi popüler dağıtım çerçeveleri tarafından desteklenmektedir.

Ollama ile Qwen 3'ü Yerel Olarak Nasıl Çalıştırılır

Ollama, LLM'leri yerel olarak indirme, yönetme ve çalıştırma kolaylığı nedeniyle büyük popülerlik kazanmıştır. Karmaşıklığın çoğunu soyutlayarak bir komut satırı arayüzü ve bir API sunucusu sağlar.

1. Kurulum:
Ollama'yı kurmak genellikle basittir. Resmi Ollama web sitesini (ollama.com) ziyaret edin ve işletim sisteminiz (macOS, Linux, Windows) için indirme talimatlarını izleyin.

2. Qwen3 Modellerini Çekme:
Ollama, hazır modellerden oluşan bir kitaplık tutar. Belirli bir Qwen3 modelini çalıştırmak için ollama run komutunu kullanırsınız. Model yerel olarak mevcut değilse, Ollama onu otomatik olarak indirir. Qwen ekibi, çeşitli Qwen3 varyantlarını doğrudan Ollama kitaplığında kullanıma sundu.

Ollama web sitesinin Qwen3 sayfasında (örneğin, ollama.com/library/qwen3) mevcut Qwen3 etiketlerini bulabilirsiniz. Yaygın etiketler şunları içerebilir:

Örneğin, 4B parametre modelini çalıştırmak için terminalinizi açın ve şunu yazın:

ollama run qwen3:4b

Bu komut, modeli (gerekirse) indirecek ve etkileşimli bir sohbet oturumu başlatacaktır.

3. Model ile Etkileşim:
ollama run komutu etkinleştirildikten sonra, istemlerinizi doğrudan terminale yazabilirsiniz. Ollama ayrıca, OpenAI standardıyla uyumlu bir API sunan yerel bir sunucu (genellikle http://localhost:11434 adresinde) başlatır. Bunu, curl veya Python, JavaScript vb. çeşitli istemci kitaplıkları gibi araçları kullanarak programlı olarak etkileşimde bulunabilirsiniz.

4. Donanım Hususları:
LLM'leri yerel olarak çalıştırmak önemli kaynaklar gerektirir.

Ollama, özellikle tüketici sınıfı donanımda (sınırlar dahilinde) hızlı başlangıç, yerel geliştirme, deneme ve tek kullanıcılı sohbet uygulamaları için mükemmeldir.

Ollama'yı vLLM ile Yerel Olarak Nasıl Çalıştırılır

vLLM, çıkarım hızını ve bellek verimliliğini önemli ölçüde artırmak için PagedAttention gibi optimizasyonlar kullanan, yüksek verimli bir LLM hizmet kitaplığıdır ve bu da onu talepkar uygulamalar ve daha büyük modellere hizmet vermek için ideal hale getirir. vLLM ekibi, Qwen3'ün piyasaya sürülmesinden itibaren 0. Gün desteği dahil olmak üzere yeni mimariler için mükemmel destek sağlar.

1. Kurulum:
vLLM'yi pip kullanarak kurun. Genellikle bir sanal ortam kullanmanız önerilir:

pip install -U vllm

Gerekli önkoşullara sahip olduğunuzdan emin olun, genellikle uygun bir CUDA araç takımı yüklü uyumlu bir NVIDIA GPU. Belirli gereksinimler için vLLM belgelerine bakın.

2. Qwen3 Modellerine Hizmet Verme:
vLLM, bir modeli yüklemek ve OpenAI uyumlu bir API sunucusu başlatmak için vllm serve komutunu kullanır. Qwen ekibi ve vLLM belgeleri, Qwen3'ü çalıştırma konusunda rehberlik sağlar.

Sağlanan bilgilere ve yaygın vLLM kullanımına dayanarak, büyük Qwen3-235B MoE modeline FP8 nicemlemesi (azaltılmış bellek kullanımı için) ve 4 GPU arasında tensör paralelliği kullanarak nasıl hizmet verebileceğiniz aşağıdadır:

vllm serve Qwen/Qwen3-235B-A22B-FP8 \
    --enable-reasoning \
    --reasoning-parser deepseek_r1 \
    --tensor-parallel-size 4

Bu komutu inceleyelim:

Bu komutu diğer Qwen3 modelleri (örneğin, Qwen/Qwen3-30B-A3B veya Qwen/Qwen3-32B) için uyarlayabilir ve donanımınıza göre tensor-parallel-size gibi parametreleri ayarlayabilirsiniz.

3. vLLM Sunucusu ile Etkileşim:
vllm serve çalıştıktan sonra, OpenAI API spesifikasyonunu yansıtan bir API sunucusuna (varsayılan olarak http://localhost:8000) ev sahipliği yapar. Standart araçları kullanarak onunla etkileşimde bulunabilirsiniz:

curl http://localhost:8000/v1/completions \
    -H "Content-Type: application/json" \
    -d '{
        "model": "Qwen/Qwen3-235B-A22B-FP8", # Hizmet verdiğiniz model adını kullanın
        "prompt": "LLM'lerde Mixture-of-Experts kavramını açıklayın.",
        "max_tokens": 150,
        "temperature": 0.7
    }'
from openai import OpenAI

# Yerel vLLM sunucusuna işaret edin
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

completion = client.completions.create(
  model="Qwen/Qwen3-235B-A22B-FP8", # Hizmet verdiğiniz model adını kullanın
  prompt="Müzik keşfeden bir robot hakkında kısa bir hikaye yazın.",
  max_tokens=200
)
print(completion.choices[0].text)

4. Performans ve Kullanım Durumları:
vLLM, yüksek verim (saniye başına birçok istek) ve düşük gecikme süresi gerektiren senaryolarda parlar. Optimizasyonları onu şunlar için uygun hale getirir:

Apidog ile Ollama Yerel API'sini Test Etme

Apidog, Ollama'nın API moduyla iyi eşleşen bir API test aracıdır. İstek göndermenize, yanıtları görüntülemenize ve Qwen 3 kurulumunuzu verimli bir şekilde hata ayıklamanıza olanak tanır.

Apidog'u Ollama ile kullanma şekli:

Akış Yanıtları:

curl http://localhost:11434/api/generate -d '{"model": "gemma3:4b-it-qat", "prompt": "AI hakkında bir şiir yazın.", "stream": true}'

Bu işlem, modelinizin beklendiği gibi çalıştığından emin olur ve Apidog'u değerli bir ek yapar.

Sonuç

Güçlü ve çeşitli Qwen3 model ailesinin piyasaya sürülmesi, Ollama ve vLLM gibi olgun yerel yürütme araçlarıyla birleştiğinde, yapay zeka uygulayıcıları için heyecan verici bir zamanı işaret ediyor. İster kişisel kullanım ve denemeler için Ollama'nın tak ve çalıştır basitliğine, ister sağlam uygulamalar oluşturmak için vLLM'nin yüksek performanslı hizmet yeteneklerine öncelik verin, son teknoloji LLM'leri yerel olarak çalıştırmak her zamankinden daha mümkün.

Qwen3-30B-A3B'yi ve hatta daha büyük yoğun varyantları kendi donanımınıza getirerek, benzeri görülmemiş kontrol, gizlilik ve maliyet etkinliği elde edersiniz. Yenilikçi projeler için hibrit düşünme ve kapsamlı çok dilli destek gibi gelişmiş özelliklerinden yararlanabilirsiniz. Donanım ve yazılım ekosistemleri gelişmeye devam ettikçe, büyük dil modellerinin gücü giderek daha fazla demokratikleşecek ve uzak bulut sunucularından doğrudan yerel makinelerimize taşınacaktır. Bu yerel yapay zeka devriminin ön saflarını deneyimlemek için Ollama ve vLLM'yi kullanarak Qwen3'ü deneyin.

💡
Harika bir API Test aracı mı arıyorsunuz? Harika API Dokümantasyonu oluşturur?

Geliştirici Ekibinizin birlikte maksimum verimlilikle çalışması için entegre, Hepsi Bir Arada bir platform mu istiyorsunuz?

Apidog tüm taleplerinizi karşılıyor ve Postman'in yerini çok daha uygun bir fiyata alıyor!
button

Explore more

Fathom-R1-14B: Hindistan'dan Gelişmiş Yapay Zeka Muhakeme Modeli

Fathom-R1-14B: Hindistan'dan Gelişmiş Yapay Zeka Muhakeme Modeli

Yapay zeka hızla gelişiyor. FractalAIResearch/Fathom-R1-14B, 14.8 milyar parametreyle matematik ve genel akıl yürütmede başarılı.

5 June 2025

Mistral Code: İşletmeler için En Özelleştirilebilir Yapay Zeka Destekli Kodlama Asistanı

Mistral Code: İşletmeler için En Özelleştirilebilir Yapay Zeka Destekli Kodlama Asistanı

Mistral Code'u keşfedin: Kurumsal kullanıma özel, en özelleştirilebilir yapay zeka destekli kodlama asistanı.

5 June 2025

Claude Code'un 2026'te Yapay Zeka Kodlamasını Nasıl Dönüştürdüğü

Claude Code'un 2026'te Yapay Zeka Kodlamasını Nasıl Dönüştürdüğü

Claude Code, 2026'te yapay zeka destekli kodlamayı nasıl devrimleştiriyor? Özelliklerini, kullanımını ve Windsurf kısıtlamalarından sonra neden popüler olduğunu öğrenin. Geliştiriciler için okunması gereken!

5 June 2025

API Tasarım-Öncelikli Yaklaşımı Apidog'da Uygulayın

API'leri oluşturmanın ve kullanmanın daha kolay yolunu keşfedin