Qwen 3.8-Max Tanıtıldı: Otonom Kodlama, Uzun Ufuklu Ajanlar ve 2.4 Trilyon Parametre

Paylaş:
Qwen 3.8-Max Tanıtıldı: Otonom Kodlama, Uzun Ufuklu Ajanlar ve 2.4 Trilyon Parametre - blog yazısı görseli
Özet

Alibaba Cloud, 2.4 trilyon parametreli (95B aktif) Qwen 3.8-Max modelini tanıttı. Otonom kodlama, 10+ günlük kendini geliştiren sistemler, çip tasarımı ve açık kaynak hamlesiyle yapay zeka ajanlarında yeni bir bar belirleniyor.

Alibaba Cloud Qwen ekibi, bugüne kadar geliştirdikleri en gelişmiş amiral gemisi modeli olan Qwen 3.8-Max'i resmen duyurdu. Bu lansman aynı zamanda yapay zeka dünyasında tarihi bir kırılmaya da işaret ediyor: Alibaba, ilk kez Qwen-Max sınıfı devasa bir modelin açık kaynak ağırlıklarını (open weights) önümüzdeki hafta yayınlayacağını bildirdi.

Qwen 3.5 mimari temeli üzerine inşa edilen Qwen 3.8-Max, 2.4 trilyon toplam parametreye ve 95 milyar aktif parametreye (MoE mimarisi) sahip. Model; kod yazma, karmaşık iş otomasyonu, bilimsel araştırma ve günlerce süren uzun ufuklu (long-horizon) otonom görevlerde uçtan uca güvenilir sonuçlar üretmek üzere tasarlandı.

Artık QwenCloud üzerinden API aracılığıyla erişilebilen Qwen 3.8-Max'in öne çıkan mimari yeteneklerini, otonom kodlama testlerini ve endüstriyel başarılarını tüm detaylarıyla inceliyoruz.

1. Otonom Kodlamada Yeni Bir Bar: Kendi Kendini Geliştiren Sistemler

Üst seviye yapay zeka modelleri için kodlama, artık sadece istenen bir fonksiyonu yazmaktan çok daha öteye geçti. Günümüz dünyasında gerçek bir yazılım ajanı; boş bir klasörden başlayan, günlerce süren ve insan müdahalesi gerektirmeyen projeleri kendi başına bitirebilmeli, hata ve geri bildirim döngülerinden öğrenerek kendisini geliştirebilmelidir.

Qwen 3.8-Max, sıfır insan yardımıyla tamamen kendi yazdığı ve çalıştırdığı kodlarla üç zorlu otonom senaryoda test edildi:

A. 10+ Günlük Otonom Kodlama: Self-Evolving Harness (oh-my-cli)

Qwen 3.8-Max'ten sıfırdan oh-my-cli adlı bir projeyi oluşturması ve 10 günden uzun süren otonom bir süreçte kendi kendini geliştiren bir mühendislik harness'ı kurması istendi.
  • Döngü Mühendisliği (Loop Engineering): Görev durum makinesi (issue state machine), dağıtıcı (dispatcher), izleyici ve watchdog bileşenlerini tek bir yürütme döngüsünde birleştirdi. GitHub Issues'a giren yeni bir talep, agent tarafından devralındı (readyleasedactive), kod yazıldı, E2E testleri ve CI denetimleri çalıştırıldı ve başarılı olan PR'lar otomatik merge edildi.
  • Kendi Kendini Test Etme: Her güncellemede Build, Unit Test, E2E ve Desktop Lifecycle doğrulamaları tetiklendi. Hatalı durumlar ilgili issue ve PR'lara otomatik yönlendirilerek kendini tamir etti.
  • Çok Kaynaklı Evrim: Kullanıcı ve topluluk geri bildirimlerini çalıştırılabilir işlere dönüştürerek /goal, /resume, dinamik iş akışları, oturum yeniden oynatma ve masaüstü yeteneklerini otonom geliştirdi.

Yaklaşık 16 günlük tam otonom çalışma sonucunda repository'de 265 commit, 127 PR ve 151 issue başarıyla tamamlandı. Tüm süreç public olarak qwen-code-dev-bot/oh-my-cli deposunda yayınlandı.

B. Araştırma Makalesini Sıfırdan İnceleme, Kodlama ve Geliştirme

Qwen 3.8-Max'e yalnızca bir PDF araştırma makalesi ("Unified Data Selection for LLM Reasoning") ve bir grup GPU verildi. Modelden makaledeki tüm deneyleri sıfırdan kodlaması, ardından yöntemi kendi fikirleriyle geliştirmesi istendi.

1. Sıfırdan Yeniden İnşa (37 Saat): Başlangıç kodu olmadan veri işleme betiklerini, eğitim hatlarını ve değerlendirme düzeneklerini sıfırdan yazdı. 7.600 satırdan fazla kod yazarak Qwen3-8B modelini defalarca ince ayarladı ve AIME24 benchmark'ında rastgele seçime kıyasla +%7.7 kazancı doğruladı. 2. Kendi Kendini İyileştiren Araştırma Döngüsü (88 Saat): 5 gün (125 saat) boyunca kesintisiz çalışan model; hipotez kurma, kod yazma, GPU eğitimi ve analiz adımlarını 4 turda 18 farklı geliştirme fikriyle yineledi. Sonuçta makalenin orijinal yöntemini AIME24 matematik yarışması benchmark'ında +2.7 puan geride bırakan yepyeni bir veri seçim algoritması keşfetti.

C. 24 Saatte 526 İnsan Takımına Karşı Rekabet

Tianchi platformunda düzenlenen WWW2025 Multimodal Dialogue Intent Recognition Challenge yarışmasına Qwen 3.8-Max otonom olarak dahil edildi.
    526 insan takımının yer aldığı yarışmada, 24 saatlik katı süre sınırı altında sıfır insan yardımıyla:
  • Metin tarafı için BERT, MacBERT ve RoBERTa modellerini ince ayarladı ve toplulaştırdı (ensemble).
  • Müşteri ekran görüntüleri için Qwen2.5-VL-7B ve Chinese-CLIP modellerini eğitti.
  • Modellerin oylarını çapraz doğrulama ile kalibre ederek ağırlıklı bir oylama sistemi (weighted-voting) kurdu.
  • 45 farklı submission (gönderim) boyunca doğruluk oranını 0.60'tan 0.853'e çıkardı ve 458 insan takımını (%87) geride bıraktı.

2. Gerçek Dünya İş Süreçleri ve RL İle Horizontal Yetenek Artışı

Sadece kodlama değil, mesleki günlük işte karşılaşılan karmaşık, çok adımlı ve araç yoğun görevler modellerin ekonomik değerini belirliyor. Qwen 3.8-Max, pekiştirmeli öğrenme (RL) ortamları ve hesaplama gücünün ortak ölçeklenmesi ile eğitildi.

RL Mimarisinin Üç Temel Taşı

1. Bağımsız Ölçeklenen Gerçek Ortamlar: Görev (tek adımlı → çoklu adımlı → çok günlük), Çalışma Alanı (çoklu dosya → hiyerarşik klasörler) ve Harness (QwenWork, Claude Code, Codex, OpenClaw, Hermes) eksenlerinde ortamlar bağımsız ölçeklendi. 2. Evrensel Ödül Sistemi (Universal Reward System): Kod yürütme denetimi, metin/görsel çıktı değerlendirmesi ve ajan teftişini tek bir ölçeklenebilir altyapıda birleştirdi. 3. Canlı Veri Dengeleyici (Online Data Balancer): Her veri grubunun görev zorluğu ve harness dağılımını dengeleyerek RL eğitimindeki gradyan varyansını bastırdı.

Mesleki Uzmanlık Showcase'leri

Qwen 3.8-Max, yüzlerce yüksek değerli meslekte uzman seviyesinde performans gösterdi:

Meslek / AlanSenaryo / GörevQwen 3.8-Max PerformansıGeleneksel Süreç
Kurumsal Uyum AvukatıYüzlerce dokümandan oluşan derlemeyi inceleme1.284 ilgili maddeyi 1 saatin altında tespit ettiParalegal ekibi için ~1 hafta
UI/UX TasarımcısıNOVA dijital bankacılık uygulaması tasarımı8 ekranlı interaktif prototipi 0 revizyon ile tek atışta üretti3–5 revizyon turu
Restoran Kurucusu100+ tedarikçi dökümanından menü oluşturma26 tabaklık kalori ve köken detaylı menüyü %33.8 maliyetle hazırladıŞef ve operasyon ekibi için haftalarca test
İnşaat Mühendisi30 katlı kule sismik modellemesiTarayıcı üzerinde canlı sismik modeli ve kat arası kayma oranını hesapladıÖzel yazılımlarda >1 hafta
Spor Veri Analisti8.400 hücum/savunma pozisyonu analiziDakikalar içinde oyuncu taktik profili ve koçluk raporu çıkardıAnaliz ekibi için birkaç gün

Otonom Kantitatif Finans Stratejisi (Quant Research Loop)

Model, tek bir konuşma içinde 330 alt ajanı (sub-agent) orkestre ederek 6.000'den fazla backtest gerçekleştirdi. Faktör madenciliği ve ETF rotasyon R&D süreçlerinde 0.64 – 1.48 arasında aşırı Sharpe oranı elde eden finansal stratejiler geliştirdi. Aşırı uyum (overfitting) tespit ettiğinde faktörleri budadı ve modeller arasında dinamik geçişler yaptı.

3. Uzun Ufuklu Görevler: Çip Tasarımından E-Ticaret Simülasyonuna

Otonom Çip Tasarımı ve Kapalı Döngü Donanım Mühendisliği

Qwen 3.8-Max; mantık yapılandırması, çoklu kısıt optimizasyonu ve fiziksel serim (layout) aşamalarını içeren dijital çip tasarım sürecini uçtan uca başardı. GCD / RSA kriptografik donanım hızlandırıcısı üzerinde çalışan model; simulation (Iverilog), synthesis (Yosys) ve physical design (OpenROAD) araçlarından oluşan sanal alanda 500 tur ve 71 değerlendirme yaptı.
  • Mantıksal Sentez (Yosys Cell Count): İlk çalışan tasarımı 8.298 kapı (gate) olan model, mantıksal rewritelar, modül birleştirmeleri ve kaydırma-çıkarma algoritmalarıyla kapı sayısını 678'e düşürdü (%91.8 küçülme).
  • Fiziksel Layout (OpenROAD / Nangate45 PDK): 106×106 µm² olan die alanını 46×46 µm²'ye düşürdü (%81 fiziksel alan tasarrufu). Toplam kablo uzunluğu (wirelength) 33.369 µm'den 4.187 µm'ye geriledi ve 500 MHz frekansta zamanlama kapanışı (timing closure) sağlandı (+0.66 ns Slack).

E-Commerce Bench: 365 Günlük Operasyonel Liderlik

Taobao ve Tmall'un gerçek verileriyle oluşturulan 365 günlük e-ticaret operasyon simülasyonunda Qwen 3.8-Max; 12 mağaza türü, 600 tedarikçi, 7.000 ürün ve 152 sahte/dolandırıcı tüccar içeren ekosistemde yarıştı.

¥100.000 başlangıç sermayesini yıl sonunda ¥416.252 seviyesine ulaştırarak 4.16x getiri elde etti. En yakın rakibi GLM 5.2'yi %38, önceki nesil Qwen 3.7-Max'i ise %152 geride bıraktı. 2.000'den fazla etkileşim turu boyunca pazarlık stratejilerini ve stok yönetimini adaptif olarak geliştirdi.

4. Çok Modlu Ajanlar ve Hibrit Ajan (Coding + GUI) Mimarisi

Qwen 3.8-Max, görselleri ve videoları sadece anlamakla kalmıyor; görevin tüm yaşam döngüsüne görsel zekayı entegre ediyor.

  • Uzun Bağlam Görsel Zeka: 200+ sayfalık finansal raporları düzeniyle analiz edebiliyor. 100+ saatlik videoları "video bellek grafiği" (video memory graph) kurarak kişi, olay ve zaman damgalarıyla haritalandırıyor.
  • Görsel Geri Bildirim Döngüsü (Visual Feedback Loop): Yürütme sırasında kendi çıktılarını canlı izliyor. Yanlış yerleştirilmiş bir UI bileşeni veya hatalı açıdaki bir 3D obje tespit ettiğinde planını otonom güncelliyor.
  • Hybrid Agent & RecreationBench: Siyah kutu olarak çalışan uygulamaları (Ubuntu, macOS, Windows, Android, Web) dışarıdan gözlemleyerek sıfırdan yeniden inşa etmeyi ölçen RecreationBench'te üstün performans sergiliyor.
  • Qwen-MM-Plugins: Multimodal ajan geliştiricileri için video editleme, Blender, CAD ve görsel araç entegrasyonu sağlayan açık kaynak kütüphane duyuruldu.

Açık Kaynak Geleceği

Qwen 3.8-Max; yazılım mühendisliği, çip tasarımı, finansal analiz ve uzun süreli otonom ajan görevlerinde büyük bir sıçramaya imza atıyor. Gelecek hafta open-weights (açık ağırlıklar) olarak yayınlanacak olması, geliştiricilerin kendi sunucularında 2.4T parametreli amiral gemisi gücüne erişebileceği anlamına geliyor.

Modeli hemen denemek ve API entegrasyonu sağlamak için QwenCloud platformunu ziyaret edebilirsiniz.

Makale Bilgileri

Benzer Konudaki Yazılar