Aleph Alpha'dan Kolibri-1: 1 Milyon Token Bağlamlı Açık Ağırlıklı MoE Modeli

Paylaş:
Aleph Alpha'dan Kolibri-1: 1 Milyon Token Bağlamlı Açık Ağırlıklı MoE Modeli - blog yazısı görseli
Özet

Aleph Alpha, token başına yalnızca 3.46 milyar aktif parametre kullanan, 1 milyon token bağlam pencereli ve Apache 2.0 lisanslı açık ağırlıklı modeli Kolibri-1'i duyurdu.

Avrupa'nın egemen yapay zeka (Sovereign AI) vizyonundaki en önemli aktörlerinden Almanya merkezli Aleph Alpha, açık ağırlıklı (open-weight) yapay zeka dünyasında dengeleri değiştirecek yeni amiral gemisi modeli Kolibri-1'i duyurdu. Toplamda 78.1 milyar parametreye sahip olan model, seyrek Uzmanlar Karışımı (Sparse Mixture-of-Experts - MoE) mimarisi sayesinde çıkarım (inference) anında token başına sadece 3.46 milyar aktif parametre çalıştırıyor.

Geliştiricilere ve kurumlara tam şeffaflık sunmak amacıyla Apache 2.0 lisansı altında Hugging Face üzerinde erişime açılan Kolibri-1, özellikle 1 milyon tokenlık devasa bağlam penceresi, hibrit dikkat mekanizması ve gelişmiş akıl yürütme kabiliyetleriyle dikkatleri üzerine çekiyor.

384 Uzmanlı MoE ve Hibrit Dikkat Mimarisi

Kolibri-1'in merkezinde son derece optimize edilmiş ince taneli (fine-grained) bir Uzmanlar Karışımı tasarımı yer alıyor. Model katman başına toplam 384 uzmana ev sahipliği yaparken, her bir token için yalnızca 6 yönlendirilmiş uzman (routed expert) ve 1 paylaşılan uzman (shared expert) devreye giriyor. Bu sayede model, 78B boyutundaki dev bir bilgi havuzunu temsil ederken, işlem maliyetini ve hesaplama süresini 3.5B seviyesindeki hafif modellerin hızına düşürüyor.

    Modelin 1.048.576 (1M) tokenlık bağlam uzunluğunu verimli yönetebilmesi için Hibrit Dikkat (Hybrid Attention) mimarisi tercih edildi:
  • Çoğu katmanda bellek ve hesaplama yükünü en aza indiren kayan pencere (sliding window attention) kullanılırken;
  • Her beş katmanda bir tam dikkat (full global attention) uygulanarak uzun belgelerdeki kritik bilgilerin kusursuzca birbirine bağlanması sağlanıyor.

Bu yapı, özellikle karmaşık yasal metinlerin, yüzlerce sayfalık teknik kılavuzların ve devasa kurumsal kod tabanlarının tek seferde model bağlamına aktarılmasına olanak tanıyor.

Benchmark Sonuçları: 4B Altı Aktif Parametre Sınıfında Liderlik

Kolibri-1, token başına 4 milyar altı aktif parametre kullanan rekabetçi MoE modelleriyle (Qwen3.5 35B-A3B ve GLM-4.7 Flash gibi) karşılaştırıldığında akıl yürütme, matematik ve kodlama benchmark testlerinde üstün sonuçlar sergiliyor:

  • AIME 2026 (İleri Düzey Matematik): 96.0 puan
  • GPQA Diamond (Uzman Seviyesi Bilimsel Akıl Yürütme): 84.3 puan
  • LiveCodeBench v6 (Güncel Kodlama): 85.9 puan
  • SWE-Bench Verified (Yazılım Mühendisliği Görevleri): 66.4 puan

Model ayrıca Almanca ve İngilizce için özel olarak eğitilmiş çift dilli bir tokenlayıcı (tokenizer) barındırıyor. Almancanın zengin morfolojik yapısına göre optimize edilen bu sözlük yapısı, standart tokenlayıcılara kıyasla Almanca metinlerde yaklaşık %15 daha az token tüketerek hem hızı artırıyor hem de maliyetleri düşürüyor.

Donanım Gereksinimleri ve Dağıtım Senaryoları

Her ne kadar çıkarım anında yalnızca 3.46B parametre aktif olsa da, modelin 78.1 milyar parametrelik ağırlıklarının tamamının GPU belleğinde (VRAM) tutulması gerekiyor.

    Kolibri-1'in donanım ve dağıtım gereksinimleri şu şekilde özetleniyor:
  • Bellek Boyutu (FP8 Hassasiyeti): Yaklaşık 78 GB VRAM
  • Tavsiye Edilen Dağıtım: Çift Nvidia A100 (80GB) ya da H100 SXM5; veya tekil Nvidia H200, B200 veya B300 sistemleri
  • Çıkarım Motoru: vLLM altyapısıyla tam uyumlu çalışan özel aleph-alpha-inference eklentisi

Egemen Yapay Zeka ve Hassas Regülasyonlar İçin Tasarlandı

Aleph Alpha'nın geliştirdiği Kolibri-1, yalnızca genel tüketici sohbetleri için değil; kamu yönetimi, savunma, havacılık, sağlık ve regüle edilen kurumsal sektörlerin egemen veri gereksinimleri gözetilerek inşa edildi.

Açık ağırlıklı yapısı sayesinde kurumlar modeli kendi yerel sunucularında veya bağımsız bulut altyapılarında üçüncü taraflarla veri paylaşmadan çalıştırabiliyor. Modelin güçlü araç çağırma (tool calling) ve yapısal veri işleme yetenekleri, onu otonom yapay zeka ajanları ve RAG (Retrieval-Augmented Generation) boru hatları için güçlü bir alternatif haline getiriyor.

Makale Bilgileri

Yazar: İsmail Hakkı EREN
Benzer Konudaki Yazılar