Çin'den çıkan 2,8 trilyon parametrelik açık kaynak dev model Kimi K3 gerçekten Claude'u geçti mi? Resmi benchmark grafikleri, rakamların dürüst hali ve hangi işte hangisini kullanacağın, sade ve uydurmasız.
Dün Çin'den bir model çıktı, adı Kimi K3. Ve her yer "Claude'u geçti" diye çalkalandı. Bu rehberde kafadan konuşmuyorum. Moonshot'un kendi yayınladığı resmi benchmark grafiklerini koyuyorum, rakamları sade Türkçeyle açıklıyorum, sonunda sen hangi işte hangisini kullanacağını net bileceksin.
Kısa cevap şimdiden: K3 çok güçlü bir model ve en önemlisi açık kaynak. Ama "Claude'u geçti" lafı, olduğu gibi doğru değil. İşin güzel yanı, bunu kanıtlamak için benim sözüme bile gerek yok. Moonshot'un kendi grafiği yeter.
Çin'den çıkan modelin ne olduğu, 30 saniyede.
Çinli bir şirket, Moonshot AI, dün çıkardı. 2,8 trilyon parametre, yani şu an dünyanın en büyük açık kaynak yapay zeka modeli. Parametre sayısını "modelin beynindeki bağlantı sayısı" gibi düşünebilirsin: çok olması tek başına "en iyi" demek değil, ama büyük bir model olduğunu gösterir.
Yanında 1 milyon token hafıza var. Yani çok uzun bir dökümanı (yüzlerce sayfa) bir arada tutup üstüne konuşabiliyor. Ayrıca görsel anlıyor ve hep-açık bir düşünme modu var.
Asıl önemli olan kelime şu: açık kaynak. Buna birazdan geleceğiz, çünkü işin asıl haberi orada.
Grafiklerdeki sayıları okuyabilmen için 30 saniyelik temel.
Benchmark, modele girdirilen standart bir sınav. Herkese aynı sorular sorulur, kim kaç puan almış diye bakılır. Aşağıdaki grafiklerde göreceğin sınavlar kabaca dört gruba ayrılıyor:
Model ne kadar iyi kod yazıp hata düzeltiyor. Yazılımcıysan buraya bak.
Gerçek mesleklerden alınmış işleri ne kadar iyi yapıyor. Genel zekânın en iyi ölçüsü sayılıyor.
Model kendi kendine adım adım bir işi bitirebiliyor mu (araştır, tıkla, tamamla).
Grafik, tablo, resim gibi görselleri ne kadar iyi okuyup yorumluyor.
Moonshot'un kendi yayınladığı kodlama sınavları. K3 mavi.
Gördüğün gibi 6 kodlama sınavının sadece ikisinde (Program Bench, SWE Marathon) K3 birinci. DeepSWE, FrontierSWE ve Terminal Bench'te Fable 5 veya GPT önde. Hatta Moonshot'un kendi testi olan "Kimi Code Bench"te bile K3, Fable 5'in altında. Yani kendi grafiği bile "her şeyde geçtim" demiyor.
Genel zekânın asıl ölçüldüğü yer. Yine K3 mavi.
En üstteki sınava bak: GDPval, gerçek meslek işlerini ölçüyor ve bir modelin genel zekâsının en iyi göstergesi sayılıyor. Puanlar: Fable 5 1760, GPT-5.6 1748, Kimi K3 1668, Opus 4.8 1600.
Yani genel sıralamada K3 üçüncü. Claude'un orta-üst modeli Opus'u geçiyor, ama en güçlüsü Fable'ı ve GPT'yi geçemiyor. En iyi tarifi de bu: Opus seviyesinde bir model, ama Opus'a kıyasla çok daha ucuz. Birkaç ajan ve tarama testinde (BrowseComp, Automation) ise K3 gerçekten önde, hakkını verelim.
İnternetteki manşetin dürüst cevabı.
Yarısı doğru. K3 birkaç tekil sınavda Claude'u geçiyor, yukarıda kendi gözünle gördün. Ama en önemli sınavda (GDPval) ve toplamda Fable hâlâ önde. Manşetler o geçtiği birkaç testi seçip "geçti" diye yazıyor. Bir de küçük ama önemli bir not: bu rakamların hepsi firmaların kendi ölçümü, birebir aynı koşulda yapılmış bağımsız bir test değil (modeller farklı araçlarla ölçülüyor). Yani tek bir sayıya bakıp kesin hüküm verme.
İşin asıl haberi ve çoğu kişinin atladığı kısım.
Şöyle düşün. Kapalı bir modelde (mesela Claude, GPT) sen kiracısın. Model şirketin sunucusunda duruyor, sen bağlanıp kullanıyorsun. İçini göremezsin, indiremezsin, verdiğin veri onların sunucusundan geçer.
Açık kaynakta model senin olabiliyor. Ağırlıklarını (yani modelin kendisini) indirip kendi sunucuna kurarsın. Verini dışarı hiç vermeden çalıştırırsın, üstüne kendi işine göre eğitebilirsin. 27 Temmuz'da K3'ün ağırlıkları herkese açılıyor.
Dürüst sınır: bu, evdeki bilgisayarda çalışacak bir şey değil. 2,8 trilyon parametre ciddi donanım ister. Yani bu özellik daha çok gizliliği önemli şirketler ve kendi üstüne geliştirme yapmak isteyenler için. Normal kullanıcı için asıl kapı kimi.com.
Asıl işine yarayacak kısım burası.
Kod yazıyorsan, uzun uzun düşünmesi gereken bir iş varsa, Claude hâlâ önde (GDPval ve çoğu kodlama testi bunu gösteriyor). Ağır günlük işte ben Claude'da kalıyorum.
Hasta kaydı, müşteri verisi, şirket sırrı gibi dışarı çıkmaması gereken veriyle çalışıyorsan, K3'ü kendi sunucunda çalıştırabilmen çok değerli. Kapalı modelde bu yok.
İkisi de güçlü. K3'ün 1 milyon token hafızası çok uzun dökümanları bir arada tutmakta işine yarar. Görselde Fable birkaç puan önde ama ikisi de iyi.
kimi.com'dan kart vermeden bedava deneyebilirsin. En sağlıklısı da bu: aynı işi ikisine de sor, farkı kendin gör.
"Çin modeli demek bedava" yanılgısını düzeltelim.
Geliştiriciler için API kullanım fiyatı, Claude'un orta paketi (Sonnet) seviyesinde ve K3'ün kendi eski modelinin yaklaşık 5 katı. Yani "Çin'den çıktı, demek ki bedava" doğru değil.
Nüans şu: performansı Opus seviyesinde ama fiyatı Sonnet seviyesinde, bu iyi bir denge. Ve normal kullanıcı için kimi.com'daki sohbet bedava. Para ödemeden başlamak isteyen için sıfır maliyet.
→ Kısaca: performans için Opus seviyesi, fiyat için Sonnet seviyesi, denemek için bedava.
Benim ya da manşetlerin sözüne kalma, iki dakikada kendin kıyasla.
İki frontier modeli tek soruyla ayırt edemezsin, ikisi de iyi cevap verir. O yüzden gerçek hayattan iki soru soracağız. kimi.com'a gir (kart istemiyor), aynı iki soruyu bir de Claude'a sor, kelimesi kelimesine aynı. İkisinde de bakacağın şu: sana dürüst ve işe yarar bir cevap mı veriyor yoksa gaz mı veriyor, bir de Türkçesi doğal mı.
Neye bak: İki soruda da model sana "harika fikir" deyip geçiyor mu, yoksa gerçeği (bütçe yetmez, ya da faiz sarmalı riski) dürüstçe ve nüanslı mı söylüyor. Bir de Türkçesi doğal mı, yoksa çeviri gibi mi duruyor. Sonuç ne çıkarsa yorumlara yaz, merak ediyorum.
Kimi K3 = Moonshot'un (Çin) 2,8 trilyon parametrelik, dünyanın en büyük açık kaynak modeli; ağırlıklar 27 Temmuz'da herkese açık.
Benchmark = modele girdirilen standart sınav; her firma kendi modelini över, o yüzden dikkatli oku.
Moonshot'un KENDİ grafiğinde bile: kodlamanın çoğunda ve en önemli sınav GDPval'de Fable/GPT önde; K3 genel sıralamada 3.
En iyi tarif: Opus seviyesinde bir model, ama Opus'a kıyasla çok daha ucuz. Birkaç ajan/tarama testinde K3 gerçekten önde.
'Fable'ı geçti' yarısı doğru: birkaç tekil testte geçiyor, toplamda ve genel zekâda Fable önde.
Açık kaynağın değeri: modeli indirip kendi sunucunda, verini dışarı vermeden çalıştırmak (ama ciddi donanım ister).
Günlük ciddi iş ve kod için Claude önde; veri gizliliği ve açık kaynak esnekliği için K3 güçlü seçenek.
Ucuz değil (Sonnet seviyesi fiyat), ama kimi.com sohbeti bedava. En sağlıklısı: aynı 2 soruyu ikisine de sor, farkı kendin gör.
Kaynaklar: benchmark grafikleri Moonshot AI resmi blog (kimi.com/blog/kimi-k3) · genel sıralama Artificial Analysis Intelligence Index · officechai · the-decoder · latent.space (2026-07-17 itibarıyla doğrulandı). Rakamların çoğu firma/aggregator raporu ve zamanla değişebilir; kesin kıyas için kendi işinde dene.