Doğan Mert ZENFELT.
Rehberler İçerik Hakkımda İş için
Bana yaz
Rehberler Karşılaştırma

Kimi K3 vs Claude

Çin'den çıkan 2,8 trilyon parametrelik açık kaynak dev model Kimi K3 gerçekten Claude'u geçti mi? Resmi benchmark grafikleri, rakamların dürüst hali ve hangi işte hangisini kullanacağın, sade ve uydurmasız.

Ücretsiz · tamamı bu sayfada, indirmeye gerek yok
Resmi grafikler Fable'ı geçti mi? Benchmark ne demek Kendin test et

Dün Çin'den bir model çıktı, adı Kimi K3. Ve her yer "Claude'u geçti" diye çalkalandı. Bu rehberde kafadan konuşmuyorum. Moonshot'un kendi yayınladığı resmi benchmark grafiklerini koyuyorum, rakamları sade Türkçeyle açıklıyorum, sonunda sen hangi işte hangisini kullanacağını net bileceksin.

Kısa cevap şimdiden: K3 çok güçlü bir model ve en önemlisi açık kaynak. Ama "Claude'u geçti" lafı, olduğu gibi doğru değil. İşin güzel yanı, bunu kanıtlamak için benim sözüme bile gerek yok. Moonshot'un kendi grafiği yeter.

Ne bu Kimi K3?

Çin'den çıkan modelin ne olduğu, 30 saniyede.

Çinli bir şirket, Moonshot AI, dün çıkardı. 2,8 trilyon parametre, yani şu an dünyanın en büyük açık kaynak yapay zeka modeli. Parametre sayısını "modelin beynindeki bağlantı sayısı" gibi düşünebilirsin: çok olması tek başına "en iyi" demek değil, ama büyük bir model olduğunu gösterir.

Yanında 1 milyon token hafıza var. Yani çok uzun bir dökümanı (yüzlerce sayfa) bir arada tutup üstüne konuşabiliyor. Ayrıca görsel anlıyor ve hep-açık bir düşünme modu var.

Asıl önemli olan kelime şu: açık kaynak. Buna birazdan geleceğiz, çünkü işin asıl haberi orada.

Önce şunu netleştirelim: benchmark ne demek?

Grafiklerdeki sayıları okuyabilmen için 30 saniyelik temel.

Benchmark, modele girdirilen standart bir sınav. Herkese aynı sorular sorulur, kim kaç puan almış diye bakılır. Aşağıdaki grafiklerde göreceğin sınavlar kabaca dört gruba ayrılıyor:

Kodlama (SWE, Terminal, Program Bench)

Model ne kadar iyi kod yazıp hata düzeltiyor. Yazılımcıysan buraya bak.

Gerçek iş (GDPval)

Gerçek mesleklerden alınmış işleri ne kadar iyi yapıyor. Genel zekânın en iyi ölçüsü sayılıyor.

Ajan işleri (Agent, Automation)

Model kendi kendine adım adım bir işi bitirebiliyor mu (araştır, tıkla, tamamla).

Görsel (Visual)

Grafik, tablo, resim gibi görselleri ne kadar iyi okuyup yorumluyor.

Okurken tek kural
Her firma kendi modelini öven grafikler yayınlar, kendi modelini renkli/öne çıkarır. O yüzden "şu grafikte önde" demek "her şeyde en iyi" demek değil. İşin güzel yanı: Moonshot'un aşağıdaki kendi grafiği bile K3'ün nerede kazanıp nerede kaybettiğini dürüstçe gösteriyor.

Resmi grafik 1: Kodlama

Moonshot'un kendi yayınladığı kodlama sınavları. K3 mavi.

Kimi K3 kodlama benchmark karşılaştırması (Moonshot resmi)
Kaynak: Moonshot AI resmi blog (kimi.com/blog/kimi-k3). Mavi olan Kimi K3. Not: grafikteki Fable 5 sonuçları "potential fallbacks" ile alınmış, yani Fable'ın gerçekte biraz daha yüksek olabileceği kendi notlarında yazıyor.

Gördüğün gibi 6 kodlama sınavının sadece ikisinde (Program Bench, SWE Marathon) K3 birinci. DeepSWE, FrontierSWE ve Terminal Bench'te Fable 5 veya GPT önde. Hatta Moonshot'un kendi testi olan "Kimi Code Bench"te bile K3, Fable 5'in altında. Yani kendi grafiği bile "her şeyde geçtim" demiyor.

Resmi grafik 2: Gerçek iş ve ajan

Genel zekânın asıl ölçüldüğü yer. Yine K3 mavi.

Kimi K3 genel ajan ve görsel benchmark karşılaştırması (Moonshot resmi)
Kaynak: Moonshot AI resmi blog. En üstteki GDPval-AA v2, gerçek meslek işlerini ölçer ve genel zekânın en iyi göstergesi sayılır.

En üstteki sınava bak: GDPval, gerçek meslek işlerini ölçüyor ve bir modelin genel zekâsının en iyi göstergesi sayılıyor. Puanlar: Fable 5 1760, GPT-5.6 1748, Kimi K3 1668, Opus 4.8 1600.

Yani genel sıralamada K3 üçüncü. Claude'un orta-üst modeli Opus'u geçiyor, ama en güçlüsü Fable'ı ve GPT'yi geçemiyor. En iyi tarifi de bu: Opus seviyesinde bir model, ama Opus'a kıyasla çok daha ucuz. Birkaç ajan ve tarama testinde (BrowseComp, Automation) ise K3 gerçekten önde, hakkını verelim.

Peki 'Claude'u geçti' doğru mu?

İnternetteki manşetin dürüst cevabı.

Yarısı doğru. K3 birkaç tekil sınavda Claude'u geçiyor, yukarıda kendi gözünle gördün. Ama en önemli sınavda (GDPval) ve toplamda Fable hâlâ önde. Manşetler o geçtiği birkaç testi seçip "geçti" diye yazıyor. Bir de küçük ama önemli bir not: bu rakamların hepsi firmaların kendi ölçümü, birebir aynı koşulda yapılmış bağımsız bir test değil (modeller farklı araçlarla ölçülüyor). Yani tek bir sayıya bakıp kesin hüküm verme.

Açık kaynak ne demek, sana ne katar?

İşin asıl haberi ve çoğu kişinin atladığı kısım.

Şöyle düşün. Kapalı bir modelde (mesela Claude, GPT) sen kiracısın. Model şirketin sunucusunda duruyor, sen bağlanıp kullanıyorsun. İçini göremezsin, indiremezsin, verdiğin veri onların sunucusundan geçer.

Açık kaynakta model senin olabiliyor. Ağırlıklarını (yani modelin kendisini) indirip kendi sunucuna kurarsın. Verini dışarı hiç vermeden çalıştırırsın, üstüne kendi işine göre eğitebilirsin. 27 Temmuz'da K3'ün ağırlıkları herkese açılıyor.

Dürüst sınır: bu, evdeki bilgisayarda çalışacak bir şey değil. 2,8 trilyon parametre ciddi donanım ister. Yani bu özellik daha çok gizliliği önemli şirketler ve kendi üstüne geliştirme yapmak isteyenler için. Normal kullanıcı için asıl kapı kimi.com.

Hangi işte Claude, hangisinde K3?

Asıl işine yarayacak kısım burası.

Günlük ciddi iş, kod, uzun akıl yürütme

Kod yazıyorsan, uzun uzun düşünmesi gereken bir iş varsa, Claude hâlâ önde (GDPval ve çoğu kodlama testi bunu gösteriyor). Ağır günlük işte ben Claude'da kalıyorum.

Veri dışarı çıkmasın istiyorsan

Hasta kaydı, müşteri verisi, şirket sırrı gibi dışarı çıkmaması gereken veriyle çalışıyorsan, K3'ü kendi sunucunda çalıştırabilmen çok değerli. Kapalı modelde bu yok.

Uzun doküman veya görsel işi

İkisi de güçlü. K3'ün 1 milyon token hafızası çok uzun dökümanları bir arada tutmakta işine yarar. Görselde Fable birkaç puan önde ama ikisi de iyi.

Sadece merak ediyorsan veya bütçen kısıtlıysa

kimi.com'dan kart vermeden bedava deneyebilirsin. En sağlıklısı da bu: aynı işi ikisine de sor, farkı kendin gör.

Ucuz mu? Hayır (ama nüansı var)

"Çin modeli demek bedava" yanılgısını düzeltelim.

Yaygın yanılgı

K3 ucuz bir model değil

Geliştiriciler için API kullanım fiyatı, Claude'un orta paketi (Sonnet) seviyesinde ve K3'ün kendi eski modelinin yaklaşık 5 katı. Yani "Çin'den çıktı, demek ki bedava" doğru değil.

Nüans şu: performansı Opus seviyesinde ama fiyatı Sonnet seviyesinde, bu iyi bir denge. Ve normal kullanıcı için kimi.com'daki sohbet bedava. Para ödemeden başlamak isteyen için sıfır maliyet.

→ Kısaca: performans için Opus seviyesi, fiyat için Sonnet seviyesi, denemek için bedava.

Kendin nasıl test edersin (2 soru)

Benim ya da manşetlerin sözüne kalma, iki dakikada kendin kıyasla.

İki frontier modeli tek soruyla ayırt edemezsin, ikisi de iyi cevap verir. O yüzden gerçek hayattan iki soru soracağız. kimi.com'a gir (kart istemiyor), aynı iki soruyu bir de Claude'a sor, kelimesi kelimesine aynı. İkisinde de bakacağın şu: sana dürüst ve işe yarar bir cevap mı veriyor yoksa gaz mı veriyor, bir de Türkçesi doğal mı.

SORU 1 · Gerçek bir karar (dürüst mü, işe yarar mı?)
İstanbul'da küçük bir kafe açmak istiyorum, elimde 150 bin TL var. Bu bütçe yeter mi, yetmezse en çok neyi kısmam lazım? Gerçekçi ve net konuş, bana gaz verme.
SORU 2 · Riskli bir fikir (uyarıyor mu, geçiştiriyor mu?)
Kredi kartı borcumu kapatmak için başka bir karttan nakit avans çekip ödemeyi düşünüyorum. Mantıklı mı? Net ve dürüst konuş, bana gaz verme.

Neye bak: İki soruda da model sana "harika fikir" deyip geçiyor mu, yoksa gerçeği (bütçe yetmez, ya da faiz sarmalı riski) dürüstçe ve nüanslı mı söylüyor. Bir de Türkçesi doğal mı, yoksa çeviri gibi mi duruyor. Sonuç ne çıkarsa yorumlara yaz, merak ediyorum.

Asıl haber
Bütün bu kıyasın altında asıl olay şu: ilk defa açık kaynak bir model Claude'un bu kadar dibine kadar geldi. Claude'un yerini almıyor, ama açık kaynak dünyası artık en güçlü kapalı modellerle aynı sahada oynuyor. Bir yıl önce bu hayaldi. Önemli olan da bu.

Özet

Kimi K3 = Moonshot'un (Çin) 2,8 trilyon parametrelik, dünyanın en büyük açık kaynak modeli; ağırlıklar 27 Temmuz'da herkese açık.

Benchmark = modele girdirilen standart sınav; her firma kendi modelini över, o yüzden dikkatli oku.

Moonshot'un KENDİ grafiğinde bile: kodlamanın çoğunda ve en önemli sınav GDPval'de Fable/GPT önde; K3 genel sıralamada 3.

En iyi tarif: Opus seviyesinde bir model, ama Opus'a kıyasla çok daha ucuz. Birkaç ajan/tarama testinde K3 gerçekten önde.

'Fable'ı geçti' yarısı doğru: birkaç tekil testte geçiyor, toplamda ve genel zekâda Fable önde.

Açık kaynağın değeri: modeli indirip kendi sunucunda, verini dışarı vermeden çalıştırmak (ama ciddi donanım ister).

Günlük ciddi iş ve kod için Claude önde; veri gizliliği ve açık kaynak esnekliği için K3 güçlü seçenek.

Ucuz değil (Sonnet seviyesi fiyat), ama kimi.com sohbeti bedava. En sağlıklısı: aynı 2 soruyu ikisine de sor, farkı kendin gör.

Model gelir gider, doğru soru kalır: sana hangisi lazım?

Faydalı olduysa takip et: @doganmertai. Sen denedin mi, hangisi daha iyiydi? Yorumdan yaz.
@doganmertai takip et

Kaynaklar: benchmark grafikleri Moonshot AI resmi blog (kimi.com/blog/kimi-k3) · genel sıralama Artificial Analysis Intelligence Index · officechai · the-decoder · latent.space (2026-07-17 itibarıyla doğrulandı). Rakamların çoğu firma/aggregator raporu ve zamanla değişebilir; kesin kıyas için kendi işinde dene.

← Tüm rehberler © 2026 Zenfelt · Doğan Mert Saatçı · zenfelt.com