Kimi K3'ün rekor rakamlarının ardında yatan gerçek nedir?

Kimi K3, 16 Temmuz'dan beri çevrimiçi durumda ve manşetler, sanki Çin az önce ABD'yi geride bırakmış gibi bir izlenim yaratıyor. 2,8 trilyon parametreye sahip olan bu model, ağırlıkları kamuya açılacak olan en büyük modeldir. Bazı gözlemciler şimdiden bunu bir sonraki "DeepSeek anı" olarak nitelendiriyor.
Ancak bu modelle ilgili en ilginç cümle manşetlerde yer almıyor. Moonshot'un kendi teknik blogunda bulunuyor. Orada geliştirici, genel performansın hâlâ en güçlü özel modellerin, yani Claude Fable 5 ve GPT-5.6 Sol'un gerisinde kaldığını belirtiyor. Kendi ürününü tanıtıp onun en iyi olmadığını söyleyen bir şirket nadir görülür. İşte tam da bu nedenle rekor rakamlar daha yakından incelenmeyi hak ediyor.
K3'ün piyasaya çıktığı ve ücretsiz olarak denenebileceği haberini daha önce vermiştik. Bu yazı ise bundan sonra neler olacağına odaklanıyor.
Birincilik ve bunun gerçekte neyi ölçtüğü
K3, önemli bir karşılaştırmada birinci oluyor. Kullanıcıların iki sonucu yan yana gördüğü ve hangi modelin ürettiğini bilmeden daha iyisini seçtiği Frontend Code Arena’da K3 birinci çıkıyor. Hatta Claude ve GPT’yi de geride bırakıyor.
Ancak bir püf noktası var: Bu test, zevk meselesini ölçüyor. Kullanıcılar, hangi web arayüzünü daha çok beğendiklerini değerlendiriyor. Bu, tasarım hakkında çok şey söylüyor, ancak doğruluk hakkında pek bir şey söylemiyor. Bunu “Kimi, ABD’li modelleri geride bıraktı” şeklinde yorumlayanlar, tercih sıralaması ile doğruluk testi arasındaki farkı gözden kaçırmış oluyor.
Karşılaştırma tablolarının neden dikkatle okunması gerektiği
Moonshot ölçümlerini yayınlıyor ve ilginç kısım dipnotlarda yatıyor. Karşılaştırma testine bağlı olarak, her model farklı bir ajan sisteminde çalıştırıldı; bazen KimiCode, bazen Claude Code, bazen de Codex. Bunlar farklı başlangıç koşullarıdır; aynı pistte yapılan adil bir yarış değildir.
Kodlama testlerinden birinde, Moonshot’un kendisi bile Claude Fable 5’in görevlerin yüzde 35’inde yedek çözümlere başvurduğunu ve bunun puanını düşürmüş olabileceğini kabul ediyor. Başka bir testte ise K3, en yüksek puanına ancak bağlamı 300.000 token'da sıkıştıran bir teknikle ulaşabiliyor. Bu bağlam yönetimi olmadan puan düşüyor.
Bu tür rakamların ne kadar kolay tersine dönebileceği, bağımsız analiz firması Artificial Analysis'in yaptığı bir değerlendirmede ortaya çıkıyor. Bu değerlendirmede, Kimi K3, halüsinasyon metriğinde yüzde 49’luk bir sonuç elde ediyor. Bu, zayıf bir puan gibi görünebilir. Ancak ölçek tersine işliyor: modelin ne sıklıkla hata yapmadığını ölçüyor. Değer ne kadar yüksekse o kadar iyidir; aynı listede Claude Fable 5, yüzde 45 ile K3’ün altında yer alırken, çeşitli GPT-5.6 varyantları ise çok geride kalmaktadır.
Unutulmaması gereken bir kural: Bir karşılaştırma başlığına inanmadan önce, tam olarak neyin ölçüldüğünü ve ölçeğin hangi yöne işaret ettiğini kontrol edin.
K3’ü kendiniz çalıştırabilir misiniz?
Okurlarımız için asıl soru budur. Dürüst cevap: Ağırlıklar açıklandığında bile, sıradan kullanıcılar için bu durum pratikte hiçbir fark yaratmayacaktır. Bunun nedeni basitçe boyuttur.
Bir an için hesap yapalım. Moonshot, K3’ü başından itibaren MXFP4 adı verilen kompakt bir sayı formatında eğitiyor; bu format, ağırlık başına yaklaşık dört bit kullanıyor. Parametreler olarak da adlandırılan ağırlıklar, bir yapay zeka modelini oluşturan öğrenilmiş sayısal değerlerdir. 2,8 trilyon parametre ile, sadece model dosyası için yaklaşık 1,4 terabaytlık bir alana ihtiyaç duyarsınız. Gigabayt değil. Terabayt. Karşılaştırma için: sekiz milyar parametreye sahip, iyi donanımlı bir dizüstü bilgisayarda çalışabilen tipik bir model, yaklaşık beş gigabayt yer kaplar.
Moonshot, K3'ü 64 veya daha fazla hızlandırıcıya sahip süper düğüm kurulumlarında çalıştırmayı önermektedir. Bu aşırı bir ihtiyat değil, bu boyutların doğurduğu basit bir sonuçtur. 96 gigabayt belleğe sahip tek bir profesyonel grafik kartı, bu değerin on katından daha azdır.
Dolayısıyla "açık ağırlıklar", bu modeli evde çalıştıracağınız anlamına gelmez. Bu, araştırmacıların, şirketlerin ve bulut sağlayıcılarının, modeli yalnızca Moonshot'un sunucuları üzerinden kiralamak yerine, indirebilecekleri, inceleyebilecekleri ve kendi altyapılarında çalıştırabilecekleri anlamına gelir. Bu değerli bir durumdur, ancak birçok kişinin hayal ettiğinden farklı bir şeydir.
Kendi makinenizde bulut olmadan gerçekten yapay zeka kullanmak istiyorsanız, bu iş için geliştirilmiş küçük modeller doğru seçimdir. Bunun nasıl çalıştığını ve donanımınızın neye ihtiyaç duyduğunu ayrı bir makalede göstermiştik.
Teknik konulara meraklı olanlar için bir not: K3, ilk günden itibaren bu düşük hassasiyet seviyesinde eğitildiğinden, kompakt format orijinal halidir; sonradan küçültülmüş bir model değildir. Küçültmenin kaliteye ne kadar mal olacağı konusundaki olağan soru, bu durumda aynı şekilde gündeme gelmez.
Pratikte maliyeti nedir?
Faturalandırma, genellikle sadece birkaç karakterden oluşan küçük metin parçaları olan token'larla yapılır. API aracılığıyla Moonshot, her milyon giriş token'ı için 3 dolar ve her milyon çıkış token'ı için 15 dolar ücret alır. Tekrarlanan girişler ise 30 sent olarak faturalandırılır; bu da çok daha ucuzdur.
Bu da K3’ü artık ucuz bir seçenek olmaktan çıkarır. Giriş başına bir doların biraz altında ücret alan kendi öncülüne kıyasla yaklaşık üç kat daha pahalıdır. 10 ve 50 dolarlık Claude Fable 5 ile karşılaştırıldığında, K3 açıkça daha ucuzdur. Ancak Claude Sonnet 5, şu anki 2 ve 10 dolarlık tanıtım fiyatıyla hâlâ K3’ten daha ucuzdur ve ancak Eylül ayında K3 ile aynı seviyeye gelecektir. Moonshot’ta, Çinli modellerin esas olarak fiyat üzerinden rekabet ettiği dönem sona eriyor.
Top 10
» Top 10 Multimedia Notebook listesi
» Top 10 oyun notebooku
» Top 10 bütçeye uygun Ofis/İş Notebook Listesi
» Top 10 Premium Ofis/İş notebookları
» Top 10 Çalışma istasyonu laptopları
» Top 10 Subnotebook listesi
» Top 10 Ultrabooklar
» En iyi 10 dönüştürülebilir modeli
» Seçimi en iyi 10 tablet
» Notebookcheck Top 10 Windows Tabletleri
» Top 10 Subnotebook listesi
» NotebookCheck tarafından incelenen en iyi Notebook ekranları
» Notebookcheck'in 500 Euro altındaki en iyi 10 Notebook listesi
» NotebookCheck tarafından seçilen 300 Euro altındaki en iyi 10 Notebook
» Notebookcheck'in 500 Euro altındaki en iyi 10 Notebook listesi
» Notebookcheck'in Top 10 akıllı telefon listesi
» Notebookcheck'in Top 10 hafif oyun notebookları
Gözden kaçması kolay bir nokta daha var. K3 şu anda her zaman en yüksek çaba seviyesinde çalışıyor. Moonshot, daha sonra daha verimli modlar eklemeyi planlıyor. Bu, cevapların kapsamlı olmasını sağlıyor, ancak aynı zamanda basit bir sorunun bile maliyetli akıl yürütme sürecini tetiklediği anlamına geliyor. Bağımsız ölçümler, modelin saniyede yaklaşık 62 çıktı tokeni ürettiğini gösteriyor; bu, hız açısından ortalamaya denk geliyor.
Giriş verilerinize ne oluyor?
Uygulamada veya web sitesinde K3'ü deneyen herkes için en önemli bölüm budur. Moonshot'ın gizlilik politikası, girdilerin, seslerin, görsellerin, videoların ve dosyaların hizmetleri sunmak ve iyileştirmek amacıyla işlendiğini açıkça belirtir; buna kendi modellerinin eğitimi ve optimizasyonu da açıkça dahildir.
Politikada, içeriğinizin eğitilmesini devre dışı bırakacak özel bir anahtar bulunmamaktadır. Politika, hesap ayarlarınız aracılığıyla veya gizlilik irtibat kişisine e-posta göndererek kullanabileceğiniz genel veri sahibi haklarına işaret etmektedir. Buna karşılık, ChatGPT ve Claude, ayarlara doğrudan bir anahtar eklemiştir.
Ayrıca politikada şunlar belirtilmiştir: Toplanan veriler arasında IP adresi, cihaz tanımlayıcıları, oturum ve konuşma kimlikleri ile cihaz ayarlarının izin verdiği durumlarda panodan alınan veriler yer almaktadır. Veri depolama konumu ile ilgili olarak, politikada yalnızca verilerin ikamet ettiğiniz ülkenin dışındaki sunuculara aktarılabileceği belirtilmektedir. Herhangi bir ülke adı geçmemektedir. Hizmet sağlayıcı, Singapur merkezli Moonshot AI PTE. LTD. olup, politikanın tarihi 7 Temmuz 2025'tir.
Zararsız görevlerle yapılacak bir deneme çalışması için bu kabul edilebilir. Şirket içi veriler, müşteri verileri veya özel belgeler söz konusu olduğunda ise, herhangi bir bulut hizmetinde olduğu gibi aynı kural geçerlidir; ancak burada, kendi şartlarında eğitim amaçlı kullanımın açıkça belirtildiği bir sağlayıcı söz konusudur.
Kimi K3'ten en çok kimler yararlanır?
Denemek tamamen ücretsizdir. En çok fayda sağlayacak iki grup vardır: geliştirme veya tasarım yapanlar ve düzenli olarak çok uzun belgelerle çalışanlar. K3, kod ile görsellerin birleştiği alanlarda, yani web arayüzlerinde, 3D ve animasyonda güçlüdür. Bir milyon tokenlik bağlam penceresi, uzun metinler için gerçek bir avantajdır ve görüntü işleme özelliği de yerleşiktir.
En iyi cevap kalitesini veya en sorunsuz deneyimi istiyorsanız, ABD’nin en iyi modelleri hâlâ daha iyi bir seçimdir. Moonshot da bunu kendisi söylüyor. Yakında kendi bilgisayarına bir öncü model kurmayı uman herkes ise o 1,4 terabaytlık alanı akılda tutmalıdır.
K3 ile ilgili dikkat çekici olan şey, sıralamadan çok ilerleme hızıdır. Çinli bir şirket, dünyanın en iyileriyle aynı seviyede bir model sunuyor ve model verilerini herkese açıyor. İki yıl önce bunu hayal etmek zor olurdu.









