İçeriğe geç

Açık ağırlıklı bir modelin fiyatlandırması

Güncellendi September 1, 2026 · ilk yayın September 1, 2026

Kısa yanıt: Qwen3.8-Flash-Next, 26 Ağustos 2026'da Qwen4 mimarisinin açık ağırlıklı bir önizlemesi olarak çıktı: yaklaşık 6 milyar aktif parametre, 262,144 token yerel bağlam ve açıklanmış bir barındırılan fiyat...

Qwen3.8-Flash-Next, 26 Ağustos 2026'da Qwen4 mimarisinin açık ağırlıklı bir önizlemesi olarak çıktı: yaklaşık 6 milyar aktif parametre, 262,144 token yerel bağlam ve açıklanmış bir barındırılan fiyat yok. Bu kombinasyon alışılmış karşılaştırmayı bozar. Kapalı her model milyon token başına bir sayı verir; açık ağırlıklı bir sürüm ise size bir checkpoint verir ve sayıyı hesaplamayı size bırakır.

Sayıyı hesaplamak zor değil. Yalnızca çoğu ekip bunu hiç yapmıyor; $0 değerindeki bir indirmeyi $3.00/MTok'luk bir API ile karşılaştırıp indirmenin daha ucuz olduğu sonucuna varıyorlar. Belki de öyledir. Ama sonucu hesap belirler ve hesapta insanların unuttuğu tek bir terim vardır.

Formül

Milyon token başına maliyet, instance'ın saatlik fiyatının o instance'ın bir saatte ürettiği token sayısına bölünmesiyle bulunur:

MTok başına maliyet = saatlik_fiyat / (saniyedeki_token * 3600) * 1,000,000

Saatte $2.00 ve ölçülen saniyede 1,500 token ile hesap şöyle: 2.00 / 5,400,000 * 1,000,000 = milyon token başına $0.37. 3.00 $/MTok çıktı fiyatlı barındırılan bir modelle karşılaştırıldığında, kendi barındırmanın sekiz kat tasarruf gibi görünmesi bu yüzden. Ama bu rakam da yanlış, çünkü ödediğiniz her saniye GPU'nun meşgul olduğunu varsayar.

Herkesin unuttuğu terim: kullanım oranı

Saati kiralarsınız; ama onun yalnızca bir kısmını kullanırsınız. Bu kısma bölün:

Kullanım oranıEtkin MTok maliyeti
%100$0.37
%60$0.62
%30$1.23
%10$3.70

Kullanım oranı %10 olduğunda, kendi barındırdığınız model, yerini almak için tasarlandığı barındırılan API'den daha pahalıya gelir. Çoğu ilk dağıtım %10 ile %30 arasında kalır; çünkü trafik dalgalıdır ve instance zirve yük için boyutlandırılmıştır. Tasarruf gerçektir, ama bu bir kullanım oranı tasarrufudur, ağırlıklar tasarrufu değildir.

Sayıya dahil edilmesi gereken diğer kalemler

Checkpoint için depolama ve çıkış trafiği. Instance açıldıktan sonra modelin hazır hale gelmesine kadar geçen boşta bekleme süresi; büyük bağlamlı bir modelde yükleme dakikalar sürer ve bunların hepsi için ödeme yaparsınız. Bir düğüm arızasında ayakta kalmak için birden fazla instance gerekiyorsa yedeklilik. Ve saatlik faturalanmayan ama ilk yılın en büyük kalemi olan mühendislik zamanı.

Bunların hiçbiri kendi barındırmaya karşı bir argüman değildir. Yalnızca, bölme işlemini yapmadan ücretsiz bir indirmeyi token başına bir tarifeyle karşılaştırmanın yanlış olduğunu gösterir.

Taahhütten önce ölçün

Modeli gerçekte kiralayacağınız instance üzerinde, kendi prompt yapılarınız ve bağlam uzunluklarınızla çalıştırın; eşzamanlılık altında saniyedeki token sayısını kaydedin — model kartındaki tek akış sayısını değil. Ardından gerçek saatlik trafik profilinizden kullanım oranını hesaplayın. İki sayı, bir bölme işlemi ve karar kendiliğinden ortaya çıkar.

Uzun bağlam en çok bu noktada zorlar. 262K tokenlık bir bağlam, bir özellikten önce bir bellek ayak izidir: instance sınıfını o belirler ve instance sınıfı da formülün başındaki saatlik fiyatı belirler. Modelin desteklediği bağlamı değil, gerçekten gönderdiğiniz bağlamı fiyatlandırın.

İlgili

İlgili


Bunu kendi altyapınıza uygulamak mı istiyorsunuz? Sağlayıcı faturalarını, ağ geçidi kayıtlarını ve ana iş akışlarını getirin; maliyet etkenlerini ve tasarruf yolunu çıkaralım. Ücretsiz denetim planlayın →

finopsllm.com'a dön