Chuyển đến nội dung

Định giá một mô hình trọng số mở

Cập nhật September 1, 2026 · đăng lần đầu September 1, 2026

Trả lời nhanh: Qwen3.8-Flash-Next ra mắt ngày 26 tháng 8 năm 2026 dưới dạng bản xem trước trọng số mở của kiến trúc Qwen4: khoảng 6B tham số hoạt động, cửa sổ ngữ cảnh gốc 262,144 token và chưa công bố giá lưu trữ....

Qwen3.8-Flash-Next ra mắt ngày 26 tháng 8 năm 2026 dưới dạng bản xem trước trọng số mở của kiến trúc Qwen4: khoảng 6B tham số hoạt động, cửa sổ ngữ cảnh gốc 262,144 token và chưa công bố giá lưu trữ. Sự kết hợp đó phá vỡ cách so sánh thông thường. Một mô hình đóng cho bạn một con số trên mỗi triệu token; một bản phát hành trọng số mở cho bạn một checkpoint và để con số đó cho bạn tự tính.

Con số này không khó tính. Chỉ là hầu hết các đội không bao giờ tính nó, mà thay vào đó so sánh bản tải về 0 USD với API 3.00 USD/MTok rồi kết luận bản tải về rẻ hơn. Có thể đúng. Phép tính mới quyết định, và phép tính đó có đúng một thành phần mà người ta hay quên.

Công thức

Chi phí trên mỗi triệu token bằng giá theo giờ của instance chia cho số token mà instance đó tạo ra trong một giờ:

cost per MTok = hourly_price / (tokens_per_second * 3600) * 1,000,000

Với 2.00 USD mỗi giờ và 1,500 token mỗi giây đo được, con số là 2.00 / 5,400,000 * 1,000,000 = 0.37 USD cho mỗi triệu token. So với một mô hình được host với giá 3.00 USD/MTok đầu ra, tự host trông như tiết kiệm gấp tám lần. Con số đó cũng sai, vì nó giả định GPU bận mỗi giây bạn trả tiền.

Thành phần bị bỏ quên: mức sử dụng

Bạn thuê theo giờ nhưng chỉ dùng một phần của nó. Hãy chia cho phần đó:

Mức sử dụngChi phí hiệu dụng mỗi MTok
100%$0.37
60%$0.62
30%$1.23
10%$3.70

Ở mức sử dụng 10%, mô hình tự host tốn kém hơn chính API được host mà nó định thay thế. Hầu hết các triển khai đầu tiên nằm trong khoảng 10% đến 30%, vì lưu lượng dao động thất thường và instance được cấp phát theo đỉnh tải. Khoản tiết kiệm là có thật, nhưng nó là tiết kiệm trên mức sử dụng, không phải trên trọng số.

Những gì khác nên nằm trong con số

Lưu trữ và băng thông ra cho checkpoint. Thời gian nhàn rỗi giữa lúc instance khởi động và lúc mô hình sẵn sàng — với một mô hình ngữ cảnh lớn, việc nạp mất vài phút và bạn trả cho tất cả. Dự phòng, nếu khối lượng công việc cần nhiều hơn một instance để sống sót khi một node hỏng. Và thời gian kỹ sư, vốn không tính theo giờ nhưng là khoản lớn nhất trong năm đầu.

Không điều nào trong số đó phản đối việc tự host. Chúng chỉ phản đối việc so sánh một bản tải miễn phí với mức giá theo token mà không thực hiện phép chia.

Đo trước khi cam kết

Chạy mô hình trên instance mà bạn thực sự sẽ thuê, với các prompt và độ dài ngữ cảnh của riêng bạn, rồi ghi lại token mỗi giây dưới tải đồng thời — không phải con số một luồng trong model card. Sau đó lấy hồ sơ lưu lượng theo giờ thực tế của bạn và tính mức sử dụng. Hai con số, một phép chia, và quyết định tự khắc được đưa ra.

Ngữ cảnh dài là nơi điều này gây tổn hại nặng nhất. Ngữ cảnh 262K token là một lượng bộ nhớ trước khi nó là một tính năng: nó quyết định loại instance, và loại instance quyết định giá theo giờ ở đầu công thức. Hãy định giá theo ngữ cảnh bạn thực sự gửi đi, không phải ngữ cảnh mà mô hình hỗ trợ.

Liên quan

Liên quan


Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →

Quay lại finopsllm.com