Mô hình chi phí Claude Fable 5.1
Cập nhật September 1, 2026 · đăng lần đầu September 1, 2026
Claude Fable 5.1 (claude-fable-5-1) được định giá $10 cho mỗi triệu token đầu vào và $50 cho mỗi triệu token đầu ra. Opus 5 là $5 và $25. Chỉ nhìn bốn con số đó, Fable trông như một mức phí cố định gấp 2×. Đó là mô hình sai. Giá cache đi theo chiều ngược lại, và với khối lượng production, cache thường chứa phần lớn token.
Bốn mức giá quan trọng
Một mô hình không có một mức giá duy nhất. Fable 5.1 tính phí năm loại token khác nhau, và chỉ hai loại nằm trên bảng giá chính.
| Loại token | Fable 5.1 | Opus 5 |
|---|---|---|
| Đầu vào (chưa cache) | $10.00 / MTok | $5.00 / MTok |
| Đầu ra | $50.00 / MTok | $25.00 / MTok |
| Ghi cache (5 phút) | $12.50 / MTok | $6.25 / MTok |
| Ghi cache (1 giờ) | $20.00 / MTok | $10.00 / MTok |
| Đọc cache | $0.25 / MTok | $0.50 / MTok |
Đọc cache là điểm bất thường. Nó bằng 2,5% giá đầu vào niêm yết của chính Fable, và bằng một nửa mức mà cùng một token đã cache tốn trên Opus 5. Mọi dòng khác đều là 2×; dòng này là 0,5×.
Điều đó tác động thế nào đến khối lượng thực
Xét một agent có system prompt 100,000 token, schema công cụ và ngữ cảnh truy xuất, được tái sử dụng xuyên suốt phiên. Lần gọi lạnh, phần tiền tố tốn $1.00 trên Fable và $0.50 trên Opus 5. Lần gọi ấm tốn $0.025 trên Fable và $0.05 trên Opus 5. Nhà cung cấp đắt gấp đôi giờ rẻ bằng một nửa, trên cùng một prompt, vì thứ duy nhất thay đổi là tiền tố có trúng cache hay không.
Vậy điểm hòa vốn là một tỷ lệ trúng cache, không phải sở thích về mô hình. Dưới khoảng 50% token đầu vào được phục vụ từ cache, phụ phí đầu vào của Fable chiếm ưu thế và Opus 5 rẻ hơn ở phần tiền tố. Trên mức đó, giá cache của Fable vượt lên và tiếp tục bứt xa. Token đầu ra vẫn là 2× trong cả hai trường hợp, nên đòn bẩy thứ hai là độ dài đầu ra, không phải lựa chọn mô hình.
Đầu ra là phía không có trần
Fable 5.1 chấp nhận cửa sổ ngữ cảnh 1M token và có thể xuất tới 128K token đầu ra trong một phản hồi. Với $50 cho mỗi triệu, một phản hồi 128K duy nhất tốn $6.40 tiền đầu ra. Suy luận mở rộng luôn bật với mô hình này — không có cách nào tắt, và kiểm soát budget_tokens cũ bị từ chối với lỗi 400. Thay vào đó bạn có thiết lập effort từ low đến max. Đây giờ là núm điều chỉnh chi phí, và nó thuộc về chính sách định tuyến cùng với lựa chọn mô hình, không phải cấu hình mặc định trong ứng dụng mà không ai xem lại.
Phần suy luận thô không bao giờ được trả về, nên telemetry của bạn không thể dựng lại chi phí suy luận từ văn bản phản hồi. Bạn phải đọc nó từ khối usage ở mọi lần gọi và lưu lại. Mô hình này cũng không có Priority Tier, nên độ trễ không thể mua được — việc lập kế hoạch công suất phải làm bằng đồng thời và hàng đợi ở phía bạn.
Cần đo gì trước khi định tuyến traffic
Ba trường quyết định Fable 5.1 rẻ hay đắt với bạn, và không trường nào xuất hiện trên bảng giá.
- Tỷ lệ trúng cache theo tính năng. Không phải trung bình cấp tài khoản — một bề mặt chat ở 90% và một job batch ở 0% triệt tiêu nhau thành con số 45% vô nghĩa.
- Khuếch đại ghi cache. Ghi 1 giờ tốn 2× giá đầu vào niêm yết. Một tiền tố bị ghi lại thường xuyên hơn là được đọc sẽ lỗ ròng ở mọi TTL.
- Token đầu ra cho mỗi tác vụ thành công. Phụ phí đầu ra 2× chỉ đáng khi cần ít lần thử hơn. Hãy đo chi phí mỗi tác vụ thành công, không phải chi phí mỗi lần gọi.
Sau đó chạy so sánh dưới dạng cầu chênh lệch so với mô hình hiện tại, tách tỷ giá khỏi khối lượng và cơ cấu. Một mô hình có giá niêm yết gấp đôi và giá cache bằng một nửa sẽ hiện ra thành hai biến động lớn triệt tiêu nhau, còn một con số trung bình sẽ giấu cả hai.
Liên quan
Liên quan
Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →