Chuyển đến nội dung

Mô hình chi phí Claude Fable 5.1

Cập nhật September 1, 2026 · đăng lần đầu September 1, 2026

Trả lời nhanh: Claude Fable 5.1 (claude-fable-5-1) được định giá $10 cho mỗi triệu token đầu vào và $50 cho mỗi triệu token đầu ra. Opus 5 là $5 và $25. Chỉ nhìn bốn con số đó, Fable trông như một mức phí cố định...

Claude Fable 5.1 (claude-fable-5-1) được định giá $10 cho mỗi triệu token đầu vào và $50 cho mỗi triệu token đầu ra. Opus 5 là $5 và $25. Chỉ nhìn bốn con số đó, Fable trông như một mức phí cố định gấp 2×. Đó là mô hình sai. Giá cache đi theo chiều ngược lại, và với khối lượng production, cache thường chứa phần lớn token.

Bốn mức giá quan trọng

Một mô hình không có một mức giá duy nhất. Fable 5.1 tính phí năm loại token khác nhau, và chỉ hai loại nằm trên bảng giá chính.

Loại tokenFable 5.1Opus 5
Đầu vào (chưa cache)$10.00 / MTok$5.00 / MTok
Đầu ra$50.00 / MTok$25.00 / MTok
Ghi cache (5 phút)$12.50 / MTok$6.25 / MTok
Ghi cache (1 giờ)$20.00 / MTok$10.00 / MTok
Đọc cache$0.25 / MTok$0.50 / MTok

Đọc cache là điểm bất thường. Nó bằng 2,5% giá đầu vào niêm yết của chính Fable, và bằng một nửa mức mà cùng một token đã cache tốn trên Opus 5. Mọi dòng khác đều là 2×; dòng này là 0,5×.

Điều đó tác động thế nào đến khối lượng thực

Xét một agent có system prompt 100,000 token, schema công cụ và ngữ cảnh truy xuất, được tái sử dụng xuyên suốt phiên. Lần gọi lạnh, phần tiền tố tốn $1.00 trên Fable và $0.50 trên Opus 5. Lần gọi ấm tốn $0.025 trên Fable và $0.05 trên Opus 5. Nhà cung cấp đắt gấp đôi giờ rẻ bằng một nửa, trên cùng một prompt, vì thứ duy nhất thay đổi là tiền tố có trúng cache hay không.

Vậy điểm hòa vốn là một tỷ lệ trúng cache, không phải sở thích về mô hình. Dưới khoảng 50% token đầu vào được phục vụ từ cache, phụ phí đầu vào của Fable chiếm ưu thế và Opus 5 rẻ hơn ở phần tiền tố. Trên mức đó, giá cache của Fable vượt lên và tiếp tục bứt xa. Token đầu ra vẫn là 2× trong cả hai trường hợp, nên đòn bẩy thứ hai là độ dài đầu ra, không phải lựa chọn mô hình.

Đầu ra là phía không có trần

Fable 5.1 chấp nhận cửa sổ ngữ cảnh 1M token và có thể xuất tới 128K token đầu ra trong một phản hồi. Với $50 cho mỗi triệu, một phản hồi 128K duy nhất tốn $6.40 tiền đầu ra. Suy luận mở rộng luôn bật với mô hình này — không có cách nào tắt, và kiểm soát budget_tokens cũ bị từ chối với lỗi 400. Thay vào đó bạn có thiết lập effort từ low đến max. Đây giờ là núm điều chỉnh chi phí, và nó thuộc về chính sách định tuyến cùng với lựa chọn mô hình, không phải cấu hình mặc định trong ứng dụng mà không ai xem lại.

Phần suy luận thô không bao giờ được trả về, nên telemetry của bạn không thể dựng lại chi phí suy luận từ văn bản phản hồi. Bạn phải đọc nó từ khối usage ở mọi lần gọi và lưu lại. Mô hình này cũng không có Priority Tier, nên độ trễ không thể mua được — việc lập kế hoạch công suất phải làm bằng đồng thời và hàng đợi ở phía bạn.

Cần đo gì trước khi định tuyến traffic

Ba trường quyết định Fable 5.1 rẻ hay đắt với bạn, và không trường nào xuất hiện trên bảng giá.

Sau đó chạy so sánh dưới dạng cầu chênh lệch so với mô hình hiện tại, tách tỷ giá khỏi khối lượng và cơ cấu. Một mô hình có giá niêm yết gấp đôi và giá cache bằng một nửa sẽ hiện ra thành hai biến động lớn triệt tiêu nhau, còn một con số trung bình sẽ giấu cả hai.

Liên quan

Liên quan


Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →

Quay lại finopsllm.com