Claude Haiku 5.5 và ngưỡng giá 100k token
Cập nhật October 8, 2026 · đăng lần đầu October 8, 2026
Giá tiêu đề của Claude Haiku 5.5 phụ thuộc vào độ dài prompt. Anthropic đã phát hành mô hình vào ngày 7 tháng Mười năm 2026 cho các công việc khối lượng lớn như phân loại, tóm tắt và tác vụ subagent. Cửa sổ ngữ cảnh 1 triệu token của nó không có nghĩa là mọi token đó đều tính theo đơn giá prompt ngắn: một prompt vượt 100.000 token sẽ dùng bậc giá cao hơn. Điều này biến việc định cỡ yêu cầu thành một quyết định ngân sách, đặc biệt với các agent tích lũy tài liệu và kết quả công cụ.
Bảng giá có hai mặt
Dưới đây là giá tiêu chuẩn đã công bố của Claude API từ Anthropic tính bằng đô la Mỹ trên mỗi triệu token, kiểm tra ngày 8 tháng Mười. Ranh giới là tới 100.000 token prompt so với trên 100.000; nó không phải là mức giá chỉ áp dụng cho phần token vượt ngưỡng. Hãy kiểm tra tài liệu giá trực tiếp trước khi dùng các con số này trong dự báo.
| Loại token | Prompt tới 100k | Prompt trên 100k |
|---|---|---|
| Đầu vào chưa cache | $0.10 | $0.50 |
| Đầu ra | $0.50 | $2.50 |
| Ghi cache 5 phút | $0.125 | $0.625 |
| Ghi cache 1 giờ | $0.20 | $1.00 |
| Đọc cache | $0.01 | $0.05 |
Mỗi mức giá token được liệt kê cao gấp năm lần phía trên ranh giới. Điều đó không có nghĩa là mọi hóa đơn ứng dụng đều tăng gấp năm: phần lớn lệnh gọi có thể vẫn ngắn, và khối lượng đầu ra, cache, công cụ, xử lý batch, các lần thử lại và tỷ lệ thành công của tác vụ đều ảnh hưởng đến tổng chi tiêu. Ngữ cảnh đã cache vẫn chiếm chỗ trong prompt; một lần trúng cache không biến yêu cầu 120k token thành một prompt ngắn.
Ranh giới trông như thế nào trên một yêu cầu
Hãy xem xét hai lệnh gọi minh họa không có cache hay công cụ tính phí riêng, mỗi lệnh tạo 1,000 token đầu ra. Một prompt 99,000 token tốn khoảng $0.0104 cho đầu vào cộng đầu ra theo đơn giá prompt ngắn. Một prompt 101,000 token tốn khoảng $0.0530 theo đơn giá prompt dài. Tức là gấp khoảng năm lần cho một yêu cầu chỉ dài hơn 2,000 token đầu vào. Ví dụ này giữ đầu ra cố định để tách riêng ranh giới giá; nó không phải là mức tiết kiệm đo được trong production. Prompt thực tế còn gồm chỉ thị hệ thống, lịch sử hội thoại, schema công cụ và kết quả công cụ.
Đếm lại trước khi chuyển đổi
Ghi chú chuyển đổi của Anthropic nói rằng cùng một văn bản tạo ra xấp xỉ nhiều hơn 30% token trên Haiku 5.5 so với Haiku 4.5, và sự khác biệt tùy theo nội dung. Một prompt trông thoải mái dưới 100k theo cách đếm token cũ có thể vượt ranh giới mới. Đừng nhân mọi số đếm cũ với 1.3 rồi coi đó là dự báo hóa đơn; hãy đếm lại các yêu cầu tiêu biểu bằng claude-haiku-5-5.
Endpoint đếm token của Anthropic nhận thông điệp có cấu trúc, system prompt và các công cụ phía client được hỗ trợ trước khi gửi yêu cầu sinh. Đếm theo mô hình đích, rồi ghi lại usage thực tế sau phản hồi. Số đếm trước là ước tính và có thể khác chút ít so với đầu vào được tính phí; một số công cụ phía server và khối URL/tệp không được bộ đếm hỗ trợ. Với những đường đi đó, hãy dựa vào usage quan sát được và giữ một biên an toàn gần ngưỡng.
Quy tắc ngân sách prompt cho subagent
- Đo phân phối. Ghi lại số token prompt của Haiku 5.5 theo khối lượng công việc, mã mô hình và kết quả tác vụ. Theo dõi có bao nhiêu lệnh gọi tập trung gần hoặc vượt 100k, thay vì chỉ nhìn vào trung bình.
- Cảnh báo trước ranh giới. Đánh dấu các yêu cầu gần ngưỡng trong bộ điều phối agent. Coi mức cảnh báo là biên vận hành của riêng bạn, không phải quy tắc giá của Anthropic.
- Cắt bớt nguyên nhân. Loại bỏ các đoạn truy xuất trùng lặp, giới hạn kích thước kết quả công cụ, hoặc nén lịch sử cũ khi các bài kiểm tra chất lượng cho phép. Đừng bỏ bằng chứng mà agent cần chỉ để tiết kiệm token.
- So sánh phần đuôi dài. Với các prompt dài không tránh được, hãy thử Haiku ở bậc giá cao hơn so với một tuyến khác trên cùng tác vụ. So sánh chi phí trên mỗi kết quả được chấp nhận, độ trễ và tần suất dự phòng, không chỉ giá niêm yết.
- Đối chiếu với hóa đơn. Tính giá đầu vào, đầu ra, đọc và ghi cache thực tế theo bậc áp dụng, rồi cộng thêm công cụ và các lần thử lại. Kiểm tra lại giá của nhà cung cấp hoặc nền tảng đám mây và mọi chiết khấu hợp đồng.
Haiku 5.5 vẫn có thể là lựa chọn tốt nhất trên 100k, nhưng đó nên là một quyết định định tuyến đã đo lường. Kiểm soát quan trọng là biết yêu cầu nào vượt qua ranh giới và vì sao.
Các câu hỏi đội thường đặt ra
Giá cao hơn chỉ áp dụng cho token trên 100k phải không?
Không. Anthropic mô tả Haiku 5.5 được tính giá theo độ dài prompt: một prompt vượt 100.000 token trả đơn giá cao hơn đã công bố cho yêu cầu đó.
Cache prompt có thể giữ một yêu cầu dài ở bậc rẻ hơn không?
Không. Token tái sử dụng có thể nhận đơn giá đọc cache, nhưng ngữ cảnh đã cache vẫn chiếm độ dài prompt. Hãy đếm toàn bộ prompt khi kiểm tra ngưỡng.
Việc tăng 30% số token của bộ đếm có được đảm bảo không?
Không. Anthropic nói xấp xỉ nhiều hơn 30% token cho cùng một văn bản so với Haiku 4.5, tùy theo nội dung. Hãy đếm prompt của chính bạn trên mô hình đích.
Liên quan
- Cửa sổ ngữ cảnh bạn trả tiền hai lần
- Chi phí trên mỗi tác vụ thành công
- Ba ngân sách cho agent tự động
Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →