Chuyển đến nội dung

Giá Claude Sonnet 5.5: những gì thay đổi, những gì không

Cập nhật September 28, 2026 · đăng lần đầu September 27, 2026

Claude Sonnet 5.5 có giá $2 cho mỗi triệu token đầu vào và $10 cho mỗi triệu token đầu ra trên API của Anthropic, cùng mức giá niêm yết với Sonnet 5. Điểm thay đổi về kinh tế nằm ở hiệu quả: Anthropic cho biết Sonnet 5.5 có thể giảm tới 30% chi phí mỗi tác vụ nhờ dùng ít token hơn, đồng thời tạo đầu ra nhanh hơn hơn 30%. Đây là mức tối đa do nhà cung cấp công bố, không phải mức giảm được đảm bảo cho mọi khối lượng công việc.

Khi lập dự báo ngân sách, hãy giữ đơn giá token cố định và mô hình hóa riêng khả năng giảm số token cùng số bước của agent. Hãy đo hỗn hợp tác vụ thực tế của bạn trước khi áp dụng bất kỳ giả định tiết kiệm nào.

Giá API của Sonnet 5.5

Loại tokenGiá mỗi triệu
Đầu vào$2.00
Đầu ra$10.00
Ghi cache 5 phút$2.50
Ghi cache 1 giờ$4.00
Đọc cache$0.20

Anthropic công bố các mức giá này trong thông báo ra mắt Sonnet 5.5. Đừng hiểu “tới 30% chi phí mỗi tác vụ” là giảm 30% đơn giá token: giá đầu vào và đầu ra không đổi so với Sonnet 5. Mức $2/$10 của Sonnet 5 hiện cũng là mức chuẩn, sau khi Anthropic hủy đợt tăng giá dự kiến vào tháng 9.

Ví dụ: hiệu quả token so với thay đổi đơn giá

Xét một tác vụ dùng 100,000 token đầu vào và 10,000 token đầu ra, không dùng cache. Theo giá công bố của Sonnet 5.5, đó là $0.20 cho đầu vào cộng $0.10 cho đầu ra, tức $0.30 mỗi tác vụ. Nếu cùng tác vụ đó dùng ít hơn 30% token ở cả hai loại, chi phí mô hình hóa sẽ là $0.21. Đây chỉ là minh họa phép tính, không phải cam kết rằng mọi tác vụ sẽ dùng ít hơn 30% token.

Với khối lượng 10,000 tác vụ như vậy mỗi tháng, mức nền là $3,000. Giảm 30% khối lượng token sẽ tiết kiệm $900, đưa hóa đơn tháng mô hình hóa xuống $2,100. Kết quả thực tế thay đổi theo độ dài prompt, tỷ lệ tái sử dụng cache, độ dài đầu ra, mức nỗ lực suy luận, số lần thử lại và số lần gọi công cụ.

Benchmark ra mắt cho thấy gì và không cho thấy gì

Anthropic báo cáo cải thiện trong các đánh giá lập trình và công việc tri thức, bao gồm Terminal-Bench 4.0 và CursorBench. Công ty cũng cho biết Sonnet 5.5 tạo đầu ra nhanh hơn hơn 30% so với Sonnet 5, và trong nhiều so sánh benchmark, đạt điểm tương đương các kết quả trước đây của Sonnet 5 với một phần nhỏ chi phí mỗi tác vụ. Những kết quả này là giả thuyết hữu ích cho kế hoạch đánh giá, nhưng là số liệu do nhà cung cấp công bố, không phải dữ liệu chi phí độc lập từ môi trường production.

Một lưu ý thực tế: model nhanh hơn không tự động làm giảm hóa đơn API tính theo token. Hóa đơn giảm khi lượng dùng cho mỗi tác vụ hoàn thành giảm, hoặc khi ít tác vụ phải thử lại hay chuyển cấp. Tạo đầu ra nhanh hơn có thể chỉ cải thiện thông lượng hoặc giảm độ trễ, trong khi chi tiêu token không đổi.

Cách an toàn để dự báo việc áp dụng

  1. Giữ bảng giá cố định. Dùng $2/$10 cho mỗi triệu token đầu vào/đầu ra làm điểm xuất phát cho Sonnet 5 và 5.5.
  2. Đo lường công việc đã hoàn thành. So sánh chi phí cho mỗi tác vụ được chấp nhận, không chỉ token mỗi yêu cầu. Nếu có thể, tính cả thử lại, lời gọi công cụ và công sức sửa lại của con người.
  3. Tách theo khối lượng công việc. Đánh giá riêng lập trình, hỗ trợ khách hàng, trích xuất và tác vụ ngữ cảnh dài; một tỷ lệ tiết kiệm trung bình có thể che giấu các suy giảm chất lượng.
  4. Dùng một khoảng. Lập ngân sách với mức tiết kiệm 0% cho đến khi thử nghiệm nội bộ có bằng chứng, rồi bổ sung các kịch bản đã đo. Hãy xem “tới 30%” của Anthropic là cận trên, không phải dự báo của bạn.
  5. Kiểm tra lại chất lượng và độ trễ. Hóa đơn token thấp hơn không phải là tiết kiệm nếu tỷ lệ chấp nhận giảm hoặc phải dùng các model dự phòng đắt hơn.

FAQ

Sonnet 5.5 có rẻ hơn theo từng token không?

Không. Anthropic công bố cùng mức $2 đầu vào và $10 đầu ra cho mỗi triệu token như Sonnet 5. Tuyên bố về chi phí mỗi tác vụ đến từ việc dùng ít token hơn để hoàn thành công việc tương đương.

Có đảm bảo tiết kiệm 30% không?

Không. Anthropic mô tả mức giảm chi phí tới 30% cho đa số công việc trong tài liệu ra mắt. Kết quả của bạn phụ thuộc vào khối lượng công việc, prompt caching, cài đặt mức nỗ lực và chất lượng hoàn thành tác vụ.

Một yêu cầu có cache tốn bao nhiêu?

Anthropic liệt kê đọc cache ở mức $0.20 mỗi triệu token, ghi 5 phút ở mức $2.50 và ghi 1 giờ ở mức $4.00. Hãy xem tài liệu giá API của Claude hiện hành trước khi chốt dự báo.

Có nên chuyển ngay lưu lượng production không?

Hãy chạy đánh giá đại diện trước. Thử model ở chế độ shadow hoặc canary, so sánh chi phí mỗi kết quả được chấp nhận và độ trễ, đồng thời giữ đường quay lui cho các khối lượng công việc bị suy giảm.

Nguồn và tài liệu liên quan

Liên quan


Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →

Quay lại finopsllm.com