Chuyển đến nội dung

Mức nỗ lực của Opus 5.5 mới là giá thực

Cập nhật September 22, 2026 · đăng lần đầu September 22, 2026

Claude Opus 5.5 niêm yết giá $4 cho mỗi triệu token đầu vào và $20 cho mỗi triệu token đầu ra. Con số này thấp hơn Opus 5 20%. Bảng giá chỉ là nửa nhỏ của câu chuyện chi phí. Nửa lớn hơn là cài đặt effort, quyết định mô hình tiêu tốn bao nhiêu token để suy nghĩ trước khi trả lời.

Một mô hình, năm mức giá

Opus 5.5 cho phép chọn nỗ lực từ low đến medium, high, xhigh và max. Mỗi mức là cùng một mô hình với cùng đơn giá theo token, nhưng số token tạo ra rất khác nhau. Kết quả benchmark độc lập do The Decoder công bố cho thấy bốn trong năm mức nằm trên đường biên Pareto chi phí-hiệu năng. Cũng theo đó, ở mức nỗ lực tối đa, Opus 5.5 dùng khoảng 119,000 token đầu ra cho mỗi tác vụ, nhiều hơn hẳn các mô hình cạnh tranh ở mức cao nhất của họ.

Với $20 cho mỗi triệu token, 119,200 token đầu ra tốn $2.38 cho mỗi tác vụ trước khi tính đầu vào. Ở mức medium, Artificial Analysis đo được 25,700 token đầu ra, tức $0.51. Tính cả đầu vào, mức max tốn $5.98 cho mỗi tác vụ còn medium tốn $1.34: cùng một mô hình đắt hơn khoảng 4.5× cho mỗi tác vụ, chỉ tùy một tham số của yêu cầu.

Đo trên Artificial Analysis Intelligence Index v4.3.2 (mười bài đánh giá), đọc ngày 22 tháng 9 năm 2026. Mọi hàng dùng cùng một bộ benchmark nên có thể so sánh trực tiếp.

Mô hình và nỗ lựcIntelligence IndexChi phí mỗi tác vụToken đầu ra mỗi tác vụNằm trên đường biên chi phí–hiệu năng
Opus 5.5 · low42.3$0.5510,200Không
Opus 5.5 · medium51.2$1.3425,700Có
Opus 5.5 · high53.6$1.8235,600Có
Opus 5.5 · xhigh56.0$3.4665,700Có
Opus 5.5 · max57.6$5.98119,200Có
Opus 5 · high (tham chiếu)48.1$3.6146,200Không

Nguồn: Artificial Analysis. Nằm trên đường biên nghĩa là không có cài đặt nào của GPT-6 Sol, GPT-6 Astra, Opus 5, Opus 5.5 hay Fable 5.1 đạt điểm cao hơn với chi phí thấp hơn. Opus 5.5 low nằm ngoài đường biên vì GPT-6 Sol ở xhigh đạt 44.1 với $0.53. Chuyển từ xhigh lên max thêm 1.6 điểm nhưng tốn thêm 73% chi phí.

Medium là mức Anthropic dùng để so sánh

Phép so sánh nổi bật của Anthropic được thực hiện ở mức nỗ lực mặc định, tức medium. Họ cho rằng Opus 5.5 ở medium vượt GPT-6 Astra ở mức max trong công việc tri thức, với chi phí mỗi tác vụ chỉ bằng khoảng một phần năm. Vậy lập luận của chính Anthropic về mô hình này được xây dựng trên medium, còn max là ngoại lệ. Một đội đặt max ở mọi nơi "cho chắc ăn" đang trả tiền cho những token mà các benchmark khi ra mắt không cần đến.

Cách đặt nỗ lực mà không phải đoán

  1. Mặc định là medium. Hãy ghi rõ giá trị này trong code, đừng dựa vào giá trị mặc định của SDK vì nó có thể thay đổi mà bạn không hay biết.
  2. Tăng nỗ lực theo từng tuyến, không tăng toàn cục. Gỡ lỗi khó, lập kế hoạch dài hạn và bước review cuối có thể đáng dùng high hoặc max. Phân loại, trích xuất và chỉnh sửa thường ngày hiếm khi cần.
  3. Ghi log mức nỗ lực cho mọi yêu cầu. Không có nó thì chi phí mỗi yêu cầu không thể diễn giải được. Chi phí tăng vọt trong khi số yêu cầu không đổi thường là do thay đổi nỗ lực.
  4. So sánh các mức nỗ lực trên cùng những tác vụ đã replay. Ghi lại tỷ lệ thành công và số token đầu ra cho mỗi tác vụ hoàn thành ở từng mức, rồi ngừng tăng nỗ lực khi tỷ lệ thành công không còn cải thiện.
  5. Giới hạn đầu ra ở nơi sản phẩm cho phép. Giới hạn số token tối đa khoanh vùng trường hợp xấu nhất. Ở mức max, giới hạn này là thứ duy nhất ngăn một tác vụ chạy mất kiểm soát thành một yêu cầu tốn vài đô la.

Việc giảm từ $25 xuống $20 cho mỗi triệu token đầu ra tiết kiệm được 20%. Chuyển một khối lượng công việc từ max sang medium có thể tiết kiệm nhiều hơn thế. Hãy coi nỗ lực là một khoản trong ngân sách, có người sở hữu và rà soát như mọi khoản khác.

Liên quan


Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →

Quay lại finopsllm.com