Chuyển đến nội dung

Chi phí thực mỗi tác vụ trên các mô hình hàng đầu

Cập nhật September 22, 2026 · đăng lần đầu September 22, 2026

Giá niêm yết cho biết một token tốn bao nhiêu. Nó không cho biết một tác vụ hoàn thành tốn bao nhiêu, vì các mô hình tiêu tốn số token rất khác nhau để hoàn thành cùng một công việc. Trang này đặt cạnh nhau chi phí đo được cho mỗi tác vụ và điểm chất lượng của Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra và GPT-6 Sol ở mọi mức nỗ lực. Mọi con số đều có nguồn, không có số nào là ước tính.

Câu trả lời ngắn gọn: GPT-6 Sol là cách rẻ nhất để đạt bất kỳ điểm nào đến 47.5. Trên 47.5, Opus 5.5 là lựa chọn rẻ nhất ở mọi mức. Không cấu hình nào của GPT-6 Astra trên mức low, Opus 5 hay Fable 5.1 hiệu quả về chi phí: mỗi cấu hình đều bị một cấu hình nào đó của Sol hoặc Opus 5.5 vượt cả về điểm lẫn giá.

Phương pháp

Mọi điểm số và chi phí đều lấy từ Artificial Analysis Intelligence Index v4.3.2, đọc ngày 22 tháng 9 năm 2026. Chỉ số này chạy mười đánh giá: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience và AA-LCR. Artificial Analysis chạy từng mô hình ở từng mức nỗ lực qua API của nhà cung cấp và ghi lại số tiền phải trả theo giá niêm yết. Chi phí mỗi tác vụ là mức chi tiêu đó chia cho tác vụ, tách thành đầu vào và đầu ra. Cùng một bộ kiểm tra chạy cho mọi dòng, nên các dòng có thể so sánh trực tiếp.

Có hai giới hạn cần biết trước khi đọc số liệu. Thứ nhất, chỉ số chỉ là một tổ hợp tác vụ. Tổ hợp của bạn sẽ làm chi phí thay đổi, đó là lý do phần cuối giải thích cách đo chi phí của chính bạn. Thứ hai, điểm số từ các phiên bản chỉ số khác nhau không so sánh được, nên đừng trộn các số liệu này với những con số đã công bố trước đó.

Bảng đầy đủ: 26 cấu hình

Số token đầu ra mỗi tác vụ là số token mô hình viết ra, bao gồm cả phần suy luận. Artificial Analysis không công bố tỷ lệ đầu vào và đầu ra cho bốn cấu hình GPT-6 Sol ở giữa, nên các ô đó ghi n/a.

Mô hìnhNỗ lựcIntelligence IndexChi phí mỗi tác vụChi phí đầu vàoChi phí đầu raToken đầu ra mỗi tác vụTrên biên
GPT-6 Solnone28.1$0.33$0.28$0.054,900Không
GPT-6 Sollow33.9$0.13n/an/a3,400Có
GPT-6 Solmedium (mặc định)39.8$0.25n/an/a6,500Có
GPT-6 Solhigh42.8$0.37n/an/a10,200Có
GPT-6 Solxhigh44.1$0.53n/an/a16,000Có
GPT-6 Solmax47.5$1.06$0.74$0.3131,200Có
GPT-6 Astralow45.8$0.82$0.60$0.224,400Có
GPT-6 Astramedium49.6$1.54$1.06$0.489,600Không
GPT-6 Astrahigh50.9$1.73$1.13$0.5911,800Không
GPT-6 Astraxhigh52.4$2.31$1.46$0.8516,900Không
GPT-6 Astramax52.7$3.26$1.90$1.3627,200Không
Claude Opus 5low39.4$1.10$0.73$0.3714,700Không
Claude Opus 5medium44.8$2.19$1.47$0.7229,000Không
Claude Opus 5high (mặc định)48.1$3.61$2.46$1.1646,200Không
Claude Opus 5xhigh49.7$4.88$3.36$1.5260,700Không
Claude Opus 5max50.8$5.86$4.05$1.8172,500Không
Claude Opus 5.5low42.3$0.55$0.35$0.2010,200Không
Claude Opus 5.5medium (mặc định)51.2$1.34$0.82$0.5125,700Có
Claude Opus 5.5high53.6$1.82$1.11$0.7135,600Có
Claude Opus 5.5xhigh56.0$3.46$2.15$1.3165,700Có
Claude Opus 5.5max57.6$5.98$3.60$2.38119,200Có
Claude Fable 5.1low46.8$2.37$1.30$1.0821,600Không
Claude Fable 5.1medium48.9$2.98$1.59$1.3927,900Không
Claude Fable 5.1high51.2$3.91$2.01$1.9038,100Không
Claude Fable 5.1xhigh53.2$5.98$2.96$3.0260,500Không
Claude Fable 5.1max53.4$7.63$3.73$3.9078,100Không

Trên biên nghĩa là không có cấu hình nào khác trong bảng này đạt điểm cao hơn với số tiền thấp hơn.

Đường biên chi phí

Mười trong số 26 cấu hình nằm trên biên. Xếp theo chi phí, chúng là những cấu hình duy nhất đáng cân nhắc chỉ dựa trên giá. Mọi cấu hình khác hoặc trả nhiều hơn cho cùng điểm, hoặc đạt ít điểm hơn với cùng mức chi.

Cấu hìnhIntelligence IndexChi phí mỗi tác vụMỗi 10.000 tác vụ
GPT-6 Sol · low33.9$0.13$1,300
GPT-6 Sol · medium39.8$0.25$2,500
GPT-6 Sol · high42.8$0.37$3,700
GPT-6 Sol · xhigh44.1$0.53$5,300
GPT-6 Astra · low45.8$0.82$8,200
GPT-6 Sol · max47.5$1.06$10,600
Claude Opus 5.5 · medium51.2$1.34$13,400
Claude Opus 5.5 · high53.6$1.82$18,200
Claude Opus 5.5 · xhigh56.0$3.46$34,600
Claude Opus 5.5 · max57.6$5.98$59,800

Biên có hai vùng. Từ $0.13 đến $1.06 gần như toàn bộ là GPT-6 Sol, với GPT-6 Astra low là ngoại lệ duy nhất ở $0.82. Từ $1.34 trở lên chỉ có Opus 5.5. Khoảng cách giữa hai vùng nhỏ: Opus 5.5 medium đạt điểm cao hơn Sol max 3.7 điểm với chi phí mỗi tác vụ cao hơn $0.28.

Đối đầu trực tiếp ở điểm bằng hoặc cao hơn

Các cặp này so sánh một cấu hình rẻ hơn với một cấu hình đắt hơn nhưng đạt điểm bằng hoặc thấp hơn.

Cấu hình rẻ hơnCấu hình đắt hơnChênh lệch điểmTiết kiệm chi phí
Opus 5.5 medium: 51.2, $1.34Opus 5 high: 48.1, $3.61+3.1 cho Opus 5.563%
Opus 5.5 medium: 51.2, $1.34Opus 5 max: 50.8, $5.86+0.4 cho Opus 5.577%
Opus 5.5 medium: 51.2, $1.34Fable 5.1 high: 51.2, $3.91hòa66%
Opus 5.5 high: 53.6, $1.82GPT-6 Astra max: 52.7, $3.26+0.9 cho Opus 5.544%
Opus 5.5 high: 53.6, $1.82Fable 5.1 max: 53.4, $7.63+0.2 cho Opus 5.576%
GPT-6 Sol max: 47.5, $1.06Opus 5 high: 48.1, $3.61+0.6 cho Opus 571%

Dòng Opus 5 quan trọng với các đội chưa chuyển đổi. Opus 5 chạy mặc định ở mức nỗ lực high. Opus 5.5 chạy mặc định ở medium, và với mặc định đó nó đạt điểm cao hơn 3.1 điểm với chi phí mỗi tác vụ thấp hơn 63%. Anthropic nói Opus 5.5 rẻ hơn Opus 5 40%; khoảng cách đo được trên chỉ số này lớn hơn mức được công bố.

Tiền đi đâu: đầu vào, không phải đầu ra

Với mọi mô hình, đầu vào chiếm khoảng từ một nửa đến ba phần tư chi phí mỗi tác vụ. Với Opus 5.5 ở medium, $0.82 trong số $1.34 là đầu vào, tức 61%. Với GPT-6 Astra ở max là 58%, GPT-6 Sol ở max là 70%, và Fable 5.1 ở max là 49%. Tác vụ agent gửi lại ngữ cảnh ngày càng dài ở mỗi bước, nên chi tiêu đầu vào tăng theo số bước, không chỉ theo độ dài câu trả lời.

Đó là lý do GPT-6 Sol ở chế độ none tốn nhiều hơn ở low: $0.33 so với $0.13, dù chỉ viết 4,900 token đầu ra. $0.28 trong số $0.33 là đầu vào. Nguyên nhân có thể là nhiều bước hơn, mỗi bước gửi lại ngữ cảnh. Tắt suy luận không làm agent rẻ hơn nếu sau đó nó cần nhiều lượt hơn.

Với hóa đơn của bạn, điều này có nghĩa là bộ nhớ đệm (caching) quan trọng ngang với lựa chọn mô hình. Opus 5.5 và GPT-6 Sol đều tính $0.20 cho mỗi triệu token đầu vào được lưu đệm. GPT-6 Astra tính $1.00 và Opus 5 tính $0.50.

Khối lượng token so với giá niêm yết

GPT-6 Astra là mô hình tiết kiệm token nhất trong danh sách này. Ở nỗ lực max, nó viết 27,200 token đầu ra mỗi tác vụ, so với 119,200 của Opus 5.5 max. Nhưng Astra tính $10 và $50 cho mỗi triệu token, gấp 2.5× mức giá của Opus 5.5. Giá niêm yết thắng: Opus 5.5 high tốn $1.82 mỗi tác vụ và đạt 53.6 điểm, còn Astra max tốn $3.26 và đạt 52.7 điểm.

Opus 5.5 ở max là nơi duy nhất sự dài dòng gây hại. 119,200 token đầu ra của nó tốn $2.38 trước khi tính đầu vào, và toàn bộ tác vụ tốn $5.98. Mức này mua được điểm cao nhất trong bảng, 57.6, nhưng chi phí gấp 4.5× medium.

Lợi suất giảm dần theo nỗ lực

Mỗi dòng cho thấy việc tăng một bậc nỗ lực mang lại gì, tính bằng điểm chỉ số so với chi phí mỗi tác vụ tăng thêm.

Mô hìnhmedium → highxhigh → max
GPT-6 Sol+3.0 điểm, tăng 48%+3.4 điểm, tăng 100%
GPT-6 Astra+1.3 điểm, tăng 12%+0.3 điểm, tăng 41%
Claude Opus 5+3.3 điểm, tăng 65%+1.1 điểm, tăng 20%
Claude Opus 5.5+2.4 điểm, tăng 36%+1.6 điểm, tăng 73%
Claude Fable 5.1+2.3 điểm, tăng 31%+0.2 điểm, tăng 28%

Với Fable 5.1 và GPT-6 Astra, nỗ lực max gần như không mang lại gì: 0.2 và 0.3 điểm với mức tăng 28% và 41%. Với Opus 5.5, bước lên max vẫn mang lại 1.6 điểm, nhưng tốn thêm 73%. Chỉ dùng max cho những tác vụ mà bạn đã đo được rằng điểm tăng thêm thay đổi kết quả.

Khi nào GPT-6 Sol max là đủ

Chỉ số là một trung bình, và khoảng cách giữa Sol max và Opus 5.5 medium không đều trên các đánh giá. Điểm theo từng đánh giá từ Artificial Analysis:

Đánh giáOpus 5.5 medium ($1.34)GPT-6 Sol max ($1.06)
Terminal-Bench 4.052.543.9
AutomationBench-AA61.261.6
GDPval-AA (Elo)15761487
AA-Briefcase (Elo)16421483
Humanity's Last Exam54.747.9
SciCode59.357.6
CritPt27.730.9
AA-LCR84.383.7

Ở AutomationBench và CritPt, GPT-6 Sol bằng hoặc vượt Opus 5.5 medium với $1.06 mỗi tác vụ so với $1.34. Ở Terminal-Bench, các đánh giá công việc tri thức và Humanity's Last Exam, Opus 5.5 dẫn trước rất xa. Tự động hóa quy trình có thể chạy trên Sol. Agent terminal và lập trình, cùng công việc tri thức nặng tài liệu là nơi Opus 5.5 xứng đáng với giá của nó.

Số liệu của nhà cung cấp so với số liệu độc lập

Số liệu của nhà cung cấp và số liệu độc lập thường khác nhau, vì họ dùng các khung kiểm thử và cài đặt khác nhau. Anthropic báo cáo 66.4% trên Terminal-Bench 4.0 cho Opus 5.5 ở xhigh. Artificial Analysis đo được 59.6% ở cùng mức nỗ lực.

Nỗ lựcOpus 5.5Fable 5.1
low31.3%40.4%
medium52.5%44.9%
high56.6%52.0%
xhigh59.6%55.1%
max59.6%52.0%

Thứ hạng cũng có thể thay đổi theo chỉ số. Trên Vals AI Index, Fable 5.1 đứng đầu với 68.83%, GPT-6 Astra thứ ba với 66.61% và Opus 5.5 thứ tư với 66.16%. Chi phí mỗi tác vụ không được công bố trên cùng cơ sở ở đó, nên nó không làm thay đổi biên ở trên. Đó là lời nhắc rằng một chỉ số chỉ là một góc nhìn.

Giá niêm yết và một tác vụ nặng bộ nhớ đệm

Digital Applied đã định giá một tác vụ agent nặng bộ nhớ đệm trên từng mô hình: 8M token đọc từ cache, 400K đầu vào không qua cache, 600K token ghi cache và 300K đầu ra. Kết quả theo đúng biên, với một khoản phạt thêm cho GPT-6 Astra.

Mô hìnhĐầu vào $/MTokĐầu ra $/MTokĐọc cache $/MTokTác vụ nặng cache (Digital Applied)
GPT-6 Sol$2.00$10.00$0.20$6.90
Claude Opus 5.5$4.00$20.00$0.20$12.20
Claude Opus 5$5.00$25.00$0.50$17.25
Claude Fable 5.1$10.00$50.00$0.25$28.50
GPT-6 Astra (≤272K)$10.00$50.00$1.00$34.50
GPT-6 Astra (>272K)$20.00$75.00n/a$61.50

GPT-6 Astra tính toàn bộ yêu cầu ở mức $20 và $75 cho mỗi triệu token khi đầu vào vượt 272K token. Opus 5.5 giữ một mức giá duy nhất trong cửa sổ 1M token. Ghi cache của Opus 5.5 tốn $5 cho mỗi triệu token với cache 5 phút và $8 với cache 1 giờ, các job batch được tính 50%, và chế độ nhanh nhân đôi giá. Chi tiết xem mô hình chi phí Claude Opus 5.5 và kinh tế chế độ nhanh của Opus 5.5.

Cách đo chi phí mỗi tác vụ của chính bạn

  1. Ghi số token theo tác vụ, không theo yêu cầu: đầu vào không qua cache, đầu vào qua cache, ghi cache và đầu ra, cộng lại qua mọi bước của tác vụ.
  2. Lấy mẫu vài trăm tác vụ thực và chạy lại trên hai hoặc ba cấu hình ứng viên, ví dụ Sol max, Opus 5.5 medium và Opus 5.5 high.
  3. Chấm từng kết quả bằng cùng một kiểm tra bạn dùng trên production và đếm số tác vụ đạt.
  4. Chia tổng chi tiêu cho số tác vụ đạt. Chi phí mỗi tác vụ thành công là con số nên so sánh, vì một cấu hình rẻ nhưng thất bại thường xuyên hơn thì không hề rẻ.
  5. Chọn cấu hình rẻ nhất vượt ngưỡng chất lượng của bạn, rồi chỉ định tuyến những tác vụ thất bại sang một cấu hình cao hơn.
  6. Chạy lại phép thử khi giá hoặc mức nỗ lực mặc định thay đổi.

Về cách mức nỗ lực thay đổi hóa đơn của một mô hình, xem Các mức nỗ lực của Opus 5.5 mới là giá thực.

Lưu ý

Nguồn

Liên quan


Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →

Quay lại finopsllm.com