Mô hình chi phí OpenAI Decisions API: giá chỉ tính đầu vào và đầu ra có kiểu
Cập nhật October 7, 2026 · đăng lần đầu October 7, 2026
Decisions API của OpenAI là một endpoint beta, dùng để biến bằng chứng dạng văn bản hoặc hình ảnh được chia sẻ thành các phân loại, lựa chọn hoặc điểm số có kiểu. Với GPT-6 Luna, endpoint này tính $0.10 cho mỗi triệu token đầu vào, không tính token cache hay token đầu ra. Hãy xem tuyên bố "nhanh hơn 10 lần" như một tín hiệu về độ trễ, rồi kiểm tra chất lượng và tổng chi phí tác vụ trên khối lượng công việc của riêng bạn.
OpenAI đã phát hành gì vào ngày 6 tháng 10 năm 2026?
OpenAI đưa Decisions API ra phiên bản beta công khai vào ngày 6 tháng 10 năm 2026. Hướng dẫn Decisions chuyên biệt nói rằng endpoint này trả về câu trả lời có kiểu nhanh hơn Responses API khoảng 10 lần. Khi ra mắt, GPT-6 Luna là mô hình duy nhất được hỗ trợ, và yêu cầu dùng POST /v1/decisions. Phép so sánh tốc độ này là tuyên bố công bố của OpenAI, không phải cam kết rằng mọi ứng dụng sẽ thấy cải thiện đầu cuối tương tự.
Mỗi yêu cầu mang một đầu vào dùng chung và một hoặc nhiều câu hỏi. Mỗi câu hỏi có thể yêu cầu một vị từ (xác suất một điều kiện đúng), một lựa chọn trong tập đã cho, hoặc một điểm số theo các mức được sắp thứ tự. Endpoint trả các câu trả lời đó ở dạng có kiểu, kèm xác suất hoặc thông tin độ tin cậy. Vì vậy nó phù hợp với các quyết định có phạm vi rõ ràng, như định tuyến một ticket hỗ trợ, đánh dấu khả năng hư hỏng trong ảnh sản phẩm, hoặc chấm mức độ nghiêm trọng của sự cố.
Decisions API tính phí như thế nào?
Với endpoint Decisions, OpenAI niêm yết $0.10 cho mỗi triệu token đầu vào khi dùng GPT-6 Luna. Hướng dẫn nói rằng chỉ token đầu vào bị tính phí: không áp dụng phí đọc cache, phí ghi cache hay phí token đầu ra. Điều này khác với một yêu cầu Responses thông thường dùng GPT-6 Luna, nơi mức giá ngữ cảnh ngắn tiêu chuẩn là $0.10 cho mỗi triệu token đầu vào chưa cache, $0.01 cho đầu vào đã cache, $0.125 cho ghi cache và $0.50 cho đầu ra. Hãy dùng điều khoản giá riêng của Decisions cho endpoint này, không dùng bảng giá đầy đủ của mô hình.
Đây là một ước tính giả định, trước khi áp dụng bất kỳ điều chỉnh theo khu vực hoặc ngữ cảnh dài nào: nếu một yêu cầu trung bình dùng 1,200 token đầu vào, phí token là 1,200 ÷ 1,000,000 × $0.10 = $0.00012. Một triệu yêu cầu như vậy sẽ dùng 1.2 tỷ token đầu vào và tốn khoảng $120. Đây chỉ là ví dụ lập kế hoạch, không phải báo giá; hãy đo mức dùng token thực tế và xác nhận đơn giá hiện hành trước khi đặt ngân sách.
Vì đầu ra không phải một khoản bị tính phí ở đây, hãy đếm kỹ toàn bộ đầu vào: bằng chứng, ngữ cảnh hệ thống có trong yêu cầu, và chỉ dẫn cùng các lựa chọn của mọi câu hỏi. Khi hợp lý, hãy hỏi nhiều câu hỏi độc lập về cùng một đầu vào trong một yêu cầu duy nhất. OpenAI ghi rõ rằng các câu hỏi độc lập có thể dùng chung bằng chứng; những câu hỏi phụ thuộc vào câu trả lời trước đó nên gửi trong các lệnh gọi riêng. Giữ câu hỏi ngắn và quan sát được, để yêu cầu không phải tốn token cho các tiêu chí mơ hồ.
Khi nào đội ngũ nên dùng Decisions thay vì Responses?
Hãy dùng Decisions khi kết quả vốn có phạm vi rõ ràng: "Hình ảnh này có hư hỏng rõ ràng không?", "Trong ba hàng đợi này, hàng nào phụ trách ticket này?", hoặc "Sự cố này nghiêm trọng đến mức nào theo các mức đã nêu rõ?". Endpoint trả về một câu trả lời mà ứng dụng có thể định tuyến hoặc đếm được, thay vì yêu cầu một mô hình đa dụng viết một đoạn văn rồi phải phân tích đoạn văn đó.
Hãy giữ Responses cho các tác vụ cần giải thích, JSON schema tùy ý, văn bản sinh ra, lệnh gọi công cụ, hoặc một quyết định cần trò chuyện với mô hình. Hướng dẫn của OpenAI chỉ rõ rằng khi cần một đối tượng JSON tùy chỉnh, hãy dùng Structured Outputs; khi mô hình cần yêu cầu gọi một công cụ, hãy dùng function calling. Một lựa chọn có kiểu không thay thế được cho lời giải thích có lập luận hay một hành động có thể thực thi.
So sánh đúng là chi phí cho mỗi kết quả kinh doanh đúng, không phải token hay độ trễ đứng riêng lẻ. Một bộ phân loại nhanh nhưng tạo ra nhiều dương tính giả tốn kém có thể làm tăng công sức rà soát. Một endpoint giá thấp vẫn có thể thua nếu đội phải bù lại bằng nhiều prompt lặp lại, rà soát thủ công, hoặc sửa lỗi ở các bước sau. Hãy theo dõi usage và các trường câu trả lời của phản hồi Decision, lấy mẫu kết quả so với các ví dụ đã gán nhãn, rồi đưa chi phí rà soát của con người và xử lý ở bước sau vào chi phí cho mỗi trường hợp được định tuyến thành công.
FinOps có thể kiểm chứng tuyên bố tiết kiệm như thế nào?
- Chọn một khối lượng công việc có phạm vi rõ ràng. Hãy chọn một bước phân loại hoặc chấm điểm có lưu lượng lớn, với tập đáp án rõ ràng và chi phí lỗi đo được.
- Xây dựng một bộ kiểm thử đã gán nhãn. Đo độ chính xác theo từng danh mục và kiểm tra độ hiệu chỉnh của độ tin cậy hoặc xác suất. Đặt ngưỡng rà soát thủ công dựa trên chi phí của dương tính giả và âm tính giả, như OpenAI khuyến nghị.
- Chạy một đợt thí điểm có thể so sánh. So sánh đường đi hiện tại trong production với Decisions trên cùng đầu vào. Ghi lại độ trễ của endpoint, số token, các lần thử lại, tỷ lệ rà soát và chi phí sửa lỗi.
- Lập ngân sách cho toàn bộ tuyến. Cộng thêm lưu trữ, tài nguyên tính toán của ứng dụng, thời gian của người rà soát, và mọi lệnh gọi Responses hoặc công cụ về sau. Giá token của Decisions không làm cho phần còn lại của quy trình trở nên miễn phí.
- Giữ một đường thoát. Endpoint đang ở giai đoạn beta công khai. Hãy ghim endpoint và mô hình trong cấu hình, theo dõi changelog, và kiểm thử lại trước khi triển khai rộng khi hành vi hoặc khả năng sẵn sàng thay đổi.
OpenAI nêu rằng Zero Data Retention và sử dụng cho HIPAA được hỗ trợ cho các khách hàng đủ điều kiện, cùng các tùy chọn lưu trú dữ liệu tại Hoa Kỳ và châu Âu (EEA và Thụy Sĩ), với yêu cầu về điều kiện và thỏa thuận. Hãy đối chiếu các kiểm soát này với cấu hình thực tế của tổ chức trước khi đưa dữ liệu được quản lý vào một đợt thí điểm.
Người mua nên ghi nhớ gì về giá của Decisions API?
Decisions API mang đến một hình thái giá và độ trễ mới cho các quyết định nhỏ gọn, có kiểu: với đơn giá GPT-6 Luna đã công bố, đầu vào có giá $0.10 cho mỗi triệu token, còn token đầu ra được sinh ra không bị tính phí. Các khối lượng công việc phù hợp nhất có bằng chứng tái sử dụng được, kiểu câu trả lời rõ ràng, và cách chi phí thấp để phát hiện kết quả không chắc chắn. Hãy đo chất lượng tác vụ và tổng chi phí vận hành trước khi chuyển khối lượng production sang.
Đội ngũ nên đọc thêm nghiên cứu nào?
- Structured output không miễn phí
- Chi phí cho mỗi tác vụ thành công quan trọng hơn chi phí cho mỗi yêu cầu
- Giảm giá mô hình không tự động giảm hóa đơn AI của bạn
Liên quan
- Structured output không miễn phí
- Chi phí cho mỗi tác vụ thành công
- Giảm giá mô hình và ngân sách định tuyến
Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →