Giảm giá model và ngân sách định tuyến
Cập nhật September 10, 2026 · đăng lần đầu September 10, 2026
Giá model đang giảm nhanh, nhưng giá niêm yết thấp hơn không tự động kéo theo hóa đơn công ty thấp hơn. Các đội thường phản ứng với đợt giảm giá bằng cách tăng mức sử dụng, giữ nguyên định tuyến cao cấp, hoặc mở rộng giới hạn ngữ cảnh và đầu ra cho đến khi khoản tiết kiệm biến mất. Câu hỏi quan trọng không phải là giá mỗi token có giảm hay không, mà là chi phí mỗi tác vụ thành công có giảm hay không.
Thông báo cập nhật giá GPT-5.6 của OpenAI minh họa mẫu hình này: các model chi phí thấp được định vị cho công việc khối lượng lớn, còn các tầng nhanh hơn hoặc mạnh hơn phục vụ những khối lượng công việc mà chất lượng hoặc độ trễ xứng đáng với mức giá cao hơn. Cùng thông báo đó nhấn mạnh Batch, xử lý Flex và prompt caching như những cách để khớp năng lực và hình dạng khối lượng công việc với chi phí.
Tính lại theo khối lượng công việc
Đừng áp dụng một mức giảm phần trăm duy nhất cho toàn bộ hóa đơn. Hãy chia chi phí theo nhóm công việc: hỗ trợ khách hàng tương tác, trích xuất, lập trình, lập kế hoạch cho agent, đánh giá và làm giàu dữ liệu theo lô. Với mỗi nhóm, ghi lại chất lượng, độ trễ, tỷ lệ thành công, số token và giá của nhà cung cấp. Sau đó tính chi phí hiện tại cho mỗi tác vụ thành công trước khi quyết định những gì cần chuyển.
Một đợt giảm giá có thể thay đổi đường biên định tuyến. Một model trước đây quá đắt cho việc phân loại có thể trở thành lựa chọn rẻ nhất sau khi tính đến việc thử lại và tỷ lệ lỗi. Ngược lại, một model rẻ nhưng tạo ra nhiều đầu ra không hợp lệ có thể tốn kém hơn sau khi tính các lần gọi sửa lỗi và rà soát của con người.
Chọn đúng làn
Công việc tương tác cần độ trễ có thể dự đoán được. Ngữ cảnh lặp lại có thể hưởng lợi từ caching. Công việc không gấp có thể phù hợp với xử lý theo lô hoặc linh hoạt. Sản xuất khối lượng lớn có thể xứng đáng với năng lực cam kết. Khoản tiết kiệm đến từ việc khớp khối lượng công việc với làn thương mại phù hợp, chứ không phải từ việc chọn giá token thấp nhất đứng riêng lẻ.
Giữ định tuyến sau feature flag và chạy so sánh chất lượng và chi phí đủ lâu để bao phủ biến động lưu lượng bình thường. So sánh tổng chi phí tác vụ, bao gồm các lần gọi dự phòng, hành vi cache, lệnh gọi công cụ và xử lý hậu kỳ. Nếu tuyến mới không đạt SLO chất lượng, hãy hoàn lại dù giá token của nó trông hấp dẫn.
Biến thay đổi giá thành vận hành
- Theo dõi lịch sử giá của nhà cung cấp theo ngày hiệu lực.
- Tính lại ngân sách và dự báo khi giá thay đổi.
- Thông báo cho chủ sở hữu khối lượng công việc khi đường biên định tuyến của họ thay đổi.
- Đo khoản tiết kiệm thực tế dựa trên hóa đơn, không phải ước tính trên bảng tính.
- Sử dụng ngân sách được giải phóng một cách có chủ đích: thêm người dùng, nâng chất lượng, hoặc giảm chi tiêu.
Thay đổi giá là cơ hội để cải thiện phân bổ, không phải lý do để ngừng đo lường. Một chương trình FinOps trưởng thành coi mỗi tầng model mới như một thử nghiệm định tuyến có chủ sở hữu, đường cơ sở và chỉ số thành công.
Liên quan
Liên quan
Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →