Adaptive thinking và dự báo chi phí
Cập nhật September 1, 2026 · đăng lần đầu September 1, 2026
Ngân sách suy luận từng là một con số bạn tự đặt. Bạn truyền thinking: {type: "enabled", budget_tokens: N}, và N vừa là công cụ kiểm soát vừa là dự báo: trường hợp xấu nhất, mỗi yêu cầu tốn N token suy luận, và tài chính có thể nhân lên.
Tham số đó đã bị loại bỏ trên Opus 4.6 và Sonnet 4.6, và trên các mô hình mới nhất — Fable 5 và 5.1, Sonnet 5, Opus 5, 4.8 và 4.7 — việc gửi nó sẽ trả về 400. Thay thế là thinking: {type: "adaptive"}, khi đó mô hình tự quyết định mức suy nghĩ dựa trên độ khó của yêu cầu.
Trung bình, đây là đầu ra tốt hơn trên mỗi đô la. Nhưng đó cũng là việc gỡ bỏ một trần giới hạn; nếu dự báo của bạn được xây dựng trên trần đó, dự báo giờ đã sai theo một cách sẽ không lộ ra cho đến khi tháng kết thúc.
Điều gì thay đổi trong các con số
Chi phí trung bình trên mỗi yêu cầu thường giảm, vì các yêu cầu dễ không còn phải trả tiền cho phần suy luận mà chúng không cần. Phương sai tăng, vì các yêu cầu khó không còn bị cắt ngắn ở trần của bạn. Hai xu hướng này đi ngược chiều nhau, và một ngân sách được biểu diễn bằng mức tối đa trên mỗi yêu cầu sẽ không còn gì để bám vào.
Thất bại thực tế không nằm ở trung bình. Mà nằm ở phần đuôi: một thay đổi prompt, một loại tài liệu mới, hoặc một người dùng bắt đầu hỏi những câu khó hơn sẽ đẩy một phần lưu lượng sang suy luận sâu hơn, và không có gì trong cấu hình của bạn giới hạn điều đó.
Dự báo phân phối, không dự báo trần
Ba thay đổi, theo thứ tự chúng mang lại giá trị lớn đến đâu.
Theo dõi token suy luận như một chuỗi riêng. Chúng đã có sẵn trong đối tượng usage của mọi phản hồi. Tách chúng khỏi token đầu vào và đầu ra trong telemetry, và bạn sẽ thấy sự dịch chuyển ngay trong ngày nó xảy ra thay vì vào cuối tháng.
Lập ngân sách theo phân vị. Thay "N token mỗi yêu cầu" bằng p50 và p99 cho từng tuyến. p50 cho bạn biết khối lượng công việc tốn bao nhiêu; khoảng cách giữa p50 và p99 cho bạn biết bạn dễ bị tổn thương đến đâu trước một tuần xấu.
Cảnh báo theo tỷ lệ, không theo tổng. Tỷ trọng token suy luận trên tổng token theo từng tuyến là con số duy nhất thay đổi đầu tiên khi một thay đổi prompt khiến mô hình làm việc vất vả hơn. Cảnh báo theo tổng chi tiêu chỉ kích hoạt sau nhiều ngày, khi khối lượng đã tích lũy.
Nơi vẫn cần một trần
Bỏ núm điều chỉnh theo từng yêu cầu không có nghĩa là bỏ mọi giới hạn. Giới hạn chi tiêu ở cấp tuyến và cấp khách thuê vẫn hoạt động, vẫn bắt được các vòng lặp mất kiểm soát, và giờ đây đó là nơi đặt lan can bảo vệ — ở ranh giới bạn sở hữu, không nằm trong một tham số yêu cầu không còn tồn tại. Với các đường đi nhạy cảm về độ trễ, nơi suy luận sâu không bao giờ đáng giá, đòn bẩy là lựa chọn mô hình, không phải ngân sách token.
Liên quan
Liên quan
Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →