Công cụ máy chủ là một hóa đơn riêng
Cập nhật September 1, 2026 · đăng lần đầu September 1, 2026
Hầu hết mô hình chi phí LLM chỉ có một đồng hồ: token vào, token ra, giá trên mỗi triệu. Mô hình đó đúng khi một yêu cầu chỉ sinh ra văn bản. Nó không còn đúng từ khi các công cụ phía máy chủ xuất hiện.
Tìm kiếm web, fetch web và thực thi code chạy trên hạ tầng của nhà cung cấp, và nhiều công cụ trong số đó còn có phí riêng theo mỗi lần dùng, cộng thêm các token chúng sinh ra. Một lượt agent vì thế có thể bị tính hai lần: một lần cho các lần tìm kiếm đã chạy, và một lần nữa cho các token mà kết quả tìm kiếm thêm vào ngữ cảnh.
Phần cộng dồn
Khoản tính thứ hai là khoản hay bị bỏ sót. Mỗi kết quả công cụ được nối vào hội thoại, và mỗi lượt sau đó gửi lại toàn bộ nội dung như input. Mười lần tìm kiếm ở đầu một lần chạy agent dài không phải là mười khoản phí: đó là mười khoản phí cộng với phần nội dung kết quả được đọc lại ở mọi lượt tiếp theo.
Vì vậy chi phí agent có vẻ phi tuyến trong khi phép tính token cho thấy nó phải tuyến tính. Phí theo lượt là phần nhìn thấy được; sự tăng trưởng ngữ cảnh mà nó gây ra mới lớn hơn, và nó nằm trong dòng token input mà không có nhãn nào cho biết nguyên nhân từ công cụ.
Phải phân bổ thì mới quản lý được
Ghi lại các lần gọi công cụ theo từng yêu cầu, cùng với đối tượng usage: công cụ nào, bao nhiêu lần gọi, và mỗi kết quả thêm vào bao nhiêu token. Trường cuối cùng là thứ làm cho sự cộng dồn hiện rõ, và đó là trường mà mặc định không ai ghi lại.
Sau đó tính chi phí theo mỗi lần chạy agent, không theo mỗi lần gọi API. Một lần chạy là thứ người dùng thực sự kích hoạt; một lần gọi API chỉ là một trong hai mươi việc mà lần chạy đó đã làm. Mọi con số ngân sách hay đơn vị kinh tế gắn với lần gọi thay vì lần chạy sẽ sai theo hướng làm chi phí trông thấp hơn thực tế.
Ba biện pháp kiểm soát hiệu quả
Giới hạn số lần gọi công cụ mỗi lần chạy. Một trần cứng về số lần tìm kiếm hoặc fetch cho mỗi yêu cầu của người dùng giới hạn cả hai khoản phí cùng lúc. Phần lớn khối lượng việc chạm đến trần 10 là do lặp vòng, không phải do nghiên cứu thật.
Cắt bớt những gì đi vào ngữ cảnh. Bạn hiếm khi cần cả một trang đã fetch. Tóm tắt hoặc rút gọn kết quả trước khi nối vào sẽ giảm chi phí của mọi lượt sau đó, không chỉ lượt hiện tại.
Cache phần tiền tố ổn định. Nếu system prompt và định nghĩa công cụ không đổi trong suốt một lần chạy, và thường là vậy, prompt caching loại bỏ khoản chi phí lặp lại lớn nhất mà công cụ tạo ra.
Hãy kiểm tra bảng giá hiện hành của nhà cung cấp trước khi lập mô hình bất kỳ điều gì ở trên: công cụ nào tính phí theo lượt, và mức phí bao nhiêu, khác nhau theo từng công cụ và thay đổi theo thời gian. Luận điểm cấu trúc vẫn đúng bất kể điều đó: đồng hồ token không còn là toàn bộ hóa đơn.
Liên quan
Liên quan
Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →