Chuyển đến nội dung

Trả cho cửa sổ ngữ cảnh hai lần

Cập nhật September 1, 2026 · đăng lần đầu September 1, 2026

Trả lời nhanh: Cửa sổ ngữ cảnh được quảng cáo như một năng lực: 200,000 token, một triệu token, đủ chỗ cho bất cứ thứ gì bạn cần. Năng lực không phải là đơn vị tính tiền. Bạn bị tính tiền cho những gì bạn gửi đi, và...

Cửa sổ ngữ cảnh được quảng cáo như một năng lực: 200,000 token, một triệu token, đủ chỗ cho bất cứ thứ gì bạn cần. Năng lực không phải là đơn vị tính tiền. Bạn bị tính tiền cho những gì bạn gửi đi, và trong một cuộc hội thoại nhiều lượt, bạn gửi lại gần như toàn bộ nội dung đó ở mỗi lượt.

Đó là lần trả tiền thứ hai. Một tài liệu 30,000 token được nạp ở đầu một cuộc hội thoại hai mươi lượt không phải là 30,000 token đầu vào. Nó gần bằng 600,000, vì lượt hai gửi lại nó, và lượt hai mươi cũng vậy.

Phép tính không ai làm

Chi phí tăng theo bình phương độ dài cuộc hội thoại, không tuyến tính. Tăng gấp đôi số lượt xấp xỉ làm số token đầu vào tăng gấp bốn, với điều kiện ngữ cảnh tiếp tục tích lũy. Các nhóm mô hình hóa "chi phí mỗi tin nhắn" rồi nhân với số tin nhắn sẽ dự báo thấp hơn nhiều so với thực tế các phiên dài, và sai số tăng đúng ở nhóm người dùng bạn muốn giữ lại nhất.

Thường còn có khoản phí thứ ba: nhiều nhà cung cấp tính giá cao hơn cho các yêu cầu vượt ngưỡng ngữ cảnh dài. Chỉ một tệp đính kèm thêm cũng có thể đẩy yêu cầu vượt ngưỡng đó và tính lại giá cho toàn bộ lệnh gọi, cả đầu vào lẫn đầu ra, chứ không chỉ phần token vượt ngưỡng.

Cần đo gì

Theo dõi mức sử dụng ngữ cảnh: số token đã gửi so với số token mô hình thực sự cần. Đây là thứ gần nhất với một chỉ số lãng phí trong lĩnh vực này. Theo dõi số token đầu vào theo cuộc hội thoại, không theo yêu cầu, và chú ý đến p99 — đó là nơi các phiên tốn gấp hai mươi lần mức trung vị sinh ra.

Đặt cảnh báo cho các yêu cầu vượt ngưỡng giá ngữ cảnh dài. Đây là bước nhảy, không phải độ dốc, và nó sẽ không trông giống gì trong tổng số hằng ngày.

Ba cách sửa, rẻ nhất trước

Cache phần tiền tố ổn định. Nếu system prompt và các tài liệu đã nạp không thay đổi trong suốt cuộc hội thoại, prompt caching biến khoản chi lặp lại thành một phần nhỏ của nó. Đây là thay đổi có lợi suất cao nhất cho mọi sản phẩm nhiều lượt.

Cắt lịch sử có chủ đích. Các lượt cũ hiếm khi xứng đáng với giá gửi lại. Hãy tóm tắt phần đầu của cuộc hội thoại dài và bỏ các lượt thô; bạn vẫn giữ được mạch chuyện và không phải trả đủ giá cho nó nữa.

Gửi đoạn trích, không gửi toàn bộ kho tài liệu. Truy xuất tồn tại chính vì việc này. Việc cửa sổ đủ lớn để chứa cả một tài liệu không phải là lý do để nhét cả tài liệu vào đó.

Liên quan

Liên quan


Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →

Quay lại finopsllm.com