Chuyển đến nội dung

98% token input của Codex được cache. Không cache, hóa đơn lớn gấp 12 lần

Cập nhật October 9, 2026 · đăng lần đầu October 9, 2026

Trả lời nhanh: Trong 12 ngày sử dụng Codex nặng tay với ChatGPT Pro $100, chúng tôi đã gửi 13.0 tỷ token input và nhận về 47 triệu token output. 97.6% lượng input đó là cache hit. Theo giá API của OpenAI, khối lượng...

Trong 12 ngày sử dụng Codex nặng tay với ChatGPT Pro $100, chúng tôi đã gửi 13.0 tỷ token input và nhận về 47 triệu token output. 97.6% lượng input đó là cache hit. Theo giá API của OpenAI, khối lượng công việc này có giá trị $1,211. Nếu tính cùng số token đó mà không có cache hit nào, con số là $14,198, gấp 12 lần.

Giá trị API của 12 ngày Codex theo mô hình: có cache so với không cache$0$2k$4k$6k$8k$10k$12k$14k$1,073$13,299Sol$95$655Luna$27$144GPT-5.5$16$99AstraCam: số tiền đã trả theo giá API, có cacheXanh dương: cùng số token nhưng không có cache hit
Giá trị API của 12 ngày Codex theo mô hình: có cache so với không cache

Vì sao phần lớn input của coding agent là input đã cache

Vòng lặp của agent gửi lại toàn bộ cuộc hội thoại ở mỗi bước: system prompt, định nghĩa công cụ, các tệp đã đọc và mọi kết quả công cụ trước đó. Mỗi bước thêm một chút rồi đọc lại tất cả. Vì vậy input tăng theo bình phương độ dài phiên làm việc, trong khi output vẫn nhỏ. Trong 12 ngày, tỷ lệ input trên output của chúng tôi là 279:1.

Prompt caching là thứ giữ cho chi phí ở mức hợp lý. Input đã cache trên API của OpenAI chỉ bằng một phần mười hoặc thấp hơn so với input thường. GPT-6 Sol, mô hình làm phần lớn công việc của chúng tôi, tính $2 cho mỗi triệu token input và $0.10 cho mỗi triệu token đã cache.

Tiền đã đi đâu

Mô hìnhToken inputĐã cacheToken outputGiá trị APINếu không cache
Sol6.56B98.1%17.5M$1,073$13,299
Luna6.41B97.2%29.0M$95$655
GPT-5.50.03B93.5%0.2M$27$144
Astra0.01B94.5%0.0M$16$99
Tổng cộng13.01B97.6%47M$1,211$14,198
Thành phần chi phíGiá trị APITỷ trọng
Input đã cache$72860%
Input chưa cache$28824%
Output$19616%

Ngay cả khi được giảm 95%, input đã cache vẫn là khoản lớn nhất. Đó là dấu hiệu đặc trưng của khối lượng công việc agent: loại token rẻ nhất, nhưng với khối lượng khổng lồ. Tổng theo từng mô hình có trong codex-pro-100-model-mix.csv.

Điều gì phá vỡ cache

Một cache hit cần prefix giống hệt nhau. Bất kỳ thay đổi nào ở đầu ngữ cảnh đều buộc phải đọc lại toàn bộ phần phía sau với giá đầy đủ.

Vì sao điều này quan trọng với giới hạn Codex của bạn

Nếu bộ đếm hạn mức của Codex tính input đã cache gần với giá API, thì tỷ lệ cache hit giảm 1 điểm cũng rất tốn kém. Với khối lượng của chúng tôi, nếu Sol giảm từ 98.1% xuống 90% đã cache thì chỉ riêng input của Sol đã tốn thêm khoảng $1,004, tương đương khoảng 6 cửa sổ Pro $100 nữa. Kỷ luật về cache cũng chính là kỷ luật về hạn mức. Để biết một cửa sổ chứa được những gì, xem phép đo hệ số Pro $100 của chúng tôi; để biết vì sao chúng tôi có được tám cửa sổ trong 12 ngày, xem nhật ký reset.

Cách chúng tôi đo

Codex ghi một nhật ký JSONL cho mỗi phiên trong ~/.codex/sessions/. Mỗi yêu cầu ghi lại tổng input, input đã cache và output tích lũy, cùng với bộ đếm hàng tuần (used_percent) và thời điểm resets_at. Chúng tôi quy đổi phần chênh lệch token của từng yêu cầu theo giá niêm yết API của mô hình đã chạy yêu cầu đó, rồi nhóm các yêu cầu theo cửa sổ hàng tuần. Các con số bằng đô la là giá trị tương đương theo API, không phải số tiền chúng tôi thực sự đã trả.

Nguồn

Liên quan


Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →

Quay lại finopsllm.com