Mô hình chi phí agent luôn bật OpenAI O / AON
Cập nhật September 27, 2026 · đăng lần đầu September 27, 2026
Các tham chiếu bị rò rỉ cho thấy "O" của OpenAI (mã nội bộ AON) là một trợ lý luôn bật được thiết kế cho các tác vụ có chân trời dài. Khác với mô hình chat trả lời rồi dừng, O có môi trường cloud riêng, có thể thiết lập ngữ cảnh thực thi, viết mã, nghiên cứu và hoạt động liên tục trong nhiều giờ, nhiều ngày, hoặc có thể nhiều tuần. Nó có thể liên quan đến nhiều agent cùng trao đổi trên một tác vụ. Dự kiến ra mắt: OpenAI Dev Day, ngày 29 tháng 9 năm 2026.
Điều gì thay đổi đối với mô hình hóa chi phí
Chi phí LLM truyền thống: token mỗi yêu cầu × đơn giá. Chi phí O/AON: thời gian × tài nguyên tính toán được cấp + thông lượng token.
| Khía cạnh | API chat/completion | O / AON (dự kiến) |
|---|---|---|
| Đơn vị tính phí | Mỗi 1M token | Mỗi giờ (tính toán) + mỗi 1M token |
| Chi phí khi nhàn rỗi | $0 | >$0 (đặt trước môi trường) |
| Thời lượng tối đa | Vài phút (timeout) | Nhiều ngày/tuần |
| Song song | Yêu cầu tuần tự | Bầy nhiều agent |
| Trạng thái | Truyền trong ngữ cảnh | Môi trường bền vững |
Mô hình chi phí dự kiến (mang tính suy đoán, dựa trên mẫu rò rỉ)
OpenAI chưa công bố giá. Có hai cấu trúc khả dĩ:
Phương án A: Giờ tính toán + token (giống Codespaces)
- Đặt trước môi trường: khoảng $0.50-2.00/giờ (CPU + bộ nhớ + lưu trữ)
- Thông lượng token: cộng thêm đơn giá GPT-5 tiêu chuẩn
- Tầng ultra fast: nhân token 5-10 lần khi được bật
Một lần chạy agent 24 giờ với 5M token đầu vào / 2M token đầu ra:
| Thành phần | Chi phí (thấp) | Chi phí (cao) |
|---|---|---|
| Môi trường 24h ($1/giờ) | $24 | $48 |
| 5M đầu vào @ $5/MTok | $25 | $25 |
| 2M đầu ra @ $15/MTok | $30 | $30 |
| Tổng | $79 | $103 |
Phương án B: Gói cố định (gói Pro Max)
- ChatGPT Pro Max $500/tháng bao gồm quyền truy cập O/AON + hạn mức ultra fast
- Quy đổi theo giờ: $500 / 720 giờ = $0.69/giờ (nếu chạy 24/7)
- Điểm hòa vốn so với Phương án A: khoảng 15 giờ/ngày sử dụng liên tục
Tối ưu chi phí cho agent luôn bật
- Ngủ đông, đừng kết thúc. Nếu môi trường được giữ lại, hãy tạm dừng vòng lặp agent trong lúc nhàn rỗi thay vì tắt hẳn — khởi động lạnh tốn kém hơn chi phí đặt trước khi nhàn rỗi.
- Gom token của các subtask. Tích lũy kết quả subtask và ghi ngữ cảnh theo các khối lớn hơn để tăng tỷ lệ trúng cache trên môi trường bền vững.
- Định tuyến subtask sang mô hình rẻ hơn. O/AON điều phối; giao việc viết mã cho Sonnet 5.5, nghiên cứu cho các mô hình Flash, và chỉ leo thang lên tầng cao cấp cho các quyết định quan trọng.
- Đặt ngân sách thời gian/tiền cứng cho từng mục tiêu. "Sửa lỗi này, tối đa $10 / 2 giờ" — thực thi qua bộ điều phối, đừng trông chờ vào may rủi.
Khi nào dùng O/AON so với Opus 5.5 chạy dài
- O/AON: nghiên cứu kéo dài nhiều ngày, giám sát liên tục, phối hợp nhiều agent, tác vụ cần trạng thái môi trường bền vững
- Vòng lặp agent Opus 5.5: tác vụ viết mã với một mục tiêu duy nhất (tính bằng giờ, không phải ngày), đầu ra được định nghĩa rõ, thực thi một lần
Đọc thêm
Xem kinh tế của ChatGPT Pro Max, giá API Ultra Fast của OpenAI, chi phí agent Opus 5.5 chạy 25 giờ, và kinh tế agent.
Liên quan
- Kinh tế của ChatGPT Pro Max
- Giá API Ultra Fast của OpenAI
- Chi phí agent Opus 5.5 chạy 25 giờ
- Kinh tế agent
Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →