Mô hình chi phí GPT-6 Luna
Cập nhật September 23, 2026 · đăng lần đầu September 23, 2026
GPT-6 Luna là mô hình giá rẻ trong họ GPT-6 của OpenAI, ra mắt ngày 22 tháng 9 năm 2026 cùng GPT-6 Sol. OpenAI nhắm nó vào công việc khối lượng lớn với mục tiêu rõ ràng: tóm tắt, trích xuất và trả lời câu hỏi nhanh. Với $0.10 cho mỗi 1M token đầu vào, đây là mô hình nên định tuyến đến trước, và chỉ chuyển sang mô hình khác khi tác vụ chứng minh là cần nhiều hơn.
Giá của GPT-6 Luna
| Cấp | Đầu vào | Đầu vào đã cache | Đầu ra |
|---|---|---|---|
| Tiêu chuẩn | $0.10 | $0.01 | $0.50 |
| Batch hoặc flex | $0.05 | $0.005 | $0.25 |
| Chế độ nhanh | $0.20 | $0.02 | $1.00 |
| Ngữ cảnh dài (trên 272K đầu vào) | $0.20 | $0.02 | $0.75 |
Tính trên 1M token, theo trang giá của OpenAI. Ghi vào cache có giá $0.125. Luna có cửa sổ ngữ cảnh 1,050,000 token giống các mô hình GPT-6 còn lại, mốc kiến thức đến tháng 5 năm 2026 (mới nhất trong ba mô hình) và toàn bộ dải effort từ none đến max.
Điểm bằng GPT-5.6 Luna, rẻ hơn 61% mỗi tác vụ
Artificial Analysis đã chạy cả hai thế hệ Luna qua Intelligence Index (v4.3.2) ở effort max.
| Mô hình | Điểm chỉ số | Chi phí mỗi tác vụ | Tốc độ đầu ra |
|---|---|---|---|
| GPT-6 Luna (max) | 37 | $0.07 | 132.2 tokens/s |
| GPT-5.6 Luna (max) | 37 | $0.18 | 142.3 tokens/s |
| GPT-6 Sol (low) | 33.9 | $0.13 | — |
Điểm không đổi. Chi phí mỗi tác vụ giảm 61%, chủ yếu nhờ giá mỗi token thấp hơn. GPT-6 Luna ở max cũng vượt GPT-6 Sol ở effort low về cả điểm lẫn chi phí. Nếu bạn chạy Sol ở low để tiết kiệm, thì trên chỉ số này Luna ở max là lựa chọn tốt hơn.
Chi phí khi khối lượng lớn
Một triệu yêu cầu phân loại mỗi tháng, mỗi yêu cầu 600 token đầu vào và 100 token đầu ra, không cache:
| Mô hình | Chi phí hằng tháng |
|---|---|
| GPT-6 Luna, batch | $55 |
| GPT-6 Luna | $110 |
| GPT-5.6 Luna | $240 |
| Claude Haiku 4.5 | $1,100 |
| GPT-6 Sol | $2,200 |
| GPT-6 Astra | $11,000 |
Claude Haiku 4.5 có giá mỗi token cao gấp 10× và đạt 15 điểm trên cùng chỉ số, vì là mô hình không suy luận. Chuyển cùng khối lượng việc từ Sol sang Luna giảm hóa đơn 95%, đó là lý do đáng xây một router chỉ gửi các trường hợp khó sang Sol.
Điểm trừ: độ trễ và độ dài đầu ra
Các điểm chỉ số ở trên là ở effort max, và ở mức này Luna bắt đầu phản hồi chậm. Artificial Analysis đo được 104 giây đến token đầu tiên. Mô hình cũng dùng 150M token đầu ra trên toàn bộ chỉ số, so với trung vị 84M, mà Artificial Analysis mô tả là hơi dài dòng. Độ dài đó đã nằm trong con số $0.07 mỗi tác vụ, nên con số chi phí vẫn đúng, nhưng thời gian chờ không phù hợp với chat hướng tới người dùng.
Với lưu lượng tương tác, chạy Luna ở none, low hoặc medium mặc định, rồi đo độ chính xác trên prompt của riêng bạn. Các điểm trên trang này chỉ dành cho effort max, nên độ chính xác ở mức thấp hơn cần bạn tự kiểm thử, không tra cứu được. Giữ effort max cho các tác vụ batch, nơi độ trễ không quan trọng và giá batch giảm thêm một nửa hóa đơn.
Giới hạn tốc độ mở rộng xa hơn Sol
Luna bắt đầu ở 500K token mỗi phút ở Tier 1, giống Sol, nhưng đạt 180M token mỗi phút ở Tier 5 (Sol dừng ở 40M), với tối đa 30,000 yêu cầu mỗi phút. Với các pipeline khối lượng lớn, dư địa này quan trọng không kém giá.
Cách dùng Luna
- Định tuyến theo loại tác vụ: trích xuất, phân loại, gắn thẻ và tóm tắt ngắn mặc định đi tới Luna.
- Gửi khối lượng không gấp qua Batch API với giá $0.05/$0.25.
- Chọn effort theo từng tuyến: low cho tương tác, max cho tác vụ offline.
- Chuyển lên GPT-6 Sol khi validator từ chối đầu ra của Luna, không phải ngay từ đầu.
Nguồn: trang mô hình GPT-6 Luna của OpenAI, Artificial Analysis: GPT-6 Luna, Artificial Analysis: GPT-5.6 Luna, TechCrunch. Giá lấy ngày 23 tháng 9 năm 2026.
Liên quan
- Giá GPT-6: Astra, Sol và Luna
- Mô hình chi phí GPT-6 Sol
- Mô hình chi phí GPT-6 Astra
- Hướng dẫn chi phí mô hình suy luận
- Bảng theo dõi giá API LLM
Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →