Chuyển đến nội dung

Mô hình chi phí GPT-6 Luna

Cập nhật September 23, 2026 · đăng lần đầu September 23, 2026

GPT-6 Luna là mô hình giá rẻ trong họ GPT-6 của OpenAI, ra mắt ngày 22 tháng 9 năm 2026 cùng GPT-6 Sol. OpenAI nhắm nó vào công việc khối lượng lớn với mục tiêu rõ ràng: tóm tắt, trích xuất và trả lời câu hỏi nhanh. Với $0.10 cho mỗi 1M token đầu vào, đây là mô hình nên định tuyến đến trước, và chỉ chuyển sang mô hình khác khi tác vụ chứng minh là cần nhiều hơn.

Giá của GPT-6 Luna

CấpĐầu vàoĐầu vào đã cacheĐầu ra
Tiêu chuẩn$0.10$0.01$0.50
Batch hoặc flex$0.05$0.005$0.25
Chế độ nhanh$0.20$0.02$1.00
Ngữ cảnh dài (trên 272K đầu vào)$0.20$0.02$0.75

Tính trên 1M token, theo trang giá của OpenAI. Ghi vào cache có giá $0.125. Luna có cửa sổ ngữ cảnh 1,050,000 token giống các mô hình GPT-6 còn lại, mốc kiến thức đến tháng 5 năm 2026 (mới nhất trong ba mô hình) và toàn bộ dải effort từ none đến max.

Điểm bằng GPT-5.6 Luna, rẻ hơn 61% mỗi tác vụ

Artificial Analysis đã chạy cả hai thế hệ Luna qua Intelligence Index (v4.3.2) ở effort max.

Mô hìnhĐiểm chỉ sốChi phí mỗi tác vụTốc độ đầu ra
GPT-6 Luna (max)37$0.07132.2 tokens/s
GPT-5.6 Luna (max)37$0.18142.3 tokens/s
GPT-6 Sol (low)33.9$0.13—

Điểm không đổi. Chi phí mỗi tác vụ giảm 61%, chủ yếu nhờ giá mỗi token thấp hơn. GPT-6 Luna ở max cũng vượt GPT-6 Sol ở effort low về cả điểm lẫn chi phí. Nếu bạn chạy Sol ở low để tiết kiệm, thì trên chỉ số này Luna ở max là lựa chọn tốt hơn.

Chi phí khi khối lượng lớn

Một triệu yêu cầu phân loại mỗi tháng, mỗi yêu cầu 600 token đầu vào và 100 token đầu ra, không cache:

Mô hìnhChi phí hằng tháng
GPT-6 Luna, batch$55
GPT-6 Luna$110
GPT-5.6 Luna$240
Claude Haiku 4.5$1,100
GPT-6 Sol$2,200
GPT-6 Astra$11,000

Claude Haiku 4.5 có giá mỗi token cao gấp 10× và đạt 15 điểm trên cùng chỉ số, vì là mô hình không suy luận. Chuyển cùng khối lượng việc từ Sol sang Luna giảm hóa đơn 95%, đó là lý do đáng xây một router chỉ gửi các trường hợp khó sang Sol.

Điểm trừ: độ trễ và độ dài đầu ra

Các điểm chỉ số ở trên là ở effort max, và ở mức này Luna bắt đầu phản hồi chậm. Artificial Analysis đo được 104 giây đến token đầu tiên. Mô hình cũng dùng 150M token đầu ra trên toàn bộ chỉ số, so với trung vị 84M, mà Artificial Analysis mô tả là hơi dài dòng. Độ dài đó đã nằm trong con số $0.07 mỗi tác vụ, nên con số chi phí vẫn đúng, nhưng thời gian chờ không phù hợp với chat hướng tới người dùng.

Với lưu lượng tương tác, chạy Luna ở none, low hoặc medium mặc định, rồi đo độ chính xác trên prompt của riêng bạn. Các điểm trên trang này chỉ dành cho effort max, nên độ chính xác ở mức thấp hơn cần bạn tự kiểm thử, không tra cứu được. Giữ effort max cho các tác vụ batch, nơi độ trễ không quan trọng và giá batch giảm thêm một nửa hóa đơn.

Giới hạn tốc độ mở rộng xa hơn Sol

Luna bắt đầu ở 500K token mỗi phút ở Tier 1, giống Sol, nhưng đạt 180M token mỗi phút ở Tier 5 (Sol dừng ở 40M), với tối đa 30,000 yêu cầu mỗi phút. Với các pipeline khối lượng lớn, dư địa này quan trọng không kém giá.

Cách dùng Luna

Nguồn: trang mô hình GPT-6 Luna của OpenAI, Artificial Analysis: GPT-6 Luna, Artificial Analysis: GPT-5.6 Luna, TechCrunch. Giá lấy ngày 23 tháng 9 năm 2026.

Liên quan


Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →

Quay lại finopsllm.com