Chuyển đến nội dung

Benchmark ngữ cảnh dài của GPT-6 Sol: thực tế đã đo những gì, và GPT-5.6 Sol là gì

Cập nhật September 27, 2026 · đăng lần đầu September 27, 2026

Trả lời nhanh: Tính đến 27 tháng 9 năm 2026, GPT-6 Sol chỉ có đúng một điểm ngữ cảnh dài độc lập: 84% trên Artificial Analysis AA-LCR v1.1, ngang với GPT-5.6 Sol. Tài liệu của bài kiểm tra trung bình khoảng 100K...

Tính đến 27 tháng 9 năm 2026, GPT-6 Sol chỉ có đúng một điểm ngữ cảnh dài độc lập: 84% trên Artificial Analysis AA-LCR v1.1, ngang với GPT-5.6 Sol. Tài liệu của bài kiểm tra trung bình khoảng 100K token. Chưa ai công bố GPT-6 Sol hoạt động ra sao ở 256K, 512K hay 1M token. Phần lớn các con số ngữ cảnh dài của “Sol” trên mạng, kể cả điểm MRCR 91,5%, đều là của GPT-5.6 Sol. GPT-6 Sol ra mắt ngày 22 tháng 9.

Điều này quan trọng với chi phí vì ngữ cảnh dài là nơi giá GPT-6 tăng vọt. Khi đầu vào vượt 272K token, toàn bộ yêu cầu được tính theo mức giá ngữ cảnh dài. Quyết định giữ bao nhiêu ngữ cảnh cho một agent là cân nhắc giữa mức giá đó và dữ liệu chất lượng chưa tồn tại.

GPT-6 Sol có những điểm ngữ cảnh dài nào?

Chỉ có một điểm tổng hợp, ở khoảng 100K token.

Mô hìnhAA-LCR v1.1Xếp hạng
GPT-6 Sol (max)84.0%7
GPT-5.6 Sol (max)84.0%7
GPT-6 Astra80.7%27
Kimi K3 (dẫn đầu, 24/09/2026)88.7%1

AA-LCR gồm 100 câu hỏi viết tay trên các bộ tài liệu trung bình 99.325 token. Câu trả lời phải được ghép từ nhiều đoạn văn thay vì tìm thấy trong một đoạn. Bài test đo khả năng suy luận trên đầu vào dài. Nó không cho thấy độ chính xác thay đổi thế nào khi đầu vào dài thêm, vì mọi câu hỏi đều có độ dài gần như nhau.

Những con số ngữ cảnh dài nào thuộc GPT-5.6 Sol, không phải GPT-6 Sol?

Đó là các điểm MRCR. Bài đưa tin khi ra mắt GPT-6 Astra so sánh nó với “Sol” trong bài test MRCR v2 8-needle của OpenAI. Sol đó là GPT-5.6 Sol, và bài phân tích của Vellum xác nhận điều này.

MRCR v2, 8-needle256K–512K512K–1M
GPT-6 Astra100%96.3%
GPT-5.6 Sol91.5%73.8%
GPT-6 Solchưa công bố

Bài đánh giá GPT-6 Sol của OrcaRouter cũng nêu cùng ý: GPT-5.6 Sol có kết quả truy xuất ngữ cảnh dài đã công bố, còn GPT-6 Sol chưa có kết quả tương đương.

Chúng tôi đã tìm ở đâu?

Những nơi có thể công bố kết quả, tất cả đã kiểm tra vào ngày 27/09/2026:

Trước khi có dữ liệu theo độ dài, các nhóm nên làm gì?

Giữ các yêu cầu tới GPT-6 Sol dưới 272K token đầu vào và nén ngữ cảnh sớm. Bằng chứng hiện có cho thấy GPT-6 Sol ngang GPT-5.6 Sol ở khoảng 100K. GPT-5.6 Sol giữ được 91,5% đến 512K trên MRCR nhưng giảm xuống 73,8% sau đó. Có thể kỳ vọng GPT-6 Sol dùng được tới khoảng 250K là hợp lý, nhưng đó là suy luận chứ không phải phép đo. Trên 272K, bạn trả gấp đôi cho phần đầu vào với chất lượng chưa ai đo.

Trong Codex, đây đã là mặc định. Codex cấp cho GPT-6 Sol cửa sổ 272K và nén ngữ cảnh ở 244.800 token. Với agent của riêng bạn, hãy đặt cảnh báo cho các yêu cầu vượt 272K và coi mọi mức tăng là thứ cần kiểm thử. Tự chạy kiểm tra truy xuất trên tài liệu của mình trước khi dựa vào ngữ cảnh vượt 256K.

Chúng tôi sẽ cập nhật trang này khi Context Arena hoặc một bên đánh giá độc lập khác công bố kết quả GPT-6 Sol theo độ dài ngữ cảnh.

Nguồn

Liên quan


Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →

Quay lại finopsllm.com