GPT-6 Sol 장문 맥락 벤치마크: 실제 측정 결과와 GPT-5.6 Sol 수치 구분
업데이트 September 27, 2026 · 최초 게시 September 27, 2026
2026년 9월 27일 기준으로 GPT-6 Sol의 독립 장문 맥락 점수는 하나뿐입니다. Artificial Analysis AA-LCR v1.1에서 받은 84%이며, GPT-5.6 Sol과 같습니다. 이 테스트 문서들의 평균 길이는 약 100K 토큰입니다. GPT-6 Sol이 256K, 512K, 1M 토큰에서 어떻게 동작하는지는 아직 아무도 발표하지 않았습니다. 온라인에서 보이는 “Sol” 장문 맥락 수치 대부분, 91.5% MRCR 점수를 포함해, 는 GPT-5.6 Sol의 것입니다. GPT-6 Sol은 9월 22일에 출시되었습니다.
비용과 관련해 이것이 중요한 이유는 GPT-6 가격이 장문 맥락에서 크게 뛰기 때문입니다. 입력 토큰이 272K를 넘으면 요청 전체가 장문 맥락 요금으로 청구됩니다. 에이전트가 얼마나 많은 맥락을 유지할지 정하려면, 이 가격과 아직 존재하지 않는 품질 데이터를 비교해야 합니다.
GPT-6 Sol의 장문 맥락 점수는 무엇인가요?
약 100K 토큰에서 나온 종합 점수 하나입니다.
| 모델 | AA-LCR v1.1 | 순위 |
|---|---|---|
| GPT-6 Sol (max) | 84.0% | 7 |
| GPT-5.6 Sol (max) | 84.0% | 7 |
| GPT-6 Astra | 80.7% | 27 |
| Kimi K3 (선두, 2026년 9월 24일) | 88.7% | 1 |
AA-LCR은 평균 99,325 토큰 규모의 문서 묶음에 대해 사람이 직접 쓴 100개 질문으로 구성됩니다. 답은 한 구절에서 찾는 것이 아니라 여러 구절을 조합해 도출해야 합니다. 긴 입력에 대한 추론을 테스트하지만, 모든 질문의 길이가 비슷하기 때문에 입력이 길어질수록 정확도가 어떻게 변하는지는 보여 주지 않습니다.
어떤 장문 맥락 수치가 GPT-5.6 Sol의 것이고 GPT-6 Sol의 것이 아닌가요?
MRCR 점수입니다. GPT-6 Astra 출시 보도는 OpenAI의 MRCR v2 8-needle 테스트에서 이를 “Sol”과 비교했습니다. 그 “Sol”은 GPT-5.6 Sol이었고, Vellum의 분석도 이를 확인합니다.
| MRCR v2, 8-needle | 256K–512K | 512K–1M |
|---|---|---|
| GPT-6 Astra | 100% | 96.3% |
| GPT-5.6 Sol | 91.5% | 73.8% |
| GPT-6 Sol | 미발표 | |
OrcaRouter의 GPT-6 Sol 리뷰도 같은 점을 지적합니다. GPT-5.6 Sol에는 장문 맥락 검색 결과가 공개되어 있지만, GPT-6 Sol에는 이에 상응하는 결과가 없습니다.
어디를 확인했나요?
결과가 발표될 만한 곳을 모두 2026년 9월 27일에 확인했습니다.
- Context Arena, MRCR 리더보드. 모델 목록과 8-needle 결과에 GPT-6 항목이 없습니다. 가장 최근의 OpenAI 모델은 GPT-5.6 Sol, Terra, Luna입니다.
- OpenAI: GPT-6 출시 글과 Sol 및 Luna의 시스템 카드 부록. 둘 다 컨텍스트 길이별 Sol 결과를 제시하지 않습니다.
- Artificial Analysis: 위에서 언급한 AA-LCR만 있습니다.
- Vals, Vellum, DataCamp, emergent.sh, llm-stats, OrcaRouter: GPT-6 Sol의 길이별 장문 맥락 결과는 없습니다.
길이별 데이터가 나오기 전까지 팀은 무엇을 해야 하나요?
GPT-6 Sol 요청은 입력 272K 토큰 미만으로 유지하고 일찍 압축하세요. 지금까지의 근거는 GPT-6 Sol이 약 100K에서 GPT-5.6 Sol과 같다는 것을 보여 줍니다. GPT-5.6 Sol은 MRCR에서 512K까지 91.5%를 유지했지만 그 이후에는 73.8%로 떨어졌습니다. GPT-6 Sol도 약 250K까지는 쓸 만할 것이라고 기대하는 것은 합리적이지만, 이는 측정이 아니라 추론입니다. 272K를 넘으면 아무도 측정하지 않은 품질에 입력 비용을 두 배로 지불하게 됩니다.
Codex에서는 이것이 이미 기본값입니다. GPT-6 Sol에 272K 창을 주고 244,800 토큰에서 압축합니다. 자체 에이전트라면 272K를 넘는 요청에 알림을 설정하고, 늘리는 모든 변경은 테스트할 대상으로 다루세요. 256K를 넘는 맥락에 의존하기 전에 자신의 문서로 직접 검색 테스트를 실행하세요.
Context Arena나 다른 독립 평가 기관이 GPT-6 Sol의 길이별 결과를 발표하면 이 페이지를 업데이트하겠습니다.
출처
- Artificial Analysis: GPT-6 Sol vs GPT-5.6 Sol
- Artificial Analysis: AA-LCR 발표
- BenchLM: AA-LCR 리더보드
- Vellum: GPT-6 Astra 벤치마크 해설
- OrcaRouter: GPT-6 Sol vs GPT-5.6 Sol
- Context Arena: MRCR 리더보드
관련 글
이 내용을 현재 스택에 적용하고 싶으신가요? 공급업체 청구서, 게이트웨이 로그, 주요 워크플로를 가져오시면 비용 요인과 절감 경로를 정리해드립니다. 무료 감사 예약 →