프런티어 모델의 작업당 실제 비용
Updated September 22, 2026 · first published September 22, 2026
정가는 토큰 하나의 값을 알려 줄 뿐, 완료된 작업 하나의 값을 알려 주지는 않습니다. 같은 일을 해도 모델마다 쓰는 토큰 수가 크게 다르기 때문입니다. 이 페이지는 Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra, GPT-6 Sol의 모든 effort 단계에 대해 실측 작업당 비용과 품질 점수를 나란히 보여 줍니다. 모든 수치에 출처가 있고, 추정치는 없습니다.
결론부터 말하면, 점수 47.5까지는 어느 수준이든 GPT-6 Sol이 가장 저렴합니다. 47.5를 넘으면 모든 단계에서 Opus 5.5가 가장 저렴합니다. low보다 높은 GPT-6 Astra, Opus 5, Fable 5.1은 어떤 설정도 비용 효율적이지 않습니다. 모두 Sol이나 Opus 5.5의 어떤 설정에 점수와 가격 모두에서 밀립니다.
방법
모든 점수와 비용은 Artificial Analysis Intelligence Index v4.3.2(2026년 9월 22일 확인)에서 가져왔습니다. 이 지수는 AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR의 10개 평가로 구성됩니다. Artificial Analysis는 각 모델을 각 effort 설정으로 제공사 API를 통해 실행하고, 정가로 지불한 금액을 기록합니다. 작업당 비용은 작업 하나에 들어간 지출을 입력과 출력으로 나눈 것입니다. 모든 행이 같은 평가 세트를 거치므로 행끼리 바로 비교할 수 있습니다.
수치를 읽기 전에 두 가지 한계가 있습니다. 첫째, 이 지수는 하나의 작업 구성일 뿐입니다. 여러분의 작업 구성에서는 비용이 달라지므로, 마지막 절에서 직접 측정하는 방법을 설명합니다. 둘째, 지수 버전이 다르면 점수를 비교할 수 없습니다. 이전에 발표된 수치와 섞지 마세요.
전체 목록: 26개 설정
작업당 출력 토큰은 추론을 포함해 모델이 작성한 토큰입니다. Artificial Analysis는 GPT-6 Sol의 중간 네 설정에 대해 입력과 출력 내역을 공개하지 않아 해당 칸은 n/a로 표시했습니다.
| 모델 | Effort | Intelligence Index | 작업당 비용 | 입력 비용 | 출력 비용 | 작업당 출력 토큰 | 프런티어 여부 |
|---|---|---|---|---|---|---|---|
| GPT-6 Sol | none | 28.1 | $0.33 | $0.28 | $0.05 | 4,900 | 아니요 |
| GPT-6 Sol | low | 33.9 | $0.13 | n/a | n/a | 3,400 | 예 |
| GPT-6 Sol | medium (기본값) | 39.8 | $0.25 | n/a | n/a | 6,500 | 예 |
| GPT-6 Sol | high | 42.8 | $0.37 | n/a | n/a | 10,200 | 예 |
| GPT-6 Sol | xhigh | 44.1 | $0.53 | n/a | n/a | 16,000 | 예 |
| GPT-6 Sol | max | 47.5 | $1.06 | $0.74 | $0.31 | 31,200 | 예 |
| GPT-6 Astra | low | 45.8 | $0.82 | $0.60 | $0.22 | 4,400 | 예 |
| GPT-6 Astra | medium | 49.6 | $1.54 | $1.06 | $0.48 | 9,600 | 아니요 |
| GPT-6 Astra | high | 50.9 | $1.73 | $1.13 | $0.59 | 11,800 | 아니요 |
| GPT-6 Astra | xhigh | 52.4 | $2.31 | $1.46 | $0.85 | 16,900 | 아니요 |
| GPT-6 Astra | max | 52.7 | $3.26 | $1.90 | $1.36 | 27,200 | 아니요 |
| Claude Opus 5 | low | 39.4 | $1.10 | $0.73 | $0.37 | 14,700 | 아니요 |
| Claude Opus 5 | medium | 44.8 | $2.19 | $1.47 | $0.72 | 29,000 | 아니요 |
| Claude Opus 5 | high (기본값) | 48.1 | $3.61 | $2.46 | $1.16 | 46,200 | 아니요 |
| Claude Opus 5 | xhigh | 49.7 | $4.88 | $3.36 | $1.52 | 60,700 | 아니요 |
| Claude Opus 5 | max | 50.8 | $5.86 | $4.05 | $1.81 | 72,500 | 아니요 |
| Claude Opus 5.5 | low | 42.3 | $0.55 | $0.35 | $0.20 | 10,200 | 아니요 |
| Claude Opus 5.5 | medium (기본값) | 51.2 | $1.34 | $0.82 | $0.51 | 25,700 | 예 |
| Claude Opus 5.5 | high | 53.6 | $1.82 | $1.11 | $0.71 | 35,600 | 예 |
| Claude Opus 5.5 | xhigh | 56.0 | $3.46 | $2.15 | $1.31 | 65,700 | 예 |
| Claude Opus 5.5 | max | 57.6 | $5.98 | $3.60 | $2.38 | 119,200 | 예 |
| Claude Fable 5.1 | low | 46.8 | $2.37 | $1.30 | $1.08 | 21,600 | 아니요 |
| Claude Fable 5.1 | medium | 48.9 | $2.98 | $1.59 | $1.39 | 27,900 | 아니요 |
| Claude Fable 5.1 | high | 51.2 | $3.91 | $2.01 | $1.90 | 38,100 | 아니요 |
| Claude Fable 5.1 | xhigh | 53.2 | $5.98 | $2.96 | $3.02 | 60,500 | 아니요 |
| Claude Fable 5.1 | max | 53.4 | $7.63 | $3.73 | $3.90 | 78,100 | 아니요 |
프런티어에 있다는 것은 이 표의 다른 어떤 설정도 더 적은 돈으로 더 높은 점수를 내지 못한다는 뜻입니다.
비용 프런티어
26개 설정 중 10개가 프런티어에 있습니다. 비용순으로 정렬하면, 가격만 볼 때 검토할 가치가 있는 설정은 이 10개뿐입니다. 나머지는 같거나 더 낮은 점수에 더 많이 지불합니다.
| 설정 | Intelligence Index | 작업당 비용 | 작업 1만 건당 |
|---|---|---|---|
| GPT-6 Sol · low | 33.9 | $0.13 | $1,300 |
| GPT-6 Sol · medium | 39.8 | $0.25 | $2,500 |
| GPT-6 Sol · high | 42.8 | $0.37 | $3,700 |
| GPT-6 Sol · xhigh | 44.1 | $0.53 | $5,300 |
| GPT-6 Astra · low | 45.8 | $0.82 | $8,200 |
| GPT-6 Sol · max | 47.5 | $1.06 | $10,600 |
| Claude Opus 5.5 · medium | 51.2 | $1.34 | $13,400 |
| Claude Opus 5.5 · high | 53.6 | $1.82 | $18,200 |
| Claude Opus 5.5 · xhigh | 56.0 | $3.46 | $34,600 |
| Claude Opus 5.5 · max | 57.6 | $5.98 | $59,800 |
프런티어는 두 구간으로 나뉩니다. 0.13달러부터 1.06달러까지는 거의 GPT-6 Sol이고, 유일한 예외가 0.82달러의 GPT-6 Astra low입니다. 1.34달러부터는 Opus 5.5뿐입니다. 두 구간 사이의 차이는 작습니다. Opus 5.5 medium은 Sol max보다 3.7점 높고, 작업당 0.28달러 더 비쌉니다.
같거나 더 높은 점수에서의 일대일 비교
각 쌍은 저렴한 설정과, 점수가 같거나 더 낮은 비싼 설정을 비교합니다.
| 저렴한 설정 | 비싼 설정 | 점수 차 | 절감액 |
|---|---|---|---|
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 high: 48.1, $3.61 | Opus 5.5에서 +3.1 | 63% |
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 max: 50.8, $5.86 | Opus 5.5에서 +0.4 | 77% |
| Opus 5.5 medium: 51.2, $1.34 | Fable 5.1 high: 51.2, $3.91 | 동점 | 66% |
| Opus 5.5 high: 53.6, $1.82 | GPT-6 Astra max: 52.7, $3.26 | Opus 5.5에서 +0.9 | 44% |
| Opus 5.5 high: 53.6, $1.82 | Fable 5.1 max: 53.4, $7.63 | Opus 5.5에서 +0.2 | 76% |
| GPT-6 Sol max: 47.5, $1.06 | Opus 5 high: 48.1, $3.61 | Opus 5에서 +0.6 | 71% |
Opus 5 행은 아직 마이그레이션하지 않은 팀에게 중요합니다. Opus 5의 기본값은 high였습니다. Opus 5.5의 기본값은 medium이며, 이 기본값에서 작업당 비용이 63% 낮고 점수는 3.1점 높습니다. Anthropic은 Opus 5.5가 Opus 5보다 40% 저렴하다고 밝혔지만, 이 지수에서 측정한 차이는 그보다 큽니다.
돈이 나가는 곳: 출력이 아니라 입력
모든 모델에서 입력이 작업당 비용의 약 절반에서 4분의 3을 차지합니다. Opus 5.5 medium에서는 1.34달러 중 0.82달러, 즉 61%가 입력입니다. GPT-6 Astra max는 58%, GPT-6 Sol max는 70%, Fable 5.1 max는 49%입니다. 에이전트 작업은 단계마다 커진 컨텍스트를 다시 보냅니다. 그래서 입력 비용은 답변 길이만이 아니라 단계 수에 따라 늘어납니다.
GPT-6 Sol의 추론 없음 설정이 low보다 비싼 이유가 여기에 있습니다. 출력은 4,900토큰뿐인데도 0.13달러가 아니라 0.33달러가 듭니다. 0.33달러 중 0.28달러가 입력입니다. 단계가 늘어나고 매번 컨텍스트를 다시 보내는 것이 원인으로 보입니다. 추론을 끄더라도 그 대신 턴이 늘어나면 에이전트는 저렴해지지 않습니다.
청구서 관점에서는 캐싱이 모델 선택만큼 중요하다는 뜻입니다. Opus 5.5와 GPT-6 Sol은 캐시된 입력 100만 토큰당 0.20달러입니다. GPT-6 Astra는 1.00달러, Opus 5는 0.50달러입니다.
토큰 양과 정가
여기서 토큰 효율이 가장 좋은 모델은 GPT-6 Astra입니다. max에서도 작업당 출력이 27,200토큰으로, Opus 5.5 max의 119,200토큰보다 훨씬 적습니다. 하지만 Astra는 100만 토큰당 10달러와 50달러로 Opus 5.5 요금의 2.5×입니다. 이기는 쪽은 정가입니다. Opus 5.5 high는 작업당 1.82달러에 53.6점, Astra max는 3.26달러에 52.7점입니다.
장황함이 비용이 되는 곳은 Opus 5.5 max 하나뿐입니다. 출력 119,200토큰만으로 입력 전에 2.38달러이고, 작업 전체는 5.98달러입니다. 표에서 가장 높은 57.6점을 얻지만, 비용은 medium의 4.5×입니다.
effort 단계별 수확 체감
각 행은 effort를 한 단계 올렸을 때 얻는 지수 점수와 작업당 추가 비용을 보여 줍니다.
| 모델 | medium → high | xhigh → max |
|---|---|---|
| GPT-6 Sol | +48%에 +3.0점 | +100%에 +3.4점 |
| GPT-6 Astra | +12%에 +1.3점 | +41%에 +0.3점 |
| Claude Opus 5 | +65%에 +3.3점 | +20%에 +1.1점 |
| Claude Opus 5.5 | +36%에 +2.4점 | +73%에 +1.6점 |
| Claude Fable 5.1 | +31%에 +2.3점 | +28%에 +0.2점 |
Fable 5.1과 GPT-6 Astra에서는 max로 올려도 얻는 것이 거의 없습니다. 28%와 41% 더 내고 0.2점과 0.3점입니다. Opus 5.5는 max로 올리면 아직 1.6점을 얻지만, 비용이 73% 늘어납니다. 추가 점수가 결과를 바꾼다는 것을 측정으로 확인한 작업에만 max를 쓰세요.
GPT-6 Sol max로 충분한 경우
지수는 평균이며, Sol max와 Opus 5.5 medium의 격차는 평가마다 고르지 않습니다. Artificial Analysis의 평가별 점수:
| 평가 | Opus 5.5 medium ($1.34) | GPT-6 Sol max ($1.06) |
|---|---|---|
| Terminal-Bench 4.0 | 52.5 | 43.9 |
| AutomationBench-AA | 61.2 | 61.6 |
| GDPval-AA (Elo) | 1576 | 1487 |
| AA-Briefcase (Elo) | 1642 | 1483 |
| Humanity's Last Exam | 54.7 | 47.9 |
| SciCode | 59.3 | 57.6 |
| CritPt | 27.7 | 30.9 |
| AA-LCR | 84.3 | 83.7 |
AutomationBench와 CritPt에서는 GPT-6 Sol이 작업당 1.34달러 대비 1.06달러로 Opus 5.5 medium과 같거나 앞섭니다. Terminal-Bench, 지식 업무 평가, Humanity's Last Exam에서는 Opus 5.5가 크게 앞섭니다. 워크플로 자동화는 Sol로 돌려도 됩니다. 터미널·코딩 에이전트와 문서가 많은 지식 업무에서 Opus 5.5가 값을 합니다.
제조사 수치와 독립 측정치
제조사 수치와 독립 측정치는 평가 환경과 설정이 달라 자주 어긋납니다. Anthropic은 xhigh의 Opus 5.5가 Terminal-Bench 4.0에서 66.4%라고 발표했습니다. Artificial Analysis는 같은 effort에서 59.6%를 측정했습니다.
| Effort | Opus 5.5 | Fable 5.1 |
|---|---|---|
| low | 31.3% | 40.4% |
| medium | 52.5% | 44.9% |
| high | 56.6% | 52.0% |
| xhigh | 59.6% | 55.1% |
| max | 59.6% | 52.0% |
순위도 지수에 따라 달라집니다. Vals AI Index에서는 Fable 5.1이 68.83%로 1위, GPT-6 Astra가 66.61%로 3위, Opus 5.5가 66.16%로 4위입니다. 그곳에서는 작업당 비용이 같은 기준으로 공개되지 않으므로 위의 프런티어는 바뀌지 않습니다. 지수 하나는 하나의 관점일 뿐입니다.
정가와 캐시 중심 작업
Digital Applied는 캐시 중심 에이전트 작업 하나의 가격을 각 모델로 계산했습니다. 캐시 읽기 8M 토큰, 캐시 없는 입력 400K, 캐시 쓰기 600K, 출력 300K입니다. 결과는 프런티어와 같고, GPT-6 Astra에만 추가 페널티가 있습니다.
| 모델 | 입력 $/MTok | 출력 $/MTok | 캐시 읽기 $/MTok | 캐시 중심 작업 (Digital Applied) |
|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $10.00 | $0.20 | $6.90 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 | $12.20 |
| Claude Opus 5 | $5.00 | $25.00 | $0.50 | $17.25 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.25 | $28.50 |
| GPT-6 Astra (≤272K) | $10.00 | $50.00 | $1.00 | $34.50 |
| GPT-6 Astra (>272K) | $20.00 | $75.00 | n/a | $61.50 |
GPT-6 Astra는 입력이 272K 토큰을 넘으면 요청 전체에 100만 토큰당 20달러와 75달러를 청구합니다. Opus 5.5는 1M 토큰 창 전체에서 단일 가격입니다. Opus 5.5의 캐시 쓰기는 5분 캐시가 100만 토큰당 5달러, 1시간 캐시가 8달러이고, 배치는 50% 요금, 고속 모드는 2배 요금입니다. 자세한 내용은 Claude Opus 5.5 비용 모델과 Opus 5.5 고속 모드의 경제성을 참고하세요.
우리 팀의 작업당 비용을 측정하는 방법
- 토큰을 요청 단위가 아니라 작업 단위로 기록하세요. 캐시 없는 입력, 캐시된 입력, 캐시 쓰기, 출력을 작업의 모든 단계에 걸쳐 합산합니다.
- 실제 작업 수백 건을 표본으로 뽑아 Sol max, Opus 5.5 medium, Opus 5.5 high 같은 후보 설정 두세 개로 다시 실행하세요.
- 각 결과를 운영 환경과 같은 검사로 채점하고, 통과한 작업 수를 세세요.
- 총 지출을 통과한 작업 수로 나누세요. 비교할 숫자는 성공한 작업당 비용입니다. 싸지만 더 자주 실패하는 설정은 싸지 않습니다.
- 품질 기준을 넘는 가장 저렴한 설정을 고르고, 실패한 작업만 더 높은 설정으로 보내세요.
- 가격이나 기본 effort가 바뀌면 다시 실행하세요.
한 모델에서 effort 설정이 청구 금액을 어떻게 바꾸는지는 Opus 5.5의 effort 단계가 진짜 가격이다을 참고하세요.
유의 사항
- 모든 비용은 Artificial Analysis 작업 구성에서의 API 정가 기준입니다. 할인, 배치 요금, 자체 캐싱에 따라 달라집니다.
- Artificial Analysis는 Opus 5.5와 Fable 5.1 항목에 Default Fallback 표시를 붙였습니다. 모든 행을 같은 API 구성으로 보기 전에 방법론 설명을 확인하세요.
- 점수는 지수 v4.3.2 기준입니다. 이전 버전은 다른 평가를 썼으므로 비교할 수 없습니다.
- Digital Applied의 캐시 중심 작업은 예시용 워크로드 하나이며 측정값이 아닙니다.
- 제공사가 가격이나 기본값을 바꾸면 수치도 바뀝니다. 확인 날짜는 2026년 9월 22일입니다.
출처
- Artificial Analysis Intelligence Index
- Artificial Analysis: Claude Opus 5.5
- Artificial Analysis: Claude Opus 5
- Artificial Analysis: Claude Fable 5.1
- Artificial Analysis: GPT-6 Astra
- Artificial Analysis: GPT-6 Sol
- Digital Applied: GPT-6 Sol vs Claude Opus 5.5 cost benchmarks
- Digital Applied: Claude Opus 5.5 vs GPT-6 Astra
- Digital Applied: Is Claude Fable 5.1 still worth it?
- Digital Applied: Claude Opus 5.5 launch pricing and benchmarks
- Digital Applied: Opus 5.5 vs Grok 4.7 vs Muse Spark 1.3 cost per task
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →