OpenAI Decisions API 비용 모델: 입력만 과금과 빠른 타입 응답
업데이트 October 7, 2026 · 최초 게시 October 7, 2026
OpenAI의 Decisions API는 공유된 텍스트 또는 이미지 근거를 타입이 지정된 분류, 선택, 점수로 바꾸는 베타 엔드포인트입니다. GPT-6 Luna 기준으로 100만 입력 토큰당 $0.10이 과금되며, 캐시 토큰과 출력 토큰에는 요금이 없습니다. "10배 빠르다"는 주장은 지연 시간에 대한 신호로만 보고, 실제 워크로드에서 품질과 작업당 총비용을 직접 테스트하세요.
OpenAI가 2026년 10월 6일에 무엇을 공개했나요?
OpenAI는 2026년 10월 6일 Decisions API를 공개 베타로 추가했습니다. 전용 Decisions 가이드에 따르면 이 API는 Responses API보다 약 10배 빠르게 타입 응답을 돌려줍니다. 출시 시점에 지원되는 모델은 GPT-6 Luna 하나뿐이며, 요청은 POST /v1/decisions를 사용합니다. 속도 비교는 OpenAI가 공개한 주장이며, 모든 애플리케이션이 같은 end-to-end 개선을 얻는다는 보장은 아닙니다.
요청 하나에는 공유 입력 하나와 하나 이상의 질문이 들어갑니다. 각 질문은 조건이 참일 확률인 predicate, 주어진 집합에서 고르는 choice, 순서가 있는 단계에 대한 score 중 하나를 요청할 수 있습니다. 엔드포인트는 확률이나 신뢰도 정보와 함께 이 답변들을 타입이 지정된 형태로 반환합니다. 그래서 지원 티켓 라우팅, 제품 사진의 손상 가능성 표시, 이슈 심각도 채점처럼 범위가 정해진 결정에 잘 맞습니다.
Decisions API 과금은 어떻게 작동하나요?
Decisions 엔드포인트에서 OpenAI는 GPT-6 Luna 기준 100만 입력 토큰당 $0.10을 안내합니다. 가이드에 따르면 과금되는 것은 입력 토큰뿐이며, 캐시 읽기, 캐시 쓰기, 출력 토큰에 대한 요금은 적용되지 않습니다. 이는 일반 GPT-6 Luna Responses 요청과 다릅니다. 일반 요청은 짧은 컨텍스트 표준 요금이 캐시되지 않은 입력 100만 토큰당 $0.10, 캐시된 입력 $0.01, 캐시 쓰기 $0.125, 출력 토큰 $0.50입니다. 이 엔드포인트에는 전체 모델 요금표가 아니라 Decisions 전용 가격 조건을 적용하세요.
다음은 가정에 따른 예시 추정입니다. 지역별 또는 긴 컨텍스트 조정은 반영하지 않았습니다. 평균 요청이 입력 토큰 1,200개를 쓴다면 토큰 요금은 1,200 ÷ 1,000,000 × $0.10 = $0.00012입니다. 이런 요청이 100만 건이면 입력 토큰 1.2 billion을 쓰고 약 $120이 듭니다. 이는 계획용 예시이며 견적이 아닙니다. 예산을 잡기 전에 실제 토큰 사용량을 측정하고 현재 요율을 확인하세요.
여기서는 출력 토큰이 과금 항목이 아니므로 전체 입력을 꼼꼼히 세야 합니다. 근거 자료, 요청에 포함된 시스템 컨텍스트, 그리고 각 질문의 지시문과 선택지가 모두 포함됩니다. 의미가 있는 경우에는 같은 입력에 대한 독립적인 질문들을 하나의 요청에 묶으세요. OpenAI는 독립적인 질문들이 근거를 공유할 수 있다고 설명합니다. 이전 답변에 의존하는 질문은 별도의 호출로 보내야 합니다. 질문은 짧고 관찰 가능한 형태로 유지해서, 모호한 채점 기준에 토큰이 낭비되지 않도록 하세요.
Responses 대신 Decisions를 언제 써야 하나요?
결과가 본질적으로 범위가 정해져 있을 때 Decisions를 쓰세요. 예를 들면 "이 이미지에 눈에 보이는 손상이 있나요?", "이 티켓은 세 개의 큐 중 어디가 담당하나요?", "이 사고는 명시된 단계에서 얼마나 심각한가요?" 같은 질문입니다. 범용 모델에게 문단을 쓰게 한 뒤 그 산문을 파싱하지 않고도, 애플리케이션이 바로 라우팅하거나 집계할 수 있는 답을 받을 수 있습니다.
설명, 임의의 JSON 스키마, 생성된 텍스트, 도구 호출, 또는 모델과의 대화가 필요한 작업에는 Responses를 유지하세요. OpenAI 가이드는 커스텀 JSON 객체가 필요하면 Structured Outputs를, 모델이 도구 호출을 요청해야 하면 함수 호출을 쓰라고 명시적으로 안내합니다. 타입이 지정된 선택은 이유가 있는 설명이나 실행 가능한 동작을 대신할 수 없습니다.
올바른 비교 기준은 토큰이나 지연 시간이 아니라, 올바른 비즈니스 결과 하나당 비용입니다. 값싼 분류기라도 비싼 거짓 양성을 많이 만들면 검토 인력이 늘어납니다. 낮은 가격의 엔드포인트도 팀이 반복 프롬프트, 수작업 검토, 후속 수정으로 보완해야 한다면 결국 손해일 수 있습니다. Decisions 응답의 usage 필드와 answer 필드를 추적하고, 라벨이 붙은 예시와 비교해 결과를 샘플링하고, 사람의 검토와 후속 처리를 성공적으로 라우팅된 건당 비용에 포함하세요.
FinOps는 절감 주장을 어떻게 검증하나요?
- 범위가 정해진 워크로드 하나를 고르세요. 답 집합이 명확하고 오류 비용을 측정할 수 있는, 트래픽이 많은 분류 또는 채점 단계를 고르세요.
- 라벨이 붙은 테스트 세트를 만드세요. 카테고리별 정확도를 측정하고 신뢰도 또는 확률의 보정 상태를 살펴보세요. OpenAI의 권고대로 거짓 양성과 거짓 음성의 비용을 기준으로 사람 검토 임계값을 정하세요.
- 비교 가능한 파일럿을 실행하세요. 같은 입력으로 현재 운영 경로와 Decisions를 비교하세요. 엔드포인트 지연 시간, 토큰, 재시도, 검토율, 수정된 오류의 비용을 기록하세요.
- 전체 경로의 예산을 잡으세요. 스토리지, 애플리케이션 컴퓨트, 검토자 시간, 그 이후의 Responses나 도구 호출 비용을 더하세요. Decisions의 토큰 요금이 나머지 워크플로를 무료로 만들어 주지는 않습니다.
- 빠져나갈 경로를 남겨 두세요. 이 엔드포인트는 공개 베타입니다. 설정에 엔드포인트와 모델을 고정하고, 변경 로그를 지켜보고, 동작이나 가용성이 바뀌면 전면 롤아웃 전에 다시 테스트하세요.
OpenAI는 자격을 갖춘 고객에 대해 Zero Data Retention과 HIPAA 사용을 지원하며, 자격 및 계약 요건이 있는 미국과 유럽(EEA 및 스위스) 데이터 거주 옵션을 문서화하고 있습니다. 규제 대상 데이터를 파일럿에 넣기 전에, 이 통제가 조직의 실제 설정과 맞는지 확인하세요.
Decisions API 요금에 대해 구매자가 기억할 점은 무엇인가요?
Decisions API는 간결하고 타입이 지정된 결정을 위한 새로운 가격과 지연 시간의 조합을 제공합니다. 공개된 GPT-6 Luna 요율에서 입력은 100만 토큰당 $0.10이며, 생성된 출력 토큰에는 요금이 없습니다. 가장 적합한 후보 워크로드는 재사용 가능한 근거, 명확한 답 유형, 불확실한 결과를 저렴하게 걸러낼 방법을 갖추고 있습니다. 운영 트래픽을 옮기기 전에 작업 품질과 전체 운영 비용을 측정하세요.
팀이 함께 읽어야 할 관련 리서치는 무엇인가요?
관련 글
이 내용을 현재 스택에 적용하고 싶으신가요? 공급업체 청구서, 게이트웨이 로그, 주요 워크플로를 가져오시면 비용 요인과 절감 경로를 정리해드립니다. 무료 감사 예약 →