OpenAI O / AON 상시 가동 에이전트 비용 모델
업데이트 September 27, 2026 · 최초 게시 September 27, 2026
유출된 참조 자료에 따르면 OpenAI의 "O"(코드명 AON)는 장기 작업을 위해 설계된 상시 가동 어시스턴트입니다. 응답하고 멈추는 채팅 모델과 달리 O는 자체 클라우드 환경을 할당받고, 실행 컨텍스트를 구성하고, 코드를 작성하고, 조사하며, 몇 시간, 며칠, 또는 몇 주 동안 계속 작동할 수 있습니다. 같은 작업을 두고 여러 에이전트가 서로 통신하는 방식도 포함될 수 있습니다. 공개가 예상되는 시점은 2026년 9월 29일 OpenAI Dev Day입니다.
비용 모델링에서 무엇이 달라지나요
기존 LLM 비용은 요청별 토큰 수 × 요율입니다. O/AON 비용은 시간 × 할당된 연산 + 토큰 처리량입니다.
| 구분 | 채팅/Completion API | O / AON (예상) |
|---|---|---|
| 과금 단위 | 1M 토큰당 | 시간당(연산) + 1M 토큰당 |
| 유휴 비용 | $0 | >$0 (환경 예약) |
| 최대 실행 시간 | 분 단위(타임아웃) | 며칠/몇 주 |
| 병렬성 | 순차 요청 | 다중 에이전트 군집 |
| 상태 | 컨텍스트로 전달 | 영속 환경 |
예상 비용 모델(추측, 유출 패턴 기반)
OpenAI는 아직 가격을 공개하지 않았습니다. 가능성이 높은 구조는 두 가지입니다.
옵션 A: 연산 시간 + 토큰 (Codespaces 방식)
- 환경 예약: 시간당 약 $0.50-2.00(CPU + 메모리 + 스토리지)
- 토큰 처리량: 그 위에 표준 GPT-5 요율 적용
- Ultra fast 등급: 활성화 시 토큰 배수 5-10배
입력 5M 토큰, 출력 2M 토큰을 쓰는 24시간 에이전트 실행 예시입니다.
| 구성 요소 | 비용(낮음) | 비용(높음) |
|---|---|---|
| 24시간 환경(시간당 $1) | $24 | $48 |
| 입력 5M 토큰 @ $5/MTok | $25 | $25 |
| 출력 2M 토큰 @ $15/MTok | $30 | $30 |
| 합계 | $79 | $103 |
옵션 B: 정액 구독(Pro Max 번들)
- 월 $500의 ChatGPT Pro Max에 O/AON 접근권과 ultra fast 할당량 포함
- 실효 시간당 비용: $500 / 720h = $0.69/hr (24/7 가동 시)
- 옵션 A와의 손익분기: 하루 약 15시간 지속 사용
상시 가동 에이전트의 비용 최적화 전략
- 종료하지 말고 휴면시키세요. 환경이 유지된다면 유휴 시간에는 에이전트 루프를 중지하고 인스턴스를 내리지 마세요. 콜드 스타트 비용이 유휴 예약 비용보다 큽니다.
- 하위 작업 토큰을 묶으세요. 하위 작업 결과를 모아 더 큰 단위로 컨텍스트를 기록하면 영속 환경에서 캐시 적중률이 올라갑니다.
- 하위 작업을 더 저렴한 모델로 라우팅하세요. O/AON은 오케스트레이션을 맡기고, 코딩은 Sonnet 5.5에, 조사는 Flash 모델에 위임하며, 핵심 결정에만 고급 모델로 올리세요.
- 목표마다 시간과 금액 하드 예산을 설정하세요. "이 버그를 최대 $10 / 2시간 안에 해결"처럼 정하고, 기대에 맡기지 말고 오케스트레이터로 강제하세요.
O/AON과 Opus 5.5 장기 실행 중 무엇을 쓸까요
- O/AON: 며칠에 걸친 조사, 지속적인 모니터링, 다중 에이전트 조율, 영속 환경 상태가 필요한 작업
- Opus 5.5 에이전트 루프: 단일 목표의 코딩 작업(며칠이 아닌 몇 시간), 명확한 산출물, 일회성 실행
함께 읽을 자료
ChatGPT Pro Max 경제성, OpenAI Ultra Fast API 가격, Opus 5.5 25시간 에이전트 비용, 에이전트 경제성을 참고하세요.
관련 글
이 내용을 현재 스택에 적용하고 싶으신가요? 공급업체 청구서, 게이트웨이 로그, 주요 워크플로를 가져오시면 비용 요인과 절감 경로를 정리해드립니다. 무료 감사 예약 →