본문으로 이동

OpenAI O / AON 상시 가동 에이전트 비용 모델

업데이트 September 27, 2026 · 최초 게시 September 27, 2026

유출된 참조 자료에 따르면 OpenAI의 "O"(코드명 AON)는 장기 작업을 위해 설계된 상시 가동 어시스턴트입니다. 응답하고 멈추는 채팅 모델과 달리 O는 자체 클라우드 환경을 할당받고, 실행 컨텍스트를 구성하고, 코드를 작성하고, 조사하며, 몇 시간, 며칠, 또는 몇 주 동안 계속 작동할 수 있습니다. 같은 작업을 두고 여러 에이전트가 서로 통신하는 방식도 포함될 수 있습니다. 공개가 예상되는 시점은 2026년 9월 29일 OpenAI Dev Day입니다.

비용 모델링에서 무엇이 달라지나요

기존 LLM 비용은 요청별 토큰 수 × 요율입니다. O/AON 비용은 시간 × 할당된 연산 + 토큰 처리량입니다.

구분채팅/Completion APIO / AON (예상)
과금 단위1M 토큰당시간당(연산) + 1M 토큰당
유휴 비용$0>$0 (환경 예약)
최대 실행 시간분 단위(타임아웃)며칠/몇 주
병렬성순차 요청다중 에이전트 군집
상태컨텍스트로 전달영속 환경

예상 비용 모델(추측, 유출 패턴 기반)

OpenAI는 아직 가격을 공개하지 않았습니다. 가능성이 높은 구조는 두 가지입니다.

옵션 A: 연산 시간 + 토큰 (Codespaces 방식)

입력 5M 토큰, 출력 2M 토큰을 쓰는 24시간 에이전트 실행 예시입니다.

구성 요소비용(낮음)비용(높음)
24시간 환경(시간당 $1)$24$48
입력 5M 토큰 @ $5/MTok$25$25
출력 2M 토큰 @ $15/MTok$30$30
합계$79$103

옵션 B: 정액 구독(Pro Max 번들)

상시 가동 에이전트의 비용 최적화 전략

  1. 종료하지 말고 휴면시키세요. 환경이 유지된다면 유휴 시간에는 에이전트 루프를 중지하고 인스턴스를 내리지 마세요. 콜드 스타트 비용이 유휴 예약 비용보다 큽니다.
  2. 하위 작업 토큰을 묶으세요. 하위 작업 결과를 모아 더 큰 단위로 컨텍스트를 기록하면 영속 환경에서 캐시 적중률이 올라갑니다.
  3. 하위 작업을 더 저렴한 모델로 라우팅하세요. O/AON은 오케스트레이션을 맡기고, 코딩은 Sonnet 5.5에, 조사는 Flash 모델에 위임하며, 핵심 결정에만 고급 모델로 올리세요.
  4. 목표마다 시간과 금액 하드 예산을 설정하세요. "이 버그를 최대 $10 / 2시간 안에 해결"처럼 정하고, 기대에 맡기지 말고 오케스트레이터로 강제하세요.

O/AON과 Opus 5.5 장기 실행 중 무엇을 쓸까요

함께 읽을 자료

ChatGPT Pro Max 경제성, OpenAI Ultra Fast API 가격, Opus 5.5 25시간 에이전트 비용, 에이전트 경제성을 참고하세요.

관련 글


이 내용을 현재 스택에 적용하고 싶으신가요? 공급업체 청구서, 게이트웨이 로그, 주요 워크플로를 가져오시면 비용 요인과 절감 경로를 정리해드립니다. 무료 감사 예약 →

finopsllm.com으로 돌아가기