Quick answer: 대부분의 LLM 비용 모델은 입력 토큰과 출력 토큰이라는 단일 계량기만을 전제합니다. 하지만 웹 검색, 웹 페치, 코드 실행과 같은 서버 측 도구는 제공업체 인프라에서 실행되며 호출당 별도 요금이 부과됩니다.따라서 단일 에이전트 턴에서 도구 호출 비용과 그 결과가 컨텍스트에 추가되면서 발생하는 입력 토큰 비용이라는 이중 과금이 발생합니다.복리로 불어나는...

서버 측 도구는 별도의 청구서다

Updated September 1, 2026 · first published September 1, 2026

대부분의 LLM 비용 모델은 입력 토큰과 출력 토큰이라는 단일 계량기만을 전제합니다. 하지만 웹 검색, 웹 페치, 코드 실행과 같은 서버 측 도구는 제공업체 인프라에서 실행되며 호출당 별도 요금이 부과됩니다.

따라서 단일 에이전트 턴에서 도구 호출 비용과 그 결과가 컨텍스트에 추가되면서 발생하는 입력 토큰 비용이라는 이중 과금이 발생합니다.

복리로 불어나는 컨텍스트 비용

도구의 실행 결과는 대화 기록에 누적되며, 이후의 모든 턴에서 입력 토큰으로 계속해서 재전송됩니다. 작업 초반의 10회 웹 검색은 10번의 도구 사용료뿐만 아니라, 이후 모든 턴에서 수천 개의 토큰을 반복해서 읽는 비용을 발생시킵니다.

3가지 실질적 통제 방안

에이전트 실행당 도구 호출 횟수를 엄격히 제한하고, 컨텍스트에 추가하기 전에 결과 텍스트를 요약 및 축소하며, 변경되지 않는 시스템 프롬프트와 툴 정의에 프롬프트 캐싱을 적용해야 합니다.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research