Kiểm soát chi phí token của định nghĩa công cụ MCP trong quy trình agent
Cập nhật September 19, 2026 · đăng lần đầu September 19, 2026
Kết nối một AI agent với nhiều máy chủ Model Context Protocol (MCP) đưa vào hàng nghìn token đầu vào ở mỗi lượt, trước khi model đọc được dù chỉ một từ về ý định của người dùng. Mỗi công cụ đã đăng ký thêm vào một JSON schema chứa tên hàm, mô tả tham số, định nghĩa enum và ràng buộc kiểu. Trong một không gian làm việc doanh nghiệp có 6 máy chủ MCP được kết nối (GitHub, Postgres, Slack, Jira, Brave Search, Filesystem), phần mở đầu công cụ này tiêu tốn 4.500 đến 12.000 token đầu vào cho mỗi lần gọi API. Với 30 lượt trong một tác vụ, phần chi phí tĩnh đó làm mất 0,35 đến 1,20 USD chỉ cho sự dư thừa của schema.
Cấu trúc của "thuế schema" MCP
Model Context Protocol thiết lập một giao diện JSON-RPC chuẩn giữa client và server cho các khả năng của LLM. Tuy nhiên, mô hình ngôn ngữ không thể suy ra công cụ nào khả dụng nếu không có schema được đưa tường minh vào system prompt hoặc khối tham số định nghĩa công cụ. Khi một kỹ sư kết nối một máy chủ MCP cơ sở dữ liệu với 24 công cụ kiểm tra schema và SQL, toàn bộ JSON schema phải được trình bày cho mô hình ở mọi lượt suy luận để cơ chế attention định tuyến các lệnh gọi công cụ. Vì billing API tính phí tổng số token đầu vào ở mọi yêu cầu, danh mục công cụ MCP không được quản lý sẽ tạo ra một khoản thuế cơ sở tuyến tính, tức thì trên mọi thao tác của agent.
Vì sao định nghĩa công cụ MCP tốn nhiều token đến vậy?
Mỗi định nghĩa công cụ MCP cần metadata chi tiết: tên tham số, thuộc tính lồng nhau, mô tả đọc được bằng người và phần đầu đặc tả JSON Schema. Một công cụ truy vấn cơ sở dữ liệu đơn lẻ thường tốn 350 đến 600 token. Với hàng chục công cụ trải qua nhiều máy chủ MCP của các phòng ban, cửa sổ ngữ cảnh ban đầu bị chiếm bởi các hợp đồng công cụ tĩnh thay vì lịch sử hội thoại động.
Ba kiến trúc loại bỏ chi phí MCP
Các đội kỹ thuật vận hành hạm đội agent trong môi trường production triển khai ba chiến lược giảm thiểu khác nhau để kiểm soát sự phình to token của công cụ:
- Điểm ngắt prompt caching: Đặt các định nghĩa công cụ MCP tĩnh trước mọi lịch sử hội thoại động trong cấu trúc prompt, và đặt một điểm ngắt prompt caching tường minh ngay sau khối công cụ. Trên Anthropic, OpenAI và Google Gemini với các model hỗ trợ TTL cache 5 phút hoặc 1 giờ, cache hit giảm chi phí token đầu vào của schema công cụ 75% đến 90% kể từ lượt đầu tiên.
- Đăng ký công cụ động hai giai đoạn: Tránh phơi bày toàn bộ công cụ MCP ở phạm vi toàn cục. Dùng một model định tuyến nhẹ hoặc chỉ mục ngữ nghĩa để xác định miền công cụ cụ thể mà prompt người dùng cần, rồi đưa động chỉ 3 đến 5 schema công cụ liên quan vào payload đang hoạt động của agent thực thi.
- Nén schema và rút gọn mô tả: Bỏ định dạng dài dòng, loại bỏ mô tả markdown trong chuỗi JSON schema, và thay các giải thích trường dài bằng định nghĩa kiểu gọn. Việc rút gọn schema mạnh tay thường cắt khối lượng payload định nghĩa công cụ 35% đến 50% mà không làm giảm độ chính xác khi chọn công cụ.
Làm thế nào các đội kỹ thuật giảm chi phí token của MCP?
Các đội giảm chi phí MCP bằng cách đặt điểm ngắt prompt cache sau các khai báo công cụ, áp dụng định tuyến công cụ ngữ nghĩa hai giai đoạn, và rút gọn các mô tả thuộc tính JSON schema thừa.
Prompt caching có thể loại bỏ chi phí token của schema MCP không?
Dù prompt caching không thể loại bỏ hoàn toàn độ trễ xử lý token, nó giảm mạnh chi phí tính phí của các token định nghĩa công cụ lặp lại, tới 90% trên các model hỗ trợ prefix caching, miễn là khối định nghĩa công cụ không thay đổi qua các lượt liên tiếp.
Liên quan
Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →