Chặn nhân rộng subagent và ủy quyền đệ quy làm cạn ngân sách token
Cập nhật September 19, 2026 · đăng lần đầu September 19, 2026
Nhân rộng subagent xảy ra khi một orchestrator tự động chia nhỏ tác vụ cấp cao thành các subtask song song và cho phép các worker sinh thêm worker chuyên biệt. Nếu không có giới hạn đồng thời cứng và giới hạn độ sâu, một prompt mơ hồ của người dùng có thể kích hoạt bùng nổ theo cấp số nhân: 1 supervisor gốc sinh 6 planner theo miền, mỗi planner khởi chạy 4 agent nghiên cứu, và các agent này gọi thêm worker con. Trong kiến trúc production, việc ủy quyền đệ quy không kiểm soát thường đốt 2,000,000 đến 8,000,000 token trong 5 phút, tạo khoản chi API đột biến từ $15 đến $80 cho chỉ một giao dịch.
Toán học của ủy quyền đệ quy agent
Trong một framework agent dạng cây, việc ủy quyền mở rộng theo hệ số nhánh B lũy thừa với độ sâu thực thi D. Nếu orchestrator phân nhánh với B = 4 và cho subagent đệ quy đến độ sâu D = 3, hệ thống lên lịch 64 vòng lặp agent độc lập. Mỗi agent lá giữ ngữ cảnh hội thoại riêng, thực hiện các lệnh gọi công cụ lặp và báo cáo kết quả trung gian lên cấp trên. Vì agent cha tổng hợp và tóm tắt đầu ra của con, việc tích lũy ngữ cảnh tăng theo cấp số bình phương trên toàn bộ cây thực thi.
Nhân rộng subagent trong AI tự động là gì?
Nhân rộng subagent là một kiểu lỗi trong đó agent orchestrator sinh đệ quy các agent con và cháu mà không có ràng buộc ngân sách toàn cục, làm tăng mức tiêu thụ token theo cấp số nhân trên các luồng thực thi song song.
Bốn rào chắn production cho đội multi-agent
Các đội nền tảng vận hành hệ thống agent doanh nghiệp ngăn thác nhân rộng mất kiểm soát bằng cách áp đặt ranh giới runtime nghiêm ngặt:
- Giới hạn độ sâu đệ quy (Depth Caps): Đặt trần cứng cho cấp bậc thực thi. Trong 95% trường hợp sử dụng doanh nghiệp, giới hạn
max_depth: 2(Supervisor gốc → Worker Agent) là đủ để hoàn thành tác vụ. Cấm worker sinh subagent cấp ba trừ khi được miễn trừ theo chính sách. - Pool token dùng chung theo luồng: Không cấp cho subagent ngân sách độc lập. Phân bổ một hạn mức token chung (ví dụ 250,000 token tổng) cho ngữ cảnh luồng gốc. Truyền số dư token còn lại qua header ngữ cảnh trace. Khi agent con tiêu token, trừ vào pool toàn cục; nếu pool về 0, mọi nhánh song song dừng ngay lập tức.
- Cầu dao đồng thời: Giới hạn số tiến trình con đang chạy song song ở mức 3–5. Nếu supervisor cố sinh nhiều worker đồng thời hơn sức chứa hàng đợi cho phép, hãy xếp các tác vụ vào hàng đợi tuần tự hoặc từ chối việc tách nhỏ.
- Tracing phân tán và lan truyền chi phí OTLP: Đưa trace ID và baggage header OpenTelemetry vào mọi bus tin nhắn giữa các agent. Khi OpenLIT hoặc ClickHouse tổng hợp chi tiêu, mọi span con phải gộp vào session ID cha, giúp thấy ngay chi phí bất thường theo từng nhánh.
Giới hạn đồng thời ngăn cạn kiệt token multi-agent như thế nào?
Giới hạn đồng thời điều tiết số vòng lặp worker đang chạy cùng lúc, ngăn lượng gọi API song song tràn ngập và cho phép cầu dao ngắt các vòng lặp agent lỗi trước khi ngân sách token cạn.
Độ sâu đệ quy khuyến nghị cho ủy quyền agent là bao nhiêu?
Độ sâu đệ quy khuyến nghị là 2 cấp, từ Orchestrator gốc đến Worker chuyên biệt. Hệ thống sâu hơn cho lợi ích lập luận giảm dần, trong khi làm tăng mạnh chi phí ngữ cảnh và khuếch đại lỗi.
Liên quan
Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →