Các bài kiểm tra Jev độc lập nói gì về chi phí
Cập nhật September 21, 2026 · đăng lần đầu September 21, 2026
Kiểm thử độc lập ban đầu ủng hộ luận điểm cơ bản về Jev: đây là cách nhanh và rẻ để đưa ra các quyết định có kiểu dữ liệu. Nó cũng bổ sung một điều kiện cần thiết: mức tiết kiệm phụ thuộc vào thứ mà nó thay thế. So với một lần gọi suy luận chậm, Jev cho kết quả chênh lệch rất lớn. So với một mô hình nhỏ có đầu ra có cấu trúc, mức chênh lệch nhỏ hơn nhưng vẫn hữu ích.
Bài kiểm thử chi tiết và có thể tái lập nhất mà chúng tôi tìm được là jev-measured, gọi Jev qua OpenRouter trên tám trường hợp gồm định tuyến, chọn công cụ, kiểm duyệt, xếp hạng lại, chấm điểm khách hàng tiềm năng và guardrail. Chi phí quyết định được báo cáo nằm trong khoảng từ $0.0000153 đến $0.0000254. Trong các lần chạy đối đầu trực tiếp, độ trễ trung vị của Jev là 352 ms và chi phí trung bình là $0.0000188.
Nơi tiết kiệm là thật
So với GPT-5 Nano trong bài kiểm thử đó, Jev rẻ hơn khoảng 18 lần cho mỗi fixture và phản hồi nhanh hơn nhiều. Điều đó có ý nghĩa khi quy trình cũ yêu cầu một mô hình sinh văn bản đọc trạng thái, suy luận, tạo phản hồi có định dạng, rồi code lấy một quyết định duy nhất từ văn bản đó.
So với Gemini Flash Lite và Mistral Small, chênh lệch chi phí đo được chỉ là 1.7 lần và 1.4 lần. Ở một trường hợp chỉ có một câu hỏi, mô hình nhỏ lại rẻ hơn. Đó không phải là thất bại của Jev. Nó xác định cơ hội thực sự: Jev mạnh nhất khi một lần gọi có thể thay thế một bước quyết định lặp lại, hoặc khi nhiều câu hỏi quyết định được đánh giá cùng lúc, chứ không phải khi bị ép vào mọi phân loại tầm thường.
Đầu ra có kiểu dữ liệu loại bỏ một chi phí thật
Chính benchmark đó ban đầu phát hiện lỗi schema ở các baseline mô hình chat: giá trị boolean ở chỗ cần xác suất, chuỗi xác suất thay vì số, và thiếu trường. Chế độ JSON schema nghiêm ngặt đã loại bỏ các lỗi này. Điều chỉnh này quan trọng. Viết tài liệu FinOps tốt không che giấu cấu hình tốt nhất của baseline. Nó cho thấy việc kiểm tra đầu ra, sửa lỗi, thử lại và phân tích cú pháp đều là chi phí riêng, và Jev loại bỏ toàn bộ nhóm chi phí đó cho hợp đồng đầu ra của chính nó.
Độ chính xác và hiệu chỉnh vẫn quyết định việc triển khai
Chi phí và độ trễ không trả lời được câu hỏi liệu một quyết định có đủ tốt để tự động hóa hay không. Một bài kiểm thử độc lập về physical-AI báo cáo mức đồng thuận 91.3% với 300 mẫu sự cố của chính nó, trong khi một bài kiểm thử nhỏ trên ticket hỗ trợ không tìm thấy bằng chứng nào ủng hộ tuyên bố chung rằng Jev chính xác hơn mọi mô hình chat. Cả hai đều là thí nghiệm sớm và hẹp. Chúng chỉ ra bài kiểm thử đúng cho sản xuất: đánh giá Jev trên các trường hợp đã gán nhãn của bạn và kiểm tra độ chính xác ở từng mức độ tin cậy.
Một bảng điểm thực tế có năm dòng: độ chính xác quyết định, hiệu chỉnh độ tin cậy, độ trễ trung vị và P95, chi phí trên mỗi quyết định đúng, và tỷ lệ chuyển tiếp. Kết quả đó có thể hành động được: định tuyến các trường hợp này sang Jev khi vượt ngưỡng này; gửi phần còn lại sang một mô hình lớn hơn hoặc để người xem xét. Điều này hữu ích hơn cả sự hưng phấn lúc ra mắt lẫn một cảnh báo chung chung là đừng tin mô hình.
Liên quan
- Evals là một công cụ kiểm soát chi phí
- Chi phí trên mỗi tác vụ thành công
- Vì sao giá của các nhà cung cấp không so sánh được
Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →