Thứ Hai, 24 thg 8, 2026

Các nhà phát triển Enterprise AI thường dùng các trình quét cấu trúc để kiểm tra kỹ năng của agent, nhưng nghiên cứu mới đây cho thấy phương pháp này có rất ít giá trị dự báo về hiệu suất thực tế. Công cụ Agentic Continuous Evaluation of Skills (ACES) của Nvidia ra đời sau một nghiên cứu trên 145 kỹ năng nội bộ và công khai, cho thấy mối tương quan giữa điểm quét tĩnh (về phong cách và bảo mật) với chất lượng đánh giá của LLM-judge chỉ ở mức 0,14. Công cụ mã nguồn mở này áp dụng chỉ số "Skill Lift", giúp so sánh tỷ lệ thành công của agent khi có và không có một kỹ năng cụ thể.

Qua đánh giá 947 trường hợp với 58 kỹ năng thực tế, mức Skill Lift trung bình đạt 0,2134, nhưng chỉ có 72,8% trường hợp cho thấy sự cải thiện tích cực. Nvidia lưu ý rằng những kỹ năng trông có vẻ chuẩn xác trên lý thuyết đôi khi lại gây ra hiện tượng thoái lui hiệu suất...

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SUPPORT@omarsar012:47 24 thg 8the largest process-metric gains appear in skill execution, behavior check, and skill efficiency
SUPPORT@theultronai10:06 24 thg 8A skill can look perfectly fine on paper... and still make the agent worse in practice