Dịch vụ đánh giá của Agent Platform đã có sẵn chung (GA), cung cấp cho các nhà phát triển một động cơ thống nhất để đo lường chất lượng agent nhất quán từ thí nghiệm phát triển địa phương đến lưu lượng sản xuất thực tế. Bạn có thể đánh giá agent bằng hơn 20 chỉ số đã được xây dựng sẵn, các rubric thích ứng được DeepMind hỗ trợ, hoặc các chỉ số dựa trên mã tùy chỉnh và LLM-as-a-judge được lưu trữ trong một registry trung tâm và có phiên bản. Dịch vụ này tích hợp trực tiếp vào quy trình làm việc hiện có thông qua SDK của Agent Platform, agents-cli và ADK, đồng thời cung cấp bộ mô phỏng người dùng và môi trường tích hợp sẵn để tự động hóa kiểm thử đa lượt phức tạp và tối ưu hóa pipeline CI.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCEdevelopers.googleblog.com
  2. SOURCEdevelopers.googleblog.com
Bản Markdown