Thứ Năm, 27 thg 8, 2026
Google DeepMind thực hiện đánh giá AI mù đôi đầu tiên nhằm giải quyết vấn đề nhiễm dữ liệu benchmark
Nghiên cứu8 ngày trước1/11Google DeepMind và AVERI vừa thử nghiệm Gemini 2.5 Flash-Lite bằng cách dùng môi trường bảo mật (secure enclave) để giữ kín cả trọng số mô hình lẫn các câu lệnh kiểm tra. Quá trình đánh giá sử dụng benchmark an toàn AILuminate từ MLCommons theo phương thức mù đôi, đảm bảo cả nhà phát triển lẫn bên đánh giá đều không tiếp cận được các tài sản nhạy cảm của nhau.
Dự án có sự tham gia của OpenMined và MLCommons này nhằm loại bỏ tình trạng nhiễm dữ liệu benchmark — hiện tượng các mô hình AI được huấn luyện trên chính bộ dữ liệu dùng để kiểm tra chúng. Thử nghiệm quy mô lớn này tiếp nối dự án thí điểm năm 2024 với GPT-2 và Viện An ninh AI, nằm trong chiến lược của AVERI nhằm thiết lập các tiêu chuẩn kiểm định mã nguồn mở cho các mô hình frontier.