Thứ Ba, 1 thg 9, 2026
Google giảm 88% lượng token video của Gemini nhằm tối ưu hóa khả năng hiểu theo dạng agent
Models2 ngày trước1/12Giờ đây, các nhà phát triển có thể dùng hệ thống suy luận hướng mục tiêu để xử lý video dài bằng cách điều chỉnh tốc độ khung hình và các phương thức dựa trên câu lệnh cụ thể. Khả năng agent này đã có mặt trên Gemini API và AI Studio cho các dòng mô hình 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite, cũng như trên nền tảng Gemini Enterprise Agent. Phương pháp mới giúp giảm lượng token tiêu thụ tới 88%, hạ chi phí xuống 66% và tăng độ chính xác trên benchmark thêm 7%.
Thay vì xử lý tĩnh với tốc độ cố định một khung hình mỗi giây, hệ thống mới sẽ quét bản ghi lời thoại để xác định các thời điểm liên quan trước khi truy xuất khung hình hình ảnh. Nhờ đó, Gemini có thể suy luận xuyên suốt cả luồng âm thanh và hình ảnh cho các nội dung từ video hướng dẫn 10 phút đến các bản ghi âm kéo dài nhiều giờ. Tính năng này sẽ sớm được tích hợp vào ứng dụng Gemini và...