Thứ Ba, 1 thg 9, 2026

Giờ đây, các nhà phát triển có thể dùng hệ thống suy luận hướng mục tiêu để xử lý video dài bằng cách điều chỉnh tốc độ khung hình và các phương thức dựa trên câu lệnh cụ thể. Khả năng agent này đã có mặt trên Gemini API và AI Studio cho các dòng mô hình 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite, cũng như trên nền tảng Gemini Enterprise Agent. Phương pháp mới giúp giảm lượng token tiêu thụ tới 88%, hạ chi phí xuống 66% và tăng độ chính xác trên benchmark thêm 7%.

Thay vì xử lý tĩnh với tốc độ cố định một khung hình mỗi giây, hệ thống mới sẽ quét bản ghi lời thoại để xác định các thời điểm liên quan trước khi truy xuất khung hình hình ảnh. Nhờ đó, Gemini có thể suy luận xuyên suốt cả luồng âm thanh và hình ảnh cho các nội dung từ video hướng dẫn 10 phút đến các bản ghi âm kéo dài nhiều giờ. Tính năng này sẽ sớm được tích hợp vào ứng dụng Gemini và...

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@google17:30 1 thg 9process long-form video content with more accuracy
SOURCE@googleaistudio17:34 1 thg 9take an active, goal-directed role in determining what to watch
SUPPORT@google17:30 1 thg 97% better accuracy
SOURCE@google17:33 1 thg 9Gemini Enterprise Agent Platform
SUPPORT@googledeepmind17:29 1 thg 9from 10-minute guides to multi-hour recordings