Thứ Bảy, 29 thg 8, 2026

Phương pháp pretraining mới này thay thế các bộ mã hóa mục tiêu (target encoders) và cơ chế tái tạo bằng một bộ mã hóa duy nhất, được huấn luyện thông qua tính bất biến và SIGReg. Cách tiếp cận end-to-end này giúp đạt hiệu suất ngang ngửa V-JEPA 2 trong khi giảm chi phí tính toán từ 5,6 đến 20,8 lần.

LeVJEPA sử dụng một công thức ổn định để duy trì khả năng hiểu về hình ảnh và chuyển động, ngay cả khi loại bỏ ngẫu nhiên tới 95% video token. Phương pháp này là mã nguồn mở, giúp loại bỏ nhu cầu về masked predictions, stop-gradients hay các lịch trình teacher-student phức tạp.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@lukaskuhn7712:42 28 thg 8No target encoder, no masked prediction, no stop-gradient or teacher-student schedule
SUPPORT@randall_balestr12:58 28 thg 8open source + reproducible
SUPPORT@askalphaxiv2:24 29 thg 8randomly dropping 95% of video tokens, preventing representation collapse
SUPPORT@ylecun4:01 29 thg 8A new Pareto frontier in video pretraining