← Về trang chính1 tin
1
LeVJEPA đạt hiệu suất tương đương V-JEPA 2 nhưng tốn ít tài nguyên hơn 20 lần
Research34 ngày trướcPhương pháp pretraining mới này thay thế các bộ mã hóa mục tiêu (target encoders) và cơ chế tái tạo bằng một bộ mã hóa duy nhất, được huấn luyện thông qua tính bất biến và SIGReg. Cách tiếp cận end-to-end này giúp đạt hiệu suất ngang ngửa V-JEPA 2 trong khi giảm chi phí tính toán từ 5,6 đến 20,8 lần.
LeVJEPA sử dụng một công thức ổn định để duy trì khả năng hiểu về hình ảnh và chuyển động, ngay cả khi loại bỏ ngẫu nhiên tới 95% video token. Phương pháp này là mã nguồn mở, giúp loại bỏ nhu cầu về masked predictions, stop-gradients hay các lịch trình teacher-student phức tạp.
Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
- SOURCE@lukaskuhn77“No target encoder, no masked prediction, no stop-gradient or teacher-student schedule”x.com
- SUPPORT@randall_balestr“open source + reproducible”x.com
- SUPPORT@askalphaxiv“randomly dropping 95% of video tokens, preventing representation collapse”x.com
- SUPPORT@ylecun“A new Pareto frontier in video pretraining”x.com