Mô hình S1 của Skild AI học các tác vụ robot 10 phút chỉ từ một video, thay thế 380 ví dụ mẫu
Research37 ngày trướcMô hình foundation S1 mới giúp robot thực hiện các chuyển động vật lý phức tạp bằng cách quan sát con người làm mẫu thay vì dựa vào chỉ dẫn bằng ngôn ngữ. S1 có thể học các quy trình gồm nhiều bước kéo dài tới 10 phút — như pha cà phê pour-over, lắp ráp bộ dụng cụ hay lật bánh pancake — chỉ từ một video duy nhất mà không cần fine-tune hay post-training. Trong một bài kiểm tra, robot đã có thể tự trồng cây chỉ 11 phút sau khi video mẫu của con người được ghi lại.
Trên các benchmark nội bộ, S1 đạt tỷ lệ thành công 66% với các tác vụ chưa từng gặp, trong khi mô hình Vision-Language-Action (VLA) dùng chỉ dẫn ngôn ngữ chỉ đạt 9% dù dùng chung 100.000 giờ pretraining. Skild ước tính một video mẫu có hiệu quả tương đương với khoảng 380 ví dụ post-training chuyên biệt cho từng tác vụ...
Nguồn chính
- SOURCE@skildai“It can be taught 10-minute long tasks that it has never seen before, from one video prompt without any fine-tuning”x.com
- SUPPORT@wallstengine“S1 reached a 66% success rate on unseen tasks versus 9% for a language-prompted VLA at the same 100K hours of pretraining”x.com
- SUPPORT@rohanpaul_ai“change the economics of robot learning completely”x.com
- SUPPORT@chris_j_paxton“this to me does feel like the true gpt moment for robotics”x.com