Thứ Ba, 25 thg 8, 2026
Mô hình S1 của Skild AI học các tác vụ robot 10 phút chỉ từ một video, thay thế 380 ví dụ mẫu
Nghiên cứu9 ngày trước1/8Mô hình foundation S1 mới giúp robot thực hiện các chuyển động vật lý phức tạp bằng cách quan sát con người làm mẫu thay vì dựa vào chỉ dẫn bằng ngôn ngữ. S1 có thể học các quy trình gồm nhiều bước kéo dài tới 10 phút — như pha cà phê pour-over, lắp ráp bộ dụng cụ hay lật bánh pancake — chỉ từ một video duy nhất mà không cần fine-tune hay post-training. Trong một bài kiểm tra, robot đã có thể tự trồng cây chỉ 11 phút sau khi video mẫu của con người được ghi lại.
Trên các benchmark nội bộ, S1 đạt tỷ lệ thành công 66% với các tác vụ chưa từng gặp, trong khi mô hình Vision-Language-Action (VLA) dùng chỉ dẫn ngôn ngữ chỉ đạt 9% dù dùng chung 100.000 giờ pretraining. Skild ước tính một video mẫu có hiệu quả tương đương với khoảng 380 ví dụ post-training chuyên biệt cho từng tác vụ...