Thứ Ba, 25 thg 8, 2026

Mô hình foundation S1 mới giúp robot thực hiện các chuyển động vật lý phức tạp bằng cách quan sát con người làm mẫu thay vì dựa vào chỉ dẫn bằng ngôn ngữ. S1 có thể học các quy trình gồm nhiều bước kéo dài tới 10 phút — như pha cà phê pour-over, lắp ráp bộ dụng cụ hay lật bánh pancake — chỉ từ một video duy nhất mà không cần fine-tune hay post-training. Trong một bài kiểm tra, robot đã có thể tự trồng cây chỉ 11 phút sau khi video mẫu của con người được ghi lại.

Trên các benchmark nội bộ, S1 đạt tỷ lệ thành công 66% với các tác vụ chưa từng gặp, trong khi mô hình Vision-Language-Action (VLA) dùng chỉ dẫn ngôn ngữ chỉ đạt 9% dù dùng chung 100.000 giờ pretraining. Skild ước tính một video mẫu có hiệu quả tương đương với khoảng 380 ví dụ post-training chuyên biệt cho từng tác vụ...

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@skildai17:19 25 thg 8It can be taught 10-minute long tasks that it has never seen before, from one video prompt without any fine-tuning
SUPPORT@wallstengine17:34 25 thg 8S1 reached a 66% success rate on unseen tasks versus 9% for a language-prompted VLA at the same 100K hours of pretraining
SUPPORT@rohanpaul_ai18:05 25 thg 8change the economics of robot learning completely
SUPPORT@chris_j_paxton17:34 25 thg 8this to me does feel like the true gpt moment for robotics