---
format: "aidr-story-markdown/v1"
id: "042faabcce4839affc9f89ba6a93e1f177c965229bc42ae9a1091b349a0af0e0"
canonical_url: "https://aidr.today/042faabc?lang=vi"
title: "Mô hình S1 của Skild AI học các tác vụ robot 10 phút chỉ từ một video, thay thế 380 ví dụ mẫu"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-08-25T18:52:21.000Z"
category: "Research"
topics: ["robotics","reasoning","vision-language-action"]
source_urls: ["https://huggingnews.com/ai/skild-ai-s1-model-learns-10-minute-robot-tasks-from-one-video-replacing-ce34c26a","https://x.com/SkildAI/status/2092300842900865389","https://x.com/wallstengine/status/2092304576917721440","https://x.com/rohanpaul_ai/status/2092312459382235407","https://x.com/chris_j_paxton/status/2092304651995529392"]
summary: "Mô hình foundation S1 mới giúp robot thực hiện các chuyển động vật lý phức tạp bằng cách quan sát con người làm mẫu thay vì dựa vào chỉ dẫn bằng ngôn ngữ. S1 có thể học các quy trình gồm nhiều bước kéo dài tới 10 phút — như pha cà phê pour-over, lắp ráp bộ dụng cụ hay lật bánh pancake — chỉ từ một video duy nhất mà không cần fine-tune hay post-training. Trong một bài kiểm tra, robot đã có thể tự trồng cây chỉ 11 phút sau khi video mẫu của con người được ghi lại. Trên các benchmark nội bộ, S1 đạt tỷ lệ thành công 66% với các tác vụ chưa từng gặp, trong khi mô hình Vision-Language-Action (VLA) dùng chỉ dẫn ngôn ngữ chỉ đạt 9% dù dùng chung 100.000 giờ pretraining. Skild ước tính một video mẫu có hiệu quả tương đương với khoảng 380 ví dụ post-training chuyên biệt cho từng tác vụ..."
---

# Mô hình S1 của Skild AI học các tác vụ robot 10 phút chỉ từ một video, thay thế 380 ví dụ mẫu

> [Open the canonical story](<https://aidr.today/042faabc?lang=vi>)

**Published:** 2026-08-25T18:52:21.000Z
**Category:** Research
**Topics:** robotics, reasoning, vision\-language\-action

## Summary

Mô hình foundation S1 mới giúp robot thực hiện các chuyển động vật lý phức tạp bằng cách quan sát con người làm mẫu thay vì dựa vào chỉ dẫn bằng ngôn ngữ\. S1 có thể học các quy trình gồm nhiều bước kéo dài tới 10 phút — như pha cà phê pour\-over, lắp ráp bộ dụng cụ hay lật bánh pancake — chỉ từ một video duy nhất mà không cần fine\-tune hay post\-training\. Trong một bài kiểm tra, robot đã có thể tự trồng cây chỉ 11 phút sau khi video mẫu của con người được ghi lại\. Trên các benchmark nội bộ, S1 đạt tỷ lệ thành công 66% với các tác vụ chưa từng gặp, trong khi mô hình Vision\-Language\-Action \(VLA\) dùng chỉ dẫn ngôn ngữ chỉ đạt 9% dù dùng chung 100\.000 giờ pretraining\. Skild ước tính một video mẫu có hiệu quả tương đương với khoảng 380 ví dụ post\-training chuyên biệt cho từng tác vụ\.\.\.

## Sources

- [Story source](<https://huggingnews.com/ai/skild-ai-s1-model-learns-10-minute-robot-tasks-from-one-video-replacing-ce34c26a>)
- [Story source](<https://x.com/SkildAI/status/2092300842900865389>)
- [Supporting source](<https://x.com/wallstengine/status/2092304576917721440>)
- [Supporting source](<https://x.com/rohanpaul_ai/status/2092312459382235407>)
- [Supporting source](<https://x.com/chris_j_paxton/status/2092304651995529392>)

