---
format: "aidr-story-markdown/v1"
id: "02a178ff700f1bbeddd541b658c59d9a3a93650fb7012061246822292a8163da"
canonical_url: "https://aidr.today/02a178ff?lang=vi"
title: "PixelUMM Loại Bỏ VAEs và ViTs Khỏi Các Mô Hình Video Đa Phương Thức"
lang: "vi"
requested_lang: "vi"
available_langs: ["en","vi"]
translation_fallback: null
fallback_fields: []
published_at: "2026-10-02T07:38:13.000Z"
category: "Open Source"
topics: ["open-source"]
source_urls: ["https://huggingnews.com/ai/pixelumm-removes-vaes-and-vits-from-multimodal-video-models-6ce06acd","https://x.com/CongWei1230/status/2105808995910816159","https://marketbrief.now/ai/pixelumm-removes-vaes-and-vits-from-multimodal-video-models-6ce06acd"]
summary: "Mã nguồn và trọng số đã huấn luyện của một hệ thống hình ảnh và video mới đã được công bố công khai để các nhà phát triển sử dụng trong các tác vụ đa phương thức. Được phát triển bởi CongWei1230, mô hình mang tên PixelUMM thực hiện sinh tạo và hiểu biết trực tiếp trong không gian pixel, điều này loại bỏ nhu cầu sử dụng Vision Transformers (ViTs) và Variational Autoencoders (VAEs) thường được dùng để mã hóa dữ liệu hình ảnh trong các mô hình AI. Dự án được phát hành vào ngày 1 tháng 10 và sử dụng kiến trúc không mã hóa để vượt qua các bước nén chuẩn tìm thấy trong hầu hết các mô hình AI sinh tạo. Bằng cách loại bỏ sự phụ thuộc vào không gian tiềm năng, mô hình mong muốn thống nhất cách xử lý và sản xuất hình ảnh và video trong một khung hệ thống duy nhất."
---

# PixelUMM Loại Bỏ VAEs và ViTs Khỏi Các Mô Hình Video Đa Phương Thức

> [Open the canonical story](<https://aidr.today/02a178ff?lang=vi>)

**Published:** 2026-10-02T07:38:13.000Z
**Category:** Open Source
**Topics:** open\-source

## Summary

Mã nguồn và trọng số đã huấn luyện của một hệ thống hình ảnh và video mới đã được công bố công khai để các nhà phát triển sử dụng trong các tác vụ đa phương thức\. Được phát triển bởi CongWei1230, mô hình mang tên PixelUMM thực hiện sinh tạo và hiểu biết trực tiếp trong không gian pixel, điều này loại bỏ nhu cầu sử dụng Vision Transformers \(ViTs\) và Variational Autoencoders \(VAEs\) thường được dùng để mã hóa dữ liệu hình ảnh trong các mô hình AI\. Dự án được phát hành vào ngày 1 tháng 10 và sử dụng kiến trúc không mã hóa để vượt qua các bước nén chuẩn tìm thấy trong hầu hết các mô hình AI sinh tạo\. Bằng cách loại bỏ sự phụ thuộc vào không gian tiềm năng, mô hình mong muốn thống nhất cách xử lý và sản xuất hình ảnh và video trong một khung hệ thống duy nhất\.

## Sources

- [Story source](<https://huggingnews.com/ai/pixelumm-removes-vaes-and-vits-from-multimodal-video-models-6ce06acd>)
- [Story source](<https://x.com/CongWei1230/status/2105808995910816159>)
- [Story source](<https://marketbrief.now/ai/pixelumm-removes-vaes-and-vits-from-multimodal-video-models-6ce06acd>)

