Thứ Sáu, 21 thg 8, 2026

DeepSeek vừa phát hành mô hình multimodal thử nghiệm, giúp các AI agent xử lý hình ảnh hiệu quả tương đương với các dòng chuyên về văn bản hiện có. Dù duy trì mức giá rẻ của dòng Flash, DeepSeek-V4-Flash-Vision-Exp vẫn đạt hiệu suất tiệm cận Opus 4.8 trên các benchmark dành cho multimodal agent. Về cách tính phí, hình ảnh sẽ được token hóa với định mức tối đa 384 token mỗi ảnh.

Song song với mô hình mới, DeepSeek cũng tung ra Files API miễn phí nhằm giảm băng thông yêu cầu bằng cách cho phép người dùng tham chiếu lại các hình ảnh đã tải lên trước đó. Các thông số kỹ thuật của mô hình vision này bao gồm context window 1 triệu token, đầu ra tối đa 384 nghìn token và hỗ trợ định dạng JSON.

Đăng nhập để góp ý, chỉnh sửa
Nguồn chính
SOURCE@deepseek_ai9:17 21 thg 8multimodal agent performance close to Opus-4.8
SOURCE@deepseek_ai9:17 21 thg 8Images are tokenized for billing: up to 384 tokens each, at V4-Flash pricing
SOURCE@deepseek_ai9:17 21 thg 8Upload an image once, then reference it by file_id to save request bandwidth
SUPPORT@maxforai9:18 21 thg 8Vision 版和 V4 Flash 完全一个价
SUPPORT@teortaxestex9:21 21 thg 8RIP Whale Inference Fleet again
SUPPORT@kimmonismus9:50 21 thg 8this is the Flash model, the small one!
SOURCE@stevibe12:12 21 thg 8the official API!
SUPPORT@omarsar013:52 21 thg 8DeepSeek-V4-Flash-Vision-Exp advances multimodal agent performance.