DeepSeek vừa phát hành mô hình multimodal thử nghiệm, giúp các AI agent xử lý hình ảnh hiệu quả tương đương với các dòng chuyên về văn bản hiện có. Dù duy trì mức giá rẻ của dòng Flash, DeepSeek-V4-Flash-Vision-Exp vẫn đạt hiệu suất tiệm cận Opus 4.8 trên các benchmark dành cho multimodal agent. Về cách tính phí, hình ảnh sẽ được token hóa với định mức tối đa 384 token mỗi ảnh.

Song song với mô hình mới, DeepSeek cũng tung ra Files API miễn phí nhằm giảm băng thông yêu cầu bằng cách cho phép người dùng tham chiếu lại các hình ảnh đã tải lên trước đó. Các thông số kỹ thuật của mô hình vision này bao gồm context window 1 triệu token, đầu ra tối đa 384 nghìn token và hỗ trợ định dạng JSON.

Đăng nhập để góp ý, chỉnh sửa

Nguồn chính

  1. SOURCE@deepseek_ai“multimodal agent performance close to Opus-4.8”x.com
  2. SOURCE@deepseek_ai“Images are tokenized for billing: up to 384 tokens each, at V4-Flash pricing”x.com
  3. SOURCE@deepseek_ai“Upload an image once, then reference it by file_id to save request bandwidth”x.com
  4. SUPPORT@maxforai“Vision 版和 V4 Flash 完全一个价”x.com
  5. SUPPORT@teortaxestex“RIP Whale Inference Fleet again”x.com
  6. SUPPORT@kimmonismus“this is the Flash model, the small one!”x.com
  7. SOURCE@stevibe“the official API!”x.com
  8. SUPPORT@omarsar0“DeepSeek-V4-Flash-Vision-Exp advances multimodal agent performance.”x.com
Bản Markdown