Thứ Hai, 7 thg 9, 2026
H Company vừa ra mắt NeoMME, một họ mô hình encoder đa ngôn ngữ dùng cho văn bản và hình ảnh với quy mô 260 triệu và 800 triệu tham số. Mô hình 260 triệu thống nhất được điểm 0,523 nDCG@10 trên benchmark ViDoRe v3, gần bằng mức 0,524 của mô hình ColQwen2.5-v0.2 có 3,75 tỷ tham số nhưng sử dụng 14 lần ít tham số hơn. Các mô hình single-tower này bỏ bóng vision tower và causal decoder, cho phép tìm kiếm trang tài liệu, biểu đồ và bảng mà không cần bước OCR.
Các mô hình được huấn luyện trên 524 tỷ token đầu vào đã gộp với masked-diffusion text denoiser và bộ tối ưu NorMuon. Mô hình 260 triệu được phát triển trên 16 GPU H100, trong khi phiên bản 800 triệu cần 32 GPU. NeoMME hỗ trợ cửa sổ ngữ cảnh 16.384 token, đủ cho hai hình ảnh 4K UHD kích thước 3840x2160.