NeoMME: Building Document Retrieval Without Pretrained VLM Overhead
NeoMME is a 260M/800M multimodal encoder that rethinks visual document retrieval by training a single bidirectional Transformer from scratch instead of stacking pretrained components.