multimodal-ai.
2 writings found
Latest Archives
NeoMME: The Efficient Multimodal Encoder That Skips the VLM Bloat
NeoMME ditches separate vision towers for unified multimodal encoding. I break down why this matters for document retrieval and what it means for building efficient AI systems.
NeoMME: Building Document Retrieval Without Pretrained VLM Overhead
NeoMME is a 260M/800M multimodal encoder that rethinks visual document retrieval by training a single bidirectional Transformer from scratch instead of stacking pretrained components.
Prev
Page 1 of 1 Next