NeoMME: единый Transformer для изображений и текста без отдельной vision tower
Hugging Face выпустил NeoMME — семейство мультимодальных энкодеров 260M и 800M параметров. Модель обрабатывает текст и картинки одним bidirection-Transformer, обученным с нуля на masked discrete-diffusion. 260M модель на L40S обрабатывает ~51 страницу в секунду, а индекс late-interaction сжат в 255 раз без потери точности.