📰 IT Дайджест

← К выпуску 05.09.2026

NeoMME: единый Transformer для изображений и текста без отдельной vision tower

huggingface.co · #ai #encoder #huggingface #multimodal

Hugging Face выпустил NeoMME — семейство мультимодальных энкодеров 260M и 800M параметров. Модель обрабатывает текст и картинки одним bidirection-Transformer, обученным с нуля на masked discrete-diffusion. 260M модель на L40S обрабатывает ~51 страницу в секунду, а индекс late-interaction сжат в 255 раз без потери точности.

Открыть оригинал →