Исследователи представили NeoMME — семейство мультимодальных энкодеров размером 260M и 800M параметров, которые обрабатывают текст и изображения в едином двунаправленном Transformer. В отличие от многих современных визуальных языковых моделей, NeoMME не использует отдельную предобученную vision-башню или каузальную языковую модель. Вместо этого модель обучается с нуля на задаче masked discrete-diffusion, что позволяет ей эффективно работать с документами, изображениями и многоязычным текстом.
Традиционные подходы к визуальному поиску документов часто адаптируют предобученные генеративные визуальные языковые модели (VLM). В таких архитектурах отдельный vision-энкодер извлекает признаки изображения, проектор преобразует их в пространство входных данных языковой модели, а каузальный декодер обрабатывает объединённое представление. Однако для задач поиска, классификации и разметки токенов генерация текста не требуется, поэтому каузальный декодер добавляет лишние параметры и вычислительные затраты. NeoMME решает эту проблему, используя один Transformer для обеих модальностей: изображения делятся на сетку неперекрывающихся патчей 32×32 и проецируются через небольшой MLP, а текст обрабатывается с помощью факторизованных эмбеддингов токенов. Это упрощает предобучение, тонкую настройку и обслуживание модели.
| Параметр | NeoMME 260M | NeoMME 800M |
|---|---|---|
| Параметры | 260M | 800M |
| Контекст | 16 384 токена | 16 384 токена |
| Скорость на L40S | ~51 стр/с | — |
Архитектура NeoMME включает несколько современных улучшений: динамическое разрешение изображений (сохраняется соотношение сторон), контекст до 16 384 токенов (до двух изображений 4K), скользящее окно внимания с глобальными слоями каждые шесть слоёв, grouped-query attention, нормализация query-key, 2D ротационные позиционные эмбеддинги и MLP с squared-ReLU. Многоязычный токенизатор с 131k токенов обучен на текстах, коде, математике и машинных транскрипциях изображений. Предобучение проходит на смеси многоязычных текстов, кода, математики, естественных изображений и документов, каждая модель обрабатывает около 524 миллиардов токенов.
Архитектура обрабатывает текст и изображения в одном двунаправленном Transformer, обученном с нуля с помощью masked discrete-diffusion objective.

Для визуального поиска документов NeoMME-Retriever использует подход, аналогичный ColPali: модель возвращает плотные и late-interaction эмбеддинги за один прямой проход. На бенчмарке ViDoRe v3 обе модели лежат на парето-фронте по nDCG@10 и размеру модели. При разрешении 2048×2048 на GPU NVIDIA L40S модель 260M обрабатывает около 51 страницы в секунду, что примерно вдвое быстрее, чем ModernVBERT. Иерархический пулинг токенов и асимметричная квантизация сокращают размер индекса late-interaction с ~1.5 МБ до 6 кБ на страницу (в 255 раз), сохраняя более 95% качества поиска.
NeoMME доступен в Hugging Face Transformers, все чекпоинты опубликованы под лицензией Apache 2.0. Это открывает возможности для применения в системах визуального поиска, RAG и других задачах, где важна эффективность обработки документов. Однако стоит учитывать, что модель ориентирована на задачи энкодинга, а не генерации, поэтому для задач, требующих создания текста, потребуются другие подходы.



