Исследователи представили NeoMME — семейство мультимодальных энкодеров размером 260M и 800M параметров, которые обрабатывают текст и изображения в едином двунаправленном Transformer. В отличие от многих современных визуальных языковых моделей, NeoMME не использует отдельную предобученную vision-башню или каузальную языковую модель. Вместо этого модель обучается с нуля на задаче masked discrete-diffusion, что позволяет ей эффективно работать с документами, изображениями и многоязычным текстом.

Традиционные подходы к визуальному поиску документов часто адаптируют предобученные генеративные визуальные языковые модели (VLM). В таких архитектурах отдельный vision-энкодер извлекает признаки изображения, проектор преобразует их в пространство входных данных языковой модели, а каузальный декодер обрабатывает объединённое представление. Однако для задач поиска, классификации и разметки токенов генерация текста не требуется, поэтому каузальный декодер добавляет лишние параметры и вычислительные затраты. NeoMME решает эту проблему, используя один Transformer для обеих модальностей: изображения делятся на сетку неперекрывающихся патчей 32×32 и проецируются через небольшой MLP, а текст обрабатывается с помощью факторизованных эмбеддингов токенов. Это упрощает предобучение, тонкую настройку и обслуживание модели.

ПараметрNeoMME 260MNeoMME 800M
Параметры260M800M
Контекст16 384 токена16 384 токена
Скорость на L40S~51 стр/с

Архитектура NeoMME включает несколько современных улучшений: динамическое разрешение изображений (сохраняется соотношение сторон), контекст до 16 384 токенов (до двух изображений 4K), скользящее окно внимания с глобальными слоями каждые шесть слоёв, grouped-query attention, нормализация query-key, 2D ротационные позиционные эмбеддинги и MLP с squared-ReLU. Многоязычный токенизатор с 131k токенов обучен на текстах, коде, математике и машинных транскрипциях изображений. Предобучение проходит на смеси многоязычных текстов, кода, математики, естественных изображений и документов, каждая модель обрабатывает около 524 миллиардов токенов.

Архитектура обрабатывает текст и изображения в одном двунаправленном Transformer, обученном с нуля с помощью masked discrete-diffusion objective.

Unlike dual-tower and VLM encoders, NeoMME processes image patches and text tokens in one bidirectional Transformer, without a pretrained vision tower or a pretrained text encoder or decoder.
Unlike dual-tower and VLM encoders, NeoMME processes image patches and text tokens in one bidirectional Transformer, without a pretrained vision tower or a pretrained text encoder or decoder. · Источник: Hugging Face Blog

Для визуального поиска документов NeoMME-Retriever использует подход, аналогичный ColPali: модель возвращает плотные и late-interaction эмбеддинги за один прямой проход. На бенчмарке ViDoRe v3 обе модели лежат на парето-фронте по nDCG@10 и размеру модели. При разрешении 2048×2048 на GPU NVIDIA L40S модель 260M обрабатывает около 51 страницы в секунду, что примерно вдвое быстрее, чем ModernVBERT. Иерархический пулинг токенов и асимметричная квантизация сокращают размер индекса late-interaction с ~1.5 МБ до 6 кБ на страницу (в 255 раз), сохраняя более 95% качества поиска.

NeoMME доступен в Hugging Face Transformers, все чекпоинты опубликованы под лицензией Apache 2.0. Это открывает возможности для применения в системах визуального поиска, RAG и других задачах, где важна эффективность обработки документов. Однако стоит учитывать, что модель ориентирована на задачи энкодинга, а не генерации, поэтому для задач, требующих создания текста, потребуются другие подходы.