Проект FineBooks, совместная инициатива Hugging Face и EleutherAI, опубликовал лидерборд, оценивающий качество распознавания текста на исторических книгах. Исследователи протестировали 14 открытых OCR-моделей на 2 165 страницах из коллекции Biodiversity Heritage Library (BHL). Лучшие модели достигли точности выше 97% по символам при стоимости менее двух долларов за тысячу страниц, что делает их пригодными для массовой переобработки оцифрованных книг.

Проблема, которую решает FineBooks, связана с качеством текстов, используемых для обучения языковых моделей. Библиотеки десятилетиями оцифровывали книги с помощью оптического распознавания символов, и результаты часто содержат ошибки. Проект Talkie показал, что модель, обученная на таких текстах, усваивает информацию лишь на 30% эффективнее по сравнению с обучением на ручных транскрипциях. Это существенно ограничивает качество открытых ИИ-моделей, обученных на общедоступных книгах.

МодельРазмерТочностьСтоимость / 1000 стр.
dots.mocr3B97.6%$1.94
OvisOCR20.9B96.9%$0.46
PaddleOCR-VL-1.61B96.1%$0.34
olmOCR-28.3B95.7%$0.45
LightOnOCR-21B95.1%$0.37
Qwen3.5-9B9.7B94.9%$0.89
DeepSeek-OCR3.3B93.8%$0.37

FineBooks выбрал в качестве первого целевого источника BHL, который хранит более 300 000 оцифрованных документов по естественной истории, в сумме превышающих 64 миллиона страниц. Для оценки качества распознавания использовались эталонные транскрипции, созданные экспертами проектов IMPACT и BHL-Europe в 2011–2012 годах. Эти данные доступны под лицензией CC-BY и легли в основу нового набора эталонных данных.

Лучшие модели достигли точности выше 97% при стоимости менее $2 за тысячу страниц, что делает их пригодными для обучения ИИ.

Three of the 2,165 ground-truth pages: a single-column English natural history text, a multilingual table of contents, and an illustration plate whose entire transcription is a single line of artist credit. | Image: FineBooks / Biodiversity
Three of the 2,165 ground-truth pages: a single-column English natural history text, a multilingual table of contents, and an illustration plate whose entire transcription is a single line of artist credit. | Image: FineBooks / Biodiversity · Источник: The Decoder

Результаты лидерборда показали, что размер модели не коррелирует с качеством распознавания исторических документов. Лучший результат — 97,6% точности — показала модель dots.mocr с 3 миллиардами параметров, тогда как более крупная Qwen3.5-9B (9,7 млрд параметров) набрала лишь 94,9%. Вторая строчка — OvisOCR2 с 0,9 млрд параметров и стоимостью 46 центов за тысячу страниц. Все 14 моделей являются открытыми и работают локально без API-ключей.

Оценка проводилась только на антиквенных шрифтах на четырех языках: английском, французском, немецком и латыни. Она не учитывает готический шрифт, нелатинские алфавиты и рукописные тексты. Кроме того, FineBooks ограничен одноколоночными книжными страницами. Авторы признают, что для научных транскрипций точность пока недостаточна: модели не столько ошибаются в символах, сколько молча модернизируют архаичные символы, например длинную s (ſ), заменяя их современными эквивалентами. Для решения этой проблемы предлагается точечная дообучение моделей.

Для обучения языковых моделей лучшие модели уже работают достаточно хорошо, отмечают авторы. Они производят значительно меньше ошибок, чем старые пайплайны, а переобработка коллекции размером с BHL реалистична при измеренных затратах. Однако библиотеки сталкиваются с другой проблемой: их системы полагаются на формат ALTO XML с координатами слов, тогда как новые модели выдают Markdown или простой текст без позиций слов, что мешает интеграции в существующую инфраструктуру.

Команда планирует переобработать около 200 000 общедоступных документов BHL с помощью одной из лучших моделей и выпустить полученный текст как открытый датасет. Лидерборд будет пополняться новыми моделями на постоянной основе, а оценочный фреймворк доступен открыто. Это может стать значимым шагом в улучшении качества открытых обучающих данных для ИИ.