Через четыре месяца после выхода пятого издания книги «Живое слово от истоков до современности. Этимология русского языка на основе методов системного анализа» её автор Владимир Морозов столкнулся с неожиданным эффектом: читатели, пытавшиеся проанализировать книгу с помощью больших языковых моделей (LLM), получали не разбор, а формальные отписки. ChatGPT, Gemini и DeepSeek, несмотря на вычислительную мощность, вместо анализа методов автора выдавали шаблонные вердикты: «это фолк-лингвистика», «альтернативная этимология», «не признаётся академической наукой».
Причина, как объясняет Морозов, кроется в архитектуре LLM. Эти модели — не мыслящие существа, а математические аппараты, обученные на огромных массивах текстов из интернета: Википедия, учебники, форумы. Когда пользователь задаёт вопрос «в лоб», модель включает механизм экономии ресурсов и выбирает статистически наиболее вероятный ответ, а не углубляется в суть. Такой «ленивый ответ» возникает из-за двух факторов: иллюзии компетентности (модель знает, что в академической среде есть строгие методы, и маркирует отклонения как ненаучные) и ложного смешения смыслов (термины вроде «пофонемный разбор» ассоциируются с любительскими публикациями 90-х).
| Модель | Контекстное окно | Поддержка PDF | Особенности |
|---|---|---|---|
| Gemini 1.5 Pro (Google) | 2 000 000 токенов | Да (прямая загрузка) | Наибольший объём памяти; понимает структуру таблиц |
| DeepSeek V4 / V4-Flash | 1 000 000 токенов | Да (загрузка файлов) | Бесплатный доступ, открытый код; понимает структуру таблиц |
| Claude 3.7 Sonnet (Anthropic) | 200 000 токенов | Да | Высокое качество анализа, но малый объём |
| GPT-4 (OpenAI) | 128 000 токенов | Да (через интерфейс) | Стандартный вариант, ограничен по объёму |
В качестве примера Морозов приводит типичный ответ на вопрос о происхождении слова «раб»: модель ссылается на праиндоевропейский корень *orbh-, игнорируя его собственную систему. При этом в новом чате нейросеть признаётся, что книгу не читала, а судит по аннотации и аналогичным материалам. Это не компетентный ответ, а отписка, которая убивает интерес читателя.
Морозов предлагает использовать RAG-подход для «переобучения» нейросети диалога.
Решение, предлагаемое автором, — использовать технологию направленного контекста Retrieval-Augmented Generation (RAG). Вместо общих вопросов нужно задавать конкретные, привязывая их к методологии книги, и просить нейросеть принять эту методологию за основу диалога. Например, включить режим веб-поиска, найти материалы на сайте автора и попросить применить его инженерный метод декомпозиции семантических полей фонем. Такой подход позволяет «переобучить» модель прямо в чате, без программирования.
Проблема «ленивых ответов» выходит за рамки лингвистики. Любая новая научная идея, противоречащая мейнстриму, рискует быть отвергнутой LLM, если не задать правильный контекст. Это важно для исследователей, студентов и преподавателей, которые используют ИИ как инструмент анализа. Морозов подчёркивает: бессмысленно жаловаться на нейросети — они работают так, как им установили, но их потенциал можно использовать, если понимать механизмы их работы.
Для читателей, впервые слышащих о теме, стоит пояснить: RAG — это подход, при котором модель дополняется внешними источниками информации в момент запроса, что позволяет ей опираться на конкретные документы, а не только на обученные веса. В случае с книгой Морозова это означает, что нейросеть может «прочитать» текст и анализировать его по заданной методологии, а не по усреднённым интернет-шаблонам.
Таким образом, ключевой вывод: чтобы получить от LLM содержательный ответ, нужно не просто задать вопрос, а правильно его сформулировать, указав контекст и источники. Это превращает нейросеть из критика в персонального тьютора, способного работать с новыми идеями.

