На Habr появился подробный кейс инженера, который в одиночку построил RAG-систему для поддержки разработки и довел её до уровня, когда его тегали в чатах 115 раз за неделю. История начинается с кризиса: после переезда проекта в другое облако основная точка входа в мобильном приложении перестала работать, поддержка получила 9 критичных дефектов, а документация устарела. Инженер, отвечавший за мобильный веб, решил использовать ИИ для анализа кода, задач и чатов.

Первая версия системы была простой: загрузчики на Python складывали задачи, документацию и треды из чатов в md-файлы рядом с кодом, а корпоративный ИИ-провайдер (Deepseek V4 Flash) через OpenAI API позволял быстро получать ответы. Уже через час под сообщением руководителя поддержки появился анализ с указанием, где и что чинить, и три исправленных дефекта. Это сработало, но быстро стало ясно, что документация не обновляется, а самая актуальная информация живет в чатах.

ФазаКлючевые элементыРезультат
Фаза 1Загрузчики на Python, md-файлы, Deepseek V4 FlashБыстрый анализ дефектов, 3 фикса за час
Фаза 2graphRAG, LlamaIndex, ChromaDB, BM25+vector, Graph of Thoughts115 тегов в чатах за неделю, актуальные ответы
Фаза 3Переписывание на Go, RTX 4090, qwen3.8 27b, Temporal-awareness, logicRAGProduction-решение, оптимизация
Фаза 4Бенчмарки DRAGON, RUMBA, EnterpriseRAG-Bench80.3% на DRAGON, остальные не подошли

На втором этапе инженер внедрил graphRAG поверх md-файлов с использованием LlamaIndex и ChromaDB. Он объявил источником истины чаты и код на проде, запустил процесс очистки базы знаний и добавил гибридный поиск (BM25 + векторный). Затем появился Graph of Thoughts, который разбивает вопрос на подвопросы, делает серию запросов и синтезирует ответ. Ответы можно было редактировать и сохранять как заметки с высоким приоритетом. Это позволило быстро находить актуальные ответы, но проект прервался: CTO заблокировал перевод, и инженера сократили.

Несмотря на увольнение, автор продолжил развитие. Он переписал систему на Go, считая Python неподходящим для production. Для инференса использовал домашний RTX 4090 с 24 ГБ VRAM, разместив qwen3.8 27b и qwen3-embedder. К решению добавились Temporal-awareness (учет времени) и logicRAG, а также оптимизации для работы на домашнем железе.

На этапе бенчмарков автор искал open-source проекты для сравнения, но не нашел систем с открытыми чатами. Он протестировал русскоязычные бенчмарки DRAGON и RUMBA. DRAGON, хоть и не обновляется полгода, показал результат 80.3%, что считается максимумом для новостного корпуса. RUMBA не подошел по типу системы. EnterpriseRAG-Bench с 500 тысячами документов (чаты, доки, таски, код) оказался слишком тяжелым для локального запуска.

Автор обратился в Альянс ИИ и к разработчикам бенчмарков за рекомендациями, но ответа не получил. В это же время Яндекс анонсировал Алису ИИ для бизнеса, которая решает схожие задачи. Кейс иллюстрирует, как RAG-системы эволюционируют от простого поиска к сложным пайплайнам, и какие проблемы возникают при их внедрении в реальных проектах.