Разработчики конструктора баз данных и приложений «Интеграм» провели замер семи ИИ-моделей на задаче из реальной практики: пришла жалоба — найти изменение, которое эту проблему уже закрывало. Корпус — реальный рабочий проект: 4618 задач и изменений на русском языке, 100 вопросов с известными правильными ответами. Проверка автоматическая, сверяется номер задачи, без ИИ-судьи, чтобы оценка не «плыла» между прогонами.

Суть эксперимента — сравнить, как модели работают с разными способами подачи контекста. Четыре режима одинаковы для всех моделей: none — без контекста, kw — 12 фрагментов от поиска по совпадению слов, vecmory — 12 фрагментов от памяти на связях, mc — те же 12, но нужный ответ гарантированно внутри. Память на связях — это типизированные рёбра между записями: «эту проблему закрыло вот это изменение», «за этой задачей последовала вон та». Хранится в обычном PostgreSQL без расширений, без GPU и векторной БД.

Модельnonekwvecmorymc₽/верныймед. мс
gigachat-2-max0%40%57%71%1.85501
gigachat-20%32%51%42%0.21290
yandex-gpt-pro-5.10%42%61%77%1.14483
yandex-gpt-lite-50%39%53%62%0.66575
yandex-aliceai-llm0%39%58%75%1.54682
claude-opus-50%41%68%89%1.666741
claude-haiku-4.50%41%65%73%0.291361

Результаты показывают три вещи. Первое: при наивном поиске все семь моделей лежат в коридоре 32–42% — Opus 5 даёт 41%, GigaChat 2 Max — 40%, YandexGPT Pro — 42%. Разрыв между «дорогой» и «дешёвой» моделью почти не проявляется, потому что упирается не в ум модели, а в то, что нужный факт до неё не доехал. Второе: память добавляет каждой модели 14–27 пунктов, и дорогой Opus выигрывает от неё больше (+27), чем GigaChat 2 Max (+17). Третье, ради чего всё писалось: GigaChat 2 Max с памятью — 57%, Claude Opus 5 с обычным поиском — 41%. Пользователь, который сегодня мигрирует «на модель посильнее», на этом классе задач получил бы от памяти больше, чем от смены модели — дешевле и внутри своего контура.

При одинаковом контексте Claude Opus 5 даёт 68% против 57% у GigaChat 2 Max.

Разрыв между моделями при этом никуда не делся: при одинаковом контексте Opus даёт 68% против 57%, а в идеальных условиях — 89% против 71%. Эти 18 пунктов памятью не закрываются, их закрывает только работа над самой моделью. Отдельно про деньги: самая выгодная из семи — младшая gigachat-2: 0.21 ₽ за верный ответ против 1.85 ₽ у старшей и 1.66 ₽ у Opus. По точности она отстаёт от gigachat-2-max на шесть пунктов (51% против 57%), и эти шесть пунктов обходятся почти в девять раз дороже. Для потоковых задач, где ошибку ловит следующий этап, это может быть оправдано, но для финальных ответов — вряд ли.