Разработчики конструктора баз данных и приложений «Интеграм» провели замер семи ИИ-моделей на задаче из реальной практики: пришла жалоба — найти изменение, которое эту проблему уже закрывало. Корпус — реальный рабочий проект: 4618 задач и изменений на русском языке, 100 вопросов с известными правильными ответами. Проверка автоматическая, сверяется номер задачи, без ИИ-судьи, чтобы оценка не «плыла» между прогонами.
Суть эксперимента — сравнить, как модели работают с разными способами подачи контекста. Четыре режима одинаковы для всех моделей: none — без контекста, kw — 12 фрагментов от поиска по совпадению слов, vecmory — 12 фрагментов от памяти на связях, mc — те же 12, но нужный ответ гарантированно внутри. Память на связях — это типизированные рёбра между записями: «эту проблему закрыло вот это изменение», «за этой задачей последовала вон та». Хранится в обычном PostgreSQL без расширений, без GPU и векторной БД.
| Модель | none | kw | vecmory | mc | ₽/верный | мед. мс |
|---|---|---|---|---|---|---|
| gigachat-2-max | 0% | 40% | 57% | 71% | 1.85 | 501 |
| gigachat-2 | 0% | 32% | 51% | 42% | 0.21 | 290 |
| yandex-gpt-pro-5.1 | 0% | 42% | 61% | 77% | 1.14 | 483 |
| yandex-gpt-lite-5 | 0% | 39% | 53% | 62% | 0.66 | 575 |
| yandex-aliceai-llm | 0% | 39% | 58% | 75% | 1.54 | 682 |
| claude-opus-5 | 0% | 41% | 68% | 89% | 1.66 | 6741 |
| claude-haiku-4.5 | 0% | 41% | 65% | 73% | 0.29 | 1361 |
Результаты показывают три вещи. Первое: при наивном поиске все семь моделей лежат в коридоре 32–42% — Opus 5 даёт 41%, GigaChat 2 Max — 40%, YandexGPT Pro — 42%. Разрыв между «дорогой» и «дешёвой» моделью почти не проявляется, потому что упирается не в ум модели, а в то, что нужный факт до неё не доехал. Второе: память добавляет каждой модели 14–27 пунктов, и дорогой Opus выигрывает от неё больше (+27), чем GigaChat 2 Max (+17). Третье, ради чего всё писалось: GigaChat 2 Max с памятью — 57%, Claude Opus 5 с обычным поиском — 41%. Пользователь, который сегодня мигрирует «на модель посильнее», на этом классе задач получил бы от памяти больше, чем от смены модели — дешевле и внутри своего контура.
При одинаковом контексте Claude Opus 5 даёт 68% против 57% у GigaChat 2 Max.
Разрыв между моделями при этом никуда не делся: при одинаковом контексте Opus даёт 68% против 57%, а в идеальных условиях — 89% против 71%. Эти 18 пунктов памятью не закрываются, их закрывает только работа над самой моделью. Отдельно про деньги: самая выгодная из семи — младшая gigachat-2: 0.21 ₽ за верный ответ против 1.85 ₽ у старшей и 1.66 ₽ у Opus. По точности она отстаёт от gigachat-2-max на шесть пунктов (51% против 57%), и эти шесть пунктов обходятся почти в девять раз дороже. Для потоковых задач, где ошибку ловит следующий этап, это может быть оправдано, но для финальных ответов — вряд ли.
