В декабре 2025 года фонд ARC Prize Foundation, основанный Франсуа Шолле, представил третий вариант бенчмарка ARC-AGI-3. В отличие от предыдущих версий, задачи превратились в интерактивные игры в стиле Atari: агенту неизвестны правила и цель, их нужно выявить в процессе действий. Метрика RHAE оценивает, сколько уровней пройдено и сколько действий на это потрачено, эталоном служит усредненный человек, играющий впервые. Предполагалось, что агент, выводящий правила из наблюдений, потратит мало действий, а переборщик — много.
Ряд проектов заявили о 100% результате в этом бенчмарке. Однако, как показывает разбор проекта Сергея Родионова, PhD из SingularityNET, эти результаты достигаются не за счет общего интеллекта, а за счет инженерной обвязки. Схема проекта: агент — это Codex с доступом к Linux-окружению, файлам и Python. Алгоритмический контроллер отправляет агенту промпты, управляет циклом игры. Агент наблюдает состояние, строит гипотезу об устройстве мира, действует, проверяет результат и правит гипотезу. В первом препринте заявлены три идеи: исполняемая модель мира (игровая задача симулируется в Python), смещение к простоте (замена частных случаев общими правилами) и проверка воспроизведением (точное воспроизведение каждого наблюдения).
| Версия ARC | Год | Формат задач | Результаты |
|---|---|---|---|
| ARC-AGI-1 | 2019 | Цветные сетки, статические задачи | Первые решения — единицы процентов, затем LLM >70% |
| ARC-AGI-2 | 2025 | Несколько правил, удержание контекста | Текущие LLM не справились |
| ARC-AGI-3 | 2025 | Интерактивные игры в стиле Atari | Некоторые проекты заявляют 100% |
Автор статьи, разбиравший проект, приходит к выводу: правилам ARC-3 агент соответствует, но духу — нет. Это связная конструкция инженера, заточенная под бенчмарк. Работать такое будет только на простых, ограниченных искусственных мирах, потому что упирается в комбинаторный взрыв: написание кода для более сложной задачи и поиск решения внутри симуляции. Задачи продолжают решаться перебором — генерация идей, проверка, цикл повторяется. Для бенчмарка это выглядит как достижение, потому что проверка гипотез вынесена наружу, ее производит система LLM — Python-симулятор. На докладе автор получил справедливый ответ: человек тоже решает перебором, и с этим сложно спорить, если отбросить романтику озарений.
История бенчмарка ARC началась в 2019 году с задач на цветных сетках, где модель должна была по двум примерам решить задачу. Шолле ориентировался на то, что для каждой задачи свое правило, которого нет в обучающих данных, — модель выводит его непосредственно в моменте. ARC-AGI-1 продержался пять лет: первые решения достигали единиц процентов, затем использовали алгоритмы перебора, но из-за комбинаторного взрыва это не масштабировалось. Первых реальных успехов добились рассуждающие LLM, превысив 70%. ARC-AGI-2 вышел в 2025 году и потребовал использования нескольких правил и удержания контекста, что текущие LLM не смогли. ARC-AGI-3 изменил формат на интерактивные игры, чтобы исключить перебор.
Для нейросетей можно выделить три подхода к решению ARC-AGI-3. Прямое взаимодействие: игра отдает модели состояния, нейросеть выдает следующее действие, показатели так себе, модель теряет нить и галлюцинирует. Обучение с подкреплением: классический вариант, но устройство бенчмарка не позволяет набрать нужный объем датасета. Агентная обвязка: модель работает в цикле с инструкцией, памятью, файловой системой и исполняемым кодом — этот подход показал максимальный результат. Бенчмарк, измеряющий способность к обучению, фактически проверяет качество инженерной обвязки вокруг нейросети.
Таким образом, 100% в ARC-AGI-3 не означает AGI. Это скорее инженерное достижение, демонстрирующее, как можно обойти ограничения бенчмарка с помощью перебора и симуляции. Вопрос о том, что такое общий интеллект, остается открытым, и ARC-AGI-3, возможно, не приближает нас к ответу, а лишь показывает, как сложно его измерить.

