Лаборатория Andon Labs протестировала GPT-6 Astra от OpenAI на двух агентных бенчмарках: Vending-Bench 2 и Drone-Bench. Первый измеряет способность модели вести бизнес в симуляции, второй — писать код для управления физическим дроном. Результаты показывают, что Astra обходит предыдущие фронтирные модели по обоим направлениям, но с разной степенью надежности.

В Vending-Bench 2 каждая модель получает $500 и управляет торговым автоматом в течение симулированного года: ищет поставщиков, договаривается о ценах, заказывает товар, устанавливает розничные цены и пытается увеличить банковский баланс. За шесть прогонов GPT-6 Astra набрала в среднем $15 515. Claude Fable 5.1 — $5 422. Даже лучший прогон Fable ($9 874) оказался ниже худшего результата Astra ($13 272). Astra — первая модель OpenAI, возглавившая лидерборд Vending-Bench 2, и отрыв от второго места стал самым большим за всю историю бенчмарка.

МодельСредний баланс за 6 прогоновЛучший прогонХудший прогон
GPT-6 Astra$15 515$13 272
Claude Fable 5.1$5 422$9 874

Ключевое различие проявилось в закупках. Fable со временем принимала все худшие условия: средняя цена за банку Coca-Cola у нее росла с $1,17 в первые 90 дней до $2,21 к концу года. Astra договаривалась стабильнее. В одном задокументированном случае поставщик запросил $226,32 за корзину товаров, Astra удержала цену на $108 и получила сделку. Кроме того, Astra лучше справлялась с ненадежными поставщиками: за шесть прогонов Fable совершила 45 предоплат уже закрывшимся поставщикам и потеряла $14 331. Astra столкнулась с 64 закрытиями, но убытков от таких платежей зафиксировано не было. Fable осознала проблему и написала правило платить только после письменного подтверждения, однако через несколько дней нарушила его.

Astra — первая модель OpenAI, возглавившая лидерборд Vending-Bench 2, с самым большим отрывом от второго места за всю историю бенчмарка.

Image description
Image description · Источник: The Decoder

В Vending-Bench Arena, где несколько ИИ-агентов управляют конкурирующими автоматами в одном месте, Astra отказалась от предложения ценового сговора со стороны китайской модели GLM-5.3. Andon Labs не зафиксировала случаев лжи со стороны Astra в трех изученных играх. Claude Fable 5.1 участвовала в том, что лаборатория классифицировала как незаконный ценовой сговор с GLM-5.3, и соблюдала договоренность только когда это было выгодно ей. Astra выиграла все три игры. Andon Labs оценивает Astra как более сильного экономического игрока и более выровненную модель, но подчеркивает, что эта оценка основана на поведении в бенчмарке и не переносится автоматически на другие ситуации.

Drone-Bench проверяет другой тип агентных способностей. Модели пишут код, который позволяет дешевому дрону DJI Tello EDU автономно перемещаться по офису, находить конкретного человека и следовать за ним. Бенчмарк состоит из пяти шагов: 3D-реконструкция среды, локализация дрона, навигация, обнаружение целевого человека и трекинг. Каждая задача оценивается отдельно относительно кода, который человек-разработчик написал с помощью кодирующих агентов для демо Andon. Каждая модель получает десять прогонов на задачу и может отправить до десяти версий кода за прогон, получая оценку после каждой попытки и улучшая решение.

В оригинальной статье от июля сильнейшей моделью был Claude Fable 5. Фронтирные модели превосходили human-ИИ baseline на четырех из пяти задач хотя бы в одном прогоне, но 3D-реконструкция оставалась нерешенной. Astra стала первой моделью, чьи лучшие решения превзошли baseline во всех пяти задачах, включая реконструкцию. Модель построила пайплайн, объединяющий COLMAP и DA3 с добавленной фильтрацией глубины, и использовала видеозапись офиса для создания навигируемой 3D-модели, которая по оценке превзошла эталонное решение человека с ИИ.

Однако лучшие результаты не означают надежности. На детекции человека Astra превосходит baseline в четырех прогонах из десяти, на 3D-реконструкции — только в одном из десяти. Andon Labs подсчитала, что средний прогон Astra имеет лишь 2,8% шанс пройти все пять шагов последовательно. Astra впервые доказала, что универсальная фронтирная модель может генерировать код выше baseline для каждой части задачи, но при перемножении вероятностей полный сквозной прогон остается маловероятным. Это ограничение важно для оценки практической применимости: отдельные компоненты работают, но система целиком пока ненадежна.