Artificial Analysis, известная своими независимыми оценками больших языковых моделей и реализациями бенчмарков вроде GDPval-AA и AA-Briefcase, запустила платформу Optima. Она позволяет пользователям создавать собственные бенчмарки и сравнивать модели на своих данных, а не на абстрактных тестах. Идея в том, что публичные бенчмарки оценивают модели на заранее заданных задачах, но не показывают, какая модель лучше подходит для конкретного сценария. Optima пытается закрыть этот разрыв, давая возможность настроить сравнение под свои рабочие процессы.
Optima принимает несколько типов исходных данных. Можно загрузить существующие оценочные датасеты из своих файлов или с Hugging Face, а также трейсы ИИ-агентов с платформ вроде Arize, Braintrust или Langfuse. Разработчики могут установить навык, который собирает информацию из их среды разработки и прошлых сессий. Если таких данных нет, можно просто описать предполагаемый сценарий использования и предоставить примеры входных и выходных данных. Optima сгенерирует предлагаемые тестовые входы, критерии оценки и примеры задач, которые пользователь может отредактировать перед запуском бенчмарка.
| Метод оценки | Стоимость |
|---|---|
| Рубричная оценка | $0.125 за критерий на модель |
| Парное сравнение | $0.375 за сравнение |
Для оценки доступны два подхода: рубричная оценка по объективным критериям и парное сравнение, которое Artificial Analysis использует в своих бенчмарках. В парном подходе пользователь сначала оценивает пары ответов, указывая, какой предпочтительнее, а Optima выводит полный рейтинг на основе этих предпочтений. Помимо качества, Optima отслеживает стоимость за задачу и время за задачу как отдельные метрики. Это позволяет проверить, оправдывает ли прирост производительности более высокую цену или время обработки. Для агентных приложений цена за токен малоинформативна: более дешевая модель может оказаться дороже в итоге, если требует больше попыток или дополнительной доработки.
Платформа сравнивает модели по качеству, стоимости за задачу и времени за задачу, что особенно важно для агентных приложений.
Ранние тестеры создавали бенчмарки для финансовых и бухгалтерских агентов, чтобы найти модель, которая снижает затраты в десять раз без существенной потери качества. Другие проверяли, какая модель лучше соответствует стилю письма юристов или точнее определяет элементы в проприетарном наборе изображений. Optima взимает только фактические затраты на токены используемых моделей без наценки. Рубричная оценка стоит $0.125 за критерий на модель, парная — $0.375 за сравнение. При создании бенчмарка и на каждом этапе платформа резервирует баланс на основе оценки стоимости, а списание происходит по факту.
Optima решает известную проблему ИИ-бенчмарков. Анализ Epoch ИИ показал, что результаты зависят от деталей реализации, которые редко раскрываются. Разные формулировки промптов и настройки температуры приводили к заметным различиям в оценках одной и той же модели. Для агентных бенчмарков вроде SWE-bench смена scaffold — управляющего ПО и окружения инструментов — давала разницу до 15 процентных пунктов. Более широкое исследование 445 статей о бенчмарках с ведущих конференций выявило методологические слабости почти во всех: нечеткие определения, непрезентативные выборки, отсутствие статистической валидации. Лишь около 10% бенчмарков использовали полные реальные задачи.
Optima может решить проблему несоответствия общих бенчмарков конкретным сценариям, но глубокие методологические вызовы остаются. Даже с бенчмарком, адаптированным под ваши задачи, его полезность зависит от точности определения целевых способностей, репрезентативности тестовых случаев и качества реализации оценки. Кроме того, стоимость и время за задачу не показывают, какую ценность результат представляет для бизнеса. Дешевый и быстрый ИИ-конвейер может быть неэффективным, если его результаты требуют серьезной доработки или мало добавляют к процессу.



