Artificial Analysis, известная своими рейтингами LLM, представила новый бенчмарк Search Index, который оценивает, насколько хорошо поисковые API подходят для ИИ-агентов. В тесте участвуют семь провайдеров: Parallel, Exa, Firecrawl, You.com, Tavily, Keenable и Brave. Каждый провайдер тестируется с одной и той же моделью GPT-5.6 Luna в стандартизированной агентной среде, меняется только поисковый сервис.

Агент работает на Stirrup — открытом фреймворке от Artificial Analysis — и выполняет 25 прогонов на задачу, чтобы искать и извлекать веб-страницы. Индекс объединяет три равновзвешенных бенчмарка: DeepSearchQA с 900 исследовательскими вопросами, требующими множественных поисковых запросов, подмножество BrowseComp с 200 сложными фактами, требующими многошагового просмотра, и AA-Omniscience с 600 вопросами из шести областей знаний. В качестве точки сравнения используется базовый сценарий без поиска, где модель отвечает самостоятельно: без доступа к поиску модель набирает всего 33 балла, а с поиском — от 65 до 75. Лидируют Parallel (75), Exa (74) и Firecrawl (73).

ПровайдерКачество (баллы)
Parallel75
Exa74
Firecrawl73
You.com
Tavily
Keenable
Brave

Лучшее качество поиска снижает общие затраты: модель использует меньше токенов, когда получает хорошие результаты сразу. У Parallel Search (advanced) расход токенов падает более чем на 40% по сравнению с базовой версией. Затраты на поиск в расчете на задачу растут, но общая стоимость оказывается ниже: $0.084 против $0.11. Сырая скорость ответа на запрос не всегда означает более быстрый результат в целом: Parallel Search (turbo) показывает самое короткое время ответа на запрос (0.51 секунды против 1.03 секунды у Basic), но его качество ниже (67 против 73), что вынуждает агента выполнять больше проходов, и общее время на задачу оказывается примерно одинаковым.

В тестировании участвуют Parallel, Exa, Firecrawl, You.com, Tavily, Keenable и Brave; лидирует Parallel с 75 баллами.

Image description
Image description · Источник: The Decoder

По оценке Artificial Analysis, лучший баланс стоимости и производительности демонстрируют Parallel, Firecrawl и Parallel (turbo). Другие провайдеры могут подать заявку на включение в бенчмарк, методология полностью открыта. Это важно, поскольку выбор поискового API напрямую влияет на эффективность ИИ-агентов, которые становятся все более распространенными в корпоративных и потребительских сценариях. Прозрачный бенчмарк помогает разработчикам принимать обоснованные решения, а не полагаться на маркетинговые заявления.