Лорен Тан, инженер в Cursor, объединила почти 800 пул-реквестов за первые 12 дней месяца. На вебинаре платформы Maven она объяснила, как выстроить доверие к ИИ-агентам в разработке, чтобы они могли работать автономно и не требовать постоянного контроля. До Cursor Тан работала в Meta над React-компилятором и в Netflix техническим лидом.

Ключевая проблема при работе с агентами — доверие. Когда разработчик не доверяет агенту, он вынужден постоянно проверять каждое действие, что ограничивает продуктивность и не позволяет запускать много агентов параллельно. Тан проводит параллель с управлением людьми: если менеджер не доверяет команде, он микроменеджерит и тратит время на проверку каждого коммита. С агентами ситуация аналогична. Если выстроить систему, которая даёт уверенность в их работе, можно перейти на уровень, где агенты работают автономно, а разработчик лишь просматривает уже принятые изменения.

Главный навык, по мнению Тана, — верификация (ИИ Evals). Это способность агента самостоятельно запускать код, снимать CPU-трассировки, открывать симулятор iOS или иным способом проверять свою работу в реальной среде. Верификация замыкает цикл: она не гарантирует архитектурного совершенства, но гарантирует корректность кода. Это существенный шаг к доверию.

В качестве примера Тан рассказывает о работе над окном агента в Cursor, которое внутри компании называют Glass. Когда она пришла, ей поручили помочь с этим компонентом, написанным на React, но сроки были сжатыми, а кодовая база незнакомой. Первоначально она была единственным верификатором: запускала сборку, видела ошибки, копировала их и передавала агенту. Это было узким горлышком. Тогда она создала skill под названием control glass, который позволял агенту самостоятельно запускать локальную сборку, подключаться через Chrome DevTools Protocol и анализировать трассы. Но агент всё ещё не знал, как устроено окно агента, и беспорядочно искал в коде при жалобах на тормозящую боковую панель.

Решением стала карта функций — feature map. Это файл, в котором описаны основные элементы интерфейса: как до них добраться, какие сочетания клавиш использовать, какие DOM-атрибуты применяются для выделения элементов через CDP. Тан реализовала это в своём плагине Pstack, который можно найти по запросу «Pstack cursor». В нём есть команда create verification skill, которая анализирует код и строит начальную карту функций. Это позволяет агенту обрабатывать даже расплывчатые запросы, например, «левая боковая панель тормозит», и быстро находить нужный код.

Тан признаётся, что её первый месяц в Cursor был не очень продуктивным, но по мере наработки навыков управления агентами продуктивность резко выросла. В прошлом месяце она объединила тысячу пул-реквестов, а за первые 12 дней текущего месяца — почти 800. Длина PR варьируется от 50 до 1000 строк. Она понимает, что у слушателей возникает вопрос о качестве такого кода, и отвечает, что верификация обеспечивает корректность, хотя архитектурные решения остаются за человеком.

Описанный подход отражает общий тренд в индустрии: ИИ-агенты становятся полноценными участниками процесса разработки, но требуют выстраивания систем проверки. Кейс Cursor показывает, что при правильной организации агенты способны выполнять значительный объём работы, освобождая разработчика для задач, требующих человеческого суждения.