Anthropic опубликовала результаты биологического эксперимента, в котором языковая модель Claude работала без участия человека до двух суток подряд. Модель получила список из шестнадцати белков-мишеней и задание: придумать для каждой по тридцать маленьких белков, которые к ней прилипнут. Дальше человек не вмешивался ни в одно научное решение — только подтверждал агенту сетевые доступы и следил, чтобы не упала инфраструктура. Готовые молекулы синтезировали и проверили две сторонние лаборатории. Одну мишень пришлось выбросить: белок слипался сам с собой, и оба прибора выдали нечитаемый сигнал. По остальным пятнадцати из 1320 проверенных дизайнов связались 354, а мишеней с хотя бы одним попаданием оказалось 14.
Белок — цепочка аминокислот, которая сворачивается в фигуру со сложным рельефом, и работает он именно потому, что к нему прикладывается другой белок. Отсюда идея лекарства: залепить нужное пятно на поверхности вредного белка, и он перестанет работать. Так устроена, например, Хумира — она гасит воспаление, затыкая белок TNF-альфа. Молекулу-затычку называют связывателем, а крепость хватки — аффинностью, и измеряют ее величиной KD: чем число меньше, тем крепче держит. За последние годы появился набор открытых нейросетей, которые эту задачу пытаются решить: одни рисуют форму, другие подбирают под нее последовательность аминокислот, третьи работают судьями и предсказывают, слипнется пара или нет. Проблема в том, что между ними нет автопилота. Живой человек должен решить, какой кусок мишени брать, куда целиться и какие из десяти генераторов запускать. Это дни, а нередко недели работы специалиста, который одновременно разбирается в биологии, в структурном моделировании и в devops. Anthropic попыталась заменить не инструменты, а вот этого человека между ними.
| Мишень | Результат Claude | Результат конкурса |
|---|---|---|
| RBX1 | 28 попаданий из 90 | 9 из 245 у всех участников |
| MBP | 0 из 90 | — |
| BBF-14 | 3 из 90 (слабое связывание) | — |
Агент сам искал биологию каждой мишени, сам ставил софт из публичных репозиториев, сам выбирал точку на поверхности, куда бить, сам решал, насколько жестко фильтровать и что в итоге заказывать. Из десяти генераторов структур — RFdiffusion, PXDesign, Genie 3, BoltzGen и прочих — он собирал под каждую мишень свою схему: всего на 1315 протестированных дизайнах получилось 24 разные комбинации методов. Работу раздавал двухслойной команде саб-агентов и сам же ее проверял. Показательна анатомия управляющего промпта: он занимает около 16 тысяч слов, но собственно науки в нем только треть. Остальные две трети — как делегировать задачи и как проверять результат до того, как о нем отчитываться.
Общая доля попаданий — 26,8%, а для дизайнов, выбранных самим Claude, — 49%.
Цифры получились сильные. Общая доля попаданий — 26,8% против 10-15%, типичных для поля сегодня. Если смотреть только на дизайн, который сам Claude поставил в своем списке первым, попадание — 49%. Самое эффектное сравнение вышло на мишени RBX1, по которой недавно проводили открытый конкурс: у всех участников связались 9 дизайнов из 245, у Claude — 28 из 90. Победителя того конкурса Anthropic пересинтезировала и померила в том же прогоне: его KD оказалась 45 наномолей, у лучшего дизайна Claude — 3,9, то есть примерно вдесятеро крепче.
А теперь то, о чем не рассказывает эффектная картинка из анонса. На мишени MBP — обычном бактериальном белке с большой гладкой водолюбивой поверхностью — не сработал ни один из 90 дизайнов. На BBF-14 сработали три из 90, и все три держались слабо, на уровне микромолей, то есть в сотни раз хуже удачных попаданий. BBF-14 примечателен тем, что это белок, которого в природе нет: его самого когда-то спроектировали с нуля, и именно поэтому его используют как проверку на прочность. Провалы легли не случайно, а с понятной закономерностью: агент споткнулся там, где у мишени нет эволюционной истории или не за что ухватиться.
Все десять генераторов, которыми дирижировал Claude, учились на одной и той же базе реальных белков. Это как опросить десять выпускников одной кафедры: десять мнений, но одно образование, и там, где кафедра слепа, слепы все десять. На это указал исследователь Равид Шварц-Зив, и данные Anthropic его подтверждают самым неприятным образом: оценки судейских моделей провал не предсказали. Сигнал был, но слишком слабый, чтобы на него опереться: у проваленных мишеней медианная оценка составила 0,68-0,70 против 0,72 у успешных. Заранее понять, что кампания пустая, было невозможно, только заказать синтез и померить.
Второй удар по фигуре дирижера — то, что он мало добавляет от себя. Финальное ранжирование тридцати дизайнов, та самая экспертная работа, ради которой все затевалось, совпадает с механическим скором судейских моделей с корреляцией 0,86. Качество этого ранжирования — 0,48 по метрике средней точности: заметно лучше случайного порядка, который дал бы 0,35, но не лучше самого скора с его 0,52. Отчет формулирует это без обиняков: ранжирование сработало примерно как скор, но не лучше него.
К методологии есть и более приземленные вопросы. Флагманское сравнение с конкурсом на RBX1 сделано на мишени, отчет по итогам которого лежал у агента в папке для чтения — и так с четырьмя из шести конкурсных мишеней. На двух мишенях, специально взятых чистыми, что

