Anthropic опубликовала результаты биологического эксперимента (плюс подробный отчет), в котором модель работала без человека до двух суток подряд. Claude получил список из шестнадцати белков-мишеней и задание: придумать для каждой по тридцать маленьких белков, которые к ней прилипнут. Дальше человек не вмешивался ни в одно научное решение — только подтверждал агенту сетевые доступы и следил, чтобы не упала инфраструктура. Готовые молекулы синтезировали и проверили две сторонние лаборатории. Одну мишень пришлось выбросить: белок слипался сам с собой, и оба прибора выдали нечитаемый сигнал. По остальным пятнадцати из 1320 проверенных дизайнов связались 354, а мишеней с хотя бы одним попаданием оказалось 14.

Белок — цепочка аминокислот, которая сворачивается в фигуру со сложным рельефом, и работает он именно потому, что к нему прикладывается другой белок. Отсюда идея лекарства: залепить нужное пятно на поверхности вредного белка, и он перестанет работать. Так устроена, например, Хумира — она гасит воспаление, затыкая белок TNF-альфа. Молекулу-затычку называют связывателем, а крепость хватки — аффинностью, и измеряют ее величиной KD: чем число меньше, тем крепче держит. За последние годы появился набор открытых нейросетей, которые эту задачу пытаются решить: одни рисуют форму, другие подбирают под нее последовательность аминокислот, третьи работают судьями и предсказывают, слипнется пара или нет. Проблема в том, что между ними нет автопилота. Живой человек должен решить, какой кусок мишени брать, куда целиться и какие из десяти генераторов запускать. Это дни, а нередко недели работы специалиста, который одновременно разбирается в биологии, в структурном моделировании и в devops. Anthropic попыталась заменить не инструменты, а вот этого человека между ними.

Агент сам искал биологию каждой мишени, сам ставил софт из публичных репозиториев, сам выбирал точку на поверхности, куда бить, сам решал, насколько жестко фильтровать и что в итоге заказывать. Из десяти генераторов структур — RFdiffusion, PXDesign, Genie 3, BoltzGen и прочих — он собирал под каждую мишень свою схему: всего на 1315 протестированных дизайнах получилось 24 разные комбинации методов. Работу раздавал двухслойной команде саб-агентов и сам же ее проверял. Показательна анатомия управляющего промпта: он занимает около 16 тысяч слов, но собственно науки в нем только треть. Остальные две трети — как делегировать задачи и как проверять результат до того, как о нем отчитываться.

Цифры получились сильные. Общая доля попаданий — 26,8% против 10-15%, типичных для поля сегодня. Если смотреть только на дизайн, который сам Claude поставил в своем списке первым, попадание — 49%. Самое эффектное сравнение вышло на мишени RBX1, по которой недавно проводили открытый конкурс: у всех участников связались 9 дизайнов из 245, у Claude — 28 из 90. Победителя того конкурса Anthropic пересинтезировала и померила в том же прогоне: его KD оказалась 45 наномолей, у лучшего дизайна Claude — 3,9, то есть примерно вдесятеро крепче.

А теперь то, о чем не рассказывает эффектная картинка из анонса. На мишени MBP — обычном бактериальном белке с большой гладкой водолюбивой поверхностью — не сработал ни один из 90 дизайнов. На BBF-14 сработали три из 90, и все три держались слабо, на уровне микромолей, то есть в сотни раз хуже удачных попаданий. BBF-14 примечателен тем, что это белок, которого в природе нет: его самого когда-то спроектировали с нуля, и именно поэтому его используют как проверку на прочность. Провалы легли не случайно, а с понятной закономерностью: агент споткнулся там, где у мишени нет эволюционной истории или не за что ухватиться.

Все десять генераторов, которыми дирижировал Claude, учились на одной и той же базе реальных белков. Это как опросить десять выпускников одной кафедры: десять мнений, но одно образование, и там, где кафедра слепа, слепы все десять. На это указал исследователь Равид Шварц-Зив, и данные Anthropic его подтверждают самым неприятным образом: оценки судейских моделей провал не предсказали. Сигнал был, но слишком слабый, чтобы на него опереться: у проваленных мишеней медианная оценка составила 0,68-0,70 против 0,72 у успешных. Заранее понять, что кампания пустая, было невозможно, только заказать синтез и померить.

Второй удар по фигуре дирижера — то, что он мало добавляет от себя. Финальное ранжирование тридцати дизайнов, та самая экспертная работа, ради которой все затевалось, совпадает с механическим скором судейских моделей с корреляцией 0,86. Качество этого ранжирования — 0,48 по метрике средней точности: заметно лучше случайного порядка, который дал бы 0,35, но не лучше самого скора с его 0,52. Отчет формулирует это без обиняков: ранжирование сработало примерно как скор, но не лучше него.

К методологии есть и более приземленные вопросы. Флагманское сравнение с конкурсом на RBX1 сделано на мишени, отчет по итогам которого лежал у агента в папке для чтения — и так с четырьмя из шести конкурсных мишеней. На двух мишенях, специально взятых чистыми, чтобы исключить подсказки из обучающих данных, результат скромный: на 15-PGDH ничья с людьми, на latent GDF-8 победа, но прогон шел без контрольных образцов. Успех на TNF-альфа — двенадцать связывателей — на поверку держится на четырех каркасах, восемь из двенадцати вообще варианты одного и того же каркаса Genie 3.

Интересно и то, как результат менялся по дороге к публике. В техническом отчете черным по белому: сопоставимую кампанию с людьми-экспертами мы не проводили и не утверждаем, что дизайны Claude лучше, чем эксперт получил бы с теми же инструментами и бюджетом. В блог-посте Anthropic это звучит уже как "на уровне ведущих экспертов или даже лучше" — и дальше по агрегаторам формулировка пошла гулять без всяких оговорок. Из содержательных возражений громче всех прозвучал Мартин Шкрели, бывший фармацевтический предприниматель, осужденный за мошенничество с ценными бумагами и отстраненный от индустрии, но в химии разбирающийся. Он заявил, что аффинности низкие и что внутрь клетки такие молекулы все равно не попадают. Первое неверно фактически: он смотрел на девять значений с рекламной картинки, тогда как в отчете 90 связывателей крепче 10 наномолей и 42 крепче одного. Второе верно, но это претензия к классу молекул вообще — белки такого размера через мембрану не проходят никакие.

При всем этом работа сильна ровно тем, что делает возможной саму критику. Anthropic выложила промпты, все 1440 дизайнов, сырые показания приборов обеих лабораторий и результаты провалившихся кампаний тоже — так поступает меньшинство. Валидацию делали две коммерческие лаборатории вслепую друг от друга, и это физика в пробирке, а не самоотчет нейросети. Честная формулировка результата такая: агент впервые сам, без человека в контуре, отработал за вычислительного биолога полный цикл и на хорошо изученных мишенях выдал результат на уровне сильных команд. Цена вопроса — от 10 до 50 тысяч долларов вычислений на кампанию, но сама возможность пока закрыта: биология заблокирована в публичном Fable 5 из-за рисков двойного назначения, программу доступа для ученых только обещают. Инструменты у всех уже есть, промпт выложен — возможно, другая модель без подобных ограничений справится лучше.

P.S. Поддержать меня можно подпиской на канал "сбежавшая нейросеть", где я рассказываю про ИИ с творческой стороны.