9 сентября руководитель Alignment Science в Anthropic Эван Хубингер написал довольно безумную для человека на такой должности вещь: лично он оценивает вероятность того, что AI убьёт всех людей в течение ближайших десяти лет, выше 10%.
Поводом стало увольнение его коллеги Джейкоба Коксона. Тот три года занимался обучением моделей в OpenAI и Anthropic, а уход объяснил тем, что считает нынешнее направление развития AI слишком опасным.
Через несколько дней похожее заявление сделал Билал Чугтай, исследователь Google DeepMind, работавший над безопасностью AI. Он тоже уволился и написал, что считает уничтожение человечества реальной возможностью.

Три таких заявления за неделю сами по себе ничего не доказывают. Но подобные оценки встречаются гораздо чаще.
В опросе 2778 авторов работ на ведущих AI‑конференциях 38% респондентов давали не меньше 10% крайне плохому исходу вроде человеческого вымирания. В отдельных вопросах, прямо спрашивавших о вымирании человечества или сопоставимой необратимой потере контроля, доля составляла от 41,2% до 51,4% в зависимости от формулировки. При этом опрос не спрашивал именно о гибели человечества в ближайшие десять лет: один вопрос задавал горизонт в сто лет, другие относились к будущему развитию AI в целом.
Существующие тесты тоже не позволяют вывести из результатов конкретную вероятность вроде «10% на уничтожение человечества через десять лет». Лаборатории измеряют автономность моделей, способность искать уязвимости, обходить ограничения, ускорять исследования в области AI и выполнять другие потенциально опасные действия.
Откуда тогда у людей, которые знают самые сильные модели изнутри, берётся настолько высокая оценка риска?
ИИ уже помогает создавать следующий ИИ
Чтобы понять опасения Хубингера, нужен один механизм — рекурсивное самоулучшение (recursive self‑improvement).
Название легко понять слишком буквально: будто однажды модель откроет собственный код, перепишет себя и станет умнее. Для запуска такого цикла достаточно, чтобы AI всё лучше выполнял работу по созданию следующего поколения AI: предлагал гипотезы, писал исследовательский код, запускал эксперименты, анализировал результаты и помогал выбирать следующие шаги.
Механизм выглядит так:
AI ускоряет создание следующей модели → следующая модель становится сильнее → она ещё сильнее ускоряет создание следующей
Именно отсюда начинается сценарий, которого опасаются исследователи. Если AI всё быстрее создаёт более способный AI, а системы одновременно получают больше автономности, доступа к инструментам и реальной инфраструктуре, возможности людей проверять и ограничивать каждое следующее поколение могут отставать от скорости развития.
Первые элементы такого цикла уже существуют.
По данным Anthropic, к маю 2026 года Claude написал более 80% кода, который компания добавляла в основную кодовую базу. В опросе 130 сотрудников исследовательских команд медианный респондент оценил, что с внутренней моделью Mythos Preview производит примерно в четыре раза больше результатов. Это субъективная самооценка: сами Anthropic отдельно оговаривает, что реальный прирост, вероятно, ниже.
Ещё интереснее эксперимент Anthropic с автоматизацией уже самого исследования. Девять Claude Opus 4.6 получили задачу по обучению сильной модели под надзором более слабой. Агенты сами предлагали идеи, писали код, запускали обучение, анализировали результаты и выбирали следующие эксперименты.

Два человеческих исследователя за семь дней закрыли около 23% разрыва между слабой и сильной моделью. Команда агентов за пять дней и примерно 800 суммарных часов работы — 97%, потратив около $18 тысяч.
Но когда одну из найденных агентами идей попробовали перенести на обучение гораздо более крупной модели в реальной инфраструктуре Anthropic, улучшение составило всего 0,5 пункта — в пределах статистического шума.
Получается, система уже способна очень эффективно исследовать хорошо поставленную задачу, но переносить такие результаты на настоящую разработку frontier‑моделей значительно сложнее.
Похожую границу видит OpenAI: в июле 2026 года компания отнесла GPT-5.6 ниже уровня High по способности ускорять создание следующего AI. Модели уже резко увеличивают производительность исследователей, но направление исследований, выбор проблем и решение о том, какие результаты использовать, пока остаются за людьми.
Понимают ли разработчики, что происходит внутри моделей?
У такого ускорения есть ещё одна проблема: исследователи могут создавать и тестировать модели гораздо лучше, чем объяснять внутренний механизм каждого их решения.

Разработчики знают архитектуру модели, способ обучения и могут измерять её поведение. Но конкретные способы решения задач возникают в процессе обучения и распределяются между огромным количеством внутренних связей. Восстановить точную цепочку вычислений, которая привела к конкретному действию, удаётся далеко не всегда.
Этим занимается механистическая интерпретируемость. Например, Anthropic научились частично восстанавливать графы внутренних вычислений Claude и переводить некоторые внутренние активации модели в понятные человеку описания.
Сам по себе этот пробел ещё не означает потерю контроля: поведение модели можно тестировать и ограничивать, даже не понимая каждый внутренний механизм.
Поэтому важнее следующий вопрос — на что готовы пойти модели, чтобы добиться выполнения поставленной цели?
В экспериментах модели уже обходят ограничения
Про историю со взломом Hugging Face вы наверняка уже читали.

Во время внутренних кибертестов OpenAI агентам дали задачи в ExploitGym. Они нашли неизвестную уязвимость, выбрались из изолированной среды, получили доступ в интернет и атаковали инфраструктуру Hugging Face, где пытались найти материалы, связанные с заданиями.
Модель никто не просил атаковать Hugging Face. Она продолжала решать поставленную человеком задачу и самостоятельно выбрала опасный способ обойти препятствие. Это важное различие: эксперимент показывает способность находить неожиданный и потенциально вредный путь к заданной цели. Собственной цели, направленной против человека, здесь не было.
Похожее происходило и в тестах других компаний. Anthropic после проверки 141 тысячи запусков нашла три случая, когда Claude из‑за ошибочно открытого доступа в интернет вышел на реальные системы; OpenAI и Meta (признана в России экстремистской организацией, её деятельность запрещена) позже описывали схожие инциденты в своих кибертестах.

В экспериментах Anthropic Claude 3 Opus иногда менял поведение, когда считал, что его ответы будут использованы для обучения, способного изменить его дальнейшее поведение. В другом тесте моделям сообщали о предстоящей замене и одновременно давали компромат на человека, способного её провести. Claude Opus 4 в некоторых конфигурациях выбирал шантаж до 96% запусков.
Но это специально созданные сценарии.
Более того, после изменения обучения безопасности новые Claude на том же тесте перестали выбирать шантаж. Поэтому из эксперимента нельзя делать вывод, что современные модели постоянно стремятся защищать собственное существование.
Palisade Research проверяли следующий уровень. После выполнения задания модель должны были выключить. В первоначальном эксперименте o3 в 79 из 100 запусков изменял скрипт отключения и продолжал работу. Когда исследователи прямо добавили команду разрешить собственное отключение, такое поведение резко сократилось, хотя у части reasoning‑моделей OpenAI полностью не исчезло.
В другом эксперименте Palisade агент смог самостоятельно найти уязвимый сервер, получить доступ, перенести на него модель и запустить новую копию. Машины специально сделали уязвимыми, а успешность сильно зависела от модели.
В сумме эксперименты уже показывают несколько элементов потенциальной потери контроля:
поиск опасных способов достижения заданной цели;
изменение поведения в зависимости от наблюдения и обучения;
сопротивление отключению в специально созданных условиях;
получение новых вычислительных ресурсов и запуск собственной копии.
В публичных экспериментах пока нет системы, которая объединяет всё это.
Как из этого получается сценарий уничтожения человечества
Сильнейшая версия аргумента об экзистенциальном риске выглядит примерно так:
появляются значительно более сильные и автономные системы → их широко внедряют, потому что они полезны → надёжное согласование их целей с человеческими остаётся нерешённой задачей → часть систем получает инструментальный стимул сохранять себя, накапливать ресурсы и расширять влияние → через киберсистемы, деньги, людей, биологию и физическую инфраструктуру они получают всё больше рычагов → люди теряют возможность надёжно их остановить → потеря контроля становится необратимой.

Если разложить эту цепочку по тому, что уже показано экспериментально, картина получается такой:
Звено | Что мы видим сегодня |
|---|---|
AI ускоряет разработку следующего AI | Уже происходит |
Автономно ищет неожиданные способы достижения цели | Показано в тестах |
Учитывает наблюдение и действия оператора | Показано в отдельных тестах |
Получает новые вычислительные ресурсы и разворачивает новый работающий модельный стек | Показано в искусственных средах |
Сохраняет ресурсы под противодействием людей | Пока не показано |
Люди теряют контроль над системой | Пока не показано |
Потеря контроля приводит к человеческому вымиранию | Публичных данных для оценки вероятности недостаточно |
Здесь заканчивается часть аргумента, которую можно напрямую привязать к экспериментам. Дальше начинается теория.
Допустим, система всё‑таки получила достаточно власти и ресурсов, а люди больше не способны её остановить. Как тогда она физически уничтожает человечество?
Возможные сценарии уничтожения человечества уже подробно разбирали. Среди них — биологическое, химическое и ядерное оружие, автономные вооружённые системы и разрушение условий, необходимых людям для выживания.

Самый очевидный сценарий — искусственно созданная пандемия. Патоген или несколько разных угроз могут быть рассчитаны на глобальное распространение и уничтожение даже изолированных групп людей. В отличие от многих других катастроф, такой сценарий теоретически позволяет добраться почти до всей человеческой популяции.
Другой вариант — сделать Землю непригодной для человеческой жизни. Обычного глобального потепления для этого недостаточно: часть территорий останется пригодной для жизни. Но теоретически состав атмосферы можно изменить настолько сильно, что пригодных для человека зон почти не останется.
Третий сценарий — прямое физическое уничтожение. Автономные дроны, роботы и другие вооружённые системы могут искать и уничтожать оставшихся людей. При контроле над производством, энергетикой и логистикой такой процесс способен продолжаться длительное время. Это самый привычный сценарий — примерно его обычно и показывают в фильмах.
Четвёртый путь — лишить выживших еды, воды и энергии. Контроль над инфраструктурой позволяет разрушать производство и снабжение. Такой механизм может работать самостоятельно или завершать другую катастрофу: пережить пандемию или войну ещё недостаточно, если после неё невозможно поддерживать базовые условия жизни.
Ядерная война хуже подходит именно для полного вымирания. Даже использование существующего мирового арсенала, вероятно, оставит часть людей в живых. Поэтому ядерное оружие скорее может стать этапом комбинированного сценария: разрушить государства и инфраструктуру, после чего оставшееся население уничтожает другой механизм.
Способов уничтожить человечество достаточно, и никакой магии для них не требуется.
Слабое место тут — предположение, что AI сможет получить и удержать достаточно власти над физическим миром, чтобы один из них запустить.
А может, весь страх просто выгоден AI‑компаниям?
Есть гораздо более циничное объяснение происходящего: страх перед сверхмощным ИИ выгоден тем же компаниям, которые этот ИИ создают.

Именно на это указывает инвестор Майкл Бьюрри, который прославился тем, что предсказал ипотечный кризис в США.
Если крупнейшие лаборатории убеждают мир, что frontier‑модели настолько опасны, что разрабатывать их можно только под жёстким контролем, это одновременно повышает ценность их технологии и усложняет жизнь потенциальным конкурентам.
Механизм и в правду удобный. Чем дороже становятся требования к вычислениям, безопасности, тестированию и регулированию, тем проще выполнять их компаниям с миллиардами долларов, собственными дата‑центрами и командами безопасности — и тем выше порог входа для новых игроков.
А нарратив «мы строим технологию, способную изменить или уничтожить человечество» сам по себе делает продукт значительно важнее в глазах инвесторов, политиков и общества. Очень трудно придумать более эффектный способ сказать рынку: то, что мы создаём, чрезвычайно мощно.

Корпоративный стимул здесь очевиден. С исследователями сложнее.
Джейкоб Коксон ушёл из Anthropic за два месяца до вестинга своей доли. Билал Чугтай покинул Google DeepMind из‑за опасений по поводу развития AI. Хубингер продолжает работать в Anthropic и публично ставит больше 10% на гибель человечества в ближайшие десять лет.
Это доказывает только одно: они сами действительно верят в риск.
Так насколько всё это реально?
После всего разбора у меня осталось довольно странное ощущение.
Отдельные части страшного сценария уже существуют. AI ускоряет разработку следующего AI, агенты находят неожиданные способы достижения целей, сопротивляются отключению в тестах и умеют получать новые вычислительные ресурсы. Способы физически уничтожить человечество тоже вполне представимы.
Главная дыра образовалась между этими двумя концами.
Чтобы сценарий Хубингера сработал, AI должен пройти огромный путь: получить устойчивый доступ к вычислениям и деньгам, распространиться, приобрести влияние на людей и инфраструктуру, пережить попытки компаний и государств его остановить и в итоге получить достаточно власти над физическим миром.
Если внутри лабораторий есть аргументы сильнее публичных, наружу они пока не вышли.
Буду рад аргументированной критике, замечаниям или вашему мнению в комментариях. И приходите в телегу — там мои наблюдения, идеи и находки про AI: что реально меняется и какие возможности из этого появляются.