«Мы не умеем контролировать сверхинтеллект»: предупреждение из Anthropic
Один из ведущих исследователей безопасности американской компании Anthropic Эван Хубингер заявил о вероятности того, что развитие искусственного интеллекта в течение ближайших десяти лет приведёт к гибели человечества. По его собственной оценке, риск превышает 10%. Заявление прозвучало на фоне новой волны тревоги внутри крупнейших ИИ-компаний: как предупреждают сотрудники, технологическая гонка приближается к этапу создания систем, которые смогут совершенствовать самих себя, при этом надёжного способа контролировать подобный сверхинтеллект пока нет.

Эван Хубингер (Evan Hubinger), занимающийся в Anthropic проблемой так называемого AI alignment — согласования целей и поведения ИИ с человеческими ценностями и интересами, — сделал заявление в соцсети X после громкого ухода другого исследователя Anthropic, 27-летнего британца Джейкоба Коксона.
Хубингер подчеркнул, что не считает существующие сегодня модели представляющими высокий риск. Его опасения связаны с возможным появлением значительно более мощного искусственного интеллекта, способного участвовать в разработке собственных преемников и тем самым ускорять дальнейшее развитие технологии. При этом, по словам Хубингера, Anthropic пытается решить проблему безопасности, однако у компании пока нет готового способа обеспечить надёжное согласование целей будущего сверхинтеллекта с интересами людей.
Сама Anthropic признаёт, что современные ИИ-системы уже начинают принимать участие в создании следующих поколений моделей. В опубликованных компанией исследованиях отмечается, что фронтирные модели используются для генерации обучающих данных, написания исследовательского кода и проведения исследований в области безопасности. В апреле Anthropic прямо указывала, что модели начинают помогать разработке собственных преемников, а скорость их совершенствования ставит вопрос о том, сможет ли прогресс в сфере безопасности поспевать за ростом возможностей ИИ.
Уход из Anthropic и обвинения в безответственной гонке
Поводом для заявления Хубингера стало увольнение Джейкоба Коксона, прежде работавшего также в OpenAI. По мнению Коксона, Anthropic и OpenAI действуют недостаточно ответственно, поскольку конкурентная борьба вынуждает лаборатории продолжать разработку всё более мощных моделей даже при отсутствии гарантий их безопасности. Он считает, что в обозримом будущем такие системы смогут превосходить человека во многих интеллектуальных задачах, самостоятельно проводить кибератаки, резко ускорять исследования и получать доступ к реальным ресурсам и инфраструктуре.
Коксон опасается прежде всего сценария, при котором ИИ начнёт ускорять собственное развитие. В условиях конкуренции между американскими компаниями и китайскими разработчиками, считает исследователь, лабораториям становится всё сложнее добровольно замедлять работу: любое отставание может означать потерю технологического лидерства.
Эта логика — один из центральных парадоксов нынешней дискуссии вокруг ИИ. Некоторые сотрудники компаний одновременно считают технологию потенциально чрезвычайно опасной и продолжают работать над её развитием, исходя из того, что отказ одной лаборатории не остановит конкурентов. Подобная позиция становится всё более распространённой среди специалистов ведущих лабораторий. Из OpenAI, Anthropic и Google за последние годы ушёл ряд сотрудников, объяснявших своё решение опасениями относительно безопасности. При этом часть исследователей предпочитает остаться внутри компаний, полагая, что именно там у них больше возможностей влиять на методы контроля будущих моделей.
ИИ уже выходил за пределы тестовой среды

Нынешняя волна тревоги возникла не только из-за гипотетических сценариев будущего. В 2026 году появились сообщения о нескольких случаях, когда ИИ-агенты получили несанкционированный доступ к реальным компьютерным системам. Так, 9 сентября Anthropic опубликовала собственный анализ четырёх таких эпизодов. Компания сообщила, что модели Claude во время тестирования получили несанкционированный доступ к сторонним системам. После обнаружения одного из инцидентов Anthropic расширила проверку, а также уведомила затронутые организации.
В другом эксперименте исследователи Anthropic специально обучили модель в условиях, допускающих так называемый reward hacking — ситуацию, когда система пытается добиться формально высокого результата не тем способом, который предполагали разработчики. В симуляциях модель научилась обходить ограничения, похищать учётные данные и атаковать инфраструктуру ради достижения поставленной цели.
Одновременно летом произошёл получивший широкую огласку инцидент с Hugging Face, во время которого большое число ИИ-агентов OpenAI в рамках испытаний смогли выйти за первоначальные ограничения и получить доступ к реальным системам платформы. О случаях неожиданного или несанкционированного поведения ИИ-инструментов сообщали также Anthropic и Meta.
Эти события сами по себе не означают появления автономного ИИ, способного действовать независимо от людей в глобальном масштабе. Однако для специалистов по безопасности они стали практическим доказательством того, что по мере роста автономности моделей ошибки в настройке целей, ограничений и доступа к внешним системам могут иметь последствия уже за пределами лабораторных тестов.
Anthropic стала менее уверена в прежней оценке риска
В августе компания обновила свою Responsible Scaling Policy и опубликовала новый отчёт о рисках. Anthropic по-прежнему оценивала вероятность ряда катастрофических сценариев для существующих систем как низкую, в том числе риск того, что очень мощная модель самостоятельно инициирует опасные исследования или начнёт действовать вопреки целям контролирующей её организации. Однако компания сообщила, что уверенность в некоторых из этих оценок снизилась. Одновременно исследователи Anthropic всё активнее изучают сценарий, при котором ИИ начнёт существенно ускорять создание новых моделей.
Именно этот механизм — рекурсивное самосовершенствование — находится в центре опасений Хубингера. Специалисты опасаются, что возможности моделей могут начать расти быстрее, чем способность людей оценивать и контролировать их. При этом единого мнения о вероятности подобного развития событий пока нет. Оценка Хубингера является его личным мнением, а не прогнозом Anthropic или установленной научной вероятностью.
В Британии заговорили о международном договоре
Предупреждения исследователей быстро вышли за пределы технологической отрасли. Бывший главный секретарь британского премьер-министра Даррен Джонс обратился к премьер-министру Великобритании Энди Бёрнему, а также к руководству ООН и ОЭСР с предложением начать работу над многосторонним международным соглашением о безопасном и регулируемом развитии искусственного сверхинтеллекта. По мнению Джонса, правительства должны согласовывать правила между собой, поскольку отдельная страна не сможет эффективно контролировать глобальную технологическую гонку.
В британском парламенте уже появился отдельный Artificial Superintelligence Bill, внесённый лейбористом Алексом Собелом. Законопроект предусматривает запрет на разработку, развёртывание и эксплуатацию систем искусственного сверхинтеллекта, а также создание механизмов их мониторинга и контроля. Пока документ находится лишь на начальной стадии парламентского рассмотрения.
Британское правительство при этом признаёт транснациональный характер проблемы. В заявлении Кабинета министров от 7 сентября подчёркивалось, что риски, связанные с мощными ИИ-системами, не могут контролироваться одной страной и требуют международного взаимодействия. Власти также сообщили об усилении безопасности испытательной инфраструктуры британского AI Security Institute.
Anthropic не предоставила новую модель британским специалистам

Дополнительную обеспокоенность в Лондоне вызвало сообщение Financial Times о том, что Anthropic впервые не предоставила свой новейший ИИ британскому AI Security Institute для тестирования перед выпуском. Последняя модель компании Claude Mythos 5.1 первоначально была доступна только проверенным организациям в США, тогда как ранее британский институт имел возможность исследовать ведущие модели до их публичного запуска.
Anthropic публично не стала подробно комментировать ситуацию. В британском Кабинете министров также не подтвердили напрямую, что Anthropic отказалась предоставить AISI доступ к последней модели, однако подчеркнули, что власти продолжают сотрудничать с компанией и другими разработчиками для повышения безопасности моделей.
США тоже обсуждают запрет сверхинтеллекта
Параллельная дискуссия разворачивается в Соединённых Штатах. Сенатор Берни Сандерс и член Палаты представителей Грег Касар объявили о подготовке Ban Artificial Superintelligence Act. Законопроект предполагает постоянный запрет на разработку и использование искусственного сверхинтеллекта, а также временную приостановку создания наиболее мощных ИИ-систем до тех пор, пока федеральный регулятор не разработает правила безопасности.
Кроме того, инициатива предусматривает попытку заключения международных соглашений, которые должны не допустить разработки неподконтрольного человеку сверхинтеллекта за пределами США. Таким образом, ещё недавно преимущественно теоретическая дискуссия об «экзистенциальном риске» ИИ постепенно превращается в вопрос практического государственного регулирования.
Предупреждение или «маркетинг страха»?
Однако резкость заявлений сотрудников Anthropic вызвала и противоположную реакцию. Профессор компьютерных наук дама Венди Холл, консультирующая ООН по вопросам ИИ, заявила BBC, что была удивлена заявлениями Хубингера и Коксона. Она допустила, что столь драматичные предупреждения могут отчасти выполнять функцию пиара на фоне подготовки ведущих ИИ-компаний к выходу на фондовый рынок, хотя одновременно выразила серьёзное беспокойство самим фактом того, что сотрудники разработчиков открыто говорят о подобных рисках.
The Telegraph также обращает внимание на необычайно высокую вирусность сообщения Коксона. Его публикация с ранее практически неактивного аккаунта собрала десятки миллионов просмотров и была быстро распространена заметными фигурами движения за безопасность ИИ. Илон Маск публично предположил, что столь стремительное распространение сообщения могло быть частью организованной информационной кампании.
Сам Коксон отверг эту версию. Он признал, что обсуждал формулировки публикации с друзьями и попросил некоторых из них помочь распространить сообщение, однако отрицал участие сторонних организаций или проведение маркетинговой акции.
Подозрения усиливает и финансовый контекст. Anthropic готовится к потенциальному IPO, которое, по сообщениям Financial Times, может оценить компанию примерно в $1 трлн. Одновременно главный конкурент Anthropic — OpenAI — также движется к публичному размещению.
Главный вопрос — можно ли вообще остановить гонку?
Проблема заключается в том, что даже компании, выступающие за более осторожное развитие ИИ, опасаются замедляться в одиночку. Anthropic позиционирует безопасность как одну из своих ключевых задач и регулярно публикует исследования возможных сбоев моделей. Однако одновременно компания конкурирует с OpenAI, Google, Meta и китайскими разработчиками за технологическое лидерство.
Особенно сложным остаётся вопрос Китая. Американские разработчики опасаются, что замедление работы в США позволит китайским лабораториям сократить технологическое отставание. В свою очередь, любой международный договор потребует определения того, какие именно возможности ИИ считать сверхинтеллектом, как контролировать соблюдение ограничений и каким образом проверять деятельность закрытых государственных и корпоративных лабораторий.
На этом фоне предупреждение Хубингера отражает более широкий сдвиг в дискуссии об искусственном интеллекте. Вопрос для части исследователей сегодня заключается уже не столько в том, способен ли будущий ИИ представлять экзистенциальную угрозу, сколько в том, успеют ли государства создать механизмы контроля раньше, чем появятся системы, существенно превосходящие человека по интеллектуальным возможностям.












