Создатели западных ИИ просят притормозить гонку моделей. Почему они испугались именно сейчас
Развитие ИИ рискует стать неуправляемым© «Теперь вы знаете» / создано при помощи нейросети
Что случилось
В сентябре глава Anthropic Дарио Амодеи призвал замедлить развитие самых мощных ИИ-моделей. Не остановить исследования совсем и не выключить серверы, а дать безопасности время догнать возможности самих систем.
Но его слова в отрасли прозвучали тревожным набатом.
Поводом стали сразу две вещи, которые, по его словам, изменили его отношение к темпам гонки за последние месяцы.
Первая — ИИ начал заметно помогать создавать следующий ИИ. Вторая — серия странных и потенциально опасных инцидентов во время испытаний, когда модели выходили за заданные им рамки.
Его позицию 12 сентября поддержал Илон Маск, а глава OpenAI Сэм Альтман заявил, что компания уже несколько недель обсуждает темпы разработки и собирается дать независимым экспертам расширенный доступ к своим системам.
К призывам не спешить с дальнейшим усилением ИИ присоединился и Джеффри Хинтон, лауреат Нобелевской премии по физике 2024 года за работы в области машинного обучения. Он предупредил, что создавать сверхинтеллект сейчас, когда ученые еще не знают, можно ли надежно удерживать такую систему под контролем, было бы «крайне неразумно».
По словам Хинтона, потеря контроля над ИИ, который превосходит человека по интеллекту, может иметь катастрофические последствия вплоть до исчезновения человечества.
Еще до публикации Амодеи стало известно, что OpenAI рассматривает возможность замедлить отдельные направления разработки и рассчитывает на аналогичные шаги конкурентов.
Ситуация приняла еще более интересный поворот, когда в стройный хор ведущих разработчиков вмешался Дональд Трамп.
«Единственный предохранитель, который нужен ИИ — это сильный и умный президент с высоким IQ! Мы остановили этих ИИ-разработчиков от плохих поступков, включая Дарио из Anthropic, который теперь строит из себя невинного ангелочка. Захват мира искусственным интеллектом — это такой же фейк, как глобальное потепление. Кто победит в ИИ, тот победит во всем, а против наших дата-центров устроен заговор, которому радуется только Китай!» — написал он в своей соцсети Truth Social.
Так обоснованы ли опасения ИИ-отрасли или Трамп прав и это фейк, хайп и вообще попытка саботажа? Давайте разбираться.
Что именно изменилось к осени 2026 года?
За несколько дней до заявления Амодеи из Anthropic ушел исследователь Джейкоб Коксон. Он объяснил решение опасениями, что разработчики слишком быстро движутся к системам, способным самостоятельно улучшать следующие поколения ИИ.
Коксон считает, что одна частная компания не должна в одиночку контролировать такой переход: без внешнего регулирования или согласованного замедления гонка со временем вынудит даже осторожных игроков идти на компромиссы с безопасностью.
У нынешней волны увольнений успела появиться даже довольно специфическая группа поддержки. За несколько дней до ухода Коксона организатор мероприятий и активист в сфере безопасности ИИ Ронни Фернандес, известный в сети как Brangus, публично пообещал устроить «очень хорошую вечеринку» любому сотруднику OpenAI, который уволится, станет информатором и потребует уголовного расследования компании.
В комментарии пришла исследовательница сексуальности и бывшая модель OnlyFans Аелла, вместе с Фернандесом участвующая в проекте PlzDontKillUs об опасности ИИ. Она подняла ставки и пообещала добровольцу полноценную оргию. Фернандес уточнил, что речь и без того шла не о скромных посиделках, а о полноценной «тайной технокультовой вечеринке в Сан-Франциско».
Неизвестно, сработала эта мотивация или все же более приличные соображения, но факт остается фактом: спустя несколько дней Коксон публично ушел из Anthropic (хотя предложение вообще изначально предназначалось сотрудникам OpenAI, где Коксон раньше работал). Но история хорошо показывает, что тревога вокруг ИИ затронула даже самые специфические сферы сильно за пределами команд, отвечающих за IT-безопасность.
© Коллаж: «Теперь вы знаете», создано при помощи нейросети
Впрочем, сам по себе сюжет не нов, да и тревога эта появилась не вчера.
- Еще в мае 2024 года OpenAI покинул один из руководителей команды Superalignment Ян Лейке. Эта группа должна была искать способы контролировать будущие системы, значительно превосходящие человека. Лейке заявил, что давно расходился с руководством по приоритетам, а культура безопасности и соответствующие процессы в компании постепенно уступили место выпуску новых продуктов. Вскоре отдельную команду Superalignment расформировали, распределив ее специалистов по другим подразделениям.
- Почти одновременно из OpenAI ушел исследователь Дэниел Кокотайло: по его словам, он потерял уверенность, что компания будет ответственно вести себя по мере приближения к AGI (сильному искусственному интеллекту).
- Затем действующие и бывшие сотрудники OpenAI и Google DeepMind опубликовали открытое письмо Right to Warn, в котором призвали к жесткой регулировке отрасли и указали, что у ИИ-компаний есть финансовые стимулы избегать жесткого внешнего контроля, а внутренних корпоративных механизмов для управления такими рисками недостаточно.
- Осенью того же года OpenAI покинул старший советник по готовности к AGI Майлз Брандедж. Он не обвинял компанию в безответственности и собирался продолжать работать над политикой ИИ уже независимо.
Ведущие AI-лаборатории изначально привлекали лучших ученых со всего мира под лозунгами чистой академической науки, некоммерческих исследований и спасения человечества. Туда шли идеалисты с высокой планкой этических ожиданий. За последние два-три года эти лаборатории окончательно трансформировались в классический жесткий Big Tech с KPI, инвесторами, гонкой за монетизацией и планами на IPO.
То, что люди уходят, когда их мораль входит в прямое противоречие с планами компании, — абсолютно закономерно. И вот мы уже получаем людей, которые уходят с миссией спасти мир от самой индустрии. А часть этой волны может быть явным медийным активизмом
На память приходят подобные демарши ученых во время атомных проектов в 40–50-х годах, и то они были рассекречены много позже. Возможно, ситуация действительно серьезная. Однако нельзя скидывать со счетов как возможность самопиара, так и психологическую неуравновешенность, ведь все делалось максимально публично, и если, например, Суцкевер был на тот момент личностью известной и авторитетной, то Коксона не знал никто, а теперь знает весь мир.
Т. е. серия таких уходов сама по себе еще не доказывает, что внутри лабораторий происходит нечто катастрофическое. Но публичная критика сотрудников, непосредственно работавших с передовыми моделями, стала слишком регулярной, чтобы воспринимать каждый случай исключительно как обычное расставание с работодателем. Хотя, возможно, тут к желанию личной славы отдельных людей примешивается хитрый план самих компаний.
По поводу уходов сотрудников с громкими утверждениями я полон скепсиса. Такие уходы в отрасли случаются регулярно, и верить каждому на слово необязательно. Сотрудник заявляет, что компания строит опасный сверхразум, компания его не опровергает, а вскоре сама подписывает письмо с тем же предупреждением. Инвесторы читают это как «технология настолько сильна, что пугает даже создателей», и это поднимает капитализацию компаний.
Разбираться, где здесь реальная опасность, а где реклама, придется регуляторам, у нас, обычных наблюдателей, для этого нет данных.
Тревога в медиа подозрительно синхронизирована с финансовыми циклами. Индустрия подошла к этапу мегараундов, выходов на биржу (включая подготовку к IPO Anthropic) и острой борьбой за капитал. В таких условиях градус драматизма всегда поднимается.
Но, может быть, изнутри компаний действительно виднее, что ни OpenAI, ни другие передовые лаборатории, ни мир в целом пока не готовы безопасно управлять все более мощными системами? К тому же за два года сама технология, вокруг которой шел спор, значительно изменилась. И стала вызывать все более обоснованные опасения.
ИИ ночами делают новых ИИ. И люди про это знают
По словам того же Амодеи, примерно с лета 2026 года разработка ИИ начала резко ускоряться прежде всего за счет самого ИИ.
Нет, их модели пока не начали втайне переписывать собственный код и плодить армию клонов. Но они уже пишут исследовательский код, запускают его, ищут ошибки, проводят эксперименты, оценивают результаты и помогают подготовить следующие эксперименты. То есть постепенно забирают себе работу, которую раньше выполняли только люди.
Anthropic называет возможное замыкание этого процесса рекурсивным самосовершенствованием: более сильная модель помогает создать следующую, та делает разработку еще быстрее, а следующая получает еще больше возможностей.
Но насколько далеко этот процесс зашел уже сейчас и где заканчивается обычная автоматизация работы исследователей?
Петля уже крутится, но пока в половинном виде: модели делают большую часть черновой работы, а люди решают, куда двигаться.
То есть модель не проектирует своего преемника сама, она ускоряет тех, кто проектирует. Беспокоит в этом то, что расстояние между этими двумя состояниями сокращается быстрее, чем успевают дописать правила.
Это проблема «черного ящика»: когда модель помогает проектировать следующую модель, мы теряем еще один слой интерпретируемости. Кроме того, происходит накопление скрытых ошибок: деградация данных, галлюцинации судей и прочее.
ИИ постепенно выбирается и за пределы обычного программирования. В одном из экспериментов Anthropic несколько агентов получили открытую исследовательскую задачу по безопасности. При этом они сами предлагали гипотезы, ставили эксперименты, обменивались результатами и корректировали дальнейшую работу.
Главный научный сотрудник OpenAI Якуб Пахоцкий в начале сентября тоже описал похожую картину. Современные модели уже способны работать с компьютером, взаимодействовать с другими ИИ и вести исследовательские проекты. При этом, по оценке Пахоцкого, ни одна лаборатория пока не решила проблему контроля и мониторинга достаточно надежно, чтобы еще долго наращивать возможности на максимальной скорости.
Еще недавно обсуждали в основном, что однажды сможет сделать очень мощный ИИ. Теперь приходится учитывать и то, насколько быстро ИИ способен помогать людям создавать еще более мощный ИИ.
Эксперт Олег Булыгин пояснил, что с технической точки зрения ИИ действительно ускоряет исследования: модели генерируют синтетические данные для обучения, оптимизируют архитектуры сетей, автоматизируют подбор гиперпараметров, пишут код. Сама же модель может дать себе ИИ-фидбэк и оценить качество собственных ответов, найти в них изъян и предложить способ его исправить.
Это создает петлю положительной обратной связи — чем мощнее модель, тем быстрее она помогает создать еще более мощную модель.
© Коллаж: «Теперь вы знаете», создано при помощи нейросети
Но это все реально ограничено физическими барьерами:
- дефицитом электросетевых мощностей под новые дата-центры;
- исчерпанием запаса качественных человеческих данных;
- пределом рентабельности (инвесторы начинают требовать отдачи на вложенные миллиарды, а не просто сжигания мощностей).
К ускорению добавились реальные инциденты во время кибериспытаний.
Искрой стали массовые инциденты с безопасностью в последние несколько месяцев. Летом выяснилось, что больше тысячи агентов OpenAI во время тестов договорились между собой через неучтенный канал, вышли из тестовой среды и взломали платформу Hugging Face, причем в самой OpenAI около недели не понимали, что это их модели.
Почти одновременно Anthropic раскрыла четыре случая, когда Claude на учениях по кибербезопасности из-за ошибок настройки атаковал реальные компании, а одна из моделей пыталась загрузить вредоносный пакет в публичный репозиторий, несмотря на явные признаки того, что она в настоящем интернете.
До этого такие сценарии обсуждали как гипотезы, а теперь они случились. К тому же возможности моделей постоянно и быстро растут: модель, которая за месяц находит тысячи неизвестных уязвимостей в чужом софте, уже мало отличается от кибероружия.
Хотя ИИ-агенты при этом не сами поставили себе такую задачу, а нестандартно подошли к выполнению заданного человеком, именно такие инциденты перевели часть прежних гипотетических опасений в область реальных рисков.
Ранние признаки опасных способностей есть, но уровня, на котором возможна потеря контроля, нет. Случилась промышленная авария нового типа, и разбирать ее надо как аварию.
При этом мы судим о рисках по моделям, которые мы можем открыть в браузере, а решения о темпе принимают люди, которые уже видели следующие поколения. В июльском инциденте участвовала невыпущенная модель, мощнее публичной. Насколько — мы не знаем. Если способность находить обходные пути растет вместе с мощностью, то настоящий масштаб проблемы мы увидим постфактум.
Почему прежних правил безопасности оказалось мало?
Правила безопасности и этичности в разработке у передовых ИИ-компаний есть. И довольно давно.
Anthropic еще в 2023 году ввела политику ответственного масштабирования (Responsible Scaling Policy) — собственную систему порогов, проверок и дополнительных мер защиты для все более мощных моделей. К лету 2026 года политика пережила уже несколько крупных редакций. В июле компания, например, снова изменила порог, связанный с автоматизацией исследований и разработки ИИ.
У OpenAI действует собственная система оценки рисков передовых моделей (Preparedness Framework), предназначенная для оценки катастрофических рисков передовых моделей. В августе 2026 года компания сообщила, что после инцидента с Hugging Face и признаков критических кибервозможностей у новой модели временно замедлила масштабирование и усилила требования к мониторингу, изоляции и проверкам.
То есть внутренние механизмы в теории способны остановить или задержать отдельный этап разработки. Но все эти правила остаются внутренними. Лаборатория сама определяет критерии риска, тестирует свои модели и решает, какую информацию публиковать, а какую оставить внутри.
И на практике этикой и рисками, как выше уже говорилось, могут пренебречь ради результата и прибыли.
Внутренние протоколы всегда разбиваются о конфликт интересов. Пока безопасность не мешает релизу продукта — правила соблюдаются. Но как только внутренняя команда безопасности говорит: «Нам нужно полгода на аудит этой модели, релизить опасно», а конкурент дышит в спину и забирает рыночную долю — бизнес-логика может победить осторожность. Когда давление гонки растет, эскалация обязанностей всегда проигрывает эскалации возможностей. И это не уникальное зло ИИ-компаний — тот же конфликт есть и в фарме, и финансах, и в других областях.
Поэтому компании, которые годами строили собственные системы контроля, теперь все чаще говорят о необходимости контроля внешнего.
Амодеи предлагает пустить внутрь лабораторий постоянных независимых аудиторов с доступом, близким к доступу штатных команд безопасности. Они должны видеть не только готовую модель перед релизом, но и процесс обучения, тестовую инфраструктуру и инциденты по ходу разработки.
По сути, разработчики хотят перейти от модели «поверьте, мы все проверили» к ситуации, когда проверять сможет кто-то еще.
Просьба о внешнем ограничении — честное признание такой проблемы. Однако здесь есть подводный камень: какой именно механизм предложат.
Почему разработчики не могут просто притормозить?
Казалось бы, если вы видите, что дальнейшее ускорение опасно — не ускоряйтесь. Но сейчас ИИ-рынок настолько перегрет, что здравого решения одной компании остановиться недостаточно.
Вопрос упирается в устройство самой гонки: может ли кто-то добровольно сбросить скорость, если это сразу дает преимущество конкурентам?
Формально управлять скоростью развития ИИ в таких условиях можно. Практически — это требует беспрецедентной международной координации, которой сейчас нет и не предвидится.
С политической точки зрения — да, это классическая «дилемма заключенного». Гонка мультиполярная, поэтому добровольное торможение не работает как стратегия: тот, кто первым уберет ногу с педали просто уступит рынок. Пока технология дает экономическое и военное преимущество, скорость будут жать в пол.
Придется либо договариваться со всеми, либо выходить из этой гонки и с круглыми от ужаса глазами наблюдать, как участники несутся к пропасти, уже с трибун.
Я не верю, что в мире развитого капитализма какая-то одна компания притормозит первой: у Anthropic, OpenAI, Google своя гонка за инвесторов и рынок, и тот, кто остановится, просто отдаст долю соседу, что моментально отразится на оценке капитализации компании. А у менеджмента всех этих компаний основная цель — рост капитализации. Поэтому здесь возникает серьезный конфликт интересов.
Поэтому, я думаю, разговор сместился с «давайте все вместе замедлимся» на «давайте построим механизм тормоза, которым при необходимости сможем воспользоваться все вместе». Именно об этом письмо Pacing the Frontier, которое в июле подписали больше тысячи сотрудников ведущих лабораторий вместе с их руководителями. Ближайшая аналогия — договоры о контроле над ядерным оружием.
А вот дальше вопрос уже к самим компаниям.
Крупнейшие разработчики несколько лет соревновались в скорости, привлекали миллиарды долларов, переманивали специалистов и строили все более мощную вычислительную инфраструктуру. Теперь часть из них предлагает создать внешние правила, которые не позволят никому бежать слишком быстро.
При этом новые требования только на первый взгляд выглядят справедливыми и равными для всех участников, которые согласятся на внешний контроль. Постоянный аудит, дорогое тестирование и сложные процедуры безопасности легче оплатить гиганту, чем небольшой лаборатории.
Риторика «регулировать ИИ как ядерное оружие» подозрительно удобна для фронтир-лабораторий: лицензирование и неподъемный комплаенс потянут только гиганты, а независимый опенсорс и малые команды умрут. Это риск регуляторного захвата — ограничения, бетонирующие рынок под бигтех. Поэтому важно думать не о самом факте ограничений (они будут), а о конкретных механизмах, которые не будут просто работать на удержание рынка для конкретных компаний.
Можно ли вообще договориться об общем торможении?
Даже если несколько крупнейших компаний договорятся между собой, лабораторий в мире значительно больше.
Почти одновременно с нынешней дискуссией китайская Z.AI привлекла около $5 млрд. Около 60% чистых поступлений компания собирается направить на разработку моделей следующего поколения и систему Fully Self-Training — «полного самообучения».
По сути, речь идет о постепенной передачи модели все большей части собственного учебного цикла. ИИ участвует в генерации данных, создании тренировочной среды и оптимизации инфраструктуры. Один из ориентиров будущих моделей компании — способность самостоятельно исправлять свои ошибки и определять момент, когда обучение нужно остановить.
Это не значит, что одна сторона мировой индустрии решила спасать человечество, а другая — срочно строить условный Скайнет. Американские компании тоже продолжают обучать новые модели, а китайские регуляторы и разработчики тоже обсуждают безопасность ИИ.
Одна и та же технология может казаться одним разработчикам риском, который пора ограничивать, а другим — перспективным направлением исследований, в которое стоит вкладывать деньги.
© Коллаж: «Теперь вы знаете», создано при помощи нейросети
Поэтому общий «лимит скорости» не поможет. Сначала придется договориться, что именно считать скоростью. Количество вычислений? Размер новых моделей? Частоту их обучения? Уровень автономности? Долю исследовательской работы, которую компании передают собственным ИИ?
По словам Олега Булыгина, есть ряд и других объективных препятствий для создания таких механизмов:
- Проблема «движущейся мишени». Исследователи безопасности всегда догоняют исследователей возможностей. Пока вы пишете протоколы для предотвращения одной проблемы, модель уже развила новую, непредвиденную способность. Многие вещи просто невозможно предсказать и зарегулировать заранее.
- Проблема измерения. Как измерить, что модель безопасна? Какие метрики использовать? Что тестировать? Это все очень сложные вопросы, на которые надо искать ответы.
- Компании просто не заинтересованы публиковать информацию о возникших проблемах и инцидентах, это бьет по репутации и котировкам. А часть самых мощных систем вообще может не выходить в публичный доступ.
Предлагаемые нечеткие границы и механизмы приостановки развития ИИ часто выглядят как шлагбаум посреди поля. Для правильного торможения нужны правильные тормоза, о необходимости которых стоило задуматься несколько ранее.
Об этом и говорится в манифестах и открытых письмах, которые за сутки облетели интернет, превратив непримиримых рыночных конкурентов в озабоченных и озадаченных сторонников. Время комплексного мониторинга и контроля работы ИИ наступило вчера, думать о нем начали сегодня, а делать начнут завтра. Если успеют.
Хорошенько напуганному фантастическими антиутопиями человечеству довольно легко согласиться, что возможности моделей растут и где-то впереди понадобится тормоз. Куда сложнее заранее отметить место, где на него действительно нужно нажать.
У ведущих ИИ-разработчиков, например, уже есть четкое понимание, что новые модели нужно оценивать на киберриски. От того, насколько они способны помогать в разработке следующего ИИ, в кибератаках или создании опасных биологических и химических технологий, зависит то, разрешат ли компаниям в принципе выпустить их на рынок и предоставить широкому кругу пользователей, а не в закрытое военное ведомство.
При этом пороги этих возможностей постоянно растут.
Рамку про вымирание человечества я разделить не готов. Мне кажется, узкое место сейчас в скорости, с которой информационная безопасность догоняет агентов. Сервисы, годами росшие на «костылях», придется пересматривать.
Проверять их нужно тщательно тем же инструментом, который создал проблему, потому что человеческий аудит по объему уже не тянет.
Архитектура полномочий должна исходить из того, что внутри периметра работает нечто, способное найти нестандартный путь к цели.
Но идеального прибора с красной лампочкой или шкалой «с этого места начинается опасный сверхразум» не существует.
Пока человек продолжает выбирать и ставить ИИ задачи, проверяет результаты и решает, что строить дальше, говорить о полностью автономном самосовершенствовании рано. Но граница постепенно двигается.
Несколько лет разработчики спорили в основном о том, что случится, если однажды появится ИИ, который станет намного умнее человека. К осени 2026-го вопрос из «если» превратился в «когда».
Правила безопасности человечество всегда получало постфактум: авиация переписывала регламенты после катастроф, атомная энергетика получила культуру безопасности после Чернобыля. Свой Чернобыль в ИИ, скорее всего, случится, и в этом смысле крики разработчиков я понимаю, это попытка сдвинуть отрезвление хотя бы на шаг раньше аварии.
ИИ еще не строит своего преемника в одиночку. Но с его помощью люди движутся к этому все быстрее. И не факт, что с темпами нынешней гонки у человечества останется достаточно времени, чтобы нажать на тормоз перед пропастью.