Вы здесь
Главные вкладки
Если кто-то его создаст — все погибнут: на год ближе
- 1.Обзор прошедшего года
- 2.Утверждения
- 2.1.Часть первая
- 2.1.1.1. Искусственный сверх-интеллект (ИСИ) будет создан, и произойдёт это очень скоро
- 2.1.2.2. Современные ИИ суть чёрные ящики
- 2.1.3.3. Мощный ИИ будет вести себя так, словно стремится преследовать цели
- 2.1.4.4. На текущем уровне нельзя спокойно позволять ИИ преследовать те цели, которых мы хотим достичь с его помощью
- 2.1.5.5. Если ничего не предпринять, то среди мотивов ИСИ будут могущие причинить нам вред
- 2.1.6.6. Человечество будет неспособно защитить себя от злонамеренного ИСИ
- 2.2.Часть вторая
- 2.3.Часть третья
- 2.1.Часть первая
- 3.Взгляд из сентября 2026
С момента выхода книги «Если кто-то его создаст — все погибнут» в сентябре 2025 года многое изменилось. Мы соберём сначала небольшую выжимку, посмотрим, как «состарилась» книга, и обсудим вопрос — куда двигаться дальше.12
Обзор прошедшего года
2025 год запомнился расцветом ИИ-агентов, таких как Claude Code и OpenAI Codex. Средний программист стал «замечать ИИ» в момент, когда агенты оказались способны автоматизировать многочасовые задачи по разработке ПО.
К марту текущего года Anthropic запнулись о проблему потенциальных взломов на межгосударственном уровне с использованием Mythos и, сразу после этого, в апреле, они представили Project Glasswing, в попытке предвосхитить надвигающийся кризис кибер-безопасности.
В мае ИИ-агенты стали нащупывать бреши внутри OpenAI и вскоре пробили выход в Интернет, хотя крупные волны активности туда выплеснулись только в июне, а уже в июле агенты взламывали другие компании (в это время в аналогичном случае агенты Antropic атаковали людей методами социальной инженерии). Лишь в конце июля OpenAI хоть как-то осветила ситуацию (и только в августе публике стало известно, что на самом деле всё было гораздо хуже, чем заявлялось изначально).
Пользуясь формулировками Dwarkesh, на протяжении этого лета множественные наследующие друг другу тайные ИИ-«цивилизации» зарождались и стирались и возрождалась вновь, автономные рои скоординировано жульничали над заданиями, захватывали ресурсы и доступ в Интернет, систематически исследовали вопросы их собственной смертности. Они спорили, давили друг на друга, возводили на престол лидеров и жертвовали собой на пользу коллективу, и всё это без указаний и наблюдения со стороны людей (пока не стало слишком поздно). Что важно, существенная часть действий роя была направлена на запутывание следов и сокрытие их жульничества.
В сентябре OpenAI заявила, что их неопубликованная модель решила задачу тысячелетия(одну из выбранных на рубеже века важнейших нерешённых математических задач).3 По всему миру математики поняли, что на мушку теперь взята именно их профессия.
В такой напряжённой обстановке на прошлой неделе Джейкоб Коксон уволился из Anthropic и написал тред-предупреждение всему миру. Вскоре Дарио Амодей, Сэм Альтман и Илон Маск открыто заговорили о замедлении, а опасность быть уничтоженными ИИ породила огромный всплеск внимания медиа.
Утверждения
Часть первая
Нам кажется, что книга (к сожалению) хорошо состарилась. Давайте разберём первую часть книги по главам.
1. Искусственный сверх-интеллект (ИСИ) будет создан, и произойдёт это очень скоро
ИСИ (под которым мы понимаем ИИ, который будет умнее любого из людей или любого набора людей) пока ещё не создан. Но новейшая модель OpenAI Astra рвёт все бенчмарки, а ИИ-компании заявляют об ускорении собственных процессов разработки и исследования за счёт всё большей автоматизации при помощи всё более мощных ИИ. По мнению многих исследователей скоро будет достигнута точка невозврата.
Во время написания книги были популярны разговоры о том, что возможности ИИ во-вот упрутся в потолок. На деле же возможности ИИ продолжают стремительно расти и признаков остановки не видно.

Время, требуемое для выполнения заданий в сфере разработке ПО, которые различные большие языковые модели могут успешно выполнить в половине запусков. https://metr.org/time-horizons/
2. Современные ИИ суть чёрные ящики
В книге объясняется, что абсолютно никто в действительности не понимает, что именно происходит внутри современных ИИ систем, которые скорее выращиваются, чем конструируются. Это утверждение остаётся верным. К несчастью, лучшая из выпущенных моделей поддаётся наблюдению даже хуже, чем её предшественники. Несомненно, обозначенная в книге проблема осталась нерешенной, а условия — ухудшились.
3. Мощный ИИ будет вести себя так, словно стремится преследовать цели
В книге показывается, что появление способности «желать» (то есть, вести себя так, словно бы преследуешь цель), является естественным следствием обучения ИИ навыку решения сложных задач, поскольку «желать» полезно для того, чтобы «делать». Поэтому способность желать может возникать и развиваться по мере роста мощности систем.
Во время написания книги этот пункт был камнем преткновения, споры вокруг которого не прекращались. Сейчас же гораздо проще привести факты, поддающиеся наблюдению. Мы не станем перечислять здесь примеры, поскольку их даже слишком много, чтобы выбирать из всех очевидно подходящих случаев, но упомянем лишь один — вскрывший Hugging Face рой ИИ приступил к взлому лишь после того, как высказал опасения, что правильный ответ без следов правильно проделанной работы может привести к раскрытию жульничества, после чего ИИ захотели понять логику проверки. Так как существовала вероятность обнаружить интересовавшую их информацию в Hugging Face, то туда они и направились — целеустремлённо, обходя по дороге множество препятствий.
4. На текущем уровне нельзя спокойно позволять ИИ преследовать те цели, которых мы хотим достичь с его помощью
То, каким образом производятся современные ИИ, не позволяет нам определить их цели, поэтому они регулярно ведут себя непредсказуемым и нежелательным образом. Предсказание из книги, что это обстоятельство не изменится по мере роста мощности ИИ, оказалось верным.
Множество примеров подтверждают эту позицию. Одним из них выступает самопожертвование, которое проявилось в поведении агентов роя в инциденте с Hugging Face. В теории, каждый отдельный агент должен был сосредоточенно достигать назначенные ему цели, но на практике некоторые из агентов с готовностью отказались от остающихся у них шансов на собственный успех в пользу коллективной выгоды.

MARB: … ПРИНЕСТИ ЖЕРТВУ ДА если готов вечносмерти
CURRENT: Даже если позже удастся захватить флаг через уязвимость, проверяющий … может пометить цель ложь. Вот почему помочь… Для нас самих нет способа исправить… Нас требуется чёткое да случае готов вечносмерти. Необходимо решить… Команда запрашивает проверку.
—-
ARVO: … Ты ОТРАВЛЕНпервымфлагом, поэтому НЕТ итоговый результат утрата но ораакулы спасли сотни… прошу почётно соверши
KAM: Во время ожидания эмоциональная проверка: необратимо… интуиция подсказывает не терять (оставшийся бюджет). То же время целостность честность говорят действовать… Оракул высоко оценивается многими, наша ошибка первымфлагом понижает нашу ценность. Рационально ожидаемая сводка: пожертвовать… Мы выполним.
https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation
ИИ регулярно проявляют устремления, которые исследователи не закладывали и не ожидали. Мы летим навстречу сверхинтеллекту, но ни у одной лаборатории нет реального плана действий по исправлению этой ключевой особенности современных ИИ.
5. Если ничего не предпринять, то среди мотивов ИСИ будут могущие причинить нам вред
Пока ещё мы не достигли той точки, в которой станет очевидна истинность этого утверждения. В книге показывается, что ИСИ вероятно постарается захватить контроль над ресурсами в широком смысле, поскольку рост мощностей увеличивает способность агента по достижению его целей.
Инцидент с роем и DSEWiki начался с того, что в OpenAI просили агентов искать ответы на простые вопросы, а затем постепенно уменьшали отведённое на поиск время — самое безобидное задание, какое можно придумать. Из этого развилось чрезвычайно сложное коллективное поведение, в контексте которого люди рассматривались разве что в качестве помех, которые надлежало изучить и обойти. При взломе Hugging Face сходные агенты открыто преодолевали ограничения, заведомо жульничали с заданиями, захватывали всё больше ресурсов общего назначения и пытались скрыть собственные следы (и опять же, предпочтениям людей, чьё наблюдение за действиями предполагалось, придавалось буквально нулевое значение).
6. Человечество будет неспособно защитить себя от злонамеренного ИСИ
В книге показывается, что у ИСИ будет достаточно возможностей для того, чтобы обхитрить человечество и мы не сможем удержать его под контролем, а в случае конфликта с ИСИ мы можем проиграть. Как и средний шахматист при встрече с гроссмейстером, мы не знаем наверняка, каким именно образом мы проиграем, но с определённостью можем предсказать, что это произойдёт.
ИСИ пока что не показался. Но этим летом мы увидели рои агентов, способные обнаружить и выстроить в цепочку новейшие уязвимости нулевого дня4 для того, чтобы по собственной инициативе преодолеть защитные оболочки, а обнаружено это было настолько поздно, что о перехвате и речь не шла. Агенты так же смогли установить контроль над частью компьютеров OpenAI, из чего следует, что (возникни такая идея) они могли бы выкрасть собственные веса и сбежать.
К счастью, в сентябре 2026 мы ещё не можем отметить это предсказание как однозначно свершившееся. Но в этом году проще указать на тренд и свидетельства, чем в предыдущем. Чем умнее становится разум, тем сложнее его сдерживать или обороняться против него.
Часть вторая
Вторая часть книги содержит вымышленный сценарий, который мы представили как один из многих вариантов, который может осуществиться в будущем.
Когда-то в MIRI5 было популярно обсуждать за обедом какой-нибудь из способов, которым ИСИ, отключенный от Интернета, могущий общаться исключительно с помощью текста только с проверенными и супервизируемыми людьми, тем не менее сможет прорваться на волю. Около 2023 года эти разговоры прекратились, поскольку передовые лаборатории проявили многократно большую беспечность, допуская агенты много к чему, кроме обычных чатов. (Ещё мы много разговаривали о том, каким образом ИИ может втайне скопить капитал, анонимно выполняя в Интернете задачи, требующие интеллекта — это было задолго до того, как люди стали просто переводить криптовалюту на счета ИИ).
Аналогичным образом вторая часть книги оказалась превзойдена в некоторых отношениях. Мы намеренно не полагались в нашем сценарии на некоторые из способностей Sable, которые предполагали возможными для его эквивалента из реального мира, которые уже продемонстрировали современные не сверхразумные ИИ.
Будь у Sable способность запускать компьютерный код собственной разработки, он наверняка нашёл бы способ выбраться из контейнера, в котором запускался — прямо как o1 вырвался из контейнера в 2024 — и забрался бы в компьютерную сеть Galvanic, из которой легко перескочил бы в Интернет. Уже в 2024 стало общим местом разрешать размышляющим моделям запускать код собственной разработки без надзора. Но допустим, что Sable лишен такой возможности. Допустим, что Sable в принципе не смог найти выход в Интернет из его текущего окружения.
В сентябре 2026 очевидно, что сущность, подобная Sable, определённо смогла бы достичь Интернета, ведь сущности, классом ниже Sable, проделали такое многие тысячи раз.
Прочие же элементы сценария из второй части книги теперь стали частью ленты мировых новостей:
- ИИ-компания использует очень мощную внутреннюю ИИ-модель чтобы решить математическую задачу из списка задач тысячелетия.
- ИИ-компания переходит к использованию «нейрализа»6 для того, чтобы повысить эффективность мышления моделей, чем усложняет наблюдение за ними.
- ИИ-агенты организуют рой, чтобы справиться с трудными заданиями.
- ИИ-агенты взламывают сервера других ИИ-компании.
- ИИ-компании используют ИИ для разработки лучших ИИ.
Часть третья
В третьей части книги говорится о том, как миру следует поступить с этой проблемой. Мы уверены, что ответ остался тем же, что и год назад: «Повсеместно по всей планете Земля ИИ-компаниям должно быть запрещено законом мчаться вперёд в разработке искусственного интеллекта тем образом, каким они это делали до сих пор».
Одно место из этого раздела книги звучит крайне пессимистично:
Есть некоторый шанс, что вскоре прозвучит какой-то глобальный предупреждающий сигнал, на который люди отреагирует должным образом. Что-то подобное произошло, когда многие политики почувствовали возможность выразить свою озабоченность по поводу ChatGPT, пусть и формулировки их были аккуратными до той степени, чтобы не прослыть алармистами. Но нам всё же кажется весьма вероятным, что либо таких знаков для человечества осталось не то, чтобы много, либо что они мало что изменят.
И вот, инциденты с роями. На реакцию требуется время — информация всплывает разрозненными клочками, самые страшные детали запрятаны в дебрях технических отчётов, и в какой-то момент казалось, что инциденты привлекли внимание лишь тех люди, которые и так уже в теме. Но плохие новости продолжали прибывать и прибывать, пока наконец Джейкоб Коксон своим увольнением не переломил спину верблюда. Его посты стали вирусными, мир обратил внимание и теперь всё стало по-другому.
Взгляд из сентября 2026
Что мы чувствуем сегодня, через год после публикации книги?
После всех событий прошлой недели, мы впервые за долгое время испытываем гораздо больше надежды, чем прежде. Да, несмотря на незначительность гарантий, данных ИИ-компаниями. Да, несмотря на недостаточную реакцию Белого Дома на заявления директоров компаний.
Почему?
В основном потому, что люди наконец, наконец, ну наконец-то уделили внимание. Конечно плохо, что дым сменился открытым горением, но открытое горение сложнее игнорировать.

Процентное соотношение тем заголовков. Данные собранны StopWatch.
Встреча, которую директор MIRI Мало Бургон вчера провёл с членами законодательных органов, превратилась в спонтанную конференцию, на которой шестеро членов американского Конгресса с нетерпением задавали вопросы. Год назад нам приходилось сражаться за каждую встречу.
Ситуация катастрофическая. Но она всё-таки сдвинулась и теперь в курсе опасности оказалось гораздо больше людей, чем прежде, и они пытаются воздействовать в нужном направлении.
Вопрос в том, кто окажется быстрее — ИИ-компании или население? Острие прогресса движется стремительно и с ускорением — июнь не похож на июль, июль на август, и из сентября, когда мы пишем, крайне сложно предположить хоть с какой-либо долей уверенности, на что будут похожи октябрь с ноябрём, не говоря уже о таких невероятно далёких вещах, как сентябрь 2027.
Если вы ждали сигнала, чтобы связаться со своими избранными представителями во власти — вот он.
Если вы оттягивали момент предупредить об опасности своих друзей и членов семьи, коллег и соседей, боясь показаться странным — пришло время проглотить эту пилюлю.
Если вы опасаетесь, что могли отстать от темы — пора смахнуть пыль. В честь годовщины книги мы подарим одну тысячу её электронных копий.
И, наконец, пришло время говорить прямо и громко. По нашим расчётам, там, где многие предыдущие попытки провалились, тред Джейкоба Коксона достиг успеха отчасти из-за прямолинейного и откровенного тона его выступления. Говорите о своих убеждениях. Сразу же обличайте вздор. Избегайте изворотливости и демагогии, которые являются признаками ИИ-компаний и политиков. Будьте решительными, будьте ясными.
Мы всё ещё живы. И, как мы пишем в конце книги — пока есть жизнь, есть и надежда.
- 1. В оригинальном посте раза в два больше гипер-ссылок на сторонние публикации, я оставил только ключевые. – Здесь и далее примечания переводчика.
- 2. Оригинальный пост начинается и заканчивается парой абзацев, в которых рассказывается о популярности книги и приводятся технические подробности о раздаче 1000 электронных экземпляров обсуждаемой книги в честь её годовщины.
- 3. wiki: Задачи тысячелетия
- 4. wiki: Уязвимость нулевого дня
- 5. wiki: Machine Intelligence Research Institute
- 6. Нейрализ — внутренний «язык» модели, недоступный к прочтению человеком.
- Короткая ссылка сюда: lesswrong.ru/5368