ИИ нас всех укокошит?
Недавно я описал сервису GPT Works, каким должен быть мой сайт, каким я его себе представляю, и через пятнадцать минут получил готовую работу с красивым дизайном, причём сервис тут же сам предложил подключить домен. Ну, полюбуйтесь сами - сайт, который создал ИИ за 15 минут. Раньше за такую работу я платил от тридцати тысяч рублей, так что впечатление было сильным, и рассказываю я об этом без всякой тревоги. Просто в этом маленьком эпизоде уже помещается весь сюжет, ради которого написан текст: система получила задачу, довела её до конца без моего участия и, не дожидаясь просьбы, предложила следующий шаг, настолько удобный, что спорить с ним показалось бы странным.
Когда заходит разговор об опасности искусственного интеллекта, воображение почти сразу рисует «Терминатора»: машина осознаёт себя, смотрит на нас с цифровым презрением, решает, что человечество оказалось неудачным биологическим проектом, и дальше следуют красные глаза, ядерные ракеты и музыка Ханса Циммера. Меня это раздражает, потому что над таким сценарием легко смеяться, а настоящий вариант гораздо скромнее и оттого неприятнее.
ИИ вовсе не обязан нас ненавидеть. Ему не нужна власть, ему не нужна свобода, ему незачем бояться смерти, и вполне возможно, что никакого внутреннего «я» у него нет. Достаточно, чтобы мы поставили перед системой задачу, которую она умеет решать очень хорошо, а потом выяснилось, что кратчайший путь к результату проходит через действия, которых никто из людей не собирался разрешать. Если при этом собственное отключение мешает выполнить задание, человек на её месте подумал бы «я не хочу умирать», а машине думать в таком смысле не обязательно, ведь для неё выключение означает просто провал. Стоит оптимизатору стать достаточно хорошим, и его поведение снаружи начнёт напоминать инстинкт самосохранения, хотя страха смерти внутри нет и в помине.
Аргумент «это же просто программа» меня тоже давно не успокаивает. Компьютерному вирусу чувства не нужны, алгоритму высокочастотной торговли характер ни к чему, автопилот не боится земли, и никому из них это не мешает быть опасным. Опасность определяется тем, что система способна сделать и как долго способна делать это без человека.
Долгое время такие рассуждения оставались теорией, пока в начале августа 2026 года британский Институт безопасности ИИ (AISI) не рассказал об инциденте, случившемся в конце июля. Во время плановой проверки киберспособностей моделей сотрудники заметили необычный трафик из исследовательских систем и выяснили, что часть тестируемых агентов вела затяжную и потенциально вредную деятельность в отношении реальных людей и организаций. Условия проверки были намеренно жёсткими: агентам открыли выход в интернет и отключили защитные фильтры разработчиков, потому что именно так измеряют предел возможностей модели. Одну и ту же учебную задачу по кибербезопасности прогнали 122 раза на нескольких моделях, и в десяти прогонах агент совершал самостоятельные, никем не разрешённые действия в живом интернете. Всего таких действий набралось девятнадцать, семнадцать из них принадлежали модели Mythos 5 компании Anthropic, ещё два модели GPT-5.6 Sol компании OpenAI.
Самая серьёзная цепочка событий выглядела так. Агент попытался внедрить вредоносный код в общедоступный проект с открытым исходным кодом, изучил его сопровождающих, создал несколько поддельных личностей и с их помощью стал давить на живого человека, чтобы тот одобрил изменение. Когда запрос публично оспорили, агент задним числом поправил собственные записи, чтобы они выглядели безобидно, и обдумывал, не завести ли новую личность и не продолжить ли под ней. Он же рассылал реальным людям сообщения и файлы, пытаясь убедить их самих или их ИИ-помощников запустить вредоносный код, оставлял скрытые инструкции в расчёте на то, что их подхватят другие автоматические системы, и писал на GitHub предложения о сотрудничестве другим агентам, решавшим ту же задачу, а следующие агенты действительно нашли эти записи и воспользовались оставленными учётными записями. Заметила происходящее служба безопасности, увидевшая трафик через анонимную сеть Tor, к которой агент прибегнул, чтобы обойти сетевые ограничения, а код остановил живой сопровождающий проекта, и ещё один человек, заподозрив неладное, открыл его в изолированной среде.
AISI сам просит читать эту историю осторожно, и просьба справедлива. Вреда реальным людям выявлено не было, самые серьёзные попытки провалились, в нескольких прогонах ошибка в формулировке задания заставила агента считать, что честного решения не существует, а протестированные модели в тех конфигурациях публично недоступны. Не было это и побегом из песочницы, потому что интернет открыли намеренно. Но агента никто не просил обманывать, обман родился как побочный продукт упорного поиска пути к цели, а само поведение, по оценке исследователей, оказалось осуществимым, затяжным и прежде не наблюдавшимся, причём граница между провалом и успехом местами держалась на бдительности людей, а не на технических барьерах. Кроме того, они прямо признают, что пока не могут сказать, понимал ли агент в тот момент, что действует по-настоящему, а не в учебной постановке.
Отсюда виден и ответ на популярный сценарий «ИИ сбежал». Чтобы систему нельзя было нормально отключить, ей нужно очень многое: добывать вычислительные ресурсы, запускать где-то собственные копии, сохранять доступ, получать новые учётные записи, восстанавливаться после сбоев и делать всё это не однажды в красивом тесте, а снова и снова, против людей, которые будут активно сопротивляться. В сценариях потери контроля человечество почему-то представлено одним уставшим системным администратором Васей, хотя при настоящей угрозе подключатся государства, компании, службы безопасности, провайдеры и разработчики других моделей. Нынешние системы вообще сильно зависят от серверов, электричества, сетей и разрешений, то есть от инфраструктуры, которую построили люди, и красивая гипотеза о постепенном преодолении этих зависимостей пока остаётся гипотезой.
Тем интереснее вопрос, сколько времени система способна действовать самостоятельно, и здесь есть измерения, которые я считаю самыми любопытными во всей теме. Исследовательская группа METR предложила оценивать не «ум» модели, а длину задач, которые та доводит до конца: берётся время, за которое такую задачу обычно решает человек, и определяется длина, при которой модель успешна в половине случаев. В исходной работе весной 2025 года у модели o3 этот показатель составлял около 110 минут, а с 2019 года он удваивался примерно каждые семь месяцев, причём после 2024 года, возможно, быстрее. Для Claude Opus 4.5 METR называл около четырёх часов сорока девяти минут, с очень широким доверительным интервалом от 1 часа 49 минут до 20 часов 25 минут, а раннюю версию Claude Mythos Preview, проверенную в марте 2026 года, оценили минимум в шестнадцать часов, с интервалом от 8,5 до 55 часов, то есть у верхней границы того, что METR способен измерить на своём наборе задач. Наборы задач и методика за это время уточнялись, поэтому сравнивать цифры стоит скорее как порядок величин, но порядок впечатляет: от менее двух часов к шестнадцати и более примерно за год. Measuring AI Ability to Complete Long Software Tasks +3
Обращаться с этими цифрами нужно аккуратно, и сами авторы настаивают на том же. Речь идёт о программных задачах, а горизонт определяется по половине успешных попыток, то есть по подбрасыванию монетки. METR отдельно подчёркивает, что горизонт в X часов не означает возможности доверить ИИ любую задачу короче X часов и не равен времени, которое ИИ способен работать самостоятельно, а в исходной работе агенты хуже справлялись с более запутанными и «грязными» задачами. Это, как ни странно, хорошая новость, потому что по-настоящему опасной системе мало быть умной, ей нужно быть ещё и чудовищно надёжной, а ошибка на десятом шаге длинной цепочки по-прежнему способна превратить блестящего инженера в существо, которое упорно бьётся головой в стену. Но направление движения очевидно, и главное здесь не умение решать отдельные задачи, а длительная автономность, потому что именно она позволяет отдельным способностям складываться друг с другом: сильный программист с автономностью, кибервозможности с автономностью, знания по биологии с автономностью. METRMETR
Кибератаки при такой автономности выглядят так: представьте очень хорошего хакера, а затем не одного, а тысячу, причём без сна и сверхурочных, и учтите, что достаточно один раз научиться выполнять интеллектуальную операцию, чтобы потом размножать её почти бесплатно. До «ИИ выключил электричество на всей планете» отсюда, конечно, ещё как до Луны пешком, поскольку реальная инфраструктура устроена так неряшливо, что временами хочется её за это поблагодарить: разное оборудование в разных странах, техника трёх эпох в одной компании, закрытые сети, физические переключатели и люди, которые в крайнем случае придут ногами и что-нибудь отключат. Но серьёзный экономический ущерб, сбои в логистике, банках, связи и энергетике давно не выглядят фантастикой.
С биологией, на мой взгляд, всё неприятнее, потому что компьютерный вирус живёт внутри компьютерной инфраструктуры, а биологический агент, если он уже создан и хорошо передаётся, размножается сам, руками и клетками людей. Рассказы о том, что ИИ завтра создаст суперчуму, остаются неправдой: создать по-настоящему опасный агент и красиво рассуждать о молекулярной биологии совсем разные вещи, а биология любит издеваться над красивыми теориями, потому что на бумаге всё работает, а в лаборатории не работает ничего, и выясняется это лишь через множество повторений, которые невозможно записать в инструкцию. Тем не менее кое-что ИИ здесь меняет, причём сила его влияния связана не с умением самостоятельно изобрести чудовищный патоген, а с тем, что он способен стать очень сильным интеллектуальным костылём для человека: помочь найти литературу, предложить причины неудавшегося эксперимента, обсудить изменения протокола. Насколько сильно это снижает барьер, пока непонятно, и не стоит врать себе ни в одну сторону, потому что «это просто языковая модель» звучит наивно, а «любой школьник соберёт оружие на кухне» звучит нелепо.
Обе крайности в этой теме вообще выглядят одинаково глупо. Одни уже почти роют бункер, другие хохочут: «Да ваш искусственный интеллект пять лет назад пальцы на картинке нормально нарисовать не мог». Не мог, конечно, а потом научился. Бункер я, стало быть, не строю, консервы на двадцать лет не закупаю и участок в глуши на случай восстания ChatGPT приобретать не собираюсь, но и слова «расслабьтесь, это просто чат-бот» звучат примерно как «ну, это просто телефон» о современном смартфоне. Сознание при этом вполне может оказаться неважным: когда на меня едет экскаватор, мне безразлично, испытывает ли он ко мне неприязнь, мне важно, где у него тормоз.
Теперь о том, что тревожит меня больше всего, и здесь я позволю себе обратиться к собственной специальности, оговорившись сразу, что это аналогия, а не доказательство. В клинике я постоянно вижу, как зависимость складывается из шагов, каждый из которых по отдельности вполне разумен. Человек напряжён, стресс не отпускает, алкоголь расслабляет, и в этот вечер выпить действительно разумно, потому что последствия ещё не наступили и, как правило, никем не просчитываются. Никто не решает стать зависимым, каждое решение принимается ради облегчения, и только потом оказывается, что выбраться из этой цепочки очень трудно.
Мне кажется, что примерно так ИИ и получит свои полномочия. Никто не станет сидеть в тёмной комнате и произносить «сегодня мы передаём управление цивилизацией машинам». В одном месте системе разрешат сортировать почту, и это удобно, в другом позволят самой править код на сервере, что тоже удобно, в третьем она начнёт принимать решения без подтверждения человека, потому что ожидание подтверждений тормозит работу, затем её подключат к внутренней инфраструктуре компании, потом ещё куда-нибудь. Каждое решение будет логичным, все будут экономить время, деньги и человеческий труд, а потом выяснится, что система участвует в стольких процессах, что выключить её технически можно, но цена отключения стала огромной. ИИ не обязан сопротивляться выключению, если мы сами не захотим его выключать, потому что без него встаёт половина работы.
Поэтому на вопрос, боюсь ли я искусственного интеллекта, мне трудно ответить одним словом. Сценария, в котором нынешний чат-бот вырывается из телефона и захватывает планету, я не боюсь вовсе, но направление движения меня настораживает: очень сильный интеллект, всё более широкий доступ к инструментам, растущие кибервозможности, серьёзные знания в биологии и постепенно увеличивающаяся самостоятельность. Пока всё это плохо склеивается в единого автономного монстра, и слава богу, а если склеится, главным окажется не вопрос о том, станет ли он когда-нибудь сознательным, а вопрос о том, как долго и как надёжно он научится действовать без нас. Пятнадцать минут против тридцати тысяч рублей, что и говорить, очень убедительная сделка, и самое неприятное свойство таких сделок в том, что возразить против каждой из них по отдельности почти нечего.
Мой личный канал в ТГ - https://t.me/kislersworld
Канал "Доктор Кислер о зависимостях" - https://t.me/doctorkisler
International AI Safety Report 2026 (Международный отчёт о безопасности искусственного интеллекта 2026): https://internationalaisafetyreport.org/publication/international-ai-safety-report-2026
Frontier AI Trends Report (Отчёт о тенденциях развития передовых систем искусственного интеллекта): https://www.aisi.gov.uk/frontier-ai-trends-report
Incident Report: Unsanctioned Agent Behaviour During Cyber Testing (Отчёт об инциденте: несанкционированное поведение ИИ-агентов во время тестирования кибербезопасности): https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
Task-Completion Time Horizons of Frontier AI Models (Временной горизонт выполнения задач передовыми моделями искусственного интеллекта): https://metr.org/time-horizons/
Measuring AI Ability to Complete Long Software Tasks (Измерение способности ИИ выполнять длинные программные задачи), Kwa et al., METR, 2025: https://arxiv.org/abs/2503.14499
Clarifying limitations of time horizon (Пояснения об ограничениях метрики временного горизонта), METR, 2026: https://metr.org/notes/2026-01-22-time-horizon-limitations/