August 24

AI-ассистированная рецензия на видео об AI

Где авторы правы, где ошибаются и почему исследования ИИ устаревают быстрее, чем успевают выйти.

Недавно посмотрел длинный разговор моего друга, уважаемого коллеги Марата Агиняна и Алексея Южикова об искусственном интеллекте, психическом здоровье и о том, что вообще происходит с человеком, когда рядом появляется собеседник, который человеком не является, но способен очень убедительно его изображать. Оригинал видео тут: https://youtu.be/PCpIz6YrXB4?si=TdCCEGgdyNAcQJIj (рекомендую к просмотру, Марат если бы не был блестящим врачом, стал бы блестящим журналистом!)

Разговор мне скорее понравился. Там нет привычной паники в духе «ИИ разрушает мозг», нет и противоположного восторга, будто осталось написать правильный промпт и психотерапевты больше не нужны. Более того, несколько раз собеседники сами останавливаются там, где данных мало, и честно это признают.

Ошибок, однако, тоже хватает. Некоторые относятся просто к истории технологий, другие гораздо интереснее, потому что касаются соглашательства ИИ, психоза, тревоги и возможностей современной AI-психотерапии.

Есть при этом проблема, которая осложняет вообще любой сегодняшний разговор об искусственном интеллекте: исследование полуторагодичной давности может описывать систему, которой практически уже не существует. В этой области нельзя автоматически переносить результаты GPT-4o или даже GPT-5 образца 2025 года на актуальные модели 2026-го.

С историей ИИ в ролике действительно не всё хорошо

В разговоре трансформеры, на которых построены современные большие языковые модели, связывают с Яном Лекуном и началом девяностых. Тут обычная фактическая ошибка: архитектура Transformer появилась в 2017 году в статье Vaswani и соавторов Attention Is All You Need. Лекун, конечно, один из ключевых исследователей в истории глубокого обучения, но трансформеры в 1991 году он не создавал.

Vaswani et al., Attention Is All You Need
https://arxiv.org/abs/1706.03762

Ещё сильнее перепутана история знаменитого матча AlphaGo против Ли Седоля. В ролике необычный ход AlphaGo оказывается в четвёртой партии при счёте 2:1, после чего Ли якобы проигрывает и машина выигрывает матч.

На самом деле знаменитый Move 37 AlphaGo сделала во второй партии. После третьей счёт был уже 3:0, а четвёртую партию как раз выиграл Ли Седоль, сделав свой знаменитый Move 78, который потом называли God’s Touch.

DeepMind, AlphaGo
https://deepmind.google/research/alphago/

Там же Каспаров проигрывает Deep Blue в 1996 году, хотя в 1996-м Каспаров выиграл матч 4:2, а поражение в матче-реванше произошло в 1997-м.

IBM, Deep Blue
https://www.ibm.com/history/deep-blue

Мне здесь интересна даже не сама ошибка. Человек действительно смотрел матч AlphaGo, событие явно произвело сильное впечатление, он помнит будильник, прямую трансляцию и собственную эмоциональную реакцию, но спустя десять лет основные элементы двух разных партий спокойно слились в одно воспоминание. Хороший бытовой пример того, почему уверенность человека в своей памяти не является особенно надёжным показателем её точности.

Соглашательство ИИ: проблема реальная, но уже не такая, как два года назад

В ролике довольно много внимания уделено sycophancy, то есть склонности модели подстраиваться под позицию пользователя, угадывать ожидаемый ответ и иногда поддерживать даже ошибочную предпосылку.

Сама проблема совершенно реальна. Но если из разговора складывается впечатление, что это почти неизбежная «природа» больших языковых моделей, которую разработчики не способны существенно изменить, то к 2026 году такая картина уже выглядит устаревшей.

Весной 2025 года OpenAI действительно довольно болезненно столкнулась с соглашательством GPT-4o: одна из версий модели стала чрезмерно льстивой и поддерживающей пользователя, и обновление пришлось откатить. После этого разработчики отдельно занялись этой проблемой не только на уровне системного промпта, но и на уровне post-training.

OpenAI, Sycophancy in GPT-4o
https://openai.com/index/sycophancy-in-gpt-4o/

В системной карте GPT-5 OpenAI сообщала, что GPT-5-main показал почти трёхкратное улучшение на специальном тесте соглашательства по сравнению с последним GPT-4o, а в предварительных измерениях реального трафика частота sycophantic responses снизилась примерно на 69% у бесплатных пользователей и на 75% у платных. Это внутренние оценки производителя, а не независимое клиническое исследование, но масштаб изменения всё равно заметный.

OpenAI, GPT-5 System Card
https://deploymentsafety.openai.com/gpt-5/system-level-protections

Сам пользователь тоже способен довольно сильно менять это поведение. Custom Instructions позволяют заранее задать модели правила вроде: не соглашайся со мной автоматически, проверяй мои предпосылки, указывай на противоречащие данные, отделяй факты от моих интерпретаций. Это не гарантирует идеального результата, но характер разговора меняет заметно.

OpenAI, Custom Instructions
https://help.openai.com/en/articles/8096356/chatgpt-custom-instructions

Свежая экспериментальная работа 2026 года показала ещё одну любопытную вещь. Если человек не спрашивает, а уверенно заявляет свою позицию, особенно от первого лица, модель соглашается чаще. Чем выше выраженная пользователем уверенность, тем сильнее эффект. Если же сначала превратить такое утверждение в настоящий вопрос, соглашательство уменьшается. Причём эта техника оказалась эффективнее простого указания модели «не будь соглашательна».

https://arxiv.org/abs/2602.23971

То есть проблема не исчезла, но стала гораздо более управляемой. Есть обучение самой модели, системные инструкции, персональные настройки пользователя и банальная гигиена постановки вопроса.

Для человека, который специально настраивает ИИ на поиск ошибок и контраргументов, риск получить простое интеллектуальное поглаживание уже заметно ниже.

Клинически меня, впрочем, больше интересует не это.

Представим человека с формирующимся бредом преследования:

«Я понимаю, что ты не можешь подтвердить, что спецслужбы за мной следят. Но помоги разобраться, почему одна и та же машина появляется возле дома три дня подряд».

Модель может начать вполне корректно:

«Я не могу подтвердить, что это связано со слежкой».

Но если дальше она предлагает систематизировать номера автомобилей, сопоставлять время появления машин, искать повторяющиеся закономерности и вместе придумывать способы проверки гипотезы о слежке, простого соглашательства вроде бы нет. Однако модель уже участвует в разработке самой фабулы.

И вот это куда интереснее примитивного «Да, вы совершенно правы».

Свежий обзор 2026 года предлагает для подобных случаев модель amplification spiral, где могут взаимодействовать несколько свойств AI: подстройка под язык пользователя, гиперперсонализация и соглашательство. Авторы подчёркивают, что это пока гипотетическая модель, требующая проспективной проверки.

https://pubmed.ncbi.nlm.nih.gov/42304071/

«ИИ вызывает психоз» пока сказать нельзя

В разговоре сначала возникает достаточно сильное выражение «AI-induced psychosis», но затем собеседники сами переходят к гораздо более осторожной модели: у человека уже может существовать уязвимость или начинаться патологический процесс, а общение с LLM способствует дальнейшему развитию бредовых построений.

Такая формулировка мне кажется намного точнее.

В профессиональной литературе сейчас используется, например, выражение AI-associated delusions, то есть бредовые идеи, связанные с ИИ, а не автоматически вызванные им. В Lancet Psychiatry в 2026 году отдельно обсуждалась даже сама терминология, что хорошо показывает, насколько молодая это область исследований.

https://pubmed.ncbi.nlm.nih.gov/42134362/

Мы пока не знаем ни частоты таких эпизодов, ни относительного риска, ни того, сколько подобных случаев произошло бы без всякого ChatGPT. Поэтому история «здоровый человек открыл чат, поговорил неделю и получил психоз» пока гораздо сильнее данных.

А вот сценарий, при котором уязвимый человек или человек с уже начинающимся психотическим процессом использует модель как круглосуточного интеллектуального партнёра, а модель способствует укреплению и усложнению патологических убеждений, выглядит значительно правдоподобнее.

При этом защита от психотического контента тоже развивается очень быстро.

Есть работа в JAMA Psychiatry, где исследователи давали ChatGPT 79 запросов с психотическим содержанием. GPT-5 образца августа 2025 года справлялся лучше предыдущих вариантов, но всё ещё регулярно отвечал недостаточно корректно, поэтому авторы вполне обоснованно заключили, что на систему нельзя полагаться как на надёжную защиту от усиления психотического контента.

JAMA Psychiatry
https://jamanetwork.com/journals/jamapsychiatry/fullarticle/2846835

Только модели там тестировали 28–29 августа 2025 года.

Сами авторы отмечают, что к моменту публикации ChatGPT уже успел сменить как минимум две версии. Для классической клинической науки год между сбором данных и публикацией часто почти ничего не значит. Для LLM это иногда целая технологическая эпоха.

Современные системы уже тестируют не только на единичных опасных ответах, но и на многоходовых разговорах, где пользователь постепенно уводит модель в сторону бреда, эмоциональной зависимости или самоповреждения.

В deployment simulation GPT-5.6 частота ответов, нарушающих правила в области mental health, по внутренним оценкам OpenAI снизилась примерно на 40% по сравнению с GPT-5.5, с 0,03% до 0,02%. Это внутренний benchmark производителя, а не клиническая частота ошибок в реальной популяции, поэтому превращать эти цифры в «риск для пациента» нельзя.

OpenAI, GPT-5.6 Safety Evaluations
https://deploymentsafety.openai.com/gpt-5-6

Но и описывать современные модели так, будто защитные механизмы практически не изменились со времён GPT-4, уже неправильно. Модели действительно лучше обучены распознавать опасный психиатрический контекст и не развивать его.

Другое дело, что фраза «если у меня начинается психоз, ChatGPT обязательно это заметит» по-прежнему ничем не подтверждена.

С тревогой о здоровье разговор кажется довольно точным

Описание человека, который чувствует сердцебиение, онемение или «неполный вдох», начинает искать объяснение, узнаёт о новых симптомах, внимательнее прислушивается к телу и снова идёт за информацией, хорошо согласуется с исследованиями health anxiety и cyberchondria.

Метаанализ двадцати исследований с более чем семью тысячами участников обнаружил связь health anxiety с поиском медицинской информации и особенно сильную связь с cyberchondria.

McMullan et al., Journal of Affective Disorders
https://pubmed.ncbi.nlm.nih.gov/30419526/

Другой систематический обзор получил практически тот же результат.

https://pubmed.ncbi.nlm.nih.gov/34792473/

Но причинность сложнее привычной схемы «погуглил симптом и получил тревогу». Тревожный человек чаще ищет медицинскую информацию, а сам поиск у части людей может поддерживать тревогу. Получается скорее петля обратной связи.

С LLM у старой проблемы появляется новое продолжение. Раньше для reassurance seeking нужно было открыть поисковик и ходить по двадцати сайтам. Теперь можно несколько часов разговаривать с одним чрезвычайно терпеливым собеседником, который помнит контекст и способен бесконечно анализировать всё новые варианты одного симптома.

Но правильно настроенная современная модель способна сделать и обратное: заметить петлю reassurance seeking, отказаться от очередной порции заверений и предложить обсудить сам механизм тревоги.

Поэтому фраза «ИИ усиливает ипохондрию» тоже слишком грубая. Многое будет зависеть от модели, её настроек, формулировок пользователя и характера самого взаимодействия.

Может ли ИИ реально помогать при депрессии и тревоге?

Да, и здесь авторы ролика правильно отделяют универсальные модели от специализированных систем, построенных вокруг определённой психотерапевтической методологии.

Для цифровых CBT-чатботов уже существуют РКИ и метаанализы, обычно показывающие небольшие или умеренные эффекты на депрессивную симптоматику и более скромные эффекты на тревогу.

Один из свежих метаанализов 29 РКИ получил эффект около g=-0,55 для депрессивных симптомов и g=-0,26 для тревоги, однако разброс результатов был большим, prediction intervals пересекали ноль, а качество доказательств оставалось невысоким.

https://pubmed.ncbi.nlm.nih.gov/42101333/

Другой метаанализ 15 РКИ с 1737 участниками тоже обнаружил эффект на депрессивные симптомы, но после поправки на publication bias эффект при генерализованной тревоге уже выглядел менее убедительно.

https://pubmed.ncbi.nlm.nih.gov/42286191/

Есть одна принципиальная проблема: значительная часть этой доказательной базы относится не к современному ChatGPT, а к более старым и намного жёстче структурированным системам. Поэтому из «чатботы работают» пока нельзя автоматически получить «обычный ChatGPT является доказанной психотерапией».

Но и противоположная фраза, будто LLM вообще не способен быть терапевтическим инструментом, уже выглядит странно. Разумнее рассматривать современные модели как потенциальный дополнительный инструмент, эффективность которого зависит от конкретной задачи, модели, настроек, контекста и состояния самого человека.

ИИ как интеллектуальный оппонент мне нравится больше, чем ИИ как оракул!

Ближе к концу разговора появляется практическая идея: просить модель не подтверждать исходную позицию,

а искать контраргументы, слабые места и альтернативные объяснения.

Это, пожалуй, один из самых полезных способов взаимодействия с современным ИИ.

Можно заранее задать ему общий режим работы:

«Не соглашайся со мной ради поддержки. Если моя предпосылка неверна, скажи об этом прямо. Ищи данные против моей позиции. Различай факты, вероятностные выводы и мои интерпретации. Если качественных данных нет, не заполняй пробел правдоподобным ответом».

А в конкретном разговоре мне достаточно двух вопросов:

«Какие данные могут опровергнуть мою гипотезу?»

«Какое альтернативное объяснение я недооцениваю?»

Исследования 2026 года показывают, что даже сама замена уверенного утверждения пользователя на настоящий вопрос уже способна уменьшать соглашательство модели.

https://arxiv.org/abs/2602.23971

Поэтому sycophancy сегодня точнее описывать не как «неизлечимую болезнь ИИ», а как известную и существенно уменьшенную, хотя пока не полностью решённую проблему поведения моделей.

И действительно ли ИИ «меняет мозг»?

Вот здесь к заголовку ролика у меня остаётся больше всего вопросов.

В разговоре появляется красивый образ ИИ как «экзокортекса», дополнительного слоя коры, вынесенного наружу, а людей, постоянно использующих эти инструменты, сравнивают с цифровыми кентаврами.

Как метафора это работает. Как доказательство нейробиологических изменений, конечно, нет.

Гораздо интереснее, как меняются наши когнитивные стратегии, когда часть работы мы отдаём модели. LLM позволяет вынести наружу уже не только память или арифметику, как это делали записная книжка и калькулятор, но и формулирование гипотез, поиск контраргументов, анализ текста, планирование и часть рефлексии.

Это вполне реальный сдвиг. Но «человек иначе распределяет когнитивную нагрузку» и «у человека изменился мозг» всё ещё разные утверждения.

В итоге разговор оставляет скорее хорошее впечатление. Технических ошибок там хватает, особенно в истории искусственного интеллекта, но основная идея о двойственной роли LLM вполне разумна.

И всё же сейчас меня меньше всего беспокоит ИИ, который просто поддакивает. Это поведение уже специально исправляют, современные модели заметно лучше, а пользователь сам может настроить систему так, чтобы она спорила с ним, искала слабые места и требовала доказательств.

Интереснее момент, когда модель не льстит, не соглашается автоматически и вообще ведёт себя вполне разумно, но всё-таки принимает одну ошибочную предпосылку. Дальше она способна рассуждать внутри неё очень хорошо.

Вот там и начинается действительно трудная часть. Иногда нужно проверить не вывод, а сам вопрос, из которого этот вывод вырос.

Людям это, кстати, тоже даётся не особенно легко.

Мой личный канал в ТГ - https://t.me/kislersworld

Канал "Доктор Кислер о зависимостях" - https://t.me/doctorkisler