Машинное кодирование психотерапевтического дискурса вышло на уровень эксперта — и показало, что ИИ-терапевт работает как новичок

Обзор описывает системы кодирования психотерапевтического дискурса — формализованные методики, размечающие каждое высказывание терапевта и клиента категорией, — и три способа их автоматизации: традиционное машинное обучение на заданных экспертом признаках, промптинг больших языковых моделей и файнтюнинг. Точность машинного кодирования уже сопоставима с экспертной, но сильно зависит от категории: «Вопросы» распознаются легко, «Рефлексия» — плохо, и ровно те же категории труднее даются людям. Самый содержательный результат прикладной части: сравнение размеченных сессий показало, что ИИ-терапевт ведёт себя как неопытный специалист — даёт много готовых решений, редко спрашивает об опыте и эмоциях клиента.

Практические выводы

  • Точность автоматического кодирования повторяет трудности человека: чем хуже эксперты согласуются между собой, тем хуже работает алгоритм.
  • Разброс точности по категориям огромен: в одной работе F1 от 0,23 для «Сопротивления» до 0,85 для нейтральных высказываний.
  • Выбор подхода определяется ресурсами: много размеченных данных — файнтюнинг, мало данных или нужен быстрый результат — LLM-промптинг.
  • Сравнение сессий показало у ИИ-терапевта профиль новичка: избыток готовых решений и психообразования, дефицит вопросов об опыте и эмоциях.
  • Одна и та же категория речи терапевта может быть связана с разными критериями успеха противоположным образом.

Машинное кодирование психотерапевтического дискурса вышло на уровень эксперта — и показало, что ИИ-терапевт работает как новичок

Авторы: Латынов В.В., Власова А.С.
Оригинал: Автоматизированные системы кодирования психотерапевтического дискурса
Год и выпуск: «Современная зарубежная психология», 2026, № 2, с. 37–46

Кому и для какого вопроса пригодится

Обзор адресован тому, кто занимается супервизией, обучением или оценкой качества работы консультирующих специалистов, и отвечает на вопрос: можно ли объективировать то, что происходит в разговоре, — не по впечатлению супервизора, а по разметке каждого высказывания. Ответ, который даёт статья, утвердительный, но с оговорками, и обе части одинаково важны.

Второй адресат — тот, кого занимает тема ИИ-консультантов. Здесь обзор даёт редкую вещь: не рассуждение, а измеримое сравнение речевого поведения модели с речевым поведением опытных и неопытных специалистов, с указанием, в чём именно расходится профиль.

Третий практический слой — исследовательский. Авторы показывают, почему поле долго стояло на месте: ручное кодирование настолько трудоёмко, что метаанализ 2019 года о влиянии речи терапевта на исход включал всего 10 работ и 162 участника. Автоматизация меняет масштаб доступных выборок, и это меняет вопросы, которые можно задавать.

Что именно изучали

Это обзорная статья. Задачи заявлены в трёх пунктах: составить представление о системах кодирования психотерапевтического дискурса, выделить основные подходы к их автоматизации и охарактеризовать спектр решаемых задач.

Процедура поиска описана: arxiv.org, APA PsycNet, Frontiers, ResearchGate, ACL Anthology, Taylor & Francis Online, Nature, Semantic Scholar, Science Direct, Wiley Online Library; ключевые слова «psychotherapy», «discourse», «conversation», «behavioral coding», «deep learning», «large language models»; основное внимание публикациям 2020–2025 годов. Формализованных критериев включения, числа отобранных работ и оценки их качества авторы не приводят — это нарративный обзор с описанной стратегией поиска, а не систематический обзор с количественным синтезом.

Предмет описан аккуратно. Система кодирования разбивает текст сессии на дискретные высказывания и присваивает каждому заранее определённую категорию — в разных системах их называют интенциями, речевыми актами или психотерапевтическими вмешательствами, но речь идёт примерно об одном: о локальной цели высказывания. Систем насчитываются десятки, они различаются числом категорий (от нескольких единиц до нескольких десятков), наличием отдельных наборов для терапевта и клиента, одномерностью или многомерностью разметки и наличием иерархии.

Что обнаружили

  • Разработка системы кодирования — многоэтапная процедура: предварительный набор категорий из теории или из анализа речевых данных, детальная инструкция с определениями и примерами, обучение экспертов-кодировщиков, разметка, оценка согласованности через коэффициент Каппа, процент совпадений или внутриклассовую корреляцию. Авторы отмечают существенное: проверка валидности систем проводится далеко не всегда, поскольку главной их характеристикой принято считать надёжность. Из систем с проверенной валидностью назван SICOLENTE, где из 24 выдвинутых гипотез эмпирически подтвердились 19.
  • Выделены три подхода к автоматизации. Традиционный — классические алгоритмы (SVM, логистическая регрессия, Random Forest, бустинг) на признаках, отобранных человеком; в одной из работ таких признаков было 5850. Он прост в воспроизводстве на небольших данных и даёт интерпретируемый результат, но требует ручного отбора признаков, плохо обобщает нестандартные формулировки и теряет точность при большом числе категорий. LLM-промптинг — модель без обучения получает инструкцию с определениями категорий, примерами и контекстом; не требует локальных вычислительных ресурсов, но сильно зависит от формулировки промпта (перестановка слов заметно меняет качество), склонен к галлюцинациям и плохо ловит редкие категории. Файнтюнинг — дообучение модели на размеченных данных, при котором признаки модель находит сама; даёт, как правило, наибольшую точность, но требует объёмного размеченного корпуса и несёт риск переобучения.
  • Точность машинного кодирования в ряде исследований достигла уровня, сопоставимого с экспертным, но разброс по категориям очень велик. В работе Сао с коллегами по системе MISC метрика F1 для категорий клиента составила от 0,23 («Сопротивление») до 0,85 (нейтральные и формальные высказывания). В исследовании Эвбанка соответствующая человеку точность была достигнута для трёх категорий клиента из пяти.
  • Обнаружена устойчивая закономерность, не зависящая от языка (английский, испанский, голландский, современный иврит): категория «Вопросы» предсказывается автоматически легче, чем «Рефлексия». Объяснение авторы дают через человека: различия в машинной точности во многом отражают объективную трудность категории для экспертов-кодировщиков — чем сложнее задача человеку, тем хуже справляется и алгоритм. Отсюда прямое следствие: обучение алгоритмов на данных со слабой согласованностью экспертов даёт низкую точность.
  • Изучение процесса: конфронтация, уточнение и поддержка вызывали у клиента более высокий немедленный эмоциональный отклик, чем вопросы, самораскрытие и предоставление информации, причём наибольший отклик давала конфронтация, направленная на переживания и защитные механизмы. Обнаружена связь структуры диалога с настроем клиента: при установке сохранять проблемное поведение в речи терапевта чаще фиксировалась рефлексия, при желании измениться — вопросы и рекомендации. Контроль клиента над направлением диалога обычно усиливался по мере развития отношений, а те, кто меньше контролировал ситуацию в первые сеансы, значительно чаще выражали недовольство терапевтом и прекращали терапию. Вариативность применения категорий у разных терапевтов и у одного терапевта с разными клиентами оказалась существенной, максимальной — для эмпатии.
  • Оценка квалификации: автоматическому кодированию для оценки навыков достаточно самого текста сессий, без дополнительных сведений о специалисте. Большинство специалистов, получивших такую обратную связь, сочли оценки полностью или частично совпадающими с собственными представлениями и удобными на практике. Разработаны системы, кодирующие загруженную аудиозапись на уровне отдельных высказываний и сессии в целом.
  • Сравнение ИИ-терапевта с людьми в работе Чиу с коллегами дало профиль неопытного специалиста: избыток готовых решений проблем клиента, высокие показатели нормализации чувств и психообразования, редкие вопросы об опыте клиента и его эмоциях; динамика сеансов и адаптируемость к поведению клиента тоже соответствовали низкому уровню навыков. Сильной стороной оказалось рефлексивное слушание. Общий вывод тех авторов — поведение ИИ-терапевтов пока не в полной мере соответствует стандартам высококачественной помощи.
  • Рядом приводится расходящийся результат: в исследовании Кухайла с коллегами эксперты-психотерапевты не сумели отличить сессии ИИ от сессий людей — точность распознавания 53,9 процента, на уровне случайного угадывания, — и оценили сессии ИИ как более качественные. Авторы обзора сами предлагают объяснение расхождения: в том исследовании экспертам задавали ограниченный набор вопросов, большинство которых касалось как раз сильных сторон ИИ.
  • Связь дискурса с исходом: конгруэнтность высказываний терапевта и клиента оказалась предиктором успешности терапии при критерии уменьшения депрессивной симптоматики. В работе Эвбанка по генерализованному тревожному расстройству с уменьшением негативной симптоматики положительно связаны составление плана сеанса, проверка домашнего задания, коррекция мышления и поведения, обсуждение прогресса, планирование будущего и похвала; отрицательно — приветствие, прощание, речевые переходы, оценка риска, психотерапевтическая эмпатия и не связанный с терапией контент. Отдельно отмечено, что одни и те же категории связаны с разными критериями эффективности — уменьшением симптоматики и настроем клиента продолжать — разнонаправленно.

Что из этого следует — и не следует

Авторы заключают, что технологии уже способны кодировать психотерапевтический дискурс на сопоставимом с человеком уровне, и дают практическое правило выбора подхода: при обширном размеченном корпусе — файнтюнинг, при его нехватке или необходимости быстрого результата — LLM-промптинг с экспертно проработанной инструкцией, а традиционный подход — когда важна интерпретируемость.

Для практики супервизии из обзора следует более осторожная мысль: машинная разметка не создаёт объективности из ничего, она наследует её у экспертного консенсуса. Там, где люди расходятся в понимании категории, алгоритм будет ошибаться тем же образом, и корень проблемы лежит в определении категории, а не в модели.

Чего утверждать нельзя. Обнаруженные связи речевых категорий с исходом терапии корреляционные: из того, что частота похвалы связана с уменьшением симптоматики, не следует, что увеличение похвалы её уменьшит. Особенно осторожно нужно читать отрицательную связь эмпатии с редукцией симптомов в работе Эвбанка — сами авторы обзора рядом показывают, что направление связи меняется в зависимости от выбранного критерия успеха, и никакой рекомендации «меньше эмпатии» отсюда не следует. Данные о том, что эксперты не отличают ИИ от человека, не означают эквивалентности: обзор прямо объясняет этот результат ограниченностью использованного опросника. И ни одна из описанных систем не представлена как валидизированная для русскоязычного материала — все результаты получены на других языках и в других терапевтических традициях.

Ограничения

Авторы называют нерешённые задачи прямо: низкая точность выявления отдельных категорий, в частности негативного оценивания; необходимость выйти за пределы вербального содержания и учитывать просодические характеристики речи — тон и интонацию; проблема галлюцинаций больших языковых моделей, которые приписывают высказываниям несуществующие интенции; и проблема обобщаемости — результаты, полученные в одном терапевтическом подходе или культурном контексте, могут оказаться неэффективными в других, из-за чего требуются специальные кросс-культурные исследования универсальности самих категорий.

Оригинал: Автоматизированные системы кодирования психотерапевтического дискурса // Современная зарубежная психология — 2026. Том 15. № 2 | PsyJournals.ru