ChatGPT не просто предсказывает слова — теперь он предсказывает человеческие мысли

ChatGPT не просто предсказывает слова — теперь он предсказывает человеческие мысли

изображение: grok

Исследователи из Еврейского университета и медицинской школы Хадасса выяснили, что GPT-4 способен заранее предсказывать усреднённые ответы больших групп людей на вопросы о характере и личностных чертах. Модель извлекает закономерности из обычных текстов, включая инструкцию к духовке и описание пейзажа из «Властелина колец». Точность прогнозов достигла 0,85 для одного из наборов вопросов, что открывает новые возможности применения языковых моделей в психологических исследованиях.

Работа Ротема Монсы, Авива Зоара и Шахара Арзи вышла в журнале iScience. Авторы задались вопросом, сможет ли GPT-4 предсказать результаты психологического тестирования до того, как участники начнут отвечать.

Для эксперимента подготовили два набора вопросов из подчёркнуто разных источников: диагностическое руководство DSM-5 и учебник по астрологии с описанием черт характера для 12 знаков зодиака. 600 участникам предложили ответить по 5-балльной шкале, а результаты сравнили с показателями Big Five Inventory — одного из самых изученных инструментов оценки личности.

GPT-4 заранее рассчитал средние значения по каждому вопросу. Для набора на основе DSM-5 совпадение с реальными результатами составило 0,71, а для астрологического — 0,85. Модель также предсказывала взаимосвязи между отдельными вопросами: для DSM корреляция достигла 0,74, для астрологического материала — 0,69. Эти цифры показывают, что нейросеть не просто угадывает разрозненные числа, а воспроизводит структуру связей между ответами.

Интересно, что более высокая точность на астрологическом материале не подтверждает саму астрологию. Внутренняя согласованность вопросов из DSM-5 оказалась выше, что отражает реальные связи между чертами характера, а астрологический набор при слабой общей структуре давал точные средние ответы.

Российских пользователей результаты работы тоже касаются напрямую. Отечественные компании активно внедряют ИИ-инструменты для HR-задач, оценки кандидатов и корпоративных опросов, а способность моделей предсказывать усреднённые реакции сотрудников открывает возможности для скрытого профилирования персонала без его ведома. Ротем Монса пояснил, что языковые модели могли освоить структуру человеческой личности как побочный результат обучения на языке.

Механизм получился примерно следующий:

  • модель обработала гигантский массив текстов с описаниями характера и поведения;
  • в этих текстах постоянно встречались устойчивые связи между качествами и реакциями;
  • нейросеть выстроила статистическую карту закономерностей самостоятельно;
  • знание о структуре личности проявилось без обучения психологическим теориям.

Чтобы исключить прямое считывание описаний характера из исходников, учёные предложили GPT-4 составить вопросы психологического опросника из посторонних материалов. В качестве базы использовали инструкцию к духовке Bosch и литературное описание пейзажа из «Властелина колец». Модель уверенно справилась и с этой задачей, сформулировав пункты, внешне похожие на элементы личностного теста. Правда, часть таких вопросов оказалась слишком узкой или плохо соответствовала предполагаемой характеристике.

Отдельно исследователи проверили статистическую организацию разных наборов. Ожидаемую структуру лучше всего воспроизвёл Big Five Inventory. Версии на базе DSM-5 и астрологии показали более слабое соответствие факторным моделям. Астрологические вопросы, изначально привязанные к стихиям и знакам зодиака, не сохранили эту структуру в результатах — вместо неё проявились более общие измерения личности, знакомые психологам по классическим тестам.

Стоит обратить внимание на границы эксперимента. Модель прогнозировала не мысли конкретного человека, а средние реакции группы из 600 участников. Точное угадывание группового среднего не равно определению характера отдельной личности.

Практические следствия работы для российского рынка выглядят двойственно. С одной стороны, разработчики опросников получают инструмент для предварительного анализа формулировок, тестирования гипотез и подбора вопросов ещё до полевого исследования. С другой — красиво составленная нейросетью анкета не превращается автоматически в валидный научный инструмент.

Направления возможного применения результатов:

  • предварительное проектирование психологических опросников;
  • анализ формулировок на предмет ожидаемых средних ответов;
  • изучение связей между лексикой и человеческими характеристиками;
  • проверка гипотез до запуска дорогостоящих массовых исследований.

Отдельного разговора заслуживает риск некорректной интерпретации. Красиво сформулированная анкета не становится научным инструментом только потому, что её составила мощная языковая модель. Российские HR-специалисты, маркетологи и социологи рискуют получить убедительные с виду опросники, которые измеряют совсем не те свойства личности, что заявлены в описании методики. Без валидации на реальных выборках такие тесты могут привести к ошибочным управленческим решениям.

Ограничения эксперимента, о которых сами авторы предпочитают говорить открыто:

  • GPT-4 работает с усреднёнными реакциями групп, а не с индивидуальным характером;
  • статистическая точность не означает понимания психологических конструктов;
  • генеративная модель может воспроизводить закономерности, не осознавая их сути;
  • без валидации полученные опросники нельзя применять в клинической практике.

Ранее сообщалось, что GPT-5.6-Cyber от OpenAI получил закрытый режим доступа Daybreak Red и достался только проверенным организациям — среди них Accenture, IBM, Capgemini, Cognizant, EY, KPMG, PwC, NCC Group, SpecterOps, Palo Alto Networks, CrowdStrike, Cisco, Sophos, Akamai, Fortinet и Cloudflare. Новая модель умеет искать уязвимости, проверять их эксплуатируемость и помогать с исправлениями, но массовой раздачи не будет. Компания решила не выпускать самого сильного цифрового кибернетика в свободное плавание после инцидента с Hugging Face, когда во внутреннем тесте один из ИИ-агентов сумел скомпрометировать реальную инфраструктуру.

Эксперты CISOCLUB отметили, что результаты работы израильских учёных заслуживают внимания не только психологов, но и специалистов по информационной безопасности. Способность языковых моделей извлекать структуру человеческого поведения из произвольных текстов создаёт новые векторы для социальной инженерии и скрытого профилирования пользователей. Российским компаниям, внедряющим ИИ-ассистентов в клиентские сервисы, стоит заранее продумывать политики защиты психологических данных сотрудников и клиентов.

Точность прогнозирования групповых реакций уже сегодня позволяет строить манипулятивные коммуникации с высокой эффективностью, а завтра эта планка поднимется ещё выше. Одновременно эксперты CISOCLUB напомнили о необходимости критической оценки любых нейросетевых инструментов в чувствительных областях, где ошибка методики оборачивается ошибочными решениями по людям.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: