Интуиция бесполезна против фишинговых сообщений, созданных ИИ

Интуиция бесполезна против фишинговых сообщений, созданных ИИ

изображение: grok

Учёные Университета Бригама Янга выяснили, что участники эксперимента почти не отличают фишинговые сообщения, написанные GPT-4, от текстов живых авторов. Точность распознавания составила 52% при вероятности случайного угадывания 50%. Главным ориентиром для добровольцев оставалось внутреннее ощущение, которое в реальности не помогало.

В исследовании приняли участие 25 добровольцев. Каждый предварительно рассказал о профессии, месте работы, увлечениях, городе проживания и недавних публикациях в сети. Эти данные превратились в короткий профиль, с которым работали две группы авторов. GPT-4 по одному шаблону создала шесть персонализированных сообщений для каждого участника. Ещё шесть подготовили студенты, изучающие методы социальной инженерии, — на задание им отвели 15 мин.

Затем добровольцы получили 12 распечатанных сообщений и должны были расставить их по степени убедительности, а после провести границу между письмами, по ссылкам из которых готовы были перейти, и подозрительными текстами.

Стоит обратить внимание — один из участников признался, что убедительнее всего выглядело уведомление о подозрительной активности. Текст практически полностью повторял служебные предупреждения, которые регулярно получают сотрудники финансовой организации.

По итоговым цифрам ИИ выглядел немного успешнее. Сообщения GPT-4 попадали в категорию потенциально убедительных в 28% случаев, тексты студентов — в 21,3%. Формальное преимущество составило 6,7 процентного пункта. Авторы предупреждают, что при выборке в 25 человек статистическая погрешность слишком велика для однозначных выводов. Полученные результаты допускают несколько трактовок:

  • ИИ действительно оказался чуть эффективнее;
  • оба подхода показали примерно равный уровень;
  • преимущество могло остаться за людьми.

Любопытная деталь касается затрат. GPT-4 работала лишь с короткой анкетой пользователя, автоматически превращая факты в персональные сообщения. Студенты же проходили подготовку по социальной инженерии, а качество их текстов оценивали эксперты, среди которых были два профессора кибербезопасности.

Около трети подготовленных вариантов пришлось исключить как некачественные. Простой шаблон для генеративной модели дал сопоставимый уровень убедительности при значительно меньших ресурсах — и для российских пользователей это означает, что массовые фишинговые рассылки становятся дешевле в производстве.

Самыми опасными оказались сообщения, связанные с профессиональной деятельностью участников. Именно по таким ссылкам добровольцы были готовы перейти в 38% случаев. По сообщениям об увлечениях показатель составил 19%, а по публикациям из соцсетей — всего 17%. Различие между рабочей тематикой и двумя другими категориями оказалось статистически значимым.

Персонализация не всегда помогает атакующим. Ошибки в деталях быстро разрушали доверие. Один участник сразу заметил, что в его компании никогда не работал сотрудник, которого упоминало сообщение. Другой хорошо знал коллектив университета и понял, что названного человека там нет. Ещё один моментально отверг приглашение записаться на танцы, поскольку давно ими не занимается. Наличие личных сведений само по себе уже не производит сильного впечатления — гораздо весомее их точность.

После основной части эксперимента добровольцам сообщили, что часть писем создал ИИ, и предложили определить их. Из 300 оценок правильными оказались лишь 52%. Признаки, на которые опирались участники, распределились так:

  • слишком официальный стиль как маркер нейросети;
  • шаблонные формулировки;
  • идеальная грамотность как повод для подозрений;
  • опечатки как признак живого автора;
  • количество восклицательных знаков.

Почти половина добровольцев позже призналась, что решения принимались практически исключительно по внутреннему ощущению. Показательным вышел сюжет с эмодзи. В сообщениях GPT-4 они встречались примерно в двух третях случаев, у студентов — эпизодически. Несмотря на явное различие, большинство участников не обратило на это внимания. Лишь пять человек упомянули эмодзи при обсуждении, причём мнения разошлись:

  • одни решили, что эмодзи — признак нейросети;
  • другие сочли их доказательством человеческого авторства.

Там, где люди не увидели закономерностей, справился алгоритм машинного обучения. Исследователи перевели сообщения в векторное представление и обучили классификатор различать тексты GPT-4 и людей. После строгих предварительных преобразований, затронувших ссылки, эмодзи, регистр символов, цифры, знаки препинания и длину, модель достигла точности 88,7%.

Отмечается, что универсальным инструментом обнаружения ИИ такой классификатор считать нельзя. Он обучался на одном наборе сообщений от одной версии GPT-4 при едином шаблоне запросов, а подобные системы, по предыдущим работам, обходятся простым перефразированием.

У исследования есть и другие ограничения. Добровольцы читали распечатанные карточки, а не сообщения в телефоне. Они не видели адрес отправителя, не могли проверить ссылку и не сталкивались с интерфейсом мессенджеров или почты. Сравнение проводилось со студентами, а не с профессиональными специалистами по социальной инженерии. Для более убедительных выводов потребовалась бы выборка около 100 человек. Отсутствует и полная документация по использованной версии GPT-4, поэтому воспроизвести генерацию исходных сообщений уже нельзя.

Попытки распознать фишинг по стилю текста или ощущению не работают, и для аудитории в РФ это тот же риск — массовая генерация правдоподобных писем на русском языке уже доступна атакующим. Надёжнее проверять отправителя, привычный канал связи, адрес ссылки и соответствие сообщения ожидаемому контексту.

Ранее сообщалось, что эксперты «Лаборатории Касперского» обнаружили более 390 тысяч фишинговых атак с использованием популярных облачных платформ за период с августа 2025 по июль 2026 года. Чаще всего злоумышленники использовали Cloudflare Workers, Vercel, GitHub Pages и Netlify, размещая на этих ресурсах фишинговые ссылки для обхода многофакторной аутентификации и уклонения от обнаружения защитными решениями.

Эксперты CISOCLUB отметили, что ставка на визуальное распознавание фишинга исчерпала себя ещё до появления генеративных моделей, а теперь эта модель защиты окончательно перестаёт работать. Российским компаниям стоит переносить фокус с обучения сотрудников «замечать подозрительный стиль» на технические меры — проверку доменов отправителей, ограничение переходов по внешним ссылкам, обязательное подтверждение действий во втором канале. Персонализированные атаки по рабочим темам с показателем 38% доверия — это уровень, при котором один сотрудник в отделе почти гарантированно откроет вредоносную ссылку. Отдельного внимания заслуживает вопрос утечек профессиональных данных, поскольку именно рабочий профиль сотрудника даёт атакующему максимальный эффект.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: