MWS AI проверила способности нейросетей выявлять поддельные документы

MWS AI проверила способности нейросетей выявлять поддельные документы

MWS AI (входит в МТС Web Services) проверила способности мультимодальных моделей искусственного интеллекта (Visual Language Models, VLM) распознавать признаки поддельных документов. Тестирование провели на открытом бенчмарке MWS AI Vision Bench, который позволяет оценить качество работы нейросетей в области оптического распознавания символов (OCR) и понимания документов. По итогам тестирования выяснилось, что новые модели могут уступать предыдущим версиям в выявлении поддельных документов.

Для проверки команда дополнила открытый бенчмарк MWS AI Vision Bench датасетом и набором заданий Anti-fraud для выявления подделок. В датасете собраны 430 изображений: 200 исходных, 130 с ручными правками и 100 пересозданных генеративной моделью. В рамках экспериментальной задачи нейросети должны были определить, к какой категории относится изображение, и перечислить подозрительные элементы. Исследователи проверяли, могут ли модели выявить подмену реквизитов в отсканированных документах и отличают ли изображения, созданные ИИ, от исходных (изображения, которые в эксперименте не редактировали). При оценке учитывались корректность классификации и качество объяснения того, какие поля изменили вручную.

Среди лидеров по выявлению поддельных документов — модели семейств Claude, GPT и GLM. Ниже представлены семь лучших результатов на открытой части набора.

Чем выше балл, тем лучше результат работы моделей в исследуемых категориях. В overall* задачи из категории anti-fraud не входят.

Результаты показали, что модели, которые хорошо читают и понимают документы, могут уступать другим нейросетям в выявлении подделок. Например, GPT-6.1 Sol занимает первое место по общей оценке, но третье — по способности обнаруживать подмены. В этой категории лидирует Claude Opus 5.5.

«Новая задача Anti-fraud носит экспериментальный характер: публичный набор отличается от реального потока документов, а некоторые его особенности могут подсказывать модели правильный ответ. Поэтому оценку выявления подделок мы публикуем отдельно и не включаем в общий балл MWS AI Vision Bench. Набор помогает предварительно сравнить качество универсальных нейросетей, но для защиты от мошенничества на реальных документах лучше использовать специализированные решения», — рассказал создатель бенчмарка Георгий Гайков.

С помощью дополнительного набора исследователи могут сравнить модели, изучить их ответы и проверить, замечают ли они изменённые поля документов. Это поможет сократить объём ручной подготовки данных и проверок при выборе модели для работы в продакшене.

Технический разбор на Habr:

MWS AI Vision Bench — открытый бенчмарк MWS AI для оценки мультимодальных нейросетей на русскоязычных документах. Он проверяет оптическое распознавание символов (OCR), восстановление структуры документа, определение расположения текста, извлечение данных и ответы на вопросы по содержимому. Основной набор включает 800 изображений и 2 580 заданий: сканы документов, таблицы, рукописные записи, схемы, чертежи и графики.

*Общая оценка (Overall) — средний балл по пяти задачам: распознавание текста (OCR), восстановление структуры документа, определение расположения текста, извлечение данных и ответы на вопросы по содержимому.

MWS
Автор: MWS
МТС Web Services (MWS) — сервисы и продукты Enterprise-уровня для ИИ-экспериментов и цифровой трансформации бизнеса. Мы предлагаем передовые технологии, глубокую экспертизу, комплексную поддержку и надежную инфраструктуру, чтобы вы достигали новых высот.
Комментарии:

Как мы обрабатываем данные: политика обработки персональных данных