Европейский институт по стандартам ETSI придумал техосмотр для данных, которыми кормят нейросети

Европейский институт по стандартам ETSI придумал техосмотр для данных, которыми кормят нейросети

изображение: grok

Европейский институт телекоммуникационных стандартов ETSI выпустил технический отчёт TR 104 180 с 18 метриками для оценки качества датасетов перед тем, как отправить их в машинное обучение. Документ предлагает заменить привычное «данные вроде норм» на конкретные формулы и расчёты. По сути, у датасетов появился собственный техосмотр, и старое доброе garbage in, garbage out теперь можно подтвердить бумажкой.

Хайп вокруг ИИ обычно крутится вокруг архитектур и числа параметров, а про сырьё, на котором всё это готовится, разработчики нередко вспоминают в последнюю очередь. Авторы отчёта разложили 18 метрик по 4 блокам:

  • базовая гигиена данных, то есть полнота, точность и согласованность записей, а также число дублей в наборе;
  • практическая пригодность, куда входят доступность данных в нужный момент, задокументированное происхождение записей и их актуальность;
  • справедливость, то есть отсутствие перекоса в отношении разных социальных групп;
  • приватность, то есть риск деанонимизации людей и защита чувствительных полей.

Каждый блок бьётся ещё на несколько подпунктов, так что итоговых метрик набирается ровно 18, а не круглая цифра для красоты. Под каждую метрику отчёт даёт формулу и порог, ниже которого датасет считается проблемным, поэтому оценка получается не на глазок, а вполне конкретным числом.

Диего Лопес, глава техкомитета ETSI DATA, курировал разработку методики. Он рассказал, что измеримость качества данных здорово выручает организации, которым нужно понять, годится ли конкретный датасет под конкретную задачу и получится ли на его основе построить ИИ, которому реально можно доверять.

Отмечается, что стандартизированные метрики позволяют говорить о качестве данных на одном языке и подтверждать выводы цифрами, а не ощущениями редактора датасета.

Чтобы проверить методику на практике, рабочая группа прогнала все 18 показателей через 2 открытых датасета, показания датчиков авиационных двигателей и знакомую любому дата-сайентисту американскую перепись населения, где алгоритму нужно было предсказать, превышает ли годовой доход человека отметку в 50 000 долларов.

С показаниями турбин, знакомым инженерам набором с симуляцией деградации двигателей, всё оказалось спокойно, набор был полным, точным и не разъезжался по характеристикам со временем, инженеры годами гоняют на нём модели предиктивного обслуживания, и придраться там реально не к чему. С переписью получилось куда веселее, там сразу обнаружились три проблемы:

  • перекос по полу, у мужчин доход выше порога встречался примерно в 31% записей, у женщин только в 11%;
  • риск деанонимизации всего по 4 признакам, это возраст, раса, пол и страна проживания;
  • чувствительные поля хранились в открытом виде, без маскирования и шифрования.

Разрыв почти 3-кратный, и для методики TR 104 180 это не просто занятная статистика, а сигнал о потенциальной предвзятости исходных данных. Если такую выборку без проверки закинуть в обучение, модель начнёт воспринимать перекос как норму и штамповать его в собственных решениях уже в проде.

Уточняется, что датасет способен быть образцовым по полноте и точности и при этом плохо защищать личность людей, если по нескольким на вид безобидным полям реально вычислить конкретного человека.

Отдельно взятые эти поля выглядят безобидно, но в комбинации превращаются в цифровой отпечаток человека, и для этого не нужен даже развёрнутый профиль с именем и телефоном.

Для российских команд, которые точно так же трейнят модели на собственных датасетах, расклад ровно такой же, а закон о персональных данных к перекосам в обучающей выборке равнодушен не будет. Кривая выборка не спросит паспорт перед тем, как испортить продакшн.

Вместе с отчётом рабочая группа выпустила инструмент с открытым исходным кодом, который прогоняет любой датасет через все 18 метрик и выдаёт оценку без ручной проверки, а результат можно воткнуть прямо в пайплайн подготовки данных перед обучением. Над методикой работали специалисты из нескольких университетов и организаций:

  • Sejong University;
  • EGM;
  • TTA;
  • Daejeon University;
  • CNIT.

Для разработчиков это шанс устроить датасету полноценный экзамен ещё до старта обучения, а не после того, как обученная модель начнёт принимать решения за живых людей, причём экзамен автоматический, без созвонов и служебных записок. Российским стартапам, которые работают с персональными данными пользователей, тоже стоит взять методику на заметку. Штрафы за утечки никуда не делись, а обученная на кривых данных модель бьёт по репутации не хуже слитой базы.

Из всего этого вырисовывается простой чек-лист для любой команды, которая садится трейнить модель:

  • актуальность и происхождение записей, чтобы в обучение не улетел мусор 3-летней давности;
  • баланс между группами пользователей, чтобы алгоритм не выучил чужой перекос как норму;
  • риск деанонимизации по связке из нескольких на первый взгляд безобидных полей;
  • шифрование или маскирование чувствительных данных ещё на этапе хранения.

Ранее сообщалось, что китайские военные исследователи предлагают применять искусственный интеллект для анализа ситуации на поле боя в реальном времени и ускорения принятия решений командованием. Об этом пишет Bloomberg со ссылкой на публикации в журнале China Military Science. Среди авторов материалов — генерал-майор Чжу Сяоцянь, возглавляющий Армейский инженерный университет НОАК и выступающий за автоматизацию части боевых решений.

Эксперты CISOCLUB отметили, что подход ETSI закрывает давнюю дыру в разработке ИИ, когда датасет принимали на веру просто потому, что записей много. По их оценке, стандартизированные метрики способны сократить число моделей, обученных на кривых выборках, ещё на этапе подготовки данных. Открытый инструмент для проверки, по их мнению, снижает порог входа даже для команд без штата дата-инженеров. Раздел про приватность они назвали самым практичным, ведь деанонимизация по связке полей встречается в реальных продуктах регулярно.

По их прогнозу, подобные метрики со временем станут частью стандартного чек-листа перед релизом любой модели, которая учится на пользовательских данных. По их прикидкам, такие проверки экономят командам недели работы на разборе инцидентов уже после релиза.

Артем
Автор: Артем
Представитель редакции CISOCLUB. Пишу новости, дайджесты, добавляю мероприятия и отчеты.
Комментарии: