
Плохие данные портят ИИ: задайте порог качества до запуска

Чтобы решить, годятся ли данные для ИИ-функции, задайте до запуска порог для каждого набора: допустимую долю ошибочных меток, пропусков, противоречий и повторов, а также обязательное покрытие случаев, с которыми встретится модель. Для каждой проверки запишите способ измерения и условие блокировки выпуска. Рекомендации AWS связывают пороги данных с критериями выпуска и требуют более строгой проверки оценочных наборов, чем обучающих.
Проверяйте показатели по отдельности: заполненные поля не исправят неверные метки, а отсутствие повторов не докажет, что представлены нужные классы. Исследование табличных данных рассматривает точность, полноту и согласованность как разные измерения качества и изучает, как загрязнение обучающих и проверочных данных связано с результатами моделей. Это основание для раздельных проверок, а не готовый универсальный порог для любой задачи.
Определите назначение каждого набора
Сначала опишите решение, ради которого создаётся модель, и случаи, на которых его предстоит принимать. Для функции распределения обращений по темам важны обращения из поддерживаемых каналов и на поддерживаемых языках. Даже безошибочно размеченный набор из другого процесса может плохо отражать эту задачу. Укажите происхождение записей, правила отбора, период сбора и дату обновления версии.
Разведите обучающий набор и данные для итоговой оценки. Ошибки в обучении можно находить и исправлять в ходе разработки; ошибки в итоговом наборе искажают основание для решения о выпуске. Если на одних примерах подбирали признаки, настройки или вариант модели, не называйте результат на них независимой итоговой проверкой. Для каждого набора зафиксируйте его роль, версию и человека, который принимает решение о допуске.
Измерьте ошибки, пропуски и покрытие
У каждого показателя определите числитель, знаменатель и способ отбора записей для проверки. Для точности меток нужна контрольная выборка с согласованным эталоном и правилом разрешения спорных случаев. Когда эталона нет, можно измерять согласие разметчиков, но нельзя выдавать его за точность: люди могут одинаково применять ошибочное правило.
- Точность меток: доля проверенных записей, чья метка совпала с эталоном. Укажите размер контрольной выборки, способ её отбора и минимально допустимую долю совпадений.
- Полнота: доля записей без пропуска в каждом обязательном поле. Считайте поля отдельно, чтобы высокий общий процент заполнения не скрывал пустой признак, необходимый для решения.
- Согласованность: доля записей, проходящих конкретные правила допустимых значений, формата и сочетания полей. Сохраните перечень правил вместе с результатом: иначе повторная проверка может измерить уже другое свойство.
- Покрытие: число или доля примеров по каждому обязательному классу и срезу: языку, каналу, типу обращения или группе пользователей. Демографические срезы включайте, когда они значимы для применения модели и необходимые сведения доступны надлежащим образом.
- Шум и повторы: отдельно считайте долю ошибочных или неоднозначных меток в проверенной выборке и долю дубликатов во всём наборе. Заранее решите, считать ли почти одинаковые тексты одним примером: поиск только точных совпадений их пропустит.
Порог выбирают по последствиям ошибки и по тому, насколько надёжно измерен сам показатель. Среднее по всему набору может скрыть провал обязательного редкого класса, поэтому для критичных срезов нужны собственные условия допуска. Если контрольная выборка мала или отобрана только из удобных случаев, запишите это ограничение: измеренная доля ошибок может не отражать весь набор.
Проверьте границу между обучением и оценкой
Оценочная запись не должна попадать в обучение напрямую или через почти одинаковую копию, если из неё модель может узнать ответ. Сравните устойчивые идентификаторы, связанные объекты и содержимое записей; подход зависит от того, проверяете ли вы обращения, изображения или другие данные. Для задачи с временным порядком отдельно убедитесь, что признаки не содержат сведений, появившихся позже момента предполагаемого решения.
Документация scikit-learn объясняет, что использование проверочных данных при обучении преобразований способно завысить оценку модели. Поэтому сначала разделите записи, затем определяйте параметры заполнения пропусков, масштабирования или отбора признаков только по обучающей части. В паспорте зафиксируйте способ поиска пересечений и результат; обнаруженную утечку устраните до итоговой оценки.
Заполните паспорт набора для решения о выпуске
Паспорт можно вести как таблицу с отдельной строкой для каждой проверки. В строке нужны заранее утверждённый порог, измеренное значение, способ измерения и итог «допустить» или «остановить». Пустой результат означает, что условие допуска ещё не проверено, даже если остальные показатели выглядят приемлемо.
- Назначение: задача модели ___; роль набора — обучение или итоговая оценка ___; версия и дата обновления ___.
- Происхождение: источник и период сбора ___; правила включения и исключения записей ___; ответственный ___.
- Метки: способ получения эталона ___; размер и отбор контрольной выборки ___; измеренная точность ___; минимальный порог ___.
- Пропуски и согласованность: обязательные поля ___; доля пропусков по каждому ___; правила проверки ___; доля нарушений и допустимый максимум ___.
- Повторы и шум: определение дубликата ___; доля повторов ___; доля ошибочных или неоднозначных меток ___; допустимые максимумы ___.
- Покрытие: обязательные классы и срезы ___; число примеров в каждом ___; минимум для каждого среза ___; отсутствующие случаи ___.
- Разделение: способ поиска пересечений между обучением и оценкой ___; найденные пересечения ___; условие остановки при утечке ___.
- Решение: пройденные и проваленные проверки ___; условие блокировки выпуска ___; кто исправляет данные и кто принимает обновлённую версию ___.
Привяжите каждый порог к допуску
Не складывайте показатели в один балл, которым можно перекрыть провал обязательной проверки. Хорошее покрытие частых классов не возместит отсутствие класса, по которому функция обещает работать. Если условие не выполнено, исправьте набор либо сузьте заявленную область применения и проверьте новую версию снова.
В условном примере с распределением обращений команда может потребовать для итоговой оценки более точные метки, чем для обучения, отсутствие пересечений между наборами и минимальное покрытие каждого поддерживаемого языка. Значения команда устанавливает заранее с учётом последствий неверной маршрутизации и доступной контрольной выборки. Выпуск останавливается, если обязательное условие провалено или его результат неизвестен.
Читайте также:
Похожие статьи


Данные из контекста не заменят тест: как применять их в рекламе соцсетей

Подписаться на хэштег в Instagram больше нельзя — что работает вместо этого

Предиктивная аналитика: высокая точность ещё не делает прогноз полезным

Метки ВКонтакте: почему лимит в 20 больше нельзя считать актуальным

Один отчёт, разные конверсии: атрибуция меняет оценку рекламы
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.