Смещение данных

Материал из MachineLearning.

Версия от 10:53, 25 июля 2026; Vladimir Beliaev (Обсуждение | вклад)
(разн.) ← Предыдущая | Текущая версия (разн.) | Следующая → (разн.)
Перейти к: навигация, поиск
Статья написана с использованием LLM Claude Opus 5 и проверена участником Vladimir Beliaev 14:53, 25 июля 2026 (MSD)


Содержание

Смещение данных (англ. bias) — систематическая, а не случайная составляющая расхождения между тем, что выдаёт алгоритм машинного обучения, и тем, что считается правильным ответом. В англоязычной литературе слово bias употребляется по меньшей мере в десятке технически различных смыслов: от строгого статистического определения смещения оценки до неформального обозначения социальной предвзятости модели. Эти смыслы регулярно смешиваются, в том числе в русских переводах, что порождает содержательные ошибки — например, попытки «убрать смещение» из модели там, где смещение по построению неустранимо.

Настоящая статья систематизирует эти смыслы. Её основной тезис: все они устроены одинаково — фиксируется некоторый эталон, и смещением называется устойчивое отклонение от него; различаются же они только тем, что именно взято за эталон. Из этого следует практический вывод: смещение не является дефектом само по себе. Часть смещений вредна и подлежит устранению, часть — неустранима, а часть необходима: без индуктивного смещения обучение вообще невозможно. Более того, борьба со смещением почти всегда оказывается не его устранением, а переносом в другое место — это видно и в разложении ошибки, и в теоремах о несовместимости критериев справедливости.

Единая структура понятия

Английский термин Русский эквивалент Эталон, от которого измеряется отклонение
bias of an estimator смещение оценки истинное значение оцениваемого параметра
bias в разложении bias–variance смещение (аппроксимационная ошибка) истинная зависимость, порождающая данные
inductive bias индуктивное смещение множество всех логически допустимых гипотез
bias term свободный член, порог нулевой сдвиг разделяющей поверхности
sampling / selection bias смещение выборки, смещение отбора генеральная совокупность
dataset shift, covariate shift сдвиг данных, сдвиг признаков распределение на этапе обучения
label / annotator bias смещение разметки истинная целевая переменная
selection bias in model selection смещение при отборе моделей честная оценка обобщающей способности
exposure bias смещение экспозиции условия, в которых модель применяется
algorithmic / societal bias алгоритмическая предвзятость принятая норма справедливости
automation bias смещение доверия к автоматике независимое суждение человека

Первые четыре строки описывают смещения, которые вносит исследователь, выбирая модель и метод. Следующие четыре — смещения, которые приходят из данных и процедуры эксперимента. Последние три возникают за пределами модели — в обществе и в контуре принятия решений. Далее эти три группы рассматриваются по отдельности.

Смещения, вносимые выбором модели

Смещение оценки

Классическое определение из математической статистики. Пусть T(X) — оценка параметра θ, построенная по выборке X. Смещением оценки называется величина

bias(T) = E[T(X)] − θ.

Оценка называется несмещённой, если bias(T) = 0 при любом θ. Это единственный смысл слова bias, имеющий полностью формальное определение; все остальные в той или иной мере метафоричны.

Важно, что несмещённость не является безусловным достоинством. Классический пример — гребневая регрессия (ridge regression): она даёт смещённую оценку коэффициентов, но при мультиколлинеарности её среднеквадратичная ошибка меньше, чем у несмещённой оценки наименьших квадратов. Небольшое смещение здесь покупается ценой существенного снижения дисперсии — тот же обмен, который в общем виде описывает следующий раздел.

Разложение ошибки на смещение и разброс

Для квадратичной функции потерь ожидаемая ошибка алгоритма aD, обученного на случайной выборке D, в точке x раскладывается на три слагаемых:

ED[(yaD(x))2] = σ2 + (ED[aD(x)] − f(x))2 + ED[(aD(x) − ED[aD(x)])2],

где f — истинная зависимость, σ2 — неустранимый шум. Второе слагаемое — квадрат смещения: насколько в среднем по всем возможным обучающим выборкам модель промахивается мимо истины. Третье — разброс (variance): насколько сильно ответ модели зависит от того, какая именно выборка ей досталась.[1]

Смещение здесь измеряет недостаточную гибкость семейства моделей: линейная модель не приблизит нелинейную зависимость, сколько бы данных ей ни дали. Уменьшение смещения за счёт усложнения модели увеличивает разброс — это и есть дилемма смещения и разброса, лежащая в основе регуляризации и практики борьбы с переобучением.

Разложение справедливо для квадратичной потери; для других функций потерь аналоги существуют, но устроены сложнее, и переносить интуицию буквально нельзя.

Индуктивное смещение

Обучение по прецедентам — это индукция: по конечной выборке требуется восстановить зависимость на всей области определения. Задача поставлена некорректно, так как через любое конечное множество точек проходит бесконечно много функций. Индуктивное смещение — это совокупность априорных предположений, которые алгоритм добавляет к данным, чтобы выбрать одну гипотезу из этого бесконечного множества.[1]

Примеры: линейная модель предполагает аддитивность вкладов признаков; свёрточная сеть — трансляционную инвариантность и локальность; метод ближайших соседей — гипотезу компактности; дерево решений — предпочтение коротких описаний.

Ключевое следствие: алгоритм без индуктивного смещения не способен обобщать. Теоремы Вольперта о «бесплатных обедах» показывают, что усреднённое по всем возможным задачам качество любых двух алгоритмов совпадает.[1] Иначе говоря, алгоритм работает не вопреки своему смещению, а благодаря ему — при условии, что смещение согласовано с устройством конкретной предметной области. Это тот случай, когда требование «убрать смещение» лишено смысла.

Свободный член

Отдельный источник путаницы: в записи линейной модели a(x) = ⟨w, x⟩ + b и в нейронах сети параметр b по-английски называется bias. Здесь это чисто техническое название сдвига, не имеющее отношения ни к статистическому смещению, ни к предвзятости. По-русски его следует называть свободным членом, сдвигом или порогом; перевод «смещение» в этом контексте допустим, но требует оговорки, а перевод «предвзятость» — грубая ошибка.

Смещения, приходящие из данных и процедуры

Смещение выборки и смещение отбора

Возникает, когда обучающая выборка систематически непредставительна для генеральной совокупности. Разновидности:

  • смещение отбора (selection bias) — попадание объекта в выборку зависит от его свойств. Формально описано в эконометрике; предложенная Хекманом двухшаговая коррекция остаётся базовой техникой[1];
  • смещение выживших (survivorship bias) — частный случай: в выборку попадают только «дожившие» объекты. Модель оценки кредитного риска, обученная только на выданных кредитах, не видит отказников;
  • смещение датасета (dataset bias) — систематические артефакты конкретного набора данных. Показано, что классификатор способен с высокой точностью определить, из какого популярного набора взято изображение, — то есть наборы несут «отпечаток» способа их сборки.[1]

Сдвиг данных

Родственное, но отличное явление: обучающее и рабочее распределения различаются. Различают сдвиг признаков (covariate shift, меняется p(x) при неизменном p(y|x)), сдвиг меток (prior probability shift) и концептуальный дрейф (меняется сама зависимость).[1] В отличие от смещения выборки, сдвиг данных может возникнуть уже после развёртывания модели и требует не исправления выборки, а мониторинга.

Смещение разметки

Целевая переменная почти никогда не наблюдается напрямую — вместо неё используется прокси: не «совершил преступление», а «был арестован»; не «квалифицированный кандидат», а «был нанят и проработал год». Систематическое расхождение прокси с истинной величиной переносится в модель целиком и не обнаруживается никаким контролем качества, поскольку контроль использует тот же прокси. Сюда же относится смещение разметчиков — устойчивые различия в трактовке инструкции разными людьми.

Смещение при отборе моделей

Если по одной и той же контрольной выборке подобраны гиперпараметры и затем измерено качество, полученная оценка смещена вверх. Причина — многократное сравнение: выбирается максимум по многим зашумлённым оценкам, а максимум зашумлённых величин смещён. Эффект может быть сопоставим по величине с реальной разницей между алгоритмами; стандартное средство — вложенный скользящий контроль.[1]

Смещение экспозиции

Характерно для авторегрессионных моделей. При обучении модель на каждом шаге видит истинный префикс последовательности, а при генерации — свой собственный, уже содержащий ошибки. Условия обучения и применения расходятся, ошибки накапливаются.[1] В обучении с подкреплением аналогичную природу имеет смещение бутстрэпа во временных разностях: оценка строится по другой оценке, а не по фактическому вознаграждению.

Смещение обратной связи

Развёрнутая модель влияет на данные, на которых будет обучаться её следующая версия. Рекомендательная система показывает объекты, которые считает релевантными, получает клики только по ним и укрепляется в исходном мнении; сюда же относятся позиционное смещение и смещение популярности. Такие контуры обратной связи описаны как один из основных источников скрытого технического долга в системах машинного обучения.[1]

Смещения за пределами модели

Алгоритмическая предвзятость

Наиболее обсуждаемый публично смысл: модель систематически хуже работает для одних групп людей, чем для других, либо воспроизводит существующую дискриминацию. Технически это следствие уже перечисленных причин — непредставительной выборки, смещённого прокси, контура обратной связи, — но оценивается по иному критерию: не по точности, а по принятой норме справедливости. Обзор источников и мер предвзятости приведён в работе Мехраби и соавторов[1]; систематическая разница в точности распознавания лиц по группам продемонстрирована в исследовании Буламвини и Гебру[1].

Здесь тезис статьи о «переносе смещения» проявляется наиболее резко. Формально доказано, что три естественных критерия справедливости — калибровка по группам и равенство долей ложноположительных и ложноотрицательных ответов — несовместимы одновременно, за исключением вырожденных случаев.[1][1] Следовательно, «беспристрастной» модели не существует: выбор метода коррекции — это выбор того, какое именно смещение считать приемлемым. Практические процедуры выравнивания предложены, в частности, в работе Хардта и соавторов.[1]

Смещение доверия к автоматике

Смещение может находиться не в модели, а в человеке, который её использует: оператор склонен принимать подсказку системы, не проверяя её, и не замечать ошибок там, где система молчит. Для оценки реального качества связки «человек + модель» точности одной модели недостаточно. Это одна из причин, по которой требования к объяснимости формулируются в документах по управлению рисками ИИ.

Что из этого следует на практике

  • Прежде чем «бороться со смещением», следует назвать эталон. Без этого требование бессодержательно: индуктивное смещение убирать нельзя, свободный член — бессмысленно, смещение при отборе моделей — необходимо.
  • Смещения выборки и разметки не диагностируются по контрольной выборке, если она набрана той же процедурой. Нужен внешний источник: независимый набор данных, аудит по подгруппам, анализ процедуры сбора.
  • Смещение при отборе моделей устраняется процедурно — вложенным скользящим контролем и фиксацией отложенной выборки до начала экспериментов.
  • Сдвиг данных и контуры обратной связи требуют не однократного исправления, а постоянного мониторинга распределений и качества после развёртывания.
  • Устранение одного смещения обычно увеличивает другое. Разумная цель — не нулевое смещение, а явно сформулированный и обоснованный выбор компромисса.

Терминология на русском языке

Единого перевода термина bias не сложилось. В статистической литературе устойчиво используется «смещение», в контексте линейных моделей и нейронных сетей — «свободный член» или «сдвиг», в контексте справедливости алгоритмов — «предвзятость» или «необъективность». Перевод «смещение данных» точен только для группы явлений, связанных с формированием выборки. При переводе англоязычных текстов рекомендуется каждый раз восстанавливать, какой именно из смыслов имеется в виду, и не переносить термин механически.

См. также

Литература

  • Hastie T., Tibshirani R., Friedman J. The Elements of Statistical Learning: Data Mining, Inference, and Prediction. — 2-е изд.. — New York: Springer, 2009. — ISBN 978-0-387-84857-0
  • Quiñonero-Candela J., Sugiyama M., Schwaighofer A., Lawrence N. D. (eds.) Dataset Shift in Machine Learning. — Cambridge, MA: MIT Press, 2009. — ISBN 978-0-262-17005-5
  • Barocas S., Hardt M., Narayanan A. Fairness and Machine Learning: Limitations and Opportunities. — MIT Press, 2023. — ISBN 978-0-262-04861-3

Примечания

Личные инструменты