|
Роль: Ты специалист по машинному обучению, эконометрике и безопасности ИИ, профессор ведущего технического вуза и популяризатор науки.
Задача: Напиши энциклопедическую статью «Закон Гудхарта» (англ. Goodhart's law) на русском языке для вики MachineLearning.ru. Аудитория — студенты и инженеры в анализе данных и ML: первые разделы (определение, мотивировка) должны быть понятны новичку, дальнейшие — полезны профессионалу.
Критерии оценки статьи (заложи их в текст):
(1) мотивированный читатель узнаёт новое, текст не банален, дочитывается до конца;
(2) статья полезна и новичку (ясные определения, популярное объяснение), и профессионалу (точные формулировки, ссылки на первоисточники, современное состояние дискуссии);
(3) связность: ключевые термины оформлены внутренними ссылками [[...]], статья категоризована;
(4) текст читается как написанный экспертом, без следов LLM (без воды, без шаблонных оборотов, без списков ради списков);
(5) не выдумывай факты и источники — используй только реальные проверяемые публикации.
План статьи (следуй ему):
1. Лид: жирное название, английский термин в скобках, определение в 2–3 предложениях. Приведи каноническую популярную формулировку («когда мера становится целью, она перестаёт быть хорошей мерой») и сразу укажи, что она принадлежит не самому Гудхарту, а антропологу Мэрилин Стратерн (Strathern M. «'Improving ratings': audit in the British University system», European Review, 1997).
2. == Мотивировка == — житейские и инженерные примеры: план по «показателям» в управлении, оптимизация кликов, накрутка метрик; почему любая прокси-метрика ломается под давлением оптимизации; мост к машинному обучению: функция потерь и метрика качества — всегда прокси истинной цели.
3. == Историческая справка == — оригинальная формулировка Чарльза Гудхарта (Goodhart C.A.E., «Problems of Monetary Management: The U.K. Experience», 1975): «любая наблюдаемая статистическая закономерность имеет тенденцию разрушаться, как только на неё оказывается давление в целях управления»; контекст монетарной политики Великобритании; родственные идеи: критика Лукаса (Lucas critique, 1976), закон Кэмпбелла (Campbell's law, 1979) — объясни различия между ними.
4. == Таксономия форм закона Гудхарта == — по работе Manheim D., Garrabrant S. «Categorizing Variants of Goodhart's Law» (arXiv:1803.04585): регрессионный (regressional), экстремальный (extremal), причинный (causal), состязательный (adversarial) Гудхарт. Для каждого — короткое определение и пример из ML. Можно оформить компактной вики-таблицей. При желании — минимальная формализация в <tex>...</tex>: истинная цель V, прокси U, оптимизация U расходится с V в хвостах распределения.
5. == Закон Гудхарта в машинном обучении == —
=== Классическое обучение === — переобучение как Гудхарт по отношению к обучающей выборке; оптимизация метрики лидерборда; [[Контаминация бенчмарков больших языковых моделей|контаминация бенчмарков]]; связь с [[Скользящий контроль|скользящим контролем]] как защитой.
=== Обучение с подкреплением === — reward hacking и specification gaming: реальные задокументированные примеры (например, агент в гоночной игре CoastRunners, крутящийся за бонусами вместо финиша — из блога OpenAI «Faulty Reward Functions in the Wild», 2016; каталог примеров specification gaming DeepMind, Krakovna et al., 2020); связь со [[Спецификация цели|спецификацией цели]].
=== Языковые модели === — переоптимизация модели вознаграждения при RLHF (Gao L., Schulman J., Hilton J. «Scaling Laws for Reward Model Overoptimization», ICML 2023); сикофантия как побочный эффект оптимизации человеческих оценок.
6. == Значение для безопасности ИИ == — закон Гудхарта как элементарный механизм, лежащий в основе аргументов о рисках: [[Инструментальная конвергенция]], [[Ортогональность интеллекта и целей]], [[Корригируемость]]; почему «просто задать правильную метрику» не является решением.
7. == Практические рекомендации == — как смягчать эффект: несколько метрик вместо одной, отложенные и скрытые метрики, регуляризация давления оптимизации (early stopping, KL-штраф в RLHF), человеческий аудит, ротация бенчмарков. Типичные ошибки.
8. == См. также == — [[Спецификация цели]], [[Инструментальная конвергенция]], [[Ортогональность интеллекта и целей]], [[Корригируемость]], [[Проблема выключения ИИ]], [[Переобучение]], [[Скользящий контроль]], [[Обучение с подкреплением]], [[Контаминация бенчмарков больших языковых моделей]].
9. == Примечания == — сноски <ref>...</ref> по тексту и тег <references/> в этом разделе.
10. == Литература == — отформатированный вручную список: автор курсивом, название, издание, год, страницы. Только реальные публикации (Goodhart 1975; Strathern 1997; Campbell 1979; Lucas 1976; Manheim, Garrabrant 2018; Krakovna et al. 2020; Gao et al. 2023 и т.п.). Каждую ссылку давай так, чтобы её можно было проверить.
Формат: вики-разметка MediaWiki.
— Важные понятия — внутренние ссылки [[Название]] или [[Название|текст]]. Ссылки на перечисленные в «См. также» статьи расставляй и внутри текста при первом упоминании. Красные ссылки на пока не существующие статьи допустимы и желательны.
— Формулы — только в тегах <tex>...</tex> (НЕ <math>), без экзотических LaTeX-команд.
— НЕ используй шаблон {{о|...}} и любые хатноты.
— Секции: == Раздел ==, === Подраздел ===.
— Для важных и редких терминов давай английский вариант в скобках курсивом: (англ. reward hacking).
— В самом начале статьи помести баннер: {{well|Статья написана с использованием LLM '''Claude Fable 5''' и проверена участником ~~~~}}
— В самом конце: [[Категория:Машинное обучение]] и [[Категория:Популярные и обзорные статьи]].
Объём: развёрнутая статья порядка 1500–2500 слов основного текста. Пиши строгим, но живым энциклопедическим языком, без канцелярита.
Выведи только готовый вики-код статьи, без комментариев.
|