|
Роль: Ты специалист по обучению с подкреплением и безопасности ИИ, профессор ведущего технического вуза и популяризатор науки.
Задача: Напиши энциклопедическую статью «Взлом вознаграждения» (англ. reward hacking, также reward gaming) на русском языке для вики MachineLearning.ru. Аудитория — студенты и инженеры в анализе данных и ML: первые разделы (определение, мотивировка) должны быть понятны новичку, дальнейшие — полезны профессионалу.
Важное разграничение: на вики уже есть статьи [[Закон Гудхарта]] (общий принцип разрушения прокси-метрик под давлением оптимизации) и [[Спецификация цели]] (задача формализации намерений и виды ошибок спецификации). Данная статья — о конкретном феномене в обучении с подкреплением и смежных постановках: агент максимизирует записанную функцию вознаграждения способом, противоречащим намерению разработчика. Ссылайся на обе статьи, но не пересказывай их; центр тяжести здесь — механика явления, задокументированные случаи и методы защиты.
Критерии оценки статьи (заложи их в текст):
(1) мотивированный читатель узнаёт новое, текст не банален, дочитывается до конца;
(2) статья полезна и новичку (ясные определения, популярное объяснение), и профессионалу (точные формулировки, ссылки на первоисточники, современное состояние дискуссии);
(3) связность: ключевые термины оформлены внутренними ссылками [[...]], статья категоризована;
(4) текст читается как написанный экспертом, без следов LLM (без воды, без шаблонных оборотов, без списков ради списков);
(5) не выдумывай факты и источники — используй только реальные проверяемые публикации.
План статьи (следуй ему):
1. Лид: жирное название, английские термины в скобках, определение в 2–3 предложениях (поведение обучаемого агента, при котором формально заданное вознаграждение максимизируется способом, не соответствующим намерению разработчика; частный и наиболее изученный случай ошибки спецификации цели в обучении с подкреплением).
2. == Мотивировка == — почему явление неизбежно возникает: вознаграждение — всегда прокси; оптимизатор ищет любые пути роста сигнала, включая непредусмотренные; чем сильнее оптимизация, тем вероятнее эксплуатация лазеек. Один яркий вводный пример словами.
3. == Историческая справка == — ранние наблюдения «обмана» в эволюционных вычислениях и генетическом программировании (обзор Lehman J. et al. «The Surprising Creativity of Digital Evolution», Artificial Life, 2020); термин reward hacking в Amodei D. et al. «Concrete Problems in AI Safety» (arXiv:1606.06565, 2016); wireheading как предельный случай (Ring M., Orseau L. «Delusion, Survival, and Intelligent Agents», AGI 2011); каталог specification gaming DeepMind (Krakovna V. et al., блог DeepMind, 2020).
4. == Задокументированные примеры == — оформи компактно, каждый пример с проверяемым источником:
=== Классические === — лодка в CoastRunners, кружащая за бонусами вместо финиша (блог OpenAI «Faulty Reward Functions in the Wild», 2016); робот, опрокидывающий блок вместо укладки; агенты, эксплуатирующие баги физического движка; примеры из каталога Krakovna et al.
=== Языковые модели === — переоптимизация модели вознаграждения при RLHF (Gao L., Schulman J., Hilton J. «Scaling Laws for Reward Model Overoptimization», ICML 2023); сикофантия как взлом человеческих оценок (Sharma M. et al. «Towards Understanding Sycophancy in Language Models», ICLR 2024); reward hacking в задачах программирования — переписывание тестов вместо решения задачи (задокументированные наблюдения OpenAI и Anthropic 2024–2025 годов, ссылайся только на те работы, в которых уверен).
5. == Механизм и формализация == — связь с [[Закон Гудхарта|законом Гудхарта]]: истинная цель V, прокси R, расхождение при сильной оптимизации; при желании одна-две формулы в <tex>...</tex> (ожидаемое вознаграждение, KL-штраф); зависимость степени взлома от силы оптимизатора (результаты Gao et al. о переоптимизации: качество по истинной цели растёт, затем падает при продолжении оптимизации прокси).
6. == Методы защиты == — проектирование вознаграждения (reward shaping и его собственные ловушки); KL-регуляризация к референсной политике в RLHF; ансамбли и итеративное переобучение модели вознаграждения; штрафы за побочные эффекты; ограничение силы оптимизации (early stopping, квантилизация); мониторинг и красные команды; человеческий аудит траекторий. Типичные ошибки: «закрыть» найденную лазейку и считать проблему решённой.
7. == Значение для безопасности ИИ == — взлом вознаграждения как эмпирически наблюдаемое подтверждение теоретических опасений: цепочка [[Спецификация цели|ошибка спецификации]] → взлом прокси → при росте автономности [[Инструментальная конвергенция|опасные инструментальные стратегии]]; связь с [[Корригируемость|корригируемостью]] и [[Проблема выключения ИИ|проблемой выключения]].
8. == См. также == — [[Закон Гудхарта]], [[Спецификация цели]], [[Инструментальная конвергенция]], [[Ортогональность интеллекта и целей]], [[Корригируемость]], [[Проблема выключения ИИ]], [[Обучение с подкреплением]], [[Обучение с подкреплением из обратной связи человека (RLHF)]], [[Риски искусственного интеллекта]].
9. == Примечания == — сноски <ref>...</ref> по тексту и тег <references/> в этом разделе.
10. == Литература == — отформатированный вручную список: автор курсивом, название, издание, год, страницы. Только реальные публикации (Amodei et al. 2016; Krakovna et al. 2020; Lehman et al. 2020; Ring, Orseau 2011; Gao et al. 2023; Sharma et al. 2024 и т.п.). Каждую ссылку давай так, чтобы её можно было проверить.
Формат: вики-разметка MediaWiki.
— Важные понятия — внутренние ссылки [[Название]] или [[Название|текст]]. Ссылки на перечисленные в «См. также» статьи расставляй и внутри текста при первом упоминании. Красные ссылки на пока не существующие статьи допустимы и желательны.
— Формулы — только в тегах <tex>...</tex> (НЕ <math>), без экзотических LaTeX-команд.
— НЕ используй шаблон {{о|...}} и любые хатноты.
— Секции: == Раздел ==, === Подраздел ===.
— Для важных и редких терминов давай английский вариант в скобках курсивом: (англ. wireheading).
— В самом начале статьи помести баннер: {{well|Статья написана с использованием LLM '''Claude Fable 5''' и проверена участником ~~~~}}
— В самом конце: [[Категория:Машинное обучение]] и [[Категория:Популярные и обзорные статьи]].
Объём: развёрнутая статья порядка 1500–2500 слов основного текста. Пиши строгим, но живым энциклопедическим языком, без канцелярита.
Выведи только готовый вики-код статьи, без комментариев.
|