Обсуждение:Спецификация цели

Материал из MachineLearning.

Версия от 17:49, 19 июля 2026; Iakov Poteкhin (Обсуждение | вклад)
(разн.) ← Предыдущая | Текущая версия (разн.) | Следующая → (разн.)
Перейти к: навигация, поиск

Промпт для написания статьи в Claude Fable 5:

Роль: Ты специалист по машинному обучению и безопасности ИИ, профессор ведущего технического вуза и популяризатор науки.

Задача: Напиши энциклопедическую статью «Спецификация цели» (англ. objective specification; проблема ошибочной спецификации — objective misspecification) на русском языке для вики MachineLearning.ru. Аудитория — студенты и инженеры в анализе данных и ML: первые разделы (определение, мотивировка) должны быть понятны новичку, дальнейшие — полезны профессионалу.

Важное разграничение: на вики уже есть статья [[Закон Гудхарта]] — о том, почему прокси-метрика разрушается под давлением оптимизации. Данная статья — о самой задаче формализации намерений разработчика в виде целевой функции, о видах ошибок спецификации и методах их предотвращения. На закон Гудхарта ссылайся, но не пересказывай его.

Критерии оценки статьи (заложи их в текст):
(1) мотивированный читатель узнаёт новое, текст не банален, дочитывается до конца;
(2) статья полезна и новичку (ясные определения, популярное объяснение), и профессионалу (точные формулировки, ссылки на первоисточники, современное состояние дискуссии);
(3) связность: ключевые термины оформлены внутренними ссылками [[...]], статья категоризована;
(4) текст читается как написанный экспертом, без следов LLM (без воды, без шаблонных оборотов, без списков ради списков);
(5) не выдумывай факты и источники — используй только реальные проверяемые публикации.

План статьи (следуй ему):
1. Лид: жирное название, английский термин в скобках, определение в 2–3 предложениях (задача перевода неформальных намерений человека в формальную цель — функцию потерь, функцию вознаграждения, метрику, — которую оптимизирует система; расхождение между намерением и формализацией называется ошибкой спецификации).
2. == Мотивировка == — любая обучаемая система оптимизирует не «то, что мы хотим», а то, что записано; классическая метафора царя Мидаса; почему полная спецификация человеческих намерений на практике недостижима (неявные предпочтения, здравый смысл, контекст).
3. == Историческая справка == — задание функционала качества как классическая часть постановки задач обучения; осознание спецификации как проблемы безопасности: Amodei D. et al. «Concrete Problems in AI Safety» (arXiv:1606.06565, 2016) — avoiding negative side effects, reward hacking; систематизация DeepMind: Ortega P., Maini V. et al., блог «Building safe artificial intelligence: specification, robustness, and assurance» (2018) — иерархия ideal / design / revealed specification; каталог specification gaming (Krakovna V. et al., 2020).
4. == Виды ошибок и уровни спецификации == —
   === Ideal, design и revealed specification === — идеальная (намерения), проектная (что записали), выявленная (что система фактически оптимизирует); ошибки возникают на обоих переходах.
   === Внешнее и внутреннее выравнивание === — outer alignment (совпадение записанной цели с намерением) и inner alignment (совпадение выученной внутренней цели с записанной); меза-оптимизация по Hubinger E. et al. «Risks from Learned Optimization in Advanced Machine Learning Systems» (arXiv:1906.01820, 2019). Объясни различие на доступном уровне.
   === Типичные проявления === — specification gaming, побочные эффекты, взлом вознаграждения (со ссылкой на [[Закон Гудхарта]]), сдвиг распределения между обучением и применением.
5. == Подходы к решению == —
   === Обучение цели по человеку === — обратное обучение с подкреплением (Ng A., Russell S. «Algorithms for Inverse Reinforcement Learning», ICML 2000); кооперативное IRL (Hadfield-Menell D. et al. «Cooperative Inverse Reinforcement Learning», NeurIPS 2016); обучение по предпочтениям (Christiano P. et al. «Deep Reinforcement Learning from Human Preferences», NeurIPS 2017); моделирование вознаграждения (Leike J. et al. «Scalable agent alignment via reward modeling», arXiv:1811.07871, 2018).
   === Ограничение оптимизации === — штрафы за побочные эффекты, квантилизация, KL-регуляризация, консервативные политики.
   === Неопределённость относительно цели === — системы, сохраняющие неопределённость о человеческих предпочтениях (Russell S. «Human Compatible», 2019); связь с [[Корригируемость|корригируемостью]].
6. == Значение для безопасности ИИ == — ошибка спецификации как исходная точка большинства сценариев риска: цепочка «неверная цель → [[Закон Гудхарта|разрушение прокси]] → [[Инструментальная конвергенция|опасные инструментальные стратегии]]»; связь с [[Ортогональность интеллекта и целей|тезисом ортогональности]] (система не «догадается» о правильной цели сама) и [[Проблема выключения ИИ|проблемой выключения]].
7. == Практические рекомендации == — для инженера: тестировать цель на «взламываемость» до масштабирования; красная команда для функции вознаграждения; мониторинг выявленной спецификации в проде; несколько независимых метрик; человеческий аудит краевых случаев. Типичные ошибки.
8. == См. также == — [[Закон Гудхарта]], [[Инструментальная конвергенция]], [[Ортогональность интеллекта и целей]], [[Корригируемость]], [[Проблема выключения ИИ]], [[Обучение с подкреплением]], [[Минимизация эмпирического риска]], [[Риски искусственного интеллекта]], [[Супервыравнивание]].
9. == Примечания == — сноски <ref>...</ref> по тексту и тег <references/> в этом разделе.
10. == Литература == — отформатированный вручную список: автор курсивом, название, издание, год, страницы. Только реальные публикации (Amodei et al. 2016; Krakovna et al. 2020; Hubinger et al. 2019; Ng, Russell 2000; Hadfield-Menell et al. 2016; Christiano et al. 2017; Leike et al. 2018; Russell 2019 и т.п.). Каждую ссылку давай так, чтобы её можно было проверить.

Формат: вики-разметка MediaWiki.
— Важные понятия — внутренние ссылки [[Название]] или [[Название|текст]]. Ссылки на перечисленные в «См. также» статьи расставляй и внутри текста при первом упоминании. Красные ссылки на пока не существующие статьи допустимы и желательны.
— Формулы, если понадобятся, — только в тегах <tex>...</tex> (НЕ <math>), без экзотических LaTeX-команд.
— НЕ используй шаблон {{о|...}} и любые хатноты.
— Секции: == Раздел ==, === Подраздел ===.
— Для важных и редких терминов давай английский вариант в скобках курсивом: (англ. specification gaming).
— В самом начале статьи помести баннер: {{well|Статья написана с использованием LLM '''Claude Fable 5''' и проверена участником ~~~~}}
— В самом конце: [[Категория:Машинное обучение]] и [[Категория:Популярные и обзорные статьи]].

Объём: развёрнутая статья порядка 1500–2500 слов основного текста. Пиши строгим, но живым энциклопедическим языком, без канцелярита.
Выведи только готовый вики-код статьи, без комментариев.


Iakov Poteкhin 21:49, 19 июля 2026 (MSD)

Личные инструменты