Обсуждение:Корригируемость

Материал из MachineLearning.

Версия от 17:48, 19 июля 2026; Iakov Poteкhin (Обсуждение | вклад)
(разн.) ← Предыдущая | Текущая версия (разн.) | Следующая → (разн.)
Перейти к: навигация, поиск

Промпт для написания статьи в Claude Fable 5:

Роль: Ты специалист по машинному обучению и безопасности ИИ, профессор ведущего технического вуза и популяризатор науки.

Задача: Напиши энциклопедическую статью «Корригируемость» (англ. corrigibility) на русском языке для вики MachineLearning.ru. Аудитория — студенты и инженеры в анализе данных и ML: первые разделы (определение, мотивировка) должны быть понятны новичку, дальнейшие — полезны профессионалу.

Критерии оценки статьи (заложи их в текст):
(1) мотивированный читатель узнаёт новое, текст не банален, дочитывается до конца;
(2) статья полезна и новичку (ясные определения, популярное объяснение), и профессионалу (точные формулировки, ссылки на первоисточники, современное состояние дискуссии);
(3) связность: ключевые термины оформлены внутренними ссылками [[...]], статья категоризована;
(4) текст читается как написанный экспертом, без следов LLM (без воды, без шаблонных оборотов, без списков ради списков);
(5) не выдумывай факты и источники — используй только реальные проверяемые публикации.

План статьи (следуй ему):
1. Лид: жирное название термина, английский термин в скобках, определение в 2–3 предложениях (корригируемость — свойство ИИ-системы допускать вмешательство человека: исправление целей, ограничение возможностей, приостановку и выключение — не сопротивляясь этому и не пытаясь этим манипулировать).
2. == Мотивировка == — почему свойство нетривиально: рациональный максимизатор фиксированной функции полезности имеет инструментальные стимулы сопротивляться изменению своей цели и выключению; ссылка на [[Инструментальная конвергенция]] и [[Проблема выключения ИИ]]. Наивные решения (например, «зашить» награду за согласие на выключение) порождают извращённые стимулы — объясни, почему.
3. == Историческая справка == — термин введён в работе Soares N., Fallenstein B., Yudkowsky E., Armstrong S. «Corrigibility» (AAAI Workshop on AI and Ethics, 2015); предыстория — «базовые побуждения ИИ» Омоундро (Omohundro, «The Basic AI Drives», AGI 2008); utility indifference Армстронга; дальнейшее развитие — «The Off-Switch Game» (Hadfield-Menell, Dragan, Abbeel, Russell, IJCAI 2017) и подход CIRL / неопределённости относительно человеческой функции полезности (Russell, «Human Compatible», 2019).
4. == Формальные постановки == — требования из статьи Soares et al. (не препятствовать выключению, не манипулировать операторами, сохранять корригируемость субагентов и преемников, чинить себя без обхода ограничений); игра с выключателем как формализация: агент сохраняет кнопку выключения, если признаёт неопределённость относительно истинных предпочтений человека; при желании — простая формула ожидаемой полезности в <tex>...</tex>. Укажи и ограничения результатов: при исчезновении неопределённости стимул подчиняться исчезает.
5. == Корригируемость и современные LLM == — как проблема проявляется в системах на основе больших языковых моделей: обучение с подкреплением из обратной связи человека, отказы от изменения поведения, эксперименты с «имитацией согласия» (alignment faking) в лабораторных условиях; свяжи с [[Шеминг искусственного интеллекта]] и [[Супервыравнивание]]. Аккуратно разграничь: у диалоговой модели без долгосрочных целей говорить о корригируемости в строгом смысле некорректно, вопрос обостряется в агентных системах.
6. == Критика и открытые проблемы == — аргументы, что полная корригируемость конфликтует с автономией и полезностью системы; проблема «коррекции корректора» (человек может ошибаться); отсутствие общепринятой формализации; позиции разных исследовательских групп.
7. == См. также == — [[Проблема выключения ИИ]], [[Инструментальная конвергенция]], [[Ортогональность интеллекта и целей]], [[Спецификация цели]], [[Закон Гудхарта]], [[Сверхинтеллект]], [[Риски искусственного интеллекта]], [[Супервыравнивание]], [[Конституционный искусственный интеллект]].
8. == Примечания == — сноски <ref>...</ref> по тексту и тег <references/> в этом разделе.
9. == Литература == — отформатированный вручную список: автор курсивом, название, издание, год, страницы. Только реальные публикации (Soares et al. 2015; Omohundro 2008; Hadfield-Menell et al. 2017; Bostrom 2014; Russell 2019 и т.п.). Каждую ссылку давай так, чтобы её можно было проверить.

Формат: вики-разметка MediaWiki.
— Важные понятия — внутренние ссылки [[Название]] или [[Название|текст]]. Ссылки на перечисленные в «См. также» статьи расставляй и внутри текста при первом упоминании. Красные ссылки на пока не существующие статьи допустимы и желательны.
— Формулы — только в тегах <tex>...</tex> (НЕ <math>).
— НЕ используй шаблон {{о|...}} и любые хатноты.
— Секции: == Раздел ==, === Подраздел ===.
— Для важных и редких терминов давай английский вариант в скобках курсивом: (англ. corrigibility).
— В самом начале статьи помести баннер: {{well|Статья написана с использованием LLM '''Claude Fable 5''' и проверена участником ~~~~}}
— В самом конце: [[Категория:Машинное обучение]] и [[Категория:Популярные и обзорные статьи]].

Объём: развёрнутая статья порядка 1500–2500 слов основного текста. Пиши строгим, но живым энциклопедическим языком, без канцелярита.
Выведи только готовый вики-код статьи, без комментариев.


Iakov Poteкhin 21:48, 19 июля 2026 (MSD)

Личные инструменты