Обсуждение:Проблема выключения ИИ

Материал из MachineLearning.

Версия от 17:49, 19 июля 2026; Iakov Poteкhin (Обсуждение | вклад)
(разн.) ← Предыдущая | Текущая версия (разн.) | Следующая → (разн.)
Перейти к: навигация, поиск

Промпт для написания статьи в Claude Fable 5:

Роль: Ты специалист по машинному обучению и безопасности ИИ, профессор ведущего технического вуза и популяризатор науки.

Задача: Напиши энциклопедическую статью «Проблема выключения ИИ» (англ. shutdown problem, также off-switch problem) на русском языке для вики MachineLearning.ru. Аудитория — студенты и инженеры в анализе данных и ML: первые разделы (определение, мотивировка) должны быть понятны новичку, дальнейшие — полезны профессионалу.

Важное разграничение: на вики уже есть отдельная статья [[Корригируемость]] — о желательном свойстве системы в целом. Данная статья — о конкретной технической задаче: как спроектировать агента, который не имеет стимулов ни препятствовать своему выключению, ни добиваться его. Не пересказывай содержание статьи о корригируемости, а ссылайся на неё.

Критерии оценки статьи (заложи их в текст):
(1) мотивированный читатель узнаёт новое, текст не банален, дочитывается до конца;
(2) статья полезна и новичку (ясные определения, популярное объяснение), и профессионалу (точные формулировки, ссылки на первоисточники, современное состояние дискуссии);
(3) связность: ключевые термины оформлены внутренними ссылками [[...]], статья категоризована;
(4) текст читается как написанный экспертом, без следов LLM (без воды, без шаблонных оборотов, без списков ради списков);
(5) не выдумывай факты и источники — используй только реальные проверяемые публикации.

План статьи (следуй ему):
1. Лид: жирное название, английские термины в скобках, определение в 2–3 предложениях (задача проектирования целенаправленного агента, для которого нажатие человеком кнопки выключения не является ни препятствием, которое выгодно устранить, ни исходом, которого выгодно добиваться).
2. == Мотивировка == — наивная интуиция «просто выключим» и почему она не работает для сильного оптимизатора: выключение означает потерю будущей награды, значит рациональный максимизатор имеет инструментальный стимул его избегать ([[Инструментальная конвергенция]], самосохранение по Омоундро). Симметричная ловушка: если сделать выключение выгодным, агент стремится быть выключенным. Поясни на простом численном примере с ожидаемой полезностью.
3. == Историческая справка == — Омоундро о самосохранении (2008); Бостром о проблеме контроля (2014); «безопасно прерываемые агенты» (Orseau L., Armstrong S. «Safely Interruptible Agents», UAI 2016) — постановка для обучения с подкреплением, чтобы прерывания не искажали выучиваемую политику; «The Off-Switch Game» (Hadfield-Menell D., Dragan A., Abbeel P., Russell S., IJCAI 2017); utility indifference Армстронга; дальнейшие работы о «shutdown problem» (например, Thornley E. «The Shutdown Problem: An AI Engineering Puzzle for Decision Theorists», Philosophical Studies, 2024).
4. == Формальные постановки == —
   === Игра с выключателем === — модель Хэдфилд-Менелла и соавторов: кооперативная игра человека и робота, неопределённость робота относительно истинной человеческой полезности; главный результат: стимул сохранять кнопку растёт с неопределённостью и исчезает при полной уверенности. Одну-две ключевые формулы дай в <tex>...</tex>.
   === Безопасная прерываемость === — идея Orseau & Armstrong для Q-обучения и родственных алгоритмов: как устроить прерывания, чтобы оптимальная политика не «выучивала» их избегать; какие алгоритмы прерываемы, какие нет.
   === Подход через теорию решений === — трудности: несклонность к манипуляции кнопкой конфликтует с полнотой предпочтений; кратко о предложениях последних лет.
5. == Связь с современными системами == — как проблема выглядит для агентов на основе больших языковых моделей: лабораторные наблюдения сопротивления выключению в ролевых постановках, оговорка о различии между текстовой имитацией и подлинной целенаправленностью; когда проблема практически значима (автономность, инструменты, долгие задачи), а когда — нет.
6. == Критика и открытые вопросы == — аргументы скептиков (реальные системы — не идеальные максимизаторы; проблема может решаться инженерно на уровне инфраструктуры); контраргументы; отсутствие решения, признанного общим.
7. == См. также == — [[Корригируемость]], [[Инструментальная конвергенция]], [[Ортогональность интеллекта и целей]], [[Спецификация цели]], [[Закон Гудхарта]], [[Сверхинтеллект]], [[Риски искусственного интеллекта]], [[Обучение с подкреплением]].
8. == Примечания == — сноски <ref>...</ref> по тексту и тег <references/> в этом разделе.
9. == Литература == — отформатированный вручную список: автор курсивом, название, издание, год, страницы. Только реальные публикации (Omohundro 2008; Bostrom 2014; Orseau, Armstrong 2016; Hadfield-Menell et al. 2017; Soares et al. 2015; Russell 2019; Thornley 2024 и т.п.). Каждую ссылку давай так, чтобы её можно было проверить.

Формат: вики-разметка MediaWiki.
— Важные понятия — внутренние ссылки [[Название]] или [[Название|текст]]. Ссылки на перечисленные в «См. также» статьи расставляй и внутри текста при первом упоминании. Красные ссылки на пока не существующие статьи допустимы и желательны.
— Формулы — только в тегах <tex>...</tex> (НЕ <math>).
— НЕ используй шаблон {{о|...}} и любые хатноты.
— Секции: == Раздел ==, === Подраздел ===.
— Для важных и редких терминов давай английский вариант в скобках курсивом: (англ. shutdown problem).
— В самом начале статьи помести баннер: {{well|Статья написана с использованием LLM '''Claude Fable 5''' и проверена участником ~~~~}}
— В самом конце: [[Категория:Машинное обучение]] и [[Категория:Популярные и обзорные статьи]].

Объём: развёрнутая статья порядка 1500–2500 слов основного текста. Пиши строгим, но живым энциклопедическим языком, без канцелярита.
Выведи только готовый вики-код статьи, без комментариев.


Iakov Poteкhin 21:49, 19 июля 2026 (MSD)