|
|
| Строка 1: |
Строка 1: |
| - | == Как проверялась неопределённость == | + | == О подготовке статьи == |
| | | | |
| - | При подготовке этой статьи центральным был не перечень методов, а вопрос: какое именно распределение аппроксимируется и что измеряет полученное число. Поэтому черновик проверялся по цепочке «априор — апостериор — предиктивное распределение — приближённый алгоритм — эмпирическая проверка». Такой порядок помог не смешать вероятность класса, разброс весов, шум наблюдений и способность обнаруживать сдвиг данных.
| + | Статья «Механистическая интерпретируемость» была подготовлена с помощью '''GPT-5.6 Terra High'''. Мне было важно отличить это направление от обычных постфактум-объяснений модели: здесь речь идёт не о красивой визуализации, а о проверке конкретных внутренних механизмов нейросети через вмешательства. |
| | | | |
| - | Статья подготовлена с помощью '''GPT-5.6 Terra High'''. Оба использованных запроса приводятся ниже дословно.
| + | Первый запрос был таким: |
| | | | |
| - | === Первый запрос: вывести вероятностную постановку ===
| + | {{well| |
| | + | Ты разбираешься в интерпретируемости нейронных сетей, трансформерах и безопасности ИИ. Напиши подробную энциклопедическую статью для MachineLearning.ru про механистическую интерпретируемость (mechanistic interpretability). |
| | | | |
| - | {{well|Помоги написать русскоязычную энциклопедическую статью для MachineLearning.ru под названием «Байесовская нейронная сеть» (Bayesian neural network). Целевая аудитория — студент, знающий основы нейронных сетей и вероятностей.
| + | Объясни, чем она отличается от обычного explainable AI. Расскажи про нейроны, признаки, цепочки вычислений, головы внимания и внутренние представления модели. Особое внимание удели тому, почему корреляции активаций недостаточно и зачем нужны абляции, activation patching и другие причинные вмешательства. |
| | | | |
| - | Начни с интуитивного различия между обычной сетью с фиксированными весами и байесовской сетью, в которой веса имеют распределение. Затем последовательно выведи формулу апостериорного распределения p(w|D) и предиктивного распределения для нового объекта. Объясни, почему точный интеграл для глубокой сети почти всегда недоступен.
| + | Раскрой суперпозицию, полисемантичность, моносемантичность, разреженные автоэнкодеры и словарное обучение. Упомяни реальные работы Toy Models of Superposition, Towards Monosemanticity и Scaling Monosemanticity. |
| | | | |
| - | Отдельно и аккуратно раскрой aleatoric и epistemic uncertainty, не обещая, что байесовская сеть автоматически умеет распознавать любой неизвестный объект. Нужны разделы про вариационный вывод, ELBO, Bayes by Backprop, репараметризацию, MC dropout, MCMC и отличие байесовской сети от ансамбля обычных моделей. Добавь применения, ограничения и короткий философский раздел.
| + | Статья должна быть понятна студенту, но технически точна. Добавь формулы, внутренние ссылки, реальные академические источники, ограничения метода и связь с безопасностью ИИ. Не выдумывай факты, авторов, результаты и DOI. |
| | | | |
| - | Используй вики-разметку MachineLearning.ru. Все формулы записывай только через <tex>...</tex>, а вынесенные формулы начинай с ::. Добавь внутренние ссылки, категорию «Искусственный интеллект» и только реальные проверяемые источники. Не придумывай DOI, результаты экспериментов и вики-шаблоны.}}
| + | Формулы оформляй через <tex>...</tex>, а отдельные формулы выделяй двойным отступом через два двоеточия. |
| | + | }} |
| | | | |
| - | Первая версия правильно вводила апостериорное и предиктивное распределения, но практические меры неопределённости были описаны слишком общо. В частности, выборочная дисперсия проходов MC dropout была названа предиктивной дисперсией без добавления шума наблюдений, а различие между aleatoric и epistemic uncertainty не было связано с конкретным правдоподобием.
| + | После первого черновика я решил подробнее раскрыть два момента: что именно считается свидетельством механизма и почему отдельный нейрон не обязательно соответствует одному человеческому понятию. |
| | | | |
| - | === Второй запрос: ограничить утверждения аппроксимациями ===
| + | Второй запрос был таким: |
| | | | |
| - | {{well|Отредактируй и расширь статью «Байесовская нейронная сеть». Сохрани её понятной, но проверь математическую точность. Формально запиши p(w|D), предиктивное распределение p(y*|x*,D), ELBO и репараметризацию w=mu+sigma epsilon. Поясни смысл каждого выражения словами. | + | {{well| |
| | + | Доработай статью «Механистическая интерпретируемость» как научный редактор. |
| | | | |
| - | В разделах о вариационном выводе и MC dropout явно укажи, что это приближения, а не точный байесовский вывод. Добавь, что среднеполевое вариационное приближение не отражает корреляции между весами и поэтому может недооценивать неопределённость. В разделе об ансамблях объясни различие без утверждения, что один подход всегда лучше другого.
| + | Чётко раздели статистическое наблюдение внутренней активации и причинную проверку механизма. Добавь раздел об абляции и activation patching с простой формальной записью эффекта вмешательства. |
| | | | |
| - | Проверь, что нет сырых тегов <math> и что используются только <tex>...</tex>. Вынесенные формулы должны начинаться с ::. Оставь в литературе только реальные источники: MacKay (1992), Graves (2011), Blundell и соавторы (2015), Gal и Ghahramani (2016). Верни готовую статью целиком в вики-разметке.}}
| + | Расширь раздел о суперпозиции: объясни, почему сеть может представлять больше признаков, чем число доступных координат, и как это связано с полисемантичностью нейронов. Затем подробно опиши sparse autoencoders, словарное обучение и идею моносемантичных признаков. |
| | | | |
| - | === Что было исправлено после генерации ===
| + | Не создавай впечатление, что найденный признак автоматически является полным объяснением поведения модели. Добавь ограничения: субъективность интерпретации, неполнота покрытия, масштаб числа цепочек, перенос результатов с маленьких моделей и риск артефактов автоэнкодера. |
| | | | |
| - | Финальная версия была заново сверена по формулам и первичным публикациям. При ручной редактуре сделано следующее:
| + | Проверь, что нет пустых фраз, рекламных утверждений, выдуманных источников и несуществующих шаблонов. Все формулы должны использовать <tex>...</tex>, а не <math>...</math>. Верни готовую статью целиком в вики-разметке. |
| | + | }} |
| | | | |
| - | * исправлена грамматическая ошибка «в научных вычисления»;
| + | После второй версии были проверены разметка формул, внутренние ссылки, библиография и аккуратность формулировок о возможностях и ограничениях метода. |
| - | * определение BNN уточнено: байесовским может быть не обязательно каждый параметр сети;
| + | |
| - | * добавлено явное правдоподобие и показано, что распределение весов не задаёт алеаторическую неопределённость без вероятностной модели наблюдений;
| + | |
| - | * aleatoric и epistemic uncertainty связаны с двумя слагаемыми закона полной дисперсии для регрессии;
| + | |
| - | * пояснено, что в классификации предиктивная энтропия не является чистой мерой только одного источника неопределённости;
| + | |
| - | * добавлено тождество между логарифмом свидетельства, ELBO и KL-дивергенцией;
| + | |
| - | * для среднеполевого приближения отмечены невозможность передать корреляции и несколько мод, а также возможное сужение при минимизации <tex>\mathrm{KL}(q\|p)</tex>;
| + | |
| - | * репараметризация Bayes by Backprop дополнена положительной параметризацией масштаба через <tex>\rho</tex>;
| + | |
| - | * выборочная дисперсия MC dropout больше не названа полной предиктивной дисперсией без условного шума наблюдений;
| + | |
| - | * асимптотические свойства MCMC отделены от качества конечной цепи и необходимости диагностики смешивания;
| + | |
| - | * сравнение с ансамблями переписано без заявления о безусловном превосходстве или экономичности одного метода;
| + | |
| - | * добавлен самостоятельный раздел о проверке калибровки, покрытии интервалов и качестве при сдвиге распределения;
| + | |
| - | * конференционные публикации Blundell и Gal—Ghahramani исправлены с шаблона книги на шаблон статьи и параметр <tt>ссылка</tt>;
| + | |
| - | * в литературу возвращены обещанные работы MacKay и Graves; названия, страницы и DOI сверены с издательскими страницами;
| + | |
| - | * примечания и библиография разделены, а несуществующая категория «Искусственный интеллект» заменена существующими категориями «Машинное обучение» и «Нейронные сети».
| + | |
| - | | + | |
| - | Байесовская терминология в финальном тексте везде условна относительно выбранной модели. Фразы о калибровке, неизвестных объектах и безопасном отказе сформулированы как требования к отдельной эмпирической проверке, а не как автоматические свойства BNN.
| + | |
| - | | + | |
| - | — [[Участник:Oleg Batsiev|Oleg Batsiev]]
| + | |
После первого черновика я решил подробнее раскрыть два момента: что именно считается свидетельством механизма и почему отдельный нейрон не обязательно соответствует одному человеческому понятию.
После второй версии были проверены разметка формул, внутренние ссылки, библиография и аккуратность формулировок о возможностях и ограничениях метода.