Explainable AI
Материал из MachineLearning.
(Новая: {{well|Статья написана с использованием LLM '''Claude Opus 4.8''' и проверена участником ~~~~}} {{TOCright}} '''Explainable AI''' ({{lang...) |
м |
||
| (2 промежуточные версии не показаны) | |||
| Строка 1: | Строка 1: | ||
| - | {{well| | + | {{well|Основой статьи послужил текст, написанный с использованием LLM '''Claude Opus 4.8''' и проверенный участником [[Участник:Vladimir Beliaev|Vladimir Beliaev]] 21:02, 13 июля 2026 (MSD). Статья дополнена материалами текста «Объяснимый искусственный интеллект», подготовленного с использованием LLM '''ChatGPT GPT-5.5 Thinking''' и проверенного участником [[Участник:Niiaz Bashirov|Niiaz Bashirov]] 14 июля 2026 (MSD).}} |
{{TOCright}} | {{TOCright}} | ||
| - | '''Explainable AI''' ({{lang-en|explainable artificial intelligence}}, XAI; «объяснимый искусственный интеллект») — совокупность методов и подходов, позволяющих человеку понять, ''почему'' модель [[Машинное обучение|машинного обучения]] выдала то или иное решение. Потребность в XAI возникла как ответ на «чёрный ящик» современных моделей: [[Глубокое обучение|глубокая нейросеть]] с миллиардами параметров может быть очень точной, но по её весам невозможно напрямую понять логику конкретного предсказания. | + | '''Explainable AI''' ({{lang-en|explainable artificial intelligence}}, XAI; «объяснимый искусственный интеллект») — совокупность методов и подходов, позволяющих человеку понять, ''почему'' модель [[Машинное обучение|машинного обучения]] или ИИ-система выдала то или иное решение, рекомендацию или действие. Потребность в XAI возникла как ответ на «чёрный ящик» современных моделей: [[Глубокое обучение|глубокая нейросеть]] с миллиардами параметров может быть очень точной, но по её весам невозможно напрямую понять логику конкретного предсказания. |
| - | Мотивировка не академическая, а вполне практическая. Когда модель отказывает в кредите, ставит медицинский диагноз | + | Мотивировка не академическая, а вполне практическая. Когда модель отказывает в кредите, ставит медицинский диагноз, оценивает риск рецидива в суде или предупреждает о поломке оборудования, недостаточно знать, что она «обычно права». Нужно уметь ответить на вопрос «почему именно это решение и именно для этого объекта» — этого требуют здравый смысл, профессиональная ответственность и, в ряде случаев, регулирование. Особенно важна объяснимость там, где решения затрагивают безопасность, права людей или значимые ресурсы: в медицине, финансах, праве, образовании, промышленности, государственном управлении и критической инфраструктуре<ref name="doshi">Doshi-Velez F., Kim B. Towards a Rigorous Science of Interpretable Machine Learning. arXiv:1702.08608, 2017.</ref>. |
== Два понятия, которые важно различать == | == Два понятия, которые важно различать == | ||
| - | В русскоязычной (да и в англоязычной) литературе термины часто путают, хотя за ними стоят разные идеи. | + | В русскоязычной (да и в англоязычной) литературе термины часто путают, хотя за ними стоят разные идеи<ref name="lipton">Lipton Z. C. The Mythos of Model Interpretability // Queue. 2018. Vol. 16, No. 3. P. 31–57. doi:10.1145/3236386.3241340.</ref>. |
; Интерпретируемость (interpretability) : Свойство самой модели быть понятной по построению. [[Линейная регрессия]], небольшое [[Дерево решений|дерево решений]], набор правил — их логику можно проследить целиком. Такие модели называют «прозрачными» или «белыми ящиками». | ; Интерпретируемость (interpretability) : Свойство самой модели быть понятной по построению. [[Линейная регрессия]], небольшое [[Дерево решений|дерево решений]], набор правил — их логику можно проследить целиком. Такие модели называют «прозрачными» или «белыми ящиками». | ||
; Объяснимость (explainability) : Способность дать человеку понятное объяснение поведения модели ''без'' требования понимать её внутреннее устройство. Объяснимость применима и к чёрным ящикам — через ''post-hoc'' методы, надстраиваемые над уже обученной моделью. | ; Объяснимость (explainability) : Способность дать человеку понятное объяснение поведения модели ''без'' требования понимать её внутреннее устройство. Объяснимость применима и к чёрным ящикам — через ''post-hoc'' методы, надстраиваемые над уже обученной моделью. | ||
| + | ; Прозрачность (transparency) : Доступность сведений о структуре модели, данных, правилах, процессе обучения и ограничениях системы. Открытый код или опубликованная архитектура повышают прозрачность, но сами по себе не гарантируют понимания поведения модели. | ||
| + | ; Понятность (comprehensibility) : Пригодность объяснения для конкретного адресата. Инженеру, врачу, пациенту, аудитору и регулятору могут требоваться разные формы и уровни детализации. | ||
| + | ; Доверие (trust) : Ожидание пользователя, что система работает надёжно и уместно. Объяснение может укрепить обоснованное доверие, но способно и создать ложное доверие, если выглядит убедительно, не отражая реальной работы модели. | ||
| - | Это различие — не педантизм. Оно задаёт главный водораздел всей области | + | Это различие — не педантизм. Оно задаёт главный водораздел всей области: стоит ли объяснять чёрный ящик постфактум или сразу строить модель, не нуждающуюся в отдельном объяснении. Кроме того, объяснимость не сводится к красивой визуализации: хорошее объяснение должно быть связано с реальным поведением модели и быть полезным для поставленной задачи. |
== Как классифицируют методы XAI == | == Как классифицируют методы XAI == | ||
| Строка 19: | Строка 22: | ||
* '''По охвату''': ''локальные'' объясняют одно конкретное предсказание; ''глобальные'' описывают поведение модели в целом. | * '''По охвату''': ''локальные'' объясняют одно конкретное предсказание; ''глобальные'' описывают поведение модели в целом. | ||
| - | * '''По привязке к модели''': ''модельно-специфичные'' используют внутреннее устройство (например, градиенты нейросети); ''модельно-агностичные'' работают с любой моделью как с чёрным ящиком, | + | * '''По привязке к модели''': ''модельно-специфичные'' используют внутреннее устройство (например, градиенты нейросети); ''модельно-агностичные'' работают с любой моделью как с чёрным ящиком, изменяя её входы и наблюдая выходы. |
* '''По моменту применения''': ''ante-hoc'' (интерпретируемость встроена в модель) против ''post-hoc'' (объяснение строится после обучения). | * '''По моменту применения''': ''ante-hoc'' (интерпретируемость встроена в модель) против ''post-hoc'' (объяснение строится после обучения). | ||
| + | * '''По форме результата''': важность признаков, простые правила, локальные суррогаты, карты значимости, прототипы, контрфактические примеры или текстовые объяснения. | ||
| + | |||
| + | Локальное и глобальное объяснения решают разные задачи. Первое отвечает, почему конкретная транзакция признана мошеннической или конкретному пациенту присвоен высокий риск. Второе показывает, какие зависимости модель использует в среднем, где она ошибается и как меняется её ответ при изменении входных данных. На практике эти уровни дополняют друг друга. | ||
| + | |||
| + | == Интерпретируемые модели и суррогаты == | ||
| + | |||
| + | Самый прямой путь к объяснимости — использовать модель, понятную по своей структуре. К интерпретируемым моделям обычно относят линейные и логистические модели, небольшие деревья решений, системы правил «если — то», обобщённые аддитивные модели и разреженные модели с ограниченным числом признаков. В линейной модели коэффициенты показывают направление и силу связи признаков с предсказанием при прочих равных условиях; в дереве решений можно проследить путь от корня к листу. | ||
| + | |||
| + | Когда исходная модель слишком сложна, её поведение приближают '''суррогатной моделью''' — более простым деревом, линейной моделью или набором правил. Глобальный суррогат пытается воспроизвести модель на всём интересующем распределении данных, локальный — только в окрестности одного объекта. Понятность суррогата ещё не гарантирует его верность: необходимо отдельно проверять, насколько точно он повторяет исходную модель. | ||
| + | |||
| + | Близкий класс методов оценивает '''важность признаков''' (feature importance). Такая оценка может быть глобальной или локальной, но её нельзя автоматически трактовать как причинный эффект. Признак способен оказаться важным из-за корреляции с другим фактором, особенностей выборки или смещения данных. | ||
== LIME: объяснение через локальную аппроксимацию == | == LIME: объяснение через локальную аппроксимацию == | ||
| - | '''LIME''' (Local Interpretable Model-agnostic Explanations), предложенный Рибейро и соавторами в 2016 году, исходит из простой идеи: сложная граница решений глобально нелинейна, но ''локально'', вблизи одной точки, её можно приблизить простой линейной моделью<ref name="lime">Ribeiro M. T., Singh S., Guestrin C. "Why Should I Trust You?": Explaining the Predictions of Any Classifier // KDD. 2016. arXiv:1602.04938.</ref>. Вокруг объясняемого примера генерируют возмущённые копии, смотрят, как меняется ответ модели, и обучают на этом прозрачный суррогат. | + | '''LIME''' (Local Interpretable Model-agnostic Explanations), предложенный Рибейро и соавторами в 2016 году, исходит из простой идеи: сложная граница решений глобально нелинейна, но ''локально'', вблизи одной точки, её можно приблизить простой линейной моделью<ref name="lime">Ribeiro M. T., Singh S., Guestrin C. "Why Should I Trust You?": Explaining the Predictions of Any Classifier // KDD. 2016. P. 1135–1144. doi:10.1145/2939672.2939778. arXiv:1602.04938.</ref>. Вокруг объясняемого примера генерируют возмущённые копии, смотрят, как меняется ответ модели, и обучают на этом прозрачный суррогат. |
| - | Формально LIME ищет объяснение < | + | Формально LIME ищет объяснение <tex>\xi(x)</tex> для примера <tex>x</tex> как решение задачи: |
| - | : < | + | :<tex>\displaystyle \xi(x)=\operatorname*{arg\,min}_{g\in G}\left\{\mathcal{L}(f,g,\pi_x)+\Omega(g)\right\}</tex> |
| - | + | Здесь <tex>f</tex> — объясняемая модель, <tex>g</tex> — простой суррогат из класса интерпретируемых моделей <tex>G</tex>, <tex>\pi_x</tex> — мера близости к точке <tex>x</tex> (задаёт «локальность»), <tex>\mathcal{L}</tex> — ошибка приближения <tex>f</tex> суррогатом <tex>g</tex> в окрестности, а <tex>\Omega(g)</tex> штрафует сложность объяснения. Для классификации текста LIME, например, может показать, какие слова сильнее всего повлияли на решение. | |
| + | |||
| + | LIME интуитивен, модельно-агностичен и сравнительно быстр, но его объяснения бывают неустойчивы: результат зависит от способа генерации возмущений, представления признаков и масштаба окрестности. Поэтому локальный суррогат следует рассматривать как приближение, а не как точную расшифровку внутреннего механизма модели. | ||
== SHAP: объяснение через теорию игр == | == SHAP: объяснение через теорию игр == | ||
| - | '''SHAP''' (SHapley Additive exPlanations), предложенный Лундбергом и Ли в 2017 году, ставит задачу иначе и опирается на кооперативную теорию игр<ref name="shap">Lundberg S. M., Lee S.-I. A Unified Approach to Interpreting Model Predictions // NeurIPS. 2017. arXiv:1705.07874.</ref>. Каждый признак трактуется как «игрок», а предсказание — как «выигрыш», который нужно справедливо разделить между игроками. Справедливое разделение задаётся классической конструкцией — '''[[Вектор Шепли|значением Шепли]]''' из работы Шепли 1953 года<ref name="shapley">Shapley L. S. A Value for n-Person Games // Contributions to the Theory of Games II. Princeton University Press, 1953. P. 307–317.</ref>. | + | '''SHAP''' (SHapley Additive exPlanations), предложенный Лундбергом и Ли в 2017 году, ставит задачу иначе и опирается на кооперативную теорию игр<ref name="shap">Lundberg S. M., Lee S.-I. A Unified Approach to Interpreting Model Predictions // NeurIPS. 2017. Vol. 30. arXiv:1705.07874.</ref>. Каждый признак трактуется как «игрок», а предсказание — как «выигрыш», который нужно справедливо разделить между игроками. Справедливое разделение задаётся классической конструкцией — '''[[Вектор Шепли|значением Шепли]]''' из работы Шепли 1953 года<ref name="shapley">Shapley L. S. A Value for n-Person Games // Contributions to the Theory of Games II. Princeton University Press, 1953. P. 307–317.</ref>. |
| - | Вклад признака < | + | Вклад признака <tex>i</tex> вычисляется как взвешенное среднее его предельного вклада по всем возможным коалициям признаков: |
| - | : < | + | :<tex>\displaystyle \phi_i=\sum_{S\subseteq N\setminus\{i\}}\frac{|S|!\,\bigl(|N|-|S|-1\bigr)!}{|N|!}\left[v\!\left(S\cup\{i\}\right)-v(S)\right]</tex> |
| - | где < | + | где <tex>N</tex> — множество всех признаков, <tex>S</tex> — коалиция без признака <tex>i</tex>, а <tex>v(S)</tex> — значение модели при использовании информации из признаков коалиции <tex>S</tex>. Разность <tex>v\!\left(S\cup\{i\}\right)-v(S)</tex> — предельный вклад признака <tex>i</tex>, а дробь перед скобкой — вес, с которым усредняются вклады по коалициям. |
| - | Прямое сравнение показывает, что SHAP обычно согласованнее | + | Значения Шепли обладают полезными свойствами, в частности аддитивностью: сумма вкладов соответствует отклонению конкретного предсказания от базового значения. Поэтому SHAP теоретически обоснованнее многих эвристических методов. Плата за это — вычислительная стоимость: точный расчёт перебирает экспоненциальное число коалиций, и на практике используют приближения и специализированные алгоритмы, например KernelSHAP и TreeSHAP. |
| + | |||
| + | SHAP предоставляет единый язык для локальных объяснений и удобные визуализации, но его значения также не являются причинными эффектами. Кроме того, вычисление и трактовка усложняются при сильной зависимости признаков друг от друга. Прямое сравнение показывает, что SHAP обычно согласованнее LIME, однако оба метода чувствительны к выбору фонового распределения, модели и способу учёта [[Мультиколлинеарность|коллинеарности]] признаков<ref name="salih">Salih A. M. et al. A Perspective on Explainable Artificial Intelligence Methods: SHAP and LIME // Advanced Intelligent Systems. 2025. arXiv:2305.02012.</ref>. | ||
== Другие семейства методов == | == Другие семейства методов == | ||
| - | * '''Градиентные методы для нейросетей''': ''Grad-CAM'' и родственные подходы подсвечивают области изображения, сильнее всего повлиявшие на решение<ref name="gradcam">Selvaraju R. R. et al. Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization // ICCV. 2017. arXiv:1610.02391.</ref>; сюда же относятся интегрированные градиенты и карты значимости (saliency maps). | + | * '''Градиентные методы для нейросетей''': ''Grad-CAM'' и родственные подходы подсвечивают области изображения, сильнее всего повлиявшие на решение<ref name="gradcam">Selvaraju R. R. et al. Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization // ICCV. 2017. P. 618–626. arXiv:1610.02391.</ref>; сюда же относятся интегрированные градиенты, layer-wise relevance propagation и карты значимости (saliency maps). Красочная карта не обязательно является надёжным объяснением, поэтому такие методы проверяют на устойчивость и сопоставляют с предметной экспертизой. |
| - | * '''Контрфактические объяснения''' (counterfactuals): вместо «почему такое решение» отвечают на «что нужно изменить во входе, чтобы решение стало другим» | + | * '''Контрфактические объяснения''' (counterfactuals): вместо «почему такое решение» отвечают на «что нужно изменить во входе, чтобы решение стало другим». Например, система может показать, при каких реалистичных изменениях кредитная заявка была бы одобрена<ref name="wachter">Wachter S., Mittelstadt B., Russell C. Counterfactual Explanations without Opening the Black Box: Automated Decisions and the GDPR // Harvard Journal of Law & Technology. 2018. Vol. 31, No. 2. P. 841–887. arXiv:1711.00399.</ref>. Такие объяснения должны учитывать выполнимость изменений и не предлагать человеку изменить неизменяемые или чувствительные характеристики. |
| - | * '''Механистическая интерпретируемость''': | + | * '''Механистическая интерпретируемость''': направление, пытающееся понять внутреннюю «схемотехнику» нейросетей — какие нейроны, признаки и вычислительные цепочки за что отвечают. Особенно активно оно развивается применительно к [[Большие языковые модели|большим языковым моделям]]. |
| - | == Неудобная правда: == | + | == Объяснимость больших языковых моделей == |
| + | |||
| + | Для больших языковых моделей задача XAI особенно трудна. Такие системы не только классифицируют объекты или выдают число, но и генерируют тексты, код, планы и ответы на вопросы. Их поведение зависит от обучающих данных, архитектуры, контекста запроса, системных инструкций и процедур дообучения. | ||
| + | |||
| + | К основным подходам относятся анализ внимания и скрытых представлений, probing-классификаторы, поиск отдельных признаков и вычислительных цепей, поведенческое тестирование на наборах заданий, а также анализ чувствительности к формулировке запроса. Результаты этих методов требуют осторожной интерпретации: найденные внутренние признаки и зависимости ещё нужно связать с реальным вычислительным механизмом модели. | ||
| + | |||
| + | Отдельная проблема — текстовые «самообъяснения» модели. Языковая модель способна сгенерировать правдоподобное рассуждение о том, почему она дала ответ, но этот текст не обязан быть точным описанием внутреннего вычислительного процесса. Поэтому самоотчёт модели следует проверять внешними методами, а не принимать как готовое доказательство понимания или надёжности. | ||
| + | |||
| + | == Неудобная правда: объяснение может быть неверным == | ||
Ключевая и часто недооценённая проблема XAI — ''достоверность'' (faithfulness): объяснение может быть убедительным для человека, но плохо отражать то, что на самом деле делает модель. Post-hoc метод строит ''приближённую'' историю поведения модели, и эта история не обязана быть правдой. Хуже того, локальное объяснение для одного случая может вводить в заблуждение относительно поведения модели на других объектах, особенно для недопредставленных подгрупп — что напрямую связано с темой [[Смещение данных: bias in ML|смещений]]. | Ключевая и часто недооценённая проблема XAI — ''достоверность'' (faithfulness): объяснение может быть убедительным для человека, но плохо отражать то, что на самом деле делает модель. Post-hoc метод строит ''приближённую'' историю поведения модели, и эта история не обязана быть правдой. Хуже того, локальное объяснение для одного случая может вводить в заблуждение относительно поведения модели на других объектах, особенно для недопредставленных подгрупп — что напрямую связано с темой [[Смещение данных: bias in ML|смещений]]. | ||
Отсюда — влиятельная и полемичная позиция Синтии Рудин, сформулированная в ''Nature Machine Intelligence'' в 2019 году: в задачах с высокой ценой ошибки (медицина, правосудие, кредитование) не следует объяснять чёрные ящики постфактум — вместо этого нужно с самого начала строить интерпретируемые модели<ref name="rudin">Rudin C. Stop Explaining Black Box Machine Learning Models for High Stakes Decisions and Use Interpretable Models Instead // Nature Machine Intelligence. 2019. Vol. 1. P. 206–215. doi:10.1038/s42256-019-0048-x.</ref>. Распространённое возражение «за точность приходится платить непрозрачностью» Рудин оспаривает: на структурированных данных грамотно построенная интерпретируемая модель часто не уступает чёрному ящику в точности. Развёрнутую программу области она позже изложила в обзоре «десяти больших вызовов интерпретируемого машинного обучения»<ref name="rudin22">Rudin C. et al. Interpretable Machine Learning: Fundamental Principles and 10 Grand Challenges // Statistics Surveys. 2022. Vol. 16. P. 1–85.</ref>. | Отсюда — влиятельная и полемичная позиция Синтии Рудин, сформулированная в ''Nature Machine Intelligence'' в 2019 году: в задачах с высокой ценой ошибки (медицина, правосудие, кредитование) не следует объяснять чёрные ящики постфактум — вместо этого нужно с самого начала строить интерпретируемые модели<ref name="rudin">Rudin C. Stop Explaining Black Box Machine Learning Models for High Stakes Decisions and Use Interpretable Models Instead // Nature Machine Intelligence. 2019. Vol. 1. P. 206–215. doi:10.1038/s42256-019-0048-x.</ref>. Распространённое возражение «за точность приходится платить непрозрачностью» Рудин оспаривает: на структурированных данных грамотно построенная интерпретируемая модель часто не уступает чёрному ящику в точности. Развёрнутую программу области она позже изложила в обзоре «десяти больших вызовов интерпретируемого машинного обучения»<ref name="rudin22">Rudin C. et al. Interpretable Machine Learning: Fundamental Principles and 10 Grand Challenges // Statistics Surveys. 2022. Vol. 16. P. 1–85.</ref>. | ||
| + | |||
| + | == Как оценивать объяснения == | ||
| + | |||
| + | Универсальной метрики качества объяснения пока нет. В зависимости от задачи оценивают несколько свойств: | ||
| + | |||
| + | * '''верность''' — насколько объяснение соответствует реальному поведению модели; | ||
| + | * '''устойчивость''' — сохраняется ли оно при малых, несущественных изменениях входа; | ||
| + | * '''понятность''' — способен ли адресат правильно интерпретировать объяснение; | ||
| + | * '''полезность''' — помогает ли оно обнаружить ошибку, принять решение или оспорить результат; | ||
| + | * '''согласованность с предметными знаниями''' — не противоречит ли объяснение проверенным знаниям области; | ||
| + | * '''отсутствие манипулятивности''' — не создаёт ли оно ложной уверенности и не скрывает ли важные ограничения. | ||
| + | |||
| + | Часть критериев можно проверять автоматически, например точность суррогата или устойчивость атрибуций. Понятность и практическую полезность часто приходится оценивать в экспериментах с людьми. Исследования XAI поэтому опираются не только на машинное обучение, но и на философию, психологию и социальные науки, изучающие то, как люди формируют и воспринимают объяснения<ref name="miller">Miller T. Explanation in Artificial Intelligence: Insights from the Social Sciences // Artificial Intelligence. 2019. Vol. 267. P. 1–38. doi:10.1016/j.artint.2018.07.007.</ref>. | ||
| + | |||
| + | == Объяснимость, безопасность и ответственный ИИ == | ||
| + | |||
| + | XAI тесно связан с [[Алгоритмическая справедливость|алгоритмической справедливостью]], [[Ответственный искусственный интеллект|ответственным искусственным интеллектом]] и [[Безопасность искусственного интеллекта|безопасностью ИИ]]. Объяснения помогают находить ошибки и нежелательные зависимости, выявлять признаки-посредники чувствительных характеристик, проверять поведение модели при сдвиге распределения, документировать систему и поддерживать аудит. | ||
| + | |||
| + | Однако объяснимость сама по себе не гарантирует справедливости или безопасности. Понятная модель может использовать несправедливое правило, а убедительное объяснение сложной модели — скрывать неточность исходного метода. XAI следует сочетать с тестированием качества, анализом данных, оценкой рисков, мониторингом после внедрения и человеческим надзором. | ||
| + | |||
| + | В международной дискуссии объяснимость рассматривается рядом с прозрачностью, управляемостью и подотчётностью. Европейские рекомендации по trustworthy AI включают прозрачность и объяснимость в число условий доверенного применения систем<ref name="trustworthy">High-Level Expert Group on Artificial Intelligence. Ethics Guidelines for Trustworthy AI. European Commission, 2019.</ref>. С GDPR связывают требования предоставлять осмысленную информацию об автоматизированной обработке, хотя объём отдельного «права на объяснение» остаётся предметом юридических дискуссий. AI Act Европейского союза также устанавливает требования к прозрачности, информации для пользователей и человеческому надзору в зависимости от типа и риска системы<ref name="aiact">Regulation (EU) 2024/1689 laying down harmonised rules on artificial intelligence // Official Journal of the European Union. 2024.</ref>. | ||
== Приложения == | == Приложения == | ||
| - | XAI востребован везде, где решение нужно обосновать: в медицине (какие признаки снимка привели к | + | XAI востребован везде, где решение нужно обосновать: в медицине (какие признаки снимка или показатели пациента привели к прогнозу), в финансах (обоснование оценки кредитного риска), в промышленности (почему модель предсказала поломку), в образовании (какие факторы связаны с риском отчисления), в науке (см. [[ИИ в научных исследованиях]], где объяснение модели может подсказать новую гипотезу). |
| + | |||
| + | Объяснимость полезна не только конечному пользователю. На разных этапах жизненного цикла модели её применяют для анализа данных и выбора признаков, сравнения моделей, отладки, поиска смещений, подготовки документации, мониторинга после внедрения и общения с экспертами или регуляторами. Объяснения нередко вскрывают, что модель опирается на артефакт данных — классический «эффект умного Ганса», когда система распознаёт не объект, а посторонний признак вроде подписи на снимке. | ||
| + | |||
| + | При этом объяснение модели не означает полного понимания всей ИИ-системы. Реальная система включает данные, интерфейс, бизнес-логику, инструкции операторов, процедуры контроля и социальный контекст применения. Даже точное объяснение предсказания не отвечает автоматически на вопросы, правильно ли поставлена задача, репрезентативны ли данные и разумно ли использовать модель в данной ситуации. | ||
== Открытые проблемы == | == Открытые проблемы == | ||
* '''Достоверность против понятности.''' Чем проще и приятнее объяснение для человека, тем выше риск, что оно неточно передаёт логику модели. | * '''Достоверность против понятности.''' Чем проще и приятнее объяснение для человека, тем выше риск, что оно неточно передаёт логику модели. | ||
| - | * '''Отсутствие единых метрик.''' Нет общепринятого способа измерить, «хорошо» ли объяснение; | + | * '''Отсутствие единых метрик.''' Нет общепринятого способа измерить, «хорошо» ли объяснение; верность, устойчивость, понятность и практическая полезность не всегда совпадают. |
| - | * '''Объяснения и приватность.''' Объяснения способны | + | * '''Корреляция против причинности.''' Вклад признака в предсказание модели не означает, что изменение этого признака вызовет соответствующее изменение в реальном мире. |
| - | * '''XAI для генеративных моделей.''' Классические SHAP и LIME плохо переносятся на большие языковые и [[Мультимодальное машинное обучение|мультимодальные модели]]; здесь на первый план | + | * '''Зависимые признаки.''' При сильной корреляции между признаками их вклад можно распределить несколькими правдоподобными способами, что затрудняет однозначную интерпретацию. |
| - | * '''Человеческий фактор.''' Объяснение полезно лишь тогда, когда понятно ''конкретному'' адресату | + | * '''Объяснения и приватность.''' Объяснения способны раскрывать сведения об обучающих данных или облегчать восстановление чувствительной информации. |
| + | * '''XAI для генеративных моделей.''' Классические SHAP и LIME плохо переносятся на большие языковые и [[Мультимодальное машинное обучение|мультимодальные модели]]; здесь на первый план выходят поведенческий анализ и механистическая интерпретируемость. | ||
| + | * '''Человеческий фактор.''' Объяснение полезно лишь тогда, когда понятно ''конкретному'' адресату. Направление human-centered XAI изучает, как учитывать цели, знания и когнитивные ограничения пользователей. | ||
| + | * '''Ложное доверие.''' Убедительная визуализация или гладкий текст могут заставить пользователя переоценить надёжность системы. | ||
| + | |||
| + | Объяснимый ИИ поэтому разумнее рассматривать не как способ сделать любую модель полностью прозрачной, а как набор инструментов анализа, контроля и коммуникации. Он полезен, когда помогает выявлять ошибки, поддерживать ответственность и принимать более обоснованные решения, но не заменяет валидацию, управление рисками, предметную экспертизу и возможность человеческого вмешательства. | ||
== См. также == | == См. также == | ||
| + | * [[Искусственный интеллект]] | ||
| + | * [[Машинное обучение]] | ||
* [[Смещение данных: bias in ML]] | * [[Смещение данных: bias in ML]] | ||
* [[Дерево решений]] | * [[Дерево решений]] | ||
* [[Линейная регрессия]] | * [[Линейная регрессия]] | ||
| + | * [[Нейронная сеть]] | ||
| + | * [[Глубокое обучение]] | ||
* [[Большие языковые модели]] | * [[Большие языковые модели]] | ||
| + | * [[Алгоритмическая справедливость]] | ||
| + | * [[Ответственный искусственный интеллект]] | ||
| + | * [[Безопасность искусственного интеллекта]] | ||
* [[ИИ в научных исследованиях]] | * [[ИИ в научных исследованиях]] | ||
| Строка 85: | Строка 148: | ||
* [https://www.nature.com/articles/s42256-019-0048-x Stop Explaining Black Box Models…] — программная статья К. Рудин | * [https://www.nature.com/articles/s42256-019-0048-x Stop Explaining Black Box Models…] — программная статья К. Рудин | ||
* [https://github.com/shap/shap SHAP] — эталонная реализация метода | * [https://github.com/shap/shap SHAP] — эталонная реализация метода | ||
| + | * [https://github.com/marcotcr/lime LIME] — реализация метода LIME | ||
[[Категория:Машинное обучение]] | [[Категория:Машинное обучение]] | ||
Текущая версия
| | Основой статьи послужил текст, написанный с использованием LLM Claude Opus 4.8 и проверенный участником Vladimir Beliaev 21:02, 13 июля 2026 (MSD). Статья дополнена материалами текста «Объяснимый искусственный интеллект», подготовленного с использованием LLM ChatGPT GPT-5.5 Thinking и проверенного участником Niiaz Bashirov 14 июля 2026 (MSD). |
Explainable AI (Шаблон:Lang-en, XAI; «объяснимый искусственный интеллект») — совокупность методов и подходов, позволяющих человеку понять, почему модель машинного обучения или ИИ-система выдала то или иное решение, рекомендацию или действие. Потребность в XAI возникла как ответ на «чёрный ящик» современных моделей: глубокая нейросеть с миллиардами параметров может быть очень точной, но по её весам невозможно напрямую понять логику конкретного предсказания.
Мотивировка не академическая, а вполне практическая. Когда модель отказывает в кредите, ставит медицинский диагноз, оценивает риск рецидива в суде или предупреждает о поломке оборудования, недостаточно знать, что она «обычно права». Нужно уметь ответить на вопрос «почему именно это решение и именно для этого объекта» — этого требуют здравый смысл, профессиональная ответственность и, в ряде случаев, регулирование. Особенно важна объяснимость там, где решения затрагивают безопасность, права людей или значимые ресурсы: в медицине, финансах, праве, образовании, промышленности, государственном управлении и критической инфраструктуре[1].
Два понятия, которые важно различать
В русскоязычной (да и в англоязычной) литературе термины часто путают, хотя за ними стоят разные идеи[1].
- Интерпретируемость (interpretability)
- Свойство самой модели быть понятной по построению. Линейная регрессия, небольшое дерево решений, набор правил — их логику можно проследить целиком. Такие модели называют «прозрачными» или «белыми ящиками».
- Объяснимость (explainability)
- Способность дать человеку понятное объяснение поведения модели без требования понимать её внутреннее устройство. Объяснимость применима и к чёрным ящикам — через post-hoc методы, надстраиваемые над уже обученной моделью.
- Прозрачность (transparency)
- Доступность сведений о структуре модели, данных, правилах, процессе обучения и ограничениях системы. Открытый код или опубликованная архитектура повышают прозрачность, но сами по себе не гарантируют понимания поведения модели.
- Понятность (comprehensibility)
- Пригодность объяснения для конкретного адресата. Инженеру, врачу, пациенту, аудитору и регулятору могут требоваться разные формы и уровни детализации.
- Доверие (trust)
- Ожидание пользователя, что система работает надёжно и уместно. Объяснение может укрепить обоснованное доверие, но способно и создать ложное доверие, если выглядит убедительно, не отражая реальной работы модели.
Это различие — не педантизм. Оно задаёт главный водораздел всей области: стоит ли объяснять чёрный ящик постфактум или сразу строить модель, не нуждающуюся в отдельном объяснении. Кроме того, объяснимость не сводится к красивой визуализации: хорошее объяснение должно быть связано с реальным поведением модели и быть полезным для поставленной задачи.
Как классифицируют методы XAI
Методы удобно раскладывать по нескольким осям.
- По охвату: локальные объясняют одно конкретное предсказание; глобальные описывают поведение модели в целом.
- По привязке к модели: модельно-специфичные используют внутреннее устройство (например, градиенты нейросети); модельно-агностичные работают с любой моделью как с чёрным ящиком, изменяя её входы и наблюдая выходы.
- По моменту применения: ante-hoc (интерпретируемость встроена в модель) против post-hoc (объяснение строится после обучения).
- По форме результата: важность признаков, простые правила, локальные суррогаты, карты значимости, прототипы, контрфактические примеры или текстовые объяснения.
Локальное и глобальное объяснения решают разные задачи. Первое отвечает, почему конкретная транзакция признана мошеннической или конкретному пациенту присвоен высокий риск. Второе показывает, какие зависимости модель использует в среднем, где она ошибается и как меняется её ответ при изменении входных данных. На практике эти уровни дополняют друг друга.
Интерпретируемые модели и суррогаты
Самый прямой путь к объяснимости — использовать модель, понятную по своей структуре. К интерпретируемым моделям обычно относят линейные и логистические модели, небольшие деревья решений, системы правил «если — то», обобщённые аддитивные модели и разреженные модели с ограниченным числом признаков. В линейной модели коэффициенты показывают направление и силу связи признаков с предсказанием при прочих равных условиях; в дереве решений можно проследить путь от корня к листу.
Когда исходная модель слишком сложна, её поведение приближают суррогатной моделью — более простым деревом, линейной моделью или набором правил. Глобальный суррогат пытается воспроизвести модель на всём интересующем распределении данных, локальный — только в окрестности одного объекта. Понятность суррогата ещё не гарантирует его верность: необходимо отдельно проверять, насколько точно он повторяет исходную модель.
Близкий класс методов оценивает важность признаков (feature importance). Такая оценка может быть глобальной или локальной, но её нельзя автоматически трактовать как причинный эффект. Признак способен оказаться важным из-за корреляции с другим фактором, особенностей выборки или смещения данных.
LIME: объяснение через локальную аппроксимацию
LIME (Local Interpretable Model-agnostic Explanations), предложенный Рибейро и соавторами в 2016 году, исходит из простой идеи: сложная граница решений глобально нелинейна, но локально, вблизи одной точки, её можно приблизить простой линейной моделью[1]. Вокруг объясняемого примера генерируют возмущённые копии, смотрят, как меняется ответ модели, и обучают на этом прозрачный суррогат.
Формально LIME ищет объяснение для примера
как решение задачи:
Здесь — объясняемая модель,
— простой суррогат из класса интерпретируемых моделей
,
— мера близости к точке
(задаёт «локальность»),
— ошибка приближения
суррогатом
в окрестности, а
штрафует сложность объяснения. Для классификации текста LIME, например, может показать, какие слова сильнее всего повлияли на решение.
LIME интуитивен, модельно-агностичен и сравнительно быстр, но его объяснения бывают неустойчивы: результат зависит от способа генерации возмущений, представления признаков и масштаба окрестности. Поэтому локальный суррогат следует рассматривать как приближение, а не как точную расшифровку внутреннего механизма модели.
SHAP: объяснение через теорию игр
SHAP (SHapley Additive exPlanations), предложенный Лундбергом и Ли в 2017 году, ставит задачу иначе и опирается на кооперативную теорию игр[1]. Каждый признак трактуется как «игрок», а предсказание — как «выигрыш», который нужно справедливо разделить между игроками. Справедливое разделение задаётся классической конструкцией — значением Шепли из работы Шепли 1953 года[1].
Вклад признака вычисляется как взвешенное среднее его предельного вклада по всем возможным коалициям признаков:
где — множество всех признаков,
— коалиция без признака
, а
— значение модели при использовании информации из признаков коалиции
. Разность
— предельный вклад признака
, а дробь перед скобкой — вес, с которым усредняются вклады по коалициям.
Значения Шепли обладают полезными свойствами, в частности аддитивностью: сумма вкладов соответствует отклонению конкретного предсказания от базового значения. Поэтому SHAP теоретически обоснованнее многих эвристических методов. Плата за это — вычислительная стоимость: точный расчёт перебирает экспоненциальное число коалиций, и на практике используют приближения и специализированные алгоритмы, например KernelSHAP и TreeSHAP.
SHAP предоставляет единый язык для локальных объяснений и удобные визуализации, но его значения также не являются причинными эффектами. Кроме того, вычисление и трактовка усложняются при сильной зависимости признаков друг от друга. Прямое сравнение показывает, что SHAP обычно согласованнее LIME, однако оба метода чувствительны к выбору фонового распределения, модели и способу учёта коллинеарности признаков[1].
Другие семейства методов
- Градиентные методы для нейросетей: Grad-CAM и родственные подходы подсвечивают области изображения, сильнее всего повлиявшие на решение[1]; сюда же относятся интегрированные градиенты, layer-wise relevance propagation и карты значимости (saliency maps). Красочная карта не обязательно является надёжным объяснением, поэтому такие методы проверяют на устойчивость и сопоставляют с предметной экспертизой.
- Контрфактические объяснения (counterfactuals): вместо «почему такое решение» отвечают на «что нужно изменить во входе, чтобы решение стало другим». Например, система может показать, при каких реалистичных изменениях кредитная заявка была бы одобрена[1]. Такие объяснения должны учитывать выполнимость изменений и не предлагать человеку изменить неизменяемые или чувствительные характеристики.
- Механистическая интерпретируемость: направление, пытающееся понять внутреннюю «схемотехнику» нейросетей — какие нейроны, признаки и вычислительные цепочки за что отвечают. Особенно активно оно развивается применительно к большим языковым моделям.
Объяснимость больших языковых моделей
Для больших языковых моделей задача XAI особенно трудна. Такие системы не только классифицируют объекты или выдают число, но и генерируют тексты, код, планы и ответы на вопросы. Их поведение зависит от обучающих данных, архитектуры, контекста запроса, системных инструкций и процедур дообучения.
К основным подходам относятся анализ внимания и скрытых представлений, probing-классификаторы, поиск отдельных признаков и вычислительных цепей, поведенческое тестирование на наборах заданий, а также анализ чувствительности к формулировке запроса. Результаты этих методов требуют осторожной интерпретации: найденные внутренние признаки и зависимости ещё нужно связать с реальным вычислительным механизмом модели.
Отдельная проблема — текстовые «самообъяснения» модели. Языковая модель способна сгенерировать правдоподобное рассуждение о том, почему она дала ответ, но этот текст не обязан быть точным описанием внутреннего вычислительного процесса. Поэтому самоотчёт модели следует проверять внешними методами, а не принимать как готовое доказательство понимания или надёжности.
Неудобная правда: объяснение может быть неверным
Ключевая и часто недооценённая проблема XAI — достоверность (faithfulness): объяснение может быть убедительным для человека, но плохо отражать то, что на самом деле делает модель. Post-hoc метод строит приближённую историю поведения модели, и эта история не обязана быть правдой. Хуже того, локальное объяснение для одного случая может вводить в заблуждение относительно поведения модели на других объектах, особенно для недопредставленных подгрупп — что напрямую связано с темой смещений.
Отсюда — влиятельная и полемичная позиция Синтии Рудин, сформулированная в Nature Machine Intelligence в 2019 году: в задачах с высокой ценой ошибки (медицина, правосудие, кредитование) не следует объяснять чёрные ящики постфактум — вместо этого нужно с самого начала строить интерпретируемые модели[1]. Распространённое возражение «за точность приходится платить непрозрачностью» Рудин оспаривает: на структурированных данных грамотно построенная интерпретируемая модель часто не уступает чёрному ящику в точности. Развёрнутую программу области она позже изложила в обзоре «десяти больших вызовов интерпретируемого машинного обучения»[1].
Как оценивать объяснения
Универсальной метрики качества объяснения пока нет. В зависимости от задачи оценивают несколько свойств:
- верность — насколько объяснение соответствует реальному поведению модели;
- устойчивость — сохраняется ли оно при малых, несущественных изменениях входа;
- понятность — способен ли адресат правильно интерпретировать объяснение;
- полезность — помогает ли оно обнаружить ошибку, принять решение или оспорить результат;
- согласованность с предметными знаниями — не противоречит ли объяснение проверенным знаниям области;
- отсутствие манипулятивности — не создаёт ли оно ложной уверенности и не скрывает ли важные ограничения.
Часть критериев можно проверять автоматически, например точность суррогата или устойчивость атрибуций. Понятность и практическую полезность часто приходится оценивать в экспериментах с людьми. Исследования XAI поэтому опираются не только на машинное обучение, но и на философию, психологию и социальные науки, изучающие то, как люди формируют и воспринимают объяснения[1].
Объяснимость, безопасность и ответственный ИИ
XAI тесно связан с алгоритмической справедливостью, ответственным искусственным интеллектом и безопасностью ИИ. Объяснения помогают находить ошибки и нежелательные зависимости, выявлять признаки-посредники чувствительных характеристик, проверять поведение модели при сдвиге распределения, документировать систему и поддерживать аудит.
Однако объяснимость сама по себе не гарантирует справедливости или безопасности. Понятная модель может использовать несправедливое правило, а убедительное объяснение сложной модели — скрывать неточность исходного метода. XAI следует сочетать с тестированием качества, анализом данных, оценкой рисков, мониторингом после внедрения и человеческим надзором.
В международной дискуссии объяснимость рассматривается рядом с прозрачностью, управляемостью и подотчётностью. Европейские рекомендации по trustworthy AI включают прозрачность и объяснимость в число условий доверенного применения систем[1]. С GDPR связывают требования предоставлять осмысленную информацию об автоматизированной обработке, хотя объём отдельного «права на объяснение» остаётся предметом юридических дискуссий. AI Act Европейского союза также устанавливает требования к прозрачности, информации для пользователей и человеческому надзору в зависимости от типа и риска системы[1].
Приложения
XAI востребован везде, где решение нужно обосновать: в медицине (какие признаки снимка или показатели пациента привели к прогнозу), в финансах (обоснование оценки кредитного риска), в промышленности (почему модель предсказала поломку), в образовании (какие факторы связаны с риском отчисления), в науке (см. ИИ в научных исследованиях, где объяснение модели может подсказать новую гипотезу).
Объяснимость полезна не только конечному пользователю. На разных этапах жизненного цикла модели её применяют для анализа данных и выбора признаков, сравнения моделей, отладки, поиска смещений, подготовки документации, мониторинга после внедрения и общения с экспертами или регуляторами. Объяснения нередко вскрывают, что модель опирается на артефакт данных — классический «эффект умного Ганса», когда система распознаёт не объект, а посторонний признак вроде подписи на снимке.
При этом объяснение модели не означает полного понимания всей ИИ-системы. Реальная система включает данные, интерфейс, бизнес-логику, инструкции операторов, процедуры контроля и социальный контекст применения. Даже точное объяснение предсказания не отвечает автоматически на вопросы, правильно ли поставлена задача, репрезентативны ли данные и разумно ли использовать модель в данной ситуации.
Открытые проблемы
- Достоверность против понятности. Чем проще и приятнее объяснение для человека, тем выше риск, что оно неточно передаёт логику модели.
- Отсутствие единых метрик. Нет общепринятого способа измерить, «хорошо» ли объяснение; верность, устойчивость, понятность и практическая полезность не всегда совпадают.
- Корреляция против причинности. Вклад признака в предсказание модели не означает, что изменение этого признака вызовет соответствующее изменение в реальном мире.
- Зависимые признаки. При сильной корреляции между признаками их вклад можно распределить несколькими правдоподобными способами, что затрудняет однозначную интерпретацию.
- Объяснения и приватность. Объяснения способны раскрывать сведения об обучающих данных или облегчать восстановление чувствительной информации.
- XAI для генеративных моделей. Классические SHAP и LIME плохо переносятся на большие языковые и мультимодальные модели; здесь на первый план выходят поведенческий анализ и механистическая интерпретируемость.
- Человеческий фактор. Объяснение полезно лишь тогда, когда понятно конкретному адресату. Направление human-centered XAI изучает, как учитывать цели, знания и когнитивные ограничения пользователей.
- Ложное доверие. Убедительная визуализация или гладкий текст могут заставить пользователя переоценить надёжность системы.
Объяснимый ИИ поэтому разумнее рассматривать не как способ сделать любую модель полностью прозрачной, а как набор инструментов анализа, контроля и коммуникации. Он полезен, когда помогает выявлять ошибки, поддерживать ответственность и принимать более обоснованные решения, но не заменяет валидацию, управление рисками, предметную экспертизу и возможность человеческого вмешательства.
См. также
- Искусственный интеллект
- Машинное обучение
- Смещение данных: bias in ML
- Дерево решений
- Линейная регрессия
- Нейронная сеть
- Глубокое обучение
- Большие языковые модели
- Алгоритмическая справедливость
- Ответственный искусственный интеллект
- Безопасность искусственного интеллекта
- ИИ в научных исследованиях
Примечания
Ссылки
- Interpretable Machine Learning — открытая книга К. Мольнара, стандартный современный справочник по XAI
- Stop Explaining Black Box Models… — программная статья К. Рудин
- SHAP — эталонная реализация метода
- LIME — реализация метода LIME

