Катастрофическое забывание
Материал из MachineLearning.
Sanir Lukianov (Обсуждение | вклад)
(Новая: '''Катастрофическое забывание''' ({{lang-en|catastrophic forgetting}}, также ''catastrophic interference'') — это явление, при котором...)
К следующему изменению →
Версия 09:13, 19 июля 2026
Катастрофическое забывание (Шаблон:Lang-en, также catastrophic interference) — это явление, при котором искусственная нейронная сеть после обучения на новой задаче резко и практически полностью утрачивает способность решать ранее усвоенные задачи. Это фундаментальное ограничение большинства современных алгоритмов глубокого обучения, построенных на стохастическом градиентном спуске, и центральная проблема в области непрерывного обучения (continual learning) [1][1].
В отличие от естественных биологических систем, которые способны накапливать знания на протяжении всей жизни, нейросети при последовательном обучении сталкиваются с дилеммой стабильности-пластичности (stability-plasticity dilemma) [1][1]: высокая пластичность (способность к обучению новому) приводит к разрушению старых знаний; высокая стабильность (сохранение старого) препятствует усвоению нового.
Терминология и базовые понятия
| Непрерывное обучение | Парадигма, в которой модель последовательно обучается на потоке задач, сохраняя знания о всех ранее изученных задачах [1]. |
| Трансферное обучение | Использование знаний, полученных при решении одной задачи, для улучшения обучения на другой. Катастрофическое забывание проявляется при тонкой настройке [1]. |
| Дилемма стабильности-пластичности | Фундаментальный компромисс между сохранением старых знаний (стабильность) и усвоением новых (пластичность) [1][1]. |
| Потеря пластичности | Близкое, но отличное явление, при котором сеть со временем теряет саму способность к обучению [1]. |
Катастрофическое забывание (catastrophic forgetting, catastrophic interference) — явление, при котором нейронная сеть, обученная на последовательности задач, демонстрирует резкое падение точности на ранее изученных задачах после обучения на новой. Название «катастрофическое» подчёркивает не постепенный, а скачкообразный характер деградации: при обучении на новой задаче точность на старой может упасть с 90% до уровня случайного угадывания всего за несколько эпох.
Исторический контекст
Открытие явления (1980-е годы)
Явление было впервые систематически описано в конце 1980-х годов в работах Роберта Мак-Клоски (Robert McCloskey) и Нила Коэна (Neal Cohen) [1], а также Роджера Ратклиффа (Roger Ratcliff) [1]. В статье «Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem» (1989) авторы показали, что при последовательном обучении перцептронов и сетей с обратным распространением ошибки новое обучение может полностью разрушать старые знания. Они проанализировали причины этого явления, связав их с распределённым характером хранения информации в весах сети [1].
Исследования 1990-х годов
В 1990-х годах исследования продолжились: Роб Френч (Robert French) предложил понятие «полу-распределённых представлений» и механизмы их динамической регуляции для снижения интерференции [1], а также указал на фундаментальную связь между способностью к обобщению и уязвимостью к катастрофическому забыванию.
Современный этап (с 2017 года)
С развитием глубокого обучения и ростом числа параметров моделей проблема не только не исчезла, но и обострилась. В 2017 году вышла ключевая работа Kirkpatrick et al. с методом Elastic Weight Consolidation (EWC) [1], что положило начало современному этапу исследований, сосредоточенному на трёх основных подходах: регуляризация весов, воспроизведение опыта и архитектурная изоляция [1].
Математическая постановка
Формулировка задачи
Пусть имеется последовательность задач , каждая из которых характеризуется функцией потерь
и распределением данных
. Модель с параметрами
обучается последовательно: сначала на
(получаем
), затем на
, инициализируясь от
, и так далее.
Катастрофическое забывание возникает, когда при минимизации для задачи
градиентный спуск изменяет веса
таким образом, что
для ранее изученной задачи
(где
) резко возрастает.
Конфликт градиентов
Интуитивное объяснение заключается в конфликте градиентов. Для двух задач и
градиенты потерь
и
могут быть противоположно направлены. Тогда обновление, уменьшающее
, увеличивает
.
Формально, если скалярное произведение градиентов отрицательно:
то шаг в направлении минимизации неизбежно увеличивает
(при достаточно малой скорости обучения).
Дилемма стабильности-пластичности
Математически задача непрерывного обучения может быть сформулирована как поиск , минимизирующего эмпирический риск на всех задачах одновременно:
При последовательном обучении мы не имеем доступа ко всем данным одновременно. Ограничения на память и вычислительные ресурсы не позволяют хранить все данные . Поэтому требуется аппроксимировать совместное распределение, что и порождает дилемму [1].
Представление в пространстве параметров
Множество параметров , решающих задачу
, можно представить как подмножество
в пространстве параметров. Задача непрерывного обучения — найти точку
[1]. Показано, что эта задача в общем виде является NP-трудной (сводится к задаче выполнимости SAT) [1].
Механизмы возникновения
Катастрофическое забывание в глубоких нейросетях возникает по нескольким причинам [1][1]:
| 1. Перезапись весов | В распределённых представлениях информация о разных задачах хранится в одних и тех же весах. Обучение на новой задаче изменяет эти веса, разрушая информацию о старой задаче. |
| 2. Конфликт градиентов | Градиенты, направленные на минимизацию потерь для разных задач, могут быть ортогональны или противоположно направлены, что приводит к интерференции [1][1]. |
| 3. Отсутствие регуляризации по важности | Стандартные методы регуляризации (L1, L2) штрафуют все веса одинаково и не защищают те веса, которые критически важны для старых задач. |
| 4. Сложность модели | Чем больше параметров у модели, тем больше степеней свободы и тем выше вероятность конфликта градиентов, хотя этот вопрос остаётся предметом дискуссий. |
Важно отметить, что катастрофическое забывание — это не просто «переобучение» или «недообучение». Это фундаментальное свойство градиентного спуска в невыпуклых пространствах параметров при последовательном обучении [1].
Методы борьбы с катастрофическим забыванием
Существующие методы делятся на три основные категории [1][1]:
1. Регуляризационные методы (Regularization-based)
Эти методы добавляют к функции потерь на новой задаче штраф, препятствующий значительному изменению весов, важных для старых задач.
Elastic Weight Consolidation (EWC)
EWC [1] — один из первых и наиболее известных методов. Идея основана на байесовском подходе: после обучения на задаче апостериорное распределение
аппроксимируется гауссианом с центром в оптимальных весах
и ковариацией, определяемой матрицей Фишера
. Функция потерь для задачи
имеет вид:
где — диагональные элементы матрицы Фишера, оценивающие важность параметра
для задачи
;
— гиперпараметр [1][1].
Матрица Фишера вычисляется как:
Synaptic Intelligence (SI)
SI [1] — метод, аналогичный EWC, но оценивающий важность весов на основе их вклада в изменение функции потерь на протяжении обучения. Для каждого параметра накапливается «синаптическая значимость»
, и регуляризационный штраф имеет вид
.
Memory Aware Synapses (MAS)
MAS [1] оценивает важность весов на основе чувствительности выхода модели к изменению веса:
Этот подход не требует наличия меток для оценки важности.
Learning without Forgetting (LwF)
LwF [1] использует дистилляцию знаний: при обучении на новой задаче предсказания старой модели на данных новой задачи служат «мягкими метками», которые надо сохранить. Функция потерь комбинирует потерю на новой задаче и потерю дистилляции.
2. Методы воспроизведения опыта (Replay-based)
Эти методы хранят примеры из прошлых задач (или генерируют их) и смешивают с данными текущей задачи при обучении.
Experience Replay (ER)
Простейший метод: сохраняется буфер (buffer) фиксированного размера с примерами из прошлых задач. На каждом шаге обучения семплируется мини-батч из буфера и объединяется с данными текущей задачи [1]. Метод эффективен, но требует памяти для хранения примеров.
A-GEM (Averaged Gradient Episodic Memory)
A-GEM [1] — улучшенная версия GEM (Gradient Episodic Memory) [1]. Основная идея: при обновлении весов градиент текущей задачи проектируется так, чтобы он не увеличивал функцию потерь на старых задачах. В отличие от GEM, A-GEM использует усреднённый градиент по всем задачам из буфера, что значительно ускоряет вычисления [1].
Generative Replay
Generative Replay [1] использует генеративную модель (например, GAN или диффузионную модель) для синтеза данных из прошлых задач, вместо их хранения. Это решает проблему хранения данных, но добавляет вычислительную нагрузку [1][1].
Dark Experience Replay (DER)
DER [1] расширяет ER, сохраняя не только входные данные и метки, но и логиты (выходы до softmax) старой модели. Это позволяет использовать дистилляцию знаний при воспроизведении.
3. Архитектурные методы (Architecture-based)
Эти методы изменяют архитектуру сети, выделяя отдельные подмножества параметров для разных задач.
Progressive Neural Networks
Progressive Neural Networks [1] для каждой новой задачи добавляют новую «колонку» (столбец) нейронов, которая обучается с нуля, но имеет латеральные связи к предыдущим колонкам. Старые колонки замораживаются. Метод полностью устраняет забывание, но масштаб сети растёт линейно с числом задач.
PackNet
PackNet [1] после обучения на задаче применяет структурное прореживание (pruning) к весам, определяет важные веса и «упаковывает» их. Освободившиеся веса используются для следующей задачи.
Hard Attention to the Task (HAT)
HAT [1] использует маски (attention masks) на нейронах для каждой задачи, разрешая или запрещая их использование. Маски обучаются вместе с весами.
Сравнение подходов
| Характеристика | Регуляризационные | Реплей | Архитектурные |
| Требует дополнительной памяти | Нет | Да | Да (расширение сети) |
| Вычислительные накладные расходы | Низкие | Средние | Высокие |
| Эффективность на 5+ задач | Средняя | Высокая | Высокая |
| Масштабируемость | Высокая | Высокая | Низкая |
| Гарантии отсутствия забывания | Нет | Нет | Да (при заморозке) |
Оценка катастрофического забывания
Метрики
Пусть — точность модели на задаче
после обучения на задаче
(где
). Тогда:
| Точность после обучения | |
| Забывание (forgetting) | |
| Среднее забывание | Усредняется по всем задачам |
| Скорость обучения | Метрика из A-GEM [1], измеряет, как быстро модель достигает высокой точности на новой задаче |
Бенчмарки
| Бенчмарк | Описание | Источник |
| Split-MNIST | MNIST разбивается на 5 задач по 2 класса каждая | [1] |
| Permuted-MNIST | Каждая задача — MNIST с фиксированной случайной перестановкой пикселей | [1] |
| Split-CIFAR-10/100 | Аналогично Split-MNIST на CIFAR | [1] |
| CORe50 | Набор данных для непрерывного обучения с 50 классами объектов | [1] |
| CLEAR / Stream-51 | Современные бенчмарки, приближенные к реальным условиям | [1] |
Применения и последствия
Катастрофическое забывание критически важно для следующих областей:
| Робототехника | Роботы должны непрерывно обучаться новым навыкам, не забывая старые [1]. |
| Рекомендательные системы | Модель должна адаптироваться к новому пользователю, сохраняя знания о других. |
| Медицина | Каждый новый пациент — новая задача (анализ ЭКГ, медицинские изображения). |
| Большие языковые модели (LLM) | При дообучении на новой предметной области модель может потерять способность к общим рассуждениям [1]. |
Ограничения и открытые вопросы
Несмотря на значительный прогресс, остаются нерешённые проблемы:
| 1. Масштабируемость | Большинство методов плохо работают при числе задач более 50-100. Архитектурные методы не масштабируются, регуляризационные накапливают ошибки. |
| 2. Теоретические гарантии | Не существует методов с гарантированным отсутствием забывания. Задача является NP-трудной [1]. |
| 3. Биологическая обоснованность | Хотя биологический мозг решает эту проблему успешно [1], механизмы остаются не до конца понятыми. |
| 4. Комбинирование методов | Гибридные подходы дают лучшие результаты, но их настройка сложна. |
| 5. Стандарты оценки | Отсутствует единый стандарт оценки, что затрудняет сравнение методов [1]. |
Практические рекомендации
Выбор метода
| 2–5 задач | Регуляризационные методы (EWC, SI) — просты и не требуют памяти. |
| 5–20 задач | Реплей-методы (ER, A-GEM) — дают лучшее качество [1]. |
| Ограничения по памяти | Generative Replay [1]. |
| Критичность забывания | Progressive Neural Networks [1] — гарантирует отсутствие забывания. |
Стратегия обучения
- Используйте накопление градиентов (gradient accumulation) для стабилизации обучения.
- В реплей-методах размер буфера выбирайте как можно больше (в пределах ограничений памяти).
- Для регуляризационных методов подбирайте гиперпараметр
через валидацию.
Мониторинг и оценка
- Отслеживайте точность на всех задачах в процессе обучения (accuracy matrix).
- Используйте метрику забывания (forgetting) в дополнение к средней точности.
- Для реплей-методов применяйте аугментацию буфера.
См. также
Примечания
Литература
- McCloskey, M., & Cohen, N. J. (1989). Catastrophic interference in connectionist networks: The sequential learning problem. Psychology of Learning and Motivation, 24, 109–165.
- Ratcliff, R. (1990). Connectionist models of recognition memory: constraints imposed by learning and forgetting functions. Psychological Review, 97(2), 285–308.
- Kirkpatrick, J., Pascanu, R., Rabinowitz, N., et al. (2017). Overcoming catastrophic forgetting in neural networks. PNAS, 114(13), 3521–3526.
- Huszár, F. (2017). On Quadratic Penalties in Elastic Weight Consolidation. arXiv:1712.03847.
- Zenke, F., Poole, B., & Ganguli, S. (2017). Continual Learning Through Synaptic Intelligence. ICML.
- Aljundi, R., Babiloni, F., Elhoseiny, M., et al. (2018). Memory Aware Synapses: Learning what (not) to forget. ECCV.
- Li, Z., & Hoiem, D. (2017). Learning without Forgetting. IEEE TPAMI, 40(12), 2935–2947.
- Shin, H., Lee, J. K., Kim, J., & Kim, J. (2017). Continual Learning with Deep Generative Replay. NIPS, 30, 2994–3003.
- Lopez-Paz, D., & Ranzato, M. (2017). Gradient Episodic Memory for Continual Learning. NIPS.
- Chaudhry, A., Ranzato, M. A., Rohrbach, M., & Elhoseiny, M. (2019). Efficient Lifelong Learning with A-GEM. ICLR.
- Rusu, A. A., Rabinowitz, N. C., Desjardins, G., et al. (2016). Progressive Neural Networks. arXiv:1606.04671.
- Mallya, A., & Lazebnik, S. (2018). PackNet: Adding Multiple Tasks to a Single Network by Iterative Pruning. CVPR.
- Serra, J., Suris, D., Miron, M., & Karatzoglou, A. (2018). Overcoming Catastrophic Forgetting with Hard Attention to the Task. ICML.
- Aleixo, E., Colonna, J. G., Cristo, M., & Fernandes, E. (2024). Catastrophic Forgetting in Deep Learning: A Comprehensive Review. Journal of the Brazilian Computer Society.
- Baskaran, R. S. (2025). A Comprehensive Review of Catastrophic Forgetting in Text Processing. Taylor & Francis.
- Zenke, F., & Laborieux, A. (2024). Theories of synaptic memory consolidation and intelligent plasticity for continual learning. arXiv:2405.16922.
- Liu, Z., Liu, Y., & Liu, J. (2026). OCL-SKD: Balancing plasticity and stability in online continual learning via self-knowledge distillation. Neurocomputing, 680, 133297.
- Joudaki, A., Lanzillotta, G., Razlighi, M. S., et al. (2025). Barriers for Learning in an Evolving World: Mathematical Understanding of Loss of Plasticity. arXiv:2510.00304.

