Q-обучение

Материал из MachineLearning.

Перейти к: навигация, поиск
Статья написана с использованием LLM и проверена участником Arina Pakalova 10:54, 26 июня 2026 (MSD)


Содержание

Формализация Q-обучения и его нейробиологический аналог

Q-обучение (Q-learning) — это один из базовых алгоритмов обучения с подкреплением без модели среды (model-free). Его целью является нахождение оптимальной стратегии путем оценки функции ценности действия Q(s, a). Эта функция определяет ожидаемую совокупную награду (return), которую агент получит, выполнив действие a в состоянии s, и затем действуя оптимально.

С точки зрения вычислительной нейробиологии, табличная матрица Q, которую алгоритм поддерживает в памяти, имеет прямое биологическое воплощение. Нейробиологическим субстратом, кодирующим Q(s, a), является дорсальный стриатум (хвостатое ядро и скорлупа) [1]. Спайкинг-активность специфических популяций средних шипиковых нейронов (MSNs) стриатума пропорциональна величине Q(s, a) для конкретного моторного акта. Таким образом, алгоритмическая матрица ценностей в машинном обучении концептуально изоморфна карте синаптических весов в базальных ганглиях мозга, где каждое состояние-действие представлено своей ансамблевой активностью [1].

Ошибка временных различий и сигнал дофамина

Математическим двигателем Q-обучения является ошибка временных различий (Temporal Difference error, TD-error), обозначаемая как \delta. В дискретном времени уравнение Беллмана для \delta записывается как: \delta = r + \gamma \max_{a'} Q(s', a') - Q(s, a), где r — мгновенная награда, \gamma \in [0, 1)фактор дисконтирования, s' — новое состояние после совершения действия. Суть формулы заключается в бутстрэппинге (bootstrap): текущая оценка Q(s, a) корректируется на разницу между фактически полученным (или предсказанным на будущий шаг) и ожидаемым результатом.

В нейробиологии данный математический конструкт получил название ошибки предсказания награды (Reward Prediction Error, RPE). Классические эксперименты Вольфрама Шульца показали, что фазическая активность дофаминовых нейронов среднего мозга (VTA и SNc) математически эквивалентна сигналу \delta [1]. Дофамин не кодирует саму награду: всплеск его выброса (\delta > 0) происходит только при получении награды лучше ожидаемой; предсказуемая награда не вызывает реакции (\delta = 0); а отсутствие ожидаемой награды ведет к падению активности ниже базового уровня (\delta < 0). В контексте алгоритма дофамин выступает как глобальный множитель ошибки (global error signal), необходимый для обновления весов.

Пошаговая логика и стохастическая политика

Обновление значений в классическом алгоритме происходит по правилу градиентного спуска: Q(s, a) \leftarrow Q(s, a) + \alpha \delta, где \alpha \in (0, 1]скорость обучения (learning rate), определяющая размер шага корректировки оценки.

Для баланса между исследованием среды (exploration) и использованием найденного опыта (exploitation) в машинном обучении часто применяют epsilon-жадную стратегию. Однако она подразумевает абсолютно случайные выборы с вероятностью \epsilon, что плохо согласуется с биологическим поведением. Более реалистичной и математически обоснованной альтернативой является распределение Гиббса (политика Больцмана), где вероятность выбора действия вычисляется на основе его текущей ценности с помощью функции Softmax: P(a|s) = \frac{\exp(Q(s,a) / \tau)}{\sum_{a' \in A} \exp(Q(s,a') / \tau)}, Здесь параметр \tau > 0 (температура) контролирует уровень стохастичности: при высоких \tau действия выбираются почти равновероятно (чистое исследование), а при \tau \to 0 алгоритм вырождается в жадный выбор (чистое использование). Биологически этот параметр интерпретируется как уровень стохастического шума в нейронных сетях моторной коры и базальных ганглиев.

Псевдокод цикла Q-обучения с политикой Больцмана:

Инициализация Q(s, a) = 0 для всех s, a
ДЛЯ каждого эпизода:
    Инициализация начального состояния s
    ПОКА s не является терминальным:
        // Выбор действия на основе Softmax
        ВЫЧИСЛИТЬ P(a|s) для всех a
        ВЫБРАТЬ действие a стохастически согласно P(a|s)
        // Взаимодействие со средой
        ВЫПОЛНИТЬ a, получить награду r, перейти в состояние s'
        // Вычисление ошибки предсказания (TD-error)
        ВЫЧИСЛИТЬ delta = r + gamma * max_a'(Q(s', a')) - Q(s, a)
        // Обновление функции ценности
        ОБНОВИТЬ Q(s, a) = Q(s, a) + alpha * delta
        s = s'
    КОНЕЦ ПОКА
КОНЕЦ ДЛЯ


Ограничения табличного подхода и архитектура Actor-Critic

Базовое табличное Q-обучение сталкивается с серьезными вычислительными ограничениями при решении реальных задач. Главная проблема — проклятие размерности: алгоритм требует хранения отдельной оценки для каждой пары «состояние-действие». В средах с непрерывным пространством состояний (например, управление роботом-манипулятором) или при асинхронном поступлении стимулов таблица становится бесконечной. Кроме того, оператор максимизации \max_{a'} Q(s', a') делает алгоритм off-policy (целевая политика отличается от поведенческой), что может приводить к переоценке ценностей (overestimation bias).

В машинном обучении эти проблемы решаются переходом к аппроксимации функций (например, с помощью нейросетей) и декомпозиции архитектуры на Actor-Critic. Вместо одной таблицы Q выделяются две структуры:

При этом ошибка обновляется относительно критика: \delta = r + \gamma V(s') - V(s). Эта же ошибка \delta используется для настройки параметров Актера.

Интересно, что нервная система эволюционно пришла к точно такой же архитектурной декомпозиции [1]. Биологическим аналогом Критика выступает вентральный стриатум (оценка того, насколько хорошо текущее состояние), а Актера — дорсальный стриатум (выбор конкретного действия). Единый дофаминергический сигнал \delta одновременно модулирует синаптическую пластичность в обеих структурах. Такая организация позволяет мозгу и сложным RL-алгоритмам использовать методы временных различий с функциональной аппроксимацией, эффективно решая задачу кредитования награды (credit assignment) в длинных непрерывных последовательностях действий [1].

См. также

Примечания

Литература

  • Samejima K. et al. Representation of action-specific reward values in the striatum // Science. — 2005. — Т. 310. — № 5752.
  • Frank M. J. Dynamic dopamine modulation in the basal ganglia: a neurocomputational account of cognitive deficits in medicated and nonmedicated Parkinsonism // Journal of cognitive neuroscience. — 2005. — Т. 17. — № 1.
  • Schultz W., Dayan P., Montague P. R. A neural substrate of prediction and reward // Science. — 1997. — Т. 275. — № 5306.
  • Barto A. G. Adaptive critics and the basal ganglia // Models of information processing in the basal ganglia. — MIT Press, 1995.
  • Reinforcement learning: An introduction. — Cambridge: MIT press, 1998. — Т. 1. — № 1.
Личные инструменты