Policy gradient

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
(Новая: {{well|Статья написана с использованием LLM и проверена участником ~~~ 10:54, 26 июня 2026 (MSD)}} == Общее описание Po...)
Строка 3: Строка 3:
== Общее описание Policy Gradient ==
== Общее описание Policy Gradient ==
-
Методы Policy Gradient (PG) представляют собой класс алгоритмов обучения с подкреплением, в которых оптимизация производится напрямую по параметрам стратегии <tex>\pi_\theta(a|s)</tex>, задающей вероятность или плотность распределения действия <tex>a</tex> в состоянии <tex>s</tex>. В отличие от value-based методов, требующих дискретизации пространства действий или сложной архитектуры для непрерывных доменов, PG естественным образом работает с многомерными непрерывными пространствами, что делает их базовым инструментом для управления робототехническими манипуляторами, где действие — это вектор суставных моментов или скоростей <ref name="sutton">Sutton, R. S., & Barto, A. G. (2018). ''Reinforcement Learning: An Introduction''. MIT Press.</ref>.
+
Методы Policy Gradient (PG) представляют собой класс алгоритмов обучения с подкреплением, в которых оптимизация производится напрямую по параметрам стратегии <tex>\pi_\theta(a|s)</tex>, задающей вероятность или плотность распределения действия <tex>a</tex> в состоянии <tex>s</tex>. В отличие от value-based методов, требующих дискретизации пространства действий или сложной архитектуры для непрерывных доменов, PG естественным образом работает с многомерными непрерывными пространствами, что делает их базовым инструментом для управления робототехническими манипуляторами, где действие — это вектор суставных моментов или скоростей <ref name="sutton">Sutton R. S. et al. Reinforcement learning: An introduction. – Cambridge : MIT press, 1998. – Т. 1. – №. 1.</ref>.
Целью оптимизации является максимизация математического ожидания совокупной награды (objective function):
Целью оптимизации является максимизация математического ожидания совокупной награды (objective function):
Строка 19: Строка 19:
Использование полного возврата траектории <tex>R(\tau)</tex> в качестве оценки качества каждого шага порождает критическую проблему высокой дисперсии градиентной оценки. В контактной динамике (например, при захвате объекта роботом-манипулятором) финальная награда может быть получена только в конце эпизода. При этом стохастичность начальных условий, трения и задержек контроллеров приводит к тому, что идентичные действия в одном и том же состоянии в разных траекториях могут получить кардинально разные оценки <tex>R(\tau)</tex>.
Использование полного возврата траектории <tex>R(\tau)</tex> в качестве оценки качества каждого шага порождает критическую проблему высокой дисперсии градиентной оценки. В контактной динамике (например, при захвате объекта роботом-манипулятором) финальная награда может быть получена только в конце эпизода. При этом стохастичность начальных условий, трения и задержек контроллеров приводит к тому, что идентичные действия в одном и том же состоянии в разных траекториях могут получить кардинально разные оценки <tex>R(\tau)</tex>.
-
Высокая дисперсия градиента на реальном оборудовании означает разброс обновлений параметров: одно удачное столкновение с инерцией объекта может заставить алгоритм считать угловую скорость безопасной, в то время как в 99% случаев она ведет к разрушению механики. Для сведения дисперсии к приемлемому для физики уровню применяются два фундаментальных приема <ref name="greensmith">Greensmith, E., Bartlett, P. L., & Baxter, J. (2004). Variance reduction techniques for gradient estimates in reinforcement learning. ''Journal of Machine Learning Research'', 5, 1471-1520.</ref>:
+
Высокая дисперсия градиента на реальном оборудовании означает разброс обновлений параметров: одно удачное столкновение с инерцией объекта может заставить алгоритм считать угловую скорость безопасной, в то время как в 99% случаев она ведет к разрушению механики. Для сведения дисперсии к приемлемому для физики уровню применяются два фундаментальных приема <ref name="greensmith">Greensmith E., Bartlett P. L., Baxter J. Variance reduction techniques for gradient estimates in reinforcement learning //Journal of Machine Learning Research. – 2004. – Т. 5. – №. Nov.</ref>:
-
1. '''Введение базовой линии (baseline) <tex>b(s_t)</tex>''': Вычитание константы или функции состояния из возврата не смещает градиент, но радикально снижает дисперсию. В качестве <tex>b(s_t)</tex> используется функция ценности <tex>V(s_t)</tex>.
+
# '''Введение базовой оценки (baseline) <tex>b(s_t)</tex>''': Вычитание константы или функции состояния из возврата не смещает градиент, но радикально снижает дисперсию. В качестве <tex>b(s_t)</tex> используется функция ценности <tex>V(s_t)</tex>.
-
2. '''Учет причинности (Causality)''': Действие в момент <tex>t</tex> не может повлиять на награду, полученную до этого момента. Поэтому вместо <tex>R(\tau)</tex> используется возврат с текущего шага (reward-to-go): <tex>\hat{R}_t = \sum_{k=t}^T \gamma^{k-t} r_k</tex>.
+
# '''Учет причинности (Causality)''': Действие в момент <tex>t</tex> не может повлиять на награду, полученную до этого момента. Поэтому вместо <tex>R(\tau)</tex> используется возврат с текущего шага (reward-to-go): <tex>\hat{R}_t = \sum_{k=t}^T \gamma^{k-t} r_k</tex>.
Модифицированная оценка градиента принимает вид:
Модифицированная оценка градиента принимает вид:
Строка 30: Строка 30:
== Пошаговая логика вычислений ==
== Пошаговая логика вычислений ==
-
В современной практике чистый PG (алгоритм REINFORCE <ref name="williams">Williams, R. J. (1992). Simple statistical gradient-following algorithms for connectionist reinforcement learning. ''Machine learning'', 8(3), 229-256.</ref>) практически не применяется из-за неэффективности использования данных. Стандартом вычислений является вариация с обобщенной оценкой преимущества (Generalized Advantage Estimation, GAE) <ref name="schulman_gae">Schulman, J., Moritz, P., Levine, S., Jordan, M., & Abbeel, P. (2015). High-dimensional continuous control using generalized advantage estimation. ''arXiv preprint arXiv:1506.02438.</ref>. Логика вычислений в рамках одного эпохального обновления:
+
В современной практике чистый PG (алгоритм REINFORCE <ref name="williams">Williams R. J. Simple statistical gradient-following algorithms for connectionist reinforcement learning //Machine learning. – 1992. – Т. 8. – №. 3.</ref>) практически не применяется из-за неэффективности использования данных. Стандартом вычислений является вариация с обобщенной оценкой преимущества (Generalized Advantage Estimation, GAE) <ref name="gae">Kochenderfer M. J., Wheeler T. A., Wray K. H. Algorithms for decision making. – MIT press, 2022.</ref>. Логика вычислений в рамках одного эпохального обновления:
-
1. '''Сбор данных'''. В симуляторе параллельно генерируется <tex>N</tex> траекторий с помощью текущей политики <tex>\pi_\theta</tex>. Фиксируется последовательность <tex>(s_t, a_t, r_t, s_{t+1})</tex>.
+
# '''Сбор данных'''. В симуляторе параллельно генерируется <tex>N</tex> траекторий с помощью текущей политики <tex>\pi_\theta</tex>. Фиксируется последовательность <tex>(s_t, a_t, r_t, s_{t+1})</tex>.
-
2. '''Вычисление TD-ошибок (Temporal Difference)'''. На каждом шаге вычисляется <tex>\delta_t = r_t + \gamma V_\phi(s_{t+1}) - V_\phi(s_t)</tex>, где <tex>V_\phi</tex> — функция ценности (критик), обучаемая параллельно методом градиентного спуска по среднеквадратичной ошибке.
+
# '''Вычисление TD-ошибок (Temporal Difference)'''. На каждом шаге вычисляется <tex>\delta_t = r_t + \gamma V_\phi(s_{t+1}) - V_\phi(s_t)</tex>, где <tex>V_\phi</tex> — функция ценности (критик), обучаемая параллельно методом градиентного спуска по среднеквадратичной ошибке.
-
3. '''Расчет преимущества (Advantage)'''. Вычисляется экспоненциально взвешенная сумма TD-ошибок:
+
# '''Расчет преимущества (Advantage)'''. Вычисляется экспоненциально взвешенная сумма TD-ошибок:
<tex>\hat{A}_t^{\text{GAE}(\gamma, \lambda)} = \sum_{l=0}^{T-t} (\gamma \lambda)^l \delta_{t+l}</tex>.
<tex>\hat{A}_t^{\text{GAE}(\gamma, \lambda)} = \sum_{l=0}^{T-t} (\gamma \lambda)^l \delta_{t+l}</tex>.
-
Параметр <tex>\lambda \in [0, 1]</tex> управляет компромиссом между смещением (bias) и дисперсией. При <tex>\lambda=0</tex> оценка зависит только от одного шага (низкая дисперсия, высокое смещение), при <tex>\lambda=1</tex> вырождается в Montgomery оценку (нулевой bias, высокая дисперсия). В робототехнике типичное значение <tex>\lambda = 0.95</tex>.
+
Параметр <tex>\lambda \in [0, 1]</tex> управляет компромиссом между смещением (bias) и дисперсией. При <tex>\lambda=0</tex> оценка зависит только от одного шага (низкая дисперсия, высокое смещение), при <tex>\lambda=1</tex> вырождается в оценку Монте-Карло (нулевой bias, высокая дисперсия). В робототехнике типичное значение <tex>\lambda = 0.95</tex>.
-
4. '''Формирование loss-функции'''. Поскольку оптимизаторы в фреймворках глубокого обучения минимизируют функцию потерь, градиентный подъем заменяется на спуск:
+
# '''Формирование loss-функции'''. Поскольку оптимизаторы в фреймворках глубокого обучения минимизируют функцию потерь, градиентный подъем заменяется на спуск:
<tex>L_{\text{PG}}(\theta) = -\frac{1}{N \cdot T} \sum_{i=1}^N \sum_{t=0}^T \log \pi_\theta(a_{i,t}|s_{i,t}) \hat{A}_{i,t}</tex>.
<tex>L_{\text{PG}}(\theta) = -\frac{1}{N \cdot T} \sum_{i=1}^N \sum_{t=0}^T \log \pi_\theta(a_{i,t}|s_{i,t}) \hat{A}_{i,t}</tex>.
-
5. '''Обновление весов'''. Вычисляется <tex>\nabla_\theta L_{\text{PG}}</tex> и делается шаг оптимизатора (например, Adam).
+
# '''Обновление весов'''. Вычисляется <tex>\nabla_\theta L_{\text{PG}}</tex> и делается шаг оптимизатора (например, Adam).
== Ограничения и практика ==
== Ограничения и практика ==
Строка 45: Строка 45:
Фундаментальное ограничение базового Policy Gradient — неспособность гарантировать монотонное улучшение политики при нетривиальном размере шага обучения. В задачах с жесткими физическими ограничениями (ограничения на тяговые моменты, рабочие области) произвольное изменение <tex>\theta</tex> может вывести распределение <tex>\pi_\theta</tex> за пределы устойчивого многообразия. В симуляторе это приводит к расхождению контактного решателя, на реальном оборудовании — к аварийному останову (E-stop) из-за превышения пороговых значений токов.
Фундаментальное ограничение базового Policy Gradient — неспособность гарантировать монотонное улучшение политики при нетривиальном размере шага обучения. В задачах с жесткими физическими ограничениями (ограничения на тяговые моменты, рабочие области) произвольное изменение <tex>\theta</tex> может вывести распределение <tex>\pi_\theta</tex> за пределы устойчивого многообразия. В симуляторе это приводит к расхождению контактного решателя, на реальном оборудовании — к аварийному останову (E-stop) из-за превышения пороговых значений токов.
-
По этой причине наивный PG заменяется алгоритмами с доверительными областями (Trust Region Policy Optimization, TRPO) или клиппированием вероятностей (Proximal Policy Optimization, PPO) <ref name="schulman_ppo">Schulman, J., Wolski, F., Dhariwal, P., Radford, A., & Klimov, O. (2017). Proximal policy optimization algorithms. ''arXiv preprint arXiv:1707.06347.</ref>. В PPO целевая функция модифицируется ограничителем:
+
По этой причине наивный PG заменяется алгоритмами с доверительными областями (Trust Region Policy Optimization, TRPO) или клиппированием вероятностей (Proximal Policy Optimization, PPO) <ref name="ppo">Jin R., Li S., Wang B. On stationary point convergence of PPO-Clip //International Conference on Learning Representations. – 2024. – Т. 2024. </ref>. В PPO целевая функция модифицируется ограничителем:
<tex>L^{\text{CLIP}}(\theta) = \mathbb{E}_t \left[ \min\left( \rho_t(\theta) \hat{A}_t, \, \text{clip}(\rho_t(\theta), 1-\epsilon, 1+\epsilon) \hat{A}_t \right) \right]</tex>,
<tex>L^{\text{CLIP}}(\theta) = \mathbb{E}_t \left[ \min\left( \rho_t(\theta) \hat{A}_t, \, \text{clip}(\rho_t(\theta), 1-\epsilon, 1+\epsilon) \hat{A}_t \right) \right]</tex>,
где <tex>\rho_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{\text{old}}}(a_t|s_t)}</tex>, а <tex>\epsilon</tex> (обычно 0.1 или 0.2) жестко ограничивает отношение новых вероятностей к старым. Это предотвращает разрушительные обновления весов.
где <tex>\rho_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{\text{old}}}(a_t|s_t)}</tex>, а <tex>\epsilon</tex> (обычно 0.1 или 0.2) жестко ограничивает отношение новых вероятностей к старым. Это предотвращает разрушительные обновления весов.
-
С инженерной точки зрения PG-методы (в лице PPO) обладают критически низкой выборочной эффективностью (sample efficiency). Обучение контроллера пошагового перемещения манипулятора требует десятков миллионов кадров симуляции. Проблема усугубляется разрывом симуляции и реальности (sim-to-real gap): неточности моделирования трения скольжения и упругих деформаций приводят к тому, что политика, оптимизированная в градиенте симулятора, на реальном объекте теряет устойчивость. Практическим решением является инъекция доменного шума (Domain Randomization) в параметры физического движка на этапе сбора траекторий для PG, что делает градиент робастным к вариациям физических констант <ref name="tobin">Tobin, J., Fong, R., Ray, A., Schneider, J., Zaremba, W., & Abbeel, P. (2017). Domain randomization for transferring deep neural networks from simulation to the real world. ''IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)'.</ref>.
+
С инженерной точки зрения PG-методы (в лице PPO) обладают критически низкой выборочной эффективностью (sample efficiency). Обучение контроллера пошагового перемещения манипулятора требует десятков миллионов кадров симуляции. Проблема усугубляется разрывом симуляции и реальности (sim-to-real gap): неточности моделирования трения скольжения и упругих деформаций приводят к тому, что политика, оптимизированная в градиенте симулятора, на реальном объекте теряет устойчивость. Практическим решением является инъекция доменного шума (Domain Randomization) в параметры физического движка на этапе сбора траекторий для PG, что делает градиент робастным к вариациям физических констант <ref name="tobin">Tobin J. et al. Domain randomization for transferring deep neural networks from simulation to the real world //2017 IEEE/RSJ international conference on intelligent robots and systems (IROS). – IEEE, 2017.</ref>.
 +
 
 +
== Примечания ==
 +
{{примечания}}
== Литература ==
== Литература ==
-
<references />
+
* {{статья | автор = Sutton R. S. et al. | заглавие = Reinforcement learning: An introduction | место = Cambridge | издательство = MIT press | год = 1998 | том = 1 | номер = 1 }}
 +
* {{статья | автор = Greensmith E., Bartlett P. L., Baxter J. | заглавие = Variance reduction techniques for gradient estimates in reinforcement learning | издание = Journal of Machine Learning Research | год = 2004 | том = 5 | номер = Nov. }}
 +
* {{статья | автор = Williams R. J. | заглавие = Simple statistical gradient-following algorithms for connectionist reinforcement learning | издание = Machine learning | год = 1992 | том = 8 | номер = 3 }}
 +
* {{статья | автор = Kochenderfer M. J., Wheeler T. A., Wray K. H. | заглавие = Algorithms for decision making | издательство = MIT press | год = 2022 }}
 +
* {{статья | автор = Jin R., Li S., Wang B. | заглавие = On stationary point convergence of PPO-Clip | издание = International Conference on Learning Representations | год = 2024 | том = 2024 }}
 +
* {{статья | автор = Tobin J. et al. | заглавие = Domain randomization for transferring deep neural networks from simulation to the real world | издание = 2017 IEEE/RSJ international conference on intelligent robots and systems (IROS) | издательство = IEEE | год = 2017 }}

Версия 21:13, 18 июля 2026

Статья написана с использованием LLM и проверена участником Arina Pakalova 10:54, 26 июня 2026 (MSD)


Содержание

Общее описание Policy Gradient

Методы Policy Gradient (PG) представляют собой класс алгоритмов обучения с подкреплением, в которых оптимизация производится напрямую по параметрам стратегии \pi_\theta(a|s), задающей вероятность или плотность распределения действия a в состоянии s. В отличие от value-based методов, требующих дискретизации пространства действий или сложной архитектуры для непрерывных доменов, PG естественным образом работает с многомерными непрерывными пространствами, что делает их базовым инструментом для управления робототехническими манипуляторами, где действие — это вектор суставных моментов или скоростей [1].

Целью оптимизации является максимизация математического ожидания совокупной награды (objective function): J(\theta) = \mathbb{E}_{\tau \sim p_\theta(\tau)} \left[ \sum_{t=0}^{T} \gamma^t r_t \right], где \tau = (s_0, a_0, r_0, \dots, s_T, a_T, r_T) — траектория, p_\theta(\tau) — совместное распределение траекторий, зависящее от параметров \theta, \gamma \in [0, 1] — коэффициент дисконтирования.

Базовая теорема политики градиента (Policy Gradient Theorem) позволяет выразить градиент целевой функции через градиент логарифма вероятности действия (log-likelihood ratio trick) [1]: \nabla_\theta J(\theta) = \mathbb{E}_{\tau \sim p_\theta(\tau)} \left[ \sum_{t=0}^T \nabla_\theta \log \pi_\theta(a_t|s_t) R(\tau) \right], где R(\tau) = \sum_{t=0}^T \gamma^t r_t — возврат (return) всей траектории.

На практике в физическом симуляторе (например, MuJoCo) это означает, что мы запускаем эпизод, собираем временны́е ряды состояний и действий, а затем сдвигаем параметры сети в направлении, которое увеличивает вероятность действий, приведших к высокой суммарной награде.

Проблема высокой дисперсии

Использование полного возврата траектории R(\tau) в качестве оценки качества каждого шага порождает критическую проблему высокой дисперсии градиентной оценки. В контактной динамике (например, при захвате объекта роботом-манипулятором) финальная награда может быть получена только в конце эпизода. При этом стохастичность начальных условий, трения и задержек контроллеров приводит к тому, что идентичные действия в одном и том же состоянии в разных траекториях могут получить кардинально разные оценки R(\tau).

Высокая дисперсия градиента на реальном оборудовании означает разброс обновлений параметров: одно удачное столкновение с инерцией объекта может заставить алгоритм считать угловую скорость безопасной, в то время как в 99% случаев она ведет к разрушению механики. Для сведения дисперсии к приемлемому для физики уровню применяются два фундаментальных приема [1]:

  1. Введение базовой оценки (baseline) b(s_t): Вычитание константы или функции состояния из возврата не смещает градиент, но радикально снижает дисперсию. В качестве b(s_t) используется функция ценности V(s_t).
  2. Учет причинности (Causality): Действие в момент t не может повлиять на награду, полученную до этого момента. Поэтому вместо R(\tau) используется возврат с текущего шага (reward-to-go): \hat{R}_t = \sum_{k=t}^T \gamma^{k-t} r_k.

Модифицированная оценка градиента принимает вид: \nabla_\theta J(\theta) \approx \frac{1}{N} \sum_{i=1}^N \sum_{t=0}^T \nabla_\theta \log \pi_\theta(a_{i,t}|s_{i,t}) \left( \hat{R}_{i,t} - b(s_{i,t}) \right), где N — размер батча траекторий.

Пошаговая логика вычислений

В современной практике чистый PG (алгоритм REINFORCE [1]) практически не применяется из-за неэффективности использования данных. Стандартом вычислений является вариация с обобщенной оценкой преимущества (Generalized Advantage Estimation, GAE) [1]. Логика вычислений в рамках одного эпохального обновления:

  1. Сбор данных. В симуляторе параллельно генерируется N траекторий с помощью текущей политики \pi_\theta. Фиксируется последовательность (s_t, a_t, r_t, s_{t+1}).
  2. Вычисление TD-ошибок (Temporal Difference). На каждом шаге вычисляется \delta_t = r_t + \gamma V_\phi(s_{t+1}) - V_\phi(s_t), где V_\phi — функция ценности (критик), обучаемая параллельно методом градиентного спуска по среднеквадратичной ошибке.
  3. Расчет преимущества (Advantage). Вычисляется экспоненциально взвешенная сумма TD-ошибок:

\hat{A}_t^{\text{GAE}(\gamma, \lambda)} = \sum_{l=0}^{T-t} (\gamma \lambda)^l \delta_{t+l}. Параметр \lambda \in [0, 1] управляет компромиссом между смещением (bias) и дисперсией. При \lambda=0 оценка зависит только от одного шага (низкая дисперсия, высокое смещение), при \lambda=1 вырождается в оценку Монте-Карло (нулевой bias, высокая дисперсия). В робототехнике типичное значение \lambda = 0.95.

  1. Формирование loss-функции. Поскольку оптимизаторы в фреймворках глубокого обучения минимизируют функцию потерь, градиентный подъем заменяется на спуск:

L_{\text{PG}}(\theta) = -\frac{1}{N \cdot T} \sum_{i=1}^N \sum_{t=0}^T \log \pi_\theta(a_{i,t}|s_{i,t}) \hat{A}_{i,t}.

  1. Обновление весов. Вычисляется \nabla_\theta L_{\text{PG}} и делается шаг оптимизатора (например, Adam).

Ограничения и практика

Фундаментальное ограничение базового Policy Gradient — неспособность гарантировать монотонное улучшение политики при нетривиальном размере шага обучения. В задачах с жесткими физическими ограничениями (ограничения на тяговые моменты, рабочие области) произвольное изменение \theta может вывести распределение \pi_\theta за пределы устойчивого многообразия. В симуляторе это приводит к расхождению контактного решателя, на реальном оборудовании — к аварийному останову (E-stop) из-за превышения пороговых значений токов.

По этой причине наивный PG заменяется алгоритмами с доверительными областями (Trust Region Policy Optimization, TRPO) или клиппированием вероятностей (Proximal Policy Optimization, PPO) [1]. В PPO целевая функция модифицируется ограничителем: L^{\text{CLIP}}(\theta) = \mathbb{E}_t \left[ \min\left( \rho_t(\theta) \hat{A}_t, \, \text{clip}(\rho_t(\theta), 1-\epsilon, 1+\epsilon) \hat{A}_t \right) \right], где \rho_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{\text{old}}}(a_t|s_t)}, а \epsilon (обычно 0.1 или 0.2) жестко ограничивает отношение новых вероятностей к старым. Это предотвращает разрушительные обновления весов.

С инженерной точки зрения PG-методы (в лице PPO) обладают критически низкой выборочной эффективностью (sample efficiency). Обучение контроллера пошагового перемещения манипулятора требует десятков миллионов кадров симуляции. Проблема усугубляется разрывом симуляции и реальности (sim-to-real gap): неточности моделирования трения скольжения и упругих деформаций приводят к тому, что политика, оптимизированная в градиенте симулятора, на реальном объекте теряет устойчивость. Практическим решением является инъекция доменного шума (Domain Randomization) в параметры физического движка на этапе сбора траекторий для PG, что делает градиент робастным к вариациям физических констант [1].

Примечания

Литература

  • Sutton R. S. et al. Reinforcement learning: An introduction. — Cambridge: MIT press, 1998. — Т. 1. — № 1.
  • Greensmith E., Bartlett P. L., Baxter J. Variance reduction techniques for gradient estimates in reinforcement learning // Journal of Machine Learning Research. — 2004. — Т. 5. — № Nov..
  • Williams R. J. Simple statistical gradient-following algorithms for connectionist reinforcement learning // Machine learning. — 1992. — Т. 8. — № 3.
  • Kochenderfer M. J., Wheeler T. A., Wray K. H. Algorithms for decision making. — MIT press, 2022.
  • Jin R., Li S., Wang B. On stationary point convergence of PPO-Clip // International Conference on Learning Representations. — 2024. — Т. 2024.
  • Tobin J. et al. Domain randomization for transferring deep neural networks from simulation to the real world // 2017 IEEE/RSJ international conference on intelligent robots and systems (IROS). — IEEE, 2017.
Личные инструменты