Fetching the paper…
Reading the bibliography…
We study offline off-dynamics reinforcement learning (RL) to utilize data from an easily accessible source domain to enhance policy learning in a target domain with limited data.
A survey on transfer learning
Sinno Jialin Pan and Qiang Yang · 2009
Earlier work this paper cites.
Virtual to real reinforcement learning for autonomous driving
Xinlei Pan, Yurong You, Ziyan Wang, and Cewu Lu · 2017
Earlier work this paper cites.
Attention is all you need
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, Łukasz Kaiser, and Illia Polosukhin · 2017
Earlier work this paper cites.
Optimal treatment allocations in space and time for on-line control of an emerging infectious disease
Eric B Laber, Nick J Meyer, Brian J Reich, Krishna Pacifici, Jaime A Collazo, and John M Drake · 2018
Earlier work this paper cites.
Reinforcement learning and control as probabilistic inference: Tutorial and review
Sergey Levine · 2018
Earlier work this paper cites.
Off-policy deep reinforcement learning without exploration
Scott Fujimoto, David Meger, and Doina Precup · 2019
Earlier work this paper cites.
Stabilizing off-policy q-learning via bootstrapping error reduction
Aviral Kumar, Justin Fu, Matthew Soh, George Tucker, and Sergey Levine · 2019
Earlier work this paper cites.
Advantage-weighted regression: Simple and scalable off-policy reinforcement learning
Xue Bin Peng, Aviral Kumar, Grace Zhang, and Sergey Levine · 2019
Earlier work this paper cites.
Off-dynamics reinforcement learning: Training for transfer with domain classifiers
Benjamin Eysenbach, Swapnil Asawa, Shreyas Chaudhari, Sergey Levine, and Ruslan Salakhutdinov · 2020
Earlier work this paper cites.
D4rl: Datasets for deep data-driven reinforcement learning
Justin Fu, Aviral Kumar, Ofir Nachum, George Tucker, and Sergey Levine · 2020
Earlier work this paper cites.
Conservative q-learning for offline reinforcement learning
Aviral Kumar, Aurick Zhou, George Tucker, and Sergey Levine · 2020
Earlier work this paper cites.
Offline reinforcement learning: Tutorial, review, and perspectives on open problems
Sergey Levine, Aviral Kumar, George Tucker, and Justin Fu · 2020
Earlier work this paper cites.
Mopo: Model-based offline policy optimization
Tianhe Yu, Garrett Thomas, Lantao Yu, Stefano Ermon, James Y Zou, Sergey Levine, Chelsea Finn, and Tengyu Ma · 2020
Cited alongside, same era.
Decision transformer: Reinforcement learning via sequence modeling
Lili Chen, Kevin Lu, Aravind Rajeswaran, Kimin Lee, Aditya Grover, Misha Laskin, Pieter Abbeel, Aravind Srinivas, and Igor Mordatch · 2021
Cited alongside, same era.
Rvs: What is essential for offline rl via supervised learning?
Scott Emmons, Benjamin Eysenbach, Ilya Kostrikov, and Sergey Levine · 2021
Cited alongside, same era.
Simgan: Hybrid simulator identification for domain adaptation via adversarial reinforcement learning
Yifeng Jiang, Tingnan Zhang, Daniel Ho, Yunfei Bai, C Karen Liu, Sergey Levine, and Jie Tan · 2021
Cited alongside, same era.
When does return-conditioned supervised learning work for offline reinforcement learning?
David Brandfonbrener, Alberto Bietti, Jacob Buckman, Romain Laroche, and Joan Bruna · 2022
Cited alongside, same era.
Beyond ood state actions: Supported cross-domain offline reinforcement learning
Jinxin Liu, Ziqi Zhang, Zhenyu Wei, Zifeng Zhuang, Yachen Kang, Sibo Gai, and Donglin Wang · 2024
Closest in time.
Distributionally robust off-dynamics reinforcement learning: Provable efficiency with linear function approximation
Zhishuai Liu and Pan Xu · 2024
Closest in time.
Return augmented decision transformer for off-dynamics reinforcement learning
Ruhan Wang, Yu Yang, Zhishuai Liu, Dongruo Zhou, and Pan Xu · 2024
Closest in time.
Contrastive representation for data filtering in cross-domain offline reinforcement learning
Xiaoyu Wen, Chenjia Bai, Kang Xu, Xudong Yu, Yang Zhang, Xuelong Li, and Zhen Wang · 2024
Closest in time.
Cross-domain policy adaptation via value-guided data filtering
Kang Xu, Chenjia Bai, Xiaoteng Ma, Dong Wang, Bin Zhao, Zhen Wang, Xuelong Li, and Wei Li · 2024
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Dara: Dynamics-aware reward augmentation in offline reinforcement learning
Jinxin Liu, Hongyin Zhang, and Donglin Wang · 2022
Cited alongside, same era.
When to trust your simulator: Dynamics-aware hybrid offline-and-online reinforcement learning
Haoyi Niu, Yiwen Qiu, Ming Li, Guyue Zhou, Jianming Hu, Xianyuan Zhan, et al · 2022
Cited alongside, same era.
Prompting decision transformer for few-shot policy generalization
Mengdi Xu, Yikang Shen, Shun Zhang, Yuchen Lu, Ding Zhao, Joshua Tenenbaum, and Chuang Gan · 2022
Cited alongside, same era.
Online decision transformer
Qinqing Zheng, Amy Zhang, and Aditya Grover · 2022
Cited alongside, same era.
Cross-domain policy adaptation with dynamics alignment
Haiyuan Gui, Shanchen Pang, Shihang Yu, Sibo Qiao, Yufeng Qi, Xiao He, Min Wang, and Xue Zhai · 2023
Cited alongside, same era.
Deep spatial q-learning for infectious disease control
Zhishuai Liu, Jesse Clifton, Eric B Laber, John Drake, and Ethan X Fang · 2023
Cited alongside, same era.
Q-value regularized transformer for offline reinforcement learning
Shengchao Hu, Ziqing Fan, Chaoqin Huang, Li Shen, Ya Zhang, Yanfeng Wang, and Dacheng Tao · 2024
Cited alongside, same era.
State regularized policy optimization on data with dynamics shift
Zhenghai Xue, Qingpeng Cai, Shuchang Liu, Dong Zheng, Peng Jiang, Kun Gai, and Bo An · 2024
Closest in time.
Reinformer: Max-return sequence modeling for offline rl
Zifeng Zhuang, Dengyun Peng, Ziqi Zhang, Donglin Wang, et al · 2024
Closest in time.
Off-dynamics reinforcement learning via domain adaptation and reward augmented imitation
Yihong Guo, Yixuan Wang, Yuanyuan Shi, Pan Xu, and Anqi Liu · 2025
Closest in time.
Data fusion-enhanced decision transformer for stable cross-domain generalization
Guojian Wang, Quinson Hon, Xuyang Chen, and Lin Zhao · 2025
Closest in time.
Pre-trained language models improve the few-shot prompt ability of decision transformer
Yu Yang and Pan Xu · 2025
Closest in time.
MOBODY: Model-based off-dynamics offline reinforcement learning
Yihong Guo, Yu Yang, Pan Xu, and Anqi Liu · 2026
Closest in time.