Fetching the paper…
Reading the bibliography…
Vision-Language-Action (VLA) models demonstrate significant potential for developing generalized policies in real-world robotic control.
Playing Atari with Deep Reinforcement Learning
Mnih, V.; Kavukcuoglu, K.; Silver, D.; Graves, A.; Antonoglou, I.; Wierstra, D.; and Riedmiller, M. 2013 · 2013
Earlier work this paper cites.
Asynchronous Methods for Deep Reinforcement Learning
Mnih, V.; Badia, A. P.; Mirza, M.; Graves, A.; Lillicrap, T. P.; Harley, T.; Silver, D.; and Kavukcuoglu, K. 2016 · 2016
Earlier work this paper cites.
Rainbow: Combining Improvements in Deep Reinforcement Learning
Hessel, M.; Modayil, J.; van Hasselt, H.; Schaul, T.; Ostrovski, G.; Dabney, W.; Horgan, D.; Piot, B.; Azar, M.; and Silver, D. 2017 · 2017
Earlier work this paper cites.
Addressing Function Approximation Error in Actor-Critic Methods
Fujimoto, S.; van Hoof, H.; and Meger, D. 2018 · 2018
Earlier work this paper cites.
Recurrent Experience Replay in Distributed Reinforcement Learning
Kapturowski, S.; Ostrovski, G.; Dabney, W.; Quan, J.; and Munos, R. 2019 · 2019
Earlier work this paper cites.
Outracing champion Gran Turismo drivers with deep reinforcement learning
Wurman, P. R.; Barrett, S.; Kawamoto, K.; MacGlashan, J.; Subramanian, K.; Walsh, T. J.; Capobianco, R.; Devlic, A.; Eckert, F.; Fuchs, F.; et al. 2022 · 2022
Earlier work this paper cites.
Kosmos-2: Grounding Multimodal Large Language Models to the World
Peng, Z.; Wang, W.; Dong, L.; Hao, Y.; Huang, S.; Ma, S.; and Wei, F. 2023 · 2023
Earlier work this paper cites.
Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation
Wu, H.; Jing, Y.; Cheang, C.; Chen, G.; Xu, J.; Li, X.; Liu, M.; Li, H.; and Kong, T. 2023 · 2023
Earlier work this paper cites.
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
Zhao, T. Z.; Kumar, V.; Levine, S.; and Finn, C. 2023 · 2023
Earlier work this paper cites.
π 0 \pi_{0} : A Vision-Language-Action Flow Model for General Robot Control
Black, K.; Brown, N.; Driess, D.; Esmail, A.; Equi, M.; Finn, C.; Fusai, N.; Groom, L.; Hausman, K.; Ichter, B.; Jakubczak, S.; Jones, T.; Ke, L.; Levine, S.; Li-Bell, A.; Mothukuri, M.; Nair, S.; Pertsch, K.; Shi, L. X.; Tanner, J.; Vuong, Q.; Walling, A.; Wang, H.; and Zhilinsky, U. 2024 · 2024
Earlier work this paper cites.
GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation
Cheang, C.-L.; Chen, G.; Jing, Y.; Kong, T.; Li, H.; Li, Y.; Liu, Y.; Wu, H.; Xu, J.; Yang, Y.; Zhang, H.; and Zhu, M. 2024 · 2024
Earlier work this paper cites.
To Err is Robotic: Rapid Value-Based Trial-and-Error during Deployment
Du, M.; Khazatsky, A.; Gerstenberg, T.; and Finn, C. 2024 · 2024
Cited alongside, same era.
FLaRe: Achieving Masterful and Adaptive Robot Policies with Large-Scale Reinforcement Learning Fine-Tuning
Hu, J.; Hendrix, R.; Farhadi, A.; Kembhavi, A.; Martin-Martin, R.; Stone, P.; Zeng, K.-H.; and Ehsani, K. 2024 · 2024
Cited alongside, same era.
OpenVLA: An Open-Source Vision-Language-Action Model
Kim, M. J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E.; Lam, G.; Sanketi, P.; Vuong, Q.; Kollar, T.; Burchfiel, B.; Tedrake, R.; Sadigh, D.; Levine, S.; Liang, P.; and Finn, C. 2024 · 2024
Cited alongside, same era.
Towards Generalist Robot Policies: What Matters in Building Vision-Language-Action Models
Li, X.; Li, P.; Liu, M.; Wang, D.; Liu, J.; Kang, B.; Ma, X.; Kong, T.; Zhang, H.; and Liu, H. 2024 · 2024
Cited alongside, same era.
Reinforcement Learning with Action Chunking
Li, Q.; Zhou, Z.; and Levine, S. 2025 · 2025
Closest in time.
What Can RL Bring to VLA Generalization? An Empirical Study
Liu, J.; Gao, F.; Wei, B.; Chen, X.; Liao, Q.; Wu, Y.; Yu, C.; and Wang, Y. 2025 · 2025
Closest in time.
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
NVIDIA; :; Bjorck, J.; Castañeda, F.; Cherniadev, N.; Da, X.; Ding, R.; Fan, L. J.; Fang, Y.; Fox, D.; Hu, F.; Huang, S.; Jang, J.; Jiang, Z.; Kautz, J.; Kundalia, K.; Lao, L.; Li, Z.; Lin, Z.; Lin, K.; Liu, G.; Llontop, E.; Magne, L.; Mandlekar, A.; Narayan, A.; Nasiriany, S.; Reed, S.; Tan, Y. L.; Wang, G.; Wang, Z.; Wang, J.; Wang, Q.; Xiang, J.; Xie, Y.; Xu, Y.; Xu, Z.; Ye, S.; Yu, Z.; Zhang, A.; Zhang, H.; Zhao, Y.; Zheng, R.; and Zhu, Y. 2025 · 2025
Closest in time.
FAST: Efficient Action Tokenization for Vision-Language-Action Models
Pertsch, K.; Stachowicz, K.; Ichter, B.; Driess, D.; Nair, S.; Vuong, Q.; Mees, O.; Finn, C.; and Levine, S. 2025 · 2025
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Luo, J.; Xu, C.; Wu, J.; and Levine, S. 2024 · 2024
Cited alongside, same era.
GRAPE: Generalizing Robot Policy via Preference Alignment
Zhang, Z.; Zheng, K.; Chen, Z.; Jang, J.; Li, Y.; Wang, C.; Ding, M.; Fox, D.; and Yao, H. 2024 · 2024
Cited alongside, same era.
AgiBot-World-Contributors; Bu, Q.; Cai, J.; Chen, L.; Cui, X.; Ding, Y.; Feng, S.; Gao, S.; He, X.; Hu, X.; Huang, X.; Jiang, S.; Jiang, Y.; Jing, C.; Li, H.; Li, J.; Liu, C.; Liu, Y.; Lu, Y.; Luo, J.; Luo, P.; Mu, Y.; Niu, Y.; Pan, Y.; Pang, J.; Qiao, Y.; Ren, G.; Ruan, C.; Shan, J.; Shen, Y.; Shi, C.; Shi, M.; Shi, M.; Sima, C.; Song, J.; Wang, H.; Wang, W.; Wei, D.; Xie, C.; Xu, G.; Yan, J.; Yang, C.; Yang, L.; Yang, S.; Yao, M.; Zeng, J.; Zhang, C.; Zhang, Q.; Zhao, B.; Zhao, C.; Zhao, J.; and Zhu, J. 2025 · 2025
Cited alongside, same era.
Hume: Introducing System-2 Thinking in Visual-Language-Action Model
Authors, A. 2025 · 2025
Cited alongside, same era.
ConRFT: A Reinforced Fine-tuning Method for VLA Models via Consistency Policy
Chen, Y.; Tian, S.; Liu, S.; Zhou, Y.; Li, H.; and Zhao, D. 2025 · 2025
Cited alongside, same era.
Improving Vision-Language-Action Model with Online Reinforcement Learning
Guo, Y.; Zhang, J.; Chen, X.; Ji, X.; Wang, Y.-J.; Hu, Y.; and Chen, J. 2025 · 2025
Cited alongside, same era.
TOP-ERL: Transformer-based Off-Policy Episodic Reinforcement Learning
Li, G.; Tian, D.; Zhou, H.; Jiang, X.; Lioutikov, R.; and Neumann, G. 2025 · 2025
Cited alongside, same era.
Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance
Nakamoto, M.; Mees, O.; Kumar, A.; and Levine, S. 2024a
Cited in the paper.
Closest in time.
SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model
Qu, D.; Song, H.; Chen, Q.; Yao, Y.; Ye, X.; Ding, Y.; Wang, Z.; Gu, J.; Zhao, B.; Wang, D.; and Li, X. 2025 · 2025
Closest in time.
Reinforcement Learning with Action Sequence for Data-Efficient Robot Learning
Seo, Y.; and Abbeel, P. 2025 · 2025
Closest in time.
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models
Shi, L. X.; Ichter, B.; Equi, M.; Ke, L.; Pertsch, K.; Vuong, Q.; Tanner, J.; Walling, A.; Wang, H.; Fusai, N.; Li-Bell, A.; Driess, D.; Groom, L.; Levine, S.; and Finn, C. 2025 · 2025
Closest in time.
RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback
Shu, J.; Lin, Z.; and Wang, Y. 2025 · 2025
Closest in time.
Interactive Post-Training for Vision-Language-Action Models
Tan, S.; Dou, K.; Zhao, Y.; and Krähenbühl, P. 2025 · 2025
Closest in time.
Chunking the Critic: A Transformer-based Soft Actor-Critic with N-Step Returns
Tian, D.; Li, G.; Zhou, H.; Celik, O.; and Neumann, G. 2025 · 2025
Closest in time.