Fetching the paper…
Reading the bibliography…
Mobile agents have attracted tremendous research participation recently.
MiniVLM: A Smaller and Faster Vision-Language Model
Jianfeng Wang, Xiaowei Hu, Pengchuan Zhang, Xiujun Li, Lijuan Wang, Lei Zhang, Jianfeng Gao, and Zicheng Liu. 2021 · 2012
Earlier work this paper cites.
Communication-efficient learning of deep networks from decentralized data. In Artificial intelligence and statistics . PMLR, 1273–1282
Brendan McMahan, Eider Moore, Daniel Ramage, Seth Hampson, and Blaise Aguera y Arcas. 2017 · 2017
Earlier work this paper cites.
Measuring the effects of non-identical data distribution for federated visual classification
Tzu-Ming Harry Hsu, Hang Qi, and Matthew Brown. 2019 · 2019
Earlier work this paper cites.
Scaffold: Stochastic controlled averaging for federated learning. In International Conference on Machine Learning . PMLR, 5132–5143
Sai Praneeth Karimireddy, Satyen Kale, Mehryar Mohri, Sashank Reddi, Sebastian Stich, and Ananda Theertha Suresh. 2020 · 2020
Earlier work this paper cites.
Federated optimization in heterogeneous networks
Tian Li, Anit Kumar Sahu, Manzil Zaheer, Maziar Sanjabi, Ameet Talwalkar, and Virginia Smith. 2020 · 2020
Earlier work this paper cites.
Adaptive Federated Optimization. In International Conference on Learning Representations
Sashank J Reddi, Zachary Charles, Manzil Zaheer, Zachary Garrett, Keith Rush, Jakub Konečnỳ, Sanjiv Kumar, and Hugh Brendan McMahan. 2020 · 2020
Earlier work this paper cites.
LoRA: Low-Rank Adaptation of Large Language Models. In ICLR
Edward J Hu, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, Weizhu Chen, et al · 2021
Earlier work this paper cites.
Woojeong Jin, Yu Cheng, Yelong Shen, Weizhu Chen, and Xiang Ren. 2021 · 2021
Earlier work this paper cites.
TEA-fed: time-efficient asynchronous federated learning for edge computing. In Proceedings of the 18th ACM international conference on computing frontiers . 30–37
Chendi Zhou, Hao Tian, Hong Zhang, Jin Zhang, Mianxiong Dong, and Juncheng Jia. 2021 · 2021
Earlier work this paper cites.
Rethinking architecture design for tackling data heterogeneity in federated learning. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition . 10061–10071
Liangqiong Qu, Yuyin Zhou, Paul Pu Liang, Yingda Xia, Feifei Wang, Ehsan Adeli, Li Fei-Fei, and Daniel Rubin. 2022 · 2022
Earlier work this paper cites.
Learning to prompt for vision-language models
Kaiyang Zhou, Jingkang Yang, Chen Change Loy, and Ziwei Liu. 2022 · 2022
Earlier work this paper cites.
CogAgent: A Visual Language Model for GUI Agents
Wenyi Hong, Weihan Wang, Qingsong Lv, Jiazheng Xu, Wenmeng Yu, Junhui Ji, Yan Wang, Zihan Wang, Yuxuan Zhang, Juanzi Li, Bin Xu, Yuxiao Dong, Ming Ding, and Jie Tang. 2023 · 2023
Earlier work this paper cites.
Weirui Kuang, Bingchen Qian, Zitao Li, Daoyuan Chen, Dawei Gao, Xuchen Pan, Yuexiang Xie, Yaliang Li, Bolin Ding, and Jingren Zhou. 2023 · 2023
Earlier work this paper cites.
GPT-4: A Large-Scale Multimodal Model
OpenAI. 2023 · 2023
Earlier work this paper cites.
Android in the Wild: A Large-Scale Dataset for Android Device Control
Christopher Rawles, Alice Li, Daniel Rodriguez, Oriana Riva, and Timothy Lillicrap. 2023 · 2023
Earlier work this paper cites.
Heterogeneous federated learning: State-of-the-art and research challenges
Mang Ye, Xiuwen Fang, Bo Du, Pong C Yuen, and Dacheng Tao. 2023 · 2023
Earlier work this paper cites.
DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning
Hao Bai, Yifei Zhou, Mert Cemri, Jiayi Pan, Alane Suhr, Sergey Levine, and Aviral Kumar. 2024 · 2024
Cited alongside, same era.
The Phantom Menace: Unmasking Privacy Leakages in Vision-Language Models
Simone Caldarella, Massimiliano Mancini, Elisa Ricci, and Rahaf Aljundi. 2024 · 2024
Cited alongside, same era.
Octopus v2: On-device language model for super agent
Wei Chen and Zhiyuan Li. 2024 · 2024
Cited alongside, same era.
Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition . 24185–24198
Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, et al · 2024
Cited alongside, same era.
Privacy-Aware Visual Language Models
Laurens Samson, Nimrod Barazani, Sennay Ghebreab, and Yuki M. Asano. 2024 · 2024
Later among the works it cites.
OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis
Qiushi Sun, Kanzhi Cheng, Zichen Ding, Chuanyang Jin, Yian Wang, Fangzhi Xu, Zhenyu Wu, Chengyou Jia, Liheng Chen, Zhoumianze Liu, Ben Kao, Guohao Li, Junxian He, Yu Qiao, and Zhiyong Wu. 2024 · 2024
Later among the works it cites.
Qwen2-VL: Enhancing Vision-Language Model’s Perception of the World at Any Resolution
Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Yang Fan, Kai Dang, Mengfei Du, Xuancheng Ren, Rui Men, Dayiheng Liu, Chang Zhou, Jingren Zhou, and Junyang Lin. 2024a · 2024
Later among the works it cites.
KnowledgeSG: Privacy-Preserving Synthetic Text Generation with Knowledge Distillation from Server. In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , Yaser Al-Onaizan, Mohit Bansal, and Yun-Nung Chen (Eds.). Association for Computational Linguistics, Miami, Florida, USA, 7677–7695
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Shengwen Ding and Chenhui Hu. 2024 · 2024
Cited alongside, same era.
Training a Vision Language Model as Smartphone Assistant
Nicolai Dorka, Janusz Marecki, and Ammar Anwar. 2024 · 2024
Cited alongside, same era.
MobileViews: A Large-Scale Mobile GUI Dataset
Longxi Gao, Li Zhang, Shihe Wang, Shangguang Wang, Yuanchun Li, and Mengwei Xu. 2024 · 2024
Cited alongside, same era.
Déjà Vu Memorization in Vision-Language Models
Bargav Jayaraman, Chuan Guo, and Kamalika Chaudhuri. 2024 · 2024
Cited alongside, same era.
Dordis: Efficient Federated Learning with Dropout-Resilient Differential Privacy. In Proceedings of the Nineteenth European Conference on Computer Systems . 472–488
Zhifeng Jiang, Wei Wang, and Ruichuan Chen. 2024 · 2024
Cited alongside, same era.
Filling the missing: Exploring generative AI for enhanced federated learning over heterogeneous mobile edge devices
Peichun Li, Hanwen Zhang, Yuan Wu, Liping Qian, Rong Yu, Dusit Niyato, and Xuemin Shen. 2024c · 2024
Cited alongside, same era.
AutoGLM: Autonomous Foundation Agents for GUIs
Xiao Liu, Bo Qin, Dongzhu Liang, Guang Dong, Hanyu Lai, Hanchen Zhang, Hanlin Zhao, Iat Long Iong, Jiadai Sun, Jiaqi Wang, Junjie Gao, Junjun Shan, Kangning Liu, Shudan Zhang, Shuntian Yao, Siyi Cheng, Wentao Yao, Wenyi Zhao, Xinghan Liu, Xinyi Liu, Xinying Chen, Xinyue Yang, Yang Yang, Yifan Xu, Yu Yang, Yujia Wang, Yulin Xu, Zehan Qi, Yuxiao Dong, and Jie Tang. 2024 · 2024
Cited alongside, same era.
DeepSeek-VL: Towards Real-World Vision-Language Understanding
Haoyu Lu, Wen Liu, Bo Zhang, Bingxuan Wang, Kai Dong, Bo Liu, Jingxiang Sun, Tongzheng Ren, Zhuoshu Li, Hao Yang, Yaofeng Sun, Chengqi Deng, Hanwei Xu, Zhenda Xie, and Chong Ruan. 2024 · 2024
Cited alongside, same era.
WenHao Wang, Xiaoyu Liang, Rui Ye, Jingyi Chai, Siheng Chen, and Yanfeng Wang. 2024c · 2024
Later among the works it cites.
FedBiOT: LLM Local Fine-tuning in Federated Learning without Full Model. In Proceedings of the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining . 3345–3355
Feijie Wu, Zitao Li, Yaliang Li, Bolin Ding, and Jing Gao. 2024 · 2024
Later among the works it cites.
Ferrari: A personalized federated learning framework for heterogeneous edge clients
Zhiwei Yao, Jianchun Liu, Hongli Xu, Lun Wang, Chen Qian, and Yunming Liao. 2024 · 2024
Later among the works it cites.
Privacy-Preserving Instructions for Aligning Large Language Models
Da Yu, Peter Kairouz, Sewoong Oh, and Zheng Xu. 2024 · 2024
Later among the works it cites.
Vision-Language Models for Vision Tasks: A Survey
Jingyi Zhang, Jiaxing Huang, Sheng Jin, and Shijian Lu. 2024a · 2024
Later among the works it cites.
SWIFT:A Scalable lightWeight Infrastructure for Fine-Tuning
Yuze Zhao, Jintao Huang, Jinghan Hu, Xingjun Wang, Yunlin Mao, Daoze Zhang, Zeyinzi Jiang, Zhikai Wu, Baole Ai, Ang Wang, Wenmeng Zhou, and Yingda Chen. 2024 · 2024
Later among the works it cites.
WebArena: A Realistic Web Environment for Building Autonomous Agents
Shuyan Zhou, Frank F. Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig. 2024 · 2024
Later among the works it cites.
Federated Sketching LoRA: On-Device Collaborative Fine-Tuning of Large Language Models
Wenzhi Fang, Dong-Jun Han, Liangqi Yuan, Seyyedali Hosseinalipour, and Christopher G. Brinton. 2025 · 2025
Closest in time.
LLM-Powered GUI Agents in Phone Automation: Surveying Progress and Prospects
William Liu, Liang Liu, Yaxuan Guo, Han Xiao, Weifeng Lin, Yuxiang Chai, Shuai Ren, Xiaoyu Liang, Linghao Li, Wenhao Wang, Tianze Wu, Yong Liu, Hao Wang, Hongsheng Li, and Guanjing Xiong. 2025 · 2025
Closest in time.
AppVLM: A Lightweight Vision Language Model for Online App Control
Georgios Papoudakis, Thomas Coste, Zhihao Wu, Jianye Hao, Jun Wang, and Kun Shao. 2025 · 2025
Closest in time.
FedMobileAgent: Training Mobile Agents Using Decentralized Self-Sourced Data from Diverse Users
Wenhao Wang, Zijie Yu, William Liu, Rui Ye, Tian Jin, Siheng Chen, and Yanfeng Wang. 2025 · 2025
Closest in time.
Pilot: Building the Federated Multimodal Instruction Tuning Framework
Baochen Xiong, Xiaoshan Yang, Yaguang Song, Yaowei Wang, and Changsheng Xu. 2025 · 2025
Closest in time.