Fetching the paper…
Reading the bibliography…
New era has unlocked exciting possibilities for extending Large Language Models (LLMs) to tackle 3D vision-language tasks.
“Bleu: a method for automatic evaluation of machine translation,”
Kishore Papineni, Salim Roukos, Todd Ward, and Wei-Jing Zhu, · 2002
Earlier work this paper cites.
“Rouge: A package for automatic evaluation of summaries,”
Chin-Yew Lin, · 2004
Earlier work this paper cites.
“Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,”
Satanjeev Banerjee and Alon Lavie, · 2005
Earlier work this paper cites.
“Least absolute relative error estimation,”
Kani Chen, Shaojun Guo, Yuanyuan Lin, and Zhiliang Ying, · 2010
Earlier work this paper cites.
“Cider: Consensus-based image description evaluation,”
Ramakrishna Vedantam, C Lawrence Zitnick, and Devi Parikh, · 2015
Earlier work this paper cites.
“Scannet: Richly-annotated 3d reconstructions of indoor scenes,”
Angela Dai, Angel X Chang, Manolis Savva, Maciej Halber, Thomas Funkhouser, and Matthias Nießner, · 2017
Earlier work this paper cites.
“Pointnet++: Deep hierarchical feature learning on point sets in a metric space,”
Charles Ruizhongtai Qi, Li Yi, Hao Su, and J Guibas, · 2017
Earlier work this paper cites.
“Deep hough voting for 3d object detection in point clouds,”
Charles R Qi, Or Litany, Kaiming He, and J Guibas, · 2019
Earlier work this paper cites.
“Scanrefer: 3d object localization in rgb-d scans using natural language,”
Dave Zhenyu Chen, Angel X Chang, and Matthias Nießner, · 2020
Earlier work this paper cites.
“Scan2cap: Context-aware dense captioning in rgb-d scans,”
Zhenyu Chen, Ali Gholami, et al., · 2021
Earlier work this paper cites.
“Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,”
Junnan Li, Dongxu Li, Caiming Xiong, and Steven Hoi, · 2022
Earlier work this paper cites.
“Scanqa: 3d question answering for spatial scene understanding,”
Daichi Azuma, Taiki Miyanishi, Shuhei Kurita, and Motoaki Kawanabe, · 2022
Earlier work this paper cites.
“Sqa3d: Situated question answering in 3d scenes,”
Xiaojian Ma, Silong Yong, Zilong Zheng, Qing Li, Yitao Liang, Song-Chun Zhu, and Siyuan Huang, · 2022
Cited alongside, same era.
“Opt: Open pre-trained transformer language models,”
Susan Zhang, Stephen Roller, Naman Goyal, Mikel Artetxe, Moya Chen, Shuohui Chen, Christopher Dewan, Mona Diab, Xian Li, Xi Victoria Lin, et al., · 2022
Cited alongside, same era.
“3d-llm: Injecting the 3d world into large language models,”
Yining Hong, Haoyu Zhen, Peihao Chen, Shuhong Zheng, et al., · 2023
Cited alongside, same era.
“Chat-3d v2: Bridging 3d scene and large language models with object identifiers,”
Haifeng Huang, Zehan Wang, Rongjie Huang, Luping Liu, Xize Cheng, et al., · 2023
Cited alongside, same era.
“M3dbench: Let’s instruct large models with multi-modal 3d prompts,”
“Physically grounded vision-language models for robotic manipulation,”
Jensen Gao, Bidipta Sarkar, Fei Xia, Ted Xiao, Jiajun Wu, Brian Ichter, Anirudha Majumdar, and Dorsa Sadigh, · 2024
Later among the works it cites.
“Vr-gpt: Visual language model for intelligent virtual reality applications,”
Mikhail Konenkov, Artem Lykov, Daria Trinitatova, and Dzmitry Tsetserukou, · 2024
Later among the works it cites.
“Llplace: The 3d indoor scene layout generation and editing via large language model,”
Yixuan Yang, Junru Lu, Zixiang Zhao, et al., · 2024
Later among the works it cites.
“Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning,”
Sijin Chen, Xin Chen, Chi Zhang, Mingsheng Li, et al., · 2024
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Mingsheng Li, Xin Chen, Chi Zhang, Sijin Chen, Hongyuan Zhu, Fukun Yin, Gang Yu, and Tao Chen, · 2023
Cited alongside, same era.
“Multi3drefer: Grounding text description to multiple 3d objects,”
Yiming Zhang, ZeMing Gong, and Angel X Chang, · 2023
Cited alongside, same era.
“3d-vista: Pre-trained transformer for 3d vision and text alignment,”
Ziyu Zhu, Xiaojian Ma, Yixin Chen, Zhidong Deng, Siyuan Huang, and Qing Li, · 2023
Cited alongside, same era.
“Llm-grounder: Open-vocabulary 3d visual grounding with large language model as an agent,”
Jianing Yang, Xuweiyi Chen, Shengyi Qian, Nikhil Madaan, et al., · 2023
Cited alongside, same era.
“Llama 2: Open foundation and fine-tuned chat models,”
Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al., · 2023
Cited alongside, same era.
“Visual instruction tuning,”
Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee, · 2024
Cited alongside, same era.
“3dmit: 3d multi-modal instruction tuning for scene understanding,”
Zeju Li, Chao Zhang, Xiaoyan Wang, Ruilong Ren, Yifan Xu, Ruifei Ma, Xiangde Liu, and Rong Wei, · 2024
Cited alongside, same era.
“An embodied generalist agent in 3d world,”
Jiangyong Huang, Silong Yong, Xiaojian Ma, Xiongkun Linghu, et al., · 2024
Cited alongside, same era.
Yilun Chen, Shuai Yang, Haifeng Huang, Tai Wang, et al., · 2024
Later among the works it cites.
“Spatialrgpt: Grounded spatial reasoning in vision language model,”
An-Chieh Cheng, Hongxu Yin, Yang Fu, Qiushan Guo, Ruihan Yang, and ohters, · 2024
Later among the works it cites.
“Spatialvlm: Endowing vision-language models with spatial reasoning capabilities,”
Boyuan Chen, Zhuo Xu, Sean Kirmani, Brain Ichter, Dorsa Sadigh, et al., · 2024
Later among the works it cites.
“Mmscan: A multi-modal 3d scene dataset with hierarchical grounded language annotations,”
Ruiyuan Lyu, Tai Wang, Jingli Lin, Shuai Yang, Xiaohan Mao, Yilun Chen, Runsen Xu, Haifeng Huang, Chenming Zhu, Dahua Lin, et al., · 2024
Later among the works it cites.
“Vote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning,”
Sijin Chen, Hongyuan Zhu, Mingsheng Li, Xin Chen, Peng Guo, Yinjie Lei, YU Gang, Taihao Li, and Tao Chen, · 2024
Later among the works it cites.
“Scanreason: Empowering 3d visual grounding with reasoning capabilities,”
Chenming Zhu, Tai Wang, Wenwei Zhang, Kai Chen, and Xihui Liu, · 2024
Later among the works it cites.
Yifan Xu, Chao Zhang, Hanqi Jiang, Xiaoyan Wang, Ruifei Ma, Yiwei Li, Zihao Wu, Zeju Li, and Xiangde Liu, · 2025
Closest in time.