Fetching the paper…
Reading the bibliography…
Large language models are increasingly integrated with external environments, tools, and agents like ChatGPT plugins to extend their capability beyond language-centric tasks.
Modern Information Retrieval , volume 463
Baeza-Yates, R., Ribeiro-Neto, B., et al · 1999
Earlier work this paper cites.
Haptic keyclick feedback improves typing speed and reduces typing errors on a flat keyboard
Ma, Z., Edge, D., Findlater, L., and Tan, H. Z · 2015
Earlier work this paper cites.
Hotpotqa: A dataset for diverse, explainable multi-hop question answering
Yang, Z., Qi, P., Zhang, S., Bengio, Y., Cohen, W. W., Salakhutdinov, R., and Manning, C. D · 2018
Earlier work this paper cites.
How many words do we read per minute? a review and meta-analysis of reading rate
Brysbaert, M · 2019
Earlier work this paper cites.
Agentgraph: Towards universal dialogue management with structured deep reinforcement learning
Chen, L., Chen, Z., Tan, B., Long, S., Gasic, M., and Yu, K · 2019
Earlier work this paper cites.
Megatron-lm: Training multi-billion parameter language models using model parallelism
Shoeybi, M., Patwary, M., Puri, R., LeGresley, P., Casper, J., and Catanzaro, B · 2019
Earlier work this paper cites.
High-resolution image synthesis with latent diffusion models
Rombach, R., Blattmann, A., Lorenz, D., Esser, P., and Ommer, B · 2021
Earlier work this paper cites.
Alfworld: Aligning text and embodied environments for interactive learning
Shridhar, M., Yuan, X., Côté, M.-A., Bisk, Y., Trischler, A., and Hausknecht, M · 2021
Earlier work this paper cites.
GPT-J-6B: A 6 Billion Parameter Autoregressive Language Model
Wang, B. and Komatsuzaki, A · 2021
Earlier work this paper cites.
Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale
Aminabadi, R. Y., Rajbhandari, S., Awan, A. A., Li, C., Li, D., Zheng, E., Ruwase, O., Smith, S., Zhang, M., Rasley, J., et al · 2022
Earlier work this paper cites.
LangChain
Chase, H · 2022
Earlier work this paper cites.
No language left behind: Scaling human-centered machine translation
Costa-jussà, M. R., Cross, J., Çelebi, O., Elbayad, M., Heafield, K., Heffernan, K., Kalbassi, E., Lam, J., Licht, D., Maillard, J., Sun, A., Wang, S., Wenzek, G., Youngblood, A., Akula, B., Barrault, L., Gonzalez, G. M., Hansanti, P., Hoffman, J., Jarrett, S., Sadagopan, K. R., Rowe, D., Spruit, S., Tran, C., Andrews, P., Ayan, N. F., Bhosale, S., Edunov, S., Fan, A., Gao, C., Goswami, V., Guzmán, F., Koehn, P., Mourachko, A., Ropers, C., Saleem, S., Schwenk, H., and Wang, J · 2022
Earlier work this paper cites.
Vision-and-language navigation: A survey of tasks, methods, and future directions
Gu, J., Stefani, E., Wu, Q., Thomason, J., and Wang, X · 2022
Earlier work this paper cites.
Language models as zero-shot planners: Extracting actionable knowledge for embodied agents
Huang, W., Abbeel, P., Pathak, D., and Mordatch, I · 2022
Earlier work this paper cites.
Atlas: Few-shot learning with retrieval augmented language models, 2022
Izacard, G., Lewis, P., Lomeli, M., Hosseini, L., Petroni, F., Schick, T., Dwivedi-Yu, J., Joulin, A., Riedel, S., and Grave, E · 2022
Earlier work this paper cites.
Talm: Tool augmented language models
Parisi, A., Zhao, Y., and Fiedel, N · 2022
Earlier work this paper cites.
Orca: A Distributed Serving System for Transformer-Based Generative Models
Yu, G.-I., Jeong, J. S., Kim, G.-W., Kim, S., and Chun, B.-G · 2022
Earlier work this paper cites.
Achiam, J., Adler, S., Agarwal, S., Ahmad, L., Akkaya, I., Aleman, F. L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al · 2023
Earlier work this paper cites.
Sarathi: Efficient llm inference by piggybacking decodes with chunked prefills
Agrawal, A., Panwar, A., Mohan, J., Kwatra, N., Gulavani, B. S., and Ramjee, R · 2023
Cited alongside, same era.
Bark: Text-to-speech model
AI, S · 2023
Cited alongside, same era.
GQA: Training generalized multi-query transformer models from multi-head checkpoints
Ainslie, J., Lee-Thorp, J., de Jong, M., Zemlyanskiy, Y., Lebron, F., and Sanghai, S · 2023
Cited alongside, same era.
Introducing chatgpt and whisper apis
Brockman, G., Eleti, A., Georges, E., Jang, J., Kilpatrick, L., Lim, R., Miller, L., and Pokrass, M · 2023
Cited alongside, same era.
When using the chatgpt api, users will have to manage the context
Greyling, C · 2023
Cited alongside, same era.
Toolkengpt: Augmenting frozen language models with massive tools via tool embeddings
HuggingGPT: Solving AI tasks with chatGPT and its friends in hugging face
Shen, Y., Song, K., Tan, X., Li, D., Lu, W., and Zhuang, Y · 2023
Later among the works it cites.
Vipergpt: Visual inference via python execution for reasoning
Suris, D., Menon, S., and Vondrick, C · 2023
Later among the works it cites.
Llama: Open and efficient foundation language models
Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T., Rozière, B., Goyal, N., Hambro, E., Azhar, F., et al · 2023
Later among the works it cites.
Nvidia tensorrt-llm supercharges large language model inference on nvidia h100 gpus
Vaidya, N., Comly, N., DeLaere, J., Patel, A., and Oh, F · 2023
Later among the works it cites.
A survey on large language model based autonomous agents
Wang, L., Ma, C., Feng, X., Zhang, Z., ran Yang, H., Zhang, J., Chen, Z.-Y., Tang, J., Chen, X., Lin, Y., Zhao, W. X., Wei, Z., and rong Wen, J · 2023
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Hao, S., Liu, T., Wang, Z., and Hu, Z · 2023
Cited alongside, same era.
Look before you leap: Unveiling the power of gpt-4v in robotic vision-language planning
Hu, Y., Lin, F., Zhang, T., Yi, L., and Gao, Y · 2023
Cited alongside, same era.
Efficient memory management for large language model serving with pagedattention
Kwon, W., Li, Z., Zhuang, S., Sheng, Y., Zheng, L., Yu, C. H., Gonzalez, J., Zhang, H., and Stoica, I · 2023
Cited alongside, same era.
AlpaServe: Statistical multiplexing with model parallelism for deep learning serving
Li, Z., Zheng, L., Zhong, Y., Liu, V., Sheng, Y., Jin, X., Huang, Y., Chen, Z., Zhang, H., Gonzalez, J. E., and Stoica, I · 2023
Cited alongside, same era.
Chameleon: Plug-and-play compositional reasoning with large language models
Lu, P., Peng, B., Cheng, H., Galley, M., Chang, K.-W., Wu, Y. N., Zhu, S.-C., and Gao, J · 2023
Cited alongside, same era.
Augmented language models: a survey
Mialon, G., Dessi, R., Lomeli, M., Nalmpantis, C., Pasunuru, R., Raileanu, R., Roziere, B., Schick, T., Dwivedi-Yu, J., Celikyilmaz, A., Grave, E., LeCun, Y., and Scialom, T · 2023
Cited alongside, same era.
Fastertransformer
NVIDIA · 2023
Cited alongside, same era.
Later among the works it cites.
Chain-of-thought prompting elicits reasoning in large language models
Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F., Chi, E. H., Le, Q. V., and Zhou, D · 2023
Later among the works it cites.
Chatgpt gets its ‘wolfram superpowers’!
Wolfram, S · 2023
Later among the works it cites.
Fast distributed inference serving for large language models
Wu, B., Zhong, Y., Zhang, Z., Huang, G., Liu, X., and Jin, X · 2023
Later among the works it cites.
React: Synergizing reasoning and acting in language models
Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K. R., and Cao, Y · 2023
Later among the works it cites.
Automatic chain of thought prompting in large language models
Zhang, Z., Zhang, A., Li, M., and Smola, A · 2023
Later among the works it cites.
Improving image generation with better captions
Betker, J., Goh, G., Jing, L., Brooks, T., Wang, J., Li, L., Ouyang, L., Zhuang, J., Lee, J., Guo, Y., Manassra, W., Dhariwal, P., Chu, C., Jiao, Y., and Ramesh, A · 2024
Closest in time.
Inference without interference: Disaggregate llm inference for mixed downstream workloads
Hu, C., Huang, H., Xu, L., Chen, X., Xu, J., Chen, S., Feng, H., Wang, C., Wang, S., Bao, Y., Sun, N., and Shan, Y · 2024
Closest in time.
DSPy: Compiling declarative language model calls into state-of-the-art pipelines
Khattab, O., Singhvi, A., Maheshwari, P., Zhang, Z., Santhanam, K., A, S. V., Haq, S., Sharma, A., Joshi, T. T., Moazam, H., Miller, H., Zaharia, M., and Potts, C · 2024
Closest in time.
Meta llama 3
Meta · 2024
Closest in time.
The batch weekly issues 241
Ng, A · 2024
Closest in time.
Splitwise: Efficient generative llm inference using phase splitting
Patel, P., Choukse, E., Zhang, C., Shah, A., Goiri, Í., Maleki, S., and Bianchini, R · 2024
Closest in time.
Preble: Efficient distributed prompt scheduling for llm serving
Srivatsa, V., He, Z., Abhyankar, R., Li, D., and Zhang, Y · 2024
Closest in time.
Distllm: Disaggregating prefill and decoding for goodput-optimized large language model serving
Zhong, Y., Liu, S., Chen, J., Hu, J., Zhu, Y., Liu, X., Jin, X., and Zhang, H · 2024
Closest in time.