xlstm: Extended long short-term memory
Original
Maximilian Beck, Korbinian Pöppel, Markus Spanring, Andreas Auer, Oleksandra Prudnikova, Michael Kopp, Günter Klambauer, Johannes Brandstetter, and Sepp Hochreiter · 2024
Closest in time.
In-context learning with long-context models: An in-depth exploration
Original
Amanda Bertsch, Maor Ivgi, Uri Alon, Jonathan Berant, Matthew R Gormley, and Graham Neubig · 2024
Closest in time.
Introducing GoodAI LTM benchmark
David Castillo, Joseph Davidson, Finlay Gray, José Solorzano, and Marek Rosa · 2024
Closest in time.
LongLoRA: Efficient fine-tuning of long-context large language models
Yukang Chen, Shengju Qian, Haotian Tang, Xin Lai, Zhijian Liu, Song Han, and Jiaya Jia · 2024
Closest in time.
Command r, 2024
Cohere · 2024
Closest in time.
Introducing dbrx: A new state-of-the-art open llm, 2024
Databricks · 2024
Closest in time.
LongRoPE: Extending LLM context window beyond 2 million tokens
Original
Yiran Ding et al · 2024
Closest in time.
Data engineering for scaling language models to 128k context
Original
Yao Fu et al · 2024
Closest in time.
Chatglm: A family of large language models from glm-130b to glm-4 all tools, 2024
Team GLM, Aohan Zeng, Bin Xu, Bowen Wang, Chenhui Zhang, Da Yin, Diego Rojas, Guanyu Feng, Hanlin Zhao, Hanyu Lai, Hao Yu, Hongning Wang, Jiadai Sun, Jiajie Zhang, Jiale Cheng, Jiayi Gui, Jie Tang, Jing Zhang, Juanzi Li, Lei Zhao, Lindong Wu, Lucen Zhong, Mingdao Liu, Minlie Huang, Peng Zhang, Qinkai Zheng, Rui Lu, Shuaiqi Duan, Shudan Zhang, Shulin Cao, Shuxun Yang, Weng Lam Tam, Wenyi Zhao, Xiao Liu, Xiao Xia, Xiaohan Zhang, Xiaotao Gu, Xin Lv, Xinghan Liu, Xinyi Liu, Xinyue Yang, Xixuan Song, Xunkai Zhang, Yifan An, Yifan Xu, Yilin Niu, Yuantao Yang, Yueyan Li, Yushi Bai, Yuxiao Dong, Zehan Qi, Zhaoyu Wang, Zhen Yang, Zhengxiao Du, Zhenyu Hou, and Zihan Wang · 2024
Closest in time.
Is it really long context if all you need is retrieval? towards genuinely difficult long context nlp
Original
Omer Goldman, Alon Jacovi, Aviv Slobodkin, Aviya Maimon, Ido Dagan, and Reut Tsarfaty · 2024
Closest in time.
Mixtral of experts
Original
Albert Q Jiang et al · 2024
Closest in time.
One thousand and one pairs: A” novel” challenge for long-context language models
Original
Marzena Karpinska, Katherine Thai, Kyle Lo, Tanya Goyal, and Mohit Iyyer · 2024
Closest in time.
Babilong: Testing the limits of llms with long context reasoning-in-a-haystack
Original
Yuri Kuratov, Aydar Bulatov, Petr Anokhin, Ivan Rodkin, Dmitry Sorokin, Artyom Sorokin, and Mikhail Burtsev · 2024
Closest in time.
Can long-context language models subsume retrieval, rag, sql, and more?
Original
Jinhyuk Lee, Anthony Chen, Zhuyun Dai, Dheeru Dua, Devendra Singh Sachan, Michael Boratko, Yi Luan, Sébastien MR Arnold, Vincent Perot, Siddharth Dalmia, et al · 2024
Closest in time.
Same task, more tokens: the impact of input length on the reasoning performance of large language models
Original
Mosh Levy, Alon Jacoby, and Yoav Goldberg · 2024
Closest in time.
YaRN: Efficient context window extension of large language models
Bowen Peng, Jeffrey Quesnelle, Honglu Fan, and Enrico Shippole · 2024
Closest in time.
Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context
Original
Machel Reid et al · 2024
Closest in time.
You only cache once: Decoder-decoder architectures for language models
Original
Yutao Sun, Li Dong, Yi Zhu, Shaohan Huang, Wenhui Wang, Shuming Ma, Quanlu Zhang, Jianyong Wang, and Furu Wei · 2024
Closest in time.
A benchmark for learning to translate a new language from one grammar book
Garrett Tanzer, Mirac Suzgun, Eline Visser, Dan Jurafsky, and Luke Melas-Kyriazi · 2024
Closest in time.
Focused Transformer: Contrastive training for context scaling
Szymon Tworkowski et al · 2024
Closest in time.
Augmenting language models with long-term memory
Weizhi Wang, Li Dong, Hao Cheng, Xiaodong Liu, Xifeng Yan, Jianfeng Gao, and Furu Wei · 2024
Closest in time.
Announcing grok-1.5, 2024
X.AI · 2024
Closest in time.
Qwen2 technical report
Original
An Yang, Baosong Yang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Zhou, Chengpeng Li, Chengyuan Li, Dayiheng Liu, Fei Huang, et al · 2024
Closest in time.
Yi: Open foundation models by 01.AI
Original
Alex Young et al · 2024
Closest in time.
Lv-eval: A balanced long-context benchmark with 5 length levels up to 256k
Original
Tao Yuan, Xuefei Ning, Dong Zhou, Zhijie Yang, Shiyao Li, Minghui Zhuang, Zheyue Tan, Zhuyu Yao, Dahua Lin, Boxun Li, et al · 2024
Closest in time.
PoSE: Efficient context window extension of LLMs via positional skip-wise training
Dawei Zhu, Nan Yang, Liang Wang, Yifan Song, Wenhao Wu, Furu Wei, and Sujian Li · 2024
Closest in time.