Fetching the paper…
Reading the bibliography…
Large Language Models (LLMs)' search capabilities have garnered significant attention.
Measuring Massive Multitask Language Understanding
Hendrycks, D.; Burns, C.; Basart, S.; Zou, A.; Mazeika, M.; Song, D.; and Steinhardt, J. 2021 · 2009
Earlier work this paper cites.
Measuring Massive Multitask Language Understanding
Hendrycks, D.; Burns, C.; Basart, S.; Zou, A.; Mazeika, M.; Song, D.; and Steinhardt, J. 2021 · 2009
Earlier work this paper cites.
SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems
Wang, A.; Pruksachatkun, Y.; Nangia, N.; Singh, A.; Michael, J.; Hill, F.; Levy, O.; and Bowman, S. R. 2019 · 2019
Earlier work this paper cites.
SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems
Wang, A.; Pruksachatkun, Y.; Nangia, N.; Singh, A.; Michael, J.; Hill, F.; Levy, O.; and Bowman, S. R. 2019 · 2019
Earlier work this paper cites.
GAIA: A Benchmark for General AI Assistants
Gao, L.; Liu, S.; Wang, Y.; Zhang, Z.; Jiang, Y.; et al. 2023 · 2023
Earlier work this paper cites.
WebArena: Benchmarking LLMs for Web Agent Tasks
Liu, J.; Liu, S.; Jin, C.; et al. 2023 · 2023
Earlier work this paper cites.
Mind2Web: Towards a Generalist Agent for the Web
Yao, J.; Wu, T.; Tan, C.; Zhang, Z.; and Chen, W. 2023 · 2023
Earlier work this paper cites.
GPQA: A Benchmark for General-Purpose Question Answering on Graduate-Level Exams
Zhang, X.; Liu, S.; Wang, Y.; et al. 2023 · 2023
Earlier work this paper cites.
GAIA: A Benchmark for General AI Assistants
Gao, L.; Liu, S.; Wang, Y.; Zhang, Z.; Jiang, Y.; et al. 2023 · 2023
Earlier work this paper cites.
WebArena: Benchmarking LLMs for Web Agent Tasks
Liu, J.; Liu, S.; Jin, C.; et al. 2023 · 2023
Earlier work this paper cites.
Mind2Web: Towards a Generalist Agent for the Web
Yao, J.; Wu, T.; Tan, C.; Zhang, Z.; and Chen, W. 2023 · 2023
Earlier work this paper cites.
GPQA: A Benchmark for General-Purpose Question Answering on Graduate-Level Exams
Zhang, X.; Liu, S.; Wang, Y.; et al. 2023 · 2023
Earlier work this paper cites.
Workarena: How capable are web agents at solving common knowledge work tasks?
Drouin, A.; Gasse, M.; Caccia, M.; Laradji, I. H.; Del Verme, M.; Marty, T.; Boisvert, L.; Thakkar, M.; Cappart, Q.; Vazquez, D.; et al. 2024 · 2024
Earlier work this paper cites.
WebVoyager: Building an end-to-end web agent with large multimodal models
He, H.; Yao, W.; Ma, K.; Yu, W.; Dai, Y.; Zhang, H.; Lan, Z.; and Yu, D. 2024 · 2024
Earlier work this paper cites.
MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark
Wang, Y.; Ma, X.; Zhang, G.; Ni, Y.; Chandra, A.; Guo, S.; Ren, W.; Arulraj, A.; He, X.; Jiang, Z.; Li, T.; Ku, M.; Wang, K.; Zhuang, A.; Fan, R.; Yue, X.; and Chen, W. 2024 · 2024
Cited alongside, same era.
Workarena: How capable are web agents at solving common knowledge work tasks?
Drouin, A.; Gasse, M.; Caccia, M.; Laradji, I. H.; Del Verme, M.; Marty, T.; Boisvert, L.; Thakkar, M.; Cappart, Q.; Vazquez, D.; et al. 2024 · 2024
Cited alongside, same era.
WebVoyager: Building an end-to-end web agent with large multimodal models
He, H.; Yao, W.; Ma, K.; Yu, W.; Dai, Y.; Zhang, H.; Lan, Z.; and Yu, D. 2024 · 2024
Cited alongside, same era.
MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark
Wang, Y.; Ma, X.; Zhang, G.; Ni, Y.; Chandra, A.; Guo, S.; Ren, W.; Arulraj, A.; He, X.; Jiang, Z.; Li, T.; Ku, M.; Wang, K.; Zhuang, A.; Fan, R.; Yue, X.; and Chen, W. 2024 · 2024
Browsecomp: A simple yet challenging benchmark for browsing agents
Wei, J.; Sun, Z.; Papay, S.; McKinney, S.; Han, J.; Fulford, I.; Chung, H. W.; Passos, A. T.; Fedus, W.; and Glaese, A. 2025 · 2025
Closest in time.
Grok agents: Combining reasoning and tool use
x.ai. 2025 · 2025
Closest in time.
DeepSeek-R1-0528 Release
DeepSeek. 2025 · 2025
Closest in time.
Supergpqa: Scaling llm evaluation across 285 graduate disciplines
Du, X.; Yao, Y.; Ma, K.; Wang, B.; Zheng, T.; Zhu, K.; Liu, M.; Liang, Y.; Jin, X.; Wei, Z.; et al. 2025 · 2025
Closest in time.
Gemini Deep Research
Google. 2025 · 2025
Closest in time.
GPT-4o Mini Model Overview
OpenAI. 2024a · 2025
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
DeepSeek-R1-0528 Release
DeepSeek. 2025 · 2025
Cited alongside, same era.
Supergpqa: Scaling llm evaluation across 285 graduate disciplines
Du, X.; Yao, Y.; Ma, K.; Wang, B.; Zheng, T.; Zhu, K.; Liu, M.; Liang, Y.; Jin, X.; Wei, Z.; et al. 2025 · 2025
Cited alongside, same era.
Gemini Deep Research
Google. 2025 · 2025
Cited alongside, same era.
GPT-4o Mini Model Overview
OpenAI. 2024a · 2025
Cited alongside, same era.
GPT-4o Model Overview
OpenAI. 2024b · 2025
Cited alongside, same era.
GPT-4.1 Model Overview
OpenAI. 2025a · 2025
Cited alongside, same era.
GPT-4o Mini Search Preview
OpenAI. 2025b · 2025
Cited alongside, same era.
GPT-4o Search Preview
OpenAI. 2025c · 2025
Cited alongside, same era.
GPT-4o Model Overview
OpenAI. 2024b · 2025
Closest in time.
GPT-4.1 Model Overview
OpenAI. 2025a · 2025
Closest in time.
GPT-4o Mini Search Preview
OpenAI. 2025b · 2025
Closest in time.
GPT-4o Search Preview
OpenAI. 2025c · 2025
Closest in time.
Introducing Deep Research
OpenAI. 2025d · 2025
Closest in time.
Phan, L.; and et.al, A. G. 2025 · 2025
Closest in time.
Browsecomp: A simple yet challenging benchmark for browsing agents
Wei, J.; Sun, Z.; Papay, S.; McKinney, S.; Han, J.; Fulford, I.; Chung, H. W.; Passos, A. T.; Fedus, W.; and Glaese, A. 2025 · 2025
Closest in time.
Grok agents: Combining reasoning and tool use
x.ai. 2025 · 2025
Closest in time.