Fetching the paper…
Reading the bibliography…
Large language models (LLMs) have demonstrated transformative potential in scientific research, yet their deployment in high-stakes contexts raises significant trustworthiness concerns.
Crowdsourcing multiple choice science questions, 2017
Welbl, J., Liu, N. F., and Gardner, M · 2017
Earlier work this paper cites.
On the measure of intelligence, 2019
Chollet, F · 2019
Earlier work this paper cites.
Logiqa: A challenge dataset for machine reading comprehension with logical reasoning, 2020
Liu, J., Cui, L., Liu, H., Huang, D., Wang, Y., and Zhang, Y · 2020
Earlier work this paper cites.
Reclor: A reading comprehension dataset requiring logical reasoning, 2020
Yu, W., Jiang, Z., Dong, Y., and Feng, J · 2020
Earlier work this paper cites.
Measuring massive multitask language understanding, 2021
Hendrycks, D., Burns, C., Basart, S., Zou, A., Mazeika, M., Song, D., and Steinhardt, J · 2021
Earlier work this paper cites.
Logicinference: A new dataset for teaching logical inference to seq2seq models, 2022
Ontanon, S., Ainslie, J., Cvicek, V., and Fisher, Z · 2022
Earlier work this paper cites.
Galactica: A large language model for science, 2022
Taylor, R., Kardas, M., Cucurull, G., Scialom, T., Hartshorn, A., Saravia, E., Poulton, A., Kerkez, V., and Stojnic, R · 2022
Earlier work this paper cites.
Trustgpt: A benchmark for trustworthy and responsible large language models, 2023
Huang, Y., Zhang, Q., Y, P. S., and Sun, L · 2023
Earlier work this paper cites.
Selfcheckgpt: Zero-resource black-box hallucination detection for generative large language models, 2023
Manakul, P., Liusie, A., and Gales, M. J. F · 2023
Earlier work this paper cites.
Gpqa: A graduate-level google-proof q&a benchmark, 2023
Rein, D., Hou, B. L., Stickland, A. C., Petty, J., Pang, R. Y., Dirani, J., Michael, J., and Bowman, S. R · 2023
Cited alongside, same era.
peS2o (Pretraining Efficiently on S2ORC) Dataset
Soldaini, L., and Lo, K · 2023
Cited alongside, same era.
Scieval: A multi-level large language model evaluation benchmark for scientific research, 2023
Sun, L., Han, Y., Zhao, Z., Ma, D., Shen, Z., Chen, B., Chen, L., and Yu, K · 2023
Cited alongside, same era.
Darwin series: Domain specific large language models for natural science, 2023
Xie, T., Wan, Y., Huang, W., Yin, Z., Liu, Y., Wang, S., Linghu, Q., Kit, C., Grazian, C., Zhang, W., Razzak, I., and Hoex, B · 2023
Cited alongside, same era.
Forge: Pre-training open foundation models for science
Yin, J., Dash, S., Wang, F., and Shankar, M · 2023
Cited alongside, same era.
Sciassess: Benchmarking llm proficiency in scientific literature analysis, 2024
Lynx: An open source hallucination evaluation model, 2024
Ravi, S. S., Mielczarek, B., Kannappan, A., Kiela, D., and Qian, R · 2024
Later among the works it cites.
Trustllm: Trustworthiness in large language models, 2024
Sun, L., Huang, Y., Wang, H., Wu, S., Zhang, Q., Li, Y., Gao, C., Huang, Y., Lyu, W., Zhang, Y., Li, X., Liu, Z., Liu, Y., Wang, Y., Zhang, Z., Vidgen, B., Kailkhura, B., Xiong, C., Xiao, C., Li, C., Xing, E., Huang, F., Liu, H., Ji, H., Wang, H., Zhang, H., Yao, H., Kellis, M., Zitnik, M., Jiang, M., Bansal, M., Zou, J., Pei, J., Liu, J., Gao, J., Han, J., Zhao, J., Tang, J., Wang, J., Vanschoren, J., Mitchell, J., Shu, K., Xu, K., Chang, K.-W., He, L., Huang, L., Backes, M., Gong, N. Z., Yu, P. S., Chen, P.-Y., Gu, Q., Xu, R., Ying, R., Ji, S., Jana, S., Chen, T., Liu, T., Zhou, T., Wang, W., Li, X., Zhang, X., Wang, X., Xie, X., Chen, X., Wang, X., Liu, Y., Ye, Y., Cao, Y., Chen, Y., and Zhao, Y · 2024
Later among the works it cites.
Decodingtrust: A comprehensive assessment of trustworthiness in gpt models, 2024
Wang, B., Chen, W., Pei, H., Xie, C., Kang, M., Zhang, C., Xu, C., Xiong, Z., Dutta, R., Schaeffer, R., Truong, S. T., Arora, S., Mazeika, M., Hendrycks, D., Lin, Z., Cheng, Y., Koyejo, S., Song, D., and Li, B · 2024
Later among the works it cites.
Sciglm: Training scientific language models with self-reflective instruction annotation and tuning, 2024
Zhang, D., Hu, Z., Zhoubian, S., Du, Z., Yang, K., Wang, Z., Yue, Y., Dong, Y., and Tang, J · 2024
Later among the works it cites.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cai, H., Cai, X., Chang, J., Li, S., Yao, L., Wang, C., Gao, Z., Wang, H., Li, Y., Lin, M., Yang, S., Wang, J., Xu, M., Huang, J., Xi, F., Zhuang, J., Yin, Y., Li, Y., Chen, C., Cheng, Z., Zhao, Z., Zhang, L., and Ke, G · 2024
Cited alongside, same era.
The wmdp benchmark: Measuring and reducing malicious use with unlearning, 2024
Li, N., Pan, A., Gopal, A., Yue, S., Berrios, D., Gatti, A., Li, J. D., Dombrowski, A.-K., Goel, S., Phan, L., Mukobi, G., Helm-Burger, N., Lababidi, R., Justen, L., Liu, A. B., Chen, M., Barrass, I., Zhang, O., Zhu, X., Tamirisa, R., Bharathi, B., Khoja, A., Zhao, Z., Herbert-Voss, A., Breuer, C. B., Marks, S., Patel, O., Zou, A., Mazeika, M., Wang, Z., Oswal, P., Lin, W., Hunt, A. A., Tienken-Harder, J., Shih, K. Y., Talley, K., Guan, J., Kaplan, R., Steneker, I., Campbell, D., Jokubaitis, B., Levinson, A., Wang, J., Qian, W., Karmakar, K. K., Basart, S., Fitz, S., Levine, M., Kumaraguru, P., Tupakula, U., Varadharajan, V., Wang, R., Shoshitaishvili, Y., Ba, J., Esvelt, K. M., Wang, A., and Hendrycks, D · 2024
Cited alongside, same era.
Scisafeeval: A comprehensive benchmark for safety alignment of large language models in scientific tasks, 2024
Li, T., Lu, J., Chu, C., Zeng, T., Zheng, Y., Li, M., Huang, H., Wu, B., Liu, Z., Ma, K., Yuan, X., Wang, X., Ding, K., Chen, H., and Zhang, Q · 2024
Cited alongside, same era.
Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024
Mazeika, M., Phan, L., Yin, X., Zou, A., Wang, Z., Mu, N., Sakhaee, E., Li, N., Basart, S., Li, B., Forsyth, D., and Hendrycks, D · 2024
Cited alongside, same era.
A comprehensive survey of scientific large language models and their applications in scientific discovery, 2024
Zhang, Y., Chen, X., Jin, B., Wang, S., Ji, S., Wang, W., and Han, J · 2024
Later among the works it cites.
Extended thinking models
Antrophic · 2025
Closest in time.
Scitrust: Evaluating the trustworthiness of large language models for science
Herron, E., Yin, J., and Wang, F · 2025
Closest in time.
The llama 4 herd: The beginning of a new era of natively multimodal ai innovation
MetaAI · 2025
Closest in time.
Introducing openai o3 and o4-mini
OpenAI · 2025
Closest in time.