Fetching the paper…
Reading the bibliography…
Large language models (LLMs) have made rapid improvement on medical benchmarks, but their unreliability remains a persistent challenge for safe real-world uses.
“Language Models Are Few-Shot Learners”
Tom. Brown et al · 1901
Earlier work this paper cites.
“Right for the Wrong Reasons: Diagnosing Syntactic Heuristics in Natural Language Inference”
R. McCoy, Ellie Pavlick and Tal Linzen · 1902
Earlier work this paper cites.
“Large Language Models in Medicine”
Arun Thirunavukarasu et al · 1940
Earlier work this paper cites.
“Scaling Laws for Neural Language Models”
Jared Kaplan et al · 2001
Earlier work this paper cites.
“Learning to Complement Humans”, 2020
Bryan Wilder, Eric Horvitz and Ece Kamar · 2005
Earlier work this paper cites.
“Measuring Massive Multitask Language Understanding”
Dan Hendrycks et al · 2009
Earlier work this paper cites.
“Extracting Training Data from Large Language Models”
Nicholas Carlini et al · 2012
Earlier work this paper cites.
“Climbing towards NLU: On Meaning, Form, and Understanding in the Age of Data”
Emily. Bender and Alexander Koller · 2020
Earlier work this paper cites.
“How Can We Know When Language Models Know? On the Calibration of Language Models for Question Answering”
Zhengbao Jiang, Jun Araki, Haibo Ding and Graham Neubig · 2021
Earlier work this paper cites.
“What Disease Does This Patient Have? A Large-Scale Open Domain Question Answering Dataset from Medical Exams”
Di Jin et al · 2021
Earlier work this paper cites.
“Process for Adapting Language Models to Society (PALMS) with Values-Targeted Datasets”
Irene Solaiman and Christy Dennison · 2021
Earlier work this paper cites.
“PaLM: Scaling Language Modeling with Pathways”
Aakanksha Chowdhery et al · 2022
Earlier work this paper cites.
“GLaM: Efficient Scaling of Language Models with Mixture-of-Experts”
Nan Du et al · 2022
Earlier work this paper cites.
“GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers”
Elias Frantar, Saleh Ashkboos, Torsten Hoefler and Dan Alistarh · 2022
Earlier work this paper cites.
“Training Compute-Optimal Large Language Models”
Jordan Hoffmann et al · 2022
Earlier work this paper cites.
“Language Models (Mostly) Know What They Know”
Saurav Kadavath et al · 2022
Cited alongside, same era.
“Large Language Models Are Zero-Shot Reasoners”
Takeshi Kojima et al · 2022
Cited alongside, same era.
“Deduplicating Training Data Makes Language Models Better”
Katherine Lee et al · 2022
Cited alongside, same era.
“Training Language Models to Follow Instructions with Human Feedback”
Long Ouyang et al · 2022
Cited alongside, same era.
“MedMCQA: A Large-scale Multi-Subject Multi-Choice Dataset for Medical Domain Question Answering”
Ankit Pal, Logesh Umapathi and Malaikannan Sankarasubbu · 2022
Cited alongside, same era.
“BBQ: A Hand-Built Bias Benchmark for Question Answering”
Alicia Parrish et al · 2022
“Towards Expert-Level Medical Question Answering with Large Language Models”
Karan Singhal et al · 2023
Closest in time.
“Llama 2: Open Foundation and Fine-Tuned Chat Models”
Hugo Touvron et al · 2023
Closest in time.
“Towards Generalist Biomedical AI”
Tao Tu et al · 2023
Closest in time.
“Large Language Models as Optimizers”
Chengrun Yang et al · 2023
Closest in time.
“Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone”
Marah Abdin et al · 2024
Closest in time.
alphaXiv searches the wider corpus for related work and actual follow-ups.
alphaXiv is searching for related work…
Cited alongside, same era.
“MEDITRON-70B: Scaling Medical Pretraining for Large Language Models”
Zeming Chen et al · 2023
Cited alongside, same era.
“Med42 - a Clinical Large Language Model”, 2023
Clément Christophe et al · 2023
Cited alongside, same era.
“Lost in the Middle: How Language Models Use Long Contexts”
Nelson. Liu et al · 2023
Cited alongside, same era.
R. McCoy et al · 2023
Cited alongside, same era.
“Orca 2: Teaching Small Language Models How to Reason”
Arindam Mitra et al · 2023
Cited alongside, same era.
“Capabilities of GPT-4 on Medical Challenge Problems”
Harsha Nori et al · 2023
Cited alongside, same era.
Stella Biderman et al · 2024
Closest in time.
“Med42-v2: A Suite of Clinical LLMs”
Clément Christophe et al · 2024
Closest in time.
“The Llama 3 Herd of Models”
Abhimanyu Dubey et al · 2024
Closest in time.
URL: https://www.cem.edu.pl/
Centrum Egzaminów Medycznych, 2024 · 2024
Closest in time.
“Mixtral of Experts”
Albert. Jiang et al · 2024
Closest in time.
“Capabilities of Gemini Models in Medicine”
Khaled Saab et al · 2024
Closest in time.
“The Good, The Bad, and The Greedy: Evaluation of LLMs Should Not Ignore Non-Determinism”
Yifan Song, Guoyin Wang, Sujian Li and Bill Lin · 2024
Closest in time.
“Gemini 1.5: Unlocking Multimodal Understanding across Millions of Tokens of Context”
Gemini Team et al · 2024
Closest in time.
“Towards Conversational Diagnostic AI”, 2024
Tao Tu et al · 2024
Closest in time.