Policy optimization in rlhf: The impact of out-of-preference data
Original
Li, Z., Xu, T., and Yu, Y. (2023) · 2023
Later among the works it cites.
Detecting pretraining data from large language models
Original
Shi, W., Ajith, A., Xia, M., Huang, Y., Liu, D., Blevins, T., Chen, D., and Zettlemoyer, L. (2023) · 2023
Later among the works it cites.
Llama: Open and efficient foundation language models
Original
Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T., Rozière, B., Goyal, N., Hambro, E., Azhar, F., et al. (2023) · 2023
Later among the works it cites.
Trl: Transformer reinforcement learning
von Werra, L., Belkada, Y., Tunstall, L., Beeching, E., Thrush, T., Lambert, N., Huang, S., Rasul, K., and Gallouédec, Q. (2023) · 2023
Later among the works it cites.
A survey of large language models
Original
Zhao, W. X., Zhou, K., Li, J., Tang, T., Wang, X., Hou, Y., Min, Y., Zhang, B., Zhang, J., Dong, Z., et al. (2023) · 2023
Later among the works it cites.
Do membership inference attacks work on large language models?
Original
Duan, M., Suri, A., Mireshghallah, N., Min, S., Shi, W., Zettlemoyer, L., Tsvetkov, Y., Choi, Y., Evans, D., and Hajishirzi, H. (2024) · 2024
Closest in time.
Unpacking dpo and ppo: Disentangling best practices for learning from preference feedback
Ivison, H., Wang, Y., Liu, J., Wu, Z., Pyatkin, V., Lambert, N., Smith, N. A., Choi, Y., and Hajishirzi, H. (2024) · 2024
Closest in time.
Llm dataset inference: Did you train on my dataset?
Original
Maini, P., Jia, H., Papernot, N., and Dziedzic, A. (2024) · 2024
Closest in time.
Direct preference optimization: Your language model is secretly a reward model
Rafailov, R., Sharma, A., Mitchell, E., Manning, C. D., Ermon, S., and Finn, C. (2024) · 2024
Closest in time.
Detecting pretraining data from large language models
Shi, W., Ajith, A., Xia, M., Huang, Y., Liu, D., Blevins, T., Chen, D., and Zettlemoyer, L. (2024) · 2024
Closest in time.
Memorization in deep learning: A survey
Original
Wei, J., Zhang, Y., Zhang, L. Y., Ding, M., Chen, C., Ong, K.-L., Zhang, J., and Xiang, Y. (2024) · 2024
Closest in time.
Is dpo superior to ppo for llm alignment? a comprehensive study
Original
Xu, S., Fu, W., Gao, J., Ye, W., Liu, W., Mei, Z., Wang, G., Yu, C., and Wu, Y. (2024) · 2024
Closest in time.
Harnessing the power of llms in practice: A survey on chatgpt and beyond
Yang, J., Jin, H., Tang, R., Han, X., Feng, Q., Jiang, H., Zhong, S., Yin, B., and Hu, X. (2024) · 2024
Closest in time.
Min-k%++: Improved baseline for detecting pre-training data from large language models
Original
Zhang, J., Sun, J., Yeats, E., Ouyang, Y., Kuo, M., Zhang, J., Yang, H., and Li, H. (2024) · 2024
Closest in time.