arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31957 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31957 篇

2409.00097 2025-06-24 cs.CL cs.AI 90%

Large Language Models for Disease Diagnosis: A Scoping Review

Shuang Zhou, Zidu Xu, Mian Zhang, Chunpu Xu, Yawen Guo, Zaifu Zhan, Yi Fang, Sirui Ding, Jiashuo Wang, Kaishuai Xu, Liqiao Xia, Jeremy Yeung, Daochen Zha, Dongming Cai, Genevieve B. Melton, Mingquan Lin, Rui Zhang

机构 * Division of Computational Health Sciences, Department of Surgery, University of Minnesota(明尼苏达大学外科与计算健康科学系) School of Nursing, Columbia University(哥伦比亚大学护理学院) Erik Jonsson School of Engineering and Computer Science, University of Texas at Dallas(德克萨斯大学达拉斯分校工程与计算机科学学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算系) Department of Informatics, University of California, Irvine(加州大学尔湾分校信息学院) Department of Electrical and Computer Engineering, University of Minnesota(明尼苏达大学电子与计算机工程系) Department of Computer Science, New York University (Shanghai)(纽约大学(上海)计算机科学系) Bakar Computational Health Sciences Institute, University of California San Francisco(加州大学旧金山分校Bakar计算健康科学研究所) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业与系统工程系) Department of Computer Science, Rice University(里士满大学计算机科学系) Department of Neurology, University of Minnesota(明尼苏达大学神经病学系) Institute for Health Informatics and Division of Colon and Rectal Surgery, Department of Surgery, University of Minnesota(明尼苏达大学健康信息学研究所和结直肠外科分会)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 68 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05328 2025-06-23 cs.CL cs.AI 90%

Dynamic Knowledge Integration for Evidence-Driven Counter-Argument Generation with Large Language Models

Anar Yeginbergen, Maite Oronoz, Rodrigo Agerri

机构 * HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克大学HiTZ中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16645 2025-06-19 cs.CL cs.AI cs.SE 90%

CODESYNC: Synchronizing Large Language Models with Dynamic Code Evolution at Scale

Chenlong Wang, Zhaoyang Chu, Zhengxiang Cheng, Xuyi Yang, Kaiyue Qiu, Yao Wan, Zhou Zhao, Xuanhua Shi, Dongping Chen

机构 * National Engineering Research Center for Big Data Technology and Systems(大数据技术与系统国家工程研究中心) Services Computing Technology and System Lab(服务计算技术与系统实验室) Cluster and Grid Computing Lab(集群与网格计算实验室) School of Computer Science and Technology(计算机科学与技术学院) Huazhong University of Science and Technology(华中科技大学) Wuhuan University(吴奂大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

Journal ref International Conference of Machine Learning, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10674 2025-06-13 cs.AI cs.CL 90%

TeleMath: A Benchmark for Large Language Models in Telecom Mathematical Problem Solving

Vincenzo Colle, Mohamed Sana, Nicola Piovesan, Antonio De Domenico, Fadhel Ayed, Merouane Debbah

机构 * Paris Research Center, Huawei Technologies(巴黎研究中心,华为技术)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10504 2025-06-13 cs.CL cs.AI 90%

Beyond Single-User Dialogue: Assessing Multi-User Dialogue State Tracking Capabilities of Large Language Models

Sangmin Song, Juhwan Choi, JungMin Yun, YoungBin Kim

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07896 2025-06-10 cs.AI cs.CL 90%

Evaluating Large Language Models on the Frame and Symbol Grounding Problems: A Zero-shot Benchmark

Shoko Oka

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

Comments 52 pages, Additional resources available on GitHub repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11300 2025-06-10 cs.CL cs.AI cs.CV 90%

CORDIAL: Can Multimodal Large Language Models Effectively Understand Coherence Relationships?

Aashish Anantha Ramakrishnan, Aadarsh Anantha Ramakrishnan, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) National Institute of Technology, Tiruchirappalli(特里奇里帕利学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments To appear at the 63rd Annual Meeting of the Association for Computational Linguistics (ACL), Vienna, Austria, July 2025, https://2025.aclweb.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17458 2025-06-10 cs.CR cs.CL cs.LG 90%

RED QUEEN: Safeguarding Large Language Models against Concealed Multi-Turn Jailbreaking

Yifan Jiang, Kriti Aggarwal, Tanmay Laud, Kashif Munir, Jay Pujara, Subhabrata Mukherjee

机构 * Hippocratic AI(希波克拉底AI) Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments Accepted in ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13342 2025-06-10 cs.CL cs.AI 90%

ZeroDL: Zero-shot Distribution Learning for Text Clustering via Large Language Models

Hwiyeol Jo, Hyunwoo Lee, Kang Min Yoo, Taiwoo Park

机构 * NAVER Cloud(NAVER云) NAVER NAVER Search US(NAVER美国搜索)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at ACL2025(Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06057 2025-06-09 cs.CL cs.AI 90%

Hey, That's My Data! Label-Only Dataset Inference in Large Language Models

Chen Xiong, Zihao Wang, Rui Zhu, Tsung-Yi Ho, Pin-Yu Chen, Jingwei Xiong, Haixu Tang, Lucila Ohno-Machado

机构 * The Chinese University of Hong Kong(香港中文大学) Indiana University Bloomington(印第安纳大学布卢明顿分校) Yale University, School of Medicine(耶鲁大学医学院) IBM Research(IBM研究院) University of California, Davis(加州大学戴维斯分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05936 2025-06-09 cs.CL cs.AI 90%

DynamicMind: A Tri-Mode Thinking System for Large Language Models

Wei Li, Yanbin Wei, Qiushi Huang, Jiangyue Yan, Yang Chen, James T. Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学) University of Surrey(萨里大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08959 2025-06-05 cs.AI cs.CL 90%

Trust-Oriented Adaptive Guardrails for Large Language Models

Jinwei Hu, Yi Dong, Xiaowei Huang

机构 * University of Liverpool, UK(利物浦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02596 2025-06-04 cs.CL cs.AI 90%

EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing

Fan Gao, Dongyuan Li, Ding Xia, Fei Mi, Yasheng Wang, Lifeng Shang, Baojun Wang

机构 * The University of Tokyo(东京大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14725 2025-06-04 cs.CV cs.CL cs.LG 90%

Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens

Feng Chen, Chenhui Gou, Jing Liu, Yang Yang, Zhaoyang Li, Jiyuan Zhang, Zhenbang Sun, Bohan Zhuang, Qi Wu

机构 * AIML, University of Adelaide(AIML,阿德莱德大学) Monash University(墨尔本大学) Australian National University(澳大利亚国立大学) Tiktok, Australia(Tiktok,澳大利亚) Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments Code repository: https://github.com/Chenfeng1271/AbilityLens/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01266 2025-06-03 cs.CL cs.AI 90%

Detoxification of Large Language Models through Output-layer Fusion with a Calibration Model

Yuanhe Tian, Mingjie Deng, Guoqing Jin, Yan Song

机构 * University of Washington(华盛顿大学) University of Science and Technology of China(中国科学技术大学) People’s Daily Online(人民日报网络版)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00751 2025-06-03 cs.AI cs.LG 90%

Alignment Revisited: Are Large Language Models Consistent in Stated and Revealed Preferences?

Zhuojun Gu, Quan Wang, Shuchu Han

机构 * Department of Information Systems and Business Analytics(信息系统与商业分析系) University at Albany - State University of New York(阿尔巴尼大学 - 新 york 状态大学) Santa Clara, CA(圣克拉拉,加州) Princeton Junction, NJ(普林斯顿 junction,新泽西)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01854 2025-06-03 cs.CL cs.AI 90%

A Comprehensive Survey of Machine Unlearning Techniques for Large Language Models

Jiahui Geng, Qing Li, Herbert Woisetschlaeger, Zongxiong Chen, Fengyu Cai, Yuxia Wang, Preslav Nakov, Hans-Arno Jacobsen, Fakhri Karray

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德大学人工智能学院) Fraunhofer Institute for Open Communication Systems (FOKUS)(弗劳恩霍夫开放通信系统研究所) Technical University of Munich(慕尼黑技术大学) Technical University of Darmstadt(达姆施塔特技术大学) University of Toronto(多伦多大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00064 2025-06-03 cs.CL cs.AI 90%

Mis-prompt: Benchmarking Large Language Models for Proactive Error Handling

Jiayi Zeng, Yizhe Feng, Mengliang He, Wenhui Lei, Wei Zhang, Zeming Liu, Xiaoming Shi, Aimin Zhou

机构 * East China Normal University(东华大学) Beihang University(北航) Shanghai Jiaotong University(上海交通大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23852 2025-06-02 cs.CL cs.AI cs.MA stat.AP 90%

Large Language Model-Based Agents for Automated Research Reproducibility: An Exploratory Study in Alzheimer's Disease

Nic Dobbins, Christelle Xiong, Kristine Lan, Meliha Yetisgen

机构 * Biomedical Informatics & Data Science, Johns Hopkins University(约翰霍普金斯大学生物医学信息学与数据科学) Biomedical & Health Informatics, University of Washington(华盛顿大学生物医学与健康信息学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23020 2025-05-30 cs.CR cs.AI cs.CL 90%

AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models

Jinchuan Zhang, Lu Yin, Yan Zhou, Songlin Hu

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);post-training(abstract)

Comments Submitted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10452 2025-05-30 cs.CL cs.AI 90%

DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generation

Wenhao Hu, Jinhao Duan, Chunchen Wei, Li Zhang, Yue Zhang, Kaidi Xu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Drexel University(德雷塞尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 13 figures. Accepted to the ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08008 2025-05-30 cs.LG cs.CL cs.HC 90%

Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition

Kehua Feng, Keyan Ding, Hongzhi Tan, Kede Ma, Zhihua Wang, Shuangquan Guo, Yuzhou Cheng, Ge Sun, Guozhou Zheng, Qiang Zhang, Huajun Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 35 pages, 6 figures, Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21870 2025-05-29 cs.CL cs.AI 90%

Evaluating the Retrieval Robustness of Large Language Models

Shuyang Cao, Karthik Radhakrishnan, David Rosenberg, Steven Lu, Pengxiang Cheng, Lu Wang, Shiyue Zhang

机构 * Bloomberg(彭博) University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21608 2025-05-29 cs.CL cs.AI 90%

How does Misinformation Affect Large Language Model Behaviors and Preferences?

Miao Peng, Nuo Chen, Jianheng Tang, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10619 2025-05-29 cs.AI cs.CL cs.CR 90%

Tempest: Autonomous Multi-Turn Jailbreaking of Large Language Models with Tree Search

Andy Zhou, Ron Arel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21409 2025-05-28 cs.CL cs.AI cs.DB 90%

RelationalFactQA: A Benchmark for Evaluating Tabular Fact Retrieval from Large Language Models

Dario Satriani, Enzo Veltri, Donatello Santoro, Paolo Papotti

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20679 2025-05-28 cs.CL cs.HC cs.LG 90%

SELF-PERCEPT: Introspection Improves Large Language Models' Detection of Multi-Person Mental Manipulation in Conversations

Danush Khanna, Pratinav Seth, Sidhaarth Sredharan Murali, Aditya Kumar Guru, Siddharth Shukla, Tanuj Tyagi, Sandeep Chaurasia, Kripabandhu Ghosh

机构 * Manipal University Jaipur, India(马普尔大学斋普尔,印度) Manipal Institute of Technology, India(马普尔理工学院,印度) AryaXAI Alignment Lab, AryaXAI.com, India(AryaXAI对齐实验室,AryaXAI.com,印度) National Institute of Technology Karnataka, Surathkal, India(卡纳塔克国家理工学院,苏拉塔卡尔,印度) IISER Kolkata, India(印度科钦IISER)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG

Comments Accepted to ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20184 2025-05-27 cs.CL cs.AI 90%

THiNK: Can Large Language Models Think-aloud?

Yongan Yu, Mengqian Wu, Yiran Lin, Nikki G. Lobczowski

机构 * McGill University(麦吉尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19966 2025-05-27 cs.LG cs.AI 90%

Learning to Select In-Context Demonstration Preferred by Large Language Model

Zheng Zhang, Shaocheng Lan, Lei Song, Jiang Bian, Yexin Li, Kan Ren

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Microsoft Research Asia(微软亚洲研究院) State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(一般人工智能国家重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11365 2025-05-27 cs.CY cs.AI cs.CL cs.CR 90%

Phare: A Safety Probe for Large Language Models

Pierre Le Jeune, Benoît Malézieux, Weixuan Xiao, Matteo Dora

机构 * Giskard AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏