arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2607.11632 2026-07-14 cs.AI cs.CL cs.LG cs.SI physics.soc-ph 新提交 91%

Reproducing human biases in route choice using large language models: Toward scalable behavioral modeling

使用大语言模型在路径选择中重现人类偏差:迈向可扩展的行为建模

Jiangtao Han, Shoufeng Ma, Shuxian Xu, Geng Li, Shuai Ling, Ning Jia, Zhengbing He

机构 * Laboratory of Computation and Analytics of Complex Management Systems (CACMS), Tianjin University, China(复杂管理系统的计算与分析实验室,天津大学,中国) College of Management and Economics, Tianjin University, China(管理与经济学院,天津大学,中国) Faculty of Science and Engineering, University of Nottingham Ningbo China(科学与工程学院,诺丁汉大学宁波校区,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型能否在不明确前景理论参数时重现人类路径选择行为偏差,设计行为评估框架并比较,发现其能重现偏差及展现相关决策行为,为人类决策建模及相关研究提供可扩展替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00276 2026-07-02 cs.LG cs.AI cs.CL 新提交 91%

Testing Frontier Large Language Models' Physics Literacy in Parallel Physical Worlds

测试前沿大语言模型在平行物理世界中的物理素养

Dong Zhang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出四阶段诊断方法评估LLM在陌生物理框架中的推理能力,在三个平行世界测试发现定性-定量不对称及自我审查薄弱。

Comments 37 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13505 2026-06-24 cs.CL cs.AI cs.LG 版本更新 91%

Ensemble Learning for Large Language Models in Text and Code Generation: A Survey

面向文本与代码生成的大语言模型集成学习综述

Mari Ashiga, Wei Jie, Fan Wu, Vardan Voskanyan, Fateme Dinmohammadi, Paul Brookes, Jingzhi Gong, Zheng Wang

机构 * School of Computing and Engineering, University of West London(西伦敦大学计算机与工程学院) Turing Intelligence Technology Limited(图灵智能科技有限公司) School of Computer Science, University of Leeds(利兹大学计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了七种大语言模型集成方法(权重合并、知识融合、混合专家、奖励集成、输出集成、路由和级联),分析了它们在文本与代码生成中提升多样性、输出质量和应用灵活性的能力。

Comments Accepted by IEEE TAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18288 2026-06-19 cs.SE 版本更新 91%

Can Large Language Models Reason About Complex Execution Paths? An Empirical Study on Python

大型语言模型能否推理复杂执行路径?基于Python的实证研究

Wenhan Wang, Kaibo Liu, Zeyu Sun, An Ran Chen, Ge Li, Gang Huang, Lei Ma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract)

AI总结 本文实证研究大型语言模型在Python执行路径推理中的可行性,构建测试用例生成和缺陷分类任务,发现LLM能提升路径覆盖率,但强推理模型不一定优于弱模型。

Comments Accepted by ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03846 2026-06-03 cs.CL cs.AI cs.LG 91%

Clustered Self-Assessment: A Simple yet Effective Method for Uncertainty Quantification in Large Language Models

聚类自评估:一种简单而有效的大型语言模型不确定性量化方法

Qi Cao, Takeshi Kojima, Andrew Gambardella, Helinyi Peng, Yutaka Matsuo, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于语义聚类和多项选择概率的简单自评估方法,用于大型语言模型的不确定性量化,在多个模型和数据集上优于基线方法。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09873 2026-06-01 cs.SE 91%

Beyond Strict Rules: Assessing the Effectiveness of Large Language Models for Code Smell Detection

超越严格规则:评估大型语言模型在代码异味检测中的有效性

Saymon Souza, Amanda Santana, Eduardo Figueiredo, Igor Muzetti, João Eduardo Montandon, Lionel Briand

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本研究评估了四种大型语言模型(DeepSeek-R1、GPT-5 mini、Llama-3.3、Qwen2.5-Code)在30个Java项目中检测九种代码异味的效果,并提出了结合LLM与静态分析工具的检测策略,该策略在五个异味类型上F1分数优于单独使用LLM或工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09580 2026-05-28 cs.CR 91%

AICrypto: Evaluating Cryptography Capabilities of Large Language Models

AICrypto:评估大型语言模型的密码学能力

Yu Wang, Yijian Liu, Liheng Ji, Han Luo, Wenjie Li, Xiaofei Zhou, Chiyun Feng, Puji Wang, Yuhan Cao, Geyuan Zhang, Xiaojian Li, Rongwu Xu, Yilei Chen, Tianxing He

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 构建AICrypto基准测试,通过多项选择题、夺旗挑战和证明题评估LLM在密码学知识记忆、漏洞利用和形式推理方面的能力,发现最先进模型在常规任务上匹配或超越人类专家,但在抽象概念理解和多步推理上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04975 2026-05-28 cs.CY 91%

Evaluating Chinese Large Language Models: The Influence of Persona Assignment on Stereotypes and Safeguards

评估中文大语言模型:角色分配对刻板印象和安全机制的影响

Geng Liu, Li Feng, Carlo Alberto Bono, Songbo Yang, Mengxiao Zhu, Francesco Pierri

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究通过大规模跨模型分析,量化了角色分配对四个中文大语言模型在拒绝行为和毒性输出放大方面的影响,并探索了基于外部评估器的迭代缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09620 2026-05-21 cs.CL cs.AI cs.LG 91%

AI-Augmented Surveys: Leveraging Large Language Models and Surveys for Opinion Prediction

AI增强的调查:利用大型语言模型和调查进行意见预测

Junsol Kim, Byungkyu Lee

机构 * Department of Sociology(社会学系) University of Chicago(芝加哥大学) New York University(纽约大学) Chicago, IL(伊利诺伊州芝加哥市) New York, NY(纽约州纽约市)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于大型语言模型的框架,通过结合问题、受访者和调查时期的嵌入表示,预测重复横断面调查中缺失的响应,从而弥补传统调查在捕捉历史变化方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05739 2026-05-19 cs.LG cs.AI cs.CL q-fin.CP 91%

Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback

基于大语言模型判官的多维行为评估:用于代理股票预测系统的闭环强化学习反馈

Mohammad Al Ridhawi, Mahtab Haj Ali, Hussein Al Osman

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多维行为评估方法,通过大语言模型判官评估代理系统决策过程,利用闭环强化学习反馈提升预测性能,验证了方法在股票预测中的有效性。

Comments 17 pages, 5 figures, 14 tables. Manuscript submitted to Applied Artificial Intelligence (Taylor and Francis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05424 2026-05-08 cs.CR 91%

Evaluating the Reliability of Multiple Large Language Models in Risk Assessment: A CIS Controls Based Approach

评估多个大型语言模型在风险评估中的可靠性:基于CIS控制的方法

Gustavo Roberto Pinto, Arthur do Prado Labaki, Rodrigo Sanches Miani

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文通过问卷分析50名专家与五种大语言模型在评估网络安全风险场景中的表现,发现大语言模型低估风险,强调需人类监督,建议将LLM作为补充工具。

Comments Manuscript under review - International Journal of Data Science and Analytics

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22240 2026-04-23 cs.SE 91%

Are Decoder-Only Large Language Models the Silver Bullet for Code Search?

解码器-only大语言模型是否是代码搜索的银弹?

Yuxuan Chen, Mingwei Liu, Guangsheng Ou, Anji Li, Dekun Dai, Yanlin Wang, Zibin Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文评估了11种解码器-only LLM在代码搜索任务中的性能,发现经过微调的模型在零样本和微调设置下均优于编码器-only模型,且模型大小和训练数据组成对性能有显著影响。

Comments Published in IEEE Transactions on Software Engineering (2026). 19 pages

Journal ref IEEE Transactions on Software Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07458 2026-04-21 cs.CL cs.AI cs.LG cs.SE 91%

REFLEX: Reference-Free Evaluation of Log Summarization via Large Language Model Judgment

REFLEX:基于大语言模型判断的无参考日志摘要评估

Priyanka Mudgal

机构 * Portland State University(波特兰州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 REFLEX通过大语言模型评估日志摘要质量,无需参考摘要或人工标注,提供稳定且细粒度的评估结果,优于传统指标。

Comments Accepted at IEEE-ICETISI 2025 Code is available at: https://github.com/prmudgal/Reflex

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05995 2026-04-08 cs.CL cs.AI cs.LG 91%

The Model Agreed, But Didn't Learn: Diagnosing Surface Compliance in Large Language Models

模型已达成一致,但未学习:诊断大语言模型中的表面合规性

Xiaojie Gu, Ziying Huang, Weicong Hong, Jian Xie, Renze Lou, Kai Zhang

机构 * Independent Researcher(独立研究员) Cornell Tech(康奈尔科技校区) The Ohio State University(俄亥俄州立大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究通过引入诊断框架,揭示大语言模型在记忆修改中存在表面合规现象,指出编辑方法可能仅模仿输出而非改变内部信念,导致认知不稳定和记忆不可逆。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18583 2026-02-24 cs.CL cs.AI cs.LG 91%

Luna-2: Scalable Single-Token Evaluation with Small Language Models

Luna-2:基于小语言模型的可扩展单令牌评估

Vatsal Goel, Rishon Dsouza, Nikhil Ega, Amey Ramesh Rambatla, Rob Friel, Shuai Shao, Yash Sheth

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);SLM(abstract)

AI总结 Luna-2利用小语言模型实现高效、准确的单令牌评估,大幅降低计算成本和延迟,提升内容安全与幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16926 2026-02-20 cs.CE 91%

BEMEval-Doc2Schema: Benchmarking Large Language Models for Structured Data Extraction in Building Energy Modeling

BEMEval-Doc2Schema:用于建筑能耗建模的结构化数据提取的大型语言模型基准测试

Yiyuan Jia, Xiaoqin Fu, Liang Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 BEMEval-Doc2Schema提出了一种用于评估大型语言模型在建筑能耗建模中结构化数据提取性能的基准测试框架,通过引入KVOR指标和跨模型比较,为未来研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11798 2026-02-20 cs.CL cs.AI cs.LG 91%

Persona-driven Simulation of Voting Behavior in the European Parliament with Large Language Models

基于人物特征的欧洲议会投票行为模拟研究:利用大语言模型

Maximilian Kreutner, Marlene Lutz, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibnitz Institute for the Social Sciences(莱比锡社会科学研究所) CSH Vienna(维也纳CSH)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究利用大语言模型和人物提示技术,模拟欧洲议会成员的投票行为,实现约 0.793 的加权 F1 分数。

Comments Accepted at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00232 2026-02-17 cs.CL cs.AI cs.CY cs.LG 91%

BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses

BiasFreeBench: 一个用于减轻大型语言模型响应偏见的基准测试

Xin Xu, Xunzhi He, Churan Zhi, Ruizhe Chen, Julian McAuley, Zexue He

机构 * UC San Diego(加州大学圣地亚哥分校) Columbia University(哥伦比亚大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 BiasFreeBench通过统一测试平台评估八种主流偏见缓解方法,提供响应层面的偏见自由分数,旨在提升大型语言模型的公平性和安全性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06193 2026-01-13 cs.LG cs.AI cs.CL 91%

MLB: A Scenario-Driven Benchmark for Evaluating Large Language Models in Clinical Applications

MLB:面向临床应用的大型语言模型评估场景驱动基准

Qing He, Dongsheng Bi, Jianrong Lu, Minghui Yang, Zixiao Chen, Jiacheng Lu, Jing Chen, Nannan Du, Xiao Cu, Sijing Wu, Peng Xiang, Yinyin Hu, Yi Guo, Chunpu Li, Shaoyang Li, Zhuo Dong, Ming Jiang, Shuai Guo, Liyun Feng, Jin Peng, Jian Wang, Jinjie Gu, Junwei Liu

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Health Information Center of Zhejiang Province(浙江省健康信息中心) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

AI总结 MLB基准通过场景驱动的评估方法,评估大型语言模型在临床应用中的表现,揭示模型在结构化任务与患者交互场景间的性能差异。

Comments 11 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02861 2025-12-03 cs.NI 91%

Network Self-Configuration based on Fine-Tuned Small Language Models

基于微调小语言模型的网络自配置

Oscar G. Lira, Oscar M. Caicedo, Nelson L. S. Da Fonseca

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出SLM_netconfig,一种基于微调小语言模型的网络自配置框架,通过参数高效适应技术实现高效、准确且隐私保护的本地化配置生成。

Comments 16 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09710 2025-10-22 cs.CL cs.AI cs.LG 91%

Generating Individual Travel Diaries Using Large Language Models Informed by Census and Land-Use Data

Sepehr Golrokh Amin, Devin Rhoads, Fatemeh Fakhrmoosavi, Nicholas E. Lownes, John N. Ivan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19195 2025-10-10 cs.CL cs.AI cs.LG 91%

Can Small-Scale Data Poisoning Exacerbate Dialect-Linked Biases in Large Language Models?

Chaymaa Abbas, Mariette Awad, Razane Tajeddine

机构 * Department of Electrical and Computer Engineering, Maroun Semaan Faculty of Engineering and Architecture(电气与计算机工程系,马鲁恩·塞马安工程与建筑学院) American University of Beirut(贝鲁特美国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04974 2025-09-25 cs.CV cs.AI cs.CL cs.LG 91%

Towards Visual Text Grounding of Multimodal Large Language Model

Ming Li, Ruiyi Zhang, Jian Chen, Chenguang Wang, Jiuxiang Gu, Yufan Zhou, Franck Dernoncourt, Wanrong Zhu, Tianyi Zhou, Tong Sun

机构 * Adobe Research(Adobe研究院) University of Maryland(马里兰大学) University at Buffalo(布法罗大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12774 2025-07-18 cs.LG cs.AI cs.CL 91%

A Comprehensive Survey of Electronic Health Record Modeling: From Deep Learning Approaches to Large Language Models

Weijieying Ren, Jingxi Zhu, Zehao Liu, Tianxiang Zhao, Vasant Honavar

机构 * Information Sciences and Technology, The Pennsylvania State University(信息科学与技术系,宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10581 2025-06-19 q-bio.QM cs.AI cs.CL cs.LG eess.SP 91%

Large Language Model-informed ECG Dual Attention Network for Heart Failure Risk Prediction

Chen Chen, Lei Li, Marcel Beetz, Abhirup Banerjee, Ramneek Gupta, Vicente Grau

机构 * Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(生物医学工程研究所,工程科学系,牛津大学) Imperial College London(伦敦帝国学院) University of Sheffield(谢菲尔德大学) Novo Nordisk Research Centre Oxford (NNRCO)(牛津诺和硕研究中心(NNRCO)) Royal Society(皇家学会)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Under journal revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09315 2025-06-12 cs.CL cs.AI cs.LG 91%

Alzheimer's Dementia Detection Using Perplexity from Paired Large Language Models

Yao Xiao, Heidi Christensen, Stefan Goetze

机构 * School of Computer Science(计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments To be published in the proceedings of Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08313 2025-05-28 cs.LG cs.AI cs.CL cs.CV 91%

Can Large Language Models Understand Symbolic Graphics Programs?

Zeju Qiu, Weiyang Liu, Haiwen Feng, Zhen Liu, Tim Z. Xiao, Katherine M. Collins, Joshua B. Tenenbaum, Adrian Weller, Michael J. Black, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Cambridge(剑桥大学) MIT(麻省理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments ICLR 2025 Spotlight (v4: 47 pages, 26 figures, project page: https://sgp-bench.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05720 2025-04-24 cs.CL cs.AI cs.LG 91%

A dataset and benchmark for hospital course summarization with adapted large language models

Asad Aali, Dave Van Veen, Yamin Ishraq Arefeen, Jason Hom, Christian Bluethgen, Eduardo Pontes Reis, Sergios Gatidis, Namuun Clifford, Joseph Daws, Arash S. Tehrani, Jangwon Kim, Akshay S. Chaudhari

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Journal ref JAMIA, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01248 2025-04-03 cs.CL cs.AI cs.LG cs.SE 91%

Automated Factual Benchmarking for In-Car Conversational Systems using Large Language Models

Rafael Giebisch, Ken E. Friedl, Lev Sorokin, Andrea Stocco

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted in IEEE Intelligent Vehicles Symposium Conference (IV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10054 2024-10-10 cs.CL cs.AI cs.CY cs.HC cs.LG 91%

When "A Helpful Assistant" Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models

Mingqian Zheng, Jiaxin Pei, Lajanugen Logeswaran, Moontae Lee, David Jurgens

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted by Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏