arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2608.05921 2026-08-07 cs.SE 新提交 92%

Sensor-Level Fault Diagnosis for Automotive Software Validation Using Large Language Models

基于大语言模型的汽车软件验证传感器级故障诊断

Mohammad Abboush, Hamza Ouarrad, Andreas Rausch

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该研究提出两阶段框架,用经4-bit低秩适配的LLM对HIL平台的汽车传感器记录做故障诊断,最小模型准确率达81.6%,适配循环可在单商用加速器运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01451 2026-08-04 cs.SE 新提交 92%

Doc2CI: A Multi-Service Study of CI Configuration Generation Using Large Language Models

Doc2CI:基于大语言模型的CI配置生成多服务研究

Taher A. Ghaleb

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract_cn);language model(title,abstract_cn)

AI总结 本文通过构建DOC2CI基准评估LLM生成CI配置的能力,发现其结构有效性不足,提出无需训练的模式引导修复方法提升有效性,为相关工具开发提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26100 2026-07-30 cs.SE 新提交 92%

Large Language Models for Software Engineering Diagrams: A Systematic Review of UML and ER modelling

用于软件工程图的大语言模型:UML与ER建模的系统综述

Mojdeh Rahmanian, Ashkan Sami, Yanchao Yu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该系统综述分析64项2023-2025年研究,指出LLM在UML/ER建模中存在领域失衡、GPT依赖、评估不规范等问题,提出需标准化基准等改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13190 2026-07-16 physics.ed-ph 新提交 92%

Reliable isomorphic physics problem generation with large language models

基于大语言模型的可靠同构物理问题生成

Xian Wu, Lindim Ismaili

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 研究利用大语言模型代理工作流程生成同构物理问题,通过结合提示链等技术,在公共网站实现。开发评分标准并测试,89%生成问题可直接用,虽有局限,但显示出基于LLM系统在教学问题生成上的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03391 2026-06-19 cs.DL cs.CY 版本更新 92%

More Parameters Than Populations: A Systematic Literature Review of Large Language Models within Survey Research

参数多于总体:调查研究中的大语言模型系统文献综述

Trent D. Buskirk, Florian Keusch, Leah von der Heyde, Adam Eck

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 通过系统文献综述,评估大语言模型在调查研究三个阶段(数据收集前、中、后)的应用,讨论其潜力与陷阱,并展望调查研究对LLM发展的贡献。

Comments This working paper is outdated as of June 2026 - please refer to the full version with substantive changes here: https://doi.org/10.31235/osf.io/eubj4_v1 This work was presented at NLPOR 2025 (non-archival): https://openreview.net/forum?id=0Hxhwa56Yg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07810 2026-06-09 cs.CL cs.AI cs.LG 新提交 92%

SLMJury: Can Small Language Models Judge as Well as Large Ones?

SLMJury:小型语言模型能否像大型模型一样进行评判?

Anish Laddha, Nitesh Pradhan, Gaurav Srivastava

机构 * LNMIIT Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);large language model(abstract)

AI总结 提出SLMJury框架,评估小型语言模型作为评判者的能力,发现领域依赖的过度思考效应、领域泛化差异、闭端与开端评判能力分离,以及多智能体辩论降低准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07882 2026-05-28 cs.SE 92%

Rethinking Code Complexity Through the Lens of Large Language Models

通过大语言模型的视角重新思考代码复杂度

Chen Xie, Xiaodong Gu, Yuling Shi, Beijun Shen

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 针对传统复杂度指标与LLM感知难度不匹配的问题,提出基于语义非线性的熵引导语义组合层次复杂度度量LM-CC,实验证明其与LLM性能强相关且语义保持的复杂度降低能提升下游任务表现。

Comments accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01829 2026-05-28 cs.CL cs.AI cs.LG cs.MA 92%

Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models

如果你能说服我:评估大型语言模型说服效果与易受影响性的框架

Nimet Beyza Bozdag, Shuhaib Mehri, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PMIYC框架,通过多智能体对话自动评估LLM的说服效果与易受影响性,发现不同模型在说服力和抗说服性上存在显著差异。

Comments Paper published at the ACM Conference on AI and Agentic Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02039 2026-05-19 cs.AI cs.CL cs.DB cs.LG 92%

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

在大型语言模型上进行深度数据研究:评估深度数据研究

Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出深度数据研究(DDR)任务和DDR-Bench基准,评估大型语言模型的探索智能,发现有效探索需要内在策略而非单纯扩展。

Comments 14 pages, 7 tables, 8 figures, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16025 2026-05-12 cs.CV cs.MM eess.IV 92%

Context and Pixel Aware Large Language Model for Video Quality Assessment

基于上下文和像素的大型语言模型用于视频质量评估

Wen Wen, Yaohong Wu, Yue Sheng, Neil Birkbeck, Balu Adsumilli, Yilin Wang

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出CP-LLM,通过双视觉编码器和语言解码器同时生成视频质量评分和可解释描述,提升对像素失真敏感度,实验显示其在视频质量评估基准上表现优异。

Comments Accepted to ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06910 2026-05-11 cs.CR 92%

Benchmarking Large Language Models for IoC Recovery under Adversarial Code Obfuscation and Encryption

对对抗性代码混淆和加密下大型语言模型进行IoC恢复的基准测试

Jaime Morales, Sergio Pastrana, Juan Tapiador

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一个系统性基准测试,评估LLM在对抗性代码转换下恢复隐藏的IoC能力,发现加密技术显著降低检测性能,揭示LLM在代码分析中的局限性及改进方向。

Comments 11 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04325 2026-04-30 cs.CL cs.AI cs.CV cs.LG cs.MM 92%

Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models

超越排行榜:重新思考大型语言模型的医疗基准

Wenting Chen, Guo Yu, Yiu-Fai Cheung, Meidan Ding, Jie Liu, Zizhan Ma, Wenxuan Wang, Linlin Shen

机构 * Stanford University(斯坦福大学) Shenzhen University(深圳大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出MedCheck框架,用于评估医疗领域大型语言模型的基准,揭示现有基准在临床相关性、数据完整性及安全性方面的系统性问题。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14917 2026-04-27 cs.SE 92%

Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings

在现实世界设置下评估大型语言模型的代码推理能力

Changshu Liu, Alireza Ghazanfari, Yang Chen, Reyhaneh Jabbarvand

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文通过构建包含1200个问题的 dataset,评估 LLM 在现实复杂性下的代码推理能力,采用静态和动态分析方法,分类问题难度为 LC 或 HC,揭示现有评估方法主要偏向低复杂度问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19260 2026-04-22 econ.GN q-fin.EC 92%

Understanding the Mechanism of Altruism in Large Language Models

理解大型语言模型中的利他主义机制

Shuhuai Zhang, Shu Wang, Zijun Yao, Chuanhao Li, Xiaozhi Wang, Songfa Zhong, Tracy Xiao Liu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 研究通过稀疏自编码器揭示LLM利他行为的内部机制,识别出与行为变化相关的神经网络特征,并验证其对分配决策的影响,为对齐LLM行为与人类价值观提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21131 2025-10-27 cs.CL cs.AI cs.LG 92%

Large Language Models Meet Text-Attributed Graphs: A Survey of Integration Frameworks and Applications

Guangxin Su, Hanchen Wang, Jianwei Wang, Wenjie Zhang, Ying Zhang, Jian Pei

机构 * The University of New South Wales(新南威尔士大学) The University of Technology Sydney(技术大学悉尼分校) University of Technology Sydney(技术大学悉尼分校) Duke University(杜克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Surveys and overviews; Natural language processing; Knowledge representation and reasoning; Graph algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11569 2025-10-01 cs.CL cs.AI cs.LG 92%

Towards Reasoning Ability of Small Language Models

Gaurav Srivastava, Shuxiang Cao, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, USA(弗吉尼亚理工大学计算机科学系) Department of Physics, Clarendon Laboratory, University of Oxford, UK(牛津大学物理系,克伦德尔实验室) NVIDIA Corporation(英伟达公司)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07484 2025-07-11 cs.CL cs.AI cs.LG 92%

Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models

Kaiqu Liang, Haimin Hu, Xuandong Zhao, Dawn Song, Thomas L. Griffiths, Jaime Fernández Fisac

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

Comments Project page, code & data: https://machine-bullshit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15790 2025-02-27 cs.CL cs.AI cs.LG 92%

Small Language Models: Survey, Measurements, and Insights

Zhenyan Lu, Xiang Li, Dongqi Cai, Rongjie Yi, Fangming Liu, Xiwen Zhang, Nicholas D. Lane, Mengwei Xu

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05540 2024-07-09 q-bio.QM cs.AI cs.CL cs.LG 92%

A Fine-tuning Dataset and Benchmark for Large Language Models for Protein Understanding

Yiqing Shen, Zan Chen, Michail Mamalakis, Luhan He, Haiyang Xia, Tianbin Li, Yanzhou Su, Junjun He, Yu Guang Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14370 2026-08-17 cs.CR cs.AI cs.SE 新提交 92%

A Hybrid LLM-Based Framework for Automated Security Annotation Generation in Business Process Models

一种基于混合大语言模型(LLM)的业务流程模型自动安全标注生成框架

Md Kamrul Islam, Tiphaine Henry, Mattia Salnitri, Julius Köpke, Sami Souihi

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种混合LLM与规则的框架,输入BPMN模型和安全需求文档,自动生成符合SecBPMN2规范的安全标注,在27个流程模型数据集上验证,其准确率优于人工分析师,提升效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12368 2026-08-14 cs.AI 新提交 92%

Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments

一致性并非对齐:人类与大语言模型(LLM)伦理判断中的道德依据分歧

Octavian M. Machidon, Alina L. Machidon, Vojko Strahovnik, Mateja Centa Strahovnik, Jonas Miklavčič, Marko Robnik Šikonja

机构 * University of Ljubljana(卢布尔雅那大学) Faculty of Computer and Information Science(计算机与信息科学学院) Faculty of Theology(神学院) Faculty of Arts(艺术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究以ETHICS基准的500项道德判断条目为对象,发现LLM与人类的最终伦理判断常一致,但道德依据存在系统性分歧,表明一致性不等同于对齐性,仅靠标签评估易产生误导。

Comments 9 pages, 4 figures, 3 tables. Accepted and presented at the AI Transparency Conference (AITC 2026), Nuremberg, Germany, June 5-6, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11705 2026-08-13 cs.AI 新提交 92%

Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning

提升大语言模型的客观性:通过特质不变安全微调稳定LLM在不同特质下的安全行为

Lang Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM因系统提示词中特质不同导致同一请求安全决策不一致的问题,提出特质不变安全微调(TIST)框架及TraSN方法,提升跨特质安全稳定性且保留通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11650 2026-08-13 cs.CL 版本更新 92%

Investigating Learner-Aware Design of LLM-Generated Educational Feedback

哪种反馈适用于谁?LLM生成反馈元素在学习者特征中的差异效应

Momoka Furuhashi, Kouta Nakayama, Noboru Kawai, Takashi Kodama, Saku Sugawara, Kyosuke Takami

机构 * Tohoku University(东北大学) NII LLMC(日本信息处理学会LLMC研究中心) NII(日本信息处理学会) University of Tokyo(东京大学) Osaka Kyoiku University(大阪教养大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探讨了不同人格特征学习者对LLM生成反馈元素的接受差异,发现有效反馈元素有共同支持学习成果的模式,学习者主观偏好在人格集群中存在差异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10669 2026-08-12 cs.AI 新提交 92%

REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems

REDAgentBench:可执行的红队测试与LLM智能体系统的忠实测量

Zixing Chen, Xingyuan Liu, Jie Zhu, Huaixia Dou, Shuo Jiang, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LLM智能体安全评估的缺陷,推出REDAgentBench框架,经实验发现其宏平均ASR为65.69%,还揭示了识别-执行差距,无训练策略提醒可减少70%以上违规

Comments 6 figures, 4 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09988 2026-08-12 cs.CE cs.CL 新提交 92%

OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents

OpenPM:面向LLM投资组合管理智能体的可审计时点评估框架

Xinying Cai, Minghao Guo, Jiahe Liu, Jiaojiao Han, Bangwei Guo, Yitao Long, Yuxuan Chen, Bohan Wu, Dimitris N. Metaxas, Raymond Li

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 OpenPM是面向LLM投资组合管理智能体的可审计时点评估框架,构建了分层分配器参考智能体,发现分析师质量比构造器选择更重要,换手率是主要成本驱动因素。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05061 2026-08-12 cs.CL 版本更新 92%

No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding

无免费标签:缺乏人类基准的LLM作为评判的局限性

Michael Krumdick, Charles Lovering, Varshini Reddy, Seth Ebner, Chris Tanner

机构 * Kensho Technologies MIT(麻省理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BFF-Bench基准测试,通过专家评估LLM响应的正确性,揭示LLM作为评判在无人类基准时的局限性,显示当无正确参考时,LLM评判与人类专家的高一致性仅限于LLM能正确回答的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01629 2026-08-11 cs.CL 版本更新 92%

Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation

基准测试LLM作为裁判在长文本输出评估中的应用

Junjie Chen, Yuxi Dong, Haitao Li, Weihang Su, Yujia Zhou, Min Zhang, Yiqun Liu, Qingyao Ai

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) University of Science and Technology Beijing(北京科技大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LongJudgeBench基准,系统评估LLM裁判在长文本输出评估中的可靠性,发现当前模型存在显著可靠性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27887 2026-08-11 cs.AI q-fin.PM 版本更新 92%

PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

PortBench: 一种相关性感知的、全流水线的LLM驱动投资组合管理基准

Yuxuan Zhao, Sijia Chen, Ningxin Su

机构 * Yantai Research Institute of Harbin Engineering University(哈尔滨工程大学烟台研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出PortBench基准,通过静态QA和动态五阶段分配流水线评估LLM在投资组合管理中的表现,发现多数模型无法超越等权重分配,且存在推理错误累积和压力下大幅回撤的问题。

Comments Project page: https://portbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08531 2026-08-10 cs.AI 版本更新 92%

ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

VESTA: 一种全自动的LLM智能体场景生成与安全评估框架

Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng

机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Long-term AI(长期人工智能)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05411 2026-08-07 cs.AI 新提交 92%

Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index

基于教学适宜性指数评估和改进基于大语言模型(LLM)的AI导师的教学适配性

Benjamin Barlog, Hudson Craig, Zedong Peng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出教学适宜性指数(PSI)评估LLM导师的教学适配性,评估4类LLM并发现PSI引导的反馈可显著提升弱表现案例的适配性。

Comments This paper has already been accepted and presented at the IEEE 27th International Conference on Information Reuse and Integration for Data Science (IRI 2026) from July 31 to August 2, 2026, in Seattle, WA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏