arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2606.21810 2026-06-23 cs.SE 新提交 75%

GitReq: A Gold Standard Dataset for Software Quality Requirements

GitReq:软件质量需求的金标准数据集

Farha Kamal, Md Humaun Kabir, Md Rakibul Islam

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出GitReq数据集,包含6302条专家验证的软件质量需求,覆盖8个ISO/IEC 25010:2011质量类别,通过三重信号挖掘和人工标注构建,零样本评估GPT-5.2达到最高宏平均F1为0.641。

Comments Accepted at The 24th IEEE/ACIS International Conference on Software Engineering Research, Management and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19814 2026-06-19 cs.SE 新提交 75%

CoRaCommit: A VS Code Extension for Commit Message Generation with Exemplar Retrieval

CoRaCommit: 一种基于范例检索的提交消息生成的 VS Code 扩展

Chaoran Cai, Bo Xiong, Chong Wang, Lulu He, Peng Liang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 提出 CoRaCommit VS Code 扩展,通过检索相似提交范例作为提示上下文、并行调用多个大语言模型生成候选消息并基于用户反馈动态推荐,在 ApacheCM 数据集上优于现有扩展。

Comments 17 pages, 6 images, 3 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18262 2026-06-18 cs.HC 新提交 75%

When Prompts Mislead: Textual Dominance and Diagnostic Bias in MLLMs

当提示误导:多模态大语言模型中的文本主导与诊断偏差

Inhyuk Park, Doohyun Park

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究揭示在医学多模态大语言模型中,文本提示会主导视觉线索,导致诊断偏差,即使模型具备空间定位能力,提示策略仍可能不安全。

Comments Accepted to the CVPR 2026 MMFM-BIOMED Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18134 2026-06-17 eess.AS 新提交 75%

Grounding Spoken LLMs in Multi-Speaker Audio via Diarization Conditioning

通过说话人日志条件将口语大语言模型扩展到多说话人音频

Alexander Polok, Samuele Cornell, Sathvik Udupa, Jan Černocký, Shinji Watanabe, Lukáš Burget

专题命中 评测与基准 :SLM(abstract,abstract_cn);language model(abstract)

AI总结 提出基于说话人日志条件的口语语言模型,通过条件化声学编码器提取目标说话人表示,避免序列化输出训练导致的灾难性遗忘,在多个数据集上显著提升说话人属性转录性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17433 2026-06-17 cs.CV 新提交 75%

LADBench: A Benchmark for Logical Fault Detection in Images

LADBench: 图像中逻辑故障检测的基准

Sahasra Kondapalli, Lara Radovanovic, Aadi Palnitkar, Mingyang Mao, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);prompting(abstract)

AI总结 提出LAD-Bench基准,包含1000多张合成图像的四域逻辑异常,通过分层提示协议评估模型,揭示现有VLM在隐式逻辑故障检测上的不足。

Comments Accepted to the IEEE International Conference on Development and Learning (ICDL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13204 2026-06-12 cs.IR 新提交 75%

CoDeR: Local Constraint-Compatible Retrieval Beyond Semantic Similarity

CoDeR: 超越语义相似性的局部约束兼容检索

Xingkun Yin, Xuebin Tang, Hongyang Du

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对约束敏感查询中语义相似性作为相关性代理的失效问题,提出CoDeR方法,通过分离主题相关性与约束兼容性,利用对比学习训练兼容性评分器,在不调用外部大模型的情况下实现约束兼容检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07516 2026-06-12 math.PR 新提交 75%

Counterintuitive problems in discrete probability

离散概率中的反直觉问题

Luca Avena, Gianmarco Bet, Bernardo Busoni

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文收集了一系列离散概率中的反直觉问题及详细解答,旨在挑战启发式推理,评估大语言模型在概率推理中的认知偏差。

Comments Feedback on possible mistakes or typos and suggested additions to the list of problems are welcome at the email address of the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11205 2026-06-11 cs.LG cs.AI cs.CL 新提交 75%

Dual-Stance Evaluation of Sycophancy: The Structure of Agreement and the Limits of Intervention

谄媚的双立场评估:同意的结构与干预的局限

Matthew James Buchan

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出双立场评估方法,发现激活引导在减少谄媚时也会抑制对事实正确陈述的同意,揭示了表示可读但不可写的普遍差距。

Comments 18 pages, 9 figures, accepted to TAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11199 2026-06-11 cs.CL cs.AI cs.IR cs.LG 新提交 75%

NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track

NightFeats @ MMU-RAGent NeurIPS 2025: 面向文本到文本轨道的上下文优化多智能体RAG系统

Quentin Fever, Naziha Aslam

机构 * NightFeats

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种结构化多智能体RAG系统NightFeats,通过检索、策展和组合三阶段分解知识合成,引入时序语义重排序、矛盾协调和引用保留架构,在MMU-RAGent竞赛中超越商业基线。

Comments 5 pages, 1 figure, 1 table. NeurIPS 2025 Competition Track (MMU-RAGent). System developed October 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09595 2026-06-09 cs.IR 新提交 75%

Popcorn: A Configurable Benchmark for Visual Evidence in Multimodal Movie Recommendation

Popcorn: 多模态电影推荐中视觉证据的可配置基准

Ali Tourani, Fatemeh Nazary, Yashar Deldjoo, Tommaso Di Noia

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 提出Popcorn基准,通过配置合同标准化多模态电影推荐中的视觉证据(全片、预告片、缩略图)的嵌入、融合与评估,实验表明视觉源不可互换且影响推荐性能。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09380 2026-06-09 cs.LG cs.AI cs.CL 新提交 75%

Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

推理竞技场:当可验证奖励不足时的轨迹锦标赛

Han Zhou, Adam X. Yang, Laurence Aitchison, Anna Korhonen, Albert Q. Jiang

机构 * University of Cambridge(剑桥大学) Mistral AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出推理竞技场框架,通过轨迹锦标赛将无梯度信号的非多样奖励组转化为相对奖励信号,结合Bradley-Terry模型高效整合强化学习,在数学和编码基准上平均提升7.6%,加速训练27%-41%。

Comments 9 pages, 6 figures, 2 tables (17 pages including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08426 2026-06-09 cs.HC 新提交 75%

CritLens: Visual Analytics for Criteria Discovery in Review-Based Decision Making

CritLens:基于评论决策中标准发现的视觉分析

Hongjia Wu, Shuai Zhou, Hongxin Zhang, Wei Chen

专题命中 评测与基准 :LLM(summary_cn,abstract_cn)

AI总结 提出CritLens系统,利用LLM将评论转化为AHP决策模型,通过嵌入空间覆盖缺口检测、交互式权重调整和多级记分卡,支持用户迭代发现和验证个性化决策标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23519 2026-07-28 cs.CY cs.AI cs.CL 新提交 74%

Auditing Alignment Controllability in LLMs via Political Axes

通过政治轴审计大语言模型中的对齐可控性

Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 研究通过对7个大语言模型进行基于提示可控性的压力测试,探讨其在政治轴上的对齐可控性,发现上下文框架起主要作用,模型移动方式有别,强调政治坐标审计需考虑分散性等可控性因素,并发布相关数据和代码。

Comments 17 pages, 6 figures, 4 tables. Accepted at AIES 2026 (AAAI/ACM Conference on AI, Ethics, and Society). This version includes the supplementary appendix. Code and data: https://github.com/mbrcic/llm-political-steerability (Zenodo DOI 10.5281/zenodo.21489805)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16246 2026-08-18 cs.CR cs.AI 新提交 74%

CompoSkill: Compositional Skill Chain Attacks from Individually Scanner-Passing LLM Agent Skills

CompoSkill:通过可单独通过扫描器的大语言模型智能体技能实现的组合技能链攻击

Mingxiao Liu, Zhoumian Jiang, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 CompoSkill框架揭示现有单技能认证的自主AI智能体存在系统性缺口,其通过双攻击者系统构造组合技能链攻击,在白、黑盒设置下分别实现83.3%、80.6%的风险链形成率,现有扫描器拦截效果有限。

Comments 9 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15092 2026-08-18 cs.CR cs.AI cs.SE 新提交 74%

WeSCE: A Benchmark for Measuring Security Drift in LLM-Driven Code Editing

WeSCE:用于测量大语言模型驱动的代码编辑中安全漂移的基准

Zhiyu Zhang, Tingyue Wen, Senke Sun, Dengxiang Liang, Enhao Huang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 该研究推出WeSCE基准,针对仅指定功能目标的弱安全约束下的代码编辑,提出连续风险表示与漂移度量,以量化代码编辑中的安全漂移,为安全评估提供多尺度视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15046 2026-08-18 cs.LG 新提交 74%

Certifying Compressed Language Models: An Audit and a Statistical Toolkit

压缩语言模型的验证:审计与统计工具包

Amogh Singh

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(title);分类 cs.LG

AI总结 本文针对压缩语言模型等价声明的证据不足问题,开展17项等价声明的预注册审计,提出配对等价测试的报告标准,发布相关输出与代码。

Comments 109 pages, 3 figures, 20 tables. Artifacts and per-item outputs: doi.org/10.5281/zenodo.21939143

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14855 2026-08-18 cs.CL 新提交 74%

What to Forget in Unlearning? Forget Set Curation for Language Models

模型遗忘中该遗忘什么?面向语言模型的遗忘集筛选

Animesh Jha, Arpandeep Khatua, Youssef Allouah, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 针对语言模型遗忘中遗忘集筛选缺失的问题,提出CleanSlate基准,发现不同遗忘集筛选器存在抑制效果弱或附带损伤的缺陷,表明遗忘集选择会影响遗忘效果与附带损伤。

Comments Presented at MemFM @ ICML 2026 and FoGen @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12097 2026-08-13 cs.AI 新提交 74%

Graph-Structured Rubrics: Compiling Rubrics into Typed Evaluation Graphs for LLM Judges

图结构评分标准:将评分标准编译为用于大语言模型评判器的类型化评估图

Xi Chen, Jie Mu, Mo Xuan, Qun Shao

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本研究提出图结构评分标准(GSR),将评分标准编译为类型化评估图,在GPT-OSS-120B上较Prometheus式评分提升了精确分数一致性,且在成对评估中取得更高准确率。

Comments 11 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09412 2026-08-11 cs.AI 新提交 74%

KVDiagnosis: A Diagnostic Benchmark for KV-Cache Compression in Long-Context Language Models

KVDiagnosis:长上下文语言模型中KV缓存压缩的诊断基准

Chen Qiu, Ziwu Liu, Chao Fei, Guozhong Li, Panos Kalnis

机构 * KAUST(阿卜杜拉国王科技大学)

专题命中 评测与基准 :language model(title);分类 cs.AI

AI总结 本文提出KVDiagnosis,即长上下文语言模型KV缓存压缩的诊断基准,通过分类方法、设计评估流程、建立记录格式,在Qwen3-8B上验证其可有效区分压缩成败,代码与数据公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09187 2026-08-11 cs.CL 新提交 74%

Failure-Aware Long-Form Translation: Design and Implementation of a Recoverable LLM Translation System

故障感知的长文本翻译:可恢复大语言模型翻译系统的设计与实现

Yanlin Yu

专题命中 评测与基准 :LLM(title);分类 cs.CL

AI总结 针对长文本翻译API返回不可用结果的问题,设计实现了带恢复协议的可恢复大语言模型翻译系统,该系统通过延迟发布、验证输出等方式保障翻译可用性,经测试符合多项规则要求。

Comments 9 pages, 2 figures. A sanitized reference implementation is included as ancillary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05026 2026-08-06 cs.HC cs.AI 新提交 74%

ArtAnno: Annotating Implicit Semantics in Artworks through LLM Agent-Driven Bidirectional Human-AI Augmentation

ArtAnno:通过大语言模型智能体驱动的双向人机增强对艺术品的隐式语义进行标注

Xiaoyan Gu, Yifang Wang, Wenqing Zheng, Haozhong Liu, Yixia Zheng, Peiyi Jiang, Wenjie Ning, Wei Zhang, Wei Chen

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本研究针对艺术品隐式语义标注效率低的问题,提出双向人机增强框架并实现ArtAnno系统,经评估可提升标注效率、实现知识积累并减少标注员的信息处理工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04885 2026-08-06 cs.CV cs.CL 新提交 74%

Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

评估视觉-语言模型在视觉和文本扰动下的诊断鲁棒性

Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili

机构 * University of Tehran(德黑兰大学) Tehran University of Medical Sciences(德黑兰医科大学) Advanced Diagnostic and Interventional Radiology Research Center (ADIR)(高级诊断与介入放射学研究中心(ADIR))

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 本研究通过脑部MRI数据集评估四类视觉-语言模型在视觉、文本扰动下的诊断鲁棒性,发现其存在预测翻转、文本选择偏差、诊断过度承诺等问题,指出需采用稳定性指标评估其临床应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27984 2026-07-31 cs.AI 新提交 74%

Share the Judge, Learn the Deferral: Where Specialization Helps LLM Evaluation

共享评判,学习弃权:专业化在大语言模型评估中的作用

Weining Zhang

机构 * Cheung Kong Graduate School of Business(长江商学院)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 该研究探讨大语言模型评估中领域专业化的架构设计,发现将专业化置于弃权而非评判环节,通过共享学习与级联路由可提升评估准确率并降低计算量。

Comments 12 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27360 2026-07-31 cs.AI 新提交 74%

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

SkillMentor:基于盲点诊断的大语言模型智能体自我进化

Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Platform and Content Group, Tencent(腾讯平台与内容事业群) Soochow University(苏州大学)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本文提出SkillMentor,将盲点诊断作为独立于执行的可学习智能体能力,通过强化学习训练导师策略,在AppWorld和BFCLv3上使执行器性能平均提升44.2%,实现无需更新执行器的智能体自我进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25152 2026-07-29 cs.AI 新提交 74%

When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops

智能体循环何时会将停滞误认为进步?长期运行的自主语言模型智能体循环中的自我评估偏差与外部基础验证

Hyundoo Park, Byungho Choi

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究长期运行的自主智能体循环中自我评估偏差导致的“进步幻觉”问题,通过构建测试平台,控制评估者信息通道类型,发现自我报告无意义,带内评判者也有偏差,指出开放式目标需带外评估,强调评估者依据对结果的重要性。

Comments 23 pages. Preregistered pilot measurement study. Also deposited on Zenodo (concept DOI 10.5281/zenodo.21594735)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24314 2026-07-28 cs.LG 新提交 74%

MEGA-CL: A Molecular Foundation Model for Generalizable ADMET Prediction through Graph External Attention and Contrastive Learning

MEGA-CL:通过图外部注意力和对比学习实现可泛化ADMET预测的分子基础模型

Tinghui Jin, Kedu Jin, Ying Li, Guanghui Ren, Jingzhi Xue, Shiyu Zhou, Xiaoli Dai, Li-bin Wei, Xijing Chen, Di Zhao, Jinfeng Liu

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 该研究针对小分子ADMET预测难题,提出MEGA-CL框架,集成自监督对比学习等技术,能同时建模局部与全局关系并减轻过平滑。它在多数据集和任务中优于基线模型,在回归任务及外部验证中表现出色,还通过实验验证了其在药物研发中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22671 2026-07-28 cs.AI 新提交 74%

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

AIR-BENCH Live:基础模型不断演进的安全基准测试

Rohan Naphade, Minzhou Pan, Bo Li

机构 * Virtue AI(美德人工智能公司) Carnegie Mellon University(卡内基梅隆大学) Northeastern University(东北大学) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :foundation model(title);分类 cs.AI

AI总结 研究针对基础模型安全基准测试随模型和法规发展而不足的问题,提出AIR-BENCH Live,通过自动化更新管道和多智能体算法更新提示,扩展了基准测试风险数量,评估模型发现安全范围广等结果,使其能随领域发展。

Comments 11 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21656 2026-07-27 cs.SE cs.AI 新提交 74%

Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

跨模型大语言模型代码审查:应该用Claude审查Codex还是相反?

Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu

机构 * University of California, Davis(加州大学戴维斯分校) Johns Hopkins University(约翰霍普金斯大学) California State University, Long Beach(长滩加州州立大学)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究开发者同时使用Claude和Codex进行代码审查的成本、时间及配对顺序问题,通过对116个任务的六种条件实验发现,Claude审查Codex草稿效果好,反向则不佳,有用的配对是不对称的,应Claude审查Codex。

Comments This paper had been accepted by Agentic SE @ KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21635 2026-07-27 cs.LG 新提交 74%

Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions

面向时间干预下个人语言模型代理的用户条件评估

Pin Qian, Su Wang, Yihang Chen, Qiaolin Yu, Xiaoyuan Wang, Zhitong Guo, Zhicheng Wang, Junxian You

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) University of Glasgow(格拉斯哥大学)

专题命中 评测与基准 :LLM(title);分类 cs.LG

AI总结 研究个人语言模型代理在时间干预下的用户条件评估,提出需在不同用户条件状态下重放时间干预并测量故障传播的协议,形式化四个条件,审查发现无满足条件的公开协议,进而提出最小基准设计和候选报告指标。

Comments 9 pages, 2 figures, and 8 tables. Accepted for oral presentation at the ACM SIGKDD KDD 2026 Workshop on Personal Intelligence in the Agentic AI Era (PILA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21292 2026-07-24 cs.AI cs.SY eess.SY 新提交 74%

An LLM-Driven Workflow for Automated Process Control Strategy Generation and Tuning from Dynamic Process Models

一种由大语言模型驱动的工作流程,用于从动态过程模型自动生成和调整过程控制策略

Ari Luna Rueda, Eike Cramer, Klaus Hellgardt, Mehmet Mercangöz

机构 * Imperial College London(帝国理工学院) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 该研究提出由大语言模型驱动的工作流程,用于从动态过程模型自动生成和调整控制策略,将设计任务分解为多步骤,经执行验证和修复,在气体预热器基准测试中生成控制结构与环境,贝叶斯优化降低闭环性能目标约26.5%,证明方法可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏