arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2608.03880 2026-08-05 cs.PF cs.DC 新提交 89%

Evaluating MFU as a Proxy for GPU Power for Energy-Aware Simulation of LLM Training

评估MFU作为GPU功耗代理用于LLM训练的能效感知仿真

Niklas Enskat, Philipp Wiesner

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本研究测试MFU能否作为LLM训练的GPU功耗预测器,通过近3000次单设备训练基准测试,发现计算密集型 workload 下基于MFU的线性模型适用,特定参数拟合可大幅降低误差。

Comments Accepted at MASCOTS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03535 2026-08-05 cs.SE 新提交 89%

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation

CodeAssay:带有审计基准真值的多指标大语言模型代码生成基准

Shahbaz Siddeeq, Muhammad Waseem, Umar Subhan Malhi, Pekka Abrahamsson

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CodeAssay基准,涵盖185个Python任务,结合多类测试与度量,经审计后发现模型正确性标签有9.0%变化,且验证了多类LLM代码生成的评估特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03091 2026-08-05 cs.IR 新提交 89%

Position Bias Undermines Preference Consistency in Listwise LLM-Based Reranking

位置偏差破坏基于大语言模型的列表式重排序中的偏好一致性

Ethan Bito, Yongli Ren, Estrid He

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究揭示基于LLM的列表式重排序存在位置偏差,引入多维度评估框架验证其会破坏偏好一致性,且均衡位置曝光无法修复该问题。

Comments Accepted at RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02827 2026-08-05 cs.MA 新提交 89%

Emergence of Biased Consensus in Multi-Agent LLM Debates

多智能体LLM辩论中偏向性共识的涌现

Maya Okawa

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究针对多智能体LLM辩论中集体偏向性共识的涌现问题,提出物理启发的社会动力学分析框架,经实验验证其相变规律,发现智能体异质性可抑制该现象,且见解可推广至投资等现实决策任务。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02758 2026-08-05 cs.MA 新提交 89%

Everyone Conforms, No One Believes: Pluralistic Ignorance in LLM Agent Populations

人人遵从,无人认同:LLM智能体群体中的多元无知

Yashwanth YS

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究证实LLM智能体群体中会出现多元无知,构建了多场景基准评估8种模型,发现遵从率高且级联成功率低,提示模型选择会影响模拟结果,LLM模拟或高估社会规范稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28814 2026-08-03 cs.CL cs.AI cs.LG 新提交 89%

Rolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational Interviewing

顺应阻力:偏好优化的大型语言模型(LLM)咨询师可在动机访谈中权衡目标坚持性与关系调谐

Weiying Chen, Junlong Shen, Zhexuan Tang

专题命中 评测与基准 :LLM(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究基于动机访谈准则构建双轴评估框架,通过偏好优化训练LLM咨询师,发现惩罚对抗会降低目标坚持性,惩罚妥协无显著效果,仅提示控制可提升关系调谐且无目标坚持性代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12467 2026-07-15 cs.SE 新提交 89%

Understanding before Naming! Enhancing LLM-based Method Name Prediction with Code Summarization

命名之前先理解!通过代码摘要增强基于大语言模型的方法名预测

Wei Liu, Weisong Sun, Tingting Xu, Hanwei Qian, Yi Zhao, Chunrong Fang, Xia Feng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对方法名预测中现有评估不能反映语义质量、基于LLM的方法与人命名过程不同的问题,通过实证研究比较多种评估器及策略,提出结合摘要和细化的SMNP方法,实验证明该方法在方法名预测上有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12089 2026-07-15 cs.CR cs.SE 新提交 89%

Cross-Cutting Security Analysis of LLM-Generated Code via Metamorphic Testing and Association Rule Mining

通过变形测试和关联规则挖掘对大语言模型生成代码进行横切安全分析

Zedong Peng, Chenggang Wang, Shangyue Zhu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对LLM生成代码的安全漏洞,提出结合变形测试与关联规则挖掘的框架,定义九个MRs并应用于3700个代码片段,揭示共同违反结构与横切模式,还进行提示级风险分析,发现不安全代码生成具结构化和提示依赖性,推动相关验证与干预。

Comments This work has already been accepted by IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11390 2026-07-14 cs.SE 新提交 89%

TerraRepair: A Tool-Grounded LLM Agent for Infrastructure-as-Code Repair

TerraRepair:一种用于基础设施即代码修复的工具接地大语言模型代理

Minase Mekete Mengistu, Juri Di Rocco, Phuong T. Nguyen, Davide Di Ruscio

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨工具接地能否改进基于LLM的Terraform修复及何时升级问题。提出TerraRepair工具接地LLM代理,通过检索上下文等操作进行修复。实验表明其能显著提高扫描器验证修复率,凸显工具接地改进修复效果,同时指出特定部署上下文是自主修复的主要限制。

Comments The paper has been peer reviewed and accepted for publication in the proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07739 2026-07-10 cs.CR 新提交 89%

Controllability-Aware Adversarial Examples Against LLM-Based Network Traffic Classifiers

针对基于大语言模型的网络流量分类器的可控性感知对抗样本

Zhenpeng Li

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的网络流量分类器的对抗鲁棒性,提出可控性感知黑盒迁移框架,按通信语义划分特征组限制扰动,生成对抗样本并迁移到多个目标,发现LLM迁移漏洞及相关特性,验证跨架构迁移层次和交叉代理有效性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01855 2026-07-03 cs.SE 新提交 89%

Regression Accumulation in Multi-Turn LLM Programming Conversations

多轮LLM编程对话中的回归累积

Yonghui, Huang, Lin Ma, Amjed Tahir, Qian Zhang, Liwen Xiao, Lysa Xiao

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 研究多轮LLM编程对话中代码建议破坏先前需求的回归累积问题,通过构建542个任务链评估六种模型,发现40%-73%的任务出现回归,并验证了Verification Gate策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01277 2026-07-03 cs.CR 新提交 89%

Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety

认知防火墙:一种主动、零信任、多门控的LLM安全框架

Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01040 2026-07-02 cs.IR 新提交 89%

As It Was: Aligning LLM Search Evaluation with Historical User Preferences

如其所是:将LLM搜索评估与历史用户偏好对齐

Ali Vardasbi, Gustavo Penha, Enrico Palumbo, Claudia Hauff, Hugues Bouchard, Mounia Lalmas

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00910 2026-07-02 cs.MA 新提交 89%

Calibrating the Instrument: Controllability of an LLM-Driven Synthetic Population

校准仪器:LLM驱动的合成人群的可控性

Mirko Degli Esposti

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出SIVE实验,通过七项预注册标准评估LLM驱动合成人群对已知效价刺激的响应可控性,发现弱阳性消息被识别为阴性,经重新设计后恢复预期排序,并揭示噪声特性与微观动力学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00555 2026-07-02 cs.SE 新提交 89%

Rise From The Ashes: LLM-based Static Analysis for Deep Learning Framework Bugs

从灰烬中崛起:基于LLM的深度学习框架缺陷静态分析

Shaoyu Yang, Haifeng Lin, Chunrong Fang, Xiang Chen, Wei Cheng, Jiawei Liu, Yiyu Zhang, Hongyu Liu, Zhenyu Chen

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出首个基于LLM的静态分析技术Phoenix,通过结构化语义桥接中间表示建模跨语言张量流,结合多智能体工作流检测深度学习框架缺陷,已在PyTorch中发现31个新bug。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32034 2026-07-01 cs.LG cs.AI cs.CL 新提交 89%

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents

QVal:廉价评估长周期LLM智能体的密集监督信号

Sergio Hernández-Gutiérrez, Matteo Merler, Ilze Amanda Auzina, Joschka Strüber, Ameya Prabhu, Matthias Bethge

机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出QVal,一种无需训练的基准测试,通过Q值对齐直接评估密集监督信号质量,避免下游训练开销。在21种方法、4个环境上的实验表明,简单提示基线优于现有方法。

Comments 10 pages, 5 figures in main text; 48 pages, 6 figures with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27666 2026-06-29 cs.AR 新提交 89%

MultModLM: A multi-modal benchmark for Large-Language Model based hardware schematic generation

MultModLM:基于大语言模型的硬件原理图生成的多模态基准

Dhruv Kulkarni, Sai Manoj Pudukotai Dinkarrao

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 提出MultModLM基准,评估LLM从RTL描述生成硬件原理图的能力,通过多阶段评估框架发现模型生成原理图功能正确性有限,且LLM评估者与人类评分一致性极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27650 2026-06-29 cs.MA 新提交 89%

GenWorld: Empirically Grounded Urban Simulation Infrastructure for Scalable LLM-Agent Studies

GenWorld:用于可扩展LLM智能体研究的经验性城市模拟基础设施

Gen Li, Jieyuan Lan, Pengcheng Xu, Zongyuan Wu, Masaki Ogura, Tao Feng

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出GenWorld,一种结合合成城市、结构化接口和离线编译LLM决策信号为查找策略的经验性城市模拟基础设施,实现可扩展的LLM智能体研究。

Comments 27 pages, 24 figures. Code: https://github.com/Perseus1993/genworld. Project page: https://genworld1993.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26978 2026-06-26 cs.SE 新提交 89%

To Run or Not to Run: Analyzing the Cost-Effectiveness of Code Execution in LLM-Based Program Repair

运行还是不运行:分析基于LLM的程序修复中代码执行的成本效益

Zhihao Lin, Junhua Zhu, Mingyi Zhou, Xin Wang, Zhensu Sun, Renyu Yang, David Lo, Li Li

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 通过分析SWE-bench上的代理轨迹和端到端修复尝试,发现代码执行在LLM程序修复中普遍使用但效益不均,限制执行可节省成本且不影响修复成功率。

Comments Accepted to the ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026). 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26937 2026-06-26 cs.HC 新提交 89%

Continuous Behavioral Synthesis for Adaptive Health Dashboards: An LLM-Mediated Architecture Integrating Explicit Preference, Spatial Reorganization, and Attention Allocation Signals

自适应健康仪表盘的连续行为合成:一种集成显式偏好、空间重组和注意力分配信号的LLM中介架构

Tiziano Santilli, Mina Alipour, Mahyar T. Moghaddam

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种利用大语言模型作为行为合成引擎的架构,通过集成显式反馈、空间重组和注意力信号,实现从稀疏异构用户信号中即时生成自适应仪表盘布局。

Comments 33 pages, Accepted EICS2026 Patras, Greece

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25296 2026-06-25 cs.AR 新提交 89%

SafeGen: LLM-Driven Assertion Generation and Fault Criticality Evaluation for Functional Safety

SafeGen: 面向功能安全的LLM驱动断言生成与故障关键性评估

Xuanyi Tan, Arjun Chaudhuri, Rubin Parekhji, Krishnendu Chakrabarty

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SafeGen框架,利用大语言模型和超知识图谱从设计文档提取规范并生成功能安全断言,结合门级到RTL故障映射与形式验证实现故障关键性语义分级,在FOC系统中验证了优于传统方法。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24689 2026-06-24 cs.SE 新提交 89%

Automated Summarization of Software Documents: An LLM-based Multi-Agent Approach

软件文档的自动摘要:一种基于LLM的多智能体方法

Duc S. H. Nguyen, Minh T. Nguyen, Phuong T. Nguyen, Juri Di Rocco, Davide Di Ruscio

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出基于大语言模型的多智能体系统Metagente,采用师生架构协作生成软件文档摘要,在真实数据集上优于基线方法,提升需求分析和技术文档的摘要效果。

Comments Paper has been accepted for publication with the Automated Software Engineering journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22961 2026-06-23 cs.IR 新提交 89%

LLM-as-a-Judge for Reliable and Explainable Offline Evaluation in Top-K Recommendation

LLM-as-a-Judge:用于Top-K推荐中可靠且可解释的离线评估

Yue Que, Junyi Zhou, Xiaokun Zhang, Haiming Jin, Qiao Xiang, Chen Ma

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 针对离线评估中反馈偏差和缺乏解释的问题,提出基于LLM的语义代理和推理评分框架,提升评估可靠性与可解释性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21658 2026-06-23 hep-ex astro-ph.IM hep-ph 新提交 89%

Towards LLM-Powered Automation of a Dark Matter Constraint Repository

基于大语言模型的暗物质约束库自动化

Lanqing Yuan, Karthik Ramanathan

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 提出一个LLM流水线,从arXiv论文中提取暗物质约束曲线并生成拉取请求,在基准测试中达到90.5%的耦合类型分类准确率和0.33 dex的中位残差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17707 2026-06-17 cs.IR 新提交 89%

Do Generative Recommenders Deepen the Information Cocoon? A Closed-Loop Simulation with LLM-powered User Simulators

生成式推荐器会加深信息茧房吗?基于LLM用户模拟器的闭环仿真

Jiyuan Yang, Gengxin Sun, Mengqi Zhang, Lingjie Wang, Yuanzi Li, Hongxi Cui, Xin Xin, Pengjie Ren

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出闭环仿真框架RecLoop,利用LLM用户代理比较生成式与传统推荐器,发现生成式推荐器在暴露层面不易形成信息茧房,但反馈循环仍会导致编码空间集中,且茧房严重程度取决于分词策略和模型规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16839 2026-06-16 cs.SE 新提交 89%

Towards LLM Accelerated Rapid Reviews for Software Tool Discovery -- Case for Log Anomaly Detection

面向软件工具发现的LLM加速快速综述——以日志异常检测为例

Jesse Nyyssölä, Hamza Bin Mazhar, Alexander Bakhtin, Matteo Esposito, Nana Reinikainen, Yuqing Wang, Ying Song, Davide Taibi, Mika Mäntylä

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出一种结合LLM筛选和编码代理的流水线,用于快速识别和运行软件工具,在日志异常检测案例中实现高效综述。

Comments 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14622 2026-08-18 cs.AI 新提交 89%

A Human-Centred Approach to Benchmarking LLMs for Parenting Advice

以人为中心的基准测试大型语言模型(LLM)育儿建议方法

Yunke Zhao, Isobel Voysey, Alastair van Heerden, Rob Hughes, Jun Zhao

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文以育儿专家的多维度评分为标准,采用LLM作为评判者,评估15个LLM在100个育儿场景中英、中文的表现,发现聚合分数掩盖弱点、模型隐性影响育儿风格等,为相关应用提供见解。

Comments 15 pages. Submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04828 2026-08-06 cs.CL 新提交 89%

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

技能使用:智能体框架中的大语言模型(LLM)真的能使用技能吗?

Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

机构 * East China Normal University(华东师范大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tencent Hunyuan(腾讯混元)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究推出Skill-Use基准,评估智能体在渐进式披露下的技能使用,发现8个LLM在两个框架下的SU分数仅0.613,技能使用是依赖框架的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03512 2026-08-05 cs.AI 新提交 89%

Reversing Arrows in Large Language Models

反转大语言模型中的箭头

Sefika Efeoglu, Adrian Paschke

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究首次系统探究大语言模型的反向关系方向性,用含5457个实例的基准评估5种开源模型,发现其反向关系分类存在不对称性,关系描述与实体表示会影响性能。

Comments The preprint is under review in a venue

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03154 2026-08-05 cs.CL 新提交 89%

ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架

Shufan Ming, Yikun Han, Gibong Hong, Rui Zhang, Halil Kilicoglu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。

Comments Submitted to Journal of Biomedical Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏