arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2606.13140 2026-06-16 cs.SI 新提交 91%

MIDSim: Simulating Multi-Channel Information Diffusion in Social Media with LLM-Powered Multi-Agent System

MIDSim: 基于LLM多智能体系统的社交媒体多渠道信息扩散模拟

Lexi Liu, Qi Cao, Yuanhao Liu, Huawei Shen, Xueqi Cheng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LLM驱动的多智能体系统,联合建模社交与算法曝光流,模拟多渠道信息扩散,在三个真实数据集上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10546 2026-06-11 cs.MA 版本更新 91%

SkillAxe: Sharpening LLM-Authored Agent Skills Through Evaluation-Guided Self-Refinement

SkillAxe: 通过评估引导的自我精炼提升LLM编写的智能体技能

Srishti Gautam, Arjun Radhakrishna, Sumit Gulwani

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SkillAxe框架,通过无监督评估引导LLM自我诊断和精炼技能,在SkillsBench上提升通过率28%,缩小与人类技能的差距47-67%。

Comments 9 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10095 2026-06-10 cs.HC 新提交 91%

LLM-Based Visualization Evaluation: How Well Do Literacy-Stratified Personas Approximate Human Judgments?

基于LLM的可视化评估:按识字分层的人物角色在多大程度上接近人类判断?

Swaroop Panda

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出识字分层LLM评估框架(LSLE),通过构建可视化识字角色并引导LLM模拟评估,与人类数据对比,发现其在早期设计探索中有效,但在总结性评估中系统失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08588 2026-06-09 cs.SE 新提交 91%

LLM vs. Human Unit Tests: Fault Detection on Real Python Bugs

LLM vs. 人类单元测试:对真实 Python 错误的故障检测

Phouvadeth Vathana, Prapti Bhatt, Rishi Patel, Nasir U. Eisty

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过对比 LLM 生成与人工编写的单元测试在真实 Python 错误上的故障检测能力,发现 LLM 结合检索增强上下文可检测 69% 的故障,远超人工测试的 17.2%,且代码覆盖率相近,表明覆盖率不足以衡量故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08283 2026-06-09 q-fin.PM q-fin.TR 新提交 91%

Macro Economists in the Machine: A Multi-Agent LLM Framework for Commodity-Related ETF Portfolio Construction

机器中的宏观经济学家:用于商品相关ETF投资组合构建的多智能体LLM框架

Yiqing Wang, Dehao Dai, Ding Ma, Kerui Geng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究固定信息集和规则下,LLM在商品投资组合构建中能否增加价值。三种LLM策略(鹰派、鸽派、辩论)在夏普比率上优于规则代理,鹰派和辩论代理增益显著,但辩论代理未超越最佳单一代理,其贡献在于偏差校正。

Comments 45 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02334 2026-06-02 cs.DB 91%

Less Is More? When Dataset Context Hurts LLM-Generated Dataset Descriptions

少即是多?当数据集上下文损害LLM生成的数据集描述时

Lisa-Yao Gan, Arunav Das, Johanna Walker, Klaus Diepold, Elena Simperl

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过大规模消融实验,研究不同数据集上下文(标题、模式、代表性数据)对LLM生成数据集描述质量的影响,发现模式单独使用会降低叙事质量,而代表性数据部分改善但未提升整体面向人类的质量。

Comments Accepted to ICDE26 KDExLLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14097 2026-06-02 cs.HC 91%

Real-Time Group Dynamics with LLM Facilitation: Evidence from a Charity Allocation Task

基于LLM辅助的实时群体动态:来自慈善分配任务的证据

Aaron Parisi, Nithum Thain, Alden Hallak, Vivian Tsai, Crystal Qian

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过两项激励相容的慈善分配实验(N=879),研究LLM辅助对群体共识、分配结果和参与感知的影响,发现LLM虽未提升共识但被偏好,且存在算法引导和包容性幻觉风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20070 2026-06-02 cs.RO 91%

LLM Trainer: Automated Robotic Data Generation via Demonstration Augmentation using LLMs

LLM Trainer:利用大语言模型通过演示增强自动生成机器人数据

Abraham George, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LLM Trainer,一种利用大语言模型的世界知识将少量人类演示自动扩展为大规模机器人数据集的管道,通过离线标注和在线关键姿势重定向生成新轨迹,并采用汤普森采样优化标注。

Comments 9 pages, 5 figures, 4 tables. Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29293 2026-05-29 cs.MA 91%

LLM-ALSO: LLM-Driven Adaptive Learning-Signal Optimization for Multi-Agent Reinforcement Learning

LLM-ALSO:基于大语言模型驱动的自适应学习信号优化用于多智能体强化学习

Xiaoguang Wu, Zhi Zheng, Hui Xiong

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对稀疏奖励下多智能体强化学习协调困难的问题,提出LLM-ALSO框架,通过迭代诊断、提议和验证机制利用大语言模型自适应优化奖励塑形配置,提升学习效率与性能。

Comments 14 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03089 2026-05-27 cs.CL cs.AI cs.LG 91%

Faithfulness Evaluation for Decoder-only LLM Attributions with Controlled Retained Information

基于受控保留信息的仅解码器LLM归因忠实性评估

Xin Huang, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有软扰动忠实性指标因保留词数不同导致评估偏差的问题,提出π-Soft-NC和π-Soft-NS框架,通过控制期望保留概率公平比较归因方法,并引入专用于自回归解码器LLM的梯度归因方法Grad-ELLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25273 2026-05-26 cs.CY 91%

LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment

LLM-as-a-Judge 在医疗保健中的应用:应用、方法和人类一致性的范围分析

Lingyao Li, Deyi Li, Chen Chen, Renkai Ma, Runlong Yu, Mingquan Lin, Rui Yin, Lizhou Fan, Cathy Shyr, Siyuan Ma, Mei Liu, Steven Bethard

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过PRISMA指导的系统综述,分析了LLM-as-a-Judge在医疗保健中的应用场景、技术配置和与人类专家判断的一致性,发现其在临床决策支持、自然语言处理等领域有广泛应用,但可靠性因任务而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13510 2026-05-26 cs.CY 91%

Safe-Child-LLM: A Developmental Benchmark for Evaluating LLM Safety in Child-LLM Interactions

Safe-Child-LLM:评估儿童与LLM交互安全性的发展基准

Junfeng Jiao, Saleh Afroogh, Kevin Chen, Abhejay Murali, David Atkinson, Amit Dhurandhar

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Safe-Child-LLM基准,通过200个对抗性提示和伦理拒绝量表,系统评估LLM在儿童(7-12岁)和青少年(13-17岁)交互中的安全性,发现主流模型存在严重安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05364 2026-05-25 cs.SE 91%

Survey of LLM Agent Communication with MCP: A Software Design Pattern Centric Review

LLM智能体通信与MCP综述:以软件设计模式为中心的回顾

Anjana Sarkar, Soumyendu Sarkar

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文综述了经典软件设计模式如何增强基于LLM的智能体AI系统中通信的可靠性和可扩展性,重点分析了模型上下文协议(MCP),并探讨了中介者、观察者、发布-订阅和代理等模式在MCP兼容框架中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19110 2026-05-20 cs.CE 91%

IterSIMP-σ: Evaluating LLM-Assisted Spatial Interventions in Stress-Aware Topology Optimization

IterSIMP-σ:评估LLM辅助的应力感知拓扑优化中的空间干预

Shaoliang Yang, Jun Wang, Yunsheng Wang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究多模态大语言模型(LLM)是否能作为可检查的空间提案模块用于应力感知拓扑优化。IterSIMP-σ保持SIMP优化器作为最小化合规性的有限元求解器,并在其周围放置一个确定性的应力传递、门控评估器和混合LLM/规则解释器。每次求解后,密度和von Mises应力场被渲染;解释器提出排名的空间干预;确定性的安全措施接受、拒绝或停止每个动作。主要动作是软密度种子,所选元素在下一次求解前被初始化为高密度,但在最优标准更新时仍保持自由。我们评估该循环在16问题2D控制器-政策基准、6问题探索性3D扩展、被动固体和输入消融、应力阈值敏感性以及固定体积归因研究中,比较LLM提案与确定性最大应力热点种子、随机应力区域种子和基于规则的控制。2D控制器-政策基准显示保留合规性差异较小(软种子LLM的几何均值低1.9%),但此诊断不显著(W=33,双侧p=0.382)且不是固定体积可行最终比较。在固定体积研究中,LLM条件完成了44/48次尝试评估;25/44次完成评估产生了全部门通过的保留状态。与基于规则的控制的可行最终评分分为4/4/1,确定性精确热点种子仍具竞争力。接受的LLM空间动作有每步记录的平均归一化种子到热点距离为0.221。结果支持IterSIMP-σ作为可检查的LLM辅助设计自动化框架用于空间干预,但尚未作为证据表明LLM视觉推理能改进应力约束优化。

Comments 44 pages, 19 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16832 2026-05-19 cs.CV 91%

Coarse Semantic Injection for LLM-Conditioned Structured Indoor Prediction

粗粒度语义注入用于LLM条件的结构室内预测

Shuliang Zhu, Tomiwa Adey, Jinjia Zhou

机构 * Shuliang Zhu(朱舒良) Tomiwa Adey(阿德伊汤米瓦) Jinjia Zhou(周锦佳)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种接口保持的语义增强方法,用于LLM条件的结构解码,通过将语义证据与点云表示关联,将其编码为RGBB点接口,以提升结构室内预测的精度,特别是在复杂场景中的门框定位和家具检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01245 2026-05-19 cs.CR 91%

Comprehensive Vulnerability Analysis is Necessary for Trustworthy LLM-MAS

全面的漏洞分析对于可信的LLM-MAS至关重要

Pengfei He, Yue Xing, Juanhui Li, Shen Dong, Zhenwei Dai, Xianfeng Tang, Hui Liu, Han Xu, Zhen Xiang, Charu C. Aggarwal, Hui Liu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨了构建可信LLM-MAS需进行全面漏洞分析,提出统一框架以量化不同架构中的漏洞,并识别关键挑战如构建专用评估基准和实现安全信任管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15766 2026-05-18 cs.CE 91%

BioXArena: Benchmarking LLM Agents on Multi-Modal Biomedical Machine Learning Tasks

BioXArena:在多模态生物医学机器学习任务上评估LLM代理的基准测试

Loka Li, Duzhen Zhang, Xingbo Du, Leonard Song, Zixiao Wang, Assanali Aukenov, Noel Thomas, Shakhnazar Sailaukan, Yonghan Yang, Feilong Chen, Jiahua Dong, Kun Zhang, Bin Zhang, Le Song

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出BioXArena基准测试,旨在评估LLM代理能否为异构多模态生物医学数据集生成任务特定的模型训练流程,包含9个领域76个端到端任务,评估指标涵盖隐藏标签、隐藏评分者和生物意识度量,通过标准化环境评估11种代理配置。

Comments 69 pages, 13 figures, 34 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20924 2026-05-15 cs.CR 91%

RLCracker: Evaluating the Worst-Case Vulnerability of LLM Watermarks with Adaptive RL Attacks

RLCracker: 评估LLM水印的最坏情况漏洞

Hanbo Huang, Yiran Zhang, Hao Zheng, Xuan Gong, Yihan Li, Lin Liu, Zhuotao Liu, Shiyu Liang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出RLCracker,通过强化学习方法评估LLM水印的最坏情况漏洞,证明水印对改写攻击高度敏感,并在有限样本下实现高移除率。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04056 2026-05-13 cs.CR 91%

QuiLL: An LLM-Based Vulnerability Assessment Framework for the Wild

QuiLL:一种基于LLM的漏洞评估框架

Rijha Safdar, Danyail Mateen, Syed Taha Ali, Wajahat Hussain

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出QuiLL,首个针对真实世界漏洞检测的综合评估框架,通过端到端流程结合先进LLM优化技术,提供动态上下文学习和新颖评分指标,用于系统评估不同LLM的漏洞检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11772 2026-05-13 cs.SE 91%

Breaking the Dependency Chaos: A Constraint-Driven Python Dependency Resolution Strategy with Selective LLM Imputation

打破依赖混沌:一种基于约束的Python依赖解析策略与选择性LLM填补

Kowshik Chowdhury, Dipayan Banik, Shazibul Islam Shamim

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SMT-LLM,通过形式化约束求解替代LLM猜测,利用AST分析和vermin工具确定Python版本,并在PyPI查询前构建约束图以解决版本一致性问题,提升解析效率。

Comments 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14823 2026-05-11 physics.ed-ph 91%

Using an LLM to Investigate Students' Explanations on Conceptual Physics Questions

利用LLM探究学生对概念物理问题的解释

Sean Savage, N. Sanjay Rebello

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文利用LLM评估学生对能量与动量概念问题的书面解释,发现其评估结果与人类评分者一致,且能揭示不同错误解释类别,为教学提供更深入的理解。

Comments 5 pages, 3 figures and Physics Education Research Conference 2025

Journal ref 2025 PERC Proceedings, pp. 399-404 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02215 2026-05-11 cs.SE 91%

HEJ-Robust: A Robustness Benchmark for LLM-Based Automated Program Repair

HEJ-Robust:基于LLM的自动程序修复的鲁棒性基准

Fazle Rabbi, Jinqiu Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HEJ-Robust基准,通过八种语义保持的代码转换生成1450个实例,评估五种微调LLM,在多种转换下模型性能下降超50%,揭示当前LLM修复模型缺乏对细微语法变化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05260 2026-05-08 cs.CR 91%

SecureMCP: A Policy-Enforced LLM Data Access Framework for AIoT Systems via Model Context Protocol

SecureMCP: 一种通过模型上下文协议实现的基于策略的LLM数据访问框架,用于AIoT系统

Wonbae Kim, Hee-Kyong Yoo

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SecureMCP框架,结合RBAC与MCP服务器,通过五种防御模块实现多层防护,提升LLM生成SQL的安全性,实验显示其在保护数据安全和执行准确率方面表现优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27001 2026-05-01 cs.CR cs.SE 91%

An Empirical Security Evaluation of LLM-Generated Cryptographic Rust Code

对LLM生成的密码学Rust代码的实证安全评估

Mohamed Elsayed, Kenneth Fulton, Jeong Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了三种LLM生成的加密Rust代码的安全性,发现通用工具不足,提示策略对结果影响显著,且存在nonce重用等系统性问题。

Comments 10 pages, 2 figures , EASE 2026-The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24579 2026-04-28 cs.SE 91%

Measuring the Unmeasurable: Markov Chain Reliability for LLM Agents

测量不可测量的:用于LLM代理的马尔可夫链可靠性

Phat T. Tran-Truong, Xuan-Bach Le

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TraceToChain方法,通过构建吸收离散时间马尔可夫链模型,对LLM代理执行轨迹进行可靠性分析,提供更精确的成功时间分布估计和不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23374 2026-04-28 cs.CR 91%

Ghost in the Agent: Redefining Information Flow Tracking for LLM Agents

代理中的幽灵:重新定义LLM代理的信息流跟踪

Yuandao Cai, Wensheng Tang, Cheng Wen, Shengchao Qin

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出NeuroTaint框架,通过语义证据、因果推理和持久上下文跟踪,解决LLM代理中信息流跟踪问题,优于现有基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23196 2026-04-28 cs.CR 91%

AsmRAG: LLM-Driven Malware Detection by Retrieving Functionally Similar Assembly Code

AsmRAG:通过检索功能相似的汇编代码实现LLM驱动的恶意软件检测

ElMouatez Billah Karbab

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AsmRAG框架,利用LLM分析汇编代码,通过语义检索提升恶意软件检测的可解释性与鲁棒性,实验表明其在检测和家族归因任务中达到96%和95%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15232 2026-04-28 cs.SE 91%

When Agents Fail: A Comprehensive Study of Bugs in LLM Agents with Automated Labeling

当代理失效:对LLM代理中bug的全面研究与自动化标记

Niful Islam, Ragib Shahriar Ayon, Deepak George Thomas, Shibbir Ahmed, Mohammad Wardat

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过分析1187个bug相关帖子和代码片段,研究LLM代理中的bug类型、根本原因及影响,并构建BugReAct代理自动标记bug。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22234 2026-04-27 cs.AR 91%

GR-Evolve: Design-Adaptive Global Routing via LLM-Driven Algorithm Evolution

GR-Evolve: 通过LLM驱动的算法进化实现设计自适应的全局路由

Taizun Jafri, Vidya A. Chhabria

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出GR-Evolve框架,利用LLM自动优化EDA工具的全局路由算法,通过设计特性自适应提升路由性能,实验显示在三个工艺节点上实现8.72%的线长减少。

Comments Long version of ICCAD 2026 submitted paper under review. 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21505 2026-04-24 cs.SE 91%

Assessing the Impact of Requirement Ambiguity on LLM-based Function-Level Code Generation

评估需求模糊性对基于LLM的函数级代码生成的影响

Di Yang, Xinou Xie, Xiuwen Yang, Ming Hu, Yihao Huang, Yueling Zhang, Weikai Miao, Ting Su, Chengcheng Wan, Geguang Pu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Orchid基准,评估需求模糊性对LLM代码生成的影响,发现模糊性显著降低模型性能,且高阶模型受影响更严重,揭示了明确与模糊需求之间的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏