arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-03 至 2026-08-03 共收录 30 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 30 篇

2607.28802 2026-08-03 cs.AI 新提交 83%

Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures

模型还是控制?一种以交互为中心的智能体故障定位分类法

Harsh Raj, Vipul Gupta, Anas Mahmoud, Razvan-Gabriel Dumitru, Darvin Yi, Aakash Sabharwal, Yunzhong He

机构 * Scale

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 该研究提出以交互为中心的智能体故障分类法,将故障定位到交互及责任组件,适用于多类智能体架构,经评估具有良好可重复性与结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20075 2026-08-03 cs.SE cs.AI 版本更新 81%

Agentic Harness for Real-World Compilers

面向现实世界的编译器助手

Yingwei Zheng, Cong Li, Shaohua Li, Yuqun Zhang, Zhendong Su

机构 * Southern University of Science and Technology(南方科技大学) ETH Zurich(苏黎世联邦理工学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出llvm-autofix,首个专为修复编译器bug设计的代理工具,通过专用工具和基准测试展示其在处理复杂编译器bug时的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28685 2026-08-03 cs.AI cs.IR 新提交 79%

Safety, or Just Capability? A Validity Audit of Agent-Safety Benchmarks

安全,还是仅仅是能力?智能体安全基准的有效性审计

Youting Wang, Xiao Han, Dingyan Shang, Yuan Tang, Bowen Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 该研究审计了R-Judge等四个智能体安全基准的有效性,发现其排名分歧源于小样本偏差,能力与对齐错误安全负相关,AgentHarm与越狱安全的关联为收敛效度而非通用安全,强调安全主张需明确关键要素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26512 2026-08-03 cs.AI cs.CL 交叉投稿 79%

Evidence-Ledger Adjudication for Claim-Evidence Traceability

用于主张-证据可追溯性的证据账本裁决

Gengyu Chen, Yongjie Yu, Weiling Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Syracuse University(雪城大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出证据账本裁决的主张-证据可追溯性工作流,构建2335行盲基准实验,结果显示智能体证据账本条件的关系准确率和宏F1显著优于非智能体基线,可退回需处理的主张并为AI辅助写作提供可审计可追溯层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29191 2026-08-03 cs.SC 新提交 78%

A Proof of the Dittert Conjecture in Dimension 4 via an Exact Constrained Sum-of-Squares Certificate

通过智能体引导的精确平方和证书证明4维下的Dittert猜想

Jinhui Li, Beibei Xiong, Zhengfeng Yang

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究通过智能体引导的符号-数值方法构造精确平方和证书,在4维下证明Dittert猜想,确定均匀矩阵为对应Dittert泛函的唯一最大值点,且证书经Lean形式化验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29546 2026-08-03 nlin.AO 新提交 78%

Agent-based dynamics of criminal propensity

基于智能体的犯罪倾向动力学

Daniel Holland, Abigail Saynor, Evelyn Svingen, Galane Luo

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究将进化犯罪学的RRM形式化为智能体动力学系统,扩展有界置信意见动力学并证明收敛条件,发现系统主导行为为持续振荡,揭示了不同环境感知下的群体倾向及两极分化机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28915 2026-08-03 physics.soc-ph cs.SI math-ph math.MP 新提交 78%

An agent-based model of the formation and evolution of common ground

基于智能体的共同基础形成与演化模型

Mengbin Ye, Wooseok Jung, Tony J. Mathew, Lorenzo Zino, Yoshihisa Kashima

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究开发智能体模型,通过蒙特卡洛模拟探究网络上智能体交互的共同基础形成与演化,揭示不同交互情境会导致全球共同基础形成、分裂或完全丧失等现象,凸显数学模型研究文化动态微宏观关联的潜力。

Comments Submission for a journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07161 2026-08-03 cs.AI 版本更新 77%

SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios

SREGym:面向AI SRE代理的实时基准测试平台,具有高保真的故障场景

Jackson Clark, Yiming Su, Saad Mohammad Rafid Pial, Yifang Tian, Lily Gniedziejko, Hans-Arno Jacobsen, Yinfang Chen, Tianyin Xu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学)

专题命中 Agent评测 :agentic(abstract,abstract_cn);AI agent(abstract);分类 cs.AI

AI总结 SREGym通过模拟真实云原生系统栈中的高保真故障场景,为AI SRE代理提供实时基准测试环境,包含90个真实挑战性SRE问题,评估前沿代理能力差异显著,可达40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18529 2026-08-03 cs.HC cs.AI 版本更新 74%

EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration

EduPanel:用于教学视频的三智能体大语言模型评判器——可靠性、互补性和人类信任校准

Jia-Kai Dong, Yi-Cheng Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(NTU人工智能卓越研究中心)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 针对教学视频教学质量评估需求,提出基于评分标准、以学习者为条件的EduPanel大语言模型评判器,通过专门智能体分解评估,经多项分析实现高可靠性,能辅助教育评估,提高评分准确性且让专家可检测不可靠输出。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17877 2026-08-03 cs.AI 版本更新 74%

PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

PAIR:面向多轮代理优化的前缀感知内部奖励模型

Wonjoong Kim, Yeonjun In, Sangwu Park, Dongha Lee, Chanyoung Park

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文提出PAIR模型,通过结合冻结的隐藏状态探针和轻量级注意力头部,解决多轮任务中内部正确性探针的可靠性问题,从而在不依赖外部模型调用或地面真实依赖的情况下,为GRPO训练提供密集的步骤级奖励信号。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28840 2026-08-03 cs.CL cs.SE 新提交 73%

Benchmarks Are Not Validation: A System-Level View of Financial LLM Applications

基准测试并非验证:金融大语言模型应用的系统级视角

Burak Payzun, İrem Demirtaş, Simona Scala, Elena Ferretti, Seçil Arslan

机构 * Prometeia S.p.A.(普罗米特亚公司)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.CL、cs.SE

AI总结 该研究指出金融大语言模型不能仅靠基准测试验证,提出需从系统全栈进行多层验证,还讨论了LLM-as-a-judge的应用与控制措施,强调要研究系统感知基准等相关方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18476 2026-08-03 stat.CO cs.AI cs.LG 版本更新 73%

AI4BayesCode: From Natural Language Descriptions to Validated Modular Stateful Bayesian Samplers

AI4BayesCode: 从自然语言描述到经过验证的模块化状态性贝叶斯采样器

Jungang Zou, Alex Ziyu Jiang, Qixuan Chen

机构 * Department of Biostatistics, Columbia University(哥伦比亚大学生物统计学系)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出AI4BayesCode系统,通过自然语言描述生成可运行且验证过的MCMC采样器,采用模块化设计和递归状态性编码范式,提升了贝叶斯模型的可靠性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23802 2026-08-03 cs.AI 版本更新 70%

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励

Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

机构 * Duke University(杜克大学) Adobe Inc.(奥多比公司) Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11381 2026-08-03 q-bio.PE cs.MS 版本更新 67%

MEmilio -- A high performance Modular EpideMIcs simuLatIOn software for multi-scale and comparative simulations of infectious disease dynamics

MEmilio -- 高性能模块化流行病模拟软件用于多尺度和比较模拟的传染病动态

Julia Bicker, Carlotta Gerstein, David Kerkmann, Sascha Korf, René Schmieding, Anna Wendler, Henrik Zunker, Daniel Abele, Maximilian Betz, Khoa Nguyen, Lena Plötzke, Kilian Volmer, Agatha Schmidt, Nils Waßmuth, Patrick Lenz, Daniel Richter, Hannah Tritzschak, Ralf Hannemann-Tamas, Julian Litz, Paul Johannssen, Marielena Borges, Annika Jungklaus, Manuel Heger, Annalena Lange, Elisabeth Kluth, Kathrin Rack, Vincent Wieland, Jonas Arruda, Sebastian Binder, Margrit Klitz, Martin Siggel, Manuel Dahmen, Achim Basermann, Michael Meyer-Hermann, Jan Hasenauer, Martin J. Kühn

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 MEmilio 是一个高性能模块化流行病模拟软件,通过统一架构整合多种流行病学模型,提升传染病动态模拟的效率与准确性。

Comments 47 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02330 2026-08-03 cs.CV cs.AI cs.LG 版本更新 62%

ActionParty: Multi-Subject Action Binding in Generative Video Games

ActionParty:生成视频游戏中的多主体动作绑定

Alexander Pondaven, Ziyi Wu, Igor Gilitschenski, Philip Torr, Sergey Tulyakov, Fabio Pizzati, Aliaksandr Siarohin

机构 * Snap Research(Snap研究院) University of Oxford(牛津大学) University of Toronto(多伦多大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。

Comments ECCV 2026 - Project page: https://action-party.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29626 2026-08-03 cs.AI 新提交 57%

AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准

Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing Huang

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29559 2026-08-03 cs.AI cs.RO 新提交 57%

LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

LEMUR:基于偏好反馈的多目标强化学习对齐学习

Manith Adikari, Bei Peng, Samuele Vinanzi, Angelo Cangelosi

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出LEMUR框架,通过联合学习策略与多目标奖励模型,从人类偏好反馈中学习平衡多目标的最优策略,其在基准多目标任务上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29218 2026-08-03 cs.AI 新提交 57%

MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft

MirrorCraft:Minecraft中隐藏规则变化下的配对评估

Jianxin Gao, Beini Hu, Runze Li, Wanli Peng, Ruohan Lei, Jinyuan Zhang, Linna Deng, Tianyi Yu, Zining Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MirrorCraft是用于Minecraft隐藏规则变化下评估智能体的配对基准,实验发现规则集对隐藏规则变化的影响差异显著,未提供规则描述时ReAct表现最优,提供规则可适度提升任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29090 2026-08-03 cs.LG 新提交 57%

What Is Missing in Surgical Risk Stratification and Outcome Prediction: A Scoping Review of End-to-End Machine Learning Approaches

手术风险分层与结局预测中缺失的内容:端到端机器学习方法的范围综述

Yizhi Dong, Yuhe Ke, Hairil Rizal Abdullah, Yucheng Xing, Kevan Kai Bing Teo, Ling Huang, Mengling Feng

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本范围综述回顾190项研究,分析手术风险分层与结局预测的ML流程,发现数据、方法、评估等方面存在差距,为开发更严谨的围手术期ML工具提供参考。

Comments This work has been submitted to the IEEE JBHI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28858 2026-08-03 cs.CV cs.AI 新提交 57%

A Unified Benchmark of Deep Learning Models for Multi-task 3D Brain Tumor Segmentation from Magnetic Resonance Imaging

用于磁共振成像多任务3D脑肿瘤分割的深度学习模型统一基准

Diego J. Torrejón, Luna Y. Hernández, Javier Sánchez

机构 * Centro de Tecnologías de la Imagen (CTIM)(图像技术中心(CTIM)) Instituto Universitario de Cibernética, Empresas y Sociedad (IUCES)(网络、企业与社会大学研究所(IUCES)) University of Las Palmas de Gran Canaria(拉斯帕尔马斯大加那利大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本研究构建统一基准,在相同条件下对比3D U-Net等5种深度学习模型在BraTS 2023、2024数据集上的脑肿瘤分割性能,明确了不同架构的准确率与效率权衡及适用场景。

Comments 27 pages, 16 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28777 2026-08-03 cs.CL 新提交 57%

Self-Supervised Skill Optimization

自监督技能优化

Siran Peng, Cuiyu Yang, Tianyu Fu, Tianshuo Zhang, Haoyuan Zhang, Weisong Zhao, Anyang Su, Minghui Wu, Huiying Li, Xiangyu Zhu, Chenxu Zhao, Zhen Lei

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究提出自监督技能优化(SSO)框架,仅用未标注任务实例学习可复用技能,在封闭、开放任务上优于无真实标注的提示优化器,部分场景表现接近最强的基于真实标注的技能优化器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28651 2026-08-03 cs.HC cs.CL cs.CY 新提交 57%

Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents

基于扩展ICAP框架的协作对话认知投入度测量:人类标注、上下文学习与反思型大语言模型智能体的比较

Lan Anh Do, Hanling Jiang, Shuchin Aeron, Ayanna K. Thomas

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究用扩展7点ICAP框架测量协作对话认知投入度,对比人类标注、ICL及反思型LLM智能体,发现人类标注信度更高,智能体方法具潜力,需强化人类标注与LLM方法的交互。

Comments Accepted as a full paper in the CogSci 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28636 2026-08-03 cs.CL cs.CY 新提交 57%

Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges

模型链:面向偏见鲁棒性大语言模型评判器的跨模型审计

Qian Wang, Zhanzhi Lou, Zhenheng Tang, Nuo Chen, Bingsheng He

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究针对LLM评判器的认知偏见问题,提出跨模型审计流程CoM,发现审计器身份的关键作用,制定偏见特异性审计器选择规则,在多模型多偏见实验中取得优于基线的准确率。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23332 2026-08-03 cs.LG 版本更新 57%

AllocBench: Measuring Online Tool Allocation Capability in LLM Agents

AlloBench:测量大语言模型智能体中的在线工具分配能力

Daniel Wang, Andrew Xu

机构 * Sea12 Technologies(Sea12科技公司) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究测试大语言模型智能体在固定预算下的在线工具分配能力,通过配对基准测试发现前沿模型在抽象框架中表现近乎最优,但在脚本编写中失败,确定了各模型失败模式,还表明开源Qwen模型在抽象分配上有推广,在线工具分配是重要能力边界。

Comments 24 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29495 2026-08-03 cs.AI 版本更新 57%

Cognitive World Model for Progressive BDI/E Trajectory Evaluation of Conversational Agents

用于过程级社会影响力评估的认知世界模型

Minghui Ma, Bin Guo, Hao Wang, Han Wang, Mengqi Chen, Jingqi Liu, Yan Liu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出认知世界模型(CogWM),通过联合预测BDI/E认知状态和用户话语,实现从终端判断到过程跟踪的社会影响力对话评估,在四个场景中达到77.6%情感准确率。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04521 2026-08-03 math.OC cs.LG q-fin.CP 版本更新 57%

Unified continuous-time q-learning for mean-field game and mean-field control problems

面向平均场博弈与平均场控制问题的统一连续时间Q学习方法

Xiaoli Wei, Xiang Yu, Fengyi Yuan

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文针对环境模拟器无法直接获取群体分布的场景,提出解耦Iq函数,设计统一参数化Q学习算法,验证其在MFG与MFC学习任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29080 2026-08-03 econ.TH 新提交 50%

Rawlsian equity: a new notion of fairness for the assignment problem

罗尔斯式公平:分配问题的一种新公平概念

Özgün Ekici, Sinan Ertemel, M. Bumin Yenmez

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出用于不可分割对象分配的罗尔斯式公平概念,证明其分配集合与辅助市场稳定分配集合一致,主体提议的延迟接受算法可计算其主体最优元素,但无策略防卫的罗尔斯式公平规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29200 2026-08-03 cs.CV 新提交 50%

UltraSAM3: A Concept-Driven Foundation Model for Universal Ultrasound Image Segmentation

UltraSAM3:一种用于通用超声图像分割的概念驱动基础模型

Bo Xu, Quanhao Zhu, Rui Lin, Boling Zhu, Chenyuan Wang, Hongfei Lin, Feng Xia, Chenhua Ji

机构 * Dalian University of Technology Affiliated Center Hospital(大连大学附属中心医院)

专题命中 Agent评测 :agent(abstract)

AI总结 针对现有超声分割方法的任务局限或需专家视觉提示问题,提出概念驱动的UltraSAM3模型及指令引导智能体,在多基准测试中性能优于同类模型,提升了临床交互的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31457 2026-08-03 cs.GT 版本更新 50%

Learning Fair Allocation of Indivisible Items from Limited Feedback

从有限反馈中学习不可分割物品的公平分配

Xinyu Liu, David Kempe, Evi Micha

专题命中 Agent评测 :agent(abstract)

AI总结 研究算法在未知估值下通过有限反馈学习公平分配不可分割物品的问题,提出基于椭球法的框架,在加性估值下多项式时间内找到EF1或PROP1分配,并在单调估值下保证多项式轮次内找到EF1分配。

Comments 42 pages, full version. Accepted to the ACM Conference on Economics and Computation (EC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03105 2026-08-03 stat.AP cs.MA cs.SI physics.soc-ph 版本更新 50%

Computationally Efficient Estimation of Localized Treatment Effects for Multi-Level, Multi-Component Interventions to Address the Opioid Crisis

高效估算多层级多组件干预措施的局部治疗效应以应对阿片类药物危机

Abdulrahman A. Ahmed, M. Amin Rahimian, Qiushi Chen, Praveen Kumar

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种双层元模型框架,通过两阶段序列设计高效采样,用于估算多层级干预措施的局部治疗效应,减少计算资源消耗,应用于估算巴比妥酸盐分发和纳洛酮分布对过量死亡率的影响。

Comments repository link: https://github.com/abdulrahmanfci/gpr-metamodel/

详情

展开后加载摘要…

URL PDF HTML 收藏