arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2607.09876 2026-07-14 cs.CV cs.AI q-bio.NC q-bio.QM 新提交 57%

Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data

Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索

Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis

机构 * Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对相机陷阱数据自动检索视频的难题,提出Prompting-MammAlps基准及细粒度可解释TVR方法,训练视觉变压器并结合大语言模型处理查询,在基准测试中取得较好成绩,优于零样本VLM。

Comments Accepted at ECCV 2026; Project page: https://cnai.epfl.ch/prompting-mammalps

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09764 2026-07-14 cs.RO cs.AI 新提交 57%

OmniSCS: Omni Safety-Critical Scenario Synthesis for Autonomous Driving via a Fully Editable Driving World

OmniSCS:通过完全可编辑的驾驶世界实现自动驾驶的全场景安全关键场景合成

Xiaoyun Dong, Qian Xu, Yang Lu, Yang Lou, Yung-Hui Li, Jianping Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对自动驾驶安全关键场景合成难题,提出OmniSCS系统,通过完全可编辑驾驶世界构建和SCS合成两个模块,保持数据保真度,在多数据集实验中表现出色,能增强算法并支持实时闭环测试,为SCS优化测试提供高效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09664 2026-07-14 cs.AI cs.CV 新提交 57%

From ML Predictions to Informed Diagnostic Assistance Using the Toulmin Model of Argumentation

从机器学习预测到使用论证的图尔敏模型提供信息丰富的诊断辅助

Anca Marginean, Adrian Groza

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究如何利用图尔敏模型为基于图像的诊断提供结构化评估,通过专门模型提取依据,医学知识智能体分析保证,基于定量评估确定限定词,用图像相似性度量构建反驳,辅助人类专家评估机器学习生成的诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09016 2026-07-13 cs.CR cs.SE 新提交 57%

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

SLBench:评估大语言模型智能体在技能中遵循逻辑关系的情况

Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 研究评估大语言模型智能体遵循逻辑关系情况,引入SkillLogic框架,构建SLBench基准,扫描超500个公共技能,评估发现不安全率高,人工审核分析失败原因,还表明SLGuard可减少违规,确立遵循逻辑关系是技能引导智能体的可靠性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08768 2026-07-10 cs.CL 新提交 57%

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

UniClawBench:面向实际任务中主动智能体的通用基准测试

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。

Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07040 2026-07-09 cs.AI 新提交 57%

Measuring Intelligence Beyond Human Scale

超越人类水平的智能测量

Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan

机构 * Princeton(普林斯顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究如何测量超越人类能力的智能,提出基于相对测量的新范式,模型生成公开挑战,汇总结果得对抗性心理测量评级系统,还描述实用协议,在不同领域实例化框架,实现对超越人类前沿系统的测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06121 2026-07-09 q-fin.TR cs.AI 新提交 57%

Can Reinforcement Learning Efficiently Discover Price Manipulation?

强化学习能否有效地发现价格操纵行为?

Ioanna-Yvonni Tsaknaki, Andrea Macrì, Fabrizio Lillo

机构 * Scuola Normale Superiore(斯克沃尔纳正常大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究无模型强化学习智能体能否比传统基于模型方法更有效识别价格操纵机会,通过在单资产市场比较两种有限样本学习方法,发现中等波动率下强化学习表现良好,高波动率时都无法识别,低波动率时基于模型方法更优,凸显强化学习有效性及相关风险。

Comments 30 pages, 11 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05197 2026-07-07 cs.SE 新提交 57%

Is Three the Magic Number? An Empirical Evaluation of LLM-Based Repair Loops

三是神奇数字吗?基于大语言模型的修复循环的实证评估

Tobias Kiecker, Eik Reichmann, Hosung Kang, Gabin An, Lars Grunske

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 研究基于大语言模型的修复循环迭代限制,通过多个软件工程任务观察到收益递减模式,前几次迭代收获大,后续贡献小,还发现修复行为受工作流编排和反馈设计影响更大。

Comments 4 Pages (+1 for references), NIER Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05185 2026-07-07 cs.AI cs.SC 新提交 57%

ClassicLogic: A Knowledge-Driven Benchmark of Classic Puzzle Games for Evaluating Compositional Generalization

ClassicLogic:用于评估组合泛化能力的经典益智游戏知识驱动基准集

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡-埃森大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对现有组合泛化基准缺乏复杂显式结构的问题,构建含4类经典逻辑谜题的新基准,可细粒度评估智能体从基础规则学习到多步组合推理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04623 2026-07-07 cs.SE cs.DC 新提交 57%

Can LLMs Really Recover Microservice Failures? A Recovery-Aware Evaluation of Diagnosis-to-Action Reasoning

大语言模型真的能恢复微服务故障吗?对诊断到行动推理的恢复感知评估

Jiaxing Qi, Zhongzhi Luan, Hongyu Zhang, Shaohan Huang, Carol Fung, Yongxin Tong, Hailong Yang, Depei Qian

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 研究大语言模型在云原生微服务系统中恢复故障的能力,提出R2Act框架,定义相关内容并实例化为基准数据集,评估多种方法,发现恢复失败多因难以将诊断证据转化为有效恢复行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04576 2026-07-07 cs.CL cs.CY cs.IR 新提交 57%

Progressive Disclosure for LLM-Maintained Wiki Knowledge Bases: a Preregistered Ablation

大语言模型维护的维基知识库的渐进式披露:一项预注册的对比研究

Theodore O. Cochran

机构 * AI for Altruism (A4A)(人工智能促进利他主义组织)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究针对大语言模型维护的维基知识库,通过预注册对比研究,改造知识库实现渐进式披露。虽原节省索引加载成本未实现,但答案质量达标且成本降低,源于更有针对性的访问。

Comments 14 pages, 2 figures, 6 tables. Preregistered on OSF (https://osf.io/feka7, DOI 10.17605/OSF.IO/FEKA7). Materials-availability and deviations described in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04528 2026-07-07 cs.AI 新提交 57%

Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

测量多步语言模型智能体中工具诱导的信念差异

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究多步语言模型智能体中工具对其信念的影响,引入信念展开诊断,定义跨工具信念差异并分解,通过实验表明工具设计是智能体评估中的实验变量。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03591 2026-07-07 cs.CV cs.AI cs.CY 新提交 57%

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models

基于多模态大语言模型的第一视角事故视频中的责任分配估计

Ryosei Tamura, Andrew Shin

机构 * Keio University(庆应大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究第一视角事故视频中责任分配估计新任务,构建大语言模型辅助的责任标注管道并在多输入设置下微调模型,实验证明多模态大语言模型能有效执行该任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03501 2026-07-07 cs.DB cs.AI cs.MA 新提交 57%

STRATOS: Bridging the Symbolic-to-Numeric Gap in Spatio-Temporal Text-to-SQL for Meteorological Data

STRATOS:弥合气象数据时空文本到SQL中符号到数字的差距

Yi Zhang, Farhad Nooralahzadeh, Jonathan Fürst, Fabio Scherrer, Antonis Bezes, Vassiliki Kotroni, Kurt Stockinger

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对气象数据文本到SQL的问题,提出端到端框架STRATOS,通过解析自然语言解决模糊概念,重写复杂空间谓词,减少执行时间,并引入评估工作负载来测试系统。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02879 2026-07-07 cs.AI 新提交 57%

MedCalc-Pro: Solving Complex Medical Calculations with LLM Agents

MedCalc-Pro:使用大语言模型智能体解决复杂医学计算问题

Siran Zhao, Ruihui Hou, Ziyue Huai, Chennuo Zhang, Tong Ruan

机构 * East China University of Science and Technology(华东理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对医学计算评估大语言模型的基准过于简化的问题,提出新基准MedCalc-Pro及更通用智能体框架,含多场景任务设置和真实病例,新框架性能最佳,为评估应用LLMs提供新基准和方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02814 2026-07-07 cs.MA cs.AI cs.CY 新提交 57%

SovereignNegotiation-Bench: Evaluating User-Owned Personal Agents In Delegated Bargaining Under Privacy, Consent, Evidence, And Institutional Pressure

主权谈判基准:在隐私、同意、证据和制度压力下评估委托谈判中用户拥有的个人代理

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究个人代理替用户谈判的情况,介绍主权谈判基准,其能在多方面约束下评估谈判,通过多种场景验证,指出仅协议成功对用户拥有的谈判代理不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02605 2026-07-07 cs.SE 新提交 57%

A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges

大语言模型驱动的渗透测试综述:分类法、共同演化及开放挑战

Zheyuan He, Jiaxun Dong, Zihao Li, Ting Chen, Gelei Deng, Feng Luo, Jinkun Ji, Yuanlong Cao, Xiapu Luo

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 通过系统分析2023至2026年间81篇论文,梳理大语言模型驱动的渗透测试文献分类,追溯架构四阶段演化,指出关键发现,识别出评估可靠性等三个开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24155 2026-07-07 cs.CL 新提交 57%

MedBench v5: A Dynamic, Process-Oriented, and Hallucination-Aware Benchmark for Clinical Multimodal Models

MedBench v5:面向临床多模态模型的动态、过程导向且幻觉感知的基准

Jinru Ding, Chuchu Jiang, Lu Lu, Wenrao Pang, Mouxiao Bian, Zhuangzhi Gao, Jiangyuan Chen, Xinwei Peng, Ruiyao Chen, Sijie Ren, Renjie Lu, Yun Zhong, Bin Han, Meiling Liu, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出MedBench v5,通过双维框架、可切换信息流压力源、动态过程审计协议和幻觉传播监控,实现临床多模态模型的动态过程评估与幻觉检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21585 2026-07-07 cs.LG cs.IT math.DG math.IT math.ST stat.TH 新提交 57%

A Transport-Based Geometry of Belief-Cost

信念的成本几何:有限资源下含噪观测的推理

Laurent Caraffa

机构 * Université Gustave Eiffel, LASTIG, IGN-ENSG(古斯塔夫·埃菲尔大学,LASTIG,IGN-ENSG)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文引入信念空间的成本几何(Wasserstein最优传输经Fisher信息共形加权),证明确定性被观测和物理双重否定,并揭示三个不变结果:推理墙、诚实成本与刚性双曲几何,其中高斯分布为最极端位置-尺度信念。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20408 2026-07-07 cs.CR cs.AI 新提交 57%

NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms

LLM智能体安全性、多轮红队测试、越狱基准、对抗鲁棒性、安全关键系统

Hanwool Lee, Dasol Choi, Bokyeong Kim, Haon Park, Seung Geun Kim

机构 * AIM Intelligence(AIM智能公司) KAERI(韩国原子能研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出NRT-Bench基准,通过模拟核电站控制室的多轮红队测试,评估LLM智能体在安全关键系统中的对抗鲁棒性,发现不同模型的漏洞几乎不重叠,且防御效果高度依赖模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12502 2026-07-07 physics.soc-ph cs.AI 新提交 57%

A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints

价值的数学理论:资源约束下目标导向行为的综合

Cheng Qian

机构 * Cheng Qian(陈倩)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出价值是目标导向主体在资源约束下转化资源为目标进度的速率,通过尺度不变性公理导出对数度量,并推导出价值编码定理,实现价值与信息论的统一。

Comments Also available at https://doi.org/10.5281/zenodo.20487041 (v6). v2: the pre-registered continuation-gate experiment has been run -- prediction (i) confirmed on real frontier agents; prediction (ii) retired to mathematical scope. Code, pre-registrations, and raw run records: https://github.com/macrokit/value

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09118 2026-07-07 cs.AI 新提交 57%

ComplexConstraints and Beyond: Expert Rubrics for RLVR

复杂约束与超越:RLVR的专家评分标准

Sushant Mehta, Liudas Panavas, Suhaas Garre, Edwin Chen

机构 * Surge AI

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出专家设计的评分标准作为评估和训练信号,通过复杂指令遵循和企业智能体任务验证,在RL训练中显著提升模型性能。

Comments Accepted to the GEM workshop at ACL 2026: https://gem-workshop.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02496 2026-07-03 cs.RO cs.LG 新提交 57%

Controllable Sim Agents with Behavior Latents

具有行为潜变量的可控模拟智能体

Juanwu Lu, Junyu Zhu, Ziran Wang

机构 * Purdue University(普渡大学) University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出可控神经变分智能体(CNeVA),通过闭环共轭变分更新推断行为潜变量,结合修正流轨迹生成器,实现可解释轴上的可控模拟,在Waymo数据集上达到竞争性真实感并提供通道级可控性。

Comments 23 pages, 5 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01537 2026-07-03 cs.LG 新提交 57%

Certified World Models as Sensing Clocks: Drift-Aware Deadlines for Active Perception

认证世界模型作为感知时钟:主动感知的漂移感知截止时间

Hongbo Wang

机构 * Hongbo Wang(王Hongbo)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出一种基于认证世界模型的感知时钟,通过漂移感知的截止时间规则决定主动感知时机,在合成基准和3D VN-JEPA模型上验证了有效性。

Comments 15 pages, 3 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31947 2026-07-03 cs.CL 新提交 57%

LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish

LuxEmo:卢森堡语表达性文本转语音语料库

Nina Hosseini-Kivanani, Sandipana Dowerah

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 针对低资源语言卢森堡语,提出LuxEmo语料库(21小时,4种情感),采用半自动策展流程,并基准测试五种表达性TTS系统。

Comments 7 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00512 2026-07-02 cs.LG stat.ML 新提交 57%

From Structural Equation Modelling to Double Machine Learning: Robustness Analysis for Survey-Based Research

从结构方程模型到双机器学习:基于调查研究的鲁棒性分析

Ka Ching Chan, Qiana Liu, Sanjib Tiwari, Ranga Chimhundu

机构 * School of Business, Law, Humanities and Pathways(商学院、法律、人文与路径学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 提出一个分阶段鲁棒性分析框架,结合SEM、OLS和双机器学习,通过FinTech数字客户亲密调查模型验证,识别稳定与需谨慎解释的关系,并提供可复现模板。

Comments 21 pages, 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00436 2026-07-02 cs.AI 新提交 57%

PHREEQC-MCQ-200: A Diagnostic Benchmark for Tool-Augmented Scientific Simulator Agents

PHREEQC-MCQ-200:用于工具增强型科学模拟智能体的诊断基准

Ke Zhang, Sahchit Chundur, Mohammad Javad Qomi, Maziar Raissi

机构 * University of California, Riverside(加州大学河滨分校) University of California, Irvine(加州大学尔湾分校)

专题命中 Agent评测 :tool use(abstract);分类 cs.AI

AI总结 提出PHREEQC-MCQ-200基准,评估工具增强型智能体在地球化学模拟中的表现,发现模拟器访问显著提升准确率但存在非单调性,输出访问协议影响性能。

Comments 30 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08625 2026-07-02 cs.CL 新提交 57%

From Holistic Evaluation to Structured Criteria: Rubrics Across the Evolving LLM Landscape

从整体评估到结构化标准:大语言模型演变中的评分准则

Hao Chen, Ziyu Han, Yukun Yan, Qingfu Zhu, Maosong Sun, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Department of Computer Science and Technology, Institute for AI(计算机科学与技术系,人工智能研究院)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL

AI总结 本文提出评分准则作为统一框架,通过分解整体判断为可验证维度、提供过程级反馈和动态涌现自模型行为三个层次,连接人类意图与机器行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31055 2026-07-01 cs.CL cs.SD eess.AS 新提交 57%

Reference-Based Prosody and Rhythm Evaluation for Spoken Dialogue Systems

基于参考的口语对话系统韵律与节奏评估

Ashish Hallur, Thomas Thebaud, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velazquez

机构 * Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系) Amazon Inc.(亚马逊公司)

专题命中 Agent评测 :AI agent(abstract);分类 cs.CL

AI总结 针对语音到语音AI代理缺乏可解释的韵律与节奏评估指标,提出基于匹配参考的百分位评估协议,利用4000+小时对话数据构建参考层,有效减少误报并提高可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30774 2026-07-01 cs.AI 新提交 57%

What Drives Interactive Improvement from Feedback?

什么驱动了来自反馈的交互式改进?

Bartłomiej Cupiał, Jan Łojek, Mikołaj Garstecki, Szymon Pobłocki, Alicja Ziarko, Piotr Miłoś

机构 * University of Warsaw(华沙大学) AKCES NCBR Princeton University(普林斯顿大学) Mistral AI Institute of Mathematics, Polish Academy of Sciences(波兰科学院数学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过受控的学生-教师协议,分离反馈、重试和格式修正对多轮语言智能体性能提升的影响,发现有用反馈必须提供超越通用重试的指导,且学生利用反馈的能力是交互改进的关键瓶颈。

Comments 9 pages, 7 figures, accepted to the RLxF Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏