arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-08 至 2026-07-08 共收录 18 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 18 篇

2606.18142 2026-07-08 cs.AI cs.CL cs.CY 新提交 90%

Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models

你的AI旅行代理会为你预订斗牛:前沿AI模型中隐含动物福利的代理基准

Jasmine Brazilek, Joel Christoph, Maheep Chaudhary, Oliver Tullio, Carol Kline, Miles Tidmarsh, Arturs Kanepajs

机构 * Compassion Aligned Machine Learning(同情对齐机器学习) Sentient Futures(感知未来) Harvard Kennedy School(哈佛肯尼迪学院) Appalachian State University Department of Management(阿巴拉契亚州立大学管理系)

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 提出首个代理基准TAC,测试AI代理在为用户执行旅行预订等操作时是否避免涉及动物剥削的选项。评估七个前沿模型,所有模型得分低于随机水平64%,最佳模型仅53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06074 2026-07-08 cs.SE cs.AI cs.CY cs.HC 新提交 81%

Prompt Coach: An Empirical Evaluation of an Agentic Tutor for Learning Prompt Engineering in Software Development

Prompt Coach:软件开发中用于学习提示工程的智能导师的实证评估

Rohit Mehra, Kapil Singi, Vikrant Kaulgud, Vibhu Saujanya Sharma, Swapnajeet Gon Choudhury, Swati Sharma, Adam P. Burden, Majd Sakr

机构 * Accenture Labs, India(Accenture实验室,印度) Accenture, India(Accenture,印度) Accenture, USA(Accenture,美国)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 研究针对软件开发人员难以掌握的提示工程技能,提出智能导师Prompt Coach,通过苏格拉底式指导助其学习编写高质量代码生成提示,经实证研究,15名专业开发者参与,单次课程后有显著改进,提升了提示编写技能。

Comments 7 pages. To be published in the proceedings of 41st International Conference on Automated Software Engineering (ASE '26), October 12-16, 2026, Munich, Germany (Industry Showcase Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08671 2026-07-08 cs.LG 新提交 79%

SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History

SkillHone:基于持久决策历史的持续智能体技能演化框架

Zhiwei Li, Yong Hu

机构 * WeChat, Tencent Inc., China(腾讯微信,中国)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 提出SkillHone框架,通过持久决策历史记录诊断、修订和证据,实现智能体技能的持续演化,在开放网络深度研究基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06118 2026-07-08 cs.CV cs.MM 新提交 78%

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

WebRetriever:用于高效网络智能体评估的大规模综合基准测试

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

机构 * Mininglamp Technology(旷视科技) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23212 2026-07-08 cond-mat.dis-nn cond-mat.stat-mech nlin.AO 版本更新 78%

Replication and Information Extraction in a Minimal Agent-Environment Model

最小化智能体 - 环境模型中的复制与信息提取

Sebastiano Ariosto, Jerome Garnier-Brun, Luca Saglietti, Davide Straziota

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究在无明确指导或奖励下从数据提取信息的问题,通过对分类规则施加简单性偏差,利用统计力学工具刻画自发学习相变,扩展到智能体群体后发现交互可重塑学习相边界,开辟仅通过标签交换的分散学习途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05458 2026-07-08 cs.LG cs.AI 新提交 76%

Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning

利用离线强化学习学习控制大语言模型智能体的执行框架

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 研究提出将大语言模型智能体的执行框架视为可学习控制层,通过有限 horizon 的框架马尔可夫决策过程,利用离线强化学习训练轻量级控制器,在多领域实验中改进验证行为、提高任务质量,证明框架控制可学习且离线支持有局限。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05638 2026-07-08 cs.SE cs.AI 新提交 73%

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems

EvalLoop:一种用于商业人工智能系统评估驱动迭代改进的方法

Kenneth Benavides, Josh Fleischer, Danti Chen

机构 * Robert Half(罗伯特·哈夫公司)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究针对商业AI系统评估忽视迭代改进价值的问题,提出EvalLoop方法,通过维度指标分组、故障模式分类和结构化迭代工作流程,实现评估驱动的迭代改进,经案例研究验证有效,还能助力模型选择与部署权衡,且被打包为可重用工件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05482 2026-07-08 cs.SE cs.RO 新提交 70%

TypeGo: An OS Runtime for Embodied Agents

TypeGo:一种用于具身智能体的操作系统运行时

Guojun Chen, Alex Schott, Lin Zhong

机构 * Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.SE

AI总结 研究针对具身智能体大语言模型规划与实时控制等的矛盾,提出TypeGo运行时,将基于大语言模型的规划构建为异步循环,管理智能体物理身体,通过自然语言指令编程,能降低延迟并支持并发任务,提供了初步设计证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06683 2026-07-08 cs.SE 版本更新 70%

Benchmarking Requirement-to-Architecture Generation with Hybrid Evaluation

基于混合评估的软件需求到架构生成基准测试

Minxiao Li, Li Zhang, Shuying Yan, Fang Liu, Liehao Li, Yang Liu, Xiaoli Lian

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本文提出R2ABench基准,包含真实软件项目及PRD和PlantUML图,通过多维混合评估框架评估生成架构,发现LLM在关系推理上存在不足,代码专用模型和代理框架各有优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22136 2026-07-08 cs.LG cs.AI cs.CR cs.SE 版本更新 67%

StepShield: When, Not Whether to Intervene on Rogue Agents

StepShield:何时干预流氓代理,而非是否干预

Gloria Felicia, Zitha Sasindran, Jinfeng He, Michael Eniolade, Hemant Kumar, Milan Hussain Angati

机构 * University of Virginia(弗吉尼亚大学) Indian Institute of Science, Bangalore(印度科学研究院,班加罗尔) Cornell University(康奈尔大学) University of the Cumberlands(库姆伯兰兹大学) University of Arizona(亚利桑那大学) California State University, Northridge(加州州立大学,北岭分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究代理安全检测时机问题,引入StepShield基准及早期干预率(EIR),揭示取证陷阱,指出基于规则的护栏虽召回率高但时机不佳,现有方法无法兼顾高召回、低误报和及时干预,凸显逐步骤流氓检测待解决。

Comments 20 pages, 4 figures, 10 ablation studies. Code and data: https://github.com/glo26/stepshield

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06229 2026-07-08 cs.CL cs.AI cs.DB 新提交 62%

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

Spider 2.0-AIFunc:将现实世界的文本到SQL扩展到人工智能原生SQL工作流程

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

机构 * UC San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究院) University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对现有文本到SQL基准无法评估模型生成人工智能原生SQL能力的问题,构建Spider 2.0-AIFunc基准,经特定管道和多轮验证,评估十个先进语言模型,发现准确率差距及传统代理框架转移无效等情况。

Comments 24 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00476 2026-07-08 cs.AI 版本更新 57%

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

做他们所说的,而不是他们所推理的:定位LLM智能体中的忠实性差距

Yufeng Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过将忠实性差距分解为推理-结论和结论-行动两个步骤,在可控的德克萨斯扑克模拟器中研究LLM智能体是否按照其陈述的推理行动。

Comments submitted to COLM social simulation with LLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06126 2026-07-08 stat.AP 新提交 50%

Causal Inference with Video Features as Treatments

以视频特征为处理因素的因果推断

Kentaro Nakamura, Adam Breuer, Michael H. Crespin, Bryce J. Dietrich, Kosuke Imai

专题命中 Agent评测 :AI agent(abstract)

AI总结 研究以视频特征为处理因素的因果推断问题,核心方法是用深度生成模型及纵向神经网络架构,主要贡献为开发新统计方法,可探究视频视觉特征对观众反应的影响并用于方法基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06440 2026-07-08 cs.CV 新提交 50%

PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation

PIPBench:用于个性化图像生成评估的包含个人资料的框架

Yuhang Wu, Shuxiang Zhang, Wee Hian Ching, Chi Zhang, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 Agent评测 :agent(abstract)

AI总结 研究个性化图像生成问题,引入PIPBench基准及新数据构建管道,利用心理和人口统计学资料维度收集数据,全面评估代表性方法,揭示现有方法局限,为个性化文本到图像合成带来新挑战与机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06000 2026-07-08 cs.CR 新提交 50%

Context-to-Execution Integrity for LLM Agents

语言模型代理的上下文到执行完整性

Igor Santos-Grueiro

专题命中 Agent评测 :agent(abstract)

AI总结 研究语言模型代理执行中的上下文到执行完整性问题,提出CXI系统,通过策略标记、类型化释放等机制保障安全执行,经多方面评估,在AgentDojo和代码代理基准测试等中取得良好效果,确保权限绑定才允许执行。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11692 2026-07-08 physics.soc-ph 版本更新 50%

Topology-dependent criticality in triplet majority-rule dynamics with collective reversal on quenched networks

三元多数规则动力学中拓扑依赖的临界性

Roni Muslim

专题命中 Agent评测 :agent(abstract)

AI总结 研究三元多数规则意见动力学模型中拓扑对临界点的影响,揭示网络结构如何改变临界点位置及临界指数。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14668 2026-07-08 cs.GT 版本更新 50%

Near-Optimal Best-of-Both-Worlds Fairness for Few Agents

少数代理的近似最优两全其美公平性

Moshe Babaioff, Gefen Frosh

专题命中 Agent评测 :agent(abstract)

AI总结 研究少数代理不可分商品公平分配问题,设计多项式时间BoBW算法,为三个代理实现近似最优公平性,给出两个代理最优结果,包括分配比例、EFX准则及FPTAS等,匹配多项式时间内最强保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08317 2026-07-08 math.OC 版本更新 50%

Stationary Mean-Field Games of Singular Control under Knightian Uncertainty

奈特不确定性下奇异控制的平稳平均场博弈

Giorgio Ferrari, Ioannis Tzouanas

专题命中 Agent评测 :agent(abstract)

AI总结 研究奈特不确定性下奇异控制的平稳平均场博弈,主体通过单边奇异随机控制调整动力学以最大化奖励,利用构造性方法证明平稳平均场均衡的存在唯一性,并给出数值基准及分析不确定性对均衡的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏