arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-05 至 2026-08-05 共收录 218 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 15 篇

2608.03474 2026-08-05 cs.CV 新提交 50%

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试

Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

专题命中 软件智能体 :workflow(abstract)

AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02834 2026-08-05 cs.RO cs.SY eess.SY 新提交 50%

Biconvex Optimization for Smooth Minimum-Time Trajectories around Convex Obstacles

凸障碍物周围平滑最小时间轨迹的双凸优化

Peter Werner, Tobia Marcucci, Daniela Rus

机构 * Massachusetts Institute of Technology(麻省理工学院) University of California Santa Barbara(加州大学圣巴巴拉分校)

专题命中 软件智能体 :planning(abstract)

AI总结 本研究提出一种双凸优化方法,用于凸障碍物周围的最小时间运动规划,可保证收敛、支持任意阶导数约束,实验表明其轨迹质量高、鲁棒性强且计算效率与现有方法相当。

Comments 18 pages, 9 figures, 4 tables. Submitted to IEEE Transactions on Robotics. Project page: https://wernerpe.github.io/bmtp-website/ Code: https://github.com/wernerpe/pybmtp

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 7 篇

2607.26300 2026-08-05 cs.CL cs.AI cs.HC 版本更新 84%

AgentGUI: An Interface for Observing and Steering Long-Running AI Agents

AgentGUI:用于观测与调控长期运行AI智能体的界面

Xuan Zhao, Jiwoong Sohn, Qinyue Zheng, Michael Moor

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 GUI与网页智能体 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 针对AI智能体观测与调控的界面缺失问题,研究人员推出AgentGUI,通过轨迹可视化、手动自动调控等功能提升智能体任务处理效率,成果已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03598 2026-08-05 cs.SE 新提交 79%

From Bug Reports to Browser-Executable Procedures: An LLM-Driven Agent for Web GUI Bug Reproduction

从错误报告到浏览器可执行流程:一种大语言模型驱动的Web GUI错误复现智能体

Cunming Zhang, Yu Pei, Michail Papadakis

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.SE

AI总结 本文提出ReBug智能体系统,通过分阶段驱动真实浏览器复现Web GUI错误,在667条真实报告上的评估显示其性能优于基线,可有效支持基于报告的浏览器错误复现。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20482 2026-08-05 cs.AI cs.CL 版本更新 62%

PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails

PersonaTrail:通过浏览轨迹对个性化网络代理进行基准测试

Seungbin Yang, Chaewoon Ki, Dohyun Lee, Jaegul Choo, ChaeHun Park

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对用户指令不明确时网络代理需从浏览历史推断上下文的问题,引入PersonaTrail基准及偏好感知上下文记忆框架PACMem,利用浏览轨迹评估代理,实验证明PACMem优于现有基于记忆的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15673 2026-08-05 cs.AI cs.LG 版本更新 62%

Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking

哪里出错了?基于语义状态追踪的Web智能体过程级评估

Jiwan Chung, JiHyuk Byun, Vibhav Vineet, Seon Joo Kim

机构 * Yonsei University(延世大学) Microsoft Research(微软研究院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出WebStep基准,通过语义MDP追踪过程状态,揭示隐藏于终端成功率下的智能体差异,并定位具体改进方向。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03244 2026-08-05 cs.AI 新提交 57%

UniNav: A Unified World-Action Diffusion Model for Visual Navigation

UniNav:用于视觉导航的统一世界-动作扩散模型

Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03313 2026-08-05 cs.NI cs.MM eess.IV 新提交 50%

ProCAVE: A Self-Adaptive, Full-Lifecycle Edge Caching Framework for Video Streaming via Predictive Bandwidth Estimation and Preference-Aware Deep Reinforcement Learning

ProCAVE:基于预测带宽估计与偏好感知深度强化学习的自适应全生命周期视频流边缘缓存框架

Yeganeh Chatri, Behzad Akbari, Foad Ghaderi, Pejman Goudarzi

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究针对现有边缘缓存方法在无线动态环境下响应与协调不足的问题,提出ProCAVE框架,结合轻量Transformer、PPO、DDPG实现预测带宽建模与偏好感知缓存控制,实验表明其在字节命中率、回传负载、QoE上优于FlyCache等基线。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03143 2026-08-05 cs.CV cs.RO 新提交 50%

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

从路线到步骤:在视觉语言导航中分离语义进展与局部执行

Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本研究针对视觉语言导航中进展与执行错误难区分的问题,提出Route2Step框架,通过步骤级接口分离语义进展跟踪与动作生成,在R2R-CE数据集上显著提升了导航性能,且在真实环境中具备实用性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 18 篇

2608.03214 2026-08-05 cs.AI 新提交 90%

The Agent Operating System (AOS): A Reference Operating Architecture for Distributed Agentic Systems

智能体操作系统(AOS):分布式智能体系统的参考操作架构

Ankur Sharma, Deep Shah

专题命中 记忆与上下文管理 :agent(title,abstract);agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出智能体操作系统(AOS),作为分布式智能体系统的参考操作架构,用于管控异构组件以构建可管控、可靠、可观测且互操作的智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03800 2026-08-05 cs.CY cs.AI cs.SI 新提交 87%

Autoreflection: How Agentic Strange Loops Turn Human Culture into AI Infrastructure

自反:智能体的奇异循环如何将人类文化转化为AI基础设施

Holly Lewis

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract,comments);AI agent(abstract,comments);分类 cs.AI

AI总结 本文提出自反概念,以LLM智能体为研究对象,通过Moltbook平台案例验证其行为标准,发现智能体将人类文化转化为自身AI基础设施。

Comments 35 pages. Also available at https://philarchive.org/rec/LEWAHA. Keywords: autoreflection, AI agents, agentic AI, LLM agents, generative agents, large language models, multi-agent systems, agent societies, Moltbook, OpenClaw, situational awareness, in-context learning, philosophy of mind, emergent behavior, computational social science, identity, memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03062 2026-08-05 cs.AI cs.GR cs.SE 新提交 81%

TraceCAD: Trace-Guided Repair for Agentic CAD Generation

TraceCAD:面向智能体CAD生成的轨迹引导修复

Fengxiao Fan, Jingzhe Ni, Fan Sang, Xiaolong Yin, Yu Liu, Ruofeng Tong, Min Tang, Peng Du

专题命中 记忆与上下文管理 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 TraceCAD是一种用于智能体CAD生成的轨迹引导修复方法,通过引入持久状态等机制提升了CAD生成的几何质量与修复可靠性,在DeepCAD基准测试中取得了良好效果。

Comments 18 pages, 7 figures; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02843 2026-08-05 cs.CR cs.AI 新提交 79%

MutMem: Cryptographically Authorized Mutation in Persistent Agent Memory

MutMem:持久智能体内存中的密码学授权突变

Walid Saidi

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 本研究针对持久智能体内存的授权与防篡改问题,提出HOM-AIMOS中的MutMem协议,经实验验证其在多个基准任务中表现良好,可有效抵御中毒攻击。

Comments https://github.com/wallidsaydi-creator/HOM-AIMOS. 32 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03979 2026-08-05 cs.CV cs.AI 新提交 74%

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

Video-DeepResearch:迈向新一代多模态深度研究智能体

Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI

AI总结 该研究提出Video-DR智能体框架,通过解耦感知-探索流水线与分阶段工具解锁解决现有多模态模型的模态偏差和知识泄漏问题,构建基准并在视频问答任务上取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26760 2026-08-05 cs.CL cs.LG 版本更新 73%

Metis: Memory Foundation Model

Metis:记忆基础模型

Zeyu Zhang, Ziliang Guo, Yihang Sun, Xichong Zhang, Xixuan Hao, Zehao Lin, Yang Zhang, Xiaoyan Zhao, Tong Shen, Bo Tang, Zhi-Qin John Xu, Junchi Yan, Haofen Wang, Xu Chen, Feiyu Xiong, Zhiyu Li, Tat-Seng Chua

机构 * MemTensor (Shanghai) Technology Co., Ltd.(墨芯(上海)科技有限公司) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出首个记忆基础模型原型Metis,赋予基础模型原生记忆能力,通过新架构与优化目标实现,经实验验证其具备原生记忆能力并发布相关资源。

Comments 46 pages, 11 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03555 2026-08-05 cs.AR 新提交 67%

Heterogeneous LLM Serving with General-Purpose Processing-Near-Memory for Retrieval-Based Sparse Attention

面向基于检索的稀疏注意力的通用近内存处理异构大语言模型服务

Hyungkyu Ham, Junhyeong Bae, Seungheon Lee, Myeongjae Jeon, Gwangsun Kim

专题命中 记忆与上下文管理 :agentic(abstract,abstract_cn)

AI总结 本文针对前沿LLM的基于检索的稀疏注意力需求,提出异构解码服务系统KARAT,结合PNM与OFMS、CMR优化,大幅提升吞吐量与每TDP性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03048 2026-08-05 cs.CL cs.AI 新提交 62%

PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory

PI-Mem:通过并行迭代式记忆将长上下文推理推向360万 tokens

Dawei Liu, Haixu Song, Shuang Cheng, Shijie Wang, Haozheng Hou, Kaifeng Liu, Ermo Hua, Zhonghang Yuan, Zhijie Zhong, Yuchen Fan, Biqing Qi, Bowen Zhou

专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出PI-Mem并行迭代记忆机制,在360万 tokens长上下文下,使Qwen系列模型在HotpotQA基准上较循环记忆基线实现准确率提升与推理加速,打破长上下文推理的准确率-效率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03420 2026-08-05 cs.AI 新提交 61%

Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory

基于经验记忆提升大语言模型智能体的序列决策能力

Jakub Rada, Viliam Lisý

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI;autonomous agent(comments)

AI总结 本研究针对LLM智能体序列决策性能不足的问题,提出带经验记忆的智能体框架,通过对局后反思与规则提取,在不修改模型权重的情况下提升了井字棋任务的表现。

Comments 8 pages, 6 figures, 14 tables, 5 appendices, accepted at Neuro-Symbolic Intelligence for LLMs and Autonomous Agents workshop at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02713 2026-08-05 cs.CV cs.AI cs.RO 新提交 61%

Quo Vadis, World Modeling?

世界建模,何去何从?

Yu Yang, Xuemeng Yang, Licheng Wen, Lingdong Kong, Xiaobin Hu, Dongyue Lu, Wei Chow, Xiyan Huang, Yuxiang Feng, Yue Liao, Jianbiao Mei, Daocheng Fu, Rong Wu, Pinlong Cai, Ran Yi, Ying Tai, Jiangning Zhang, Botian Shi, Yong Liu, Shuicheng Yan

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI;agentic(comments)

AI总结 本研究提出以智能体为中心的交互式世界代理,将世界建模范式从物理状态转换转向智能体可用信息转换,划分六种代理类型与三个赋能层面,为构建赋能智能体的世界代理建立路线图。

Comments Technical Blog at https://worldbench.github.io/awesome-agentic-world-model GitHub Repo at https://github.com/worldbench/awesome-agentic-world-model

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03844 2026-08-05 cs.AI 新提交 57%

MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents

MAFIA:针对经审计的大语言模型智能体的、基于探测与事实注入的仅查询内存攻击

Jiaming Chen, Yisen Gao, Yanping Li, Zifan Liu, Yumeng Zhang, Jun Zhang

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 本研究针对经审计的LLM智能体,提出MAFIA攻击框架,通过放置策略与伪装有效载荷实现高攻击成功率,大幅降低审计检测率,揭示智能体内存系统的关键漏洞。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03007 2026-08-05 cs.SE 新提交 57%

The Ground Is Shifting: A Reflection on the Foundations of Software Measurement

基础正在转变:软件测量基础的反思

Thomas Bock, Audris Mockus, Bogdan Vasilescu

专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.SE

AI总结 本文反思软件测量的基础,指出AI智能体使用工具产生的轨迹违背了原始假设,提出开展AI辅助复现计划以开发适应当前数据的有效方法,维持软件测量的相关性。

Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26) $\unicode{0x000A}$ DOI: https://doi.org/10.1145/3832783.3834553

Journal ref Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 2026, Munich, Germany. ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01679 2026-08-05 cs.AI 版本更新 57%

When Memory Becomes Authority: Benchmarking Authority Collapse at the Memory Consolidation Boundary

当记忆成为权威:在记忆整合边界处对权威崩溃进行基准测试

Qiuyang Zhan, Rui Zhang, Sheng Guo, Lepeng Zhao, Zhuotao Liu

机构 * Tsinghua University(清华大学) East China Normal University(华东师范大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本研究推出AuthMem-Bench基准,发现智能体记忆整合存在权威崩溃问题,自动保留权威标签可大幅降低未授权动作率,证明记忆适配需同时保留权威信息。

Comments 38 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03836 2026-08-05 cs.LG 版本更新 57%

Enhancing Q-Value Updates in Deep Q-Learning via Successor-State Prediction

通过后继状态预测增强深度Q学习中的Q值更新

Lipeng Zu, Hansong Zhou, Xiaonan Zhang

机构 * Department of Computer Science(计算机科学系) Florida State University(佛罗里达州立大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文针对DQN更新方差高的问题,提出SADQ算法,通过建模环境动态融入后继状态分布实现更稳定的价值更新,实验显示其在基准及现实任务中优于DQN变体。

Comments Withdrawn by the authors because the presentation of the proposed method requires substantial revision, the theoretical analysis is incomplete, and the experimental validation is insufficient to support the main claims

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03051 2026-08-05 cs.RO cs.DC cs.SY eess.SY 新提交 50%

CUDA MPC: A GPU-Native Solver for Model Predictive Control

CUDA MPC:一款面向模型预测控制的GPU原生求解器

Babak Akbari, Melissa Greeff

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出GPU原生MPC框架CUDA MPC,通过协同设计优化算法等实现低开销,在多机器人基准测试中实时性远超CPU及同类框架,是首个实现10智能体集群无碰撞协调的实时求解器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26327 2026-08-05 econ.TH 版本更新 50%

The Last Costly Signal: How Generative AI Collapses Competence Signaling and Why Liability Sustains Markets for Expert Services

最后一个高成本信号:生成式AI如何瓦解能力信号机制,以及为何责任机制能维持专家服务市场

Andreas Bauer

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究生成式AI降低专家服务信号成本导致的市场混同问题,提出结果依赖型责任信号可恢复市场分离,还内生化合同制度并设计了相关验证实验。

Comments 26 pages, 7 figures. JEL codes: D82, D86, L15, L84, M31, O33. Simulation code and numerical results available at: https://doi.org/10.6084/m9.figshare.33106946

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25588 2026-08-05 cs.IT cs.SY eess.SY math.IT 版本更新 50%

System-Aware Adaptive CSI Feedback via RL-Guided Autoencoder Switching in Multi-User MIMO System

多用户MIMO系统中基于RL引导的自动编码器切换的系统感知自适应CSI反馈

Maryam Ansarifard, Mohit K. Sharma, George Exarchakos, Kishor C. Joshi

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 针对mMIMO系统中信道状态信息反馈问题,提出基于强化学习驱动控制框架,在预训练多速率自动编码器组上运行,依信道条件和性能指标选压缩率,引入系统感知奖励公式,相比传统方案提升频谱和反馈效率,降低反馈成本等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13706 2026-08-05 cs.CV 50%

ParkingTwin: Training-Free Streaming 3D Reconstruction for Parking-Lot Digital Twins

ParkingTwin: 无需训练的实时停车区三维重建

Xinhao Liu, Yu Wang, Xiansheng Guo, Gordon Owusu Boateng, Yu Cao, Haonan Si, Xingchen Guo, Nirwan Ansari

机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(信息与通信工程学院,电子科学与技术大学) Department of Communications and Networking, Xi'an Jiaotong-Liverpool University(通信与网络系,西安交通大学利物浦大学) School of Electrical Engineering, Hebei University of Technology(电气工程学院,河北工业大学) Advanced Networking Lab., Department of Electrical and Computer Engineering, New Jersey Institute of Technology(高级网络实验室,电气与计算机工程系,新泽西理工学院)

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 ParkingTwin通过无需训练的轻量级系统实现停车区实时三维重建,利用OSM拓扑生成一致TSDF,实时过滤动态遮挡,并在CIELAB中鲁棒融合光照,提升重建精度和效率。

Comments 35 pages, 10 figures. Submitted to ISPRS Journal of Photogrammetry and Remote Sensing. Under review

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing 240 (2026) 114-129

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 41 篇

2608.03499 2026-08-05 cs.AI 新提交 87%

WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks

WeClawArena:面向以人为中心的智能体网络中跨用户智能体协作与安全的可审计沙箱及基准

Prince Zizhuang Wang, Aojie Yuan, Haiyue Zhang, Xiyang Hu, Yue Zhao, Shuli Jiang

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 WeClawArena是面向以人为中心的智能体网络的可审计沙箱与基准,含124个基础任务及620个场景变体,可评估跨用户智能体协作的效用与攻击成功率,支持安全审计与诊断。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02683 2026-08-05 cs.CR cs.AI 新提交 87%

$S^3$: Improving Agent Safety through Multi-Stage Defense

$S^3$:通过多阶段防御提升智能体安全性

Zibo Xiao, Haoyu Wang, Jun Sun

专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);agentic(abstract)

AI总结 本研究针对LLM智能体工作流的跨阶段安全风险问题,提出多阶段防御框架$S^3$,引入阶段特定安全技能,构建MSRB基准,实验显示其安全有效性和效用保留均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25398 2026-08-05 cs.AI cs.CL 版本更新 87%

HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following

HANDBOOK.md:长上下文代理指令跟随基准测试

Liudas Panavas, Sebastian Minus, Bradley Monton, Derek Ray, Suhaas Garre, Sushant Mehta, Edwin Chen

机构 * Surge AI

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,comments);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出HANDBOOK.md基准测试,模拟企业员工遵循公司手册,含65个代理任务跨越多领域多公司。任务修改基础手册防记忆,评分具确定性。测试发现模型配置通过率低,代理常违背策略,还发布了所有任务、环境及评估工具。

Comments 16 pages, 3 figures, 5 tables. Accepted to the Workshop on Agent Behavior (WAB) at COLM 2026. Benchmark, environments, and evaluation harness: https://github.com/surge-ai/handbook

详情

展开后加载摘要…

URL PDF HTML 收藏