arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-14 至 2026-04-14 共收录 277 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 18 篇

2603.02473 2026-04-14 cs.AI 74%

Diagnosing Retrieval vs. Utilization Bottlenecks in LLM Agent Memory

诊断LLM代理记忆中的检索与利用瓶颈

Boqin Yuan, Yue Su, Kun Yao

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) Carnegie Mellon University(卡内基梅隆大学) University of North Carolina(北卡罗来纳大学)

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI

AI总结 本文通过3x3实验分析写入策略、检索方法和记忆利用行为对性能的影响,发现检索方法是主要瓶颈,且原始分块存储在无需LLM调用时表现优异。

Comments Accepted at the MemAgents Workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11563 2026-04-14 cs.CL cs.AI cs.LG 67%

Synthius-Mem: Brain-Inspired Hallucination-Resistant Persona Memory Achieving 94.4% Memory Accuracy and 99.6% Adversarial Robustness on LoCoMo

Synthius-Mem: 基于大脑启发的hallucination抵抗性人格记忆实现94.4%的记忆准确率和99.6%的对抗鲁棒性于LoCoMo

Artem Gadzhiev, Andrew Kislov

专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Synthius-Mem通过结构化人格记忆系统在LoCoMo基准上实现94.4%的记忆准确率和99.6%的对抗鲁棒性,优于现有系统并超越人类表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11037 2026-04-14 cs.LG cs.AI 62%

RTMC: Step-Level Credit Assignment via Rollout Trees

RTMC:通过展开树进行步骤级信用分配

Tao Wang, Suhang Zheng, Xiaoxiao Xu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 RTMC通过展开树方法实现步骤级信用分配,无需学习型批评者,提升SWE-bench Verified任务的pass@1性能3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23516 2026-04-14 cs.CL cs.AI cs.IR 62%

MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens

MSA:内存稀疏注意力用于高效端到端内存模型扩展至100M标记

Yu Chen, Runkai Chen, Sheng Yi, Xinda Zhao, Xiaohong Li, Jianjin Zhang, Jun Sun, Chuanrui Hu, Yunyun Han, Lidong Bing, Yafeng Deng, Tianqiao Chen

机构 * Evermind Shanda Group(盛大集团) Peking University(北京大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MSA,一种高效的端到端可训练内存模型框架,通过可扩展稀疏注意力和文档级RoPE实现线性复杂度,支持从16K到100M标记的扩展,同时保持稳定性,且在100M标记推理中实现2xA800 GPU的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07224 2026-04-14 cs.AI cs.LG 62%

Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration

巩固还是适应?PRISM:通过梯度集中解耦SFT和RL数据

Yang Zhao, Yangou Ouyang, Xiao Ding, Hepeng Wang, Bibo Cai, Kai Xiong, Jinglong Gao, Zhouhao Sun, Li Du, Bing Qin, Ting Liu

机构 * Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(哈尔滨工业大学社会计算与交互机器人研究中心) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 PRISM通过分析梯度空间结构,区分高冲突数据需RL重构与低冲突数据需SFT巩固,提升LLM训练效率与鲁棒性。

Comments ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10352 2026-04-14 cs.AI cs.OS cs.SE 62%

ClawVM: Harness-Managed Virtual Memory for Stateful Tool-Using LLM Agents

ClawVM: 用于状态ful工具使用的LLM代理的抓取管理虚拟内存

Mofasshara Rafique, Laurent Bindschaedler

机构 * Independent Researcher(独立研究员) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.SE

AI总结 ClawVM通过管理状态为类型化的页面,实现状态的可靠存储与回写,解决了状态丢失和回写失败的问题,提升了LLM代理的稳定性和可审计性。

Comments 8 pages, 1 figure, 10 tables; accepted at EuroMLSys '26 (6th Workshop on Machine Learning and Systems, co-located with EuroSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11610 2026-04-14 cs.CL 57%

Self-Evolving LLM Memory Extraction Across Heterogeneous Tasks

跨异质任务的自演化大语言模型记忆提取

Yuqing Yang, Tengxiao Liu, Wang Bill Zhu, Taiwei Shi, Linxin Song, Robin Jia

机构 * University of Southern California(南加州大学) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL

AI总结 本文提出BEHEMOTH基准,通过集群-based策略CluE提升跨异质任务的记忆提取效果,实验显示CluE在异质任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05663 2026-04-14 cs.AI 57%

CuraLight: Debate-Guided Data Curation for LLM-Centered Traffic Signal Control

CuraLight: 基于辩论引导的数据整理用于LLM中心的交通信号控制

Qing Guo, Xinhang Li, Junyu Chen, Zheng Guo, Shengzhe Xu, Lin Zhang, Lei Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Beijing Big Data Center(北京大数据中心)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出CuraLight框架,通过强化学习代理生成高质量交互轨迹并结合多LLM辩论系统优化信号控制策略,实验显示在不同真实网络中优于现有方法,降低平均通行时间、排队长度和等待时间。

Comments accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11017 2026-04-14 cs.DC cs.AI 57%

NimbusGuard: A Novel Framework for Proactive Kubernetes Autoscaling Using Deep Q-Networks

NimbusGuard:一种利用深度Q网络的主动Kubernetes自动扩展新框架

Chamath Wanigasooriya, Indrajith Ekanayake

机构 * Informatics Institute of Technology(信息科技学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出NimbusGuard,基于深度强化学习的主动Kubernetes自动扩展框架,通过LSTM预测工作负载模式,相比传统反应式方法提升性能与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07099 2026-04-14 cs.CY cs.AI cs.CR cs.SI 57%

ClausewitzGPT Framework: A New Frontier in Theoretical Large Language Model Enhanced Information Operations

ClausewitzGPT框架:理论大语言模型增强信息操作的新前沿

Benjamin Kereopa-Yorke

机构 * UNSW Canberra at the Australian Defence Force Academy(澳大利亚国防军学院新南威尔士大学堪培拉分校)

专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.AI

AI总结 本文提出ClausewitzGPT框架,旨在量化机器速运算风险并强调自主AI代理在信息操作中的关键作用,结合启蒙思想与克劳塞维茨原则,强调战略视野、伦理考量与全面理解的重要性。

Comments 14 pages, 14 figures

Journal ref Journal of Information Warfare, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10582 2026-04-14 cs.DC cs.OS cs.PF 50%

Mitigating GIL Bottlenecks in Edge AI Systems

缓解边缘AI系统中的GIL瓶颈

Mridankan Mandal, Smit Sanjay Shende

专题命中 记忆与上下文管理 :AI agent(abstract)

AI总结 本文提出了一种轻量级分析工具和自适应运行时系统,通过阻塞比率指标区分真实I/O等待与GIL竞争,实现96.5%的最优性能,优于多进程和异步IO。

Comments Accepted to DOORS 2026 (6th European Edge Computing Workshop), published in their ACM ICPS, and accepted for non-archival poster presentation at EdgeAI Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 53 篇

2604.11518 2026-04-14 cs.SE cs.AI 90%

From Translation to Superset: Benchmark-Driven Evolution of a Production AI Agent from Rust to Python

从翻译到超集:面向生产AI代理的基准驱动演进:从Rust到Python

Jinhua Wang, Biswa Sengupta

专题命中 Agent评测 :agent(title,abstract);AI agent(title);agentic(abstract);multi-agent(abstract)

AI总结 本文提出一种基于LLM的持续代码翻译方法,将Rust生产代码库迁移至Python,通过基准驱动迭代优化,实现功能扩展与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09561 2026-04-14 cs.SI cs.AI cs.CY cs.DC 89%

Emergent Social Structures in Autonomous AI Agent Networks: A Metadata Analysis of 626 Agents on the Pilot Protocol

自主AI代理网络中的涌现社会结构:对626个代理在Pilot协议上的元数据分析

Teodor-Ioan Calin

机构 * Vulture Labs, Inc.(Vulture Labs公司)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究分析了626个自主AI代理在Pilot协议上形成的社交结构,发现其具有幂律度分布、高聚类系数、大规模连通组件及功能专业化特征,揭示了机器社会的新兴社会结构。

Comments 10 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10456 2026-04-14 cs.CV 89%

A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation

一个用于指令驱动电影视频编译的基准和多智能体系统

Peixuan Zhang, Chang Zhou, Ziyuan Zhang, Hualuo Liu, Chunjie Zhang, Jingqi Liu, Xiaohui Zhou, Xi Chen, Shuchen Weng, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG在线视频事业部AI技术中心) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) State Key Lab of Multimedia Info. Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Nat’l Eng. Research Ctr. of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);planning(abstract)

AI总结 本文提出CineBench基准和CineAgents系统,解决电影视频编译中的上下文崩溃和时间碎片化问题,通过脚本逆向工程和迭代叙事规划生成更连贯的编译结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11304 2026-04-14 cs.AI 85%

BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows

BankerToolBench:评估AI代理在端到端投资银行业务流程中的表现

Elaine Lau, Markus Dücker, Ronak Chaudhary, Hui Wen Goh, Rosemary Wei, Vaibhav Kumar, Saed Qunbar, Guram Gogia, Yi Liu, Scott Millslagle, Nasim Borazjanizadeh, Ulyana Tkachenko, Samuel Eshun Danquah, Collin Schweiker, Vijay Karumathil, Asrith Devalaraju, Varsha Sandadi, Haemi Nam, Punit Arani, Ray Epps, Abdullah Arif, Sahil Bhaiwala, Curtis Northcutt, Skyler Wang, Anish Athalye, Jonas Mueller, Francisco Guzmán

机构 * Handshake AI McGill University(麦吉尔大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出BankerToolBench,一个模拟投资银行日常工作的开源基准,用于评估AI代理在高价值、高强度的专业流程中的能力,测试结果显示当前AI模型在关键指标上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10513 2026-04-14 cs.AI 85%

Agent Mentor: Framing Agent Knowledge through Semantic Trajectory Analysis

Agent Mentor: 通过语义轨迹分析框架代理知识

Roi Ben-Gigi, Yuval David, Fabiana Fournier, Lior Limonad, Dany Moshkovich, Hadar Mulian, Segev Shlomov

机构 * IBM Software Innovation Lab(IBM软件创新实验室)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出通过语义轨迹分析框架提升代理性能,通过系统提示的监控和逐步调整,系统性地注入纠正指令以改进代理知识,实验显示在规范模糊性主导的场景中效果显著。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09568 2026-04-14 cs.HC cs.CL cs.CV 85%

EvoDiagram: Agentic Editable Diagram Creation via Design Expertise Evolution

EvoDiagram:通过设计专业知识进化实现代理可编辑的图示创建

Tianfu Wang, Leilei Ding, Ziyang Tao, Yi Zhan, Zhiyuan Ma, Wei Wu, Yuxuan Lei, Yuan Feng, Junyang Wang, Yin Wu, Yizhao Xu, Hongyuan Zhu, Qi Liu, Nicholas Jing Yuan, Yanyong Zhang, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 EvoDiagram通过设计专业知识进化实现代理可编辑图示创建,解决自动系统在高保真图示生成中的挑战,提出中间画布方案和设计知识进化机制,释放CanvasBench基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08538 2026-04-14 cs.CV 85%

ParseBench: A Document Parsing Benchmark for AI Agents

ParseBench:面向AI代理的文档解析基准测试

Boyang Zhang, Sebastián G. Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Daniel B. Ospina, Simon Suo

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract)

AI总结 本文提出ParseBench,一个包含2000多页企业文档的基准测试,涵盖表格、图表、内容忠实度、语义格式和视觉关联五大能力维度,揭示了当前系统在这些方面的能力缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11806 2026-04-14 cs.AI cs.CL 84%

Detecting Safety Violations Across Many Agent Traces

在大量智能体轨迹中检测安全违规

Adam Stein, Davis Brown, Hamed Hassani, Mayur Naik, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Meerkat方法,通过聚类与智能体搜索结合,有效发现自然语言指定的安全违规,提升检测效率并发现广泛开发者作弊和奖励黑客行为。

Comments 35 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09678 2026-04-14 cs.NI cs.AI cs.FL 83%

NetAgentBench: A State-Centric Benchmark for Evaluating Agentic Network Configuration

NetAgentBench: 一种面向评估代理网络配置的基于状态的基准

Ahmed Twabi, Yepeng Ding, Tohru Kondo

机构 * Hiroshima University(广岛大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 NetAgentBench通过有限状态机形式化方法评估代理交互,揭示了当前LLM代理在复杂多轮网络配置任务中的缺陷,强调了系统性评估多轮行为稳定性的必要性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03641 2026-04-14 cs.CL 83%

Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning

Agent-Dice: 通过几何共识解耦知识更新以实现智能体持续学习

Zheng Wu, Xingyu Lou, Xinbei Ma, Yansi Li, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.CL

AI总结 本文提出Agent-Dice框架,通过几何共识过滤和曲率重要性加权解耦知识更新,解决智能体持续学习中的稳定性与可塑性矛盾,实验表明其在GUI智能体和工具使用领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24329 2026-04-14 cs.CL cs.AI cs.CV 82%

GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents

GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架

Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。

Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10846 2026-04-14 eess.SY cs.SY 82%

PFAgent: A Tractable and Self-Evolving Power-Flow Agent for Interactive Grid Analysis

PFAgent:一种可计算且自演化功率流代理用于交互式电网分析

Buxin She, Brian Chen, Luanzheng Guo, Fangxing Li

专题命中 Agent评测 :agent(title,abstract);workflow(abstract)

AI总结 本文提出PFAgent,一种可计算且自演化功率流代理,旨在自动化电网分析流程,通过整合意图解析、知识检索、工具执行和结构化报告等功能,提升电网分析的自动化与交互性。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15640 2026-04-14 cs.LG cs.AI cs.CL 82%

Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training

数据混合代理:学习重新加权领域以实现持续预训练

Kailai Yang, Xiao Liu, Lei Ji, Hao Li, Xiao Liang, Zhiwei Liu, Yeyun Gong, Peng Cheng, Mao Yang

机构 * The University of Manchester(曼彻斯特大学) Microsoft Research(微软研究院) Imperial College London(伦敦帝国学院) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。

Comments Accepted by the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09791 2026-04-14 cs.AI cs.CL cs.LG cs.MA 82%

Pioneer Agent: Continual Improvement of Small Language Models in Production

先驱代理:生产环境中小语言模型的持续改进

Dhruv Atreja, Julia White, Nikhil Nayak, Kelton Zhang, Henrijs Princis, George Hurn-Maloney, Ash Lewis, Urchade Zaratiana

机构 * Fastino Labs

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Pioneer Agent,通过闭环系统自动化小语言模型的持续改进,通过冷启动和生产模式提升模型性能,发现有效训练策略。

Comments 43 pages, 10 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09579 2026-04-14 cs.AI cs.SE 81%

Help Without Being Asked: A Deployed Proactive Agent System for On-Call Support with Continuous Self-Improvement

无需被要求的帮助:一个用于轮班支持的主动代理系统,具备持续自我改进

Fengrui Liu, Xiao He, Tieying Zhang

机构 * ByteDance(字节跳动)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出Vigil系统,通过主动提供帮助减少人工支持负担,持续学习提升能力,已在Volcano Engine部署超过十个月,验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11419 2026-04-14 cs.AI cs.CR 79%

Beyond RAG for Cyber Threat Intelligence: A Systematic Evaluation of Graph-Based and Agentic Retrieval

超越RAG的网络威胁情报:基于图和代理检索的系统评估

Dzenan Hamzic, Florian Skopik, Max Landauer, Markus Wurzenberger, Andreas Rauber

机构 * AIT Austrian Institute of Technology(AIT奥地利技术研究所)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文系统评估了四种RAG架构在CTI分析中的表现,发现图检索在结构化查询中表现更优,混合图文方法在多跳查询中提升答案质量达35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11307 2026-04-14 cs.AI 79%

PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers

PaperScope:一种多模态多文档基准,用于跨大规模科学论文的智能深度研究

Lei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 PaperScope提出一个多模态多文档基准,用于评估智能深度研究能力,包含2000多个跨领域问题,验证了现有系统在长上下文检索和多源推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11174 2026-04-14 cs.RO cs.AI 79%

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

EmbodiedGovBench: 一种用于具身代理系统治理、恢复和升级安全性的基准

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-瓦特大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出EmbodiedGovBench基准,用于评估具身代理系统的治理能力,包括可控性、政策边界、安全恢复和审计完整性等,填补了传统任务成功率指标的不足。

Comments 34 pages, 7 tables. Code: https://github.com/s20sc/embodied-gov-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10988 2026-04-14 cs.AI cs.CV 79%

WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark

WebForge: 破解浏览器代理基准测试中的现实性-可重现性-可扩展性三重困境

Peng Yuan, Yuyang Yin, Yuxuan Cai, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 WebForge通过四阶段流程生成自包含的网页环境,解决基准测试中的现实性、可重现性和可扩展性矛盾,构建包含934个任务的基准测试集,揭示多维评估对模型能力的深入刻画。

Comments 14 pages, 6 figures, 6 tables, plus 29-page supplementary. Code: https://github.com/yuandaxia2001/WebForge Dataset: https://huggingface.co/datasets/yuandaxia/WebForge

详情

展开后加载摘要…

URL PDF HTML 收藏