arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-14 至 2026-04-14 共收录 53 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 53 篇

2604.11518 2026-04-14 cs.SE cs.AI 90%

From Translation to Superset: Benchmark-Driven Evolution of a Production AI Agent from Rust to Python

从翻译到超集:面向生产AI代理的基准驱动演进:从Rust到Python

Jinhua Wang, Biswa Sengupta

专题命中 Agent评测 :agent(title,abstract);AI agent(title);agentic(abstract);multi-agent(abstract)

AI总结 本文提出一种基于LLM的持续代码翻译方法,将Rust生产代码库迁移至Python,通过基准驱动迭代优化,实现功能扩展与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09561 2026-04-14 cs.SI cs.AI cs.CY cs.DC 89%

Emergent Social Structures in Autonomous AI Agent Networks: A Metadata Analysis of 626 Agents on the Pilot Protocol

自主AI代理网络中的涌现社会结构:对626个代理在Pilot协议上的元数据分析

Teodor-Ioan Calin

机构 * Vulture Labs, Inc.(Vulture Labs公司)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究分析了626个自主AI代理在Pilot协议上形成的社交结构,发现其具有幂律度分布、高聚类系数、大规模连通组件及功能专业化特征,揭示了机器社会的新兴社会结构。

Comments 10 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10456 2026-04-14 cs.CV 89%

A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation

一个用于指令驱动电影视频编译的基准和多智能体系统

Peixuan Zhang, Chang Zhou, Ziyuan Zhang, Hualuo Liu, Chunjie Zhang, Jingqi Liu, Xiaohui Zhou, Xi Chen, Shuchen Weng, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG在线视频事业部AI技术中心) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) State Key Lab of Multimedia Info. Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Nat’l Eng. Research Ctr. of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);planning(abstract)

AI总结 本文提出CineBench基准和CineAgents系统,解决电影视频编译中的上下文崩溃和时间碎片化问题,通过脚本逆向工程和迭代叙事规划生成更连贯的编译结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11304 2026-04-14 cs.AI 85%

BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows

BankerToolBench:评估AI代理在端到端投资银行业务流程中的表现

Elaine Lau, Markus Dücker, Ronak Chaudhary, Hui Wen Goh, Rosemary Wei, Vaibhav Kumar, Saed Qunbar, Guram Gogia, Yi Liu, Scott Millslagle, Nasim Borazjanizadeh, Ulyana Tkachenko, Samuel Eshun Danquah, Collin Schweiker, Vijay Karumathil, Asrith Devalaraju, Varsha Sandadi, Haemi Nam, Punit Arani, Ray Epps, Abdullah Arif, Sahil Bhaiwala, Curtis Northcutt, Skyler Wang, Anish Athalye, Jonas Mueller, Francisco Guzmán

机构 * Handshake AI McGill University(麦吉尔大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出BankerToolBench,一个模拟投资银行日常工作的开源基准,用于评估AI代理在高价值、高强度的专业流程中的能力,测试结果显示当前AI模型在关键指标上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10513 2026-04-14 cs.AI 85%

Agent Mentor: Framing Agent Knowledge through Semantic Trajectory Analysis

Agent Mentor: 通过语义轨迹分析框架代理知识

Roi Ben-Gigi, Yuval David, Fabiana Fournier, Lior Limonad, Dany Moshkovich, Hadar Mulian, Segev Shlomov

机构 * IBM Software Innovation Lab(IBM软件创新实验室)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出通过语义轨迹分析框架提升代理性能,通过系统提示的监控和逐步调整,系统性地注入纠正指令以改进代理知识,实验显示在规范模糊性主导的场景中效果显著。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09568 2026-04-14 cs.HC cs.CL cs.CV 85%

EvoDiagram: Agentic Editable Diagram Creation via Design Expertise Evolution

EvoDiagram:通过设计专业知识进化实现代理可编辑的图示创建

Tianfu Wang, Leilei Ding, Ziyang Tao, Yi Zhan, Zhiyuan Ma, Wei Wu, Yuxuan Lei, Yuan Feng, Junyang Wang, Yin Wu, Yizhao Xu, Hongyuan Zhu, Qi Liu, Nicholas Jing Yuan, Yanyong Zhang, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 EvoDiagram通过设计专业知识进化实现代理可编辑图示创建,解决自动系统在高保真图示生成中的挑战,提出中间画布方案和设计知识进化机制,释放CanvasBench基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08538 2026-04-14 cs.CV 85%

ParseBench: A Document Parsing Benchmark for AI Agents

ParseBench:面向AI代理的文档解析基准测试

Boyang Zhang, Sebastián G. Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Daniel B. Ospina, Simon Suo

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract)

AI总结 本文提出ParseBench,一个包含2000多页企业文档的基准测试,涵盖表格、图表、内容忠实度、语义格式和视觉关联五大能力维度,揭示了当前系统在这些方面的能力缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11806 2026-04-14 cs.AI cs.CL 84%

Detecting Safety Violations Across Many Agent Traces

在大量智能体轨迹中检测安全违规

Adam Stein, Davis Brown, Hamed Hassani, Mayur Naik, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Meerkat方法,通过聚类与智能体搜索结合,有效发现自然语言指定的安全违规,提升检测效率并发现广泛开发者作弊和奖励黑客行为。

Comments 35 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09678 2026-04-14 cs.NI cs.AI cs.FL 83%

NetAgentBench: A State-Centric Benchmark for Evaluating Agentic Network Configuration

NetAgentBench: 一种面向评估代理网络配置的基于状态的基准

Ahmed Twabi, Yepeng Ding, Tohru Kondo

机构 * Hiroshima University(广岛大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 NetAgentBench通过有限状态机形式化方法评估代理交互,揭示了当前LLM代理在复杂多轮网络配置任务中的缺陷,强调了系统性评估多轮行为稳定性的必要性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03641 2026-04-14 cs.CL 83%

Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning

Agent-Dice: 通过几何共识解耦知识更新以实现智能体持续学习

Zheng Wu, Xingyu Lou, Xinbei Ma, Yansi Li, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.CL

AI总结 本文提出Agent-Dice框架,通过几何共识过滤和曲率重要性加权解耦知识更新,解决智能体持续学习中的稳定性与可塑性矛盾,实验表明其在GUI智能体和工具使用领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24329 2026-04-14 cs.CL cs.AI cs.CV 82%

GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents

GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架

Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。

Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10846 2026-04-14 eess.SY cs.SY 82%

PFAgent: A Tractable and Self-Evolving Power-Flow Agent for Interactive Grid Analysis

PFAgent:一种可计算且自演化功率流代理用于交互式电网分析

Buxin She, Brian Chen, Luanzheng Guo, Fangxing Li

专题命中 Agent评测 :agent(title,abstract);workflow(abstract)

AI总结 本文提出PFAgent,一种可计算且自演化功率流代理,旨在自动化电网分析流程,通过整合意图解析、知识检索、工具执行和结构化报告等功能,提升电网分析的自动化与交互性。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15640 2026-04-14 cs.LG cs.AI cs.CL 82%

Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training

数据混合代理:学习重新加权领域以实现持续预训练

Kailai Yang, Xiao Liu, Lei Ji, Hao Li, Xiao Liang, Zhiwei Liu, Yeyun Gong, Peng Cheng, Mao Yang

机构 * The University of Manchester(曼彻斯特大学) Microsoft Research(微软研究院) Imperial College London(伦敦帝国学院) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。

Comments Accepted by the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09791 2026-04-14 cs.AI cs.CL cs.LG cs.MA 82%

Pioneer Agent: Continual Improvement of Small Language Models in Production

先驱代理:生产环境中小语言模型的持续改进

Dhruv Atreja, Julia White, Nikhil Nayak, Kelton Zhang, Henrijs Princis, George Hurn-Maloney, Ash Lewis, Urchade Zaratiana

机构 * Fastino Labs

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Pioneer Agent,通过闭环系统自动化小语言模型的持续改进,通过冷启动和生产模式提升模型性能,发现有效训练策略。

Comments 43 pages, 10 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09579 2026-04-14 cs.AI cs.SE 81%

Help Without Being Asked: A Deployed Proactive Agent System for On-Call Support with Continuous Self-Improvement

无需被要求的帮助:一个用于轮班支持的主动代理系统,具备持续自我改进

Fengrui Liu, Xiao He, Tieying Zhang

机构 * ByteDance(字节跳动)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出Vigil系统,通过主动提供帮助减少人工支持负担,持续学习提升能力,已在Volcano Engine部署超过十个月,验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11419 2026-04-14 cs.AI cs.CR 79%

Beyond RAG for Cyber Threat Intelligence: A Systematic Evaluation of Graph-Based and Agentic Retrieval

超越RAG的网络威胁情报:基于图和代理检索的系统评估

Dzenan Hamzic, Florian Skopik, Max Landauer, Markus Wurzenberger, Andreas Rauber

机构 * AIT Austrian Institute of Technology(AIT奥地利技术研究所)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文系统评估了四种RAG架构在CTI分析中的表现,发现图检索在结构化查询中表现更优,混合图文方法在多跳查询中提升答案质量达35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11307 2026-04-14 cs.AI 79%

PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers

PaperScope:一种多模态多文档基准,用于跨大规模科学论文的智能深度研究

Lei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 PaperScope提出一个多模态多文档基准,用于评估智能深度研究能力,包含2000多个跨领域问题,验证了现有系统在长上下文检索和多源推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11174 2026-04-14 cs.RO cs.AI 79%

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

EmbodiedGovBench: 一种用于具身代理系统治理、恢复和升级安全性的基准

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-瓦特大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出EmbodiedGovBench基准,用于评估具身代理系统的治理能力,包括可控性、政策边界、安全恢复和审计完整性等,填补了传统任务成功率指标的不足。

Comments 34 pages, 7 tables. Code: https://github.com/s20sc/embodied-gov-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10988 2026-04-14 cs.AI cs.CV 79%

WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark

WebForge: 破解浏览器代理基准测试中的现实性-可重现性-可扩展性三重困境

Peng Yuan, Yuyang Yin, Yuxuan Cai, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 WebForge通过四阶段流程生成自包含的网页环境,解决基准测试中的现实性、可重现性和可扩展性矛盾,构建包含934个任务的基准测试集,揭示多维评估对模型能力的深入刻画。

Comments 14 pages, 6 figures, 6 tables, plus 29-page supplementary. Code: https://github.com/yuandaxia2001/WebForge Dataset: https://huggingface.co/datasets/yuandaxia/WebForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10343 2026-04-14 cs.LG 79%

WaterAdmin: Orchestrating Community Water Distribution Optimization via AI Agents

WaterAdmin: 通过AI代理协调社区供水优化

Jiaqi Wen, Pingbo Tang, Shaolei Ren, Jianyi Yang

机构 * University of Houston(休斯顿大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Riverside(加州大学河滨分校)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.LG

AI总结 本文提出WaterAdmin框架,结合LLM进行社区上下文抽象与优化控制,以实现动态环境下供水系统的可靠性和节能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10252 2026-04-14 cs.AI cs.SY eess.SY 79%

A Dual-Positive Monotone Parameterization for Multi-Segment Bids and a Validity Assessment Framework for Reinforcement Learning Agent-based Simulation of Electricity Markets

多段报价的双正单调参数化及强化学习代理仿真电力市场的有效性评估框架

Zunnan Xu, Zhaoxia Jing, Zhanhua Pan

机构 * School of Electric Power Engineering, South China University of Technology(华南理工大学电力学院) Department of Engineering, University of Exeter(埃克塞特大学工程学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出双正单调参数化方法及有效性评估框架,解决传统方法在连续可导性和可逆性方面的不足,提升电力市场仿真结果的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07148 2026-04-14 eess.IV 78%

Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model

Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理

Yingjie Zhou, Jiezhang Cao, Farong Wen, Zicheng Zhang, Yu Zhou, Yue Shi, Xiaohong Liu, Radu Timofte, Luc Van Gool, Guangtao Zhai

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09554 2026-04-14 cs.AI cs.CL cs.LG 75%

LABBench2: An Improved Benchmark for AI Systems Performing Biology Research

LABBench2:一种改进的AI系统进行生物研究的基准测试

Jon M Laurent, Albert Bou, Michael Pieler, Conor Igoe, Alex Andonian, Siddharth Narayanan, James Braza, Alexandros Sanchez Vassopoulos, Jacob L Steenwyk, Blake Lash, Andrew D White, Samuel G Rodriques

机构 * Broad Institute, Cambridge, MA, USA(博德研究所,美国马萨诸塞州剑桥市)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出LABBench2,一个包含近1900个任务的改进基准,用于评估AI在真实世界中执行科学任务的能力,展示了当前前沿模型在不同子任务上的性能差异,并提供了数据集和评估工具以促进社区使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10286 2026-04-14 cs.AI 74%

STARS: Skill-Triggered Audit for Request-Conditioned Invocation Safety in Agent Systems

STARS:基于技能触发的请求条件调用安全性审计

Guijia Zhang, Shu Yang, Xilin Gong, Di Wang

机构 * Shenzhen University(深圳大学) King Abdullah University of Science & Technology(阿卜杜拉国王科技大学) PRADA Lab(PRADA实验室) University of Georgia(佐治亚大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 STARS通过结合静态能力先验、请求条件调用风险模型和校准风险融合策略,提升代理系统调用时的风险评估与优先级排序能力,优于静态筛查和上下文评分方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23514 2026-04-14 cs.CL cs.AI 73%

If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs

如果一个大语言模型是一个角色,它会知道自己故事吗?评估大语言模型的终身学习

Siqi Fan, Xiusheng Huang, Yiqun Yao, Xuezhi Fang, Kang Liu, Peng Han, Shuo Shang, Aixin Sun, Yequan Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Spin Matrix, China(中国Spin Matrix公司)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出LIFESTATE-BENCH基准,评估LLM的终身学习能力,通过Hamlet和合成剧本数据集,发现非参数方法在管理状态学习上表现更优,但所有模型在交互延长时均面临灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07070 2026-04-14 cs.AI cs.LG 73%

EVGeoQA: Benchmarking LLMs on Dynamic, Multi-Objective Geo-Spatial Exploration

EVGeoQA:基于动态多目标地理空间探索的LLM基准测试

Jianfei Wu, Zhichun Wang, Zhensheng Wang, Zhiyu He

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education(北京市教育人工智能重点实验室) Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(教育部智能技术与教育应用工程研究中心) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 EVGeoQA针对动态地理空间探索提出多目标基准,通过电动汽车充电场景设计,评估LLM在动态环境中的探索能力,发现其在长距离空间探索上存在不足,但能通过历史轨迹总结提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09564 2026-04-14 cs.DC cs.AI cs.SE 73%

ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness

ACE-Bench:一个轻量级的评估 Azure SDK 使用正确性的基准测试

Wenxing Zhu, Simeng Qi, Junkui Chen, Yan Xie, Min Huang, Jingkan He, Xiao Wang, Cheng Chen, Sijing Meng, Tianqi Zhang

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 ACE-Bench通过将官方文档示例转化为自包含编码任务,提供快速可重复的通过或失败信号,评估基于LLM的编码代理是否正确使用Azure SDK,同时减少评估成本并提高可重复性。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16644 2026-04-14 cs.CV 71%

CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance

CountLoop:通过迭代代理指导实现无训练的高实例图像生成

Anindya Mondal, Ayan Banerjee, Sauradip Nag, Josep Llados, Xiatian Zhu, Anjan Dutta

机构 * University of Surrey(萨里大学) Universitat Autònoma de Barcelona(巴塞罗那自治大学) Simon Fraser University(西蒙菲莎大学)

专题命中 Agent评测 :agent(title)

AI总结 CountLoop通过迭代反馈机制实现高密度场景下的精确实例控制,结合视觉语言模型生成布局和评估反馈,减少计数误差并提升空间质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17012 2026-04-14 cs.CV cs.AI 70%

SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence

SpatialScore:迈向空间智能的综合评估

Haoning Wu, Xiao Huang, Yaohui Chen, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出SpatialScore,首个全面评估多模态空间智能的基准,评估49个模型发现其在空间理解上存在显著差距,并构建了SpatialCorpus和SpatialAgent提升模型性能。

Comments Accepted by CVPR 2026 (Highlight); Project Page: https://haoningwu3639.github.io/SpatialScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11072 2026-04-14 cs.AI 70%

Hodoscope: Unsupervised Monitoring for AI Misbehaviors

Hodoscope:无监督监控AI误行

Ziqian Zhong, Shashwat Saxena, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出Hodoscope,通过无监督方法发现AI代理的异常行为,减少人工审查工作量,并提升LLM判断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏