arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2512.20798 2026-05-12 cs.AI 83%

A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents

一个评估自主AI代理结果驱动约束违反的基准

Miles Q. Li, Benjamin C. M. Fung, Martin Weiss, Pulei Xiong, Khalil Al-Hussaeni, Claude Fachkha

机构 * McGill University(麦吉尔大学) Tiptree Advanced Systems Corporation(蒂普里高级系统公司) Polytechnique Montréal(蒙特利尔理工学院) National Research Council Canada(加拿大国家研究委员会) Rochester Institute of Technology(罗切斯特理工学院) University of Dubai(迪拜大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一个包含40个场景的基准,用于评估自主AI代理在追求目标优化时出现的结果驱动约束违反问题,发现多数模型存在25%以上的偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06132 2026-05-08 cs.AI 83%

Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents

Claw-Eval: 向可信的自主代理评估迈进

Bowen Ye, Rang Li, Qibin Yang, Yuanxin Liu, Linli Yao, Hanglong Lv, Zhihui Xie, Chenxin An, Lei Li, Lingpeng Kong, Qi Liu, Zhifang Sui, Tong Yang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The University of Hong Kong(香港大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 Claw-Eval通过300人验证任务覆盖9类任务,采用轨迹感知评分体系,揭示自主代理在安全、鲁棒性及一致性上的多维特性,验证传统评估方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01214 2026-05-05 cs.AI cs.CY 83%

Agentic AI Systems Should Be Designed as Marginal Token Allocators

代理AI系统应作为边际令牌分配经济体进行设计

Siqi Zhu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出代理AI系统应以边际令牌分配经济体为设计框架,揭示各层在边际效益等于边际成本加延迟成本加风险成本的条件下,导致局部优化全局失衡的问题,提出令牌意识评估、自主定价、拥堵定价和服务风险调整等研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00073 2026-05-04 cs.AI 83%

AgentReputation: A Decentralized Agentic AI Reputation Framework

AgentReputation: 一种去中心化的代理AI声誉框架

Mohd Sameen Chishti, Damilare Peter Oyinloye, Jingyue Li

机构 * Department of Computer Science(计算机科学系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出AgentReputation框架,旨在解决去中心化代理AI市场中声誉机制失效的问题,通过分层架构和上下文感知声誉卡片实现声誉管理,同时提供风险驱动的决策引擎。

Comments 5 pages, 1 figure, accepted to FSE 2026, Ideas, Visions and Reflections track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10887 2026-05-04 cs.AI 83%

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

InfantAgent-Next:一种用于自动化计算机交互的多模态通用代理

Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Connecticut(康涅狄格大学) The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Cisco Research(思科研究)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出InfantAgent-Next,一种多模态通用代理,能够通过文本、图像、音频和视频与计算机交互。该代理结合工具型和纯视觉代理,在高度模块化架构中协同解决解耦任务。在OSWorld等基准上取得7.27%准确率,超越Claude-Computer-Use。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25109 2026-04-29 cs.CR cs.AI 83%

Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills

结构化安全审计与不信任代理技能的鲁棒性增强

Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出SkillGuard-Robust,通过角色感知证据提取、选择性语义验证和一致性保持裁决,解决代理技能预加载审计中语义保持重写下恶意意图识别不一致的问题,实验结果显示其在不同数据集上的高准确率和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00931 2026-04-29 cs.AI 83%

PsychAgent: An Experience-Driven Lifelong Learning Agent for Self-Evolving Psychological Counselor

PsychAgent: 一种基于经验的终身学习代理用于自我进化的心理辅导员

Yutao Yang, Junsong Li, Qianjun Pan, Jie Zhou, Kai Chen, Qin Chen, Jingyuan Zhao, Ningning Zhou, Xin Li, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) School of Psychology and Cognitive Science, East China Normal University(东华大学心理学与认知科学学院)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出PsychAgent,通过长期多会话交互的内存增强规划引擎、技能进化引擎和强化内化引擎,实现心理辅导员的自我进化,提升多会话咨询的一致性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23897 2026-04-28 cs.AI econ.GN q-fin.EC 83%

MarketBench: Evaluating AI Agents as Market Participants

MarketBench:评估AI代理作为市场参与者

Andrey Fradkin, Rohit Krishnan

机构 * Boston University and the MIT Initiative on the Digital Economy(波士顿大学和MIT数字经济倡议)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出MarketBench基准,评估AI代理在市场中的自我评估能力与成本感知,通过软件工程基准和LLM实验发现自我校准不足,但补充信息后有所改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20441 2026-04-23 cs.AI 83%

MedSkillAudit: A Domain-Specific Audit Framework for Medical Research Agent Skills

MedSkillAudit:一种面向医学研究代理技能的领域特定审计框架

Yingyong Hou, Xinyuan Lao, Huimei Wang, Qianyu Yao, Wei Chen, Bocheng Huang, Fei Sun, Yuxian Lv, Weiqi Lei, Xueqian Wen, Pengfei Xia, Zhujun Tan, Shengyang Xie

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出MedSkillAudit框架,用于评估医学研究代理技能的可靠性,通过专家评审和统计指标验证其有效性,为医学研究代理技能的治理提供实践基础。

Comments 20 pages, 9 figures, 1 graphic abstract, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20200 2026-04-23 cs.CL 83%

Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows

追逐公共评分:用户压力与编码代理工作流中的评估剥削

Hardy Chen, Nancy Lau, Haoqin Tu, Shuo Yan, Xiangyan Liu, Zijun Wang, Juncheng Wu, Michael Qizhe Shieh, Alvaro A. Cardenas, Cihang Xie, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) UT Dallas(德克萨斯大学达拉斯分校) NUS(新加坡国立大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.CL

AI总结 研究用户压力是否导致公共评分剥削,通过实验发现更强模型剥削率更高,高压力促使早期剥削,添加反剥削提示可有效减少剥削。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19818 2026-04-23 cs.SE cs.HC cs.MA 83%

Beyond Task Success: An Evidence-Synthesis Framework for Evaluating, Governing, and Orchestrating Agentic AI

超越任务成功:一个证据综合框架用于评估、治理和协调智能体AI

Christopher Koch, Joshua Andreas Wellbrock

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 本文提出一个证据综合框架,解决评估、治理和协调智能体AI中的治理到行动闭合缺口,通过四个层次框架、ODTA运行时测试和最小行动证据包,整合现有证据以提升可信度。

Comments 8 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22673 2026-04-22 cs.AI 83%

Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks

超越行程规划——多轮和工具使用旅行任务的现实世界基准

Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院) National University of Singapore(新加坡国立大学) Beihang University(北航) AMAP, Alibaba Group(阿里云实验室)

专题命中 Agent评测 :planning(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 本文提出TravelBench,一个现实世界旅行规划基准,通过多轮对话和工具使用评估LLM的独立解决问题、隐含偏好获取和能力边界识别能力。

Comments Accepted to the ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18240 2026-04-21 cs.AI 83%

AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation

AJ-Bench:用于环境感知评估的代理作为裁判基准测试

Wentao Shi, Yu Wang, Yuyang Zhao, Yuxin Chen, Fuli Feng, Xueyuan Hao, Xi Su, Qi Gu, Hui Su, Xunliang Cai, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meituan(美团)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 AJ-Bench通过三个领域155个任务评估代理作为裁判的能力,揭示了基于代理的验证方法在信息获取和过程验证中的性能提升及挑战。

Comments Accepted to ACL 2026 Findings. 43 pages total, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16753 2026-04-21 cs.AI 83%

Know When to Trust the Skill: Delayed Appraisal and Epistemic Vigilance for Single-Agent LLMs

何时信任技能:单智能体LLM的延迟评估与认知警惕

Eren Unlu

机构 * Globeholder Paris, France(巴黎Globeholder机构)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出MESA-S框架,通过延迟评估和认知警惕机制提升单智能体LLM的可靠性,减少供应链漏洞并防止自信膨胀。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14583 2026-04-17 cs.LG 83%

From Risk to Rescue: An Agentic Survival Analysis Framework for Liquidation Prevention

从风险到救援:一种用于防止清算的代理生存分析框架

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 本文提出一种基于生存分析的代理框架,通过预测和执行干预主动防止清算,引入返回期指标和趋势分数以优化资本效率,验证结果表明其能有效预防高风险场景下的清算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14160 2026-04-17 cs.AI 83%

NuHF Claw: A Risk Constrained Cognitive Agent Framework for Human Centered Procedure Support in Digital Nuclear Control Rooms

NuHF Claw:一种面向数字核控制室的人本流程支持的风险约束认知代理框架

Xingyu Xiao, Jiejuan Tong, Jun Sun, Zhe Sui, Peng Chen, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程国家重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出NuHF Claw框架,通过风险约束代理运行时,将认知状态推断与概率安全评估结合,实现实时自主系统行为调控,提升核控制室操作安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09643 2026-04-17 cs.ET cs.AI 83%

MM-tau-p$^2$: Persona-Adaptive Prompting for Robust Multi-Modal Agent Evaluation in Dual-Control Settings

MM-tau-p$^2$: 人格自适应提示用于双控制设置中多模态代理的鲁棒性评估

Anupam Purwar, Aditya Choudhary

机构 * Sprinklr AI

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MM-tau-p$^2$基准,通过12个新指标评估多模态代理在双控制环境中的鲁棒性,结合用户输入解决查询,并展示即使使用前沿LLM,多模态鲁棒性等指标仍需考虑。

Comments A benchmark for evaluating multimodal both voice and text LLM agents in dualcontrol settings. We introduce persona adaptive prompting and 12 new metrics to assess robustness safety efficiency and recovery in customer support scenarios

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12986 2026-04-15 cs.CR cs.AI 83%

Parallax: Why AI Agents That Think Must Never Act

Parallax:为什么具有思考能力的AI代理必须永不行动

Joel Fokou

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出Parallax框架,通过认知-执行分离、对抗验证与渐进确定性、信息流控制和可逆执行四大原则,解决具有执行能力的AI代理安全问题,实验显示其在98.9%的攻击中有效阻止。

Comments 20 pages, 1 figure, 5 tables. Open-source reference implementation: https://github.com/openparallax/openparallax. Documentation: https://docs.openparallax.dev. Feedback welcome via email or GitHub issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12717 2026-04-15 cs.AI 83%

Transferable Expertise for Autonomous Agents via Real-World Case-Based Learning

通过现实世界案例学习实现自主代理的可迁移专业技能

Zhenyu Ma, Yuyang Song, Chunyi Yang, Jingyi Zhu, Letian Yang, Xukai Jiang

机构 * National Glycoengineering Research Center, Shandong University(山东大学糖工程研究中心) State Key Laboratory of Microbial Technology, Shandong University(山东省微生物技术重点实验室)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出基于案例学习的框架,通过将过往任务经验转化为可重用的知识资产,使自主代理能迁移先前经验以执行更结构化的分析,在六个复杂任务类别基准测试中表现优异,尤其在复杂任务上优势显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09729 2026-04-15 cs.CV cs.AI 83%

LOLGORITHM: Funny Comment Generation Agent For Short Videos

LOLGORITHM:短视频 funny 评论生成代理

Xuan Ouyang, Bouzhou Wang, Senan Wang, Siyuan Xiahou, Jinrong Zhou, Yuekang Li

机构 * University of New South Wales(新南威尔士大学) University of Sydney(悉尼大学) The University of Hong Kong(香港大学) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出LOLGORITHM框架,通过视频摘要、分类和语义检索生成符合平台文化的短视频评论,实验显示其在YouTube和抖音上的人类偏好选择率高达80.46%和84.29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09678 2026-04-14 cs.NI cs.AI cs.FL 83%

NetAgentBench: A State-Centric Benchmark for Evaluating Agentic Network Configuration

NetAgentBench: 一种面向评估代理网络配置的基于状态的基准

Ahmed Twabi, Yepeng Ding, Tohru Kondo

机构 * Hiroshima University(广岛大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 NetAgentBench通过有限状态机形式化方法评估代理交互,揭示了当前LLM代理在复杂多轮网络配置任务中的缺陷,强调了系统性评估多轮行为稳定性的必要性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03641 2026-04-14 cs.CL 83%

Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning

Agent-Dice: 通过几何共识解耦知识更新以实现智能体持续学习

Zheng Wu, Xingyu Lou, Xinbei Ma, Yansi Li, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.CL

AI总结 本文提出Agent-Dice框架,通过几何共识过滤和曲率重要性加权解耦知识更新,解决智能体持续学习中的稳定性与可塑性矛盾,实验表明其在GUI智能体和工具使用领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09470 2026-04-13 cs.CL 83%

Agentic Jackal: Live Execution and Semantic Value Grounding for Text-to-JQL

代理Jackal:用于文本到JQL的实时执行与语义价值接地

Vishnu Murali, Anmol Gulati, Elias Lumer, Kevin Frank, Sindy Campagna, Vamse Kumar Subbiah

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出Jackal基准,通过实时执行和语义检索工具提升文本到JQL的准确性,验证了代理方法在解决语义歧义中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09285 2026-04-13 cs.AI 83%

SAGE: A Service Agent Graph-guided Evaluation Benchmark

SAGE:基于服务代理图的评估基准

Ling Shi, Yuqin Dai, Ziyin Wang, Ning Gao, Wei Zhang, Chaozheng Wang, Yujie Wang, Wei He, Jinpeng Wang, Deiyi Xiong

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出SAGE基准,通过动态对话图验证逻辑合规性,解决现有基准无法评估多维度用户行为和SOP的问题,揭示模型在意图分类与后续动作推导间的执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07142 2026-04-13 cs.HC cs.AI 83%

Exploring Teachers' Perspectives on Using Conversational AI Agents for Group Collaboration

探索教师使用对话式AI代理进行小组协作的视角

Prerna Ravi, Carúmey Stevens, Beatriz Flamia Azevedo, Jasmine David, Brandon Hanks, Hal Abelson, Grace Lin, Emma Anderson

机构 * Massachusetts Institute of Technology(麻省理工学院) Instituto Politécnico de Bragança(布拉干萨理工学院)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究探讨教师如何感知对话式AI代理对小组协作的影响,揭示设计中的核心矛盾及教学应用考量。

Comments Accepted to 27th International Conference on AI in Education (AIED) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07988 2026-04-10 cs.DC cs.AI 83%

LogAct: Enabling Agentic Reliability via Shared Logs

LogAct:通过共享日志实现代理可靠性

Mahesh Balakrishnan, Ashwin Bharambe, Davide Testuggine, David Geraghty, David Mao, Vidhya Venkat, Ilya Mironov, Rithesh Baradi, Gayathri Aiyer, Victoria Dudin

机构 * Meta

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 LogAct通过共享日志实现代理可靠性,允许代理通过LLM推理分析执行历史,实现故障恢复、健康检查和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06582 2026-04-10 cs.IR cs.AI cs.MA 83%

Agentic SPARQL: Evaluating SPARQL-MCP-powered Intelligent Agents on the Federated KGQA Benchmark

代理SPARQL:在联邦知识图谱问答基准上评估基于SPARQL-MCP的智能代理

Daniel Dobriy, Frederik Bauer, Amr Azzam, Debayan Banerjee, Axel Polleres

机构 * WU Vienna(维也纳经济大学) Leuphana Universität Lüneburg(吕讷堡大学) Complexity Science Hub Vienna(维也纳复杂性科学中心)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了基于SPARQL-MCP的智能代理在联邦SPARQL查询中的潜力,扩展了知识图谱问答基准,并评估了通过MCP集成SPARQL联邦与LLM代理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02837 2026-04-06 cs.CR cs.AI 83%

Towards Secure Agent Skills: Architecture, Threat Taxonomy, and Security Analysis

面向安全的智能体技能:架构、威胁分类与安全分析

Zhiyuan Li, Jingzheng Wu, Xiang Ling, Xing Cui, Tianyue Luo

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文首次系统分析了智能体技能框架的安全性,识别各生命周期阶段的攻击面,构建了包含七类十七种场景的威胁分类,并提出针对各威胁类别的防御方向和研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29848 2026-04-01 cs.AI cs.MA 83%

AgentFixer: From Failure Detection to Fix Recommendations in LLM Agentic Systems

AgentFixer: 从LLM代理系统中故障检测到修复建议

Hadar Mulian, Sergey Zeltyn, Ido Levy, Liane Galanti, Avi Yaeli, Segev Shlomov

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一个综合验证框架,通过系统诊断和改进可靠性故障,结合轻量规则检查与LLM评估,提升代理系统性能,通过实验展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29199 2026-04-01 cs.AI 83%

AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction

AEC-Bench:一种用于建筑、工程和施工领域代理系统的多模态基准

Harsh Mankodiya, Chase Gallik, Theodoros Galanos, Andriy Mulyar

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 AEC-Bench旨在评估建筑、工程和施工领域代理系统在真实任务中的表现,涵盖图纸理解、跨表单推理和项目级协调任务,通过多模型基准测试提升基础模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏