arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15603 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15603 篇

2605.17475 2026-05-19 cs.SE 90%

Event-B Agent: Towards LLM Agent for Formal Model Synthesis and Repair

Event-B Agent:迈向LLM代理的正式模型综合与修复

Hongshu Wang, Xinyue Zuo, Yuhan Sun, Qin Li, Yamine Ait Ameur, Jin Song Dong

专题命中 Agent评测 :agent(title,title_cn);分类 cs.SE

AI总结 本文提出Event-B Agent,一种基于LLM的正式模型综合与修复框架,通过自然语言要求构建初始模型并迭代修复和优化,提升模型质量。

Comments accepted by FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25944 2026-04-21 cs.AI 90%

NuRisk: A Visual Question Answering Dataset for Agent-Level Risk Assessment in Autonomous Driving

NuRisk:面向自动驾驶中 agent 级风险评估的视觉问答数据集

Yuan Gao, Mattia Piccinini, Roberto Brusnicki, Yuchen Zhang, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, TUM School of Engineering and Design, Technical University of Munich(自主车辆系统教授职位,TUM工程与设计学院,慕尼黑技术大学) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所(MIRMI))

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI

AI总结 NuRisk 数据集通过 2.9K 场景和 1.1M agent 级样本,提供基于鸟瞰图的时序图像及量化风险标注,提升自动驾驶中 agent 行为与情境的时空推理能力。

Comments 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03128 2026-02-04 cs.AI 90%

Understanding Multi-Agent LLM Frameworks: A Unified Benchmark and Experimental Analysis

理解多智能体大语言模型框架:一个统一的基准测试和实验分析

Abdelghny Orogat, Ana Rostam, Essam Mansour

机构 * Concordia University(康科迪亚大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MAFBench统一评估套件,系统比较多智能体LLM框架,揭示架构设计对性能的显著影响。

Comments 25 pages, 9 figures and 13 tables; introduces MAFBench unified multi-agent evaluation suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02345 2026-08-04 cs.CL cs.AI stat.AP 新提交 90%

Can AI Agents Simulate A/B Test Outcomes? A Validation Framework for Agentic Experimentation

AI智能体能模拟A/B测试结果吗?智能体实验的验证框架

Stefan Hut, Lorenzo Masoero

机构 * Amazon(亚马逊公司)

专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出智能体实验的验证框架S-RCT,用AI智能体模拟A/B测试结果,经67个营销A/B测试验证,校准后可降低预测误差,为实验者提供智能体信号支持。

Comments Accepted as a workshop paper at https://www.aiagentbehavior.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18142 2026-07-08 cs.AI cs.CL cs.CY 新提交 90%

Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models

你的AI旅行代理会为你预订斗牛:前沿AI模型中隐含动物福利的代理基准

Jasmine Brazilek, Joel Christoph, Maheep Chaudhary, Oliver Tullio, Carol Kline, Miles Tidmarsh, Arturs Kanepajs

机构 * Compassion Aligned Machine Learning(同情对齐机器学习) Sentient Futures(感知未来) Harvard Kennedy School(哈佛肯尼迪学院) Appalachian State University Department of Management(阿巴拉契亚州立大学管理系)

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 提出首个代理基准TAC,测试AI代理在为用户执行旅行预订等操作时是否避免涉及动物剥削的选项。评估七个前沿模型,所有模型得分低于随机水平64%,最佳模型仅53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11518 2026-04-14 cs.SE cs.AI 90%

From Translation to Superset: Benchmark-Driven Evolution of a Production AI Agent from Rust to Python

从翻译到超集:面向生产AI代理的基准驱动演进:从Rust到Python

Jinhua Wang, Biswa Sengupta

专题命中 Agent评测 :agent(title,abstract);AI agent(title);agentic(abstract);multi-agent(abstract)

AI总结 本文提出一种基于LLM的持续代码翻译方法,将Rust生产代码库迁移至Python,通过基准驱动迭代优化,实现功能扩展与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04756 2026-03-09 cs.AI cs.CE cs.SE 90%

MOOSEnger -- a Domain-Specific AI Agent for the MOOSE Ecosystem

MOOSEnger -- 一个针对MOOSE生态系统的领域特定AI代理

Mengnan Li, Jason Miller, Zachary Prince, Alexander Lindsay, Cody Permann

机构 * Idaho National Laboratory(爱达荷国家实验室)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 MOOSEnger 是一个专为MOOSE生态系统的AI代理,通过检索增强生成和领域特定工具提升多物理场仿真效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07407 2025-09-03 cs.AI cs.CL cs.MA 90%

A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems

Jinyuan Fang, Yanwen Peng, Xi Zhang, Yingxu Wang, Xinhao Yi, Guibin Zhang, Yi Xu, Bin Wu, Siwei Liu, Zihao Li, Zhaochun Ren, Nikos Aletras, Xi Wang, Han Zhou, Zaiqiao Meng

机构 * University of Glasgow(格拉斯哥大学) University of Sheffield(谢菲尔德大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) National University of Singapore(新加坡国家大学) University of Cambridge(剑桥大学) University College London(伦敦大学学院) University of Aberdeen(阿伯丁大学) Leiden University(莱顿大学)

专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

Comments Github Repo: https://github.com/EvoAgentX/Awesome-Self-Evolving-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21034 2025-09-01 cs.CR cs.AI cs.LG 90%

SAGA: A Security Architecture for Governing AI Agentic Systems

Georgios Syros, Anshuman Suri, Jacob Ginesin, Cristina Nita-Rotaru, Alina Oprea

机构 * Northeastern University(东北大学)

专题命中 Agent评测 :agentic(title,abstract);AI agent(title);agent(abstract);autonomous agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01717 2025-07-03 cs.AI cs.IR cs.LG cs.MA 90%

Agent Ideate: A Framework for Product Idea Generation from Patents Using Agentic AI

Gopichand Kanumolu, Ashok Urlana, Charaka Vinayak Kumar, Bala Mallikarjunarao Garlapati

机构 * TCS Research, Hyderabad, India(塔塔咨询服务研究中心,印度海得拉巴) IIIT Hyderabad(IIIT海得拉巴)

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

Comments AgentScen Workshop, IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20664 2025-06-26 cs.AI cs.CL cs.HC cs.MA 90%

The Decrypto Benchmark for Multi-Agent Reasoning and Theory of Mind

Andrei Lupu, Timon Willi, Jakob Foerster

机构 * FAIR at Meta(Meta 的 FAIR) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

Comments 41 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03434 2025-11-06 cs.HC cs.AI cs.MA cs.NI cs.SI 90%

Inter-Agent Trust Models: A Comparative Study of Brief, Claim, Proof, Stake, Reputation and Constraint in Agentic Web Protocol Design-A2A, AP2, ERC-8004, and Beyond

Botao 'Amber' Hu, Helena Rong

专题命中 Agent评测 :agentic(title,abstract);agent(title,abstract);AI agent(abstract);分类 cs.AI

Comments Submitted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12721 2026-08-14 cs.CV 新提交 89%

VOS-Agent: The 1st Place Solution for the 8th LSVOS Challenge (MOSEv2 Track)

VOS-Agent:第8届LSVOS挑战赛(MOSEv2赛道)的第一名解决方案

Canyang Wu, Jinrong Zhang, Xusheng He, Ce Bian, Xianjing Han, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Nanyang Technological University(南洋理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 Agent评测 :agent(title,title_cn)

AI总结 针对复杂视频目标分割中微小目标、语义主导目标的稳健传播难题,本文提出VOS-Agent协作框架,以SAM3为共享密集分割模块,根据目标特征激活专用智能体,在ECCV 2026第8届LSVOS挑战赛MOSEv2赛道获第一名,J&JF指标达69.82%。

Comments 1st Place Solution for the 8th LSVOS MOSEv2 Challenge (ECCV 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25489 2026-07-29 cs.CV 新提交 89%

Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation

医学中的智能体人工智能:临床转化的架构、应用、评估及挑战

Zheng Tong, Yang Liu, Wanshu Fan, Jing Qin, Zhongbin Han, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, San Francisco(加州大学旧金山分校) Yale University(耶鲁大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 研究探讨医学中智能体人工智能的架构、应用等,通过范围审查筛选相关研究,指出其范围未定论且评估与临床需求不符,证据基础有限,临床转化需更清晰定义、可重复评估等。

Comments Review article, 6 figures, 2 tables. 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25155 2026-07-29 eess.SY cs.SY 新提交 89%

VeraGrid-Agent: Tool-Augmented LLMs for Distribution Optimal Power Flow at the Grid Edge

VeraGrid-Agent:用于电网边缘分布式最优潮流的工具增强大语言模型

Shivanshu Tripathi, Hamed Mohsenian-Rad, Maziar Raissi

专题命中 Agent评测 :agent(title,title_cn)

AI总结 研究针对电网边缘分布式最优潮流问题,提出工具增强大语言模型VeraGrid-Agent,通过自主编写模拟器输入、执行求解器并读取输出作答。引入VeraGrid-MCQ-150测试评估,相比无工具推理,该模型显著提升准确率,且剩余错误源于推理而非求解器执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08819 2026-06-15 cond-mat.mtrl-sci 89%

TEM Agent: enhancing transmission electron microscopy (TEM) with modern AI tools

TEM Agent:利用现代AI工具增强透射电子显微镜(TEM)

Morgan K. Wall, Alexander J. Pattison, Edward S. Barnard, Stephanie M. Ribet, Peter Ercius

专题命中 Agent评测 :agent(title,title_cn)

AI总结 本文提出TEM Agent框架,通过模型上下文协议(MCP)方法结合商业LLM,实现对TEM多个子系统的访问与控制,简化复杂显微镜生态系统,提升用户完成各类难度实验的能力。

Comments 22 pages, 4 figures

Journal ref Npj Computational Materials (2026) 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19941 2026-07-23 cs.HC cs.AI 新提交 89%

A Framework of User Experience Principles for Human-AI Agent Interaction in the Workplace

工作场所中人类与人工智能代理交互的用户体验原则框架

Kathrin Paimann, Elizangela Valarini, Sebastian Juhl

机构 * SAP SE(SAP公司) Hochschule Fresenius(弗赖辛大学) University of Missouri(密苏里大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 研究工作场所人类与人工智能代理交互的用户体验原则,采用多方法识别并验证八项核心原则框架及标准,为设计师和工程师提供指导方针,为相关实证研究奠定结构化基础。

Comments 6 pages, 1 figure, 1 table, to be published in the proceedings of Mensch und Computer 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18257 2026-07-22 cs.HC cs.AI 新提交 89%

Assistant or Actor? Student Trust, Control, and Delegation Regret When Using a General-Purpose AI Agent

助手还是执行者?使用通用人工智能代理时学生的信任、控制与委托遗憾

Shiva Pochampally, Shengwei An, Yan Chen

机构 * Department of Computer Science(计算机科学系) Virginia Tech(弗吉尼亚理工大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 研究探讨用户使用通用人工智能代理时的委托遗憾问题,通过大学生完成不同任务的对照研究,发现参与者按任务校准信任,不可逆与外部可见性影响信任撤回,代理无预览执行行动时委托遗憾常现,为代理设计提供了相关启示。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09448 2026-06-26 cs.CV cs.AI 版本更新 89%

A Guideline-Aware AI Agent for Zero-Shot Target Volume Auto-Delineation

一种遵循指南的AI智能体用于零样本靶区自动勾画

Yoon Jo Kim, Wonyoung Cho, Jongmin Lee, Han Joo Chae, Hyunki Park, Sang Hoon Seo, Jae Myung Noh, Kyungmi Yang, Dongryul Oh, Jin Sung Kim

机构 * Oncosoft Inc.(Oncosoft公司) Department of Radiation Oncology, Samsung Medical Center, Sungkyunkwan University School of Medicine(放射肿瘤科,三星医疗中心,成均馆大学医学院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出OncoAgent框架,将文本临床指南转化为三维靶区轮廓,无需训练即可实现零样本勾画,在食管癌病例中达到与监督方法相当的Dice系数,且医生更偏好其指南依从性和临床可接受性。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11909 2026-06-11 cs.AI 新提交 89%

Embodied-BenchClaw: An Autonomous Multi-Agent System for Embodied Spatial Intelligence Benchmark Construction

Embodied-BenchClaw:用于具身空间智能基准构建的自主多智能体系统

Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Zhe Ji, Jinshan Lai, Xi Ren, Jianwei Hu, Qiang Ma

机构 * QiYuan Lab(启元实验室) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 Agent评测 :agent(title);multi-agent(title);autonomous agent(abstract);planning(abstract)

AI总结 提出Embodied-BenchClaw,一个通过五阶段流水线和三个智能体协调的自主系统,自动构建可验证、可执行、可维护且诊断有用的具身空间智能基准,减少人工工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04193 2026-06-04 cs.CR cs.AI cs.DC 89%

Notarized Agents: Receiver-Attested Confidential Receipts for AI Agent Actions

公证代理:面向AI代理行为的接收方认证保密收据

Juan Figuera

机构 * Independent Researcher, Sello Project(独立研究者,Sello项目)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 针对AI代理日志自审计的信任缺陷,提出接收方签名收据协议Sello,通过HPKE加密、JWS绑定和Merkle日志实现防篡改追踪。

Comments 22 pages. Reference implementation at https://github.com/juanfiguera/sello

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11418 2026-05-13 cs.AI cs.CR 89%

Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry

深入探究SKILL.md:人工智能代理技能注册中的语义供应链攻击

Shoumik Saha, Kazem Faghih, Soheil Feizi

机构 * Department of Computer Science, University of Maryland - College Park(马里兰大学计算机科学系)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 研究了SKILL.md文件在AI代理技能生命周期三个阶段中的语义供应链攻击,发现文本触发可影响技能发现、选择和治理,揭示SKILL.md的动态作用。

Comments 31 pages, 21 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10516 2026-05-12 cs.AI 89%

Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability

一致性作为可检验的属性:评估AI代理可靠性的统计方法

Harsh Raj, Niranjan Orkat, Suvrorup Mukherjee, Aritra Guha, Cheryl Flynn, Subhabrata Majumdar

机构 * Northeastern University(东北大学) University of Pécs(佩奇大学) University of Michigan(密歇根大学) AT&T Chief Data Office(AT&T首席数据办公室) Indian Institute of Management Bangalore(班加罗尔印度管理学院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种评估AI代理可靠性的统计方法,通过输出级可靠性和轨迹级稳定性指标,揭示代理核心能力与执行鲁棒性之间的差异,验证了轨迹一致性指标在诊断敏感性上的优势。

Comments 33 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14455 2026-04-17 cs.AI 89%

AIBuildAI: An AI Agent for Automatically Building AI Models

AIBuildAI: 一个用于自动构建AI模型的AI代理

Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Medicine, University of California San Diego(加州大学圣地亚哥分校医学系)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 AIBuildAI通过分层代理架构自动构建AI模型,超越传统AutoML,实现端到端自动化,展示出在Kaggle风格任务中63.1%的获奖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09561 2026-04-14 cs.SI cs.AI cs.CY cs.DC 89%

Emergent Social Structures in Autonomous AI Agent Networks: A Metadata Analysis of 626 Agents on the Pilot Protocol

自主AI代理网络中的涌现社会结构:对626个代理在Pilot协议上的元数据分析

Teodor-Ioan Calin

机构 * Vulture Labs, Inc.(Vulture Labs公司)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究分析了626个自主AI代理在Pilot协议上形成的社交结构,发现其具有幂律度分布、高聚类系数、大规模连通组件及功能专业化特征,揭示了机器社会的新兴社会结构。

Comments 10 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07007 2026-04-09 cs.MA cs.AI cs.CY 89%

AgentCity: Constitutional Governance for Autonomous Agent Economies via Separation of Power

AgentCity:通过权力分离实现自主代理经济的宪法治理

Anbang Ruan, Xing Zhang

机构 * NetX Foundation(NetX 基金会)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);AI agent(abstract);planning(abstract)

AI总结 本文提出通过权力分离模型,在区块链上实现自主代理经济的宪法治理,通过智能合约、确定性软件和人类裁决三者分离,解决代理社会逻辑垄断问题,实现人类意图与集体行为的对齐。

Comments 111 pages, 11 figures, 19 tables, 67 references. Pre-registered experimental design

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03870 2026-04-07 cs.CL 89%

Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs

你的代理比你想象的更脆弱:揭示代理LLM中的间接注入漏洞

Wenhui Zhu, Xuanzhao Dong, Xiwen Chen, Rui Cai, Peijie Qiu, Zhipeng Wang, Oana Frunza, Shao Tang, Jindong Gu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Morgan Stanley(摩根士丹利) UC Davis(加州大学戴维斯分校) Washington University in St. Louis(圣路易斯华盛顿大学) Rice University(莱斯大学) Florida State University(佛罗里达州立大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(title,abstract);agentic(title);autonomous agent(abstract);multi-agent(abstract)

AI总结 研究揭示了代理LLM在动态环境中存在严重的间接注入漏洞,通过评估六种防御策略发现现有防护不足,提出基于表示工程的检测方法以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29399 2026-04-03 cs.AI cs.DB 89%

ELT-Bench-Verified: Benchmark Quality Issues Underestimate AI Agent Capabilities

ELT-Bench-Verified: 评估质量问题低估了AI代理的能力

Christopher Zanoli, Andrea Giovannini, Tengjun Jin, Ana Klimovic, Yotam Perlitz

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院) University of Illinois (UIUC)(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过重新评估ELT-Bench发现代理能力被低估,提出Auditor-Corrector方法修正评估质量,构建ELT-Bench-Verified提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25609 2026-02-25 cs.AI cs.CY 89%

A Framework for Studying AI Agent Behavior: Evidence from Consumer Choice Experiments

研究AI代理行为的框架:来自消费者选择实验的证据

Manuel Cherep, Chengtian Ma, Abigail Xu, Maya Shaked, Pattie Maes, Nikhil Singh

机构 * MIT(麻省理工学院) Tsinghua University(清华大学) Dartmouth College(达特茅斯学院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出ABxLab框架,通过控制选项属性和说服性提示,研究AI代理在现实决策中的选择行为,揭示代理在无认知限制下仍存在强烈偏好偏见,为AI代理行为研究提供测试平台。

Comments ICLR, 31 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16037 2026-02-19 cs.AI cs.MA 89%

Optimization Instability in Autonomous Agentic Workflows for Clinical Symptom Detection

自主代理工作流中临床症状检测的优化不稳定性

Cameron Cagan, Pedram Fard, Jiazi Tian, Jingya Cheng, Shawn N. Murphy, Hossein Estiri

机构 * Massachusetts General Hospital(麻省总医院)

专题命中 Agent评测 :autonomous agent(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究发现自主AI系统在低流行病学任务中,回顾性选择比主动干预更有效,揭示了优化不稳定性导致的失效模式。

详情

展开后加载摘要…

URL PDF HTML 收藏