VMAS: A Vectorized Multi-Agent Simulator for Collective Robot Learning
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI
Comments 13 pages
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI
Comments Accepted to ICML 2021 and presented as a long talk; 33 pages; 9 figures
Journal ref In International Conference on Machine Learning 2021 (pp. 6187-6199). PMLR
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG
Comments 14 pages, 6 figures
专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI
专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI
Comments 13 pages, in MICAI 2000: Advances in Artificial Intelligence. Lecture Notes in Artificial Intelligence 1793, pp. 621-633. Springer-Verlag
Journal ref MICAI 2000: Advances in Artificial Intelligence. Lecture Notes in Artificial Intelligence 1793, pp. 621-633. Springer-Verlag
生产AI代理运行时治理的五平面参考架构
机构 * Kamiwaza
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);workflow(abstract);agentic(abstract)
AI总结 针对生产AI代理打破传统数据边界治理假设的问题,提出由推理平面和四个执行平面组成的五平面参考架构,通过可组合原语实现运行时治理,阻断七种威胁并验证四个正确性不变式。
Comments 65 pages, 3 figures, 5 tables. Reference architecture with a reference implementation of the policy-engine core and microbenchmark results; full-system evaluation identified as future work
面向大语言模型的智能体环境工程:环境建模、合成、评估与应用综述
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);multi-agent(abstract)
AI总结 本文从环境工程生命周期出发,系统综述了智能体环境的建模、合成、评估与应用,涵盖八种属性与领域、两种合成范式、四种智能体演化路径及三种环境演化范式。
Comments 63 pages, 10 figures
Herculean: 面向金融智能的智能体基准测试
机构 * The Fin AI ; Yale University(耶鲁大学) ; Columbia University(哥伦比亚大学) ; Stevens Institute of Technology(史蒂文斯理工学院) ; NVIDIA(英伟达) ; New York University(纽约大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Florida(佛罗里达大学) ; MBZUAI ; Université de Montréal(蒙特利尔大学) ; University of Minnesota(明尼苏达大学) ; University of Massachusetts Boston(马萨诸塞大学波士顿分校) ; National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) ; University of Liverpool(利物浦大学) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; National University of Singapore(新加坡国立大学) ; Halmstad University(哈尔姆斯塔德大学) ; University of Manchester(曼彻斯特大学) ; Cardiff University(卡迪夫大学) ; McGill University(麦吉尔大学) ; Mila – Quebec AI Institute(魁北克人工智能研究所)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);workflow(abstract)
AI总结 本文提出Herculean,首个覆盖交易、对冲、市场洞察和审计四个代表性工作流的智能体金融智能基准测试,通过标准化MCP技能环境评估异构智能体系统,发现智能体在交易和市场洞察上表现较好,但在对冲和审计等需要长期协调、状态一致性和结构化验证的任务上存在显著不足。
Agent工具编排泄露更多:数据集、基准测试与缓解措施
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
专题命中 Agent评测 :agent(title,title_cn);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 研究LLM代理在编排多个工具时泄露敏感结论的风险(TOP-R),构建了包含1000个实例的基准TOP-Bench,并提出TOP-Align后训练方法以缓解泄露。
Comments 17 pages, 2 figures. Dataset and code are available at https://github.com/1Ponder/TOP-R
迈向具有智能体纠正和语义评估的类人交互式语音识别
机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) ; X-LANCE Lab, School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院X-LANCE实验室) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Fudan University(复旦大学) ; Tongyi Fun Team, Alibaba Group(阿里云通义团队)
专题命中 Agent评测 :agentic(title,summary_cn);分类 cs.AI、cs.CL
AI总结 提出Agentic ASR闭环框架,通过多轮交互和语义纠正减少语义错误,并引入句子级语义错误率(S^2ER)作为评估指标。
为每个行动投保:自主AI代理运行时精算控制的权威边界框架
机构 * Department of Risk Management and Insurance(风险管理与保险系)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool-use(abstract);agentic(abstract)
AI总结 提出精算行动接口(AAI)和权威边界框架,通过确定性运行时合约对自主AI代理的副作用行动进行定价、门控和评估,实现跨领域的精算控制与基准测试。
Comments 35 pages, 4 figures, 11 tables. Companion paper on the mathematical foundations: SSRN 6761960
LLM Agent工具调用流量中的内容感知攻击检测:特征、架构与评估协议的实证研究
机构 * Department of Computer Engineering, Duzce University(杜兹大学计算机工程系)
专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI、cs.LG
AI总结 针对MCP工具调用流量,提出基于图神经网络的攻击检测框架,通过内容嵌入和任务分离评估协议,实现AUROC超过0.89的检测性能,并揭示随机分割评估导致的高估问题。
Comments v2: renamed manuscript (brand removed; descriptive title). No changes to methodology, results, tables, or figures
可验证的代理基础设施:基于证明的授权机制用于主权AI系统
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);autonomous agent(abstract)
AI总结 本文提出Distributed Trust Framework,通过结构化可验证的艺术品计算执行权限,解决自主AI代理执行安全风险问题,实现授权过程的可验证、分布和可回放。
Comments 19 pager, 2 figures, 4 tables
上下文代理:非线性对话的动态 discourse 树
机构 * Shandong University(山东大学)
专题命中 Agent评测 :agent(title,summary_cn);分类 cs.AI、cs.CL
AI总结 本文提出 Context-Agent 框架,通过动态树结构建模对话历史,解决非线性对话中的上下文管理问题,并引入 NTM 评估基准,提升多轮对话任务完成率和效率。
Comments 14 pages, 7 figures, ACL 2026
AgentArch: 一种全面的基准,用于评估企业中的代理架构
机构 * ServiceNow
专题命中 Agent评测 :agent(title,abstract);function calling(abstract);agentic(abstract);multi-agent(abstract)
AI总结 AgentArch提出一个企业特定的基准,评估代理架构在复杂任务中的性能,揭示模型特定的架构偏好及性能瓶颈。
机构 * Independent Researcher(独立研究者)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)
机构 * Microsoft Health and Life Sciences(微软健康与生命科学)
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);workflow(abstract);multi-agent(abstract)
Comments 9 pages, 1 figure; Added missing co-authors and contributors
机构 * Huawei Company(华为公司) ; Cornell University(康奈尔大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);multi-agent(abstract)
Comments 18 pages, 3 figures, 3 tables, to be submitted to VLDB 2026 (PVLDB Volume 19)
大语言模型生成的GPU内核能否用于生产?基于追踪的基准测试与优化代理
机构 * Alibaba Group(阿里巴巴集团)
专题命中 Agent评测 :agent(title,summary_cn);分类 cs.AI
AI总结 研究大语言模型生成GPU内核用于生产的可行性,提出Atrex-Bench基准测试,发现现有模型表现不佳。为此发布Atrex-Kernel-Agent优化代理,结合多种技术,经案例研究能将回退转换为匹配或超越生产基线的内核。
Comments Both artifacts are released as open source: Atrex-Bench (https://github.com/alibaba/atrex-bench) and Atrex-Kernel-Agent (https://github.com/alibaba/atrex-kernel-agent)
Co-Director: 基于代理的生成视频叙事
机构 * Google(谷歌)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);multi-agent(abstract);分类 cs.AI
AI总结 本文提出Co-Director框架,通过分层多代理方法解决视频生成的语义一致性问题,引入分层参数化和多模态自优化循环,实现叙事策略探索与有效配置的平衡,通过GenAD-Bench验证其在个性化广告中的优越性。
Comments Project Page: https://co-director-agent.github.io/
专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);tool-use(abstract);workflow(abstract)
Comments Project report of AgentGuard in LLM Agent MOOC Hackathon hosted by UC Berkeley in 2024
基于小型语言模型的语言条件认知雷达自主智能体
专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract)
AI总结 本文提出一种小型语言模型驱动的自主智能体框架,作为语言条件认知雷达的智能控制器,经实验验证可在多种雷达场景下完成算法选择,且雷达特定提示与基于物理的工具执行是可靠决策的必要条件。
Comments Accepted at MLSP 2026, ATL, USA
ChatMuse:在混合现实中通过主动辅助人工智能代理支持面对面小团体对话体验
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)
AI总结 研究旨在解决面对面小团体对话有效支持信息的设计生成问题,提出ChatMuse系统,它能分析参与者线索并提供实时指导,利用用户行为反应改进支持能力,通过受试者内研究证明了该系统在协助小团体对话方面的可行性和有效性。
Comments 19 pages, 9 figures, 4 tables, Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), Detroit, MI, USA
VIGIL:AI代理技能中行为规范的运行时执行
专题命中 Agent评测 :agent(title,abstract);AI agent(title);agentic(abstract)
AI总结 提出VIGIL框架,通过符号策略语言将自然语言规范转化为SMT约束,实现代理系统跨技能行为策略的运行时监控,检测违规召回率>95%。
从代理身份到代理经济:衡量ERC-8004 AI代理的操作就绪度
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)
AI总结 本文通过分析以太坊上ERC-8004代理的数据,构建操作就绪度框架,发现早期采用以注册为主但操作浅层,身份层可见但元数据、服务、声誉和跨链证据有限,所有权和反馈活动高度集中,表明从代理身份到代理经济的转型尚未完成。
迈向可信的AI代理无线网络优化数字孪生:挑战、解决方案与机遇
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)
AI总结 本文提出一种新的数字孪生评估框架,用于确保AI代理基于网络优化的数字孪生的可信度,通过任务导向的评估方法减少训练和测试成本,同时保持部署性能。
LLM Agent 中阴谋行为的宪法黑盒监控
机构 * University of Cambridge(剑桥大学)
专题命中 Agent评测 :agent(title_cn,summary_cn);分类 cs.AI、cs.CL、cs.LG
AI总结 研究使用基于宪法黑盒的监控器,通过仅观察外部输入和输出检测LLM Agent的阴谋行为,并在合成数据上优化后泛化到更真实环境。
Comments Accepted at ICML 2026. Camera-ready version
基于活动理论的教师专业发展在教学人工智能代理设计中的应用
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)
AI总结 本研究通过两轮形成性干预,探讨教师在完成专业发展后为何失去创建AI代理的兴趣,并验证系统性设计能否解决这一问题,发现通过活动理论和自我决定理论的整合,可提升教师的能力与意愿。
Latent-Y:一种经过实验室验证的自主代理用于从头药物设计
专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);AI agent(abstract)
AI总结 Latent-Y通过自主执行抗体设计流程,结合生成模型Latent-X2,实现了高效药物设计,展示了在不同任务类型中的成功案例,并在实验室验证中达到高成功率。
Comments A.N. performed work as an advisor to Latent Labs. A.H. and D.Y. performed work while at Latent Labs