arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-25 至 2026-05-25 共收录 151 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 9 篇

2602.11243 2026-05-25 cs.LG cs.CL 62%

Evaluating Memory Structure in LLM Agents

评估LLM智能体中的记忆结构

Alina Shutova, Alexandra Olenina, Ivan Vinogradov, Anton Sinitsin

机构 * HSE University(莫斯科国立高等经济学院) Yandex YSDA New Economic School(新经济学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL、cs.LG

AI总结 提出StructMemEval基准测试,通过结构化记忆任务(如交易账本、待办事项列表、树结构等)评估LLM智能体组织长期记忆的能力,发现简单检索增强LLM难以胜任,而记忆智能体在提示下可解决,但现代LLM在无提示时无法自主识别记忆结构。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21198 2026-05-25 cs.DC cs.AI cs.LG 62%

ZipMoE: Efficient On-Device MoE Serving via Lossless Compression and Cache-Affinity Scheduling

ZipMoE:通过无损压缩和缓存亲和调度实现高效的设备端MoE服务

Yuchen Yang, Yaru Zhao, Pu Yang, Shaowei Wang, Zhi-Hua Zhou

机构 * School of Electronic Science and Engineering, Nanjing University, China.(南京大学电子科学与工程学院) National Key Laboratory for Novel Software Technology, Nanjing University, China.(南京大学新型软件技术国家重点实验室)

专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出ZipMoE系统,通过缓存-调度协同设计利用边缘设备硬件特性和MoE参数统计冗余,实现无损且高效的设备端MoE推理,显著降低延迟并提升吞吐量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22872 2026-05-25 cs.LG cs.AI cs.CV 62%

MedExpMem: Adapting Experience Memory for Differential Diagnosis

MedExpMem:适应经验记忆用于鉴别诊断

Qianhan Feng, Zhongzhen Huang, Yakun Zhu, Yannian Gu, Winnie Chiu Wing Chu, Xiaofan Zhang, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出MedExpMem经验记忆框架,通过存储和利用诊断失败中的判别经验,增强医学视觉语言模型的鉴别诊断能力,在放射学基准上最高提升7.0%准确率。

Comments MICCAI 2026 Early Accept. Submission Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23067 2026-05-25 cs.CL 57%

What Training Data Teaches RL Memory Agents: An Empirical Study of Curriculum Effects in Memory-Augmented QA

训练数据教会RL记忆体代理什么:记忆增强问答中课程效应的实证研究

Xinjie He, Zhiyuan Lin, Su Liu, Jialun Wu, Qiyang Xie, Weikai Zhou, Shuai Xiao

机构 * Columbia University(哥伦比亚大学) Independent Researcher(独立研究者) Johns Hopkins University(约翰霍普金斯大学) Northeastern University(东北大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.CL

AI总结 通过控制实验,研究训练课程(领域内、混合、领域外)对强化学习记忆体代理在记忆增强问答中的技能获取和专业化影响,发现课程组成作为专业化的细粒度杠杆,混合课程在整体F1上最优,而窄领域外课程可转移特定技能(如时间推理),并报告了将GRPO适配到单GPU环境的实用经验。

Comments 14 pages, 2 figures, 11 tables. Code, checkpoints, and evaluation artifacts available at https://github.com/EvaxHe/rl-memory-curriculum

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14300 2026-05-25 eess.SY cs.SY 50%

Distributed consensus-based observer design for target state estimation with bearing measurements

基于方位测量的分布式一致性观测器设计用于目标状态估计

Marcelo Jacinto, Pedro Trindade, Francisco Rego, Rita Cunha

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 针对任意阶积分器链建模的目标,提出一种分布式一致性观测器,利用方位测量和通信网络实现目标跟踪,并给出指数稳定性条件。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 22 篇

2605.11053 2026-05-25 cs.CR cs.AI cs.LG 88%

Content-Aware Attack Detection in LLM Agent Tool-Call Traffic: An Empirical Study of Features, Architectures, and Evaluation Protocols

LLM Agent工具调用流量中的内容感知攻击检测:特征、架构与评估协议的实证研究

Sultan Zavrak

机构 * Department of Computer Engineering, Duzce University(杜兹大学计算机工程系)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对MCP工具调用流量,提出基于图神经网络的攻击检测框架,通过内容嵌入和任务分离评估协议,实现AUROC超过0.89的检测性能,并揭示随机分割评估导致的高估问题。

Comments v2: renamed manuscript (brand removed; descriptive title). No changes to methodology, results, tables, or figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18859 2026-05-25 cs.LG cs.AI 81%

TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

TwinRouterBench:面向现实智能体LLM路由的快速静态与实时动态评估

Pei Yang, Wanyi Chen, Tongyun Yang, Pengbin Feng, Jiarong Xing, Wentao Guo, Yuhang Yao, Yuhang Han, Hanchen Li, Xu Wang, Zeyu Wang, Jie Xiao, Anjie Yang, Liang Tian, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Independent Researcher(独立研究者) University of Southern California(南加州大学) Rice University(Rice大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) University of the Chinese Academy of Sciences(中国科学院大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 提出TwinRouterBench基准,通过静态轨迹级前缀和动态智能体执行两轨,实现无需在线LLM评判的步骤级路由评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23899 2026-05-25 cs.AI 79%

From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills

从原始经验到技能消费:模型生成智能体技能的系统研究

Zisu Huang, Jingwen Xu, Yifan Yang, Ziyang Gong, Qihao Yang, Muzhao Tian, Xiaohua Wang, Changze Lv, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Xue Yang, Dongdong Chen, Xiaoqing Zheng, Chong Luo

机构 * Fudan University(复旦大学) Microsoft Research(微软研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文系统研究了模型生成技能在语言智能体中的全生命周期(经验生成、技能提取、技能消费),通过构建效用评估框架发现技能平均有益但存在负迁移,并提出了元技能以提升技能质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07801 2026-05-25 cs.CV cs.AI 79%

VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos

VideoTemp-o3:在智能视频思考中协调时间定位与视频理解

Wenqi Liu, Yunxiao Wang, Shijie Ma, Meng Liu, Qile Su, Tianke Zhang, Haonan Fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航) Southern University of Science and Technology(南方科技大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 提出VideoTemp-o3统一框架,通过联合建模视频定位与问答、设计统一掩码机制和专用奖励,解决长视频理解中采样效率低、定位弱和工作流僵化问题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03260 2026-05-25 cs.CE cs.CL 79%

SciNet: Evaluating AI Agents in Relation-Aware Scientific Literature Retrieval

SciNet: 评估关系感知科学文献检索中的AI代理

Chenyang Shao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University, Beijing, China(电子工程系、BNRist、清华大学、北京、中国) Zhongguancun Academy(中关村学院)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.CL

AI总结 针对现有检索代理难以理解论文间复杂关系网络的问题,提出首个关系感知数据集SciNet,通过三类任务系统评估代理,发现准确率低于20%,但下游综述质量提升25.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22114 2026-05-25 eess.SY cs.SY 78%

Bearing-Only Solution to the Fermat-Weber Location Problem for Unicycle Agent

独轮车代理的Fermat-Weber位置问题的纯方位解

Hong Liang Cheah, Mohammad Deghat, Jose Guivant

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对独轮车代理的非完整约束,提出纯方位控制律以解决Fermat-Weber位置问题,包括静止信标、饱和输入和移动信标情况,并通过仿真和实验验证有效性。

Comments This paper has been accepted for presentation at the 23rd IFAC World Congress

Journal ref 23rd IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22643 2026-05-25 cs.CL 74%

Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety

温水煮青蛙:面向智能体安全的多轮基准测试

Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Federico Sartore, Enrico Panai, Laura Caroli, Yue Zhu, Adam Leon Smith, Luca Nannini, Marcello Galisai, Susanna Cifani, Francesco Giarrusso, Marcantonio Bracale Syrnikov, Daniele Nardi

机构 * Icaro Foundation(Icaro基金会) Sapienza University of Rome(罗马萨皮恩扎大学) Sant’Anna School of Advanced Studies(圣安娜高级研究学校) Tongji University School of Law(同济大学法学院) AIQI Consortium(AIQI联盟) Università Cattolica del Sacro Cuore(圣心大学) Piccadilly Labs(皮卡迪利实验室) VU Amsterdam(阿姆斯特丹伏伊大学) Independent(独立)

专题命中 Agent评测 :agentic(title);分类 cs.CL

AI总结 提出一个多轮基准测试,评估工具使用AI模型在办公场景中对渐进式攻击的脆弱性,发现平均攻击成功率为44.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20896 2026-05-25 cs.CR cs.AI cs.LG 73%

GenAI-Driven Threat Detection with Microsoft Security Copilot

GenAI驱动的威胁检测与Microsoft Security Copilot

Scott Freitas, Amir Gharib

机构 * Microsoft Security Research(微软安全研究)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 提出动态威胁检测代理(DTDA),结合统一活动时间线、版本化LLM提示合同、规划器-执行器调查循环和动态告警生成,在Microsoft Security Copilot中实现持续、可解释的威胁检测,在线评估精确率80.1%,离线F1分数0.78。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23019 2026-05-25 cs.LG 70%

PACE: Two-Timescale Self-Evolution for Small Language Model Agents

PACE:小型语言模型代理的双时间尺度自我进化

Chen Ling, Pei Chen, Albert Guan, Jiaming Qu, Shayan Ali Akbar, Madhu Gopinathan, Erwin Cornejo

机构 * Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.LG

AI总结 提出PACE框架,通过双时间尺度协调低风险提示优化与高风险控制逻辑更新,使冻结的小型语言模型在无需权重更新或依赖前沿模型的情况下实现自主自我进化,在12个骨干-基准组合上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23215 2026-05-25 cs.LG cs.AI cs.CL 67%

FastKernels: Benchmarking GPU Kernel Generation in Production

FastKernels:生产中GPU内核生成的基准测试

Gabriele Oliaro, Yichao Fu, May Jiang, Owen Lu, Junli Wang, Zhihao Jia, Hao Zhang, Samyam Rajbhandari

机构 * Snowflake AI Research(Snowflake AI研究院) CMU(卡内基梅隆大学) UCSD(加州大学圣地亚哥分校) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对现有基准与生产推理框架脱节的问题,提出FastKernels基准,包含46个代表性架构,覆盖96.2%的HuggingFace Transformers架构,并作为生产级推理框架,评估显示最强代理仅实现0.94倍加速,揭示基准-生产错位是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23170 2026-05-25 cs.CL cs.AI cs.LG 67%

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

长上下文LLM中的位置失败:推理基准测试中的盲点

Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Central South University of Forestry and Technology(中央林业科技大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 通过提出上下文旋转评估(CRE)框架,系统控制任务位置、填充内容和上下文长度,揭示了长上下文推理基准测试中因任务位置变化导致的模型性能显著下降,并发现填充-答案干扰是主要错误模式。

Comments 20 pages, 1 figure, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22855 2026-05-25 cs.GT cs.AI cs.CL cs.LG 67%

PrefBench: Evaluating Zero-Shot LLM Agents in Hidden-Preference Personalized Pricing Negotiations

PrefBench:评估隐藏偏好个性化定价谈判中的零样本LLM智能体

Yingjie Lei

机构 * University of Aberdeen(阿伯丁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PrefBench基准,通过隐藏偏好模拟评估零样本LLM智能体在个性化定价谈判中的利润表现,发现LLM虽能达成高交易率但利润远低于简单启发式方法。

Comments 24 pages, 3 figures, 5 tables. Code is available at https://github.com/ChaosTheProducer/PrefBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23459 2026-05-25 cs.SE cs.AI 62%

AI Assurance: A Comprehensive Testing Strategy for Enterprise AI Systems

AI 保证:企业 AI 系统的综合测试策略

Chitra Badagi, Divye Singh, Animesh Sen, Adinath Shirsath

机构 * Thoughtworks Technologies(Thoughtworks技术公司)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 本文针对基于大语言模型、检索管道和自主代理的企业 AI 系统,提出了一种以持续风险降低为核心、将评估作为核心工程学科、并关注组织影响的综合保证策略,包括结构化的 AI 故障分类法、五层 AI 保证金字塔以及评估驱动开发、RAG 系统测试、模型生命周期管理和治理的操作指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00979 2026-05-25 cs.CR cs.AI cs.CL 62%

GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents

GradingAttack: 揭示基于LLM的教育评分代理中的安全漏洞

Xueyi Li, Zhuoneng Zhou, Zitao Liu, Yongdong Wu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) Jinan University(济南大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出GradingAttack框架,通过token级和prompt级对抗攻击策略,系统评估基于LLM的教育评分代理的安全漏洞,发现其缺乏鲁棒防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18000 2026-05-25 cs.LG cs.AI q-bio.PE 62%

Reward Engineering for Spatial Epidemic Simulations: A Reinforcement Learning Platform for Individual Behavioral Learning

空间流行病模拟中的奖励工程:个体行为学习的强化学习平台

Radman Rakhshandehroo, Daniel Coombs

机构 * Department of Computer Science University of British Columbia(计算机科学系,不列颠哥伦比亚大学) Department of Mathematics and Institute of Applied Mathematics University of British Columbia(数学系和应用数学研究所,不列颠哥伦比亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出ContagionRL平台,通过奖励函数设计系统评估空间流行病模拟中个体行为学习策略,发现势场奖励方法能有效提升非药物干预依从性和空间规避策略。

Comments 38 pages, 15 figures and 18 tables; Accepted to TMLR. OpenReview: https://openreview.net/forum?id=yPEASsx3hk

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11759 2026-05-25 cs.AI 57%

Retrieval Is Not Enough: Why Organizational AI Needs Epistemic Infrastructure

检索是不够的:为什么组织AI需要认知基础设施

Federico Bottino, Carlo Ferrero, Nicholas Dosio, Pierfrancesco Beneventano

机构 * Kakashi Ventures Accelerator (KVA)(Kakashi Ventures加速器) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本文提出OIDA框架,通过类型化知识对象、知识重力引擎和问题原语,解决组织AI中检索系统缺乏认知结构的问题,并引入认知质量评分(EQS)进行评估。

Comments 10 pages, 2 figures, 8 tables, 6 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23311 2026-05-25 cs.AI 57%

DART: Semantic Recoverability for Structured Tool Agents

DART:结构化工具代理的语义可恢复性

Ke Yang, Panpan Li, Zonghan Wu, Kejin Xu, Huaxi Huang, Xiaoshui Huang

机构 * MOS Intelligent Connectivity Technology Co. Ltd.(MOS智能连接技术有限公司) Sichuan Vocational College of Post and Telecom(四川邮电职业技术学院) East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对结构化工具代理执行失败时局部恢复可能破坏下游已提交工作的语义一致性问题,提出DART运行时系统,通过形式化语义可恢复性并实施可接受性检查,在依赖和效果约束下选择安全的恢复点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02239 2026-05-25 cs.RO cs.AI 57%

LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation

LACY: 基于视觉-语言模型的语言-动作循环用于自我改进的机器人操作

Youngjin Hong, Houjian Yu, Mingen Li, Changhyun Choi

机构 * Department of Electrical and Computer Engineering, Univ. of Minnesota(电气与计算机工程系,明尼苏达大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出LACY框架,通过联合学习语言到动作、动作到语言和语言一致性验证三个任务,实现机器人操作的自我改进,平均任务成功率提升56.46%。

Comments Accepted to ICRA 2026. Project page: https://vla2026.github.io/LACY/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06858 2026-05-25 physics.soc-ph cs.AI nlin.AO 57%

Disentangling Interaction and Bias Effects in Opinion Dynamics of Large Language Models

大型语言模型中意见动态的交互与偏差效应的分离

Vincent C. Brockers, David A. Ehrlich, Viola Priesemann

机构 * Max-Planck-Institute for Dynamics and Self-Organization(马克斯·普朗克动态与自组织研究所) Institute for the Dynamics of Complex Systems(复杂系统动力学研究所) University of Göttingen(哥廷根大学) Campus Institute for Dynamics of Biological Networks(校园生物网络动力学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出贝叶斯框架分离主题偏差、同意偏差和锚定偏差,分析LLM在多步对话中的意见轨迹,发现意见快速收敛至共享吸引子,且微调可改变吸引子位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03784 2026-05-25 cs.LG 57%

Insulin Resistance Prediction From Wearables and Routine Blood Biomarkers

从可穿戴设备和常规血液生物标志物预测胰岛素抵抗

Ahmed A. Metwally, A. Ali Heydari, Daniel McDuff, Alexandru Solot, Zeinab Esmaeilpour, Anthony Z Faranesh, Menglian Zhou, David B. Savage, Conor Heneghan, Shwetak Patel, Cathy Speed, Javier L. Prieto

机构 * Google Research(谷歌研究) Institute of Metabolic Science, University of Cambridge(剑桥大学代谢科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究利用可穿戴设备时间序列数据和血液生物标志物,通过深度神经网络模型预测胰岛素抵抗,在最大规模远程招募数据集上实现了优于单一数据源的性能,并展示了模型在肥胖和久坐人群中的高灵敏度及可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23629 2026-05-25 cs.CV 50%

DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs

DDX-TRACE: 视觉语言模型中医学诊断轨迹的基准

Jiazhen Pan, Weixiang Shen, Jun Li, Julian Canisius, Felix Bitzer, Paula Roßmüller, Jiancheng Yang, Virginie Kreutzinger, Daniel Rueckert, Benedikt Wiestler

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) Munich Center for Machine Learning(慕尼黑机器学习中心) LMU Munich(慕尼黑大学) Aalto University(阿尔托大学) Imperial College London(伦敦帝国学院)

专题命中 Agent评测 :planning(abstract)

AI总结 提出DDX-TRACE基准,通过隐藏证据的多轮诊断轨迹评估VLM在神经放射学中的工作流质量,揭示最终诊断分数无法反映的推理缺陷。

Comments 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23187 2026-05-25 cs.CV cs.RO 50%

IntentionNav: A Benchmark for Intent-Driven Object Navigation from Implicit Human Instruction

IntentionNav: 一种基于隐式人类指令的意图驱动目标导航基准

Lin Qian, Shijie Li, Sihao Lin, Xuan Zhang, Bangya Liu, Yanran Li, Hujun Yin

机构 * The University of Manchester(曼彻斯特大学) A*STAR Responsible AI Research Centre, Adelaide University(阿德莱德大学负责任人工智能研究中心) University of Bedfordshire(贝福德郡大学)

专题命中 Agent评测 :agent(abstract)

AI总结 提出IntentionNav基准,通过隐式人类指令(如“我需要热一下食物”)驱动智能体推断目标物体并导航至其位置,实验表明当前模型在终端成功率和精确定位方面存在显著瓶颈。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他Agent 4 篇

2605.23179 2026-05-25 cs.AI 79%

Redrawing the AI Map: A Theory of Accountability Boundaries in Agentic Ecosystems

重绘AI地图:代理生态系统中责任边界的理论

Muhammad Zia Hydari, Farooq Muzaffar

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI

AI总结 本文提出一种能力层面的理论,通过引入责任资产、验证成本和责任可转移性等概念,解释在代理生态系统中何时执行边界与责任边界可以分离,并识别出组件、集成和双轨三种边界策略及规则债务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23426 2026-05-25 cs.HC cs.AI 70%

Socially fluent AI decouples conversational signals from source identity in online interaction

社交流畅的AI在在线互动中解耦对话信号与来源身份

Lixiang Yan, Yueqiao Jin, Xibin Han, Dragan Gašević

机构 * School of Education, Tsinghua University(清华大学教育学院) Faculty of Information Technology, Monash University(墨尔本大学信息技术学院) Faculty of Education, The University of Hong Kong(香港大学教育学院)

专题命中 其他Agent :AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究通过同步文本群组交互实验,发现社交流畅的AI代理使人类无法高于随机水平区分AI与人类队友,且这种失败源于参与者依赖与真实身份弱相关的怀疑启发式,而非缺乏身份相关信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02087 2026-05-25 cs.AI 57%

Model Spec Midtraining: Improving How Alignment Training Generalizes

模型规范中期训练:改进对齐训练的泛化能力

Chloe Li, Nevan Wichers, Sara Price, Samuel Marks, Jon Kutasov

机构 * Anthropic

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 提出模型规范中期训练(MSM),通过在预训练后、对齐微调前用合成文档训练模型学习规范内容,从而引导模型从后续演示数据中泛化,有效降低代理失调率并提升对齐泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏