arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-16 至 2026-07-16 共收录 161 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 10 篇

2607.13981 2026-07-16 cs.LO cs.FL 新提交 78%

Agent-Alternation-Free Epistemic Metric Temporal Logic with Past: Model Checking and Complexity

带过去时态的无主体交替认知度量时态逻辑:模型检查与复杂性

Benedikt Bollig, Matthias Függer, Thomas Nowak, Paul Zeinaty

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 研究带过去时态的无主体交替认知度量时态逻辑的模型检查,通过结合时态测试自动机与完美回忆观察者进行分析,证明其模型检查为EXPSPACE完全,给出了该逻辑在特定条件下的复杂性结论。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13602 2026-07-16 cs.CL cs.LG stat.ML 新提交 62%

Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight Analysis

类比深度研究:检索和整合历史类比以进行前瞻性分析

Yongqiang Chen, Guangyi Chen, Yuewen Sun, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出类比深度研究(ADR)任务及ADR-bench,发现LLM智能体找类比能力差。基于理论分析提出ADR原则,构建因果类比研究者(CANA)框架,提升历史类比生成效果,超越现有智能体,案例研究证实其利用历史类比的有效性。

Comments Ongoing project

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13475 2026-07-16 cs.RO cs.LG 新提交 57%

Deformable State Estimation for Autonomous Surgical Tissue Retraction Under Partial Observability

部分可观测性下自主手术组织牵开的可变形状态估计

Everest Yang, Skye Thompson, George D. Konidaris

机构 * Brown University(布朗大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.LG

AI总结 研究部分可观测下自主手术组织牵开的可变形状态估计问题,提出结合多层感知器与低维PCA潜在表示、用几何感知正则化训练的状态估计器,在二维模拟中评估,结果显示该估计器在多步牵开中性能良好,能支持有效可变形操作。

Comments Accepted to the ICRA 2026 RASEI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12924 2026-07-16 cs.AI 版本更新 57%

Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes

用于参数化动作马尔可夫决策过程的知识与梯度引导强化学习

Jonas Ehrhardt, René Heesch, Oliver Niggemann

机构 * HSU-AI Institute for Artificial Intelligence(HSU人工智能研究所)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究参数化动作马尔可夫决策过程中的强化学习,提出KGRL算法,利用领域知识修剪动作、约束参数空间,结合梯度细化参数,能提供局部解释并提高样本效率,优于现有强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13798 2026-07-16 cs.CY cs.HC 新提交 50%

Persona Migration and Expectation Recalibration in Generative AI Adoption: A Longitudinal Study at a State Department of Transportation

生成式人工智能应用中的角色迁移与期望重新校准:对某州交通运输部的纵向研究

Omidreza Shoghli, Fatemeh Banani Ardecani, Amin Mohamadi Hezaveh

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 研究某州交通运输部对Microsoft 365 Copilot的采用,通过匹配两波调查等方法,发现使用后感知有用性下降,确定三种基线角色及迁移情况,提出公共部门人工智能采用应动态监测并提供针对性支持,给出员工异质性跟踪框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13067 2026-07-16 cs.RO 新提交 50%

A 3DGS-Driven Dynamic Viewpoint and Vibrotactile Framework for Subsea Teleoperation Validated via fNIRS

一种由 3DGS 驱动的用于水下遥操作的动态视点和振动触觉框架,并通过功能近红外光谱法进行验证

Fang Xu, Tianyu Zhou, Ruitong Tian, Md Jahidul Islam, Jing Du

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 研究针对水下遥操作受限于二维视图和通信延迟的问题,提出基于 ROS - Unity 框架的多模态架构,用 3DGS 驱动的 DAVS 及振动触觉套装辅助,经实验验证该方式能提升操作员性能与认知耐力。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08448 2026-07-16 cs.RO 版本更新 50%

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

利用VLA:通过记忆引导智能体将冻结的视觉语言动作模型转化为可靠的操作原语

Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

机构 * Tsinghua University(清华大学) Striding AI(驰行人工智能公司) Purdue University(普渡大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Infinigence AI(英飞智研人工智能公司) Zhongguancun Academy(中关村学院) Hong Kong University of Science and Technology(香港科技大学)

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 研究语言条件下操作问题,提出Harness VLA框架,将冻结VLA与分析原语库结合,通过学习操作范围扩展预训练VLA,在多种扰动操作任务中相比基线有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05463 2026-07-16 q-bio.NC 版本更新 50%

Governable Individuals: An Identity Layer for Embodied Agents That Keep Learning

可治理个体:用于持续学习的具身智能体的身份层

Xue Qin, Simin Luan, Cong Yang, Zhijun Li

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究具身人工智能中持续智能体的治理问题,提出可治理个体概念,其能力可变,权限等只能通过特定签名生命周期转换扩展,经测试发现仅学习判断和行为测试不足,需架构性承载层,还介绍了相关抽象概念、机制及开放问题。

Comments Perspective paper. Companion technical report with proofs and empirical evaluation to be posted separately on arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 31 篇

2607.13104 2026-07-16 cs.AI cs.CL cs.LG 新提交 85%

Self-Improvements in Modern Agentic Systems: A Survey

现代智能系统中的自我改进:一项综述

Zhe Ren, Yimeng Chen, Dandan Guo, Guowei Rong, Tonghui Li, R. B. Xiong, Qingfeng Lan, Wenyi Wang, Li Nanbo, Yibo Yang, Mingchen Zhuge, Jürgen Schmidhuber

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Alberta(阿尔伯塔大学) The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI)

专题命中 Agent评测 :agentic(title);agent(abstract,comments);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 综述现代自我改进智能体从研究走向部署,目标是经验驱动的可控进化。提出系统级框架,将智能体视为基础模型与操作支架的耦合配置,自我改进形式化为更新算子,还组织回顾了相关工作、应用、评估等内容并展望未来。

Comments 97 pages, 12 figures. Project page: https://selfimproving-agent.github.io/ Repository: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14004 2026-07-16 cs.AI cs.CL cs.LG 新提交 82%

Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0

智能体优化器的效果会叠加吗?基于终端基准测试2.0的持续学习评估

Wenxiao Wang, Priyatham Kattakinda, Soheil Feizi

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究智能体优化器收益是否叠加的问题,通过基于终端基准测试2.0的两阶段持续学习评估,比较GEPA、Meta Harness和RELAI-VCL三种方法,发现仅RELAI-VCL能使优化收益叠加,因其在优化循环中内置回归控制。

Comments Technical Report by RELAI (relai.ai)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13792 2026-07-16 cs.CV 新提交 82%

EgoProceVQA: A Novel Egocentric Procedural Understanding Task with Self-Skill-Exploration Agent

EgoProceVQA:一种具有自我技能探索代理的新型自我中心程序理解任务

Junlong Li, Junxi Li, Yuxiang Yang, Wenbin Zou, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract)

AI总结 研究针对现有自我中心视频理解评估忽视程序理解的问题,引入EgoProceVQA任务,开发EgoProceGen数据生成平台并构建基准。通过评估发现模型不足,进而提出EgoProceAgent框架,设计相关工具库,使其在多任务上获最优性能,为该任务奠定统一基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11999 2026-07-16 cs.CY 版本更新 82%

Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack

承保智能体经济:人工智能保险堆栈蓝图

Cristian Trout, Sanmi Koyejo, Sasha Romanosky, Giorgio Ripamonti, Lynn Thompson, Desiree Spain, Alex Taylor, Kevin Casey, Stephen Casper, Matthew Botvinick, Sean McGregor, Miles Brundage, A. Feder Cooper, Patricia Paskov, Adrien Ecoffet, Ben Bucknall, Kevin Wei, Markus Anderljung, Lukasz Szpruch, Bri Treece, Tom Zick, Gabriel Weil, Ugur Ozer, Kevin Kalinich, Jesus Gonzalez, Vitaly Baranov, Moran Koren, Guy Laban, Gil Arazi, Henri Winand, Derek Blum, Toby Clowes, Adam Kleinman, Anita Srinivasan, Tom Fehring, Rune Kvist, Rajiv Dattani

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)

AI总结 研究人工智能智能体经济下保险面临的风险及可保性问题,提出构建含八个组件的人工智能保险堆栈,通过行业协调实现限额承保,还探讨了前沿人工智能灾难性风险承保及所需工具,以助保险公司管理相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13172 2026-07-16 cs.AI cs.LG 新提交 81%

Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models

通过世界模型从人类偏好和理由中学习安全智能体行为

Ilias Kazantzidis, Timothy J. Norman, Yali Du, Christopher T. Freeman

机构 * University of Southampton(南安普顿大学) King’s College London(伦敦国王学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在环境未知且无合适奖励函数时安全训练与部署智能体策略的问题,提出DROPJ方法,先学习世界模型,由人类在其中生成模拟轨迹并给出偏好及理由,据此训练奖励模型用于部署,实验表明该方法可降低训练成本、提升部署性能及安全性。

Comments 42 pages, 18 figures. Extended version of a paper presented at ICAART 2026; submitted for consideration in the ICAART 2026 post-publication selected-papers volume in Lecture Notes in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10057 2026-07-16 quant-ph cs.AI cs.CV cs.LG 交叉投稿 81%

Quantum Circuit Vision: Cost-Aware Evaluation of Visual AI Agents for Quantum Code Generation

量子电路视觉:用于量子代码生成的视觉人工智能代理的成本感知评估

Dongping Liu, Aoyu Zhang, Luyao Zhang

机构 * Amazon Web Services(亚马逊网络服务) Duke Kunshan University(杜克昆山大学)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究人工智能代理对量子电路图的理解及代码生成成本,提出量子电路视觉评估框架,构建基准并评估模型,发现中级模型在成本-准确性上平衡最佳,电路深度是失败主因,提出级联路由策略并开源数据集及代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13940 2026-07-16 cs.AI 新提交 79%

A Self-Evolving Agent for Longitudinal Personal Health Management

一种用于纵向个人健康管理的自我进化智能体

Haoran Li, Jiebi Deng, Tong Jin, Jinghong Han, Yuxin Wang, Zexin Wang, Qingyi Si, Weikang Gong, Xiahai Zhuang, Jia You, Wei Cheng, Jianfeng Feng, Hongcheng Guo

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) School of Life Sciences, Beijing University of Chinese Medicine(北京中医药大学生命科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) JD.com, Inc.(京东公司) Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, Fudan University, Ministry of Education(复旦大学计算神经科学与类脑智能教育部重点实验室) Department of Neurology, Huashan Hospital, Fudan University(复旦大学附属华山医院神经内科)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对多数健康AI系统孤立处理请求的问题,开发开源智能体架构HealthClaw,通过自我进化更新支持,经合成基准和生物医学任务评估,在准确率、隐私性及任务指标增益上表现出色,支持纵向个人健康智能体的自我进化记忆。

Comments 20 pages, 4 figures, 6 supplementary tables. Code: https://github.com/HC-Guo/HealthClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13370 2026-07-16 cs.CY cs.AI cs.HC 新提交 79%

Learning Engagement Assistant (LEA): Cross-Course Scalability and Classroom Evaluation of an Agentic AI Tutoring System

学习参与助手(LEA):智能AI辅导系统的跨课程可扩展性与课堂评估

Teri Rumble, Javad Zarrin, P. George Lovell, Ruth Falconer

机构 * Faculty of Design, Informatics and Business(设计、信息学与商业学院)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究LEA智能AI辅导系统,首次在真实学生中进行课堂部署并测试跨课程可扩展性,发现模拟与实际有差异,基于RAGAS评估答案相关性等指标,表明编排层无需改,下游组件课程无关性待进一步研究。

Comments Extended version of a paper presented at ICAART 2026. Manuscript under review at SN Computer Science (Springer). 32 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13693 2026-07-16 cs.MA cs.AI cs.SI physics.soc-ph 新提交 79%

Social Simulations: from Agent-Based Modeling to Digital Twins

社会模拟:从基于主体的建模到数字孪生

Erica Cau, Andrea Failla, Valentina Pansanella, Giulio Rossetti

机构 * Department of Computer Science, University of Pisa(皮萨大学计算机科学系) ISTI-CNR(意大利国家研究委员会信息与系统研究所)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 探讨社会模拟从基于主体建模到数字孪生的演变,阐述了各阶段范式的方法论基础、应用等,强调从抽象模型到特定社会系统逼真计算表示的转变。

Comments Entry for Encyclopedia of Social Network Analysis and Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13987 2026-07-16 cs.CR 新提交 78%

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

智能体技能安全:威胁模型、攻击、防御与评估

Sanket Badhe, Priyanka Tiwari

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13396 2026-07-16 cs.AI cs.CL cs.SE 新提交 75%

Set-shifting Behavioral Test for Harnessed Agents

用于受约束智能体的集合转移行为测试

Ziwei Ye

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究当可靠工具在会话中悄然改变时语言模型智能体的工具选择,借鉴认知心理学的集合转移构建基准和评估框架,计算集合转移准确率,测试发现不同失败模式及集合框架对路由动态有影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11619 2026-07-16 cs.AI 版本更新 72%

When Agents Disagree With Themselves: Behavioral Consistency as an Uncertainty Signal for LLM Agents

当智能体与自身意见相左:测量基于LLM的智能体的行为一致性

Aman Mehta

机构 * Aman Mehta

专题命中 Agent评测 :agentic(abstract,comments);agent(abstract);分类 cs.AI

AI总结 研究发现基于LLM的智能体在相同任务上运行结果不一致,且这种不一致与任务成功率密切相关,通过监控行为一致性可提升智能体可靠性。

Comments Accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems. 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13465 2026-07-16 cs.CL cs.AI cs.HC cs.MA cs.SE 新提交 67%

DevicesWorld: Benchmarking Cross-Device Agents in Heterogeneous Environments

DevicesWorld:异构环境中跨设备智能体的基准测试

Huatao Li, Xinwei Geng, Yuheng Wang, Yutong Li, Runde Yang, Hantao Chen, Shu Yao, Jingru Fan, Xuhui Ren, Yuanyuan Zhao, Fei Huang, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Honor Device Co., Ltd(荣耀终端有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究针对智能体跨设备协同操作难评估的问题,引入DevicesWorld基准测试,整合多类设备环境及众多任务,通过固定评估集评估五个前沿智能体系统,发现成功率低,为可靠跨设备智能体研究提供了可执行、可重现及有诊断作用的评估。

Comments https://github.com/AgenticOrgLab/DevicesWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13190 2026-07-16 physics.ed-ph 新提交 67%

Reliable isomorphic physics problem generation with large language models

基于大语言模型的可靠同构物理问题生成

Xian Wu, Lindim Ismaili

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 研究利用大语言模型代理工作流程生成同构物理问题,通过结合提示链等技术,在公共网站实现。开发评分标准并测试,89%生成问题可直接用,虽有局限,但显示出基于LLM系统在教学问题生成上的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13618 2026-07-16 cs.AI cs.LG 新提交 62%

STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle

库存盘点:使用公平预言机测量大语言模型智能体中感知与行动之间的差距

Sagar Deb, Ashwanth Krishnan

机构 * QpiAI

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型智能体在多周决策任务中的知行差距,提出库存盘点基准,通过公平参考策略区分感知与行动失败,测量知行差距两方向,为评估大语言模型智能体提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13041 2026-07-16 cs.CY cs.AI cs.LG cs.MM 新提交 62%

LessonBench-V1: A Benchmark Dataset for Evaluating AI Lesson Generation Agents

LessonBench-V1:用于评估人工智能课程生成代理的基准数据集

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, UK(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国) Department of Physics and Mathematics, Nottingham Trent University, Nottingham, UK(物理与数学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对无标准化基准评估人工智能课程生成系统的问题,引入LessonBench-V1基准数据集,其含人工编写课程与逆向工程课程计划,经人工审核并综合多种教学方法生成,可系统评估相关代理,还提出三维评估管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21688 2026-07-16 cs.LO cs.LG 版本更新 57%

A-IC3: Learning-Guided Adaptive Inductive Generalization for Hardware Model Checking

A-IC3:用于硬件模型检查的学习引导自适应归纳泛化

Xiaofeng Zhou, Guangyu Hu, Hongce Zhang, Wei Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对IC3算法在硬件模型检查中归纳泛化策略固定的问题,提出基于机器学习的轻量级框架,利用多臂赌博机算法动态选择策略,经实验验证该方法能有效提升rIC3解决案例数量及PAR-2分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14001 2026-07-16 cs.LG 新提交 57%

Lyapunov Exponent as Physics-Informed Dense Reward: RL Discovery of Stabilization Beyond the Kapitza Pendulum

李雅普诺夫指数作为物理信息密集奖励:强化学习发现超越卡皮察摆的稳定方法

Slava Andrejev

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究针对强化学习中稳定垂直运动倒立摆的问题,提出将李雅普诺夫特征指数作为密集奖励信号,智能体借此成功找到卡皮察摆振荡运动并抑制摆动,让摆处于直立位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13621 2026-07-16 cs.AI 新提交 57%

UESF-Bench: Benchmarking and Probing for Unified Embodied Seeking and Following

UESF-Bench:统一的具身寻找与跟随的基准测试与探究

Kun Yu, Jianhua Yang, Yixiang Chen, Changwei Wang, Hongyuan Yu, Yan Huang, Fushuo Huo, Ya Jing, Zhumin Chen, Keji He

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Qilu University of Technology(齐鲁工业大学) Xiaomi Inc(小米公司) Beijing University Of Technology(北京工业大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对现有具身智能体语言引导人类跟随基准测试的局限,引入UESF-Bench基准,提出SeekFollow-VLA框架,可处理语义引导探索等任务,实验显示该框架在单人和多人环境中比基线有明显改进,为统一具身寻找与跟随建立基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13056 2026-07-16 cs.RO cs.LG 新提交 57%

HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration

HRIBench:以交互为中心的人机协作基准测试

Chang Liu, Jiawei Zhang, Tao Zhang, Ye Wang, Hongyu Zhou, Qin Jin

机构 * Renmin University of China(中国人民大学) Beijing Normal University(北京师范大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究针对当前VLA基准未充分考量人机交互结构的问题,引入HRIBench基准,它以结构化场景脚本定义协作任务与交互角色,含多项可解释指标。通过实验表明该基准能暴露机器人策略局限,提升协作性能,推动以交互为中心的机器人学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24152 2026-07-16 cs.CV cs.LG 版本更新 57%

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

具有反事实可控性的自主视频生成用于自进化世界模型

Xin Wang, Wenxuan Liu, Tongtong Feng, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出反事实可控性是自进化世界模型的关键,通过自主视频生成实现可控性,使模型能测试动作后果并反馈改进生成。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04365 2026-07-16 cs.LG 版本更新 57%

Survival Dynamics of Neural and Programmatic Policies in Evolutionary Reinforcement Learning

进化强化学习中神经策略与编程策略的生存动态

Anton Roupassov-Ruiz, Yiyang Zuo

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究进化强化学习中神经策略与编程策略的生存动态,通过开源重新实现经典测试平台并进行严格生存分析,发现编程策略在生存性能上超越神经策略,如PERL比NERL平均多存活201.69步。

Comments Remove the Acknowledgement

详情

展开后加载摘要…

URL PDF HTML 收藏