arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-26 至 2026-05-26 共收录 136 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 5 篇

2605.24805 2026-05-26 cs.CV 77%

Fishbone: From One 3D Asset to a Million Controllable Edits

Fishbone: 从一个3D资产到百万可控编辑

Yumeng He, Xiaoying Wang, Peihao Li, Yanjia Huang, Joe Masterjohn, Jiajun Wu, Leonidas Guibas, Yin Yang, Ying Jiang, Chenfanfu Jiang

机构 * UCLA(加州大学洛杉矶分校) USC(南加州大学) UC Berkeley(加州大学伯克利分校) TRI(技术研究院) Stanford(斯坦福大学) Utah(犹他大学)

专题命中 机器人学习 :robotics(abstract);robot learning(abstract);embodied AI(abstract);分类 cs.CV

AI总结 提出一种统一的脊-肋表示方法Fishbone,支持通用网格的可控参数化变形、降阶动力学和动画,并构建了Fishbone-136K数据集,应用于可控3D生成、机器人学习数据增强等任务。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23987 2026-05-26 cs.AI cs.RO 76%

Beyond Predefined Learning Objects: A Thinking-Learning Interaction Model for Up-to-Date Autonomous Robot Learning

超越预定义学习对象:面向最新自主机器人学习的思维-学习交互模型

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(成都信息科技大学计算机学院)

专题命中 机器人学习 :robot learning(title);分类 cs.RO、cs.AI

AI总结 针对自主机器人在开放环境中无法依赖预定义学习对象的问题,提出一种思维-学习交互模型,通过思维指导学习(识别变化、选择证据、组织训练、规划验证)和学习促进思维(更新知识、经验、策略、推理)的双向机制,实现输入特征发现、输出类别扩展、模型更新和动作例程重构,实验验证了模型在特征适应、新类别形成、模型更新和动作优化上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06218 2026-05-26 cs.RO 70%

Few-Shot Neural Differentiable Simulator: Real-to-Sim Rigid-Contact Modeling

少样本神经可微模拟器:真实到模拟的刚体接触建模

Zhenhao Huang, Siyuan Luo, Bingyang Zhou, Ziqiu Zeng, Jason Pho, Fan Shi

机构 * National University of Singapore(新加坡国立大学) Prana Lab(Prana实验室)

专题命中 机器人学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种结合解析公式物理一致性与图神经网络表示能力的少样本真实到模拟方法,通过少量真实数据校准解析模拟器生成大规模合成数据集,并引入基于网格的图神经网络隐式建模刚体前向动力学及碰撞检测的代理梯度,实现完全可微性,从而提升模拟保真度和策略学习效率。

Comments Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25326 2026-05-26 cs.CV 57%

Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation

感知-然后-规划:以布局为策略的单目3D场景布局估计

Junwei Zhou, Yu-Wing Tai

机构 * Department of Computer Science(计算机科学系) Dartmouth College(达特茅斯学院)

专题命中 机器人学习 :manipulation(abstract);分类 cs.CV

AI总结 提出Perceive-then-Plan框架,通过视觉语言模型将单目3D布局估计转化为感知与迭代规划问题,以布局为策略(LaP)学习动作序列逐步优化场景假设,生成更物理一致且与观测对齐的3D布局。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24922 2026-05-26 cs.RO 57%

MuJoCoUni:Persistent Batched Runtime Primitives for MuJoCo

MuJoCoUni:MuJoCo的持久化批处理运行时原语

Yufei Jia, Junzhe Wu

机构 * Tsinghua University(清华大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 提出MuJoCoUni,一个用于在线机器人学习和批处理物理评估的MuJoCo下游发行版,通过BatchEnvPool提供有状态环境执行的运行时原语,支持高吞吐并行执行并保持上游语义。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 35 篇

2605.25077 2026-05-26 cs.CV 92%

WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models

WorldCraft: 从相机导航到交互式视频世界模型中的物体操控

Bohai Gu, Taiyi Wu, Yueyang Yuan, Jian Liu, Xiaocheng Lu, Dazhao Du, Jie Zhang, Jinxiang Lai, Shuai Yang, Xiaotong Zhao, Alan Zhao, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) AI Technology Center, Tencent Video, Tencent(腾讯视频AI技术中心,腾讯) Wuhan University(武汉大学) Peking University(北京大学)

专题命中 机器人操作 :manipulation(title,abstract);navigation(title,abstract);world model(title,abstract);分类 cs.CV

AI总结 提出WorldCraft框架,通过轨迹控制管道(NWT、SP-LoRA、TASP)将交互式视频世界模型从相机导航扩展到物体级轨迹操控,实现用户指定路径下的物体运动与相机导航共存。

Comments Project page: https://nevsdev.github.io/WorldCraft/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25829 2026-05-26 cs.RO cs.AI 88%

OASIS: Observation-Action Space Alignment via SE(3) Trajectory Prediction for Robotic Manipulation

OASIS: 通过SE(3)轨迹预测实现机器人操作中的观测-动作空间对齐

Xinzhe Chen, Sihua Ren, Liqi Huang, Haowen Sun, Mingyang Li, Xingyu Chen, Zeyang Liu, Xuguang Lan

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 提出OASIS视觉运动策略,通过SE(3)末端执行器轨迹预测对齐中间表示与动作空间,在仿真和真实实验中优于VLA和WAM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02037 2026-05-26 cs.RO cs.AI 88%

VILAS: A VLA-Integrated Low-cost Architecture with Soft Grasping for Robotic Manipulation

VILAS:一种集成软抓取的VLA低成本机器人操作架构

Zijian An, Hadi Khezam, Bill Cai, Ran Yang, Shijie Geng, Yiming Feng, Yue Zheng, Lifeng Zhou

机构 * Drexel University(德雷塞尔大学) Virginia Seafood Agricultural Research and Extension Center(弗吉尼亚海鲜农业研究与推广中心) Amazon Store Foundation AI (SFAI)(亚马逊商店基金会人工智能(SFAI))

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 提出VILAS低成本模块化机器人操作平台,集成软抓取机构,支持端到端VLA策略学习与部署,并在葡萄抓取任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17057 2026-05-26 cs.RO 88%

RoboManipBaselines: A Unified Framework for Imitation Learning in Robotic Manipulation across Real and Simulation Environments

RoboManipBaselines:面向真实与仿真环境的机器人操作模仿学习统一框架

Masaki Murooka, Tomohiro Motoda, Ryoichi Nakajo, Hanbit Oh, Koshi Makihara, Keisuke Shirai, Tetsuya Ogata, Yukiyasu Domae

机构 * Artificial Intelligence Research Center, National Institute of Advanced Industrial Science and Technology (AIST)(日本国家先进工业科学技术研究院人工智能研究中心) CNRS-AIST JRL (Joint Robotics Laboratory), IRL(法国国家科学研究中心与日本AIST联合机器人实验室) Institute for AI and Robotics, Future Robotics Organization, Waseda University(早稻田大学未来机器人组织人工智能与机器人研究所) AI Robot Association (AIRoA)(人工智能机器人协会)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 提出RoboManipBaselines开源框架,统一支持仿真和真实环境下的机器人操作模仿学习全流程,包括数据收集、策略训练和部署,并通过基准测试和研究应用验证其有效性。

Comments Added a Limitations section in response to comments from reviewers

Journal ref IEEE Access 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25547 2026-05-26 cs.RO cs.CV 87%

TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation

TapSampling:基于任务进度理解验证器的推理时采样方法用于机器人操作

Sizhe Zhao, Shengping Zhang, Shuo Yang, Weiyu Zhao, Shuigen Wang, Xiangyang Ji

机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) Harbin Institute of Technology (Weihai) Qingdao Research Institute, China(哈尔滨工业大学(威海)青岛研究院,中国) Iray Technology co., Ltd., Shandong, China(Iray科技有限公司,山东,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 机器人操作 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.CV

AI总结 提出TapSampling框架,通过Action-VAE在低维潜空间采样候选动作,并利用任务进度预测验证器选择最优动作,无需微调即可提升多种通用策略的性能。

Comments ICML 2026. Project Page: https://aipixel.github.io/TapSampling/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25495 2026-05-26 cs.RO cs.CV 84%

RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation

RepSAM: 通过表示引导的适应连接基础模型与机器人视觉

Wenhui Chu

机构 * Department of Computer Science and Engineering, Texas A&M University(计算机科学与工程系,德克萨斯大学阿马尔科分校)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV;robotics(comments)

AI总结 针对基础模型在非结构化机器人视觉场景中性能下降的问题,提出RepSAM框架,通过CKA引导的秩分配策略和多模态融合模块实现参数高效微调,在减少158倍可训练参数的同时达到全微调97.9%的性能。

Comments Accepted to IJCAI-ECAI 2026 (Special Track on AI and Robotics). 8 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23651 2026-05-26 cs.RO 83%

HeLoM: Hierarchical Learning for Whole-Body Loco-Manipulation by a Hexapod Robot

HeLoM: 六足机器人全身移动操作的分层学习

Xinrong Yang, Peizhuo Li, Hongyi Li, Yifeng Peng, Arhaan Jain, Junkai Lu, Linnan Chang, Yuhong Cao, Yifeng Zhang, Ge Sun, Guillaume Sartoretti

机构 * MARMoT Lab, Department of Mechanical Engineering, National University of Singapore(机械工程系,新加坡国立大学MARMoT实验室) Center for X-mechanics, Zhejiang University(浙江大学X力学中心)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出HeLoM分层框架,通过协调多肢控制实现六足机器人对重/不规则物体的稳定推动,在仿真和实物实验中验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03526 2026-05-26 cs.RO 83%

CollaBot: Vision-Language Guided Simultaneous Collaborative Manipulation

CollaBot: 视觉-语言引导的同步协作操作

Kun Song, Gaoming Chen, Shentao Ma, Ninglong Jin, Guangbao Zhao, Mingyu Ding, Zhenhua Xiong, Jia Pan

机构 * Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);分类 cs.RO

AI总结 提出CollaBot通用框架,通过场景分割、协作抓取和两阶段规划,实现多机器人同步协作操作大型物体,在实验中达到72%成功率。

Comments 8 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25362 2026-05-26 cs.RO 79%

Prior Policy Guided Dual-Agent Coordinated Manipulation Planning of Spacecraft-Manipulator System

先验策略引导的航天器-机械臂系统双智能体协同操控规划

Yuhui Hu, Dong Zhou, Kaihong Ouyang, Zhongliang Yu, Jianfeng Lv, Xiangyu Shao

机构 * School of Astronautics(航天学院) School of Automation(自动化学院) School of Information Science and Engineering(信息科学与工程学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 针对空间机械臂与基座强耦合导致的姿态稳定问题,提出先验策略引导的双智能体协同操控规划框架,通过时间步级专家切换机制提升深度强化学习效率,实现末端执行器高精度到达与基座姿态稳定。

Comments 36 pages, 13 figures, 6 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20473 2026-05-26 cs.RO 79%

Data-Driven Optimization of Tactile Sensor Configurations for Efficient Dexterous Manipulation

数据驱动的触觉传感器配置优化以实现高效灵巧操作

Haoran Guo, Haoyang Wang, Zhengxiong Li, He Bai, Lingfeng Tao

机构 * ShanghaiTech University, School of Information Science and Technology(上海科技大学信息科学与技术学院) University of Alberta(阿尔伯塔大学) Oklahoma State University(俄克拉荷马州立大学) University of Colorado Denver, Department of Computer Science and Engineering(科罗拉多大学丹佛分校计算机科学与工程系) Department of Robotics and Mechatronics Engineering, Kennesaw State University(凯斯西储大学机器人与机电工程系)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出两阶段框架量化触觉传感器对深度强化学习策略的贡献,将Shadow Hand传感器从92个减少至14个仍保持90%以上性能,并发现中指传感器具有负贡献。

Comments This work has been submitted to the ICRA for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24630 2026-05-26 cs.CV 78%

DexSIM: Real-time Dexterous Simulation with Unified Causal Video Diffusion

DexSIM: 具有统一因果视频扩散的实时灵巧仿真

Adam Lee

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);navigation(abstract);分类 cs.CV

AI总结 提出DexSIM框架,通过两阶段训练(双向视频扩散和自回归滚动训练)实现实时、长时一致的灵巧操作仿真,在像素相似度、运动保真度和手部投影精度上超越基线。

Comments World Model @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24554 2026-05-26 cond-mat.stat-mech quant-ph 78%

Manipulation of information flow and thermodynamic performance in nonreciprocal quantum dot information engines

非互易量子点信息引擎中的信息流和热力学性能调控

Hao Feng, Junjie Liu

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 本文通过扩展热力学第二定律,研究非互易耦合对双量子点信息引擎中信息流和热力学性能的调控机制,并证明非互易性可等效映射为有效互易系统。

Comments 16 pages, 6 figures, comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24509 2026-05-26 cs.CV cs.AI cs.GR cs.LG 78%

Φ-Noise: Training-Free Temporal Video Conditioning via Phase-Based Noise Manipulation

Φ-Noise:基于相位噪声操作的无训练时间视频条件生成

Ofir Abramovich, Nadav Z. Cohen, Adi Rosenthal, Ariel Shamir

机构 * Canvas-Lab

专题命中 机器人操作 :manipulation(title);分类 cs.AI、cs.CV、cs.LG

AI总结 提出一种无需训练的方法,通过将参考视频的低频相位信息注入扩散噪声潜变量,实现运动条件视频生成,无需修改模型架构或推理流程。

Comments Under Review; 26 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25346 2026-05-26 cs.RO cs.AI cs.LG cs.SY eess.SY math.OC 76%

Parallel Differentiable Reachability for Learning and Planning with Certified Neural Dynamics and Controllers

用于学习和规划的并行可微可达性:带认证的神经动力学与控制器

Keyi Shen, Glen Chou

机构 * MIT(麻省理工学院)

专题命中 机器人操作 :robotics(abstract,comments);manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出一种基于JAX的并行可微可达性框架,结合泰勒模型流形构建与CROWN线性界传播,支持GPU批处理和自动微分,并用于认证训练和可达性感知的MPC,在非抓取操作和四旋翼任务中实现在线规划与有界不确定性下的认证可达集过近似。

Comments Robotics: Science and Systems XXII (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24690 2026-05-26 cs.RO cs.LG 74%

Sum of Costs Diffusion with Dynamic Guidance for Motion Planning

运动规划的动态引导代价和扩散模型

Aysu Aylin Kaplan, Özgür Erkent

机构 * Computer Engineering Department, Hacettepe University(哈切特佩大学计算机工程系)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG;robotics(comments)

AI总结 提出一种基于扩散模型的高泛化运动规划方法,通过总碰撞代价梯度引导去噪过程并动态选择引导起始步,在Mπnets数据集上取得最优性能。

Comments Accepted at the Frontiers of Optimization for Robotics Workshop at the IEEE International Conference of Robotics & Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20390 2026-05-26 cs.RO 70%

NeuralTouch: Neural Descriptors for Precise Sim-to-Real Tactile Robot Control

NeuralTouch: 用于精确的仿真到现实触觉机器人控制的神经描述符

Yijiong Lin, Bowen Deng, Keju Pu, Chenghua Lu, Max Yang, Efi Psomopoulou, Nathan F. Lepora

机构 * Department of Engineering Mathematics and Bristol Robotics Laboratory(工程数学系和布里斯托尔机器人实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出NeuralTouch多模态框架,结合神经描述符场(NDF)和触觉感知,通过深度强化学习策略利用触觉反馈优化抓取姿态,实现精确且可泛化的机器人操作。

Journal ref IEEE/ASME Transactions on Mechatronics, 2026 IEEE/ASME Transactions on Mechatronics IEEE/ASME Transactions on Mechatronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25216 2026-05-26 cs.RO 70%

InvariantCloud: A Globally Invariant, Uniquely Indexed Point Cloud Framework for Robust 6-DoF Tactile Pose Tracking

InvariantCloud:一种全局不变、唯一索引的点云框架,用于鲁棒的6自由度触觉姿态跟踪

Pengfei Ye, Yuxiang Ma, Yi Zhou, Wei Chen, Wenzhen Dong, Molong Duan

机构 * Department of Mechanical and Aerospace Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学机械与航空航天工程系) Department of Mechanical Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程系) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出InvariantCloud框架,利用视觉触觉传感器上表面标记星座的全局不变性,通过一次性全局不变点云配准实现6自由度物体姿态估计,抑制累积漂移并准确估计偏航旋转,在长序列操作任务中展现出高精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24813 2026-05-26 cs.RO cs.SY eess.SY 70%

Manifold-Constrained MPPI: Real-Time Sampling-Based Control Under Hard Constraints

流形约束MPPI:硬约束下的实时采样控制

Seulchan Lee, Sanghyun Kim

机构 * School of Mechanical Engineering, Kyung Hee University(京畿大学机械工程学院) Advanced Institute of Convergence Technology(融合技术高级研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出流形约束MPPI(MC-MPPI),通过变分自编码器学习约束流形的低维表示,结合二次规划控制器,实现实时硬约束满足。

Comments International Journal of Control, Automation, and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02839 2026-05-26 cs.RO 70%

Language Movement Primitives: Grounding Language Models in Robot Motion

语言运动基元:将语言模型锚定在机器人运动中

Yinlong Dai, Benjamin A. Christie, Daniel J. Evans, Dylan P. Losey, Simon Stepputtis

机构 * Collab , Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061(合作组,机械工程系,弗吉尼亚理工学院,黑斯堡,VA 24061) TEA Lab , Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061(TEA实验室,机械工程系,弗吉尼亚理工学院,黑斯堡,VA 24061)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出语言运动基元(LMP)框架,通过将视觉语言模型(VLM)推理与动态运动基元(DMP)参数化结合,实现零样本机器人操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25187 2026-05-26 cond-mat.soft 67%

Unfrustrated Self-Morphing of Bulk Liquid Crystal Elastomers

体液晶弹性体的无挫自变形

Shachaf Rotem, Hillel Aharoni

专题命中 机器人操作 :robotics(abstract);manipulation(abstract)

AI总结 通过分析参考里奇曲率,提出体液晶弹性体无应力、无挫变形的条件,识别出两类几何兼容系统,为体LCE的正向和逆向设计提供数学基础。

Comments 11 pages, 3 figures, 5 SI pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25304 2026-05-26 cs.LG cs.CR cs.CV 62%

When Interpretability Becomes a Liability: Adversarial Attacks on CBM Concept Layers

当可解释性成为负担:针对CBM概念层的对抗攻击

Aditya Sridhar

机构 * Independent Researcher(独立研究者)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 本文系统研究了概念瓶颈模型(CBM)中概念层的对抗性脆弱性,提出了一种基于语义扰动的稳定性正则化防御方法SPECTRA,显著提高了攻击所需的最小扰动范数,同时保持了分类精度。

Comments Accepted to CVPR 2026 (Findings). 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23939 2026-05-26 cs.AI cs.LG 62%

DRIVE: Modeling Skills at the Reasoning and Interaction Levels for Web Agents under Continual Learning

DRIVE:在持续学习下为Web代理建模推理与交互层面的技能

Xirui Liu, Sihang Zhou, Yanning Hou, Rong Zhou, Haoyuan Chen, Maolin He, Siwei Wang, Hao Chen, Jian Huang

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 提出DRIVE框架,通过将历史经验分离为自然语言推理技能和程序化交互技能,并采用场景感知协调机制,解决Web代理在持续学习中推理与交互知识纠缠的问题,在WebArena上平均任务成功率提升7.3个百分点。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25979 2026-05-26 cs.CV 57%

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

LLaVA-OneVision-2:迈向下一代感知智能

Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

机构 * Glint Lab(Glint实验室) AIM for Health Lab(健康AI实验室) MVP Lab(MVP实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出LLaVA-OV-2模型,通过编解码流令牌化、窗口注意力和3D RoPE实现统一视频理解与时空定位,在多项基准上超越Qwen3-VL-8B。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25435 2026-05-26 cs.AI 57%

Security of OpenClaw Agents: Fundamentals, Attacks, and Countermeasures

OpenClaw 代理的安全性:基础、攻击与对策

Yuntao Wang, Jianle Ba, Han Liu, Yanghe Pan, Jintao Wei, Zhou Su, Tom H. Luan, Linkang Du

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学网络科学与工程学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文综述了 OpenClaw 代理的安全挑战,分类分析了技能投毒、认知操纵、多代理级联故障和供应链漏洞等威胁,并总结了现有防御机制。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20479 2026-05-26 cs.CY cs.AI cs.CL 57%

Profiling learners' affective engagement: Emotion AI, intercultural pragmatics, and language learning

学习者情感投入画像:情感AI、跨文化语用学与语言学习

Robert Godwin-Jones

机构 * Virginia Commonwealth University(弗吉尼亚大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文探讨了情感AI在语言学习中的应用,特别是自动情感识别和模拟人类响应如何影响语用能力和互动能力的发展,并讨论了其个性化学习优势与情感操纵风险。

Journal ref Language Learning & Technology, 30(2), 14-35 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏