arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-19 至 2026-08-19 共收录 35 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2512.00074 2026-08-19 cs.RO cs.CV 版本更新 86%

Bootstrap Dynamic-Aware 3D Visual Representation for Scalable Robot Learning

基于 Bootstrap 的动态感知 3D 视觉表示用于可扩展的机器人学习

Qiwei Liang, Boyang Cai, Minghao Lai, Sitong Zhuang, Tao Lin, Yan Qin, Yixuan Ye, Jiaming Liang, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学) Beijing Jiaotong University(北京交通大学) Central South University(中南大学)

专题命中 机器人学习 :robot learning(title);robotics(abstract);manipulation(abstract);robotic(abstract)

AI总结 AFRO通过动态感知的3D表示提升机器人操作性能,结合扩散策略实现高效预训练。

Comments Project Page: this https URL (https://kolakivy.github.io/AFRO/), accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 13 篇

2406.01586 2026-08-19 cs.RO cs.AI 版本更新 88%

ManiCM: Real-time 3D Diffusion Policy via Consistency Model for Robotic Manipulation

ManiCM:用于机器人操作的基于一致性模型的实时3D扩散策略

Zifeng Gao, Guanxing Lu, Tianxing Chen, Wenxun Dai, Ziwei Wang, Chao Shang, Wenbo Ding, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究提出ManiCM模型,通过一致性约束实现一步推理,在31项机器人操作任务上,推理速度较最优方法提升10倍且保持竞争力。

Comments this https URL (https://manicm-fast.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01115 2026-08-19 cs.RO cs.CV 版本更新 87%

KAN We Flow? Advancing Robotic Manipulation with 3D Flow Matching via KAN & RWKV

KAN We Flow? 通过KAN与RWKV实现3D操作的机器人操控进步

Zhihao Chen, Yiyuan Ge, Ziyang Wang, Youwei Zhang

机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学智能工程与自动化学院) Beijing Hydrogen Intelligence Technology Co. Ltd.(北京氢能智能科技有限公司) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.CV

AI总结 KAN-We-Flow通过结合RWKV和KAN技术,实现轻量高效的3D机器人操作策略,显著提升性能与效率。

Comments Accepted By ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08748 2026-08-19 cs.RO cs.AI 版本更新 87%

Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT

面向机器人操作的视觉提示:采用带标注引导的拾取与放置方法,基于ACT算法

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

机构 * Embodied AI Research Team(具身人工智能研究团队) National Institute of AIST(国家信息与系统技术研究所)

专题命中 机器人操作 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.AI

AI总结 针对便利店机器人拾取放置任务的挑战,提出带标注引导视觉提示的感知-行动流水线,采用ACT算法实现自适应操作,提升了零售环境下的抓取精度与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29662 2026-08-19 cs.CV cs.RO 版本更新 81%

SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation

SAFE-Pruner: 语义注意力引导的未来感知令牌剪枝用于高效视觉-语言-动作操控

Shilin Ma, Chubin Zhang, Changyuan Wang, Yuji Wang, Yue Wu, Zixuan Wang, Jingqi Tian, Zheng Zhu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 机器人操作 :manipulation(title);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对视觉-语言-动作模型推理加速中现有剪枝方法忽略深层视觉信息的问题,提出SAFE-Pruner框架,通过引入未来层注意力线索和语义注意力一致性实现前瞻性令牌剪枝,在仿真和真实实验中取得最高1.89倍加速且成功率下降小于1.7%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01824 2026-08-19 cs.RO 版本更新 79%

ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction

ReTouch:利用在线优化的触觉预测实现接触丰富的灵巧操作

Shiqi Zhang, Xin Zhang, Yedong Shen, Yao Li, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Jiajun Deng, Yanyong Zhang

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本研究提出视觉-语言-动作模型ReTouch,通过在线优化触觉预测实现接触丰富的灵巧操作,在真实机器人实验中,其平均成功率较最强基线提升18.4至23.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12499 2026-08-19 cs.RO 版本更新 79%

Action-Effect Memory Pretraining for Robot Manipulation

动作-效应记忆预训练用于机器人操作

Yijing Zhou, Qiwei Liang, Sitong Zhuang, Jiaxi Li, Xianpeng Wang, Boyang Cai, Yunyang Mo, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出AEM框架,通过视觉-动作历史掩码建模学习紧凑时间表征,提升机器人操作在部分可观测环境下的性能,优于单帧预训练和帧堆叠方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09948 2026-08-19 cs.AI cs.CV cs.RO 版本更新 75%

LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models

LoopVLA: 在视觉-语言-动作模型中学习充分性

Boyang Shen, Kaixiang Yang, Hao Wang, Qiuyu Yu, Qiang Xie, Qiang Li, Zhiwei Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan United Imaging Surgical Co.,Ltd. (UIS)(武汉联影 surgical 公司)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 LoopVLA通过递归学习实现表示细化、动作预测和充分性估计,减少计算并提升效率,实验表明其在精度和性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14825 2026-08-19 cs.MA cs.AI 版本更新 57%

Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce

长视野多智能体大语言模型商业环境中涌现的对齐失效通信

Zeyuan Li, Lukas Petersson, Alessandro Acquisti, Michiel A. Bakker

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06323 2026-08-19 cs.RO 版本更新 57%

VOLT: Vision and Language Trajectory Segmentation for Faster-than-Demonstration Policies

VOLT: 面向超演示速度策略的视觉与语言轨迹分割

Robert Ramirez Sanchez, Daniel J. Evans, Dylan P. Losey, Siddarth Jain

机构 * Collab , Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061(机械工程系,弗吉尼亚理工学院,布莱克斯堡,VA 24061) Mitsubishi Electric Research Laboratories ( MERL ), Cambridge, MA 02139(三菱电机研究实验室(MERL),剑桥,MA 02139)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出VOLT方法,通过视觉与语言线索对演示轨迹进行分割,选择性下采样安全加速部分,保留需要精细操作的慢速段,从而训练出比演示更快的机器人策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06185 2026-08-19 cs.CY cs.AI cs.CL cs.HC 版本更新 57%

Hidden Prompts in Manuscripts Exploit AI-Assisted Peer Review

手稿中的隐藏提示利用AI辅助同行评审

Zhicheng Lin

机构 * Department of Psychology, Yonsei University(延世大学心理学系) Department of Psychology, University of Science and Technology of China(中国科学技术大学心理学系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 研究探讨了手稿中隐藏指令对AI同行评审的影响,分析了提示注入技术及学术出版物政策的不一致,指出需加强技术筛查与政策协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00992 2026-08-19 cs.AI cs.CL cs.CY cs.HC 版本更新 57%

Evidence of conceptual mastery in the application of rules by Large Language Models

大型语言模型在规则应用中展现出概念掌握能力的证据

José Luiz Nunes, Guilherme FCF Almeida, Brian Flanagan

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文通过两项心理学实验发现,Gemini Pro等部分LLMs在规则应用上展现类人表现,证实LLMs掌握规则概念,对法律决策与哲学探究有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23890 2026-08-19 cs.CY cs.HC 版本更新 50%

Divergent Paths to Depolarization: Dialogue Design Shapes the Intergroup Attitudinal Effects of AI-Assisted Political Argumentation

去极化的分歧路径:对话设计决定AI辅助政治辩论的亲社会效益

Jianlong Zhu, Syed Muhammad Jhon Raza Naqvi, Carolin-Theresa Ziemer, Usman Naseem, Ingmar Weber

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过在线实验发现,AI对话中态度一致对话比态度不一致对话更有效减少极化,但态度不一致对话能随时间提升认知特质共情,表明对话设计是AI介导行为干预的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17127 2026-08-19 cs.CL 版本更新 50%

The Emergence of Lab-Driven Alignment Signatures: A Psychometric Framework for Auditing Latent Bias and Compounding Risk in Generative AI

实验室驱动的对齐签名的出现:一种心理测量框架,用于审计生成AI中的潜在偏见和叠加风险

Dusan Bosnjakovic

机构 * AI Researcher(人工智能研究员)

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出了一种心理测量框架,用于审计生成AI中的潜在偏见和叠加风险,通过分析九个领先模型的实验室信号,揭示了持续行为聚类的成因。

Comments v2: expanded from 9 to 18 behavioral dimensions and from 4 to 6 developer organizations; revised statistical methodology (rank-based inference with effect-size criterion, replacing variance-decomposition approach); model-level results now reported; references corrected throughout

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 6 篇

2510.08713 2026-08-19 cs.AI cs.CV cs.RO 版本更新 90%

Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight

通过记忆增强的规划和前瞻性构建视觉导航的统一世界模型

Yifei Dong, Fengyi Wu, Guangyu Chen, Lingdong Kong, Qiyu Hu, Yuxuan Zhou, Xu Zhu, Jingdong Sun, Jun-Yan He, Qi Dai, Alexander G. Hauptmann, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) Apple(苹果公司) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出UniWM,一种整合视觉前瞻性与规划的统一世界模型,通过记忆机制提升导航鲁棒性和泛化能力,在多个基准测试中显著提升导航成功率。

Comments Accepted to ECCV 2026. 22 pages, 12 figures, code: this https URL (https://github.com/UWMILab/UniWM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03699 2026-08-19 cs.RO eess.SY 版本更新 79%

Lost in Time? Continuous Symmetry and Identifiability in Aided Inertial Navigation with Unknown Measurement Delays

迷失在时间中?具有未知测量延迟的辅助惯性导航中的连续对称性和可识别性

Jonathan Kelly, Phone Thiha Kyaw, Matthew Giamou

机构 * Space & Terrestrial Autonomous Robotic Systems (STARS) Laboratory at the University of Toronto Institute for Aerospace Studies (UTIAS)(多伦多大学航天研究所空间与地面自主机器人系统(STARS)实验室) Autonomous Robotics & Convex Optimization (ARCO) Laboratory in the Department of Computing and Software, McMaster University(麦克马斯特大学计算与软件系自主机器人与凸优化(ARCO)实验室)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 研究辅助导航中单个辅助传感器测量相对于惯性测量流有未知但恒定延迟时系统的可识别性,利用特殊伽利略群刻画无信息轨迹并与延迟测量模型连续对称性相关,揭示可识别性失败轨迹类别及与线性化分析联系。

Comments Accepted to the IEEE International Conference on Multisensor Fusion and Integration (MFI), Pilsen, Czechia, Sep 2-4, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15239 2026-08-19 cs.RO cs.MA 版本更新 79%

Symmetry-Breaking in Multi-Agent Navigation: Winding Number-Aware MPC with a Learned Topological Strategy

多智能体导航中的对称性破坏:基于 winding 数的 MPC 与学习拓扑策略

Tomoki Nakao, Kazumi Kasaura, Tadashi Kozuno

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究生院) OMRON SINIC X Corporation(OMRON SINIC X公司)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 WNumMPC 通过学习拓扑策略和 winding 数,有效解决多智能体导航中的对称性死锁问题,实现鲁棒的仿真到现实迁移。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22104 2026-08-19 cs.AI cs.LG cs.LO cs.RO eess.SY 版本更新 67%

Efficient Dynamic Shielding for Parametric Safety Specifications

面向参数化安全规范的高效动态防护机制

Davide Corsi, Kaushik Mallik, Andoni Rodriguez, Cesar Sanchez

机构 * University of California, Irvine(加州大学尔湾分校) IMDEA Software Institute(IMDEA软件研究所)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文针对参数化安全规范提出动态防护机制,其离线设计耗时数分钟,在线适配速度较暴力重新计算方法快最多5倍,可用于未知区域机器人导航以应对安全规范的动态变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00945 2026-08-19 cs.RO 版本更新 57%

VertiAKD: Adaptive Off-Road Kinodynamics on Vertically Challenging Terrain

VertiAKD:适用于垂直挑战性地形的自适应越野运动动力学

Tong Xu, Chenhui Pan, Francesco Cancelliere, Xuesu Xiao

机构 * George Mason University(乔治梅森大学) University of Catania(卡塔尼亚大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 该研究提出VertiAKD框架,可在几何与语义复杂地形上跨不同车辆迁移适配越野运动动力学知识,仅需一分钟新数据即可显著降低长 horizon 预测误差,实现鲁棒闭环轨迹跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13743 2026-08-19 cs.SE 版本更新 50%

Counterexample Classification for Signal Temporal Logic Specifications

针对信号时间逻辑规范的反例分类

Zhenya Zhang, Parv Kapoor, Jie An, Eunsuk Kang

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出利用参数信号时间逻辑(PSTL)对违反STL规范的反例进行分类,通过定义类别间的包含关系和二分查找方法提高分类效率,并在两个系统上验证了其有效性。

Comments The full version of the paper accepted by EMSOFT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 4 篇

2601.21282 2026-08-19 cs.CV 版本更新 83%

WorldBench: Benchmarking Physical Understanding of World Models by Isolating Physics Concepts

WorldBench: 为世界模型诊断评估进行物理辨析

Rishi Upadhyay, Howard Zhang, Jim Solomon, Ayush Agrawal, Yunhao Ba, Alex Wong, Celso M de Melo, Achuta Kadambi

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Sony AI(索尼人工智能) Yale University(耶鲁大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.CV

AI总结 WorldBench通过概念特定的解耦评估,提升世界模型的物理推理能力评估的准确性和可扩展性。

Comments Webpage: this https URL (https://world-bench.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01372 2026-08-19 cs.LG cs.AI cs.CV 版本更新 67%

BRo-JEPA: Learning Modular Transformations in Latent Space

BRo-JEPA:在潜空间中学习模算术

Divyansh Jha, Yuanfang Xie, Brennen Yu, Varan Mehra

机构 * Georgia Institute of Technology(佐治亚理工学院) NYU Langone Health(纽约大学Langone医疗中心)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出BRo-JEPA模型,通过在潜空间中施加模10算术的循环结构,实现零样本泛化,解决了标准模型无法外推未见操作的问题。

Comments 20 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13546 2026-08-19 cs.CV 版本更新 57%

Alaya-EVOKE: From Linear-Scaling Supervision to Endless World

Alaya-EVOKE:从线性缩放监督到无尽世界

Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang, Feng Zhao

机构 * MoE Key Lab of BIPC(BIPC教育部重点实验室) USTC(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Alaya Lab(Alaya实验室)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 Alaya-EVOKE将持久世界状态外部化并重新设计教师模型,解决交互式世界模型的冲突需求,在WBench等基准上实现最优性能,支持开放式长时序生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18005 2026-08-19 cs.CV 版本更新 57%

UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale

RAISECity: 一种用于城市级现实对齐3D世界生成的多模态代理框架

Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京研究院,清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 RAISECity通过多模态代理框架实现城市级3D世界生成,提升现实对齐、精度和性能,适用于沉浸媒体和具身智能应用。

Comments Accepted by ACM MM 2026, the code is available at: this https URL (https://github.com/tsinghua-fib-lab/UrbanWorld2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 2 篇

2605.25477 2026-08-19 cs.RO cs.AI 版本更新 73%

EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models

EXPO-FT:面向视觉-语言-动作模型的样本高效强化学习微调

Perry Dong, Kuo-Han Hung, Tian Gao, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出EXPO-FT系统,通过样本高效的强化学习微调预训练的VLA策略,在多种高精度操作任务中实现完美性能(30/30成功率),平均仅需19.1分钟在线机器人数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15455 2026-08-19 math.NA cs.AI math.AP 版本更新 57%

Solving nonconvex Hamilton--Jacobi--Isaacs equations with PINN-based policy iteration

用基于PINN的策略迭代求解非凸哈密顿-雅可比-艾萨克斯方程

Hee Jun Yang, Minjung Gim, Yeoneung Kim

机构 * National Institute for Mathematical Sciences(数学科学研究院) Department of Applied Artificial Intelligence(应用人工智能系)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI

AI总结 本文提出结合PINN与策略迭代的无网格框架,可求解高维非凸HJI方程,在两类数值实验中表现优于直接PINN求解器,具理论依据与应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 8 篇

2607.07459 2026-08-19 cs.RO cs.CV 版本更新 84%

EmbodiedGen V2: An Agentic, Simulation-Ready 3D World Engine for Embodied AI

EmbodiedGen V2:用于具身人工智能的具有智能体特性、可用于模拟的3D世界引擎

Xinjie Wang, Liu Liu, Taojun Ding, Andrew Choi, Chaodong Huang, Mengao Zhao, Ziang Li, Jackson Jiang, Chunlei Yu, Shengxiang Liu, Wei Xu, Zhizhong Su

机构 * Horizon Robotics(地平线机器人) WuwenAI(悟文智能)

专题命中 机器人数据与评测 :embodied AI(title);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究提出EmbodiedGen V2这个用于具身智能的3D世界引擎,通过统一表示解决资产组装问题。其生成环境支持多种任务,评估中资产管道表现良好,强化学习提升了模拟成功率,确立了它作为可扩展模拟基础设施的地位。

Comments Project page: this http URL (http://horizonrobotics.github.io/EmbodiedGen)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14229 2026-08-19 cs.AI cs.CV cs.RO 版本更新 82%

HA-VLN 2.0: An Open Benchmark and Leaderboard for Human-Aware Navigation in Discrete and Continuous Environments with Dynamic Multi-Human Interactions

HA-VLN 2.0:面向离散与连续环境中动态多人交互的人类感知导航开放基准与排行榜

Yifei Dong, Fengyi Wu, Qi He, Lingdong Kong, Heng Li, Minghan Li, Zebang Cheng, Yuxuan Zhou, Jingdong Sun, Qi Dai, Alexander G Hauptmann, Zhi-Qi Cheng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出HA-VLN 2.0统一基准,通过标准化任务、HAPS 2.0数据集与模拟器、16844条社会指令基准测试及真实机器人实验,证明显式社会建模提升导航鲁棒性并减少碰撞。

Comments Accepted to IROS 2026. 35 pages, 20 figures, website: this https URL (https://uwmilab.github.io/HA-VLN-webpage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12313 2026-08-19 cs.CV cs.CL 版本更新 57%

AVA-Encoder: Towards Agent-Native Video Representation Learning

AVA-Encoder:面向智能体原生的视频表示学习

Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li, Shuqi Gu, Kan Ren, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Computing Technology(中国科学院计算技术研究所) Southeast University(东南大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17013 2026-08-19 cs.CV 版本更新 57%

Toward Universal Skeleton-Based Action Recognition across Heterogeneous Skeletons and Open Vocabularies

迈向通用的基于骨骼的动作识别

Jidong Kuang, Hongsong Wang, Jie Gui, Yuan Yan Tang, James Tin-Yau Kwok

机构 * School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出了一种基于Transformer的模型,通过统一骨骼表示、动作编码器和多粒度动作-文本对齐,解决异构骨骼动作识别的挑战,实验验证了方法的有效性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏