arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-12 至 2026-06-12 共收录 64 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 20 篇

2606.13677 2026-06-12 cs.RO cs.AI cs.CV cs.LG 新提交 85%

Mana: Dexterous Manipulation of Articulated Tools

Mana: 铰接工具的灵巧操作

Zhao-Heng Yin, Guanya Shi, Pieter Abbeel, C. Karen Liu

机构 * UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学) Stanford University(斯坦福大学) Amazon FAR(亚马逊FAR)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出Mana框架,将灵巧操作重解释为动画问题,通过粗到细的流水线自动生成操作轨迹,实现铰接工具的零样本仿真到现实迁移。

Comments Project Page: https://zhaohengyin.github.io/mana

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08765 2026-06-12 cs.RO cs.CV 新提交 84%

RGB-S: Image-Aligned Tactile Saliency for Robust Dexterous Manipulation

RGB-S: 用于鲁棒灵巧操作的图像对齐触觉显著性

Shengcheng Luo, Kefei Wu, Xiaoying Zhou, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

机构 * ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出RGB-S框架,通过正向运动学和相机标定将触觉传感器位置投影到RGB图像平面,生成力调制高斯显著性图,显式对齐触觉与视觉,在严重遮挡下灵巧操作成功率提升26.7个百分点。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13601 2026-06-12 cs.RO cs.SY eess.SY 新提交 83%

MCR-Bionic Hand: Anatomical Structural Priors for Dexterous Manipulation

MCR-Bionic Hand: 用于灵巧操作的解剖结构先验

Haosen Yang, Guowu Wei

机构 * University of Salford(索尔福德大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出MCR-Bionic Hand,一种基于人体手部解剖结构先验的仿生机械手,通过结构智能实现低维控制到灵巧操作的映射,在接触密集型任务中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13279 2026-06-12 cs.RO 新提交 83%

See Selectively, Act Adaptively: Dual-Level Structural Decomposition for Bimanual Robot Manipulation

选择性观察,适应性行动:双水平结构分解用于双臂机器人操作

Yoon-Ji Choi, Young-Chae Son, Soo-Chul Lim

机构 * Dongguk University(东国大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出基于双水平结构分解的双臂操作VLA框架,通过视觉选择路由和动作专家混合机制分别处理视觉相关性和双臂交互模式,在模拟和真实任务中成功率分别提升27.7%和43.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13394 2026-06-12 cs.RO 新提交 79%

GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation

GeoHAT: 几何自适应混合动作Transformer用于移动操作

Xiangyu Zhu, Renjun Wu, Luzhou Ge, Jinyan Liu, Xuesong Li

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出GeoHAT框架,通过轻量级傅里叶空间编码器注入几何信息,并采用混合全身动作解码器分解机械臂与基座动作,在ManiSkill-HAB基准上成功率提升23.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13352 2026-06-12 cs.RO 新提交 79%

Low cost, easily manufactured, highly flexible strain and touch sensitive fiber for robotics applications

低成本、易制造、高柔性应变与触觉传感纤维用于机器人应用

Christian Diaz Herrera, Srushti Raste, Simin Liu, Miles Modeste, Jiyang, Yin, Katelyn McCall, Yuxing Jared Yao, Roopkamal Chahal, Simon Chidley, Trung Ha, T. David Westmoreland, Sonia Roberts

机构 * Wesleyan University(卫斯理大学)

专题命中 机器人操作 :robotics(title);robotic(abstract);分类 cs.RO

AI总结 提出一种仅用廉价商用部件和工具快速制造的导电纤维,兼具电阻应变传感和电容触觉传感功能,实验验证其在机器人抓取、姿态估计和近场跟踪中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13232 2026-06-12 cs.RO 新提交 79%

WT-UMI: Tactile-based Whole-Body Manipulation via Force-Supervised Contact-Aware Planning

WT-UMI: 基于触觉的全身操控通过力监督的接触感知规划

Jaehwi Jang, Zhaoyuan Gu, Alfred Cueva, Zimeng Chai, Junjie Sheng, Thong Nguyen, Himank Galundia, Yifan Wu, Huishu Xue, Isaac Legene, Ojas Mediratta, Davin Doan, Andrew Collins, Sarah Sadegh, KyoungMok Kim, Rishita Dhalbisoi, Zun Chen, Ye Zhao

机构 * The Institute for Robotics and Intelligent Machines, Georgia Institute of Technology(机器人与智能机械研究所,佐治亚理工学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出WT-UMI系统,结合人体演示与遥操作数据,通过力监督规划器预测末端执行器位姿和接触力轨迹,并利用触觉导纳控制器提升全身操控性能。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12759 2026-06-12 cs.RO 新提交 79%

Sparse2Act: Learning Action-Aligned Sparse 3D Representations for Cross-Domain Robot Manipulation

Sparse2Act: 学习跨域机器人操作的动作对齐稀疏3D表示

Yu Guo, Chang Yu, Siyu Ma, Yunuo Chen, Yin Yang, Ying Nian Wu, Chenfanfu Jiang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣迭戈分校) University of Utah(犹他大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出Sparse2Act框架,通过动作对齐的掩码稀疏3D编码预训练,实现跨域机器人操作,在LIBERO-10上达86.9%成功率,并支持域迁移和sim-to-real。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18438 2026-06-12 cs.CV 版本更新 79%

CPAM: Context-Preserving Adaptive Manipulation for Zero-Shot Real Image Editing

CPAM: 保持上下文的自适应操作用于零样本真实图像编辑

Dinh-Khoi Vo, Thanh-Toan Do, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * Faculty of Information Technology, University of Science, Ho Chi Minh City, Vietnam(越南科学大学信息科技学院) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学) Faculty of Information Technology, Monash University, Melbourne, Victoria, Australia(莫纳什大学信息科技学院) Department of Computer Science, University of Dayton, Dayton, Ohio, US(Dayton 大学计算机科学系)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV

AI总结 提出CPAM零样本框架,通过保持上下文的自适应操作和掩码引导,实现复杂非刚性真实图像的编辑,保留纹理和身份,无需微调。

Comments Accepted to IEEE Transactions on Multimedia. Project page: https://vdkhoi20.github.io/CPAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13080 2026-06-12 physics.optics 新提交 78%

Intelligent Perception Assisted Light Modulation for real-time and program-free nanofabrication and particle manipulation

智能感知辅助光调制用于实时无编程纳米制造和粒子操控

Weixin Zhu, Hanyu Guo, Chen Zhang, Fang Yang, Ce Zhang, Lijing Zhong, Jianrong Qiu, Kaige Wang, Jintao Bai, Wei Zhao

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 提出智能感知辅助光调制技术,通过实时手势识别与动态空间光调制实现无编程激光束控制,用于纳米制造(最小特征尺寸280 nm)和细胞操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11767 2026-06-12 cs.RO cs.AI 新提交 73%

Blind Dexterous Grasping via Real2Sim2Real Tactile Policy Learning

通过真实到仿真到真实触觉策略学习的盲操作灵巧抓取

Shengcheng Luo, Xiyan Huang, Zhe Xu, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

机构 * ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出一种结合Real2Sim触觉校准、布局感知触觉编码器和触觉条件扩散策略的框架,实现仅依赖触觉的灵巧手盲抓取,在真实机器人上对20个物体达到27%成功率。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12954 2026-06-12 cs.RO 新提交 70%

Towards Reliable Sequential Object Picking in Clutter: The Runner-up Solution to RGMC 2025

面向杂乱环境中的可靠顺序物体抓取:RGMC 2025 亚军方案

Wei Yu, Xidan Zhang, Ziyi Zheng, Weijie Kong, Huixu Dong

机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对杂乱环境中的顺序物体抓取任务,提出集成硬件-软件流水线,结合多功能夹爪设计与物体分布及遮挡关系新表示,实现高效识别、搜索与顺序抓取,获RGMC 2025亚军。

Comments First, Second and Third Coauthor contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12604 2026-06-12 cs.RO 新提交 70%

EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot Demonstrations

EgoEngine:从自我中心人类视频到高保真灵巧机器人演示

Yangcen Liu, Shuo Cheng, Xinchen Yin, Woo Chul Shin, Alfred Cueva, Yiran Yang, Zhenyang Chen, Chuye Zhang, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Tsinghua University(清华大学)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出EgoEngine框架,通过视觉和动作桥接,将自我中心人类视频转化为高保真机器人数据,首次实现零样本灵巧策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10683 2026-06-12 cs.RO cs.AI cs.CV 新提交 67%

UniDexTok: A Unified Dexterous Hand Tokenizer from Real Data

UniDexTok:基于真实数据的统一灵巧手分词器

Dong Fang, Youjun Wu, Yuanxin Zhong, Rui Zhang, Yunlong Wang, Xiaosong Jia, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Hefei University of Technology(合肥工业大学) Rimbot Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出统一灵巧手模型(UDHM)将人手和机器人手状态映射到共享22自由度语义接口,并基于此开发UniDexTok,一种免重定向的状态分词器,学习基于真实关节状态的离散token,实现异构灵巧手的统一表示,误差降低98%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01630 2026-06-12 cs.LG cs.MA cs.RO cs.SY eess.SY 版本更新 62%

DiffCoord: Differentiable Coordination for Distributed Multi-Agent Trajectory Optimization

DiffCoord: 分布式多智能体轨迹优化的可微协调

Bingheng Wang, Yichao Gao, Tianchen Sun, Shanker Ajay, Lin Zhao

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出DiffCoord框架,将截断ADMM-DDP管道的耦合参数通过端到端元学习联合优化,利用智能体神经网络实现任务自适应,并扩展到不同智能体数量。在协作空中运输系统中验证,相比现有方法将每智能体梯度计算时间减少70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13282 2026-06-12 cs.AI 新提交 57%

ERTS: Adversarial Robustness Testing of Ethical AI via Semantic Perturbation in a Bounded Consequence Space

ERTS: 通过有界后果空间中的语义扰动进行伦理AI的对抗鲁棒性测试

Pratyush Chaudhari

机构 * Pratyush Chaudhari(普拉蒂什·查德哈里)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出伦理鲁棒性测试系统(ERTS),通过有界伦理后果空间、语义扰动和领域自适应评估,测试AI在伦理推理中的对抗鲁棒性,实验表明仅33%模型通过测试。

Comments 8 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00167 2026-06-12 cs.RO 版本更新 57%

EgoMoD: Predicting Global Maps of Dynamics from Local Egocentric Observations

EgoMoD:从局部自我中心观测预测全局动态地图

Iacopo Catalano, David Morilla-Cabello, Jorge Pena-Queralta, Eduardo Montijano

机构 * University of Turku, Finland(芬兰图尔库大学) Centre for Artificial Intelligence, Zürich University of Applied Sciences, Winterthur, Switzerland(瑞士应用科学大学人工智能中心) Instituto de Investigación en Ingeniería de Aragón, Universidad de Zaragoza, Spain(西班牙阿拉贡工程研究所,萨拉戈萨大学)

专题命中 机器人操作 :navigation(abstract);分类 cs.RO

AI总结 提出EgoMoD方法,利用短时自我中心视频和位姿条件架构,学习从局部观测预测全局运动动态地图,替代传统全局感知基础设施,实现零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12586 2026-06-12 cs.CR 新提交 50%

Beyond Attack Success Rate: Examining Trigger Leakage in Vision-Language Agentic Systems

超越攻击成功率:视觉-语言智能系统中的触发器泄漏研究

Jiamin Chang, Salil Kanhere, Piotr Koniusz, Jason, Xue, Hammond Pearce

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出“触发器泄漏”概念,量化视觉-语言智能系统中后门触发器在视觉或语义相近输入下意外激活隐藏行为的风险,并引入邻域泄漏率(NLR)指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13257 2026-06-12 cond-mat.str-el cond-mat.mes-hall 新提交 50%

Selective stabilization of antiferromagnetic orders in FeTe films via local strain engineering

FeTe薄膜中反铁磁序的局域应变工程选择性稳定

Hao Xu, Jing Jiang, Xuesong Gai, Haicheng Lin, Kai Liu, Zhong-Yi Lu, Kai Chang, Chong Liu

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过扫描隧道显微镜和密度泛函理论计算,发现局域单轴应变可在FeTe薄膜中选择性稳定双共线或二聚体反铁磁序,并首次实验实现长程二聚体反铁磁序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03096 2026-06-12 cs.CL 版本更新 50%

Can Factual Opinions Be Edited (Manipulated) in Large Language Models?

大型语言模型中的事实性观点能否被编辑(操纵)?

Yuanpu Cao, Ziyi Yin, Fenglong Ma, Jinghui Chen

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出FOE基准测试,评估当前知识编辑技术对事实性观点(如公众人物立场)的操纵能力,并发现其仅能实现表面修改,无法保持观点与证据的一致性;进而提出自生成证据对齐方法实现观点-证据对齐。

Comments Accepted to the ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 13 篇

2606.13494 2026-06-12 cs.RO cs.CV 新提交 84%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12603 2026-06-12 cs.RO cs.AI 新提交 84%

From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation

从模仿到对齐:面向长距离人行道导航的人类偏好流策略

Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出FlowPilot,一种仅使用单目RGB相机的无地图导航策略,通过锚定流匹配进行预训练,并引入人类偏好学习实现对齐,在长距离人行道导航中提升鲁棒性和社会合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12550 2026-06-12 cs.RO cs.AI 新提交 81%

Foresight: Iterative Reasoning About Clues that Matter for Navigation

Foresight: 关于导航关键线索的迭代推理

Arthur Zhang, Carl Qi, Donne Su, Xiangyun Meng, Amy Zhang, Joydeep Biswas

机构 * UT Austin(德克萨斯大学奥斯汀分校) FieldAI

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出Foresight框架,利用微调VLM交替提出和批评图像空间运动计划,通过人类反馈学习奖励模型进行强化学习后训练,实现无地图导航中稀疏语言指令下的迭代运动优化,任务成功率提升37%。

Comments 22 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01621 2026-06-12 cs.CV cs.RO 版本更新 81%

Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation

Goal2Pixel: 将目标锚定到像素以实现视觉语言导航

Muyi Bao, Yuxin Cai, Hang Xu, Zongtai Li, Jinxi He, Jingfan Tang, Chen Lv, Ji Zhang, Yaqi Xie, Wenshan Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 提出Goal2Pixel范式,通过将连续环境中的视觉语言导航(VLN-CE)重新定义为可导航像素锚定,利用图像平面作为统一空间接口,预测可见导航像素并反投影为3D航点,结合可见性感知关键帧记忆和坐标感知辅助损失,在减少VLM调用次数的同时实现竞争性性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13190 2026-06-12 cs.RO cs.HC 新提交 79%

Multi-Modal Multi-Agent Robotic Cognitive Alignment enabled by Non-Invasive Consumer Brain Computer Interfaces: A Proof of Concept Exploration

基于非侵入式消费级脑机接口的多模态多智能体机器人认知对齐:概念验证探索

Nataliya Kosmyna, Liz Jenkins, Anoop K. Sinha

机构 * GOOGLE(谷歌) Paradigms of Intelligence(智能范式) Cambridge, MA, United States(马萨诸塞州剑桥市,美国) Mountain View, CA, United States(加利福尼亚州山景城,美国)

专题命中 具身导航 :robotic(title,abstract);分类 cs.RO

AI总结 提出一种框架,利用消费级脑机接口监测脑电信号,在高认知负荷时延迟智能体通信,实现认知对齐的多智能体交互,初步验证了实时信号处理、大语言模型与机器人结合的可行性。

Comments 19 pages, 9 figures, for associated video, see https://youtu.be/0Tav-G87XGs

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05121 2026-06-12 eess.SY cs.RO cs.SY 版本更新 79%

Trojan Attacks on Neural Network Controllers for Robotic Systems

针对机器人系统神经网络控制器的木马攻击

Farbod Younesi, Walter Lucia, Amr Youssef

机构 * Concordia University(康科德大学) Concordia Institute for Information Systems Engineering(康科德信息系统工程研究所) Fonds de recherche du Québec – Nature et Technologies(魁北克自然与技术研究基金) National Cybersecurity Consortium(国家网络安全联盟)

专题命中 具身导航 :robotic(title,abstract);分类 cs.RO

AI总结 针对机器人神经网络控制器,设计轻量级并行木马网络,在特定触发条件下篡改控制指令,通过仿真验证攻击有效性。

Comments Paper submitted to the 2026 IEEE Conference on Control Technology and Applications (CCTA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12579 2026-06-12 cs.RO 新提交 72%

G-MAPP: GPU-accelerated Multi-Agent Planning and Perception for Reactive Motion Generation

G-MAPP: 基于GPU加速的多智能体规划与感知用于反应式运动生成

Tanmay Bishnoi, Riddhiman Laha, Tobias Löw, Jose Alex Chandy, Luis F. C. Figueredo, Sami Haddadin

机构 * Department of Electrical, Computer, and Biomedical Engineering, Toronto Metropolitan University(多伦多都会大学电气、计算机与生物医学工程系) Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所) Institute for Experiential Robotics, Northeastern University(东北大学体验式机器人研究所) Idiap Research Institute(Idiap 研究所) EPFL(瑞士联邦理工学院洛桑) CHART Group at the School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院 CHART 小组) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 具身导航 :robotics(abstract,journal_ref);world model(abstract);分类 cs.RO

AI总结 提出GPU加速的框架,通过并行状态探索和紧密耦合感知-动作循环,实现非结构化环境中的实时反应式运动生成,在7自由度机器人上达到5倍加速并成功避障。

Comments The implementation is available at: https://github.com/chart-research/g-mapp

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7516-7523, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13488 2026-06-12 cs.CV 新提交 70%

Point-Wise Geometry-Aware Transformer for Partial-to-Full Point Cloud Registration in Computer-Assisted Surgery

面向计算机辅助手术中部分到完整点云配准的点级几何感知Transformer

Siyu Zhou, Zhongliang Jiang

机构 * The Chair for Computer Aided Medical Procedures, Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序教席) The University of Hong Kong(香港大学)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出GAPR-Net,一种结合卷积与Transformer的粗到细框架,通过交叉注意力融合局部与全局信息,并设计变换不变的点级几何特征,在四个骨骼数据集上实现94.2%配准召回率、1.992mm RMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13366 2026-06-12 cs.CV cs.MM 新提交 57%

Dual-Constrained Diffusion Image Compression for Operational Rate-Distortion-Perception Optimization

双约束扩散图像压缩用于操作率失真感知优化

Sanxin Jiang, Jiro Katto, Heming Sun

机构 * Shanghai University of Electric Power(上海电力大学) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 提出DCIC框架,结合学习编解码器和基于扩散的解码器,通过联合失真和等幂约束实现率失真感知帕累托前沿的连续导航,无需额外码率开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12852 2026-06-12 cs.AI 新提交 57%

WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning

WISE:具有Why-Which推理的Minecraft长时域智能体

Renmin Cheng, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 具身导航 :embodied agent(abstract);分类 cs.AI

AI总结 提出WISE框架,通过因果事件图增强情景记忆并解耦what-where-when与which-why推理,结合机会主义任务调度和多尺度探索,显著提升长时域稀疏任务的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏