arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 928 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 928 篇

2606.09777 2026-06-16 cs.RO 新提交 70%

AetheRock: An Arm-Worn Robot Teaching System for Force-Guided Vision-Tactile Learning

AetheRock: 一种用于力引导视觉触觉学习的臂戴式机器人教学系统

Hong Li, Yue Xu, Yihan Tang, Yankang Dong, Chenyuan Liu, Chenyang Yu, Xuyang Li, Siyuan Huang, Yujun Shen, Nan Xue, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出臂戴式设备AetheRock采集夹爪力、视觉和触觉数据,并设计ForceVT框架利用力和视觉引导触觉学习,解决力感知机器人学习中传感器装配不兼容问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14344 2026-06-15 cs.LG 新提交 70%

More with LESS -- Local Scene Representations for Tactile Imaging

用更少实现更多——局部场景表示用于触觉成像

Zohar Rimon, Elisei Shafer, Tal Tepper, Daniel Kozin, Alon Malka, Roy Holland, Aviv Tamar

机构 * Technion - Israel Institute of Technology(以色列理工学院) Rambam Health Care Campus(拉姆巴姆医疗中心)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 提出局部编码器空间感知(LESS)方法,通过局部感受野的循环编码器网格建模触觉场景,实现内部结构的2D/3D重建,在泛化、不确定性估计和手持成像上取得突破。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14250 2026-06-15 cs.RO 新提交 70%

SyLink Hand: A Synergy-Inspired Linkage-Driven Anthropomorphic Hand for Human-Like Dexterity

SyLink Hand:一种受协同作用启发的连杆驱动拟人手,实现类人灵巧性

Hao Wu, Yanzhe Wang, Yu Feng, Yitong Li, Jingxiang Guo, Jian Liu, Jianshu Zhou

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 受人类手部协同作用启发,提出SyLink Hand拟人灵巧手,通过生物力学协同原理与连杆驱动机构结合,在紧凑低成本架构中实现外观、运动学和功能的高度拟人化,验证了协同启发连杆设计有效平衡拟人度、机械简单性和功能多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12954 2026-06-12 cs.RO 新提交 70%

Towards Reliable Sequential Object Picking in Clutter: The Runner-up Solution to RGMC 2025

面向杂乱环境中的可靠顺序物体抓取:RGMC 2025 亚军方案

Wei Yu, Xidan Zhang, Ziyi Zheng, Weijie Kong, Huixu Dong

机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对杂乱环境中的顺序物体抓取任务,提出集成硬件-软件流水线,结合多功能夹爪设计与物体分布及遮挡关系新表示,实现高效识别、搜索与顺序抓取,获RGMC 2025亚军。

Comments First, Second and Third Coauthor contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12604 2026-06-12 cs.RO 新提交 70%

EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot Demonstrations

EgoEngine:从自我中心人类视频到高保真灵巧机器人演示

Yangcen Liu, Shuo Cheng, Xinchen Yin, Woo Chul Shin, Alfred Cueva, Yiran Yang, Zhenyang Chen, Chuye Zhang, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Tsinghua University(清华大学)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出EgoEngine框架,通过视觉和动作桥接,将自我中心人类视频转化为高保真机器人数据,首次实现零样本灵巧策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11982 2026-06-11 cs.LG 新提交 70%

PAWS: Preference Learning with Advantage-Weighted Segments

PAWS: 基于优势加权片段的首选学习

Aleksandar Taranovic, Onur Celik, Niklas Freymuth, Ge Li, Serge Thilges, Huy Le, Tai Hoang, Rania Rayyes, Gerhard Neumann

机构 * University of Freiburg(弗莱堡大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.LG

AI总结 针对偏好强化学习中训练与推理分布不匹配导致时间信用分配退化的问题,提出PAWS方法,利用片段级优势函数直接进行策略更新,在机器人操作和运动任务上优于现有方法。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10743 2026-06-10 cs.RO 新提交 70%

Hand-centric Human-to-Robot Trajectory Transfer from Video Demonstrations via Open-World Contact Localization

基于开放世界接触定位的以手为中心的人到机器人轨迹迁移

Yitian Shi, Di Wen, Zhengqi Han, Zicheng Guo, Yu Hu, Edgar Welte, Kunyu Peng, Rainer Stiefelhagen, Rania Rayyes

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出HOWTransfer框架,通过接触定位从人类视频中提取接触感知的机器人轨迹,无需物体特定描述,在多样化操作任务中实现86%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09798 2026-06-09 cs.RO 新提交 70%

SynManDex: Synthesizing Human-like Dexterous Grasps from Synthetic Human Pre-Grasps

SynManDex: 从合成人类预抓取中合成类人灵巧抓取

Yanming Shao, Zanxin Chen, Wenwei Lin, Mingjie Zhou, Tianxing Chen, Xiaokang Yang, Yichen Chi, Yao Mu

机构 * Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Shenzhen University(深圳大学) Fudan University(复旦大学) University of Hong Kong(香港大学) ZTE Corporation(中兴通讯股份有限公司)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出SynManDex流水线,利用生成的人类预抓取作为启发,通过机器人原生优化实现力闭合接触,生成类人灵巧抓取,在仿真和真实机器人上取得高成功率和类人性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08980 2026-06-09 cs.CV 新提交 70%

EPS3D: End-to-End Feed-Forward 3D Panoptic Segmentation

EPS3D: 端到端前馈式3D全景分割

Runsong Zhu, Jiaxin Guo, Xiaoyang Guo, Zhengzhe Liu, Ka-Hei Hui, Wei Yin, Kai Chen, Wei Chen, Weiqiang Ren, Yunhui Liu, Pheng-Ann Heng, Chi-Wing Fu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出端到端前馈框架EPS3D,通过蒸馏训练和多视图图像预测3D感知特征,结合互增强模块实现语义-实例一致性,在Replica上语义mIoU提升13%,每场景仅需1秒。

Comments ICML 2026. The code is publicly available at \href{https://github.com/Runsong123/EPS3D}{https://github.com/Runsong123/EPS3D}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08828 2026-06-09 cs.RO 新提交 70%

Video2Sim2Real: Full-Stack Autonomous Dexterous Skill Acquisition from a Single Human Video

Video2Sim2Real:从单个人类视频实现全栈自主灵巧技能获取

Yunhai Han, Jianuo Qiu, Linhao Bai, Ziyu Xiao, Zihang Zeng, Yangcen Liu, Zhaodong Yang, Shalin Jain, Wenrui Ma, Jiaqi Fu, Yuqian Zheng, Manisha Natarajan, Muhammad Zubair Irshad, Kenneth Shaw, Matthew Gombolay, Zsolt Kira, Harish Ravichandar

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Pennsylvania(宾夕法尼亚大学) Toyota Research Institute(丰田研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出Video2Sim2Real框架,从单个人类操作视频中重建数字孪生并提取运动先验,通过物体关键帧优化机器人配置,结合残差强化学习与碰撞感知规划,实现从仿真到真实世界的灵巧技能迁移。

Comments Website: https://video2sim2real.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08743 2026-06-09 cs.RO 新提交 70%

Guided Discovery of New Behaviors using Diffusion Policies

使用扩散策略引导发现新行为

Dian Yu, Sebastian Sanokowski, Majid Khadiv

机构 * Munich Institute of Robotics and Machine Intelligence, Technical University of Munich(慕尼黑工业大学慕尼黑机器人与机器智能研究所)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出结合Feynman-Kac校正器与引导势能的框架,从扩散策略中挖掘并优化罕见但可行的轨迹,再训练策略以系统发现多样化可执行行为。

Comments Preprint. Supplementary video: https://youtu.be/T7MUvMA67VM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07304 2026-06-08 cs.RO 新提交 70%

CAPE: Contrastive Action-conditioned Parallel Encoding for Embodied Planning

CAPE: 用于具身规划的条件对比动作并行编码

Cong Chen, Haowen Wang, Zhixiang Zhang, Pei Ren, Zhengping Che

专题命中 机器人操作 :embodied agent(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出CAPE框架,通过对比学习区分不同动作序列的未来结果,实现高效视觉动力学建模,在真实世界和零样本迁移任务中显著提升规划性能并降低推理成本。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06704 2026-06-08 cs.RO 新提交 70%

Optimal Control Approach for Non-prehensile Ball Juggling Using a 7-DoF Manipulator

使用7自由度机械臂进行非抓取式抛球的最优控制方法

Joel Ramadani, Vasilije Rakčević, Riddhiman Laha, Arne Sachtler, Valentin Le Mesle, Achim J. Lilienthal, Sami Haddadin

机构 * Technical University of Munich(慕尼黑技术大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) German Aerospace Center (DLR), Institute of Robotics and Mechatronics(德国航空航天中心(DLR)机器人与机电机构研究所)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种基于模型的两阶段最优控制框架,用于7自由度机械臂使用工具进行非抓取式抛球,生成周期性抛球轨迹并通过离线计算实现实时误差校正。

Comments 8 pages, accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00554 2026-08-04 cs.RO cs.AI cs.CV 新提交 67%

DexMani: Human-Derived Manipulability Guidance for Dexterous Rotation

DexMani:用于灵巧旋转的人类衍生可操作度引导

Xiaoyang Chen, Shengcheng Luo, Haoran Guo, Jiaming Jiang, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 DexMani框架通过迁移人类演示的接触条件可操作度演化引导强化学习,在多款机器人手上实现了更高的物体旋转成功率与更平稳的运动,且可跨本体迁移技能。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11807 2026-07-14 cs.HC 新提交 67%

HandPad: A Bimanual Hand Interface for Fluid Window Interactions in VR

HandPad:用于VR中流畅窗口交互的双手操作界面

Wen Ying, Adil Rahman, Erzhen Hu, Seongkook Heo

专题命中 机器人操作 :manipulation(abstract);navigation(abstract)

AI总结 研究针对VR中依赖外部设备限制移动使用的问题,提出HandPad双手交互技术,利用不对称双手协调等优势,实现多窗口导航等功能,经探索性研究验证其能高效、符合人体工程学地交互,有潜力成为VR无设备知识工作方法。

Comments Project page link: https://handpad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06134 2026-07-08 cs.CR 新提交 67%

Poster: Mind the Gap -- Characterizing the Temporal Blind Spot Between GSB and DNS Resolution

海报:注意差距——刻画谷歌安全浏览(GSB)与域名系统(DNS)解析之间的时间盲点

Tomer Gal, Fujiao Ji, Doowon Kim, Harel Israel Berger

专题命中 机器人操作 :manipulation(abstract);navigation(abstract)

AI总结 研究刻画谷歌安全浏览与DNS解析间时间差距,通过数据包捕获分析发现约79%测量有正时间差距,DNS响应滞后,复杂解析中或有安全隐患,为研究浏览器安全机制中基于时间的风险及缓解措施奠定基础。

Comments To appear in the proceedings of the 23rd Conference on Detection of Intrusions and Malware & Vulnerability Assessment (DIMVA '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17408 2026-06-17 cs.RO cs.CV cs.LG 新提交 67%

Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies

动作生成应从何处开始?面向生成式机器人策略的可学习源先验

Meipo Dai, Qiyuan Zhuang, He-Yang Xu, Ying-Jie Shuai, Yijun Wang, Qi Dou, Xiu-Shen Wei

机构 * Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出LeaP,用轻量MLP预测基于本体感知的对角高斯分布作为动作生成源先验,替代标准高斯分布,在15个RoboTwin任务中平均成功率81.6%,优于基线方法6.5-25.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14136 2026-06-15 eess.SY cs.SY 新提交 67%

Environment-Aware Stable Neural Koopman Dynamics Learning for Input-Driven Systems under Environmental Constraints

环境约束下输入驱动系统的环境感知稳定神经库普曼动力学学习

Lin Feng

专题命中 机器人操作 :manipulation(abstract);robotic(abstract)

AI总结 提出ESNKD框架,结合纤维束编码器、输入条件神经ODE、收缩合成层和LMI-ISS验证,实现环境变化下的稳定预测与安全认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10683 2026-06-12 cs.RO cs.AI cs.CV 新提交 67%

UniDexTok: A Unified Dexterous Hand Tokenizer from Real Data

UniDexTok:基于真实数据的统一灵巧手分词器

Dong Fang, Youjun Wu, Yuanxin Zhong, Rui Zhang, Yunlong Wang, Xiaosong Jia, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Hefei University of Technology(合肥工业大学) Rimbot Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出统一灵巧手模型(UDHM)将人手和机器人手状态映射到共享22自由度语义接口,并基于此开发UniDexTok,一种免重定向的状态分词器,学习基于真实关节状态的离散token,实现异构灵巧手的统一表示,误差降低98%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09811 2026-06-09 cs.RO cs.AI cs.CV 新提交 67%

AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing

AHA-WAM:异步自适应时域世界-动作建模与观测引导的上下文路由

Jisong Cai, Long Ling, Shiwei Chu, Zhongshan Liu, Jiayue Kang, Zhixuan Liang, Wenjie Xu, Yinan Mao, Weinan Zhang, Xiaokang Yang, Ru Ying, Ran Zheng, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Baidu AI Cloud(百度智能云) The University of Hong Kong(香港大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出AHA-WAM,一种基于双扩散Transformer的异步时域自适应世界-动作模型,通过低频世界规划器和高频动作执行器解耦时序,实现高效闭环控制,在RoboTwin和真实任务上达到SOTA性能。

Comments Project page: https://serene-sivy.github.io/aha-wam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06601 2026-06-08 cs.CV cs.AI cs.LG 新提交 67%

Direct 3D-Aware Object Insertion via Decomposed Visual Proxies

通过分解视觉代理实现直接3D感知物体插入

Jingbo Gong, Yikai Wang, Yushi Lan, Yuhao Wan, Ziheng Ouyang, Rui Zhao, Ming-Ming Cheng, Qibin Hou, Chen Change Loy

机构 * Google(谷歌) Black Forest Labs(黑森林实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出DIRECT框架,通过分解外观、几何和上下文引导,实现可控制3D姿态的物体插入,在几何可控性和视觉质量上优于现有方法。

Comments ICML 2026; Project Page: https://gong1130.github.io/DIRECT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13698 2026-07-16 cs.RO cs.CV 新提交 66%

Towards a Modular Bin-picking Framework for Handling Object Pose Uncertainties

迈向用于处理物体姿态不确定性的模块化抓取框架

Frederik Hagelskjær

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.CV;manipulation(comments)

AI总结 本文针对精确抓取应用中物体姿态估计和抓取过程的误差问题,提出模块化框架。通过物体姿态分布估计和第二视角模块降低姿态不确定性,用独立模块补偿抓取误差,经真实场景测试,该框架能提高效率,是解决相关不确定性的首个可互换模块框架。

Comments 7 pages, 5 figures, 1 table, keywords: bin picking; object manipulation; grasping strategies; object pose distribution estimation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08948 2026-07-13 cs.RO cs.CV 新提交 66%

SplatCtrl: Perception-Action Coupling via Gaussian Scene Representations and Reactive Robot Control

SplatCtrl:通过高斯场景表示和反应式机器人控制实现感知-动作耦合

Siddarth Jain, Ho Jin Choi

机构 * Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室) University of Pennsylvania(宾夕法尼亚大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.CV;robotics(comments)

AI总结 针对机器人在非结构化动态环境控制难题,提出SplatCtrl框架。基于3D高斯溅射,引入混合滤波和重定位策略用于场景重建,还提出从高斯推导距离函数的方法,纳入控制障碍函数,实现感知-动作耦合,经实验验证有效。

Comments Published in 2026 International Conference on Robotics and Automation (ICRA). 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09127 2026-08-11 cs.RO cs.GR 新提交 65%

High Fidelity Capture, Reconstruction, and Transfer of Human Demonstrations for Robot-Assisted Bathing

面向机器人辅助洗澡任务的人类演示的高保真捕捉、重建与迁移

Arjun S. Lakshmipathy, Jonathan P. King, Ethan Zuo, Rohit Satishkumar, Hongyi Chen, Jeffrey Ichnowski, Dan Ding, Zackory Erickson, Nancy S. Pollard

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) School of Health and Rehabilitation Sciences, University of Pittsburgh(匹兹堡大学健康与康复科学学院)

专题命中 机器人操作 :robotics(abstract,comments);分类 cs.RO

AI总结 针对机器人辅助洗澡任务中人类演示难以迁移的问题,提出以接触区域为核心的高保真处理框架,构建含多维度同步数据的数据集,实现灵巧软手完成洗澡任务,相关材料将公开以推动pHRI研究。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Official conference page: https://www.roboticsproceedings.org/rss22/p094.pdf

Journal ref Proceedings of Robotics: Science and Systems (RSS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11749 2026-08-13 cs.LG cs.AI stat.ML 新提交 62%

MOON: Multi-Objective OrthoNormalized Updates for Multitask Learning

MOON:面向多任务学习的多目标正交归一化更新方法

Shiji Zhou, Kunlin Lyu, Lei Zhang, Ruodong Wang, Yifan Sun

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对现有多任务学习方法忽略现代架构矩阵结构、优化效率受限的问题,提出MOON方法,在谱-核范数几何下进行梯度操作,理论与实验均表明其可提升优化效率和多任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 62%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09270 2026-08-11 cs.CV cs.AI cs.IR cs.MM 新提交 62%

GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views

GRASP:面向无人机视角细粒度跨模态理解的粒度感知区域对齐与语义原型学习

Jiahui Cui, Yan Zhao, Kan Wei, Enze Zhu, Peirong Zhang, Lei Wang, Yiru Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 机器人操作 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 针对无人机视角细粒度跨模态理解的背景杂波干扰与视觉同构歧义问题,提出GRASP框架,通过RFA和SPEM策略提升性能,在相关基准数据集上验证了有效性。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM Multimedia 2026, MM '26). 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03127 2026-08-05 cs.RO cs.AI 新提交 62%

DigitCode: Symbolic Tokenization of Hand Motion by Anatomical Units

DigitCode:基于解剖单元的手部运动符号分词

Haoyu Gu, Haotian Lu, Jingrun Du, Xiao-Ping Zhang

专题命中 机器人操作 :robot learning(abstract);分类 cs.RO、cs.AI

AI总结 本文提出DigitCode,沿手部解剖单元层次结构调整HL字母表以构建离散符号表征,将量化误差降低四分之三,发布HandTok测试平台,可用于修复生成的畸形手部及机器人重定向等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01899 2026-08-04 cs.CV cs.CL cs.LG 新提交 62%

SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

SpatioLM:面向视觉-语言模型的通用物理空间智能

Jing Wu, Jianhua Wu, Jiayi Guan, Jiahong Chen, Jinghui Lu, Hangjun Ye, Bingzhao Gao, Long Chen

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 SpatioLM是一种参数高效的视觉-语言模型,通过内置空间视觉模块和伪深度、相机监督提升空间智能,在VSI-Bench获71.6分,还可迁移至具身操纵任务,同时保留通用能力。

Comments 27 pages,13 figures,16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00931 2026-08-04 cs.RO cs.CV 新提交 62%

Stipple: Real-Time Incremental Gaussian Splatting with Visual-Inertial Tracking

Stipple:基于视觉-惯性跟踪的实时增量高斯溅射技术

Kilian Northoff, Mateo de Mayo, Daniel Cremers

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Stipple方法,结合Basalt视觉-惯性跟踪系统与Brush增量3D高斯溅射技术,实现实时同步跟踪重建,替代3DGS繁重步骤,为机器人与XR的实时3D重建提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏