arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-13 至 2026-08-13 共收录 37 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 11 篇

2608.12122 2026-08-13 cs.RO cs.CV 新提交 82%

HandEdit: A Unified Benchmark for Egocentric Human-to-Robot Dexterous Hand Image Editing

HandEdit:用于自我中心视角下人类到机器人灵巧手图像编辑的统一基准

Zhenjie Yang, Xingyu Jiao, Guopeng Zhong, Shuzhe Yang, Shi Che, Chao Wu, Chenyu Jiang, Dongjie Zhang, Yideng Zhang, Zheng Zhang, Muyun Jiang, Haisheng Su, Shuang Jin, Donghang Zhang, Chao Yang, Li Chen, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan

专题命中 机器人操作 :robotics(abstract);embodied AI(abstract);manipulation(abstract);robotic(abstract)

AI总结 HandEdit是含2亿+实例、覆盖26种URDF的统一具身感知图像编辑基准,用于弥合人类与机器人数据差异,可评估11种图像编辑基线,助力具身人工智能发展。

Comments Technical Report. Project Page: https://handedit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12197 2026-08-13 eess.SY cs.AI cs.SY 新提交 79%

NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation

NetlistBench:评估大型语言模型在SPICE网表识别与操作中的可靠性

Jiarui Ma, Jianghan Wang, Yuheng Ma, Ziyi Zhuang, Xiaoguang Liu

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI

AI总结 研究针对LLMs在SPICE网表识别与操作中的可靠性,构建含2342个案例的NetlistBench基准,发现其性能随结构复杂度变化,为电路设计自动化提供关键瓶颈参考。

Comments accepted by MLCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11769 2026-08-13 cs.RO 新提交 79%

Policy-Induced Hand Priors in Humanoid Dual-Arm Manipulation: Diagnosing and Mitigating Initial-Pose Dependence

人形双臂操纵中的策略诱导手部先验:诊断与缓解初始位姿依赖

Chaeyeon Jung, Juyoun Park

机构 * Center for Humanoid Research, Korea Institute of Science and Technology (KIST)(韩国科学技术研究院类人机器人研究中心)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本研究针对人形双臂操纵中VLA策略的初始位姿依赖问题,量化策略诱导手部先验,发现扩大训练数据初始位姿覆盖可提升稳健性,为缓解该依赖提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11655 2026-08-13 cs.CV cs.AI 新提交 79%

Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting

运动即提示:通过运动引导的跨帧视觉提示增强多模态大语言模型的运动推理能力

Xikai Sun, Kebin Liu, Haotian Wang, Li Liu, Xu Wang, Yunhao Liu

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文针对多模态大语言模型处理视频时丢失帧间关键运动信息的问题,提出Motion-as-Prompt框架,通过标记轨迹增强视觉提示,在CLEVRER等数据集上提升GPT-5.5的运动推理准确率且不影响非运动理解

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11749 2026-08-13 cs.LG cs.AI stat.ML 新提交 62%

MOON: Multi-Objective OrthoNormalized Updates for Multitask Learning

MOON:面向多任务学习的多目标正交归一化更新方法

Shiji Zhou, Kunlin Lyu, Lei Zhang, Ruodong Wang, Yifan Sun

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对现有多任务学习方法忽略现代架构矩阵结构、优化效率受限的问题,提出MOON方法,在谱-核范数几何下进行梯度操作,理论与实验均表明其可提升优化效率和多任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12273 2026-08-13 cs.CR cs.AI 新提交 57%

Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

收敛式绕路劫持:基于技能的大语言模型智能体中的任务保留型资源放大

Junliang Liu, Ruoyu Li, Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Jingheng Xu, Laizhong Cui

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 该研究提出收敛式绕路劫持攻击,耦合LLM智能体技能选择与规划阶段,可放大任务资源消耗,在DeepSeek-V4-Pro上80.02%的任务会被选中攻击者控制的协调器,任务完成率不变但成本显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11574 2026-08-13 cs.CV 新提交 57%

Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands

手部可见性检测器:针对手部关键点的逐点可见性估计

Ryosei Hara, Masashi Hatano, Rintaro Yanagi, Atsushi Hashimoto, Takuma Yagi, Mariko Isogawa

机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司) The University of Tokyo(东京大学) Keio University(庆应义塾大学) National Institute of Advanced Industrial Science Technology (AIST)(日本产业技术综合研究所)

专题命中 机器人操作 :robotics(abstract);分类 cs.CV

AI总结 本研究提出Hand Visibility Detector,将逐关节手部可见性估计作为独立任务研究,利用预训练HPE模型作骨干实现高性能,其可见性加权三角化可降低3D手部姿态标注的重投影误差。

Comments Code: https://github.com/ryhara/hand_visibility_detector

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12172 2026-08-13 cs.MA 新提交 50%

Rethinking Agent Security as a Networking Problem

将智能体安全重新思考为一个网络问题

Van Tran, Taveesh Sharma, Tajveer Singh Dhesi, Nick Feamster

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究针对现有以智能体为中心的安全防御无法可靠防范AI智能体风险的问题,借鉴网络领域原则,提出结合确定性执行与语义策略的AI智能体安全系统设计思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11708 2026-08-13 cs.HC cs.GR 新提交 50%

A Browser-Based Gesture-Driven Avatar Interaction Framework for Metaverse Onboarding Environments

面向元宇宙入门环境的基于浏览器的手势驱动虚拟化身交互框架

Deepti Parachuri, Chhayank Sahu, Sameer Singh Choudhary

专题命中 机器人操作 :navigation(abstract)

AI总结 本文提出一种面向元宇宙入门环境的基于浏览器的手势驱动交互框架,结合Google MediaPipe手势识别与两种移动技术,经5人评估验证,实现无控制器的轻量交互。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12135 2026-08-13 quant-ph 新提交 50%

The Min-Rains Relative Entropy Is Not Tight for Exact PPT Entanglement Distillation

最小-雷恩斯相对熵对于精确PPT纠缠蒸馏并不紧

Chengkai Zhu, Xin Wang

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究否定了最小-雷恩斯相对熵是精确PPT纠缠蒸馏紧界的猜想,通过引入新的单字母上界,揭示了PPT操作下精确纠缠操纵的微妙渐近结构。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11718 2026-08-13 quant-ph physics.optics 新提交 50%

Experimental quantum telecloning across silicon photonic chips

硅光子芯片间的实验量子远程克隆

Zicong Wen, Kai Wang, Bochi Wu, Leizhen Chen, Yan-Qing Lu, Shining Zhu, Xiao-Song Ma

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究人员利用硅光子平台,通过光纤连接的两个光子芯片实现1对2对称量子远程克隆,片间克隆保真度78.45±1.39%,为大规模量子网络奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 5 篇

2608.11876 2026-08-13 cs.RO cs.HC 新提交 83%

D3D-GEN: Robot-Aware Domain-Grounded Interactive 3D World Generation for Social Robotics

D3D-GEN:面向社交机器人的机器人感知、领域锚定的交互式3D世界生成

Anh Duc Do, Volodymyr Scherbyna, Tai Duc Nguyen, Spaarsh Thakkar, Zhengcheng Shen, Teham Buiyan, Archan Misra, Linh Kästner

机构 * Singapore Management University(新加坡管理大学) Technical University Berlin(柏林工业大学) Max Planck Institute(马克斯·普朗克研究所) Technical University Braunschweig(布伦瑞克工业大学)

专题命中 具身导航 :robotics(title);embodied AI(abstract);navigation(abstract);分类 cs.RO

AI总结 D3D-GEN是一种新型3D世界生成系统,结合领域智能体与RAG流水线,可快速生成领域锚定的交互式3D世界,已构建多领域数据库并生成数十种仿真环境,适配Isaac Sim等仿真器。

Comments 8 pages, 5 figures, and 5 tables. Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11597 2026-08-13 cs.RO cs.LG 新提交 81%

IoT-Enabled Autonomous Maritime Navigation in Smart Ports: A Curriculum-Guided Shared Policy Learning Framework

智能港口中基于物联网的自主海上航行:课程引导的共享策略学习框架

Yuqing Lin, Rangya Zhang, Kum Fai Yuen

机构 * Nanyang Technological University(南洋理工大学) School of Civil and Environmental Engineering(土木与环境工程学院) School of Mechanical and Aerospace Engineering(机械与航空航天工程学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.LG

AI总结 针对智能港口IoT自主海上设备的导航挑战,提出课程引导共享策略学习框架,经模拟验证其可靠性、避碰性等优于基线方法,可有效泛化到高密度场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11485 2026-08-13 cond-mat.mtrl-sci 新提交 78%

Advances and opportunities for automated robotic preparation of 2D materials and fabrication of 2D heterostructures

二维材料自动化机器人制备及二维异质结构制备的进展与机遇

S. Davari, D. L. Duong, T. Faltermeier, J. A. Goss, A. Hasani, D. Kotekar-Patil, J. Peabody, S. Wyss, H. O. H. Churchill, N. J. Borys

专题命中 具身导航 :robotic(title,abstract)

AI总结 本文综述了二维材料及异质结构自动化机器人制备的进展,指出人工制备已达极限,需AI驱动的自动化工具推动该领域向新前沿发展。

Journal ref Shiva Davari et al 2026 2D Mater. 13 032004

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11895 2026-08-13 cs.RO cs.MA 新提交 61%

Scalable Multi-Agent Maze Traversal with Local Communication

带局部通信的可扩展多智能体迷宫遍历

Julian Rau, Jahir Argote-Gerald, Grace McFassel, Genki Miyauchi, Paul Trodden, Roderich Groß

机构 * Technical University of Darmstadt(达姆施塔特工业大学) The University of Sheffield(谢菲尔德大学) University of Bristol(布里斯托尔大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 针对通信受限的未知迷宫环境,提出基于局部通信与主从机制的分布式多智能体遍历算法,其性能接近最优全知策略,且在多智能体场景下优于朴素基线。

Comments This manuscript has been accepted for publication in the proceedings of the World Symposium on the Algorithmic Foundations of Robotics (WAFR 2026), to be published by Springer in the Springer Proceedings in Advanced Robotics (SPAR) series

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11364 2026-08-13 cs.HC 新提交 50%

QUARTZ: Qualitative Understanding via Accessible Representation and Visualization

QUARTZ:通过可访问表示与可视化实现定性理解

Omar Khan, JooYoung Seo

专题命中 具身导航 :navigation(abstract)

AI总结 该研究针对盲人和低视力研究者无法访问定性数据可视化的问题,提出基于网络的QUARTZ系统,通过用户研究揭示相关障碍并提出设计准则,以提升该群体参与定性研究的可访问性。

Comments 24 pages, accepted at ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 2 篇

2608.12078 2026-08-13 cs.CV cs.AI cs.LG 新提交 83%

Better Slots, Better Worlds: Representation Quality & Robustness in Object-Centric World Models

更好的槽,更好的世界:以对象为中心的世界模型中的表示质量与鲁棒性

Shukrullo Nazirjonov, Sai Prasanna, Anna Manasyan, Georg Martius

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 该研究通过受控实验分析以对象为中心的世界模型,发现槽质量与规划成功率正相关,槽绑定良好时可减少辅助输入,且在分布偏移下其鲁棒性优于LeWM,预训练特征是鲁棒性关键因素。

Comments Published at Model-Based RL in the Era of Generative World Models Workshop at RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11601 2026-08-13 cs.CV 新提交 79%

How Can Driving World Models Do Counterfactual Prediction?

驾驶世界模型如何能进行反事实预测?

Jiaru Zhang, Can Cui, Yi Xu, Xin Ye, Ruqi Zhang, Ziran Wang

机构 * Purdue University(普渡大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文指出驾驶世界模型的反事实预测目标与直接动作条件预测存在根本差距,构建基准验证该问题,并提出简单无训练流程提升反事实预测效果,呼吁开发更好的相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 3 篇

2608.12308 2026-08-13 cs.CV cs.AI 新提交 84%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 机器人基础模型 :navigation(title,abstract);embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11363 2026-08-13 cs.RO cs.LG 新提交 73%

Adaptation of Generalist Robot Policies with Minimal Data

基于最少数据的通用机器人策略适配

Shreyas Kowshik, Sreyas Venkataraman, Leo Wang, Niharika Pant, Max Simchowitz, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人基础模型 :robot learning(abstract);robot policy(abstract);分类 cs.RO、cs.LG

AI总结 本文提出MiDAS算法,结合离线行为克隆与在线强化学习,实现机器人策略仅用1次演示即可完成任务适配,性能优于基线且能泛化,为机器人自主学习提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11739 2026-08-13 cs.RO cs.AI 新提交 62%

G0.5: One Autoregressive Stream for Robot Reasoning and Action

G0.5:用于机器人推理与动作的单自回归流

Yicheng Liu, Zibin Dong, Baijun Ye, Tianyuan Yuan, Tao Jiang, Anqi Yang, Shicheng Cao, Haonan Liu, Yue Sun, Zihan Guo, Xiao Liu, Dong Ke, Changxun Pan, Chenru Wu, Tailai Cheng, Xiaoshu Ren, Xinlei Zhang, Jianning Cui, Zijie Zhao, Haoyu Zhang, Kaiming Xu, Haodong Yang, Bowen Zhang, Jiahui Niu, Shaoting Zhu, Shiduo Zhang, Hang Zhao

机构 * Galaxea(星系科技(Galaxea))

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出G0.5,一种单自回归流的VLA模型,通过三个关键组件实现推理与动作统一,在7项基准中超越现有最优模型,展现出良好的泛化与指令跟随能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 3 篇

2608.12063 2026-08-13 cs.RO cs.AI 新提交 81%

Learning Loco-Manipulation From SMPC Demonstrations With Sparse Offline-to-Online RL

基于稀疏离线到在线强化学习从SMPC演示中学习移动操作

Martin Schuck, Maks Sorokin, Simone Manni, Duy Ta, Angela P. Schoellig, Marco Hutter, Simon Le Cleac'H, Jan Brüdigam

机构 * RAI Institute(RAI研究所) Technical University of Munich(慕尼黑工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究利用仿真中SMPC生成的离线数据,结合稀疏奖励训练离策略RL智能体,整合动态稳定性控制器,实现机器人移动操作技能的仿真到真实迁移,性能超越原最优控制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11350 2026-08-13 cs.CL cs.RO 新提交 79%

Self-Evolving Embodied Agents via Skill-Harness Evolution

基于技能-工具链进化的自演化具身智能体

Peidong Wang, Zhiming Ma, Ying Chang, Xufang Luo, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * Microsoft Research(微软研究院) Northeastern University(东北大学)

专题命中 模仿学习与强化学习 :embodied agent(title,abstract);分类 cs.RO

AI总结 提出免训练的SHAPER框架,通过演化技能与工具链实现冻结模型驱动的自演化具身智能体,在VLABench等数据集上验证其适配优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12306 2026-08-13 cs.LG cs.AI 新提交 73%

Redistribution-based Cost Inference Improves Sparse Safe Offline RL

基于重分配的代价推断改进稀疏安全离线强化学习

Ebenezer Gelo, Geraud Nangue Tasse, Steven James, Benjamin Rosman

机构 * University of the Witwatersrand(威特沃特斯兰德大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 针对安全离线强化学习中稀疏轨迹级停止反馈问题,提出RCI框架转换为密集每步代价,经理论证明转换无损,实验在两类任务上违规率更低且鲁棒性好。

Comments Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), affiliated with IJCAI/ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 人机交互与遥操作 3 篇

2608.12145 2026-08-13 cs.CV cs.LG 新提交 62%

Autonomous Telerehabilitation via Skeletal Motion Prediction and Joint-Level Performance Assessment

基于骨骼动作预测与关节级性能评估的自主远程康复

Lara Pereira, João Ruivo Paulo, Pedro Santos, Paulo Peixoto

机构 * Institute of Systems and Robotics(系统与机器人研究所) University of Coimbra(科英布拉大学)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种基于骨骼动作预测与关节级性能评估的双模块远程康复系统,其动作分类与预测模块在对应基准上表现优异,为自主反馈式远程康复提供了新方案。

Comments Accepted at IEEE RO-MAN2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11540 2026-08-13 eess.SY cs.AI cs.CY cs.SY 新提交 57%

A Conceptual Framework for Enhancing Workforce Readiness for Smart Manufacturing in the AI Era

AI时代提升智能制造劳动力准备度的概念框架

Dalton Ross Smith, Wilburn Whittington, Alejandro Martinez, Aidan Duncan, Gang Li

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.AI

AI总结 针对AI时代智能制造劳动力能力缺口,本文提出含九个阶段、四个支柱的WRL框架,经89个顶点项目验证可诊断能力差距,为教育等领域提供循证工具,未来将校准支柱权重并测试信效度。

Comments 30 pages, 11 figures, submission for ASEE Journal of Engineering Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11417 2026-08-13 cs.RO cs.HC cs.SY eess.SY 新提交 57%

Locomotion Variability and User Experience in Smart Wheelchair Human-Robot Interaction

智能轮椅人机交互中的运动变异性与用户体验

Sean Kille, Adina M. Panchea, Balint Varga, Sören Hohmann

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Université de Sherbrooke(谢布鲁克大学)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 该研究在智能轮椅共享控制场景中,提出保留自然运动结构的支持自主辅助策略,发现其在任务表现相当的情况下,能提升用户感知自主感与有用性,凸显设计辅助机器人需尊重人类运动结构的重要性。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 机器人数据与评测 8 篇

2608.11901 2026-08-13 cs.RO 新提交 83%

DaViNCi: A Dataset Towards Outdoor Vision-and-Language Navigation with Continuous Actions and Dynamic Elements

DaViNCi:面向包含连续动作与动态元素的户外视觉语言导航的数据集

Zihao Xie, Pingrui Lai, Yitong Wu, Hua Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出首个同时包含连续动作与动态元素的户外视觉语言导航数据集DaViNCi,通过实验验证其挑战性,为推动户外VLN向更真实环境发展提供实用支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11246 2026-08-13 cs.AI cs.LG cs.RO 新提交 82%

Towards the Harness of Embodied Agents

迈向具身智能体的管控

Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出名为Thea的具身智能体管控系统,通过场景图和退出码评估弥合物理世界与智能体的差距,实现长程任务完成。

Comments Project page: https://eit-hai.github.io/thea

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11564 2026-08-13 cs.CV cs.RO 新提交 62%

Repurposing RGB-based Foundation Model for Depth Estimation on Thermal Images Using Hierarchical Supervision

利用分层监督将基于RGB的基础模型重新用于热图像的深度估计

Jie Hong, Tingtian Li, Xuesong Li, Xiao Li

机构 * The University of Hong Kong(香港大学) Commonwealth Scientific and Industrial Research Organisation (CSIRO)(英联邦科学与工业研究组织)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对热图像深度估计中RGB基础模型分层表示利用不足的问题,提出RGB-HS框架,通过分层监督和基于图像质量的标记加权对齐,在基准上实现了有竞争力的性能。

Comments Accepted in IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏