arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-11 至 2026-08-11 共收录 190 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 3 篇

2608.09853 2026-08-11 cs.RO cs.CV cs.LG 新提交 87%

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

RynnValue:基于时间距离扩展机器人价值基础模型

Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

机构 * DAMO Academy, Alibaba Group(达摩院(阿里巴巴集团)) Hupan Lab(湖畔实验室)

专题命中 机器人学习 :robotic(title,abstract);robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 该研究提出开源机器人价值基础模型 RynnValue,以时间距离为监督目标,在多维度超越现有方法,可提升机器人策略的真实世界任务成功率并实现零样本泛化。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07558 2026-08-11 cs.RO cs.CV 新提交 84%

Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning

学习物理交互:触觉与力感知机器人学习综述

Shilin Shan, Chuhao Zhou, Ruize Wang, Xinyan Chen, Xiangyu Chen, Xinyu Zhou, Boyu Ma, Iris Yuxuan Hu, Jingliang Li, Celeste Yuxuan Hu, Geng Li, Guohao Chen, Tianrui Zhu, Zhe Li, Yanjie Ze, Haoran Geng, Zhiyang Dou, Jianxin Bi, Yuejiang Liu, Jianshu Zhou, Jiachen Li, Paul Liang, Tatsuya Harada, Robert Katzschmann, Harold Soh, Na Li, Edward Johns, Danica Kragic, Jan Peters, Wojciech Matusik, Masayoshi Tomizuka, Jitendra Malik, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Stanford University(斯坦福大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院) The University of Tokyo(东京大学) ETH Zurich(苏黎世联邦理工学院) Harvard University(哈佛大学) Imperial College London(伦敦帝国学院) KTH Royal Institute of Technology(瑞典皇家理工学院) Technical University of Darmstadt(达姆施塔特工业大学)

专题命中 机器人学习 :robot learning(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本综述针对力与触觉感知机器人学习研究的空白,提出TF-ART分类法,整合多模态感知与多阶段系统设计视角,兼具算法与实践意义。

Comments 53 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05234 2026-08-11 cs.RO cs.LG 版本更新 62%

OLIVE: Online Low-Rank Incremental Learning for Efficient Adaptive Exoskeletons

OLIVE: 面向高效自适应外骨骼的在线低秩增量学习

Dong Liu, Yanxuan Yu, Ben Lengerich, Tong Geng, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Rice University(里奇大学)

专题命中 机器人学习 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 提出OLIVE框架,通过低秩残差分解和奖励驱动策略梯度实现外骨骼控制的在线个性化自适应,在多种地形上提升步态平滑度、降低努力并增强稳定性。

Comments Accepted to UbiComp / ISWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 56 篇

2608.09778 2026-08-11 cs.RO 新提交 88%

RoboSeg: Online Part-Level Semantic Reconstruction for Robotic Manipulation via a Single Eye-in-Hand Camera

RoboSeg:基于单眼在手相机的机器人操作的在线部件级语义重建

Zhaochen Lan, Mengxiang Lin

机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 RoboSeg是无需CAD模型的部件级语义重建系统,结合VLM、TSDF融合与SAM3,实现机器人操作的部件语义索引,在24次物理试验中21次完成综合任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07553 2026-08-11 cs.RO 新提交 88%

Self Supervised Learning from Automatically Generated Demonstrations for Visual Robotic Manipulation

面向视觉机器人操纵的自动生成演示的自监督学习

Andres Rivas, Anselmo R. Cukla, Rodrigo S. Guerra, Bruna V. Guterres, Ricardo B. Grando

机构 * Technological University of Uruguay(乌拉圭技术大学) Federal University of Santa Maria(圣玛丽亚联邦大学) Federal University of Rio Grande(里奥格兰德联邦大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 该研究提出一种基于ROS 2和Isaac Sim的自监督视觉机器人操纵方法,通过自动生成演示训练卷积网络,在仿真和真实UR5e机器人上验证了其抓取成功率,为视觉操纵提供了低部署成本的方案。

Comments Paper accepted at the ICCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22122 2026-08-11 cs.RO cs.AI cs.CL cs.CV 版本更新 87%

REMAC: Self-Reflective and Self-Evolving Multi-Agent Collaboration for Long-Horizon Robot Manipulation

REMAC:用于长时程机器人操作的自反思与自进化多智能体协作框架

Puzhen Yuan, Angyuan Ma, Yunchao Yao, Huaxiu Yao, Masayoshi Tomizuka, Mingyu Ding

专题命中 机器人操作 :manipulation(title,abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本研究提出REMAC自适应多智能体规划框架,通过自反思与自进化实现多机器人长时程任务规划,在RoboCasa基准测试中使任务平均成功率提升40%、执行效率提升52.7%。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24744 2026-08-11 cs.RO cs.CV 版本更新 86%

Data Pyramid for Embodied Manipulation: A Survey

用于具身操纵的数据金字塔

Yifan Ye, Yankai Fu, Yaoxu Lv, Bohan Hou, Jun Cen, Lingdong Kong, Duo Zheng, Tianxing Chen, Jiaming Liu, Ziang Cao, Yunfan Lou, Wei Chow, Xian Sun, Yingshuo Wang, Kuangzhi Ge, Xiaowei Chi, Xidong Zhang, Zhibo Pang, Yiwu Zhong, Sirui Han, Zhihe Lu, Weihao Yuan, Qifeng Chen, Michael Yu Wang, Yao Mu, Ziwei Liu, Jianfei Yang, Ping Luo, Shanghang Zhang

机构 * PKU(北京大学) NTU(南洋理工大学) HKUST(香港科技大学) NUS(新加坡国立大学) CUHK(香港中文大学) HKU(香港大学) Duke(杜克大学) UCB(加州大学伯克利分校) GBU(未提及具体中文名的机构) NJU(南京大学) SJTU(上海交通大学)

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 研究围绕具身操纵数据生态系统展开,构建跨越五个互补数据源的“数据金字塔”,通过数据配方分析具身基础模型,将数据组成与多种能力联系起来,并讨论了六个开放挑战,为下一代具身系统设计奠定基础。

Comments Awesome Embodied Data Pyramid; Project Page at https://jasper-aaa.github.io/embodied-data-pyramid/ GitHub Repo at https://github.com/worldbench/awesome-embodied-data-pyramid

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08183 2026-08-11 cs.RO 新提交 85%

Multi-modal Interactive Control of Robotic Arm based on Offline Large Language Models

基于离线大语言模型的机械臂多模态交互控制

Hanxiao Chen

机构 * University of Tokyo(东京大学)

专题命中 机器人操作 :robotic(title,abstract);embodied AI(abstract);manipulation(abstract);分类 cs.RO

AI总结 该研究提出“Socratic Models-ChatGLM”算法,基于离线开源大语言模型与PyBullet平台实现机械臂多模态交互控制,可降低成本并解决复杂多步骤机械操作任务。

Comments This research work has been accepted for poster presentation at ICRA 2026 MEI (Multimodal Embodied Interaction in Robots) Workshop. (Here is the workshop-version short paper.)

Journal ref https://ieeexplore.ieee.org/abstract/document/11371765; 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09303 2026-08-11 cs.RO cs.LG 新提交 84%

SAFE-CHEM: Uncertainty-Aware Policy Switching for Robust Robotic Chemistry

SAFE-CHEM:面向稳健机器人化学的不确定性感知策略切换

Laura Jones, Shazil Shahzad, Ayesha Sana, Gabriella Pizzuto

机构 * School of Computer Science & Informatics, University of Liverpool(利物浦大学计算机科学与信息学院) Department of Chemistry, University of Liverpool(利物浦大学化学系)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本研究针对机器人化学实验的安全风险,提出SAFE-CHEM不确定性感知框架,通过混合控制架构在不确定性超阈值时切换至备份控制器,提升任务成功率并减少安全违规,实现零样本仿真到真实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07746 2026-08-11 cs.LG cs.RO 新提交 84%

LUCID: Latent-Skill Unified Control via Imagined Dynamics for Long-Horizon Humanoid Loco-Manipulation

LUCID:基于想象动力学的潜在技能统一控制用于长程人形机器人移动操作

Cheng Guo, Mingzhe Ni, Angelo Cangelosi, Arash Ajoudani

专题命中 机器人操作 :manipulation(title,abstract);world model(abstract);分类 cs.RO、cs.LG

AI总结 该研究针对人形机器人长程移动操作的复杂序列任务,提出分层基于模型的强化学习框架LUCID,经模拟多物体重排实验验证,其任务成功率优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09771 2026-08-11 cs.RO 新提交 83%

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

SLIM-0.5B:学习机器人操作的动作基础预测隐变量

Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

机构 * Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 机器人操作 :manipulation(title,abstract);world model(abstract);分类 cs.RO

AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。

Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09762 2026-08-11 cs.RO 新提交 83%

Efficient Real-World Online Reinforcement Learning for Robot Manipulation via Centralized Training and Critic Decomposition

基于集中式训练与评论者分解的高效真实世界机器人操作在线强化学习

Changhao Li, Yifang Zhang, Heng Zhang, Davide Torielli, Damiano Gasperini, Arturo Laurenzi, Luca Muratore, Arash Ajoudani, Nikos Tsagarakis

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) University of Genova(热那亚大学) TU Delft(代尔夫特理工大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文针对真实世界机器人操作在线强化学习的局限,提出结合CTDE与HRA的框架,在多任务实验中大幅提升了样本效率与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09125 2026-08-11 cs.RO 新提交 83%

Trajectory Divergence Horizon Decision for Reliable Dual-Arm Surgical Subtask Manipulation

可靠双臂手术子任务操作的轨迹发散 horizon 决策

Mingwu Su, Guankun Wang, Jinsong Lin, Rulin Zhou, Ziyi Hao, Zhiwei Fang, Huxin Gao, Jiewen Lai, Jiazheng Wang, Fan Zhang, Hongliang Ren

机构 * The Chinese University of Hong Kong (CUHK)(香港中文大学) Huawei Technologies Co. Ltd.(华为技术有限公司) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 针对现有VLA策略在手术操作中易累积误差的问题,提出TDHD机制,构建双臂手术基准并收集600个演示,实验显示其可提升器械和组织操作的成功率。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07230 2026-08-11 cs.CV 版本更新 83%

PhyEdit: Towards Real-World Object Manipulation via Physically-Grounded Image Editing

PhyEdit: 通过物理基础图像编辑实现真实世界物体操作

Ruihang Xu, Dewei Zhou, Xiaolong Shen, Fan Ma, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室人工智能研究所ReLER实验室)

专题命中 机器人操作 :manipulation(title,abstract);world model(abstract);分类 cs.CV

AI总结 PhyEdit通过结合显式几何模拟与2D-3D监督,提升图像编辑中物理准确性和操作一致性,引入RealManip-10K数据集和ManipEval基准测试,优于现有方法。

Comments Code: https://github.com/nenhang/PhyEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01414 2026-08-11 cs.RO 版本更新 83%

Learning When to See and When to Feel: Adaptive Vision-Torque Fusion for Contact-Aware Manipulation

学习何时视觉何时触觉:适应性视觉-扭矩融合用于接触感知操控

Jiuzhou Lei, Chang Liu, Yu She, Xiao Liang, Minghui Zheng

机构 * Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) Zachry Department of Civil and Environmental Engineering, Texas A&M University(德州农工大学扎克里土木与环境工程系)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出适应性视觉-扭矩融合策略,通过比较不同融合方法提升机器人操控性能,实验显示方法在成功率上优于基线14%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08009 2026-08-11 cs.CV cs.AI 新提交 81%

Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation

基于证据的取证推理:检测与定位多模态媒体篡改

Yichun Yeh, Yiheng Li, Xiaobo Hu, Zhen Lei, Yang Yang

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.CV

AI总结 本文针对多模态媒体篡改检测与定位问题,提出基于证据的取证推理框架,结合锚定-验证推理链、可验证奖励系统与模态解耦优势路由机制,实现最优性能与可解释性的统一。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09731 2026-08-11 cs.RO cs.MM 新提交 79%

TAMS: Task-Aware Multi-View Adaptive Streaming for Wireless Telerobotic Manipulation

TAMS:面向无线遥机器人操作的任务感知多视角自适应流

Zexin Deng, Zhenhui Yuan, Lu Tian, Subhash Lakshminarayana, Longhao Zou

机构 * Pengcheng Laboratory(鹏城实验室) Southern Univ. of Sci. & Tech.(南方科技大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 TAMS系统可根据无线遥机器人操作阶段动态分配多视角视频比特率,经6-DoF遥操作测试,其缩短任务时间、提升成功率,性能优于均等及静态分配基线。

Comments 6 pages, 5 figures, 2 tables. Code available at: https://github.com/Dzxx623/TAMS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09410 2026-08-11 cs.RO 新提交 79%

Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation

权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习

Yunhao Zhao, Zhenyang Ni, Haoyang Chen, Ruohan Zhang, Qi Zhu

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。

Comments 9 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09381 2026-08-11 cs.RO 新提交 79%

JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

JEPA-WAM:基于联合嵌入世界建模的视觉-语言-动作策略学习

Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

机构 * XYZ Embodied AI(XYZ具身智能)

专题命中 机器人操作 :world model(title);manipulation(abstract);分类 cs.RO

AI总结 该研究提出JEPA-WAM,一种构建于预训练V-JEPA空间的隐式WAM,通过共享预测器耦合隐式转移预测与动作生成,在LIBERO-Plus等数据集上取得优异的机器人操作策略性能,且泛化能力强。

Comments 22 pages, 7 figures. Project page: https://spritewithoutice.github.io/JEPA_WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09198 2026-08-11 cs.RO 新提交 79%

Ultra-Low-Impedance Robotic Gripper for High-Bandwidth and Transparent Physical Interaction

用于高带宽透明物理交互的超低阻抗机器人夹爪

Joon Lee, Ari Choi, Seokhwan Jeong

机构 * Sogang University(西江大学)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO

AI总结 该研究提出新型9自由度三指差动直接驱动夹爪,结合低减速比差动传动,实现低阻抗、高带宽透明物理交互,解决力矩与硬件复杂度的权衡,为无传感器力估计提供基础。

Comments ICRA 2027 (Late Breaking Rsult Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07576 2026-08-11 cs.RO cs.CG 新提交 79%

Reconfigurable Structural Robotic Assembly: Interlocking 3D Aggregations with Self-Aligning Compound Nested Lattice Modules

可重构结构机器人装配:采用自对准复合嵌套晶格模块的互锁三维集合体

Alexander Htet Kyaw, Miana Smith, Paul Richard, Neil Gershenfeld

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO

AI总结 本研究将几何智能编码入结构化材料系统,提出自对准复合嵌套晶格模块,实现三维互锁装配,经测试模块刚度等性能达标,可重复使用支持可重构建造。

Comments Accepted to the 46th Annual Conference for the Association for Computer Aided Design in Architecture (ACADIA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06375 2026-08-11 cs.RO 版本更新 79%

$ω$-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation

ω-0:一种用于类人机器人协同移动操作的潜在预测世界动作模型

Zhe Li, Zhenzhe Zhang, Yangyang Wei, Wenjie Zhang, Xichen Yuan, Peiyuan Zhi, Gen Li, Xinying Guo, Fengjie Gao, Jianfei Yang, Shanghang Zhang

机构 * NTU(南洋理工大学) PKU(北京大学) BAAI(北京智源人工智能研究院) HKUST(GZ)(香港科技大学(广州))

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本文提出 ω-0 模型,针对类人机器人协同移动操作问题,结合潜在视觉预见与扩散动作生成,在 11 项家庭任务上优于多个基线,还构建了 ω-HOME 数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02968 2026-08-11 cs.IR 78%

FlippedRAG: Black-Box Opinion Manipulation Adversarial Attacks to Retrieval-Augmented Generation Models

FlippedRAG: 黑盒意见操控对抗攻击针对检索增强生成模型

Zhuo Chen, Yuyang Gong, Jiawei Liu, Miaokun Chen, Haotan Liu, Qikai Cheng, Fan Zhang, Wei Lu, Xiaozhong Liu

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 本文提出FlippedRAG,一种针对黑盒RAG模型的对抗攻击方法,通过逆向工程检索器和污染触发器实现对意见操控的高效攻击。

Comments Accepted by 32nd ACM Conference on Computer and Communications Security (ACM CCS 2025)

Journal ref CCS '25: Proceedings of the 2025 ACM SIGSAC Conference on Computer and Communications Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08839 2026-08-11 cs.RO cs.CV 新提交 73%

SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models

SG-WAM:面向世界-动作模型的文本 grounded 与空间感知语义引导

Junjie He, Junfeng Li, Zhide Zhong, Haodong Yan, Ruixin Li, Yangyang Zheng, Jiaguan Zhu, Tianran Zhang, Yuqiao Du, Wen Chen, Shunbo Zhou, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ola Dimensions(奥拉维度公司)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对现有世界-动作模型(WAM)存在的视频与指令语义不对齐问题,提出基于视觉-语言模型(VLM)的SG-WAM语义引导方法,通过注入文本接地且空间感知的语义前瞻,提升了WAM的指令遵循与操纵精度,经仿真和真实实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07714 2026-08-11 cond-mat.str-el cond-mat.mtrl-sci 新提交 71%

Engineering correlated phases through manipulation of Van Hove singularities

通过操纵范霍夫奇点工程化关联相

Thomas P. Sheerin, Maria Ramirez, Chris A. Hooley, Luke C. Rhodes

专题命中 机器人操作 :manipulation(title)

AI总结 本研究通过两种重整化群方法,改变跳跃参数调控范霍夫奇点,揭示其对关联电子系统有序相的影响,为量子材料设计提供调控规则。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05868 2026-08-11 cs.RO 版本更新 70%

AnyCamVLA: Zero-Shot Camera Adaptation for Viewpoint Robust Vision-Language-Action Models

AnyCamVLA: 零样本相机适应用于视角鲁棒的视觉-语言-动作模型

Hyeongjun Heo, Seungyeon Woo, Sang Min Kim, Junho Kim, Junho Lee, Yonghyeon Lee, Young Min Kim

机构 * Department of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 AnyCamVLA通过零样本相机适应提升视觉-语言-动作模型在视角变化下的鲁棒性,适用于任何RGB策略。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07558 2026-08-11 cs.CV cs.LG cs.RO 版本更新 67%

Unsupervised Point Cloud Registration with Self-Distillation

基于自蒸馏的无监督点云配准

Christian Löwens, Thorben Funke, André Wagner, Alexandru Paul Condurache

专题命中 机器人操作 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文针对点云配准依赖真实位姿标注的问题,提出自蒸馏无监督方法,在3DMatch基准上优于现有方法,且可泛化至汽车雷达场景。

Comments Oral at BMVC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09127 2026-08-11 cs.RO cs.GR 新提交 65%

High Fidelity Capture, Reconstruction, and Transfer of Human Demonstrations for Robot-Assisted Bathing

面向机器人辅助洗澡任务的人类演示的高保真捕捉、重建与迁移

Arjun S. Lakshmipathy, Jonathan P. King, Ethan Zuo, Rohit Satishkumar, Hongyi Chen, Jeffrey Ichnowski, Dan Ding, Zackory Erickson, Nancy S. Pollard

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) School of Health and Rehabilitation Sciences, University of Pittsburgh(匹兹堡大学健康与康复科学学院)

专题命中 机器人操作 :robotics(abstract,comments);分类 cs.RO

AI总结 针对机器人辅助洗澡任务中人类演示难以迁移的问题,提出以接触区域为核心的高保真处理框架,构建含多维度同步数据的数据集,实现灵巧软手完成洗澡任务,相关材料将公开以推动pHRI研究。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Official conference page: https://www.roboticsproceedings.org/rss22/p094.pdf

Journal ref Proceedings of Robotics: Science and Systems (RSS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09270 2026-08-11 cs.CV cs.AI cs.IR cs.MM 新提交 62%

GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views

GRASP:面向无人机视角细粒度跨模态理解的粒度感知区域对齐与语义原型学习

Jiahui Cui, Yan Zhao, Kan Wei, Enze Zhu, Peirong Zhang, Lei Wang, Yiru Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 机器人操作 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 针对无人机视角细粒度跨模态理解的背景杂波干扰与视觉同构歧义问题,提出GRASP框架,通过RFA和SPEM策略提升性能,在相关基准数据集上验证了有效性。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM Multimedia 2026, MM '26). 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18587 2026-08-11 cs.CV cs.AI 版本更新 62%

HyperFake: Hyperspectral Reconstruction and Attention-Guided Analysis for Advanced Deepfake Detection

HyperFake:用于高级深度伪造检测的高光谱重建与注意力引导分析

Pavan C Shekar, Pawan Soni, Vivek Kanhangad

机构 * Department of Electrical Engineering, Indian Institute of Technology Indore(印度理工学院印度尔分校电子工程系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 HyperFake是首个利用高光谱成像重建的深度伪造检测方法,通过改进的MST++架构、光谱注意力机制与EfficientNet分类器,从RGB视频重建31通道高光谱数据,实现了更准确且泛化性更强的深度伪造检测。

Comments 6 pages, 3 figures, 1 table. Preliminary results on FaceForensics++ dataset. First approach to use hyperspectral reconstruction for deepfake detection

详情

展开后加载摘要…

URL PDF HTML 收藏