arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-15 至 2026-06-15 共收录 16 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 6 篇

2602.01948 2026-06-15 cs.RO 版本更新 76%

A Unified Control Architecture for Macro-Micro Manipulation using a Active Remote Center of Compliance for Manufacturing Applications

面向制造应用的宏微操作统一控制架构:基于主动远程柔顺中心

Patrick Frank, Christian Friedrich

机构 * Institute for Robotics and Intelligent Production Systems University of Applied Sciences Karlsruhe (HKA)(机器人与智能生产系统研究所 卡尔施塔特应用科学大学(HKA))

专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)

AI总结 提出一种将宏操作器纳入主动交互控制的新架构,相比现有领先-跟随方法将控制带宽提升2.1倍,相比传统力控制提升12.5倍,并引入替代模型简化控制器设计。

Comments 17 pages, 14 figures, submitted to Robotics and Computer-Integrated Manufacturing (RCIM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05230 2026-06-15 cs.CV cs.RO 版本更新 73%

Digital Twin Driven Textile Classification and Foreign Object Recognition in Automated Sorting Systems

数字孪生驱动的自动化分拣系统中的纺织品分类与异物识别

Serkan Ergun, Tobias Mitterer, Hubert Zangl

机构 * Institute of Smart Systems Technologies(智能系统技术研究所) University of Klagenfurt(克雷格弗特大学) AAU SAL USE Laboratory(AAU SAL USE实验室) Silicon Austria Labs(硅 Austria 实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出一种数字孪生驱动的机器人分拣系统,结合抓取预测、多模态感知和视觉语言模型,实现纺织品分类与异物检测,Qwen模型准确率达87.9%。

Comments 10 pages,single column, 5 figures, preprint for Photomet Edumet 2026 (Klagenfurt, Austria)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23336 2026-06-15 cs.IR cs.CL cs.LG 版本更新 57%

Efficient Rationale-based Retrieval: On-policy Distillation from Generative Rerankers based on JEPA

高效基于理由的检索:基于JEPA的生成重排序器的在线蒸馏

Teng Chen, Sheng Xu, Feixiang Guo, Xiaoyu Wang, Qingqing Gu, Hongyan Li, Luo Ji

机构 * Geely AI Lab(吉利人工智能实验室)

专题命中 机器人操作 :robotic(abstract);分类 cs.LG

AI总结 本文提出Rabtriever,通过在线蒸馏从生成重排序器中学习,将查询和文档独立编码,提升检索效率,同时在多个任务中表现优异。

Comments 11 pages, 8 figures. ICMR 2026 (https://youtu.be/apDcrzEVwq4)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19115 2026-06-15 cs.CV 版本更新 57%

FBSDiff++: Improved Frequency Band Substitution of Diffusion Features for Efficient and Highly Controllable Text-Driven Image-to-Image Translation

FBSDiff++: 改进的扩散特征频带替换用于高效且高度可控的文本驱动图像到图像翻译

Xiang Gao, Yunpeng Jia

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出FBSDiff++框架,通过动态频带替换扩散特征,实现无需训练的文本驱动图像到图像翻译,支持外观、布局和轮廓引导,并大幅提升推理速度(8.9倍),支持任意分辨率输入和局部编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20021 2026-06-15 cond-mat.mtrl-sci cond-mat.mes-hall 版本更新 50%

Spin Response Properties in Electronically Robust Ferromagnetic Strained CrSiSe$_3$ Monolayer under External Electric Fields

在外部电场下电子稳健的铁磁应变CrSiSe3单层的自旋响应特性

S. Solihin, Ahmad R. T. Nugraha, Muhammad Aziz Majidi

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究通过第一性原理计算探讨了外部电场下应变工程化的铁磁CrSiSe3单层的电子、拓扑、磁声学和磁光特性,发现其电荷部分在0.3V/Å电场下具有极强的稳健性,而自旋自由度则表现出高度可调性,电场调控自旋 Berry 式曲率并增强自旋霍尔电导,同时外部电场调节集体磁声子激发,从而建立了一种稳定的自旋电子器件平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15741 2026-06-15 physics.optics 版本更新 50%

Singular value decomposition to describe bound states in the continuum in periodic metasurfaces

奇异值分解描述周期超表面中的连续谱束缚态

Nikita Ustimenko, Ivan Fernandez-Corbaton, Carsten Rockstuhl

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出利用有效转移矩阵和散射矩阵的奇异值分解,给出BIC形成的通用条件,并通过多极共振阵列验证了该方法在预测BIC位置及准BIC行为上的有效性。

Comments submitted to Phys. Rev. B

Journal ref Phys. Rev. B 113, 235418 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 3 篇

2512.21201 2026-06-15 cs.RO cs.AI cs.CV 版本更新 85%

Schrödinger's Navigator: Imagining an Ensemble of Futures for Zero-Shot Object Navigation

薛定谔的导航者:为零样本目标导航设想未来轨迹集合

Yu He, Da Huang, Zhenyang Liu, Zixiao Gu, Qiang Sun, Guangnan Ye, Yanwei Fu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Shanghai University of International Business and Economics(上海对外经贸大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出一种信念感知框架,在推理时通过轨迹条件化的3D世界模型设想多个未来场景,结合自适应遮挡物感知采样和未来感知价值图,提升零样本目标导航在遮挡严重环境中的隐蔽目标发现和风险感知路径选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14154 2026-06-15 cs.RO 版本更新 83%

Cross-Stage Sensorimotor Perception Scheduling and Sparse Map Encoding for Efficient Edge Embodied Navigation

跨阶段感知运动调度与稀疏地图编码用于高效边缘具身导航

Yaotian Liu, Sri Sai Rakesh Nakkilla, Xiangyu Zhou, Yu Cao, Jeff Zhang

机构 * Arizona State University(亚利桑那州立大学) University of Minnesota(明尼苏达大学)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO

AI总结 针对边缘设备上具身导航的延迟和内存瓶颈,提出SKIP调度器(基于安全跳过准则)和SCOUT稀疏编码器,实现1.7倍加速、50.5%内存降低和7.1% SPL提升。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16413 2026-06-15 eess.SY cs.SY 版本更新 50%

Hierarchical Distributed Architecture for the Least Allan Variance Atomic Timing

最小Allan方差原子定时的分层分布式架构

Jiayu Chen, Takahiro Kawaguchi, Yuichiro Yano, Yuko Hanado, Takayuki Ishizaki

专题命中 具身导航 :navigation(abstract)

AI总结 提出一种基于微型原子钟组的分层分布式定时架构,通过下层分布式控制实现短期同步,上层监督器在正常/应急模式下分别锚定标准时间或最优浮动控制,使生成时标的Allan方差在1秒至数天内达10^{-23}量级。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 2 篇

2602.01801 2026-06-15 cs.CV cs.AI 版本更新 81%

Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention

快速自回归视频扩散与世界模型:基于时间缓存压缩与稀疏注意力

Dvir Samuel, Issar Tzachor, Matan Levy, Michael Green, Gal Chechik, Rami Ben-Ari

机构 * Hebrew University of Jerusalem(特拉维夫大学) Google Research(谷歌研究)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出FAST-AR框架,通过TempCache压缩KV缓存、AnnCA加速交叉注意力、AnnSA稀疏化自注意力,实现自回归视频扩散模型5-10倍加速,同时保持视觉质量并稳定GPU内存使用。

Comments Accepted to ICML 2026. Project Page: https://dvirsamuel.github.io/fast-auto-regressive-video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10886 2026-06-15 cs.CL 版本更新 50%

MET-Bench: Multimodal Entity Tracking for Evaluating the Limitations of Vision-Language and Reasoning Models

MET-Bench:用于评估视觉语言与推理模型局限性的多模态实体追踪

Vanya Cohen, Raymond Mooney

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 具身推理 :world model(abstract)

AI总结 提出MET-Bench多模态实体追踪基准,发现视觉语言模型在图像实体追踪上显著弱于文本,主要源于视觉推理缺陷,强化学习可提升模态内性能但跨模态迁移不足。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 2 篇

2603.18464 2026-06-15 cs.LG 版本更新 83%

AcceRL: A Distributed Asynchronous Reinforcement Learning and World Model Framework for Vision-Language-Action Models

AcceRL: 面向视觉-语言-动作模型的分布式异步强化学习与世界模型框架

Chengxuan Lu, Shukuan Wang, Yanjie Li, Yingying Fang, Huoyan Wang, Tian Zhang, Wei Liu, Shiji Jin, Fuyuan Qian, Peiming Li, Chao Xu, Baigui Sun, Yang Liu

机构 * IROOTECH TECHNOLOGY Wolf 1069 b Lab, Sany Group(伊罗科技沃尔夫1069b实验室,三一集团)

专题命中 模仿学习与强化学习 :world model(title,abstract);embodied AI(abstract);分类 cs.LG

AI总结 提出AcceRL框架,通过物理隔离环境交互、模型推理和梯度更新实现分布式异步强化学习,消除同步系统的空闲气泡,提升硬件利用率,并支持即插即用的世界模型集成,在LIBERO任务上实现2.4倍吞吐加速和200倍样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25025 2026-06-15 cs.RO cs.SY eess.SY 版本更新 70%

Micro-Swarm Locomotion Optimization in Dynamic Flow using Multi-Objective Multi-Agent Reinforcement Learning

动态流场中微群集运动优化的多目标多智能体强化学习方法

Josef Berman, Oren Gal

机构 * Hatter Department of Marine Technologies, Leon H. Charney School of Marine Sciences, University of Haifa(哈特尔海洋技术系,列昂·H·夏恩海洋科学学院,海法大学)

专题命中 模仿学习与强化学习 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出混合CFD与多目标多智能体强化学习框架,通过PCGrad解决梯度冲突,在振荡流中优化微机器人集群的上游推进、能量效率和运动平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 1 篇

2604.01463 2026-06-15 cs.RO cs.AI cs.HC 版本更新 62%

Low-Burden LLM-Based Preference Learning: Personalizing Assistive Robots from Natural Language Feedback for Users with Paralysis

基于低负担LLM的偏好学习:通过自然语言反馈为瘫痪用户个性化辅助机器人

Keshav Shankar, Dan Ding, Wei Gao

机构 * Electrical and Computer Engineering(电气与计算机工程) Rehabilitation Science and Technology(康复科学与技术)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对严重运动障碍用户,提出一种低负担离线框架,利用大语言模型将非结构化自然语言反馈转化为确定性机器人控制策略,并通过职业治疗框架解码用户需求,显著降低用户负担。

Comments Accepted to IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他机器人 2 篇

2503.19947 2026-06-15 cs.CV cs.AI 版本更新 62%

Vanishing Depth: Training Generalized Depth Adapters with Sinusoidal Depth Preprocessing for Pretrained RGB Encoders

消失深度:基于正弦深度预处理的预训练RGB编码器通用深度适配器训练

Paul Koch, Jörg Krüger

机构 * Fraunhofer IPK(弗劳恩霍夫研究所) TU-Berlin(技术大学柏林)

专题命中 其他机器人 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 提出自监督训练方法,为预训练RGB编码器添加深度适配器,结合正弦深度编码实现通用鲁棒的深度特征提取,在分割、姿态估计和深度补全等下游任务中提升基线性能,SUN-RGBD分割达56.05 mIoU。

Comments Accepted to IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05407 2026-06-15 cs.AI 版本更新 57%

PRISM: Perception Reasoning Interleaved for Sequential Decision Making

PRISM: 感知与推理交错用于序列决策

Mohamed Salim Aissi, Clemence Grislain, Clement Romac, Laure Soulier, Mohamed Chetouani, Olivier Sigaud, Nicolas Thome

机构 * Institut National de la Recherche Scientifique (INRS)(国家科学研究院)

专题命中 其他机器人 :embodied agent(abstract);分类 cs.AI

AI总结 提出PRISM框架,通过动态问答流水线紧密耦合视觉语言模型(VLM)和语言模型(LLM),实现任务驱动的感知,在ALFWorld和R2R基准上显著超越现有图像模型。

详情

展开后加载摘要…

URL PDF HTML 收藏