arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-06 至 2026-08-06 共收录 20 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 20 篇

2608.04042 2026-08-06 cs.RO 新提交 88%

Kitchen Robotic Manipulation utilizing Foundation Models

基于基础模型的厨房机器人操作

Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

机构 * Kumoh National Institute of Technology(金乌国立技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO;robotics(comments)

AI总结 本研究提出一种整合多种基础模型的模块化厨房机器人感知流水线,经评估优化后可在杂乱遮挡场景下实现89.12%的ADI,无需环境重训练即可完成餐具处理等家庭操作任务。

Comments Intelligent Service Robotics (ISR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05042 2026-08-06 cs.RO 新提交 83%

BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

BridgeVLA++:一种面向三维操作的数据高效、可泛化且内存增强的视觉-语言-动作框架

Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges ByteDance Seed(字节跳动种子实验室)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本研究提出内存增强的三维VLA框架BridgeVLA++,通过新增时空记忆架构,在保留原模型数据效率与泛化能力的同时,提升了记忆相关操作性能,且在多任务与真实平台上验证了其有效性。

Comments This work has been submitted to the IEEE TPAMI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04196 2026-08-06 cs.RO cs.CV cs.LG 新提交 82%

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation

SiMDex:挖掘相似的自我中心视频以实现跨 embodiment 的灵巧操作

Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato

机构 * The University of Tokyo(东京大学) ByteDance Seed(字节跳动 Seed) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 该研究提出SiMDex框架,通过三层流程从海量自我中心人类视频中挖掘与任务相关的子集,用于VLA后训练,仅用少量样本便显著提升了机器人灵巧操作的成功率,证明选择性数据整理更有效。

Comments 12 pages, 4 figures. Project page: https://lin-nie.github.io/SiMDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15560 2026-08-06 cs.CR cs.AI cs.LG 交叉投稿 81%

Temporal Context Awareness: A Defense Framework Against Multi-turn Manipulation Attacks on Large Language Models

时序上下文感知:一种针对大型语言模型多轮操纵攻击的防御框架

Prashant Kulkarni, Assaf Namer

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI、cs.LG

AI总结 针对LLMs易受多轮操纵攻击的问题,本文提出TCA框架,通过分析语义漂移等实现防御,初步评估显示其能识别传统方法遗漏的微妙操纵模式,为对话式AI系统提供安全保障。

Comments 6 pages, 2 figures, IEEE CAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04425 2026-08-06 cs.RO 新提交 79%

SSC: A Verifiable Structured Representation for Bimanual Manipulation Labelling

SSC:用于双手操作标注的可验证结构化表示

Yupu Lu, Shuang Wu, Sihan Chen, Ruihua Han, Yichen Zhang, Marcus Kalander, Jia Pan

机构 * Artificial Intelligence Laboratory (Leibniz)(莱布尼茨人工智能实验室)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 针对操作标注的自然语言难验证、刚性模板过度分割问题,提出SSC结构化表示,在BEHAVIOR-1K上验证其逻辑与内容补全功能,评估13个VL模型并报告标注异常。

Comments 8 main pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04365 2026-08-06 cs.LG cs.CR cs.CY 新提交 79%

Manipulation-Proof Oblivious Audits against Deceptive Model Providers

针对欺骗性模型提供者的防操纵遗忘审计

Augustin Godinot, Sofiane Azogagh, Julien Ferry, Sébastien Gambs

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.LG

AI总结 本文提出新型防操纵遗忘审计协议,利用私有信息检索机制提升审计对模型提供者操纵行为的可检测性,实验验证其有效实用。

Comments This work has been accepted for publication at the 2026 AAAI/ACM Conference on AI, Ethics, and Society (AIES)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03387 2026-08-06 cs.RO 版本更新 79%

RoboReact: Agentic Skill Distillation from Generated Egocentric Videos for Generalizable Whole-Body Manipulation

RoboReact:基于生成的自我中心视频的智能体技能蒸馏,实现通用全身操控

Shuliang He, Shuai Wang, Bo Yue, Junchi Teng, Changyu Wang, Guiliang Liu

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本研究提出RoboReact框架,通过生成自我中心视频并结合视觉语言引导的闭环控制,实现人形机器人全身操控技能的通用获取,可在多样场景中稳健执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04798 2026-08-06 cs.HC 新提交 78%

Reference-Based Manipulation: A Framework and Pipeline for Multimodal Spatial Reasoning

基于参考的操作:多模态空间推理的框架与流程

Yangyang He, Zhuangze Hou, Yonglin Chen, Can Liu

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 本研究针对沉浸式平台中多模态空间交互问题,提出基于参考的操作框架,分解空间参考为源、锚点、框架组件,实现LLM驱动的流程并验证其效用,为空间交互设计提供关键经验。

Comments 16 pages, 10 figures. Accepted to the 39th Annual ACM Symposium on User Interface Software and Technology (UIST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04933 2026-08-06 cs.RO 新提交 74%

Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments

Mimir:面向交互环境中具身智能体的、具备动态 grounding 的神经符号记忆系统

Haoming Xu, Zhenlin He, Hengyi Wang, Jiafeng Xu, Hao Dong

专题命中 机器人操作 :embodied agent(title);分类 cs.RO

AI总结 本文提出Mimir,一种分离世界与任务记忆并具备动态grounding的神经符号记忆系统,在EB-ALFRED、EB-Habitat等具身任务中显著提升了智能体的长程执行成功率。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04673 2026-08-06 cs.CV cs.RO 新提交 73%

Differential 6-DOF Pose Estimation with Provable First-Order Immunity to Camera Calibration Errors

抗相机标定误差的可证一阶差分6自由度位姿估计

Yueqiang Zhang, Liang Deng, Yi Zhang, Baoqiong Wang, Wenjun Chen, Shuixin Pan, Yulan Guo, Qifeng Yu

机构 * Shenzhen University(深圳大学) Sun Yat-sen University(中山大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出差分6-DOF位姿估计方法,避免独立绝对位姿估计,可证抗一阶相机外参误差,在微运动估计上优于PnP等方法,单目、双目求解器精度与效率优异。

Comments 16 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04300 2026-08-06 cs.HC 新提交 71%

An immersive micro-manipulation system using real-time 3D imaging microscope and 3D operation interface for high-speed and accurate micro-manipulation

采用实时三维成像显微镜与三维操作界面的沉浸式显微操作系统,用于高速精准的显微操作

Kenta Yokoe, Tadayoshi Aoyama, Toshiki Fujishiro, Masaru Takeuchi, Yasuhisa Hasegawa

专题命中 机器人操作 :manipulation(title)

AI总结 针对辅助生殖技术中胚胎学家短缺的问题,提出结合实时3D成像显微镜与3D操作界面的沉浸式显微操作系统,经实验验证可提升移液管操作的速度与精准度。

Comments Published version. Originally published in ROBOMECH Journal (Springer, Open Access, CC BY 4.0)

Journal ref ROBOMECH Journal, vol. 9, article 16 (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05003 2026-08-06 quant-ph 新提交 71%

Universal linear manipulation via routing and projective measurements

基于路由和投影测量的通用线性操控

Alessio Baldazzi, Sonia Mazzucchi, Lorenzo Pavesi

专题命中 机器人操作 :manipulation(title)

AI总结 本研究提出基于路由和投影测量的方案,以最少元件实现通用线性幺正变换,推广至多光子散射玻色采样实验,且测试了其在损耗和相位噪声下的鲁棒性。

Comments 44 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04996 2026-08-06 cs.RO 新提交 70%

DreamWAM: Beyond RGB Future Prediction for World Action Models

DreamWAM:超越RGB未来预测的世界动作模型

Shanglin Yuan, Weiheng Zhao, Xin Shi, Haoyi Jiang, Xianda Guo, Liu Liu, Wenyu Liu, Wei Sui, Xinggang Wang

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO

AI总结 DreamWAM通过结构化超越RGB的世界建模,在LIBERO及真实操作任务中提升了世界动作模型的鲁棒性与成功率,相关代码模型已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18066 2026-08-06 cs.RO cs.AI cs.LG q-bio.QM 版本更新 67%

Arnold: A multi-task, multi-embodiment muscle transformer policy

Arnold:一种多任务、多 embodiment 的肌肉 Transformer 策略

Boshi An, Alberto Silvio Chiappa, Merkourios Simos, Chengkun Li, Alexander Mathis

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本研究开发了基于 Transformer 的肌肉控制策略 Arnold,结合行为克隆与强化学习,实现多任务多 embodiment 控制,性能优于单任务策略,还揭示了肌肉协同作用的任务特异性等特性。

Comments B.A., A.S.C. and M.S. contributed equally. Code is available at https://github.com/amathislab/arnold

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05101 2026-08-06 cs.CV cs.MM 新提交 57%

HexMIL: Hierarchical Attention MIL for Ante-Hoc Explainable Detection of AI-Manipulated CT Volumes

HexMIL:用于AI篡改CT体积事前可解释检测的分层注意力多实例学习

Orazio Pontorno, Luca Guarnera, Zahid Akhtar, Sebastiano Battiato

机构 * University of Catania(卡塔尼亚大学) State University of New York Polytechnic Institute(纽约州立大学理工学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 HexMIL是一种无掩码的医疗深度伪造检测器,采用分层注意力多实例学习,利用二元体积级监督实现AI篡改CT体积的事前可解释检测,在跨生成器泛化任务中性能优于基线。

Comments Accepted at ACM Multimedia 2026 (MM '26)

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10--14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15890 2026-08-06 cs.CV 版本更新 57%

Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting

Exo2EgoPose:利用外心演示进行视觉语言引导的自我中心3D手部姿态预测

Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Xiang Li, Hongliang Li

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究视觉语言引导的自我中心3D手部姿态预测任务,提出Exo2EgoPose框架,利用外心演示补偿自我中心视角线索不足,含双层外心重建模块和全局到局部调制模块,实验显示该方法优于现有技术,具备人机转移能力且有改进。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02915 2026-08-06 cs.RO 版本更新 57%

Zero-shot Sim2Real Transfer for Magnet-Based Tactile Sensor on Insertion Tasks

基于磁敏触觉传感器的零样本仿真到真实迁移在插入任务中的应用

Beining Han, Abhishek Joshi, Jia Deng

机构 * Princeton University(普林斯顿大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 针对磁敏触觉传感器的仿真到真实差距问题,提出新型GCS技术,实现了盲插入任务中基于原始触觉读数的RL策略零样本仿真到真实迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04707 2026-08-06 cs.HC 新提交 50%

LiverPlan: A Stage-Adaptive Immersive Visual Analytics Framework for Anatomical Liver Surgical Planning

LiverPlan:用于解剖性肝手术规划的阶段自适应沉浸式视觉分析框架

Qixuan Liu, Shi Qiu, Xiwen Wu, Yuqi Tong, Yinqiao Wang, Ruiyang Li, Jialun Pei, Shengdong Zhao, Chi-Wing Fu, Pheng-Ann Heng

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究提出LiverPlan阶段自适应沉浸式视觉分析框架,解决现有2D桌面肝手术规划工具的三大局限,经8名外科医生的对照研究,该框架可显著提升规划效率、降低认知负担并优化安全标准的主动优化。

Comments VIS 2026, to appear in TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04475 2026-08-06 cs.HC 新提交 50%

Super-Gaussian: Interactive Scene Editing for 3D Gaussian Splatting and NLI-Based Volume Visualization in Virtual Reality

超高斯:虚拟现实中面向三维高斯溅射与基于自然语言交互的体可视化的交互式场景编辑

Suemin Jeon, Kaiyuan Tang, Chaoli Wang, Won-Ki Jeong

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究针对VR中体可视化的渲染成本与交互问题,提出Super-Gaussian框架,结合三维高斯溅射、特征感知聚类、分层选择-细化工作流与NLI,实现高效直观的体数据交互编辑与分析

Comments IEEE VIS 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10153 2026-08-06 quant-ph 版本更新 50%

An Interpretation of Bunched Logic for Reasoning about Heap-Manipulating Quantum Programs

用于推理堆操作量子程序的束逻辑解释

Bonan Su, Li Zhou, Yuan Feng, Mingsheng Ying

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文针对堆操作量子程序的正确性推理挑战,提出了一种束逻辑的量子解释,首次给出分离蕴涵的量子解释,构建了支持局部推理且相对完备的量子分离逻辑。

详情

展开后加载摘要…

URL PDF HTML 收藏