arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-13 至 2026-08-13 共收录 19 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 19 篇

2606.17598 2026-08-13 cs.RO cs.CV 版本更新 90%

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation

MuseVLA: 一种用于机器人操作的自适应多模态感知视觉-语言-动作模型

Xingyuming Liu, Ruichun Ma, Heyu Guo, Qixiu Li, Qingwen Yang, Lin Luo, Shiqi Jiang, Chenren Xu, Jiaolong Yang, Baining Guo

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Microsoft Research Asia(微软亚洲研究院) Princeton University(普林斯顿大学) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.CV

AI总结 提出MuseVLA模型,通过将传感器作为按需工具集成,实现自适应多模态感知;设计传感器图像统一表示,并引入数据合成流水线,在灵巧手操作任务中平均成功率80.6%,显著优于RGB-only和多模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12908 2026-08-13 cs.RO 版本更新 89%

Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models

机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干

Zijian Song, Qichang Li, Jiawei Zhou, Zhenlong Yuan, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) X-Era AI Lab(X-Era人工智能实验室) AMAP, Alibaba(阿里妈妈实验室) Guangdong University of Technology(广东工业大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);world model(abstract);分类 cs.RO

AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11109 2026-08-13 cs.RO 版本更新 83%

FEWT: Frequency-Enhanced Wavelet-based Transformer for Multimodal Wheeled Bimanual Manipulation

FEWT:用于多模态轮式双臂操作的频率增强型小波Transformer

Jiaxin Huang, Hanyu Liu, Yunsheng Ma, Jian Shen, Yilin Zheng, Jiayi Wen, Zhigong Song

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本研究针对轮式双臂操作的空间视觉与物理动力学表示不匹配问题,提出FEWT框架,整合FE-EMA与TS-DWT模块并结合STF传感器,在模拟及真实操作任务中较基准取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12122 2026-08-13 cs.RO cs.CV 新提交 82%

HandEdit: A Unified Benchmark for Egocentric Human-to-Robot Dexterous Hand Image Editing

HandEdit:用于自我中心视角下人类到机器人灵巧手图像编辑的统一基准

Zhenjie Yang, Xingyu Jiao, Guopeng Zhong, Shuzhe Yang, Shi Che, Chao Wu, Chenyu Jiang, Dongjie Zhang, Yideng Zhang, Zheng Zhang, Muyun Jiang, Haisheng Su, Shuang Jin, Donghang Zhang, Chao Yang, Li Chen, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan

专题命中 机器人操作 :robotics(abstract);embodied AI(abstract);manipulation(abstract);robotic(abstract)

AI总结 HandEdit是含2亿+实例、覆盖26种URDF的统一具身感知图像编辑基准,用于弥合人类与机器人数据差异,可评估11种图像编辑基线,助力具身人工智能发展。

Comments Technical Report. Project Page: https://handedit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12197 2026-08-13 eess.SY cs.AI cs.SY 新提交 79%

NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation

NetlistBench:评估大型语言模型在SPICE网表识别与操作中的可靠性

Jiarui Ma, Jianghan Wang, Yuheng Ma, Ziyi Zhuang, Xiaoguang Liu

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.AI

AI总结 研究针对LLMs在SPICE网表识别与操作中的可靠性,构建含2342个案例的NetlistBench基准,发现其性能随结构复杂度变化,为电路设计自动化提供关键瓶颈参考。

Comments accepted by MLCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11769 2026-08-13 cs.RO 新提交 79%

Policy-Induced Hand Priors in Humanoid Dual-Arm Manipulation: Diagnosing and Mitigating Initial-Pose Dependence

人形双臂操纵中的策略诱导手部先验:诊断与缓解初始位姿依赖

Chaeyeon Jung, Juyoun Park

机构 * Center for Humanoid Research, Korea Institute of Science and Technology (KIST)(韩国科学技术研究院类人机器人研究中心)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本研究针对人形双臂操纵中VLA策略的初始位姿依赖问题,量化策略诱导手部先验,发现扩大训练数据初始位姿覆盖可提升稳健性,为缓解该依赖提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11655 2026-08-13 cs.CV cs.AI 新提交 79%

Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting

运动即提示:通过运动引导的跨帧视觉提示增强多模态大语言模型的运动推理能力

Xikai Sun, Kebin Liu, Haotian Wang, Li Liu, Xu Wang, Yunhao Liu

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文针对多模态大语言模型处理视频时丢失帧间关键运动信息的问题,提出Motion-as-Prompt框架,通过标记轨迹增强视觉提示,在CLEVRER等数据集上提升GPT-5.5的运动推理准确率且不影响非运动理解

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11749 2026-08-13 cs.LG cs.AI stat.ML 新提交 62%

MOON: Multi-Objective OrthoNormalized Updates for Multitask Learning

MOON:面向多任务学习的多目标正交归一化更新方法

Shiji Zhou, Kunlin Lyu, Lei Zhang, Ruodong Wang, Yifan Sun

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对现有多任务学习方法忽略现代架构矩阵结构、优化效率受限的问题,提出MOON方法,在谱-核范数几何下进行梯度操作,理论与实验均表明其可提升优化效率和多任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12273 2026-08-13 cs.CR cs.AI 新提交 57%

Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

收敛式绕路劫持:基于技能的大语言模型智能体中的任务保留型资源放大

Junliang Liu, Ruoyu Li, Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Jingheng Xu, Laizhong Cui

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 该研究提出收敛式绕路劫持攻击,耦合LLM智能体技能选择与规划阶段,可放大任务资源消耗,在DeepSeek-V4-Pro上80.02%的任务会被选中攻击者控制的协调器,任务完成率不变但成本显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11574 2026-08-13 cs.CV 新提交 57%

Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands

手部可见性检测器:针对手部关键点的逐点可见性估计

Ryosei Hara, Masashi Hatano, Rintaro Yanagi, Atsushi Hashimoto, Takuma Yagi, Mariko Isogawa

机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司) The University of Tokyo(东京大学) Keio University(庆应义塾大学) National Institute of Advanced Industrial Science Technology (AIST)(日本产业技术综合研究所)

专题命中 机器人操作 :robotics(abstract);分类 cs.CV

AI总结 本研究提出Hand Visibility Detector,将逐关节手部可见性估计作为独立任务研究,利用预训练HPE模型作骨干实现高性能,其可见性加权三角化可降低3D手部姿态标注的重投影误差。

Comments Code: https://github.com/ryhara/hand_visibility_detector

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09989 2026-08-13 eess.IV cs.CV 版本更新 57%

Algorithmic statistics of retinal images

视网膜图像的算法统计学

Loan Huynh, Ronald Zambrano, Layton Aho, Fabio Lavinsky, Gadi Wollstein, Joel S. Schuman, Andrew R. Cohen

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文针对三维视网膜图像的分析问题,提出结合归一化压缩距离与各向异性结构增强滤波器的度量学习方法,其预测误差优于非度量深度学习方法,还提出归一化压缩向量用于可视化变化模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11952 2026-08-13 cs.RO 版本更新 57%

Deformable In-Hand Slip-Aware Tactile Sensor with Integrated Velocity, Force/Torque, and Pressure Map Sensing

可变形手内滑移感知触觉传感器,集成速度、力/力矩和压力图传感

Gabriel Arslan Waltersson, Yiannis Karayiannidis

机构 * Chalmers University of Technology(查尔姆斯理工大学) Lund University(隆德大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出一种新型触觉传感器,通过可变形接触垫集成速度、力/力矩和压力图传感,实现手内操作的滑移感知控制,并支持快速低成本制造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14419 2026-08-13 cs.CL cs.LG 交叉投稿 57%

WavePhaseNet: A DFT-Based Method for Constructing Semantic Conceptual Hierarchy Structures (SCHS)

WavePhaseNet:一种基于离散傅里叶变换(DFT)的构建语义概念层次结构(SCHS)方法

Kiyotaka Kasubuchi, Kazuo Fukiya

机构 * Pionira Solutions LLC(皮奥尼拉解决方案有限公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 WavePhaseNet通过DFT构建语义概念层次结构,利用频谱分析和上同调正则化实现语义一致性控制,减少维度以提升推理能力并抑制幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12172 2026-08-13 cs.MA 新提交 50%

Rethinking Agent Security as a Networking Problem

将智能体安全重新思考为一个网络问题

Van Tran, Taveesh Sharma, Tajveer Singh Dhesi, Nick Feamster

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究针对现有以智能体为中心的安全防御无法可靠防范AI智能体风险的问题,借鉴网络领域原则,提出结合确定性执行与语义策略的AI智能体安全系统设计思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11708 2026-08-13 cs.HC cs.GR 新提交 50%

A Browser-Based Gesture-Driven Avatar Interaction Framework for Metaverse Onboarding Environments

面向元宇宙入门环境的基于浏览器的手势驱动虚拟化身交互框架

Deepti Parachuri, Chhayank Sahu, Sameer Singh Choudhary

专题命中 机器人操作 :navigation(abstract)

AI总结 本文提出一种面向元宇宙入门环境的基于浏览器的手势驱动交互框架,结合Google MediaPipe手势识别与两种移动技术,经5人评估验证,实现无控制器的轻量交互。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12135 2026-08-13 quant-ph 新提交 50%

The Min-Rains Relative Entropy Is Not Tight for Exact PPT Entanglement Distillation

最小-雷恩斯相对熵对于精确PPT纠缠蒸馏并不紧

Chengkai Zhu, Xin Wang

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究否定了最小-雷恩斯相对熵是精确PPT纠缠蒸馏紧界的猜想,通过引入新的单字母上界,揭示了PPT操作下精确纠缠操纵的微妙渐近结构。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11718 2026-08-13 quant-ph physics.optics 新提交 50%

Experimental quantum telecloning across silicon photonic chips

硅光子芯片间的实验量子远程克隆

Zicong Wen, Kai Wang, Bochi Wu, Leizhen Chen, Yan-Qing Lu, Shining Zhu, Xiao-Song Ma

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究人员利用硅光子平台,通过光纤连接的两个光子芯片实现1对2对称量子远程克隆,片间克隆保真度78.45±1.39%,为大规模量子网络奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10822 2026-08-13 cond-mat.mes-hall 版本更新 50%

Strong coupling between antiferromagnetic magnons and spoof surface plasmons

反铁磁磁振子与类表面等离激元的强耦合

Yamin Sun, Ka Shen, H. Y. Yuan

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出一种平面异质结构,通过解析求解耦合方程预测反铁磁磁振子与类表面等离激元在太赫兹波段存在强耦合,为相关杂化系统提供了片上集成的可行平台。

Comments Corrected Figure 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21392 2026-08-13 cs.CR 版本更新 50%

VIPER-MCP: Detecting and Exploiting Taint-Style Vulnerabilities in Model Context Protocol Servers

VIPER-MCP: 检测和利用模型上下文协议服务器中的污点式漏洞

Pengyu Sun, Zifeng Kang, Qishu Jin, Enhao Huang, Xin Liu, Dakun Shen, Song Li

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出VIPER-MCP,一种用于模型上下文协议服务器的端到端自动漏洞审计框架,能够检测污点式漏洞并动态验证其可利用性,通过生成具体的概念验证提示。该框架引入了两种新技术:一种是双阶段静态分析策略中的锚查询,增强了标准污点警报的功能性上下文;另一种是反馈驱动的提示进化机制,通过双变异调度和适应度评分的种子选择,逐步优化自然语言提示以达到易受攻击的sink。

详情

展开后加载摘要…

URL PDF HTML 收藏