arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-07 至 2026-07-07 共收录 223 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 77 篇

2607.02638 2026-07-07 cs.CV q-bio.QM 新提交 79%

CLABTOOLKIT: An Open-Source Toolkit for Routine Processing, Manipulation, and Visualization of Neuroimaging Data

CLABTOOLKIT:用于神经影像数据常规处理、操作和可视化的开源工具包

Yasser Alemán-Gómez, Nino Hervé, Patric Hagmann

机构 * Connectomics Lab, Department of Radiology, Lausanne University Hospital (CHUV)(洛桑大学医院(CHUV)放射科连接组学实验室) University of Lausanne (UNIL)(洛桑大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV

AI总结 神经影像研究面临数据结构多样、工具接口和格式不兼容问题。CLABTOOLKIT将相关操作整合为统一框架,核心数据结构可处理多种格式数据,还有多个模块支持多种分析及可视化,其配置系统方便定制工作流程。

Comments Presented at OHBM 2026 in Bordeaux, France. Submitted to Aperture Neuro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01051 2026-07-07 cs.RO 新提交 79%

AutoSpeed: Annotation-Free Stage-Adaptive Motion Speed Learning for Robot Manipulation

AutoSpeed:面向机器人操作的无标注阶段自适应运动速度学习

Qingda Hu, Ziheng Qiu, Jieru Zhao, Zhongxue Gan, Wenchao Ding

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出AutoSpeed框架,通过频域速度调制和复合代价优化,使视觉运动策略能根据任务阶段自适应调整执行速度,减少执行时间并提高成功率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07961 2026-07-07 cs.LG cs.CR cs.NI 版本更新 79%

Graph Representation Learning Augmented Model Manipulation on Federated Fine-Tuning of LLMs

图表示学习增强的模型操纵在联邦微调大型语言模型中的应用

Hanlin Cai, Kai Li, Houtianfu Wang, Haofan Dong, Yichen Li, Falko Dressler, Ozgur B. Akan

机构 * Centre for neXt Communications (CXC), Department of Engineering, University of Cambridge(下一代通讯中心(CXC),工程系,剑桥大学) Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(安全、可靠与信任跨学科中心(SnT),卢森堡大学) Telecommunication Networks group (TKN) at the School of Electrical Engineering and Computer Science, TU Berlin(电信网络组(TKN)位于电气工程与计算机科学学院,柏林技术大学) Center for neXt-Generation Communications (CXC), Department of Electrical and Electronics Engineering, Koç University(下一代通讯中心(CXC),电子与电气工程系,科克大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.LG

AI总结 本文提出AugMP策略,通过图表示学习框架和迭代操纵算法,增强对抗性更新的有效性和隐蔽性,实验表明其能显著降低全局LLM准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15061 2026-07-07 cs.RO cs.CV 版本更新 79%

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

专题命中 机器人操作 :robotics(abstract);embodied agent(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05141 2026-07-07 q-fin.CP econ.TH nlin.AO q-fin.TR 新提交 78%

Square-Root Price Impact Is Necessary for Endogenous Manipulation Cycles in Learning-Agent Markets

平方根价格影响对于学习型代理市场中内生操纵周期是必要的

Yang Zhou, Jianwen Chen, Ruipeng Wei

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 研究单个进化优化的机构代理与众多散户交易者互动的市场,机构代理发现多周期掠夺策略。通过平均场约化映射系统,揭示平方根价格影响的必要性,其是市场非线性动力学系统最优控制解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24589 2026-07-07 eess.AS cs.SD 版本更新 78%

YingMusic-Singer: Controllable Singing Voice Synthesis with Flexible Lyric Manipulation and Annotation-free Melody Guidance

YingMusic-Singer-Plus: 可控歌唱语音合成与灵活歌词操控及无标注旋律引导

Chunbo Hao, Junjie Zheng, Guobin Ma, Yuepeng Jiang, Huakang Chen, Wenjie Tian, Gongyu Chen, Zihao Chen, Lei Xie

机构 * AI Lab, GiantNetwork(巨人网络AI实验室)

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 本文提出YingMusic-Singer-Plus,一种基于扩散模型的可控歌唱语音合成方法,支持灵活歌词操控和无标注旋律引导,优于现有基准模型。

Comments INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15723 2026-07-07 physics.atom-ph 78%

Microscopic Rydberg electron orbit manipulation with optical tweezers

利用光镊进行微观里德伯电子轨道操控

Homar Rivera-Rodríguez, Matthew T. Eiles, Tilman Pfau, Florian Meinert

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 提出利用束宽小于里德伯电子轨道的光镊激光场局域操控里德伯原子的电子物质波,通过计算本征态发现强态混合导致大偶极矩,并利用位置依赖能级振荡实现亚轨道尺度的电子径向囚禁。

Journal ref Phys. Rev. Lett. 137, 013401 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04426 2026-07-07 cs.RO 新提交 77%

ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI

ACE-Brain-0.5:用于物理智能体人工智能的统一具身基础模型

Brain Team, Ziyang Gong, Haoming Gu, Zehang Luo, Tianyi Zhang, Tao Tao, Yixiao Chi, Zhe Liu, Lingsi Zhu, Jingyuan Liu, Anke Tang, Songze Li, Yilun Kong, Ningjing Liu, Tianyu Zhu, Yunpeng Qing, Shuang Luo, Xiang Liu, Shi Fu, Dawei Nie, Sixiang Liu, Zhexi Wen, Feng Pan, Xiaofeng Wang, Zhi Hou, Chunxiao Liu, Xue Yang, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * ACE-Brain Team(ACE-Brain团队)

专题命中 机器人操作 :embodied AI(abstract);manipulation(abstract);navigation(abstract);分类 cs.RO

AI总结 研究针对具身人工智能从模块向物理智能体发展的问题,提出ACE-Brain-0.5统一基础模型,通过耦合的五个功能及SSR+等方法,提升空间感知等能力,在多基准测试中有进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30988 2026-07-07 cs.RO 新提交 77%

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

多感官持续学习:将预训练的视觉运动策略适应到力觉

Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(abstract);world model(abstract);robot policy(abstract);分类 cs.RO

AI总结 提出MuSe方法,通过多阶段融合、多感官未来预测和预训练数据经验回放,将有限的多感官数据融入预训练的纯视觉策略,在保持原始任务性能的同时适应新任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03283 2026-07-07 cs.CV 版本更新 77%

Utonia: Toward One Encoder for All Point Clouds

Utonia:迈向适用于所有点云的单一编码器

Yujia Zhang, Xiaoyang Wu, Yunhan Yang, Xianzhe Fan, Han Li, Yuechen Zhang, Zehao Huang, Naiyan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xiaomi(小米)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 研究旨在训练跨多领域的单自监督点变压器编码器Utonia,其能学习一致表征空间实现跨域转移,统一各领域点云,提升感知能力,还对具身和多模态推理有益,有望成为稀疏3D数据基础模型。

Comments produced by Pointcept, project page: https://pointcept.github.io/Utonia

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01685 2026-07-07 cs.CL cs.AI cs.MA 74%

Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage

用真理欺骗:通过生成蒙太奇进行开放式通道多智能体合谋以操纵信念

Jinwei Hu, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人操作 :manipulation(title);分类 cs.AI

AI总结 本文研究了通过公开通道分发真实证据片段,利用多智能体合谋操纵信念的新威胁,提出了生成蒙太奇框架,展示了在14种LLM家族中74.4%的攻击成功率,并揭示了更强的推理能力反而增加了易受攻击的风险。

Comments Accepted to the ACL 2026 Main Conference (Oral Presentation)

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 5979-5996, San Diego, California, United States, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04591 2026-07-07 cs.RO cs.AI 新提交 73%

Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning

用于视觉-语言-动作学习的从简单到复杂的结构化演示

Xinchuan Qiu, Yi Yu

机构 * Graduate School of Advanced Science and Engineering, Hiroshima University(广岛大学先进科学与工程研究生院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究视觉-语言-动作模型中演示的收集与组织问题,提出用双臂机器人平台的从简单到复杂结构化演示收集策略,依三原则组织数据,提升了学习效率与稳定性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03865 2026-07-07 cs.RO cs.AI 新提交 73%

High-Fidelity One-Step Generative Visuomotor Policy via Recursive Correction, Frequency Consistency, and Contrastive Flow Matching

通过递归校正、频率一致性和对比流匹配实现高保真一步生成视觉运动策略

Yuran Chen, Xinye Cai, Zhonglin Gong, Yang Huang

机构 * School of Safety Science and Engineering, Anhui University of Science and Technology(安徽理工大学安全科学与工程学院) State Key Laboratory of Digital Intelligent Technology for Unmanned Coal Mining, Anhui University of Science and Technology(安徽理工大学煤矿智能开采技术与装备国家重点实验室) School of Artificial Intelligence, Anhui University of Science and Technology(安徽理工大学人工智能学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究针对生成模型多步采样有延迟、一步加速方法有偏差等问题,提出含递归校正、频率一致性和对比流匹配三机制的框架,解决相关问题,实验显示该方法在低延迟下性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03449 2026-07-07 cs.RO cs.AI 新提交 73%

HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control

HiMe:用于长距离视觉-语言-动作控制的分层具身记忆

Li Ji, Siyin Wang, Pengfang Qian, Xiaopeng Yu, Yihai Tian, Zhaoye Fei, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对视觉-语言-动作模型处理非马尔可夫任务的不足,提出HiMe分层具身记忆框架,解耦智能为高频执行器等,引入动态知识系统,平衡实时执行与思考规划冲突,提升长距离任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02549 2026-07-07 cs.CV cs.RO 新提交 73%

Learning 3D Affordances for Blade Insertion in Cluttered Stowing

学习在杂乱收纳中进行刀片插入的3D可用空间

Tianyu Li, Harpreet Sawhney, Minju Jung, Aditya Mehrotra, Kunal Mehrotra, Mudit Agrawal

机构 * Amazon Robotics(亚马逊机器人公司)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究杂乱收纳中刀片插入的3D可用空间问题,利用VulcanVoxel方法,通过基于3D占用场的掩码自动编码器,从单峰数据恢复多模态预测,提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03078 2026-07-07 cs.RO 版本更新 72%

3D Cal: An Open-Source Software Library for Depth Reconstruction on Vision-Based Tactile Sensors

3D Cal:用于基于视觉的触觉传感器深度重建的开源软件库

Rohan Kota, Kaival Shah, J. Edward Colgate, Gregory Reardon

机构 * McCormick School of Engineering, Center for Robotics and Biosystems, Northwestern University(麦科姆ick工程学院,机器人与生物系统中心,西北大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 介绍3D Cal开源库,将低成本3D打印机变为自动探测设备,为校准基于视觉的触觉传感器生成大量标记训练数据,还提供端到端管道训练自定义卷积网络进行深度重建,给出校准准则并展示良好性能。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). Project page: https://rohankotanu.github.io/3DCal/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05396 2026-07-07 cs.CV cs.AI cs.LG cs.RO 新提交 70%

From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model

从固定相机到自由相机:无需标定的视图鲁棒视觉-语言-动作模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对真实机器人部署中相机位姿变动问题,提出CamVLA模型,解耦操控控制与相机几何,实现无标定视图鲁棒的机器人任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04645 2026-07-07 cs.CL cs.AI cs.CR cs.LG 新提交 62%

Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations

追溯性思维链(RetroCoT):作为跨模型代际安全诊断的法证重建提示

Samira Hajizadeh

机构 * Columbia University(哥伦比亚大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型安全对齐受语用寄存器影响,介绍追溯性思维链攻击RetroCoT将有害请求重构为法证重建任务,在AdvBench测试中取得一定成功率,还发现模型代际差异及新语用寄存器对模型安全对齐的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04184 2026-07-07 cs.AI cs.LG 新提交 62%

A Clustering-Based Framework for Identifying Suspicious Trading Patterns in Capital Market

一种基于聚类的资本市场可疑交易模式识别框架

Asif Zaman, Romona Magdalene Sarkar, Sabiha Khair Ohi, Iftekharul Mobin

机构 * Department of Computer Science & Engineering(计算机科学与工程系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对资本市场操纵股价问题,运用K-Means++聚类实现无监督欺诈检测工具,用2012至2024年约百万金融交易数据集,提出聚类流程识别欺诈交易并分类,给出各类型占比且模型表现获验证。

Comments Accepted for publication in IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence & Networking (QPAIN), 2026. This is the authors preprint version. The final version is available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03502 2026-07-07 cs.CL cs.AI cs.LG 新提交 62%

Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

解读点之间的信息:解码跨填充令牌的隐藏计算

Kaley Brauer, Claudio Mayrink Verdun, Samuel Marks

机构 * Harvard University(哈佛大学) Cambridge Boston Alignment Initiative(剑桥波士顿对齐计划) Massachusetts Institute of Technology(麻省理工学院) Anthropic

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究前沿语言模型对无内容填充令牌的隐藏计算,通过分析两个前沿模型在四个任务家族中的表现,介绍无监督解码管道,能从隐藏状态恢复中间值,证明隐藏计算可从残差流读取。

Comments Accepted to ICML 2026 Mech Interp Workshop, 10 main paper pages, 20 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06941 2026-07-07 cs.LG cs.AI cs.CL 版本更新 62%

Endogenous Resistance to Activation Steering in Language Models

语言模型中激活引导的内生抵抗

Alex McKenzie, Keenan Pepper, Stijn Servaes, Martin Leitgab, Murat Cubuktepe, Mike Vaiana, Diogo de Lucena, Judd Rosenblatt, Michael S. A. Graziano

机构 * University of Washington(华盛顿大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大型语言模型在任务不匹配的激活引导下能内生抵抗,通过显式重启恢复正确生成,并识别出相关稀疏自编码器潜在变量,可增强或削弱该抵抗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08521 2026-07-07 cs.CV cs.AI 版本更新 62%

VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models

VISOR:视觉语言模型中用于输出重定向的基于视觉输入的转向

Mansi Phute, Ravikumar Balakrishnan

机构 * Georgia Institute of Technology(佐治亚理工学院) HiddenLayer, Inc(HiddenLayer公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 研究提出VISOR方法,通过优化视觉输入实现对视觉语言模型行为的精细控制,在关键对齐任务中验证其有效性,且具有低开销等优势,但也揭示了视觉通道安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04650 2026-07-07 stat.ML cs.LG 新提交 57%

Decomposition for Bayesian Networks: Local and Parallel Inference

贝叶斯网络的分解:局部与并行推理

Pei Heng, Xinyi Hu, Yi Sun

机构 * School of Mathematics and Statistics and KLAS, Northeast Normal University(数学与统计学学院及KLAS,东北师范大学) College of Mathematics and System Sciences, Xinjiang University(数学与系统科学学院,新疆大学) Institute of Statistics and Data Science, Xinjiang University of Finance and Economics(统计与数据科学学院,新疆财经大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 针对高维贝叶斯网络精确推理复杂度随规模指数增长的问题,提出基于有向凸子图的分解框架与最小d-分解树,实现并行推理,效率优于连接树法且保留推理精度。

Comments 13 pages, 5 figures,Code available at https://github.com/Balance-H/Decomposition-for-BNs

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05013 2026-07-07 cs.CL cs.LG 新提交 57%

Knowledge Knows, Verbalization Tells: Disentangling Latent Directions for Mathematical Solvability in LLMs

知识所知,语言所表:解开大语言模型中数学可解性的潜在方向

Nikolaos Xiros, Maria-Eleni Zoumpoulidi, Georgios Paraskevopoulos

机构 * Institute for Language and Speech Processing, Athena Research Center(语言与语音处理研究所,雅典娜研究中心)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 研究大语言模型数学推理中数学问题可解性判定难题,通过分别探究可解性知识与语言表达的表征,揭示二者在模型隐藏状态中可分离,还表明提示不可解线索等可减少编造,操纵表征能改善模型弃权。

Comments 14 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04612 2026-07-07 cs.GR cs.CV 新提交 57%

StructuredEdit: Constraint-Aware Graphic Design Editing via Differentiable Parameter Propagation

StructuredEdit:通过可微参数传播实现约束感知的平面设计编辑

Veeramanohar Avudaiappan, Ritwik Murali

机构 * Department of Electrical and Electronics Engineering, Amrita School of Engineering, Coimbatore, Amrita Vishwa Vidyapeetham India(电子与电子工程系,阿米特拉工程学院,科伊巴托尔,阿米特拉世界学院,印度) Department of Computer Science and Engineering, Amrita School of Computing, Coimbatore, Amrita Vishwa Vidyapeetham India(计算机科学与工程系,阿米特拉计算学院,科伊巴托尔,阿米特拉世界学院,印度)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究针对平面设计编辑在严格约束下操作难的问题,提出StructuredEdit将设计编辑转为参数操作,核心方法是可微参数传播,贡献是提升了约束满意度等指标,还减少了用户编辑时间和校正迭代次数。

Comments 3 page poster short paper.2 Figures, 2 Tables. Planned to submit to SIGGRAPH Asia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04554 2026-07-07 cs.RO 新提交 57%

HUGS: Guiding Unified Dexterous Grasp Synthesis Across Modes and Scales via Learned Human Priors

HUGS:通过学习人类先验知识指导跨模式和尺度的统一灵巧抓取合成

Mingrui Yu, Yongpeng Jiang, Yongyi Jia, Kangchen Lv, Li Huang, Yi Ren, Xiang Li

机构 * Tsinghua University(清华大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 研究跨尺度物体的灵巧抓取问题,提出HUGS框架,通过学习物体条件下的人类先验知识指导优化,平衡成功率和多样性,提升了接触模式覆盖与合成成功率,合成大量机器人抓取数据。

Comments The first two authors contributed equally. Project website: https://hugs-dex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04260 2026-07-07 cs.RO 新提交 57%

FLOAT Drone for Physical Interaction: Lateral Airflow Reduction, Wrench Modeling, and Adaptive Control

用于物理交互的FLOAT无人机:侧向气流减少、力扳手建模和自适应控制

Junxiao Lin, Kehan Zhou, Shuhang Ji, Yimin Peng, Shen Wang, Jialiang Hou, Fei Gao

机构 * Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院网络系统与控制研究所) Differential Robotics Technology Company(差分机器人技术公司)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 研究针对下一代无人机空中物理交互,提出FLOAT无人机。通过同轴双旋翼布局、控制面等设计实现多维度力扳手生成等。贡献包括量化侧向气流减少,建立高保真模型并嵌入分配器,实验证明提升控制精度等。

Comments 11 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03828 2026-07-07 cs.RO 新提交 57%

ObjRetarget: An Object-Aware Motion Retargeting Framework with Anthropomorphic Arm Constraints and Polyhedral Hand Modeling

ObjRetarget:一个具有拟人化手臂约束和多面体手部建模的物体感知运动重定向框架

Yuanchuan Lai, Qing Gao, Ziyan Liang, Junjie Hu, Zhaojie Ju

机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) School of Computing, University of Portsmouth(朴茨茅斯大学计算学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出ObjRetarget框架,用于从人类视频学习机器人灵巧操作,集成拟人化手臂轨迹约束与结构化手-物体几何建模,提升操作成功率与接触稳定性,泛化性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02991 2026-07-07 cs.CV 新提交 57%

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

GuideMe:流视频中的多域任务指导与干预

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究院) University of Science and Technology of China(中国科学技术大学) Chinese University of Hong Kong(香港中文大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02796 2026-07-07 cs.CV 新提交 57%

Biomechanics-aware Multi-view Markerless Motion Capture of Dexterous Hand Movements

生物力学感知的灵巧手部运动多视图无标记运动捕捉

Pouyan Firouzabadi, J. D. Peiffer, Kunal Shah, Anton Sobinov, Lee E. Miller, R. James Cotton, Wendy M. Murray

机构 * Biomedical Engineering Department, Northwestern University(西北大学生物医学工程系) Shirley Ryan AbilityLab(谢里尔·瑞安能力实验室) Department of Organismal Biology and Anatomy, University of Chicago(芝加哥大学器官生物学与解剖学系) Department of Physical Medicine and Rehabilitation, Northwestern University(西北大学物理医学与康复系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 研究评估一种生物力学重建方法在无标记运动捕捉中追踪灵巧手部运动的性能,用自定义8相机设置采集数据,与两阶段方法对比,该方法更有效利用二维数字关键点信息,能支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏