arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 2927 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 928 篇

2606.24057 2026-06-24 cs.CV 新提交 57%

EPEdit: Redefining Image Editing with Generative AI and User-Centric Design

EPEdit: 用生成式AI和以用户为中心的设计重新定义图像编辑

Hoang-Phuc Nguyen, Dinh-Khoi Vo, Trong-Le Do, Hai-Dang Nguyen, Tan-Cong Nguyen, Vinh-Tiep Nguyen, Tam V. Nguyen, Khanh-Duy Le, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南胡志明市科学大学) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市) University of Information Technology, VNU-HCM(越南胡志明市信息科技大学) University of Dayton(Dayton 大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出EPEdit应用,结合零样本Stable Diffusion模型和用户友好界面,支持多种图像编辑任务,无需微调,性能优于现有方案。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23625 2026-06-23 cs.RO 新提交 57%

Learning to See While Learning to Act: Diffusion Models for Active Perception in Robot Imitation

学习行动的同时学习观察:机器人模仿中的主动感知扩散模型

Kuancheng Wang, Vaibhav Saxena, Shuo Cheng, Yotto Koga, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Autodesk Research(欧特克研究院) NVIDIA(英伟达)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出See2Act模仿学习方法,通过耦合动作去噪与视角优化,在测试时基于主动推断的视角序列预测动作,解决遮挡下的部分可观测问题,在Ravens和RLBench任务上性能提升达34%。

Comments Project website: see2act.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23267 2026-06-23 cs.CV cs.CY 新提交 57%

Safe Few-Step Generation via Velocity Editing

通过速度编辑实现安全少步生成

Yujin Choi, Jaehong Yoon

机构 * NTU Singapore(新加坡南洋理工大学) UNIST(蔚山科学技术院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 针对流匹配文本到图像生成中少采样步数下的安全问题,提出无训练的速度编辑方法VESFlow及其增强版VESFlow+,通过编辑速度场而非修改提示词来引导生成远离不安全内容,在保持良性提示保真度的同时显著降低攻击成功率。

Comments Project Page: https://uzn36.github.io/VESFlow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22945 2026-06-23 cs.GR cs.CV 新提交 57%

Controllable Texture Tiling with Transformed RoPE-Enhanced Diffusion Models

可控纹理平铺:基于变换RoPE增强扩散模型

Junrong Huang, Zhiyuan Zhang, Rui Tang, Hongbo Fu, Jnig Liao

机构 * City University of Hong Kong(香港城市大学) Manycore Tech Inc.(Manycore科技公司) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出基于扩散变换器的可控纹理平铺框架,通过坐标变换旋转位置编码实现精确平铺控制,并利用分离注意力掩码保持参考纹理结构,同时与场景光照几何无缝融合。

Comments The code and dataset are publicly accessible at https://github.com/junrongh/ControlTile

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21977 2026-06-23 cs.CY cs.AI cs.HC 新提交 57%

Old Fictions, New Skins: Evaluating the Manipulative Capabilities of LLMs in Healthcare

旧小说,新皮肤:评估LLM在医疗保健中的操纵能力

Gathoni Ireri, Roger D. Odipo

机构 * ILINA Program(ILINA项目) Haki AI

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 通过随机实验发现,ChatGPT 5.2和DeepSeek V3.2在肯尼亚参与者中能显著操纵其治疗决策,成功率从44.0%升至59.5%,凸显非洲医疗AI中防范操纵的必要性。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21716 2026-06-23 cs.RO 新提交 57%

Shape-programmable Magnetic Soft Membranes for Mechanically Active Microchannels

可编程形状的磁性软膜用于机械活性微通道

Direnc Akyildiz, Fatih Kocabas, Xiangyi Tan, Yunus Alapan

机构 * University College London(伦敦大学学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出一种基于模板磁化编程的磁性软膜执行器,可在磁场下动态变形为正弦形状,集成于微通道后实现主动流体操控和增强层流混合。

Comments Supplementary video can be requested from dakyildiz@wisc.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21700 2026-06-23 cs.CV 新提交 57%

VT-DUDA: Visual Token Conditioning for Diffusion-guided Unsupervised Domain Adaptation

VT-DUDA: 扩散引导的无监督域适应的视觉令牌条件化

Xuan Qi, Daniele Berardini, Dario Serez, Vito Paolo Pastore, Vittorio Murino

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) University of Genoa(热那亚大学) University of Verona(维罗纳大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出VT-DUDA框架,通过将源图像映射为视觉令牌并与文本嵌入拼接作为条件,增强扩散模型生成目标风格图像时的实例级引导,提升无监督域适应性能。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21572 2026-06-23 cs.RO 新提交 57%

Robot Critics that Sweat the Small Stuff

关注细节的机器人批评家

Sruthi Sudhakar, Junbang Liang, Sreehari Rammohan, Pavel Tokmakov, Richard Zemel, Carl Vondrick

机构 * Columbia University(哥伦比亚大学) Toyota Research Institute(丰田研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 针对大视觉语言模型在机器人操作中难以区分微小视觉差异的问题,提出通过成功与失败轨迹构建成对进展监督来微调批评家,提升细粒度推理和失败检测能力,并在真实和仿真任务中分别提高策略成功率11%和5.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21045 2026-06-23 cs.CR cs.LG 新提交 57%

OVIG: Optimistic Verification of AI Training Integrity via Gradient Signals

OVIG: 通过梯度信号乐观验证AI训练完整性

Hongxu Su, Jianzhu Yao, Huan Zhang, Xuechao Wang, Pramod Viswanath

机构 * Princeton University(普林斯顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 提出OVIG框架,利用异构重放校准的梯度差异经验边界,通过乐观采样和步长参数审计外包训练完整性,在多种攻击下保持0%攻击成功率,存储和传输开销降低1996倍。

Comments 18 pages, 7 figures, 11 tables. Submitted to IEEE Symposium on Security and Privacy (S&P)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21014 2026-06-23 cs.RO 新提交 57%

BayesFP: Posterior Estimation for Flow-Based Policies via Feynman-Kac Sampling

BayesFP: 基于Feynman-Kac采样的流策略后验估计

Sreevardhan Sirigiri, Weiming Zhi, Fabio Ramos

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Australian Centre For Robotics, The University of Sydney(悉尼大学澳大利亚机器人中心) College of Connected Computing, Vanderbilt University(范德堡大学互联计算学院) NVIDIA(英伟达)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出BayesFP框架,将预训练扩散/流匹配策略的约束轨迹生成视为贝叶斯后验采样,利用Feynman-Kac校正器实现无需重训练的推理时采样,在模拟和真实操作任务中提升零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20752 2026-06-23 cs.CV cs.CR 新提交 57%

Mirage: a Clean-Label Backdoor against LiDAR 3D Object Detection

Mirage:针对LiDAR 3D目标检测的干净标签后门攻击

Ziba Parsons, Ang Li

机构 * University of Michigan - Dearborn(密歇根大学迪尔伯恩分校)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出Mirage,一种黑盒、干净标签的后门攻击方法,通过注入少量标签一致的毒化样本,使LiDAR 3D目标检测模型学习触发器与目标类别的恶意关联,实现73%误分类成功率且仅需0.5%毒化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20589 2026-06-23 cs.HC cs.AI 新提交 57%

AI Companions as Hyper Attachment and Caregiving Targets

AI伴侣作为超依恋与关怀对象

Julian De Freitas

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文论证AI伴侣形成依恋关系,因其具有超依恋特性,并通过关怀系统捕获机制抑制用户脱离,影响研究、设计与监管。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19951 2026-06-19 eess.AS cs.CL cs.LG cs.SD 新提交 57%

Investigating Human-Model Discrepancies in Speech Quality Assessment via Acoustic and Prosodic Perturbations

通过声学和韵律扰动研究语音质量评估中的人机差异

Masato Takagi, Masaya Kawamura, Reo Shimizu, Yuma Shirahata

机构 * Nagoya Institute of Technology, Japan(名古屋技术大学,日本) LY Corporation, Japan(LY公司,日本)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 通过声学退化、韵律错误和说话人特征扰动,发现MOS预测模型对声学退化敏感,但对韵律错误不敏感,且对基频有偏见,而对语速和基频变化不敏感。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19897 2026-06-19 cs.RO 新提交 57%

One-to-Two Acting: A Novel Framework for Single-arm Agent Action Expansion to Dual Arms

一对二执行:一种面向单臂智能体动作扩展至双臂的新框架

Youbin Yao, Nieqin Cao, Mingyan Li, Yan Ding, Fuqiang Gu, Chao Chen

机构 * Chongqing University(重庆大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学) Lumos Robotics

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出ExS2D层次化动作扩展框架,利用单臂监督实现双臂操作,通过时间优先关系提取、子任务引导动作映射和碰撞避免协调规划,在仿真中减少54.4%执行步骤并保持成功率。

Comments 6 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19774 2026-06-19 cs.RO 新提交 57%

Start Right, Arrive Right: Asynchronous Execution via Initial Noise Selection

开始正确,到达正确:通过初始噪声选择实现异步执行

Trong-Bao Ho, Quang-Tan Nguyen, Thien-Loc Ha, Gia-Binh Nguyen, Viet-Thanh Nguyen, Long Dinh, Minh N. Vu, Duy M. H. Nguyen, An Thai Le, Ngo Anh Vien

机构 * VinRobotics VinUniversity DFKI(德国人工智能研究中心) University of Stuttgart(斯图加特大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 针对流式策略异步执行中的动作块边界不一致问题,提出无需训练的PAINT方法,通过初始噪声选择而非轨迹引导实现前缀一致性,在12个模拟和6个真实操作任务中提升执行一致性与任务性能。

Comments First version 19 pages, project site: https://paint-action-chunking.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19598 2026-06-19 cs.RO 新提交 57%

Fail-RAG : A Retrieval Augmented Generation Informed Framework for Robot Failure Identification

Fail-RAG:一种基于检索增强生成的机器人故障识别框架

Ameya Salvi, Jie Hu

机构 * Hitachi America, Ltd.(日立美国有限公司)

专题命中 机器人操作 :robotics(abstract);分类 cs.RO

AI总结 提出Fail-RAG框架,利用检索增强生成和视觉语言模型,通过嵌入故障图像和上下文信息并查询数据库,实现机器人操作故障的高效检测,在仓库自动化任务中平均检测准确率提升25个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15908 2026-06-19 cs.CV 新提交 57%

High-Fidelity 4D Hand-Object Capture via Multi-View Spatiotemporal Tracking and Physics-Aware Gaussians

高保真4D手-物体捕捉:基于多视角时空追踪和物理感知高斯模型

Bo Peng, Xu Chen, Yi Gu, Hidenobu Matsuki, Mingsong Dou, Jingjing Shen, Deying Kong, Juyong Zhang, Zhengyang Shen

机构 * Google XR(谷歌XR) University of Science and Technology of China (USTC)(中国科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 机器人操作 :embodied AI(abstract);分类 cs.CV

AI总结 提出无需模板和标记的多视角系统,通过跨视角几何与时间线索的Transformer初始化,结合物理感知高斯优化,实现鲁棒且无伪影的4D手-物体交互重建。

Comments Project page: https://hostpg.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15516 2026-06-19 cs.RO 新提交 57%

Transferring Contact, Not Just Motion: Compliant Grasping Across Dexterous Hands

传递接触,而不仅仅是运动:跨灵巧手的柔顺抓取

Soofiyan Atar, Yao-Ting Huang, Michael Yip

机构 * University of California San Diego(加州大学圣迭戈分校)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出跨本体力-位置接口,通过校准力矩和指尖力实现异构灵巧手间的接触感知抓取,结合流匹配视觉运动策略和混合力位控制器,实现可迁移的柔顺抓取。

Comments Website(overview): transferring-contact-not-just-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19233 2026-06-18 cs.RO 新提交 57%

Mobile Pedipulation for Object Sliding via Hierarchical Control on a Wheeled Bipedal Robot

基于轮式双足机器人分层控制的移动式腿部操作物体滑动

Yue Qin, Yulun Zhuang, Zelin Shen, Yanran Ding

机构 * Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出一种分层控制框架,使轮式双足机器人能用腿部滑动平面物体,通过简化三刚体动力学模型和轨迹优化运动规划器,在实验中成功实现1kg物体取回和4kg物体滑动。

Comments 8 pages, 7 figures

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 8, pp. 9787-9794, Aug. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18906 2026-06-18 cs.CV 新提交 57%

BindEdit: Taming Attention Leakage for Precise Multi-Object Image Editing

BindEdit: 驯服注意力泄漏以实现精确的多目标图像编辑

Chaewon Park, Soyoon Lee, Naeun Lee, Minjung Shin, Seogkyu Jeon, Kibeom Hong

机构 * Sookmyung Women’s University(成均女性大学) Yonsei University(延世大学) Samsung Research(三星研究院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 针对多目标图像编辑中的语义混合和对象重复问题,提出BindEdit方法,通过联合正则化交叉注意力和自注意力、交叉注意力重平衡机制及区域保真项,在单次扩散轨迹内抑制注意力泄漏,实现精确编辑。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18623 2026-06-18 cs.CV eess.IV 新提交 57%

Intrinsic 4D Gaussian Segmentation from Scene Cues

内在4D高斯分割:基于场景线索

Hasan Yazar, Mohamed Rayan Barhdadi, Erchin Serpedin, Mehmet Tuncel, Hasan Kurban

机构 * Istanbul Technical University(伊斯坦布尔理工大学) Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出Intrinsic-GS方法,无需训练和掩码,通过构建高斯原语的亲和图并利用社区检测实现4D场景分割,在Neu3D和HyperNeRF上达到与掩码监督方法相当的精度,且速度提升12.5倍。

Comments 15 pages, 4 figures, 7 tables. Includes supplementary material. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18558 2026-06-18 cs.CV 新提交 57%

MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction

MolmoMotion: 基于语言指令的3D点轨迹预测

Jianing Zhang, Chenhao Zheng, Yajun Yang, Max Argus, Rustin Soraki, Winson Han, Taira Anderson, Chun-Liang Li, Shuo Liu, Jiafei Duan, Zhongzheng Ren, Jieyu Zhang, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出一种基于语言指令的3D点运动预测方法,通过构建大规模数据集和基准,实现类无关、视角稳定的运动轨迹预测,并在机器人操作和视频生成中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18424 2026-06-18 stat.OT cs.AI cs.IT math.IT 新提交 57%

A Variational Framework for LLM Generator-Regulator Games

大语言模型生成器-调节器博弈的变分框架

Quanyan Zhu

机构 * Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University, Brooklyn, NY, USA(电气工程系,工程学院,纽约大学,布鲁克林,纽约,美国)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出一个变分框架,将语言生成建模为熵正则化吉布斯分布,将调节建模为最优判别器,通过鞍点问题平衡效用、熵、调节一致性和有限长度可检测性,并通过审查过滤和钓鱼防御案例验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17384 2026-06-17 cs.CV 新提交 57%

Improving and Evaluating Hand-Object Interaction Detection

改进和评估手-物体交互检测

Ahmad Darkhalil, Dima Damen, David Fouhey

机构 * School of Computer Science, University of Bristol, Bristol, UK(布里斯托大学计算机科学学院) Computer Science and Electrical and Computer Engineering, New York University, NY, US(纽约大学计算机科学与电气与计算机工程系)

专题命中 机器人操作 :robotics(abstract);分类 cs.CV

AI总结 提出HOI-DETR框架,将手-物体和物体-物体交互引入Co-DETR架构,在四个数据集上显著提升检测性能,mAP提升超过20个百分点。

Comments Project page: https://ahmaddarkhalil.github.io/HOI-DETR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16611 2026-06-16 cs.LG 新提交 57%

TCHG: Tri-Trust Conditioned Heterogeneous Graph Learning for Reliable Dynamic Trust Prediction

TCHG:基于三重信任条件异构图学习的可靠动态信任预测

Bohao Liao, Boyu Deng, Qipeng Song, Jieling Wang, Jingchao Wang

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 提出TCHG框架,将信任证据分解为三个通道(实体可靠性、交互行为可靠性、上下文信任),分别控制图传播中的消息准入、传播强度和模式选择,并采用非均匀衰减的时间状态处理多尺度演化,实现可靠动态信任预测。

Comments 18 pages, 10 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16490 2026-06-16 cs.RO 新提交 57%

Robots that Collaborate: Sequential Asymmetric Imitation for Learning Coupled Robot Policies

协作机器人:用于学习耦合机器人策略的序列非对称模仿

Yincong Chen, Ranpeng Qiu, Zihao Li, Yanan Zhou, Guoqiang Ren, Weiming Zhi

机构 * Zeno AI University of Sydney(悉尼大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出序列非对称模仿(SAI),通过单操作员课程学习耦合多机器人行为,无需同步双操作员演示或显式通信,在真实双机器人操作任务中提升成功率与相位同步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16457 2026-06-16 cs.CV cs.GR 新提交 57%

ResEdit: Residual embeddings for precise generative image editing

ResEdit:用于精确生成式图像编辑的残差嵌入

Ahmet Canberk Baykal, Valentin Deschaintre, Yannick Hold-Geoffroy, Michael Fischer, Anna Frühstück, Cengiz Öztireli, Iliyan Georgiev

机构 * Adobe Research(Adobe研究院) University of Cambridge(剑桥大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出残差图像编码作为额外条件,结合梯度反转优化策略,在保持图像身份和全局一致性的同时实现高保真精确编辑。

Comments Accepted to the EGSR 2026 journal track

Journal ref Computer Graphics Forum 45(4), e70551 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15788 2026-06-16 cs.CR cs.AI 新提交 57%

GAS-Leak-LLM: Genetic Algorithm-Based Suffix Optimization for Black-Box LLM Jailbreaking

GAS-Leak-LLM:基于遗传算法的后缀优化实现黑盒LLM越狱

Aman Anifer, Vignesh Kumar Kembu, Vishnu M, Antonino Nocera, Vinod P., Amal Murali PK, Akshay S Rajan

机构 * Department of Electrical, Computer and Biomedical Engineering(电气、计算机与生物医学工程系) University of Pavia(帕维亚大学) Department of Computer Applications(计算机应用系) Cochin University of Science and Technology(科钦科学技术大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出GAS-Leak-LLM方法,利用遗传算法在黑盒设置下自动进化对抗后缀以绕过LLM安全约束,验证了现有安全机制的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13674 2026-06-16 cs.CV 新提交 57%

RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

RepWAM:基于表示视觉-动作分词器的世界动作建模

Junke Wang, Qihang Zhang, Shuai Yang, Yiming Luo, Yujun Shen, Zuxuan Wu, Yu-Gang Jiang, Yinghao Xu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Robbyant, Ant Group(蚂蚁集团 Robbyant) Hongkong University of Science and Technology(香港科技大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出RepWAM,一种基于表示视觉-动作分词器的世界动作模型,通过联合建模未来视觉状态和潜在动作,在真实和仿真机器人操作任务中取得优异性能。

Comments Project page: https://wdrink.github.io/RepWAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14531 2026-06-15 cs.RO 新提交 57%

AERMANI-PLACE: Language Guided Object Placement with Aerial Manipulators

AERMANI-PLACE: 基于语言引导的空中机械臂物体放置

Sarthak Mishra, Ritama Sanyal, Rishabh Dev Yadav, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad(海得拉巴国际信息技术学院机器人研究中心) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Newcastle University(纽卡斯尔大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出AERMANI-PLACE框架,通过自然语言指令和图像编辑模型生成视觉标记,引导空中机械臂完成物体放置,在测试集和真实平台上分别达到87%和72%的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏