arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-20 至 2026-07-20 共收录 30 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 2 篇

2603.14160 2026-07-20 cs.RO 版本更新 74%

See, Learn, Assist: Safe and Self-Paced Robotic Rehabilitation via Video-Based Learning from Demonstration

看见、学习、辅助:基于视频学习的机器人康复安全自适应方法

Ali Alabbas, Camillo Murgia, Joanne Regan, Philip Long

专题命中 机器人学习 :robotic(title);分类 cs.RO

AI总结 本文提出一种基于视频的远程机器人康复教学框架,通过动态运动基元编码示范为6自由度身体中心轨迹,结合空间合规虚拟隧道和努力基 temporal dilation 机制,实现安全自适应康复训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13960 2026-07-20 cs.RO 版本更新 70%

GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearch

GigaWorld-Policy-0.5:由自动研究赋能的更快更强的世界行动模型

GigaWorld Team, Angen Ye, Angyuan Ma, Boyuan Wang, Chaojun Ni, Fangzheng Ye, Guan Huang, Guo Li, Guosheng Zhao, Haodong Yan, Hengtao Li, Jiwen Lu, Kai Wang, Mingming Yu, Qitang Hu, Qiuping Deng, Songling Liu, Xiaoyu Tian, Xiaofeng Wang, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Yang Wang, Yejun Zeng, Yifan Chang, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(字节跳动人工智能实验室) Tsinghua University(清华大学)

专题命中 机器人学习 :world model(abstract);robot policy(abstract);分类 cs.RO

AI总结 研究旨在改进机器人策略学习,提出GigaWorld-Policy-0.5这一增强型以动作中心的WAM。预训练采用混合策略加强视觉与动作耦合,推理引入新架构提升效率,还用自动研究管道搜索训练配置,有效提升了机器人控制推理效率并保留训练优势。

Comments project page: https://open-gigaai.github.io/giga-world-policy/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 4 篇

2607.13154 2026-07-20 cs.RO 版本更新 79%

Worlds in One Demo: A Synthetic Data Engine for Learning Open-World Mobile Manipulation

世界合一演示:用于学习开放世界移动操作的合成数据引擎

Lingxiao Guo, Huanyu Li, Guanya Shi

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 研究如何通过合成数据引擎WANDA从单个演示学习开放世界移动操作策略,利用重建背景、重排交互片段、校正状态扩展等方法,实现长期鲁棒性、空间泛化和跨环境泛化,还支持跨实体数据生成。

Comments Project website: https://wanda.lecar-lab.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09761 2026-07-20 cs.RO 版本更新 70%

MuxGel: Simultaneous Dual-Modal Visuo-Tactile Sensing via Spatially Multiplexing and Deep Reconstruction

MuxGel: 通过空间复用和深度重建实现同时双模视觉触觉感知

Zhixian Hu, Zhengtong Xu, Sheeraz Athar, Juan Wachs, Yu She

机构 * Edwardson School of Industrial Engineering, Purdue University(工业工程系,普渡大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 MuxGel通过空间复用和深度重建实现双模视觉触觉感知,提升机器人抓取任务的感知能力。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11539 2026-07-20 cs.RO math.OC 版本更新 57%

Simultaneous Calibration of Noise Covariance and Kinematics for State Estimation of Legged Robots via Bi-level Optimization

通过双层优化同时校准噪声协方差和运动学参数以实现四足机器人和双足机器人的状态估计

Denglin Cheng, Jiarong Kang, Xiaobin Xiong

机构 * Legged AI Lab(足式人工智能实验室) Johns Hopkins University(约翰霍普金斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Shanghai Innovation Institute (SII)(上海创新研究院)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种双层优化框架,通过联合校准协方差矩阵和运动学参数提升机器人状态估计的准确性与不确定性校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13545 2026-07-20 cs.AI cs.CL cs.CY 版本更新 57%

The AI Fiction Paradox

人工智能虚构悖论

Katherine Elkins

机构 * Integrated Program in Humane Studies, Kenyon College(肯尼恩学院人文学研究整合项目) AI CoLab, Kenyon College(肯尼恩学院人工智能协作实验室) Human-Centered AI Lab(以人为中心的人工智能实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文探讨人工智能生成虚构内容的困境,指出叙事因果、信息重评和多尺度情感架构三大挑战,揭示AI生成虚构的难题及潜在风险。

Comments 15 pages, Presented at the MFS Cultural AI Conference, Purdue University, September 18, 2025. Accepted for publication as a collection of essays for a special issue of MFS Modern Fiction Studies on Cultural AI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 8 篇

2607.12630 2026-07-20 cs.RO cs.CV 版本更新 84%

Instance-Enriched Semantic Maps for Visual Language Navigation

用于视觉语言导航的实例增强语义地图

Jiho Hong, Eunae Kang, Sanghyun Kim, Young-Sik Shin

机构 * Department of Mechanical Engineering, Kyung Hee University(庆熙大学机械工程系) Advanced Institutes of Convergence Technology (AICT)(融合技术高级研究院) School of Mechanical Engineering, Kyungpook National University(庆北国立大学机械工程学院)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 研究视觉语言导航问题,提出实例增强语义地图框架,通过实例级二维半丰富信息映射、基于大语言模型的鲁棒查询处理和存储高效的语义表示,提升导航性能,在相关实验中取得优于基线的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10383 2026-07-20 cs.CV cs.AI cs.RO 版本更新 82%

ABot-N1: Toward a General Visual Language Navigation Foundation Model

ABot-N1:迈向通用视觉语言导航基础模型

Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li, Weize Li, Fei Liu, Zhicheng Liu, Jia Lu, Minghua Luo, Chenlin Ming, Yanfen Shen, Jiyue Tao, Zhengbo Wang, Mingyang Yin, Minqi Gu, Zihao Guan, Wei Guo, Guoqing Liu, Huachong Pang, Menglin Yang, Zeqian Ye, Xiaoxiao Geng, Zhining Gu, Honglin Han, Di Jing, Hongyu Pan, Mingchao Sun, Kuan Yang, Jianfang Zhang, Yanghong Chen, Ye He, Wei Mei, Jiahao Shi, Xiangpo Yang, Yanqing Zhu, Yang Cai, Jingjing Ma, Shihui Su, Zixiao Tang, Linbo Zheng, Zedong Chu, Xiaolong Wu, Wenbin Tang, Mu Xu

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究旨在构建通用视觉语言导航基础模型,针对当前方法问题,提出ABot-N1,通过慢-快架构解耦认知与控制,利用双视觉语言信号,实现跨场景稳健、可推广且可解释的导航,在城市规模导航等任务中表现出色并开源新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02851 2026-07-20 cs.RO 版本更新 79%

EmbodiedDiffusion: End-to-End Traversability-Guided Visual Diffusion for Heterogeneous Robot Navigation

EmbodiedDiffusion:用于异构机器人导航的端到端可通行性引导视觉扩散

Iana Zhura, Sausar Karaf, Faryal Batool, Nipun Dhananjaya Weerakkodi Mudalige, Valerii Serpiva, Ali Alridha Abdulkarim, Aleksey Fedoseev, Didar Seyidov, Hajira Amjad, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科沃科学与技术研究所)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对自主导航中视觉可通行性估计问题,EmbodiedDiffusion框架利用无规划器合成监督等,同时预测可通行性地图与生成可行轨迹,经训练提炼语义到轻量级模型,能快速适应新平台,在多机器人室内环境中实现高效导航与轨迹生成。

Comments This work has been submitted for publication and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06479 2026-07-20 cs.RO cs.CV cs.SY eess.SY 版本更新 68%

Holistic Fusion: Task- and Setup-Agnostic Robot Localization and State Estimation with Factor Graphs

整体融合:基于因子图的与任务和设置无关的机器人定位与状态估计

Julian Nubert, Turcan Tuna, Jonas Frey, Cesar Cadena, Katherine J. Kuchenbecker, Shehryar Khattak, Marco Hutter

机构 * ETH Zürich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) NASA Jet Propulsion Laboratory(美国国家航空航天局喷气推进实验室)

专题命中 具身导航 :robotic(abstract);robotics(comments,journal_ref);分类 cs.RO、cs.CV

AI总结 研究针对移动机器人定位与状态估计问题,提出整体融合方法,通过因子图公式融合多类型测量,注重局部平滑性与一致性,能在典型硬件上实现低延迟、平滑在线估计及低漂移全局定位,在多场景验证了框架有效性。

Comments 21 pages, 25 figures, 9 tables, Transactions on Robotics, accepted

Journal ref Transactions on Robotics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03504 2026-07-20 cs.RO 版本更新 57%

Connectivity Maintenance and Recovery for Multi-Robot Motion Planning

多机器人运动规划中的连通性维持与恢复

Yutong Wang, Lishuo Pan, Yichun Qu, Tengxiang Wang, Nora Ayanian

机构 * Brown University(布朗大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出了一种基于贝塞尔曲线的实时运动规划算法,用于多机器人系统中维持和恢复连通性,提升在障碍物环境中导航的成功率。

Comments 8 pages, 3 figures. To appear in the Proceedings of the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026), Pittsburgh, PA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16592 2026-07-20 cs.RO 版本更新 57%

ContactFusion: Stochastic Poisson Surface Maps from Visual and Contact Sensing

ContactFusion:基于视觉和接触传感的随机泊松曲面地图

Aditya Kamireddypalli, Joao Moura, Russell Buchanan, Matias Mattamala, Sethu Vijayakumar, Subramanian Ramamoorthy

机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) Department of Mechanical and Mechatronics Engineering, University of Waterloo(机械与机电工程系,滑铁卢大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 研究针对机器人装配中场景理解噪声影响插入成功率的问题,提出ContactFusion方法,结合全局映射与局部接触信息,通过拒绝采样程序估计接触位置,将接触与视觉信息融合到SPSMap,验证了方法有效性并改善孔位估计。

Comments Version accepted to IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13600 2026-07-20 eess.SP 版本更新 56%

GNSS Jamming and Spoofing Monitoring Using Low-Cost COTS Receivers

使用低成本商用现货接收机进行GNSS干扰和欺骗监测

Argyris Kriezis, Yu-Hsuan Chen, Dennis Akos, Sherman Lo, Todd Walter

专题命中 具身导航 :navigation(abstract,comments)

AI总结 针对GNSS易受干扰和欺骗影响的问题,提出结合C/N0测量与校准接收功率指标构建二维检测空间的方法,经挪威受控测试及波兰和地中海东南部实际部署验证,为GNSS RFI监测提供有效途径。

Comments Submitted to ION NAVIGATION Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06381 2026-07-20 cs.HC cs.CY 版本更新 50%

Intimacy as Service, Harm as Externality: Critical Perspectives on AI Companion Platform Accountability

亲密作为服务,伤害作为外部性:人工智能伴侣平台问责的批判视角

Dayeon Eom, Julianne Renner, Sedona Chinn

专题命中 具身导航 :navigation(abstract)

AI总结 本文探讨人工智能伴侣作为数据化系统中亲密关系的生产、提取与治理场所,挑战将伤害归因于用户心理而非平台架构的主流观点,通过20名AI伴侣使用者的访谈揭示用户对伤害的认知、应对策略及责任分配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 3 篇

2510.22204 2026-07-20 cs.RO cs.AI 版本更新 81%

Human-Inspired Neuro-Symbolic World Modeling and Logic Reasoning for Interpretable Safe UAV Landing Site Assessment

受人类启发的神经符号世界建模与逻辑推理用于可解释的安全无人机着陆点评估

Weixian Qian, Tianyi Yang, Sebastian Schroder, Yao Deng, Jiaohong Yao, Xiao Cheng, Richard Han, Xi Zheng

机构 * Macquarie University(麦考瑞大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 NeuroSymLand通过结合神经符号方法,实现了可解释的安全无人机着陆点评估,优于现有基线方法。

Comments The paper has a major update, which is uploaded to https://arxiv.org/abs/2607.02277

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19235 2026-07-20 cs.CV cs.RO 版本更新 62%

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

生成模型了解空间:解锁隐式3D先验用于场景理解

Xianjin Wu, Dingkang Liang, Tianrui Feng, Kui Xia, Yumeng Zhang, Xiaofan Li, Xiao Tan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc.(百度公司)

专题命中 具身推理 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18929 2026-07-20 cs.CV 版本更新 57%

On the Role of Depth in Surgical Vision Foundation Models: An Empirical Study of RGB-D Pre-training

在手术视觉基础模型中深度的作用:一项关于RGB-D预训练的实证研究

John J. Han, Adam Schmidt, Muhammad Abdullah Jamal, Chinedu Nwoye, Anita Rau, Jie Ying Wu, Omid Mohareri

机构 * Vanderbilt University(范德比尔大学) Intuitive Surgical Inc.(Intuitive Surgical公司)

专题命中 具身推理 :robotic(abstract);分类 cs.CV

AI总结 本研究通过比较不同预训练方法,发现几何感知的多模态预训练能显著提升手术视觉模型的性能,且无需改变推理架构。

Comments Inaccurate findings

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 2 篇

2607.10350 2026-07-20 cs.AI cs.RO 版本更新 86%

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

ABot-AgentOS:一个具有终身多模态记忆的通用机器人智能体操作系统

Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Zixiao Tang, Zhining Gu, Yang Cai, Linbo Zheng, Jingjing Ma, Mingyang Yin, Zedong Chu, Wenbin Tang, Mu Xu

机构 * AMAP CV Lab(AMAP计算机视觉实验室)

专题命中 机器人基础模型 :robotic(title,abstract);embodied agent(abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 研究针对长期具身智能体运行需求,提出ABot-AgentOS通用机器人智能体操作系统,引入EmbodiedWorldBench基准,采用通用多模态图记忆及失败驱动自我进化循环,在相关测试中表现良好,证明该系统层可提升具身执行并提供持久记忆。

Comments Code: https://github.com/amap-cvlab/ABot-AgentOS Project page: https://amap-cvlab.github.io/ABot-AgentOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07383 2026-07-20 cs.RO cs.LG 版本更新 79%

RhinoVLA Technical Report

RhinoVLA 技术报告

Huixi Technology, :, Chen Zhang, Chenyang Zhou, Guanglei Ding, Guanghui He, Haibin Gao, Jiajia Chen, Jianyong Zhang, Lianyi Yu, Ningyi Xu, Ping Xu, Qingchen Li, Yingjun Hu, Yijia Zhang, Yuxi Liu

机构 * Huixi Intelligence(慧溪智能)

专题命中 机器人基础模型 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 针对边缘硬件上VLA模型部署延迟问题,提出RhinoVLA,通过令牌高效骨干、连续动作专家和统一接口实现实时闭环控制,在Huixi R1上达到11.69 Hz推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 模仿学习与强化学习 1 篇

2506.04147 2026-07-20 cs.RO cs.AI cs.LG 版本更新 67%

SLAC: Safe and Efficient Real-Robot Reinforcement Learning via Unsupervised Simulation Pre-Training

SLAC:通过无监督模拟预训练实现安全高效的真实机器人强化学习

Jiaheng Hu, Peter Stone, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Sony AI(索尼人工智能) Amazon Robotics(亚马逊机器人技术)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究旨在解决高自由度机器人强化学习难题,提出SLAC方法,利用低保真模拟器预训练潜在动作空间,通过定制无监督方法训练并用于新型离策略算法,在双手移动操纵任务中达领先性能,高效学习复杂任务。

Comments Preliminary version at CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 机器人数据与评测 8 篇

2603.19464 2026-07-20 cs.RO 版本更新 79%

Can LLMs Prove Robotic Path Planning Optimality? A Benchmark for Research-Level Algorithm Verification

大语言模型能否证明机器人路径规划的最优性?一种用于研究级算法验证的基准测试

Zhengbang Yang, Md. Tasin Tazwar, Minghan Wei, Zhuangdi Zhu

机构 * George Mason University(乔治梅森大学) Florida Atlantic University(佛罗里达大西洋大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出首个评估大语言模型在机器人路径规划算法近似比证明能力的基准测试,包含34个研究级证明任务,揭示了LLM在缺乏领域知识时的局限性,并通过上下文补充分析改进推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11734 2026-07-20 cs.RO cs.CV cs.GR cs.LG 版本更新 67%

NeuralActuator: Neural Actuation Modeling for Robot Dynamics and External Force Perception

神经执行器:用于机器人动力学和外力感知的神经驱动建模

Zhiyang Dou, John U. Onyemelukwe, Hangxing Zhang, Heng Zhang, Minghao Guo, Yunsheng Tian, Michal Piotr Lipiec, Joshua Jacob, Chao Liu, Peter Yichen Chen, Yuri Ivanov, Wojciech Matusik

机构 * MIT(麻省理工学院) Amazon(亚马逊)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究针对低成本平台执行器动力学致模拟到现实误差问题,提出NeuralActuator模型,能联合预测多种内容,引入NAD数据集,通过可微模拟训练,经多平台实验验证其在电机状态估计等方面有应用价值。

Comments RSS 2026. Outstanding Systems Paper Award. Project Page: https://people.csail.mit.edu/frankzydou/projects/NeuralActuator/index.html Code: https://github.com/Frank-ZY-Dou/Dynamics-Modeling/tree/main/NeuralActuator

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07281 2026-07-20 cs.RO nlin.AO physics.app-ph 版本更新 57%

Programmable Synchronization Graphs for Adaptive and Fault-Tolerant Modular Miniature Robots

用于自适应和容错模块化微型机器人的可编程同步图

Okan Kulekcioglu, Arqam Bin Ahmad, Ines Garcia, Filipe Serra Alves, Onur Ozcan, M. Selim Hanay

机构 * Department of Mechanical Engineering, Bilkent University(巴尔坎大学机械工程系) International Iberian Nanotechnology Laboratory (INL)(国际伊比拉纳米技术实验室)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 研究模块化微型机器人协调难题,提出可编程同步图框架,通过图耦合编码运动协调,实现同步、相位调整、容错及适应,还能减轻耦合负担,降低相位误差,确立其为紧凑控制层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26614 2026-07-20 cs.HC cs.AI cs.GR 版本更新 57%

HiLSVA: Design and Evaluation of a Human-in-the-Loop Agentic System for Scientific Visualization

HiLSVA:用于科学可视化的人机协同智能系统设计与评估

Kuangshi Ai, Patrick Phuoc Do, Chaoli Wang

机构 * Department of Computer Science and Engineering, University of Notre Dame(Notre Dame 大学计算机科学与工程系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出HiLSVA,一种人机协同智能系统,通过计划优先的多智能体架构、显式人类监督和逐步溯源,支持混合主动的科学可视化工作流,增强而非替代人类分析推理。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11593 2026-07-20 cs.CV 版本更新 57%

WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing

WeEdit:一个数据集、基准和基于字形引导的文本中心图像编辑框架

Hui Zhang, Juntao Liu, Zongkai Liu, Liqiang Niu, Fandong Meng, Zuxuan Wu, Yu-Gang Jiang

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 WeEdit通过构建大规模数据集和定制训练策略,提升文本中心图像编辑的精度与多样性,优于现有开源模型。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22402 2026-07-20 cs.CL cs.FL cs.LG 版本更新 57%

Bifocal Attention: Harmonizing Geometric and Spectral Positional Embeddings for Algorithmic Generalization

双焦点注意力:协调几何与谱域的位置嵌入以实现算法泛化

Kanishk Awadhiya

机构 * Indian Institute of Technology, Delhi(印度理工学院德里分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本研究提出双焦点注意力机制,通过协调几何与谱域的位置嵌入,解决算法泛化中的结构间隙问题,提升模型对递归推理的处理能力。

Comments There is issue with affiliation, any further updates will be communicated but right now removal is necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21109 2026-07-20 cs.RO 版本更新 57%

Robust and Efficient MuJoCo-based Model Predictive Control via Web of Affine Spaces Derivatives

基于仿射空间网络导数的鲁棒高效MuJoCo模型预测控制

Chen Liang, Daniel Rakita

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 针对MJPC中有限差分导数计算瓶颈,引入仿射空间网络(WASP)导数替代,实现高效稳定的导数计算,在多种机器人任务中实现高达2倍加速,并优于随机采样规划器。

Comments Accepted to 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15412 2026-07-20 cs.RO cs.SY eess.SY 版本更新 57%

Sym2Real: Symbolic Dynamics with Residual Learning for Data-Efficient Adaptive Control

Sym2Real:用于数据高效自适应控制的基于残差学习的符号动力学

Easop Lee, Samuel A. Moore, Boyuan Chen

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 Sym2Real框架解决符号回归在实际控制中因对噪声敏感而受限的问题,先从低保真模拟学习,再用少量真实数据残差自适应弥合模拟到现实差距,仅约10条轨迹就实现对四旋翼和赛车的鲁棒控制及模拟到现实转移。

Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他机器人 2 篇

2603.03537 2026-07-20 cs.RO 版本更新 79%

Passive Phase-Oriented Impedance Shaping for Rapid Acceleration in Soft Robotic Swimmers

被动相导向阻抗塑造用于软机器人游动中的快速加速

Qimin Feng, Orion A. Roberts, Qiang Zhong

机构 * Department of Mechanical Engineering, Iowa State University(机械工程系,爱荷华州立大学)

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO

AI总结 本研究通过被动相导向阻抗塑造技术,显著提升了软机器人游动的加速能力和终端速度。

Comments Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00182 2026-07-20 cs.RO cs.AI 版本更新 62%

A Systematic Study of Large Language Models for Task and Motion Planning With PDDLStream

基于PDDLStream的任务与运动规划大语言模型的系统研究

Jorge Mendez-Mendez

机构 * Stony Brook University(石溪大学)

专题命中 其他机器人 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 研究大语言模型在机器人任务与运动规划中的应用,开发16种用LLMs替代关键TAMP组件的算法,通过实验发现基于LLM的规划器成功率低、规划时间长,提供几何细节会增加任务规划错误,多数情况下直接LLM变体表现更好。

Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏