DR-GS: Physically-Based Deformable and Relightable 2D Gaussians
DR-GS: 基于物理的可变形与可重光照的2D高斯泼溅
专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV
AI总结 提出DR-GS框架,通过显式解耦几何、光照和材质,实现可变形物体的物理一致重光照与后编辑,在静态重建、动态变形和重光照中达到领先视觉质量。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
DR-GS: 基于物理的可变形与可重光照的2D高斯泼溅
专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.CV
AI总结 提出DR-GS框架,通过显式解耦几何、光照和材质,实现可变形物体的物理一致重光照与后编辑,在静态重建、动态变形和重光照中达到领先视觉质量。
Human2Any: 通过约束感知的组合规划实现人到机器人的迁移
机构 * Georgia Institute of Technology(佐治亚理工学院) ; NVIDIA Corporation(英伟达公司)
专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 提出Human2Any框架,从人类视频学习可重用的物体中心交互先验,结合机器人端可行性推理与运动规划,实现无需目标任务真实机器人数据的跨实体、场景和任务迁移。
在拜占庭故障下鲁棒的多智能体大语言模型
机构 * Department of Robotics, University of Michigan, Ann Arbor, USA(密歇根大学机器人系,安娜堡,美国) ; Thomas Lord Department of Computer Science, University of Southern California, USA(南加州大学计算机科学托马斯·劳德系,美国)
专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Self-Anchored Consensus算法,通过去中心化迭代过滤和优化协议提升多智能体系统在拜占庭故障下的鲁棒性,实验表明其在数学和常识推理任务中表现优异。
看见并切换:基于视觉的交互式机器人技能编程分支方法
专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.CV
AI总结 See & Switch通过视觉输入实现机器人技能编程的条件分支,通过决策状态实现任务分支选择,提升机器人在现实环境中的适应能力。
Comments 8 pages, 9 figures
决策依赖成本不确定性下的鲁棒策略分类
专题命中 机器人操作 :manipulation(abstract);分类 cs.LG
AI总结 针对策略分类中成本依赖决策的现实问题,提出两阶段鲁棒优化框架,利用决策依赖不确定集建模,减少博弈行为并降低不确定性。
Comments 29 pages, 7 figures, accepted for publication at ICML 2026
WARP: 从离线人类演示中学习的全身重定向
专题命中 机器人操作 :manipulation(abstract);分类 cs.RO
AI总结 提出WARP离线管线,通过闭式肩-肘-腕几何求解器精确跟踪末端执行器并保持全身结构意图,实现从人类演示到机器人动作的零样本全身移动操作。
DCGrasp: 距离感知的可控抓取生成
专题命中 机器人操作 :robotics(abstract);分类 cs.CV
AI总结 提出DCGrasp系统,利用距离感知抓取能量项生成高质量、物理合理的3D手-物交互,支持灵活用户控制并泛化到多样物体和手形。
场景即对象,而非基元:来自无位姿视图的实例结构化3D标记化
机构 * Yonsei University(延世大学) ; Seoul National University(首尔国立大学)
专题命中 机器人操作 :manipulation(abstract);分类 cs.CV
AI总结 提出一种前馈框架,直接从无位姿多视图图像将场景分解为实例结构化的3D标记组,实现重建、分割和操作,无需3D标注。
Comments Project page: https://yoomimi.github.io/instok3d
LLM代理中的记忆作为攻击面:多项选择题回答研究
专题命中 机器人操作 :manipulation(abstract);分类 cs.AI
AI总结 研究LLM代理中外部记忆组件在多项选择题回答中的脆弱性,通过插入误导记忆进行攻击,实验表明简单记忆操纵即可显著影响答案准确性。
IMU-HOI:通过接触感知惯性融合实现连贯的人-物交互与运动捕捉的共生框架
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 机器人操作 :robotics(abstract);分类 cs.CV
AI总结 提出IMU-HOI框架,利用稀疏IMU同时恢复全身人体姿态和物体6-DoF轨迹,通过推断手-物接触并融合运动学与惯性推理,实现无漂移的人-物交互运动捕捉。
Comments 10 pages, 5 figures. Accepted by CVPR 2026
Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR), 2026, pp. 42901-42910
基于闭环VLM代理的文本引导的6D物体姿态重排
机构 * Seoul National University RLWRLD(首尔大学 RLWRLD)
专题命中 机器人操作 :manipulation(abstract);分类 cs.CV
AI总结 本文提出通过闭环VLM代理实现文本引导的6D物体姿态重排,引入多视角推理、坐标系可视化和单轴旋转预测等技术,提升VLM在3D场景中推理目标物体姿态的能力,且在不同VLM上均有效。
SK-Adapter:基于骨架的结构控制用于原生3D生成
专题命中 机器人操作 :manipulation(abstract);分类 cs.CV
AI总结 本文提出SK-Adapter框架,通过将3D骨架作为第一类控制信号,实现原生3D生成的精确结构控制,同时保留几何与纹理质量,优于现有基线方法。
Comments ECCV 2026
AeroPlace-Flow:基于视觉前瞻和物体流的语言引导空中机械臂物体放置
机构 * Robotics Research Center, IIIT Hyderabad, India(印度IIIT海得拉巴机器人研究中心) ; Department of Computer Science, University of Manchester, UK(英国曼彻斯特大学计算机科学系) ; Newcastle University, UK(英国新castle大学)
专题命中 机器人操作 :manipulation(abstract);分类 cs.RO
AI总结 本文提出AeroPlace-Flow框架,通过视觉前瞻和3D几何推理实现语言引导的空中物体放置,无需预设姿态或任务特定训练,在多样化的空中场景中实现75%的平均成功率。
种子到种子:扩散种子空间中的无配对图像翻译
机构 * General Motors R&D(通用汽车研发中心) ; The Hebrew University of Jerusalem(耶路撒冷希伯来大学)
专题命中 机器人操作 :manipulation(abstract);分类 cs.CV
AI总结 本文提出一种结合GAN和扩散模型的无配对图像翻译方法,通过利用预训练扩散模型的种子空间语义信息,实现复杂汽车场景的结构保持翻译,优于现有方法。
Comments British Machine Vision Conference (BMVC) 2025. Official proceedings: https://bmvc2025.bmva.org/proceedings/154/
RetrDex: 在杂乱场景中利用灵巧手高效检索物体
专题命中 机器人操作 :manipulation(abstract);分类 cs.RO
AI总结 本文提出RetrDex框架,通过大规模并行强化学习和空间感知表示,使灵巧臂手系统在杂乱场景中高效检索物体,展示出在多种配置下的强性能和零样本迁移能力。
Comments Accepted by IROS 2026
用于相干GHz-THz声子工程的GaAs/AlAs声学纳米腔
专题命中 机器人操作 :manipulation(abstract)
AI总结 本文综述了GaAs/AlAs声学纳米腔在GHz-THz声子工程中的进展,重点介绍了基于DBR的微柱谐振器实现三维声子限制和光声场共定位,以及超快光学技术对纳米尺度声子动力学的探测。
提交责任重要:合著关系下的角色感知提交配额
专题命中 机器人操作 :manipulation(abstract)
AI总结 针对同行评审负载控制,提出角色感知的提交配额框架,区分主要作者、合著者和导师角色,避免对称配额对独立作者和学生论文的不利影响。
铁电体中的铁子霍尔效应:热梯度驱动的极化横向积累
专题命中 机器人操作 :manipulation(abstract)
AI总结 本文理论证明,在铁电材料中,霍尔效应偏转的晶格激发(铁子)携带电偶极矩,其横向运动导致极化积累,称为铁子霍尔效应,并在BaTiO3中通过原子晶格动力学验证。
一维Cs₂CoCl₄在单壁碳纳米管中受限的结构性质
专题命中 机器人操作 :manipulation(abstract)
AI总结 通过透射电镜和模拟发现,Cs₂CoCl₄在单壁碳纳米管径向压缩下结晶为四方和正交相,并保持磁性质,展示一维受限作为结构调控工具。
Comments Thirteen pages including Supplementary Information. Four figures in the main text, and seven figures in the Supplementary Information
金刚石中表面声波的光控声子超辐射
专题命中 机器人操作 :manipulation(abstract)
AI总结 通过光学驱动氮空位中心能级跃迁增强自旋-声子耦合,在弱耦合区域触发表面声波声子超辐射相变,实现可调控的固态量子器件。
Comments 11 pages, 7 figures
由反向旋转轨道角动量场驱动的多能级原子系统中的线性和非线性光学扭矩
专题命中 机器人操作 :manipulation(abstract)
AI总结 研究矢量涡旋光束在Λ型和三脚架型原子系统中产生的光学扭矩,发现原子相干性(包括初始布居差和相对相位)可控制扭矩,即使两分量振幅相等也能产生非零扭矩。
全局自注意力与精确傅里叶传播用于相位-only 远场全息成像
专题命中 机器人操作 :manipulation(abstract)
AI总结 本文提出利用自注意力机制建模远场全息成像中的全局耦合结构,实现单次拍摄高保真相位全息生成,并结合相机-in-the-loop训练和可学习相位校正器实现适应性光波控制。
Comments 19 pages, 9 figures. Proof-of-concept physics-in-the-loop self-attention framework for phase-only far-field holography
RoamFlow: 用于图像目标导航的强化对齐一步动作均值流策略
专题命中 具身导航 :navigation(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO
AI总结 提出RoamFlow框架,利用均值流预测平均速度场实现轨迹合成,结合专家模仿和强化学习两阶段训练,在仿真和真实机器人上实现高效推理和强导航性能。
沉思之道:面向具身导航的空间感知世界动作模型
专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.RO、cs.AI
AI总结 提出SWAM,一种任务中心联合观测-动作生成框架,通过单次推理同时生成中间RGB-D序列和对应动作轨迹,解决现有世界模型规划器依赖候选、计算开销大和动作-视觉不一致的问题,在成功率、轨迹精度和推理效率上显著超越两阶段方法。
Comments ECCV 2026
HUMEMBR:学习人类日常行为以进行预测性具身导航
机构 * Kiel University, Germany(德国基尔大学) ; George Mason University, USA(美国乔治·马歇尔大学)
专题命中 具身导航 :navigation(title,abstract);robotics(abstract);分类 cs.RO
AI总结 提出HUMEMBR系统,通过连续记忆构建与并行检索机制,实现基于人类日常行为的具身问答和导航,相比全上下文LLM基线在长时推理上更高效。
Comments Accepted to IROS 2026
DRIVE-Nav: 方向推理、检查与验证以实现高效的开放词汇导航
机构 * Beijing Institute of Technology(北京理工大学) ; DeepBlue College(深蓝学院) ; The National Key Laboratory of Autonomous Intelligent Unmanned Systems (KAIUS), School of Automation(自主智能无人系统全国重点实验室(KAIUS),自动化学院)
专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO
AI总结 DRIVE-Nav通过方向化探索框架提升开放词汇导航效率,通过方向检查和验证减少冗余路径,实验显示在HM3D-OVON等数据集上性能优越。
Comments 8 pages, 4 figures. Project page: https://coolmaoguo.github.io/drive-nav-page/
端到端的激光雷达深度强化学习用于作物行导航
机构 * University of São Paulo (USP)(圣保罗大学)
专题命中 具身导航 :navigation(title,abstract);robotics(comments,journal_ref);分类 cs.RO、cs.AI
AI总结 本文提出基于激光雷达的端到端导航系统,通过深度强化学习直接将3D激光雷达数据映射到控制指令,解决农业环境中GNSS不可靠、行内杂乱和光照变化的问题。
Comments Accepted to the 22nd International Conference on Advanced Robotics (ICAR 2025). 7 pages
Journal ref 22nd International Conference on Advanced Robotics (ICAR), 2025
CLOSER-VLN:面向空中视觉语言导航的闭环自验证检索增强推理
专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV
AI总结 提出CLOSER方法,通过闭环的推理、验证、检索和纠正机制,解决空中VLN中开放循环决策导致的误差累积问题,在CityNav基准上取得32.01% SR和21.28% SPL。
OpenFrontier: 基于视觉-语言基础的通用导航
机构 * ETH Zurich(苏黎世联邦理工学院) ; Microsoft Spatial AI Lab(微软空间人工智能实验室) ; University of Bonn(波恩大学)
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出OpenFrontier框架,通过稀疏子目标识别与到达问题实现高效导航,无需任务特定训练或微调,适用于多种视觉-语言先验模型,展示零样本性能和真实机器人部署效果。
MM-Nav:基于多专家学习的多视角VLA模型用于鲁棒视觉导航
机构 * Peking University(北京大学) ; Galbot ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出MM-Nav模型,通过多专家学习从合成数据中学习多样化的导航能力,展示模型在合成环境中的强泛化能力,并在现实世界实验中验证其有效性。
Comments Project page: https://pku-epic.github.io/MM-Nav-Web/