RefTr: Recurrent Refinement of Confluent Trajectories for 3D Vascular Tree Centerlines
RefTr: 基于连通轨迹的3D血管树中心线递归细化
专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 RefTr通过递归细化连通轨迹生成3D血管树中心线,采用Transformer架构提升精度并减少参数,实验显示其在性能、速度和参数数量上均优于现有方法。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
RefTr: 基于连通轨迹的3D血管树中心线递归细化
专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 RefTr通过递归细化连通轨迹生成3D血管树中心线,采用Transformer架构提升精度并减少参数,实验显示其在性能、速度和参数数量上均优于现有方法。
具有人类意识的自主驾驶实验室中的机器人行为
专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 本文提出了一种基于AI的具身感知方法,通过预测人类意图实现自主驾驶实验室中机器人与人类的主动交互,提升实验室自动化流程的效率和协调性。
张量张量与凸集图的耦合:在C空间中实现有效的压缩、探索与规划
机构 * Technical University of Munich(慕尼黑技术大学) ; Northeastern University(东北大学)
专题命中 具身导航 :robotic(abstract);分类 cs.RO
AI总结 TANGO通过结合张量压缩与图优化,在C空间中实现高效、几何感知的运动规划,提升轨迹生成的质量和效率。
Comments 8 pages, 10 figures, accepted paper for ICRA2026
当语义连接群体:由LLM驱动的模糊控制用于协作多机器人水下覆盖
专题命中 具身导航 :navigation(abstract);分类 cs.RO
AI总结 本文提出一种由LLM驱动的模糊控制框架,用于实现多机器人水下协作覆盖,通过语义引导实现高效导航和探索。
Comments Withdrawal for further improvement. The final version will be released in a few months
弥合认知鸿沟:为老年人设计和评估一个语音启用的社区聊天机器人
专题命中 具身导航 :navigation(abstract)
AI总结 本文提出了一种语音启用的社区聊天机器人,通过共设计和教育工作坊,提升老年人对AI的认知和透明度,同时探索零触控导航对年龄包容性AI的重要性。
生成式预测控制:通过预测世界建模增强推理时间的机器人策略
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 GPC通过预测世界建模在推理时间提升机器人策略,结合生成先验与前瞻性预测,实现测试时间适应,优于行为克隆并与其他基线方法相媲美。
Comments Acceptance to IEEE Robotics and Automation Letters. Website: https://computationalrobotics.seas.harvard.edu/GPC
See4D: 通过自回归视频修复实现无姿态4D生成
机构 * NUS(新加坡国立大学) ; HKU(香港大学) ; CUHK(香港中文大学) ; THU(清华大学) ; Shanghai AI Lab(上海人工智能实验室) ; Horizon Robotics(地平线机器人) ; NTU(国立科技大学)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 See4D通过自回归视频修复实现无姿态4D生成,提升从随意视频到4D世界建模的实用性。
Comments Eurographics2026; 26 pages; 21 figures; 3 tables; project page: https://see-4d.github.io/
SELF-VLA: 一种增强技能的代理视觉-语言-动作框架用于接触丰富的拆解
专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 SELF-VLA是一种整合显式拆解技能的代理视觉-语言-动作框架,通过实验在接触丰富的拆解任务中优于现有端到端VLA模型。
ManiVID-3D: 通用的视角不变强化学习用于机器人操作的解耦3D表示
专题命中 模仿学习与强化学习 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV
AI总结 ManiVID-3D通过解耦3D表示实现视角不变的强化学习,提升机器人操作在视角变化下的鲁棒性和效率。
Comments Accepted to RA-L. Project website: https://zheng-joe-lee.github.io/manivid3d/
ResWM:基于视觉强化学习的残差动作世界模型
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Texas A&M University-Commerce(德克萨斯A&M大学-科摩斯)
专题命中 模仿学习与强化学习 :world model(title,abstract);robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 ResWM通过将控制变量从绝对动作转换为残差动作,提升了视觉强化学习中世界模型的预测能力和稳定性,实现了更高效的样本利用和更平滑的控制策略。
Comments Submit KDD2026
NFPO:归一化流在机器人策略学习中的稳定策略优化
专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO
AI总结 本文提出NFPO方法,利用归一化流作为策略参数化,解决在线强化学习中训练不稳定问题,通过实验展示其在机器人学习任务中的稳健性和有效性。
通过混合大语言模型(LLM)符号规划和LLM引导的强化学习实现新颖性适应
机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) ; Austrian Institute of Technology GmbH(奥地利技术研究所)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 本文提出一种融合大语言模型、符号规划和强化学习的神经符号架构,用于在动态开放环境中处理新颖物体,通过LLM识别缺失操作符并生成计划,提升机器人在连续领域中的操作符学习能力。
跨领域策略优化 via 域间Bellman一致性与混合批评者
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG
AI总结 本文提出QAvatar方法,通过域间Bellman一致性与混合批评者解决跨领域RL中的可转移性问题,实现可靠的知识迁移。
Comments Accepted at ICLR 2026
对抗性强化学习用于检测车联网中的虚假数据注入攻击
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI
AI总结 本文提出基于对抗性强化学习的方法,用于检测车联网中的虚假数据注入攻击,通过纳什均衡策略优化检测效果,提升交通网络的鲁棒性。
基于无人机的化学烟雾源定位的多智能体强化学习
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 本研究提出基于多智能体深度强化学习的框架,用于无人机在化学烟雾源定位中的高效检测与精准定位。
在智能体互联网中的智能体发现:挑战与解决方案
专题命中 人机交互与遥操作 :embodied agent(abstract)
AI总结 本文提出了一种两阶段能力发现框架,通过自主能力声明和任务驱动的发现机制,提升智能体互联网中智能体能力发现的性能与可扩展性。
Comments This work has been submitted to the IEEE for possible publication
Journal ref IEEE Network, 2026
SaPaVe:迈向视觉-语言-动作模型中的主动感知与操作
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机科学学院,北京大学) ; School of Software, Beihang University(软件学院,北航) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 机器人数据与评测 :manipulation(title,abstract);robotics(title);分类 cs.RO、cs.CV
AI总结 SaPaVe通过解耦相机与操作动作,结合自下而上训练策略,实现高效且可推广的主动感知与操作,在现实任务中成功率达31.25%。
Comments Accepted to CVPR 2026. See project page at https://lmzpai.github.io/SaPaVe
RC-NF:基于机器人条件的归一化流用于机器人操作中的实时异常检测
机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) ; Singapore Management University(新加坡国立大学)
专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(title);分类 cs.RO、cs.CV
AI总结 RC-NF通过实时监控机器人状态和物体运动轨迹,提升VLA系统在动态环境中的鲁棒性和适应性,实现异常检测与干预。
Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
可衡量的多样性:一种快速、无模型的机器人数据集多样性度量方法
专题命中 机器人数据与评测 :robotics(title,abstract);manipulation(abstract);分类 cs.RO
AI总结 本文提出FAKTUAL算法,通过计算演示数据集的熵来提升机器人模仿学习中数据集的多样性,从而提高下游任务的成功率,同时具有较高的计算效率。
STONE数据集:一个可扩展的多模态周围视图3D可通行性数据集用于越野机器人导航
机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) ; Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)
专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO
AI总结 STONE数据集通过大规模多模态数据和自动标注流程,为越野机器人导航中的3D可通行性预测提供了可扩展的地面真实值和基准测试平台。
Comments ICRA 2026
ReViP: 通过视觉-本体感知再平衡缓解视觉语言动作模型中的虚假完成
专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 ReViP通过引入视觉-本体感知再平衡机制,缓解视觉语言动作模型中的虚假完成问题,提升模型在扰动下的鲁棒性和任务成功率。
MANSION: 多楼层语言到3D场景生成用于长周期任务
机构 * Tsinghua University(清华大学) ; AgiBot ; McGill University, MILA - Quebec AI Institute(麦吉尔大学,魁北克人工智能研究所)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 MANSION是首个多楼层语言驱动的3D场景生成框架,能生成真实可导航的建筑环境,支持跨楼层长周期任务的开发与评估,同时配套发布MansionWorld数据集和任务语义编辑代理,为空间推理和规划提供关键测试平台。
部署时学习机器人策略的可靠性
机构 * STANFORD UNIVERSITY(斯坦福大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文研究了如何通过部署时机制提升学习机器人策略的可靠性,提出运行时监控、数据驱动的可解释性框架及长周期任务执行方法,以应对部署中的分布偏移、误差叠加和复杂依赖性问题。
Comments Stanford University PhD dissertation, 2026. 182 pages, 37 figures. Available from Stanford Digital Repository
GTR-Bench:评估视觉-语言模型中的地理时间推理
机构 * Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院) ; Peking University(北京大学) ; Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)
专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV
AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。
Comments ICLR 2026, 31 pages, 20 figures
UniCompress: 用于统一视觉-语言理解和生成的标记压缩
专题命中 其他机器人 :embodied AI(abstract);分类 cs.CV
AI总结 UniCompress通过引入可学习的全局元标记引导的插件压缩和解压缩机制,显著减少视觉标记数量,同时保持图像理解和生成任务的性能,为资源受限场景下的统一多模态建模提供高效解决方案。
线性粘弹性 rheological FrBD 模型
专题命中 其他机器人 :robotics(abstract)
AI总结 本文提出基于广义Maxwell和广义Kelvin-Voigt模型的FrBD框架,用于构建速率和状态依赖的摩擦模型,并探讨其在控制设计中的应用。
Comments 6 pages, 3 figures. Under review at IEEE LCSS
利用空中共识实现多智能体系统的避障与编队控制
专题命中 其他机器人 :robotic(abstract)
AI总结 本文提出利用空中共识技术实现多智能体系统的高效编队与避障控制,通过利用无线信道干扰提升通信效率,展现了在大规模智能体场景下的优越性能。
Comments Submitted to CDC 2024
Journal ref 2024 IEEE 63rd Conference on Decision and Control (CDC), pp. 5417-5423