Range-Based Set Reconciliation via Range-Summarizable Order-Statistics Stores
基于范围的集合同步 via 可范围总结的顺序统计存储
专题命中 具身导航 :navigation(abstract)
AI总结 本文提出了一种基于范围的集合同步方法,通过递归比较连续范围的摘要来同步有序集合,并设计了可范围总结的顺序统计存储结构以降低局部计算成本,通过实验验证了其在持久化内存中的有效性。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
基于范围的集合同步 via 可范围总结的顺序统计存储
专题命中 具身导航 :navigation(abstract)
AI总结 本文提出了一种基于范围的集合同步方法,通过递归比较连续范围的摘要来同步有序集合,并设计了可范围总结的顺序统计存储结构以降低局部计算成本,通过实验验证了其在持久化内存中的有效性。
GenFacet:通过多任务偏好对齐的端到端生成方法实现电商多维搜索
专题命中 具身导航 :navigation(abstract)
AI总结 本文提出GenFacet,一种端到端生成框架,通过多任务偏好对齐提升电商多维搜索效果,实验证明显著提升点击率和转化率。
通过博弈论轨迹生成实现自动驾驶车辆在作业区的 maneuvering 规划
专题命中 具身导航 :navigation(abstract)
AI总结 本文提出博弈论框架用于生成自动驾驶车辆在作业区的轨迹,通过建模变道为车辆间的非合作博弈,平衡安全、进度和交通稳定性,减少冲突频率35%。
Comments This work has been submitted to the IEEE for possible publication
DynFlowDrive: 基于流的动态世界建模用于自动驾驶
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出DynFlowDrive,通过流基于的动力学建模提升自动驾驶中的场景预测可靠性,引入稳定性感知的多模式轨迹选择策略,实验证明在nuScenes和NavSim基准上效果显著。
Comments 18 pages, 6 figs
通过同态世界模型在无线CSI中实现结构化潜在动态
机构 * Engineering Division, New York University (NYU), Abu Dhabi, UAE.(纽约大学阿布扎克分校工程系) ; Center for Wireless Communications, University of Oulu, Finland.(奥卢大学无线通信中心) ; NYU WIRELESS, NYU Tandon School of Engineering, New York, USA.(纽约大学无线技术实验室,纽约大学坦顿工程学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.LG
AI总结 本文提出一种自监督框架,通过建模CSI的时间演变,在紧凑的潜在空间中学习无线信道的预测和结构化表示,利用JEPA学习动作条件的潜在动态,通过同态更新提升几何一致性和组合性,实验表明其在保持拓扑和预测未来嵌入方面优于基线方法。
Comments ACCEPTED FOR PUBLICATION IN IEEE INTERNATIONAL CONFERENCE ON COMMUNICATIONS (ICC) 2026
WorldAgents: 2D基础图像模型是否能作为3D世界模型的智能体?
机构 * Technical University of Munich(慕尼黑技术大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 本文探讨2D基础图像模型是否具备3D世界生成能力,提出多智能体架构实现3D世界合成,通过实验验证2D模型能生成一致且逼真的3D世界。
Comments Webpage: https://ziyaerkoc.com/worldagents/ Video: https://www.youtube.com/watch?v=Mj2FqqhurdI
R2-Dreamer:无需解码器或增强的冗余减少世界模型
机构 * Honda R&D Co., Ltd.(本田研发株式会社) ; The University of Tokyo(东京大学) ; RIKEN AIP(日本科学技术研究院(RIKEN)先进研究所(AIP))
专题命中 具身推理 :world model(title);分类 cs.RO、cs.AI、cs.LG
AI总结 R2-Dreamer提出一种无需解码器或增强的基于模型的强化学习框架,通过自监督目标作为内部正则化器,提高表示鲁棒性,训练速度更快且在多个任务中表现优异。
Comments 20 pages, 12 figures, 2 tables
Journal ref Published as a conference paper at ICLR 2026
如何使LLM具备3D能力?LLM中空间推理的综述
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guang Zhou)(香港科学与技术大学(广州))
专题命中 具身推理 :robotics(abstract);分类 cs.AI、cs.CV
AI总结 本文综述了将LLM与3D空间理解结合的方法,提出分类体系,涵盖图像、点云和混合模态方法,并讨论了当前限制与未来研究方向。
Comments 9 pages, 5 figures
Journal ref IJCAI 2025
World4RL: 基于扩散世界模型的强化学习政策精修框架用于机器人操作
机构 * The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Zhongguancun Academy(中关村学院) ; Beijing Zhongke Huiling Robot Technology Co(北京中科创联机器人技术有限公司) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);world model(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI
AI总结 World4RL通过扩散世界模型提升机器人操作政策的精修效果,采用高保真模拟环境进行端到端政策优化,优于模仿学习及其他基线方法。
一种用于提升长周期LLM代理的子目标驱动框架
机构 * Google DeepMind(谷歌DeepMind)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出子目标分解规划框架和MiRA强化学习框架,通过实时规划和密集奖励信号提升LLM在长周期任务中的表现,成功率达到43.0%。
Comments 50 pages, 15 figures
VAMPO:通过改进视频动作模型的视觉动态进行策略优化
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Xiamen University(厦门大学) ; University of Sussex(Sussex大学) ; Tianjin University(天津大学) ; Wuhan University(武汉大学) ; Hebei University of Technology(河北工业大学) ; Nanjing University(南京大学) ; Fudan University(复旦大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; South China University of Technology(华南理工大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 VAMPO通过策略优化直接提升视频动作模型的视觉动态,结合GRPO和非对抗性奖励,在多种模拟和真实任务中提升任务相关视觉动态,增强下游动作生成和泛化能力。
从语音指令到家庭任务:Inria TIAGo++在euROBIN服务机器人竞赛中的应用
机构 * Inria/LORIA
专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO
AI总结 本文介绍了Inria团队在euROBIN竞赛中使用的集成机器人系统,通过改进TIAGo++平台实现自主和远程操作模式,并结合LLM进行指令理解和任务规划,解决了服务机器人部署中的实际问题。
一种用于具有机器人、光学和电磁追踪的3D超声重建的统一平台和质量保证框架
机构 * School of Computer Science, University of Leeds(利兹大学计算机科学学院) ; School of Electronic and Electrical Engineering, University of Leeds(利兹大学电子与电气工程学院) ; St James’s University Hospital, Leeds Teaching Hospitals NHS Trust(利兹教学医院,利兹教学医院国家健康服务信托基金) ; Leeds Institute of Medical Research, University of Leeds(利兹医学研究所,利兹大学)
专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出了一种统一平台和质量保证框架,用于评估机器人、光学和电磁追踪的3D超声重建的体积准确性和可重复性,通过定制的仿生体评估不同扫描速度和入射角下的追踪性能,实现了高精度的3D重建和验证。
Comments This work has been submitted to the IEEE for possible publication
RobotArena ∞:通过现实到模拟的翻译实现可扩展的机器人评估
机构 * Carnegie Mellon University(卡内基梅隆大学) ; National Taiwan University(国立台湾大学)
专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出RobotArena Infinity框架,通过模拟环境与在线人类反馈,解决机器人政策评估中的劳动密集型、安全性差等问题,实现可扩展的视觉-语言-动作评估。
Comments Website: https://robotarenainf.github.io
策略导航还是随机搜索?智能体和人类如何在文档集合上进行推理
机构 * Snowflake\,AI\,Research ; University\,of\,Oxford ; Computer\,Vision\,Center
专题命中 机器人数据与评测 :navigation(title);分类 cs.AI
AI总结 本文通过MADQA基准测试,探讨智能体与人类在文档检索中的策略性推理与随机搜索差异,揭示最佳智能体在准确性上接近人类,但依赖暴力搜索而非有效策略规划。
UniPR: 一种统一的基于单立体对的物体级实拍到仿真感知与重建框架
机构 * NTU(国立新加坡大学) ; Tencent Robotics X(腾讯机器人实验室) ; Futian Laboratory(福田实验室) ; HKUST(香港科技大学) ; THU(清华大学)
专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.CV
AI总结 本文提出UniPR,一种端到端的物体级实拍到仿真感知与重建框架,通过几何约束解决尺度模糊问题,消除了对类别特定规范的依赖,并通过大规模立体数据集LVS6D提升研究效率和实用性。
通过视觉引导的图着色学习视觉排列任务的离散抽象
专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO
AI总结 本文提出通过结合结构约束和注意力引导的视觉距离,学习视觉排列任务的离散图结构抽象,以支持高效规划。
FORWARD:在崎岖地形中操作的前送机数据集
机构 * Umeå University(乌梅亚大学) ; Swedish University of Agricultural Sciences(瑞典农业科学大学) ; Skogforsk, Swedish Forest Research Institute(森林研究所,瑞典)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文介绍了FORWARD数据集,包含在瑞典中部两个森林地区崎岖地形中操作的前送机的高分辨率多模态数据,用于开发森林机械的交通性、感知和自主控制算法。
Comments 33 pages, 24 figures
LIORNet:一种用于恶劣天气条件下自动驾驶的自监督激光雷达雪清除框架
机构 * Ministry of National Defense(国防 ministry) ; Department of Smart Mobility Engineering(智能移动工程系)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV
AI总结 本文提出LIORNet,通过自监督学习和多物理统计线索生成伪标签,有效区分噪声点与环境结构,提升恶劣天气下激光雷达感知的准确性和鲁棒性。
Comments 14 pages, 6 figures, 2 tables
Hyper-STTN:基于超图的时空变换网络用于轨迹预测
机构 * School of Applied and Creative Computing, Purdue University(普渡大学应用与创意计算学院) ; Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(印第安纳大学布卢明顿分校计算机科学系和智能系统工程系) ; Department of Applied Artificial Intelligence, Sungkyunkwan University(成均馆大学应用人工智能系)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG
AI总结 本文提出Hyper-STTN,通过构建多尺度超图和时空变换器,有效建模人群轨迹预测中的群体和个体交互,实验表明其优于现有方法。
Comments To appear in ICRA2026
Mash, Spread, Slice! 通过视觉空间进展学习操控物体状态
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV
AI总结 SPARTA框架首次统一处理物体状态变化任务,通过空间进展和物体中心变化生成结构化策略观察和密集奖励,提升机器人操控效率和准确性。
Comments Accepted at ICRA 2026
GravCal:单图像IMU重力先验校准
机构 * UC Riverside(加州大学河滨分校)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV
AI总结 GravCal通过单图像校准IMU重力先验,结合残差修正和图像估计,提升重力方向精度,减少角误差。
Comments 14 pages, 4 figures
Physion-Eval:通过人类推理评估生成视频的物理真实性
机构 * Physion Labs(Physion实验室) ; Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; Harvard University(哈佛大学) ; Character AI
专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV
AI总结 本文提出Physion-Eval基准,通过专家人类推理评估生成视频的物理真实性,揭示当前视频生成模型在物理关键场景中存在显著缺陷,83.3%的外向视角和93.5%的内向视角视频存在可识别的物理错误。
ReMAP-DP:基于重投影多视角对齐点地图的扩散策略
机构 * School of Computer Science, Beijing Institute of Technology, China(北京理工大学计算机科学学院)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO
AI总结 本文提出ReMAP-DP框架,结合标准化视角重投影与结构感知双流扩散策略,解决2D视觉表示在3D空间感知上的不足,提升机器人在多样化任务中的精度与鲁棒性。
Comments fix some typos