EyeWorld: A Generative World Model of Ocular State and Dynamics
EyeWorld: 一种眼态与动态的生成世界模型
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 EyeWorld通过统一多模态解析与时间条件状态转移,实现对眼态的鲁棒多模态解释与临床预测模拟。
Comments 38 pages, 8 figures
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
EyeWorld: 一种眼态与动态的生成世界模型
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 EyeWorld通过统一多模态解析与时间条件状态转移,实现对眼态的鲁棒多模态解释与临床预测模拟。
Comments 38 pages, 8 figures
从梯度到里卡蒂几何:用于单次学习的卡尔曼世界模型
机构 * UC Berkeley School of Information(伯克利大学信息学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.LG
AI总结 本文提出卡尔曼世界模型(KWM),通过递归贝叶斯滤波而非反向传播优化动态系统,实现无梯度的训练与适应,适用于序列建模任务,展示出竞争性能和增强的鲁棒性与持续适应性。
超越注意力:通过球面核算子构建真正的自适应世界模型
机构 * Independent Researcher(独立研究者)
专题命中 具身推理 :world model(title,abstract);分类 cs.LG
AI总结 本文提出球面核算子,通过将数据流形投影到统一的高维球面并利用超球面多项式,解决传统注意力机制的饱和问题,提升世界模型的预测能力与收敛速度。
ExoPredicator:为机器人规划学习动态世界的抽象模型
专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出ExoPredicator框架,通过联合学习符号状态表示和因果过程,解决长周期具身规划中的外源性过程建模问题,实现对复杂任务的泛化能力。
Comments ICLR 2026. The last two authors contributed equally in co-advising
全景 affordance 预测
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; SJTU(上海交通大学) ; MBZUAI(慕尼黑工业大学人工智能研究所) ; UniTrento(特伦特大学) ; Knowin
专题命中 具身推理 :embodied AI(abstract);分类 cs.RO、cs.CV
AI总结 本文提出全景 affordance 预测,利用 360 度影像捕捉全局空间关系,通过 PAP-12K 数据集和 PAP 框架解决超高清影像的高分辨率和畸变问题,展现全景感知在具身智能中的潜力。
BLINK:自然杀伤细胞杀伤行为的隐式建模
专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG
AI总结 BLINK通过轨迹基于的递归状态空间模型,从部分观测的NK-肿瘤相互作用序列中学习隐式相互作用动力学,预测凋亡增量并提升单细胞水平的NK细胞杀伤行为的定量评估与结构建模能力。
耦合粒子滤波器用于鲁棒的 affordance 估计
机构 * Robotics and Biology Laboratory, Technische Universität Berlin(技术大学柏林机器人与生物学实验室) ; Robotics Institute Germany(德国机器人研究所) ; Science of Intelligence (SCIoI), Cluster of Excellence, Berlin, Germany(智能科学(SCIoI),卓越中心,柏林,德国)
专题命中 具身推理 :robotic(abstract);分类 cs.RO;robotics(comments)
AI总结 本文提出耦合递归估计器用于估计 affordance 的可抓取和可移动区域,通过双向信息交换提升鲁棒性和精度,在真实数据集上优于现有方法。
Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026
RS-WorldModel:一种用于遥感理解与未来感知预测的统一模型
机构 * Central South University(中南大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Guangming Laboratory(光明实验室) ; South China University of Technology(华南理工大学)
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 RS-WorldModel通过联合处理时空变化理解和文本引导的未来场景预测,提升遥感任务的跨任务迁移能力,其在1.1 million样本数据集上训练,参数仅2B即可超越多数开源模型。
学习2D不变的可供性知识以实现3D可供性定位
专题命中 具身推理 :robotics(abstract);分类 cs.CV
AI总结 本文提出MIFAG框架,通过多视角交互图像提取不变可供性知识,提升3D对象可供性定位的泛化能力。
Comments Accepted by AAAI 2025 (Oral)
RenderMem:将渲染作为空间记忆检索
专题命中 具身推理 :embodied agent(abstract);分类 cs.AI
AI总结 RenderMem通过将渲染作为3D世界与空间推理的接口,使智能体能直接进行视角相关的可见性与遮挡推理,提升空间记忆系统的表现。
理解下一token预测器中看似无用特征的出现
专题命中 具身推理 :world model(abstract);分类 cs.LG
AI总结 研究探讨了训练中的Transformer模型如何计算看似冗余的抽象特征,并提出方法分析梯度信号对特定特征形成的影响,通过玩具任务和小型模型验证,揭示了预训练语言模型中形式推理领域特征的产生机制。
Comments ICLR 2026
利用视觉语言模型推理来约束任务和运动规划
机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) ; Department of Computer Science, Rice University(莱斯大学计算机科学系) ; Ken Kennedy Institute, Rice University(莱斯大学肯尼迪研究所)
专题命中 具身推理 :robotics(abstract);分类 cs.RO
AI总结 本文提出VIZ-COAST方法,利用大预训练视觉语言模型的空间推理能力,提前识别向下细化中的问题,减少规划时间并消除失败。
Comments 9 pages, 7 figures, 1 table. Submitted to IROS 2026
VLA-Thinker: 通过图像推理增强视觉-语言-动作模型
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出VLA-Thinker框架,通过动态可调用的推理动作提升视觉语言动作模型的能力,通过两阶段训练流程提升操控性能,在LIBERO和RoboTwin 2.0基准上取得显著成果。
Comments We introduce VLA-Thinker, the first VLA model capable of thinking-with-image reasoning, which models visual perception as a dynamically invocable reasoning action, enabling Multimodal Embodied Chain-of-Thought
Eva-VLA:评估视觉-语言-动作模型在现实物理变化下的鲁棒性
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 本文提出Eva-VLA框架,通过将不可控物理变化转化为连续优化问题,系统评估VLA模型的鲁棒性,发现OpenVLA在三种物理变化下的平均失败率超过90%,并验证了对抗训练提升模型鲁棒性的有效性。
信息论视角下的持续视觉-语言-动作对齐约束
机构 * Westlake University, China(西湖大学) ; University of Southampton, UK(南安普顿大学)
专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV
AI总结 本文提出Info-VLA框架,通过两个互补约束保持跨模态信息结构,解决持续学习中视觉语言动作对齐退化问题,实验表明其在任务保持与适应性上优于现有方法。
强化学习在机器人与控制系统中的分类与趋势:一种结构化综述
专题命中 模仿学习与强化学习 :robotics(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG
AI总结 本文综述了强化学习原理、深度强化学习算法及其在机器人和控制系统中的应用,探讨了核心算法策略及现代DRL技术,旨在连接理论进展与实际应用。
VLD:用于强化学习导航的视觉语言目标距离
机构 * ETH Zurich(苏黎世联邦理工学院) ; EPFL(瑞士联邦理工学院) ; Stanford University(斯坦福大学) ; UC Berkeley(伯克利大学)
专题命中 模仿学习与强化学习 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 本文提出VLD学习框架,通过解耦感知学习与策略学习,利用大规模视频数据训练距离预测器,提升机器人导航性能与现实迁移能力。
可信的Actor-Critic:基于控制屏障函数的分层强化学习用于安全导航
专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.LG
AI总结 本文提出可信Actor-Critic算法,结合控制屏障函数设计分层强化学习框架,通过理论分析和实验验证,提升机器人安全导航性能。
Comments Accepted to ICRA 2025
轨迹多样性驱动的鲁棒视觉-语言导航
机构 * Xi’an Jiaotong University(西安交通大学) ; Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术大学微电子学院)
专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.CV
AI总结 本文提出NavGRPO框架,通过群体相对策略优化实现目标导向的导航策略学习,在未见环境中提升鲁棒性,实验显示在R2R和REVERIE基准上SPL提升达3.0%和1.71%。
Comments 17pages, 5 figures
从自身视角到世界视角:通过强化学习实现具身系统的协作空间推理
专题命中 模仿学习与强化学习 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.CV
AI总结 本文提出E2W基准和CoRL框架,通过结合链式推理监督微调与强化学习,解决多智能体系统中分布式视角下的空间推理问题,实现跨视角实体识别与任务执行。
SmoothVLA: 通过内在平滑性优化对齐视觉-语言-动作模型与物理约束
专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 SmoothVLA通过内在平滑性优化对齐视觉-语言-动作模型与物理约束,结合物理指导的混合奖励函数和GRPO方法,提升轨迹平滑度和泛化能力。
通过Stackelberg近端策略优化实现高效的形态-控制协同设计
机构 * Center of Excellence for Generative AI, King Abdullah University of Science and Technology (KAUST)(生成人工智能卓越中心,卡奥斯特大学) ; Dalle Molle Institute for Artificial Intelligence Research (IDSIA)(人工智能研究达勒莫利研究所) ; Università della Svizzera italiana (USI)(瑞士意大利大学) ; Scuola universitaria professionale della Svizzera italiana (SUPSI)(瑞士意大利专业大学)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出Stackelberg PPO方法,通过将形态与控制的内在耦合建模为Stackelberg博弈变体,解决形态与控制策略的协同优化问题,提升机器人设计效率。
Comments presented at the Fourteenth International Conference on Learning Representations; 11 pages in main text + 3 pages of references + 23 pages of appendices, 5 figures in main text + 11 figures in appendices, 16 tables in appendices; accompanying website available at https://yanningdai.github.io/stackelberg-ppo-co-design/ ; source code available at https://github.com/YanningDai/StackelbergPPO
您的视觉-语言-动作模型已具备路径偏差检测的注意力头
专题命中 模仿学习与强化学习 :navigation(abstract,comments);分类 cs.RO、cs.CV
AI总结 本文提出一种无需训练的异常检测框架,通过监控VLA模型中的三个注意力头实时检测路径偏差,并利用轻量级RL策略进行恢复,展示了其在物理机器人上的实际鲁棒性。
Comments Keywords: Vision-Language Action (VLA), Reinforcement Learning (RL), Navigation Path Recovery, Robot Operating System (ROS)
MA-VLCM:一种用于多智能体团队设置中策略价值估计的视觉语言批评模型
机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; Clemson University(克莱姆斯大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 本文提出MA-VLCM,通过预训练的视觉语言模型替代传统集中批评者,提升多智能体强化学习的样本效率和泛化能力,适用于资源受限的机器人部署。
Comments 7 pages, 6 figures
PerlAD:基于伪模拟的强化学习在闭环端到端自动驾驶中的应用
机构 * School of Automation and Electrical Engineering, University of Science and Technology Beijing(北京科技大学自动化与电气工程学院) ; Xiaomi EV(小牛电动车) ; State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.CV
AI总结 PerlAD通过伪模拟强化学习方法解决闭环端到端自动驾驶中训练与现实需求不匹配的问题,利用向量空间构建伪模拟环境,结合预测世界模型和分层解耦规划器,实现高效训练和规划,实验表明其在Bench2Drive和DOS基准上均表现优异。
Comments Accepted by IEEE RA-L. Submitted: 2025.12.2; Revised: 2026.2.4; Accepeted: 2026.3.7
ICPRL: 从交互控制中获取物理直觉
机构 * Institute of Software, Chinese Academy of Science(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Alibaba Group(阿里巴巴集团) ; RUC(中国人民大学) ; PUC-Rio(里约热内卢联邦大学)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG
AI总结 ICPRL通过多轮组相对策略优化,使VLM在动态物理环境中获取物理直觉并适应策略,其世界模型预测潜在动作结果,提升物理谜题解决能力。
Comments 22 pages
多智能体协调的深度强化学习
专题命中 模仿学习与强化学习 :robotics(comments,journal_ref);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出一种基于信息素的多智能体深度强化学习框架,通过虚拟信息素模拟局部和社会交互,实现无通信的去中心化协调,解决狭窄环境中多机器人协作的挑战。
Comments 11 pages, 8 figures, 1 table, presented at SWARM 2022, to be published in Journal of Artificial Life and Robotics
Journal ref Artificial Life and Robotics (2025)
人形守门员:从位置条件任务-运动约束中学习
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO
AI总结 本文提出一种强化学习框架,用于人形机器人在真实环境中自主守门。通过整合感知输入的多个人类动作先验,学习端到端RL策略,实现自然、动态的机器人与物体交互。
DiG-Net:通过超范围动态手势识别增强人机交互
专题命中 人机交互与遥操作 :robotics(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出DiG-Net框架,通过结合DADA模块和时空图模块,实现超远距离(30米)的鲁棒手势识别,提升助残机器人在家庭医疗、工业安全等场景中的可用性。
Comments arXiv admin note: substantial text overlap with arXiv:2411.18413
人类行为预测的去混淆框架:在动态环境中增强机器人系统
专题命中 人机交互与遥操作 :robotic(title);分类 cs.RO
AI总结 本文提出一种去混淆框架,通过整合先进的时间序列预测方法,提升动态环境中人类行为预测的准确性,为适应性人机交互系统提供可靠基础。
Comments 7 pages, Under review