Physiological World Models for Human State Transitions
面向人体状态转换的生理世界模型
专题命中 具身推理 :world model(title,abstract);分类 cs.AI
AI总结 本文提出生理世界模型(PWM),引入人体状态转换标记,构建含六项基准任务的框架,用于建模人体生理状态响应现实因素的变化,助力个性化健康管理等场景。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
面向人体状态转换的生理世界模型
专题命中 具身推理 :world model(title,abstract);分类 cs.AI
AI总结 本文提出生理世界模型(PWM),引入人体状态转换标记,构建含六项基准任务的框架,用于建模人体生理状态响应现实因素的变化,助力个性化健康管理等场景。
支持种群规模扩展的多智能体世界建模
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 针对多智能体世界模型的种群可扩展性问题,提出无需重训练即可扩展至任意智能体数量的Khora模型,通过解耦世界状态演化与渲染实现跨视图一致性,验证了泛化性并构建了实时交互系统。
Comments Technical report. Project page: https://rhos.ai/research/khora. Online demo: https://ophilus.ai/khora
CaliBench:视频世界模型的随机动力学是否经过物理校准?
机构 * Odyssey(奥德赛公司)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 CaliBench用于测试视频世界模型的物理校准,将性能分解为可评分性与校准度,发现多数场景-模型组合显著未校准,发布了mnTV指标用于模型对比。
用于学习世界模型中反事实滚动的低秩动力学有效潜在载体
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI
AI总结 本文针对学习世界模型的反事实滚动问题,提出基于低秩动力学有效潜在载体的方法,在两物体碰撞环境中验证秩4修补块可实现稳定的12步自主反事实滚动,且效果可复现。
不存在的证据:当视觉失效时维持世界模型的跨模态溯因风险感知
机构 * University of South Florida(南佛罗里达大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 该研究提出跨模态溯因风险感知方法,在视觉失效时通过声学线索维持世界模型,可提前1.7秒预警,虚警减少42%,校准良好,能在视觉退化下保持高危险感知度。
Comments 7 pages, 3 figures. Working draft prepared for journal submission
多智能体具身自动驾驶:从V2X信息交换到共享世界模型
机构 * Lingnan University, Hong Kong(岭南大学(香港))
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。
SCOPE:用于视频世界模型的分数隔离智能体优化
机构 * Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; Tencent(腾讯)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI
AI总结 本研究针对视频世界模型推理时改进的评估难题,提出SCOPE框架,通过类型化状态更新与冻结策略实现可审计适应,在Physics-IQ基准上较冻结基线提升+14.24,同时揭示推理时更新的益处需原则性部署机制。
ActSWM:面向开放世界游戏长视界规划的动作敏感型世界模型
专题命中 具身推理 :world model(title,abstract);分类 cs.RO
AI总结 针对开放世界游戏长视界规划的上下文崩塌问题,提出动作敏感型世界模型ActSWM,通过约束隐式回滚保留动作依赖差异,提升了任务成功率与动作恢复能力。
Comments 10 pages, 5 figures
DrivingWorld:通过视频GPT构建自动驾驶领域的世界模型
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 本文提出名为DrivingWorld的自动驾驶GPT风格世界模型,通过时空融合等策略提升视频生成质量与时长,实现更优的可控未来视频生成效果。
Journal ref ICPR 2026
DriveCache:面向驾驶世界模型推理的动作感知缓存
专题命中 具身推理 :world model(title);分类 cs.AI、cs.CV
AI总结 针对扩散驾驶生成器吞吐量受限的问题,提出动作感知的DriveCache控制器,利用规划运动与动态规划优化缓存,提升保真度-效率权衡,代码将公开。
Comments 9 pages, 7 figures, 4 tables
一种在膜世界模型中局部共形凯勒流形上的新自对偶引力瞬子解
专题命中 具身推理 :world model(title)
AI总结 本文在共形膨胀子引力中找到了一种真空类克尔扭曲时空上的精确引力瞬子解,该解由一阶偏微分方程导出,与自对偶性相关,其奇点由五次多项式决定,拓扑为S^3×R/Z_2,并利用克莱因瓶上的对径边界条件描述了霍金粒子蒸发过程,最后揭示了与Janis-Newman-Winicour模型之间的联系。
Comments Version V4 : final. pictures improved --- spelling improved --- comments welcome---73 pages---70 pictures
生成式上下文与受控状态:可问责纵向临床推理的功能条件
机构 * MyndwareMed(迈恩德韦尔医疗)
专题命中 具身推理 :world model(abstract,abstract_cn);分类 cs.AI
AI总结 本文区分生成式上下文与受控状态,定义可问责临床AI的审计标准与信息要求,提出六级成熟度框架,将当前LLM临床实践定位于高能力低成熟度,为可问责临床AI提供概念与审计工具。
SCALE:用于正确几何空间中JEPA规划的状态校准潜在嵌入
机构 * Boston University(波士顿大学) ; Unity Technologies(Unity科技公司)
专题命中 具身推理 :world model(abstract);分类 cs.LG
AI总结 该研究提出SCALE正则化器,为LeWM表示校准几何属性,在多任务、多求解器和多计算预算下均提升规划性能,证明规划依赖信息对几何的塑造作用。
Comments 15 pages, 2 figures
RAISECity: 一种用于城市级现实对齐3D世界生成的多模态代理框架
机构 * College of AI, Tsinghua University(人工智能学院,清华大学) ; Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) ; Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京研究院,清华大学)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 RAISECity通过多模态代理框架实现城市级3D世界生成,提升现实对齐、精度和性能,适用于沉浸媒体和具身智能应用。
Comments Accepted by ACM MM 2026, the code is available at: https://github.com/tsinghua-fib-lab/UrbanWorld2.0
NebulaVLA:用于机器人操纵的带引导动作的双频视觉-语言-动作模型
机构 * ZTE Corporation(中兴通讯股份有限公司)
专题命中 机器人基础模型 :manipulation(title);robotic(title);robotics(abstract);分类 cs.RO、cs.AI
AI总结 NebulaVLA是一种异步双频VLA模型,通过解耦语义推理与动作控制、引入GESTURE-7表示及引导动作算法,在LIBERO-Plus上以85.5%成功率、约2.7倍速度优于同步基线,实现高效机器人操纵控制。
Comments 14 pages, 5 figures
$τ_0$-VLA:一种具有世界模型引导测试时计算能力的分层机器人基础模型
机构 * Shanghai Innovation Institute(上海创新研究院) ; Agibot Finch(智元 Finch(智元鹦鹉)) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 机器人基础模型 :robot foundation model(title,abstract);manipulation(abstract);分类 cs.RO
AI总结 $τ_0$-VLA是一种分层机器人基础模型,通过世界模型引导的测试时计算分配额外资源优化子任务生成,经40115小时异构真实数据训练后,可提升长时程机器人操作的闭环成功率。
Comments 18 pages, 5 figures. Project page: https://tau0-vla.github.io/
ViTaR:面向基础VLA操作的视觉-触觉残差自适应方法
专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO
AI总结 ViTaR将触觉反馈转为有界残差修正的执行调制器,在冻结VLA上实现自适应,在UniVTAC基准上成功率提升30.6个百分点,适配真实机器人场景。
结合推测推理与验证的高效VLA推理的算法-架构协同设计
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Computer Science, King Abdullah University of Science and Technology(阿卜杜拉国王科技大学计算机科学学院)
专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 针对VLA模型推理延迟高、动作长度有限的问题,提出SpecVLA算法-架构协同框架,通过状态感知推理、sVLA验证模型与异构架构,在保持任务成功率的同时降低延迟,实现高效可靠的实时机器人操控。
SparkVLA:用于长程操作的停止感知分层视觉-语言-动作(VLA)模型,结合自适应动作分块
专题命中 机器人基础模型 :manipulation(title);分类 cs.RO
AI总结 针对分层VLA系统中停止与动作分块决策孤立评估的问题,提出SparkVLA,通过统一排序解决依赖,在RoboCerebra上取得显著性能提升,真实机器人实验验证了其有效性。
更智能地记忆:用于机器人记忆的视觉历史压缩器与双曲经验空间
机构 * Xidian University(西安电子科技大学)
专题命中 机器人基础模型 :robotic(title);分类 cs.RO
AI总结 该研究提出即插即用模块 RS,通过双分支结构压缩视觉历史并组织经验,适配 pi0 后显著提升机器人任务成功率,在真实机器人实验中表现优异。
Comments 19 pages, 7 pages
EcoVLA:面向实时约束的视觉-语言-动作模型的节能设备-边缘协同推理
机构 * Beihang University(北京航空航天大学) ; Beijing University of Technology(北京工业大学)
专题命中 机器人基础模型 :embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 EcoVLA是面向VLA模型的自适应设备-边缘协同推理框架,可在实时约束下最大化能效,提升能效达236%,同时保持服务水平目标满足。
Comments Accepted by APPT 2026
想象恢复:视觉-语言-动作模型的推理时反事实重对齐
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 针对VLA模型易受在线干扰的问题,提出无需训练的CoRe框架,通过反事实想象与最小重对齐实现无试错恢复,大幅提升任务成功率并减少物理恢复操作。
TurboVLA:在RTX 4090上以32 Hz运行、显存占用<1 GB的实时视觉-语言-动作模型
机构 * Huazhong University of Science and Technology(华中科技大学) ; Huawei Technologies Co. Ltd(华为技术有限公司)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 本研究提出TurboVLA,将传统VLA模型的LLM中心路径重构为视觉语言直接映射,仅0.2B参数即可在RTX 4090上实现97.7%LIBERO任务成功率,性能优于更大模型且显存占用极低。
Comments Code is available at https://github.com/H-EmbodVis/TurboVLA
StructRL:面向基于流的视觉-语言-动作模型的结构化动作空间探索
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Singapore Management University(新加坡管理大学)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO
AI总结 StructRL通过将策略随机性重定位至动作空间的三个耦合设计,解决基于流的VLA模型的结构化噪声稀释问题,在模拟与真实任务上提升了探索效率及OOD性能。
US-VLA:用于腹部超声的超声-视觉-动作模型
机构 * Faculty of Computer Science and Technology, Ocean University of China(中国海洋大学计算机科学与技术学院) ; School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) ; the Qilu Second Hospital of Shandong University(山东大学第二齐鲁医院) ; Innovation School of Artificial Intelligence, Hefei University of Technology(合肥工业大学人工智能创新学院)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV
AI总结 针对现有超声扫描方法泛化性与稳定性不足的问题,提出US-VLA模型,设计超声感知专家融合模块并构建US-VLA-Data数据集,在腹部超声探头操作任务中取得竞争力性能。
PhaseLoRA:面向连续动作视觉-语言-动作策略的控制条件式低秩适配
机构 * Tsinghua University(清华大学)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 PhaseLoRA是面向连续动作VLA策略的轻量级PEFT方法,通过控制条件式LoRA实现阶段依赖适配,在LIBERO数据集上较匹配参数的高秩LoRA基线提升平均成功率12.2个百分点,性能优于其他LoRA变体。
GigaBrain-0.7:采用三系统架构扩展具身基础模型以获得涌现能力
专题命中 机器人基础模型 :embodied agent(abstract);分类 cs.RO
AI总结 研究针对VLA模型泛化不足问题,提出三系统架构的GigaBrain-0.7具身基础模型,扩展至37000小时异质具身数据,实现零样本等能力显著提升,将开源代码与权重。
Comments https://gigaai.cc/blog/gigabrain07
VLAConf: 视觉-语言-动作模型的校准任务成功置信度
机构 * Department of Electronic and Electrical Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学电子与电气工程系,深圳,中国) ; Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) ; National Cybersecurity Academy, Wuhan University, Wuhan, China(武汉大学国家网络安全学院,武汉,中国)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 提出VLAConf,一种基于单类判别性置信度框架的方法,通过冻结预训练VLA内部表示和轻量级置信度头,在单次前向传播中直接估计逐步异常分数,实现高效且跨架构通用的任务成功置信度估计。
Comments 10 pages, 6 figures
Robo-Dopamine 2.0:面向机器人操纵的历史条件感知与分布外感知过程奖励建模
机构 * Peterson Co(彼得森公司)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI
AI总结 本文提出Robo-Dopamine 2.0,一种历史条件与分布外感知的过程奖励模型,结合带符号跳课程训练,提升了机器人操纵的视觉顺序一致性与分布外鲁棒性,在下游强化学习中取得优异的真实世界任务表现。
HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作
机构 * Xi’an Jiaotong University(西安交通大学) ; Peking University(北京大学) ; Nankai University(南开大学)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI
AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。
Comments Project page: https://grange007.github.io/HAF