Beyond Static Forecasting: Unleashing the Power of World Models for Mobile Traffic Extrapolation
超越静态预测:利用世界模型进行移动交通外推
专题命中 具身推理 :world model(title,abstract)
AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
超越静态预测:利用世界模型进行移动交通外推
专题命中 具身推理 :world model(title,abstract)
AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。
Enfold:将世界生成器计算融入预测表示以实现高效具身控制
机构 * Shanghai Jiao Tong University(上海交通大学) ; South China University of Technology(华南理工大学) ; Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))
专题命中 具身推理 :world model(title);分类 cs.RO、cs.CV
AI总结 Enfold将世界生成器计算融入预测表示,在LIBERO等多任务中实现高效具身控制,大幅降低动作延迟,且能适应场景变化,为具身控制提供了新范式。
Comments project page, https://zwl666666.github.io/enfold/
VLAff:用于统一可操作 affordance 的视觉-语言-affordance 模型
机构 * University of Tokyo(东京大学)
专题命中 具身推理 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.CV
AI总结 本研究提出 VLAff 模型,结合 EgoAffordance 数据集,解决人类与机器人 embodiment 不匹配问题,实现视觉 affordance 预测及真实机器人零样本操作等应用。
Comments 8 pages, 5 figures. Accepted to IEEE/RSJ IROS 2026. Project page: https://ojh6404.github.io/vlaff/
从被动镜像到主动智能体:面向网络物理AI的 holonic 数字孪生
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 本文针对当前AI嵌入物理系统失效、无线网络架构无法支持实时物理AI协调的问题,提出HDT-Nets框架,通过holonic数字孪生实现实时物理AI推理,为网络物理AI提供新方案。
PhaseCoder: 无关麦克风几何的多模态大语言模型空间音频理解
机构 * Google DeepMind(谷歌DeepMind) ; Media Lab, MIT(媒体实验室,麻省理工学院) ; Google AR(谷歌AR)
专题命中 具身推理 :embodied AI(abstract);分类 cs.AI
AI总结 PhaseCoder是一种无需麦克风几何结构的Transformer空间音频编码器,能够生成空间嵌入并使LLM实现复杂空间推理和转录任务。
SpaceVLA:用于机器人操作的空间 grounding VLA,支持用户编写的抓取与放置锚点
专题命中 机器人基础模型 :manipulation(title,abstract);robotic(title)
AI总结 本研究针对VLA模型操作时缺乏显式空间意图的问题,提出视觉意图锚点的XR流程,通过微调OpenVLA-7B的SpaceVLA模型,在Unity试验中实现91.25%抓取成功率,完成机器人抓取放置任务。
Comments A poster for the ISMAR conference, 4 pages, 3 figures
SkillMemo:用于组合式具身操纵的专家引导技能记忆框架
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Department of Automation, Tsinghua University(清华大学自动化系) ; Nanyang Technological University(南洋理工大学) ; Beijing Normal University(北京师范大学)
专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 SkillMemo是一种专家引导的技能记忆框架,通过分解轨迹为技能基元并结合动态记忆库,提升了DP和VLA模型的组合泛化能力,在基准测试中达到最优性能。
DyPES-VLA:学习共享动态先验与具身特定控制以实现跨具身操作
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; COCO Matrix
专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO
AI总结 该研究针对跨具身机器人操作问题,提出DyPES-VLA模型,通过学习共享动态先验与具身特定MoE动作头,在LIBERO等数据集上达到先进操作成功率。
上下文视觉-语言-动作模型:通过上下文后训练与智能体工具使用为视觉-语言-动作模型赋予语言能力
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO
AI总结 该研究针对现有VLA模型用CoT会降低控制性能的问题,提出通过上下文后训练和智能体工具使用赋予VLA语言能力的方法,在多模拟和真实机器人任务上实现SOTA性能与效率。
MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; East China University of Science and Technology(华东理工大学) ; Huawei Celia Team(华为Celia团队) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; OpenHelix Robotics
专题命中 机器人基础模型 :world model(abstract);分类 cs.RO
AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。
Comments Accepted by ACM MM 2026
通过预言强化行动策略
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 机器人基础模型 :world model(abstract);分类 cs.RO
AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。
动态目标掩码作为视觉目标条件强化学习的目标表示
机构 * University of Alberta(阿尔伯塔大学) ; McGill University(麦吉尔大学) ; University of Ottawa(渥太华大学) ; AMII ; CIFAR Canada AI Chair(CIFAR加拿大人工智能主席) ; Vector Institute(向量研究所)
专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);navigation(abstract);robotic(abstract)
AI总结 该研究针对视觉目标条件强化学习,提出动态目标掩码作为目标表示,结合Detic等预训练检测器生成掩码,在机械臂和仿真导航任务中实现高成功率与高效学习,支持仿真到现实迁移。
Dream-MPC:基于梯度与潜在想象的模型预测控制
机构 * Autonomous Intelligent Systems, Computer Science Institute VI - Intelligent Systems(自主智能系统,计算机科学研究所VI - 智能系统) ; Robotics, Center for Robotics(机器人学,机器人中心) ; the Lamarr Institute for Machine Learning(拉马尔机器学习研究所) ; Artificial Intelligence, University of Bonn, Germany(人工智能,波恩大学,德国)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 提出Dream-MPC方法,通过从展开策略生成少量候选轨迹,并利用学习的世界模型进行梯度上升优化,结合不确定性正则化和时间上的优化迭代摊销,显著提升了底层策略性能,在24个连续控制任务上优于无梯度MPC和现有基线。
Comments Accepted for International Conference on Machine Learning (ICML) 2026
潜在上下文是否有帮助?北极航运中逆强化学习的受控评估
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过对北极航运航次的受控评估,发现非线性共享奖励模型优于线性基线,添加船舶特定潜在上下文反而降低性能,表明可观测特征已能解释行为差异,为安全关键领域的AI部署提供支持。
DeepForgeSeal:基于对抗强化学习的隐空间驱动半脆弱深度伪造检测水印技术
机构 * The Signal Processing, Artificial Intelligence and Vision Technologies (SAIVT), Queensland University of Technology, Australia(信号处理、人工智能与视觉技术研究所(SAIVT),昆士兰理工大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.CV
AI总结 该研究针对深度伪造检测中现有水印方法鲁棒性与脆弱性难以平衡的问题,提出基于对抗强化学习的隐空间驱动半脆弱水印框架,在CelebA和CelebA-HQ数据集上性能优于现有最优方法
Comments Accepted for Publication in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)
EnvACE:通过世界预演内化环境动态以实现智能体强化学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Sun Yat-sen University(中山大学) ; Central South University(中南大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tencent Inc.(腾讯公司)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI
AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。
面向机械臂的触摸屏远程操作界面的设计与评估
机构 * Institut Polytechnique de Paris(巴黎综合理工学院) ; University of the West of England(西英格兰大学) ; IIT(意大利理工学院) ; Kempten University of Applied Sciences(肯普滕应用技术大学)
专题命中 人机交互与遥操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO
AI总结 本研究设计并评估了一种用于机械臂的触摸屏远程操作界面,经20名参与者对比测试,该界面可缩短任务时间、提升路径精度并降低认知负荷,优于传统操纵杆。
Comments 9 pages, 7 figures, accepted for presentation at the IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026), Kitakyushu, Japan, 24-28 August 2026
GAUGE:面向仿真引擎与视频世界模型物理保真度的、基于测量的基准
专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本研究提出基于真实世界的GAUGE基准,联合评估数值仿真器与生成式视频世界模型的物理保真度,发现无统一保真的物理引擎,视频模型存在轨迹形式正确但物理量错误的问题,为开发高保真仿真器奠定基础。
机器人从人类演示中学习:手写字母轨迹与类人性评估
机构 * University of the West of England(西英格兰大学) ; Bristol Robotics Laboratory(布里斯托机器人实验室) ; Kempten University of Applied Sciences(肯普滕应用科学大学)
专题命中 机器人数据与评测 :robot learning(title);robotic(abstract);分类 cs.RO、cs.LG
AI总结 该研究提出LfD框架,构建含力与归一化时间维度的GMM-GMR方法,基于3142个手写演示数据集,经21人用户研究生成类人性得分71.50的轨迹,开源数据集提供基准。
Comments 9 pages, 7 figures, 4 tables, accepted for presentation at the IEEE International Conference on Development and Learning (ICDL) 2026, Kyoto, Japan, 15-18 September 2026
IcFuzz:基于语义阶段引导与多级变异的Isaac Sim模糊测试
机构 * Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学) ; Chinese University of Hong Kong(香港中文大学)
专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);robotic(abstract);分类 cs.RO
AI总结 本文提出首个针对Isaac Sim的模糊测试方法IcFuzz,通过LLM语义阶段分割、多级变异算子与多臂老虎机算法提升测试效果,在代码覆盖率与漏洞检测上优于基线,已发现11个漏洞且9个被确认修复。
Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
GST-Bench:视觉语言模型能否从视频中发展出全局空间感知能力?
机构 * ByteDance Seed(字节跳动 Seed) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV
AI总结 该研究提出GST-Bench基准评估VLMs的视频全局空间感知,发现其与人类存在显著差距,构建GST-Bench-Local探究原因,还提供GST-Train数据集助力相关研究。
可读且直观的多模态机器人状态与意图通信:在线和真实世界研究验证
机构 * Chair of Perception for Intelligent Systems, Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所智能系统感知教席) ; Centre for Applied Autonomous Sensor Systems (AASS), Örebro University(厄勒布鲁大学应用自主传感器系统中心) ; Robotics Institute Germany (RIG)(德国机器人研究所)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO
AI总结 针对移动非人形机器人,通过在线和真实世界实验,系统比较了低表达单模态LED与高表达多模态(凝视、手势、语音)通信策略,发现多模态更可读直观,且真实环境中可读性和信心下降。
Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)
DocQT: 通过多样化的JPEG量化表提高文档伪造定位的鲁棒性
机构 * MAIF, Niort, France(法国尼奥特MAIF机构) ; L3i Laboratory, La Rochelle University, La Rochelle, France(法国拉罗谢尔大学拉罗谢尔L3i实验室)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV
AI总结 本文提出DocQT数据集,通过对比不同架构在不同量化表训练下的表现,证明标准质量因子增强无法代表实际压缩多样性,并展示了显式考虑量化表的架构在实际部署中的鲁棒性优势。
基于视觉-语言表示学习的场景变化检测
机构 * New York University(纽约大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV
AI总结 本文提出LangSCD框架,通过融合语言和视觉信息提升场景变化检测的鲁棒性,引入几何-语义匹配模块和多类标注数据集NYC-CD,实验证明其在多个基准上的优越性能。
Comments 9 pages, 6 figures, 6 tables
为模块化、纤维增强软连续臂的设计、交互控制和部署设计数字孪生
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO
AI总结 本文提出了一种基于数字孪生的框架,用于设计、交互控制和部署模块化纤维增强软连续臂,通过三维重建和仿真验证,实现了对软机器人臂的高效开发与应用。
Comments 8 pages, 4 figures This work has been submitted for possible publication
Journal ref Adv. Intell. Syst. 8(3), e70465 (2026)
优雅降级:缓解机器人不可避免故障的影响
机构 * George Mason University(乔治梅森大学) ; RobotiXX Lab(RobotiXX实验室)
专题命中 机器人数据与评测 :分类 cs.RO、cs.AI、cs.LG;robotics(comments)
AI总结 针对家庭服务机器人不可避免的故障,本文提出一种评估故障影响概率与严重程度的安全公式,结合FailBench模拟框架,为开发更安全的机器人运动规划及学习策略提供基础。
Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA 2026)
Recti-Q:用于边缘机器人中分布外鲁棒量化感知的特征空间校正
专题命中 其他机器人 :robotics(title);robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 研究针对边缘机器人中PTQ在分布变化下可靠性降低的问题,提出轻量级特征空间校正框架Recti-Q,它冻结量化主干,仅用源数据训练小型分类器头LoRA适配器,与架构无关,能恢复鲁棒性,节省内存且实现低带宽OTA弹性修补。
Comments Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
如您所愿:利用LLM在精准农业中进行形式化验证的任务规划
机构 * University of California, Merced(加州大学默塞德分校)
专题命中 其他机器人 :robotic(abstract);分类 cs.RO、cs.AI;robotics(journal_ref)
AI总结 针对自然语言歧义性,提出基于线性时序逻辑(LTL)反馈循环的LLM任务规划系统,通过双LLM分工实现规范生成与验证,提升精准农业任务规划的可靠性。
Journal ref Published in Proceedings of 2026 International Conference on Robotics and Automation (ICRA)
经皮脊髓刺激(tSCS)可破坏健康成年人的有意识踝关节本体感觉,并产生更受限的运动模式
专题命中 其他机器人 :robotic(abstract);分类 cs.RO
AI总结 该研究以28名健康成年人为对象,探究tSCS的效应,发现其破坏有意识踝关节本体感觉、使步态更受限,且经刺激下训练可改善本体感觉并重塑运动控制。
BendTwin:基于弯曲感知可微分弹簧-质量模型的鲁棒密到稀物理重建
机构 * University of Cambridge(剑桥大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Northwestern Polytechnical University(西北工业大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 其他机器人 :robotics(abstract);分类 cs.CV
AI总结 BendTwin是一种弯曲感知可微分弹簧-质量框架,通过引入弯曲约束提升力学稳定性,在可变形物体重建与预测任务中优于仅用轴向弹簧的PhysTwin,可用于从稀疏视角RGB-D视频构建力学保真数字孪生。