Facial Expression Generation Aligned with Human Preference for Natural Dyadic Interaction
面向自然双人互动的人类偏好对齐的面部表情生成
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV
AI总结 本文提出了一种基于人类反馈的面部表情生成方法,通过动作学习和强化学习策略实现自然双人互动中与人类偏好的对齐。
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
面向自然双人互动的人类偏好对齐的面部表情生成
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV
AI总结 本文提出了一种基于人类反馈的面部表情生成方法,通过动作学习和强化学习策略实现自然双人互动中与人类偏好的对齐。
H-WM:由分层世界模型引导的机器人任务和运动规划
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; University of Toronto(多伦多大学) ; University of British Columbia(不列颠哥伦比亚大学) ; McGill University(麦吉尔大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 H-WM通过结合逻辑和视觉世界模型,实现机器人任务和运动规划中的鲁棒长视界推理与稳定引导。
Comments 8 pages, 4 figures
跨视角视觉:评估视觉-语言模型在机器人场景中的空间推理能力
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Microsoft Research Asia(微软亚洲研究院) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV
AI总结 本文提出MV-RoboBench基准,评估视觉-语言模型在机器人场景中的多视角空间推理能力,揭示其在多视角机器人感知中的挑战。
Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://aaronfengzy.github.io/MV-RoboBench-Webpage/
Journal ref International Conference on Learning Representations (ICLR), 2026
VCA:面向目标模糊环境中的分割物体精确操控的视觉-点击-动作框架
机构 * ROBROS Inc.(ROBROS公司)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 VCA框架通过视觉点击交互替代文本指令,实现目标模糊环境中分割物体的精确操控,提升机器人操作的准确性和实用性。
Comments Submitted to UR 2026
动作推理:利用LLM进行三维空间中的机器人动作推理以实现积木堆叠
机构 * CV4DT, CSIC, Department of Engineering, University of Cambridge(CV4DT、CSIC、工程系、剑桥大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 本文提出ActionReasoning框架,利用LLM进行三维空间中的动作推理,实现稳定积木堆叠,提升机器人操作的泛化能力。
Comments 8 pages, 5 figures, accepted by the 2026 IEEE International Conference on Robotics and Automation
价格并不合理:神经符号方法在结构化长周期操作任务中优于VLA,且能耗显著更低
机构 * Human-Robot Interaction Lab, Tufts University(Tufts大学人机交互实验室) ; AIT Austrian Institute of Technology GmbH(奥地利技术研究所)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 神经符号方法在结构化长周期操作任务中表现优于VLA,且能耗更低。
Comments Accepted at the 2026 IEEE International Conference on Robotics & Automation (ICRA 2026)
EgoScale:利用多样化的视点人类数据进行规模化灵巧操作
机构 * NVIDIA ; University of California, Berkeley(加州大学伯克利分校) ; University of Maryland(马里兰大学)
专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.RO
AI总结 EgoScale通过大规模视点人类数据训练视觉语言动作模型,实现高效的灵巧操作转移,提升机器人任务成功率54%。
MoIRA:多任务机器人中的模块化指令路由架构
机构 * Department of Multimedia Systems, National University of Kyiv-Mohyla Academy(多媒体系统系,基尔夫学院国家大学) ; Department of Mathematics, National University of Kyiv-Mohyla Academy(数学系,基尔夫学院国家大学)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO
AI总结 MoIRA是一种模块化指令路由架构,通过外部文本路由器协调专家,实现高效多任务机器人系统。
Comments Updated to reflect the final accepted version published in Neurocomputing
Journal ref Neurocomputing, vol. 674, 132962, 2026
InternVLA-A1:统一理解、生成和行动以实现机器人操作
机构 * InternVLA-A1 Team(InternVLA-A1团队)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 InternVLA-A1通过统一的Transformer架构,结合语义理解和动态预测能力,提升了机器人操作任务的性能。
Comments Homepage: https://internrobotics.github.io/internvla-a1.github.io/
UniManip: 通用目的零样本机器人操作的代理操作图
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) ; Department of Automation, Tsinghua University, China(清华大学自动化系)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 UniManip通过双层代理操作图实现通用零样本机器人操作,结合高层任务协调与底层动态状态表示,提升无监督环境下的执行鲁棒性。
Comments 15 pages, 12 figures, 6 tables, project page: https://henryhcliu.github.io/unimanip
HoloBrain-0 技术报告
机构 * Horizon Robotics
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 HoloBrain-0 提出了一种融合视觉、语言和动作的框架,通过预训练和后训练范式,在模拟和现实任务中取得领先性能,并开源完整生态系统促进机器人研究。
Comments 32 pages
为分层操作策略扩展世界模型
机构 * Xi’an Jiao Tong University(西安交通大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 本文提出分层VLA框架,利用大规模预训练世界模型提升机器人操作在分布外场景的泛化能力,实验显示性能提升显著。
通过屋顶线建模为设备端大语言模型设计硬件协同缩放定律
机构 * AI Lab, The Yangtze River Delta Institution of Automation, Chinese Academy of Sciences(人工智能实验室,长江三角洲自动化研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; University College London(伦敦大学学院) ; Institution of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) ; The University of Edinburgh(爱丁堡大学)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.LG
AI总结 本文提出通过屋顶线建模为设备端大语言模型设计硬件协同缩放定律,通过训练170个模型建立架构与训练损失的缩放关系,实现准确度与延迟的直接对应,降低架构选择时间并提升模型性能。
UniVTAC:一种用于视觉-触觉操作数据生成、学习和评估的统一仿真平台
机构 * ScaleLab, Shanghai Jiao Tong University(上海交通大学ScaleLab) ; D-Robotics ; ViTai Robotics ; The University of Hong Kong(香港大学) ; Nanjing University(南京大学) ; Shenzhen University(深圳大学) ; Wuhan University(武汉大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 UniVTAC提出了一种统一的视觉-触觉数据生成平台,通过训练触觉中心的编码器和基准任务提升机器人操作的成功率。
Comments Website: https://univtac.github.io/
RoboInter: 一种面向机器人操控的综合中间表示套件
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Beihang University(北航) ; Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 RoboInter通过统一的中间表示套件,提升机器人操控中视觉-语言-动作系统的泛化能力和推理能力。
Comments Published to ICLR 2026, 69 pages, 40 figures
NavDreamer: 视频模型作为零样本三维导航器
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO
AI总结 NavDreamer利用视频模型实现零样本三维导航,通过生成视频模型作为语言指令与导航轨迹的接口,结合时空信息和物理动态,实现强大泛化能力。
Comments Work in the progress. 22 pages, 15 figures
区分与注入:通过参数结构推理诱导的功能区分来增强VLAs
机构 * University of Science(科学大学) ; Zhejiang University of Technology(浙江工业大学) ; Technology University(技术大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 iSTAR通过参数结构推理诱导功能区分,提升VLA模型在任务分解和任务变化下的可靠性与成功率。
RoboPaint:从人类示范到任何机器人和任何视角
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 RoboPaint通过真实-仿真-真实数据流程,将人类示范转化为机器人训练数据,实现高效、低成本的复杂灵巧操作训练。
Comments 17 pages
StreamVLA: 通过完成状态门控打破原因-行动循环
机构 * Tsinghua University(清华大学) ; Technical University of Munich(慕尼黑技术大学) ; Shanghai University(上海大学) ; Wuhan University(武汉大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 StreamVLA通过完成状态门控机制,实现高效机器人操作,减少推理延迟并提升任务成功率。
PhysBrain: 人眼视角数据作为视觉语言模型到物理智能的桥梁
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 PhysBrain通过将人类眼动视频转化为多级具身监督,提升机器人在眼动感知和长期规划中的能力,实现从人类视角到机器人控制的有效迁移。
Comments 21 pages, 8 figures
当注意力背叛时:通过重建视觉标记在机器人策略中消除后门攻击
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Faculty of Artificial Intelligence, Hubei University(湖北大学人工智能学院) ; Institute of Technological Sciences, Wuhan University(武汉大学技术科学研究院) ; School of Robotics, Wuhan University(武汉大学机器人学院)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 Bera通过重建视觉标记消除机器人策略中的后门攻击,无需重新训练模型即可有效防御后门风险。
Comments ICRA2026 accepted
加速自动驾驶中的结构化链式推理
机构 * NVIDIA ; University of Southern California(南加州大学) ; Harvard University(哈佛大学) ; Stanford University(斯坦福大学)
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO
AI总结 FastDriveCoT通过并行解码方法加速自动驾驶中的结构化链式推理,实现3-4倍的生成速度提升和端到端延迟的显著降低,同时保持推理效果。
ConLA:从人类视频中通过对比学习学习机器人操作
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; State Key Laboratory of Mobile Network and Mobile Multimedia Technology, Shenzhen(移动网络与移动多媒体技术国家重点实验室(深圳)) ; ZTE Corporation(中兴通讯) ; Shanghai Jiao Tong University(上海交通大学) ; Central South University(中南大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 ConLA通过对比学习从人类视频中学习机器人操作,有效解决潜在表示中的捷径学习问题,提升机器人学习的可扩展性。
IROS: 一种用于实时基于视觉语言模型的室内导航的双过程架构
机构 * Yonsei University(延世大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 IROS是一种结合视觉语言模型上下文推理与轻量级感知模块的双过程架构,实现低延迟的室内导航。
统一感知与行动:一种融合模态的管道,具有隐式视觉推理链的机器人行动生成
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 VITA通过融合视觉和动作的共享潜在空间,实现机器人行动生成的统一感知与行动,提升了多个任务的成功率和性能。
Shallow-π:基于流的视觉-语言-动作模型的知识蒸馏
机构 * Samsung Research South Korea(三星韩国研究)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 Shallow-π通过知识蒸馏显著减少基于流的VLA模型的transformer深度,实现更快的推理速度和更高的性能
TC-IDM:为可执行零样本机器人运动实现视频生成
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) ; School of Computer Science, Peking University(北京大学计算机科学学院)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 TC-IDM通过工具中心逆动力学模型实现视频生成,提升机器人零样本任务的执行能力与泛化性能。
生成场景回放用于端到端自动驾驶
机构 * Qualcomm AI Research(高通人工智能研究)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV
AI总结 GeRo通过自回归回放策略,结合规划与生成,提升自动驾驶系统的长期推理和多代理规划能力。
GR-Dexter 技术报告
机构 * ByteDance Seed(字节跳动种子)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 GR-Dexter 提出了一种综合框架,通过紧凑机械手、双臂遥控系统和训练配方,实现基于VLA的通用灵巧手机器人操作。
LoLA:面向通用机器人操作的长周期隐式动作学习
机构 * Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Microsoft Research(微软研究院)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO
AI总结 LoLA通过整合长期多视角观察和机器人本体感觉,实现长周期、语言引导的机器人操作任务,显著优于现有方法。