arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-23 至 2026-07-23 共收录 14 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 12 篇

2607.20345 2026-07-23 cs.RO cs.AI 新提交 91%

Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

弥合实验室与商店之间的差距:一种用于零售类人机器人的数据高效训练后及经验驱动学习的VLA框架

Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le

机构 * HIVE Robots(蜂巢机器人公司) Technical University of Denmark(丹麦技术大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 研究针对VLA类人机器人弥合实验室与实际应用差距的问题,提出DEED系统级方法,含数据高效训练后管道、经验驱动细化研究及潜在空间分析工具,经实验证明精心设计数据和训练后处理可解决该问题。

Comments 8 pages. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19399 2026-07-23 cs.LG cs.AI cs.CV 新提交 90%

Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models

在大规模视觉-语言-动作模型中利用离线监督实现高效且通用的强化学习

Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 研究在大规模视觉-语言-动作模型中,通过将离线监督纳入强化学习,结合离线与在线训练优点,提升训练效率。经实验验证,该混合方法在保持强大分布外能力的同时,所需训练预算减半,实现效率与性能双赢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27355 2026-07-23 cs.RO 版本更新 90%

RouterVLA: Budgeted Commissioning and Expert Onboarding for Growing VLA Pools

RouterVLA:将冒烟测试转化为异构VLA选择的监督信号

Xingyu Ren, Chugang Yi, Youran Sun

机构 * The Chinese University of Hong Kong(香港中文大学) University of Maryland, College Park(马里兰大学 College Park 分校) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出RouterVLA方法,利用预部署评估的冒烟测试记录来监督异构VLA策略的选择,通过结果分离的交叉拟合和透明规则,在LIBERO-Plus数据集上将保留集成功率提升14.64个百分点。

Comments v2: revised title, updated author list, restructured the experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15330 2026-07-23 cs.RO cs.CV 版本更新 90%

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

小米机器人1:利用超过10万小时的真实世界轨迹扩展视觉语言动作模型

Xiaomi Robotics Team, Jun Guo, Piaopiao Jin, Jason Li, Peiyan Li, Yingyan Li, Futeng Liu, Wanli Peng, Optimus Qin, Yifei Su, Nan Sun, Qiao Sun, Runze Suo, Heyun Wang, Yunhong Wang, Rujie Wu, Caoyu Xia, Lina Zhang, Jack Zhao, Guoliang Chen, Wenlong Chen, Xinze He, Bin Li, Qing Li, Zhuorong Li, Heng Qu, Wenxuan Song, Diyun Xiang, Yifan Xie, Peiran Xu, Hangjun Ye, Wen Ye, Han Zhao, Quanyun Zhou

机构 * Xiaomi Robotics(小米机器人)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 研究提出小米机器人1这一视觉语言动作模型,采用两阶段训练方法,预训练利用大量真实轨迹赋予模型能力,后训练使其与机器人实体及指令对齐。该模型在多基准测试中表现优异,能有效微调,建立新的最先进水平。

Comments Project page: https://robotics.xiaomi.com/xiaomi-robotics-1.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02533 2026-07-23 cs.RO cs.LG 90%

HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models

HMVLA:超几何多模态融合用于视觉-语言-动作模型

Kun Wang, Xiao Feng, Mingcheng Qu, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) Chongqing Research Institute of HIT(重庆HIT研究 institute) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract,abstract_cn);vision language action(abstract)

AI总结 HMVLA通过在双曲空间中融合视觉、语言和动作信息,提升多模态语义对齐的效率和准确性。

Comments 5 pages,5 figures,ICASSP

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20175 2026-07-23 cs.CV 新提交 79%

PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving

PerceptDrive:用于端到端自动驾驶的具有自适应专家路由的感知先验世界-动作建模

Yushan Liu, Tianxiong Lv, Bohua Wang, Hangqi Fan, Chenxu Zhao, He Zheng, Xuchang Zhong, Yifan Xie, Congyang Zhao, Zhihao Liao, Leigang Luo, Yang Cai, Xiao-Ping Zhang, Wenbo Ding

机构 * Tsinghua University(清华大学) AMap, Alibaba Group(高德软件有限公司,阿里巴巴集团)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 研究针对自动驾驶中感知基础模型的问题,提出PerceptDrive框架,将教师提炼先验和观察潜变量输入可训练模型,经特定分支处理、先验保留及场景条件路由,实验表明其性能领先,证实相关方法的有效性及对先验的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20061 2026-07-23 cs.RO 新提交 77%

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

ReferTrack:用于具身视觉跟踪的先指认后跟踪

Hanjing Ye, Tianle Zeng, Jiazhao Zhang, Shaoan Wang, Zibo Zhang, Weisi Situ, Yuchen Zhou, Yonggen Ling, Hong Zhang

机构 * SUSTech(南方科技大学) Tencent Robotics X(腾讯机器人X实验室) Peking University(北京大学) Futian Laboratory(福田实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 研究针对具身视觉跟踪问题,提出ReferTrack先指认后跟踪范式,用单个摄像头,先选目标再解码跟踪航点,通过滑动窗口队列保留运动线索,经数据集协同训练增强识别,在EVT - Bench上达先进单视图性能并验证了迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19695 2026-07-23 cs.RO cs.CV 新提交 73%

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation

NavVerse:在连续机器人模拟中对室内到室外的具身导航进行基准测试

Junzhe Wu, Yue Hu, Zeyu Han, Po-Hsun Chang, Yinan Dong, Behrad Rabiei, Maani Ghaffari

机构 * University of Michigan(密歇根大学) Tsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 研究针对机器人在连续场景中从室内到室外的导航问题,引入NavVerse基准,涵盖多种场景和任务。通过可执行接口用多指标评估智能体,零样本实验显示当前智能体在跨上下文导航上差距大,适应是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14969 2026-07-23 cond-mat.str-el 版本更新 71%

On the Symmetries of Anisotropic Spin Interaction Models

关于各向异性自旋相互作用模型的对称性

Arist Zhenyuan Yang

专题命中 VLA模型 :action model(title)

AI总结 研究各向异性自旋相互作用模型的对称性,通过重新定义纯自旋群\(S_0\)制定tSSG理论,研究自旋-1模型发现\(\mathbb{Z}_2\)拓扑四极激发及相关特性,建立相互作用自旋系统对称语言,开辟非常规磁性研究途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12381 2026-07-23 quant-ph 版本更新 71%

Enhanced quantum illumination of a lossy target: A sequential interaction model

增强的损失性目标量子照明:一个顺序交互模型

Shilpi Srivastava, Shubhrangshu Dasgupta

专题命中 VLA模型 :action model(title)

AI总结 研究在现实环境中量子照明对损失性目标的有效性,比较高斯双模压缩态与最优经典协议的性能,发现TMSS在低反射率目标下具有更高的SNR和更强的抗热噪声能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18709 2026-07-23 cs.RO 版本更新 70%

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

RoboInter1.5:用于具身世界建模和机器人操作的整体中间表示套件

Ziqin Wang, Hao Li, Weijun Wang, Junhao Cai, Jia Zeng, Yilun Chen, Jiangmiao Pang, Si Liu

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究针对现有机器人数据集问题,基于RoboInter1.0提出RoboInter1.5套件,含多种中间表示资源及相关任务,通过广泛评估证明其为中间表示提供统一时空框架,将其作为双向接口,规范动作空间并约束物理模拟器潜在展开。

Comments 28 pages. arXiv admin note: substantial text overlap with arXiv:2602.09973

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19906 2026-07-23 cs.LO cs.MA 新提交 50%

The Dynamic Turn in Paraconsistency

弗协调逻辑中的动态转向

Rafael Ongaratto, Hans van Ditmarsch

专题命中 VLA模型 :action model(abstract)

AI总结 该研究提出弗协调逻辑的动态转向,引入AMLFI1及其特殊情况PALFI1,还有带事实变化的UMLFI1,证明了这些逻辑的可靠性和完全性,它们扩展了已知认知弗协调逻辑,可形式化临时矛盾的获取与解决。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2607.19633 2026-07-23 cs.RO 新提交 70%

LENS: LLM-guided Environment Simplification for Planning and Control in Clutter

LENS:用于杂乱环境中规划与控制的大语言模型引导的环境简化

Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对现实世界多物体杂乱环境处理难题,提出LENS方法,通过大语言模型引导自动生成特定场景和任务的自适应更新抽象,经实验验证其能改进多种模型在高度杂乱操纵场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19919 2026-07-23 cs.RO cs.LG 新提交 62%

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

扩散重滚动:用于机器人序列预测的可修正去噪

Seonsoo Kim, Seongil Hong, Jun-Gill Kang

机构 * Agency for Defense Development(国防发展局)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.LG

AI总结 研究提出扩散重滚动框架用于机器人序列预测,能选择性重新去噪局部稳定区域,实现跨视野迭代修正。通过与其他方法对比评估,在多任务基准测试中取得更好性能,支持结构化重新去噪是可修正机器人序列生成的有效机制。

Comments Project Page: https://seonsoo-p1.github.io/DiffusionReRoll/

详情

展开后加载摘要…

URL PDF HTML 收藏