arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-27 至 2026-03-27 共收录 7 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 5 篇

2603.25740 2026-03-27 cs.RO cs.AI cs.CV cs.LG cs.MA 89%

Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving

Drive My Way: 为个性化驾驶的视觉-语言-动作模型偏好对齐

Zehao Wang, Huaide Jiang, Shuaiwu Dong, Yuping Wang, Hang Qiu, Jiachen Li

机构 * University of California, Riverside(加州大学河滨分校) University of Michigan(密歇根大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出Drive My Way框架,通过学习用户驾驶习惯和自然语言指令,实现个性化驾驶,提升对用户意图的适应能力。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026); Project website: https://dmw-cvpr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24941 2026-03-27 cs.CV cs.CL 88%

Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models

超越注意力幅度:利用层间排名一致性提升高效视觉-语言-动作模型

Peiju Liu, Jinming Liu, Xipeng Qiu, Xuanjing Huang

机构 * Fudan University(复旦大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

AI总结 本文提出TIES框架,通过层间排名一致性动态平衡注意力幅度,提升视觉-语言-动作模型的效率,实现在CogACT+SIMPLER基准上成功率提升6%并减少78%的token使用。

Comments 10 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25038 2026-03-27 cs.RO 83%

$π$, But Make It Fly: Physics-Guided Transfer of VLA Models to Aerial Manipulation

$π$, 但使其飞行:基于物理的VLA模型向空中操作的转移

Johnathan Tucker, Denis Liu, Aiden Swann, Allen Ren, Javier Yu, Jiankai Sun, Brandon Kim, Lachlain McGranahan, Quan Vuong, Mac Schwager

机构 * Stanford University(斯坦福大学) Physical Intelligence

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出AirVLA系统,研究预训练VLA模型在空中抓取任务中的迁移性,通过引入负载感知指导机制和高斯点扩散管道合成数据,提升空中操作性能,实现导航任务100%成功和抓取任务50%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25562 2026-03-27 cs.NI cs.SY eess.SP eess.SY 50%

Deep Reinforcement Learning-Based Cooperative Rate Splitting for Satellite-to-Underground Communication Networks

基于深度强化学习的卫星到地下通信网络协作速率分割

Kaiqiang Lin, Kangchun Zhao, Yijie Mao

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出一种基于协作速率分割的传输框架,通过地面中继解码并转发公共流至地下设备,解决地下通信中的信号衰减问题,采用深度强化学习优化功率分配、信息分割和时间槽调度以提升最小可实现速率。

Comments 6 pages, 3 figures, 1 table, and submitted to IEEE TVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24702 2026-03-27 physics.flu-dyn 50%

Detonation propagation in weakly confined gases

弱约束气体中的爆轰传播

Youssef K. Wahba, XiaoCheng Mi, Charles B. Kiyanda, Andrew J. Higgins

专题命中 VLA模型 :action model(abstract)

AI总结 研究弱约束气体中爆轰在分层结构中的传播,通过CFD模拟分析声学阻抗比和层厚对爆轰行为的影响,提出解析模型解释不同驱动状态下的爆轰特性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 语言条件控制 1 篇

2603.25481 2026-03-27 cs.RO 81%

LILAC: Language-Conditioned Object-Centric Optical Flow for Open-Loop Trajectory Generation

LILAC:基于语言的物体中心光学流用于开环轨迹生成

Motonari Kambara, Koki Seno, Tomoya Kaichi, Yanan Wang, Komei Sugiura

机构 * Keio University(庆应义塾大学) KDDI Research Inc.(KDDI研究所)

专题命中 语言条件控制 :vision-language-action(abstract);VLA(abstract);action model(abstract);language-conditioned robot(abstract)

AI总结 本文提出LILAC模型,通过结合视觉与语言信息生成物体中心光学流,并转化为6自由度机械臂轨迹,实验显示其在多个基准和实际物体操作中表现更优。

Comments Accepted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 1 篇

2512.02787 2026-03-27 cs.RO cs.CV 73%

Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols

通过视觉符号诊断、纠正并学习操纵失败

Xianchao Zeng, Xinyu Zhou, Youcheng Li, Jiayou Shi, Tianle Li, Liangming Chen, Lei Ren, Yong-Lu Li

机构 * Beihang University(北京航空航天大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数据集与评测 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出ViFailback框架,通过视觉符号提升标注效率,并释放大规模数据集和基准测试,验证了框架在故障诊断和纠正中的有效性。

Comments Accepted by CVPR 2026. Project Website: https://x1nyuzhou.github.io/vifailback.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏