arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-29 至 2026-07-29 共收录 36 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 2 篇

2607.25593 2026-07-29 cs.RO 新提交 83%

When Does Legacy Data Start to Help? Emergent Transfer in Cross-Configuration Robot Learning

遗留数据何时开始发挥作用?跨配置机器人学习中的涌现转移

Tao Wang, Hudson Hou, Yingdong Hu, Yufeng Liu, Qinghai Li, Yingjie Jiang, Yingzhi Wang, Cheng Ma, Richard Wang, Yang Gao

专题命中 机器人学习 :robot learning(title);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究跨配置机器人学习中遗留数据何时有益,发现存在类似顿悟的三阶段转变,即低能力时遗留数据无效,超阈值后收益剧增,高能力时收益递减,基于梯度对齐等给出理论解释和阶段感知规则并验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25541 2026-07-29 cs.RO 新提交 79%

P3: Probabilistic Policy Propagation for Stable VAE-Based Robot Learning

P3:基于稳定变分自编码器的机器人学习的概率策略传播

Liyun Yan, Jianming Ma, Yang Zhang, Shengcheng Fu, Zhanxiang Cao, Keqi Zhu, Yizhi Chen, Yue Gao

专题命中 机器人学习 :robot learning(title);robotics(abstract);分类 cs.RO

AI总结 研究基于变分自编码器的机器人学习中随机潜变量与近端策略优化不匹配问题,提出P³框架,它结合概率方法与采样校准,实验表明可提高数据效率、减少收敛步数,为人形跑酷任务的基于变分自编码器的PPO奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 10 篇

2607.26047 2026-07-29 cs.RO 新提交 83%

S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information

S2A2:利用声学空间信息进行操作任务的视听模仿学习

Kaneyoshi Hiratsuka, Benjamin Yen, Ryosuke Kojima

机构 * Kyoto University(京都大学) RIKEN(理化学研究所) Institute of Science Tokyo(东京理科大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 研究利用声学信息进行操作任务的模仿学习,提出多模态框架S2A2,集成视觉与声学信息,实现多种策略集成,模拟与真实机器人实验表明其对特定任务有效且适用于现实操作。

Comments Project page: https://azuma413.github.io/projects/s2a2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25895 2026-07-29 cs.RO cs.CV cs.LG 新提交 82%

HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

HiFi-UMI:仅从高保真UMI数据中学习可部署的操作策略

Simple AI, :, Yuteng Wei, Jinming Ma, Jiawei Wang, Weitao Zhou, Yushen Zuo, Ke Rui, Minglei Li, Jinhao Zhang, Zhikang Pan, Xiang Wang, Haoran Jia, Huan Du, Zicheng Zeng, Jun Ma, Guiyu Qin, Di Zhang, Xiaofei Li

机构 * Simple AI(简单人工智能公司)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究如何从高保真UMI数据学习可部署操作策略,提出HiFi-UMI系统,其无需外部跟踪达3毫米精度。利用该系统数据实现零机器人训练后策略,预训练还能降误差提成功率,且开源了相关高保真资源。

Comments 33 pages, 15 figures, 4 tables. Project page: https://cloud.simpleai.tech/simple-world-lab/hifi-umi/ Dataset: https://huggingface.co/datasets/simple-world-lab/HiFi-UMI-2K

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24859 2026-07-29 cs.CR 新提交 78%

The Mirage of LLM Guardrails: A Case Study in AI-Assisted Medical Note Manipulation

大语言模型护栏的幻象:人工智能辅助医疗记录操纵的案例研究

Davis Yadav, Amulya Yadav

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 研究大语言模型在医疗记录操纵场景下内置护栏的可靠性,通过开发操纵流程、实证评估、利用多种指标评估及用户研究,揭示其弱点,为大语言模型在医疗领域的护栏设计、安全政策及伦理等方面提供参考。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24888 2026-07-29 cs.CR cs.SE 新提交 71%

Trusting-Trust Attack against an Entire Linux Distribution through Binary Manipulation

通过二进制操作对整个Linux发行版进行信任-信任攻击

Julien Malka, Aman Sharma, Martin Monperrus, Stefano Zacchiroli, Théo Zimmermann

专题命中 机器人操作 :manipulation(title)

AI总结 研究针对Linux发行版的信任-信任攻击,利用对成品ELF文件的操作,围绕GNU strip构建攻击。在NixOS引导中植入有效载荷,在实际nixpkgs版本上成功构建安装程序并植入后门,证明该攻击不限于编译器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25397 2026-07-29 cs.RO 新提交 70%

Decompose and Reorganize: Planning with Primitives and Visuomotor Policies Learned from Demonstrations

分解与重组:利用从示范中学到的原语和视觉运动策略进行规划

Yizhou Chen, Hang Xu, Dongjie Yu, Yupu Lu, Tengye Xu, Zeqing Zhang, Wei Zhang, Yi Ren, Ben M. Chen, Jia Pan

机构 * The University of Hong Kong(香港大学) JD.com (JingDong)(京东) Nanyang Technological University (NTU)(南洋理工大学) Southern University of Science and Technology (SUSTech)(南方科技大学) Huawei Technologies(华为技术有限公司) The Chinese University of Hong Kong (CUHK)(香港中文大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究如何使机器人灵巧、长视野操作自动化,提出DR-LfD框架,将视觉运动策略集成到TAMP决策系统,基于接触关系分解示范为原子技能,经实验验证该框架在多类任务中性能强大。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25798 2026-07-29 cs.RO 新提交 57%

Transformer Transformer: A Unified Model for Motion-Conditioned Robot Co-design

Transformer Transformer:一种用于运动条件机器人协同设计的统一模型

Huy Ha, C. Karen Liu, Shuran Song

机构 * Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 研究运动条件机器人协同设计问题,提出基于RoboTokens训练的Transformer Transformer统一模型,能跨实体空间和用例,通过动力学自引导优化设计,实验显示其可零样本优化,制造的优化设计大幅降低跟踪误差。

Comments 26 pages, 12 figures, 20 tables. Project page: https://transformer-transformer.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25227 2026-07-29 cs.CR cs.LG 新提交 57%

Decision-Level Hijacking: Injecting Cognitive Bias into Large Language Models via Bit-Flip Attacks

决策级劫持:通过位翻转攻击向大语言模型注入认知偏差

Yu Yan, Jiahao Chen, Siqi Lu, Yongjuan Wang, Ziming Zhao, Zhaoxuan Li, Tianyu Du, Qingjun Yuan, Shouling Ji

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 研究大语言模型在高风险决策场景中的决策级劫持问题,提出CogBias框架,利用位翻转攻击,通过可微情感评估器等将主观偏好转化为优化信号,经实验验证该方法能在少量位翻转下诱导目标主题立场转变,破坏模型价值对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25846 2026-07-29 math.GR math.FA math.MG 新提交 50%

Ends of Uncountable Locally Finite Groups: An Analytic and Coarse Geometric Approach

不可数局部有限群的端点:一种分析与粗几何方法

Hussain AL-Rasheed

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究不可数局部有限群的端点问题,采用通过希格森冠拓扑结构的粗几何方法,借助子群不变性解释粗开闭集边界,利用相关技术实现几何刚性,得出此类群恰好有一个端点的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25998 2026-07-29 quant-ph 新提交 50%

Observable Estimation in the Absence of Classical Verification

在没有经典验证的情况下的可观测量估计

Samantha V. Barron, Bradley Mitchell, Vinay Tripathi, Francesco Grieco, Ilan Rosen, Francesca Pietracaprina, Davide Materia, Alireza Seif, Darvin Wanisch, Ramón L. Panadés-Barrueta, Ewout van den Berg, Jay-U Chung, Andrew Eddins, Sam Ferracin, Guillermo García-Pérez, John Goold, Luke C. G. Govia, Holger Haas, Ian Hincks, Jesse C. Hoke, Zoë Holmes, Su-un Lee, Youngseok Kim, Swarnadeep Majumder, Sabrina Maniscalco, Simone Montangero, Daniel Puzzuoli, Tomaž Prosen, James Raftery, Ricardo Rivera Cardoso, Max Rossmannek, Manuel Rudolph, Brendan Saxberg, Liran Shirizly, Karthik Siva, Joshua Skanes-Norman, Ilaria Siloi, Kevin C Smith, Boris Sokolov, Maika Takita, Yanting Teng, Mao Tian Tan, Joseph Tindall, Zoltán Zimborás, Matteo A. C. Rossi, Minh C. Tran, Sergei N. Filippov, Abhinav Kandala

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究在无经典验证时如何信任量子结果,建立独立验证量子估计框架,应用于物理模型半混沌动力学,通过量子启发式实验测试假设并增强信心,还可通过操纵噪声设置精度界限,为可信量子计算提供途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25303 2026-07-29 physics.optics 新提交 50%

Resonance-Induced Sign Reversal of Optical Gradient Forces and Three-Dimensional Singularity Trapping

共振诱导的光学梯度力符号反转与三维奇点捕获

Jinsheng Lu, Soon Wei Daniel Lim, Federico Capasso

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究光频率通过共振时光学梯度力的变化,利用广义Fano线形模型定量分析,通过全波模拟验证,在此基础上实现硅纳米颗粒的三维奇点捕获,建立了控制共振系统光学力的设计原则。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 10 篇

2607.25106 2026-07-29 cs.CV 新提交 83%

IMPRINT: Image-Conditioned Query Enrichment for Long-Tail Object Goal Navigation

IMPRINT:用于长尾目标导航的图像条件查询增强

Jelin Raphael Akkara, Filippo Ziliotto, Luciano Serafini, Lamberto Ballan, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)

专题命中 具身导航 :navigation(title,abstract);embodied AI(abstract);分类 cs.CV

AI总结 研究针对具身人工智能中ObjectNav依赖纯文本查询可靠性低的问题,提出IMPRINT框架,用网络图像丰富文本查询改善定位,无需训练导航策略。通过新基准HSSD-rare评估,显示图像条件查询可提升导航增益,还指出下游检测质量是关键瓶颈。

Comments Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). Project page: https://github.com/JelinR/IMPRINT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25754 2026-07-29 cs.RO 新提交 79%

Cooperative Multi-UAV Navigation in Complex Environments via Systematic Multi-Agent Deep Reinforcement Learning

通过系统多智能体深度强化学习实现复杂环境下的多无人机协同导航

Yu Su, Nabil Aouf

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对复杂环境下多无人机协同导航面临的问题,提出多智能体深度强化学习框架,通过协同探索等方法解决,含感知、示范缓冲区和课程调度机制,能抽象特征实现跨场景转移,经仿真验证有良好性能。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25448 2026-07-29 cs.RO 新提交 79%

Room-Mediated Co-occurrence for Zero-Shot Object-Centric Semantic Navigation via Frontier Scoring

通过前沿评分实现基于零样本目标中心语义导航的房间介导共现

Adam Scicluna, Gavin Paul, Alen Alempijevic

机构 * Robotics Institute, Faculty of Engineering and Information Technology, University of Technology Sydney (UTS)(悉尼科技大学工程与信息技术学院机器人研究所)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 研究零样本目标中心语义导航,提出通过房间词汇表介导对象关系的无需训练的管道,利用CLIP-derived的RPV计算共现,经洪水填充传播投影到值图排序前沿,相比基线提升了SR和SPL,保留可解释性与灵活性。

Comments 8 pages. Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25235 2026-07-29 eess.SY cs.SY 新提交 78%

Progressive Replacement Sequence Planning for Laser-Enhanced BeiDou Navigation Constellations

激光增强北斗导航星座的渐进式替换序列规划

Huan Yan, Juan A. Fraire, Ziqi Yang, Kanglian Zhao, Wenfeng Li, Jinjun Zheng, Ziyu Wang, Changgang Zheng

专题命中 具身导航 :navigation(title,abstract)

AI总结 研究北斗卫星系统早期卫星接近寿命末期,用激光卫星替换微波卫星的序列规划问题,通过建立整数线性规划模型和优先级感知搜索启发式算法,实现更优混合网络演变,为北斗替换规划提供决策支持和工程指导。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25389 2026-07-29 cs.CV cs.RO 新提交 73%

HOME: Robust Hough-space Matching Method for Structured and Textureless Videos

HOME:用于结构化和无纹理视频的鲁棒霍夫空间匹配方法

Masaki Satoh

专题命中 具身导航 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对机器人定位中基于点的特征在结构化或无纹理环境中失效的问题,提出HOME框架,将图像转换到霍夫空间,通过一维点匹配实现高效线匹配,经单应性估计验证,其匹配精度高、速度快,扩展到3D姿态估计前景广阔。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24983 2026-07-29 cs.LG cs.AI math.OC stat.ML 新提交 62%

Generative Distributionally Robust Optimization

生成式分布鲁棒优化

Ziwei Zhang, Jonathan Yu-Meng Li, Zhihao Jin

机构 * Telfer School of Management, University of Ottawa(渥太华大学泰尔弗管理学院) Department of Electrical and Computer Engineering, Western University(西安大略大学电气与计算机工程系)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 研究提出生成式分布鲁棒优化(GDRO)框架,接受可采样条件生成器为名义模型,通过采样器-辛科恩配对限制最坏情况法则,可直接有限样本近似和可微实现,相比名义决策降低了罕见上下文库存遗憾和SocialGAN导航碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25056 2026-07-29 cs.RO 新提交 57%

Hybrid Artificial Potential Fields and Spatio-Temporal Transformers for Real-Time AUV Path Planning

用于实时 AUV 路径规划的混合人工势场与时空变压器

Khadija Rais, Abdelmadjid Benmachiche, Imene Soualmia

机构 * Echahid Cheikh Larbi Tebessi University(艾哈西德·谢赫·拉尔比·泰贝西大学) Chadli Bendjedid University(查德利·本杰迪德大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 研究 AUV 在复杂水下环境的路径规划,比较 13 种算法,提出混合人工势场与时空变压器的方法。该方法性能平衡,平均路径短、碰撞率低、计算高效,优于其他算法,为实时 AUV 导航提供强大解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24795 2026-07-29 cs.AI cs.HC 新提交 57%

When Shortest Isn't Safest: A Design Science Approach to Senior-Friendly Pedestrian Routing

当最短路径并非最安全路径时:一种面向老年人友好型行人路线规划的设计科学方法

Erdi Ünal, Daniel Eisenhardt, Christian Meske, Seyed Nima Afzali, Aysegül Dogangün

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 研究针对行人导航系统忽视老年人出行障碍等问题,通过设计科学方法开发老年人友好型行人路线规划制品,经访谈得出设计要求和原则并实例化,实地研究表明该制品生成的路线更受青睐,综合见解给出完善原则,为从业者提供指导。

Journal ref Design for Better Futures: Beyond the Science of the Artificial. Completed Research, LNCS 16605 (2026) 406-424

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24757 2026-07-29 cs.HC cs.AI cs.CY 新提交 57%

From Idea to Classroom in Days: Using "Vibe Coding" to Create a Programming Process Visualizer from IDE Activity Logs

数天内从想法到课堂:利用“氛围编码”从IDE活动日志创建编程过程可视化工具

Heidi Taveter, Marina Lepp

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 利用人工智能辅助的“氛围编码”,快速开发并在课堂部署Thonny日志可视化工具,可分析Python IDE日志,生成学生编程过程视图,支持教师决策,经评估和试点收集反馈后进行了可用性改进。

Comments 9 pages, 6 figures. Accepted for presentation at the 2026 IEEE Frontiers in Education Conference (FIE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25431 2026-07-29 cs.SE 新提交 50%

CodeNib: A Multi-View Data System for Serving Repository Context to Coding Agents

CodeNib:一种用于向编码代理提供仓库上下文的多视图数据系统

Zhongming Yu, Hengjia Yu, Boqin Yuan, Shuting Zhao, Yizhao Chen, Aryan Dokania, Mihir Jagtap, Jiayu Chang, Yitong Ma, Yash Jayswal, Wentao Ni, Hejia Zhang, Zhaoling Chen, Gangda Deng, Jishen Zhao

专题命中 具身导航 :navigation(abstract)

AI总结 研究编码代理从仓库获取上下文的问题,提出CodeNib构建多视图数据系统,可重用视图并映射到源范围,通过运行时提供多种服务,实验表明其在更新速度、延迟等方面有优势,支持多视图仓库上下文服务。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 4 篇

2607.25236 2026-07-29 cs.CL cs.RO 新提交 83%

VisualPatchWorld: Code World Models as Latent Structured Representations for Planning

视觉补丁世界:作为规划潜在结构化表示的代码世界模型

Jiaxin Bai, Jiaxuan Xiong

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.RO

AI总结 研究旨在构建用于规划的代码世界模型。提出VisualPatchWorld方法,先选定性动力学形式,再拟合参数。实验表明其平均规划成功率69.0%,超基线23.5分,在多方面接近真实引擎成功率,为自动构建有用的代码世界模型提供实用途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26056 2026-07-29 cs.RO 新提交 79%

INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models

INTACT:用于无搜索世界模型的同构意图到动作学习

Junhan Sun, Hao Zhao, Guofeng Zhang

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) InSpatio

专题命中 具身推理 :world model(title,abstract);分类 cs.RO

AI总结 研究针对前向潜在世界模型恢复动作需昂贵搜索的问题,提出INTACT方法,通过特定架构和技术实现意图到动作学习,在多任务上取得高成功率,减少采样并提升性能,还具有快速推理能力。

Comments 28 pages, 11 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26037 2026-07-29 cs.CV cs.GR 新提交 79%

Wonder: Video World Model Done Better

Wonder:改进的视频世界模型

Jiacong Xu, Hanwen Jiang, Zhixin Shu, Kalyan Sunkavalli, Vishal M. Patel, Yiqun Mei

机构 * Adobe Research(Adobe研究院) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 Wonder是用于实时相机可控世界探索的通用视频世界模型,通过系统级协同设计,包括新型相机条件设定、高效内存机制等,能合成多样视频,支持视频条件生成,保持长时间的连贯视觉效果。

Comments Project Page: https://wonder-world-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26040 2026-07-29 cs.LG stat.ML 新提交 74%

Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent Guidance

强化信息梦行者:通过潜在引导有效训练的非对称世界模型

Gaspard Lambrechts, Adrien Bolland, Daniel Ebi, Damien Ernst

专题命中 具身推理 :world model(title);分类 cs.LG

AI总结 研究基于模型的强化学习中,非对称学习对观测及特权信息表示的影响。针对‘信息梦行者’局限性,提出用潜在引导的新目标,形成‘强化信息梦行者’算法,实验显示其比之前非对称方法有更持续改进。

Comments 8 pages, 18 pages total, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 3 篇

2607.25912 2026-07-29 cs.RO cs.AI 新提交 62%

SAM3D-Guided Object-Centric Representation Alignment for Vision-Language-Action Models

用于视觉-语言-动作模型的SAM3D引导的以对象为中心的表示对齐

Zonghe Liu, Shanyuan Jie, Xiaoquan Sun, Chen Cao, Zetian Xu, Zongsheng Liu, Jiayu Chen

机构 * University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Huazhong University of Science and Technology(华中科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Infiforce(英飞拓)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对视觉-语言-动作模型缺乏目标对象细粒度3D理解的问题,提出以对象为中心的3D表示对齐框架,利用SAM3D提供3D先验,经定位、生成掩码、提取表示等步骤与视觉特征对齐,实验证明其可提升模型性能,尤其在长时操纵场景有效。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25487 2026-07-29 cs.AI cs.CV 新提交 62%

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

CoTinyVLA:用于十亿参数以下视觉-语言-动作模型的思维链蒸馏

Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

机构 * Chung-Ang University(韩国中央大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 研究针对VLA模型内存需求大问题,提出CoTinyVLA模型。通过双视图时间输入、分层思维链蒸馏、释义增强三个组件,在LIBERO-Plus基准测试中取得优异成绩,证明结构化监督可让小参数主干超越其他模型。

Comments 22 pages, 2 figures, 20 tables. Code at https://github.com/BrainJellyPie/CoTinyVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25516 2026-07-29 cs.RO 新提交 57%

A Causality-aware Infer-diagnose-refine Framework for Test-time Modality Adaptation in VLA Models

用于视觉语言动作模型测试时模态适应的因果感知推理-诊断-细化框架

Haoyu Zhang, Yuwei Wu, Jin Chen, Gao Zhi, Zhenxin Diao, Mingyang Gao, Kun Wu, Yongchun Liu, Fan Li

机构 * Beijing Institute of Technology(北京理工大学) AInnovation Co. Ltd.(A创新有限公司) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 针对VLA模型模态融合问题,提出因果感知推理-诊断-细化框架,通过视觉观察推理、因果效应诊断及动作预测细化实现模态适应,设计因果感知动作细化器,实验验证了该框架在多VLA主干上提升整体性能的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 模仿学习与强化学习 1 篇

2607.24860 2026-07-29 cs.RO 新提交 79%

Egocentric Station Holding of Robotic Fish in Unknown Turbulent Background Flow

未知湍流背景流中机器鱼的自我中心驻位

Xiaozhu Lin, Xu Huang, Hongru Dai, Xiaopei Liu, Junzhi Yu, Yang Wang

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) State Key Laboratory for Turbulence and Complex Systems, Department of Advanced Manufacturing and Robotics, College of Engineering, Peking University(北京大学工程科学学院先进制造与机器人系湍流与复杂系统国家重点实验室) Laboratory of Cognitive and Decision Intelligence for Complex System, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能实验室)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 研究机器鱼在未知湍流背景流中的自我中心驻位问题,提出SWiFT框架,集成实验装置、CFD模拟器及转移管道,通过强化学习探索驻位策略,相比现有方法有显著改进,验证了仅靠自我中心反馈可驻位,推动机器鱼控制发展。

Comments 20 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏