arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 238 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 238 篇

2506.13751 2025-09-26 cs.RO cs.AI 73%

LeVERB: Humanoid Whole-Body Control with Latent Vision-Language Instruction

Haoru Xue, Xiaoyu Huang, Dantong Niu, Qiayuan Liao, Thomas Kragerud, Jan Tommy Gravdahl, Xue Bin Peng, Guanya Shi, Trevor Darrell, Koushil Sreenath, Shankar Sastry

机构 * University of California Berkeley(加州大学伯克利分校) Norwegian University of Science and Technology(挪威科学与技术大学) Simon Fraser University(西蒙弗雷泽大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments https://ember-lab-berkeley.github.io/LeVERB-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18897 2025-08-21 cs.RO cs.AI 73%

MinD: Learning A Dual-System World Model for Real-Time Planning and Implicit Risk Analysis

Xiaowei Chi, Kuangzhi Ge, Jiaming Liu, Siyuan Zhou, Peidong Jia, Zichen He, Yuzhen Liu, Tingguang Li, Lei Han, Sirui Han, Shanghang Zhang, Yike Guo

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24156 2025-06-02 cs.CV cs.RO 73%

Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction

Chenyou Fan, Fangzheng Yan, Chenjia Bai, Jiepeng Wang, Chi Zhang, Zhen Wang, Xuelong Li

机构 * Institute of Artificial intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11123 2025-05-19 cs.RO cs.AI 73%

Conditioning Matters: Training Diffusion Policies is Faster Than You Think

Zibin Dong, Yicheng Liu, Yinchuan Li, Hang Zhao, Jianye Hao

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2505.10105

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00171 2025-03-26 cs.RO cs.CV 73%

RoboMatrix: A Skill-centric Hierarchical Framework for Scalable Robot Task Planning and Execution in Open-World

Weixin Mao, Weiheng Zhong, Zhou Jiang, Dong Fang, Zhongyue Zhang, Zihan Lan, Haosheng Li, Fan Jia, Tiancai Wang, Haoqiang Fan, Osamu Yoshie

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15959 2025-03-25 cs.RO cs.CV 73%

Diffusion Transformer Policy

Zhi Hou, Tianyi Zhang, Yuwen Xiong, Hengjun Pu, Chengyang Zhao, Ronglei Tong, Yu Qiao, Jifeng Dai, Yuntao Chen

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

Comments preprint; New Project Page: https://robodita.github.io; revert unsuitable replacement

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.05341 2023-04-11 math.OC math.AP 71%

Mean-field optimal control in a multi-agent interaction model for prevention of maritime crime

Gianluca Orlando

专题命中 动作表示与策略 :action model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05117 2026-07-31 cs.RO 版本更新 70%

SeedPolicy: Horizon Scaling via Self-Evolving Diffusion Policy for Robot Manipulation

SeedPolicy: 通过自进化扩散策略实现机器人操控的水平扩展

Youqiang Gui, Yuxuan Zhou, Shen Cheng, Xinyang Yuan, Haoqiang Fan, Peng Cheng, Shuaicheng Liu

机构 * Sichuan University(四川大学) Dexmal Inc.(Dexmal公司) Independent Researcher(独立研究员) UESTC

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 本文提出SEGA模块,通过门控注意力机制提升扩散策略在长时域操控中的表现,实验表明其在RoboTwin 2.0基准上优于现有方法,具有更高的效率和性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19633 2026-07-23 cs.RO 新提交 70%

LENS: LLM-guided Environment Simplification for Planning and Control in Clutter

LENS:用于杂乱环境中规划与控制的大语言模型引导的环境简化

Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对现实世界多物体杂乱环境处理难题,提出LENS方法,通过大语言模型引导自动生成特定场景和任务的自适应更新抽象,经实验验证其能改进多种模型在高度杂乱操纵场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12992 2026-07-15 cs.RO 新提交 70%

ChunkFlow: Towards Continuity-Consistent Chunked Policy Learning

ChunkFlow:迈向连续性一致的分块策略学习

Zhao Yang, Yinan Shi, Mingyuan Yao, Wenyao Xue, Yawei Jueluo, Longjun Liu

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) Jiangsu Cytoderm Intelligent Technology Co., Ltd.(江苏希迪姆智能科技有限公司)

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究视觉语言动作模型分块策略的边界抖动问题,提出ChunkFlow框架划分块区域,执行时用确定性重叠混合,训练时用多种损失,通过实验验证该框架在低延迟推理下能改善成功稳定性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23568 2026-07-14 cs.RO cs.SY eess.SY 版本更新 70%

TactileReflex: Noise-Statistics-Driven Vision-Tactile Reflex Control for Force-Sensitive Manipulation

TactileReflex:基于噪声统计的视觉-触觉反射控制用于力敏感操作

Ziyan Feng, Yulong Fu, Zheng Li, Yuxin He, Jieji Ren, Yudong Zhong, Lujia Wang, Jinni Zhou, Qiang Nie

机构 * Thrust of Robotics and Autonomous Systems, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统研究所,香港科学与技术大学(广州)) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 针对易变形容器操作中的力控制难题,提出基于噪声统计的标定驱动反射控制范式,利用视觉触觉传感器提取图像级代理并实现约12Hz的优先反射通道,无需外部标定或手动调参。

Comments 8 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03283 2026-07-07 cs.AI 新提交 70%

Embodied Operators and Benchmarking: Toward Reusable and Deployable Embodied Intelligence Systems

具身算子与基准测试:迈向可复用和可部署的具身智能系统

Junwu Xiong, Jiaxuan Gao, Wei Chai, Renxing Chen, Yuzhen Li, Yu Guo, Yucheng Guo, Mingxi Luo, Wenyang Ma, Yiyun Mou, Yifei Zhang, Chen Zhou, Yongjian Guo

机构 * JDT Tsinghua University(清华大学) Tianjin University(天津大学) Beihang University(北京航空航天大学)

专题命中 动作表示与策略 :VLA(abstract);embodied foundation model(abstract);分类 cs.AI

AI总结 研究具身智能系统中可复用功能模块即具身算子,明确其定义边界、构建分类法,提出多维度基准框架,探讨加速及挑战,为具身智能系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02642 2026-07-07 cs.RO 新提交 70%

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

GigaWorld-1:构建用于机器人策略评估的世界模型路线图

GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(巨元人工智能) Tsinghua University(清华大学)

专题命中 动作表示与策略 :robot foundation model(abstract);embodied foundation model(abstract);分类 cs.RO

AI总结 研究机器人策略评估中世界模型,介绍WMBench基准,通过分析多种模型、方案及大量模拟策略展开,得出评估器质量受长期动作忠实性影响等核心见解,推导出设计路线图并实现GigaWorld-1。

Comments Project page: https://open-gigaai.github.io/giga-world-1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31132 2026-07-01 cs.RO 新提交 70%

ELASTIC: Efficiently Learning to Adaptively Scale Test-Time Compute for Generative Control Policies

ELASTIC: 高效学习自适应缩放测试时计算以生成控制策略

Andrew Zou Li, Gokul Swamy, Yonatan Bisk, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出ELASTIC算法,通过元强化学习为生成控制策略学习状态依赖的测试时计算调度,在扩散策略和视觉-语言-动作模型上实现帕累托最优,减少34%延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20871 2026-06-23 cs.RO 新提交 70%

Geometric Entropy: When Trajectory Diversity Helps and Hurts in Imitation Learning

几何熵:轨迹多样性在模仿学习中的利弊

Qian Luo, Ruizhe Liu, Pei Zhou, Xunzhe Zhou, Yanchao Yang

机构 * InfoBodied AI Lab, The University of Hong Kong(香港大学信息体人工智能实验室) Transcengram

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出几何熵(H_G)量化演示轨迹的几何多样性,发现成功率与H_G呈倒U型关系,且最优熵随任务掌握度增加而降低,可用于数据集审计与校准。

Comments Accepted to IROS 2026. Project page: https://geometric-entropy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19340 2026-06-23 cs.RO 新提交 70%

ZeroDex: Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning

零样本长时程灵巧操作:基于多视图3D接地VLM推理

Jisoo Kim, Sangwon Baik, Taeksoo Kim, Sungjoo Kim, Junyoung Lee, Mingi Choi, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出零样本框架,利用多视图RGB图像通过VLM生成3D任务规划,结合三角测量和射线投票实现精确3D接地,支持抓取和工具使用,在真实实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07079 2026-05-11 cs.CV cs.AI cs.LG cs.RO 70%

Learning Visual Feature-Based World Models via Residual Latent Action

通过残差潜在动作学习基于视觉特征的世界模型

Xinyu Zhang, Zhengtong Xu, Yutian Tao, Yeping Wang, Yu She, Abdeslam Boularias

机构 * Rutgers University(罗格斯大学) Purdue University(普渡大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出RLA-WM世界模型,通过流匹配预测残差潜在动作,优于现有特征和视频扩散模型,且在速度和效率上更优,同时开发了两项机器人学习技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07060 2026-04-07 cs.RO 70%

PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation

PALM:通过具身理由推理进行长时间 horizon 肢体操作的进展感知策略学习

Yuanzhe Liu, Jingyuan Zhu, Yuchen Mo, Gen Li, Xu Cao, Jin Jin, Yifan Shen, Zhengyuan Li, Tianjiao Yu, Wenzhen Yuan, Fangqiang Ding, Ismini Lourentzou

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 PALM通过具身理由推理和子任务进展线索,改进长horizon机器人操作的策略学习,实现91.8%的成功率和更长的任务长度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08602 2026-03-31 cs.RO 70%

Mimic Intent, Not Just Trajectories

模仿意图,而非仅仅轨迹

Renming Huang, Chendong Zeng, Wenjing Tang, Jintian Cai, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出MINT方法,通过多尺度频域标记解耦行为意图与执行细节,提升模仿学习的适应性和迁移能力,实验显示其在任务基准和真实机器人上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26322 2026-03-30 cs.RO 70%

DiffusionAnything: End-to-End In-context Diffusion Learning for Unified Navigation and Pre-Grasp Motion

DiffusionAnything: 端到端的上下文扩散学习用于统一导航和预抓取运动

Iana Zhura, Yara Mahmoud, Jeffrin Sam, Hung Khang Nguyen, Didar Seyidov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(斯科尔科沃科学技术学院数字工程中心智能空间机器人实验室)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出一种端到端的上下文扩散学习方法,通过多尺度特征调制实现统一的导航与精细操控,仅需5分钟自监督数据即可实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22264 2026-03-24 cs.RO 70%

UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos

UniDex:一种机器人基础套件,用于从第一人称人类视频中实现通用灵巧手控制

Gu Zhang, Qicheng Xu, Haozhe Zhang, Jianhan Ma, Long He, Yiming Bao, Zeyu Ping, Zhecheng Yuan, Chenhao Lu, Chengbo Yuan, Tianhai Liang, Xiaoyu Tian, Maanping Shao, Feihong Zhang, Mingyu Ding, Yang Gao, Hao Zhao, Hang Zhao, Huazhe Xu

机构 * Tsinghua University(清华大学) Shanghai Qizhi Institute(上海启智研究院) Sun Yat-sen University(中山大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出UniDex,通过机器人中心数据集、统一视觉-语言-动作策略和实用人类数据采集设置,实现通用灵巧手控制。UniDex-VLA在两项不同手的挑战性工具使用任务中达到81%的平均任务进度,优于现有VLA基线。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14327 2026-03-17 cs.RO 70%

OmniClone: Engineering a Robust, All-Rounder Whole-Body Humanoid Teleoperation System

OmniClone:构建一个稳健、全面的全身人形遥控系统

Yixuan Li, Le Ma, Yutang Lin, Yushi Du, Mengya Liu, Kaizhe Hu, Jieming Cui, Yixin Zhu, Wei Liang, Baoxiong Jia, Siyuan Huang

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 OmniClone通过高效的多技能控制和诊断评估,实现低成本、高精度的人形遥控系统,显著降低误差并提升实用性。

Comments Website: https://omniclone.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03836 2026-03-05 cs.RO 70%

SkillVLA: Tackling Combinatorial Diversity in Dual-Arm Manipulation via Skill Reuse

SkillVLA: 通过技能复用解决双臂操作中的组合多样性问题

Xuanran Zhai, Zekai Huang, Longyan Wu, Qianyou Zhao, Qiaojun Yu, Jieji Ren, Ce Hao, Harold Soh

机构 * National University of Singapore(国立新加坡大学) Beijing Zhongguancun Academy(北京中关村学院) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Smart Systems Institute, NUS(NUS智能系统研究所)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 SkillVLA通过技能复用解决双臂操作中的组合多样性问题,提升技能组合成功率至51%并在复杂任务中表现优异。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13833 2026-02-17 cs.RO 70%

Semantic-Contact Fields for Category-Level Generalizable Tactile Tool Manipulation

语义接触场用于类别级可泛化的触觉工具操作

Kevin Yuchen Ma, Heng Zhang, Weisi Lin, Mike Zheng Shou, Yan Wu

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 SCFields通过融合视觉语义与密集接触估计,实现类别级可泛化的触觉工具操作,显著优于视觉和原始触觉基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12032 2026-02-13 cs.RO 70%

When would Vision-Proprioception Policies Fail in Robotic Manipulation?

视觉-本体感觉策略在机器人操作中何时会失败?

Jingxian Lu, Wenke Xia, Yuxuan Wu, Zhiwu Lu, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光明学院人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大模型与智能治理研究重点实验室) School of Artificial Intelligence, Beihang University(北航人工智能学院)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 研究提出GAP算法,通过动态调节本体感觉优化,解决视觉-本体感觉策略在运动转换阶段的泛化问题。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06620 2026-02-12 cs.RO cs.SY eess.SY 70%

Force Generative Imitation Learning: Bridging Position Trajectory and Force Commands through Control Technique

力生成模仿学习:通过控制技术弥合位置轨迹与力命令之间的鸿沟

Hiroshi Sato, Sho Sakaino, Toshiaki Tsuji

机构 * Graduate School of Systems and Information Engineering, University of Tsukuba(东京大学系统与信息工程研究生院) Graduate School of Science and Engineering, Saitama University(埼玉大学科学与工程研究生院) Department of Intelligent Interaction Technologies, Institute of Systems and Information Engineering, University of Tsukuba(东京大学系统与信息工程研究所智能交互技术系)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文提出一种力生成模型,通过无记忆反馈控制机制提升机器人在未见过位置轨迹下的力命令生成能力,以改善现实任务中的泛化性能。

Comments Accepted for IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23823 2025-12-10 cs.RO 70%

Control Your Robot: A Unified System for Robot Control and Policy Deployment

掌控你的机器人:一种统一的机器人控制与策略部署系统

Tian Nian, Weijie Ke, Shaolong Zhu, Bingshan Hu

机构 * ScaleLab, Shanghai Jiao Tong University(上海交通大学ScaleLab) University of Shanghai for Science and Technology(上海科学技术大学)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 Control Your Robot提出了一种统一的机器人控制与策略部署框架,通过模块化设计和标准化流程,实现跨平台的数据收集与策略学习,提升机器人学习的可扩展性和可重复性。

Comments Code: https://github.com/Tian-Nian/control_your_robot

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16651 2025-11-21 cs.RO 70%

InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre-training Generalist Policy

InternData-A1:开创高保真合成数据用于预训练通用策略

Yang Tian, Yuyin Yang, Yiman Xie, Zetao Cai, Xu Shi, Ning Gao, Hangxu Liu, Xuekun Jiang, Zherui Qiu, Feng Yuan, Yaping Li, Ping Wang, Junhao Cai, Jia Zeng, Hao Dong, Jiangmiao Pang

机构 * Shanghai AI Laboratory Peking University(北京大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 InternData-A1通过高保真合成数据实现与最强$π$-数据集相当的VLA模型预训练性能,展示了大规模模拟在机器人任务中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16240 2025-11-04 cs.RO 70%

Cosmos-Surg-dVRK: World Foundation Model-based Automated Online Evaluation of Surgical Robot Policy Learning

Lukas Zbinden, Nigel Nelson, Juo-Tung Chen, Xinhao Chen, Ji Woong Kim, Mahdi Azizian, Axel Krieger, Sean Huver

机构 * NVIDIA Johns Hopkins University(约翰霍普金斯大学) Stanford University(斯坦福大学)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

Comments minor metadata and notation fixes; +3 citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23931 2025-10-07 cs.CV 70%

AutoPrune: Each Complexity Deserves a Pruning Policy

Hanshi Wang, Yuhao Xu, Zekun Xu, Jin Gao, Yufan Liu, Weiming Hu, Ke Wang, Zhipeng Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), CASIA(多模态人工智能系统国家重点实验室(MAIS),中国科学院自动化所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab) Anyverse Intelligence Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京多模态信息超智能安全重点实验室) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.CV

Comments 13 pages, 2 figures

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏