arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 161 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 161 篇

2506.12779 2025-09-03 cs.RO cs.LG 62%

From Experts to a Generalist: Toward General Whole-Body Control for Humanoid Robots

Yuxuan Wang, Ming Yang, Ziluo Ding, Yu Zhang, Weishuai Zeng, Xinrun Xu, Haobin Jiang, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05625 2025-09-01 cs.LG cs.AI 62%

SPIN-ODE: Stiff Physics-Informed Neural ODE for Chemical Reaction Rate Estimation

Wenqing Peng, Zhi-Song Liu, Michael Boy

机构 * Institute for Atmospheric and Earth Systems Research, University of Helsinki(大气与地球系统研究所,赫尔辛基大学) Department of Computational Engineering, Lappeenranta-Lahti University of Technology LUT(计算工程系,拉佩兰塔-拉赫蒂技术大学LUT) Atmospheric Modelling Centre-Lahti(拉赫蒂大气建模中心)

专题命中 部署与泛化 :action model(abstract);分类 cs.AI、cs.LG

Comments Accepted at the European Conference on Artificial Intelligence (ECAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12236 2025-05-20 cs.CL cs.AI cs.LG 62%

Bridging Generative and Discriminative Learning: Few-Shot Relation Extraction via Two-Stage Knowledge-Guided Pre-training

Quanjiang Guo, Jinchuan Zhang, Sijie Wang, Ling Tian, Zhao Kang, Bin Yan, Weidong Xiao

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Information Engineering University(信息工程大学) National University of Defense Technology(国防科技大学)

专题命中 部署与泛化 :action model(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 6 figures, Appear on IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16228 2025-01-09 cs.RO cs.LG 62%

Policy Adaptation via Language Optimization: Decomposing Tasks for Few-Shot Imitation

Vivek Myers, Bill Chunyuan Zheng, Oier Mees, Sergey Levine, Kuan Fang

专题命中 部署与泛化 :language-conditioned robot(abstract);分类 cs.RO、cs.LG

Comments 27 pages, 14 figures

Journal ref Conference on Robot Learning, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15996 2024-12-06 cs.CV cs.AI 62%

Spatio-Temporal Context Prompting for Zero-Shot Action Detection

Wei-Jhe Huang, Min-Hung Chen, Shang-Hong Lai

专题命中 部署与泛化 :action model(abstract);分类 cs.CV、cs.AI

Comments Accepted by WACV2025. Project page: https://webber2933.github.io/ST-CLIP-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04491 2024-08-09 cs.CV cs.AI 62%

Towards Synergistic Deep Learning Models for Volumetric Cirrhotic Liver Segmentation in MRIs

Vandan Gorade, Onkar Susladkar, Gorkem Durak, Elif Keles, Ertugrul Aktas, Timurhan Cebeci, Alpay Medetalibeyoglu, Daniela Ladner, Debesh Jha, Ulas Bagci

专题命中 部署与泛化 :action model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10189 2024-05-31 cs.CL cs.AI cs.LG 62%

Chem-FINESE: Validating Fine-Grained Few-shot Entity Extraction through Text Reconstruction

Qingyun Wang, Zixuan Zhang, Hongxiang Li, Xuan Liu, Jiawei Han, Huimin Zhao, Heng Ji

专题命中 部署与泛化 :action model(abstract);分类 cs.AI、cs.LG

Comments 16 pages. Accepted by Findings of the Association for Computational Linguistics: EACL 2024. Code and resources are available at https://github.com/EagleW/Chem-FINESE

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03599 2024-01-09 cs.RO cs.AI 62%

Disentangled Neural Relational Inference for Interpretable Motion Prediction

Victoria M. Dax, Jiachen Li, Enna Sachdeva, Nakul Agarwal, Mykel J. Kochenderfer

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.AI

Journal ref IEEE Robotics and Automation Letters, Date: FEBRUARY 2024 , Volume: 9, Issue: 2, ISSN: 2377-3766, pp1452-1459

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.00690 2021-12-06 cs.CV cs.LG 62%

MDFM: Multi-Decision Fusing Model for Few-Shot Learning

Shuai Shao, Lei Xing, Rui Xu, Weifeng Liu, Yan-Jiang Wang, Bao-Di Liu

专题命中 部署与泛化 :action model(abstract);分类 cs.CV、cs.LG

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). arXiv admin note: text overlap with arXiv:2109.07785

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.03022 2021-02-08 cs.RO cs.AI 62%

Active inference body perception and action for humanoid robots

Guillermo Oliver, Pablo Lanillos, Gordon Cheng

专题命中 部署与泛化 :action model(abstract);分类 cs.RO、cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09661 2026-07-13 cs.CV 新提交 57%

PanoWorld: Real-World Panoramic Generation

全景世界:真实世界全景生成

Haoyuan Li, Dizhe Zhang, Yuemei Zhou, Xiangkai Zhang, Haoran Feng, Xiaofan Lin, Wenjie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi

机构 * Insta360 Research(影石创新科技研究院) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Wuhan University(武汉大学) UC Merced(加州大学默塞德分校)

专题命中 部署与泛化 :action model(abstract);分类 cs.CV

AI总结 该研究旨在解决全景世界模型的远程记忆挑战,提出PanoWorld,利用旋转等变特性简化相机轨迹,通过DPRC和GMA进行建模与记忆增强,经三阶段训练优化,构建World360数据集验证其有效性,优于其他方法且将公开模型、代码和数据集。

Comments Project page: https://lihaoy-ux.github.io/panoworld-page/ Code:https://github.com/Insta360-Research-Team/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09378 2026-07-13 quant-ph cs.AI cs.CR 新提交 57%

When Routes Run Out: Adversarial Co-Learning and Explainable Robustness in Quantum Repeater Networks

当路线耗尽时:量子中继器网络中的对抗协同学习与可解释鲁棒性

Brennan Bell, Inti Gabriel Mendoza Estrada, Andreas Trügler, Paul Erker

机构 * RFI-IRFOS and TU Graz(RFI-IRFOS和格拉茨技术大学) openmaind FlexCo and TU Graz(openmaind FlexCo和格拉茨技术大学) Know Center Research GmbH and University of Graz(Know Center Research GmbH和格拉茨大学) Atominstitut, TU Wien and IQOQI, ÖAW(原子院、维也纳技术大学和ÖAW IQOQI)

专题命中 部署与泛化 :action model(abstract);分类 cs.AI

AI总结 研究量子中继器网络路由对抗博弈问题,通过对抗协同学习,发现保留率与参考值紧密跟踪,拟合决策树解释模型并报告忠实度,构建提示记录形成开源解释工作流程。

Comments 4 pages, 5 figures, submitted to IEEE QCE26, Workshop on Q-GenAI: Synergies between QC & GenAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14891 2026-07-07 cs.CV 版本更新 57%

GaussianArt: Unified Modeling of Geometry and Motion for Articulated Objects

高斯艺术:关节物体几何与运动的统一建模

Licheng Shen, Saining Zhang, Honghan Li, Peilin Yang, Zihao Huang, Zongzheng Zhang, Hao Zhao

机构 * BAAI(百度人工智能研究院) AIR, THU(清华大学人工智能研究院) NTU(国立台湾大学) BIT(北京理工大学) HUST(华中科技大学)

专题命中 部署与泛化 :action model(abstract);分类 cs.CV

AI总结 研究关节物体重建,此前方法解耦几何与运动,本文用关节3D高斯联合建模,提升运动分解鲁棒性,支持多达20个部件的物体,还提出新基准测试,实验表明该方法在多任务中精度更优。

Comments 3DV 2026 Project Page: https://sainingzhang.github.io/project/gaussianart/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14862 2026-06-16 cs.RO 新提交 57%

TacStyle: Personalizing Tactile Robot Policies using Structured Behavior Representations

TacStyle: 使用结构化行为表示个性化触觉机器人策略

Kevin Robledo, Matías I. Torres Galaz, Kumar Dixhant Rai, Shelly Sara Ulman, Tasmia Tasrin, Heramb Nemlekar

机构 * Department of Computer Science, California State University, Northridge(加州州立大学北岭分校计算机科学系) Department of Mechanical Engineering, California State University, Northridge(加州州立大学北岭分校机械工程系)

专题命中 部署与泛化 :language-conditioned robot(abstract);分类 cs.RO

AI总结 提出通过结构化潜在表示组织用户偏好,结合基础模型解释语言指令,实现机器人行为精细调整,减少偏好标签需求。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09640 2026-06-09 cs.RO 新提交 57%

Physics-Aware Sparse Learning and Selective Online Adaptation for Euler-Lagrange Robot Dynamics

面向欧拉-拉格朗日机器人动力学的物理感知稀疏学习与选择性在线自适应

Rishabh Dev Yadav, Samaksh Ujjawal, Sihao Sun, Spandan Roy, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) International Institute of Information Technology Hyderabad(海得拉巴国际信息技术学院) Delft University of Technology(代尔夫特理工大学) Newcastle University(纽卡斯尔大学)

专题命中 部署与泛化 :action model(abstract);分类 cs.RO

AI总结 提出一种保结构残差学习框架,将模型误差分解为惯性修正、科里奥利项和广义力残差,通过物理约束学习机械部分,并用稀疏历史依赖潜变量模型和贝叶斯线性回归在线自适应扰动敏感部分,提升多机器人平台动力学预测与轨迹跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00471 2026-05-04 cs.RO 57%

Stereo Multistage Spatial Attention for Real-Time Mobile Manipulation Under Visual Scale Variation and Disturbances

立体多阶段空间注意力用于在视觉尺度变化和干扰下的实时移动操作

Xianbo Cai, Hideyuki Ichiwara, Hyogo Hiruma, Masaki Yoshikawa, Hiroshi Ito, Tetsuya Ogata

机构 * Department of Intermedia Art and Science, Waseda University(媒体艺术与科学系,早稻田大学) SB Intuitions Corp.(SB Intuitions公司) Research and Development Group, Hitachi, Ltd.(日立株式会社研发部) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO

AI总结 本文提出一种基于立体多阶段空间注意力的深度预测学习方法,用于实时移动操作,通过层次递归架构整合空间注意力点与机器人状态,提升在视觉尺度变化和干扰下的鲁棒性和任务成功率。

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22615 2026-05-01 cs.RO 57%

GazeVLA: Learning Human Intention for Robotic Manipulation

GazeVLA:学习人类意图以促进机器人操作

Chengyang Li, Kaiyi Xiong, Yuan Xu, Lei Qian, Yizhou Wang, Wentao Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) Peking University(北京大学) ShanghaiTech University(上海科技大学)

专题命中 部署与泛化 :embodied foundation model(abstract);分类 cs.RO

AI总结 本文提出GazeVLA框架,通过学习人类意图弥合人机之间的固有差距,提升机器人操作性能。

Comments Project page: https://gazevla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17876 2026-04-21 cs.RO 57%

OFlow: Injecting Object-Aware Temporal Flow Matching for Robust Robotic Manipulation

OFlow:注入对象感知的时间流匹配以实现稳健的机器人操作

Kuanning Wang, Ke Fan, Chenhao Qiu, Zeyu Shangguan, Yuqian Fu, Yanwei Fu, Daniel Seita, Xiangyang Xue

机构 * Fudan University(复旦大学) University of Southern California(南加州大学)

专题命中 部署与泛化 :VLA(abstract);分类 cs.RO

AI总结 OFlow通过统一时间预测和对象感知推理,提升机器人操作的鲁棒性,实验表明对象感知预测增强了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12656 2026-03-24 cs.CV 57%

SPKLIP: Aligning Spike Video Streams with Natural Language

SPKLIP:通过自然语言对齐尖峰视频流

Yongchang Gao, Meiling Jin, Zhaofei Yu, Tiejun Huang, Guozhang Chen

专题命中 部署与泛化 :VLA(abstract);分类 cs.CV

AI总结 SPKLIP提出了一种专门用于尖峰视频-语言对齐的架构,通过分层尖峰特征提取器和尖峰-文本对比学习实现多尺度时间动态建模,并在稀疏异步输出上实现高效的少样本学习。

Comments A dataset partitioning error occurred and is being corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12987 2026-03-20 hep-ph cs.LG hep-ex nucl-ex physics.comp-ph 57%

Transfer Learning for Neutrino Scattering: Domain Adaptation with GANs

迁移学习用于中微子散射:基于GANs的领域适应

Jose L. Bonilla, Krzysztof M. Graczyk, Artur M. Ankowski, Rwik Dharmapal Banerjee, Beata E. Kowal, Hemant Prasad, Jan T. Sobczyk

机构 * Institute of Theoretical Physics, University of Wroc aw(沃拉夫大学理论物理研究所)

专题命中 部署与泛化 :action model(abstract);分类 cs.LG

AI总结 本文研究了通过GANs进行迁移学习在中微子散射过程中的应用,探讨了不同目标和过程间基本动力学的共享程度,并验证了在不同模型下迁移学习的有效性。

Comments 23 pages, 22 figures, together with supplement, as published in Phys. Rev. D

Journal ref Phys.Rev.D 113 (2026) 5, 053001

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02772 2026-03-04 cs.RO 57%

Agentic Self-Evolutionary Replanning for Embodied Navigation

代理自进化重规划用于具身导航

Guoliang Li, Ruihua Han, Chengyang Li, He Li, Shuai Wang, Wenchao Ding, Hong Zhang, Chengzhong Xu

机构 * Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) SIAT, Chinese Academy of Sciences(中国科学院上海技术物理研究所) Department of Computer Science, University of Hong Kong(香港大学计算机科学系) Academy for Engineering & Technology, Fudan University(复旦大学工程与技术学院) Department of EEE, Southern University of Science and Technology(南方科技大学电子工程系)

专题命中 部署与泛化 :action model(abstract);分类 cs.RO

AI总结 SERP通过自进化动作模型和图链式思考重规划,提升具身导航在复杂环境中的鲁棒性和效率。

Comments 8 pages, 10 figures, 4 tables, submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24143 2026-03-02 cs.RO 57%

Robust Skills, Brittle Grounding: Diagnosing Restricted Generalization in Vision-Language Action Policies via Multi-Object Picking

稳健的技能,脆弱的接地:通过多对象拾取诊断视觉语言动作策略中的受限泛化

David Emukpere, Romain Deffayet, Jean-Michel Renders

机构 * Naver Labs Europe(纳维尔实验室欧洲)

专题命中 部署与泛化 :VLA(abstract);分类 cs.RO

AI总结 通过多对象拾取实验发现,视觉语言动作策略在复杂环境下执行基本操作比遵循指令更可靠,表明技能获取与指令遵循脱节,需改进基准测试以更准确诊断泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16072 2026-02-20 cs.RO 57%

I-FailSense: Towards General Robotic Failure Detection with Vision-Language Models

I-FailSense:面向通用机器人故障检测的视觉-语言模型

Clemence Grislain, Hamed Rahimi, Olivier Sigaud, Mohamed Chetouani

机构 * ISIR, Sorbonne Université, CNRS(ISIR,索邦大学,国家科学研究中心)

专题命中 部署与泛化 :language-conditioned robot(abstract);分类 cs.RO

AI总结 I-FailSense通过构建专门用于检测语义错位故障的数据集,提出了一种开源视觉-语言模型框架,有效提升机器人故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17259 2026-02-20 cs.RO 57%

FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment

FRAPPE:通过多未来表示对齐将世界建模注入通用策略

Han Zhao, Jingbo Wang, Wenxuan Song, Shuai Chen, Yang Liu, Yan Wang, Haoang Li, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) South China University of Technology(华南理工大学) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学)

专题命中 部署与泛化 :VLA(abstract);分类 cs.RO

AI总结 FRAPPE通过多未来表示对齐提升通用机器人策略的世界建模能力,提高微调效率并减少数据依赖,实验证明其在长时序和未见场景中的泛化性能优于现有方法。

Comments Project Website: https://h-zhao1997.github.io/frappe

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03998 2026-02-20 eess.IV cs.CV q-bio.QM 57%

AtlasPatch: Efficient Tissue Detection and High-throughput Patch Extraction for Computational Pathology at Scale

AtlasPatch: 高效组织检测与高通量切片提取用于大规模计算病理学

Ahmed Alagha, Christopher Leclerc, Yousef Kotp, Omar Metwally, Calvin Moras, Peter Rentopoulos, Ghodsiyeh Rostami, Bich Ngoc Nguyen, Jumanah Baig, Abdelhakim Khellaf, Vincent Quoc-Huy Trinh, Rabeb Mizouni, Hadi Otrok, Jamal Bentahar, Mahdi S. Hosseini

机构 * Department of Computer Science and Software Engineering (CSSE)(计算机科学与软件工程系) Concordia University(Concordia大学) Concordia Institute for Information Systems Engineering (CIISE)(Concordia信息系统工程研究所) Department of Building, Civil, and Environmental Engineering(建筑、土木和环境工程系) University of Montreal Hospital Center (CHUM)(蒙特利尔大学医院中心) Mila–Quebec AI Institute(Mila-魁北克人工智能研究所) Khalifa University(Khalifa大学) McGill University(麦吉尔大学) Institute for Research in Immunology and Cancer(免疫学与癌症研究所在)

专题命中 部署与泛化 :action model(abstract);分类 cs.CV

AI总结 AtlasPatch通过高效组织检测和高通量切片提取,显著提升大规模计算病理学的处理效率与性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06512 2026-02-09 cs.RO 57%

Beyond the Majority: Long-tail Imitation Learning for Robotic Manipulation

超越多数:用于机器人操作的长尾模仿学习

Junhong Zhu, Ji Zhang, Jingkuan Song, Lianli Gao, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) Southwest Jiaotong University(西南交通大学) Tongji University(同济大学)

专题命中 部署与泛化 :VLA(abstract);分类 cs.RO

AI总结 本文提出APA方法,通过从数据丰富的头部任务迁移知识以提升机器人操作中数据稀缺的尾部任务性能。

Comments accept by IEEE International Conference on Robotics and Automation (ICRA 2026), 8 pages, 6 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01067 2026-02-03 cs.RO 57%

A Systematic Study of Data Modalities and Strategies for Co-training Large Behavior Models for Robot Manipulation

对大型行为模型在机器人操作中协同训练数据模态和策略的系统研究

Fanqi Lin, Kushal Arora, Jean Mercat, Haruki Nishimura, Paarth Shah, Chen Xu, Mengchao Zhang, Mark Zolotas, Maya Angeles, Owen Pfannenstiehl, Andrew Beaulieu, Jose Barreiros

机构 * Toyota Research Institute, Cambridge MA(丰田研究院) Tsinghua University, Beijing, China(清华大学)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO

AI总结 本文研究了机器人操作中协同训练不同数据模态和策略对行为模型性能的影响,发现视觉语言和跨身体数据显著提升泛化能力,而离散动作令牌无明显优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15761 2026-01-23 cs.AI 57%

Off-Policy Actor-Critic with Sigmoid-Bounded Entropy for Real-World Robot Learning

基于Sigmoid受限熵的离策略Actor-Critic用于现实世界机器人学习

Xiefeng Wu, Mingyu Hu, Shu Zhang

机构 * Wuhan University(武汉大学)

专题命中 部署与泛化 :VLA(abstract);分类 cs.AI

AI总结 SigEnt-SAC通过Sigmoid受限熵机制,实现低成本、高效率的现实世界机器人强化学习。

Comments 7 pages main text 2 page reference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00797 2025-12-02 cs.RO 57%

Transforming Monolithic Foundation Models into Embodied Multi-Agent Architectures for Human-Robot Collaboration

将单体基础模型转化为具身体验的多智能体架构以实现人机协作

Nan Sun, Bo Mao, Yongchang Li, Chenxu Wang, Di Guo, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO

AI总结 InteractGen通过分解机器人智能为多个智能体,提升服务机器人在人类环境中的自主性和协作能力。

Comments 21 pages, 16 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05935 2025-11-11 cs.CV 57%

Interaction-Centric Knowledge Infusion and Transfer for Open-Vocabulary Scene Graph Generation

Lin Li, Chuhan Zhang, Dong Zhang, Chong Sun, Chen Li, Long Chen

机构 * HKUST(香港科技大学) AI Chip Center for Emerging Smart Systems(新兴智能系统人工智能芯片中心) Tencent(腾讯)

专题命中 部署与泛化 :action model(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏