arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9819 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9146 篇

2104.02934 2021-04-08 cs.CL cs.AI cs.LG 62%

A Question-answering Based Framework for Relation Extraction Validation

Jiayang Cheng, Haiyun Jiang, Deqing Yang, Yanghua Xiao

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.00912 2021-04-05 cs.AI cs.CV cs.GR 62%

Datacentric analysis to reduce pedestrians accidents: A case study in Colombia

Michael Puentes, Diana Novoa, John Delgado Nivia, Carlos Barrios Hernández, Oscar Carrillo, Frédéric Le Mouël

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI

Journal ref International Conference on Sustainable Smart Cities and Territories (SSCt2021), Apr 2021, Doha, Qatar

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.09001 2020-10-01 cs.LG cs.MA cs.RO stat.ML 62%

MagNet: Discovering Multi-agent Interaction Dynamics using Neural Network

Priyabrata Saha, Arslan Ali, Burhan A. Mudassar, Yun Long, Saibal Mukhopadhyay

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.LG

Comments Accepted manuscript by ICRA 2020

Journal ref ICRA 2020, pp. 8158-8164

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.14175 2020-07-31 cs.LG cs.AI stat.ML 62%

PyKEEN 1.0: A Python Library for Training and Evaluating Knowledge Graph Embeddings

Mehdi Ali, Max Berrendorf, Charles Tapley Hoyt, Laurent Vermue, Sahand Sharifzadeh, Volker Tresp, Jens Lehmann

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.11479 2020-07-13 eess.IV cs.CV cs.LG 62%

Change Detection in Multi-temporal VHR Images Based on Deep Siamese Multi-scale Convolutional Networks

Hongruixuan Chen, Chen Wu, Bo Du, Liangpei Zhang

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.13608 2020-06-25 cs.CV cs.LG cs.MM 62%

Comprehensive Information Integration Modeling Framework for Video Titling

Shengyu Zhang, Ziqi Tan, Jin Yu, Zhou Zhao, Kun Kuang, Tan Jiang, Jingren Zhou, Hongxia Yang, Fei Wu

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.LG

Comments 11 pages, 6 figures, to appear in KDD 2020 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.13046 2020-06-24 cs.CV cs.LG eess.IV 62%

Rotation Invariant Deep CBIR

Subhadip Maji, Smarajit Bose

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.LG

Comments arXiv admin note: text overlap with arXiv:2002.07877

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.09272 2020-03-03 cs.CV cs.RO 62%

Learning 3D-aware Egocentric Spatial-Temporal Interaction via Graph Convolutional Networks

Chengxi Li, Yue Meng, Stanley H. Chan, Yi-Ting Chen

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.CV

Comments Accepted to the International Conference on Robotics and Automation (ICRA) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.10188 2020-01-29 eess.IV cs.CV cs.LG stat.ML 62%

Robust Method for Semantic Segmentation of Whole-Slide Blood Cell Microscopic Image

Muhammad Shahzad, Arif Iqbal Umar, Muazzam A. Khan, Syed Hamad Shirazi, Zakir Khan, Waqas Yousaf

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.LG

Comments 13 pages, 13 figures

Journal ref Volume 2020, Article ID 4015323, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.06588 2019-06-18 cs.RO cs.LG 62%

Reinforcement Learning with Non-uniform State Representations for Adaptive Search

Sandeep Manjanna, Herke van Hoof, Gregory Dudek

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.LG

Comments Published at IEEE INTERNATIONAL SYMPOSIUM ON SAFETY, SECURITY AND RESCUE ROBOTICS 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.00848 2019-06-04 cs.RO cs.LG 62%

Predicting Vehicle Behaviors Over An Extended Horizon Using Behavior Interaction Network

Wenchao Ding, Jing Chen, Shaojie Shen

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.LG

Comments 6+n pages. Accepted to International Conference on Robotics and Automation (ICRA) 2019. IEEE copyright

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.11279 2019-03-28 cs.IR cs.CV cs.LG 62%

Graph Convolution for Multimodal Information Extraction from Visually Rich Documents

Xiaojing Liu, Feiyu Gao, Qiong Zhang, Huasha Zhao

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.LG

Comments naacl'19 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.05054 2018-10-05 cs.CL cs.AI cs.DB cs.LG 62%

IncSQL: Training Incremental Text-to-SQL Parsers with Non-Deterministic Oracles

Tianze Shi, Kedar Tatwawadi, Kaushik Chakrabarti, Yi Mao, Oleksandr Polozov, Weizhu Chen

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.09496 2018-01-30 cs.IR cs.AI cs.DL cs.LG 62%

Improving Active Learning in Systematic Reviews

Gaurav Singh, James Thomas, John Shawe-Taylor

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

Comments 10 pages, many figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.04115 2017-06-14 cs.CL cs.AI cs.LG 62%

Zero-Shot Relation Extraction via Reading Comprehension

Omer Levy, Minjoon Seo, Eunsol Choi, Luke Zettlemoyer

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

Comments CoNLL 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.00873 2016-11-04 cs.AI cs.LG 62%

Extracting Actionability from Machine Learning Models by Sub-optimal Deterministic Planning

Qiang Lyu, Yixin Chen, Zhaorong Li, Zhicheng Cui, Ling Chen, Xing Zhang, Haihua Shen

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.02877 2016-06-10 cs.RO cs.AI 62%

Understanding User Instructions by Utilizing Open Knowledge for Service Robots

Dongcai Lu, Feng Wu, Xiaoping Chen

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.03269 2016-05-12 cs.RO cs.AI 62%

A Hierarchical Emotion Regulated Sensorimotor Model: Case Studies

Junpei Zhong, Rony Novianto, Mingjun Dai, Xinzheng Zhang, Angelo Cangelosi

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI

Comments Accepted at The 5th International Conference on Data-Driven Control and Learning Systems. 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1210.4889 2012-10-19 cs.LG cs.AI stat.ML 62%

Learning STRIPS Operators from Noisy and Incomplete Observations

Kira Mourao, Luke S. Zettlemoyer, Ronald P. A. Petrick, Mark Steedman

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

Comments Appears in Proceedings of the Twenty-Eighth Conference on Uncertainty in Artificial Intelligence (UAI2012)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18184 2026-08-20 cs.CV 新提交 57%

Human-Centric Intelligence in the Era of Foundation Models: A Survey

基础模型时代的以人为中心的智能:一项综述

Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Peking University(北京大学) University of Southern Queensland(南昆士兰大学) Tongji University(同济大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Beijing Institute of Technology(北京理工大学) The University of Sydney(悉尼大学) University of Trento(特伦托大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文针对基础模型时代以人为中心的智能进展碎片化问题,提出全谱人类上下文分类法,梳理其方法基础、相关方法与资源,探讨挑战方向,为该领域推进提供参考。

Comments GitHub Repo: https://github.com/cseeyangchen/Human-Centric-AI; Project Page: https://cseeyangchen.github.io/Human-Centric-AI/homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18026 2026-08-19 cs.LG cs.CE 新提交 57%

TabNSM: Neural Sparse Mixer for Tabular Regression

TabNSM:面向表格回归的神经稀疏混合器

Ali Eslamian, Qiang Cheng

机构 * University of Kentucky(肯塔基大学) Institute for Biomedical Informatics(生物医学信息学研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 该研究提出TabNSM框架,通过自适应稀疏交互模块、多阶段回归头等组件,在9个真实回归基准上实现高维表格回归的优性能与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17496 2026-08-19 cs.RO 新提交 57%

Calibrated Predictive Safety for Heterogeneous Robots: An Action-Conditioned JEPA Framework with Model-Based Safety Shields

异构机器人的校准预测安全性:一种带基于模型安全盾的动作条件联合嵌入预测架构(JEPA)框架

Kaiming Zhong, Tianhua Liu, Yue Wang

机构 * Guangdong Bifang Intelligent Control Technology Co., Ltd.(广东毕方智能控制技术有限公司)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 本研究提出带基于模型安全盾的动作条件JEPA框架,用于异构机器人,可预测候选动作的任务进展与物理风险,在仿真中提升了成功率并降低碰撞漏报率。

Comments 17 pages, 9 figures. Simulation-only empirical results on LIBERO-Long (no real-robot experiments). Source, figure-generation scripts and reproducibility checklist included. Level-3 offline reranking significance test not executed; see Sec. 7 (Scope and honesty statement) for detailed disclosure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16797 2026-08-18 cs.IR cs.AI 新提交 57%

UniDot: A Unified Network for Sequence Modeling and Feature Interaction in Large-scale Recommendation

UniDot:用于大规模推荐中序列建模与特征交互的统一网络

Rongcheng Lin, Yan Sun, Jamey Zhang, Guanglei Xiong, Ivan Ji, Xianjie Chen, Shujian Bu

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 UniDot是统一推荐系统中特征交互与序列建模的架构,经特定优化方法训练后,在TAAC KDD Cup 2026工业赛道获亚军。

Journal ref KDD 2026 UniRec Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16476 2026-08-18 cs.RO 新提交 57%

Exposing the Long-tail in Embodied Urban Navigation via Scalable Learning from In-the-Wild Videos

通过从野外视频进行可扩展学习揭示具身城市导航中的长尾分布

Bingyi Xia, Han Bao, Zhewei Chen, Hanjing Ye, Jingwen Yu, Yuhan Pang, Wenjun Xu, Jiankun Wang

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 该研究提出可扩展框架,从网络规模野外 egocentric 视频学习点目标城市导航策略,自动注释视频并训练视觉-语言-动作策略,表征并诊断导航长尾分布与失败模式,验证了知识迁移效果并揭示长尾结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15266 2026-08-18 cs.GR cs.LG 新提交 57%

BrainLinear: A Linear Model for Brain Network Analysis in Sparse Tangent Subspaces

BrainLinear:用于稀疏切空间中脑网络分析的线性模型

Sijing Wu, Dongyuan Li, Miaoting Huang, Weiwei Ye, Ying Zhang, Feng Xia, Renhe Jiang

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本研究针对脑网络分析中现有方法的冗余与高成本问题,提出轻量几何感知框架BrainLinear,在ABIDE和ADNI数据集上以远低于GNN、Transformer的成本达到更优性能,且支持连接层面解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02169 2026-08-17 cs.LG 版本更新 57%

Responsiveness Verification: Will Predictions Change? How Much? How Often?

响应性验证:预测会改变吗?改变多少?改变频率如何?

Harry Cheon, Meredith Stewart, Bogdan Kulynych, Tsui-Wei Weng, Berk Ustun

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本研究提出测量响应性的算法与交互模型框架,搭配统计保证,可用于检测累犯预测的排除情况、估计内容审核博弈成本、测试LLM基准鲁棒性,提升模型安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18064 2026-08-13 cs.AI 版本更新 57%

Towards Human Motion World Models via Executable Behaviour Representations

通过可执行模型理解人类行为

Rimvydas Rubavicius, Manisha Dubey, N. Siddharth, Subramanian Ramamoorthy

机构 * School of Informatics The University of Edinburgh(信息学院爱丁堡大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出EXACT语言,通过可执行神经符号模型分析人类动作,提升动作分割和异常检测的效率与直观性。

Comments Accepted in ECCV2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09388 2026-08-11 cs.CV 新提交 57%

Efficient Human-Contact Representation for Human-Scene Interaction

面向人-场景交互的高效人体接触表示

Nghia Vu, Tuong Do, Binh X. Nguyen, Erman Tjiputra, Anh Nguyen

机构 * AIOZ University of Liverpool(利物浦大学) NTHU(国立清华大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 针对人-场景交互中接触表示效率不足的问题,提出稀疏接触掩码与稀疏算子,在三个基准数据集的接触预测和场景合成任务上,实现至少12倍提速且精度优于现有最优模型。

Comments Accepted in ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08632 2026-08-11 cs.AI 新提交 57%

A QUBO-Inspired Computational Framework for Airport Landside Bottleneck Diagnosis and Dynamic Dispatch Optimization

一种受QUBO启发的机场陆侧瓶颈诊断与动态调度优化计算框架

Wuming Lei, Xiaobin Li, Mingyan Sun, Jianing Long, Yulin Tong, Yanbin Gao

机构 * East China Jiaotong University(华东交通大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本研究针对机场陆侧高峰耦合拥堵问题,提出受QUBO启发的计算框架,通过5分钟状态模型与多指标诊断瓶颈,采用两种调度方案优化,在两大机场测试中显著缩减旅客队列,且具备鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06435 2026-08-04 cs.AI 版本更新 57%

Trust but Verify:Evidence-Linked Multi-Agent Clinical Information Extraction in Pathology

从细则中发现幽门螺杆菌:基于证据关联的多智能体胃活检报告病例发现

Yufan Wang, Anit Kumar Sahu, Yan Fei Ng, Daniel Kang, Shayan Vassef, Soorya Ram Shimgekar, Koustuv Saha, Piyum Zonooz, Navin Kumar, Chee Leong Cheng, Li Yan Khor

机构 * Department of Anatomical Pathology, Singapore General Hospital(新加坡中央医院解剖病理科) Duke–NUS Medical School(新加坡国立大学Duke-NUS医学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 研究针对胃活检报告中幽门螺杆菌证据提取难题,采用Nimblemind多智能体系统,经试点评估其总体准确率达98.61%,虽与其他比较器性能相似,但实现了工作流程整合和可追溯性,还能大幅减少审查时间。

详情

展开后加载摘要…

URL PDF HTML 收藏