arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7370 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7370 篇

2604.18740 2026-04-22 cs.CV 77%

Autonomous Skeletal Landmark Localization towards Agentic C-Arm Control

自主骨骼标志点定位以实现智能C臂控制

Jay Jung, Ahmad Arrabi, Jax Luo, Scott Raymond, Safwan Wshah

机构 * University of Vermont(佛蒙特大学) Cleveland Clinic(克利夫兰诊所)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文研究了利用多模态大语言模型实现C臂控制中骨骼标志点的自主定位,通过实验验证了其在准确性和推理能力上的优势,为智能C臂控制提供了新方法。

Comments Accepted at IJCARS: IPCAI 2026. Int J CARS (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17880 2026-04-21 cs.RO cs.CV 77%

ST-$π$: Structured SpatioTemporal VLA for Robotic Manipulation

ST-$π$: 结构化时空VLA用于机器人操作

Chuanhao Ma, Hanyu Zhou, Shihan Peng, Yan Li, Tao Gu, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 本文提出ST-$π$模型,通过结构化时空视觉语言模型和动作专家,解决机器人操作中精细时空推理问题,同时引入结构化时空标注数据集进行训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16397 2026-04-21 cs.CL cs.AI 77%

From Attribution to Abstention: Training-Free Attention-Based Auditing for Clinical Summarization

从归因到回避:基于注意力的无训练审计用于临床摘要

Qianqi Yan, Huy Nguyen, Sumana Srivatsa, Hari Bandi, Xin Eric Wang, Krishnaram Kenthapadi

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Oracle Health AI

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出ClinTrace框架,通过解码器注意力权重提取临床有用信号,实现无训练的注意力基于审计,提升临床摘要的透明性和可靠性,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04567 2026-04-17 cs.CV 77%

All Changes May Have Invariant Principles: Improving Ever-Shifting Harmful Meme Detection via Design Concept Reproduction

所有变化可能都有不变原则:通过设计概念再现改进永动有害迷因检测

Ziyou Jiang, Mingyang Li, Junjie Wang, Yuekai Huang, Jie Huang, Zhiyuan Chang, Zhaoyang Li, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory Institute of Software Chinese Academy of Sciences(软件研究所信息集成系统技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出RepMD方法,通过设计概念再现检测不断变化的有害迷因,利用攻击树定义设计概念图,并指导多模态大语言模型提高检测准确率。

Comments 19 pages, 11 figures, 9 tables accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05991 2026-04-16 cs.AI 77%

3D Instruction Ambiguity Detection

三维指令歧义检测

Jiayu Ding, Haoran Tang, Hongbo Jin, Wei Gao, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出三维指令歧义检测任务,构建了大规模基准Ambi3D,发现现有3D大语言模型难以判断指令歧义,提出AmbiVer框架解决该问题,提升具身AI的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06711 2026-04-09 cs.CV cs.CL 77%

Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation

通过组件导向的多模态知识增强专门化大型模型进行甲骨文解读

Jianing Zhang, Runan Li, Honglin Pang, Ding Xia, Zhou Zhu, Qian Zhang, Chuntao Li, Xi Yang

机构 * College of Software, Jilin University(吉林大学软件学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) School of Archaeology, Jilin University(吉林大学考古学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MoE, China(教育部知识驱动人机智能工程研究中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出一种基于组件的多模态知识增强框架,利用视觉语言模型和语言模型代理进行组件识别与语义推理,通过专家标注的OB-Radix数据集提升甲骨文解读的精度与细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04579 2026-04-08 cs.CV 77%

Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation

Firebolt-VL: 通过跨模态调制实现高效的视觉-语言理解

Quoc-Huy Trinh, Mustapha Abdullahi, Bo Zhao, Debesh Jha

机构 * Aalto University(阿尔托大学) University of South Dakota(南达科他大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Firebolt-VL模型,通过替换Transformer解码器为液态基础模型解码器,并引入Token-Grid相关模块,提升视觉语义理解效率与精度。

Comments arXiv admin note: substantial text overlap with arXiv:2511.11177

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03759 2026-04-07 cs.RO cs.AI 77%

Build on Priors: Vision--Language--Guided Neuro-Symbolic Imitation Learning for Data-Efficient Real-World Robot Manipulation

基于先验知识:视觉-语言引导的神经符号模仿学习用于数据高效的现实机器人操作

Pierrick Lorang, Johannes Huemer, Timothy Duggan, Kai Goebel, Patrik Zips, Matthias Scheutz

机构 * Tufts University(塔夫茨大学) Austrian Institute of Technology GmbH (AIT)(奥地利技术研究所(AIT))

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出一种可扩展的神经符号框架,通过少量未标注的示范数据自动构建符号规划领域和高效控制策略,无需手动领域工程,提升现实机器人操作的效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27183 2026-04-02 cs.CV 77%

Communicating about Space: Language-Mediated Spatial Integration Across Partial Views

关于空间的交流:通过语言介导的空间整合跨部分视图

Ankur Sikarwar, Debangan Mishra, Sudarshan Nikhil, Ponnurangam Kumaraguru, Aishwarya Agrawal

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) IIIT Hyderabad(海得拉巴国际信息技术学院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究探讨多模态大语言模型能否通过对话整合不同视角,发现其在识别共享锚点物体上表现较好,但在关系推理和全局地图构建上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25791 2026-03-30 cs.CV 77%

ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions

ArtHOI:通过基础模型驯化实现单目4D手-物体交互重建

Zikai Wang, Zhilu Zhang, Yiqing Wang, Hui Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ArtHOI框架,通过整合多基础模型先验知识,解决单目视频中手-物体交互的4D重建问题,引入自适应采样细化和多模态大语言模型引导对齐方法,构建两个新数据集并验证方法有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24684 2026-03-27 cs.CV 77%

KitchenTwin: Semantically and Geometrically Grounded 3D Kitchen Digital Twins

KitchenTwin: 基于语义和几何的3D厨房数字孪生

Quanyun Wu, Kyle Gao, Daniel Long, David A. Clausi, Jonathan Li, Yuhao Chen

机构 * University of Waterloo(滑铁卢大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出一种基于语义和几何的3D厨房数字孪生框架,通过融合视觉引导的对象网格与Transformer预测的全局点云,实现几何一致的数字孪生构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22706 2026-03-25 cs.CV cs.SE 77%

How Far Can VLMs Go for Visual Bug Detection? Studying 19,738 Keyframes from 41 Hours of Gameplay Videos

VLMs在视觉缺陷检测中能走多远?研究41小时游戏录像中的19,738个关键帧

Wentao Lu, Alexander Senchenko, Alan Sayle, Abram Hindle, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学)

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 研究通过分析41小时游戏录像中的19,738个关键帧,评估VLMs在实际场景中检测视觉缺陷的能力,发现其性能有限,需结合混合方法提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18627 2026-03-20 cs.AI 77%

Agentic Flow Steering and Parallel Rollout Search for Spatially Grounded Text-to-Image Generation

代理流引导与并行展开搜索用于空间感知的文本到图像生成

Ping Chen, Daoxuan Zhang, Xiangming Wang, Yungeng Liu, Haijin Zeng, Yongyong Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出AFS-Search框架,通过闭合环路机制和空间感知引导提升文本到图像生成的精度与效率,实现性能和速度的双重优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12936 2026-03-16 cs.RO cs.CV 77%

MotionAnymesh: Physics-Grounded Articulation for Simulation-Ready Digital Twins

MotionAnymesh:基于物理的运动模拟数字双胞胎生成

WenBo Xu, Liu Liu, Li Zhang, Dan Guo, RuoNan Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出MotionAnymesh框架,通过结合物理先验知识和几何物理联合估计,解决静态3D网格转化为可交互数字双胞胎的难题,提升模拟精度和物理可行性。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08192 2026-03-10 cs.CV 77%

Route, Retrieve, Reflect, Repair: Self-Improving Agentic Framework for Visual Detection and Linguistic Reasoning in Medical Imaging

路由、检索、反思、修复:一种自改进的代理框架,用于医学影像中的视觉检测和语言推理

Md. Faiyaz Abdullah Sayeedi, Rashedur Rahman, Siam Tahsin Bhuiyan, Sefatul Wasi, Ashraful Islam, Saadia Binte Alam, AKM Mahbubur Rahman

机构 * 1 Center for Computational \& Data Sciences (CCDS), Independent University, Bangladesh (IUB)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 R^4框架通过路由、检索、反思和修复四个代理提升医学影像分析的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03113 2026-03-03 cs.CV cs.CL 77%

Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection

通过基于梯度的自我反思缓解多模态幻觉

Shan Wang, Maying Shen, Nadine Chang, Chuong Nguyen, Hongdong Li, Jose M. Alvarez

机构 * NVIDIA Australian National University(澳大利亚国立大学) Data61, CSIRO(Data61,CSIRO)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GACD方法,通过梯度分析缓解多模态模型的幻觉问题,提升输出的视觉基础性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20648 2026-02-24 cs.CV 77%

LocateAnything3D: Vision-Language 3D Detection with Chain-of-Sight

LocateAnything3D: 基于视觉-语言的3D检测与链式视觉推理

Yunze Man, Shihao Wang, Guowen Zhang, Johan Bjorck, Zhiqi Li, Liang-Yan Gui, Jim Fan, Jan Kautz, Yu-Xiong Wang, Zhiding Yu

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 LocateAnything3D通过将3D检测转化为下一个token预测问题,实现了多目标3D检测,取得了Omni3D基准测试中的最佳成绩。

Comments Tech report. Project page: https://nvlabs.github.io/LocateAnything3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19304 2026-02-24 cs.RO cs.AI cs.HC cs.MA 77%

Safe and Interpretable Multimodal Path Planning for Multi-Agent Cooperation

安全且可解释的多模态路径规划用于多智能体协作

Haojun Shi, Suyu Ye, Katherine M. Guerrerio, Jianzhi Shen, Yifan Yin, Daniel Khashabi, Chien-Ming Huang, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 CaPE通过多模态路径规划实现安全且可解释的多智能体协作,利用视觉-语言模型和模型基于规划器确保路径调整的安全性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17677 2026-02-23 cs.LG cs.CL cs.RO 77%

Reducing Text Bias in Synthetically Generated MCQAs for VLMs in Autonomous Driving

减少自动驾驶VLMs中合成生成MCQA的文本偏差

Sutej Kulgod, Sean Ye, Sanchit Tanwar, Christoffer Heckman

机构 * Zoox, Inc.(Zoox公司)

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.LG

AI总结 本文提出方法减少自动驾驶VLMs中合成生成MCQA的文本偏差,通过解耦正确答案与语言痕迹并采用课程学习策略,使模型依赖视觉基础以提升感知理解能力。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15650 2026-02-18 cs.CV 77%

Concept-Enhanced Multimodal RAG: Towards Interpretable and Accurate Radiology Report Generation

概念增强的多模态RAG:迈向可解释且准确的放射科报告生成

Marco Salmè, Federico Siciliano, Fabrizio Silvestri, Paolo Soda, Rosa Sicilia, Valerio Guarrasi

机构 * Department of Engineering(工程系) Research Unit of Artificial Intelligence and Computer Systems(人工智能与计算机系统研究单位) Università Campus Bio-Medico of Roma(罗马大学生物医学校园) Department of Computer, Control and Management Engineering(计算机、控制与管理工程系) Sapienza University of Rome(罗马萨皮恩扎大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入、辐射物理、生物医学工程系) Umeå University(乌梅拉大学) UniCamillus-Saint Camillus International University of Health Sciences(UniCamillus-圣卡米卢斯国际健康科学大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 概念增强的多模态RAG通过分解视觉表示为可解释的临床概念,提升放射科报告生成的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12260 2026-01-21 cs.AI 77%

Docs2Synth: A Synthetic Data Trained Retriever Framework for Scanned Visually Rich Documents Understanding

Docs2Synth: 一种用于扫描视觉丰富文档理解的合成数据训练检索框架

Yihao Ding, Qiang Sun, Puzhen Wu, Sirui Li, Siwen Luo, Wei Liu

机构 * University of Western Australia(西澳大学) The University of Hong Kong(香港大学) Murdoch University(默多克大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 Docs2Synth通过合成监督框架实现私有和低资源领域文档理解,利用检索引导推理提升接地能力和领域泛化,无需人工标注。

Comments Accepted at WWW 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02358 2026-01-19 cs.CV 77%

VINO: A Unified Visual Generator with Interleaved OmniModal Context

VINO:一个具有交错多模态上下文的统一视觉生成器

Junyi Chen, Tong He, Zhoujie Fu, Pengfei Wan, Kun Gai, Weicai Ye

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 VINO通过统一的视觉生成框架实现图像和视频的生成与编辑,利用交错多模态上下文条件处理,提升多任务视觉创作能力。

Comments Project page: https://sotamak1r.github.io/VINO-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04734 2026-01-09 cs.CV 77%

AIVD: Adaptive Edge-Cloud Collaboration for Accurate and Efficient Industrial Visual Detection

AIVD:自适应边缘-云协作用于准确高效的工业视觉检测

Yunqing Hu, Zheming Yang, Chang Zhao, Qi Guo, Meng Gao, Pengcheng Li, Wen Ji

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 AIVD通过边缘-云协作提升工业视觉检测的精度与效率,采用轻量边缘检测与云MLLM协同,结合高效微调策略和动态调度算法,实现高吞吐低延迟的资源优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15971 2025-12-19 cs.CV 77%

From Words to Wavelengths: VLMs for Few-Shot Multispectral Object Detection

从词语到波长:用于少样本多光谱目标检测的视觉语言模型

Manuel Nkegoum, Minh-Tan Pham, Élisa Fromont, Bruno Avignon, Sébastien Lefèvre

机构 * Univ Bretagne Sud, IRISA, UMR 6074(布列塔尼大学,IRISA,UMR 6074) Univ Rennes, IRISA, UMR 6074(里尔大学,IRISA,UMR 6074) ATERMES UiT The Arctic University of Norway(北欧大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出利用视觉语言模型进行少样本多光谱目标检测,通过整合文本、视觉和热模态,在数据稀缺情况下实现高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08294 2025-12-11 cs.CV 77%

OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation

OpenSubject: 利用视频衍生的身份和多样性先验进行主体驱动的图像生成与操纵

Yexin Liu, Manyuan Zhang, Yueze Wang, Hongyu Li, Dian Zheng, Weiming Zhang, Changsheng Lu, Xunliang Cai, Yan Feng, Peng Pei, Harry Yang

机构 * HKUST(香港科技大学) Meituan(美团) HKUST(GZ)(香港科技大学(广州))

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 OpenSubject通过视频衍生的大规模数据集提升主体驱动图像生成与操纵的性能,尤其在复杂场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06663 2025-12-09 cs.CV 77%

CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks

CoT4Det:面向感知导向视觉-语言任务的链式思维框架

Yu Qi, Yumeng Zhang, Chenting Gong, Xiao Tan, Weiming Zhang, Wei Zhang, Jingdong Wang

机构 * Baidu Inc.(百度公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 CoT4Det通过将感知任务分解为分类、计数和定位三个步骤,提升视觉-语言模型在目标检测等任务中的性能,使mAP从19%提升至33%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01946 2025-12-09 cs.CV 77%

3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding

3DRS: MLLMs 需要 3D 意识表示监督以实现场景理解

Xiaohu Huang, Jingjing Wu, Qunyi Xie, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Department of Computer Vision Technology (VIS), Baidu Inc.(百度公司计算机视觉技术部)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 3DRS 通过引入预训练 3D 基础模型的监督,提升 MLLM 的 3D 表示能力,从而增强场景理解性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16412 2025-12-09 cs.CV cs.CE 77%

A Survey on Industrial Anomalies Synthesis

工业异常合成方法综述

Yanshu Wang, Xichen Xu, Jiaqi Liu, Xiaoning Lei, Guoyang Xie, Guannan Jiang, Zhichao Lu

机构 * Shanghai Jiao Tong University(上海交通大学) City University of Hong Kong(香港城市大学) Department of Intelligent Manufacturing, CATL(CATL智能制造部门)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出工业异常合成方法的统一综述,引入首个分类法并探讨多模态学习的应用,为未来研究提供框架和路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19221 2025-12-01 cs.CV cs.RO 77%

Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving

Percept-WAM:感知增强的环境感知-行动模型用于鲁棒的端到端自动驾驶

Jianhua Han, Meng Tian, Jiangtong Zhu, Fan He, Huixin Zhang, Sitong Guo, Dechang Zhu, Hao Tang, Pei Xu, Yuze Guo, Minzhe Niu, Haojie Zhu, Qichao Dong, Xuechao Yan, Siyuan Dong, Lu Hou, Qingqiu Huang, Xiaosong Jia, Hang Xu

机构 * Yinwang Intelligent Technology Co. Ltd.(亿网通智能科技有限公司) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 Percept-WAM通过整合2D/3D场景理解能力,提升自动驾驶的感知与行动决策,实现端到端鲁棒性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11177 2025-11-26 cs.CV 77%

Viper-F1: Fast and Fine-Grained Multimodal Understanding with Cross-Modal State-Space Modulation

Viper-F1:基于交叉模态状态空间调制的高效细粒度多模态理解

Quoc-Huy Trinh

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Viper-F1通过引入高效液态状态空间动力学和令牌-网格相关模块,实现了高效细粒度多模态理解。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏