arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2602.12196 2026-02-13 cs.CL cs.AI 83%

Visual Reasoning Benchmark: Evaluating Multimodal LLMs on Classroom-Authentic Visual Problems from Primary Education

视觉推理基准:评估多模态大语言模型在小学课堂真实视觉问题上的能力

Mohamed Huti, Alasdair Mackintosh, Amy Waldock, Dominic Andrews, Maxime Lelièvre, Moritz Boos, Tobias Murray, Paul Atherton, Robin A. A. Ince, Oliver G. B. Garrod

机构 * Fab AI

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出视觉推理基准,用于评估多模态大语言模型在小学课堂真实视觉问题上的能力,揭示模型在静态与动态任务上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12159 2026-02-13 cs.RO cs.AI 83%

3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting

3DGSNav: 通过主动3D高斯散射增强视觉-语言模型的物体导航

Wancai Zheng, Hao Chen, Xianlong Lu, Linlin Ou, Xinyi Yu

机构 * Zhejiang University of Technology, Hangzhou, China(浙江工业大学,杭州,中国) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

AI总结 3DGSNav通过主动3D高斯散射提升视觉-语言模型的物体导航能力,结合结构化视觉提示和链式推理,实现高效且可靠的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13853 2026-02-13 cs.CV 83%

Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark

世界模拟器能推理吗?Gen-ViRe:一个生成性视觉推理基准

Xinxin Liu, Zhaopan Xu, Ming Li, Kai Wang, Yong Jae Lee, Yuzhang Shang

机构 * University of Central Florida(中央佛罗里达大学) National University of Singapore(新加坡国立大学) UW-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :visual reasoning(title,abstract);VLM(abstract);分类 cs.CV

AI总结 Gen-ViRe提出一个生成性视觉推理基准,通过分解CoF推理为六个认知维度和24个子任务,评估视频模型的推理能力,揭示视觉质量与推理深度的差异。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11455 2026-02-13 cs.AI 83%

Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning

应得之 credit:跨模态连接驱动精确强化学习用于 MLLM 推理

Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) EPIC Lab, SJTU(EPIC实验室,上海交通大学)

专题命中 视觉推理 :MLLM(title);grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 通过跨模态连接驱动精确强化学习,提升多模态大语言模型的推理能力,仅引入1.2%开销即超越基线模型。

Comments 20pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19191 2026-02-10 cs.CV 83%

Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models

像阅读文本一样理解图像:视觉-语言模型中的序列图像理解

Yueyan Li, Chenggong Zhao, Zeyuan Zang, Caixia Yuan, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出通过序列化方法理解图像内容,揭示视觉-语言模型中对象识别与空间感知的机制,改进解码效率并增强空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04413 2026-02-05 cs.CL cs.AI cs.MM 83%

History-Guided Iterative Visual Reasoning with Self-Correction

基于历史的迭代视觉推理与自我校正

Xinglong Yang, Zhilin Peng, Zhanzhan Liu, Haochen Shi, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 视觉推理 :visual reasoning(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 H-GIVR框架通过迭代视觉推理与自我校正,显著提升多模态推理准确性并保持低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20272 2026-02-04 cs.CV 83%

Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning

Ground-R1: 通过强化学习激励基于地面的视觉推理

Meng Cao, Haoze Zhao, Can Zhang, Xiaojun Chang, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Sun Yat-sen University(中山大学)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 Ground-R1 通过 Scale Relative Policy Optimization 方法,解决 LVLM 在视觉证据 grounding 方面的偏差问题,提升推理准确性和证据 grounding 能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03026 2026-02-04 cs.AI cs.MA 83%

Visual Reasoning over Time Series via Multi-Agent System

通过多智能体系统进行时间序列的视觉推理

Weilin Ruan, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 MAS4TS通过多智能体系统实现时间序列的视觉推理,利用分析-推理-执行范式,结合视觉语言模型和工具链,提升时间序列任务的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01816 2026-02-03 cs.CV 83%

Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies

看见即相信?多模态大语言模型在视觉错觉和异常上的基准测试

Wenjin Hou, Wei Liu, Han Hu, Xiaoxiao Sun, Serena Yeung-Levy, Hehe Fan

机构 * Zhejiang University(浙江大学) Tencent Hunyuan Team(腾讯文言团队) Stanford University(斯坦福大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出VIA-Bench基准测试,评估多模态大语言模型在视觉错觉和异常上的性能,揭示其在复杂视觉任务中的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01298 2026-02-03 cs.CV 83%

Interaction-Consistent Object Removal via MLLM-Based Reasoning

基于MLLM的交互一致物体移除

Ching-Kai Huang, Wen-Chieh Lin, Yan-Cen Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出基于MLLM的REORM框架,通过多模态语言模型推断需共同删除的交互元素,解决交互一致物体移除问题,并在ICOREval基准上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01200 2026-02-03 cs.CV 83%

Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis

Med3D-R1: 促进3D医学视觉-语言模型的临床推理

Haoran Lai, Zihang Jiang, Kun Zhang, Qingsong Yao, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Wei Wei, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(先进研究所,中国科学技术大学) Stanford University(斯坦福大学) Medical Business Department, iFlytek Co.Ltd(iFlytek公司医学业务部) The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine University of Science and Technology of China(中国科学技术大学第一附属医院,生命科学与医学系)

专题命中 视觉推理 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 Med3D-R1通过两阶段训练框架提升3D医学视觉-语言模型的临床推理能力,实现更准确的异常诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21342 2026-01-30 cs.AI 83%

Ostrakon-VL: Towards Domain-Expert MLLM for Food-Service and Retail Stores

Ostrakon-VL:面向食品服务与零售商店的领域专家MLLM

Zhiyong Shen, Gongpeng Zhao, Jun Zhou, Li Yu, Guandong Kou, Jichen Li, Chuanlei Dong, Zuncheng Li, Kaimao Li, Bingkun Wei, Shicheng Hu, Wei Xia, Wenguo Duan

机构 * Rajax Network Technology (Taobao Shangou of Alibaba)(Rajax网络技术(淘宝商购的阿里巴巴))

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 Ostrakon-VL通过多阶段训练策略在FSRS场景中取得新突破,实现60.1的高分表现,超越现有模型并展示更高参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21181 2026-01-30 cs.AI 83%

MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models

MAD:用于减轻多模态大语言模型中跨模态幻觉的模态自适应解码

Sangyun Chung, Se Yeon Kim, Youngchae Chee, Yong Man Ro

机构 * Integrated Vision Language Lab, KAIST, South Korea(韩国科学技术院集成视觉语言实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual language model(abstract);分类 cs.AI

AI总结 MAD通过自适应加权对比解码分支,有效减少多模态大语言模型中的跨模态幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20641 2026-01-29 cs.AI 83%

Investigating the Development of Task-Oriented Communication in Vision-Language Models

探究视觉-语言模型中以任务为导向的交流发展

Boaz Carmeli, Orr Paradise, Shafi Goldwasser, Yonatan Belinkov, Ron Meir

机构 * Technion – Israel Institute of Technology(技术ion–以色列理工学院) EPFL(苏黎世联邦理工学院) University of California, Berkeley(加州大学伯克利分校) Harvard University(哈佛大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

AI总结 研究视觉-语言模型在协作任务中发展以任务为导向的通信协议的潜力与风险

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05665 2026-01-22 cs.CL cs.CV 83%

Interleaved Latent Visual Reasoning with Selective Perceptual Modeling

交错的潜在视觉推理与选择性感知建模

Shuai Dong, Siyuan Wang, Xingyu Liu, Chenglin Li, Haowen Hou, Zhongyu Wei

机构 * China University of Geosciences, Wuhan(中国地质大学(武汉)) Shanghai Innovation Institute(上海创新研究院) University of Southern California(南加州大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 ILVR通过交错潜在视觉表示与文本生成,实现动态状态演变与精确感知建模的统一,提升多模态推理性能。

Comments 18 pages, 11 figures. Code available at https://github.com/XD111ds/ILVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13096 2026-01-21 cs.RO cs.CV 83%

LLM-VLM Fusion Framework for Autonomous Maritime Port Inspection using a Heterogeneous UAV-USV System

基于异构无人机-水下机器人系统的LLM-VLM融合框架用于自主港口检测

Muhayy Ud Din, Waseem Akram, Ahsan B. Bakht, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS)(卡利法大学自主机器人系统中心(KUCARS)) Khalifa University(卡利法大学)

专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出基于LLM和VLM的融合框架,利用异构无人机-水下机器人系统实现自主港口检测,通过符号规划与语义检测提升检测效率和安全性。

Comments submitted in AEJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12626 2026-01-21 cs.CV 83%

Linear Mechanisms for Spatiotemporal Reasoning in Vision Language Models

线性机制用于视觉语言模型中的时空推理

Raphi Kang, Hongqiao Chen, Georgia Gkioxari, Pietro Perona

机构 * California Institute of Technology(加利福尼亚理工学院)

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种线性机制用于视觉语言模型中的时空推理,通过分析空间ID和时间ID的结合,揭示了模型内部的因果推理过程,以提升模型的可解释性和设计能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11322 2026-01-19 cs.CV cs.LO 83%

Enhancing Vision Language Models with Logic Reasoning for Situational Awareness

通过逻辑推理增强视觉语言模型以提升情境感知能力

Pavana Pradeep, Krishna Kant, Suya Yu

机构 * CIS Department, Temple University(Temple大学计算机与信息科学系) ARL(美国陆军研究实验室)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文通过整合逻辑推理与传统计算机视觉方法,提升视觉语言模型在情境感知中的准确性与细粒度事件识别能力。

Comments Accepted for publication in IEEE Transactions on AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03515 2026-01-08 cs.CL cs.AI 83%

Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents

Mem-Gallery: 多模态长时对话记忆的基准测试用于 MLLM 代理

Yuanchen Bei, Tianxin Wei, Xuying Ning, Yanjun Zhao, Zhining Liu, Xiao Lin, Yada Zhu, Hendrik Hamann, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究) Stony Brook University(石溪大学) Brookhaven National Laboratory(布鲁赫斯国家实验室)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 Mem-Gallery 是一个用于评估多模态长时对话记忆的基准测试,通过多会话对话数据集和系统评估框架,揭示了记忆提取、推理和知识管理的关键发现。

Comments 34 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19936 2026-01-05 cs.CV 83%

VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs

VisualQuest: 一个用于多模态大语言模型(MLLMs)抽象视觉推理的基准数据集

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * School of Computer Science and Technology, Dalian University of Technology, Dalian, China(大连理工大学计算机科学与技术学院) School of Foreign Languages, Dalian University of Technology, Dalian, China(大连理工大学外语学院) School of Computer Science and Technology, Xinjiang Normal University, Urumqi, China(新疆师范大学计算机科学与技术学院)

专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 VisualQuest通过风格化图像和针对性问题,评估多模态大语言模型在抽象视觉推理上的能力,发现Gemini和GPT-4o在不同任务上表现突出,揭示多模态理解的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21583 2025-12-29 cs.AI 83%

A Medical Multimodal Diagnostic Framework Integrating Vision-Language Models and Logic Tree Reasoning

一种整合视觉-语言模型和逻辑树推理的医学多模态诊断框架

Zelin Zang, Wenyi Gu, Siqi Ma, Dan Yang, Yue Shen, Zhu Zhang, Guohui Fan, Wing-Kuen Ling, Fuji Yang

机构 * Tsientang Institute of Advanced Study (TIAS)(钱塘先进研究所) Westlake University(西湖大学) Ant Group(蚂蚁集团) China-Japan Friendship Hospital(中日友好医院)

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.AI

AI总结 本文提出一种整合视觉-语言模型与逻辑树推理的医学诊断框架,旨在提升多模态医学AI的可信度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20557 2025-12-24 cs.CV 83%

Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models

在4D中学习推理:面向视觉语言模型的动态空间理解

Shengchao Zhou, Yuxin Chen, Yuying Ge, Wei Huang, Jiehong Lin, Ying Shan, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG实验室)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本研究提出DSR套件,通过生成多选题-答案对和轻量级几何选择模块提升视觉语言模型的动态空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15705 2025-12-19 cs.CV 83%

GeoVista: Web-Augmented Agentic Visual Reasoning for Geolocalization

GeoVista: 基于网络增强的代理视觉推理用于地理定位

Yikun Wang, Zuyan Liu, Ziyi Wang, Han Hu, Pengfei Liu, Yongming Rao

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文元) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV

AI总结 GeoVista通过整合图像缩放和网络搜索工具,提升地理定位任务的代理模型性能,实现优于开源模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15940 2025-12-19 cs.CV cs.RO 83%

R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

R4:在4D时空空间中为视觉语言模型引入检索增强推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业协会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 R4通过构建4D时空知识库,使视觉语言模型具备结构化终身记忆,实现无需训练的检索增强推理,提升动态环境中的具身推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12487 2025-12-16 cs.CV 83%

More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models

不止于最终答案:提升视觉提取和逻辑一致性的视觉语言模型

Hoang Anh Just, Yifei Fan, Handong Zhao, Jiuxiang Gu, Ruiyi Zhang, Simon Jenni, Kushal Kafle, Ruoxi Jia, Jing Shi

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe Research(Adobe研究院) Apple(苹果公司)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 PeRL-VL通过解耦框架提升视觉语言模型的视觉提取和推理一致性,实现Pass@1准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11060 2025-12-15 cs.CV 83%

Synthetic Vasculature and Pathology Enhance Vision-Language Model Reasoning

合成血管和病理增强视觉-语言模型推理

Chenjun Li, Cheng Wan, Laurin Lux, Alexander Berger, Richard B. Rosen, Martin J. Menten, Johannes C. Paetzold

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔·康奈尔医学) Technical University of Munich(慕尼黑技术大学) New York Eye and Ear Infirmary of Mount Sinai(圣文森特医院) Cornell Tech(康奈尔科技)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本研究提出合成血管推理框架,通过生成具有糖尿病视网膜病变特征的图像和文本,提升视觉-语言模型在OCTA图像诊断中的推理能力与病理定位精度。

Comments 23 pages, 8 figures, 6 tables. Full paper under review for MIDL 2026 (Medical Imaging with Deep Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10300 2025-12-12 cs.AI 83%

Investigating The Functional Roles of Attention Heads in Vision Language Models: Evidence for Reasoning Modules

探讨视觉语言模型中注意力头的功能作用:推理模块的证据

Yanbei Jiang, Xueqi Ma, Shu Liu, Sarah Monazam Erfani, Tongliang Liu, James Bailey, Jey Han Lau, Krista A. Ehinger

机构 * The University of Melbourne(墨尔本大学) The University of Sydney(悉尼大学)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文通过CogVision数据集探讨视觉语言模型中注意力头的功能作用,揭示其在多模态推理中的关键作用及分布特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08860 2025-12-10 cs.CV 83%

Tri-Bench: Stress-Testing VLM Reliability on Spatial Reasoning under Camera Tilt and Object Interference

Tri-Bench:在相机倾斜和物体干扰下测试VLM在空间推理中的可靠性

Amit Bendkhale

机构 * Amit Bendkhale(独立研究者)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 Tri-Bench通过测试VLM在相机倾斜和物体干扰下的空间推理可靠性,揭示了模型在几何推理中的不足。

Comments 6 pages, 3 figures. Code and data: https://github.com/Amiton7/Tri-Bench. Accepted to the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04441 2025-12-09 cs.CV 83%

MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving

MindDrive: 一个整合世界模型和视觉-语言模型的全功能框架,用于端到端自动驾驶

Bin Sun, Yaoguang Cao, Yan Wang, Rui Wang, Jiachen Shang, Xiejie Feng, Jiayi Lu, Jia Shi, Shichun Yang, Xiaoyu Yan, Ziying Song

机构 * School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) State Key Laboratory of Intelligent Transportation System, Beihang University(北京航空航天大学智能交通系统国家重点实验室) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新院) Contemporary Amperex Technology Co., Limited (CATL)(当代电动车技术有限公司(CATL)) Research Institute of Aero-Engine, Beihang University(北京航空航天大学航空发动机研究院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) China Automotive Engineering Research Institute Co., Ltd.(中国汽车工程研究院股份有限公司)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 MindDrive通过整合世界模型和视觉-语言模型,提出了一种端到端自动驾驶框架,实现高质量轨迹生成与多目标决策推理,提升自动驾驶的安全性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04650 2025-12-09 cs.CV 83%

EncQA: Benchmarking Vision-Language Models on Visual Encodings for Charts

EncQA:在图表视觉编码上评估视觉-语言模型的基准测试

Kushin Mukherjee, Donghao Ren, Dominik Moritz, Yannick Assogba

机构 * Stanford University(斯坦福大学) Apple(苹果公司)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 EncQA通过系统覆盖图表理解的关键视觉编码和任务,揭示了不同编码和任务间VLMs性能的显著差异,强调了针对性策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏