arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4469 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4469 篇

2605.01495 2026-05-05 cs.CL cs.AI 70%

FT-RAG: A Fine-grained Retrieval-Augmented Generation Framework for Complex Table Reasoning

FT-RAG:一种面向复杂表格推理的细粒度检索增强生成框架

Zebin Guo, Weidong Geng, Ruichen Mao

机构 * Georgia Institute of Technology(佐治亚理工学院) Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室)

专题命中 视觉推理 :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 FT-RAG通过细粒度检索和多模态融合提升表格推理能力,引入多表RAG库增强训练数据,实现表格和单元格命中率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01338 2026-05-05 cs.AI 70%

DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

DiagramNet: 一种面向非标准系统级图表的端到端识别框架和数据集

Jincheng Lou, Ruohan Xu, Jiapeng Li, Junyin Pi, Runzhe Tao, Weijian Fan, Xiao Tan, Guojie Luo, Yibo Lin

机构 * School of IC, Peking University, Beijing, China(北京大学信息科学技术学院) College of Artificial Intelligence, Xi'an Jiaotong University, Xi'an, China(西安交通大学人工智能学院) Department of Precision Instruments, Tsinghua University, Beijing, China(清华大学精密仪器系) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院) School of Computer Science, Peking University, Beijing, China(北京大学计算机科学系) Institute of EDA, Peking University, Beijing, China(北京大学EDA研究院) Beijing Advanced Innovation Center for IC, Beijing, China(北京集成电路先进创新中心)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出DiagramNet数据集和训练框架,通过端到端方法在系统级图表识别中超越现有模型,提升多模态大语言模型的图表理解能力。

Comments 13 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27507 2026-04-28 cs.CV 70%

Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM

Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型

Haifeng Huang, Yilun Chen, Zehan Wang, Jiangmiao Pang, Zhou Zhao

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17687 2026-04-28 cs.CR cs.AI 70%

CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks

CrossGuard: 保护大规模多模态语言模型免受联合模态隐式恶意攻击

Xu Zhang, Hao Li, Zhichao Lu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Computer Science & Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出CrossGuard,一种意图感知的防护系统,通过生成隐式样本和实验验证,有效防御显式和隐式攻击,提升大规模多模态语言模型的安全性与实用性。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16915 2026-04-27 cs.CV 70%

KIRA: Knowledge-Intensive Image Retrieval and Reasoning Architecture for Specialized Visual Domains

KIRA:面向专业视觉领域的知识密集型图像检索与推理架构

Parthaw Goswami, Jaynto Goswami Deep

机构 * University of Missouri(密苏里大学) SAP Prague(SAP 布拉格)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 KIRA提出一种五阶段框架,解决视觉RAG中的核心问题,包括多粒度知识库构建、领域自适应对比编码、双路径跨模态检索、多跳视觉推理及证据条件生成,通过四个专业领域实验验证其有效性。

Journal ref CVPR 2026 2nd Workshop on Knowledge-Intensive Multimodal Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20319 2026-04-23 cs.CV 70%

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark

SurgCoT:通过链式推理基准提升手术视频中的时空推理

Gui Wang, YongSong Zhou, Kaijun Deng, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen

机构 * School of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) University of Nottingham(诺丁汉大学) School of AI, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 SurgCoT通过统一的链式推理框架评估多模态大语言模型在7个外科领域35种手术中的时空推理能力,揭示了商业模型在手术推理中的优势及现有模型的不足。

Comments Accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19567 2026-04-22 cs.AI 70%

Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

基于LLM的多模态推理用于视觉语义算术

Chuou Xu, Liya Ji, Qifeng Chen

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract_cn);分类 cs.AI

AI总结 本文提出两种新型任务和IRPD数据集,通过SAri-RFT方法提升大视觉语言模型的跨模态关系推理能力,实现视觉语义算术的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07966 2026-04-22 cs.CV cs.CL 70%

Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images

视觉-表格问答:面向表格图像推理的开放领域基准

Boammani Aser Lompo, Marc Haraoui

机构 * École de Technologie Supérieure(埃克塞技术学院)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出Visual-TableQA,一个大规模开放领域多模态数据集,用于评估和提升视觉推理能力,包含2500个LaTeX渲染表格和6000对推理密集型问答对,通过多模型协作生成,验证了模型在外部基准上的鲁棒性。

Comments Accepted at the First Workshop on Foundations of Reasoning in Language Models, NeurIPS 2025. Available at: https://openreview.net/forum?id=fvJRsGwhPf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17052 2026-04-21 cs.CV 70%

OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning

OASIS:按需分层事件记忆用于流媒体视频推理

Zhijia Liang, Jiaming Li, Weikai Chen, Yanhao Zhang, Haonan Lu, Guanbin Li

机构 * Sun Yat-sen University(中山大学) OPPO AI Center(OPPO人工智能中心) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 OASIS通过结构化按需检索解决流媒体视频推理中记忆检索的挑战,提升长周期准确性和组合推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20409 2026-04-21 cs.CL cs.AI cs.CY 70%

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments Under review; 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-04-20 cs.AI 70%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14041 2026-04-17 cs.CV 70%

Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios

寻找并解决:用于日常场景中视觉线索驱动推理的MLLMs基准测试

Xiaomin Li, Tala Wang, Zichen Zhong, Ying Zhang, Zirui Zheng, Takashi Isobe, Dezhuang Li, Huchuan Lu, You He, Xu Jia

机构 * Dalian University of Technology(大连理工大学) WeChat, Tencent Inc.(微信,腾讯公司) Tsinghua University(清华大学)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出DailyClue基准测试,旨在评估MLLMs在日常场景中通过视觉线索进行推理的能力,强调真实日常活动和挑战性查询设计,推动模型深入理解与推理。

Comments Accepted by ACL Findings 2026. Project page: https://xiaominli1020.github.io/DailyClue/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12358 2026-04-16 cs.CV 70%

Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding

为何及何时视觉标记修剪失效?对多模态大语言模型解码中相关视觉信息转移的研究

Jiwan Kim, Kibum Kim, Wonjoong Kim, Byung-Kwan Lee, Chanyoung Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) NVIDIA

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文研究了视觉标记修剪在复杂视觉推理任务中的失效原因,提出解码阶段感知标记修剪方法,有效缓解了修剪方法在复杂推理任务中的性能下降。

Comments Preprint, Project : https://ptkjw1997.github.io/DSTP-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01410 2026-04-16 cs.AI 70%

GraphScout: Empowering Large Language Models with Intrinsic Exploration Ability for Agentic Graph Reasoning

GraphScout: 通过内在探索能力增强大语言模型以实现代理图推理

Yuchen Ying, Weiqi Jiang, Tongya Zheng, Yu Wang, Shunyu Liu, Kaixuan Chen, Mingli Song

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 GraphScout通过灵活的图探索工具,使模型自主生成结构化训练数据,从而在无需人工标注的情况下提升大语言模型的图推理能力,实验显示其在多个领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13074 2026-04-16 cs.CL cs.CV 70%

PersonaVLM: Long-Term Personalized Multimodal LLMs

PersonaVLM:长期个性化多模态大语言模型

Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan

机构 * Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。

Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12966 2026-04-15 cs.CV 70%

Boosting Visual Instruction Tuning with Self-Supervised Guidance

通过自监督指导提升视觉指令微调

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris

机构 * Sorbonne Universite, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎75005) Institut universitaire de France (IUF)(法国国家科学院(IUF))

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种轻量方法,通过加入少量视觉基础自监督任务提升MLLMs的视觉推理能力,无需人工标注或架构修改,有效提升视觉中心评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02387 2026-04-14 cs.AI 70%

VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments

VS-Bench:评估多智能体环境中视觉语言模型的战略能力

Zelai Xu, Zhexuan Xu, Xiangmin Yi, Huining Yuan, Mo Guang, Kaiwen Long, Xinlei Chen, Yi Wu, Chao Yu, Yu Wang

机构 * EE, Tsinghua University(清华大学电子工程系) SIGS, Tsinghua University(清华大学深圳国际研究生院) Li Auto Inc.(理想汽车) IIIS, Tsinghua University(清华大学交叉信息研究院)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.AI

AI总结 VS-Bench是首个评估多智能体环境中视觉语言模型战略能力的多模态基准,涵盖合作、竞争和混合动机交互,通过感知、推理和决策三个维度评估15种领先模型,揭示当前模型在推理和决策上的显著差距。

Comments Published at CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10436 2026-04-14 cs.CV 70%

SignReasoner: Compositional Reasoning for Complex Traffic Sign Understanding via Functional Structure Units

SignReasoner:通过功能结构单元实现复杂交通标志理解的组合推理

Ruibin Wang, Zhenyu Lin, Xinhai Zhao

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出SignReasoner,通过功能结构单元实现复杂交通标志的组合推理,提升自动驾驶安全。核心方法是功能结构单元,通过分解标志为基本功能块,增强模型对未知配置的泛化能力。

Comments CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09167 2026-04-13 cs.CV cs.MA 70%

MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding

MAG-3D:多智能体基础推理用于3D理解

Henry Zheng, Chenyue Fang, Rui Huang, Siyuan Wei, Xiao Liu, Gao Huang

机构 * Tsinghua University(清华大学) Pico, ByteDance(字节跳动Pico)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出MAG-3D,一种无需训练的多智能体框架,通过动态协调专家代理实现灵活的3D基础推理,解决复杂场景中的空间和几何关系推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07774 2026-04-10 cs.RO cs.CV 70%

RoboAgent: Chaining Basic Capabilities for Embodied Task Planning

RoboAgent: 通过基本能力串联实现具身任务规划

Peiran Xu, Jiaqi Zheng, Yadong Mu

机构 * Peking University(北京大学) XYZ Embodied AI(XYZ具身智能)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出RoboAgent,通过串联基本能力实现具身任务规划,利用单个VLM构建能力驱动的规划框架,结合多阶段训练方法提升规划效果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07430 2026-04-10 cs.CV 70%

HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents

HY-Embodied-0.5:面向现实世界代理的具身基础模型

Tencent Robotics X, HY Vision Team, :, Xumin Yu, Zuyan Liu, Ziyi Wang, He Zhang, Yongming Rao, Fangfu Liu, Yani Zhang, Ruowen Zhao, Oran Wang, Yves Liang, Haitao Lin, Minghui Wang, Yubo Dong, Kevin Cheng, Bolin Ni, Rui Huang, Han Hu, Zhengyou Zhang, Linus, Shunyu Yao

机构 * Tencent Robotics X(腾讯机器人X实验室) HY Vision Team(HY视觉团队)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出HY-Embodied-0.5,旨在提升现实世界代理的具身智能能力,通过混合Transformer架构和迭代自演化训练方法,实现高效和强大的模型变体,验证了其在多个基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06777 2026-04-09 cs.CV 70%

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization

行走与言说:通过多模态代理策略优化弥合图像推理与行动之间的差距

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuchen Zhou, Xiaobo Xia, Yuanyu Wan, Lijun Zhang, Tat-Seng Chua

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) AI Business, Alibaba Group(阿里巴巴集团智能计算研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, China(上海交通大学自动化与智能感知学院) School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能工程学院(深圳)) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) School of Software Technology, Zhejiang University, China(浙江大学软件学院) School of Computing, National University of Singapore, Singapore, Singapore(新加坡国立大学计算机学院)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MAPO方法,通过强制生成视觉内容的显式文本描述,结合语义对齐与任务奖励,提升多模态推理能力,实验表明其在多个视觉推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06685 2026-04-09 cs.CL cs.AI 70%

ChemVLR: Prioritizing Reasoning in Perception for Chemical Vision-Language Understanding

ChemVLR:在化学视觉语言理解中优先考虑推理

Xuanle Zhao, Xinyuan Cai, Xiang Cheng, Xiuyi Chen, Bo Xu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 ChemVLR通过细化化学描述符识别,提升化学视觉语言模型的推理能力,实现更清晰的推理路径,实验显示其在分子和反应任务中达到SOTA性能。

Comments Accepted by ACL 2026 Findings, Preprint Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06347 2026-04-09 cs.CV 70%

Evidence-Based Actor-Verifier Reasoning for Echocardiographic Agents

基于证据的Actor-验证者推理用于超声波代理

Peng Huang, Yiming Wang, Yineng Chen, Liangqiao Gui, Hui Guo, Bo Peng, Shu Hu, Xi Wu, Tsao Connie, Hongtu Zhu, Balakrishnan Prabhakaran, Xin Wang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Southwest Jiaotong University(西南交通大学) Purdue University(普渡大学) Chengdu University of Information Technology(成都信息工程大学) Harvard Medical School(哈佛医学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉推理 :VLM(abstract);visual language model(abstract);分类 cs.CV

AI总结 本文提出EchoTrust框架,通过结构化中间表示和不同角色分析,提升超声波临床决策支持系统中推理的可靠性与可解释性。

Comments cvprw 2026(AIMS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02676 2026-04-09 cs.CV 70%

AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process

AdaptMMBench: 多模态适应推理的基准测试用于模式选择和推理过程

Xintong Zhang, Xiaowen Zhang, Jingrong Wu, Zhi Gao, Shilin Yan, Zhenxin Diao, Kunpeng Gao, Xuanyan Chen, Yuwei Wu, Yunde Jia, Qing Li

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出AdaptMMBench,通过五类领域评估多模态适应推理,利用MCC指标评估模式选择合理性,揭示适应模式选择与最终准确率的脱钩现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18100 2026-04-09 cs.CV 70%

Spatial-Conditioned Reasoning in Long-Egocentric Videos

长时自体视频中的空间条件推理

James Tribble, Hao Wang, Si-En Hong, Chaoyi Zhou, Ashish Bastola, Siyu Huang, Abolfazl Razi

机构 * Clemson University(克莱姆森大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文研究了在不修改模型架构的情况下,显式空间信号如何影响基于VLM的视频理解,通过引入Sanpo-D数据集和评估多个VLM在导航导向的空间查询上的表现,发现深度感知和空间化表示能提升安全关键任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04564 2026-04-07 cs.RO cs.CV 70%

Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs

基于视觉提示的越野制图推理使用多模态大语言模型

Abdelmoamen Nasser, Yousef Baba'a, Murad Mebrahtu, Nadya Abdel Madjid, Jorge Dias, Majid Khonji

机构 * Khalifa University(哈利法大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种零样本方法,利用SAM2进行环境分割和多模态大语言模型(VLM)进行可行驶区域推理,通过整合分割图像和原始图像实现越野制图推理,无需专门地形模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03660 2026-04-07 cs.AI 70%

TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables

TableVision:一种大规模基准,用于复杂分层表格上的空间感知推理

Xiaoyu Chen, Lu Dai, Hanqing Wang, Zhuoyu Li, Wenbin Dai, Yanzong Zheng, Zhenggang Xia, Junyong Lin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出TableVision基准,通过量化分析发现复杂表格推理中的感知瓶颈,引入轨迹感知的分层任务分类,结合确定性接地流程生成6799条高保真推理轨迹,提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01681 2026-04-03 cs.RO cs.AI 70%

Bridging Large-Model Reasoning and Real-Time Control via Agentic Fast-Slow Planning

通过代理快慢规划弥合大模型推理与实时控制

Jiayi Chen, Shuai Wang, Guangxu Zhu, Chengzhong Xu

机构 * Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong (Shenzhen)(深圳市大数据研究院,香港中文大学(深圳)) Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究院) State Key Laboratory of Internet of Things for Smart City (SKL-IOTSC), University of Macau(澳门大学智慧城市物联网国家重点实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出一种分层框架,通过感知-决策-轨迹-控制的分离,提升自动驾驶系统在扰动下的鲁棒性,减少侧向偏移和完成时间。

Comments 8 pages, 12figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01181 2026-04-02 cs.HC cs.CL cs.CV 70%

True (VIS) Lies: Analyzing How Generative AI Recognizes Intentionality, Rhetoric, and Misleadingness in Visualization Lies

真正的(视觉)谎言:分析生成式AI如何识别意图性、修辞和误导性在可视化谎言中

Graziano Blasilli, Marco Angelini

机构 * Sapienza University of Rome(罗马大学) Link Campus University(Link Campus大学)

专题命中 视觉推理 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文研究多模态大语言模型识别和解释误导性可视化的能力,并通过2336条新冠相关推文数据集分析其识别原因和潜在意图性,评估16种前沿模型并对比人类专家行为。

详情

展开后加载摘要…

URL PDF HTML 收藏