arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26071 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2602.22455 2026-05-14 cs.CV 57%

Exploring Multimodal LMMs for Online Episodic Memory Question Answering on the Edge

探索多模态大语言模型用于边缘端在线事件记忆问答

Giuseppe Lando, Rosario Forte, Antonino Furnari

机构 * Department of Mathematics and Computer Science, University of Catania, Italy(数学与计算机科学系,卡塔尼亚大学,意大利)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文研究多模态大语言模型在边缘端实时在线事件记忆问答中的可行性,通过双线程架构实现视频转文本记忆与问答推理,实验显示边缘端方案在隐私保护方面具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06371 2026-05-13 cs.CL cs.AI 57%

OASIS: A Multilingual and Multimodal Dataset for Culturally Grounded Spoken Visual QA

OASIS:一个多语言多模态数据集用于文化导向的语音视觉问答

Firoj Alam, Ali Ezzat Shahroor, Md. Arid Hasan, Zien Sheikh Ali, Hunzalah Hassan Bhatti, Mohamed Bayan Kmainasi, Shammur Absar Chowdhury, Basel Mousi, Fahim Dalvi, Nadir Durrani, Natasa Milic-Frayling

机构 * Qatar Computing Research Institute(卡塔尔计算研究 institute)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 OASIS是一个多语言多模态数据集,涵盖图像、文本和语音,旨在评估模型在现实场景中的文化导向推理能力,包含0.92M真实图像和14.8M问答对。

Comments Multimodal Foundation Models, Large Language Models, Native, Multilingual, Language Diversity, Contextual Understanding, Culturally Informed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10791 2026-05-12 cs.AI 57%

PathISE: Learning Informative Path Supervision for Knowledge Graph Question Answering

PathISE: 通过信息路径监督学习知识图谱问答

Shengxiang Gao, Chao Lei, Jey Han Lau, Jianzhong Qi

机构 * The University of Melbourne(墨尔本大学)

专题命中 视觉问答 :grounding(abstract_cn);分类 cs.AI

AI总结 PathISE通过学习高质量的中间监督信号提升知识图谱问答性能,利用轻量级Transformer估计关系路径信息,生成可复用的监督信号以增强现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10761 2026-05-12 cs.CV 57%

RadThinking: A Dataset for Longitudinal Clinical Reasoning in Radiology

RadThinking:放射学中纵向临床推理的数据集

Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou, Jakob Wasserthal, Alan L. Yuille, Zongwei Zhou

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Clinic of Radiology and Nuclear Medicine, University Hospital Basel(巴塞尔大学医院放射科与核医学科) Department of Oncology, Johns Hopkins School of Medicine(约翰霍普金斯医学院肿瘤科)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 RadThinking数据集通过三个难度层级的VQA任务,提供放射学纵向临床推理的训练和评估框架,支持多步骤推理和临床指南标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16025 2026-05-12 cs.CV cs.MM eess.IV 57%

Context and Pixel Aware Large Language Model for Video Quality Assessment

基于上下文和像素的大型语言模型用于视频质量评估

Wen Wen, Yaohong Wu, Yue Sheng, Neil Birkbeck, Balu Adsumilli, Yilin Wang

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出CP-LLM,通过双视觉编码器和语言解码器同时生成视频质量评分和可解释描述,提升对像素失真敏感度,实验显示其在视频质量评估基准上表现优异。

Comments Accepted to ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09209 2026-05-11 cs.CV 57%

Surgical Visual Understanding (SurgVU) Dataset

外科视觉理解(SurgVU)数据集

Aneeq Zia, Max Berniker, Rogerio Nespolo, Xiaorui Zhang, Conor Perreault, Ziheng Wang, Benjamin Mueller, Ryan Schmidt, Kiran Bhattacharyya, Xi Liu, Anthony Jarc

机构 * Intuitive Surgical

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文介绍了用于外科数据科学的基础研究的大型外科视频数据集,包含视频及标注,展示了数据收集方法和独特属性,并提出了多个示例问题,旨在推动机器学习领域在手术数据科学中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06201 2026-05-08 cs.AI 57%

Towards Annotation-Free Validation of MLLMs: A Vision-Language Logical Consistency Metric

迈向无标注验证的MLLMs:一种视觉-语言逻辑一致性度量

Ying Gu, Mei Chee Leong, Hui Li Tan, Shangbo Mao, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I 2 R), Agency for Science, Technology and Research (A*STAR), Singapore(信息通信研究所(I2R),科技研究局(A*STAR),新加坡)

专题命中 视觉问答 :MLLM(abstract);分类 cs.AI

AI总结 本文提出一种无需标注的视觉-语言逻辑一致性度量,用于评估大语言模型在因果关系上的逻辑一致性,发现尽管准确率提升,但逻辑一致性仍显著滞后。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22285 2026-05-04 cs.CV 57%

VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding

VideoDetective:通过外在查询和内在相关性进行长视频理解的线索搜索

Ruoliu Yang, Chu Wu, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出VideoDetective框架,通过结合查询与片段的相关性及片段间亲和力,有效定位长视频问答中的关键片段,提升多模态大语言模型在长视频理解中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25313 2026-04-30 cs.CL cs.AI 57%

Faithfulness-QA: A Counterfactual Entity Substitution Dataset for Training Context-Faithful RAG Models

忠实性问答:一个用于训练上下文忠实RAG模型的反事实实体替换数据集

Li Ju, Junzhe Wang, Qi Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出Faithfulness-QA数据集,通过反事实实体替换生成可控的知识冲突,旨在训练上下文忠实的RAG模型并评估其上下文接地行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13606 2026-04-30 cs.CV 57%

ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch

ChartVerse: 通过从零开始可靠程序合成实现图表推理的扩展

Zheng Liu, Honglin Lin, Chonghan Qin, Xiaoyang Wang, Xin Gao, Yu Li, Mengzhang Cai, Yun Zhu, Zhanping Zhong, Qizhi Pei, Zhuoshi Pan, Xiaoran Shang, Bin Cui, Conghui He, Wentao Zhang, Lijun Wu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京市软件与硬件协同人工智能系统重点实验室)

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

AI总结 ChartVerse通过从零开始生成复杂图表和可靠推理数据,解决开放源模型开发中高质量训练数据缺乏的问题,采用RPE量化图表复杂度并生成高复杂度图表,结合truth-anchored inverse QA合成和CoT蒸馏提升推理深度。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23665 2026-04-28 cs.CV 57%

HAC: Parameter-Efficient Hyperbolic Adaptation of CLIP for Zero-Shot VQA

HAC: CLIP在零样本视觉问答中的高效超几何适应

Francesco Dibitonto, Cigdem Beyan, Vittorio Murino

机构 * Department of Computer Science, University of Verona(威尼斯大学计算机科学系) EVS - Embedded Vision Systems Srl(嵌入式视觉系统公司) AI for Good (AIGO), Istituto Italiano di Tecnologia(AI for Good(AIGO),意大利技术研究院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 HAC通过轻量级微调使预训练CLIP模型迁移到超几何空间,用于视觉问答任务,展现出任务无关的适应能力,在多个基准上超越欧几里得基线和先前超几何方法。

Comments This is the preprint version of the paper. The final version has been accepted for publication in the Proceedings of the 28th International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22281 2026-04-27 cs.CV 57%

DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning

DocPrune:通过背景、问题和理解感知的令牌修剪实现高效的文档问答

Joonmyung Choi, Sanghyeok Lee, Jongha Kim, Sehyung Kim, Dohwan Ko, Jihyung Kil, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出DocPrune框架,通过背景、问题和理解感知的令牌修剪提升长文档理解效率,实验显示在M3DocRAG上提升了吞吐量和F1分数。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07940 2026-04-24 cs.CV 57%

Beyond the Frame: Generating 360 Panoramic Videos from Perspective Videos

超越帧限:从视角视频生成360度全景视频

Rundong Luo, Matthew Wallingford, Ali Farhadi, Noah Snavely, Wei-Chiu Ma

机构 * Cornell University(康奈尔大学) University of Washington(华盛顿大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出从视角视频生成完整全景视频的方法,通过设计几何与运动感知操作提升生成质量,实现空间与时间一致性,应用于视频稳定、视角控制和交互式视觉问答。

Comments Project page: https://red-fairy.github.io/argus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03337 2026-04-22 cs.CV 57%

Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration

少即是多:通过自适应帧剪枝和语义图集成实现高效的视频问答

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Yijie Xu, Xuming Hu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)中国) The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学,香港特别行政区,中国)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种结合自适应帧剪枝和轻量级语义图的框架,有效减少视频问答中输入token数量,提升效率并增强基模型性能。

Comments Accepted to CVPR 2026 Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17405 2026-04-21 cs.AI 57%

STRIDE: Strategic Iterative Decision-Making for Retrieval-Augmented Multi-Hop Question Answering

STRIDE: 用于检索增强多跳问答的策略迭代决策

Wei Chen, Lili Zhao, Zhi Zheng, HuiJun Hou, Tong Xu

机构 * University of Science Technology of China \& State Key Laboratory of Cognitive Intelligence Hefei Anhui China Technology of China \& State Key Laboratory of Cognitive Intelligence

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 STRIDE通过分离战略规划、动态控制和 grounded 执行,解决多跳问答中实体早 Commit 和推理依赖缺失的问题,提升推理鲁棒性与准确性。

Comments Accepted by SIGIR 2026 Full Paper. The code repository is available at https://github.com/fanshu6hao/STRIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16979 2026-04-21 cs.CV cs.CL 57%

DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models

DOSE: 通过现成模型进行多模态大语言模型的数据选择

Biao Wu, Yiwu Zhong, Meng Fang, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) Peking University(北京大学) University of Liverpool(利物浦大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出DOSE方法,利用现成预训练模型筛选多模态数据,提升数据质量和对齐性,减少计算成本,增强数据多样性,使模型在标准VQA和数学基准测试中表现优异。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16311 2026-04-21 cs.CL cs.AI cs.SI 57%

Multimodal Claim Extraction for Fact-Checking

多模态声明提取用于事实核查

Joycelyn Teo, Rui Cao, Zhenyun Deng, Zifeng Ding, Michael Sejr Schlichtkrull, Andreas Vlachos

机构 * Defence Science and Technology Agency, Singapore(新加坡国防科学与技术局) University of Cambridge, UK(英国剑桥大学) Queen Mary University of London, UK(英国伦敦大学学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 本文提出首个多模态社交媒体声明提取基准,评估了最先进的多模态大语言模型,在语义对齐、忠实度和去上下文化框架下发现基线模型难以建模修辞意图和上下文线索,引入意图感知框架MICE提升关键意图场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14122 2026-04-21 cs.CV 57%

EgoSound: Benchmarking Sound Understanding in Egocentric Videos

EgoSound:评估egocentric视频中声音理解的基准测试

Bingwen Zhu, Yuqian Fu, Qiaole Dong, Guolei Sun, Tianwen Qian, Yuzheng Wu, Danda Pani Paudel, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) KAUST(卡塔尔大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 EgoSound首次系统评估多模态大语言模型在egocentric视频中的声音理解能力,包含7个任务分类,揭示当前模型在空间和因果理解上的局限。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03611 2026-04-17 cs.CV 57%

PortraitCraft: A Benchmark for Portrait Composition Understanding and Generation

PortraitCraft:面向肖像构图理解与生成的基准测试

Yuyang Sha, Zijie Lou, Youyun Tang, Xiaochao Qu, Zheng Qu, Ben Xia, Haoxiang Li, Ting Liu, Luoqi Liu

机构 * MT Lab, Meitu Inc(美图实验室,美图公司) Airbrush Studio, Meitu Inc(喷雾工作室,美图公司) Meitu Design, Meitu Inc(美图设计,美图公司)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出PortraitCraft基准测试,通过结构化多级监督数据集,实现对肖像构图的理解与生成评估,包含评分预测、细粒度属性推理和生成任务,推动细粒度肖像理解与可控生成研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13979 2026-04-16 cs.CL cs.AI cs.DB 57%

Leveraging LLM-GNN Integration for Open-World Question Answering over Knowledge Graphs

利用LLM-GNN集成进行知识图谱上的开放世界问答

Hussein Abdallah, Ibrahim Abdelaziz, Panos Kalnis, Essam Mansour

机构 * Concordia University(康科迪亚大学) IBM KAUST(科威特大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出GLOW系统,结合预训练GNN和LLM进行开放世界知识图谱问答,通过结构化提示引导LLM推理,提升多跳推理和缺失链接处理能力,在GLOW-BENCH基准上取得显著提升。

Comments 18 pages,6 figures,10 tables. https://aclanthology.org/2026.eacl-long.26/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03963 2026-04-15 cs.CV 57%

TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

TempR1:通过时间感知的多任务强化学习提升多模态大语言模型的时间理解

Tao Wu, Li Yang, Gen Zhan, Yabin Zhang, Yiting Liao, Junlin Li, Deliang Fu, Li Zhang, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Inc.(字节跳动公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 TempR1通过时间感知的多任务强化学习框架,系统增强MLLMs的时间理解能力,通过多任务语料库和改进的GRPO算法实现稳定有效的跨任务优化,提升时间依赖性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12208 2026-04-15 cs.RO cs.AI 57%

Unveiling the Surprising Efficacy of Navigation Understanding in End-to-End Autonomous Driving

揭示端到端自动驾驶中导航理解的惊人效能

Zhihua Hua, Junli Wang, Pengfei LI, Qihao Jin, Bo Zhang, Kehua Sheng, Yilun Chen, Zhongxue Gan, Wenchao Ding

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Didi Chuxing(滴滴出行) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 本文提出SNG框架,通过真实导航模式高效表示全局导航信息,结合导航路径与分步信息,提升自动驾驶的全局与局部规划能力,实现无需辅助损失函数的高精度导航建模。

Comments 8 pages, 6 figures. ICRA 2026. Code available at https://fudan-magic-lab.github.io/SNG-VLA-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17012 2026-04-14 cs.CV 57%

4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation

4D-RGPT:通过感知蒸馏实现区域级4D理解

Chiao-An Yang, Ryo Hachiuma, Sifei Liu, Subhashree Radhakrishnan, Raymond A. Yeh, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * NVIDIA(英伟达)

专题命中 视觉问答 :MLLM(abstract);分类 cs.CV

AI总结 本文提出4D-RGPT和P4D框架,解决3D/4D视频问答中4D感知和时间理解不足的问题,并构建了区域级提示的R4D-Bench基准。

Comments CVPR 2026 (Highlight). Project page: https://www.ca-joe-yang.com/resource/projects/4D_RGPT/. GitHub: https://github.com/NVlabs/4D-RGPT. Dataset: https://huggingface.co/datasets/nvidia/R4D-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09666 2026-04-14 cs.IR cs.AI 57%

Do We Still Need GraphRAG? Benchmarking RAG and GraphRAG for Agentic Search Systems

我们仍然需要GraphRAG吗?对RAG和GraphRAG在代理搜索系统中的基准测试

Dongzhe Fan, Zheyi Xue, Siyuan Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文通过RAGSearch基准测试,评估了代理搜索系统对密集RAG和代表性的GraphRAG方法的影响,发现代理搜索显著提升了密集RAG性能,但在复杂多跳推理中GraphRAG仍具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15578 2026-04-13 cs.CV 57%

AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning

AVATAAR:通过时间自适应对齐和推理实现代理视频回答

Urjitkumar Patel, Fang-Chun Yeh, Chinmay Gondhalekar

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

AI总结 AVATAAR通过结合全局和局部视频上下文,以及预检索思考代理和重思模块,提升长视频问答的准确性和可解释性,实验显示在CinePile基准上显著提升各类问答任务性能。

Comments Accepted in the 5th IEEE Big Data Workshop on Multimodal AI (MMAI 2025), Dec 8-11, Macau, China, 2025 (Preprint Copy)

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05215 2026-04-13 cs.CL cs.LG 57%

BEDTime: A Unified Benchmark for Automatically Describing Time Series

BEDTime:一个统一的基准测试用于自动描述时间序列

Medhasweta Sen, Zachary Gottesman, Jiaxing Qiu, C. Bayan Bruss, Nam Nguyen, Tom Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视觉问答 :vision language model(abstract);分类 cs.LG

AI总结 本文提出BEDTime基准测试,评估模型对时间序列结构属性的描述能力,发现专为时间序列语言设计的模型表现欠佳,而视觉语言模型表现优异,且所有方法在现实鲁棒性测试中均表现脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05350 2026-04-10 cs.CL cs.AI 57%

DQA: Diagnostic Question Answering for IT Support

DQA:面向IT支持的诊断问题解答

Vishaal Kapoor, Mariam Dundua, Sarthak Ahuja, Neda Kordjazi, Evren Yortucboylu, Vaibhavi Padala, Derek Ho, Jennifer Whitted, Rebecca Steinert

机构 * Amazon(亚马逊)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 DQA通过维护持续诊断状态和聚合根本原因,提升企业IT支持中的系统性故障排查效率,其在150个匿名场景中取得78.7%的成功率,优于多轮RAG基线的41.3%。

Comments 7 pages, 2 tables, submitted at ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00912 2026-04-10 cs.CV cs.MM 57%

ProCap: Projection-Aware Captioning for Spatial Augmented Reality

ProCap:面向空间增强现实的投影感知描述生成

Zimo Cao, Yuchen Deng, Haibin Ling, Bingyao Huang

机构 * Southwest University(西南大学) Westlake University(西湖大学)

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV

AI总结 ProCap通过分离物理场景与投影内容,解决空间增强现实中的语义歧义问题,提出RGBP数据集和双描述评估协议,提升SAR的智能交互能力。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06376 2026-04-09 cs.CV 57%

MTA-Agent: An Open Recipe for Multimodal Deep Search Agents

MTA-Agent:多模态深度搜索代理的开放配方

Xiangyu Peng, Can Qin, An Yan, Xinyi Yang, Zeyuan Chen, Ran Xu, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce 人工智能研究院)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MTA-Agent,通过构建高质量多跳视觉-语言训练数据,实现多模态深度搜索代理,其在六个基准测试中达到54.63%的平均准确率,优于其他模型,同时降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04359 2026-04-07 cs.CL cs.AI 57%

GROUNDEDKG-RAG: Grounded Knowledge Graph Index for Long-document Question Answering

基于源文档的知识图谱-RAG:用于长文档问答的 grounded 知识图谱

Tianyi Zhang, Andreas Marfurt

机构 * getAbstract Lucerne University of Applied Sciences and Arts(卢塞恩应用科学与艺术大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出 groundedkg-rag,通过从源文档中显式提取并 grounding 知识图谱,提升长文档问答的效率和事实准确性,实验表明其在成本较低的情况下性能优于现有基线。

Comments To appear in the Proceedings of KG-LLM @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏