arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3111 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3111 篇

2604.22560 2026-04-27 cs.CV cs.AI 87%

Cross-Stage Coherence in Hierarchical Driving VQA: Explicit Baselines and Learned Gated Context Projectors

层次驾驶视觉问答中的跨阶段一致性:显式基线与学习门控上下文投影

Gautam Kumar Jain, Carsten Markgraf, Julian Stähler

机构 * Technische Hochschule Augsburg(亚琛工业大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);visual question answering(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文研究了驾驶场景中跨阶段上下文传递的两种方法,显式基线通过无额外训练的4B VLM减少矛盾,隐式基线通过门控投影提升规划阶段语义一致性,两者共同探讨了领域适应在全谱改进中的潜力。

Comments 16 pages, 8 figures, 8 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00869 2026-06-24 cs.CL 版本更新 87%

What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning

视觉-语言模型缺少什么?探究它们在因果顺序推理中的困难

Zhaotian Weng, Haoxuan Li, Xin Eric Wang, Kuan-Hao Huang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Texas A&M University(德克萨斯A&M大学)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(summary_cn,abstract_cn)

AI总结 针对VLM在因果推理中的不足,提出VQA-Causal和VCR-Causal基准,发现模型在因果任务上仅略优于随机猜测,归因于训练数据缺乏因果表达,并通过难负例微调改善。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03191 2026-05-26 cs.CV cs.AI cs.LG 87%

AnatomiX, an Anatomy-Aware Grounded Multimodal Large Language Model for Chest X-Ray Interpretation

AnatomiX:一种解剖学感知的胸部X光解读多模态大语言模型

Anees Ur Rehman Hashmi, Numan Saeed, Christoph Lippert

机构 * Hasso Plattner Institute(霍普夫纳研究所) MBZUAI(穆萨大学人工智能研究所)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出AnatomiX,一种两阶段解剖学感知多模态大语言模型,通过先识别解剖结构再执行下游任务,在解剖定位、短语定位、定位诊断和定位描述任务上相比现有方法提升超过25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03794 2026-03-24 cs.CV cs.AI cs.CL cs.LG 87%

AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition

AdaptVision: 通过自适应视觉获取实现高效的视觉-语言模型

Zichuan Lin, Yicheng Liu, Yang Yang, Lvfang Tao, Deheng Ye

机构 * Tencent Hunyuan(腾讯文言)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 AdaptVision通过自适应视觉获取机制,结合强化学习与工具学习,提升视觉-语言模型在视觉问答任务中的效率与准确性。

Comments Accepted by CVPR 2026. Code and models are available at https://github.com/AdaptVision/AdaptVision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13756 2026-03-11 cs.CV cs.AI cs.LG 87%

RECODE: Reasoning Through Code Generation for Visual Question Answering

RECODE: 通过代码生成进行视觉问答的推理

Junhong Shen, Mu Cai, Bo Hu, Ameet Talwalkar, David A Ross, Cordelia Schmid, Alireza Fathi

专题命中 视觉问答 :visual question answering(title);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 RECODE通过代码生成实现视觉问答的可验证推理,优于传统方法。

Comments The authors are withdrawing this manuscript temporarily to conduct additional checks of the experimental setup and implementation. We plan to post an updated version after completing these checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 87%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 视觉问答 :vision-language model(title,abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13157 2026-02-17 eess.SP 87%

Seeing Radio: From Zero RF Priors to Explainable Modulation Recognition with Vision Language Models

看见无线电:从零RF先验到可解释的调制识别与视觉语言模型

Hang Zou, Bohao Wang, Yu Tian, Lina Bariah, Chongwen Huang, Samson Lasaulce, Mérouane Debbah

专题命中 视觉问答 :vision language model(title);vision-language model(abstract);VLM(abstract);visual question answering(abstract)

AI总结 本文提出利用视觉语言模型直接感知无线电波信号并推断调制模式,通过转换IQ流为图像数据,提升模型准确性至90%,并实现可解释的调制识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01062 2026-01-06 cs.LG cs.AI cs.CV 87%

SPoRC-VIST: A Benchmark for Evaluating Generative Natural Narrative in Vision-Language Models

SPoRC-VIST:评估视觉语言模型生成自然叙述能力的基准

Yunlin Zeng

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 SPoRC-VIST基准通过合成到现实训练策略评估视觉语言模型生成多说话者播客对话的自然性和深度。

Comments 14 pages, 3 figures. Accepted to WVAQ 2026, WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16680 2025-09-23 cs.CV cs.AI cs.LG 87%

ProtoVQA: An Adaptable Prototypical Framework for Explainable Fine-Grained Visual Question Answering

Xingjian Diao, Weiyi Wu, Keyi Kong, Peijun Qing, Xinwen Xu, Ming Cheng, Soroush Vosoughi, Jiang Gui

机构 * Dartmouth College(达特茅斯学院) Shandong University(山东大学) Harvard University(哈佛大学)

专题命中 视觉问答 :visual question answering(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18023 2025-07-22 cs.CL 87%

DARE: Diverse Visual Question Answering with Robustness Evaluation

Hannah Sterz, Jonas Pfeiffer, Ivan Vulić

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Google DeepMind(谷歌DeepMind)

专题命中 视觉问答 :visual question answering(title,abstract);vision language model(abstract);VLM(abstract);LLaVA(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22946 2025-05-30 cs.CL cs.AI cs.CV cs.CY cs.LG 87%

NegVQA: Can Vision Language Models Understand Negation?

Yuhui Zhang, Yuchang Su, Yiming Liu, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published at ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03225 2025-04-10 cs.CV cs.AI cs.CL cs.CY cs.LG 87%

Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation

Yuhui Zhang, Yuchang Su, Yiming Liu, Xiaohan Wang, James Burgess, Elaine Sui, Chenyu Wang, Josiah Aklilu, Alejandro Lozano, Anjiang Wei, Ludwig Schmidt, Serena Yeung-Levy

专题命中 视觉问答 :vision language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05967 2024-11-05 cs.CV cs.AI cs.CL cs.LG 87%

CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark

David Romero, Chenyang Lyu, Haryo Akbarianto Wibowo, Teresa Lynn, Injy Hamed, Aditya Nanda Kishore, Aishik Mandal, Alina Dragonetti, Artem Abzaliev, Atnafu Lambebo Tonja, Bontu Fufa Balcha, Chenxi Whitehouse, Christian Salamea, Dan John Velasco, David Ifeoluwa Adelani, David Le Meur, Emilio Villa-Cueva, Fajri Koto, Fauzan Farooqui, Frederico Belcavello, Ganzorig Batnasan, Gisela Vallejo, Grainne Caulfield, Guido Ivetta, Haiyue Song, Henok Biadglign Ademtew, Hernán Maina, Holy Lovenia, Israel Abebe Azime, Jan Christian Blaise Cruz, Jay Gala, Jiahui Geng, Jesus-German Ortiz-Barajas, Jinheon Baek, Jocelyn Dunstan, Laura Alonso Alemany, Kumaranage Ravindu Yasas Nagasinghe, Luciana Benotti, Luis Fernando D'Haro, Marcelo Viridiano, Marcos Estecha-Garitagoitia, Maria Camila Buitrago Cabrera, Mario Rodríguez-Cantelar, Mélanie Jouitteau, Mihail Mihaylov, Mohamed Fazli Mohamed Imam, Muhammad Farid Adilazuarda, Munkhjargal Gochoo, Munkh-Erdene Otgonbold, Naome Etori, Olivier Niyomugisha, Paula Mónica Silva, Pranjal Chitale, Raj Dabre, Rendi Chevi, Ruochen Zhang, Ryandito Diandaru, Samuel Cahyawijaya, Santiago Góngora, Soyeong Jeong, Sukannya Purkayastha, Tatsuki Kuribayashi, Teresa Clifford, Thanmay Jayakumar, Tiago Timponi Torrent, Toqeer Ehsan, Vladimir Araujo, Yova Kementchedjhieva, Zara Burzo, Zheng Wei Lim, Zheng Xin Yong, Oana Ignat, Joan Nwatu, Rada Mihalcea, Thamar Solorio, Alham Fikri Aji

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00876 2024-05-03 cs.CV cs.AI cs.LG 87%

Beyond Human Vision: The Role of Large Vision Language Models in Microscope Image Analysis

Prateek Verma, Minh-Hao Van, Xintao Wu

专题命中 视觉问答 :vision language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08241 2023-06-01 cs.LG cs.AI cs.CL cs.CV cs.HC 87%

ILLUME: Rationalizing Vision-Language Models through Human Interactions

Manuel Brack, Patrick Schramowski, Björn Deiseroth, Kristian Kersting

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Proceedings of the 40th International Conference on Machine Learning (ICML), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.11253 2022-08-25 cs.CV cs.AI cs.CL cs.LG 87%

FashionVQA: A Domain-Specific Visual Question Answering System

Min Wang, Ata Mahjoubfar, Anupama Joshi

专题命中 视觉问答 :visual question answering(title,abstract);VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14554 2024-08-21 cs.CV cs.AI 87%

SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge

Chuanhao Li, Zhen Li, Chenchen Jing, Shuo Liu, Wenqi Shao, Yuwei Wu, Ping Luo, Yu Qiao, Kaipeng Zhang

专题命中 视觉问答 :vision-language model(title,abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

Comments 13 pages, 6 figures, a plug-and-play framework to augment large vision-language models with up-to-date internet knowledge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06959 2026-08-10 cs.CV 新提交 86%

Summarize First, Download Later: Onboard VLMs for Bandwidth-Efficient Earth Observation

先总结,后下载:面向带宽高效的地球观测的机载视觉语言模型

Junghwan Park, Sangcheol Sim, Woojin Cho, Darongsae Kwon

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 针对地球观测卫星下行链路带宽瓶颈,提出“先总结,后下载”范式,通过机载VLM生成摘要、地面VQA验证后按需下载全分辨率图像,可降带宽消耗并加速时间敏感任务的洞察时间。

Comments IGARSS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27122 2026-07-30 cs.CV 新提交 86%

Towards Grounded GI Endoscopy VQA via Multi-Task Learning on Small VLMs

基于小型视觉语言模型多任务学习的 grounded 胃肠道内窥镜视觉问答研究

Itbaan Safwan, Ramail Khan, Muhammad Annas Shaikh, Muhammad Atif Tahir

机构 * Institute of Business and Administration(商业管理学院)

专题命中 视觉问答 :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract)

AI总结 该研究针对胃肠道内窥镜视觉问答任务,提出多任务微调方案,利用现有数据集构建辅助任务,微调小型视觉语言模型,实现了准确率提升与答案-图像区域对齐优化。

Comments Accepted at EMA4MICCAI 2026 (Workshop on Efficient Medical AI, MICCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04149 2026-07-07 cs.CV 新提交 86%

Beyond Scene Priors: Fine-Grained Traffic Scene Reasoning with Benchmarking and Query-Guided Small-Object Focus

超越场景先验:通过基准测试和查询引导的小目标聚焦进行细粒度交通场景推理

Waikit Xiu, Qiang Lu, Zian Wang, Xinjie Yang, Zhiwei Chen, Chen Sun, Xiying Li

机构 * The University of Hong Kong(香港大学) Sun Yat-Sen University(中山大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对安全关键交通场景中复杂问题,提出细粒度交通推理基准FGTR - Bench和文本引导小目标推理MLLM(TSR - MLLM),解决视觉语言对齐中关键小目标被忽视问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23881 2026-06-24 cs.CL cs.CV cs.IR 新提交 86%

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

先定位再排序:基于知识的视觉问答中无训练实体识别的再探讨

Qian Ma, Qiong Wu, Zhengyi Zhou, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

专题命中 视觉问答 :MLLM(summary_cn,abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 针对知识型视觉问答中实体与证据双重定位瓶颈,提出解耦实体识别与段落排序的无训练IBA框架,利用MLLM候选名称选择与文本重排序器,在降低复杂度同时提升性能。

Comments Accepted by ACL 2026 Findings. Project page https://github.com/VAN-QIAN/ACL26-IBA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19646 2026-06-19 cs.IR cs.CV 新提交 86%

SAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering

SAFE-Cascade: 面向图表问答的成本自适应视觉语言路由

Ayush Dwivedi, Qixin Wang, Ashvi Soni, Ruoteng Wang, Han Li, Animesh Mahapatra, Neeraj Agrawal, Xintao Wu

机构 * University of Arkansas(亚拉巴马大学)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出SAFE-Cascade系统,通过OCR和轻量语言模型先给出答案,再由学习路由器决定是否调用VLM,在ChartQA上以73.1%的VLM调用率达到69.1%准确率,减少26.9%的VLM调用和9.3%的成本。

Comments Demo paper submitted at CIKM 2026. 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11632 2026-05-28 cs.CV 86%

KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering

KG-ViP:在多模态大语言模型中桥接知识基础与视觉感知以进行视觉问答

Zhiyang Li, Ao Ke, Yukun Cao, Xike Xie

机构 * University of Science and Technology of China(中国科学技术大学) Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,中国科学技术大学) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(title);分类 cs.CV

AI总结 提出KG-ViP框架,通过检索与融合场景图和常识图,统一外部知识与细粒度视觉细节,缓解多模态大语言模型在视觉问答中的知识幻觉和视觉感知不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24492 2026-05-26 cs.CV 86%

Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs

Med-R2: 面向医学视觉语言模型中基于证据推理的对抗性基准

Wen Ma, Fucheng Niu, Zhiting Fan, Zikai Xiao, Jiaxiang Liu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学技术研究院)

专题命中 视觉问答 :VLM(summary_cn,abstract_cn);vision-language model(abstract);visual question answering(abstract);grounding(abstract)

AI总结 提出 Med-R2 Bench,一个分层对抗性基准,通过逐步QA任务和对抗扰动评估医学VLM在临床工作流中的视觉证据推理鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03157 2026-04-06 cs.AI 86%

Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models

Chart-RL: 通过强化学习优化策略以提升基于视觉语言模型的图表问答中的视觉推理

Yunfei Bai, Amit Dhanda, Shekhar Jain

机构 * Amazon(亚马逊)

专题命中 视觉问答 :vision language model(title,abstract);visual reasoning(title);分类 cs.AI

AI总结 本文提出Chart-RL框架,通过反馈驱动的策略优化提升视觉语言模型在复杂数据可视化中的推理能力,实现更高的准确率和更高效的推理速度。

Comments In Proceedings of the 32nd ACM-SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02182 2025-11-05 cs.CV 86%

Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimodal Large Language Models

Jinhwan Seo, Yoonki Cho, Junhyug Noh, Sung-eui Yoon

机构 * KAIST(韩国科学技术院) Ewha Womans University(成均馆大学)

专题命中 视觉问答 :grounding(title,abstract);multimodal large language model(title);分类 cs.CV

Comments 1st place winner of Grounded Videoqa track at the ICCV2025 Perception Test

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10193 2024-04-17 cs.CV 86%

Consistency and Uncertainty: Identifying Unreliable Responses From Black-Box Vision-Language Models for Selective Visual Question Answering

Zaid Khan, Yun Fu

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(title);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02830 2026-08-05 cs.CV cs.AI 新提交 86%

In-Context Collapse in Vision-Language Models and How to Mitigate it?

视觉语言模型中的上下文坍缩及其缓解方法

Mohammad Rostami

机构 * Amazon Generative AI Innovation Center(亚马逊生成式AI创新中心)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文发现视觉语言模型存在随演示增多的上下文坍缩问题,通过因果定位将其归因于视觉-语言整合通路,提出CircA干预方法可有效缓解该问题并实现抗坍缩能力迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25479 2026-07-29 cs.CR cs.AI cs.LG 新提交 86%

Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering

通过表示引导在视觉语言模型供应链中植入架构后门

Maria Rosaria Briglia, Igor Maljkovic, Antonio Emanuele Cinà, Luca Oneto, Iacopo Masi, Fabio Roli

专题命中 视觉问答 :vision-language model(title);VLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型供应链安全问题,提出通过表示引导植入架构后门的攻击方法,该方法不影响训练数据等,通过触发控制模型表示转向攻击者目标,评估表明其损害模型多项性能,还提出审计防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11798 2026-07-14 cs.CV cs.AI 新提交 86%

StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description

StoryTeller:用于长格式音频描述的免训练叙事接地

Seung Hyun Hahm, Minh T. Dinh, SouYoung Jin

机构 * Dartmouth College(达特茅斯学院)

专题命中 视觉问答 :grounding(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究针对长格式音频描述问题,提出免训练的StoryTeller框架。它通过维护叙事记忆跨场景传递信息,仅用原始视频和标题,经语义过滤等确保信息准确。引入StoryAD-QA基准测试,实验证明该框架显著提升了叙事相关能力。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏