arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26071 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3129 篇

2404.00578 2024-04-02 cs.CV 61%

M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models

Fan Bai, Yuxin Du, Tiejun Huang, Max Q. -H. Meng, Bo Zhao

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV;MLLM(comments)

Comments MLLM, 3D medical image analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.06075 2021-11-12 cs.CV 61%

Graph Relation Transformer: Incorporating pairwise object features into the Transformer architecture

Michael Yang, Aditya Anantharaman, Zachary Kitowski, Derik Clive Robert

专题命中 视觉问答 :visual question answering(abstract,comments);分类 cs.CV

Comments Presented as poster in CVPR 2021 Visual Question Answering Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18988 2026-08-20 cs.CL cs.AI 新提交 57%

DeepWeaver: Bridging the Evidence Synthesis Gap in Open-Ended Question Answering

DeepWeaver:弥合开放域问答中的证据合成鸿沟

Xujia Wang, Yizhe Zhang, Bin Xu, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 该研究针对开放域问答中检索与生成间的证据合成鸿沟,提出DeepWeaver框架,通过Thought Block Chains编织证据,在LoQA和DeepResearch Bench基准上提升了问答的内容、引用及见解质量。

Comments 49 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16841 2026-08-20 cs.CV cs.MM 版本更新 57%

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉

Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Road Transport Development Center(上海市道路运输发展中心) Hunan Institute of Advanced Technology(湖南先进技术研究院)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15708 2026-08-18 cs.CV 新提交 57%

What You Ask is What You Ground: Bridging Question Intent to Temporal Evidence for Grounded VideoQA

你所问即你所定位:连接问题意图与时序证据以实现定位视频问答

Jinhwan Seo, Kyubeom Han, Jumin Lee, Junhyug Noh, Sung-eui Yoon

机构 * KAIST(韩国科学技术院) Ewha Womans University(梨花女子大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 针对定位视频问答中问题不变定位的失效模式,提出GroundFormer模型,通过可学习通信令牌、因子化MIL交叉注意力等技术,在NExT-GQA和STAR数据集上实现最优性能,提升时序定位的问题区分性。

Comments Accepted at ECCV2026. Code: https://github.com/jinhseo/GroundFormer. Project page: https://jinhseo.github.io/groundformer/groundformer.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14718 2026-08-18 cs.CV cs.CL 新提交 57%

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

VideoGAIA:面向通用人工智能助手的智能体视频理解基准

Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20271 2026-08-18 cs.CV 版本更新 57%

A Versatile Foundation Model for AI-enabled Mammogram Interpretation

一种用于AI辅助乳腺X线摄影解读的通用基础模型

Fuxiang Huang, Jiayi Zhu, Yunfang Yu, Yu Xie, Yuan Guo, Qingcong Kong, Mingxiang Wu, Xinrui Jiang, Shu Yang, Jiabo Ma, Ziyi Liu, Zhe Xu, Zhixuan Chen, Yujie Tan, Zifan He, Luhui Mao, Xi Wang, Junlin Hou, Lei Zhang, Qiong Luo, Zhenhui Li, Herui Yao, Hao Chen

机构 * Guangdong Provincial Key Laboratory of Malignant Tumor Epigenetics and Gene Regulation, Guangdong-Hong Kong Joint Laboratory for RNA Medicine, Department of Medical Oncology, Breast Tumor Centre, Phase I Clinical Trial Centre(广东省恶性肿瘤表观遗传与基因调控重点实验室,粤港澳RNA医学联合实验室,医学肿瘤科,乳腺肿瘤中心,I期临床试验中心) Guangdong Provincial Key Laboratory of Cancer Pathogenesis and Precision Diagnosis and Treatment, AI Big Data Laboratory, Department of Medical Oncology(广东省肿瘤发生与精准诊断与治疗重点实验室,人工智能大数据实验室,医学肿瘤科) Chongqing Key Laboratory of Bio-perception(重庆生物感知重点实验室)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 研究针对乳腺X线分析基础模型的临床转化缺陷,推出VersaMammo模型,构建含70余万张图像的多机构数据集,经两阶段预训练后在92项临床任务基准中表现顶尖,推动乳腺癌筛查诊断进展。

Comments 69 pages, 12 figures, 52 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14179 2026-08-17 cs.AI 新提交 57%

Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding

语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试

Jeongwan Shin, Jaehyeon Kim, Donguk Ko, Jaeho Choi

机构 * DGIST(大邱庆北科学技术院) KAIST(韩国科学技术院) InnoCORE LLM

专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI

AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。

Comments Accepted to CVPR 2026 Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08802 2026-08-17 cs.AI 版本更新 57%

Improving Generalization Robustness of Multimodal RLVR

提升多模态RLVR的泛化鲁棒性

Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) University of California Berkeley(加州大学伯克利分校) Rochester Institute of Technology(罗切斯特理工学院) Georgia Institute of Technology(佐治亚理工学院) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28026 2026-08-17 cs.AI 版本更新 57%

BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

当选择成为先验:用于科学图表多选问答的对比解码

Taeyun Roh, Suhyeong Park, Dongyoung Lee, Eunyeong Jo, Wonjune Jang, Junha Jung, Jaewoo Kang

机构 * Korea University(高丽大学) Konkuk University(建国大学) Myongji University(明知大学) AIGEN Sciences

专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出SCICON方法,通过对比文本和图像信息,减少选择偏差,提升科学图表多选问答的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05809 2026-08-14 cs.CR cs.LG 版本更新 57%

Adjustable Text-Guided Backdoor Attacks with Natural-Word Triggers on Multimodal Pretrained Models

隐蔽且可调节的文本引导后门攻击多模态预训练模型

Yiyang Zhang, Chaojian Yu, Ziming Hong, Yuanjie Shao, Qinmu Peng, Tongliang Liu, Xinge You

机构 * National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学国家防伪工程技术研究中心) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

AI总结 本文提出一种基于文本的后门攻击方法,利用常见文本词汇作为触发器,提升攻击隐蔽性和实用性,并通过视觉对抗扰动调节模型对文本触发器的学习,实现可控的攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12310 2026-08-13 cs.CL cs.AI 版本更新 57%

LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

LakeQuest:用于跨数据湖的有基础问答的三领域基准测试

Michael Solodko, Steven Gong, Guangwei Yu, Satya Krishna Gorti, Jesse C. Cresswell, Victor Zhong

机构 * University of Waterloo(滑铁卢大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 介绍LakeQuest基准测试,用于评估跨数据湖的有基础问答。它跨越三个领域,含9846个QA对及证据指针,能暴露系统故障模式。通过基线评估发现高质量检索不能保证正确推理,凸显未来智能QA系统需强大发现和跨文件组合机制。

Comments 24 pages, 4 figures, 18 tables. Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11074 2026-08-12 cs.CV 新提交 57%

CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering

CapProbe:通过全场景密集问答评估详细图像描述

Mouxiao Huang, Qiangyu Yan, Borui Jiang, Han Shu

机构 * Huawei Technologies(华为技术有限公司)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 CapProbe是用于评估VLMs生成的详细图像描述的全场景密集问答基准,通过区域对齐的事实核查,揭示了13个VLMs的覆盖差距、能力-效率权衡及遗漏的失败模式,相关资源将很快发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09227 2026-08-11 cs.AI 新提交 57%

Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models

Omni2LoRA:用于高效全模态语言模型的保持一致性的参数化存储器

Puneet Mathur, Manan Suri, Dinesh Manocha

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 Omni2LoRA是一种保持一致性的参数化存储器压缩框架,通过优化秩分配策略提升全模态语言模型效率,在视听问答任务中优于多种基线,大幅缩短推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07700 2026-08-11 cs.AI cs.DB 新提交 57%

Towards Researcher Agents for Knowledge-Graph Question Answering

面向知识图谱问答的研究者智能体

Tommaso Soru, Abdulsobur Oyewale

机构 * Liber AI Research(Liber AI研究院)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本研究提出研究者智能体式文本转SPARQL系统,在DBpedia上迭代优化后,其在2025年DBpedia验证集上总体准确率达0.22,发现瓶颈在谓词选择,建议基准采用多指标评分。

Comments Second International TEXT2SPARQL Challenge, co-located with Text2KG at ESWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01045 2026-08-11 cs.AI 版本更新 57%

Med-CRAFT: An Information System for Explainable and Configurable Construction of Multimodal Medical QA Datasets

Med-CRAFT:通过知识图谱遍历自动构建可解释的多跳视频工作负载

Shenxi Liu, Kan Li, Mingyang Zhao, Yuhang Tian, Bin Li

机构 * Beijing Institute of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 视觉问答 :MLLM(abstract_cn);分类 cs.AI

AI总结 Med-CRAFT通过知识图谱遍历自动构建可解释的多跳视频工作负载,生成具有细粒度时间选择性和多跳逻辑复杂性的医疗视频推理基准。

Comments 23 pages, 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06108 2026-08-07 cs.AI 新提交 57%

Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents

评估大语言模型的投资逻辑:面向个性化金融智能体的真实世界基准

Yuanhong Jiang, Jingjie Zou, Zhenghong Lin, Xusheng Yu, Qiqi Huang, Shuai Jia, Shijie Dai

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 该研究推出原生过程基准InvestLogicBench,含151位真实投资者的201247项决策,评估发现金融LLMs逻辑合理性高但事件接地性低,指出需以P→E→R→D→O轨迹评估个性化决策智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05691 2026-08-07 cs.CV 新提交 57%

SciQNet: Two-Stage Multimodal Adaptation for Scientific Image Quality Assessment

SciQNet:面向科学图像质量评估的两阶段多模态适配框架

Yin-Loon Khor, Yi-Jie Wong, Jing Jie Tan, Ming Jie Lee

机构 * Universiti Malaya(马来亚大学) Universiti Tunku Abdul Rahman(拉曼大学) National University of Singapore(新加坡国立大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本研究提出SciQNet两阶段多模态适配框架,在ICME 2026科学图像质量评估挑战赛评分赛道获第2,模型在SIQA-S、SIQA-U等指标表现优异,证实预训练数据相关性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29637 2026-08-03 cs.CV cs.SE 新提交 57%

CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding

CodeShrink:面向高效多模态代码理解的自适应视觉压缩

Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Zipeng Xie, Junliang Liu, Wang Luo, Yuan Jiang, Yintong Huo, Michael Lyu

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 CodeShrink是含无空白渲染、自适应压缩配置、主导令牌选择的自适应视觉压缩框架,可减少代码理解的视觉令牌用量,在三类代码任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27260 2026-07-31 cs.LG 新提交 57%

Regularizing modality contribution drift in multimodal continual learning

多模态持续学习中模态贡献漂移的正则化

Zhen Zhang, Jielei Chu, Bin Liu, Tianrui Li

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG

AI总结 针对多模态持续学习中的模态贡献漂移问题,提出含基于重放和无重放版本的CMCDR方法,经实验验证其通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24748 2026-07-29 cs.IR cs.AI cs.CL 新提交 57%

VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents

VLD-RAG:用于长的、视觉丰富的多页文档的智能视觉语言检索增强生成

Seonok Kim

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 研究针对视觉丰富的长文档问答的多模态检索增强生成,提出VLD-RAG框架,构建多模态索引并采用混合检索策略,经智能体工作流程协调,在相关基准上提升了证据页面检索及问答表现,凸显协调验证与混合检索的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18368 2026-07-29 cs.AI 版本更新 57%

Neuro-Symbolic Meta-Policies for Temporal Knowledge-Graph Memory under Partial Observability

部分可观测性下用于时态知识图谱记忆的神经符号元策略

Taewoon Kim, Vincent François-Lavet, Michael Cochez

机构 * HumemAI(胡梅人工智能公司) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ELLIS Institute Finland & Abo Akademi University(芬兰埃利斯研究所和图尔库大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 研究部分可观测性下的强化学习,提出神经符号元策略,结合知识图谱编码与值头,通过RDF表示等实现语义网基础,在特定设置下限定符感知的StarE - GNN配置性能最佳且有可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01348 2026-07-28 cs.CL cs.LG 版本更新 57%

Does Faithfulness-Guided Alignment Hurt Accuracy? Unlocking Accurate and Faithful Post-Retrieval Reasoning

CRAFT: 通过强化学习进行多跳问答的校准推理与答案忠实轨迹

Yu Liu, Wenxiao Zhang, Diandian Guo, Cong Cao, Fangfang Yuan, Qiang Sun, Yanbing Liu, Jin B. Hong, Zhiyuan Ma

专题命中 视觉问答 :grounding(abstract);分类 cs.LG

AI总结 CRAFT通过强化学习框架提升多跳问答的推理准确性和答案忠实度,结合确定性奖励和判官奖励,增强推理轨迹的可审计性与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19624 2026-07-23 cs.CV 新提交 57%

Pathologist Attention-Aligned Report Generation for Prostate Histopathology

用于前列腺组织病理学的病理学家注意力对齐报告生成

Ruoyu Xue, Suryakant Singh, Souradeep Chakraborty, Pierre Marza, Oksana Yaskiv, Constantin Friedman, Natallia Sheuka, Paul Friedman, Bharat Ramlal, Beatrice Knudsen, Rajarsi Gupta, Joel Saltz, Prateek Prasanna, Gregory Zelinsky, Dimitris Samaras

机构 * Department of Computer Science, Stony Brook University(纽约州立大学石溪分校计算机科学系) Department of Biomedical Informatics, Stony Brook University(纽约州立大学石溪分校生物医学信息学系) Université Paris-Saclay, CentraleSupélec, Gustave Roussy, INSERM, IHU PRISM, Cancer Data Science Unit(巴黎萨克雷大学、中央理工高等电力学院、古斯塔夫·鲁西研究所、法国国家健康与医学研究院、PRISM综合大学医院、癌症数据科学单元) Université Paris-Saclay, CentraleSupélec, MICS Laboratory(巴黎萨克雷大学、中央理工高等电力学院、MICS实验室) Department of Pathology and Laboratory Medicine, Northwell Health Laboratories(诺斯韦尔健康实验室病理与检验医学部) Department of Pathology, University of Utah School of Medicine(犹他大学医学院病理系) Department of Psychology, Stony Brook University(纽约州立大学石溪分校心理学系)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 研究将人类注意力引入前列腺病理报告生成模型训练,收集多模态数据集,通过注意力对齐损失微调模型,在两个模型上评估,在报告生成和视觉问答任务中取得较好效果,模型注意力图与病理学家注意力更对齐。

Comments 11 pages, 4 figures, accepted for publication at the 29th International Conference on Medical Image Computing and Computer-Assisted Intervention (MICCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05482 2026-07-22 cs.AI cs.CL cs.MA 版本更新 57%

FinRAG-12B: A Production-Validated Recipe for Grounded Question Answering in Banking

FinRAG-12B:一家银行中基于事实的问题回答的生产验证配方

Denys Katerenchuk, Pablo Duboue, Keelan Evanini, David Gondek, Nithin Govindugari, Olivier Allauzen, Joshua Baptiste, David J More, Joshua Schechter

机构 * Kasisto Textualization NBME

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种高效框架,通过数据生成管道和校准拒绝机制,提升银行领域LLM的准确性与合规性,实现7.1个百分点的查询解决率提升。

Comments 7 pages, ACL 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16189 2026-07-20 cs.CV 新提交 57%

Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA

将视频搜索为树:用于有基础的长视频问答的自校正智能体

Ce Zhang, Ziyang Wang, Yulu Pan, Oluwatumininu Oguntola, Pranav Wagh, Qiyu Wu, Hiromi Wakaki, Mohit Bansal, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Sony(索尼)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 研究有基础的长视频问答问题,提出VideoTreeSearch框架,通过构建自适应时间树及可学习的离散操作让智能体导航,经监督微调与强化学习训练,在多个基准测试中表现出色,证明自校正分层搜索是关键机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15241 2026-07-17 cs.CL cs.CV 新提交 57%

Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA

超越排行榜:可信多模态视觉问答的设计经验教训

Sushant Gautam, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen, Steven A. Hicks

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 以MediaEval Medico 2025为案例,分析九个多模态问答系统,发现预训练主干的参数高效适应虽有挑战性能,但答案提升未转化为完整临床推理,结构化推理等方法更可靠,结果促使多方面改进,支持可信多模态医疗保健人工智能。

Comments Accepted for presentation at the 39th IEEE International Symposium on Computer-Based Medical Systems (IEEE CBMS 2026) as a regular paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24563 2026-07-16 cs.CV cs.CL 版本更新 57%

NeMo: Needle in a Montage for Video-Language Understanding

NeMo:视频语言理解中的蒙太奇之针

Zi-Yuan Hu, Shuo Liang, Duo Zheng, Yanyang Li, Yeyao Tao, Shijia Huang, Wei Feng, Jia Qin, Jianguang Yu, Jing Huang, Meng Fang, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Phoenix TV(凤凰电视台) Stanford University(斯坦福大学) University of Liverpool(利物浦大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 为评估视频大语言模型时间理解能力,提出蒙太奇之针(NeMo)任务,开发自动数据生成管道并构建NeMoBench基准,能生成高质量数据,评估了20个模型,展现其能力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11891 2026-07-15 cs.CL cs.AI 新提交 57%

CANDI: Contextual Alignment for Niche Domains Question Answering

CANDI:特定领域问答的上下文对齐

Megha Chakraborty, Darssan L. Eswaramoorthi, Het Riteshkumar Shah, Madhur Thareja, Michelle A Ihetu, Harshul Raj Surana, Kaushik Roy, Amit Sheth

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 研究针对专业领域大语言模型评估问题,提出CANDI-QA数据集,含两类问答对。评估多种语言模型,给出MTSS-Net框架。揭示特定领域上下文对齐挑战及当前模型局限,为上下文感知语言模型研究提供关键基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10990 2026-07-14 cs.CV 新提交 57%

TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

TreeSoc:用于足球视频理解的树状结构动态推理与工具协同

Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen, Trung-Hoang Le, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市越南国立大学科学大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 针对当代视觉语言模型理解足球视频的挑战,提出TreeSoc框架,通过动态深度优先搜索机制分解查询,支持自适应工具路由,在多个数据集上取得优异成绩,证明其为视频理解的有效范式。

Comments Accepted to ICMV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏