M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV;MLLM(comments)
Comments MLLM, 3D medical image analysis
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV;MLLM(comments)
Comments MLLM, 3D medical image analysis
专题命中 视觉问答 :visual question answering(abstract,comments);分类 cs.CV
Comments Presented as poster in CVPR 2021 Visual Question Answering Workshop
DeepWeaver:弥合开放域问答中的证据合成鸿沟
机构 * Tsinghua University(清华大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 该研究针对开放域问答中检索与生成间的证据合成鸿沟,提出DeepWeaver框架,通过Thought Block Chains编织证据,在LoQA和DeepResearch Bench基准上提升了问答的内容、引用及见解质量。
Comments 49 pages, 6 figures
回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉
机构 * Xidian University(西安电子科技大学) ; Tsinghua University(清华大学) ; Shanghai Road Transport Development Center(上海市道路运输发展中心) ; Hunan Institute of Advanced Technology(湖南先进技术研究院)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。
Comments Accepted by ACM Multimedia 2026
你所问即你所定位:连接问题意图与时序证据以实现定位视频问答
机构 * KAIST(韩国科学技术院) ; Ewha Womans University(梨花女子大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
AI总结 针对定位视频问答中问题不变定位的失效模式,提出GroundFormer模型,通过可学习通信令牌、因子化MIL交叉注意力等技术,在NExT-GQA和STAR数据集上实现最优性能,提升时序定位的问题区分性。
Comments Accepted at ECCV2026. Code: https://github.com/jinhseo/GroundFormer. Project page: https://jinhseo.github.io/groundformer/groundformer.html
VideoGAIA:面向通用人工智能助手的智能体视频理解基准
机构 * The Chinese University of Hong Kong(香港中文大学) ; Ant Group(蚂蚁集团) ; Tsinghua University(清华大学) ; Tongji University(同济大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。
一种用于AI辅助乳腺X线摄影解读的通用基础模型
机构 * Guangdong Provincial Key Laboratory of Malignant Tumor Epigenetics and Gene Regulation, Guangdong-Hong Kong Joint Laboratory for RNA Medicine, Department of Medical Oncology, Breast Tumor Centre, Phase I Clinical Trial Centre(广东省恶性肿瘤表观遗传与基因调控重点实验室,粤港澳RNA医学联合实验室,医学肿瘤科,乳腺肿瘤中心,I期临床试验中心) ; Guangdong Provincial Key Laboratory of Cancer Pathogenesis and Precision Diagnosis and Treatment, AI Big Data Laboratory, Department of Medical Oncology(广东省肿瘤发生与精准诊断与治疗重点实验室,人工智能大数据实验室,医学肿瘤科) ; Chongqing Key Laboratory of Bio-perception(重庆生物感知重点实验室)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 研究针对乳腺X线分析基础模型的临床转化缺陷,推出VersaMammo模型,构建含70余万张图像的多机构数据集,经两阶段预训练后在92项临床任务基准中表现顶尖,推动乳腺癌筛查诊断进展。
Comments 69 pages, 12 figures, 52 tables
语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试
机构 * DGIST(大邱庆北科学技术院) ; KAIST(韩国科学技术院) ; InnoCORE LLM
专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI
AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。
Comments Accepted to CVPR 2026 Findings
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026
提升多模态RLVR的泛化鲁棒性
机构 * National University of Singapore(新加坡国立大学) ; DAMO Academy Alibaba Group(阿里巴巴达摩院) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学) ; University of California Berkeley(加州大学伯克利分校) ; Rochester Institute of Technology(罗切斯特理工学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Renmin University of China(中国人民大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI
AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。
Comments 32 pages, 5 figures
当选择成为先验:用于科学图表多选问答的对比解码
机构 * Korea University(高丽大学) ; Konkuk University(建国大学) ; Myongji University(明知大学) ; AIGEN Sciences
专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI
AI总结 本文提出SCICON方法,通过对比文本和图像信息,减少选择偏差,提升科学图表多选问答的准确性。
隐蔽且可调节的文本引导后门攻击多模态预训练模型
机构 * National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学国家防伪工程技术研究中心) ; School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) ; Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG
AI总结 本文提出一种基于文本的后门攻击方法,利用常见文本词汇作为触发器,提升攻击隐蔽性和实用性,并通过视觉对抗扰动调节模型对文本触发器的学习,实现可控的攻击效果。
LakeQuest:用于跨数据湖的有基础问答的三领域基准测试
机构 * University of Waterloo(滑铁卢大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 介绍LakeQuest基准测试,用于评估跨数据湖的有基础问答。它跨越三个领域,含9846个QA对及证据指针,能暴露系统故障模式。通过基线评估发现高质量检索不能保证正确推理,凸显未来智能QA系统需强大发现和跨文件组合机制。
Comments 24 pages, 4 figures, 18 tables. Accepted at the Conference on Language Modeling (COLM) 2026
CapProbe:通过全场景密集问答评估详细图像描述
机构 * Huawei Technologies(华为技术有限公司)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 CapProbe是用于评估VLMs生成的详细图像描述的全场景密集问答基准,通过区域对齐的事实核查,揭示了13个VLMs的覆盖差距、能力-效率权衡及遗漏的失败模式,相关资源将很快发布。
Omni2LoRA:用于高效全模态语言模型的保持一致性的参数化存储器
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI
AI总结 Omni2LoRA是一种保持一致性的参数化存储器压缩框架,通过优化秩分配策略提升全模态语言模型效率,在视听问答任务中优于多种基线,大幅缩短推理时间。
面向知识图谱问答的研究者智能体
机构 * Liber AI Research(Liber AI研究院)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本研究提出研究者智能体式文本转SPARQL系统,在DBpedia上迭代优化后,其在2025年DBpedia验证集上总体准确率达0.22,发现瓶颈在谓词选择,建议基准采用多指标评分。
Comments Second International TEXT2SPARQL Challenge, co-located with Text2KG at ESWC 2026
Med-CRAFT:通过知识图谱遍历自动构建可解释的多跳视频工作负载
机构 * Beijing Institute of Technology(北京理工大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
专题命中 视觉问答 :MLLM(abstract_cn);分类 cs.AI
AI总结 Med-CRAFT通过知识图谱遍历自动构建可解释的多跳视频工作负载,生成具有细粒度时间选择性和多跳逻辑复杂性的医疗视频推理基准。
Comments 23 pages, 4 figures, 10 tables
评估大语言模型的投资逻辑:面向个性化金融智能体的真实世界基准
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 该研究推出原生过程基准InvestLogicBench,含151位真实投资者的201247项决策,评估发现金融LLMs逻辑合理性高但事件接地性低,指出需以P→E→R→D→O轨迹评估个性化决策智能体。
SciQNet:面向科学图像质量评估的两阶段多模态适配框架
机构 * Universiti Malaya(马来亚大学) ; Universiti Tunku Abdul Rahman(拉曼大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 本研究提出SciQNet两阶段多模态适配框架,在ICME 2026科学图像质量评估挑战赛评分赛道获第2,模型在SIQA-S、SIQA-U等指标表现优异,证实预训练数据相关性的重要性。
CodeShrink:面向高效多模态代码理解的自适应视觉压缩
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
AI总结 CodeShrink是含无空白渲染、自适应压缩配置、主导令牌选择的自适应视觉压缩框架,可减少代码理解的视觉令牌用量,在三类代码任务上优于基线。
多模态持续学习中模态贡献漂移的正则化
机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.LG
AI总结 针对多模态持续学习中的模态贡献漂移问题,提出含基于重放和无重放版本的CMCDR方法,经实验验证其通用性与有效性。
VLD-RAG:用于长的、视觉丰富的多页文档的智能视觉语言检索增强生成
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 研究针对视觉丰富的长文档问答的多模态检索增强生成,提出VLD-RAG框架,构建多模态索引并采用混合检索策略,经智能体工作流程协调,在相关基准上提升了证据页面检索及问答表现,凸显协调验证与混合检索的重要性。
部分可观测性下用于时态知识图谱记忆的神经符号元策略
机构 * HumemAI(胡梅人工智能公司) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; ELLIS Institute Finland & Abo Akademi University(芬兰埃利斯研究所和图尔库大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 研究部分可观测性下的强化学习,提出神经符号元策略,结合知识图谱编码与值头,通过RDF表示等实现语义网基础,在特定设置下限定符感知的StarE - GNN配置性能最佳且有可追溯性。
CRAFT: 通过强化学习进行多跳问答的校准推理与答案忠实轨迹
专题命中 视觉问答 :grounding(abstract);分类 cs.LG
AI总结 CRAFT通过强化学习框架提升多跳问答的推理准确性和答案忠实度,结合确定性奖励和判官奖励,增强推理轨迹的可审计性与语义一致性。
用于前列腺组织病理学的病理学家注意力对齐报告生成
机构 * Department of Computer Science, Stony Brook University(纽约州立大学石溪分校计算机科学系) ; Department of Biomedical Informatics, Stony Brook University(纽约州立大学石溪分校生物医学信息学系) ; Université Paris-Saclay, CentraleSupélec, Gustave Roussy, INSERM, IHU PRISM, Cancer Data Science Unit(巴黎萨克雷大学、中央理工高等电力学院、古斯塔夫·鲁西研究所、法国国家健康与医学研究院、PRISM综合大学医院、癌症数据科学单元) ; Université Paris-Saclay, CentraleSupélec, MICS Laboratory(巴黎萨克雷大学、中央理工高等电力学院、MICS实验室) ; Department of Pathology and Laboratory Medicine, Northwell Health Laboratories(诺斯韦尔健康实验室病理与检验医学部) ; Department of Pathology, University of Utah School of Medicine(犹他大学医学院病理系) ; Department of Psychology, Stony Brook University(纽约州立大学石溪分校心理学系)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 研究将人类注意力引入前列腺病理报告生成模型训练,收集多模态数据集,通过注意力对齐损失微调模型,在两个模型上评估,在报告生成和视觉问答任务中取得较好效果,模型注意力图与病理学家注意力更对齐。
Comments 11 pages, 4 figures, accepted for publication at the 29th International Conference on Medical Image Computing and Computer-Assisted Intervention (MICCAI 2026)
FinRAG-12B:一家银行中基于事实的问题回答的生产验证配方
机构 * Kasisto ; Textualization ; NBME
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种高效框架,通过数据生成管道和校准拒绝机制,提升银行领域LLM的准确性与合规性,实现7.1个百分点的查询解决率提升。
Comments 7 pages, ACL 2026 conference
将视频搜索为树:用于有基础的长视频问答的自校正智能体
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Sony(索尼)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
AI总结 研究有基础的长视频问答问题,提出VideoTreeSearch框架,通过构建自适应时间树及可学习的离散操作让智能体导航,经监督微调与强化学习训练,在多个基准测试中表现出色,证明自校正分层搜索是关键机制。
超越排行榜:可信多模态视觉问答的设计经验教训
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
AI总结 以MediaEval Medico 2025为案例,分析九个多模态问答系统,发现预训练主干的参数高效适应虽有挑战性能,但答案提升未转化为完整临床推理,结构化推理等方法更可靠,结果促使多方面改进,支持可信多模态医疗保健人工智能。
Comments Accepted for presentation at the 39th IEEE International Symposium on Computer-Based Medical Systems (IEEE CBMS 2026) as a regular paper
NeMo:视频语言理解中的蒙太奇之针
机构 * The Chinese University of Hong Kong(香港中文大学) ; Phoenix TV(凤凰电视台) ; Stanford University(斯坦福大学) ; University of Liverpool(利物浦大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
AI总结 为评估视频大语言模型时间理解能力,提出蒙太奇之针(NeMo)任务,开发自动数据生成管道并构建NeMoBench基准,能生成高质量数据,评估了20个模型,展现其能力与局限。
CANDI:特定领域问答的上下文对齐
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 研究针对专业领域大语言模型评估问题,提出CANDI-QA数据集,含两类问答对。评估多种语言模型,给出MTSS-Net框架。揭示特定领域上下文对齐挑战及当前模型局限,为上下文感知语言模型研究提供关键基准。
TreeSoc:用于足球视频理解的树状结构动态推理与工具协同
机构 * University of Science, VNU-HCM(胡志明市越南国立大学科学大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 针对当代视觉语言模型理解足球视频的挑战,提出TreeSoc框架,通过动态深度优先搜索机制分解查询,支持自适应工具路由,在多个数据集上取得优异成绩,证明其为视频理解的有效范式。
Comments Accepted to ICMV 2026