arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 3126 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3126 篇

2607.11257 2026-07-14 cs.CV cs.LG 新提交 62%

LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models

拉瓜迪亚:基于病理学基础模型的语言引导自适应蒸馏

Gangsu Kim, Won-Ki Jeong

机构 * College of Informatics, Korea University(韩国大学信息学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 研究针对病理学基础模型计算成本高问题,提出拉瓜迪亚框架,通过多阶段流程,在临床语言指导下整合多模型知识,进行自适应蒸馏。实验表明其87M参数学生模型性能出色,凸显临床语言对构建高效可靠数字病理系统的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06641 2026-07-09 cs.CL cs.AI cs.LG 新提交 62%

Healthier LLMs: Retrieval-Augmented Generation for Public Health Question Answering

更健康的语言模型:用于公共卫生问答的检索增强生成

Felix Feldman, Joshua Harris, Timothy Laurence, Leo Loman, Ollie Higgins, Fan Grayson, Poonam Soma, Bethany Pace-Bonello, Michael Borowitz, Toby Nonnenmacher

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大型语言模型在公共卫生问答受幻觉等限制的问题,采用检索增强生成方法,通过扩展基准并系统评估检索与生成选择,比较多种检索方式,引入评判方法,突出检索对可靠公共卫生问答的作用并提供实用指导。

Comments 19 Pages, 14 Main Text Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05880 2026-07-08 cs.CV cs.AI 新提交 62%

Harrison.Rad 1.5 Technical Report: A radiology foundation model that can draft reports from images, priors and clinical context

哈里森.Rad 1.5技术报告:一种可根据图像、先验知识和临床背景起草报告的放射学基础模型

Suneeta Mall, Vladimir Nekrasov, Ashnil Kumar, Sajith Karunasena, Aiden Nibali, Alix Bird, Mateo Diaz Shine, Jarrel Seah

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对放射科报告积压问题,提出HR1.5多模态大语言模型,通过三阶段训练,用特定评分框架评估,该模型是唯一达模拟FRCR及格标准的系统,在多方面准确率最高,还研究了可解释性等以支持临床应用评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01751 2026-07-03 cs.CV cs.AI 新提交 62%

MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding

MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准

Yuan Wang, Shujian Gao, Songtao Jiang, Zhengyu Hu, Zuozhu Liu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出MedStreamBench基准,通过时间受限证据窗口和主动监控设置,评估模型在流式与主动式医疗视频理解中的回答时机与正确性,发现离线识别与时间感知决策间存在显著差距。

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17442 2026-07-01 cs.CV cs.AI 版本更新 62%

REMSA: Foundation Model Selection for Remote Sensing via a Constraint-Aware Agent

REMSA:通过约束感知代理进行遥感基础模型选择

Binger Chen, Tacettin Emre Bök, Behnood Rasti, Volker Markl, Begüm Demir

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) U AI(5U AI) Technische Universität Berlin & BIFOLD(柏林工业大学 & BIFOLD)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 提出REMSA,一种基于结构化数据库RS-FMD的约束感知代理,通过自然语言查询自动选择遥感基础模型,结合元数据检索与上下文学习,在专家评估基准中优于多种基线。

Comments Code and data available at https://github.com/be-chen/REMSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14612 2026-06-29 eess.AS cs.AI cs.LG 版本更新 62%

Event-Grounded Question Answering over Long Audio via Structured Retrieval

基于结构化检索的长音频事件问答

Kartik Hegde, Arvind Krishna Sridhar, Naveen Vakada, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies, Inc., India(印度高通技术公司) Qualcomm Technologies, Inc., USA(美国高通技术公司) University of Turku, Finland(芬兰图尔库大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出LA-RAG框架,通过音频基础模型将长音频转为带时间戳的事件记录并存入SQL数据库,结合意图感知检索和LLM生成,实现低延迟高精度的长音频问答,在多个基准上提升时间定位F1达11-17%。

Comments Submitted to EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24797 2026-06-24 cs.CV cs.AI 新提交 62%

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

EG-VQA: 基于接地时间证据的可验证视频问答基准

Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen University(深圳大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23063 2026-06-23 cs.CV cs.AI 新提交 62%

Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs

注意力谱正则化:无回放的连续多模态大语言模型

Chuangxin Zhao, Canran Xiao, Siyuan Ma, Mengyao Lyu, Yanbiao Ma, Jun Xia, Guiguang Ding, Yang Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出注意力谱正则化(ASR),一种无回放的连续学习框架,通过存储技能级交叉注意力原型分布并施加谱正则化约束,有效缓解多模态大语言模型在连续微调中的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22862 2026-06-23 cs.CV cs.LG 新提交 62%

Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME

看得见的链,答不出的答案:针对视频MME上强制思维链的多方面评估方案

Zhichao Fan, Yanhang Li, Zexin Zhuang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northeastern University(东北大学) Southern Methodist University(南卫理公会大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出三探针评估方案检验强制思维链在视频问答中的可靠性,应用于Qwen2.5-VL发现思维链强依赖视频但未提升准确率,甚至在小模型上导致下降。

Comments 10 pages, 5 figures. To appear at The 2nd Workshop on Evaluation for Multimodal Generation @ SIGIR 2026 (EvalMG '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20643 2026-06-23 cs.AI cs.CV 新提交 62%

SPARC: A Multi-Agent System for Electrical Circuit Question Answering

SPARC:用于电路问答的多智能体系统

Mushtari Sadia, Zhenning Yang, Umme Habiba Lamia, Nishat Shawrin, Ang Chen, Amrita Roy Chowdhury

机构 * University of Michigan(密歇根大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出SPARC多智能体系统,通过可执行的物理仿真程序进行推理,在电路问答任务上实现83%准确率,较基线提升高达58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19966 2026-06-19 cs.CV cs.LG 新提交 62%

Semantic-Anchored Evidential Fusion for Domain-Robust Whole-Slide Survival Analysis

语义锚定证据融合用于域鲁棒的全切片生存分析

Yucheng Xing, Ling Huang, Pei Liu, Jingying Ma, Jiaqing Xu, Kai He, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Imperial College London(帝国理工学院) Hunan University(湖南大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 提出SAEFS框架,通过视觉问答提取语义锚点,结合双流证据提取和狄利克雷主观逻辑建模不确定性,实现跨域零样本生存分析,平均C-index提升10.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11209 2026-06-11 cs.CL cs.AI cs.LG 新提交 62%

ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

ProcessThinker: 通过基于展开的过程奖励增强多模态大语言模型推理

Jingpei Wu, Xiao Han, Weixiang Shen, Boer Zhang, Zifeng Ding, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Harvard University(哈佛大学) University of Cambridge(剑桥大学) Mina AI Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠人工智能卓越学校(relAI))

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 提出ProcessThinker,一种无需显式过程奖励模型的后训练方法,通过步骤标记格式和基于展开的过程奖励,为多步推理提供密集的步骤级奖励,提升多模态推理一致性。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29588 2026-06-11 cs.CV cs.AI q-bio.NC 版本更新 62%

Brain-IT-VQA: From Brain Signals to Answers

Brain-IT-VQA: 从脑信号到答案

Roman Beliy, Matias Cosarinsky, Oliver Heinimann, Navve Wasserman, Michal Irani

机构 * Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 提出 Brain-IT-VQA 框架,基于 fMRI 脑信号解码语言令牌并结合语言模型进行视觉问答,在 NSD-VQA 新基准上显著优于先前方法,并用于分析脑区对视觉信息的贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08063 2026-06-09 cs.CV cs.AI cs.CL 新提交 62%

Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

Robust-U1: MLLMs能否自我恢复受损视觉内容以实现鲁棒理解?

Jiaqi Tang, Jianmin Chen, Youyang Zhai, Wei Wei, Runtao Liu, Mengjie Zhao, Xiangyu Wu, Qingfa Xiao, Qifeng Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出Robust-U1框架,通过监督微调、强化学习和多模态推理,使多模态大模型具备显式视觉自恢复能力,在真实和对抗性损坏下达到最先进鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05275 2026-06-05 cs.CV cs.AI 62%

Personal AI Agent for Camera Roll VQA

个人AI代理用于相机胶卷VQA

Thao Nguyen, Krishna Kumar Singh, Donghyun Kim, Yong Jae Lee, Yuheng Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Korea University(韩国大学) Adobe Research(Adobe研究院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出camroll数据集和camroll-agent代理,通过层次化记忆和工具集解决个人相机胶卷中的长程、高度个性化的视觉问答问题。

Comments Project page, code, and demo: https://thaoshibe.github.io/camroll

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07294 2026-06-05 cs.CV cs.AI 62%

MAviS: A Multimodal Conversational Assistant For Avian Species

MAviS:一种用于鸟类物种的多模态对话助手

Yevheniia Kryklyvets, Mohammed Irfan Kurpath, Sahal Shaji Mullappilly, Jinxing Zhou, Fahad Shabzan Khan, Rao Anwer, Salman Khan, Hisham Cholakkal

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MAviS数据集和MAviS-Chat模型,通过整合图像、音频和文本信息,提升对鸟类物种的细粒度理解与多模态问答能力,并展示了在生态应用中领域适应的多模态大语言模型的重要性。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02522 2026-06-02 cs.CV cs.AI 62%

Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events

Moment-Video: 诊断视频多模态大语言模型在瞬时视觉事件上的时间保真度

Xiaolin Liu, Yilun Zhu, Xiangyu Zhao, Xuehui Wang, Yan Li, Xin Li, Haoyu Cao, Xing Sun, Shaofeng Zhang, Xu Yang, Zhihang Zhong, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Southeast University(东南大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出 Moment-Video 基准,通过瞬时视觉事件理解任务诊断视频 MLLMs 的时间保真度,发现最佳模型准确率仅 39.6%,多数开源模型低于 25%。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02168 2026-06-02 cs.CV cs.LG 62%

Disentanglement-Based Equivariant Learning for Compositional VQA

基于解耦的等变学习用于组合式VQA

Zhou Du, Zhaoquan Yuan, Xiao Wu, Changsheng Xu

机构 * IEEE Publication Technology Group(IEEE出版技术组) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) Engineering Research Center of Sustainable Urban Intelligence Transportation, Ministry of Education, China(可持续智慧城市交通工程研究中心,中华人民共和国教育部) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统(MAIS)国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 提出DEAL框架,通过因果干预解耦视觉和文本概念,并利用等变约束增强组合推理能力,在CLEVR-CoGenT和GQA-SGL上超越现有方法。

Comments Accepted by IEEE Transactions on Multimedia

Journal ref IEEE Trans. Multimedia, vol. 27, pp. 8160-8173, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12263 2026-06-02 cs.AI cs.LG 62%

InPhyRe Discovers: Large Multimodal Models Struggle in Inductive Physical Reasoning

InPhyRe 发现:大型多模态模型在归纳物理推理中表现不佳

Gautam Sreekumar, Vishnu Naresh Boddeti

机构 * Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 提出 InPhyRe 基准测试,通过合成视频中的碰撞事件预测任务,评估大型多模态模型在未见物理定律下的归纳物理推理能力,发现其依赖有限参数知识、受语言偏差影响且忽略视觉输入。

Comments Accepted to TMLR. 53 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25773 2026-06-02 cs.CV cs.AI cs.CL 62%

v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound

v-HUB: 从视觉和声音理解视频幽默的基准

Zhengpeng Shi, Yanpeng Zhao, Jianqun Zhou, Yuxuan Wang, Qinrong Cui, Wei Bi, Songchun Zhu, Bo Zhao, Zilong Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Beijing Institute for General Artificial Intelligence(北京一般人工智能研究院) Independent Researcher(独立研究者)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出v-HUB基准,通过非语言短视频评估多模态大语言模型在仅凭视觉线索理解幽默的能力,并发现音频信息有助于提升幽默理解。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23220 2026-06-02 cs.CV cs.AI 62%

Med-Scout: Curing MLLMs' Geometric Blindness in Medical Perception via Geometry-Aware RL Post-Training

Med-Scout: 通过几何感知的强化学习后训练治愈多模态大语言模型在医学感知中的几何盲点

Anglin Liu, Ruichao Chen, Yi Lu, Hongxia Xu, Jintai Chen

机构 * HKUSTGZ-ML4Health-Lab(香港科技大学-ML4Health实验室)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出Med-Scout框架,利用无标注医学图像中的内在几何逻辑,通过强化学习和三种代理任务(层次尺度定位、拓扑拼图重建、异常一致性检测)来缓解多模态大语言模型的几何盲点,并在新基准Med-Scout-Bench上提升超过40%的几何感知性能,同时泛化到更广泛的医学理解任务。

Comments 29 pages, 14 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12667 2026-05-18 cs.LG cs.AI 62%

ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization

ODRPO:离散奖励的序分解以实现鲁棒策略优化

Nirmal Patel, Fei Wang, Inderjit S. Dhillon

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Google(谷歌)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ODRPO框架,通过将离散奖励分解为序二进制指标,减少噪声影响,提升策略优化鲁棒性,实验表明在Qwen2.5-7B和Qwen3-4B模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01707 2026-05-14 cs.CV cs.AI cs.CL 62%

StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos

StreamGaze:流媒体视频中的目光引导时间推理与前瞻性理解

Daeun Lee, Subhojyoti Mukherjee, Branislav Kveton, Ryan A. Rossi, Viet Dac Lai, Seunghyun Yoon, Trung Bui, Franck Dernoncourt, Mohit Bansal

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) Adobe Research(Adobe研究院)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 StreamGaze通过引入目光引导的任务评估多模态大语言模型在流媒体视频中的时间推理和前瞻性理解能力,揭示了现有模型在目光引导下的时间推理、意图建模和前瞻性预测方面的局限性。

Comments Accepted to CVPR 2026 with strong scores (5/5/5) but desk-rejected after the camera-ready due to not completing all reviewing duties

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11803 2026-05-13 cs.CV cs.AI 62%

OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models

OTT-Vid: 基于最优传输的视频大语言模型时间令牌压缩

Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee

机构 * Yonsei University(延世大学) LG Electronics(LG电子) KIST(韩国科学技术院)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 OTT-Vid通过结合空间修剪和最优传输,有效压缩视频令牌,保持高性能,实验显示在保留10%令牌的情况下,VQA和VTG性能分别达到95.8%和73.9%。

Comments 22pages, 9 figures. Code available at https://github.com/minseokii/OTT-Vid

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12248 2026-05-12 eess.AS cs.AI cs.CL cs.LG cs.SD 62%

AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering

AQUA-Bench:在音频问答中超越寻找答案到知晓何时没有答案

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾国立台湾大学通信工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾国立台湾大学人工智能研究中心)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 AQUA-Bench针对音频问答中不可回答的问题提出评估基准,评估三种场景:缺失答案检测、不兼容答案集检测和不兼容音频问题检测,推动更稳健可靠的音频-语言系统发展。

Comments Accepted to ICASSP 2026 (Oral). Project Website: https://github.com/kuan2jiu99/aqua-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15204 2026-05-11 cs.CV cs.AI 62%

Physics-Based Benchmarking Metrics for Multimodal Synthetic Images

基于物理的多模态合成图像基准度量指标

Kishor Datta Gupta, Marufa Kamal, Md. Mahfuzur Rahman, Fahad Rahman, Mohd Ariful Haque, Sunzida Siddique

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结合大语言模型与推理、知识映射和视觉语言模型的物理约束多模态数据评估指标,以提升多模态合成图像的语义和结构准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23276 2026-04-28 cs.CV cs.AI cs.CL 62%

Lightweight and Production-Ready PDF Visual Element Parsing

轻量且适用于生产的PDF视觉元素解析

Meizhu Liu, Yassi Abbasi, Matthew Rowe, Michael Avendi, Paul Li

机构 * Oracle AI

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种轻量级PDF解析框架,通过空间启发式、布局分析和语义相似性结合,实现高准确率的视觉元素检测与标题关联,提升多模态RAG检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01907 2026-04-27 cs.CV cs.AI 62%

Lifting Unlabeled Internet-level Data for 3D Scene Understanding

提升互联网级未标记数据用于3D场景理解

Yixin Chen, Yaowei Zhang, Huangyue Yu, Junchao He, Yan Wang, Jiangyong Huang, Hongyu Shen, Junfeng Ni, Shaofei Wang, Baoxiong Jia, Song-Chun Zhu, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文通过设计数据引擎利用互联网未标记视频生成训练数据,提升3D场景理解模型性能,验证了在不同感知粒度任务中的有效性。

Comments CVPR 2026. Project page: https://sv-pp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20306 2026-04-23 cs.CV cs.AI 62%

Dual Causal Inference: Integrating Backdoor Adjustment and Instrumental Variable Learning for Medical VQA

双重因果推断:整合后门调整与工具变量学习用于医疗视觉问答

Zibo Xu, Qiang Li, Ke Lu, Jin Wang, Weizhi Nie, Yuting Su

机构 * School of Microelectronics, Tianjin University(天津大学微电子学院) Department of Orthopedics, Affiliated Kunshan Hospital of Jiangsu University(江苏大学附属昆山医院骨科部) Department of Clinical Laboratory, The Third Central Hospital of Tianjin(天津第三中心医院临床实验室) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双重因果推断框架,通过整合后门调整和工具变量学习,解决医疗视觉问答中多模态数据中的内在偏见问题,提升模型的诊断推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16756 2026-04-21 cs.AI cs.CL cs.CV cs.RO eess.AS 62%

End-to-end Listen, Look, Speak and Act

端到端听、看、说和行动

Siyin Wang, Wenyi Yu, Xianzhao Chen, Xiaohai Tian, Jun Zhang, Lu Lu, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ELLSA模型,首个端到端全双工系统,实现视觉、文本、语音和行动的同步感知与生成,支持对话轮替、指令拒绝等复杂交互行为,推动更自然的人工智能发展。

Comments 22 pages, 8 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏