QARI-OCR: High-Fidelity Arabic Text Recognition through Multimodal Large Language Model Adaptation
机构 * NAMAA ; KAND CA Corp. ; Prince Sultan University
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * NAMAA ; KAND CA Corp. ; Prince Sultan University
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
机构 * Seoul National University(首尔国立大学) ; Kim & Chang AI&IT System Center(金·昌AI&IT系统中心) ; Waddle Corporation(Waddle公司)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
机构 * Institute for Transfusion Medicine, University Hospital Essen, Hufelandstraße 55, Essen, Germany(1 输血医学研究所,埃森大学医院,Hufelandstraße 55,德国) ; Department of Computer Science, University of Applied Sciences and Arts Dortmund (FHDO), Emil-Figge Str. 42, Dortmund, Germany(2 计算机科学系,多特蒙德应用科学大学(FHDO),Emil-Figge Str. 42,德国) ; Institute for Medical Informatics, Biometry and Epidemiology (IMIBE), University Hospital Essen, Hufelandstraße 55, Essen, Germany(3 医学信息学、生物统计学和流行病学研究所(IMIBE),埃森大学医院,Hufelandstraße 55,德国) ; Institute for AI in Medicine (IKIM), University Hospital Essen, Girardetstraße 2, Essen, Germany(4 医学人工智能研究所(IKIM),埃森大学医院,Girardetstraße 2,德国) ; Institute of Interventional and Diagnostic Radiology and Neuroradiology, University Hospital Essen, Hufelandstraße 55, Essen, Germany(5 干预性和诊断放射学及神经放射学研究所,埃森大学医院,Hufelandstraße 55,德国) ; Department of Dermatology, University Hospital Essen, Hufelandstraße 55, Essen, Germany(6 皮肤科系,埃森大学医院,Hufelandstraße 55,德国)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(title);分类 cs.CL、cs.AI
Comments NAACL 2025 Main
专题命中 图文多模态 :multi-modal(title);分类 cs.CL、cs.AI
Comments 32pp (+6pp sup.mat.) Accepted in Computer Vision and Image Understanding Journal on January 23, 2025. This research received funding Horizon-Europe TERAIS project (G.A. 101079338) and Slovak Research and Development Agency, project no. APVV-21-0105
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL
专题命中 图文多模态 :image-text(title);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(title);分类 cs.CV、cs.AI
Comments Accepted to ECCV Synthetic Data for Computer Vision Workshop (Oral)
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
Comments Code is available at https://github.com/cnzzx/VSA
专题命中 图文多模态 :multi-modal(title);分类 cs.CV、cs.MM
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
Comments 14 pages, 10 figures. Accepted to 35th British Machine Vision Conference (BMVC 2024), Workshop on Privacy, Fairness, Accountability and Transparency in Computer Vision
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL
Comments 12 pages, 5 tables, 2 figures, Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024) @ NAACL 2024
专题命中 图文多模态 :multi-modal(title);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(title);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(title);分类 cs.CL、cs.AI
Comments 18 pages, 9 figures, 12 tables
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI
专题命中 图文多模态 :cross-modal(title);分类 cs.CV、cs.CL
专题命中 图文多模态 :multi-modal(title);分类 cs.CV、cs.CL
专题命中 图文多模态 :multi-modal(title);分类 cs.CV、cs.CL
专题命中 图文多模态 :cross-modal(title);分类 cs.CV、cs.CL
专题命中 图文多模态 :image-text(title);分类 cs.CV、cs.CL
Comments 9 pages, 2 figures, 6 tables, 1 algorithm
专题命中 图文多模态 :image-text(title);分类 cs.CV、cs.MM
Comments 15pages, 15 figures, 8 tables
专题命中 图文多模态 :multi-modal(title);分类 cs.CV、cs.CL
Comments Source code available at: https://github.com/subho406/OmniNet
专题命中 图文多模态 :multi-modal(title);分类 cs.CV、cs.CL
Comments To be presented at ICML 2018; 10 pages 5 figures
专题命中 图文多模态 :multi-modal(title);分类 cs.CV、cs.AI
Comments 23 pages; CVPR 2017 submission; see https://guesswhat.ai
视觉-语言 Grounding 作为双向概念对应
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(艾伦人工智能研究所) ; FAIR at Meta(Meta FAIR实验室)
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本研究将视觉-语言 Grounding 建模为双向概念对应,提出 ConCor-1 模型统一相关任务,在长文本数据集和零样本 LVIS 上对应 F1 分别提升 48%、29%,性能优于基线。
通过LENS:视觉语言模型表示的局部几何分解
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本研究提出LENS方法,将VLM激活分解为局部低秩高斯邻域,揭示LLaVA与Qwen3-VL的不同模态融合轨迹,该方法可实现因果生成干预并提升多模态检索性能。
主动观察者的测试
机构 * University of Southern California(南加州大学)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 研究多模态大语言模型是否具备主动观察能力,引入ActiveVision基准测试,发现前沿模型表现不佳,即便能编写视觉代码差距仍存,表明当前模型缺乏主动视觉观察,呼吁构建闭合感知 - 推理循环的架构和训练目标。
Comments 17 pages, 8 figures, 4 tables. Project page: https://activevision.dev
空间思考者:通过密集奖励强化场景图基础的空间推理
机构 * University of Oxford(牛津大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。
Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)