Med-UniC: Unifying Cross-Lingual Medical Vision-Language Pre-Training by Diminishing Bias
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NeurIPS 2023 Main track
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NeurIPS 2023 Main track
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by ICCV 2023. Code: https://github.com/KevinLight831/CTP
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract)
Comments 6 pages, 3 figures, accepted to SIRIP 2023
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments NAACL Findings 2022
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted at EACL 2023 (main track); 26 pages, 21 figures, 6 tables; Pau Rodriguez and Saba Ahmadi had equal contributions
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by AAAI 2023, 12 pages, 6 figures
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted by ACM MM22
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Best Demo Award at CVPR 2022
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Accepted to IJCAI2022, data and codes are available at https://github.com/CCIIPLab/DPT
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by CVPR 2022
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ACL2021 main conference
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Appearing at IJCAI 2020
Mull-Tokens: 通用模态的潜在思考
机构 * Google(谷歌) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; Boston University(波士顿大学)
专题命中 图文多模态 :multimodal(abstract,comments);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Mull-Tokens,一种无需模态切换的潜在令牌,用于空间、时间等多模态推理,通过预训练和微调在四个挑战性基准上实现3%-16%的提升。
Comments Project webpage: https://arijitray.com/multimodal_thinking/, Accepted to CVPR 2026 (Findings Track)
机构 * VLM Safety LAB, MODULABS(视觉语言模型安全实验室,MODULABS) ; ETRI(电子技术研究院) ; KAIST(韩国科学技术院)
专题命中 图文多模态 :multimodal(abstract,comments);image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted to Safe and Trustworthy Multimodal AI Systems(SafeMM-AI) Workshop at ICCV2025, Non-archival track
机构 * Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; CloudWalk Technology Co., Ltd(云walk科技有限公司) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 图文多模态 :multimodal(abstract,comments);multi-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted to CVPR 2025 Workshop on CV4Animals. https://github.com/983632847/Awesome-Multimodal-Object-Tracking
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI;multimodal(comments)
Comments Preprint submitted to Elsevier. https://github.com/983632847/Awesome-Multimodal-Object-Tracking
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL;multimodal(comments)
Comments De-Factify 2: Second Workshop on Multimodal Fact Checking and Hate Speech Detection, co-located with AAAI 2023
用于微调CLIP的移位感知校准:利用图像-文本对齐
专题命中 图文多模态 :image-text(title);分类 cs.CV
AI总结 研究针对微调CLIP时预测置信度与准确性不一致问题,提出无需训练的移位感知校准(SAC)方法,利用原始与微调CLIP输出对数差异作校准信号,经实验验证该方法在多数据集和微调方法上提升了校准效果。
CAIRN:使用拓扑感知大型多模态模型进行跨房间3D场景理解
机构 * University of Oxford(牛津大学) ; Microsoft(微软公司) ; Simon Fraser University(西蒙弗雷泽大学)
专题命中 图文多模态 :multimodal(title);分类 cs.CV
AI总结 研究针对现有3D-LLMs不能处理多房间场景问题,提出拓扑感知3D-LLM即CAIRN。其将Transformer注意力与场景层次对齐,通过多种方式增强模型能力。在新基准CAIRN-MR上实验,CAIRN在多房间任务中大幅超越前人,单房间任务也具竞争力。
Comments Project Page: https://oceansdepp.github.io/cairn_web/
BUS:用于高级多模态推理的受脑启发的无监督自我反思
机构 * AAAI Press(美国人工智能协会出版社)
专题命中 图文多模态 :multimodal(title);分类 cs.CV
AI总结 研究针对VLM处理复杂视觉任务的不足,受脑启发提出BUS无监督训练框架,通过反向预测提升其反思推理能力,无需标注数据,与多种微调方法兼容,经实验验证在多任务中有效提升了VLM推理性能。
高熵标记作为视觉-语言模型中的多模态失败点
机构 * The Australia National University(澳大利亚国立大学) ; The University of Queensland(昆士兰大学) ; GE research(GE研究)
专题命中 图文多模态 :multimodal(title);分类 cs.CV
AI总结 本研究揭示视觉-语言模型中约20%的高熵标记集中了不成比例的对抗性影响,并提出基于熵引导的稀疏攻击方法(EGA),实现高攻击成功率与有害率。
Comments 19 Pages,11 figures,8 tables
RSICCLLM:用于遥感图像变化描述的多模态大语言模型
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) ; Great Bay University, Dongguan, China(东莞Great Bay大学,中国) ; Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国) ; Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)
专题命中 图文多模态 :multimodal(title);分类 cs.CV
AI总结 提出首个针对遥感图像变化描述任务的大视觉语言模型后训练框架RSICCLLM,通过数据生成范式、差异感知微调和双负偏好优化,仅7B参数即超越更大规模模型。
Comments Accepted by ECCV 2026
ExDet: 基于跨模态外推与校正的开放域开放词汇检测
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部) ; Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳理工大学计算机科学与人工智能学院) ; School of Artificial Intelligence, Nanchang University(南昌大学人工智能学院)
专题命中 图文多模态 :cross-modal(title);分类 cs.CV
AI总结 提出ExDet框架,通过文本引导外推(TGE)和检测器兼容校正(DCR)模块,无需额外训练即可增强开放域开放词汇检测的跨类别和跨域泛化能力,在多个基准上取得最优性能。
KEPO:基于知识的偏好优化用于多模态推理及其在医学VQA中的应用
机构 * Chapman University(查普曼大学) ; Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) ; University of California, Irvine(加州大学伊文斯分校)
专题命中 图文多模态 :multimodal(title);分类 cs.AI
AI总结 KEPO通过质量门控的在线蒸馏和知识增强的探索策略,提升多模态推理任务的训练稳定性与推理一致性,优于强化学习和在线蒸馏基线。
基于视觉提示的越野制图推理使用多模态大语言模型
机构 * Khalifa University(哈利法大学)
专题命中 图文多模态 :multimodal(title);分类 cs.CV
AI总结 本文提出一种零样本方法,利用SAM2进行环境分割和多模态大语言模型(VLM)进行可行驶区域推理,通过整合分割图像和原始图像实现越野制图推理,无需专门地形模型。
SAGE:面向sink的 grounded 解码用于多模态幻觉缓解
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 图文多模态 :multimodal(title);分类 cs.CV
AI总结 SAGE通过动态调节自注意力机制,实时监控 grounding 可靠性,有效缓解多模态幻觉问题,实验显示在MSCOCO和AMBER基准上取得显著提升。
Comments 25 pages, 6 figures, 7 tables