arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-07 至 2026-07-07 共收录 23 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 23 篇

2607.03661 2026-07-07 cs.CV 新提交 89%

From Geometric Labels to Semantic Understanding of Indoor Building Components Using Multimodal Large Language Models

使用多模态大语言模型从几何标签到室内建筑组件的语义理解

Shuju Jing, Chao Yin

机构 * School of Qilu Transportation, Shandong University(山东大学齐鲁交通学院) Guangzhou Institute of Geography, Guangdong Academy of Sciences(广东省地理研究所)

专题命中 图文多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV

AI总结 研究针对室内建筑组件,提出以点云为中心的多模态大语言模型Building-MLLM,通过特定机制解决语义集中问题,开发引擎编译数据集,实验表明其在多任务上表现优异,提升室内组件语言理解。

Comments 46 pages, 13 figures, accepted by Automation in Construction journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04779 2026-07-07 cs.CV 新提交 84%

DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation

DGSeg:用于推理分割的语义-空间引导预测的动态门控

Ruizhe Zeng, Siyu Cao, Lu Zhang, Zhiyong Liu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Nanjing Artificial Intelligence Research of IA(中国科学院自动化所南京人工智能研究院)

专题命中 图文多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 研究推理分割问题,提出DGSeg框架,借助MLLM生成语义和空间线索,经动态门控模块自适应融合预测,抑制噪声或冲突区域,在多基准测试中表现出色。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17395 2026-07-07 cs.CV cs.AI cs.LG 版本更新 84%

SpectralGCD: Spectral Concept Selection and Cross-modal Representation Learning for Generalized Category Discovery

SpectralGCD:用于广义类别发现的光谱概念选择和跨模态表示学习

Lorenzo Caselli, Marco Mistretta, Simone Magistri, Andrew D. Bagdanov

机构 * University of Florence, Media Integration and Communication Center (MICC)(佛罗伦萨大学,媒体整合与通信中心(MICC))

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究广义类别发现问题,提出SpectralGCD方法,利用CLIP跨模态相似性统一表示,通过光谱滤波和知识蒸馏提升性能,相比现有方法计算成本低且精度高。

Comments Accepted at ICLR 2026. Code available at https://github.com/miccunifi/SpectralGCD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03748 2026-07-07 cs.AI 新提交 83%

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

将交错多模态推理作为统一决策过程进行衔接

Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Washington(华盛顿大学) The Chinese University of Hong Kong(香港中文大学) Australian National University(澳大利亚国立大学)

专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 研究统一多模态模型中强化学习优化多轮生成的问题,提出BRAID框架,将文本-图像-文本推理视为统一马尔可夫决策过程,通过单一强化学习目标联合优化文本和视觉生成,实验表明该框架性能优于基线。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09484 2026-07-07 cs.CV 版本更新 83%

Purify then Guide: Rethinking Domain Generalization for Multimodal Face Anti-Spoofing

净化然后引导:重新思考多模态人脸反欺骗的领域泛化

Yingjie Ma, Xun Lin, Zitong Yu, Haonan Wang, Ruixin Zhang, Shouhong Ding, Xin Liu, Xiaochen Yuan, Weicheng Xie, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computing and Information Technology, Great Bay University(大湾区大学计算与信息科技学院) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息处理重点实验室) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室) Tencent Youtu Lab(腾讯优图实验室) School of Psychology, Shanghai Jiao Tong University(上海交通大学心理学院) Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究多模态人脸反欺骗中领域泛化问题,提出MMDA框架,利用CLIP零样本泛化能力,通过去噪和对齐机制提升跨模态对齐泛化性能,含多个模块及策略,实验表明优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02734 2026-07-07 cs.CL cs.AI 新提交 81%

Echoes of Unrest: A Multimodal NLP Framework for Early Warning of Fake News and Violence-Driven Mob Activity

动荡的回声:用于假新闻和暴力驱动的暴民活动早期预警的多模态NLP框架

Md. Maruf Bangabashi, Tahmid Hasan, Golam Mahmud, Md. Mostafijur Rahman, Md. Toufiqur Rahman, Jahanur Biswas

机构 * Department of Computer Science and Engineering, Dhaka International University(达卡国际大学计算机科学与工程系) Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology(孟加拉国工程技术大学计算机科学与工程系)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对社交媒体上错误信息传播引发危害的问题,提出多语言、多模态NLP框架。通过融合多基准数据集创建数据集,集成多种技术进行多模态融合,实验显示该框架在早期错误信息检测中有效。

Comments Accepted for publication as a book chapter (Taylor & Francis, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05222 2026-07-07 cs.CV 新提交 79%

A Multimodal Reasoning Typology for Grounding Chart-Image Coherence in Science Communication

面向科学传播中图表-图像连贯性锚定的多模态推理类型学

Avina Nakarmi, Sohom Sen, Xun Song, Sreyashi Samaddar, Aritra Dasgupta

机构 * New Jersey Institute of Technology(新泽西理工学院) Brooklyn College(布鲁克林学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出R1-R5多模态推理类型学,刻画科学文献中图表、图像与文本的协同推理缺口,可系统识别连贯性锚定状态,缩小不同人群解读科学结论的认知差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03461 2026-07-07 cs.CV cs.LG 新提交 79%

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的力量

Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究统一多模态模型在视觉-语言-动作-世界建模中的作用,基于BAGEL构建WorldBagel框架,通过多任务机器人操作等实验,发现统一不仅便利,更是学习有效模型的关键因素。

Comments Rejected by ECCV 2026, Arxiv Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02592 2026-07-07 cs.CV cs.LG 新提交 79%

H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation

H-OPD:置信感知异构多教师多模态在线策略蒸馏

Qixiang Yin, Huanjin Yao, Yuchen Cai, Jianghao Chen, Ziyi Wang, Min Yang, Fei Su, Zhicheng Zhao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ByteDance(字节跳动) USTC(中国科学技术大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部互动技术与体验系统重点实验室) Zhongguancun Academy(中关村科学城)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究多模态推理的在线策略蒸馏问题,提出H-OPD框架,通过验证异构教师互补性,以令牌级教师仲裁取代任务或样本级路由,结合视觉与文本教师,在多基准测试中性能优越。

Comments Technical report(work-in-progress). Code will be available at \url{https://github.com/buptyqx/H-OPD}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28160 2026-07-07 cs.AI 79%

Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning

按需查看:多模态推理中视觉证据获取的认知调度框架

Yang Zhang, Xiaoshuai Sun, Rui Zhao, Wujin Sun, Yidong Chen, Jiayi Ji, Qian Chen, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception(多媒体可信感知实验室) Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China(教育部高效计算实验室,厦门大学,361005,中国) Sino-Russian ResearchCenter for Digital Economy(中俄数字经济研究中心) Institute of Artificial Intelligence, Xiamen University, China(人工智能研究院,厦门大学,中国) School of Informatics, Xiamen University, China(信息学院,厦门大学,中国) School of Information Engineering, Xiamen Ocean Vocational College, Xiamen 361102, China(信息工程学院,厦门海洋职业技术学院,厦门361102,中国)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出CSMR框架,通过语言模型控制何时调用独立视觉感知模块获取任务相关视觉证据,在零样本设置下多个基准上优于基线方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03245 2026-07-07 cs.LG 新提交 78%

PhenoNEST: A Neuro-Symbolic Framework for Ontology-Aware Multimodal Plant Phenotyping and Trait Discovery

PhenoNEST:用于本体感知多模态植物表型分析和性状发现的神经符号框架

Jayant Ghadge, Soumyashree Kar, Surya S. Durbha

机构 * Centre of Studies in Resources Engineering (CSRE)(资源工程研究中心) Indian Institute of Technology Bombay(孟买印度理工学院)

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 提出构建多模态粒状知识图谱框架,以弥合语义鸿沟,通过蒸馏野外记录提取实体和关系,结合模型与本体对齐,经视觉语言模型生成软图,引入节点连接多模态子图,成功映射野外观察,助力小麦育种。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07403 2026-07-07 cs.CV cs.AI cs.CL cs.LG 版本更新 75%

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

空间思考者:通过密集奖励强化场景图基础的空间推理

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark

机构 * University of Oxford(牛津大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。

Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03624 2026-07-07 cs.CV cs.AI cs.LG 新提交 73%

RADIO1D: Elastic Representations for Condensed Vision Modeling

RADIO1D:用于压缩视觉建模的弹性表示

Greg Heinrich, Mike Ranzinger, Collin McCarthy, Natan Bagrov, Eugene Khvedchenya, Bryan Catanzaro, Jan Kautz, Andrew Tao, Pavlo Molchanov

机构 * NVIDIA(英伟达)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 挑战视觉语言模型需固定基于补丁的2D视觉特征的假设,分析微调视觉编码器,基于发现引入RADIO1D,用多教师知识蒸馏等将图像压缩成1D令牌序列,有强分层总结能力,在多模态基准测试中有优势。

Comments Published as main conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交 70%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04548 2026-07-07 cs.CV cs.AI 新提交 62%

Explainable Novel Category Discovery in Semantic Concept Space

语义概念空间中的可解释新类别发现

Ifrat Ikhtear Uddin, Yang Zhou, KC Santosh, Longwei Wang

机构 * Department of Computer Science, University of South Dakota(南达科他大学计算机科学系) Department of Computer Science and Software Engineering, Auburn University(奥本大学计算机科学与软件工程系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出xNCD框架,在结构化语义概念空间进行基于表示的发现和伪标签分配,通过视觉与语言先验对齐学习无标签概念表示,使发现类别可解释,实验证明其有强发现性能和内在解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04344 2026-07-07 cs.CV cs.AI 新提交 62%

IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation

IRIS:一种通过主题树和场景驱动的VQA生成用于眼表疾病的智能视觉语言系统

Hao Wei, Wenjin Qi, Dasen Dai, Minqing Zhang, Wu Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对眼表疾病领域缺乏多模态数据问题,引入IRIS系统。构建IRIS-120K数据集,提出协同数据生成范式,含主题发现树和场景驱动策略,使4B参数VLM性能达最优。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02575 2026-07-07 cs.CV cs.AI 新提交 62%

Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models

标准条件上下文学习:评估视觉语言模型中的标准转移适应性

Kaiyun Yang, Ruilin Yang, Zhimin Yao, J. Wang, Wei Ge

机构 * Megvii Technology Inc., Beijing, China(美科科技有限公司,北京,中国)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究提出标准条件上下文学习(CC-ICL)新设置,模型需从上下文推断潜在标准并据此调整预测。为此提出两个评估指标,构建CC-Bench基准。实验发现多数模型有边界偏差,简单多标准训练可改善。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08521 2026-07-07 cs.CV cs.AI 版本更新 62%

VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models

VISOR:视觉语言模型中用于输出重定向的基于视觉输入的转向

Mansi Phute, Ravikumar Balakrishnan

机构 * Georgia Institute of Technology(佐治亚理工学院) HiddenLayer, Inc(HiddenLayer公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究提出VISOR方法,通过优化视觉输入实现对视觉语言模型行为的精细控制,在关键对齐任务中验证其有效性,且具有低开销等优势,但也揭示了视觉通道安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04694 2026-07-07 cs.CV 新提交 57%

Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data?

解决缺失的第一步:视觉语言模型能否标准化原始异构医学数据?

Xin Chen, Dongliang Xu, Cunhao Zhu, Xudong Luo, Haoyang Lyu, Xiaoxiao Sun, Serena Yeung-Levy, Yue Yao

机构 * Shandong University(山东大学) Stanford University(斯坦福大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 研究视觉语言模型应用于医学AI时原始医学数据标准化问题,通过构建基准测试,让模型处理原始数据集文件夹,评估其多种能力,发现即使最佳模型端到端成功率也低,凸显该环节是医学AI诊断关键瓶颈。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04356 2026-07-07 cs.CV 版本更新 57%

Stage-wise Attention-Guided Region Sequencing for Adversarial Attacks on Large Vision-Language Models

用于对大型视觉语言模型进行对抗攻击的逐阶段注意力引导区域排序

Jaehyun Kwak, Nam Cao, Boryeong Cho, Segyu Lee, Sumyeong Ahn, Se-Young Yun

机构 * KAIST(韩国科学技术院) KENTECH(KENTECH研究院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对大型视觉语言模型的有针对性对抗攻击,基于注意力分析提出逐阶段注意力引导区域排序,介绍了黑盒区域排序框架SAGA,在多个模型上取得了最先进的攻击成功率和最佳不可感知性。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04816 2026-07-07 cs.RO 新提交 50%

CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models

CAC-VLA:用于视觉-语言-动作模型的上下文门控动作条件调节

Yifu Xiong, Wenhao Yu, Jiaxuan Lin, Bojun Zou, Jiahao Li, Lu Zhang, Yanyong Zhang, Jianmin Ji

机构 * University of Science and Technology of China (USTC)(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究视觉-语言-动作模型,提出上下文门控动作条件调节框架CAC-VLA,在视觉语言模型中学习轻量级潜在动作接口,训练模型预测潜在动作并通过上下文门调节动作专家,实验验证其有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04609 2026-07-07 cs.RO 新提交 50%

SEAM: Smooth Execution of Action-Chunked Motion for Vision-Language-Action Policies

SEAM:用于视觉-语言-动作策略的动作块运动平滑执行

Dijia Zhan, Xuemiao Xu, Jinyi Li, Jie Tang

机构 * South China University of Technology(南方科技大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究视觉-语言-动作策略中动作块执行的多模态分叉问题,提出无训练推理时的SEAM方法,利用同步执行见解,通过速度引导损失转向机制减少边界抖动和块过渡不连续性。

Comments 8 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04630 2026-07-07 cs.SE 版本更新 50%

Foundation Models for Software Engineering of Cyber-Physical Systems: the Road Ahead

网络物理系统软件工程的基础模型:未来之路

Chengjie Lu, Pablo Valle, Jiahui Wu, Erblin Isaku, Hassan Sartaj, Aitor Arrieta, Shaukat Ali

专题命中 图文多模态 :multimodal(abstract)

AI总结 探讨基础模型在网络物理系统软件工程中的应用,指出除语言模型外其他模型潜力大。通过文献等得出前瞻性研究路线图,突出挑战与机会,还讨论了应用模型的常见挑战,为研究和实践提供指导。

Comments 3 figures, 20 tables, 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏