arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-01 至 2026-07-01 共收录 26 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 1 篇

2603.18481 2026-07-01 cs.CV cs.LG 版本更新 77%

T-QPM: Enabling Temporal Out-Of-Distribution Detection and Domain Generalization for Vision-Language Models in Open-World

T-QPM:面向开放世界视觉语言模型的时间分布外检测与域泛化

Aditi Naiknaware, Salimeh Sekeh

机构 * San Diego State University(圣地亚哥州立大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出T-QPM框架,通过时间四元模式匹配和轻量级融合权重学习,增强视觉语言模型在动态环境下的分布外检测和协变量偏移鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2508.08237 2026-07-01 cs.MM cs.AI cs.CV cs.SD eess.AS 版本更新 85%

VGGSounder: Audio-Visual Evaluations for Foundation Models

VGGSounder:基础模型的音视频评估

Daniil Zverev, Thaddäus Wiedemer, Ameya Prabhu, Matthias Bethge, Wieland Brendel, A. Sophia Koepke

机构 * Technical University of Munich, MCML(慕尼黑技术大学,MCML) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) MPI for Intelligent Systems, ELLIS Institute(智能系统Max Planck研究所,ELLIS研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 针对VGGSound数据集在音视频基础模型评估中的标签不完整、类别重叠和模态错位等问题,提出重新标注的多标签测试集VGGSounder,并引入模态混淆指标分析模型性能退化。

Comments Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19127 2026-07-01 cs.LG 版本更新 78%

On Optimizing Multimodal Jailbreaks for Spoken Language Models

关于优化口语语言模型的多模态越狱攻击

Aravind Krishnan, Karolina Stańczak, Dietrich Klakow

机构 * Saarland University(萨尔大学) DFKI GmbH(德国人工智能研究中心) ETH AI Center(ETH人工智能中心)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 提出联合音频文本多模态攻击框架JAMA,通过梯度优化同时扰动语音和文本模态,在四个SLM上实现1.5至20倍于单模态的越狱成功率,并分析其运行机制。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09803 2026-07-01 cs.SD 版本更新 67%

MAGE: Modality-Agnostic Music Generation and Target-Source Extraction

MAGE:模态无关的音乐生成与编辑

Muhammad Usama Saleem, Tejasvi Ravi, Tianyu Xu, Rajeev Nongpiur, Ishan Chatterjee, Mayur Jagdishbhai Patel, Pu Wang

机构 * Google(谷歌) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

AI总结 MAGE提出了一种模态无关框架,统一了多模态音乐生成与混合编辑,通过可控多模态FluxFormer和音频视觉 nexus 对齐机制,实现灵活且高效的音乐生成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2604.06687 2026-07-01 cs.CV 版本更新 57%

RASR: Retrieval-Augmented Semantic Reasoning for Fake News Video Detection

RASR:基于检索的语义推理用于虚假新闻视频检测

Hui Li, Peien Ding, Jun Li, Guoqi Ma, Zhanyu Liu, Ge Xu, Junfeng Yao, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Computer Science and Information Security, Guilin University of Electronic Technology(桂林电子科技大学计算机科学与信息安全学院) School of Computer and Big Data, Minjiang University(闽江学院计算机与大数据学院) Xiamen University(厦门大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RASR框架,通过跨实例语义解析器和检索器、领域引导多模态推理模块和多视图特征解耦融合模块,提升虚假新闻视频检测的准确性和跨域泛化能力。

Comments The paper needs revision, and the experiments need to be expanded

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18242 2026-07-01 cs.CV 版本更新 57%

EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning

EgoVITA:学习规划与验证以实现自我中心视频推理

Yogesh Kulkarni, Pooyan Fazli

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出EgoVITA框架,通过先规划自我中心动作序列再以第三方视角验证时空一致性的方法,提升自我中心视频推理的准确性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17581 2026-07-01 cs.LG cs.CV 版本更新 57%

EgoCogNav: Cognition-aware Human Egocentric Navigation

EgoCogNav: 认知感知的人类自我中心导航

Zhiwen Qiu, Ziang Liu, Wenqian Niu, Tapomayukh Bhattacharjee, Saleh Kalantari

机构 * Cornell University(康奈尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出EgoCogNav多模态自我中心导航框架,联合预测路径不确定性、轨迹和头部运动,并引入CEN数据集,实验表明其能学习与人类扫描、犹豫等行为相关的感知不确定性。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2507.00263 2026-07-01 cs.CV cs.LG cs.NE 版本更新 77%

Room Scene Discovery and Grouping in Unstructured Vacation Rental Image Collections

非结构化度假租赁图像集合中的房间场景发现与分组

Vignesh Ram Nithin Kappagantula, Shayan Hassantabar

机构 * Expedia Group(Expedia集团)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV

AI总结 针对度假租赁平台图片缺乏结构化分类的问题,提出一种低延迟、样本高效的机器学习流水线,通过监督式房间类型检测、重叠检测和聚类算法实现房间分组,并利用多模态大语言模型识别床型,显著优于对比学习和预训练嵌入聚类方法。

Comments Presented at the Two-sided Marketplace Optimization Workshop, KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 3 篇

2604.15917 2026-07-01 cs.CV 版本更新 57%

Making Image Editing Easier via Adaptive Task Reformulation with Agentic Executions

通过具有代理执行的自适应任务重构使图像编辑更易于实现

Bo Zhao, Kairui Guo, Runnan Du, Haiyang Sun, Pengshan Wang, Huan Yang, Kun Gai, Yixin Cao, Wei Ji

机构 * Nanjing University(南京大学) Beijing Institute of Technology(北京理工大学) College of Artificial Intelligence, China University of Petroleum (Beijing)(中国石油大学(北京)人工智能学院) Beijing University of Posts and Telecommunications(北京邮电大学) Fudan University(复旦大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 本文提出通过自适应任务重构框架提升图像编辑性能,通过代理分析和反馈优化任务描述,改进编辑效果,尤其在复杂案例中表现显著。

Comments 9pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09731 2026-07-01 cs.DC cs.AI 版本更新 57%

SMART: When is it Actually Worth Expanding a Speculative Tree?

SMART: 在什么情况下扩展推测树实际上是有价值的?

Lifu Wang, Pan Zhou

机构 * Singapore Management University(新加坡管理大学)

专题命中 多模态生成 :MLLM(abstract_cn);分类 cs.AI

AI总结 SMART系统通过运行时树构建优化,提升生成速度,通过边际效益-成本分析,在不同硬件和批量规模下实现平均20%的额外加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09100 2026-07-01 cs.CV cs.RO 版本更新 57%

Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch

基于本体感知和多接触触觉的物理 grounded 的 3D 生成重建在手部遮挡下

Gabriele Mario Caddeo, Pasquale Marra, Lorenzo Natale

机构 * Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种多模态、物理 grounded 的方法,用于在严重手部遮挡下进行度量尺度的无遮挡物体重建和姿态估计,通过本体感知和多接触触觉信号提升重建精度和物理一致性。

Comments 29 pages, 10 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 8 篇

2511.14286 2026-07-01 cs.CV 版本更新 83%

NeuralBoneReg: An Instance-Specific Label-Free Point Cloud-Based Method for Multi-Modal Bone Surface Registration

NeuralBoneReg:一种用于多模态骨表面注册的实例特定无标签点云方法

Luohong Wu, Matthias Seibold, Nicola A. Cavalcanti, Yunke Ao, Roman Flepp, Aidana Massalimova, Lilian Calvet, Philipp Fürnstahl

机构 * Research in Orthopedic Computer Science, Balgrist University Hospital, University of Zurich(骨科计算机科学研究所,巴尔格里斯大学医院,苏黎世大学) AI Center, ETH Zurich(人工智能中心,苏黎世联邦理工学院)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出NeuralBoneReg,一种自监督的基于点云的骨表面注册框架,通过隐式神经无符号距离场和MLP注册模块实现多模态数据间的鲁棒对齐,在多个数据集上达到或超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21173 2026-07-01 cs.RO cs.CV 版本更新 83%

Multimodal Benchmark for Safety Assessment in Industrial Inspection Scenarios

工业检测场景安全评估的多模态基准

Zeyi Liu, Shuang Liu, Jihai Min, Zhaoheng Zhang, Jun Cen, Pengyu Han, Songqiao Hu, Zihan Meng, Xiao He, Donghua Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) DAMO Academy, Alibaba Group(阿里巴巴达摩院) School of Automation, Southeast University(东南大学自动化学院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。

Comments 14 pages, 6 figures, Accepted by Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17294 2026-07-01 cs.CL cs.AI cs.LG 版本更新 76%

From Multimodal Perception to Strategic Reasoning: A Survey on AI-Generated Game Commentary

从多模态感知到策略推理:AI生成游戏评论综述

Qirui Zheng, Xingbo Wang, Keyuan Cheng, Yunlong Lu, Muhammad Asif Ali, Lingfeng Li, Yongyi Wang, Wenxin Li

机构 * Peking University(北京大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

AI总结 本文提出统一框架,将AI生成游戏评论分为描述性、分析性和背景性三类,综述方法、数据集和评估指标,并指出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17028 2026-07-01 cond-mat.mtrl-sci physics.ins-det 版本更新 71%

Accelerating Structure-Property Relationship Discovery with Multimodal Machine Learning and Self-Driving Microscopy

利用多模态机器学习和自驱动显微镜加速结构-性能关系发现

Jiawei Gong, Danqing Ma, Ralph Bulanadi, Robert Moore, Rama Vasudevan, Lianfeng Zhao, Yongtao Liu

专题命中 多模态评测 :multimodal(title)

AI总结 提出结合自主显微镜与双新颖深度核学习及双变分自编码器的框架,用于高效采集光谱数据并构建结构-性能关系图,应用于钙钛矿薄膜揭示了纳米结构特征与迟滞行为的关联。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30599 2026-07-01 cs.CV 版本更新 70%

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing

Goku:百万级通用指令视频编辑数据集与基准

Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Tencent Hunyuan(腾讯混元)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出首个百万级多任务视频编辑数据集Goku,包含200万高质量指令对齐对,并设计高效数据合成流程和渐进过滤系统,基于此提出双分支模型Goku-Edit及包含1000个测试用例的基准Goku-Bench,在指令遵循上提升8%。

Comments Project Page: https://flying-sky999.github.io/Goku.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29672 2026-07-01 cs.CL 版本更新 57%

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分

William Orwig, Roger E. Beaty

机构 * Harvard University(哈佛大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08758 2026-07-01 eess.IV cs.CV 版本更新 57%

M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

M3CoTBench:医学图像理解中多模态大语言模型的思维链基准测试

Juntao Jiang, Jiangning Zhang, Yali Bi, Jinsheng Bai, Weixuan Liu, Weiwei Jin, Zhucun Xue, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学) Zhejiang Provincial People’s Hospital(浙江省人民医院) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出M3CoTBench基准,通过多层级难度数据集和专用评估指标,系统评测多模态大语言模型在医学图像理解中的思维链推理正确性、效率、影响和一致性。

Comments 39 pages, 8 figures; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24561 2026-07-01 cs.CV 版本更新 57%

RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios

RGBT-GroundBench: 超越RGB的复杂真实世界场景中的视觉定位

Tianyi Zhao, Jiawen Xi, Linhui Xiao, Junnan Li, Xue Yang, Maoxun Yuan, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学人工智能研究院、虚拟现实技术与系统国家重点实验室) Pengcheng Laboratory(鹏城实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 提出首个大规模RGB-热红外视觉定位基准RGBT-GroundBench,包含4万+图像和3级细粒度标注,统一评估协议支持RGB/热红外/融合输入,揭示低照度下性能显著下降,并引入参考基线RGBT-VGNet。

Comments 40pages, 9figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 3 篇

2511.00810 2026-07-01 cs.CV cs.AI cs.CL cs.HC cs.LG 版本更新 87%

GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding

GUI-AIMA: 对齐内在多模态注意力与上下文锚点以实现GUI定位

Shijie Zhou, Viet Dac Lai, Hao Tan, Jihyung Kil, Wanrong Zhu, Changyou Chen, Ruiyi Zhang

机构 * University at Buffalo(布法罗大学) Adobe Research(Adobe研究院)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 GUI-AIMA通过多模态注意力对齐与上下文锚点,实现高效的GUI定位,无需坐标生成,提升数据效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17442 2026-07-01 cs.CV cs.AI 版本更新 62%

REMSA: Foundation Model Selection for Remote Sensing via a Constraint-Aware Agent

REMSA:通过约束感知代理进行遥感基础模型选择

Binger Chen, Tacettin Emre Bök, Behnood Rasti, Volker Markl, Begüm Demir

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) U AI(5U AI) Technische Universität Berlin & BIFOLD(柏林工业大学 & BIFOLD)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出REMSA,一种基于结构化数据库RS-FMD的约束感知代理,通过自然语言查询自动选择遥感基础模型,结合元数据检索与上下文学习,在专家评估基准中优于多种基线。

Comments Code and data available at https://github.com/be-chen/REMSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19600 2026-07-01 cs.SE cs.AI cs.CL 版本更新 62%

Human-Agent Collaborative Paper-to-Page Crafting

人机协作的论文到网页制作

Qianli Ma, Siyu Wang, Yilin Chen, Yinhao Tang, Yixiang Yang, Chang Guo, Bingjie Gao, Zhening Xing, Yanan Sun, Zhipeng Zhang

机构 * AutoLab, SAI, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出AutoPage多智能体系统,通过粗到细的流水线将论文转化为交互式网页,并引入Checker智能体验证和人工检查点,在15分钟内以低于0.1美元的成本生成高质量网页。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 1 篇

2606.29805 2026-07-01 cs.CV 版本更新 79%

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO AI中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

9. 其他多模态 3 篇

2603.23455 2026-07-01 cs.CV 版本更新 79%

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测

Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Roboflow

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29629 2026-07-01 cs.DC 版本更新 78%

Energy-Efficient Multimodal Inference Serving with Tri-serve

能效多模态推理服务:Tri-serve

Ziyang Jia, Sara Rashidi Golrouye, Laxmi Bhuyan, Benjamin Kubwimana, Devashree Tripathy, Zexin Li, Cong Liu, Daniel Wong

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 针对多模态推理服务中GPU硬件频率管理导致的三种能效问题,提出软件DVFS控制器Tri-serve,联合优化依赖停顿、算术强度影响和热节流,实现22%能效提升且无延迟或吞吐量损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17415 2026-07-01 eess.IV cs.CV cs.LG 版本更新 57%

Structured SIR: Efficient and Expressive Importance-Weighted Inference for High-Dimensional Image Registration

Structured SIR: 高效且富有表现力的重要性加权推断用于高维图像配准

Ivor J. A. Simpson, Neill D. F. Campbell

机构 * University of Sussex(萨塞克斯大学) University College London(伦敦大学学院) University of Bath(巴斯大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出Structured SIR方法,结合采样重要性重采样与低秩加稀疏Cholesky精度因子的协方差参数化,实现高维3D图像配准中高效且多模态的不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏