arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-30 至 2026-07-30 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 11 篇

2503.15846 2026-07-30 cs.CV 版本更新 89%

A Closer Look at Dynamic Scene Graph Generation In the Era of Multimodal Large Language Models

多模态大语言模型时代的动态场景图生成研究

Xuanming Cui, Jaiminkumar Ashokbhai Bhoi, Chionh Wei Peng, Adriel Kuek, Ser Nam Lim

专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV

AI总结 本研究针对多模态大语言模型时代动态场景图生成的局限,从任务设置优化评估指标、基于MLLM改进模型设计,在多个数据集上实现了最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26818 2026-07-30 cs.CV 新提交 83%

Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory

Ripple:基于跨模态循环记忆的实时流音频-视频生成

Yanbo Ding, Zhizhi Guo, Quanyue Song, Yishan He, Zhixiang He, Yongxiang Li, Yali Wang

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司)

专题命中 多模态生成 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出Ripple系统,通过跨模态循环记忆机制及三阶段训练方案,实现480P下约28 FPS的实时流音频-视频生成,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26411 2026-07-30 cs.CV 新提交 79%

Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering

统一多模态模型是否在同一空间中思考?通过跨分支引导的视角

Yu Wang, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究针对统一多模态模型是否共享统一可迁移语义空间的问题,提出跨分支语义引导框架,发现理解分支的引导向量可迁移至生成分支,揭示架构统一不保证语义对齐,该框架可用于探测多模态表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08334 2026-07-30 cs.CL 版本更新 79%

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐

Yada Pruksachatkun, Yixin Wan, Xingrun Chen, Kai-Wei Chang, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22039 2026-07-30 cs.CV 版本更新 79%

OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning

OmniAD:基于多模态推理的工业异常检测与理解

Shifang Zhao, Yiheng Lin, Lu Han, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) Visual Intelligence + X International Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际合作实验室) Key Laboratory of Noise and Vibration Research, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所噪声与振动重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 OmniAD是融合视觉与文本推理的多模态框架,以Text-as-Mask Encoding等技术实现工业异常检测与理解,在MMAD基准性能超Qwen2.5-VL-7B等模型,代码与模型将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27113 2026-07-30 cs.CV 新提交 77%

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Zijian Yu, Chuanbiao Song, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) Ant Group(蚂蚁集团) Sangfor Technologies Inc.(深信服科技股份有限公司)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV

AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24241 2026-07-30 cs.CV cs.AI 版本更新 62%

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

FilmBench:用于电影视频生成的电影级基准测试

Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao, Jinlin Wang, Xiaotong Lv, Peng Han, Zimeng Li, Fanshu Ding, Yushu Wang, Han Wu, Jingjing Chen, Chongxiao Wang, Yanhao Wu, Chenglong Huang, Xiaoqian Zhu, Jie Tian, Hua Li, Jingjing Fan, Mingshuang Tang, Zhong Li, Hengxia Qiang, Weibin Chen, Jinyang Zhen, Bing Zhao, Lin Qu, Jing Li, Hu Wei

机构 * Alibaba Group(阿里巴巴集团) Moku Lab, Hujing Digital Media & Entertainment Group(魔氪实验室,虎鲸数字媒体与娱乐集团) Beijing Film Academy(北京电影学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FilmBench是基于电影学院传统专业电影语言开发的文本到视频和参考到视频基准测试。它从获奖影片反向设计提示,依电影分类法评估,开发自动评估代理并开源核心套件,能再现人类模型排名,指出当前模型在动态美学等方面不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26754 2026-07-30 cs.CV 新提交 57%

StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

StatePlay:用于机制一致性生成的状态感知游戏世界模型

Zijun Lin, Zeqing Wang, Cheston Tan, Bihan Wen, Yeying Jin

机构 * Tencent(腾讯)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出StatePlay,一种状态感知游戏世界模型,采用混合Transformer架构联合预测视觉内容与游戏状态,经实验验证可提升游戏生成的机制保真度。

Comments Project Page: https://jimntu.github.io/stateplay_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08293 2026-07-30 cs.CV 版本更新 57%

Distill, Diffuse, Segment: Unsupervised 3D Semantic Segmentation for Autonomous Driving Based on Multi-Level Distillation and Graph Diffusion

Distill, Diffuse, and Semanticize (DDS): 基于多粒度蒸馏和图扩散的无标注3D场景理解

Yijing Wang, Ruonan Li, Qilin Wang, Rongqiang Zhao, Jie Liu

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Pengcheng Laboratory(鹏城实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 DDS通过多粒度蒸馏和图扩散实现轻量级无标注3D场景理解,提升区域一致性和语义识别,实验显示在多个数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11214 2026-07-30 eess.SP cs.IT math.IT 版本更新 50%

CSI Prediction Using Diffusion Models

基于扩散模型的信道状态信息(CSI)预测

Mehdi Sattari, Javad Aliakbari, Alexandre Graell i Amat, Tommy Svensson

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一种基于扩散模型的新型概率CSI预测框架,分解任务为时间编码器与扩散生成器,研究多种推理方案与骨干,仿真显示其性能优于现有最先进基线模型。

Comments Accepted, IEEE Transactions on Wireless Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13337 2026-07-30 cs.RO 50%

Invisible Servoing: a Visual Servoing Approach with Return-Conditioned Latent Diffusion

Bishoy Gerges, Barbara Bazzana, Nicolò Botteghi, Youssef Aboudorra, Antonio Franchi

机构 * Robotics and Mechatronics group, Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(特文特大学机器人与机电组,电气工程、数学与计算机科学学院) Department of Applied Mathematics, University of Twente(特文特大学应用数学系) Department of Computer, Control and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、控制与管理工程系)

专题命中 多模态生成 :cross-modal(abstract)

Journal ref 2025 International Conference on Unmanned Aircraft Systems (ICUAS)

详情

展开后加载摘要…

URL PDF HTML 收藏