arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-14 至 2026-07-14 共收录 21 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 21 篇

2607.11364 2026-07-14 cs.LG cs.AI cs.MM 新提交 81%

BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

BackgroundMellow:一种用于叙事驱动的丰富电影音效生成的多模态凝聚框架

Ajitesh Jamulkar, Aritra Hazra

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI、cs.MM

AI总结 多模态AI中为文本叙事生成电影音效困难,BackgroundMellow框架将其视为编排与信号处理问题,通过主 - 专家架构、Tango2模型、背景音乐检索器及NLP模块实现,经实验验证在时间同步等方面有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09892 2026-07-14 eess.IV cs.AI 新提交 79%

Next-Dense-Stride Prediction for Multimodal Autoregressive Visual Modeling

用于多模态自回归视觉建模的下密集步长预测

Chicago Y. Park, Jialin Mao, Xiaojian Xu, Taha Kass-Hout, Ulugbek S. Kamilov, Cao Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) GE HealthCare(通用电气医疗)

专题命中 多模态生成 :multimodal(title);cross-modal(abstract);分类 cs.AI

AI总结 研究提出DenseAR范式,将自回归图像生成重构成下密集步长预测,解决现有模型局限。基于此扩展为统一模型处理多模态和成像任务,在医学和自然图像验证,在多对比脑MRI及ImageNet上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10287 2026-07-14 cs.CV 新提交 79%

InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation

InterPet4D:用于宠物运动生成的多模态4D人宠交互数据集

Yichen Peng, Jyun-Ting Song, Chen-Chieh Liao, Kris Kitani, Hideki Koike, Erwin Wu

机构 * Institute of Science Tokyo(东京科学研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 因缺乏高质量数据集,人宠交互研究不足。本文提出InterPet4D多模态数据集及InterPetMoGen框架,通过同步多视图系统记录交互并标注,含多类型数据,所提模型FID得分11.21,优于基线,有效模拟人宠交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10004 2026-07-14 cs.CV 新提交 79%

Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning

模型指导绘图:用于统一多模态推理的自适应视觉门控

Wenxi Gao, Guanxi Lu, Didi Zhu, Hao Mark Chen, Quan Deng, Zhican Wang, Jiankang Deng, Hongxiang Fan

机构 * Imperial College London(伦敦帝国理工学院) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对统一多模态模型在视觉推理中存在的问题,提出基于生成意图和视觉保真度两个内部信号的AdaViG方法,可动态评估视觉步骤,避免误导性视觉证据进入推理过程,提升了准确率并降低计算量和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11886 2026-07-14 cs.CV 新提交 77%

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型

Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动Seed) Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04673 2026-07-14 cs.AI 版本更新 74%

Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message

木马提示:通过伪造助手消息来破解对话式多模态模型

Wei Duan, Li Qian

专题命中 多模态生成 :multimodal(title);分类 cs.AI

AI总结 研究针对对话式多模态模型的安全漏洞,提出木马提示越狱技术,通过伪造对话历史绕过安全机制,在谷歌Gemini-2.0上实验显示其攻击成功率高于现有方法,揭示对话AI安全缺陷,呼吁转变验证范式。

Comments We stopped working on this idea because we realized that there was a paper submitted before it that took almost identical approach

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11594 2026-07-14 cs.AI cs.GR 新提交 70%

MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

MAGIC:利用大语言模型生成具有可导航多场景的游戏世界并感知过渡

Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 研究利用大语言模型生成多场景游戏世界时面临的问题,提出MAGIC系统,通过四阶段管道将自然语言提示转化为可运行项目,解决跨场景一致性等问题,在新基准测试中表现出色,生成可执行项目且过渡识别指标优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11643 2026-07-14 cs.RO cs.AI 新提交 57%

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

小米机器人-U0:基于世界基础模型的统一具身合成

Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li

机构 * Xiaomi Robotics(小米机器人)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究针对基础模型应用于具身场景受限问题,提出小米机器人-U0多模态自回归模型,将具身生成扩展为基础图像和视频生成的形式,联合优化多种生成任务,在多方面取得领先成果,证明基础世界模型可用于具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10678 2026-07-14 cs.AI 新提交 57%

Personalized Emotional Intelligence in Generative AI through Symbolic Affective Reasoning

通过符号情感推理实现生成式人工智能中的个性化情商

Qing Lin, Mengmi Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究旨在解决生成式人工智能中缺乏个性化情感理解等问题,提出EROS混合框架,结合符号推理与深度学习,利用大规模数据集发现情感规则等,通过可扩展记忆库实现个性化,实验表明其能有效引发目标情感反应并适应个体偏好,为相关AI系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10535 2026-07-14 cs.CV 新提交 57%

Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation

通过聚类截断提高自回归文本到图像生成中的样本多样性

Trang Nguyen, Shuang Wu, Runyan Tan, Phillip Howard

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Thoughtworks(Thoughtworks公司)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 研究自回归图像生成模型中样本多样性问题,指出其关键属性限制现有方法。提出无p聚类新解码策略,在四个自回归T2I模型和两个数据集上评估,该策略能解锁最大多样性并保持图像质量与提示对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10159 2026-07-14 cs.AI 新提交 57%

UNIT: Unleash Large Language Models Potential for Graph Continual Learning

UNIT:释放大语言模型在图连续学习中的潜力

Tairan Huang, Yili Wang, Beibei Hu, Yiting Shi, Qiutong Li, Changlong He, Jianliang Gao

机构 * Central South University(中南大学) Hongkong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hunan Institute of Engineering(湖南工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 针对图连续学习面临的语义-结构分离和知识转移不平衡问题,提出UNIT框架,通过微调大语言模型、引入不确定感知锚点生成机制和结构融合建模,提升模型适应性与跨任务知识保留能力,在图连续学习任务中达最优性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10388 2026-07-14 cond-mat.mtrl-sci cs.AI 新提交 57%

The evolution of AI from image interpretation toward scientific inference in nanoparticle electron microscopy

人工智能在纳米颗粒电子显微镜中从图像解释到科学推理的演变

Evropi Toulkeridou, Jiafei Li, Leonardo Lari, Panagiotis Grammatikopoulos

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 综述纳米颗粒电子显微镜中人工智能从图像解释到科学推理的演变,围绕颗粒表征挑战,回顾从传统机器学习到多种先进方法,探讨整合多方面数据,评估现有方法利弊,强调其在下一代纳米颗粒表征及加速材料发现中的作用。

Comments Main article: 34 pages, 8 figures (including Graphical Abstract), 5 tables. Appendix: 18 pages, 1 figure, 4 tables. This manuscript has been submitted (after invitation) to Advanced Intelligent Discovery for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13184 2026-07-14 cs.CV 57%

Triad: Empowering LMM-based Anomaly Detection with Vision Expert-guided Visual Tokenizer and Manufacturing Process

Triad: 通过视觉专家引导的视觉标记器和制造过程增强基于LMM的异常检测

Yuanze Li, Shihao Yuan, Haolin Wang, Qizhang Li, Ming Liu, Chen Xu, Guangming Shi, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Lab(鹏城实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Triad通过引入视觉专家引导的标记器和制造过程,提升基于LMM的工业异常检测性能。

Journal ref In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp. 21917-21926. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11631 2026-07-14 stat.CO stat.ML 新提交 50%

Markov Chain Monte Carlo with Diffusion Paths

带扩散路径的马尔可夫链蒙特卡罗

Han Chen, Sifan Liu, Jun Yang

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对多模态分布采样难题,提出沿扩散路径插值的方法,通过变分估计中间得分,引入MAD - Path采样器消除偏差,经谱隙分析明确路径特性,量化误差影响,实验表明其在全局探索和模式权重估计上优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11027 2026-07-14 cs.RO 新提交 50%

SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation

SegDiff:用于一致且自适应机器人操作的分段轨迹扩散

Haidong Cao, Wenjun Cao, Quanhao Li, Sicheng Xie, Zhiying Du, Jiaqi Leng, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University, China(可信具身人工智能研究院,复旦大学,中国) Shanghai Key Laboratory of Multimodal Embodied AI, China(上海多模态具身人工智能重点实验室,中国)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 研究针对机器人模仿学习中现有方法的不足,提出SegDiff闭环视觉运动策略,分解示范为运动段并预测连续轨迹,利用扩散模型等提出动态时间集成机制,在多场景中性能优于现有方法,能处理长时间依赖并保持实时适应与控制稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11018 2026-07-14 cs.RO 新提交 50%

Whole-Body Semantic-to-Actuation Grounding of Elephant-Inspired Soft-Trunk Motion via Lightweight Flow Matching

通过轻量级流匹配实现大象启发式软躯干运动的全身语义到驱动的基础

Tingcong Liu, Tongshun Chen, Siyi Ma, Yuhao Wang, Aye Phyu Phyu Aung, Ibrahim Alsarraj, J. Senthilnath, Bo An, Ke Wu

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对近距离人机交互中类似躯干机器人关联开放词汇响应难的问题,提出基于轻量级流匹配的全身语义到驱动基础框架,将多模态大语言模型响应转换为元组,参数化轨迹并采样运动,实验显示其提升关联正确性、减少推理时间,还提升了人机交互满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10288 2026-07-14 cs.RO 新提交 50%

PIER-Flow: Physics-Informed Efficient Rectified Flow for Real-Time Mobile Robot Navigation

PIER-Flow:用于实时移动机器人导航的物理信息高效整流流

Shibo Li, Zhongcheng Wang, Jiahe Cao, Jianhua Yang, Ke Wu

机构 * School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究针对移动机器人在复杂环境下导航问题,提出PIER-Flow策略。通过将MPC专家知识融入常微分方程,利用并行潜在采样等实现单步动作生成,经物理信息训练目标及异步架构提升性能,在模拟和实际部署中均取得良好效果,显著加速规划并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17527 2026-07-14 cs.RO 版本更新 50%

Safer Trajectory Planning with CBF-guided Diffusion Model for Unmanned Aerial Vehicles

基于CBF引导扩散模型的无人机安全轨迹规划

Peiwen Yang, Shiyu Bai, Weisong Wen, Yixin Gao, Jiahao Hu

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出AeroTrajGen框架,通过CBF引导采样提升扩散模型在无人机轨迹生成中的安全性与敏捷性,减少碰撞率94.7%。

Comments Some equations need to be checked

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05576 2026-07-14 cs.RO 版本更新 50%

Task Parameter Extrapolation via Learning Inverse Tasks from Forward Demonstrations

通过从正向演示中学习逆向任务进行任务参数外推

Serdar Bahar, Fatih Dogangun, Matteo Saveriano, Yukie Nagai, Emre Ugur

机构 * Bogazici University(博雅科技大学) University of Trento(特伦托大学) The University of Tokyo(东京大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种基于任务逆向学习的联合学习方法,通过利用辅助正向演示实现准确且高效的知识转移,以解决机器人学习中的泛化问题。

Comments Accepted for publication in IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03564 2026-07-14 cs.LG 版本更新 50%

CoGenCast: A Coupled Autoregressive-Flow Generative Framework for Time Series Forecasting

CoGenCast:用于时间序列预测的耦合自回归流生成框架

Mingyue Cheng, Yaguo Liu, Daoyu Wang, Xiaoyu Tao, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对时间序列预测需兼顾语义理解与随机建模的问题,提出CoGenCast框架,将预训练大语言模型与流匹配机制结合,通过修改注意力拓扑重配置模型,集成流匹配机制捕捉动态,实现多模态预测和跨域统一训练,实验显示性能具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16565 2026-07-14 eess.SY cs.SY 版本更新 50%

Agentic AI-RAN Empowering Synergetic Sensing, Communication, Computing, and Control

智能人工智能无线接入网络助力协同感知、通信、计算和控制

Lingxiao Sun, Zhaoyang Zhang, Zihan Lin, Zirui Chen, Weijie Zhou, Zhaohui Yang, Tony Q. S. Quek

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究6G低空无线网络中,智能人工智能无线接入网络(Agentic AI-RAN)架构助力协同SC3任务执行。提出面向任务的架构解决资源受限边缘环境异构负载协调难题,经无人机系统原型验证,该框架在6G关键任务低空网络中具可行性。

Comments 7 pages, 5 figures, 1 table; revised version with minor corrections

详情

展开后加载摘要…

URL PDF HTML 收藏