arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-28 至 2026-07-28 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 11 篇

2607.22603 2026-07-28 cs.AI 新提交 83%

Group Preference Collapse in Personalized Multimodal Large Language Models

个性化多模态大语言模型中的群体偏好崩溃

Fan Lyu, Wenqi Zhang, Joost van de Weijer

机构 * Computer Vision Center, Universitat Autònoma de Barcelona(计算机视觉中心,巴塞罗那自治大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 研究个性化多模态大语言模型中群体偏好崩溃问题,提出PrefMoE框架,它分离配置文件信息与偏好表示,分解偏好,保留个性化残差并通过单独路径路由因素,实验表明该框架能改善偏好敏感个性化并减少偏好崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24157 2026-07-28 cs.CV 新提交 81%

UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling

UniGen-AR:通过自回归建模统一视觉生成

Zhipeng Bao, Zhen Zhu, Nupur Kumari, Anurag Bagchi, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) Toyota Research Institute(丰田研究院)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 研究统一视觉生成问题,提出UniGen-AR框架,将通用多模态语言模型与视觉自回归解码器配对,能为多任务生成图像值输出,相比基于扩散的基线,推理延迟低达19倍,确立视觉自回归建模为统一视觉生成的高效主干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05607 2026-07-28 cs.CV cs.AI 版本更新 81%

DreamCAD: Scaling Multi-modal CAD Generation using Differentiable Parametric Surfaces

DreamCAD: 通过可微参数曲面实现多模态CAD生成的扩展

Mohammad Sadil Khan, Muhammad Usama, Rolandos Alexandros Potamias, Didier Stricker, Muhammad Zeshan Afzal, Jiankang Deng, Ismail Elezi

机构 * DFKI RPTU Imperial College London(帝国理工学院伦敦分校) Huawei London Research Center(华为伦敦研究中心)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 DreamCAD通过可微参数曲面直接生成可编辑的BRep,无需CAD特定注释,实现多模态CAD生成的扩展,并在多个基准测试中取得最佳性能。

Comments For Caption Dataset: https://huggingface.co/datasets/SadilKhan/CADCap-1M

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23673 2026-07-28 cs.CV 新提交 79%

Contrastive Parameter Disentanglement for Multi-modal Remote Sensing Image Generation

用于多模态遥感图像生成的对比参数解缠

Yu Zhang, Wenda Zhao, Haojun Tang, Haipeng Wang

机构 * School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院) Unit 92728 of PLA(中国人民解放军92728部队)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 针对现有遥感图像生成方法局限,提出对比参数解缠框架,通过对比参数解缠模块、解缠优化策略及查询-键结构转移机制,实现多模态遥感图像高质量生成,在相关任务中性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23523 2026-07-28 cs.AR 新提交 78%

CircuitWeave: Topology-Behavior Alignment for Executable Multimodal RTL Generation

CircuitWeave:用于可执行多模态RTL生成的拓扑-行为对齐

Jiahao Feng, Haiyan Qin, Zhiwei Xie, Wang Kang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究如何从自然语言规范生成RTL,提出CircuitWeave合同介导多模态框架,从原理图和文本提取合同并融合,通过联合目标监督相关过程,在生成可执行RTL上取得较好效果,部分指标高于无原理图的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23472 2026-07-28 cs.CV 新提交 70%

VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation

VIPER:用于物理上合理的视频生成的视觉上下文物理推理

Tianxiao Chen, Hanmo Chen, Huajin Chen, Bo Li, Qi Ye, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24110 2026-07-28 cs.CV cs.LG physics.optics 新提交 70%

BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion

超越融合:用于无校准红外超分辨率和红外-可见光融合的自对齐潜在扩散

Minchong Chen, Xiaoyun Yuan, Minyu Cao, Jianing Zhang, Jun Zhang, Shuyang Liu, Xiaokang Yang

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对移动红外-可见光成像中跨传感器未对准问题,提出超越融合框架,通过引入跨模态自对齐模块及未对准增强模块,实现无校准条件下的红外超分辨率和红外-可见光融合,经实验验证了其有效性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19942 2026-07-28 cs.CV cs.AI 版本更新 62%

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

G-MAD:用于多视图RGB-T航空目标检测的基于游戏的数据生成框架

Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

机构 * LIG Defense&Aerospace(LIG国防与航空航天公司) GIST(韩国科学技术院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对航空目标检测中数据集构建的问题,提出基于游戏的G-MAD数据生成框架,可解决视点控制、数据对齐及标注成本等问题,支持多视图相机放置等功能,还构建并发布了AMOD基准。

Comments ACM Multimedia 2026 (Supplementary Material Included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05382 2026-07-28 cs.CV cs.AI 版本更新 62%

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

超越可教内容的搜索:拓展智能体视觉生成的知识边界

Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Waterloo(滑铁卢大学) Qwen Applications(通义千问应用) Imperial College London(帝国理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉生成器的世界知识瓶颈,构建专用数据集与基准,提出教-搜协同训练框架定位动态知识边界,实现知识驱动的可迭代视觉生成性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23917 2026-07-28 cs.CV 新提交 57%

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

凝视到文本生成:超越人类注意力的分类解码

Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

机构 * Stony Brook University(纽约州立大学石溪分校) Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出将凝视解码为自然语言描述人类目标的新问题,构建Gazette框架,基于多模态大语言模型,利用新颖策略合成出声思考转录本并指令调优,使其在多任务凝视解码中达最优性能,能推断多样场景下人类目标意图。

Comments To appear in European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01572 2026-07-28 cs.LG cs.AI physics.app-ph 57%

Reconstructing Multi-Scale Physical Fields from Extremely Sparse Measurements with an Autoencoder-Diffusion Cascade

使用自编码器-扩散级联从极度稀疏测量中重建多尺度物理场

Letian Yi, Tingpeng Zhang, Mingyuan Zhou, Guannan Wang, Quanke Su, Zhilu Lai

机构 * Internet of Things Thrust(物联网方向) Intelligent Transportation Thrust(智能交通方向) Marine Hydrodynamic Research Facility(海洋流体研究设施) Department of Civil and Environmental Engineering(土木与环境工程系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出Cascaded Sensing框架,通过粗尺度确定性估计和细尺度条件扩散模型级联,解决极度稀疏测量下物理场重建的不适定性和多模态后验问题。

Comments 34 pages,22 figures

Journal ref Journal of Computational Physics, Volume 565, 15 November 2026, Article 115214

详情

展开后加载摘要…

URL PDF HTML 收藏