arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-03 至 2026-06-03 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 12 篇

2602.12221 2026-06-03 cs.CV 79%

Best of Both Worlds: Multimodal Reasoning and Generation via Unified Discrete Flow Matching

两全其美:通过统一离散流匹配实现多模态推理与生成

Onkar Susladkar, Tushar Prakash, Gayatri Deshmukh, Kiet A. Nguyen, Jiaxun Zhang, Adheesh Juvekar, Tianshu Bao, Lin Chai, Sparsh Mittal, Inderjit S Dhillon, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Research(谷歌研究) Sony Research, India(索尼印度研究) Indian Institute of Technology, Roorkee(印度理工学院罗尔基分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出UniDFlow框架,通过任务特定低秩适配器解耦理解与生成,并利用基于参考的多模态偏好对齐优化忠实性与可控性,在多个基准上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03236 2026-06-03 cs.AI 77%

Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents

先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架

Zhijie Ding, Weinan Hong, Zicheng Zhu, Lei Li, Dezhi Kong, Hao Wang, Peng Zhou, Xuchu Jiang, Jiaming Xu

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司) Zhongnan University of Economics and Law(中南财经政法大学) Jilin University(吉林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 提出预推理感知框架(PRPF),通过轻量级多模态主动感知器(MPP)进行干预门控和上下文压缩,仅在需要时激活主动代理推理器(PAR),以解决主动移动代理中干预时机与方式决策的目标错位和冗余推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03183 2026-06-03 cs.MM cs.CV cs.SD eess.AS 75%

Inference-Time Scaling for Joint Audio-Video Generation

联合音视频生成的推理时缩放

Jaemin Jung, Kyeongha Rho, Inkyu Shin, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Luma AI

专题命中 多模态生成 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 针对联合音视频生成中多目标优化的挑战,提出多验证器框架与自适应奖励加权算法,在无需额外训练的情况下显著提升语义对齐、感知质量和音视频同步。

Comments Accepted by Transactions on Machine Learning Research (TMLR). Project page: https://jung-jaemin.github.io/ITS-AVGen-Proj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03322 2026-06-03 cs.LG cs.AI 74%

Multi-Modal Graph Neural Network with Transformer-Guided Adaptive Diffusion for Preclinical Alzheimer Classification

多模态图神经网络与Transformer引导的自适应扩散用于临床前阿尔茨海默病分类

Jaeyoon Sim, Minjae Lee, Guorong Wu, Won Hwa Kim

机构 * Pohang University of Science and Technology(浦项科学技术大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态生成 :multi-modal(title);分类 cs.AI

AI总结 提出一种结合扩散核与多头注意力的图神经网络框架,通过Transformer引导自适应扩散过程,有效融合多模态特征,提升临床前阿尔茨海默病分类性能并识别关键脑区。

Comments 10 pages, Accepted to MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31530 2026-06-03 eess.AS cs.SD 70%

UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion

UNISON: 通过深度LLM融合的统一声音生成与编辑框架

Zhaoqing Li, Haoning Xu, Jingran Su, Yaofang Liu, Zhefan Rao, Huimeng Wang, Jiajun Deng, Tianzi Wang, Zengrui Jin, Rui Liu, Haoxuan Che, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) Huawei Research Hong Kong(华为香港研究)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 eess.AS

AI总结 提出UNISON,一个基于潜在扩散的统一框架,通过层间深度LLM融合和多任务架构,实现语音生成、声音生成和音频编辑,在多个任务上达到或超越专业模型性能,且参数量减少约4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07265 2026-06-03 cs.CV cs.AI cs.CL 67%

WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation

WISE: 一种基于世界知识的文本到图像生成语义评估方法

Yuwei Niu, Munan Ning, Mengren Zheng, Weiyang Jin, Bin Lin, Peng Jin, Jiaqi Liao, Chaoran Feng, Fanqing Meng, Kunpeng Ning, Bin Zhu, Li Yuan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对现有文本到图像生成模型缺乏复杂语义理解和世界知识整合评估的问题,提出WISE基准,包含25个子领域的1000个精心设计的提示,并引入WiScore指标评估知识-图像对齐,实验表明当前模型在整合世界知识方面存在显著局限。

Comments Accepted to ICML 2026. We have also released an updated version of the benchmark, WISE_Verified. Please refer to https://github.com/PKU-YuanGroup/WISE for the latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03132 2026-06-03 cs.CL 57%

DMT-CBT: Longitudinal Therapeutic State Modeling for CBT Counseling

DMT-CBT:面向CBT咨询的纵向治疗状态建模

Chang Liu, Shuyi Zhang, Changsheng Ma, Yongfeng Tao, Minqiang Yang, Bin Hu

机构 * School of Information Science and Engineering, Lanzhou University(信息科学与工程学院,兰州大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 提出DMT-CBT框架,通过跨会话结构化治疗状态、多模态行为基础与工具增强干预,解决现有方法将CBT咨询简化为局部回复生成的问题,实现纵向治疗状态动态建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17149 2026-06-03 cs.LG cs.AI 57%

TimeOmni-VL: Unified Models for Time Series Understanding and Generation

TimeOmni-VL:统一时间序列理解与生成的模型

Tong Guan, Sheng Pan, Johan Barthelemy, Zhao Li, Yujun Cai, Cesare Alippi, Ming Jin, Shirui Pan

机构 * Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出TimeOmni-VL框架,通过保真双向映射和理解引导生成,首次统一时间序列的理解与生成任务。

Comments Accepted by the Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10055 2026-06-03 cs.CV 57%

Physical Plausibility Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance

通过 HCM-GRPO 实现物理合理性推理:赋能紧凑模型以获得卓越性能

Zhiyuan Hu, Zheng Sun, Yi Wei, Long Yu

机构 * Tsinghua University(清华大学) Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在物理合理性推理中数据缺乏和推理能力弱的问题,提出包含大规模数据集和 HCM-GRPO 方法的完整解决方案,以紧凑模型超越大规模开源和闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03926 2026-06-03 cs.HC cs.LG 50%

DiffUNet^2: Bidirectional Prediction, Probabilistic Generation and Collaborative Visual Discovery for Scientific Data

DiffUNet^2: 科学数据的双向预测、概率生成与协同视觉发现

Mengdi Chu, Jiaxin Yang, Angus G. Forbes, Nathan Debardeleben, Earl Lawrence, Ayan Biswas, Han-Wei Shen

机构 * Ohio State University(俄亥俄州立大学) NVIDIA Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 多模态生成 :any-to-any(abstract)

AI总结 提出基于扩散模型的条件生成框架DiffUNet^2,实现时间序列的双向任意步预测与概率分布捕获,并结合交互式可视化支持科学探索。

Comments 12 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03563 2026-06-03 cond-mat.mtrl-sci cond-mat.mes-hall 50%

Reversible Superdense Ordering of Tetragonal Lithium in a Layered Material

层状材料中四方锂的可逆超密有序

Natalie L. Williams, Stephen D. Funni, Sihun Lee, Drake Niedzielski, Mingjia Fang, Josh Leeman, Ratnadwip Singha, Saif Siddique, Tyler Hendee, Shiyu Xu, Jeffrey Kaaret, Giovanni Sartorello, Nicole A. Benedek, Leslie M. Schoop, Lynden A. Archer, Tomás A. Arias, Judy J. Cha

专题命中 多模态生成 :multimodal(abstract)

AI总结 利用多模态扫描透射电子显微镜结合成像、光谱和衍射,原位观测全固态电化学电池中锂的插层过程,发现LaTe3中三种有序相及高浓度下具有四方对称性的三层超密锂相,实现锂有序和动力学的完整追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00366 2026-06-03 cs.LG math.OC 50%

GLENS: Global Search via Learning from Solver Iterates with Diffusion Models

GLENS: 通过扩散模型从求解器迭代中学习进行全局搜索

Anjian Li, Bartolomeo Stellato, Ryne Beeson

机构 * Department of Electrical and Computer Engineering, Princeton University(电气工程与计算机科学系,普林斯顿大学) Department of Operations Research and Financial Engineering, Princeton University(运筹学与金融工程系,普林斯顿大学) Department of Mechanical and Aerospace Engineering, Princeton University(机械与航空航天工程系,普林斯顿大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出GLENS方法,利用扩散模型学习求解器迭代过程中的局部几何结构,生成高质量且多样化的初始猜测,加速多模态非凸优化问题的全局搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏