arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4946 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4946 篇

2511.12207 2026-03-17 cs.CV 79%

Mixture of States: Routing Token-Level Dynamics for Multimodal Generation

状态混合:用于多模态生成的路由令牌级动态

Haozhe Liu, Ding Liu, Mingchen Zhuge, Zijian Zhou, Tian Xie, Sen He, Yukang Yang, Shuming Liu, Yuren Cong, Jiadong Guo, Hongyu Xu, Ke Xu, Kam-Woh Ng, Juan C. Pérez, Juan-Manuel Pérez-Rúa, Tao Xiang, Wei Liu, Shikun Liu, Jürgen Schmidhuber

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MoS,一种多模态扩散模型的融合范式,通过灵活的状态交互融合模态。核心是可学习的令牌路由器,通过时间步和输入依赖的交互对模态隐藏状态进行去噪,实现令牌级特征与扩散轨迹的精确对齐。

Comments Accepted to CVPR 2026; Homepage: https://haozheliu-st.github.io/mos-homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24267 2026-03-17 cs.CV 79%

FakeScope: Large Multimodal Expert Model for Transparent AI-Generated Image Forensics

FakeScope:大型多模态专家模型用于透明的AI生成图像取证

Yixuan Li, Yu Tian, Yipo Huang, Wei Lu, Shiqi Wang, Weisi Lin, Anderson Rocha

机构 * College of Computing, City University of Hong Kong(城市大学 computing 学院) School of Data Science and Artificial Intelligence, Chang’an University(长安大学数据科学与人工智能学院) School of Computer Science and Engineering, Ministry of Education Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-Sen University(中山大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学 computing 与数据科学学院) Artificial Intelligence Lab. (Recod.ai) at the University of Campinas(坎皮纳斯大学人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 FakeScope通过多模态专家模型提升AI生成图像的检测能力,提供可解释的取证分析,实现高精度识别与深入解释,具备零样本检测和跨生成器泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13070 2026-03-16 cs.CV 79%

Mitigating Memorization in Text-to-Image Diffusion via Region-Aware Prompt Augmentation and Multimodal Copy Detection

通过区域感知提示增强和多模态复制检测缓解文本到图像扩散中的记忆化

Yunzhuo Chen, Jordan Vice, Naveed Akhtar, Nur Al Hasan Haldar, Ajmal Mian

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) Curtin University(科廷大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出区域感知提示增强和多模态复制检测方法,通过增强提示多样性与检测复制行为,提升文本到图像扩散模型的生成质量与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08820 2026-03-16 cs.CV 79%

Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing

Omni-Video 2:基于MLLM条件扩散模型的统一视频生成与编辑扩展

Hao Yang, Zhiyu Tan, Jia Gong, Luozheng Qin, Hesen Chen, Xiaomeng Yang, Yuqing Sun, Yuetan Lin, Mengping Yang, Hao Li

专题命中 多模态生成 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出Omni-Video 2,通过连接预训练多模态大语言模型与视频扩散模型,实现视频生成与编辑的统一。核心方法是利用MLLM生成明确的目标描述以指导生成过程,并通过轻量适配器高效注入多模态条件token,提升复杂编辑任务性能。

Comments Technical Report, Project: https://howellyoung-s.github.io/Omni-Video2-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14327 2026-03-16 cs.CV 79%

MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer

MoVieDrive:基于多模态多视角视频扩散变换器的城市场景合成

Guile Wu, David Huang, Dongfeng Bai, Bingbing Liu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出MoVieDrive,通过多模态多视角视频扩散变换器生成城市驾驶场景视频,实现多模态数据生成与可控生成。

Comments CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11556 2026-03-13 cs.CV 79%

Enhancing Image Aesthetics with Dual-Conditioned Diffusion Models Guided by Multimodal Perception

通过多模态感知引导的双条件扩散模型增强图像美学

Xinyu Nan, Ning Wang, Yuyao Zhai, Mei Yang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出双监督图像美学增强模型DIAE,通过多模态感知和双分支监督框架提升图像美学质量与内容一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10702 2026-03-12 cs.CV 79%

UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations

UniCom: 通过压缩的连续语义表示实现统一多模态建模

Yaqi Zhao, Wang Lin, Zijian Zhang, Miles Yang, Jingyuan Chen, Wentao Zhang, Zhao Zhong, Liefeng Bo

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 UniCom通过压缩连续语义表示实现统一多模态建模,有效解决离散化与连续建模的矛盾,提升生成性能和图像可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09538 2026-03-11 cs.CV 79%

Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization

迈向统一多模态交错生成的群体相对策略优化

Ming Nie, Chunwei Wang, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿恒智能科技有限公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于强化学习的后训练策略,通过群体相对策略优化框架提升统一多模态模型的交错生成能力,实验表明其在质量与连贯性上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09536 2026-03-11 cs.HC cs.MM 79%

Dynamic Multimodal Expression Generation for LLM-Driven Pedagogical Agents: From User Experience Perspective

动态多模态表达生成用于基于大语言模型的教育代理:从用户体验视角

Ninghao Wan, Jiarun Song, Fuzheng Yang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出基于大语言模型的动态多模态表达生成方法,通过生成协调的语音和手势指令,提升教育代理的沉浸感和自然表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12130 2026-03-11 cs.CL 79%

PRISM of Opinions: A Persona-Reasoned Multimodal Framework for User-centric Conversational Stance Detection

观点PRISM:一种基于人设的多模态框架用于以用户为中心的对话立场检测

Bingbing Wang, Zhixin Bai, Zhengda Jin, Zihan Wang, Xintong Song, Jingjie Lin, Sixuan Li, Jing Li, Ruifeng Xu

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东省新型安全智能技术重点实验室) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学) Macau University of Science and Technology, Hong Kong, China(澳门科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 PRISM通过多模态和用户人设分析,提升对话立场检测的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24099 2026-03-10 cs.CV 79%

Unified Multi-Modal Interactive & Reactive 3D Motion Generation via Rectified Flow

通过修正流实现统一的多模态交互与反应3D运动生成

Prerit Gupta, Shourya Verma, Ananth Grama, Aniket Bera

机构 * Department of Computer Science Purdue University(计算机科学系 哈佛大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 DualFlow通过修正流实现多模态双人运动生成,提升运动质量与节奏同步性。

Comments Under review at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06544 2026-03-09 cs.CV 79%

Modeling and Measuring Redundancy in Multisource Multimodal Data for Autonomous Driving

多源多模态数据中冗余建模与测量用于自动驾驶

Yuhan Zhou, Mehri Sattari, Haihua Chen, Kewei Sha

机构 * Dept. of Information Science University of North Texas Denton, Texas, USA(信息科学系 诺克斯维尔大学 德顿, 德克萨斯州, 美国) Dept. of Data Science University of North Texas Denton, Texas, USA(数据科学系 诺克斯维尔大学 德顿, 德克萨斯州, 美国)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究了自动驾驶中多源多模态数据的冗余问题,通过实验展示了删除冗余标签对目标检测性能的提升作用,并揭示了数据质量与性能之间的直接联系。

Comments This paper has been accepted by the Fourth IEEE International Conference on Mobility: Operations, Services, and Technologies (MOST) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06507 2026-03-09 cs.CV 79%

Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis

自监督流匹配用于可扩展的多模态合成

Hila Chefer, Patrick Esser, Dominik Lorenz, Dustin Podell, Vikash Raja, Vinh Tong, Antonio Torralba, Robin Rombach

机构 * Black Forest Labs(黑森林实验室) MIT(麻省理工学院)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 Self-Flow通过自监督流匹配方法,在无需外部监督的情况下提升多模态生成的性能和扩展性。

Comments project webpage: https://bfl.ai/research/self-flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06147 2026-03-09 cs.CV 79%

Longitudinal NSCLC Treatment Progression via Multimodal Generative Models

多模态生成模型用于非小细胞肺癌治疗进展的纵向预测

Massimiliano Mantegna, Elena Mulero Ayllón, Alice Natalina Caragliano, Francesco Di Feola, Claudia Tacconi, Michele Fiore, Edy Ippolito, Carlo Greco, Sara Ramella, Philippe C. Cattin, Paolo Soda, Matteo Tortora, Valerio Guarrasi

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma, Italy(人工智能与计算机系统单位,工程系,罗马大学生物医学学院) Multi-Specialist Clinical Institute for Orthopaedic Trauma Care (COT), Messina, Italy(骨科创伤护理多学科临床研究所(COT),意大利Messina) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University, Sweden(诊断与介入系,放射物理,生物医学工程,乌梅大学,瑞典) Operative Research Unit of Radiation Oncology, Fondazione Policlinico Universitario Campus Bio-Medico, Rome, Italy(放射肿瘤手术研究单位,大学生物医学学院基金会,罗马,意大利) Research Unit of Radiation Oncology, Department of Medicine and Surgery, Università Campus Bio-Medico di Roma, Italy(放射肿瘤研究单位,医学与外科系,罗马大学生物医学学院,意大利) Department of Biomedical Engineering, University of Basel, Allschwil, Switzerland(生物医学工程系,巴塞尔大学,瑞士Allschwil) Department of Naval, Electrical, Electronics and Telecommunications Engineering, University of Genoa, Italy(海军、电气、电子与电信工程系,热那亚大学,意大利)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出虚拟治疗框架,利用多模态生成模型预测NSCLC治疗进展,验证扩散模型在生成稳定肿瘤演变轨迹方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06043 2026-03-09 cs.CV 79%

Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models

通过理解学习生成:基于理解的内在奖励用于统一多模态模型

Jiadong Pan, Liang Li, Yuxin Peng, Yu-Ming Tang, Shuohuan Wang, Yu Sun, Hua Wu, Qingming Huang, Haifeng Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GvU机制,通过内在奖励提升统一多模态模型的生成能力,同时增强其视觉理解能力,缩小理解与生成之间的能力差距。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05800 2026-03-09 cs.DC cs.AI 79%

StreamWise: Serving Multi-Modal Generation in Real-Time at Scale

StreamWise: 实时大规模多模态生成服务

Haoran Qiu, Gohar Irfan Chaudhry, Chaojie Zhang, Íñigo Goiri, Esha Choukse, Rodrigo Fonseca, Ricardo Bianchini

机构 * Microsoft Azure Research(微软Azure研究院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

AI总结 StreamWise通过实时播客视频生成,整合LLM、文本转语音和视频音频生成,实现高效多模态实时服务,兼顾延迟、成本和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04868 2026-03-06 cs.AI 79%

K-Gen: A Multimodal Language-Conditioned Approach for Interpretable Keypoint-Guided Trajectory Generation

K-Gen:一种多模态语言条件方法用于可解释的关键点引导轨迹生成

Mingxuan Mu, Guo Yang, Lei Chen, Ping Wu, Jianxun Cui

机构 * Harbin Institute of Technology Chongqing Research Inst. of HIT(哈尔滨工业大学重庆研究院) Changan Automobile Co., Ltd Chongqing, China(长安汽车有限公司重庆)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 K-Gen通过多模态语言模型结合关键点引导方法,提升自动驾驶轨迹生成的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04307 2026-03-05 cs.CV 79%

Dual Diffusion Models for Multi-modal Guided 3D Avatar Generation

多模态引导的3D人像生成双扩散模型

Hong Li, Yutang Feng, Minqi Meng, Yichen Yang, Xuhui Liu, Baochang Zhang

机构 * Beihang University(北航大学) KAUST(卡塔尔科技大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出PromptAvatar,通过双扩散模型实现多模态引导的3D人像生成,提升生成质量与效率。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21628 2026-03-04 cs.CL 79%

RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning

RuCL:基于分层评分标准的课程学习用于多模态大语言模型推理

Yukun Chen, Jiaming Li, Longze Chen, Ze Gong, Jingpeng Li, Zhen Qin, Hengyu Chang, Ancheng Xu, Zhihao Yang, Hamid Alinejad-Rokny, Qiang Qu, Bo Zheng, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) School of Biomedical Engineering, UNSW Sydney(新南威尔士大学生物医学工程学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 RuCL通过分层评分标准课程学习提升多模态大语言模型的推理能力,实现7.83%的准确率提升。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01253 2026-03-03 cs.CV 79%

Cross-Modal Guidance for Fast Diffusion-Based Computed Tomography

跨模态引导用于快速扩散基于计算机断层扫描

Timofey Efimov, Singanallur Venkatakrishnan, Maliha Hossain, Haley Duba-Sullivan, Amirkoushyar Ziabari

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种无需重新训练扩散模型的跨模态引导方法,用于提升稀疏视图中子CT的重建质量。

Comments Accepted at the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06027 2026-03-03 cs.CV eess.IV 79%

OSDM-MReg: Multimodal Image Registration based One Step Diffusion Model

OSDM-MReg: 基于一步扩散模型的多模态图像配准

Xiaochen Wei, Weiwei Guo, Wenxian Yu, Feiming Wei, Dongying Li

机构 * Shanghai Key Laboratory of Intelligent Sensing and Recognition(上海智能感知与识别重点实验室) Shanghai Jiao Tong University(上海交通大学) Center of Digital Innovation(数字创新中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 OSDM-MReg通过一步扩散模型和多模态融合策略,实现多模态图像配准的高效准确配准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24183 2026-03-02 cs.CV cs.LG 79%

A multimodal slice discovery framework for systematic failure detection and explanation in medical image classification

一种用于医学图像分类中系统性故障检测和解释的多模态切片发现框架

Yixuan Liu, Kanwal K. Bhatia, Ahmed E. Fetit

机构 * Department of Computing, Imperial College London, UK(帝国理工学院 computing 部,英国) Aival, London, UK(Aival,伦敦,英国)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出了一种多模态切片发现框架,用于医学图像分类中的系统性故障检测与解释,展示了其在故障发现和解释生成方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05236 2026-02-26 cs.CV 79%

Unified Reward Model for Multimodal Understanding and Generation

多模态理解和生成的统一奖励模型

Yibin Wang, Yuhang Zang, Hao Li, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出统一奖励模型,通过联合学习多种视觉任务提升多模态理解和生成的性能。

Comments project page: https://codegoat24.github.io/UnifiedReward/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21319 2026-02-26 cs.LG cs.CV cs.RO 79%

Uncertainty-Aware Diffusion Model for Multimodal Highway Trajectory Prediction via DDIM Sampling

面向多模态高速公路轨迹预测的不确定性感知扩散模型 via DDIM采样

Marion Neumeier, Niklas Roßberg, Michael Botsch, Wolfgang Utschick

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出cVMDx模型,通过DDIM采样提升效率和鲁棒性,实现高效多模态轨迹预测并增强不确定性估计能力。

Comments Accepted as a conference paper in IEEE Intelligent Vehicles Symposium (IV) 2026, Detroit, MI, United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09609 2026-02-24 cs.CV 79%

Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing

Tele-Omni: 一种用于视频生成与编辑的统一多模态框架

Jialun Liu, Tian Li, Xiao Cao, Yukuo Ma, Gonghu Shang, Haibin Huang, Chi Zhang, Xiangzhen Chang, Zhiyong Huang, Jiakui Hu, Zuoxin Li, Yuanzhi Liang, Cong Liu, Junqi Liu, Robby T. Tan, Haitong Tang, Qizhen Weng, Yifan Xu, Liying Yang, Xiaoyan Yang, Peng Yu, Shiwen Zhang, Xuelong Li

机构 * TeleAI

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Tele-Omni是一种统一多模态框架,通过解析文本、图像和参考视频指令,实现视频生成与编辑的灵活控制,提升时间一致性和视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15650 2026-02-18 cs.CV 79%

Concept-Enhanced Multimodal RAG: Towards Interpretable and Accurate Radiology Report Generation

概念增强的多模态RAG:迈向可解释且准确的放射科报告生成

Marco Salmè, Federico Siciliano, Fabrizio Silvestri, Paolo Soda, Rosa Sicilia, Valerio Guarrasi

机构 * Department of Engineering(工程系) Research Unit of Artificial Intelligence and Computer Systems(人工智能与计算机系统研究单位) Università Campus Bio-Medico of Roma(罗马大学生物医学校园) Department of Computer, Control and Management Engineering(计算机、控制与管理工程系) Sapienza University of Rome(罗马萨皮恩扎大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering(诊断与介入、辐射物理、生物医学工程系) Umeå University(乌梅拉大学) UniCamillus-Saint Camillus International University of Health Sciences(UniCamillus-圣卡米卢斯国际健康科学大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 概念增强的多模态RAG通过分解视觉表示为可解释的临床概念,提升放射科报告生成的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07139 2026-02-17 cs.CV cs.CR cs.LG 79%

Image Can Bring Your Memory Back: A Novel Multi-Modal Guided Attack against Image Generation Model Unlearning

图像能帮你找回记忆:一种新颖的多模态引导攻击对抗图像生成模型去学习

Renyang Liu, Guanlin Li, Tianwei Zhang, See-Kiong Ng

机构 * Institute of Data Science, National University of Singapore(数据科学研究所,新加坡国立大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 Recall提出一种新颖的多模态引导攻击框架,针对图像生成模型去学习的鲁棒性进行攻击,展示其在对抗有效性、计算效率和语义保真度上的优势。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18956 2026-02-17 cs.AI cs.LG 79%

Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection

训练多模态大推理模型需要更优质的思考:一种用于长链式思考合成与选择的三阶段框架

Yizhi Wang, Linan Yue, Min-Ling Zhang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (SEU), Ministry of Education(计算机网络与信息集成重点实验室(SEU))

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出SynSelect框架,通过三阶段合成与选择生成高质量多模态推理数据,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00787 2026-02-17 cs.CV 79%

Image-to-Brain Signal Generation for Visual Prosthesis with CLIP Guided Multimodal Diffusion Models

基于CLIP引导的多模态扩散模型的图像到脑信号生成用于视觉假体

Ganxi Xu, Zhao-Rong Lai, Yuting Tang, Yonghao Song, Guoxu Zhou, Boyu wang, Jian Zhu, Jinyi Long

机构 * Jinan University, Guangzhou, China Department of Rehabilitation Medicine, The First Affiliated Hospital of Jinan University, Guangzhou, China Western University, Ontario, Canada Guangdong University of Technology, Guangzhou, China Tsinghua University, Beijing, China

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于CLIP引导的多模态扩散模型,实现图像到脑信号的转换,通过交叉注意力机制和空间-时间位置编码生成生物合理的脑信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03866 2026-02-12 cs.DL cs.AI 79%

PaperX: A Unified Framework for Multimodal Academic Presentation Generation with Scholar DAG

PaperX: 一种多模态学术演示生成的统一框架与学者DAG

Tao Yu, Minghui Zhang, Zhiqing Cui, Hao Wang, Zhongtian Luo, Shenghua Chai, Junhao Gong, Yuzhao Peng, Yuxuan Zhou, Yujia Yang, Zhenghao Zhang, Haopeng Jin, Xinming Wang, Yufei Xiong, Jiabing Yang, Jiahao Yuan, Hanqing Wang, Hongzhu Yi, Yan Huang, Liang Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(乌尔姆大学) Peking University(北京大学) Tsinghua University(清华大学) HKUST(GZ)(香港科技大学(广州))

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 PaperX通过Scholar DAG实现多模态学术演示生成的统一框架,提升内容质量和效率。

Comments 29 pages, 9 figures, Project website: https://github.com/yutao1024/PaperX

详情

展开后加载摘要…

URL PDF HTML 收藏