arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-23 至 2026-03-23 共收录 73 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2511.17910 2026-03-23 cs.CL 79%

L2V-CoT: Cross-Modal Transfer of Chain-of-Thought Reasoning via Latent Intervention

L2V-CoT:通过潜在干预实现链式推理的跨模态转移

Yuliang Zhan, Xinyu Tang, Han Wan, Jian Li, Ji-Rong Wen, Hao Sun

专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CL

AI总结 本文提出L2V-CoT方法,通过潜在干预将链式推理从LLM转移到VLM,利用低频潜在表示提升多步推理能力,实验表明优于无训练基线和监督方法。

Comments AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17246 2026-03-23 cs.LG 67%

On the Cone Effect and Modality Gap in Medical Vision-Language Embeddings

关于医学视觉-语言嵌入中的锥效应与模态间隙

David Restrepo, Miguel L Martins, Chenwei Wu, Luis Filipe Nakayama, Diego M Lopez, Stergios Christodoulidis, Maria Vakalopoulou, Enzo Ferrante

机构 * CentraleSupélec, Université Paris-Saclay, France(中央理工巴黎高等学院,巴黎萨克雷大学,法国) University of Porto, Portugal(葡萄牙波尔图大学) University of Michigan, USA(美国密歇根大学) Federal University of São Paulo, Brazil(巴西圣保罗联邦大学) Universidad del Cauca, Colombia(哥伦比亚考卡大学) Universidad de Buenos Aires, Argentina(阿根廷布宜诺斯艾利斯大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文研究了视觉语言模型中的锥效应及其对多模态性能的影响,通过轻量级机制调控模态间隙,发现医学数据集对间隙调节更敏感,但过度消除间隙并非最优,任务相关分离更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20116 2026-03-23 cs.CV cs.AI 62%

Chain-of-Adaptation: Surgical Vision-Language Adaptation with Reinforcement Learning

链式适应:基于强化学习的手术视觉-语言适应

Jiajie Li, Chenhui Xu, Meihuan Liu, Jinjun Xiong

机构 * University at Buffalo(布法罗大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出链式适应框架,通过强化学习整合领域知识,保持模型推理和感知能力,在手术基准测试中实现更高的准确性和更稳定的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19531 2026-03-23 cs.CV cs.AI 62%

dinov3.seg: Open-Vocabulary Semantic Segmentation with DINOv3

dinov3.seg: 基于DINOv3的开放词汇语义分割

Saikat Dutta, Biplab Banerjee, Hamid Rezatofighi

机构 * IITB-Monash Research Academy(IITB-莫纳什研究学院) IIT Bombay(印度理工学院班加罗尔) Monash University(莫纳什大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出dinov3.seg,通过改进DINOv3模型实现开放词汇语义分割,结合文本嵌入与视觉特征,提升复杂场景下的分割精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19678 2026-03-23 cs.CV 57%

Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification

视觉-语言属性解耦与强化用于终身人物重识别

Kunlun Xu, Haotong Cheng, Jiangmeng Li, Xu Zou, Jiahuan Zhou

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan, China(华中科技大学人工智能与自动化学院,武汉,中国)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VLADR方法,通过视觉-语言属性解耦与强化提升跨域知识迁移,增强抗遗忘与泛化能力,实验表明在抗遗忘和泛化能力上优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18282 2026-03-23 cs.CV 57%

CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning

CycleCap: 通过自监督循环一致性微调提升VLMs的描述性能

Marios Krestenitis, Christos Tzelepis, Konstantinos Ioannidis, Stefanos Vrochidis, Ioannis Kompatsiaris, Georgios Tzimiropoulos, Shaogang Gong, Ioannis Patras

机构 * Queen Mary, University of London(伦敦大学玛丽女王学院) Centre for Research and Technology Hellas(希腊研究中心) City St George’s, University of London(伦敦大学圣乔治学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出CycleCap,通过自监督循环一致性训练提升VLMs的图像描述性能,利用GRPO优化策略,基于重建图像与原始图像相似性作为奖励信号,无需标注数据即可提高描述准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24837 2026-03-23 cs.CV 57%

ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models

ZOO-Prune:基于零阶梯度估计的训练自由token剪枝方法用于视觉-语言模型

Youngeun Kim, Youjia Zhang, Huiling Liu, Aecheon Jung, Sunwoo Lee, Sungeun Hong

机构 * Amazon(亚马逊公司) Sungkyunkwan University(成均馆大学) Inha University(inha大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ZOO-Prune方法,通过零阶梯度估计在视觉-语言模型中实现无需训练的token剪枝,实验表明其在剪枝94.4%token的同时保持精度,并提升推理效率2.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2306.02393 2026-03-23 cs.RO cs.CV 79%

EgoSpot:Egocentric Multimodal Control for Hands-Free Mobile Manipulation

EgoSpot:面向无手移动操作的视角多模态控制

Ganlin Zhang, Deheng Zhang, Longteng Duan, Guo Han, Yuqian Fu, Danda Pani Paudel, Luc Van Gool, Eric Vollenweider

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zurich(苏黎世联邦理工学院) SJTU(上海交通大学) Microsoft(微软公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种基于微软HoloLens 2混合现实头显的无手控制框架,通过眼动、头部动作和语音指令融合实现机器人移动和机械臂操作的实时控制,提升无障碍交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19831 2026-03-23 eess.AS cs.AI cs.MM 67%

Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech?

Gesture2Speech: 手部动作能多大程度上塑造表现性语音?

Lokesh Kumar, Nirmesh Shah, Ashishkumar P. Gudmalwar, Pankaj Wasnik

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出Gesture2Speech框架,利用视觉手势线索调节合成语音的语调,通过多模态MoE架构动态融合语言内容和手势特征,提升语音自然度和手势与语调的同步性。

Comments Accepted at The 2nd International Workshop on Bodily Expressed Emotion Understanding (BEEU) at AAAI 2026 [non-archival]

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20165 2026-03-23 cs.SD eess.AS 57%

Audio Avatar Fingerprinting: An Approach for Authorized Use of Voice Cloning in the Era of Synthetic Audio

音频人像指纹:在合成音频时代授权使用语音克隆的方法

Candice R. Gerstner

机构 * Research Directorate and AI Security Center(研究部和人工智能安全中心)

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出音频人像指纹技术,用于验证合成语音是否由授权身份生成,通过扩展现有说话人验证模型并引入新数据集解决合成语音授权使用验证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19468 2026-03-23 cs.SD eess.AS 57%

Listen First, Then Answer: Timestamp-Grounded Speech Reasoning

先听再回答:基于时间戳的语音推理

Jihoon Jeong, Pooneh Mousavi, Mirco Ravanelli, Cem Subakan

机构 * Mila-Quebec AI Institute(魁北克AI研究所) Université Laval(拉瓦尔大学) Concordia University(康科迪亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出基于强化学习的时间戳接地策略,使语音大模型在推理时更关注音频内容,提升多模态推理的准确性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19279 2026-03-23 cs.CL 57%

Multilingual Hate Speech Detection and Counterspeech Generation: A Comprehensive Survey and Practical Guide

多语言仇恨言论检测与反仇恨言论生成:全面综述与实用指南

Zahra Safdari Fesaghandis, Suman Kalyan Maity

机构 * Bilkent University(比尔肯特大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文综述并指导多语言仇恨言论检测与反仇恨言论生成,分析单语言系统在非英语和混合语言环境中的不足,提出三阶段框架,整合最新NLP进展,强调数据稀缺、公平性与多模态解决方案。

Comments 29 pages, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19350 2026-03-23 cs.CL 57%

Modeling Turn-Taking with Semantically Informed Gestures

通过语义引导的手势建模轮流交替

Varsha Suresh, M. Hamza Mughal, Christian Theobalt, Vera Demberg

机构 * Saarland University(萨尔兰大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔兰信息学校区)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过引入DnD Gesture++数据集,结合文本、音频和手势的混合专家框架,研究语义引导的手势在多模态轮流交替建模中的作用。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2603.19565 2026-03-23 cs.CV cs.AI cs.LG 62%

PFM-VEPAR: Prompting Foundation Models for RGB-Event Camera based Pedestrian Attribute Recognition

基于RGB事件相机的行人属性识别的PFM-VEPAR:用于基础模型的提示方法

Minghe Xu, Rouying Wu, ChiaWei Chu, Xiao Wang, Yu Li

机构 * City University of Macau(澳门城市大学) Zhuhai College of Science and Technology(珠海科学技术学院) Macau University of Science and Technology(澳门科学大学) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PFM-VEPAR,通过轻量级DCT和IDCT提取事件域特征,结合外部记忆库和Hopfield网络提升行人属性识别的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19546 2026-03-23 cs.LG cs.AI cs.CV 62%

Subspace Kernel Learning on Tensor Sequences

张量序列的子空间核学习

Lei Wang, Xi Ding, Yongsheng Gao, Piotr Koniusz

机构 * Griffith University(格里菲斯大学) Data61 CSIRO University of New South Wales(新南威尔士大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UKTL框架,通过不确定性驱动的子空间加权和可扩展的Nyström线性化,实现对多模式张量的高效学习,取得最先进的性能和有意义的模式洞察。

Comments Accepted at the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18062 2026-03-23 cs.CV cs.AI 62%

S3T-Former: A Purely Spike-Driven State-Space Topology Transformer for Skeleton Action Recognition

S3T-Former:一种纯粹由脉冲驱动的状态空间拓扑变换器用于骨骼动作识别

Naichuan Zheng, Hailun Xia, Zepeng Sun, Weiyi Li, Yujia Wang

机构 * School of Information and Communication Engineering(信息与通信工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) International School(国际学校) School of Economics and Management(经济管理学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出S3T-Former,一种专为高效骨骼动作识别设计的脉冲驱动变换器,通过多流解剖脉冲嵌入和横向脉冲拓扑路由实现稀疏事件流,提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20186 2026-03-23 cs.CV 57%

Improving Image-to-Image Translation via a Rectified Flow Reformulation

通过修正流重新公式化改进图像到图像转换

Satoshi Iizuka, Shun Okamoto, Kazuhiro Fukui

机构 * University of Tsukuba(茨口大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出I2I-RFR方法,通过将标准图像到图像回归网络重新解释为连续时间传输模型,提升图像转换性能,保留传统监督训练流程,增强感知质量和细节保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06344 2026-03-23 cs.CV cs.LG 57%

Hyper-STTN: Hypergraph Augmented Spatial-Temporal Transformer Network for Trajectory Prediction

Hyper-STTN:基于超图的时空变换网络用于轨迹预测

Weizheng Wang, Baijian Yang, Sungeun Hong, Wenhai Sun, Byung-Cheol Min

机构 * School of Applied and Creative Computing, Purdue University(普渡大学应用与创意计算学院) Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(印第安纳大学布卢明顿分校计算机科学系和智能系统工程系) Department of Applied Artificial Intelligence, Sungkyunkwan University(成均馆大学应用人工智能系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Hyper-STTN,通过构建多尺度超图和时空变换器,有效建模人群轨迹预测中的群体和个体交互,实验表明其优于现有方法。

Comments To appear in ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19571 2026-03-23 cs.CV 57%

CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management

CurveStream: 通过曲率感知的层次视觉记忆管理提升MLLMs在流媒体视频理解中的性能

Chao Wang, Xudong Tan, Jianjian Cao, Kangcong Li, Tao Chen

机构 * College of Future Information Technology, Fudan University(未来信息科技学院,复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 CurveStream通过曲率感知的层次视觉记忆管理框架,在流媒体视频理解中实现显著性能提升,实验表明其在多个基准测试中均优于现有方法,达到新状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19481 2026-03-23 cs.CV 57%

Narrative Aligned Long Form Video Question Answering

叙事对齐的长视频问答

Rahul Jain, Keval Doshi, Burak Uzkent, Garin Kessler

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出NA-VQA基准,评估长视频中的深度时间与叙事推理能力,通过88部完整电影和4.4K开放性问题测试模型整合分散叙事信息的能力,提出Video-NaRA框架提升远距离推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10518 2026-03-23 cs.CV 57%

VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning

VR-Thinker: 通过图像推理提升视频奖励模型

Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

机构 * CUHK MMLab(香港中文大学多模态实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Nanjing University(南京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VR-Thinker框架,通过图像推理操作和可配置视觉记忆窗口提升视频奖励模型的推理精度与可靠性,实现在视频偏好基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19564 2026-03-23 cs.LG 50%

Wearable Foundation Models Should Go Beyond Static Encoders

可穿戴基础模型应超越静态编码器

Yu Yvonne Wu, Yuwei Zhang, Hyungjun Yoon, Ting Dang, Dimitris Spathis, Tong Xia, Qiang Yang, Jing Han, Dong Ma, Sung-Ju Lee, Cecilia Mascolo

机构 * Dartmouth College, USA(达特茅斯学院) University of Cambridge, UK(剑桥大学) The University of Melbourne, Australia(墨尔本大学) Google Research, UK(谷歌研究) Tsinghua University, China(清华大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出可穿戴基础模型需超越静态编码器,通过结构丰富数据、纵向感知多模态建模和代理推理系统实现连续性健康支持。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2512.24903 2026-03-23 cs.CV cs.CE 83%

FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation

FinMMDocR:基于场景意识、文档理解与多步骤计算的金融多模态推理基准测试

Zichen Tang, Haihong E, Rongjin Li, Jiacheng Liu, Linwei Jia, Zhuodi Hao, Zhongjun Yang, Yuanze Li, Haolin Tian, Xinyi Hu, Peizhi Zhao, Yuan Liu, Zhengyu Wang, Xianghe Wang, Yiling Huang, Xueyuan Lin, Ruofei Bai, Zijian Xie, Qian Huang, Ruining Cao, Haocheng Gao

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 FinMMDocR通过引入场景意识、文档理解和多步骤计算,推动多模态大语言模型在现实金融场景中的推理能力提升,其包含12种隐含金融场景、9类丰富文档及平均11步推理任务。

Comments Accepted by AAAI-26 Main Track

Journal ref Proc. AAAI 2026 (Vol. 40, No. 30), pages 25858-25866

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20181 2026-03-23 cs.CR cs.AI 79%

Improving Generalization on Cybersecurity Tasks with Multi-Modal Contrastive Learning

通过多模态对比学习提升网络安全任务的泛化能力

Jianan Huang, Rodolfo V. Valentim, Luca Vassio, Matteo Boffa, Marco Mellia, Idilio Drago, Dario Rossi

机构 * Huawei Paris Research Center, France(华为巴黎研究中心,法国)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多模态对比学习框架,通过文本指导 payloads 分类,提升网络安全任务的泛化能力,并在合成基准和真实数据集上验证效果。

Comments Submitted to Euro S&P - 5th International Workshop on Designing and Measuring Security in Systems with AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20016 2026-03-23 cs.CV 79%

CFCML: A Coarse-to-Fine Crossmodal Learning Framework For Disease Diagnosis Using Multimodal Images and Tabular Data

CFCML:一种用于多模态图像和表格数据疾病诊断的粗到细跨模态学习框架

Tianling Liu, Hongying Liu, Fanhua Shang, Lequan Yu, Tong Han, Liang Wan

机构 * College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) Medical School of Tianjin University(天津大学医学院) Peng Cheng Lab(鹏城实验室) Department of Statistics and Actuarial Science, School of Computing and Data Science, The University of Hong Kong(统计与精算系,计算与数据科学学院,香港大学) Department of Radiology, Tianjin Huanhu Hospital(天津华医院放射科) Tianjin Key Laboratory of Cerebral Vascular and Neurodegenerative Diseases(天津脑血管与神经退行性疾病重点实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出CFCML框架,通过粗到细的跨模态学习逐步缩小多模态数据间的模态差距,提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17470 2026-03-23 cs.CV cs.AI 62%

VirPro: Visual-referred Probabilistic Prompt Learning for Weakly-Supervised Monocular 3D Detection

VirPro: 基于视觉引用的概率提示学习用于弱监督单目3D检测

Chupeng Liu, Jiyong Rao, Shangquan Sun, Runkai Zhao, Weidong Cai

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VirPro,通过生成场景条件化提示并结合多高斯提示建模,提升单目3D检测的弱监督性能,实验表明在KITTI基准上平均精度提升4.8%。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04803 2026-03-23 cs.CV cs.AI cs.LG 62%

Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation

通过对比信号引导扩散重建以实现平衡的视觉表示

Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Ruochen Cui, Xilin Zhao, Qingming Huang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Information Engineering, CAS(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过对比信号优化扩散重建,以提升CLIP中判别能力和细节感知能力,解决传统方法在平衡视觉表示上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2603.19337 2026-03-23 cs.CV cs.AI 84%

Diffusion-Guided Semantic Consistency for Multimodal Heterogeneity

扩散引导的语义一致性用于多模态异质性

Jing Liu, Zhengliang Guo, Yan Wang, Xiaoguang Zhu, Yao Du, Zehua Wang, Victor C. M. Leung

机构 * The University of British Columbia(不列颠哥伦比亚大学) Fudan University(复旦大学) Duke Kunshan University(杜克昆山大学) East China Normal University(华东师范大学) University of California, Davis(加州大学戴维斯分校) China University of Mining and Technology(中国矿业大学) SMBU Shenzhen University(深圳大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SemanticFL框架,利用预训练扩散模型的语义表示,通过跨模态对比学习提升联邦学习在多模态异质数据中的鲁棒性,实验表明其在CIFAR-10等数据集上准确率提升达5.49%。

Comments Accepted by IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19598 2026-03-23 cs.CV 79%

FlowScene: Style-Consistent Indoor Scene Generation with Multimodal Graph Rectified Flow

FlowScene: 多模态图校正流驱动的风格一致室内场景生成

Zhifei Yang, Guangyao Zhai, Keyang Lu, YuYang Yin, Chao Zhang, Zhen Xiao, Jieyi Long, Nassir Navab, Yikai Wang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Technical University of Munich(慕尼黑技术大学) Beijing Jiaotong University(北京交通大学) Beijing Digital Native Digital City Research Center(北京数字原生数字城市研究院) Theta Labs, Inc.(Theta Labs公司) Beijing Normal University(北京师范大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 FlowScene通过多模态图校正流模型生成风格一致的室内场景,实现对布局、形状和纹理的精细控制,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20192 2026-03-23 cs.CV cs.AI 62%

LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

LumosX:通过身份与属性的关系实现个性化视频生成

Jiazheng Xing, Fei Du, Hangjie Yuan, Pengwei Liu, Hongbin Xu, Hai Ci, Ruigang Niu, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LumosX通过结合身份与属性关系,提升多主体个性化视频生成的精细度和一致性,采用数据与模型双改进策略,构建了全面的基准测试平台。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://jiazheng-xing.github.io/lumosx-home/

详情

展开后加载摘要…

URL PDF HTML 收藏