arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-19 至 2026-03-19 共收录 79 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 11 篇

2603.17326 2026-03-19 cs.CV 70%

FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions

FineViT: 通过密集描述逐步解锁细粒度感知

Peisen Zhao, Xiaopeng Zhang, Mingxing Xu, Ruoyu Sun, Zewei Du, Dunzheng Wang, Guanghao Zheng, Haohang Xu, Zhibo Zhang, Yuhang Zhang, Yi Ai, Lin Liu, Qi Tian

机构 * Huawei Inc.(华为公司)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 FineViT通过密集描述逐步训练,提升细粒度视觉感知能力,在长上下文检索中表现优异,超越现有多模态视觉编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17079 2026-03-19 cs.CV 70%

ACE-LoRA: Graph-Attentive Context Enhancement for Parameter-Efficient Adaptation of Medical Vision-Language Models

ACE-LoRA:图注意上下文增强用于医疗视觉-语言模型的参数高效适应

M. Arda Aydın, Melih B. Yilmaz, Aykut Koç, Tolga Çukur

机构 * Bilkent University(比尔肯特大学) National Magnetic Resonance Research Center (UMRAM)(国家磁共振研究所以及UMRAM)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出ACE-LoRA框架,通过整合LoRA模块和ACE-HGNN模块,提升医疗VLM的零样本泛化能力,解决领域特异性与泛化能力的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18002 2026-03-19 cs.CV cs.AI cs.CL 67%

Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models

Loc3R-VLM:基于语言的定位与3D推理的视觉语言模型

Kevin Qu, Haozhe Qi, Mihai Dusmanu, Mahdi Rad, Rui Wang, Marc Pollefeys

机构 * Microsoft Spatial AI Lab(微软空间AI实验室) ETH Zurich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Loc3R-VLM通过结合全局布局重建和显式情境建模,提升视觉语言模型的3D空间理解能力,在语言定位和3D问答任务中取得最优性能。

Comments Project Page: https://kevinqu7.github.io/loc3r-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06313 2026-03-19 cs.CV 57%

WMoE-CLIP: Wavelet-Enhanced Mixture-of-Experts Prompt Learning for Zero-Shot Anomaly Detection

WMoE-CLIP:小波增强的专家混合提示学习用于零样本异常检测

Peng Chen, Chao Huang

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, Shenzhen(中山大学深圳校区计算机科学与技术学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出WMoE-CLIP方法,通过小波分解提取多频图像特征并结合变分自编码器提升提示适应性,引入语义感知的专家混合模块,有效提升零样本异常检测性能。

Journal ref ICASSP 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09262 2026-03-19 cs.CV 57%

MultiMedEval: A Benchmark and a Toolkit for Evaluating Medical Vision-Language Models

MultiMedEval:用于评估医学视觉-语言模型的基准和工具包

Corentin Royer, Bjoern Menze, Anjany Sekuboyina

机构 * University of Zürich(苏黎世大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 MultiMedEval通过23个数据集和11个医学领域,评估六种多模态任务,提供开源工具简化VLM评估,促进公平统一的基准测试。

Comments Accepted at MIDL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17520 2026-03-19 cs.CV 57%

PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation

PCA-Seg:重新审视开放词汇语义和部分分割中的成本聚合

Jianjian Yin, Tao Chen, Yi Chen, Gensheng Pei, Xiangbo Shu, Yazhou Yao, Fumin Shen

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing Normal University(南京师范大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) University of Electronic Science and Technology of China(电子科技大学) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出PCA-Seg方法,通过并行成本聚合缓解类级语义与空间上下文之间的知识干扰,提升开放词汇语义和部分分割性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17325 2026-03-19 cs.CV 57%

MedSAD-CLIP: Supervised CLIP with Token-Patch Cross-Attention for Medical Anomaly Detection and Segmentation

MedSAD-CLIP:基于Token-Patch交叉注意力的监督CLIP用于医学异常检测和分割

Thuy Truong Tran, Minh Kha Do, Phuc Nguyen Duy, Min Hun Lee

机构 * Singapore Management University(新加坡管理大学) La Trobe University(拉特罗布大学) Vietnam National University, Hanoi(越南国家大学河内分校)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出MedSAD-CLIP,通过Token-Patch交叉注意力提升医学图像中病变定位,结合轻量级图像适配器和可学习提示词,实现CLIP在医学领域的有效监督适应,实验表明其在分割和分类任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16600 2026-03-19 cs.CV 57%

Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLM Reward Models

原因至关重要:通过代理引导的批评学习可转移的评分标准用于视觉语言模型奖励模型

Weijie Qiu, Dai Guan, Junxin Wang, Zhihang Li, Yongbo Gai, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Proxy-GRM,通过代理引导的评分标准验证提升视觉语言模型奖励模型的评分质量,利用轻量级代理代理进行评分标准验证,实现评分标准的可转移性和一致性,实验表明其在多个基准测试中表现优异。

Comments 25 pages, 10 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14549 2026-03-19 cs.CV cs.LG 57%

ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference

ASAP: 一种面向高效视觉-语言模型推理的注意力转移感知剪枝方法

Surendra Pathak, Bo Han

机构 * George Mason University(乔治·马歇尔大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出ASAP方法,通过动态双向软注意力掩码缓解注意力转移问题,并引入加权软合并组件减少语义冗余,实现视觉上下文近似无损压缩,保持99.02%的LLaVA-NeXT-7B性能,计算量降低约80%。

Comments Update in V2: Added citations, refrences, and other minor rewrites

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11005 2026-03-19 cs.CV 57%

Draft and Refine with Visual Experts

草稿与润色:借助视觉专家

Sungheon Jeong, Ryozo Masukawa, Jihong Park, Sanggeon Yun, Wenjun Huang, Hanning Chen, Mahdi Imani, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Northeastern University(东北大学) MOLOCO

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DnR框架,通过可视化专家反馈提升模型视觉利用能力,减少幻觉并提高多模态系统可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06231 2026-03-19 cs.CV 57%

RSRefSeg 2: Decoupling Referring Remote Sensing Image Segmentation with Foundation Models

RSRefSeg 2: 解耦引用遥感图像分割与基础模型

Keyan Chen, Chenyang Liu, Bowen Chen, Jiafan Zhang, Zhengxia Zou, Zhenwei Shi

机构 * Beihang University(北京航空航天大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 RSRefSeg 2通过解耦传统三阶段流程,提出双阶段协作框架,结合CLIP的跨模态对齐与SAM的分割泛化能力,提升遥感图像分割精度与复杂语义解释能力。

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 1-20, 2026, Art no. 4700420

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2603.16966 2026-03-19 cs.CV cs.AI cs.MM cs.SD eess.AS 77%

CineSRD: Leveraging Visual, Acoustic, and Linguistic Cues for Open-World Visual Media Speaker Diarization

CineSRD:利用视觉、听觉和语言线索进行开放世界视觉媒体说话人聚类

Liangbin Huang, Xiaohua Liao, Chaoqun Cui, Shijing Wang, Zhaolong Huang, Yanlong Du, Wenji Mao

机构 * Hujing Digital Media and Entertainment Group(华景数字媒体与娱乐集团) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 CineSRD通过整合视觉、听觉和语言线索,解决开放世界视觉媒体中说话人识别的挑战,提出统一多模态框架并构建专用基准数据集,验证其在复杂场景下的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16292 2026-03-19 cs.CL cs.AI 62%

Attention-guided Evidence Grounding for Spoken Question Answering

基于注意力的证据 grounding 用于语音问答

Ke Yang, Bolin Chen, Yuejie Li, Yueying Hua, Jianhao Nie, Yueping He, Bowen Li, Chengjun Mao

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于注意力的证据 grounding 方法,通过 SpeechLLM 的内部跨模态注意力机制定位关键证据,减少幻觉并提升效率,优于传统 cascaded 系统。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16874 2026-03-19 cs.HC cs.AI 57%

Disclosure By Design: Identity Transparency as a Behavioural Property of Conversational AI Models

设计中的披露:对话式AI模型的身份透明性作为行为属性

Anna Gausen, Sarenne Wallbridge, Hannah Rose Kirk, Jennifer Williams, Christopher Summerfield

机构 * AI Security Institute(人工智能安全研究所) University of Southampton(萨默塞特大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 研究探讨对话式AI在人类与AI交互日益模糊时如何维持身份透明性,提出通过设计实现披露,以提升系统可靠性并保护用户自主验证能力。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22272 2026-03-19 cs.CL 57%

From Slides to Chatbots: Enhancing Large Language Models with University Course Materials

从幻灯片到聊天机器人:利用大学课程材料增强大语言模型

Tu Anh Dinh, Philipp Nicolas Schumacher, Jan Niehues

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄理工学院,德国)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 本文研究如何通过整合大学课程材料提升大语言模型在计算机科学课程中的表现,比较了RAG和CPT两种策略,并发现多模态RAG在处理包含图像和公式的幻灯片时更有效。

Comments Accepted to NSLP @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2603.11971 2026-03-19 cs.CV cs.AI 84%

Multimodal Emotion Recognition via Bi-directional Cross-Attention and Temporal Modeling

通过双向交叉注意力和时间建模的多模态情感识别

Junhyeong Byeon, Jeongyeol Kim, Sejoon Lim

机构 * Kookmin University(韩国釜山大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态情感识别框架,结合时间建模、音频学习和跨模态融合,提升野外视频中情绪识别的鲁棒性。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16939 2026-03-19 cs.CV 83%

Solution for 10th Competition on Ambivalence/Hesitancy (AH) Video Recognition Challenge using Divergence-Based Multimodal Fusion

第十届Ambivalence/Hesitancy(AH)视频识别挑战赛中基于分歧的多模态融合解决方案

Aislan Gabriel O. Souza, Agostinho Freire, Leandro Honorato Silva, Igor Lucas B. da Silva, João Vinícius R. de Andrade, Gabriel C. de Albuquerque, Lucas Matheus da S. Oliveira, Mário Stela Guerra, Luciana Machado

机构 * Universidade de Pernambuco(巴伊亚大学) Escola Politécnica de Pernambuco(巴伊亚理工学院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于分歧的多模态融合方法,通过测量视觉、音频和文本通道间的跨模态冲突,提升AH识别性能,在BAH数据集上达到0.6808的宏F1分数,优于基准线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17541 2026-03-19 cs.CV 79%

Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models

时间收益,空间代价:重新审视多模态大语言模型中的视频微调

Linghao Zhang, Jungang Li, Yonghua Hei, Sicheng Tao, Song Dai, Yibo Yan, Zihao Dongfang, Weiting Liu, Chenxi Qin, Hanqian Li, Xin Zou, Jiahao Zhang, Shuhang Xun, Haiyun Jiang, Xuming Hu

机构 * SJTU(上海交通大学) HKUST(GZ)(香港科技大学(珠海)) HKUST(香港科技大学) CityU(城市大学) FDU(复旦大学) HIT(哈尔滨工业大学) TJU(天津大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究了视频微调对多模态大语言模型视觉能力的影响,发现视频性能提升的同时,静态图像表现可能受限,提出混合帧策略以缓解空间与时间理解的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17948 2026-03-19 cs.CV cs.AI 62%

VideoAtlas: Navigating Long-Form Video in Logarithmic Compute

VideoAtlas: 在对数计算中导航长视频

Mohamed Eltahir, Ali Habibullah, Yazan Alshoibi, Lama Ayash, Tanveer Hussain, Naeemullah Khan

机构 * King Abdullah University of Science and Technology (KAUST)(卡斯特大学) Department of Computer Science, King Khalid University (KKU)(国王 Khalid 大学计算机科学系) Department of Computer Science, Edge Hill University(Edge Hill 大学计算机科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VideoAtlas通过层次化网格结构实现长视频的无损表示,解决视频表示和长上下文问题,提出Video-RLM架构,展示对数计算增长、环境预算和自适应计算分配等贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17307 2026-03-19 cs.CV cs.AI 62%

Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

Symphony:一种受认知启发的多智能体系统用于长视频理解

Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Kuaishou Technology(快手科技) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Symphony多智能体系统,通过模拟人类认知模式,提升长视频理解任务的推理能力,实验显示在多个基准测试中表现优异。

Comments Accepted by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17930 2026-03-19 cs.CV 57%

Interpretable Traffic Responsibility from Dashcam Video via Legal Multi Agent Reasoning

基于法律多智能体推理的可解释交通责任分析

Jingchun Yang, Jinchang Zhang

机构 * Northeast University(东北大学) SUNY Binghamton University(纽约州立大学布法罗分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出C-TRAIL多模态数据集,结合视频与文本描述,通过两阶段框架实现交通责任判定,优于现有方法并提供透明法律推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14827 2026-03-19 cs.CV 57%

SemanticFace: Semantic Facial Action Estimation via Semantic Distillation in Interpretable Space

SemanticFace: 通过可解释空间中的语义蒸馏进行语义面部动作估计

Zejian Kang, Kai Zheng, Yuanchen Fei, Wentao Yang, Hongyuan Zou, Xiangru Huang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Hunan University(湖南大学) The University of Hong Kong(香港大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SemanticFace通过语义蒸馏在可解释空间中估计面部动作,提升系数精度和可解释性,实现跨身份泛化和抗域移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18886 2026-03-19 cs.CV 57%

MagicWorld: Towards Long-Horizon Stability for Interactive Video World Exploration

MagicWorld: 向交互视频世界探索的长时稳定迈进

Guangyuan Li, Bo Li, Jinwei Chen, Xiaobin Hu, Lei Zhao, Peng-Tao Jiang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo蓝影实验室,vivo移动通信有限公司) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MagicWorld模型,通过引入流引导运动保留约束和增强交互训练策略,解决复杂环境中运动漂移和长时交互误差累积问题,并构建RealWM120K数据集验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17653 2026-03-19 cs.RO 50%

REAL: Robust Extreme Agility via Spatio-Temporal Policy Learning and Physics-Guided Filtering

REAL:通过时空策略学习和物理引导过滤实现鲁棒极端敏捷

Jialong Liu, Dehan Shen, Yanbo Wen, Zeyu Jiang, Changhao Chen

机构 * PEAK-Lab, The Hong Kong University of Science and Technology (Guangzhou)(高峰实验室,香港科学与技术大学(广州))

专题命中 视频多模态 :cross-modal(abstract)

AI总结 REAL通过结合时空策略学习和物理引导过滤,提升在动态环境下极端敏捷的鲁棒性,能够在视觉干扰下实现可靠攀爬。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2603.17360 2026-03-19 cs.CV 85%

MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval

MCoT-MVS:基于多模态链式推理的多级视觉选择用于组合图像检索

Xuri Ge, Chunhao Wang, Xindi Wang, Zheyun Qin, Zhumin Chen, Xin Xin

机构 * Shandong University(山东大学)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出MCoT-MVS方法,通过多模态链式推理提取参考图像的多级视觉特征,结合注意力机制与文本提示,提升组合图像检索的准确性和鲁棒性。

Comments Accepted by The Web Conference 2026 (WWW2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16289 2026-03-19 cs.CV cs.AI 81%

VisBrowse-Bench: Benchmarking Visual-Native Search for Multimodal Browsing Agents

VisBrowse-Bench:多模态浏览代理的视觉原生搜索基准测试

Zhengbo Zhang, Jinbo Su, Zhaowen Zhou, Changtao Miao, Yuhan Hong, Qimeng Wu, Yumeng Liu, Feier Wu, Yihe Tian, Yuhao Liang, Zitong Shan, Wanke Xia, Yi-Fan Zhang, Bo Zhang, Zhe Li, Shiming Xiang, Ying Yan

机构 * CASIA Ant Digital Technologies Ant Group(蚂蚁集团数字技术部) RUC(清华大学) FZU(福建师范大学) THU(清华大学) USTB(北京科技大学) PKU(北京大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisBrowse-Bench,用于评估多模态浏览代理的视觉推理能力,通过文本-图像检索和联合推理进行多模态证据交叉验证,验证了不同模型在搜索过程中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16239 2026-03-19 math.NA cs.LG cs.NA 50%

Neural Pushforward Samplers for the Fokker-Planck Equation on Embedded Riemannian Manifolds

神经推前采样器用于嵌入黎曼流形上的福克-计划克方程

Andrew Qing He, Wei Cai

机构 * Department of Mathematics, Southern Methodist University(数学系,南方 Methodist 大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文扩展了弱对抗神经推前方法,用于嵌入黎曼流形上的福克-计划克方程,通过神经推前映射和重traction层约束流形,实现概率守恒,采用弱对抗目标训练,无需网格或坐标图,验证了方法在曲面多模态不变分布中的能力。

Comments 13 pages, 2 figures, 1 table, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 7 篇

2602.21818 2026-03-19 cs.CV 85%

SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model

SkyReels-V4:多模态视频-音频生成、修复和编辑模型

Guibin Chen, Dixuan Lin, Jiangping Yang, Youqiang Zhang, Zhengcong Fei, Debang Li, Sheng Chen, Chaofeng Ao, Nuo Pang, Yiming Wang, Yikun Dou, Zheng Chen, Mingyuan Fan, Tuanhui Li, Mingshan Chang, Hao Zhang, Xiaopeng Sun, Jingtao Xu, Yuqiang Xie, Jiahua Wang, Zhiheng Xu, Weiming Xiong, Yuzhe Jin, Baoxuan Gu, Binjie Mao, Yunjie Yu, Jujie He, Yuhao Feng, Shiwen Tu, Chaojie Wang, Rui Yan, Wei Shen, Jingchen Wu, Peng Zhao, Xuanyue Zhong, Zhuangzhuang Liu, Kaifei Wang, Fuxiang Zhang, Weikai Xu, Wenyan Liu, Binglu Zhang, Yu Shen, Tianhui Xiong, Bin Peng, Liang Zeng, Xuchen Song, Haoxiang Guo, Peiyu Wang, Max W. Y. Lam, Chien-Hung Liu, Yahui Zhou

机构 * Skywork AI

专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 SkyReels-V4是一款多模态视频基础模型,支持视频音频生成、修复和编辑,采用双流多模态扩散变换器架构,结合文本编码器实现多模态指令处理,支持高分辨率、长时长视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16967 2026-03-19 cs.CV cs.AI 84%

MSRAMIE: Multimodal Structured Reasoning Agent for Multi-instruction Image Editing

MSRAMIE:多模态结构推理代理用于多指令图像编辑

Zhaoyuan Qiu, Ken Chen, Xiangwei Wang, Yu Xia, Sachith Seneviratne, Saman Halgamuge

机构 * University Of Melbourne(墨尔本大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 MSRAMIE基于多模态大语言模型构建无需训练的代理框架,通过结构化多模态推理处理多指令图像编辑任务,提升复杂指令遵循度和完成概率,同时保持图像质量和一致性。

Comments 14 pages, 6 figures, 3 tables, appendix and references provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17049 2026-03-19 cs.CV cs.AI 84%

From Geometric Mimicry to Comprehensive Generation: A Context-Informed Multimodal Diffusion Model for Urban Morphology Synthesis

从几何模仿到综合生成:一种基于上下文的多模态扩散模型用于城市形态合成

Fangshuo Zhou, Huaxia Li, Liuchang Xu, Rui Hu, Sensen Wu, Liang Xu, Hailin Feng, Zhenhong Du

机构 * Zhejiang Agriculture and Forestry University(浙江农业与林业大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ControlCity模型,通过多模态信息融合实现城市形态综合生成,提升了形态保真度和空间重叠度,实现了跨城市风格迁移和未知城市零样本生成。

Comments Accepted

Journal ref International Journal of Geographical Information Science (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏