arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-25 至 2026-06-25 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 10 篇

2606.20300 2026-06-25 cs.CV 新提交 83%

CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection

CMDS-AD: 跨模态双流解耦用于少样本异常检测

Junhao Cai, Junyu Chen, Deyu Zeng, Junhao Pang, Qiwei Liang, Xiaopin Zhong, Zongze Wu

机构 * Shenzhen University(深圳大学) Guangzhou Maritime University(广州航海学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 提出跨模态双流异常检测框架CMDS-AD,通过扩散模型生成多样本并利用低频正常估计辅助解耦高频缺陷,在1-shot设置下MVTec 3D-AD上I-AUROC提升5.7%。

Comments Accepted to ECCV 2026! Project page: https://cmds-ad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03211 2026-06-25 cs.CV cs.NI eess.SP 交叉投稿 79%

Channel-adaptive Cross-modal Generative Semantic Communication for Point Cloud Transmission

面向点云传输的信道自适应跨模态生成式语义通信

Wanting Yang, Zehui Xiong, Qianqian Yang, Ping Zhang, Merouane Debbah, Rahim Tafazolli

机构 * IEEE

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出GenSeC-PC框架,通过跨模态语义编码融合图像与点云,结合信道自适应联合编解码和扩散模型加速,实现低信噪比下的鲁棒点云传输。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24196 2026-06-25 cs.AI 新提交 74%

Navigating User Behavior toward Personalized Multimodal Generation

导航用户行为以实现个性化多模态生成

Hengji Zhou, Yufeng Liu, Ye Liu, Yong Xu, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 多模态生成 :multimodal(title);分类 cs.AI

AI总结 提出NaviGen,通过双标识符编码用户行为并采用两阶段SFT+RL训练,将交互历史转化为可执行指令,提升个性化图像和视频生成质量。

Comments 16 pages, 15 figures, 5 tables. Code is available at https://github.com/iLearn-Lab/NaviGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15490 2026-06-25 cs.CV cs.LG eess.IV 版本更新 70%

Improving Factuality of 3D Brain MRI Report Generation with Paired Image-domain Retrieval and Text-domain Augmentation

通过配对图像域检索和文本域增强提高3D脑MRI报告生成的事实准确性

Junhyeok Lee, Yujin Oh, Dahyoun Lee, Hyon Keun Joh, Minchul Kim, Chul-Ho Sohn, Sung Hyun Baik, Cheol Kyu Jung, Jung Hyun Park, Kyu Sung Choi, Byung-Hoon Kim, Jong Chul Ye

机构 * Cancer Biology, Seoul National University College of Medicine, Korea(首尔国立大学医学院癌症生物学系,韩国) Radiology, Massachusetts General Hospital(麻省总医院放射科) Harvard Medical School(哈佛医学院) Biomedical Systems Informatics, Yonsei University College of Medicine, Korea(延世大学医学院生物医学系统信息学系,韩国) Graduate School, Yonsei University, Korea(延世大学研究生院,韩国) Radiology, Seoul National University College of Medicine, Korea(首尔国立大学医学院放射科,韩国) Radiology, Seoul National University Hospital, Korea(首尔国立大学医院放射科,韩国) Radiology, Seoul National University Bundang Hospital, Korea(首尔国立大学 Bundang 医院放射科,韩国) Radiology, SMG-SNU Boramae Medical Center, Korea(SMG-SNU Boramae 医疗中心放射科,韩国) Psychiatry, Yonsei University College of Medicine, Korea(延世大学医学院精神病学系,韩国) Behavioral Sciences in Medicine, Yonsei University College of Medicine, Korea(延世大学医学院医学行为科学系,韩国) Yonsei Institute for Digital Health, Korea(延世大学数字健康研究院,韩国) Kim Jaechul Graduate School of AI, KAIST, Korea(金 Jaechul人工智能研究生院,韩国)

专题命中 多模态生成 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出PIRTA框架,通过检索相似3D DWI/ADC图像并利用其配对报告指导LLM生成,避免显式跨模态对齐,显著提高缺血区域准确性。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25740 2026-06-25 cs.CV cs.AI 新提交 62%

Point Cloud Diffusion with Global and Local Reconstruction for Instance-Level 3D Anomaly Detection

基于全局与局部重建的点云扩散用于实例级3D异常检测

Linchun Wu, Qin Zou, Jiwen Lu, Qingquan Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Automation, Tsinghua University(清华大学自动化系) Guangdong Artificial Intelligence and Digital Economy Laboratory (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出PCDiff框架,通过实例级多模态条件生成弱缺陷异常,并采用联合局部-全局重建算法恢复前景缺陷同时保持背景正常结构,在3D异常检测中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25390 2026-06-25 cs.CV cs.AI 新提交 62%

Anatomically-conditioned Latent Diffusion Model for Data-Efficient Few-Shot Cross-Domain 3D Glioma MRI Synthesis

解剖条件约束的潜在扩散模型用于数据高效的小样本跨域3D胶质瘤MRI合成

Salman Shaik, Truong Thanh Hung Nguyen, Hung Cao

机构 * Analytics Everywhere Lab, University of New Brunswick, Canada(新不伦瑞克大学分析无处不在实验室,加拿大)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出解剖条件约束的潜在扩散模型(ALDM),通过两阶段框架(3D变分自编码器学习解剖先验,ControlNet引导的潜在扩散生成结构一致体积)在仅16张目标图像的小样本设置下优于GAN基线,实现FID 85.40和分类AUC 0.987。

Comments Published in Canadian AI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25592 2026-06-25 cs.CV 新提交 57%

VPA-Guard: Defending and Benchmarking Image-to-Video Generation Against Visual Prompt Attacks

VPA-Guard:防御与基准测试图像到视频生成中的视觉提示攻击

Yining Sun, Haoyu Kang, Jiajun Wu, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochen Han, Fangming Liu, Wai Kin Victor Chan, Alex Jinpeng Wang

机构 * Tsinghua University(清华大学) Central South University(中南大学) South China Normal University(华南师范大学) ByteDance Inc.(字节跳动公司) Pengcheng Laboratory(鹏城实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出首个针对图像到视频生成中视觉提示攻击的系统基准VVA-Bench,并设计检索增强自进化防御框架VPA-Guard,平均降低攻击成功率44.2%和危害评分73.4%。

Comments Dataset Page: https://huggingface.co/datasets/CSU-JPG/VVA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20183 2026-06-25 cs.CV 版本更新 57%

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

MSAVBench:面向多镜头音频-视频生成的全面可靠评估

Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu, Quanhao Li, Zhiwu Qing, Xiang Wang, Zhen Xing, Ruihang Chu, Lingyi Hong, Yefei He, Junjie Zhou, Junqiu Yu, Yang Shi, Difan Zou, Kai Zhu, Shiwei Zhang, Yingya Zhang, Yu Liu, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 提出首个多镜头音频-视频生成基准MSAVBench,通过自适应混合评估框架在四个维度上系统评估19个模型,发现当前系统在导演级控制和细粒度音视频同步上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17773 2026-06-25 cs.CV 版本更新 57%

LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation

LoT-Pass: 面向图像到视频生成的长期鲁棒图像水印

Guanjie Wang, Zehua Ma, Han Fang, Weiming Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 针对图像引导视频生成中源图像追踪缺失的问题,提出跨模态水印框架I2VWM,通过视频模拟噪声层和光流对齐模块增强水印的时间鲁棒性,在开源和商业模型上验证了效果。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25754 2026-06-25 cs.RO 新提交 50%

Stage-Aware and Roughness-Constrained Diffusion Policy for Multi-Stage Robotic Polishing

阶段感知与粗糙度约束的扩散策略用于多阶段机器人抛光

Shuai Ke, Jiexin Zhang, Huan Zhao, Zhiao Wei, Yikun Guo, Tiange Wu, Guoqiang Guo, Haoyuan Zhou, Jie Pan, Han Ding

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) Shanghai Spaceflight Precision Machinery Institute(上海航天精密机械研究所)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出阶段感知与粗糙度约束扩散策略(SRDP),通过多模态观测推断阶段后验并约束去噪过程,实现无外部标签的阶段一致动作生成,提升多阶段抛光质量。

详情

展开后加载摘要…

URL PDF HTML 收藏