arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2602.11146 2026-05-25 cs.CV cs.AI 62%

Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling

超越基于VLM的奖励:扩散原生潜在奖励建模

Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

机构 * The Hong Kong University of Science Huawei Hong Kong AI Framework \& Data Technologies Lab Tsinghua University The Australian National University

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出扩散原生潜在奖励模型DiNa-LRM,直接在噪声扩散状态上进行偏好学习,通过噪声校准Thurstone似然和推理时噪声集成,实现高效且鲁棒的奖励建模。

Comments Accepted by ICML 2026. Code: https://github.com/HKUST-C4G/diffusion-rm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20316 2026-05-21 cs.CV cs.AI 62%

FullFlow: Upgrading Text-to-Image Flow Matching Models for Bidirectional Vision--Language Generation

FullFlow: 通过双向视觉-语言生成升级文本到图像流匹配模型

Eric Tillmann Bill, Enis Simsar, Alessio Tonioni, Thomas Hofmann

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FullFlow方法,通过仅训练LoRA适配器和轻量级文本头部,将预训练的rectified-flow文本到图像模型升级为双向视觉-语言生成器,从而在保持图像连续流的同时添加文本离散插入过程,提升文本到图像和图像到文本的生成质量。

Comments project page: https://ericbill21.github.io/fullflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16961 2026-05-19 cs.CV cs.AI 62%

Latent Action Control for Reasoning-Guided Unified Image Generation

潜在动作控制用于推理引导的统一图像生成

Fuxiang Zhai, Sixiang Chen, Yingjin Li, Shuaibo Li, Jianyu Lai, Tengjun Huang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Latent Action Control (LAC),通过将推理表示为隐藏的连续动作,使推理过程可操作,从而在统一生成器中实现推理引导的图像生成。LAC通过角色结构化的潜在轨迹进行规划、内部视觉草图、诊断和细化,并将这些动作注入到条件流生成的隐藏流中,从而提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14876 2026-05-18 cs.CV cs.AI 62%

Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning

通过闭环验证推理解锁复杂视觉生成

Hanbo Cheng, Limin Lin, Ruo Zhang, Yicheng Pan, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CLVR框架,结合视觉语言逻辑规划与像素级扩散生成,通过自动化数据引擎和PPRL解决多步推理中的优化问题,同时引入DSWM降低推理成本,实验表明其在多个基准上优于开源模型,实现了复杂视觉生成的扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02307 2026-05-18 cs.CV cs.AI 62%

NoiseShift: Resolution-Aware Noise Recalibration for Better Low-Resolution Image Generation

NoiseShift: 为更好的低分辨率图像生成的分辨率感知噪声校准

Ruozhen He, Moayed Haji-Ali, Ziyan Yang, Vicente Ordonez

机构 * Rice University(里士大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出NoiseShift,通过校准噪声条件以恢复局部正反向一致性,提升低分辨率图像生成质量,无需额外计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13729 2026-05-14 cs.CV cs.AI 62%

Coordinating Multiple Conditions for Trajectory-Controlled Human Motion Generation

轨迹控制的人体运动生成

Deli Cai, Haoyang Ma, Changxing Ding

机构 * School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) Pazhou Lab(琶洲实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CMC框架,通过分治策略协调文本和轨迹条件,解决现有方法中文本与轨迹冲突及冗余表示导致的不稳定问题,实验显示其在控制精度和运动质量上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09587 2026-05-13 cs.CV cs.AI 62%

MieDB-100k: A Comprehensive Dataset for Medical Image Editing

MieDB-100k:用于医学图像编辑的综合数据集

Yongfan Lai, Wen Qian, Bo Liu, Hongyan Li, Hao Luo, Fan Wang, Bohan Zhuang, Shenda Hong

机构 * State Key Laboratory of General Artificial Intelligence, Beijing, China(1 国家一般人工智能重点实验室,北京,中国) School of Intelligence Science and Technology, Peking University, Beijing, China(2 智能科学与技术学院,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(3 国家健康数据科学研究院,北京大学,北京,中国) DAMO Academy, Alibaba Group, Zhejiang, China(4 阿里巴巴集团 DAMO 院,浙江,中国) hupan lab, zhejiang province(5 鹏元实验室,浙江省) Zhejiang University, Zhejiang, China(6 浙江大学,浙江,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MieDB-100k数据集,通过数据筛选流程结合专家模型与规则生成方法,解决医学图像编辑中数据质量、多样性与可扩展性不足的问题,实验表明其在医学图像编辑任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03206 2026-05-13 cs.AI cs.CL 62%

Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner

连续离散扩散:使你的扩散语言模型成为潜在推理器

Cai Zhou, Chenxiao Yang, Yi Hu, Chenyu Wang, Chubin Zhang, Muhan Zhang, Lester Mackey, Tommi Jaakkola, Stephen Bates, Dinghuai Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院) Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥)) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CCDD模型,结合连续和离散空间,提升扩散语言模型的表达能力和训练效果,通过联合多模态扩散过程实现高质量的生成与推理。

Comments 29 pages. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11061 2026-05-13 cs.CV cs.MM 62%

HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer

HiDream-O1-Image:一种原生统一的图像生成基础模型,具有像素级统一的Transformer

Qi Cai, Jingwen Chen, Chengmin Gao, Zijian Gong, Yehao Li, Yingwei Pan, Yi Peng, Zhaofan Qiu, Kai Yu, Yiheng Zhang, Hao Ai, Siying Bai, Yang Chen, Zhihui Chen, Fengbin Gao, Ying Guo, Dong Li, Zhen Shen, Leilei Shi, Jing Wang, Siyu Wang, Yimeng Wang, Rui Zheng, Ting Yao, Tao Mei

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出HiDream-O1-Image,通过像素空间扩散Transformer实现多模态输入的结构统一,无需外部VAE或离散文本编码器,提升生成和编辑任务的性能,实验表明其在多种生成任务中表现优异。

Comments Source codes and models are available at Github: https://github.com/HiDream-ai/HiDream-O1-Image and Huggingface: https://huggingface.co/HiDream-ai/HiDream-O1-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00814 2026-05-11 cs.CV cs.AI 62%

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

持久视觉记忆:在大型视觉-语言模型中维持感知以实现深度生成

Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Zefeng He, Muxin Fu, Daizong Liu, Wei-Long Zheng, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tongji University(同济大学) Wuhan University(武汉大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PVM模块,通过增强视觉证据的持续访问能力,解决LVLMs中视觉信号稀释问题,提升复杂推理任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06641 2026-05-08 cs.AI cs.CV 62%

GlazyBench: A Benchmark for Ceramic Glaze Property Prediction and Image Generation

GlazyBench:陶瓷釉料属性预测与图像生成的基准测试

Ziyu Zhai, Siyou Li, Juexi Shao, Juntao Yu

机构 * Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GlazyBench,首个用于AI辅助釉料设计的基准数据集,包含23148种真实釉料配方,支持釉料属性预测与图像生成任务,通过传统机器学习和大语言模型建立基线,展示出有前景但具挑战性的实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19182 2026-05-08 cs.CV cs.AI 62%

SOWing Information: Cultivating Contextual Coherence with MLLMs in Image Generation

信息播种:利用大规模语言模型在图像生成中培养上下文一致性

Yuhan Pei, Ruoyu Wang, Yongqi Yang, Ye Zhu, Olga Russakovsky, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SOW方法,通过多模态大语言模型实现文本-视觉到图像生成,提升图像像素级条件保真度和视觉语义一致性。

Comments Project page: https://pyh-129.github.io/SOW/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16552 2026-04-30 cs.CV cs.AI 62%

Co-generation of Layout and Shape from Text via Autoregressive 3D Diffusion

通过自回归3D扩散模型生成布局和形状

Zhenggang Tang, Yuehao Wang, Yuchen Fan, Jun-Kun Chen, Yu-Ying Yeh, Kihyuk Sohn, Zhangyang Wang, Qixing Huang, Alexander Schwing, Rakesh Ranjan, Dilin Wang, Zhicheng Yan

机构 * Meta Reality Labs(Meta现实实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种新的文本到场景生成方法,通过自回归3D扩散模型生成布局和形状,解决文本描述与生成场景不一致的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19216 2026-04-30 cs.NI cs.AI cs.CV cs.LG 62%

Bridging Visual and Wireless Sensing via a Unified Radiation Field for 3D Radio Map Construction

通过统一的辐射场桥接视觉与无线传感以实现3D无线电地图构建

Chaozheng Wen, Jingwen Tong, Zehong Lin, Chenghong Bian, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出URF-GS框架,结合3D高斯散射和反渲染技术,融合多模态数据以提升3D无线电地图的空间频谱精度和样本效率。

Comments The code for this work will be publicly available at: https://github.com/wenchaozheng/URF-GS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25806 2026-04-29 cs.CL cs.AI cs.HC 62%

MAIC-UI: Making Interactive Courseware with Generative UI

MAIC-UI: 用生成式UI制作交互式课程ware

Shangqing Tu, Yanjia Li, Keyu Chen, Sichen Zhang, Jifan Yu, Daniel Zhang-Li, Lei Hou, Juanzi Li, Yu Zhang, Huiqin Liu

机构 * Tsinghua University(清华大学) Guangzhou University(广州大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 MAIC-UI通过零代码系统实现教育者快速编辑交互式课程ware,采用多模态知识分析、生成-验证-优化流程和点击定位编辑技术,提升教学效果和学习公平性。

Comments You can try our demo at https://open.maic.chat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13766 2026-04-29 cs.SE cs.AI cs.CL 62%

A Blueprint for AI-Driven Software Quality: Integrating LLMs with Established Standards

AI驱动软件质量的蓝图:整合大语言模型与现有标准

Avinash Patil

机构 * Juniper Networks Inc.(Juniper网络公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了利用大语言模型提升软件质量保证的过程,结合现有标准,分析AI在需求验证、缺陷检测等任务中的应用,并提出未来发展方向。

Comments 16 pages, 2 Table, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24559 2026-04-28 cs.CL cs.AI 62%

Aligned Multi-View Scripts for Universal Chart-to-Code Generation

对齐的多视图脚本用于通用图表到代码生成

Zhihan Zhang, Lizi Liao

机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Chart2NCode数据集和CharLuMA模型,通过多语言监督提升图表到代码生成的可执行性和视觉一致性,优于开源基线并具备竞争力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04395 2026-04-24 cs.CV cs.MM 62%

BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion

BiTDiff:通过BiMamba-Transformer扩散实现细粒度3D导体运动生成

Tianzhi Jia, Kaixing Yang, Xiaole Yang, Xulong Tang, Ke Qiu, Shikui Wei, Yao Zhao

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学) Renmin University of China(中国人民大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出BiTDiff框架,结合BiMamba-Transformer模型和扩散策略,解决3D导体运动生成中的数据和方法限制,构建了首个大规模CM-Data数据集,并实现高质量运动合成与训练自由的联合级运动编辑。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15453 2026-04-20 cs.CV cs.AI cs.LG 62%

(1D) Ordered Tokens Enable Efficient Test-Time Search

(1D) 有序标记实现高效的测试时搜索

Zhitong Gao, Parham Rezaei, Ali Cy, Mingqiao Ye, Nataša Jovanović, Jesse Allardice, Afshin Dehghan, Amir Zamir, Roman Bachmann, Oğuzhan Fatih Kar

机构 * Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士联邦理工学院洛桑分校) Apple(苹果公司)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了有序标记对测试时搜索能力的影响,发现粗到细的1D结构比传统2D网格结构更易进行搜索,通过实验验证了有序结构在生成过程中能提升测试时扩展性。

Comments Project page: https://soto.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13590 2026-04-20 eess.IV cs.AI cs.CV 62%

Intelligent Healthcare Imaging Platform: A VLM-Based Framework for Automated Medical Image Analysis and Clinical Report Generation

智能医疗影像平台:基于视觉语言模型的自动化医学图像分析与临床报告生成框架

Samer Al-Hamadani

机构 * Automated Manufacturing Department/Al-Khwarizmi College of Engineering/ University of Baghdad/Gilgamesh University(自动化制造部门/阿尔·卡瓦尔齐米工程学院/巴格达大学/吉尔伽美什大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于视觉语言模型的智能多模态框架,用于自动化医学图像分析和临床报告生成,结合视觉特征提取与自然语言处理,实现上下文图像解释,并通过多层可视化技术提升临床信心。

Comments 32 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09057 2026-04-17 cs.CV cs.MM cs.SD 62%

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

Tora3:基于轨迹的音频视频生成与物理一致性

Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。

Comments 12 pages, 5 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07069 2026-04-17 cs.CV cs.AI 62%

Bird-SR: Bidirectional Reward-Guided Diffusion for Real-World Image Super-Resolution

Bird-SR:双向奖励引导扩散用于现实世界图像超分辨率

Zihao Fan, Xin Lu, Yidi Liu, Jie Huang, Dong Li, Xueyang Fu, Baocai Yin

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, School of Information Science and Technology, University of Science and Technology of China(脑启发智能感知与认知MoE实验室,信息科学与技术学院,中国科学技术大学) iFlytek Research, iFlytek Co., Ltd., Hefei, China(科大讯飞研究院,科大讯飞股份有限公司,合肥,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Bird-SR通过双向奖励引导扩散框架,结合合成和真实图像数据,提升现实世界超分辨率的结构一致性与感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12622 2026-04-15 cs.CV cs.AI cs.NI 62%

Efficient Semantic Image Communication for Traffic Monitoring at the Edge

边缘交通监控中的高效语义图像通信

Damir Assylbek, Nurmukhammed Aitymbetov, Marko Ristin, Dimitrios Zorbas

机构 * Nazarbayev University, School of Engineering & Digital Sciences(纳扎尔拜耶夫大学工程与数字科学学院) Zurich University of Applied Sciences (ZHAW)(苏黎世应用科学大学(ZHAW))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMSD和SAMR两种语义图像通信管道,通过压缩和加密实现高效传输,同时保持视觉信息。MMSD用语义表示替代原始图像,SAMR通过语义重要性选择性抑制区域,两者均采用边缘轻量处理与服务器重计算的异构架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17596 2026-04-14 cs.CV cs.AI cs.LG cs.RO 62%

PRIX: Learning to Plan from Raw Pixels for End-to-End Autonomous Driving

PRIX:从原始像素学习计划以实现端到端自动驾驶

Maciej K. Wozniak, Lianhang Liu, Yixi Cai, Patric Jensfelt

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) SCANIA(斯堪尼亚)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PRIX通过使用仅需摄像头数据的端到端驾驶架构,无需BEV表示和LiDAR,直接从原始像素预测安全轨迹,实现了高效且实用的自动驾驶解决方案。

Comments Accepted for Robotics and Automation Letters (RA-L) and will be presented at iROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09700 2026-04-14 cs.CV cs.AI 62%

Attention-Guided Flow-Matching for Sparse 3D Geological Generation

基于注意力的流匹配用于稀疏3D地质生成

Zhixiang Lu, Mengqi Han, Peixin Guo, Tianming Bai, Jionglong Su, Fei Fang, Sifan Song

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-GeoFlow框架,通过将离散类别生成转化为连续向量场回归,解决稀疏多模态地质建模中的非线性拓扑断点问题,实现稳定确定性最优传输路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08915 2026-04-13 cs.CV cs.AI 62%

Large-Scale Universal Defect Generation: Foundation Models and Datasets

大规模通用缺陷生成:基础模型与数据集

Yuanting Fan, Jun Liu, Bin-Bin Gao, Xiaochen Chen, Yuhuan Lin, Zhewei Dai, Jiawei Zhan, Chengjie Wang

机构 * Tencent Youtu Lab, Shenzhen, China(腾讯优图实验室,深圳,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UniDG模型和UDG数据集,通过参考基和文本指令生成缺陷,提升缺陷生成的多样性和真实性,实验表明其在异常检测和定位任务中表现优异。

Comments 25 pages, 13 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13450 2026-04-13 cs.CV cs.CL 62%

LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models

LADR:基于局部性的动态救援方法,用于高效文本到图像生成的扩散大语言模型

Chenglin Wang, Yucheng Zhou, Shawn Chen, Tao Wang, Kai Zhang

机构 * East China Normal University(华东师范大学) University of Macau(澳门大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出LADR方法,通过利用图像的空间马尔可夫性质加速推理,实现文本到图像生成的高效生成,同时保持生成质量。

Comments ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12242 2026-04-13 cs.CV cs.AI cs.LG 62%

OmniPrism: Learning Disentangled Visual Concept for Image Generation

OmniPrism: 学习解耦的视觉概念用于图像生成

Yangyang Li, Daqing Liu, Wu Liu, Allen He, Xinchen Liu, Yongdong Zhang, Guoqing Jin

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 OmniPrism通过自然语言引导学习解耦的视觉概念表示,结合扩散模型生成高质量图像,解决多方面概念混淆问题。

Comments WebPage available at https://tale17.github.io/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08121 2026-04-10 cs.CV cs.AI 62%

Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator

Uni-ViGU:通过基于扩散的视频生成器实现视频生成与理解的统一

Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能实验室) Fudan University(复旦大学) Independent Researcher(独立研究者) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Uni-ViGU通过基于扩散的视频生成器统一视频生成与理解,引入统一流方法和模态驱动的MoE框架,实现多模态生成与理解的协同优化。

Comments Page and Code: https://fr0zencrane.github.io/uni-vigu-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08037 2026-04-10 cs.CR cs.AI cs.CV cs.LG 62%

PrivFedTalk: Privacy-Aware Federated Diffusion with Identity-Stable Adapters for Personalized Talking-Head Generation

PrivFedTalk: 隐私感知的联邦扩散模型与身份稳定的适配器用于个性化说话头生成

Soumya Mazumdar, Vineet Kumar Rakesh, Tapas Samanta

机构 * Engineering Sciences, Homi Bhabha National Institute(霍米·巴巴国立研究所工程科学系)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PrivFedTalk框架,结合条件潜在扩散模型与参数高效的身份适应,解决个性化说话头生成中的隐私问题,通过身份稳定联邦聚合和时间去噪一致性正则化提升性能。

Comments GitHub: https://github.com/mazumdarsoumya/PrivFedTalk

详情

展开后加载摘要…

URL PDF HTML 收藏