arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-07 至 2026-04-07 共收录 111 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 82 篇

2602.03151 2026-04-07 cs.AI 78%

Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration

增强基础视觉语言模型对缺失模态的鲁棒性:可扩展的扩散用于双向特征恢复

Wei Dai, Haoyu Wang, Honghao Chang, Lijun He, Fan Li, Jian Sun, Haixia Bi

机构 * Department of Electronics Information \ 'an Jiaotong University Xi'an China School of Information Communications Engineering \ 'an Jiaotong University Xi'an China School of Mathematics Statistics \ 'an Jiaotong University Xi'an China Information \ 'an Jiaotong University Communications Engineering \ 'an Jiaotong University Statistics \ 'an Jiaotong University

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种通用缺失模态恢复策略,通过增强扩散模型实现双向特征对齐,提升视觉语言模型在模态缺失情况下的鲁棒性和可扩展性。

Comments 10 pages, 8 figures, 6 tables. Experiments and some details have been updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04205 2026-04-07 physics.optics 78%

Non-diffusion transport in decoherent non-Hermitian quasicrystals

非扩散传输在退相干非厄运体系准晶体中

Yudong Ren, Rui Zhao, Kangpeng Ye, Lu Zhang, Hongsheng Chen, Haoran Xue, Yihao Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究揭示非厄运准晶体在退相干条件下仍存在非扩散传输结构,挑战传统安德森理论,提出耗散与退相干协同作用的新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03677 2026-04-07 cs.CL cs.AI 78%

Unlocking Prompt Infilling Capability for Diffusion Language Models

解锁扩散语言模型的提示填充能力

Yoshinari Fujinuma, Keisuke Sakaguchi

机构 * Patronus AI Tohoku University(东北大学) RIKEN(理化学研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过扩展监督微调中的全序列掩码,解锁扩散语言模型的提示填充能力,证明模型填充的提示能匹配或超越手动设计模板,并有效跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03654 2026-04-07 cs.IR 78%

Joint Behavior-guided and Modality-coherence Conditional Graph Diffusion Denoising for Multi Modal Recommendation

多模态推荐的联合行为引导和模态一致性条件图扩散去噪

Xiangchen Pan, Wei Wei

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出JBM-Diff模型,通过多视图信息传播和特征融合去除多模态特征中的冗余信息,并从行为角度检测样本对的偏序一致性以提升推荐准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03537 2026-04-07 cs.CL cs.LG 78%

Rethinking Token Prediction: Tree-Structured Diffusion Language Model

重新思考标记预测:树结构扩散语言模型

Zihao Wu, Haoming Yang, Juncheng Dong, Vahid Tarokh

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出树结构扩散语言模型,通过利用标记间的内在结构,减少参数和内存使用,实现在有限资源下提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03404 2026-04-07 cs.RO cs.LG 78%

Diffusion Policy with Bayesian Expert Selection for Active Multi-Target Tracking

具有贝叶斯专家选择的扩散策略用于主动多目标跟踪

Haotian Xiang, Qin Lu, Yaakov Bar-Shalom

机构 * University of Georgia(佐治亚大学) University of Connecticut(康涅狄格大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种基于贝叶斯框架的扩散策略,用于主动多目标跟踪,通过预测专家策略的跟踪性能并选择最不确定的策略,提升跟踪效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03303 2026-04-07 physics.ao-ph cs.AI 78%

Downscaling weather forecasts from Low- to High-Resolution with Diffusion Models

从低分辨率到高分辨率的天气预报降尺度方法

Joffrey Dumont Le Brazidec, Simon Lang, Martin Leutbecher, Baudouin Raoult, Gert Mertes, Florian Pinault, Aristofanis Tsiringakis, Pedro Maciel, Ana Prieto Nemesio, Jan Polster, Cathal O Brien, Matthew Chantry

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的全球大气降尺度方法,通过学习细尺度残差的条件分布,将低分辨率预报转化为高分辨率预报,并在热带气旋中生成一致的极端值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03276 2026-04-07 physics.app-ph cond-mat.mes-hall cond-mat.mtrl-sci physics.comp-ph 78%

Scaling atom-by-atom inverse design with nano-topology optimization and diffusion models

基于纳米拓扑优化与扩散模型的原子级逆向设计扩展

Chun-Teh Chen, Denvid Lau

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出结合纳米拓扑优化与扩散模型的原子级逆向设计框架,通过原子级优化与表面物理驱动的拓扑选择规则,实现纳米结构的高效设计与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00472 2026-04-07 stat.ML cs.LG math.ST stat.TH 78%

Partially Functional Dynamic Backdoor Diffusion-based Causal Model

部分功能动态后门扩散因果模型

Xinwen Liu, Lei Qian, Song Xi Chen, Niansheng Tang

机构 * YunNan University(云南大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出PFD-BDCM模型,通过动态后门调整和基函数展开,解决时空数据中动态混杂和功能变量的因果推断问题,实验显示其在观测、干预和反事实查询中表现更优。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02371 2026-04-07 cs.LG 78%

SFBD Flow: A Continuous-Optimization Framework for Training Diffusion Models with Noisy Samples

SFBD流:一种用于训练扩散模型的连续优化框架,无需噪声样本

Haoye Lu, Darren Lo, Yaoliang Yu

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SFBD流框架,通过连续优化替代交替步骤,提升扩散模型训练效率,并在多个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04416 2026-04-07 math.AP 71%

Rigidity for a semilinear Neumann problem with exponential nonlinearity in the large diffusion limit

具有大扩散极限的指数非线性半线性Neumann问题的刚性

Juneyoung Seo

专题命中 扩散模型 :diffusion(title)

AI总结 研究在大扩散极限下,指数非线性半线性Neumann问题的解的刚性性质,证明存在阈值ε,使得ε>阈值时所有经典解必须为常数,回答了Calanchi等人提出的猜想。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03898 2026-04-07 cs.AI stat.CO 71%

LLM-Agent-based Social Simulation for Attitude Diffusion

基于大语言模型的社交模拟用于态度扩散

Deepak John Reji

机构 * University of Limerick(利默里克大学)

专题命中 扩散模型 :diffusion(title)

AI总结 本文提出discourse_sim框架,结合LLM与基于代理的建模,模拟公众对移民态度随时间变化的动态,通过生成社交媒体帖子和解读观点来研究态度扩散和信念演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04646 2026-04-07 cs.CV cs.AI 70%

Training-Free Refinement of Flow Matching with Divergence-based Sampling

无需训练的流匹配细化方法:基于发散性的采样

Yeonwoo Cha, Jaehoon Yoo, Semin Kim, Yunseo Park, Jinhyeon Kwon, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出无需训练的流匹配细化方法,通过发散性采样提升生成质量,适用于文本到图像合成等任务。

Comments Project Page: https://yeonwoo378.github.io/official_fds

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04630 2026-04-07 cs.CV 70%

Multimodal Backdoor Attack on VLMs for Autonomous Driving via Graffiti and Cross-Lingual Triggers

通过涂鸦和跨语言触发器对自动驾驶VLMs进行多模态后门攻击

Jiancheng Wang, Lidan Liang, Yong Wang, Zengzhen Su, Haifeng Xia, Yuanting Yan, Wei Wang

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出GLA攻击方法,利用自然触发器在自动驾驶场景中实现隐蔽稳定的后门攻击,实验显示仅需10%污染率即可达到90%攻击成功率且无误报,同时提升模型性能指标,揭示了自动驾驶VLMs的安全威胁。

Comments This is a submission to the "Pattern Analysis and Applications". The manuscript includes 14 pages and 6 figures. All authors have approved the submission, and there is no conflict of interest to declare

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03635 2026-04-07 cs.CV cs.AI 70%

A Generative Foundation Model for Multimodal Histopathology

多模态病理生成模型基础框架

Jinxi Xiang, Mingjie Li, Siyu Hou, Yijiang Chen, Xiangde Luo, Yuanfeng Ji, Xiang Zhou, Ehsan Adeli, Akshay Chaudhari, Curtis P. Langlotz, Kilian M. Pohl, Ruijiang Li

机构 * Department of Radiation Oncology, Stanford University School of Medicine(斯坦福大学医学院放射肿瘤学系) Department of Psychiatry and Behavioral Sciences, Stanford University School of Medicine(斯坦福大学医学院精神病学与行为科学系) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Radiology, Stanford University(斯坦福大学放射学系) Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学医学与影像人工智能中心)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出MuPD模型,通过扩散变压器整合病理图像、分子数据和临床文本,实现跨模态生成任务,提升诊断准确性和数据扩展性。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03603 2026-04-07 cs.CV cs.LG eess.IV 70%

Stochastic Generative Plug-and-Play Priors

随机生成性插件式先验

Chicago Y. Park, Edward P. Chandler, Yuyang Hu, Michael T. McCann, Cristina Garcia-Cardona, Brendt Wohlberg, Ulugbek S. Kamilov

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Washington University in St. Louis(圣路易斯华盛顿大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出随机生成性插件式先验框架,通过引入噪声利用生成式扩散模型先验提升逆问题鲁棒性,实验显示在多通道MRI重建和大遮挡图像修复中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00721 2026-04-07 cs.CV cs.LG 70%

Common Inpainted Objects In-N-Out of Context

常见补全物体在上下文中的内-外场景

Tianze Yang, Tyson Jordan, Ruitong Sun, Ninghao Liu, Jin Sun

机构 * University of Georgia(佐治亚大学)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 COinCO数据集通过扩散补全技术生成97722张包含上下文一致和不一致场景的图像,用于研究上下文学习,支持细粒度上下文推理、基于上下文的物体预测和增强的假检测。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04348 2026-04-07 cs.SD cs.CV cs.MM 62%

OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text

OmniSonic: 向通用和整体音频生成迈进:从视频和文本生成音频

Weiguo Pian, Saksham Singh Kushwaha, Zhimin Chen, Shijian Deng, Kai Wang, Yunhui Guo, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Clemson University(克莱姆森大学) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出UniHAGen任务,通过视频和文本生成涵盖屏幕内外声音的综合音频场景。OmniSonic基于流匹配扩散框架,采用TriAttn-DiT架构和MoE门控机制,实现屏幕内外声音和语音的联合生成,建立新的UniHAGen-Bench基准。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03462 2026-04-07 cs.CV cs.GR cs.RO 62%

SpectralSplat: Appearance-Disentangled Feed-Forward Gaussian Splatting for Driving Scenes

SpectralSplat:面向驾驶场景的外观-解耦前馈高斯点云法

Quentin Herau, Tianshuo Xu, Depu Meng, Jiezhi Yang, Chensheng Peng, Spencer Sherk, Yihan Hu, Wei Zhan

机构 * Applied Intuition The Hong Kong University of Science and Technology(香港科技大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 SpectralSplat通过前馈高斯点云法解耦场景几何与外观属性,提升驾驶场景的重建质量和可控外观迁移能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04934 2026-04-07 cs.CV 57%

Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision

Vanast:通过合成三元监督实现的人像虚拟试穿

Hyunsoo Cha, Wonjung Woo, Byungjun Kim, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Vanast通过统一框架直接从单张人体图像、服装图像和姿态引导视频生成服装转移的人形动画视频,解决传统两阶段流程导致的身份漂移、服装扭曲和前后不一致问题。

Comments Accepted to CVPR 2026, Project Page: https://hyunsoocha.github.io/vanast/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04608 2026-04-07 cs.CV 57%

Beyond Semantics: Uncovering the Physics of Fakes via Universal Physical Descriptors for Cross-Modal Synthetic Detection

超越语义:通过通用物理描述符揭示合成检测的物理本质

Mei Qiu, Jianqiang Zhao, Yanyun Qu

机构 * SDIC Intelligence Information Technology Co., Ltd.(国投智能信息技术有限公司) Xia'men University(厦门大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过通用物理描述符区分真实与AI生成图像,探索跨模态合成检测中的核心物理特征及多模态模型整合方法,实现高准确率检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04425 2026-04-07 cs.CV 57%

HandDreamer: Zero-Shot Text to 3D Hand Model Generation using Corrective Hand Shape Guidance

HandDreamer: 通过纠正手形引导实现零样本文本到3D手模型生成

Green Rosh, Prateek Kukreja, Vishakha SR, Pawan Prasad B H

机构 * Samsung R&D Institute India Bangalore(三星印度班加罗尔研发中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出HandDreamer,通过MANO手模型初始化和手骨骼引导扩散过程,解决零样本文本生成3D手模型中的视角不一致和细节丢失问题,提升手部结构的自洽性与多样性。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04331 2026-04-07 cs.CV cs.AI 57%

GA-GS: Generation-Assisted Gaussian Splatting for Static Scene Reconstruction

GA-GS:基于生成的高斯点散射用于静态场景重建

Yedong Shen, Shiqi Zhang, Sha Zhang, Yifan Duan, Xinran Zhang, Wenhao Yu, Lu Zhang, Jiajun Deng, Yanyong Zhang

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) The Chinese University of Hong Kong(香港中文大学) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出GA-GS方法,通过生成技术辅助恢复动态物体遮挡区域,引入可学习的真实性标量平衡真实背景与生成区域,利用轨迹匹配数据集验证了其在大规模持久遮挡场景中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24702 2026-04-07 cs.CV 57%

Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility

通过推理不合理的部分来增强视频生成的物理合理性

Yutong Hao, Chen Chen, Ajmal Saeed Mian, Chang Xu, Daochang Liu

机构 * University of Western Australia(西澳大利亚大学) University of Sydney(悉尼大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的框架,在推理阶段通过显式推理不合理性来提升视频生成的物理合理性,通过同步解耦引导策略和物理感知推理流程,有效抑制不合理内容,提升物理真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04434 2026-04-07 cs.CV 57%

Durian: Dual Reference Image-Guided Portrait Animation with Attribute Transfer

Durian: 基于双参考图像的面部动画与属性迁移

Hyunsoo Cha, Byungjun Kim, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Durian通过双参考图像引导的方法,实现跨身份属性迁移的面部动画生成,利用自重建机制避免显式配对数据,提升模型泛化能力。

Comments Accepted to ICLR 2026, Project Page: https://hyunsoocha.github.io/durian

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03833 2026-04-07 cs.CV 57%

SPARK-IL: Spectral Retrieval-Augmented RAG for Knowledge-driven Deepfake Detection via Incremental Learning

SPARK-IL:基于频谱检索的增强型RAG用于通过增量学习的知识驱动深度伪造检测

Hessen Bougueffa Eutamene, Abdellah Zakaria Sellam, Abdelmalik Taleb-Ahmed, Abdenour Hadid

机构 * Univ. Polytechnique Hauts-de-France(上法兰西理工大学) Institute of Applied Sciences and Intelligent Systems – Lecce(应用科学与智能系统研究所(莱切)) Department of Innovation Engineering, University of Salento(萨伦托大学创新工程系) Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi(索邦大学阿布扎比分校索邦人工智能中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SPARK-IL框架,结合双路径频谱分析与增量学习,利用冻结的ViT-L/14编码器生成语义表示,并通过频谱嵌入融合与残差连接实现跨生成器检测,达到94.6%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03556 2026-04-07 cs.CV cs.AI cs.CL 57%

Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models

重点至关重要:面向视觉语言模型中幻觉的相位感知抑制

Sohyeon Kim, Sang Yeon Yoon, Kyeongbo Kong

机构 * Pusan National University(釜山大学) Pukyong National University(釜庆大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种轻量级干预方法,在视觉编码器的聚焦阶段选择性抑制低关注的token,通过单次前向传递统计信息和DPP保留多样视觉线索,减少幻觉的同时保持caption质量,且推理延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03249 2026-04-07 cs.CY cs.AI cs.CV cs.HC 57%

BLK-Assist: A Methodological Framework for Artist-Led Co-Creation with Generative AI Models

BLK-Assist:一种面向艺术家的生成AI模型细调方法论框架

Daniel Grimes, Rachel M. Harrison

机构 * Ophiuchus LLC

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 BLK-Assist通过参数高效方法为特定艺术家微调扩散模型,包含三个组件:BLK-Conceptor、BLK-Stencil和BLK-Upscale,实现隐私保护的人机协同创作,保持风格一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04922 2026-04-07 math.PR cond-mat.stat-mech math-ph math.MP 50%

Elephant random walk on the infinite dihedral group $\mathbb{Z}_2 * \mathbb{Z}_2$

在无限二面体群$\mathbb{Z}_2 * \mathbb{Z}_2}$上的象形随机游走

Soumendu Sundar Mukherjee, Himasish Talukdar

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究无限二面体群$\mathbb{Z}_2 * \mathbb{Z}_2}$上的象形随机游走,发现其具有与简单随机游走相同的渐进行为,但记忆参数影响收敛速度。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04909 2026-04-07 cond-mat.other cs.NA math.NA physics.chem-ph 50%

Weak Solutions to the Bloch Equations with Distant Dipolar Field

布洛赫方程弱解中的远距离偶极场

Louis-S. Bouchard

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了在有限域内考虑远距离偶极场的布洛赫方程,通过有限元弱形式支持空间变化的扩散和弛豫参数,并利用短距离正则化处理偶极场核,证明了偶极场算子的有界性,并获得了局部适定性和全局存在性。

Comments 28 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏