arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-20 至 2026-05-20 共收录 119 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2605.20147 2026-05-20 cs.CV 83%

PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset

PixVerve:通过大规模高质量数据集将原生超高清图像生成推至100MP

Haojun Chen, Haoyang He, Chengming Xu, Qingdong He, Junwei Zhu, Yabiao Wang, Zhucun Xue, Xianfang Zeng, Zhennan Chen, Xiaobin Hu, Hao Zhao, Yong Liu, Jiangning Zhang, Dacheng Tao

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出PixVerve-95K数据集,通过精心设计的数据管道构建,包含95K张高分辨率图像和七维标注,用于推动超高清图像生成技术,通过三种训练方案将T2I基础模型扩展到100MP生成,并建立PixVerve-Bench评估协议。

Comments Project page is available at https://haojunchen663.github.io/projects/PixVerve/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19855 2026-05-20 cs.CV cs.AI 79%

A Framework for Evaluating Zero-Shot Image Generation in Concept-based Explainability

基于概念的可解释性人工智能的零样本图像生成评估框架

Giacomo Astolfi, Matteo Bianchi, Riccardo Campi, Antonio De Santis, Marco Brambilla

机构 * Politecnico di Milano, DEIB(米兰理工大学,DEIB)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种基于概念的可解释性人工智能的零样本图像生成评估框架,通过生成合成概念数据集来评估概念基于的XAI方法,探讨了零样本文本到图像生成模型在模型分析中的挑战和开放性问题。

Comments G. Astolfi, M. Bianchi, and R. Campi contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19111 2026-05-20 cs.CV cs.AI 79%

FAGER: Factually Grounded Evaluation and Refinement of Text-to-Image Models

FAGER:基于事实的文本到图像模型评估与改进

Youngsun Lim, Cusuh Ham, Pin-Yu Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Adobe(Adobe公司) IBM Research(IBM研究院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出FAGER框架,用于评估和改进文本到图像模型的事实准确性,通过结合LLM生成事实和参考引导的视觉事实提取与验证,构建结构化事实评估标准,并通过VLM进行评估,验证FAGER在事实性测试中优于现有方法,并能无训练改进T2I输出。

Comments It was accepted for an oral presentation at the 2nd Workshop on the Evaluation of Generative Foundation Models (EVGENFM2026) at CVPR 2026. Total 8 pages (1 page for references). 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19190 2026-05-20 cs.CY cs.AI cs.HC 78%

Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South

Going PLACES: 参与式本地化红队测试用于全球南方的文本到图像安全

Charvi Rastogi, Mukul Bhutani, Minsuk Kahng, Shamsuddeen Hassan Muhammad, Evgeniia Razumovskaia, Priyanka Suresh, Ibrahim Said Ahmad, Charu Kalia, Yaaseen Mahomed, Madhurima Maji, Minjae Lee, Alicia Parrish, Jessica Quaye, Vijay Janapa Reddi, Aishwarya Verma, Lora Aroyo

机构 * Google DeepMind(谷歌DeepMind) Yonsei University(延世大学) Imperial College(帝国理工学院) University of Wisconsin–Stevens Point(威斯康星州立大学斯普林特分校) Google Research(谷歌研究) Harvard University(哈佛大学)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 本文提出PLACES数据集,通过在非洲和亚洲的本地社区进行参与式红队测试,收集了26000多个文本到图像模型失败案例,揭示了全球南方在文化和社会规范方面的独特对抗模式和安全框架的结构性缺失。

Comments Published at ACM Conference on FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07561 2026-05-20 cs.CV 74%

PureCC: Pure Learning for Text-to-Image Concept Customization

PureCC: 文本到图像概念定制的纯学习

Zhichao Liao, Xiaole Xian, Qingyu Li, Wenyu Qin, Meng Wang, Weicheng Xie, Siyang Song, Pingfa Feng, Long Zeng, Liang Pan

机构 * Tsinghua University(清华大学) School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(深圳大学智能信息处理广东省重点实验室) Kling Team, Kuaishou Technology(快手科技Kling团队) University of Exeter(埃克塞特大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 文生图 :text-to-image(title);分类 cs.CV

AI总结 本文提出PureCC,一种用于文本到图像概念定制的纯学习方法,通过分离学习目标来平衡概念定制的保真度与模型保留。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 5 篇

2605.19319 2026-05-20 cs.CV 83%

SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution

SWEET:基于图像编辑的稀疏世界建模用于具身任务执行

Yiren Song, Yihan Wang, Xiyao Deng, Zhuoran Yan, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) Central South University(中南大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文研究图像编辑模型能否作为稀疏视觉世界模型用于机器人操作,通过预测任务级未来状态而非密集视频生成,提出SWEET框架实现稀疏视觉规划,结合语言指令和空间引导生成关键帧,并通过扩散动作预测器生成可执行动作,实验表明其在不同场景中提升关键帧预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19511 2026-05-20 cs.CV 79%

Are Watermarked Images Editable? SafeMark for Watermark-Preserving Text-Guided Image Editing

水印图像可编辑吗?SafeMark用于水印保持的文本引导图像编辑

Xiaodong Wu, Qi Li, Xiangman Li, Zelin Zhang, Lingshuang Liu, Jianbing Ni

机构 * Queen’s University(皇后大学) University of Waterloo(滑铁卢大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 本文研究了一个基础但未被充分探索的问题:水印图像能否在不损害水印完整性的情况下保持可编辑?我们提出了SafeMark框架,该框架在图像编辑过程中显式地将水印完整性整合进去。具体来说,SafeMark将阈值化的水印解码损失直接添加到扩散编辑器的训练目标中,微调编辑器,使得语义上有效的编辑也能够在最终输出中保留嵌入的水印。这种设计具有清晰的信息论依据:在编辑图像上保持高比特准确性下限界了编辑通道所保持的水印与编辑输出之间的互信息,这一量根本控制着水印恢复能力。SafeMark与可微扩散编辑器兼容,不需要架构修改。在多个数据集、文本引导编辑方法和编辑后失真设置上的广泛评估表明,SafeMark在多种编辑设置中实现了高水印比特准确性,同时保持高质量的语义编辑,而不会牺牲对常见编辑后失真的鲁棒性。这些结果表明,语义可编辑性和水印完整性本质上是兼容的,使生成编辑管道中的图像溯源变得可信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23622 2026-05-20 cs.CV cs.AI 79%

DLEBench: Evaluating Small-scale Object Editing Ability for Instruction-based Image Editing Model

DLEBench: 评估基于指令的图像编辑模型在小规模物体编辑能力

Shibo Hong, Boxian Ai, Jun Kuang, Wei Wang, FengJiao Chen, Zhongyuan Peng, Chenhao Huang, Yixin Cao

机构 * College of Computer Science(计算机科学学院) Artificial Intelligence(人工智能) Fudan University(复旦大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出DLEBench,首个专门评估基于指令的图像编辑模型在小规模物体编辑能力的基准,通过1889个样本覆盖复杂场景,揭示了现有模型在小物体编辑上的性能差距,强调了专用基准的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18993 2026-05-20 cs.CV cs.AI cs.GR 73%

FreeOrbit4D: Training-Free Arbitrary Camera Redirection for Monocular Videos via Foreground-Complete 4D Reconstruction

FreeOrbit4D: 通过前景完整4D重建实现免训练的任意相机重定向

Wei Cao, Hao Zhang, Fengrui Tian, Yulun Wu, Yingying Li, Shenlong Wang, Ning Yu, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Eyeline Labs(Eyeline实验室)

专题命中 图像编辑 :diffusion(abstract,abstract_cn);分类 cs.CV、cs.GR

AI总结 本文提出FreeOrbit4D,一种无需训练的框架,通过恢复完整的前景4D代理来解决大角度重定向中的几何模糊问题,从而生成更真实且时间一致的视频。

Comments 12 pages, 10 figures. Accepted to SIGGRAPH Conference Papers 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20174 2026-05-20 cs.CV cs.LG 70%

Multi-axis Analysis of Image Manipulation Localization

多轴分析图像操纵定位

Keanu Nichols, Divya Appapogu, Giscard Biamby, Dina Bashkirova, Anna Rohrbach, Bryan A. Plummer

机构 * Boston University(波士顿大学) University of California, Berkeley(加州大学伯克利分校) Technical University of Darmstadt(德累斯顿技术大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出AUDITS基准,用于多轴分析图像操纵检测,通过不同领域转移类型评估现有方法的鲁棒性,以推动更可靠和通用的图像操纵检测方法的发展。

Comments 28 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 79 篇

2605.19532 2026-05-20 cs.CV cs.LG 88%

Boosting Text-to-Image Diffusion Models via Core Token Attention-Based Seed Selection

通过基于核心标记注意力的种子选择提升文本到图像扩散模型

Yunzhe Zhang, Hongfu Liu, Pengyu Hong

机构 * Brandeis University(布兰迪大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了文本到图像扩散模型中种子对生成质量的影响,提出基于核心标记注意力的种子选择方法,无需训练即可提升文本与图像的一致性及视觉质量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08248 2026-05-20 cs.CV 88%

TextBoost: Boosting Text Encoder for Personalized Text-to-Image Generation

TextBoost: 通过文本编码器提升文本到图像生成的个性化

NaHyeon Park, Kunhee Kim, Hyunjung Shim

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出TextBoost,一种高效的文本到图像扩散模型单次个性化方法,通过仅微调文本编码器提升计算和存储效率,并保持语义完整性,从而实现更快收敛和更低存储需求,同时保持高质量生成。

Comments Project page: https://textboost.github.io. Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19698 2026-05-20 cs.CR cs.LG 88%

Awakening the Hydra: Stabilizing Multi-Concept Backdoor Injection in Text-to-Image Diffusion Models

唤醒 Hydra:在文本到图像扩散模型中稳定多概念后门注入

Kai Wang, Jiale Zhang, Chengcheng Zhu, Chuang Ma, Songze Li

机构 * Yangzhou University(扬州大学) Nanjing University(南京大学) Chongqing University(重庆大学) Southeast University(东南大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract)

AI总结 本文研究了在易受干扰的环境下多概念后门攻击的稳定性问题,提出 Hydra 框架,通过约束触发语义和协调跨任务交互,实现稳健且可控的多概念后门注入,实验表明 Hydra 在保持清洁生成质量的同时,有效激活后门。

Comments Preprint. 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06462 2026-05-20 cs.CL cs.LG 87%

Diffusion-State Policy Optimization for Masked Diffusion Language Models

扩散状态策略优化用于掩码扩散语言模型

Daisuke Oba, Hiroki Furuta, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究院)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Diffusion-State Policy Optimization(DiSPO),一种用于掩码扩散语言模型的插件信用分配层,通过直接优化中间填充决策来改进生成过程,实验表明其在数学和规划基准测试中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18775 2026-05-20 cs.IR cs.AI 87%

Query-Aware Flow Diffusion for Graph-Based RAG with Retrieval Guarantees

基于查询意识的流扩散图基RAG系统:具有检索保证

Zhuoping Zhou, Davoud Ataee Tarzanagh, Sima Didari, Wenjun Hu, Baruch Gutow, Oxana Verkholyak, Masoud Faraki, Heng Hao, Hankyu Moon, Seungjai Min

机构 * Samsung SDS Research America(三星SDS美国研究院)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出了一种无需训练的Query-Aware Flow Diffusion RAG(QAFD-RAG)系统,通过动态适应查询语义来改进图基RAG系统的检索能力,提供了首次统计保证,证明在弱信号-噪声条件下,QAFD-RAG能够以高概率恢复相关子图。

Comments Published at the International Conference on Learning Representations (ICLR) 2026. 38 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10180 2026-05-20 cs.CV cs.CR 85%

What Concepts Lie Within? Detecting and Suppressing Risky Content in Diffusion Transformers

什么概念在其中?在扩散变换器中检测和抑制危险内容

Chenyu Zhang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文研究了如何在扩散变换器中检测和抑制危险内容,提出了一种无需训练的推理时安全机制AHV-D&S,通过分析注意力头对概念的敏感性来检测和抑制危险生成倾向,有效压制了性内容、受版权保护的内容及有害内容,同时保持视觉质量。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16736 2026-05-20 cs.CV 85%

CAB: Accelerating Flow and Diffusion Sampling via Rectification and Corrected Adams-Bashforth

CAB: 通过校正和修正Adams-Bashforth加速流和扩散采样

Anuska Roy, Pravin Nair

机构 * Department of Electrical Engineering(电气工程系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的采样器CAB,通过将采样动态转换为统一的校正坐标系,并应用带有基于过去速度评估的简单修正项的多步Adams-Bashforth预测器,从而在不增加额外函数评估次数的情况下加速流和扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19037 2026-05-20 math.NA cs.NA 85%

DG = FEM + flat elements, Part I: Diffusion

DG = FEM + flat elements, Part I: Diffusion

Jiří Szotkowski, Václav Kučera, Chi-Wang Shu, Antoine Quiriny, Jonathan Lambrechts, Nicolas Moës, Jean-François Remacle

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文研究了连续有限元方法(FEM)与不连续Galerkin方法(DG)在泊松问题中的联系,通过在单元界面插入消失厚度的'虚拟'元素,并修改扩散系数以证明FEM公式收敛于Babuška-Zlámal DG方法,采用梯形边积分。该方法通过简单的网格编辑和单个雅可比阈值实现,能够在不修改原有FEM代码的情况下实现DG的简单实现,并支持适应性元素级的FEM与DG切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04663 2026-05-20 cs.LG cs.AI 85%

Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design

重新思考扩散模型强化学习的设计空间:超越损失设计的似然估计的重要性

Jaemoo Choi, Yuchen Zhu, Wei Guo, Petr Molodyk, Bo Yuan, Jinbin Bai, Yi Xin, Molei Tao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) National University of Singapore(新加坡国立大学) Nanjing university(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文研究了扩散模型强化学习设计空间中的关键问题,通过分解策略梯度目标、似然估计器和回放采样方案三个因素,发现基于证据下界(ELBO)的模型似然估计器是实现有效、高效和稳定强化学习优化的主要因素,优于特定策略梯度损失函数的影响。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11688 2026-05-20 cs.LG cs.CV 83%

Hierarchical Schedule Optimization for Fast and Robust Diffusion Model Sampling

分层调度优化用于快速且稳健的扩散模型采样

Aihua Zhu, Rui Su, Qinglin Zhao, Li Feng, Meng Shen, Shibo He

机构 * School of Computer Science and Engineering, Macau University of Science and Technology(澳门科学技术大学计算机科学与工程学院) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种分层调度优化方法,通过改进的双层优化框架,在极低的函数评估次数下实现高效的扩散模型采样,显著提升了样本质量和计算效率。

Comments Preprint, accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16445 2026-05-20 cs.LG cs.AI 82%

Membership Inference Attacks on Discrete Diffusion Language Models

对离散扩散语言模型的成员推断攻击

Shailesh Kasivelrajan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了对微调后的MDLMs的成员推断攻击,发现其比现有灰盒基线更易受攻击,并设计了阴影模型转移攻击以证明其有效性。

Comments Citations and Co Authors need to be verified and updated. Will submit a new version soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20308 2026-05-20 cs.CV cs.GR 81%

Taming Real-World Space-Time Video Super-Resolution with One-Step Diffusion

通过一步扩散模型平滑现实世界的时空视频超分辨率

Shuoyan Wei, Feng Li, Chen Zhou, Runmin Cong, Yao Zhao, Huihui Bai

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) Visual Intelligence + X International Cooperation Joint Laboratory of MOE, Beijing(教育部视觉智能+X国际合作联合实验室) Innovation School of Artificial Intelligence, Hefei University of Technology(合肥工业大学人工智能创新学院) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出OSDEnhancer框架,通过一步扩散模型实现鲁棒的时空视频超分辨率,解决了现实世界中复杂未知退化的问题,通过线性初始化和分治策略提升时空动态和纹理恢复性能。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19865 2026-05-20 cs.CV 79%

Landscape-Awareness for Geometric View Diffusion Model

面向几何视角的扩散模型

Yan-Ting Chen, Hao-Wei Chen, Tsu-Ching Hsiao, Chun-Yi Lee

机构 * Elsa Lab, National Taiwan University(国家台湾大学 Elsa 实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种面向几何视角的扩散模型,通过重塑优化景观来引导更新至真实视角,并通过视角条件扩散模型进行细化,以提高收敛性、减少对暴力采样依赖并实现更高的样本效率。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19804 2026-05-20 cs.CV cs.AI cs.LG 79%

Stitched Value Model for Diffusion Alignment

用于扩散对齐的拼接价值模型

Hyojun Go, Hyungjin Chung, Prune Truong, Goutam Bhat, Li Mi, Zhaochong An, Zixiang Zhao, Dominik Narnhofer, Serge Belongie, Federico Tombari, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) University of Copenhagen(哥本哈根大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出StitchVM,一种将预训练的干净图像奖励模型转移到噪声潜在空间的拼接框架,通过高效转移和微调,提升扩散对齐的效率和效果。

Comments Project page: https://gohyojun15.github.io/StitchVM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19556 2026-05-20 cs.CV 79%

EpiDiffVO: Geometry-Aware Epipolar Diffusion for Robust Visual Odometry

EpiDiffVO: 一种基于几何的视差扩散用于鲁棒视觉里程计

Prateeth Rao

机构 * International Institute of Information Technology Bangalore(国际信息科技学院班加罗尔)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种稀疏视差匹配框架,通过优化几何一致性来减少冗余,并结合视差扩散过程和图神经网络实现高效的视觉里程计。

Comments 8 pages, 5 figures, in revision to be submitted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19378 2026-05-20 cs.CV 79%

Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock

视觉扩散变换器中稀疏专家混合路由的稀疏性:从路由崩溃到选择性死锁的诊断、边界校准和进化路线图

Haiying Sha

机构 * Haiying Sha(海ying Sha)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文系统诊断了Token-Choice稀疏混合专家(MoE)在视频扩散变换器中的训练失败模式,通过分析超过6500万个标记的路由决策时间序列,提出了功能冗余假说,并总结了从视觉统一到世界模型的三步进化路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14530 2026-05-20 cs.CV 79%

Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models

缓解大扩散视觉-语言模型中的遮蔽先验漂移和位置注意力崩溃

Sujung Hong, Chanyong Yoon, Seong Jae Hwang

机构 * Department of Artificial Intelligence, Yonsei University, Seoul, Republic of Korea(首尔大学人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了大扩散视觉-语言模型在长形式生成中的重复生成和视觉 grounding 退化问题,提出了一种无需训练的解决方案来缓解遮蔽先验漂移和位置注意力崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20981 2026-05-20 cs.CV 79%

Distribution Prototype Diffusion Learning for Open-set Supervised Anomaly Detection

分布原型扩散学习用于开放集监督异常检测

Fuyun Wang, Tong Zhang, Yuanzhi Wang, Yide Qiu, Xin Liu, Xu Guo, Zhen Cui

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing SeetaCloud Technology(南京海康威视科技) Beijing Normal University(北京师范大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种分布原型扩散学习方法,通过构建可学习的高斯原型来创建潜在表示空间,以提高正常样本的判别边界,并通过Schroedinger桥促进正常样本向原型的扩散,同时将异常样本推离,从而提升异常检测性能。

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20124 2026-05-20 cond-mat.quant-gas cond-mat.stat-mech cond-mat.str-el 78%

Finite-temperature spin diffusion in the two-dimensional XY model

二维XY模型中有限温度下的自旋扩散

Erik Fitzner, Byungjin Lee, Junhyeok Hur, Minseok Kim, Benedikt Schneider, Jae-yoon Choi, Björn Sbierski

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过理论与实验结合的方法,量化了二维正方形晶格量子自旋-1/2 XY模型在有限温度下的自旋扩散,展示了在超越一维范围和验证先进量子模拟平台定量能力上的突破。

Comments 6+3 pages, comments are welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19886 2026-05-20 math.DS 78%

Constraint-Aware Physics-Informed Neural Networks for SEIR Reaction-Diffusion Epidemic Models with Vital Dynamics

具有约束的物理信息神经网络用于带有人口动态的SEIR反应扩散流行病模型

Achraf Zinihi, Matthias Ehrhardt

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种具有约束的物理信息神经网络(PINN)方法,用于带有均匀Neumann边界条件的SEIR反应扩散系统,通过结构保持隐式显式非标准有限差分(NSFD)方案生成合成基准数据,以解决空间流行病学数据稀缺的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏