arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-02 至 2026-07-02 共收录 103 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2511.18050 2026-07-02 cs.CV cs.AI 交叉投稿 89%

UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios

UltraFlux:面向多种宽高比的高质量原生4K文本到图像生成的数据-模型协同设计

Tian Ye, Song Fei, Lei Zhu

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对扩散变压器扩展到原生4K多宽高比时出现的位置编码、VAE压缩和优化耦合失效问题,提出数据-模型协同设计的UltraFlux,通过共振2D RoPE、非对抗VAE后训练、SNR感知Huber小波目标和分阶段美学课程学习,在4K分辨率下实现高保真、细节保留的文本到图像生成。

Comments Project Page: https://w2genai-lab.github.io/UltraFlux/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08492 2026-07-02 cs.CV cs.AI 新提交 86%

Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation

眼见为实:基于视觉锚点的提示重写对齐用于文本到图像生成

Xuanyi Liu, Deyi Ji, Junyu Lu, Jing Wang, Lanyun Zhu, Qianxiong Xu, Xuhang Chen, Tianrun Chen, Siwei Ma

机构 * Peking University(北京大学) Tencent(腾讯) Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学) University of Cambridge(剑桥大学) Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 提出FaithRewriter框架,利用多模态大模型生成中间视觉线索,结合大语言模型生成视觉锚定的增强提示,再蒸馏至小模型,以缩小用户意图与生成图像之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24548 2026-07-02 cs.CV 新提交 79%

Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning

文本到图像模型是归纳主义的火鸡吗?一个用于因果推理的反事实基准

Jiayi Lei, Yuandong Pu, Xingyu Han, Rongpeng Zhu, Jing Xu, Jinyao Wang, Zijian Zhou, Bin Fu, Yuewen Cao, Yihao Liu, Hongsheng Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 提出反事实基准CF-World,通过三个递进层级测试T2I模型在违反现实先验规则下的图像生成能力,发现所有模型在反事实设置下性能急剧下降,原因是模型将世界知识与视觉外观编码为紧密耦合的模式。

Comments 10 pages, 7 figures. Project page: https://github.com/jylei16/CF-World.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03650 2026-07-02 cs.CV cs.LG 版本更新 57%

Generated Contents Enrichment

生成内容丰富化

Mahdi Naseri, Jiayan Qiu, Zhou Wang

机构 * University of Waterloo(滑铁卢大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出生成内容丰富化任务,通过显式场景表示丰富稀疏场景描述,再用对抗框架生成语义更丰富、结构连贯的图像。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2403.19645 2026-07-02 cs.CV 版本更新 79%

Learn Once, Edit Anywhere: Visual Direction Transfer for Diffusion Models

一次学习,随处编辑:扩散模型的视觉方向迁移

Yusuf Dalva, Hidir Yesiltepe, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 图像编辑 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ViDiT框架,通过从图像编辑对中学习连续编辑方向,实现无需微调的零样本图像属性编辑,在保持输入保真度的同时实现精确、可扩展的属性控制。

Comments ECCV 2026, Project page: http://vidit-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00410 2026-07-02 cs.CV cs.LG 新提交 70%

MindAU: EEG-Conditioned Facial Action Unit Editing via Dual-Stream Manifold Alignment

MindAU: 基于双流流形对齐的脑电条件面部动作单元编辑

Zhenhang Li, Xin Zhou, Hao Deng, Lijun Yin

机构 * Binghamton University(宾汉姆顿大学) Massachusetts General Hospital(马萨诸塞综合医院) Harvard Medical School(哈佛医学院)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 提出MindAU框架,通过双流流形对齐将EEG特征与AU文本语义和视觉位移对齐,实现高保真身份保持的面部动作单元编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18765 2026-07-02 cs.CV cs.AI 版本更新 57%

NI-Tex: Non-isometric Image-based Garment Texture Generation

NI-Tex: 基于非等距图像的服装纹理生成

Hui Shan, Ming Li, Haitao Yang, Kai Zheng, Sizhe Zheng, Yanwei Fu, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对非等距图像与3D服装网格间的纹理生成问题,提出结合物理模拟数据集、非等距图像编辑和迭代烘焙的框架,生成高质量PBR纹理。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16711 2026-07-02 cs.CV eess.IV 57%

Motion Transfer-Enhanced StyleGAN for Generating Diverse Macaque Facial Expressions

增强型运动转移StyleGAN用于生成多样化猕猴面部表情

Takuya Igaue, Catia Correia-Caeiro, Akito Yoshida, Takako Miyabe-Nishiwaki, Ryusuke Hayashi

机构 * Human Informatics Research Institute, National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究所(AIST)人类信息学研究所) Graduate School of Engineering, The University of Tokyo(东京大学工学研究科) Human Biology & Primate Cognition, Institute of Biology, Leipzig University(莱比锡大学生物研究所人类生物学与灵长类认知) Araya Inc.(Araya公司) Center for the Evolutionary Origins of Human Behavior (EHuB), Kyoto University(京都大学人类行为进化起源中心(EHuB))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出利用StyleGAN2生成猕猴面部表情,通过运动转移增强数据,改进训练集多样性与精度,实现更丰富的表情生成。

Journal ref IEEE Access, vol. 14, pp. 95120-95136, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 74 篇

2607.00402 2026-07-02 cs.CV cs.AI cs.LG 新提交 88%

The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models

文本到图像扩散模型安全对齐中的高效用幻觉

Adeel Yousaf, Soumik Ghosh, James Beetham, Amrit Singh Bedi, Mubarak Shah

机构 * Institute of Artificial Intelligence University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 揭示安全对齐方法在粗粒度指标上看似高效用,但在细粒度语义正确性上显著下降,提出结构感知几何正则化(SAGE)以恢复结构化效用。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00094 2026-07-02 cs.CV cs.AI 版本更新 88%

Diffusion Image Generation with Explicit Modeling of Data Manifold Geometry

显式建模数据流形几何的扩散图像生成

Duoduo Xue, Zhiyu Zhu, Junhui Hou

机构 * City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出MIND框架,通过将离散补丁标记化集成到连续扩散模型的得分函数中显式建模流形几何,结合离散标记的结构量化能力和连续扩散的并行生成灵活性,在ImageNet 256×256上显著降低FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14679 2026-07-02 cs.CV 版本更新 88%

Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection

基于语义注入的通用图像免疫方法抵御基于扩散模型的图像编辑

Chanhui Lee, Donggyu Choi, Seunghyun Shin, Hae-Gon Jeon, Jeany Son

机构 * POSTECH(浦项科技大学) GIST(光州科学技术院) Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

AI总结 提出首个通用对抗扰动框架,通过语义注入使扩散模型误解输入图像,抑制原始内容,从而有效阻断未经授权的编辑,在通用扰动设置下优于基线,并具备黑盒迁移性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08127 2026-07-02 cs.CV cs.AI 版本更新 88%

Controllable Diffusion-Based Lesion Inpainting for Scalable Histopathology Data Augmentation

基于可控扩散的病灶修复用于可扩展的组织病理学数据增强

Mohamad Koohi-Moghadam, Mohammad-Ali Nikouei Mahani, Rex K. H. Au-Yeung, Raymond Yu O, Monalyn Marabi, Piyapharom Intarawichian, Fabian Z. X. Lean, Andrew Ferguson, Kyongtae Tyler Bae

机构 * Department of Diagnostic Radiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院诊断放射学系) Department of Pathology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院病理学系) Department of Anatomical and Cellular Pathology, Prince of Wales Hospital, The Chinese University of Hong Kong(香港中文大学威尔斯亲王医院解剖及细胞病理学系) Department of Infectious Diseases and Public Health, Jockey Club College of Veterinary Medicine and Life Sciences, City University of Hong Kong(香港城市大学赛马会动物医学及生命科学院传染病及公共卫生学系) CityU Veterinary Diagnostic Laboratory Co., Ltd., City University of Hong Kong(香港城市大学城市大学兽医诊断实验室有限公司)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 提出PathoGen扩散模型,将病灶可控地修复到良性组织图像中,生成高保真形态,在四个数据集上优于基线,病理专家区分真假仅略高于随机(57.75%),数据增强使分割Dice提升最高0.18。

Comments 19 pages, 5 figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16325 2026-07-02 cs.CV 版本更新 87%

UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention

UltraImageGen: 高效超高清图像生成与层级局部注意力

Yuyao Zhang, Yu-Wing Tai

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 提出UltraImageGen框架,通过层级局部注意力和低分辨率全局引导,将预训练扩散模型扩展到8K以上分辨率,实现近线性复杂度、10倍加速和更低内存占用。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00817 2026-07-02 cs.CV 新提交 85%

Training-Free Debiasing of Diffusion Models via CLIP-Guided Denoising Optimization

无需训练的扩散模型去偏方法:基于CLIP引导的去噪优化

Dain Kim, Jinseo Kim, Sungyong Baik

机构 * Dept. of Artificial Intelligence, Hanyang University(汉阳大学人工智能系) Dept. of Data Science, Hanyang University(汉阳大学数据科学系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出TES框架,通过扩散过程中优化文本嵌入来缓解人口统计偏见,无需重新训练,使用两阶段策略(早期全局对齐+迭代去噪时CLIP反馈)实现稳定可控的属性引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01147 2026-07-02 cs.CV 新提交 83%

EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation

EquiSteer: 面向更公平的文本引导图像生成的交叉注意力引导

Tatiana Gaintseva, Akshit Achara, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Noah’s Ark(华为诺亚方舟实验室) King’s College London(伦敦国王学院) Imperial College London(帝国理工学院)

专题命中 扩散模型 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出EquiSteer,一种无需训练的方法,通过在推理时引导交叉注意力激活来减少文本到图像扩散模型中的性别偏见,平均减少高达87%的性别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00183 2026-07-02 cs.CV 新提交 83%

DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation

DriftScope: 测量扩散模型适应的隐藏效应

Héctor Laria, Yiping Han, Julian D. Santamaria, Kai Wang, Bogdan Raducanu, Joost van de Weijer, Alexandra Gomez-Villa

机构 * Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Universitat Autonoma de Barcelona, Barcelona, Spain(巴塞罗那自治大学) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机科学项目) City University of Hong Kong, HK SAR, China(香港城市大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对预训练文本到图像扩散模型的适应(概念定制或遗忘),提出DriftScope诊断工具,通过稀疏自编码器和零样本分类揭示模型权重修改导致语义无关概念系统性漂移,FID/KID无法早期检测,而特定类别零样本准确率下降高达18.9点。

Comments 22 pages, 5 figures, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27285 2026-07-02 cs.CV cs.CR 版本更新 83%

Rethinking Robust Adversarial Concept Erasure in Diffusion Models

重新思考扩散模型中的鲁棒对抗性概念擦除

Qinghong Yin, Yu Tian, Heming Yang, Xiang Chen, Xianlin Zhang, Yue Ming, Xueming Li, Yue Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对扩散模型中概念擦除的对抗训练忽视概念语义导致拟合不足的问题,提出语义引导的鲁棒对抗概念擦除方法S-GRACE,显著提升擦除性能26%并减少90%训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11925 2026-07-02 cs.CV 版本更新 83%

Continuous Speculative Decoding for Autoregressive Image Generation

连续推测解码用于自回归图像生成

Zili Wang, Zheng Zhang, Kun Ding, Qi Yang, Fei Li, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) JD.COM Inc(京东集团股份有限公司) China Tower Corporation Limited(中国铁塔股份有限公司)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出连续推测解码方法,通过近似准则、去噪轨迹对齐和接受-拒绝采样,加速连续视觉自回归模型,实现2倍以上加速且保持生成质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00987 2026-07-02 cs.CV 新提交 79%

AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution

AVSR-Diff: 用于时间一致任意尺度视频超分辨率的尺度无关扩散先验

Geunhyuk Youk, Jeonghyeok Do, Dayeon Kim, Jihyong Oh, Munchurl Kim

机构 * KAIST(韩国科学技术院) CMLab, Chung-Ang University(中央大学CMLab)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出AVSR-Diff框架,通过解耦尺度无关的潜在去噪与连续坐标渲染,并引入时间门控特征循环和尺度感知傅里叶细化模块,实现任意尺度下的高保真时间一致视频超分辨率。

Comments Accepted to ECCV 2026. Project page: https://kaist-viclab.github.io/AVSR-Diff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00647 2026-07-02 cs.CV 新提交 79%

Not All Prediction Targets Keep Training-Free Diffusion Guidance on the Manifold

并非所有预测目标都能保持无训练扩散引导在流形上

Yunsung Lee, Hyeongmin Lee

机构 * Seoul National University of Science and Technology(首尔科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文分析不同预测目标对无训练扩散引导中干净图像估计精度的影响,提出x预测能最可靠地保持引导样本在数据流形上,并引入Child FID指标评估流形损伤。

Comments Accepted to ECCV 2026. 15-page main paper with appendix (48 pages total, 14 figures). Project page: https://manluml.github.io/on-manifold-tfg

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00509 2026-07-02 cs.CV 新提交 79%

AnF-DiffPET: Anatomy- and Frequency-Guided Diffusion for PET/CT Denoising

AnF-DiffPET: 用于PET/CT去噪的解剖与频率引导扩散

Xuepeng Liu, Ruili Li, Zetong Liu, Renyiming Li, Yan Li, Yin Dai, Chao Li, Yueyang Teng

机构 * College of Medicine and Biological Information Engineering, Northeastern University(东北大学医学与生物信息工程学院) Tohoku University School of Medicine(东北大学医学院) Department of Clinical Neurosciences, University of Cambridge(剑桥大学临床神经科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出AnF-DiffPET框架,通过解剖-频率引导、多尺度交叉变换重建和频率对比硬挖掘,解决低剂量PET去噪中的解剖引导不足、多尺度特征传播不稳定和频域恢复不确定性问题,在多个数据集上优于现有方法。

Comments 11 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00382 2026-07-02 cs.CV 新提交 79%

Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers

活力感知压缩:面向高效图像到形状扩散Transformer

Jaeah Lee, Hyunjin Kim, Jaewoong Cho, Gihyun Kwon

机构 * KRAFTON AI, Republic of Korea(KRAFTON AI, 韩国) Amazon, Australia(亚马逊, 澳大利亚)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出首个针对图像到形状扩散Transformer的压缩方法,通过活力引导的结构化剪枝、自适应量化和微调,在保持几何保真度下实现高达66%的模型尺寸缩减。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00058 2026-07-02 cs.CV 新提交 79%

Joint Medical Image Enhancement and Segmentation with Diffusion-based Symbiotic Information Interaction

基于扩散的共生信息交互的联合医学图像增强与分割

Ying Chen, Jinyue Li, Qiankun Li

机构 * Shenzhen Research Institute, The Chinese University of Hong Kong(香港中文大学深圳研究院) University of Science and Technology of China(中国科学技术大学) Imperial Global Singapore, Imperial College London(伦敦帝国学院新加坡分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DiSIINet,利用扩散模型和共生信息交互模块,在统一框架中实现图像增强与分割的相互促进,在多模态医学图像上取得显著性能提升。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13581 2026-07-02 cs.CV 版本更新 79%

HIR-ALIGN: Enhancing Hyperspectral Image Restoration via Diffusion-Based Data Generation

HIR-ALIGN:通过基于扩散的数据生成增强超光谱图像恢复

Li Pang, Heng Zhao, Yijia Zhang, Deyu Meng, Xiangyong Cao

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Mathematics and Statistics and the Ministry of Education Key Laboratory for Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学学院和教育部智能网络与网络安全重点实验室) Pazhou Laboratory (Huangpu), Guangzhou(广州黄埔 Pazhou 实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HIR-ALIGN框架,通过生成与目标分布匹配的合成数据提升超光谱图像恢复性能,包含代理生成、分布自适应合成和对齐监督微调三个阶段,理论分析表明增强细调可降低目标域恢复风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19036 2026-07-02 cs.CV 版本更新 79%

FUMO: Prior-Modulated Diffusion for Single Image Reflection Removal

FUMO:先验调制扩散模型用于单图像反射去除

Telang Xu, Chaoyang Zhang, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FUMO扩散模型,通过从混合图像提取强度和高频先验,结合粗到细训练范式,实现空间自适应和结构保真的单图像反射去除。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15129 2026-07-02 cs.CV 版本更新 79%

Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors

利用视频扩散先验的超低比特率图像压缩的下一帧解码

Yunuo Chen, Chuqin Zhou, Jiangchuan Li, Xiaoyue Ling, Bing He, Jincheng Dai, Li Song, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种超低比特率图像压缩新范式,通过定义紧凑锚帧作为中间状态,利用预训练视频扩散模型将解码转化为下一帧预测,在保持语义的同时丢弃高频细节,相比DiffC在CLIC2020上节省超50%比特率并实现5倍解码加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06275 2026-07-02 cs.CV 版本更新 79%

Spectral and Trajectory Regularization for Diffusion Transformer Super-Resolution

扩散变换器超分辨率的频谱与轨迹正则化

Jingkai Wang, Yixin Tang, Jue Gong, Jiatong Li, Shu Li, Libo Liu, Jianliang Lan, Yutong Liu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shenzhen Transsion Holdings Co., Ltd.(深圳传音控股股份有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出StrSR框架,通过非对称判别蒸馏和频率分布匹配策略,解决扩散变换器在真实图像超分辨率中的轨迹失配和周期性伪影问题,实现最先进性能。

Comments 15 pages, appears at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03370 2026-07-02 cs.CV cs.LG 版本更新 79%

GryphOne: Symbol-Aware Masked Diffusion for Structural Refinement in Offline Handwritten Mathematical Expression Recognition

GryphOne: 面向离线手写数学表达式识别中结构细化的符号感知掩码扩散

Takaya Kawakatsu, Ryo Ishiyama

机构 * Preferred Networks, Inc.(Preferred Networks公司) Kyushu University(九州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出离散扩散框架GryphOne,将HMER重构为迭代符号细化而非序列生成,通过符号感知分词和随机掩码互学习提升鲁棒性,在MathWriting上达到5.51% CER和59.9% EM,超越所有重实现模型和商业系统。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11641 2026-07-02 cs.CV cs.LG 版本更新 79%

Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers

分布混合至关重要:面向高效视频扩散Transformer的动态稀疏注意力

Yuxi Liu, Yipeng Hu, Zekun Zhang, Kunze Jiang, Kun Yuan

机构 * Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出MOD-DiT框架,通过两阶段动态稀疏注意力(利用早期去噪先验和分布混合线性近似预测掩码,结合在线块掩码策略)在无需采样的情况下实现高效视频生成,显著加速并保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15702 2026-07-02 cs.CV 版本更新 79%

End-to-End Training for Autoregressive Video Diffusion via Self-Resampling

通过自重采样实现自回归视频扩散的端到端训练

Yuwei Guo, Ceyuan Yang, Hao He, Yang Zhao, Meng Wei, Zhenheng Yang, Weilin Huang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance Seed(字节跳动Seed) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出自回归视频扩散模型的端到端训练框架Resampling Forcing,通过自重采样模拟推理错误,结合稀疏因果掩码和动态历史路由,实现长视频生成的时间一致性。

Comments Project Page: https://guoyww.github.io/projects/resampling-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏