arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-30 至 2026-06-30 共收录 177 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 8 篇

2606.30262 2026-06-30 cs.CV 88%

Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment

中间文本表示引导的文本到图像生成以增强唯一性对齐

Soyoun Won, Aryan Yazdan Parast, Basim Azam, Jean Honorio, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型在生成唯一性对象时因概念关联偏差导致对齐失败的问题,提出中间文本表示引导扩散方法,无需额外训练即可恢复被抑制的概念,在OAO-AttackBench上VQAScore提升高达19.1个百分点。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29013 2026-06-30 cs.CV 87%

Mural: Transferring LLM knowledge to image generation via Mixture-of-Transformers

Mural: 通过混合Transformer将LLM知识迁移到图像生成

Achin Jain, Jie An, Siddharth Chaudhary, Davide Modolo

机构 * Amazon AGI(亚马逊人工智能研究院)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 提出Mixture-of-Transformers架构,将冻结的LLM与扩散图像生成器结合,仅用文本-图像对训练,在多个基准上取得优异性能,并涌现出跨语言生成、颜色引导构图等新能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28643 2026-06-30 cs.CV 83%

Obliviate: Erasing Concepts from Autoregressive Image Generation Models

Obliviate: 从自回归图像生成模型中擦除概念

Hossein Shakibania, Jonas Henry Grebe, Tobias Braun, Ege Aktemur, Saleh Aslani, Mehmet Görkem Yiğit, Marcus Rohrbach

机构 * TU Darmstadt, Germany(图宾根大学) Multimodal AI Lab, TU Darmstadt, Germany(多模态人工智能实验室) Zuse School ELIZA(祖斯学院ELIZA) hessian.AI, Germany(海西斯.AI)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出Obliviate方法,通过KL散度监督视觉token分布、轨迹级更新和对齐视觉前缀,有效擦除自回归文生图模型中的有害概念,在保持模型效用同时大幅降低不当内容生成。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30458 2026-06-30 cs.CV 79%

Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance

跨分辨率语义迁移用于低分辨率监控下的鲁棒文本-图像检索

Wenjie Qian, Bin Yang, Xiao Wang, Wenke Huang, Ling Mei, Xin Xu, Mang Ye

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University(武汉大学计算机学院,国家多媒体软件工程技术研究中心) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System, Wuhan University of Science and Technology(湖北省智能信息处理与实时工业系统重点实验室,武汉科技大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 针对低分辨率监控场景中文本-图像检索的可靠性崩溃和排序漂移问题,提出CLIP框架CRST,通过分辨率条件推理、文本引导精炼和跨分辨率邻域迁移,在三个数据集上平均提升超低分辨率Rank-1和mAP分别5.7%和5.3%。

Comments 10 pages,8 figures,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27122 2026-06-30 cs.CV 79%

InterPartAbility: Phrase-Region Grounding for Interpretable Text-to-Image Person Re-Identification

InterPartAbility: 基于文本引导的部分匹配用于可解释的人员重识别

Shakeeb Murtaza, Aryan Shukla, Rajarshi Bhattacharya, Maguelonne Heritier, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA系统工程系,蒙特利尔ÉTS学院,加拿大) Genetec Inc.(Genetec公司)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出InterPartAbility,通过显式部分匹配和短语-区域绑定提升TI-ReID的可解释性,引入PPIM模块实现概念级指导,生成 grounded 解释图谱,实验表明在CUHK-PEDES等基准上达到SOTA可解释性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15727 2026-06-30 cs.CV cs.AI cs.GR cs.LG eess.IV 73%

Spanning the Visual Analogy Space with a Weight Basis of LoRAs

通过LoRAs的权重基来跨越视觉类比空间

Hila Manor, Rinon Gal, Haggai Maron, Tomer Michaeli, Gal Chechik

专题命中 文生图 :text-to-image(abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 本文提出LoRWeB,通过在单次推理中为每个类比任务专门化模型,动态组合学习的变换原语,以提升视觉类比学习的泛化能力。

Comments Accepted to ECCV 2026; Code and data are in https://research.nvidia.com/labs/par/lorweb

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07778 2026-06-30 cs.CV 70%

Distribution Matching Variational AutoEncoder

分布匹配变分自编码器

Sen Ye, Jianning Pei, Mengde Xu, Shuyang Gu, Chunyu Wang, Liwei Wang, Han Hu

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出DMVAE,通过分布匹配约束将编码器的潜在分布与任意参考分布对齐,发现基于自监督学习的分布在图像生成中表现优异。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08307 2026-06-30 stat.ML cs.LG 67%

Concentration bounds on response-based vector embeddings of black-box generative models

基于响应的生成模型向量嵌入的集中界

Aranyak Acharyya, Joshua Agterberg, Youngser Park, Carey E. Priebe

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

AI总结 本文研究了基于响应的生成模型向量嵌入的集中界,通过数据核视角空间嵌入方法,在适当正则条件下推导出样本向量嵌入的高概率集中界,并确定所需样本响应数量以实现目标精度的群体嵌入近似。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 7 篇

2606.30054 2026-06-30 cs.CV 79%

Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation

照亮统一多模态模型以实现自由形式交错文本-图像生成

Chonghuinan Wang, Zhikai Chen, Chunwei Wang, Yecong Wan, Junwei Yang, Zhixin Wang, Wei Zhang, Jiaqi Xu, Renjing Pei, Xiaohe Wu, Fan Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) Nankai University(南开大学)

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 提出ILLUME-X统一多模态模型,通过改进数据效率和稳定训练,实现高质量自由形式交错文本-图像生成,在风格迁移等任务上超越先前模型。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12175 2026-06-30 cs.CV 79%

Redefining Quality Criteria and Distance-Aware Score Modeling for Image Editing Assessment

重新定义质量标准与距离感知评分建模用于图像编辑评估

Xinjie Zhang, Qiang Li, Xiaowen Ma, Axi Niu, Li Yan, Qingsen Yan

机构 * Northwestern Polytechnical University(西北工业大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出DS-IEQA框架,通过反馈驱动指标优化和令牌解耦距离回归损失,改进图像编辑质量评估的指标定义与评分连续性建模。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 2812-2820

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29286 2026-06-30 cs.CV 57%

ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving

ASTAD:自动驾驶中合成到真实适应的非对称风格迁移

Dingyi Yao, Xinqi Zhang, Lihui Peng, Jianming Hu, Danya Yao, Yi Zhang

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 提出ASTAD任务,针对合成数据有标注而真实数据无标注的不对称性,设计无训练两阶段框架ASTModel,通过粗语义先验提取和动态精炼实现类一致风格迁移,显著提升下游感知性能并加速推理。

Comments Accepted for publication at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28724 2026-06-30 cs.CV cs.AI 57%

CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation

CCRC:面向图像变化描述与分割的变化感知描述与推理链

Jinhong Hu, Xiaoping Wang, Shuyin Huang, Guojin Zhong, Kaitai Liu, Kai Lu

机构 * College of Computer Science and Electronic Engineering, Hunan University, China(湖南大学计算机科学与电子工程学院,中国) Guangxi Minzu University, China(广西民族大学,中国) National University of Defense Technology, China(国防科学技术大学,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出变化感知描述与推理链(CCRC),通过双链框架解耦语义推理与空间分割,实现图像变化描述与分割(ICCS)任务,在合成和真实基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13082 2026-06-30 cs.CV cs.RO eess.IV 57%

InterEdit: Navigating Text-Guided 3D Dyadic Human Motion Editing

InterEdit:文本引导的3D双人运动编辑

Yebin Yang, Di Wen, Lei Qi, Weitong Kong, Junwei Zheng, Ruiping Liu, Yufan Chen, Chengzhi Wu, Kailun Yang, Yuqian Fu, Danda Pani Paudel, Luc Van Gool, Kunyu Peng

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) KAUST(韩国国立大学) INSAIT

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出InterEdit3D数据集和TMME基准,基于文本引导的双人3D运动编辑方法,通过语义感知计划令牌对齐和交互感知频率令牌对齐策略提升编辑一致性与保真度。

Comments Accepted to ECCV 2026. The dataset and code will be released at https://github.com/YNG916/InterEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03143 2026-06-30 cs.CV cs.AI 57%

Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing

二维编辑,三维验证:强化学习用于多视角一致场景编辑

Jiyuan Wang, Chunyu Lin, Lei Sun, Zhi Cao, Yuyang Yin, Lang Nie, Zhenlong Yuan, Xiangxiang Chu, Yunchao Wei, Kang Liao, Guosheng Lin

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出RL3DEdit框架,利用强化学习优化多视角一致的3D场景编辑,通过VGGT模型生成的置信度图和姿态误差作为奖励信号,提升编辑质量与效率。

Comments Accepted by ECCV 2026, 32 pages, 10 figures, with Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28732 2026-06-30 eess.AS 50%

CTC-Seeded Token Edit Refinement for Non-Autoregressive Speech Recognition

基于CTC初始化的标记编辑精炼用于非自回归语音识别

Wanting Huang, Weiran Wang

专题命中 图像编辑 :diffusion(abstract)

AI总结 提出一种非自回归语音识别方法,利用CTC假设作为初始序列,通过编辑流解码器并行预测插入、删除和替换操作,仅需两步编辑即可显著降低词错误率。

Comments Submitted to IEEE SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 125 篇

2603.12575 2026-06-30 cs.CV 89%

AccelAes: Accelerating Diffusion Transformers for Training-Free Aesthetic-Enhanced Image Generation

AccelAes: 通过美学感知的时空缩减加速无训练扩散变换器

Xuanhua Yin, Chuanzhi Xu, Haoxian Zhou, Boyu Wei, Weidong Cai

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出AccelAes框架,通过空间-时间缩减提升扩散变换器的生成效率与美学质量,在Lumina-Next上实现2.11倍加速并提升ImageReward 11.9%。

Comments Accepted by ECCV2026; 34 pages, 19 tables, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05693 2026-06-30 eess.IV cs.AI cs.CV 88%

Longitudinal Lesion Inpainting in Brain MRI via 3D Region Aware Diffusion

通过3D区域感知扩散进行脑部MRI的纵向病变修复

Zahra Karimaghaloo, Dumitru Fetco, Haz-Edine Assemlal, Hassan Rivaz, Douglas L. Arnold

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 本文提出基于DDPM的新型伪3D纵向修复框架,利用多通道条件结合不同时间点的纵向信息,提高病变修复的感知保真度和纵向稳定性,同时提升处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02172 2026-06-30 cs.CV 88%

TerraDiT: Point-Conditioned Diffusion Transformer for Satellite Image Synthesis

TerraDiT:基于点的扩散变换器用于卫星图像合成

Srikumar Sastry, Dan Cher, Brian Wei, Aayush Dhakal, Subash Khanal, Dev Gupta, Nathan Jacobs

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);image generation(abstract);分类 cs.CV

AI总结 TerraDiT通过点条件控制实现文本到卫星图像生成,提供语义丰富的控制信号,具有灵活、标注友好和计算简单的推理特性。

Comments 26 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30332 2026-06-30 cs.CV 83%

UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception

UniGP:驯服扩散Transformer以实现先验保留的统一生成与感知

Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zeekr Automobile R&D Co., Ltd.(小鹏汽车研发有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出UniGP框架,基于MMDiT通过简单联合训练统一可控生成与密集预测,无需复杂任务设计,保留骨干先验,在多个任务上超越先前统一方法并与专用方法持平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29801 2026-06-30 cs.CV 83%

Concept Removal Guidance: Evidence-Calibrated Negative Guidance for Safe Diffusion Sampling

概念移除引导:用于安全扩散采样的证据校准负引导

Yoonseok Choi, Chaeyoung Oh, Hyunjun Choi, Seokin Seo, Kee-Eung Kim

机构 * KAIST(韩国科学技术院) KIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出概念移除引导(CRG),一种无需训练的方法,通过从模型噪声预测中估计不良概念存在并自适应校准负引导权重,在保持良性保真度的同时降低攻击成功率。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28628 2026-06-30 eess.IV cs.CV cs.LG 83%

Envisage: Diffusion-Based Rhinoplasty Goal Visualization with Mask-Decomposed Evaluation

Envisage:基于扩散的鼻整形目标可视化与掩码分解评估

Mudit Agarwal, Amit D. Bhrany

机构 * University of Washington(华盛顿大学) University of Washington School of Medicine(华盛顿大学医学院) Department of Otolaryngology–Head and Neck Surgery(耳鼻喉科–头颈外科部门)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出Envisage扩散修复管线,从单张正面照片可视化鼻整形目标,并引入SurgicalScore掩码分解协议评估局部编辑质量,克服全脸身份指标在硬合成编辑下的混淆。

Comments 29 pages, 4 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00654 2026-06-30 cs.CV 83%

Seed-to-Seed: Unpaired Image Translation in Diffusion Seed Space

种子到种子:扩散种子空间中的无配对图像翻译

Or Greenberg, Eran Kishon, Dani Lischinski

机构 * General Motors R&D(通用汽车研发中心) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出一种结合GAN和扩散模型的无配对图像翻译方法,通过利用预训练扩散模型的种子空间语义信息,实现复杂汽车场景的结构保持翻译,优于现有方法。

Comments British Machine Vision Conference (BMVC) 2025. Official proceedings: https://bmvc2025.bmva.org/proceedings/154/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05934 2026-06-30 cs.CV 83%

AD-DAE: Alzheimer's Disease Progression Modeling with Unpaired Longitudinal MRI using Diffusion Auto-Encoders

AD-DAE:利用未配对纵向MRI进行阿尔茨海默病进展建模的扩散自编码器

Ayantika Das, Arunima Sarkar, Keerthi Ram, Mohanasankar Sivaprakasam

机构 * Indian Institute of Technology Madras (IITM)(印度理工学院马德拉斯分校) Sudha Gopalakrishnan Brain Centre (SGBC), IITM(苏达·戈帕拉克里希南脑中心(SGBC),印度理工学院马德拉斯分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出AD-DAE框架,通过扩散自编码器在无配对纵向MRI数据中建模阿尔茨海默病进展,利用紧凑的潜在空间生成后续影像。

Comments Accepted in IEEE Journal of Biomedical and Health Informatics ( https://ieeexplore.ieee.org/document/11579738 )

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07711 2026-06-30 cs.CV cs.AI 83%

SSM Meets Video Diffusion Models: Efficient Long-Term Video Generation with Structured State Spaces

结构状态空间模型与视频扩散模型的结合:利用结构状态空间实现高效长时视频生成

Yuta Oshima, Shohei Taniguchi, Masahiro Suzuki, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出利用结构状态空间模型作为视频扩散模型的时序特征提取器,以解决传统注意力层在生成长视频序列时的计算成本问题,实验表明结构状态空间模型在内存使用和性能上更具优势。

Comments Accepted as a workshop paper at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28922 2026-06-30 eess.IV 82%

Cross-Sensor SAR Data Generation Using Diffusion Models and Feature Migration

基于扩散模型和特征迁移的跨传感器SAR数据生成

Xuanting Wu, Fan Zhang, Fei Ma, Qiang Yin, Yongsheng Zhou

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出融合稳定扩散模型与注意力蒸馏的框架,利用历史SAR数据生成适配新传感器特性的训练数据,缓解数据稀缺问题。

Journal ref Transactions of Nanjing University of Aeronautics and Astronautics, 2025, 42(4): 509-524

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25044 2026-06-30 cs.RO 82%

X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models

X-DiffVLA:面向视觉-语言-动作模型的跨具身扩散动作头

Boyu Li, Chaoyi Xu, Haoqi Yuan, Xinrun Xu, Börje F. Karlsson, Haoran Li, Zongqing Lu, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(SKL-MAIS,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) BeingBeyond School of Computer Science, Peking University(北京大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对跨具身数据学习通用策略的挑战,提出X-DiffVLA模型,通过扩散模型和具身强制技术实现异构末端执行器间的知识迁移,在RoboCasa和Isaac Gym上分别提升15.3%和12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29095 2026-06-30 cs.CV cs.GR cs.LG 81%

HorizonRelight: Relighting Long-horizon Videos Consistently via Diffusion Transformers

HorizonRelight: 通过扩散变换器一致地重照明长时域视频

Jing Yang, Mayoore Jaiswal, Zian Wang, Steven Zeng, Rochelle Pereira, Yajie Zhao, Jianyuan Min

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 针对长视频重照明中的时间不连续问题,提出基于扩散变换器的框架,通过掩码目标域自条件化和热启动提示实现跨块一致重照明,显著提升时间一致性。

Comments https://research.nvidia.com/labs/sil/projects/horizonrelight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30642 2026-06-30 cs.SD cs.AI 80%

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

LeVo 2:通过层次表示建模和渐进式后训练实现稳定悦耳的歌曲生成

Shun Lei, Huaicheng Zhang, Dapeng Wu, Yaoxun Xu, Lishi Zuo, Wei Tan, Hangting Chen, Guangzheng Li, Jianwei Yu, Zhiyong Wu, Dong Yu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent(腾讯) Wuhan University(武汉大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 提出LeVo 2混合LLM-Diffusion框架,通过层次化建模(先预测混合令牌进行语义规划,再并行预测人声和伴奏令牌)解决全曲生成中协调性与细节保真度的权衡,并引入美学引导训练策略,在主观和客观指标上超越开源基线,接近商业系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30417 2026-06-30 cs.CV cs.AI 79%

Beyond Point Estimates for Glaucoma Visual Field Forecasting with Diffusion Models

超越点估计:基于扩散模型的青光眼视野预测

Marta Colmenar Herrera, Pablo Márquez Neila, Şerife Seda Kucur Ergünay, Martin S. Zinkernagel, Raphael Sznitman

机构 * ARTORG Center for Biomedical Engineering Research, UniBe, Switzerland(瑞士UniBe生物医学工程研究中心ARTORG) PeriVision SA, Epalinges, Switzerland(瑞士Epalinges市PeriVision公司) Department of Ophthalmology, Inselspital, Bern, Switzerland(瑞士伯恩Inselspital眼科部门)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出使用条件去噪扩散模型进行概率性视野预测,生成未来视野的分布,实现校准良好的预测,并在点估计上达到最先进精度,支持从点估计向不确定性感知的临床风险评估转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30012 2026-06-30 cs.CV 79%

SkelEM: Training-Signal Decoupling of Skeleton and Diffusion for Self-supervised Axial Super-Resolution in Volume Microscopy

SkelEM:用于体积显微镜中自监督轴向超分辨率的骨架与扩散训练信号解耦

Bohao Chen, Yanchao Zhang, Yanan Lv, Chenxun Deng, Hua Han, Xi Chen

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, China(中国科学院大学先进交叉学科学院) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences, China(中国科学院脑认知与脑启发智能技术国家重点实验室) School of Future Technology, University of Chinese Academy of Sciences, China(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出SkelEM框架,通过解耦低频拓扑与高频细节的训练信号,结合确定性骨架与扩散精炼器,实现体积显微镜自监督轴向超分辨率,仅需≤5步即可恢复高保真细节,并在新基准BRAVE-ASR上取得最优平衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏