arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-30 至 2026-07-30 共收录 76 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 59 篇

2504.19621 2026-07-30 cs.LG eess.IV stat.ML 版本更新 50%

AI Alignment in Medical Imaging: Unveiling Hidden Biases Through Counterfactual Analysis

医学影像中的AI对齐:通过反事实分析揭示隐藏偏差

Haroui Ma, Francesco Quinzan, Theresa Willem, Stefan Bauer

机构 * School of Computation, Information and Technology, Technical University of Munich(技术大学慕尼黑计算、信息与技术学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Helmholtz AI, Munich, Germany(海德堡人工智能研究所,德国慕尼黑)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究针对医学影像ML系统的偏差问题,提出结合条件潜在扩散模型与统计假设检验的统计框架,在多数据集上验证其优于基线,为医疗AI安全提供可靠工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01982 2026-07-30 stat.ML cs.LG 版本更新 50%

Learning Controlled Stochastic Differential Equations

学习受控随机微分方程

Luc Brogat-Motte, Riccardo Bonalli, Alessandro Rudi

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对多维非线性受控随机微分方程,提出核方法拟合漂移与扩散项,证明有限样本误差界并通过数值实验验证,提供开源Python实现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 4 篇

2607.26529 2026-07-30 cs.CV 新提交 57%

CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling

CineWeaver:用于电影叙事的无训练参考可控多镜头长视频生成

Yuyang Huang, Yabo Chen, Wenrui Dai, Ziyang Zheng, Haibin Huang, Chi Zhang, Junni Zou, Hongkai Xiong, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) China Telecom(中国电信) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(电信AI))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CineWeaver是首个无训练的统一框架,通过操控位置编码、注意力模式等,实现参考可控的多镜头长视频生成,产出的电影视频时长较长且质量高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26411 2026-07-30 cs.CV 新提交 57%

Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering

统一多模态模型是否在同一空间中思考?通过跨分支引导的视角

Yu Wang, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本研究针对统一多模态模型是否共享统一可迁移语义空间的问题,提出跨分支语义引导框架,发现理解分支的引导向量可迁移至生成分支,揭示架构统一不保证语义对齐,该框架可用于探测多模态表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19651 2026-07-30 cs.AI cs.CV cs.LG 版本更新 57%

BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation

BrainG3N:用于可控3D脑MRI生成的双用途分词器

Max Van Puyvelde, Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) Department of Mathematical Modelling, Statistics & Bioinformatics, Ghent University(根特大学数学建模、统计与生物信息学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出基于3D掩码自编码器的分词器,解耦编码器与解码器,在23项线性探测任务中21项超越SOTA,并支持条件生成和纵向预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26762 2026-07-30 cs.CL 新提交 50%

Relation Geometry in Semantic Space of Language Models

语言模型语义空间中的关系几何

Zhihan Cao, Hiroaki Yamada, Simone Teufel, Tatsuya Hiraoka, Kentaro Inui, Hitomi Yanaka, Takenobu Tokunaga

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究语言模型语义空间中关系几何的表征情况,通过三类语言模型在6种语义关系上的实验,发现非对称关系的表征更清晰,且不同模型依赖的信息来源存在差异。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2607.26641 2026-07-30 cs.CV cs.AI 新提交 57%

FakeIDet3-DB: Refining Digital Attacks and Patch Extraction for Secure ID Benchmarking

FakeIDet3-DB:用于安全身份基准测试的数字攻击与补丁提取优化

Muñoz-Haro Javier, Teruel Andres, Tolosana Ruben, DeAlcala Daniel, Vera-Rodriguez Ruben, Morales Aythami, Fierrez Julian

机构 * School of Engineering, Universidad Autónoma de Madrid(马德里自治大学工程学院)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 针对真实ID数字篡改检测的领域差距,构建首个含520万补丁的FakeIDet3-DB数据库,提出PACE算法,评估显示现有模型对其攻击检测定位性能不佳。

Comments 13 Pages, Database, Pipeline, Algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 3 篇

2607.26742 2026-07-30 eess.AS cs.AI cs.SD 新提交 82%

Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model

基于Style-Diffusion TTS模型潜在空间适配的零样本人脸到语音合成

Carlos Muñoz-Romero, Jose A. Gonzalez-Lopez

专题命中 个性化与一致性 :diffusion(title,title_cn)

AI总结 该研究提出基于StyleTTS 2的人脸到语音合成框架,通过人脸适配器实现静态人脸到语音的零样本生成,在LRS3数据集上验证了效果,且映射具有语言无关性。

Comments 5 pages, 1 figure, 5 tables, submitted to IberSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26304 2026-07-30 cs.CV 新提交 57%

MoSAIC: Aligned Intervention Supervision for Part-Local Motion Style Transfer

MoSAIC:用于局部部位动作迁移的对齐干预监督

Nazanin Amini, Kevin Desai

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MoSAIC是一种局部部位参考条件动作风格迁移的潜在扩散框架,通过对齐干预监督优化响应与保留的权衡,在评估中降低了误差并提升了选中区域响应与路由影响浓度。

Comments 23 pages, 6 figures, 11 tables. Project page: https://utsa-virlab.github.io/MoSAIC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02240 2026-07-30 cond-mat.mtrl-sci physics.app-ph 50%

Improving atomic force microscopy structure discovery via style-translation

Jie Huang, Niko Oinonen, Fabio Priante, Filippo Federici Canova, Lauri Kurki, Chen Xu, Adam S. Foster

专题命中 个性化与一致性 :image generation(abstract)

Comments 14 pages, 7 figures

Journal ref npj Computational Materials (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 1 篇

2607.26860 2026-07-30 cs.LG 新提交 75%

Amortized Moment Matching for Visual Generation

用于视觉生成的摊销矩匹配

Wenze Liu, Xintao Wang, Pengfei Wan, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技影幻团队)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 该研究提出摊销矩匹配方法,构建AMFD损失,用于视觉生成,在ImageNet、GenEval等基准上性能优于FD基线及FLUX.2 4B模型,实现高效高维数据生成。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 5 篇

2605.08293 2026-07-30 cs.CV 版本更新 79%

Distill, Diffuse, Segment: Unsupervised 3D Semantic Segmentation for Autonomous Driving Based on Multi-Level Distillation and Graph Diffusion

Distill, Diffuse, and Semanticize (DDS): 基于多粒度蒸馏和图扩散的无标注3D场景理解

Yijing Wang, Ruonan Li, Qilin Wang, Rongqiang Zhao, Jie Liu

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Pengcheng Laboratory(鹏城实验室)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 DDS通过多粒度蒸馏和图扩散实现轻量级无标注3D场景理解,提升区域一致性和语义识别,实验显示在多个数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27113 2026-07-30 cs.CV 新提交 57%

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Zijian Yu, Chuanbiao Song, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) Ant Group(蚂蚁集团) Sangfor Technologies Inc.(深信服科技股份有限公司)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11654 2026-07-30 cs.CV 版本更新 57%

Kinetic Mining in Context: Few-Shot Action Synthesis via Text-to-Motion Distillation

上下文中的动作合成:通过文本到运动蒸馏实现少样本动作合成

Luca Cazzola, Ahed Alboody

机构 * University of Trento(特伦托大学) CESI LINEACT

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 KineMIC通过文本到运动蒸馏实现少样本动作合成,提升HAR识别准确率23.1%

Comments To appear in the proceedings of 28th International Conference on Pattern Recognition (ICPR 2026). For references, please cite the official proceedings version. Paper website: https://lucazzola.github.io/kinemic-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02294 2026-07-30 cs.CV 版本更新 57%

Improving Knowledge Distillation Under Unknown Covariate Shift Through Confidence-Guided Data Augmentation

通过置信度引导的数据增强改进未知协变量偏移下的知识蒸馏

Niclas Popp, Kevin Alexander Laube, Matthias Hein, Lukas Schott

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) University of Tübingen(图宾根大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对未知协变量偏移下知识蒸馏效果受限的问题,提出置信度引导的扩散数据增强策略,经实验验证可提升多数据集上的相关准确率与虚假特征得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26399 2026-07-30 math.ST math.MG math.OC stat.TH 新提交 50%

A Lower Bound on the Sliced Wasserstein Comparison Constant for Translated Measures

平移测度的切片沃尔什斯坦因比较常数的下界

Avery Noroozi

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 该研究针对ℝᵈ上的平移概率测度,推导了W₁与SW₁的闭式表达式,并为二者间的常数c_d构造了显式下界,揭示了切片沃尔什斯坦因距离计算效率对应的理论成本。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏