arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-11 至 2026-08-11 共收录 166 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 6 篇

2608.07713 2026-08-11 cs.CV cs.LG 新提交 74%

Tokenizer Generator Coupling in Medical Image Generation

医疗图像生成中的分词器-生成器耦合

Liam Chalcroft

机构 * University College London(伦敦大学学院)

专题命中 个性化与一致性 :image generation(title);分类 cs.CV

AI总结 该研究针对64×64低分辨率医疗图像,发现分词器与生成器的分离不合理,提出邻域条件预测增益指标,调优D3PM和SE-D3PM后FID-192大幅下降,验证了分词器-生成器耦合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23094 2026-08-11 cs.CV cs.GR cs.LG 版本更新 62%

FusionRelight: Relighting Portraits in Real Time via Hybrid Domain Knowledge Fusion

面向真实场景中人像重照明的混合领域知识融合

Qian Huang, Mayoore Selvarasa Jaiswal, Zhen Zhong, Rochelle Pereira, Jianyuan Min

机构 * NVIDIA

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出混合领域知识融合方法,通过融合合成、单光源和真实数据集的优势,提升人像重照明的实用性与效率,实现6至240倍的推理加速且保持SOTA视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06009 2026-08-11 cs.CV 版本更新 57%

Wan-Animate-2: Pushing the Application Boundaries of Character Animation

Wan-Animate-2:拓展角色动画的应用边界

Guangyuan Wang, Li Hu, Dechao Meng, Zhongyi Zhang, Peng Zhang, Xindi Zhang, Mingyang Huang, Ruoshi Zhang, Ke Sun, Zhe Zhang, Xingjun Wang, Gang Cheng, Hai Xu, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Wan-Animate-2角色动画框架,通过消除中间运动提取器提升动画保真度,新增文本驱动视角控制,推出实时高效变体Wan-Animate-2-Lite,将发布其基础模型权重。

Comments Project page: https://humanaigc.github.io/wan-animate-2/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像生成评测 4 篇

2607.19341 2026-08-11 cs.CV 版本更新 77%

ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

ExpertVerse:知识密集型视觉合成中专家级推理的通用基准

Yuan Wang, Yongchao Du, Mengting Chen, Jinsong Lan, Jiaxuan Luo, Xuetao Feng, Xiaoyong Zhu

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08964 2026-08-11 cs.LG 新提交 67%

Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities

数学视觉图表:评估大型语言模型数学图表生成能力的综合基准

Harish Kashyap, Kiran Byadarhaly, Sriram Chakaravarthy, Sanyukta Tuti, Aryan Mistry

机构 * Pandita AI Inc.(潘迪塔人工智能公司)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract)

AI总结 本研究推出首个专门评估LLMs数学图表生成能力的基准Math-Vision Diagrams,涵盖文本到代码与图像范式,测试发现LLMs在该任务上存在困难,相关资源将开源。

Comments Accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07550 2026-08-11 cs.CV cs.LG 新提交 57%

Auditing Medical Vision-Language Models on Chest Radiographs: Estimating Reference Agreement Across Institutions

胸部X光医学视觉语言模型审计:估算跨机构参考一致性

Pengyang Yu, Yiou Wang, Zhongping Dong, Sahraoui Dhelim, Chun-Mei Feng, M. Tahar Kechadi

机构 * University College Dublin(都柏林大学学院) School of Computer Science, University College Dublin(都柏林大学学院计算机科学学院) The Third Affiliated Hospital of Southern Medical University(南方医科大学第三附属医院) Dublin City University(都柏林城市大学)

专题命中 图像生成评测 :generative vision(abstract);分类 cs.CV

AI总结 该研究通过评估三个生成式视觉语言模型在胸部X光数据上的表现,估算跨机构参考一致性,发现无法推荐默认估算器,且参考一致性需按站点和接口重新评估。

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09974 2026-08-11 cs.AI cs.CL 版本更新 50%

SPRInG: Continual LLM Personalization via Selective Parametric Adaptation and Retrieval-Interpolated Generation

SPRInG: 通过选择性参数适应和检索插值生成实现连续大语言模型个性化

Seoyeon Kim, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 图像生成评测 :personalized generation(abstract)

AI总结 SPRInG通过选择性参数适应和检索插值生成,实现连续大语言模型个性化,有效应对用户偏好变化带来的挑战。

Comments under review, 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 效率与蒸馏 8 篇

2608.09226 2026-08-11 cs.CV cs.AI 新提交 85%

RL-Native Distillation: Exploiting Scored Trajectories for Few-Step Image Generation

原生强化学习蒸馏:利用带分数轨迹实现少步图像生成

Yuhan Li, Fangao Zeng, Sicong Kang, Mengfei Xu, Hao Zhou, Wei Li, Pipei Huang, Bingbing Ni

机构 * Shanghai Jiao Tong University(上海交通大学) Taobao & Tmall group of Alibaba(阿里巴巴淘宝天猫集团)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出REST框架,将RL与蒸馏联合训练,通过AMD优化,实现少步无CFG图像生成,性能优于40步RL教师,成本低、迭代少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20512 2026-08-11 cs.CV 版本更新 83%

Adversarial Concept Distillation for One-Step Diffusion Personalization

对抗概念蒸馏用于一步扩散个性化

Yixiong Yang, Tao Wu, Senmao Li, Shiqi Yang, Yaxing Wang, Joost van de Weijer, Kai Wang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) VCIP, CS, Nankai University(南开大学计算机学院视觉计算与智能感知实验室) Program of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学项目) City University of Hong Kong(香港城市大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出OPAD框架,结合教师-学生蒸馏与对抗监督,通过多步扩散模型作为教师,一步学生模型联合训练,以实现一步扩散模型的高效个性化。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07620 2026-08-11 cs.CV 新提交 70%

FlowErase-OPD: Multi-Concept Erasure via Anchored On-Policy Distillation in Flow Matching Models

FlowErase-OPD:基于流匹配模型中锚定在线策略蒸馏的多概念擦除方法

Yi Sun, Yimin Zhou, Xinhao Zhong, Zhiqi Zhang, Junhao Li, Bin Chen

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 FlowErase-OPD是基于在线策略蒸馏的多概念擦除框架,通过引入AMTD和ARC缓解擦除与生成能力的权衡,在多概念擦除任务中实现了优于现有方法的性能,且模型鲁棒性较强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09637 2026-08-11 cs.CV cs.AI 新提交 57%

DUET: A Diversity-Quality Duet of Distillation Experts for Two-Step Video Generation

DUET:用于两步视频生成的蒸馏专家的多样性-质量二重奏

Zian Li, Litong Gong, Borui Liao, Pengfei Liu, Xinyu Wang, Xinyuan Wei, Yifan Gao, Tiezheng Ge, Muhan Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出DUET模型,通过噪声级专家二重奏协调两步视频生成中质量与多样性的权衡,经改进的DUET+进一步提升质量并保留多样性优势,效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08638 2026-08-11 cs.SD cs.AI cs.CL 新提交 50%

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

CuteTTS:基于连续隐变量自回归建模的高效高保真语音合成

Yuqian Zhang, Yao Shi, Kexin Huang, Botian Jiang, Zhe Xu, Yiwei Zhao, Min Liang, Shuang Chen, Xipeng Qiu

机构 * Shanghai Innovation Institute(上海创新研究院) OPPO AI Center(OPPO人工智能中心) Fudan University(复旦大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 CuteTTS是结合语义对齐因果VAE隐变量等的连续自回归TTS系统,经引导步蒸馏后,在保持相当质量的同时降低了延迟,实现了高保真与低延迟的平衡。

Comments 20 pages, 6 figures, 10 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08129 2026-08-11 cs.HC 新提交 50%

Understanding Security and Privacy Perceptions of Content Creators Regarding AI Labels of AI-Generated Content

理解内容创作者对AI生成内容的AI标签的安全与隐私认知

Shuning Zhang, Hui Wang, Rongjun Ma, Xin Yi, Kanye Ye Wang, Robert Xiao, Hewu Li

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 本文通过对21位AIGC创作者访谈及多平台图像测试,揭示创作者对AI标签的认知偏差与规避行为,提出应开发适配创作者动机的隐式AI标签。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07648 2026-08-11 stat.ML cond-mat.dis-nn cond-mat.stat-mech cs.LG physics.comp-ph 新提交 50%

Leveraging generative models to assist Monte Carlo sampling

利用生成模型辅助蒙特卡洛采样

Marylou Gabrié

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本教程综述介绍了机器学习与计算统计物理交叉领域的新范式——用生成模型辅助蒙特卡洛采样,探讨相关方法方向及优劣势,为相关领域研究者提供入门基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00040 2026-08-11 cs.LG cs.AI 版本更新 50%

Attn-QAT: 4-Bit Attention With Quantization-Aware Training

Attn-QAT:4位注意力与量化感知训练

Peiyuan Zhang, Matthew Noto, Wenxuan Tan, Chengquan Jiang, Will Lin, Wei Zhou, Hao Zhang

机构 * Stanford University(斯坦福大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 Attn-QAT通过稳定4位量化感知训练实现高效的注意力计算,提升模型推理速度并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他图像生成 1 篇

2608.09468 2026-08-11 cs.LG cs.AI 新提交 50%

MixFormer: Linear Transformer with Mixture of Memory Experts

MixFormer:带有记忆专家混合体的线性Transformer

Yu Guo, Lei Duan

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) School of Artificial Intelligence, Sichuan University(四川大学人工智能学院)

专题命中 其他图像生成 :image generation(abstract)

AI总结 针对现有线性Transformer主流方向状态空间模型的输入适应性与内存容量局限,论文提出带记忆专家混合体和时间感知线性注意力的MixFormer,在长序列生成任务上实现性能提升,为下一代网络基础设施提供更可持续的计算主干。

Comments 17 pages, 9 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏