arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-06 至 2026-08-06 共收录 81 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 57 篇

1709.02069 2026-08-06 math.ST stat.CO stat.ME stat.TH 50%

An Alternative Approach to Functional Linear Partial Quantile Regression

Dengdeng Yu, Matthew Pietrosanu, Ivan Mizera, Bei Jiang, Linglong Kong, Wei Tu

专题命中 扩散模型 :diffusion(abstract)

Journal ref Statistics in Biosciences, 17, 174-190 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 7 篇

2510.14190 2026-08-06 cs.LG 版本更新 78%

Contrastive Diffusion Alignment: Learning Structured Latents for Controllable Generation

对比扩散对齐:用于可控生成的结构化潜在学习

Ruchi Sandilya, Sumaira Perez, Charles Lynch, Lindsay Victoria, Benjamin Zebley, Derrick Matthew Buchanan, Mahendra T. Bhati, Nolan Williams, Timothy J. Spellman, Faith M. Gunning, Conor Liston, Logan Grosenick

机构 * Department of Psychiatry, Weill Cornell Medicine, New York, NY, USA(威立·科林斯医学中心精神科) Department of Psychiatry, Stanford University, Stanford, CA, USA(斯坦福大学精神科) Department of Neuroscience, University of Connecticut School of Medicine, Farmington, CT, USA(康涅狄格大学医学院神经科学系)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 ConDA通过对比学习在扩散模型中学习结构化潜在空间,实现可控生成和动态解释。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04737 2026-08-06 cs.CV cs.GR 新提交 62%

Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors

基于稀疏直接飞行时间传感器的密集度量深度补全

Hakyeong Kim, Ruicheng Wang, Chengtang Yao, Jiaolong Yang, Min H. Kim

机构 * KAIST(韩国科学技术院) USTC(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种深度引导双分支视觉Transformer框架,结合dToF模拟流程,实现稀疏dToF到密集度量深度的零样本泛化补全,性能优于现有方法且高效。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05069 2026-08-06 cs.CV cs.AI 新提交 57%

VQ-VAD: Vector-quantized Motion Representation Learning for Human-centric Video Anomaly Detection

VQ-VAD:面向以人为中心的视频异常检测的向量量化运动表示学习

Narges Rashvand, Ghazal Alinezhad Noghre, Shanle Yao, Gabriel Maldonado, Hamed Tabkhi

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 针对现有基于姿态的视频异常检测方法的局限,提出VQ-VAD框架,通过向量量化学习离散运动表示,在多评估设置的基准测试中取得优异性能,代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04622 2026-08-06 cs.CV 新提交 57%

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

DAC-Pose:用于姿态引导人体生成的双智能体协作框架

Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen University of Advanced Technology(深圳理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。

Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16060 2026-08-06 cs.CV 版本更新 57%

ArtChart: Faithful Artistic Chart Generation with Integrated Text Rendering

ArtChart:一个用于忠实生成艺术图表并集成文本渲染的基准测试

Meijia Huang, Yingjie Yin, Shihao Wang, Chenguang Ma

机构 * Ant Group(蚂蚁集团)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 研究旨在解决艺术图表生成难题,提出ArtChart框架,含特定即插即用模块及强化学习等策略,构建基准测试和评估套件,实验证明该框架能生成兼具美观与数学准确性的图表,优于开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12000 2026-08-06 cs.CV 版本更新 57%

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

MetaView:基于尺度感知隐式几何先验的单目新视图合成

Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) Kolors Team, Kuaishou Technology(快手科技色彩团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。

Comments accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24015 2026-08-06 math.OC cs.GT cs.SY econ.TH eess.SY 版本更新 50%

Continuous-Time Information-Mechanism Control

多区域电力系统协调的分布鲁棒联合信息与机制设计

Furkan Sezer

专题命中 可控生成 :diffusion(abstract)

AI总结 针对多区域电力系统协调问题,提出分布鲁棒的联合信息与机制设计框架,通过高斯公共信号和Groves转移机制实现激励对齐,并利用Isaacs方程求解,在2021年Uri暴风雪案例中验证了信息设计和市场耦合的互补性。

Comments 41 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 3 篇

2608.04821 2026-08-06 cs.CV 新提交 70%

Global Attention-Fused Image Cropping with Attention-Guided and Global-Aligned Crop Evaluator

融合全局注意力的图像裁剪方法:基于注意力引导与全局对齐的裁剪评估器

Haotian Yang, Zhile Yang, Kin-Man Lam, Patrick Le Callet, Xin Sun

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen University of Advanced Technology(深圳理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) The Hong Kong Polytechnic University(香港理工大学) Nantes Université(南特大学) Ecole Centrale Nantes(南特中央理工学院) CAPACITES SAS(CAPACITES SAS公司) CNRS(法国国家科学研究中心) LS2N, UMR 6004(LS2N实验室(UMR 6004))

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 该研究提出GAFIC图像裁剪方法,通过AGFF与GACE模块结合多尺度排序损失,在GAIC、CPC数据集上性能优于现有方法,适用于需保证像素完整性与高效批量处理的场景。

Comments The source code is available at https://github.com/AIVRC/GAFIC.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04525 2026-08-06 cs.CV 新提交 57%

Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution

面向场景文本图像超分辨率的耦合连续-离散生成方法

Axi Niu, Knag Zhang, Qingsen Yan, Hao Jin, Jinqiu Sun, Yanning Zhang

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 针对现有场景文本图像超分辨率(STISR)方法误差传播、成本高的问题,提出统一框架DualTSR,通过耦合连续-离散生成实现高效准确的STISR,在多数据集上表现优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04378 2026-08-06 cs.SD cs.LG eess.AS 新提交 50%

Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

助力音乐协同创作智能体“良好聆听”:用于理解与生成的分层自监督世界模型

Scott H. Hawley

机构 * Belmont University(贝尔蒙特大学)

专题命中 图像修复 :inpainting(abstract)

AI总结 本研究提出分层自监督世界模型,通过Swin V2编码器与条件流匹配模型构建协同音乐创作智能体,提升了和弦与调式检测准确率,可快速生成音乐建议并支持交互演示。

Comments 20 pages, 14 figures. A 6-page version was submitted to the NeurIPS 2026 Creative AI Track. Supplemental website with listening examples: https://drscotthawley.github.io/midi-rae-jepa-son/. Live demo: https://drscotthawley-midi-rae-jepa-son.hf.space/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 3 篇

2607.04140 2026-08-06 eess.AS cs.CL 版本更新 78%

DELTA-TTS: Adapting Autoregressive Model into Diffusion Language Model for Text-to-Speech

DELTA-TTS:将自回归模型适配为扩散语言模型以实现文本转语音

Junwon Moon, Yejin Lee, Seungbeom Kim, Hoseong Ahn, Sewoong Park, Heeseung Kim, Kyuhong Shim

机构 * Sungkyunkwan University(首尔大学) University of Seoul(首尔大学)

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 针对自回归TTS推理慢、鲁棒性差的问题,提出基于LoRA的轻量适配框架DELTA-TTS,将预训练AR TTS转为离散扩散语言模型,推理速度提升3.3倍且性能更优。

Comments ICML 2026 SPIGM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19358 2026-08-06 cs.CL cs.AI 71%

Benchmarking and Improving LLM Robustness for Personalized Generation

Chimaobi Okite, Naihao Deng, Kiran Bodipati, Huaidian Hou, Joyce Chai, Rada Mihalcea

机构 * University of Michigan(密歇根大学)

专题命中 个性化与一致性 :personalized generation(title)

Comments First draft. First camera-ready version

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04448 2026-08-06 cs.CV cs.AI 新提交 70%

When does training on downscaled images yield the same gradients?

在降采样图像上进行训练何时能产生相同的梯度?

Seunghyun Ji

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究探究降采样图像训练的梯度一致性,推导梯度变化的两个项,发现特定噪声窗口内降采样梯度与原生梯度接近,据此训练LoRA适配器可减少14.6%训练时间且性能接近原生。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 4 篇

2608.05049 2026-08-06 cs.CV 新提交 57%

OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing

OmniEdit-Bench:基于指令的视频编辑综合基准

Chenxuan Miao, Yutong Feng, Yi Lu, Yunfeng Yan, Donglian Qi, Shiwei Zhang, Yu Liu, Xi Chen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 针对现有基于指令的视频编辑基准的任务覆盖有限、指标不足的问题,OmniEdit-Bench将编辑任务分解为多维度并提出含惩罚机制的评估框架,实验显示当前IVE模型仍待提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04504 2026-08-06 cs.CV cs.AI 新提交 57%

GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction

GeoReward:缓解跨市场偏好预测的视觉语言模型中的上下文变量高估问题

Shuo Liu, Huixiang Cai, Weiru Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本研究针对视觉语言模型的上下文变量高估问题,提出GeoReward奖励模型,通过三种机制缓解该偏差,在跨市场广告偏好预测任务中性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04349 2026-08-06 cs.CV 新提交 57%

Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models

Poly-OPD:用于能力可选流模型的异构多教师在线策略蒸馏

Siming Fu, Haojun Xu, Ruizhe He, Zheming Fu, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Linjiang Huang, Si Liu

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 Poly-OPD框架通过异构多教师在线策略蒸馏,将FLUX.1-dev和Z-Image的互补优势整合到25亿参数的SD3.5-Medium模型,提升了文本到图像生成的GenEval与DrawBench指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04838 2026-08-06 math.ST math.PR stat.TH 新提交 50%

Exchangeable Testing Against an Unknown Benchmark

针对未知基准的可交换检验

Alexander Gnedin

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本研究针对未知基准的序贯检验,提出基于组合秩的更新机制,建立贝叶斯框架下可显式计算的预测概率,分析了相关马尔可夫链的渐近行为。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 3 篇

2602.19161 2026-08-06 cs.CV 版本更新 57%

Flash-VAED: Plug-and-Play VAE Decoders for Efficient Video Generation

Flash-VAED: 用于高效视频生成的即插即用VAE解码器

Lunjie Zhu, Yushi Huang, Xingtong Ge, Yufei Xue, Zhening Liu, Yumeng Zhang, Zehong Lin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 Flash-VAED通过通道剪枝和分阶段运算优化,实现了高效视频生成的高质量与高速度平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05022 2026-08-06 cs.DS cs.NA math.NA math.PR math.ST stat.TH 新提交 50%

Exact simulation of diffusions and improved algorithms for log-concave sampling

扩散过程的精确模拟及对数凹采样的改进算法

Fan Chen, Sinho Chewi, Alexander Rakhlin, Matthew S. Zhang

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 该研究基于Girsanov定理的密度比无偏估计量,提出改进的扩散精确模拟及对数凹采样算法,优化了采样复杂度与维度依赖关系,还给出相关应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12390 2026-08-06 astro-ph.HE 版本更新 50%

Time-dependent cosmic-ray escape from wind bubbles: hard spectra formation

从风泡中时间依赖的宇宙射线逃逸:硬谱形成

Lukas Merten, Sophie Aerdker, Enrico Peretti

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究风泡中宇宙射线的时间依赖逃逸,通过求解含时输运方程发现逃逸谱可硬于E^{-2},且低能粒子可能被显著抑制,为多信使观测提供特征。

详情

展开后加载摘要…

URL PDF HTML 收藏