An Alternative Approach to Functional Linear Partial Quantile Regression
专题命中 扩散模型 :diffusion(abstract)
Journal ref Statistics in Biosciences, 17, 174-190 (2025)
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 扩散模型 :diffusion(abstract)
Journal ref Statistics in Biosciences, 17, 174-190 (2025)
对比扩散对齐:用于可控生成的结构化潜在学习
机构 * Department of Psychiatry, Weill Cornell Medicine, New York, NY, USA(威立·科林斯医学中心精神科) ; Department of Psychiatry, Stanford University, Stanford, CA, USA(斯坦福大学精神科) ; Department of Neuroscience, University of Connecticut School of Medicine, Farmington, CT, USA(康涅狄格大学医学院神经科学系)
专题命中 可控生成 :diffusion(title,abstract)
AI总结 ConDA通过对比学习在扩散模型中学习结构化潜在空间,实现可控生成和动态解释。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026
基于稀疏直接飞行时间传感器的密集度量深度补全
机构 * KAIST(韩国科学技术院) ; USTC(中国科学技术大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出一种深度引导双分支视觉Transformer框架,结合dToF模拟流程,实现稀疏dToF到密集度量深度的零样本泛化补全,性能优于现有方法且高效。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
VQ-VAD:面向以人为中心的视频异常检测的向量量化运动表示学习
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 针对现有基于姿态的视频异常检测方法的局限,提出VQ-VAD框架,通过向量量化学习离散运动表示,在多评估设置的基准测试中取得优异性能,代码已公开。
DAC-Pose:用于姿态引导人体生成的双智能体协作框架
机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV
AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。
Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose
ArtChart:一个用于忠实生成艺术图表并集成文本渲染的基准测试
机构 * Ant Group(蚂蚁集团)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV
AI总结 研究旨在解决艺术图表生成难题,提出ArtChart框架,含特定即插即用模块及强化学习等策略,构建基准测试和评估套件,实验证明该框架能生成兼具美观与数学准确性的图表,优于开源基线。
MetaView:基于尺度感知隐式几何先验的单目新视图合成
机构 * Nanyang Technological University(南洋理工大学) ; Kolors Team, Kuaishou Technology(快手科技色彩团队) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。
Comments accepted to ECCV 2026
多区域电力系统协调的分布鲁棒联合信息与机制设计
专题命中 可控生成 :diffusion(abstract)
AI总结 针对多区域电力系统协调问题,提出分布鲁棒的联合信息与机制设计框架,通过高斯公共信号和Groves转移机制实现激励对齐,并利用Isaacs方程求解,在2021年Uri暴风雪案例中验证了信息设计和市场耦合的互补性。
Comments 41 pages, 6 figures
融合全局注意力的图像裁剪方法:基于注意力引导与全局对齐的裁剪评估器
机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; The Hong Kong Polytechnic University(香港理工大学) ; Nantes Université(南特大学) ; Ecole Centrale Nantes(南特中央理工学院) ; CAPACITES SAS(CAPACITES SAS公司) ; CNRS(法国国家科学研究中心) ; LS2N, UMR 6004(LS2N实验室(UMR 6004))
专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 该研究提出GAFIC图像裁剪方法,通过AGFF与GACE模块结合多尺度排序损失,在GAIC、CPC数据集上性能优于现有方法,适用于需保证像素完整性与高效批量处理的场景。
Comments The source code is available at https://github.com/AIVRC/GAFIC.git
面向场景文本图像超分辨率的耦合连续-离散生成方法
专题命中 图像修复 :diffusion(abstract);分类 cs.CV
AI总结 针对现有场景文本图像超分辨率(STISR)方法误差传播、成本高的问题,提出统一框架DualTSR,通过耦合连续-离散生成实现高效准确的STISR,在多数据集上表现优于对比方法。
助力音乐协同创作智能体“良好聆听”:用于理解与生成的分层自监督世界模型
机构 * Belmont University(贝尔蒙特大学)
专题命中 图像修复 :inpainting(abstract)
AI总结 本研究提出分层自监督世界模型,通过Swin V2编码器与条件流匹配模型构建协同音乐创作智能体,提升了和弦与调式检测准确率,可快速生成音乐建议并支持交互演示。
Comments 20 pages, 14 figures. A 6-page version was submitted to the NeurIPS 2026 Creative AI Track. Supplemental website with listening examples: https://drscotthawley.github.io/midi-rae-jepa-son/. Live demo: https://drscotthawley-midi-rae-jepa-son.hf.space/
DELTA-TTS:将自回归模型适配为扩散语言模型以实现文本转语音
机构 * Sungkyunkwan University(首尔大学) ; University of Seoul(首尔大学)
专题命中 个性化与一致性 :diffusion(title,abstract)
AI总结 针对自回归TTS推理慢、鲁棒性差的问题,提出基于LoRA的轻量适配框架DELTA-TTS,将预训练AR TTS转为离散扩散语言模型,推理速度提升3.3倍且性能更优。
Comments ICML 2026 SPIGM Workshop
机构 * University of Michigan(密歇根大学)
专题命中 个性化与一致性 :personalized generation(title)
Comments First draft. First camera-ready version
Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, 2025
在降采样图像上进行训练何时能产生相同的梯度?
专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 该研究探究降采样图像训练的梯度一致性,推导梯度变化的两个项,发现特定噪声窗口内降采样梯度与原生梯度接近,据此训练LoRA适配器可减少14.6%训练时间且性能接近原生。
OmniEdit-Bench:基于指令的视频编辑综合基准
机构 * The University of Hong Kong(香港大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; Peking University(北京大学)
专题命中 图像生成评测 :image editing(abstract);分类 cs.CV
AI总结 针对现有基于指令的视频编辑基准的任务覆盖有限、指标不足的问题,OmniEdit-Bench将编辑任务分解为多维度并提出含惩罚机制的评估框架,实验显示当前IVE模型仍待提升。
GeoReward:缓解跨市场偏好预测的视觉语言模型中的上下文变量高估问题
机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 本研究针对视觉语言模型的上下文变量高估问题,提出GeoReward奖励模型,通过三种机制缓解该偏差,在跨市场广告偏好预测任务中性能优于现有基线。
Poly-OPD:用于能力可选流模型的异构多教师在线策略蒸馏
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 Poly-OPD框架通过异构多教师在线策略蒸馏,将FLUX.1-dev和Z-Image的互补优势整合到25亿参数的SD3.5-Medium模型,提升了文本到图像生成的GenEval与DrawBench指标。
针对未知基准的可交换检验
专题命中 图像生成评测 :diffusion(abstract)
AI总结 本研究针对未知基准的序贯检验,提出基于组合秩的更新机制,建立贝叶斯框架下可显式计算的预测概率,分析了相关马尔可夫链的渐近行为。
Comments 17 pages
Flash-VAED: 用于高效视频生成的即插即用VAE解码器
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 Flash-VAED通过通道剪枝和分阶段运算优化,实现了高效视频生成的高质量与高速度平衡。
Comments Accepted by ICML 2026
扩散过程的精确模拟及对数凹采样的改进算法
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 该研究基于Girsanov定理的密度比无偏估计量,提出改进的扩散精确模拟及对数凹采样算法,优化了采样复杂度与维度依赖关系,还给出相关应用。
从风泡中时间依赖的宇宙射线逃逸:硬谱形成
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 研究风泡中宇宙射线的时间依赖逃逸,通过求解含时输运方程发现逃逸谱可硬于E^{-2},且低能粒子可能被显著抑制,为多信使观测提供特征。