arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-27 至 2026-05-27 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 7 篇

2510.17759 2026-05-27 cs.CR cs.CL cs.CV cs.LG stat.ML 70%

VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models

VERA-V:用于破解视觉语言模型的变分推断框架

Qilin Liao, Anamika Lochab, Ruqi Zhang

机构 * Department of Computer Science, Purdue University, USA(美国普渡大学计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出VERA-V变分推断框架,通过联合后验分布生成隐蔽的文本-图像对抗输入,以系统性地发现视觉语言模型的多模态漏洞,在多个基准上攻击成功率最高提升53.75%。

Comments 18 pages, 7 Figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04533 2026-05-27 cs.CV 70%

TAG: Tangential Amplifying Guidance for Hallucination-Resistant Sampling

TAG: 切向放大引导用于抗幻觉采样

Hyunmin Cho, Donghoon Ahn, Susung Hong, Jee Eun Kim, Seungryong Kim, Kyong Hwan Jin

机构 * Korea University(韩国大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一种无需训练、与架构无关的即插即用引导方法TAG,通过放大估计分数的切向分量来纠正采样轨迹,减少语义不一致性并提高保真度。

Comments Accepted to ICML 2026 (Regular)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27336 2026-05-27 cs.CV 57%

PARE: Pruning and Adaptive Routing for Efficient Video Generation

PARE:面向高效视频生成的剪枝与自适应路由

Yutong Wang, Yunke Wang, Tianfan Xue, Yu Qiao, Yaohui Wang, Xinyuan Chen, Chang Xu

机构 * The University of Sydney(悉尼大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出PARE方法,通过结构感知剪枝压缩宽度和输入自适应路由压缩深度,联合减少视频扩散Transformer的计算量,在Wan2.1-14B上实现每步计算大幅降低且质量保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26744 2026-05-27 cs.CV 57%

Self-Intersection-Aware 3D Human Motion Generation Using an Efficient Human Sphere Proxy

基于高效人体球代理的自交感知3D人体运动生成

Pascal Herrmann, Maarten Bieshaar, Dennis Mack, Robert Herzog, Juergen Gall

机构 * Bosch Research(博世研究院) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于人体球代理的自交损失函数,用于训练人体运动生成模型,可减少高达49%的自交现象并改善评估指标。

Comments Accepted to BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19741 2026-05-27 cs.CV 57%

Efficient Transferable Optimal Transport via Min-Sliced Transport Plans

通过最小切片传输计划的高效可迁移最优传输

Xinran Liu, Elaheh Akbari, Rocio Diaz Martin, Navid NaderiAlizadeh, Soheil Kolouri

机构 * Department of Computer Science, Vanderbilt University(范德比大学计算机科学系) Department of Mathematics, Florida State University(佛罗里达州立大学数学系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) Department of Electrical & Computer Engineering, Vanderbilt University(范德比大学电气与计算机工程系)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出最小切片传输计划(min-STP)框架,研究优化切片器在不同分布对间的可迁移性,并引入小批量公式以提高可扩展性,在点云对齐和流生成建模中实现一次性匹配和摊销训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26800 2026-05-27 math.ST stat.TH 50%

Accelerated Schrödinger-Föllmer samplers

加速的薛定谔-福尔默采样器

Haotian Lin, Xiaojie Wang, Xiaoyan Zhang

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出一种高效的随机龙格-库塔方案来加速薛定谔-福尔默采样器,用于复杂高维多模态分布采样,并证明其L^2-Wasserstein距离下的收敛阶为O(h^{3/2}|ln h|)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26469 2026-05-27 cs.LG 50%

DiVeQ: Differentiable Vector Quantization Using the Reparameterization Trick

DiVeQ: 使用重参数化技巧的可微分向量量化

Mohammad Hassan Vali, Tom Bäckström, Arno Solin

机构 * ELLIS Institute Finland & Department of Computer Science, Aalto University, Finland(芬兰ELLIS研究所及阿尔托大学计算机科学系) Department of Information and Communications Engineering, Aalto University, Finland(芬兰阿尔托大学信息与通信工程系)

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 提出DiVeQ方法,通过重参数化技巧将量化视为添加模拟量化失真的误差向量,实现前向传播硬量化而梯度可流动,并引入空间填充变体SF-DiVeQ减少量化误差并充分利用码本,在VQ-VAE、VQGAN和DAC任务中提升重建质量和样本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏