arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-27 至 2026-05-27 共收录 91 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70 篇

2507.11486 2026-05-27 cs.LG 50%

Exploring the robustness of TractOracle methods in RL-based tractography

探索基于强化学习的纤维追踪中TractOracle方法的鲁棒性

Jeremi Levesque, Antoine Théberge, Maxime Descoteaux, Pierre-Marc Jodoin

机构 * Department of Computer Science, Faculty of Science, University of Sherbrooke(谢布罗克大学计算机科学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过整合强化学习的最新进展,扩展了TractOracle-RL框架,并引入迭代奖励训练(IRT)方法,实验表明基于oracle的RL方法在准确性和解剖有效性上显著优于传统纤维追踪技术。

Comments 38 pages, 8 figures. Submitted to Medical Image Analysis

Journal ref Medical Image Analysis, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18602 2026-05-27 cond-mat.mtrl-sci 50%

Defect thermodynamics of orthorhombic Ba$_2$In$_2$O$_5$: First-principles calculations on the role of oxygen dumbbell interstitials

正交相Ba$_2$In$_2$O$_5$的缺陷热力学:氧哑铃间隙原子作用的第一性原理计算

Rachele Sciotto, Karsten Albe

专题命中 扩散模型 :diffusion(abstract)

AI总结 利用第一性原理计算,研究了Ba$_2$In$_2$O$_5$中氧哑铃间隙原子的存在及其对缺陷热力学的影响,揭示了氧空位和间隙原子主导的本征缺陷化学。

Comments 12 pages, 8 figures. Version 3 has an updated title and minor editorial corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01941 2026-05-27 cond-mat.mtrl-sci cs.CE cs.LG physics.comp-ph 50%

FluxNet: Learning Capacity-Constrained Local Transport Operators for Conservative and Bounded PDE Surrogates

FluxNet: 学习容量受限的局部传输算子用于保守且有界的PDE代理模型

Zishuo Lan, Junjie Li, Lei Wang, Jincheng Wang

机构 * State Key Laboratory of Solidification Processing, Northwestern Polytechnical University, Xi'an, 710072, China(固态加工国家重点实验室,西北工业大学,西安,710072,中国)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出FluxNet,通过学习累积传输量实现精确离散守恒,并利用模块化容量受限传输头强制物理边界,解决自回归PDE代理中的守恒和边界违反问题。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21906 2026-05-27 math.ST cs.LG stat.ML stat.TH 50%

Error Analysis of Discrete Flow with Generator Matching

生成器匹配的离散流误差分析

Zhengyan Wan, Yidong Ouyang, Qiang Yao, Liyan Xie, Fang Fang, Hongyuan Zha, Guang Cheng

机构 * School of Statistics, East China Normal University(东华大学统计学院) Department of Statistics and Data Science, University of California, Los Angeles(加州大学洛杉矶分校统计与数据科学系) Department of Industrial and Systems Engineering, University of Minnesota(明尼苏达大学工业与系统工程系) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文基于随机微积分理论,通过Girsanov型定理统一分析离散流模型的收敛性质,给出了转移率估计误差和提前停止误差的非渐近误差界,并首次提供了离散流模型的误差分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22157 2026-05-27 physics.comp-ph 50%

A Radiation Exchange Factor Formulation with Proven Non-Negativity and Unconditional Energy Conservation

具有证明的非负性和无条件能量守恒的辐射交换因子公式

Nikolaj Maack Bielefeld

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种辐射交换因子矩阵公式,通过Hadamard乘积分解首次交互矩阵,保证非负解和无条件能量守恒,适用于一般域上的混合边界条件问题。

Comments Major revision (v2): the absorption and reflection-scattering matrices have been redefined at the single-step level, correcting a structural error in v1 affecting reflecting-wall cases. Full discussion in Appendix B

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23058 2026-05-27 math.AP math.PR 50%

Infinite-dimensional nonlinear stationary Fokker-Planck-Kolmogorov equations

无穷维非线性平稳Fokker-Planck-Kolmogorov方程

Vladimir I. Bogachev, Michael Röckner, Stanislav V. Shaposhnikov

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文证明在无穷维空间上,具有中心高斯测度γ、单位扩散算子和形如-x+v(p,x)的漂移的非线性平稳Fokker-Planck-Kolmogorov方程存在概率解,其中v是取值于γ的Cameron-Martin空间H的有界映射,且v定义在由概率密度构成的L^2(γ)的子集E与X的乘积空间上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05305 2026-05-27 cs.CL 50%

SONAR-LLM: Autoregressive Transformer that Thinks in Sentence Embeddings and Speaks in Tokens

SONAR-LLM:在句子嵌入中思考、以令牌说话的自回归Transformer

Nikita Dragunov, Temurbek Rahmatullaev, Elizaveta Goncharova, Nikita Kurdiukov, Aysel Mirzoeva, Anna Borisiuk, Andrey Kuznetsov, Anton Razzhigaev

机构 * FusionBrain Lab, AXXX(融合大脑实验室,AXXX) T-Tech MSU(莫斯科大学) DS-NLP Group, AXXX(自然语言处理组,AXXX)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出SONAR-LLM,一种在连续SONAR嵌入空间“思考”但通过令牌级交叉熵监督的解码器-only Transformer,融合语义抽象与似然训练信号,在39M至1.3B参数规模上取得有竞争力的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13762 2026-05-27 cs.LG q-bio.BM 50%

MolPIF: A Parameter Interpolation Flow Model for Molecule Generation

MolPIF: 一种用于分子生成的参数插值流模型

Yaowei Jin, Junjie Wang, Yufan Tang, Wenkai Xiang, Duanhua Cao, Dan Teng, Zhehuan Fan, Jiacheng Xiong, Xia Sheng, Chuanlong Zeng, Duo An, Mingyue Zheng, Shuangjia Zheng, Qian Shi

机构 * Lingang Laboratory(灵冈实验室) School of Information Science and Technology(信息科学与技术学院) ShanghaiTech University(上海科技大学) Drug Discovery and Design Center, State Key Laboratory of Drug Research(药物发现与设计中心、国家药物研究重点实验室) Shanghai Institute of Materia Medica, Chinese Academy of Sciences(中国科学院上海 medicinal materials 研究院) Global Institute of Future Technology(未来技术全球研究院) Shanghai Jiao Tong University(上海交通大学) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出参数插值流模型MolPIF,通过参数空间分布插值统一连续坐标与离散原子类型的生成,在CrossDocked2020数据集上优于基线方法。

Comments Accepted to Bioinformatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06168 2026-05-27 physics.comp-ph nlin.AO 50%

Robustness of complexity estimation in event-driven signals against accuracy of event detection method

事件驱动信号中复杂度估计对事件检测方法准确性的鲁棒性

Marco Cafiso, Paolo Paradisi

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过系统评估事件驱动扩散缩放算法,研究事件检测方法(RTE-Finder)的准确性对复杂度估计的影响,发现复杂度估计对误报率具有鲁棒性。

Journal ref Chaos, Solitons & Fractals, Volume 208, Part 3, 2026, 118264, ISSN 0960-0779

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00307 2026-05-27 cs.LG physics.ao-ph 50%

Generating realistic global precipitation fields from modelled atmospheric circulation

从模拟大气环流生成逼真的全球降水场

Michael Aich, Sebastian Bathiany, Philipp Hess, Yu Huang, Niklas Boers

机构 * Technical University of Munich(慕尼黑技术大学) Munich Climate Center(慕尼黑气候中心) TUM School of Engineering and Design(TUM工程与设计学院) Department of Aerospace and Geodesy(航空航天与大地测量系) Earth System Modelling Group(地球系统建模组) Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所) Global Systems Institute(全球系统研究所) Department of Mathematics(数学系) University of Exeter(埃克塞特大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出基于条件扩散模型与UNet架构的生成式机器学习方法,从少量预报大气变量生成高分辨率全球降水场,作为传统参数化方案的替代,减少偏差并实现高效集合预测。

Comments Accepted for publication at Climate Dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09522 2026-05-27 math.AP nlin.PS 50%

Linear convective stability of a front superposition with unstable connecting state

具有不稳定连接态的前沿叠加的线性对流稳定性

Louis Garénaux, Bastian Hilder

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究反应扩散系统中两个前沿叠加的对流稳定性,通过数值范围估计揭示不稳定连接态导致长程半强相互作用,使得叠加波的对流稳定传播速度少于单波。

Comments 13 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19381 2026-05-27 quant-ph cond-mat.mes-hall cond-mat.quant-gas cond-mat.str-el 50%

Spontaneous symmetry breaking in open quantum systems: strong, weak, and strong-to-weak

开放量子系统中的自发对称性破缺:强、弱及强到弱

Ding Gu, Zijian Wang, Zhong Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究开放量子系统中强对称、弱对称及无对称相之间的自发对称性破缺,通过构造具体Liouvillian模型,揭示了强对称总是自发破缺(完全或变为弱对称),并发现强到弱对称破缺导致无间隙Goldstone模和对称荷扩散,以及弱U(1)对称破缺自然产生时间晶体序。

Comments 15 pages, 3 figures

Journal ref Phys. Rev. B 112, 245123 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 7 篇

2605.14799 2026-05-27 cs.CV cs.CR cs.SI 70%

Can Visual Mamba Improve AI-Generated Image Detection? An In-Depth Investigation

视觉Mamba能否提升AI生成图像检测?一项深入研究

Mamadou Keita, Wassim Hamidouche, Hessen Bougueffa Eutamene, Abdelmalik Taleb-Ahmed, Xianxun Zhu, Abdenour Hadid

机构 * Laboratory of IEMN, CNRS, Centrale Lille, UMR 8520, Univ. Polytechnique Hauts-de-France(伊姆纳实验室,国家科学研究中心,里尔中央理工大学,UMR 8520,法国高等技术大学) Khalifa University(卡利法大学) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi(索邦人工智能中心,索邦大学阿布扎克分校)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究系统评估了Vision Mamba模型在AI生成图像检测中的性能,与CNN、ViT和VLM检测器进行对比,分析了准确性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26944 2026-05-27 cs.RO cs.CV 57%

Object Pose and Shape Estimation for Grasping: Does it Work?

用于抓取的目标姿态与形状估计:有效吗?

Pavan Karke, Kushal Shah, Gaurav Singh, Md Faizal Karim, K Madhava Krishna, Rajat Talak

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文通过对比端到端抓取合成方法与模块化方法(先估计目标姿态和形状再采样抓取),评估现有姿态和形状估计方法在抓取任务中的有效性。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26316 2026-05-27 cs.CV cs.AI 57%

E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control

E$^3$C: 具有3D环境记忆和自我-外部人体姿态控制的视频生成

Qiao Gu, Lingni Ma, Adam W Harley, Richard Newcombe, Florian Shkurti, Julian Straub

机构 * Meta Reality Labs(Meta现实实验室) University of Toronto(多伦多大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出E$^3$C可控视频扩散框架,通过3D点云记忆和双通道人体控制(自我与外骨骼),实现物理一致的自我中心视频生成。

Comments Preprint. Project Page: https://e3c-videogen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09344 2026-05-27 cs.CV cs.LG 57%

DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data

DreamSim: 使用合成数据学习人类视觉相似性的新维度

Stephanie Fu, Netanel Tamir, Shobhita Sundaram, Lucy Chai, Richard Zhang, Tali Dekel, Phillip Isola

机构 * MIT(麻省理工学院) Weizmann Institute of Science(魏茨曼科学研究所) Adobe Research(Adobe研究)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出DreamSim指标,通过合成数据训练,在图像布局、对象姿态和语义内容等中高层面上对齐人类感知,并在检索和重建任务中优于现有指标。

Comments Website: https://dreamsim-nights.github.io/ Code: https://github.com/ssundaram21/dreamsim

Journal ref Advances in Neural Information Processing Systems 36 (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27314 2026-05-27 cs.RO cs.SY eess.SY 50%

Riding the Shifting Potential: When Reactive Control Suffices for Multi-Goal Behavior

驾驭变化势场:何时反应控制足以实现多目标行为

Vito Mengers, Oliver Brock

机构 * Robotics and Biology Laboratory, Technische Universität Berlin(技术大学柏林机器人与生物学实验室) Science of Intelligence (SCIoI), Cluster of Excellence, Berlin, Germany(智能科学(SCIoI),卓越中心,柏林,德国) Robotics Institute Germany(德国机器人研究所)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出通过零空间投影扩展图基世界模型中的交互结构,动态调整优先级以解决多目标冲突,在非凸障碍导航和非凸物体推拉任务中实现100%成功率,无需演示或重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26993 2026-05-27 math.AP 50%

Backward Uniqueness for Coupled Ultraparabolic Operators and an Application to Jerk-Driven Control Models

耦合超抛物算子的向后唯一性及其在急动驱动控制模型中的应用

Xiao-Dong Cao, Chao-Jiang Xu, Yan Xu

专题命中 可控生成 :diffusion(abstract)

AI总结 通过引入不变频率变量并建立适应输运结构的频率局部化Carleman估计,证明了具有耦合线性漂移的超抛物算子的向后唯一性,并将其应用于急动驱动控制模型中位置、速度、加速度或急动误差的向后唯一性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24152 2026-05-27 cs.AI 50%

Neuro-Inspired Inverse Learning for Planning and Control

神经启发式逆向学习用于规划与控制

Maryna Kapitonova, Tonio Ball

机构 * NeuroMentum AI IMBIT, University of Freiburg, Germany(NeuroMentum AI IMBIT,弗赖堡大学,德国)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出一种神经启发式框架Inverter,通过逆向学习(IL)结合前向/逆向内部模型、开环多步运动指令和层次化动作组织,在规划与控制任务中实现高效推理,平均性能提升24.2%且计算时间降低一到两个数量级。

Comments Version 2, minor fix in online version of the abstract, pdf unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2605.26137 2026-05-27 cs.GR cs.AI cs.CV 62%

AssetGen: Deployable 3D Asset Generation at Interactive Speed

AssetGen: 可部署的交互速度3D资产生成

Dilin Wang, Xiaoyu Xiang, Kihyuk Sohn, Tom Monnier, Yu-Ying Yeh, Thu Nguyen-Phuoc, Jiawen Zhang, Yuchen Fan, Antoine Toisoul, Hyunyoung Jung, Prithviraj Dhar, Michael Bunnell, Nikolaos Sarafianos, Chuhang Zou, Roman Shapovalov, Andrea Vedaldi, Rakesh Ranjan

机构 * Reality Labs, Meta(Meta现实实验室)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV、cs.GR

AI总结 提出AssetGen系统,通过粗到细的VecSet框架、多视图纹理生成及端到端加速,在30秒内生成带烘焙法线、颜色纹理和可控多边形预算的高质量网格,支持实时渲染和移动端部署。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2605.26612 2026-05-27 cs.CL 50%

LATTE: Forecasting Peer Anchored Preference Trajectories for Personalized LLM Generation

LATTE: 预测同伴锚定偏好轨迹以实现个性化LLM生成

Jinze Li, Xiaoyan Yang, Shuo Yang, Jinfeng Xu, Yue Shen, Jian Wang, Jinjie Gu, Edith Cheuk-Han Ngai

机构 * The University of Hong Kong(香港大学) Ant Healthcare, Ant Group(蚂蚁集团医疗科技部)

专题命中 个性化与一致性 :personalized generation(abstract)

AI总结 提出LATTE框架,通过预测同伴锚定的相对偏好状态来个性化冻结的大语言模型,在Amazon Reviews 2023和MemoryCD上优于检索、摘要记忆和静态潜在轮廓等方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 3 篇

2605.12271 2026-05-27 cs.CV 57%

Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm

超越文本提示:视觉到视觉生成作为统一范式

Yaofang Liu, Kangning Cui, Meng Chu, Zhaoqing Li, Suiyun Zhang, Jean-Michel Morel, Xiaodong Cun, Haoxuan Che, Rui Liu, Raymond H. Chan

机构 * City University of Hong Kong(香港城市大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Celia Research HK(Celia研究香港) Great Bay University(大湾大学) Lingnan University(岭南大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 提出视觉到视觉(V2V)生成范式及无需训练的V2V-Zero框架,通过利用视觉页面隐藏状态替代文本条件,在多个任务上达到或接近优化后的文本到图像性能。

Comments Project Page: https://yaofang-liu.github.io/V2V_Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14993 2026-05-27 cs.CV cs.AI cs.LG 57%

Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation

Kandinsky 5.0:图像与视频生成的基础模型系列

Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov

机构 * Kandinsky Lab(Kandinsky 实验室)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文介绍Kandinsky 5.0系列模型,通过多阶段训练、自监督微调和强化学习后训练,实现高分辨率图像和10秒视频的高质量生成。

Comments Website: https://kandinskylab.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26741 2026-05-27 cond-mat.mtrl-sci cs.AI 50%

MatFormBench: A Benchmarking Evaluation Framework for Target-Driven Materials Formulation

MatFormBench: 一个面向目标驱动材料配方的基准评估框架

Linhan Wu, Chenxi Wang, Chuhan Yang, Zhengwei Yang, Yuyang Liu

机构 * DeepVerse

专题命中 图像生成评测 :diffusion(abstract)

AI总结 针对现有材料机器学习基准仅关注正向属性预测而缺乏逆向优化评估的问题,提出MatFormBench基准框架,集成物理驱动配方生成方案与多维度评分指标,系统评估39种逆向设计算法。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 7 篇

2510.17759 2026-05-27 cs.CR cs.CL cs.CV cs.LG stat.ML 70%

VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models

VERA-V:用于破解视觉语言模型的变分推断框架

Qilin Liao, Anamika Lochab, Ruqi Zhang

机构 * Department of Computer Science, Purdue University, USA(美国普渡大学计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出VERA-V变分推断框架,通过联合后验分布生成隐蔽的文本-图像对抗输入,以系统性地发现视觉语言模型的多模态漏洞,在多个基准上攻击成功率最高提升53.75%。

Comments 18 pages, 7 Figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04533 2026-05-27 cs.CV 70%

TAG: Tangential Amplifying Guidance for Hallucination-Resistant Sampling

TAG: 切向放大引导用于抗幻觉采样

Hyunmin Cho, Donghoon Ahn, Susung Hong, Jee Eun Kim, Seungryong Kim, Kyong Hwan Jin

机构 * Korea University(韩国大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一种无需训练、与架构无关的即插即用引导方法TAG,通过放大估计分数的切向分量来纠正采样轨迹,减少语义不一致性并提高保真度。

Comments Accepted to ICML 2026 (Regular)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27336 2026-05-27 cs.CV 57%

PARE: Pruning and Adaptive Routing for Efficient Video Generation

PARE:面向高效视频生成的剪枝与自适应路由

Yutong Wang, Yunke Wang, Tianfan Xue, Yu Qiao, Yaohui Wang, Xinyuan Chen, Chang Xu

机构 * The University of Sydney(悉尼大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出PARE方法,通过结构感知剪枝压缩宽度和输入自适应路由压缩深度,联合减少视频扩散Transformer的计算量,在Wan2.1-14B上实现每步计算大幅降低且质量保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26744 2026-05-27 cs.CV 57%

Self-Intersection-Aware 3D Human Motion Generation Using an Efficient Human Sphere Proxy

基于高效人体球代理的自交感知3D人体运动生成

Pascal Herrmann, Maarten Bieshaar, Dennis Mack, Robert Herzog, Juergen Gall

机构 * Bosch Research(博世研究院) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于人体球代理的自交损失函数,用于训练人体运动生成模型,可减少高达49%的自交现象并改善评估指标。

Comments Accepted to BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19741 2026-05-27 cs.CV 57%

Efficient Transferable Optimal Transport via Min-Sliced Transport Plans

通过最小切片传输计划的高效可迁移最优传输

Xinran Liu, Elaheh Akbari, Rocio Diaz Martin, Navid NaderiAlizadeh, Soheil Kolouri

机构 * Department of Computer Science, Vanderbilt University(范德比大学计算机科学系) Department of Mathematics, Florida State University(佛罗里达州立大学数学系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) Department of Electrical & Computer Engineering, Vanderbilt University(范德比大学电气与计算机工程系)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出最小切片传输计划(min-STP)框架,研究优化切片器在不同分布对间的可迁移性,并引入小批量公式以提高可扩展性,在点云对齐和流生成建模中实现一次性匹配和摊销训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26800 2026-05-27 math.ST stat.TH 50%

Accelerated Schrödinger-Föllmer samplers

加速的薛定谔-福尔默采样器

Haotian Lin, Xiaojie Wang, Xiaoyan Zhang

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出一种高效的随机龙格-库塔方案来加速薛定谔-福尔默采样器,用于复杂高维多模态分布采样,并证明其L^2-Wasserstein距离下的收敛阶为O(h^{3/2}|ln h|)。

详情

展开后加载摘要…

URL PDF HTML 收藏