arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1207 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1207 篇

2608.12937 2026-08-14 math-ph cs.NA math.AP math.MP math.NA 新提交 50%

Transparent Boundary Conditions for the Heat Equation on Metric Graphs

度量图上热方程的透明边界条件

Jasur Matrasulov, Jambul Yusupov, Matthias Ehrhardt

专题命中 图像生成评测 :diffusion(abstract)

AI总结 该研究针对度量星形图建模的分支准一维区域的时变热方程,结合透明边界条件与网络偏微分方程理论,推导了消除热回流的精确顶点条件,经数值方法验证,为低维结构热扩散控制提供了数学框架。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09974 2026-08-11 cs.AI cs.CL 版本更新 50%

SPRInG: Continual LLM Personalization via Selective Parametric Adaptation and Retrieval-Interpolated Generation

SPRInG: 通过选择性参数适应和检索插值生成实现连续大语言模型个性化

Seoyeon Kim, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 图像生成评测 :personalized generation(abstract)

AI总结 SPRInG通过选择性参数适应和检索插值生成,实现连续大语言模型个性化,有效应对用户偏好变化带来的挑战。

Comments under review, 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06967 2026-08-10 cs.CL 新提交 50%

Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

语言模型无需视觉输入即可进行想象?Ekphrasis:测量仅文本大型语言模型的视觉创意构想能力

Hongyu Luo, He Wang, Huihao Jing, Hong Ting Tsang, Yuxuan Liu, Wuganjing Song, Yauwai Yim, Chunyang Li, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 图像生成评测 :image generation(abstract)

AI总结 本研究推出基准Ekphrasis,测量仅文本大型语言模型的视觉创意构想能力,发现该能力与流畅度分离,且其排序可跨模态稳定存在。

Comments 25 pages, 4 main figures, with appendices. Code and data: https://github.com/Imhongyu/Ekphrasis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04838 2026-08-06 math.ST math.PR stat.TH 新提交 50%

Exchangeable Testing Against an Unknown Benchmark

针对未知基准的可交换检验

Alexander Gnedin

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本研究针对未知基准的序贯检验,提出基于组合秩的更新机制,建立贝叶斯框架下可显式计算的预测概率,分析了相关马尔可夫链的渐近行为。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20894 2026-08-04 math.AP 版本更新 50%

On the well-posedness of porous medium equations on general metric measure spaces

关于一般度量测度空间上多孔介质方程的适定性

Diwen Chang

专题命中 图像生成评测 :diffusion(abstract)

AI总结 研究一般度量测度空间上带符号多孔介质方程柯西问题的适定性,基于Rothe方法和单调算子理论,仅用狄氏型定义,证明对给定初始数据存在唯一弱解,适用于多种度量测度空间包括非光滑分形。

Comments 39 pages, 2 figures. Have corrected nearly all errors in old versions. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08417 2026-08-04 cs.CL cs.AI 版本更新 50%

Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics

破解生成困惑度:为何无条件文本评估需要分布度量

Antonio Franca, Alexander Tong

机构 * AITHYRA Institute(AITHYRA研究所)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文指出生成困惑度(gen-PPL)作为非自回归语言模型评估指标存在缺陷,通过构造零参数朴素采样器在LM1B和OpenWebText上达到SOTA gen-PPL但生成不连贯文本,建议采用直接量化生成文本与参考文本分布差异的评估套件。

Comments Presented at the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24871 2026-07-29 cond-mat.mtrl-sci 新提交 50%

A flexible kinetic Monte Carlo framework for GaN molecular beam epitaxy with adaptive on-the-fly barrier evaluation

用于 GaN 分子束外延的具有自适应实时势垒评估的灵活动力学蒙特卡罗框架

Sajid Ali, Norbert Krause, Carla Verdi

专题命中 图像生成评测 :diffusion(abstract)

AI总结 该研究提出基于晶格的 KMC 框架模拟 GaN(0001)分子束外延生长,捕捉关键微观过程,支持自适应实时势垒评估,能再现岛形成等现象,为 GaN 外延及化合物半导体非平衡生长提供了灵活的原子尺度预测模拟平台。

Journal ref Applied Surface Science, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14021 2026-07-27 cs.RO 版本更新 50%

Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation

工业灵巧性基准测试:一个用于工业灵巧操作的硬件-软件基准测试平台

Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast

机构 * Analog Devices, Inc.(亚德诺半导体技术有限公司)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 针对工业灵巧操作瓶颈,提出从经典流程到端到端多模态模仿学习框架的转变,介绍了IDB板、DAG-ROS框架和AG-iDP3策略框架,通过数据中心电缆操作实验表明新策略在多方面优于传统方法,推动向可扩展机器人自动化发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16268 2026-07-21 cs.LG 新提交 50%

PsiLogic: Chaos-Aware Active Cancellation for Adam with a Fair Cross-Domain Benchmark

PsiLogic:用于Adam的混沌感知主动抵消及公平跨域基准测试

Ali Sultonov

专题命中 图像生成评测 :diffusion(abstract)

AI总结 研究针对自适应优化器在不同训练阶段更新规则相同的问题,提出PsiLogic优化器,通过双指数移动平均控制主动抵消项,经FairBench基准测试,在多个领域表现优异,还发布开源实现等支持验证。

Comments 9 pages, 4 figures; code at https://github.com/Troxter222/psilogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06796 2026-07-15 cs.RO 版本更新 50%

RoboDesign1M: A Large-scale Dataset for Robot Design Understanding

RoboDesign1M:用于机器人设计理解的大规模数据集

Tri Le, Toan Nguyen, Quang Tran, Quang Nguyen, Baoru Huang, Hoan Nguyen, Minh Nhat Vu, Tung D. Ta, Anh Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) University of Liverpool(利物浦大学) University of Information Technology(信息技术大学) Automation & Control Institute(自动化与控制研究所) Department of Creative Informatics(创意信息系) Faculty of Environment and Information Studies(环境与信息科学系)

专题命中 图像生成评测 :image generation(abstract)

AI总结 针对机器人设计领域缺乏大规模数据集的问题,介绍了含100万个样本的RoboDesign1M数据集,提出半自动数据收集管道,经多项实验评估,该数据集可推动机器人设计理解研究及相关自动化发展。

Comments 8 pages, accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09973 2026-07-14 cs.SD cs.AI cs.SY eess.AS eess.SP eess.SY 新提交 50%

A Production-Oriented Framework for Evaluation of SFX Generation

一种面向生产的声效生成评估框架

Mélodie Desbos, Yara Bahram, Eric Granger, Mohammadhadi Shateri

专题命中 图像生成评测 :inpainting(abstract)

AI总结 针对工业声音设计中声效生成评估问题,提出面向生产的评估框架,通过确定生产要求、两阶段协议及结合客观指标与人类研究,揭示不同基线的优势权衡,为声效变化评估建立协议并为设计音频生成管道提供基础。

Comments 8 pages main paper, 7 pages appendix, Proceedings of the 29th International Conference on Digital Audio Effects (DAFx26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11335 2026-07-14 q-fin.MF math.OC 新提交 50%

Minimizing Benchmark-Relative Drawdown Duration via Occupation Time Penalization

通过占用时间惩罚最小化基准相对回撤持续时间

Jun Sekine, Marcus Wunsch

专题命中 图像生成评测 :diffusion(abstract)

AI总结 研究连续时间投资组合优化问题,投资者相对不可复制基准评估,引入基准相对回撤持续时间标准,通过推导方程、建立定理等,得到基于投影的最优控制特征及相关结果,为基准跟踪提供新方案和风险管理新结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08751 2026-07-10 cs.RO 新提交 50%

DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation

DexVerse:用于多任务、多实体灵巧操作的模块化基准测试

Yunchao Yao, Zhuxiu Xu, Tianqi Zhang, Zixian Liu, Sikai Li, Zhenyu Wei, Feng Chen, Dihong Huang, Kechang Wan, Chenyang Ma, Shuqi Zhao, Shenghua Gao, Masayoshi Tomizuka, Yi Ma, Mingyu Ding

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) The University of Hong Kong(香港大学) UC Berkeley(加州大学伯克利分校)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 DexVerse是用于多任务、多实体灵巧操作的模块化基准测试,含100个任务,支持多种机器人手臂和手,可扩展且提供视觉变化等。通过对多种方法的基准测试,揭示任务泛化和视觉运动鲁棒性挑战,为通用灵巧操作提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28578 2026-07-01 cond-mat.mtrl-sci cs.AI 交叉投稿 50%

Surrogate-Gated Generation and Foundation-Model Embeddings for Bayesian Materials Design

用于贝叶斯材料设计的代理门控生成与基础模型嵌入

Sk Md Ahnaf Akif Alvi, Jan Janssen, Danny Perez, Douglas Allaire, Raymundo Arroyave

机构 * Texas A&M University(德克萨斯A&M大学) Max-Planck-Institute for Sustainable Materials(马克斯·普朗克可持续材料研究所) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出一种代理门控生成方法,利用高斯过程代理对扩散先验生成的晶体结构进行排序筛选,在固定预算下匹配或超越无门控微调性能,并识别出ORB嵌入与高斯过程为最可靠的代理组合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31700 2026-07-01 cs.LG cs.NE 新提交 50%

Diffusing Blame: Task-Dependent Credit Assignment in Biologically Plausible Dual-Stream Networks

扩散责任:生物合理双流网络中的任务依赖信用分配

Yutaro Yamada, Luca Grillotti, Rujikorn Charakorn, Sebastian Risi, David Ha, Robert Tjarko Lange

机构 * Sakana AI

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出模误差路由扩展误差扩散法,在严格遵循戴尔原则的双流兴奋/抑制网络中,实现MNIST 96.7%和CIFAR-10 61.7%的分类性能,并集成PPO在强化学习任务中取得竞争性结果。

Comments ALIFE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29172 2026-06-30 physics.ao-ph 50%

CORDEX-ML-Bench: A Benchmark for Data-Driven Regional Climate Downscaling -Experiment Design and Overview

CORDEX-ML-Bench: 数据驱动区域气候降尺度的基准测试——实验设计与概述

Neelesh Rampal, José González-Abad, Henry Addison, Jorge Baño-Medina, Maria Laura Bettolli, Valentina Blasone, Ben Booth, Erika Coppola, Serafina Di Gioia, Joshua Oldham-Dorrington, Antoine Doury, Francois Engelbrecht, Ramón Fuentes-Franco, Peter B. Gibson, Luca Glawion, Caroline Hardy, Mikhail Ivanov, Hugo Kyo Lee, Mikel N. Legasa, Matias Olmo, Andrew Orr, Julius Polz, Martin S. J. Rogers, Maybritt Schillinger, Shivani Sharma, Pedro M. M. Soares, Stefan Sobolowski, Jessica Steinkopf, Wenchang Tang, Jr-Ben Tian, Ricardo Tomé, Ko-Chih Wang, Yi-Chi Wang, Peter A. G. Watson, Tom Wetherell, Martin Widmann, José M. Gutiérrez

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出CORDEX-ML-Bench基准,在三个区域以10公里分辨率降尺度温度和降水,评估40种ML配置,发现生成模型在降水上优于确定性方法,但历史训练模型低估未来信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12957 2026-06-30 cs.LG cs.AI 50%

Attribution Graphs and Causal Probing for Mechanistic Discovery and Bias Repair in Multimodal Generative Learning

揭示-修订:具有多模态注意力的可解释性偏见感知生成建模

Noor Islam S. Mohammad, Uluğ Bayazıt

专题命中 图像生成评测 :image generation(abstract)

AI总结 本文提出一个统一了跨模态注意力融合、Grad-CAM++属性分析和揭示-修订反馈循环的可解释性偏见感知生成框架,通过多模态MNIST和Fashion MNIST数据集验证了其在图像生成和子组审计中的性能。

Comments We are recently authors in conflict with this work; I am heartily requesting to withdraw this paper as soon as possible

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26498 2026-06-26 math.OC cs.LG 新提交 50%

Mean-Field PhiBE: Continuous-Time Mean-Field Reinforcement Learning from Discrete-Time Data

平均场 PhiBE:基于离散时间数据的连续时间平均场强化学习

Erhan Bayraktar, Martin Hernandez, Qinxin Yan, Yuhua Zhu

机构 * Department of Mathematics, University of Michigan, Ann Arbor, MI, USA(密歇根大学数学系,安阿伯,密歇根州,美国) Department of Statistics and Data Science, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校统计与数据科学系,加利福尼亚州,美国) Program in Applied and Computational Mathematics, Princeton University, Princeton, NJ, USA(普林斯顿大学应用与计算数学项目,普林斯顿,新泽西州,美国)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 针对仅离散时间数据可用但种群连续演化的模型无关连续时间平均场控制问题,提出平均场PhiBE方法,将离散时间信息融入Wasserstein空间上的连续时间PDE,并推导策略梯度定理,实现模型无关的演员-评论家算法,证明一阶一致性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09976 2026-06-26 cs.LG cs.RO 版本更新 50%

Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models

视觉-语言-动作模型的流匹配策略的强化微调

Mingyang Lyu, Yinqian Sun, Erliang Lin, Huangrui Li, Ruolin Chen, Feifei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知人工智能实验室,自动化研究所,中国科学院,北京,中国) Beijing Institute of AI Safety and Governance, China(北京人工智能安全与治理研究院,中国) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术国家重点实验室) Beijing Key Laboratory of Safe AI and Superalignment, China(北京安全人工智能与超对齐重点实验室,中国) University of Chinese Academy of Sciences (UCAS), Beijing, China(中国科学院大学(UCAS),北京,中国) Long-term AI,Beijing,China(长期人工智能,北京,中国)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 针对流匹配模型强化微调中重要性采样计算困难的问题,提出流策略优化算法,通过条件流匹配目标、结构感知信用分配等技术实现稳定在线微调,在LIBERO和ALOHA任务上超越基线。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22510 2026-06-23 cs.LG cs.AI cs.DC 新提交 50%

Fed-CausalDiff: Decoupled Synchronization for Federated Do-Simulation and Policy Evaluation

Fed-CausalDiff: 面向联邦干预模拟与策略评估的解耦同步方法

Pengfei Li, Mohammad Khalil

机构 * Akademiaavtalen project ASPIRE(Akademiaavtalen项目ASPIRE)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出Fed-CausalDiff联邦因果扩散框架,通过将潜在状态演化解耦为全局因果评分和局部混杂评分,实现解耦同步,在保护数据隐私的同时提升干预效应和策略价值估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21779 2026-06-23 cs.CR 新提交 50%

FrogBard-512: Design and Experimental Evaluation of a Four-Voice Permutation-Based Hash Function

FrogBard-512:四声道排列哈希函数的设计与实验评估

Victor Duarte Melo

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出一种基于2048位排列的四声道哈希函数FrogBard-512,采用1024位速率、16轮置换和树模式,通过实验验证实现一致性和无统计缺陷。

Comments 18 pages, 7 figures, and 10 tables. This paper describes an experimental hash-function design and reports implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14930 2026-06-23 math.NA cs.NA 版本更新 50%

Kernel-learning parameter prediction and evaluation in algebraic multigrid method for several PDEs

针对若干偏微分方程的代数多重网格方法中核学习参数预测与评估

Junyue Luo, Xiaoqiang Yue, Fangfang Zhang, Juan Zhang

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出基于高斯过程回归的代数多重网格参数优化策略,通过核学习构建核函数库并线性组合最优核,在小规模数据集上预测近优参数,显著降低计算时间并保持迭代次数与网格搜索一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25937 2026-06-17 cs.RO cs.LG 版本更新 50%

Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned

视觉基础模型能否导航?零样本真实世界评估与经验教训

Maeva Guerrier, Karthik Soma, Jana Pavlasek, Giovanni Beltrame

机构 * Polytechnique Montreal(蒙特利尔理工学院)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文对五种视觉导航模型在真实环境中进行零样本评估,发现其存在几何理解不足、感知混淆和分布漂移等系统性问题,并公开评估代码与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09098 2026-06-16 eess.AS 新提交 50%

HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis

HoliDubber: 通过文本引导的音频合成实现复杂声学场景的全景视频配音

Wenhao Guan, Yifan Duan, Junxi Liu, Yu Gu, Feng Dang, Kaidi Wang, Qingyang Hong, Lin Li, Xie Chen

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出HoliDubber框架,基于补丁自回归扩散Transformer,从单一文本提示联合生成语音和音效,实现全景视频配音,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14334 2026-06-15 cs.LG math.DG 新提交 50%

Riemannian Metric Matching for Scalable Geometric Modeling of Distributions

黎曼度量匹配:面向分布的可扩展几何建模

Jacob Bamberger, Adam Gosztolai, Pierre Vandergheynst, Michael Bronstein, Iolo Jones

机构 * University of Cambridge(剑桥大学)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出黎曼度量匹配框架,通过神经网络学习数据的黎曼几何,利用carré du champ算子的条件期望形式实现样本级训练和恒定成本推理,在精度相当或更优下速度提升400倍。

Comments ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12434 2026-06-12 cs.CY 新提交 50%

Pluralistic-Alignment Urbanism: Operationalizing a Right to AI for Inclusive Public Space

多元对齐城市主义:将人工智能权利操作化以促进包容性公共空间

Rashid Mushkani

专题命中 图像生成评测 :text-to-image(abstract)

AI总结 提出多元对齐城市主义(PAU)框架,通过两个蒙特利尔案例研究,将公共空间AI系统视为公民基础设施,并制定程序性AI权利,以处理分歧、亚组差异和偏好判断,实现包容性治理。

Comments Accepted to The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), June 25--28, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21227 2026-06-12 cond-mat.mtrl-sci cs.AI 版本更新 50%

PhononBench:A Large-Scale Phonon-Based Benchmark for Dynamical Stability in Crystal Generation

PhononBench:面向晶体生成中动态稳定性的基于声子的大规模基准

Xiao-Qi Han, Ze-Feng Gao, Wen-Kao Li, Peng-Jie Guo, Zhong-Yi Lu

机构 * School of Physics, Renmin University of China(中国人民大学物理学院)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出PhononBench,首个大规模AI生成晶体动态稳定性基准,利用MatterSim势高效计算声子,评估7个模型生成的133,838个结构,发现平均动态稳定性率仅32.15%。

Comments 53 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27303 2026-06-11 eess.SP 版本更新 50%

Point Spread Function Optimization for Communication-assisted UAV-borne MIMO TomoSAR

面向通信辅助的无人机载MIMO TomoSAR的点扩展函数优化

Pouya Fakharizadeh, Mohamed-Amine Lahmeri, Gerhard Krieger, Robert Schober

专题命中 图像生成评测 :image generation(abstract)

AI总结 针对无人机载MIMO合成孔径雷达层析成像系统,提出基于粒子群优化的联合无人机编队与卸载功率分配方法,以最小化点扩展函数旁瓣水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10071 2026-06-10 cs.LG cs.AI 新提交 50%

Temporal Sheaf Neural Networks with Dynamic Orthogonal Transport

时序层神经网络与动态正交传输

Md Sadek Hossain Asif, Tanzila Khan, Md. Mosaddek Khan

机构 * University of Dhaka(达卡大学)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出时序层神经网络(TSNN),通过动态正交帧和局部坐标系间显式传输实现时序链接预测,在多种基准上超越现有方法,尤其适用于节点角色异质性强的图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09705 2026-06-09 cs.LG cond-mat.stat-mech 新提交 50%

When Do Local Score Models Extrapolate Across Size? A Diagnostic Theory and Benchmark

局部评分模型何时能跨尺寸外推?诊断理论与基准

Wenjie Xi

机构 * The University of Hong Kong(香港大学) Department of Physics and HK Institute of Quantum Science & Technology(物理系与香港量子科学与技术研究所)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出诊断理论,证明局部模型能否稳定外推取决于高斯平滑评分的准局部性,并引入有限深度局部流(FDLF)基准进行验证。

详情

展开后加载摘要…

URL PDF HTML 收藏