Renormalized entropy production for optimal transport in jump processes: Make conservative forces optimal again
重整化熵产在跳跃过程最优传输中的应用:使保守力再次成为最优解
专题命中 扩散模型 :diffusion(abstract)
AI总结 研究揭示了在跳跃过程中,尽管保守力不最小化熵产,但能唯一表征重整化熵产,通过数值例子探讨了其与传统熵产的异同。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
重整化熵产在跳跃过程最优传输中的应用:使保守力再次成为最优解
专题命中 扩散模型 :diffusion(abstract)
AI总结 研究揭示了在跳跃过程中,尽管保守力不最小化熵产,但能唯一表征重整化熵产,通过数值例子探讨了其与传统熵产的异同。
凝聚对称包含过程在环面上热力学极限下的收敛性到凝聚布朗运动
专题命中 扩散模型 :diffusion(abstract)
AI总结 研究了离散一维环面上凝聚对称包含过程的饱和态,证明在适当缩放下,凝聚体位置收敛于连续环面上的凝聚布朗运动,通过控制凝聚时间并结合无凝聚运动的精确估计,证明其收敛性。
Comments 40 pages, 5 figures. Comments welcome!
二项流:用于离散序数数据的去噪和流匹配
机构 * Division of Applied Mathematics, Brown University, Providence, RI, USA 02912(应用数学系,布朗大学,普罗维德恩,罗德岛州,美国 02912) ; Department of Statistical Sciences, University of Toronto, Toronto, ON, Canada M5G 1X6(统计科学系,多伦多大学,多伦多,安大略省,加拿大 M5G 1X6)
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出二项流,为离散非负序数数据提供训练离散扩散模型的简单方法,同时实现去噪、采样和精确似然估计。
Comments 41 pages, 9 figures
二维平衡流中内波能量频谱扩散
专题命中 扩散模型 :diffusion(abstract)
AI总结 研究二维平衡流中内波能量频谱扩散机制,发现真实湍流流场中频谱扩散弱于合成流场,推导出频谱扩散时间尺度,揭示大气和海洋中宽带频谱的其他成因。
RXJ2014.8-2430中大尺度晃动冷前缘的详细视图
专题命中 扩散模型 :diffusion(abstract)
AI总结 研究通过新的Chandra观测分析RXJ2014.8-2430中三个冷前缘的精细结构,发现一个可能的Kelvin-Helmholtz不稳定性或AGN活动产生的气体空洞,并测量冷前缘宽度,发现其与库仑自由程一致,表明扩散被抑制。
Comments 11 pages, 13 figures, accepted for publication in MNRAS
数据驱动建模用于预测阿根廷巴塔哥尼亚地区森林火灾蔓延
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出基于反应-扩散-对流模型的数据驱动方法,结合高精度地形和植被数据,通过遗传算法和XGBoost优化参数,提升火灾预测精度,为森林管理提供新方法。
Comments 29 pages, 8 figures
Journal ref Ecological Modelling, Volume 518, August 2026, 111618
STARRY:面向机器人操作的时空动作中心世界建模
机构 * Beijing Institute of Technology(北京理工大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; University of Science and Technology of China(中国科学技术大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; East China Normal University(华东师范大学) ; DeepCybo
专题命中 扩散模型 :diffusion(abstract)
AI总结 STARRY通过统一扩散过程联合去噪未来时空潜在表示和动作,提升机器人操作中时空协调的精度与成功率。
Comments 19 pages
纳米尺度KPZ类粗糙表面在界面限制的晶体生长与退却中的内在台阶阻塞现象
专题命中 扩散模型 :diffusion(abstract)
AI总结 研究了纳米尺度KPZ类动力学粗糙晶体表面在界面限制的晶体生长或退却过程中出现的内在台阶阻塞现象,通过MC模拟揭示了台阶阻塞的机制及抑制方法。
Comments stepJam_w7acs-latex-templates3barxivex; 19 pages, 7 figures. Version 2. Crystal Growth & Design in press. https://doi.org/10.1021/acs.cgd.6c00011
DeepFixel:通过球形卷积神经网络实现交叉白质纤维识别
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出DeepFixel,一种球形卷积神经网络,用于高效分离交叉白质纤维的ODF,相较于非凸优化和基于fixel的方法,具有更高的计算效率和更小的角分离能力。
Comments 11 pages, 6 figures. Accepted to SPIE Medical Imaging 2026: Clinical and Biomedical Imaging
可微自动编码神经算子用于可解释且可整合的潜在空间建模
机构 * Department of Mechanical Engineering, University of Utah, Salt Lake City, UT, USA(犹他大学机械工程系) ; Imaging Institute, University of Utah, Salt Lake City, UT, USA(犹他大学成像研究所)
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出Diano,一种可微自动编码神经算子框架,通过构建可可视化粗网格潜在空间,实现不同空间离散化下的维度和几何缩减,并在潜在空间中直接施加守恒方程,通过编码和解码神经算子实现高效建模。
耗散-相干权衡与热力学速度限制之间的对偶性基于随机极限环的热力学不确定性关系
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文基于热力学不确定性关系,推导了随机极限环在弱噪声极限下的两个基本权衡:耗散-相干权衡和热力学速度限制,并通过噪声罗素模型和随机化学系统进行了数值验证。
Comments 10 pages, 3 figures (main text) + 22 pages, 2 figures (supplemental material)
将独立性纳入Stein方法的扩展
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文扩展Stein方法以纳入辅助随机变量的独立性,适用于存在Stein特征化的任何分布,并通过马尔可夫算子工具展示了对ergodic扩散不变测度定律的应用。
Comments Accepted for publication in Statistics and Probability Letters. 11 pages
超活跃磁星喷发:巨量耀斑、重子喷射与快速射电暴
专题命中 扩散模型 :diffusion(abstract)
AI总结 研究探讨磁星内部磁场通过偶极扩散演化引发喷发的过程,发现其可喷射磁环并产生巨量耀斑,解释了SGR 1806-20 2004年耀斑及后续辐射现象,提出超活跃磁星可能为宇宙快速射电暴的引擎。
Comments 9 pages, 4 figures, accepted ApJL
各向异性高斯场的参数化与惩罚复杂性先验
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出一种平滑可逆的各向异性高斯场相关长度和扩散矩阵参数化方法,并构建惩罚复杂性先验,以获得合适的后验协方差结构。
Comments v2: revised version, accepted for publication in the Journal of the American Statistical Association
姿态感知扩散用于3D生成
机构 * Gaoling School of AI, Renmin University of China(中国人民大学 Gallagher人工智能学院) ; VCIP, School of Computer Science, Nankai University(南开大学计算机学院 VCIP) ; THU-Bosch MLCenter, Tsinghua University(清华大学 THU-Bosch 机器学习中心) ; Inspur Group(Inspur集团)
专题命中 可控生成 :diffusion(title,summary_cn);分类 cs.CV
AI总结 本文提出Pose-Aware Diffusion,通过直接在观测空间生成3D几何,解决姿态对齐难题,实现高保真姿态一致的3D资产生成。
知识图谱的语义层次细节:通过谱热扩散发现抽象边界
机构 * Mnemoverse.AI, Funchal, Madeira, Portugal(Mnemoverse.AI,法赫尔,马德拉,葡萄牙)
专题命中 可控生成 :diffusion(title,abstract)
AI总结 本文提出SLoD框架,通过谱热扩散在图拉普拉斯上定义连续缩放操作,解决知识图谱中抽象层次边界检测问题,实验证明其在合成数据和WordNet中的有效性。
Comments v2: extended companion of GRAAI 2026 workshop paper; full proofs of Lemmas A.1-A.2 (Frechet-mean and heat-kernel Lipschitz constants, corrected) in Appendix A; Proposition 1(i) empirical anchor (new Figure 1); 50-seed ablation with BCa CIs and Wilcoxon tests (Tables 3-4, p<10^-15); WordNet retained (tau=0.79). 21 pages, 6 figures, 4 tables
端到端自回归图像生成与1D语义分词器
机构 * California Institute of Technology(加州理工学院) ; Stanford University(斯坦福大学)
专题命中 可控生成 :image generation(title);分类 cs.CV
AI总结 本文提出端到端训练 pipeline,结合重建与生成优化,改进1D分词器,实现自回归图像生成的高FID分数结果。
Comments In ICML 2026 (Spotlight)
基于可学习可逆变换和语义先验的忠实极端图像放大
机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) ; School of Information and Communications Engineering, Xi’an Jiaotong University(信息与通信工程学院,西安交通大学) ; Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出FaithEIR框架,通过可学习可逆变换和语义先验提升极端图像放大的真实性与细节,实验表明其优于现有方法。
适配大型视觉语言模型以生成低光照增强
机构 * Dalian University of Technology(大连理工大学) ; National University of Singapore(新加坡国立大学) ; Hong Kong Polytechnic University(香港理工大学) ; University of California, San Francisco(加州大学旧金山分校) ; Nanjing University of Science and Technology(南京理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出VLM-IMI框架,通过迭代和手动指令适配大型视觉语言模型,用于生成低光照增强。该框架包含正常光照指令先验生成和指令感知光照增强扩散两个分支,通过融合模块整合跨模态先验,提升生成效果。
Comments 11 papers,8 figures, CVPR2026 Findings
GPT-4o对视觉的理解有多好?在标准计算机视觉任务上评估多模态基础模型
机构 * Swiss Federal Institute of Technology(瑞士联邦理工学院)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 本文评估了GPT-4o等多模态基础模型在标准计算机视觉任务上的表现,发现其在语义任务上优于几何任务,GPT-4o在非推理模型中表现最佳,推理模型在几何任务中有所提升。
Comments ICLR 2026. Project page at https://fm-vision-evals.epfl.ch/
InpaintSLat:通过初始噪声优化进行结构化3D潜在映射修复
机构 * Seoul National University(首尔国立大学)
专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出一种无需训练的可控3D修复方法,通过优化初始噪声提升3D修复的高保真度,引入基于修正流模型的反向传播近似,优化结构化3D潜在映射,实验显示在上下文一致性和提示对齐方面优于基线方法。
Comments project page: https://robot0321.github.io/InpaintSLat/index.html
残差扩散桥模型用于图像修复
机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; Zhongguancun Academy(中关村学院) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) ; School of Robotics, Wuhan University(武汉大学机器人学院)
专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出残差扩散桥模型,通过理论重构扩散桥的随机微分方程,利用残差调节噪声注入与去除,实现自适应修复受损区域并保留完整区域,验证了模型的最优性。
Comments Accepted by CVPR 2026 as Highlight
GOR-IS: 在内在空间中进行3D高斯物体移除
机构 * Nankai University(南开大学) ; Nanjing University(南京大学)
专题命中 图像修复 :inpainting(abstract);分类 cs.CV
AI总结 本文提出GOR-IS框架,通过分解场景为内在组件并建模光传输,实现物理一致且视觉连贯的3D物体移除,实验表明其在感知相似度和PSNR上优于现有方法。
UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成
机构 * Beihang University(北京航空航天大学) ; Nanjing University(南京大学) ; Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV
AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。
Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)
Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)
图像质量评估的算法凝视:LAION-Aesthetics预测器的审计与踪迹民族志
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 本文研究了广泛用于训练视觉生成图像模型的LAION-Aesthetics预测器,揭示其在筛选图像数据时对女性描述的偏向性,以及其对西方艺术史中帝国和男性凝视的强化,呼吁转向更多元的审美评估。
Comments To Appear at FAccT 2026
深度伪造:我们需要重新思考“真实”图像的概念
机构 * Institute for Machine Learning and Analytics, Offenburg University(机器学习与分析研究所,奥芬堡大学) ; University of Mannheim(曼海姆大学) ; Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰州信息校区)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 本文指出当前“伪造”检测方法依赖过时的低分辨率“真实”图像数据集,呼吁重新定义“真实”图像并建立新基准数据集。
ML-Bench&Guard: 政策导向的多语言安全基准与大型语言模型的防护机制
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Fudan University(复旦大学) ; University of Chicago(芝加哥大学)
专题命中 图像生成评测 :diffusion(abstract)
AI总结 本文提出ML-Bench和ML-Guard,通过区域法规构建多语言安全基准,并开发基于扩散模型的防护系统,实现文化与法律一致的多语言安全评估。
多模态融合的拓扑学:为何当前架构在创造性认知上失败
机构 * Guangzhou Academy of Fine Arts(广州美术学院)
专题命中 图像生成评测 :diffusion(abstract)
AI总结 本文指出当前多模态AI架构存在拓扑限制而非参数限制,通过哲学、认知科学和数学三个支柱提出多模态融合的拓扑学框架,提出UOO实现、ANALOGY-MM基准和META-TOP三阶基准,通过实验路线验证拓扑同构性。
Comments Expanded 11 technical improvements; 5 reference corrections; Appendix B pseudocode added. ~43 pages, 5 figures. Chinese philosophical terms romanized. Companion monograph available separately
通过能量评分与辅助上下文表示蒸馏实现一步文本到音频生成
机构 * National Taiwan University(国立台湾大学) ; Amazon AGI(亚马逊人工智能实验室)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 本文提出了一种结合能量距离训练和表示层蒸馏的一步采样框架,有效提升了文本到音频生成的速度与质量,在AudioCaps基准上优于现有方法,达到与多步采样扩散模型相当的性能。
Riemannian MeanFlow:在流形上直接学习流映射的高效生成框架
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; Mila - Quebec AI Institute(魁北克人工智能研究所)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 Riemannian MeanFlow在流形上直接学习流映射,通过单次前向传递实现高质量生成,相比传统方法减少10倍的函数评估次数,并通过奖励预览实现高效奖励引导设计。