Pyramidal Patchification Flow for Visual Generation
金字塔补丁化流用于视觉生成
专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 本研究提出金字塔补丁化流方法,通过动态调整补丁大小和线性投影提升视觉生成效率与性能。
Comments ICLR 2026
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
金字塔补丁化流用于视觉生成
专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 本研究提出金字塔补丁化流方法,通过动态调整补丁大小和线性投影提升视觉生成效率与性能。
Comments ICLR 2026
BiGain:联合生成与分类的统一标记压缩
机构 * VILA Lab, MBZUAI(MBZUAI视觉实验室) ; North Carolina State University(北卡罗来纳州立大学)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 BiGain通过频率分离技术,实现生成与分类的统一标记压缩,提升扩散模型的加速性能和分类准确率,同时保持生成质量。
Comments CVPR 2026. Code: https://github.com/Greenoso/BiGain
Ada3Drift: 适应性训练时间漂移用于一步式三维视觉-运动机器人操作
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 Ada3Drift通过将迭代细化从推理时间转移到训练时间,实现高保真的单步三维视觉-运动机器人操作生成,同时在少样本条件下提升性能并减少计算成本。
NeuralOS: 通过神经生成模型实现操作系统的模拟
机构 * University of Waterloo(滑铁卢大学) ; National Research Council Canada(加拿大国家研究委员会)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 NeuralOS通过神经生成模型模拟操作系统GUI,能准确预测用户交互并生成逼真界面,展示了合成数据在模拟未安装应用上的潜力。
Comments ICLR 2026
TextFlux:一种无需OCR的DiT模型用于高保真多语言场景文本合成
机构 * bilibili Inc.(哔哩哔哩公司) ; OpenWPLab(开放WPLab) ; Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 TextFlux是一种无需OCR的DiT模型,通过简化架构和训练流程,实现高保真多语言场景文本合成。
Comments Accepted to Eurographics 2026 (Computer Graphics Forum)
生成式预测控制:通过预测世界建模增强推理时间的机器人策略
专题命中 扩散模型 :diffusion(abstract);分类 cs.CV
AI总结 GPC通过预测世界建模在推理时间提升机器人策略,结合生成先验与前瞻性预测,实现测试时间适应,优于行为克隆并与其他基线方法相媲美。
Comments Acceptance to IEEE Robotics and Automation Letters. Website: https://computationalrobotics.seas.harvard.edu/GPC
超图上的最大熵随机游走
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出了一种基于超图的最大熵随机游走框架,通过广播和融合机制建模高阶交互,并利用Kullback-Leibler散度投影推断转移核,以提升复杂系统中方向流动和信息扩散的建模能力。
时空表征受限主动布朗运动在通道中的行为
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文研究了受限主动布朗粒子在通道中的时空行为,通过分析首次通过性质和空间分布,揭示了主动运动对扩散过程的影响,并利用Siegmund对偶性解释了稳态状态的形成。
Comments 9 pages, 3 figures
在随机热力学中,什么是最小工作过渡?
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文探讨了随机热力学中最小工作过渡的概念,指出在考虑控制协议速度限制后,最优控制问题需重新定义,并通过悬浮粒子模型验证了广义薛定谔桥的重要性。
Comments 23 pages, 3 figures
泰勒弥散在变密度、变粘度脉动流中的表现
专题命中 扩散模型 :diffusion(abstract)
AI总结 研究脉动流中变密度和变粘度条件下泰勒弥散现象,通过多重尺度分析建立有效混合模型,揭示剪切诱导弥散机制。
Journal ref Prog. Scale Model. Int. J. 7 (2026) 1-6
DocSage:一个多文档多实体问答的信息结构代理
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 扩散模型 :diffusion(abstract)
AI总结 DocSage通过动态模式发现、结构化信息提取和模式感知推理,解决多文档多实体问答中的跨文档证据链构建和实体关系推断问题,实现超过27%的准确率提升。
具有稳态保证的因果影响最大化
专题命中 扩散模型 :diffusion(abstract)
AI总结 本研究提出CIM框架,在预算限制下通过两阶段方法最大化网络稳态潜在结果,提供因果推断与网络优化的结合及可证明的保证。
一个纳什分层不等式与一般二维域上化学趋化-流体系统的全局正则性
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文通过改进的纳什不等式证明了二维化学趋化-流体系统在一般二维域上的全局正则性,解决了大质量数据导致的有限时间奇点问题。
Comments 62 pages, 7 figures
不可逆端口哈密顿系统用于一维流体系统
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出了一种扩展的不可逆端口哈密顿系统框架,用于建模具有粘性耗散的非等熵流体,并确保热力学定律的满足。
热核及树上热方程解的长时间渐进行为
专题命中 扩散模型 :diffusion(abstract)
AI总结 研究同构树上热核及热方程解的长时间渐进行为,推导热核渐进行为并证明解在l^p范数下的分解性质,揭示图几何对热扩散的影响。
一维浅层神经网络近似中块牛顿方法的收敛性分析
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出了一种用于一维浅层神经网络近似问题的块牛顿方法,并分析了其局部收敛性,同时允许在优化过程中减少参数数量以提高效率。
通过具有Lipschitz保证的流匹配进行分布估计
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文通过流匹配方法,在高维情况下改进了分布估计的收敛率,无需log-concavity假设。
定制化排序使高容量正极材料成为可能
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出计算有序框架,用于设计高容量无钴正极材料,通过元素统计和启发式方法实现相稳定与Li扩散的优化。
Comments 47 pages, 12 figures
Journal ref Adv. Energy Mater.15, no. 47 (2025): e03660
氢和氧空位在晶硅电池中的作用:湿环境中器件退化机制
专题命中 扩散模型 :diffusion(abstract)
AI总结 本研究通过理论分析揭示了湿环境中硅太阳能电池退化主要由氢空位引起,而非氧空位,为开发针对性缓解策略提供了理论依据。
Comments 26 pages, 5 figures
黎曼变分流匹配用于材料和蛋白质设计
专题命中 扩散模型 :diffusion(abstract)
AI总结 RG-VFM通过黎曼几何方法提升流形生成性能,有效捕捉流形结构并改进下游任务表现。
See4D: 通过自回归视频修复实现无姿态4D生成
机构 * NUS(新加坡国立大学) ; HKU(香港大学) ; CUHK(香港中文大学) ; THU(清华大学) ; Shanghai AI Lab(上海人工智能实验室) ; Horizon Robotics(地平线机器人) ; NTU(国立科技大学)
专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV、cs.GR
AI总结 See4D通过自回归视频修复实现无姿态4D生成,提升从随意视频到4D世界建模的实用性。
Comments Eurographics2026; 26 pages; 21 figures; 3 tables; project page: https://see-4d.github.io/
FlashMotion: 通过轨迹引导的少步可控视频生成
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM
AI总结 FlashMotion通过轨迹引导和蒸馏方法实现了少步可控视频生成,提升了视频质量和轨迹准确性。
Comments Accepted by CVPR2026
DVD:利用生成先验的确定性视频深度估计
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 DVD通过确定性方法将预训练视频扩散模型转化为单次通过深度回归器,解决视频深度估计中的生成与判别模型权衡问题,实现零样本性能提升并释放开源训练套件。
Comments Project: https://dvd-project.github.io/
EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Microsoft Corporation(微软公司)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。
PolyCrysDiff: 可控生成三维可计算多晶材料结构
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 PolyCrysDiff通过条件潜在扩散框架实现了可计算的多晶材料三维微结构可控生成,有效提升了晶粒属性控制精度,为多晶材料的优化设计提供新方法。
语义感知的重建误差用于检测AI生成图像
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 本文提出语义感知的重建误差(SARE)用于检测AI生成图像,通过分析图像与描述词引导重建间的语义差异,提升跨生成模型的检测鲁棒性。
UNet-AF: 一种无别名的UNet用于图像恢复
专题命中 图像修复 :diffusion(abstract);分类 cs.CV
AI总结 本文提出一种无别名UNet架构,通过选择先进的翻译等变层提升图像恢复任务中的等变性,实验显示其在性能和等变性方面优于传统方法。
面向表情识别的个性化特征翻译:一种高效的无源域适应方法
机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(蒙特利尔工程学院系统工程系LIVIA) ; LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(蒙特利尔工程学院软件与IT工程系LIVIA) ; Dept. of Health, Kinesiology, & Applied Physiology, Concordia University, Montreal, Canada(蒙特利尔大学健康、运动科学与应用生理学系) ; Montreal Behavioural Medicine Centre, CIUSSS Nord-de-l’Ile-de-Montréal, Canada(蒙特利尔行为医学中心,北岛-蒙特利尔CIUSSS) ; Dept. of Electrical and Computer Engineering, Queen’s University, Kingston, Canada(皇后大学电气与计算机工程系)
专题命中 个性化与一致性 :image generation(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文提出SFDA-PFT方法,通过潜在空间中的特征翻译实现无源域适应,解决中性表情目标数据下的表情识别问题,提升隐私敏感场景下的性能。
DreamVideo-Omni: 基于潜在身份强化学习的多主体视频定制与 Omni-运动控制
机构 * Fudan University(复旦大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; Zhejiang University(浙江大学) ; MMLab, The University of Hong Kong(香港大学MMLab) ; Nanyang Technological University(南洋理工大学) ; Show Lab, National University of Singapore(新加坡国立大学Show Lab)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 DreamVideo-Omni通过渐进式两阶段训练范式,实现多主体视频定制与Omni-运动控制,采用条件感知嵌入和分层运动注入策略,提升身份保持与运动控制精度。
Comments Project Page: https://dreamvideo-omni.github.io
StyleGallery: 无需训练且语义感知的任意图像参考个性化风格迁移
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 StyleGallery通过语义感知和无需训练的框架,实现任意图像参考的个性化风格迁移,提升内容保留与风格化平衡能力。
Comments 18 pages, 23 figures, Conference on Computer Vision and Pattern Recognition 2026