arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-24 至 2026-06-24 共收录 90 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 71 篇

2606.24385 2026-06-24 math.PR math-ph math.MP 新提交 50%

Gradient Mean-Field Dynamics with Measure-Valued States: Well-Posedness, Chaos, and Long-Time Stability

梯度平均场动力学与测度值状态:适定性、混沌与长期稳定性

Anderson Melchor Hernandez

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究状态空间为位置与概率测度乘积的随机平均场相互作用粒子系统,建立强解存在唯一性,证明混沌传播,并分析非线性McKean-Vlasov动力学指数收敛到不变测度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24380 2026-06-24 hep-ph 新提交 50%

Fully-heavy multiquarks in neural-network quantum states

神经网络量子态中的全重多夸克

Wen-min Li, Zhenyu Zhang, Qian Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 利用神经网络量子态方法,结合群论构造色旋子部分,有效解决了全重多夸克态谱学计算中的高维难题,精度优于传统方法。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24393 2026-06-24 physics.bio-ph cond-mat.soft 新提交 50%

Uniaxial poroelastic tendon model with crimped fibre recruitment

具有卷曲纤维募集的单轴多孔弹性肌腱模型

Zoe C. Godard, Sarah L. Waters, Derek E. Moulton

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一维多孔弹性模型,包含卷曲纤维的逐步募集,研究肌腱在加载和卸载过程中的力学响应,发现纤维募集导致加载时更慢达到稳态、卸载时松弛更慢,产生应力-应变滞回环,为肌腱结构提供自然保护机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24291 2026-06-24 cond-mat.soft cond-mat.stat-mech physics.flu-dyn 新提交 50%

Broadband molecular dynamics simulation of fluid inertial effects in confined Brownian motion

受限布朗运动中流体惯性效应的宽带分子动力学模拟

Quentin Thomas, Clara Mefo Sop, Maxime Lavaud, Yacine Amarouchene, Thomas Salez, Pascal Damman

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过分子动力学模拟,研究受限布朗粒子在宽频谱范围内的速度自相关函数,揭示壁面附近有效附加质量的增强及扩散系数的降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23921 2026-06-24 cond-mat.soft 新提交 50%

Flexibility Controls Active-Filament Transport in Crowded Landscapes

柔性控制拥挤环境中的活性细丝输运

Qingyi Di, Mohammad Fazelzadeh, Sara Jabbari-Farouji

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过布朗动力学模拟,研究活性聚合物在有序和无序障碍物阵列中的输运,发现柔性在中等时优化无序环境中的扩散,而半柔性细丝在密集有序阵列中因定向运动增强迁移率,并识别出三种输运机制。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23780 2026-06-24 astro-ph.HE 新提交 50%

Signatures of $^{56}$Ni Mixing and Neutron-rich Ejecta in Supernovae

超新星中$^{56}$Ni混合与富中子抛射物的特征

Nikhil Sarin

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过多壳层模型研究$^{56}$Ni混合和r-process物质对超新星光变曲线的影响,发现混合导致快速明亮上升并改变参数推断,而r-process特征取决于镍背景、径向位置和观测角度。

Comments Submitted. 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23677 2026-06-24 cond-mat.stat-mech nlin.AO nlin.PS physics.bio-ph 新提交 50%

Effective hyperuniformity in time-integrated stochastic Turing patterns

时间积分随机图灵模式中的有效超均匀性

Anirban Mukherjee, Hong-Yan Shih

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过时间积分随机图灵模式,发现非保守多物种随机系统中存在无需精细调谐的有效超均匀性,并解析验证了其大尺度组织涌现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20552 2026-06-24 cond-mat.soft cond-mat.stat-mech hep-th 新提交 50%

On the Renormalization Group Flow of Active Flocks

活性群体的重整化群流

Kevin T. Grosvenor, Subodh P. Patil

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过MSRDJ作用量研究Malthusian群体的统计场论重整化,利用广义Galileon对称性计算所有阶耦合重整化,发现固定点线和边缘顶点不稳定性,揭示超越Wilson-Fisher临界性的非平衡临界行为。

Comments A mistake in the previous version regarding symmetry structure of the theory corrected and elaborated upon, conclusions unchanged. References added and discussion amended. 19 pages, six appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12636 2026-06-24 hep-th astro-ph.CO gr-qc quant-ph 新提交 50%

Quantum Stochastic Inflation

量子随机暴胀

Robson Christie, Jaewoo Joo, Greg Kaplanek, Vincent Vennin, David Wands

专题命中 扩散模型 :diffusion(abstract)

AI总结 将随机暴胀置于开放量子系统框架中,通过粗粒化场与动量构成的正则对,推导出非幺正演化方程,得到GKLS动力学,并联系Langevin方程和Fokker-Planck方程。

Comments 51 pages, 3 figures. Source files and supporting code available at https://github.com/rchristie95/QuantumStochasticInflation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17917 2026-06-24 cond-mat.soft physics.flu-dyn 版本更新 50%

Lateral hydrodynamics in supported membranes: The Evans-Sackmann model and its extensions

支撑膜中的横向水动力学:Evans-Sackmann模型及其扩展

Yuto Hosaka, David Andelman, Shigeyuki Komura

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文综述了Evans-Sackmann水动力学模型在支撑流体膜中横向传输的理论发展和现代应用,讨论了模型的原始形式、扩展以及其在膜相分离动力学和相关扩散中的统一作用。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20904 2026-06-24 stat.ME math-ph math.DS math.MP nlin.CD physics.data-an stat.ML 50%

Data-Driven Weak-form Discovery of Stochastic Systems

弱形式恢复随机生成器与动力学不变量

Eshwar R A, Gajanan V. Honnavar

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过弱投影方法从稀疏回归中联合识别随机过程的漂移和扩散项,从而显式生成符可进行谱分析,并在基准系统中验证了其准确性。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23541 2026-06-24 cond-mat.mes-hall physics.app-ph 50%

A Symmetric Unified Transport and Charge Model for Metal-Oxide-Semiconductor Field-Effect Transistor from Diffusive to Ballistic Regimes

从扩散到弹道输运的金属-氧化物-半导体场效应晶体管对称统一输运与电荷模型

Chien-Ting Tung

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一种对称统一输运紧凑模型,通过高场散射长度统一漂移-扩散与弹道输运,并引入量子电容和沟道电荷模型,准确描述从扩散到弹道极限的电流和电容行为。

Comments Submitted to JAP

Journal ref J. Appl. Phys. 28 June 2026, 139 (24): 244501

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16603 2026-06-24 hep-ph astro-ph.CO 版本更新 50%

Baryon Asymmetry from Electroweak-Symmetric Domain Walls

重子不对称性来自电弱对称域墙

Jacopo Azzola, Oleksii Matsedonskyi, Andreas Weiler

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究电弱对称域墙在电弱破缺等离子体中通过产生手性不对称性来生成重子不对称性,分析壁厚、CP破坏源和扩散长度的层次关系及参数极限下的标度行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08504 2026-06-24 astro-ph.GA 50%

Ashes of FIRE: Modeling Dust Grain Size Evolution in the Local Group with FIRE

FIRE的灰烬:在本地群中建模尘埃颗粒大小演变

Caleb R. Choban, Samir Salim, Dušan Kereš, Julia Roman-Duval, Karin M. Sandstrom

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种新的离散尘埃颗粒大小演化模型,用于研究本地群中尘埃丰度、化学组成和颗粒大小的变化,发现尘埃颗粒大小分布呈现双峰特征,揭示了尘埃生长和破坏对尘埃丰度的影响。

Comments 29 pages, 17 figures, submitted to MNRAS. Comments welcomed

Journal ref Mon Not R Astron Soc (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15370 2026-06-24 cs.SI 版本更新 50%

The Significance of User Characteristics for Reposting Prediction on X: A Comparative Analysis Under Distribution Shift

用户特征对X平台转发预测的重要性:分布漂移下的比较分析

Ziming Xu, Shi Zhou, Vasileios Lampos, Ingemar J. Cox

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对分布漂移下X平台转发预测任务,比较帖子特征与用户特征的效果,发现用户特征(如社交关系、历史行为)在未见话题上F1超过0.70,而帖子特征仅约0.12,表明转发决策主要由稳定用户特征驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21916 2026-06-24 cs.RO 版本更新 50%

Prior Reinforce: Goal-Conditioned Dynamic Manipulation with Limited Trials

Prior Reinforce: 有限试验下的目标条件动态操控

Yihang Hu, Pingyue Sheng, Yuyang Liu, Shengjie Wang, Yang Gao

机构 * IIIS, Tsinghua University(清华大学智能学院) Shanghai Qi Zhi Institute(上海启智研究院) Spirit AI

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出Prior Reinforce框架,利用条件扩散模型从少量演示学习运动流形,并在低维条件空间通过反馈驱动优化适应新目标,实现少至十次试验内的动态操控。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14313 2026-06-24 cond-mat.quant-gas 50%

Exact results for heavy unitary Bose polarons

均匀博极子的精确结果

Nikolay Yegovtsev, Grigori E. Astrakharchik, Pietro Massignan, Victor Gurarie

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了均匀博极子的能量表达式,通过数值精确的扩散蒙特卡洛计算,证明了格罗斯-皮塔耶夫斯基理论对重均匀博极子的准确描述。

Comments Published version

Journal ref Phys. Rev. A 110, 023310 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 4 篇

2606.24021 2026-06-24 cs.CV cs.GR 新提交 62%

Token-to-Token Alignment of Text Embeddings for Semantic Blending

Token-to-Token对齐的文本嵌入用于语义融合

Saar Huberman, Ron Mokady, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) BRIA AI

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 提出Token-to-Token对齐框架,通过结构对齐和嵌入对齐建立提示词间语义对应,使线性插值实现平滑语义过渡,用于图像融合和连续编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24333 2026-06-24 cs.CV 新提交 57%

UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation

UniTranslator:一种用于端到端图像内机器翻译的统一多模态框架

Jiahao Lyu, Pei Fu, Zhenhang Li, Shaojie Zhang, Jiahui Yang, Yu Zhou, Can Ma, Zhenbo Luo, Jian Luan

机构 * MiLM Plus, Xiaomi Inc(小米公司MiLM Plus) Binghamton University(宾汉姆顿大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出UniTranslator统一框架,通过理解-生成对齐模块和空间掩码解码器解决翻译理解与文本编辑的冲突及空间错位问题,在多个基准上实现最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23979 2026-06-24 math.OC 新提交 50%

Traveling profiles and control cost for a PDE describing the evolution of invasive species

描述入侵物种演化的偏微分方程的传播轮廓与控制成本

Stefano Bianchini, Chiara Trifone

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究入侵物种控制模型中最优行波解的结构,通过相平面分析得到唯一最优轮廓,并证明控制成本函数关于速度仅C1光滑、关于非线性项Lipschitz连续,且一般非凸非次加性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23800 2026-06-24 quant-ph 新提交 50%

Unitary Designs from Doped Matchgate Circuits

掺杂匹配门电路中的酉设计

Fabian Ballar Trigueros, Zheng-Hang Sun, Xhek Turkeshi, Piotr Sierant, Poetri Sonya Tarabunga

专题命中 可控生成 :diffusion(abstract)

AI总结 研究通过掺杂非高斯门突破匹配门电路的可积性限制,利用匹配门交换子框架分析酉2-设计形成,得到非高斯门数量的严格界限,并展示在局部电路中的扩散限制。

Comments 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2106.06998 2026-06-24 cs.LG cs.NA math.NA 版本更新 50%

XConv: Low-memory stochastic backpropagation for convolutional layers

XConv: 卷积层的低内存随机反向传播

Anirudh Thatipelli, Jeffrey Sam, Mathias Louboutin, Ali Siahkoohi, Rongrong Wang, Felix J. Herrmann

机构 * University of Central Florida(中央佛罗里达大学) Rice University(里士满大学) DevitoCodes Ltd(DevitoCodes有限公司) Michigan State University(密歇根州立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 图像修复 :inpainting(abstract)

AI总结 提出XConv方法,通过存储激活的压缩投影并利用多通道随机迹估计近似梯度,在不增加计算、不约束架构、不大量修改代码的情况下,大幅降低卷积层反向传播的内存需求。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 3 篇

2606.24119 2026-06-24 cs.LG cs.CL 新提交 78%

When Top-1 Fails: Calibrating LoRA Monitors for Masked Diffusion LMs

当Top-1失败时:为掩蔽扩散LM校准LoRA监控器

Lucky Verma, Pratik Yadav

机构 * Independent Researcher(独立研究员) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 个性化与一致性 :diffusion(title,abstract)

AI总结 针对离散扩散语言模型微调中top-1 argmax作为崩溃预警的零精度问题,提出使用最大LoRA梯度范数作为参数侧信号,在LLaDA族上实现0.68精度和0.79 F1分数,并建议每族DLM校准阈值。

Comments 14 pages, 3 figures. Code and result artifacts: https://github.com/lucky-verma/top1-fails-dlm-lora-monitors

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09303 2026-06-24 cs.LG cs.NA math.NA 版本更新 67%

Stabilizing Physics-Informed Consistency Models via Structure-Preserving Training

通过保结构训练稳定物理信息一致性模型

Che-Chia Chang, Chen-Yang Dai, Te-Sheng Lin, Ming-Chih Lai, Chieh-Hsin Lai

机构 * Institute of Artificial Intelligence Innovation(人工智能创新研究所) National Yang Ming Chiao Tung University(国立阳明交通大学) Department of Applied Mathematics(应用数学系) National Center for Theoretical Sciences(理论科学研究中心) National Taiwan University(国立台湾大学)

专题命中 个性化与一致性 :diffusion(abstract);inpainting(abstract)

AI总结 提出物理信息一致性建模框架,通过保结构两阶段训练策略和两步残差目标,解决物理约束下一致性训练的不稳定性,实现快速、高保真的PDE求解。

Comments Accepted to KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23950 2026-06-24 cs.CV 新提交 57%

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

DivRL: 解耦自相似性奖励用于多样化主题驱动生成

Qian Wang, Zhenyu Li, Abdelrahman Eldesokey, Peter Wonka

机构 * KAUST(阿卜杜拉国王科技大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出DivRL框架,通过解耦视觉特征中的负自相似性度量(nSSM)和视觉语义匹配(VSM),采用“探索-抑制”策略联合优化身份一致性与结构多样性,解决主题驱动生成中的身份-多样性悖论。

Comments Accepted to ECCV 2026. Project page: https://qianwangx.github.io/DivRL/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 2 篇

2606.02800 2026-06-24 cs.CV cs.AI cs.LG cs.MM cs.RO 版本更新 62%

Cosmos 3: Omnimodal World Models for Physical AI

Cosmos 3:面向物理AI的全模态世界模型

NVIDIA, :, Aditi, Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline Aubame, Alisson Azzolini, Junjie Bai, Maciej Bala, Yogesh Balaji, Josh Bapst, Aarti Basant, Mukesh Beladiya, Mohammad Qazim Bhat, Zaid Pervaiz Bhat, Dan Blick, Vanni Brighella, Han Cai, Tiffany Cai, Eric Cameracci, Jiaxin Cao, Yulong Cao, Mark Carlson, Carlos Casanova, Ting-Yun Chang, Yan Chang, Yu-Wei Chao, Prithvijit Chattopadhyay, Roshan Chaudhari, Chieh-Yun Chen, Junyu Chen, Ke Chen, Qizhi Chen, Wenkai Chen, Xiaotong Chen, Yu Chen, An-Chieh Cheng, Click Cheng, Xiu Chia, Jeana Choi, Chaeyeon Chung, Wenyan Cong, Yin Cui, Magdalena Dadela, Nalin Dadhich, Wenliang Dai, Joyjit Daw, Alperen Degirmenci, Rodrigo Vieira Del Monte, Robert Denomme, Sameer Dharur, Marco Di Lucca, Ke Ding, Wenhao Ding, Yifan Ding, Yuzhu Dong, Nicole Drumheller, Yilun Du, Aigul Dzhumamuratova, Aleksandr Efitorov, Hamid Eghbalzadeh, Naomi Eigbe, Imad El Hanafi, Hassan Eslami, Benedikt Falk, Jiaojiao Fan, Jim Fan, Amol Fasale, Sergiy Fefilatyev, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Vikram Fugro, Prashant Gaikwad, TJ Galda, Katelyn Gao, Yihuai Gao, Wenhang Ge, Sreyan Ghosh, Arushi Goel, Vivek Goel, Akash Gokul, Rama Govindaraju, Jinwei Gu, Miguel Guerrero, Elfie Guo, Aryaman Gupta, Siddharth Gururani, Hugo Hadfield, Song Han, Ankur Handa, Zekun Hao, Mohammad Harrim, Ali Hassani, Nathan Hayes-Roth, Yufan He, Chris Helvig, Cyrus Hogg, Madison Huang, Michael Huang, Sophia Huang, Yufan Huang, Jacob Huffman, DeLesley Hutchins, Suneel Indupuru, Boris Ivanovic, Arihant Jain, Joel Jang, Ryan Ji, Yanan Jian, Dongfu Jiang, Jingyi Jin, Atharva Joshi, Nikhilesh Joshi, Pranjali Joshi, Andy Ju, Jaehun Jung, Weiwei Kang, Scott Kassekert, Jan Kautz, Ashna Khetan, Julia Kiczka, Slawek Kierat, Gwanghyun Kim, Kuno Kim, Sunny Kim, Kezhi Kong, Xin Kong, Zhifeng Kong, Tomasz Kornuta, Egor Krivov, Hui Kuang, Saurav Kumar, Chia-Wen Kuo, George Kurian, Wojciech Kutak, JF Lafleche, Himangshu Lahkar, Omar Laymoun, Jayjun Lee, Sanggil Lee, Gabriele Leone, Boyi Li, Freya Li, Jiajun Li, Jinfeng Li, Ling Li, Pengcheng Li, Shangru Li, Tingle Li, Xiaolong Li, Xuan Li, Zhaoshuo Li, Zhiqi Li, Hao Liang, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Ming-Yu Liu, Sifei Liu, Zihan Liu, Hai Loc Lu, Xiangyu Lu, Alice Luo, Ruipu Luo, Wenjie Luo, Jiangran Lyu, Martin Ding Ma, Nic Ma, Qianli Ma, Dawid Majchrowski, Louis Marcoux, Miguel Martin, Qing Miao, Ashkan Mirzaei, Shreyas Misra, Kaichun Mo, Durra Mohsin, Hyejin Moon, Pawel Morkisz, Saeid Motiian, Kirill Motkov, Seungjun Nah, Yashraj Narang, Deepak Narayanan, Thabang Ngazimbi, Julian Ouyang, Shubham Pachori, David Page, Yatian Pang, Sehwi Park, Mahesh Patekar, Mostofa Patwary, Marco Pavone, Trung Pham, Wei Ping, Soha Pouya, Shrimai Prabhumoye, Varun Praveen, Delin Qu, Hesam Rabeti, Morteza Ramezanali, Marilyn Reeb, Xuanchi Ren, Kristen Rumley, Wojciech Rymer, Jun Saito, Yeongho Seol, John Shao, Piyush Shekdar, Tianwei Shen, Humphrey Shi, Min Shi, Stella Shi, Kevin Shih, Mohammad Shoeybi, Mateusz Sieniawski, Shuran Song, Alexander Sotelo, Amir Sotoodeh, Sunil Srinivasa, Vignesh Srinivasakumar, Bartosz Stefaniak, Rahul Heinrich Steiger, Shangkun Sun, Jiaxiang Tang, Shitao Tang, Yangyang Tang, Yue Tang, Tolou Tavakkoli, Kayley Ting, Krzysztof Tomala, Wei-Cheng Tseng, Jibin Varghese, Sergei Vasilev, Thomas Volk, Raju Wagwani, Roger Waleffe, Andrew Z. Wang, Boxiang Wang, Haoxiang Wang, Qiao Wang, Shihao Wang, Shijie Wang, Ting-Chun Wang, Yan Wang, Yu Wang, Rohit Watve, David Wehr, Fangyin Wei, Xinshuo Weng, Jay Zhangjie Wu, Kedi Wu, Hongchi Xia, Summer Xiao, Tianjun Xiao, Kevin Xie, Daguang Xu, Jiashu Xu, Mengyao Xu, Ruqing Xu, Xingqian Xu, Yao Xu, Dinghao Yang, Dong Yang, Hans Yang, Xiaodong Yang, Xuning Yang, Yichu Yang, Yurong You, Zhiding Yu, Hao Yuan, Simon Yuen, Xiaohui Zeng, Pengcuo Zeren, Cindy Zha, Haotian Zhang, Jenny Zhang, Jing Zhang, Liangkai Zhang, Paris Zhang, Shun Zhang, Xuanmeng Zhang, Zhizheng Zhang, Ann Zhao, Yilin Zhao, Yuliya Zhautouskaya, Charles Zhou, Fengzhe Zhou, Shilin Zhu, Yuke Zhu, Dima Zhylko, Artur Zolkowski

机构 * NVIDIA

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 提出基于统一混合Transformer架构的全模态世界模型Cosmos 3,联合处理语言、图像、视频、音频和动作序列,在理解和生成任务上达到新最优,为具身智能体提供可扩展的通用骨干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23835 2026-06-24 cs.CV eess.IV 新提交 57%

ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation

ABACUS: 自适应统一基础模型,桥接图像计数理解与生成

Anindya Mondal, Sauradip Nag, Anjan Dutta

机构 * University of Surrey(萨里大学) Simon Fraser University(西蒙菲莎大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 提出ABACUS统一视觉语言模型,通过密度感知自适应缩放、边界感知计数策略和循环一致性GRPO,无需特定训练即可处理多种计数任务并生成计数忠实图像,在七个基准上达到最优。

Comments Under review, webpage: https://mondalanindya.github.io/ABACUS/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 3 篇

2606.18478 2026-06-24 cs.CV 新提交 57%

Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation

数据强制蒸馏:恢复少步视频生成中的多样性和保真度

Siyi Chen, Shaowei Liu, Yixuan Jia, Zian Wang, Huan Ling, Qing Qu, Jun Gao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对分布匹配蒸馏(DMD)在少步视频生成中出现的模式坍塌和过饱和问题,提出数据强制蒸馏(DFD)框架,通过教师评分差异引导学生接近真实数据分布,仅需一行代码修改即可恢复多样性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11121 2026-06-24 cs.CV eess.IV 版本更新 57%

Generative Manifold Distillation: Aligning Restoration Trajectories with Natural Image Prior

生成式流形蒸馏:将恢复轨迹与自然图像先验对齐

Yuyang Hu, Mojtaba Sahraee-Ardakan, Arpit Bansal, Kangfu Mei, Chenyang Qi, Peyman Milanfar, Mauricio Delbracio

机构 * Google(谷歌) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 提出生成式流形蒸馏(GMD),通过几何流形对齐实现无配对域自适应,利用冻结文本到图像基础模型的流匹配动力学将离流形恢复投影到自然图像流形,并引入质量门控滤波器和源锚定轨迹正则化,无需架构修改或推理延迟即可提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24745 2026-06-24 cs.SD cs.AI eess.AS 新提交 50%

Beyond U-Net: A Latent-Representation-Aligned Skip-Free Backbone for Flow-Matching Speech Enhancement

超越U-Net:用于流匹配语音增强的无跳跃连接潜在表示对齐骨干网络

Wangyi Pu, Michele Scarpiniti

机构 * Department of Information Engineering, Electronics and Telecommunications(信息工程、电子与电信系)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出一种无跳跃连接的编码器-解码器骨干网络,通过潜在表示对齐(LRA)引导流匹配语音增强,避免U-Net跳跃连接传递噪声相关特征,仅需五次函数评估即可提升PESQ和感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏