arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-25 至 2026-06-25 共收录 80 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 68 篇

2606.14158 2026-06-25 math.AP 新提交 50%

Nonlinear stability and optimal decay rate of the planar entropy wave for Landau equation

Landau方程平面熵波的非线性稳定性与最优衰减率

Renjun Duan, Feimin Huang, Rui Li, Lingda Xu

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对具有库仑相互作用的Landau方程,在无限通道域中研究熵波的非线性渐近稳定性与最优衰减率,通过时间-速度插值技术和耦合扩散波克服谱隙缺失,并引入变换恢复高维结构条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04066 2026-06-25 q-bio.NC cs.LG 版本更新 50%

SC-TauPath: A Structural Connectivity Attribution Framework for Mapping Tau Propagation Pathways in Alzheimer's Disease

SC-TauPath:一种用于映射阿尔茨海默病中tau蛋白传播路径的结构连接归因框架

Jing Zhang, Norman Scheel, Minheng Chen, Tong Chen, Yanjun Lyu, David C. Zhu, Rong Zhang, Dajiang Zhu

机构 * University of Texas at Arlington(德克萨斯理工大学) Michigan State University(密歇根州立大学) University of Texas Southwestern Medical Center(德克萨斯西南医学中心)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出SC-TauPath框架,结合网络扩散模型增强的多层感知机和梯度×输入归因方法,从体内神经影像数据中映射tau蛋白传播路径,并验证了与Braak分期解剖学的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23434 2026-06-25 cs.LG 版本更新 50%

Onsager-Machlup Posterior Transport for Deep Gaussian Processes

深度高斯过程的Onsager-Machlup后验传输

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS(日本理化学研究院iTHEMS研究中心) RIKEN AIP(日本理化学研究院AIP研究中心) South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出OM-Path方法,通过概率流ODE和Onsager-Machlup路径正则化将深度高斯过程推断转化为后验传输,在大型UCI数据集上优于现有变分推断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21574 2026-06-25 quant-ph cond-mat.stat-mech cond-mat.str-el 50%

Generalized stochastic spin-wave theory for open quantum spin systems

开放量子自旋系统的广义随机自旋波理论

Zejian Li, Anna Delmonte, Rosario Fazio

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种半经典框架,用于解决驱动耗散自旋系统中的开放量子动力学,通过广义自旋波近似描述量子轨迹,适用于传统自旋波理论无法覆盖的领域,展示了在二维晶格上变量范围驱动耗散伊辛模型中的应用。

Comments 16 pages, 10 figures

Journal ref Phys. Rev. B 113, 214324 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03548 2026-06-25 math.PR 版本更新 50%

Degree-preserving conservative processes and a unified approach for their hydrodynamics

保度保守过程及其流体动力学的统一方法

Chiara Franceschini, Patrícia Gonçalves, Kohei Hayashi, Makiko Sasada

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究一类满足“保度性质”的一维守恒型相互作用系统,建立了不变测度与流体动力学极限的统一分析框架,证明乘积不变测度的边缘分布属于六种特定分布族,并揭示宏观行为由经典热方程控制。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21996 2026-06-25 cs.CE 版本更新 50%

Intrusive and Non-Intrusive Model Order Reduction for Airborne Contaminant Transport: Comparative Analysis and Uncertainty Quantification

空气污染物传输的侵入式与非侵入式模型降阶:比较分析与不确定性量化

Lisa Kühn, Jacopo Bonari, Max von Danwitz, Alexander Popp

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对化工泄漏后污染物扩散的高保真模拟计算成本高的问题,本文比较了侵入式与非侵入式模型降阶方法,并构建了非侵入式降阶模型,实现快速预测及不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01759 2026-06-25 cs.LG cs.AI 版本更新 50%

Weight Space Representation Learning via Neural Field Adaptation

通过神经场自适应进行权重空间表示学习

Zhuoqian Yang, Mathieu Salzmann, Sabine Süsstrunk

机构 * EPFL(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出利用预训练基础模型和低秩自适应约束优化空间,诱导权重空间结构,实现高质量、有区分性和语义结构的表示,并在潜在扩散模型中提升生成质量。

Comments 9 pages body, 9 pages appendix

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05835 2026-06-25 cond-mat.mes-hall cond-mat.mtrl-sci quant-ph 版本更新 50%

Boltzmann transport theory of magnon-exciton drag

磁振子-激子拖曳的玻尔兹曼输运理论

Zakhar A. Iakovlev, Akashdeep Kamra, Mikhail M. Glazov

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对双层范德华反铁磁半导体CrSBr,发展磁振子-激子拖曳效应的微观理论,通过玻尔兹曼方程揭示磁振子-激子散射主导输运,产生大且各向同性的激子传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17247 2026-06-25 cs.LG cs.AI q-bio.BM 版本更新 50%

OmegAMP: Targeted AMP Discovery via Biologically Informed Generation

OmegAMP:通过生物信息引导的靶向抗菌肽发现

Diogo Soares, Leon Hetzel, Paulina Szymczak, Marcelo Der Torossian Torres, Johanna Sommer, Cesar de la Fuente-Nunez, Fabian Theis, Stephan Günnemann, Ewa Szczurek

机构 * Institute of AI for Health, Helmholtz Munich(海德堡-慕尼黑人工智能与健康研究所) School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院) Institute of Computational Biology, Helmholtz Munich(海德堡-慕尼黑计算生物学研究所) Munich Data Science Institute, Technical University of Munich(慕尼黑技术大学慕尼黑数据科学研究所) Faculty of Medicine, Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学医学院) Machine Biology Group, Departments of Psychiatry and Microbiology, Institute for Biomedical Informatics, Institute for Translational Medicine and Therapeutics, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学马歇尔医学中心机器生物学组) Departments of Bioengineering and Chemical and Biomolecular Engineering, University of Pennsylvania(宾夕法尼亚大学生物工程与化学与生物分子工程系) Department of Chemistry, School of Arts and Sciences, University of Pennsylvania(宾夕法尼亚大学化学系) Penn Institute for Computational Science, University of Pennsylvania(宾夕法尼亚大学宾夕法尼亚计算科学研究所) TUM School of Life Sciences, Technical University of Munich(慕尼黑技术大学生命科学学院) Faculty of Mathematics, Informatics and Mechanics, University of Warsaw(华沙大学数学、信息学与力学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出OmegAMP框架,利用扩散模型和生物信息编码空间实现可控抗菌肽生成,结合数据增强分类器降低假阳性,在湿实验中达到96%活性率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07149 2026-06-25 math.AP cs.NA math-ph math.MP math.NA 版本更新 50%

Derivation of the fourth-order DLSS equation with nonlinear mobility via chemical reactions

通过化学反应推导具有非线性迁移率的四阶DLSS方程

Alexander Mielke, André Schlichting, Artur Stephan

专题命中 扩散模型 :diffusion(abstract)

AI总结 将一维四阶DLSS方程解释为化学反应网络,通过速率方程在离散圆上的极限推导出经典DLSS方程或具有幂次型非线性迁移率的变体,并利用EDP收敛识别极限梯度结构。

Comments 36 pages, 2 figure. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 3 篇

2601.14945 2026-06-25 cs.RO cs.AI 版本更新 78%

TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control

TIDAL: 时间交错扩散与动作循环用于高频VLA控制

Yuteng Sun, Haoran Wang, Ruofei Bai, Zhengguo Li, Jun Li, Meng Yee Michael Chuah, Wei Yun Yau

机构 * Institute for Infocomm Research (I$^2$R), A*STAR, Singapore(信息通信研究所(I²R),A*STAR,新加坡) Tsinghua University, Beijing, China(清华大学,北京,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出TIDAL分层框架,通过双频架构解耦语义推理与高频执行,实现边缘硬件上约9Hz控制更新,在动态拦截任务中性能提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25376 2026-06-25 cs.CV 新提交 57%

Transferable Attack against Face Swapping in an Extended Space

扩展空间中针对人脸交换的可迁移攻击

Mingzhi Lyu, Yi Huang, Jun Xie, Zihao Zhao, Hong Xu, Adams Wai-Kin Kong

机构 * IEEE(电气电子工程师学会) IEEE International Conference on Multimedia and Expo (ICME)(IEEE国际多媒体与展览会议)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出基于重光照函数的加性身份攻击(AIR),通过联合重光照和加性扰动扩展攻击空间,生成强且视觉自然的对抗样本,无需代理模型即可高效迁移攻击多种主体无关的人脸交换模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25985 2026-06-25 cs.RO 新提交 50%

Action ControlNet: A Lightweight Delay-Aware Adapter for Smooth Asynchronous Control in Vision-Language-Action Models

Action ControlNet: 一种轻量级延迟感知适配器,用于视觉-语言-动作模型中的平滑异步控制

Tiecheng Guo, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出Action ControlNet,一种轻量级延迟感知适配器,通过将已执行的动作后缀作为残差条件,在不重新训练骨干网络的情况下,减少异步执行中的动作不连续和抖动,提升机器人操控的鲁棒性和平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2511.22411 2026-06-25 cs.CV 版本更新 57%

StyleFusion360: View-Consistent Head Stylization via Adaptive Style Modulation

StyleFusion360: 通过自适应风格调制实现视图一致的人头风格化

Furkan Guzelant, Arda Goktogan, Tarık Kaya, Aysegul Dundar

机构 * Bilkent University(比尔肯特大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出StyleFusion360,一种基于扩散的框架,通过自适应风格调制实现单风格参考图像的多视图一致、身份保持的3D人头风格化,无需逐风格训练,并支持强度控制和局部编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2509.26376 2026-06-25 cs.CV 版本更新 79%

ScalingAR: Scaling Confidence for Autoregressive Image Generation

ScalingAR: 自回归图像生成的置信度缩放

Harold Haodong Chen, Xianfeng Wu, Wen-Jie Shu, Rongjin Guo, Disen Lan, Harry Yang, Ying-Cong Chen

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 提出ScalingAR框架,通过令牌熵作为置信度信号,在轮廓级和策略级进行自适应轨迹剪枝和动态引导调度,无需早期解码或外部奖励,显著提升自回归图像生成性能。

Comments ICML 2026; Code: https://github.com/EnVision-Research/ScalingAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17037 2026-06-25 cs.CV cs.AI 版本更新 70%

AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

AMVICC: 一种用于VLM和IGM跨模态故障模式分析的新型基准

Aahana Basappa, Pranay Goel, Anusri Karra, Anish Karra, Asa Gilmore, Kevin Zhu

机构 * Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA) Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA) West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA) Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出AMVICC基准,通过图像到文本和文本到图像任务系统比较多模态大模型和图像生成模型的视觉推理失败模式,发现故障模式在模型和模态间共享,但存在特定于模型和模态的失败。

Comments 14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25445 2026-06-25 cs.CV cs.AI 新提交 57%

C3-Bench: A Context-Aware Change Captioning Benchmark

C3-Bench:一种上下文感知的变化描述基准

Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 提出C3-Bench基准,包含51种真实变化场景的4996对图像,并首次引入LLM-as-Judge评估框架,揭示现有模型在非训练分布场景下的系统性盲点。

Comments ECCV 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 3 篇

2606.25473 2026-06-25 cs.CV cs.LG 新提交 79%

Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models

Causal-rCM:一种用于流式视频生成和交互式世界模型中自回归扩散蒸馏的统一教师强制与自我强制开放配方

Kaiwen Zheng, Guande He, Min Zhao, Jintao Zhang, Huayu Chen, Jianfei Chen, Chen-Hsuan Lin, Ming-Yu Liu, Jun Zhu, Qianli Ma

机构 * Tsinghua University(清华大学) UT Austin(德克萨斯大学奥斯汀分校) NVIDIA(英伟达)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Causal-rCM框架,将扩散蒸馏扩展到自回归视频扩散,通过教师强制(前向散度)与自我强制(反向散度)互补,实现流式视频生成和交互式世界模型,在帧级和块级设置中达到最先进性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25040 2026-06-25 cs.CV 新提交 57%

Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation

Chorus II: 跨请求稀疏性重用用于高效图像到视频生成

Hao Liu, Chenghuan Huang, Hao Liu, Xing Cai, Chen Li, Ziyang Ma, Jing Lyu, Nong Xiao, Jiangsu Du

机构 * Sun Yat-sen University(中山大学) WeChat HPC, Tencent Inc.(腾讯微信高性能计算) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对图像到视频生成中计算昂贵的问题,提出跨请求稀疏性重用框架,通过共享稀疏掩码重用避免在线预测,实现2.16倍加速且保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23743 2026-06-25 cs.CV cs.AI cs.LG 新提交 57%

Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation

Sol视频推理引擎:面向高效视频生成的智能原生全栈加速框架

Yitong Li, Junsong Chen, Haopeng Li, Haozhe Liu, Jincheng Yu, Ligeng Zhu, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA Research, Efficient AI Team & Singapore Lab(英伟达研究院高效AI团队及新加坡实验室) NVIDIA SANA Team(英伟达SANA团队) Codex GPT-Image2

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出Sol视频推理引擎,通过智能体驱动的缓存、稀疏注意力、令牌剪枝、量化和内核融合五种技术组合,针对具体模型、硬件和配置自动优化,实现视频扩散模型2倍以上加速且保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏