arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-03 至 2026-08-03 共收录 72 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 53 篇

2607.26924 2026-08-03 cs.LG cs.RO 版本更新 67%

Temporally Centered SIGReg Improves Multi-Task LeWorldModel Learning: From Analysis to Method

时间中心SIGReg改进多任务LeWorldModel学习:从分析到方法

Chang Liu, Fei Suo, Yanzhou Jin, Yusuke Iwasawa, Yutaka Matsuo, Yaonan Zhu

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工程学院)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 该研究针对SIGReg在多任务LeWM中导致表示混叠的问题,提出将其应用于时间中心残差的改进方法,在LIBERO基准上显著提升了多任务世界模型的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19537 2026-08-03 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 版本更新 62%

Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook

生成式AI时代的深度伪造媒体生成与检测:综述与展望

Florinel-Alin Croitoru, Andrei-Iulian Hiji, Vlad Hondru, Nicolae Catalin Ristea, Paul Irofti, Marius Popescu, Cristian Rusu, Radu Tudor Ionescu, Fahad Shahbaz Khan, Mubarak Shah

机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science, University of Central Florida(中佛罗里达大学计算机科学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 综述了深度伪造生成与检测技术,涵盖图像、视频、音频和多模态内容,构建了分类体系,并提出了新的多模态基准测试,发现现有检测器对未见生成器的深度伪造泛化能力不足。

Comments Accepted in ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29545 2026-08-03 cs.CV 新提交 57%

MoRoute: Dynamic Routing for In-Context Multimodal Video Generation

MoRoute:面向上下文多模态视频生成的动态路由

Chong Gao, Jie Ma, Zhan Peng, Chongxiao Wang, Haoxue Wu, Jun Liang, Guanbin Li, Jing Li

机构 * Sun Yat-sen University(中山大学) HUJING Digital Media & Entertainment Group(沪景数字媒体娱乐集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 MoRoute是采用动态层路由连接VLM与视频DiT的多模态视频生成框架,在三个基准数据集上均优于现有最优方法,提升了视频生成与编辑的性能。

Comments Project page: https://orange-3dv-team.github.io/MoRoute/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28760 2026-08-03 cs.CV cs.AI cs.LG stat.ML 新提交 57%

WaiT for the Signal: Simple Frequency-Aware Flow-Matching

面向信号的WaiT:简单的频率感知流匹配

Krunoslav Lehman Pavasovic, Théophane Vallaeys, Stéphane Mallat, Giulio Biroli, Luke Zettlemoyer, Brian Karrer, Jakob Verbeek

机构 * FAIR, Meta(FAIR(Meta旗下研究机构)) École Normale Supérieure(巴黎高等师范学院) Sorbonne University(索邦大学)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 该研究提出频率感知流匹配模型WaiT,通过无损小波分解生成过程,引入三轴评估协议,在ImageNet等数据集上实现SOTA生成性能,采样计算量降低50%,还可无缝扩展至视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28737 2026-08-03 cs.LG cs.CV cs.RO 新提交 57%

Mirror Learning

镜像学习

Yunpeng Liu, Matthew Niedoba, Oluwanifemi A. Adekanye, Jason Yoo, Yingchen He, Berend Zwartsenberg, Frank Wood

机构 * University of British Columbia(不列颠哥伦比亚大学) Inverted AI Amii

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出镜像学习框架,通过视频扩散模型的视角变换与逆动力学模型合成镜像数据,用其增强行为克隆训练可提升策略性能,为数据收集提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21529 2026-08-03 cs.CV cs.AI 版本更新 57%

ElasticTTT: Prior-Preserving Test-Time Tuning for Video Editing

ElasticTTT:用于视频编辑的保留先验的测试时调优

Yueyi Liu, Chi Zhang, Sen Cui, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对预训练扩散模型的测试时调优中存在的问题,提出ElasticTTT框架,通过目标分布正则化、对比条件采样和异步噪声调度等方法,成功保留基础模型生成先验,在一次性视频编辑中达领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25333 2026-08-03 cs.CV 版本更新 57%

Teaching Video Generators to Remember: Eliciting Dynamic Memory for Out-of-Sight State Evolution

教会视频生成器记忆:为不可见状态演化引出动态记忆

Tianshuo Xu, Yichen Xie, Depu Meng, Chensheng Peng, Quentin Herau, Bo Jiang, Yihan Hu, Wei Zhan

机构 * Applied Intuition(应用直觉) University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对视频生成模型在观测中断时状态冻结的问题,提出ReMind框架,通过面向记忆的数据构建、事件感知训练和缓存适配,利用KV缓存机制实现动态记忆,在STEVO-Bench和恢复任务上取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08328 2026-08-03 cs.LG cs.CV 版本更新 57%

P-Flow: Proxy-gradient Flows for Linear Inverse Problems

P-Flow:用于线性逆问题的代理梯度流

Zehua Jiang, Fenghao Zhu, Xinquan Wang, Chongwen Huang, Zhaoyang Zhang

机构 * Zhejiang University(浙江大学) University of Notre Dame(诺丁汉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 P-Flow通过代理梯度更新源点,稳定逆问题重建过程,避免长链微分的数值不稳定性与计算开销,结合高维空间测度集中现象,提供理论分析和实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04677 2026-08-03 cs.CV 57%

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length

实时动态化身:具有无限长度的音频驱动化身生成流式传输

Yubo Huang, Hailong Guo, Fangtai Wu, Weiqiang Wang, Shifeng Zhang, Shijie Huang, Qijun Gan, Lin Liu, Sirui Zhao, Enhong Chen, Jiaming Liu, Steven Hoi

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学) Monash University(墨尔本大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Live Avatar框架,通过算法和系统协同设计,解决14B扩散模型在实时流式传输中无限长度生成的挑战,实现稳定生成超过10000秒,并引入GenBench基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16870 2026-08-03 cs.CV cs.AI 版本更新 57%

Demystifying Video Reasoning

揭秘视频推理

Ruisi Wang, Zhongang Cai, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang, Ran Ji, Chenyang Gu, Bo Li, Ziqi Huang, Hokin Deng, Dahua Lin, Ziwei Liu, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文通过实验揭示视频扩散模型中的推理主要发生在去噪步骤中,提出链式步骤(CoS)机制,并发现工作记忆、自我修正和感知先行等涌现行为,最后提出一种无需训练的集成策略来提升推理能力。

Comments Homepage: https://www.wruisi.com/demystifying_video_reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08390 2026-08-03 cs.RO cs.CV 版本更新 57%

DuetHOI: Language-Guided Bimanual Hand--Object Motion Generation with Articulation Planning and Contact Refinement

StructBiHOI: 结构化关节建模用于长时程双臂手-物体交互生成

Zhi Wang, Yuyan Liu, Liu liu, Ruonan Liu, Ruixuan Liu

机构 * Hefei University of Technology(合肥工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 StructBiHOI通过结构化关节建模框架实现长时程双臂手-物体交互生成,提升稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29220 2026-08-03 q-fin.CP 新提交 50%

Decoupled Probabilistic Forecasting and Arbitrage-Aware Refinement of Implied Volatility Surfaces

隐含波动率曲面的解耦概率预测与套利感知优化

Lifeng Hao, Shaolin Ji

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对隐含波动率曲面预测难题,提出解耦生成优化框架,用条件扩散模型捕捉随机动态,通过曲面感知注意力模块优化无套利约束,在沪深300股指期权的日度和分钟级预测中提升了精度并降低了残差违规

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29043 2026-08-03 q-bio.GN cs.AI 新提交 50%

Improving scDiffusion with Sparsity-Biased Classifier-Free Guidance

用稀疏性偏向的无分类器引导改进scDiffusion

Yu Song, Hao Sun, Ikuko Nishikawa, Yen-Wei Chen

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究针对scRNA-seq生成中现有CFG引导效果受限的问题,提出SB-CFG策略,通过引入刻意信息不足的稀疏参考优化引导,在五个公开数据集上实现了标记基因表达等指标的一致提升。

Comments Accepted to IEEE EMBC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28864 2026-08-03 stat.ML cs.LG 新提交 50%

Conditioning Tree-Based Diffusions and Flows for Probabilistic Tabular Regression

基于条件树的扩散模型与流模型的概率表格回归

Silas Koemen

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出DiffGBM模型,通过显式调整基于树的扩散与流模型的设计维度,在表格回归任务上实现优于基线的预测性能,同时提升采样效率与校准度。

Comments 25 pages, 2 figures. Code: github.com/silaskoemen/diffgbm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29482 2026-08-03 cs.RO 新提交 50%

Temporal Policy: History-Initialized Action Generation for Robotic Learning from Demonstration

时间策略:用于机器人演示学习的历史初始化动作生成

Dylan Miller, Martin Jagersand

机构 * University of Alberta(阿尔伯塔大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出Temporal Policy生成框架,将动作生成为时间耦合传输问题,在降低近一个数量级传输成本的同时匹配基线成功率,实现高频闭环控制。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29665 2026-08-03 cs.LG cs.NA math.NA 新提交 50%

Freeze, Then Select: Structured Field Adapters and Stability-Validated Weak Selection for PDE Discovery from Sparse Observations

冻结后选择:用于从稀疏观测中发现PDE的结构化场适配器与稳定性验证弱选择

Juncheng Zhong, Chenghuang Shen, Jianfeng Liu, Zhengdong Xiao, Longjiu Luo, Qianrong Wang, Wenjun Xu, Wenlian Lu

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对稀疏观测的PDE发现问题,提出冻结后选择方法,结合结构化场适配器与SVWS,在6种稀疏MDBench场景中实现最高精确支持集恢复率,尤其在Kuramoto-Sivashinsky动力学上优势显著。

Comments 18 pages, 5 figures, and 17 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29036 2026-08-03 cs.LG math.DS 新提交 50%

Dynamics-aware identification of governing equations from sparse and noisy data

基于稀疏含噪数据的动力学感知控制方程识别

Pongpisit Thanasutives, Yoshinobu Kawahara

机构 * The University of Osaka(大阪大学) RIKEN(理化学研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对稀疏含噪数据下控制方程识别中导数估计不可靠的问题,提出基于Koopman的上采样预处理技术,经实验验证可提升ODE与PDE的识别性能,优于传统插值方法。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29605 2026-08-03 math.AP 新提交 50%

Dimension Reduction and Asymptotic Approximation of Reactive Transport in a Bulk Domain with a Branched Thin Fracture

含分支细裂缝的体域中反应输运的降维与渐近近似

Taras Mel'nyk, Christian Rohde

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对含分支细裂缝的二维体域反应输运,通过降维将裂缝转化为一维图,推导极限问题结构,构造校正子并建立多尺度近似与误差估计,揭示裂缝几何对输运的影响。

Comments 36 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29578 2026-08-03 math.NA cs.NA math.PR 新提交 50%

Error of randomized Milstein scheme for scalar SDEs with noisy information about coefficients and Wiener process

Paweł M. Morkisz, Paweł Przybyłowicz, Martyna Wiącek

专题命中 扩散模型 :diffusion(abstract)

Comments 33 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29217 2026-08-03 math.NA cs.NA 新提交 50%

Certified Seventh-Order Two-Derivative Hermite Deferred Correction via Node-Sweep Co-Design

基于节点-扫描协同设计的可证七阶双导数Hermite延迟校正方法

Zhixin Huo

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对扩散主导半线性问题,通过节点-扫描协同设计提出可证七阶双导数Hermite延迟校正方法,设计的Accuracy-P40方法可降低计算量并满足刚性条件,经测试验证了阶数与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29001 2026-08-03 math.AP 新提交 50%

Invasion Fronts in Shifting Habitats and Competition Systems: A Hamilton-Jacobi Approach and Nonlocal Effects

生境变化与竞争系统中的入侵前沿:哈密尔顿-雅可比方法与非局部效应

King-Yeung Lam, Chang-Hong Wu, Xiao Yu

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究综述了反应-扩散方程传播现象的进展,介绍哈密尔顿-雅可比方法,探讨非局部拉拽型前沿等内容,还证明了移动环境中入侵波对数修正的新结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28798 2026-08-03 physics.soc-ph 新提交 50%

Occupational Convergence or Divergence? Mapping Labor Market Structural Shifts Driven by AI Penetration

职业的趋同还是分化?绘制由AI渗透驱动的劳动力市场结构转变图

Rafiazka Hilman, Julia Koltai

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究利用10国在线职位空缺数据,结合NLP、大语言模型等方法,发现AI相关技能在核心STEM职业间趋同,但核心与其他职业间分化,强化了职业分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28782 2026-08-03 physics.optics physics.chem-ph 新提交 50%

Mode-Selective and Anharmonicity-Controlled Energy Transport in Cavity-Coupled Water

腔耦合水中的模式选择性与非谐性可控能量传输

Sachith Wickramasinghe, Michael Fowler, Gerrit Groenhof, Arkajit Mandal

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究通过介观实时模拟揭示,分子非谐性是光子传输的关键决定因素,可通过调谐腔光子频率控制腔耦合水中的模式选择性能量传输,为相关现象提供了微观机制与解析解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29262 2026-08-03 cond-mat.soft physics.flu-dyn 新提交 50%

Phoretic flow in a three-dimensional wedge geometry

三维楔状几何中的电泳流

Abdallah Daddi-Moussa-Ider, Semyon Yakubovich, Maciej Lisicki

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对三维楔状受限几何,建立了扩散主导 regime 下化学驱动电泳流的格林函数理论框架,推导了浓度场与速度场的显式谱解,为相关数值模拟提供了分析基准。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29230 2026-08-03 cond-mat.soft physics.flu-dyn 新提交 50%

Weak-electrolyte diffusiophoresis for rigid colloids

刚性胶体的弱电解质扩散电泳

Subrata Majhi, Huanshu Tan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究建立弱电解质中刚性胶体扩散电泳模型,通过求解耦合方程揭示双电层及离子反应对迁移率的影响,发现反应-极化耦合无法由完全解离模型仅调整离子强度重现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28859 2026-08-03 cond-mat.mtrl-sci cond-mat.other physics.acc-ph 新提交 50%

Automating the analysis of micron-scale synchrotron diffraction data on inhomogeneous polycrystalline samples: a solid oxide electrolysis cell case study

自动化分析非均匀多晶样品的微米级同步辐射衍射数据:固体氧化物电解池案例研究

Liam A. V. Nagle-Cocco, Christopher A. Crain, Michael J. Dzara, Mathias A. Kiefer, Madeline G. Port, Tolga Han Ulucan, Madeline Van Winkle, Oscar Hathaway, Nicholas A. Strange

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种自动化开源Python程序,用于分析非均匀多晶器件的微米级同步辐射衍射数据,以固体氧化物电解池为案例验证,该协议经修改可应用于多种电化学器件。

Comments In review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22903 2026-08-03 cond-mat.soft 版本更新 50%

From Local Structure to Thermodynamics and Transport of Water with Machine Learning Force Fields

利用机器学习力场从局部结构到水的热力学与输运

Andreas Kretschmer, Florian Altmann, Nader Nour, Alper T. Celebi, Markus Valtiner

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究利用机器学习力场评估液态水相关性质,不同密度泛函理论交换关联泛函会影响预测结果;RPBE-D3与实验结果最一致,经典SPC/E模型与RPBE-D3有相似性,揭示了平动和取向熵贡献与自扩散系数的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13319 2026-08-03 cs.LG 版本更新 50%

LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning

LightningRL: 通过强化学习打破块状dLLMs的精度-并行性权衡

Yanzhe Hu, Yijie Jin, Pengfei Liu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出LightningRL框架,通过强化学习优化预训练dLLMs的速度-质量帕累托前沿,提升并行生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15203 2026-08-03 stat.ME 版本更新 50%

Conditional GLMMs for reaction times in choice tasks

选择任务中反应时的条件广义线性混合模型(GLMMs)

Mauricio Tejo, Cristian Meza, Fernando Marmolejo-Ramos

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究将选择任务反应时建模的扩散模型与GLMMs结合,利用扩散模型的首达时间分布为GLMMs选择分布,经模拟和真实数据验证,可推断认知过程并讨论方法扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2607.28955 2026-08-03 cs.CV cs.AI 新提交 57%

Retrieval-Driven Training-Free AI-Generated Video Attribution

检索驱动的无训练AI生成视频溯源

Renxi Cheng, Chaolei Han, Jie Gui, Hongsong Wang

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间科学与工程学院) Purple Mountain Laboratories(紫金山实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 针对现有视觉溯源方法泛化性不足的问题,本文提出检索驱动的无训练AI生成视频溯源范式,基于生成指纹的流程在GenVidBench上实现优于SOTA的检测与溯源性能。

详情

展开后加载摘要…

URL PDF HTML 收藏