arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-01 至 2026-07-01 共收录 119 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 91 篇

2604.02914 2026-07-01 cond-mat.stat-mech 版本更新 50%

Hamiltonian flocks: Time-Reversal Symmetry and its consequences

哈密顿蜂群:时间反演对称性及其后果

Mathias Casiulis, Leticia F. Cugliandolo

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究哈密顿蜂群中时间反演对称性的扩展,揭示其对平衡系统波动-耗散定理的影响及非平衡系统中极性自由度的混合效应。

Comments 65 pages (22 pages of main text and 43 of appendices), 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21210 2026-07-01 cs.LG cs.CE 版本更新 50%

Pretrained Video Models as Differentiable Physics Simulators for Urban Wind Flows

预训练视频模型作为可微物理模拟器用于城市风流

Janne Perini, Rafael Bischof, Moab Arar, Ayça Duran, Michael A. Kraus, Siddhartha Mishra, Bernd Bickel

机构 * ETH Zurich(苏黎世联邦理工学院) Tel Aviv University(特拉维夫大学) TU Darmstadt(达姆施塔特工业大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出WinDiNet,一种预训练视频扩散模型,用于快速模拟城市风流,通过反向传播优化建筑布局以提升风安全性和行人舒适度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13672 2026-07-01 math.NA cs.NA math.AP math.CA math.FA 版本更新 50%

Numerical Analysis of differential equations on weighted Sobolev spaces: beyond classical orthogonal polynomials

加权Sobolev空间上微分方程的数值分析:超越经典正交多项式

Maxime Breden, Hugo Chu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文为加权Sobolev空间上的微分方程数值分析奠定数学基础,通过分解主导线性分量实现基于正交多项式的求解,并提出新的Sobolev正交多项式概念,应用于Gross-Pitaevskii方程和随机共振的严格证明。

Comments added a computer-assisted proof of stochastic resonance

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08566 2026-07-01 cond-mat.soft cond-mat.stat-mech 版本更新 50%

Homing through Reinforcement Learning

通过强化学习实现归巢

Riya Singh, Pratikshya Jena, Anish Kumar, Shradha Mishra

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出强化学习框架模拟连续二维域中的自适应归巢,发现平均归巢时间随旋转扩散强度呈非单调变化,且RL智能体比主动布朗粒子更快、更定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13987 2026-07-01 physics.ao-ph 版本更新 50%

An intercomparison of generative machine learning methods for downscaling precipitation at fine spatial scales

用于精细空间尺度降水降尺度的生成式机器学习方法比较

Neelesh Rampal, Bryn Ward-Leikis, Yun Sing Koh, Peter B. Gibson, Hong-Yang Liu, Vassili Kitsios, Tristan Meyers, Jeff Adie, Yang Juntao, Steven C. Sherwood

专题命中 扩散模型 :diffusion(abstract)

AI总结 比较GAN、流匹配和扩散模型在降尺度日降水中的表现,发现扩散和流匹配生成更高保真度预测和更好校准的集合,但多数方法低估极端降水的气候变化信号。

Comments 34 pages, 9 Figures, 4 Supplemental Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05968 2026-07-01 cond-mat.mtrl-sci 版本更新 50%

Revisiting $μ$SR Studies of Ion Dynamics in the Light of Extended Kubo-Toyabe Model

重新审视扩展Kubo-Toyabe模型下的离子动力学μSR研究

Takashi U. Ito, Ryosuke Kadono

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过扩展动态Kubo-Toyabe函数描述共存动态与静态内磁场下的自旋弛豫,重新评估Na_xCoO_2中的μ±SR数据,否定了传统钠离子扩散解释,支持μ+自扩散场景,并解决了基于dKT函数的μSR研究中长期存在的经典过势垒跳跃机制不一致问题。

Comments 6 pages, 3 figures

Journal ref Journal of Physics: Conference Series 3222, 012009 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12189 2026-07-01 math.PR 版本更新 50%

Stein's method for models with general clocks: A tutorial

一般时钟模型的Stein方法:教程

Anton Braverman, Ziv Scully

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文教程介绍Stein方法的生成元比较法,用于分析一般时钟驱动的马尔可夫模型的扩散近似,并给出非渐近误差界,通过排队系统实例展示其应用。

Comments The content of this paper was merged into submission arXiv:2407.12716

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.12861 2026-07-01 physics.plasm-ph 50%

Runaway dynamics in the DT phase of ITER operations in the presence of massive material injection

ITER运行中DT阶段大规模材料注入下的失控动力学

O. Vallhagen, O Embreus, I Pusztai, L Hesslow, T Fülöp

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究大规模注入氘-惰性气体混合物对等离子体失控生成、电场电阻扩散及温度演变的影响,发现除非电流淬灭时间过长,否则会产生显著的失控电流。

Comments 24 pages, 8 figures

Journal ref J. Plasma Phys. 86 (2020) 475860401

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 10 篇

2606.31147 2026-07-01 cs.CV 新提交 85%

WaterGen: Decoupling Scene and Medium in Underwater Image Generation

WaterGen:水下图像生成中的场景与介质解耦

Jiayi Wu, Tianfu Wang, Tianyi Xiong, Dehao Yuan, Xiaomin Lin, Md Jahidul Islam, Cornelia Fermuller, Christopher Metzler, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学) University of South Florida(南佛罗里达大学) University of Florida(佛罗里达大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出WaterGen方法,通过解耦场景生成和介质建模,在潜在扩散框架下生成大规模、真实、多样的水下图像,提升下游恢复和分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31924 2026-07-01 cs.CV 新提交 79%

InstanceControl: Controllable Complex Image Generation without Instance Labeling

InstanceControl: 无需实例标注的可控复杂图像生成

Xiaoyu Liu, Huan Wang, Fan Li, Zhixin Wang, Jiaqi Xu, Ming Liu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) HUAWEI Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 提出InstanceControl方法,利用视觉语言模型自动建立文本与视觉条件间的实例对应,无需人工标注,通过自适应掩码细化策略实现复杂多实例场景的精确可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31537 2026-07-01 cs.CV cs.MA 新提交 79%

DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation

DataEvolver: 面向文本丰富图像生成的自我进化多智能体数据构建

Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang

机构 * Central South University(中南大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 提出DataEvolver,一种自我进化的多智能体框架,通过反馈驱动策略迭代优化数据构建,显著提升文本丰富图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31029 2026-07-01 cs.CV 新提交 74%

TerraDiT-$Ω$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive

TerraDiT-$\Omega$:任意地理基元的卫星图像合成统一空间控制

Brian Wei, Srikumar Sastry, Daniel Cher, Eric Xing, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 可控生成 :image synthesis(title);分类 cs.CV

AI总结 提出TerraDiT-Ω框架,通过几何感知局部注意力机制,支持从任意原生地理基元(多边形、折线、边界框、点)直接生成卫星图像,在多种控制格式下优于密集和稀疏控制基线,并提升下游任务性能。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31204 2026-07-01 cs.CV 新提交 70%

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

AC3S: 面向3D感知合成数据生成的自适应条件控制

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。

Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20935 2026-07-01 cs.CV 版本更新 70%

ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation

ISAC:无需训练的实例到语义注意力控制用于多实例生成

Sanghyun Jo, Wooyeol Lee, Ziseok Lee, Jonghyun Choi, Jaesik Park, Kyungsu Kim

机构 * OGQ Seoul National University(首尔大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出ISAC方法,通过先稳定自注意力布局再绑定交叉注意力语义,无需训练即可解决多实例生成中的遗漏、合并和语义混淆问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31933 2026-07-01 cs.CV 新提交 57%

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

无处可藏:基于背景控制对的视频幻觉基准测试

Haojian Huang, Harold Haodong Chen, Meng Luo, Junjia Du, Shanqing Xu, Ziheng Chen, Yanxiang Huang, Yinchuan Li, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Knowin AI(考恩人工智能) The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 提出VidPair-Halluc基准,通过背景相似但前景语义不同的视频对,精确评估大型视频模型中的视频幻觉,包含1K对抗视频对和11K时空问答对。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31426 2026-07-01 eess.SP 新提交 50%

Towards a Joint Task-Oriented and Generative Semantic Communication Framework for 6G Networks

面向6G网络的联合任务导向与生成式语义通信框架

Soheyb Ribouh, Phil Polo Ditsia Di Ngoma

专题命中 可控生成 :diffusion(abstract)

AI总结 提出一种基于OFDM的端到端语义通信框架,通过图表示提取视觉语义,结合ST-GNN进行碰撞风险估计,并利用扩散模型重建场景,在MIMO配置下实现99.1%数据压缩,优于JPEG/HEVC,同时保持下游推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31132 2026-07-01 cs.RO 新提交 50%

ELASTIC: Efficiently Learning to Adaptively Scale Test-Time Compute for Generative Control Policies

ELASTIC: 高效学习自适应缩放测试时计算以生成控制策略

Andrew Zou Li, Gokul Swamy, Yonatan Bisk, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出ELASTIC算法,通过元强化学习为生成控制策略学习状态依赖的测试时计算调度,在扩散策略和视觉-语言-动作模型上实现帕累托最优,减少34%延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31968 2026-07-01 math.OC math.AP 新提交 50%

Approximate Controllability of the generalized Burgers-Huxley equation in one dimension

一维广义Burgers-Huxley方程的近似可控性

Aman Patel, Mohmedmunavvar Mubarak Bapu, Mrinmay Biswas

专题命中 可控生成 :diffusion(abstract)

AI总结 研究广义Burgers-Huxley方程通过内部控制的可控性,证明非全局近似可控,但可在适当时间内将系统从任一稳态驱动到另一稳态的任意小邻域,前提是两者在同一连通分量中。

Comments 48 pages, Comments Welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2601.19506 2026-07-01 cs.CV 版本更新 57%

Bridging Information Asymmetry: A Hierarchical Framework for Deterministic Blind Face Restoration

弥合信息不对称:一种降低不确定性的分层盲脸修复框架

Zhengjian Yao, Jiakui Hu, Kaiwen Li, Hangzhou He, Xinliang Zhang, Shuang Zeng, Lei Zhu, Yanye Lu

机构 * Biomedical Engineering Department, College of Future Technology, Peking University(北京大学未来技术学院生物医学工程系) Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出Pref-Restore分层框架,通过语义信息增强、纹理保真对齐和保真约束偏好优化,降低盲脸修复中的不确定性,实现身份敏感的高保真重建。

Comments Accepted by TPAMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2603.08090 2026-07-01 cs.CV cs.AI 版本更新 86%

DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation

DSH-Bench: 一个具有层次化主体分类的难度和场景感知基准,用于主体驱动的文本到图像生成

Zhenyu Hu, Qing Wang, Te Cao, Luo Liao, Longfei Lu, Liqun Liu, Shuang Li, Hang Chen, Mengge Xue, Yuan Chen, Chao Deng, Peng Shu, Huan Yu, Jie Jiang

机构 * Tencent(腾讯)

专题命中 个性化与一致性 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 DSH-Bench通过四个创新解决现有基准的不足,提供层次化主体分类和细粒度评估,引入SICS指标提升主体保持度评估,并通过实验证明其在模型优化中的指导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 3 篇

2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交 62%

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28578 2026-07-01 cond-mat.mtrl-sci cs.AI 交叉投稿 50%

Surrogate-Gated Generation and Foundation-Model Embeddings for Bayesian Materials Design

用于贝叶斯材料设计的代理门控生成与基础模型嵌入

Sk Md Ahnaf Akif Alvi, Jan Janssen, Danny Perez, Douglas Allaire, Raymundo Arroyave

机构 * Texas A&M University(德克萨斯A&M大学) Max-Planck-Institute for Sustainable Materials(马克斯·普朗克可持续材料研究所) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出一种代理门控生成方法,利用高斯过程代理对扩散先验生成的晶体结构进行排序筛选,在固定预算下匹配或超越无门控微调性能,并识别出ORB嵌入与高斯过程为最可靠的代理组合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31700 2026-07-01 cs.LG cs.NE 新提交 50%

Diffusing Blame: Task-Dependent Credit Assignment in Biologically Plausible Dual-Stream Networks

扩散责任:生物合理双流网络中的任务依赖信用分配

Yutaro Yamada, Luca Grillotti, Rujikorn Charakorn, Sebastian Risi, David Ha, Robert Tjarko Lange

机构 * Sakana AI

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出模误差路由扩展误差扩散法,在严格遵循戴尔原则的双流兴奋/抑制网络中,实现MNIST 96.7%和CIFAR-10 61.7%的分类性能,并集成PPO在强化学习任务中取得竞争性结果。

Comments ALIFE2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 5 篇

2606.32020 2026-07-01 cs.CV 新提交 79%

Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers

跨空间蒸馏:用现代扩散教师训练一步学生模型

Anh Nguyen, Ngan Nguyen, Duc Vu, Trung Dao, Viet Nguyen, Quan Dao, Kien Nguyen, Chi Tran, Phong Nguyen, Khoi Nguyen, Cuong Pham, Dimitris Metaxas, Vishal M. Patel, Anh Tran

机构 * Qualcomm AI Research(高通AI研究院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) Rutgers University(罗格斯大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出跨空间蒸馏框架,通过轻量级潜在接口Bridge解决教师与学生模型潜在空间不匹配问题,实现异构教师蒸馏到紧凑学生模型,显著提升性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31259 2026-07-01 cs.SD cs.AI cs.MM eess.AS 新提交 79%

SwiftAudio: Data-Efficient Caption-Only Distillation for One-Step Text-to-Audio Diffusion-based Generation

SwiftAudio: 用于一步式文本到音频扩散生成的数据高效纯文本蒸馏

Binh Mai, Tran Quoc Bao Le, Hung Dinh, Cong Tran

机构 * Posts and Telecommunications Institute of Technology(邮电技术学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.MM

AI总结 提出SwiftAudio框架,通过仅使用文本描述从预训练扩散教师模型进行无音频蒸馏,实现一步式文本到音频生成,在AudioCaps和Clotho上达到最优性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31220 2026-07-01 math.PR 新提交 50%

Efficient Computation Of Sensitivities For Derivatives In Energy Markets

能源市场衍生品敏感性的高效计算

Fred Espen Benth, Olfa Draouil, Farouk Hammami

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出随机框架计算能源市场Delta敏感性,对比密度法与Malliavin微积分法,通过OU、CARMA、跳扩散等过程验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11439 2026-07-01 cs.LG cs.AI physics.chem-ph 50%

Sampling Out-of-Distribution Chemical Spaces via Bayesian Flow

通过贝叶斯流采样非分布化学空间

Nianze Tao, Minori Abe

机构 * Hiroshima University(广岛大学) Tokyo University of Agriculture(东京农业大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出利用贝叶斯流网络生成高质量非分布分子,通过强化学习策略和可控微分方程求解器提升采样效率,并引入半自回归策略提升模型性能。

Comments 35 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07175 2026-07-01 cs.RO 版本更新 50%

Continuous-Space Roadmap Generation for Mobile Robot Fleets with Distance Constraints and Geometry-Aware Discretization

面向距离约束与几何感知离散化的移动机器人车队连续空间路图生成

Marvin Rüdt, Constantin Enke, Kai Furmans

机构 * Institute for Material Handling and Logistics, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院物流与物料搬运研究所)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出一种连续空间路图生成方法,通过凸角点与站点交互点布点、局部网格扩展离散化、机器人尺寸约束及运输需求驱动的K最短路径剪枝,实现高冗余、短路径与足够间距的路图,在多智能体拾取与交付任务中优于现有方法。

Comments Accepted for publication at the 31st IEEE International Conference on Emerging Technologies and Factory Automation (ETFA)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他图像生成 1 篇

2509.25682 2026-07-01 cs.CV 版本更新 57%

Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples

少样本合成图像溯源:有限样本下识别未见生成器

Shiyu Wu, Shuyan Li, Jing Li, Jing Liu, Yequan Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peking University(北京大学)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 提出少样本合成图像溯源新范式,构建含45个生成器、117万图像的OmniFake数据集,并设计OmniDFA基线,实现少样本下识别未见生成器,在AIGI检测中达到最优泛化性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏