arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-07 至 2026-08-07 共收录 22 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2603.08652 2026-08-07 cs.AI 版本更新 85%

CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation

CoCo:用于文本到图像预览和稀有概念生成的代码作为CoT

Haodong Li, Chunmei Qing, Huanyu Zhang, Dongzhi Jiang, Yihang Zou, Hongbo Peng, Dingming Li, Yuhong Dai, ZePeng Lin, Juanxi Tian, Yi Zhou, Siqi Dai, Jingwei Wu, Pheng-Ann Heng

机构 * South China University of Technology(南方科技大学) StepFun Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image editing(abstract)

AI总结 CoCo通过代码驱动的推理框架,提升文本到图像生成的精度和可控性,实现结构化图像生成和稀有概念生成。

Comments 21 pages, 7 figures, and 3 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 19 篇

2601.15844 2026-08-07 astro-ph.IM astro-ph.CO 版本更新 82%

Radio-Interferometric Image Reconstruction with Denoising Diffusion Restoration Models

利用去噪扩散恢复模型进行无线电干涉成像重建

Michel Morales, Emma Tolley, Remi Poitevineau

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于去噪扩散概率模型的无线电天空成像重建方法,通过训练DDPM并结合DDRM技术,在不依赖网格化可见度数据的情况下实现高保真重建,优于传统CLEAN方法。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19725 2026-08-07 cs.LG cs.CV 版本更新 81%

Analytic Distribution of Classifier-Free Guidance for Schedule Design

用于调度设计的无分类器指导的解析分布

Enze Jiang, Zheng Ma

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 研究针对扩散模型中无分类器指导(CFG)的分布问题,通过概率流常微分方程分析并推导解析表示,提出分布引导CFG调度,经玩具模型验证,在Stable Diffusion 1.5上改进生成效果,降低采样成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26237 2026-08-07 cs.CV 版本更新 79%

LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models

LumaGuide:用于扩散模型中无需训练的高动态范围(HDR)生成的分布塑造方法

Bowen Chen, Shreshth Saini, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出无需训练的LumaGuide框架,通过在采样时直接塑造输出分布,实现扩散模型的可控生成,可用于HDR及视频生成,无需重新训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03881 2026-08-07 astro-ph.HE 版本更新 78%

Suppressed diffusion and gamma-ray emission from the Cygnus bubble

天鹅座气泡的抑制扩散和伽马射线辐射

Ben Li, Pasquale Blasi, Elena Amato

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究通过数值求解非热粒子输运方程,探讨了天鹅座OB2星团中粒子加速机制(激波或中心源)及抑制扩散对LHAASO观测到的PeV伽马射线能谱和形态的影响。

Comments 15 pages, 11 figures. Published in A&A

Journal ref Astronomy & Astrophysics, 712, A41 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26540 2026-08-07 physics.chem-ph cs.AI 版本更新 78%

Domain-Gated Latent Diffusion: Generative Inverse Design of HMX-Class Energetic Materials with First-Principles Validation

DGLD: 用于发现新型含能材料的域门控潜在扩散

Yehudit Aperstein, Alexander Apartsin

机构 * Department of Intelligent Systems, Afeka Tel -Aviv College of Engineering(智能系统系,阿费卡特拉维工程学院) School of Computer Science, Faculty of Sciences, HIT -Holon Institute of Technology(计算机科学学院,科学学院,希伯来理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出域门控潜在扩散模型(DGLD),通过标签质量门控、多任务评分引导和四阶段化学验证漏斗,从稀疏标记数据中生成12个经DFT验证的新型含能材料候选物,其中领先化合物L1和E1在爆速和结构新颖性上表现优异。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01107 2026-08-07 cs.LG cond-mat.dis-nn stat.ML 版本更新 78%

Diffusion Operator Geometry of Feedforward Representations

前馈表示的扩散算子几何

Kanishka Reddy

机构 * Department of Applied Mathematics(应用数学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散算子的前馈表示几何分析框架,通过Gaussian核扩散马尔可夫算子推导出运输、谱、标签边界和局部尺度可观测量,并验证了其在合成数据和MNIST实验中的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26114 2026-08-07 astro-ph.IM 版本更新 78%

Charge diffusion and modulation transfer function in a Nancy Grace Roman Space Telescope detector

罗马空间望远镜探测器中的电荷扩散与调制传递函数

Emily Macbeth, Katherine Laliotis, Christopher M. Hirata, Christopher Merchant

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究罗马空间望远镜探测器中电荷扩散对弱引力透镜测量的影响,通过激光条纹图案分析,确定调制传递函数模型,并提出适用于弱引力透镜测量的调查策略。

Comments 20 pages, 14 figures. As accepted to PASP

Journal ref Publications of the Astronomical Society of the Pacific, Volume 138, Issue 8, id.085002, 17 pp. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25406 2026-08-07 cs.RO 版本更新 78%

MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation

MMaDA-VLA: 基于统一多模态指令与生成的大型扩散视觉-语言-动作模型

Yang Liu, Pengxiang Ding, Tengyue Jiang, Xudong Wang, Wenxuan Song, Minghui Lin, Han Zhao, Hongyin Zhang, Zifeng Zhuang, Wei Zhao, Siteng Huang, Jinkui Shi, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) East China University of Science and Technology(华东理工大学) Huawei Celia Team(华为Celia团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) OpenHelix Robotics

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出MMaDA-VLA模型,通过统一多模态理解与生成框架,解决机器人操控中的时序不一致和长周期误差累积问题,实现高效视觉-语言-动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09799 2026-08-07 math-ph math.MP 版本更新 78%

Time-marching representation based quantum algorithms for the Lattice Boltzmann model of the advection-diffusion equation

基于时间推进表示的量子算法用于输运-扩散方程的格子玻尔兹曼模型

Yuan He, Yuan Yu, Yue Yu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于时间推进表示的量子算法,用于格子玻尔兹曼模型中的输运-扩散方程,实现了无测量的量子模拟方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07568 2026-08-07 cs.LG cs.AI 版本更新 78%

d3LLM: Ultra-Fast Diffusion LLM using Pseudo-Trajectory Distillation

d3LLM:基于伪轨迹蒸馏的超快扩散大语言模型

Yu-Yang Qian, Junda Su, Lanxiang Hu, Peiyuan Zhang, Zhijie Deng, Peng Zhao, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 d3LLM通过伪轨迹蒸馏和熵基多块解码技术,在提升并行性的同时保持准确性,实现超快的扩散大语言模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06800 2026-08-07 stat.ML cs.LG math.PR 版本更新 78%

A Reverse-BSDE Diffusion Sampler

反向倒向随机微分方程扩散采样器

Jairon H. N. Batista, Flávio B. Gonçalves, Yuri F. Saporito, Rodrigo S. Targino

机构 * FGV EMAp

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究将反向时间扩散采样器重新表述为前向-后向随机微分方程,证明其与原方法等价并分解近似误差,经合成目标实验验证,该方法对复杂全局结构目标的采样具有良好前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01591 2026-08-07 cs.CV 版本更新 70%

Faster and Better Alignment for Flow Matching Models via Step-aware Advantages

Know Your Step: 通过步感知优势实现更快速和更优的流匹配模型对齐

Zhixiong Yue, Feiyang Ye, Zixuan Ni, Sheng Shen, Yu Zhang

机构 * Zhejiang University(浙江大学) HiThink Research(HiThink研究) Southern University of Science and Technology(南方科技大学)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 TAFS GRPO通过步感知优势机制改进流匹配模型,实现更高效且更优的少步文本到图像生成与人类偏好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04955 2026-08-07 cs.CV 版本更新 57%

Towards Valid B-Rep Generation: Training-Free Wireframe Anomaly Detection and Repair

面向有效边界表示(B-Rep)生成:无需训练的线框异常检测与修复

Jingyu Wu, Youcheng Cai, Tengyu Luo, Ligang Liu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对CAD模型B-Rep生成中线框的几何拓扑异常问题,提出无需训练的WDR框架,通过GTAD检测风险、EGGTR修复,提升了B-Rep有效性且保留模型质量,可集成至多种生成流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04657 2026-08-07 cs.CV 版本更新 57%

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接

Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Feng Gao, Bailin Li, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) The University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Southeast University(东南大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Li Auto(理想汽车) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26320 2026-08-07 cs.RO cs.CV 版本更新 57%

DFM-VLA: Iterative Action Refinement for Robot Manipulation via Discrete Flow Matching

DFM-VLA:通过离散流匹配实现机器人操作的迭代动作细化

Jiayi Chen, Wenxuan Song, Jiaxin Fang, Ruiqing Yin, Jingbo Wang, Shuai Chen, Jieyuan Pei, Yikai Qin, Feifan Chen, Haodong Yan, Zhide Zhong, Wen Chen, Yan Wang, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology(哈尔滨工业大学) ShanghaiTech University(上海科技大学) Shanghai Institute of Technical Physics, CAS(中国科学院上海技术物理研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 DFM-VLA通过离散流匹配实现机器人操作中动作token的迭代细化,采用动态概率速度场和双阶段解码策略,提升了动作生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18831 2026-08-07 cs.CV 版本更新 57%

IDperturb: Enhancing Variation in Synthetic Face Generation via Angular Perturbation

IDperturb: 通过角度扰动增强合成人脸生成的多样性

Fadi Boutros, Eduarda Caldeira, Tahar Chettaoui, Naser Damer

机构 * Fraunhofer IGD(弗劳恩霍夫图像识别研究所) Department of Computer Science, TU Darmstadt(图腾大学计算机科学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 IDperturb通过角度扰动提升合成人脸生成的多样性,从而提高FR模型的性能和泛化能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05009 2026-08-07 physics.data-an 版本更新 50%

Weak Form Recovery of Heston Type Stochastic Dynamics

Heston型随机动力学的弱形式恢复

Sai Sathvik Gullipalli, Eshwar R A, Gajanan V. Honnavar

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究验证空间弱形式LASSO流程可恢复Heston随机波动率模型,经模拟及标普500数据测试,其在指定库内系数估计可靠,漂移参数恢复精度较低,无明显噪声相变。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27044 2026-08-07 math.AP 版本更新 50%

Failure of the Weak Sard property without Anomalous Dissipation

无反常耗散时弱Sard性质的失效

Umberto Pappalettera

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究构造了一类无弱Sard性质且无反常耗散的向量场,否定了Bagnara等人提出的相关猜想。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01922 2026-08-07 hep-ph nucl-th 版本更新 50%

Anisotropy effects on heavy quark dynamics in Gribov modified gluon plasma

各向异性对Gribov修正胶子等离子体重夸克动力学的影响

Sumit, Jai Prakash, Santosh Kumar Das, Najmul Haque

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究在福克-普朗克方程框架内采用非微扰Gribov重求和方法,探究相对论重离子碰撞早期夸克-胶子等离子体的动量各向异性对重夸克输运性质的影响,发现动量各向异性、角依赖及非微扰效应起重要作用。

Comments 20 pages, 9 figures

Journal ref J. Phys. G: Nucl. Part. Phys. 53 (2026) 085101

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 可控生成 1 篇

2507.13311 2026-08-07 cs.CV 版本更新 79%

FashionPose: Unified Text-Driven Fashion Synthesis with Joint Geometric and Photometric Control

FashionPose:结合几何与光度控制的统一文本驱动时尚合成

Chuancheng Shi, Shaotian Li, Zhenlong Yuan, Zifeng Cheng, Fei Shen

机构 * The University of Sydney(悉尼大学) Shenyang Aerospace University(沈阳航空航天大学) Zhonghuan Information College, Tianjin University of Technology(天津工业大学中环信息学院)

专题命中 可控生成 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 提出FashionPose级联架构,通过双向对比对齐、身份锚定合成与提示条件重光照模块,结合PoseCap数据集,实现文本驱动的可控时尚合成,性能优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2606.21138 2026-08-07 cs.CV 版本更新 57%

SEED: Simple ViT and Evolving Harness for Explainable Text Forgery Detection

SEED: 用于可解释文本伪造检测的简单ViT与演化框架

Kahim Wong, Kemou Li, Yiming Chen, Haiwei Wu, Jiantao Zhou

机构 * State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系智慧城市物联网国家重点实验室) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 个性化与一致性 :image editing(abstract);分类 cs.CV

AI总结 提出SEED系统,结合相似性引导数据增强、单一ViT联合检测与定位、以及基于MLLM的演化报告生成,在ACM MM 2026文本伪造挑战赛中获得第三名。

详情

展开后加载摘要…

URL PDF HTML 收藏