arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-10 至 2026-06-10 共收录 60 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2606.10492 2026-06-10 cs.CV 新提交 88%

PathRelax: Parallel-Path Relaxed Speculative Jacobi Decoding for Accelerating Auto-Regressive Text-to-Image Generation

PathRelax: 并行路径松弛推测雅可比解码加速自回归文本到图像生成

Haodong Lei, Hongsong Wang, Bingxuan Dai, Pan Zhou

机构 * College of Software Engineering, Southeast University(东南大学软件工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 针对自回归文本到图像模型因长序列导致推理慢的问题,提出并行路径交叉松弛推测雅可比解码框架,通过多序列草稿树结构扩展搜索空间并利用跨路径语义相似性提高接受率,实现3.95-4.18倍加速。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11188 2026-06-10 cs.CV 新提交 70%

ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

ARM: 一种具有统一离散表示的自回归大型多模态模型

Junke Wang, Xiao Wang, Jiacheng Pan, Xuefeng Hu, Feng Li, Jingxiang Sun, Chaorui Deng, Zilong Chen, Yunpeng Chen, Kaibin Tian, Matthew Gwilliam, Hao Chen, Danhui Guan, Kun Xu, Weilin Huang, Zuxuan Wu, Haoqi Fan, Yu-Gang Jiang, Zhenheng Yang

机构 * Shanghai Key Lab of Intelligent Information Processing, Fudan University(复旦大学上海智能信息处理重点实验室) School of Computer Science, Fudan University(复旦大学计算机科学技术学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Youtu Lab, Tencent(腾讯优图实验室) Meta AI Shanghai AI Laboratory(上海人工智能实验室)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出ARM模型,通过离散语义视觉分词器将图像映射为紧凑token序列,结合自回归建模和强化学习,统一实现图像理解、生成和编辑,并提升任务性能与跨任务协同。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2606.09901 2026-06-10 cs.GR cs.CV cs.HC cs.LG cs.MM 新提交 85%

On the Controllability-Fidelity Frontier in Diffusion Editing

扩散编辑中的可控性-保真度前沿

Yi Hu, Leying Yi, Emily Davis, Finn Carter

机构 * Xidian University(西安电子科技大学)

专题命中 图像编辑 :diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 本文理论结合实证研究扩散图像编辑中用户意图遵循、非目标内容保持与输出质量间的权衡,提出算法框架并揭示关键失败模式,讨论伦理考量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 45 篇

2606.10653 2026-06-10 cs.CV 新提交 86%

STEDiff: Strengthening Text Embedding for Text-to-Image Alignment in Diffusion Model

STEDiff: 增强文本嵌入以提升扩散模型中文本到图像的对齐

Hailan Zhang, Haipeng Liu, Bo Fu, Yang Wang

机构 * Hailan Zhang, Haipeng Liu, Yang Wang(未明确机构) Bo Fu(未明确机构)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title);分类 cs.CV

AI总结 提出训练免费的STEDiff方法,通过利用[EOT]令牌增强子句语义并引入语义增强损失,在文本嵌入空间中改善扩散模型对复杂提示的语义对齐,无需微调或布局先验。

Comments 8 pages, 8 figures, to appear at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09909 2026-06-10 cs.CR cs.AI cs.CV 新提交 83%

Bypassing Copyright Protection in Diffusion-based Customization via Two-Stage Latent Feature Optimization

通过两阶段潜在特征优化绕过基于扩散的定制中的版权保护

Ziang Xu, Wenbo Yu, Hongyao Yu, Hao Fang, Jiawei Kong, Bin Chen, Hao Wu, Shu-Tao Xia, Zhiyong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出两阶段潜在特征优化(TS-LFO)攻击方法,通过潜在去噪和重建阶段恢复被防御破坏的映射,有效绕过扩散模型定制中的版权保护。

Comments accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10390 2026-06-10 physics.med-ph 新提交 82%

Foveated-Imaging Geometry CT Architecture and Seeded Diffusion Model Enabling Global Super-Resolution Reconstruction

中心凹成像几何CT架构与种子扩散模型实现全局超分辨率重建

Wenxin Mo, Yingxian Xia, Yongle Yan, Hao Zhou, Li Zhang, Hewei Gao

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出中心凹成像几何CT架构,集成局部高分辨率数据到低分辨率主导的采集方案,并开发扩散概率超分辨率重建框架,实现全场高分辨率CT图像重建。

Comments 24pages,10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10183 2026-06-10 cs.CV cs.AI cs.MM 新提交 81%

Making Time Editable in Video Diffusion Transformers

在视频扩散Transformer中实现时间可编辑性

Konstantin Kuklev, Viacheslav Vasilev, Alexander Kunitsyn, Andrei Ivaniuta, Denis Dimitrov

机构 * Kandinsky Lab(坎迪斯基实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 提出一种时间控制方法,通过轻量级时间模块扩展预训练DiT,实现运动速度和时序结构的编辑,无需重新设计骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10280 2026-06-10 eess.IV cs.CV 新提交 80%

Overlapped Wavelet Diffusion for Low-Light Image Enhancement

重叠小波扩散用于低光照图像增强

Fen Peng, Taizo Suzuki, Seisuke Kyochi

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出重叠小波扩散框架OWDiff,通过重叠小波变换消除块伪影,并引入低频引导的高频增强模块恢复细节,在LOLv1和LOLv2-real数据集上优于现有方法。

Comments Advance published in IEICE Transactions on Information and Systems. DOI: 10.1587/transinf.2026PCP0006. Code: https://github.com/FinnPeg/Overlapped-Wavelet-Diffusion

Journal ref IEICE Transactions on Information and Systems, Advance online publication, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11180 2026-06-10 cs.CV 新提交 79%

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

Lip Forcing: 用于实时唇部同步的少步自回归扩散

Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee, Joungbin Lee, Siyoon Jin, Heeseong Shin, Jung Yi, Yunjin Park, Chulmin Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) AIPARK

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Lip Forcing,首个用于视频到视频唇部同步的自回归扩散方法,通过蒸馏14B教师模型为因果学生模型,仅需两步去噪即可实现实时同步,并引入同步窗口DMD、两步推理计划和SyncNet奖励。

Comments Project Page: https://cvlab-kaist.github.io/LipForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11019 2026-06-10 cs.RO cs.AI 新提交 78%

Diffusion Forcing Planner: History-Annealed Planning with Time-Dependent Guidance for Autonomous Driving

扩散强制规划器:基于时间依赖引导的历史退火规划用于自动驾驶

Zehan Zhang, Neng Zhang, Yaoyi Li, Jia Cai, Zhiling Wang

机构 * University of Science and Technology of China(中国科学技术大学) Yinwang Intelligent Technology Co., Ltd(银网智能科技有限公司) Hefei Institutes of Physical Science, Chinese Academy of Sciences(中国科学院合肥物质科学研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出扩散强制规划器(DFP),通过历史引导控制实现异构联合扩散过程,结合退火历史的条件引导,解决运动规划中的时间不一致问题,在nuPlan上取得竞争性能。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10825 2026-06-10 cs.LG 新提交 78%

MODIP: Efficient Model-Based Optimization for Diffusion Policies

MODIP:扩散策略的高效基于模型的优化

Zakariae El Asri, Philippe Gratias-Quiquandon, Nicolas Thome, Olivier Sigaud

机构 * Sorbonne Université, CNRS, ISIR, F-75005 Paris, France(索邦大学,法国国家科学研究中心,智能系统与机器人研究所,法国巴黎) Institut Universitaire de France (IUF)(法国大学研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出MODIP框架,利用世界模型和模型预测控制生成高质量轨迹,以监督方式微调扩散策略,实现离线到在线的强化学习微调,在D4RL和RoboMimic任务上超越行为克隆基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10537 2026-06-10 cs.CL 新提交 78%

Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models

Prefilling-dLLM: 扩散语言模型中长上下文推理的预测性预填充

Jing Xiong, Qi Han, Shansan Gong, Yunta Hsieh, Chengyue Wu, Chaofan Tao, Chenyang Zhao, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) LMSYS Org(LMSYS组织)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散语言模型在长上下文中因重复编码前缀导致计算量二次增长的问题,提出Prefilling-dLLM框架,通过分块缓存KV表示并基于稀疏性选择相关块,实现高效解码,在LongBench等基准上达到最先进加速效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10371 2026-06-10 cs.RO cs.AI 新提交 78%

Test-time Adversarial Takeover: A Real-time Hijacking Interface against Robotic Diffusion Policies

测试时对抗接管:针对机器人扩散策略的实时劫持接口

Zi Yin, Peilin Chai, Siyuan Huang, Zhanhao Hu

机构 * Tsinghua University(清华大学) Independent Researcher(独立研究员) Johns Hopkins University(约翰霍普金斯大学) UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出测试时对抗接管(TAKO)方法,通过可微扩散推理学习可重复使用的通用补丁,在测试时切换补丁以劫持机器人策略,实现远程操控,在多种任务和模型上达到100%接管成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09962 2026-06-10 cs.LG cs.AI cs.SD 新提交 78%

Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech

FSQ 令牌在分类数据连续扩散中的最优性及其在文本到语音中的应用

Vadim Popov, Wenju Gu, Tasnima Sadekova, Georgii Aparin, Assel Yermekova

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) National Research University Higher School of Economics(俄罗斯国家研究大学高等经济学院) National University of Science and Technology MISIS(俄罗斯科学与技术国立大学MISIS)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究连续扩散模型中离散令牌的潜在空间结构,通过理论分析和实验证明 FSQ 令牌化方案在分类数据连续扩散中最优,并在文本到语音任务中验证其优于基于 LLM 的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10480 2026-06-10 math.NA cs.NA 新提交 78%

Spectral and computational aspects of a regularized fractional Laplacian for non-local diffusion on graphs

正则化分数阶拉普拉斯算子在图上非局部扩散的光谱与计算方面

Alessandro Filippo, Mariarosa Mazza

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对分数阶拉普拉斯算子破坏图拓扑兼容性的问题,提出正则化算子,证明其独立于边权重的超扩散性质,并给出保持计算效率的构造方法。

Comments 21 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10353 2026-06-10 math.NA cs.NA math.ST stat.TH 新提交 78%

Higher-order Diffusion Sampling via Chebyshev Interpolation and Gauss--Seidel Iterations

通过切比雪夫插值和高斯-赛德尔迭代的高阶扩散采样

Bingyuan Wei, Meng Huang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出切比雪夫-高斯-赛德尔高阶采样器,在精确分数条件下,仅需 d^{1+o_T(1)}ε^{-1/K_1} 次分数函数即可达到总变差距离 ε,且放宽了有界支撑假设,对分数和雅可比估计误差具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11140 2026-06-10 physics.geo-ph cs.AI cs.LG stat.AP stat.ML 新提交 78%

Data assimilation for subsurface flow using latent diffusion model parameterization: performance of ensemble-Kalman and Monte Carlo techniques

基于潜扩散模型参数化的地下流体数据同化:集成卡尔曼与蒙特卡洛技术的性能

Guido Di Federico, Wenchao Teng, Louis J. Durlofsky

机构 * Department of Energy Science & Engineering, Stanford University(能源科学与工程系,斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对地下流体数据同化中高维参数反演问题,比较了基于潜扩散模型(LDM)的集成卡尔曼方法(ESMDA)与蒙特卡洛方法(MCMC/SMC)在三维河道地质模型上的性能,发现蒙特卡洛方法在保持地质真实性的同时能更有效地降低数据失配和不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10034 2026-06-10 physics.chem-ph 新提交 78%

Electron Paramagnetic Resonance Study of Radical Species on NaNbO3@CeO2-Modified Carbon Vulcan XC72 Gas Diffusion Electrode for Electrochemical Degradation of Paracetamol via Electro-Fenton

NaNbo3@CeO2修饰碳Vulcan XC72气体扩散电极电芬顿降解对乙酰氨基酚中自由基物种的电子顺磁共振研究

Caio Machado Fernandes, Joao Paulo C. Moura, Aline B. Trench, Rafael Sotana, Ana Maria P. Neto, Willy G. Santos, Mauro C. Santos

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 利用EPR直接定量分析新型GDE电极降解对乙酰氨基酚中的自由基,发现BDD阳极优于Pt,15分钟完全降解,矿化率81.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10482 2026-06-10 cond-mat.mes-hall 新提交 78%

Strain-programmable exciton diffusion in moiré heterostructures

莫尔异质结中应变可编程的激子扩散

Chiho Song, Chiranjit Mondal, Jaebin Lee, Kenji Watanabe, Takashi Taniguchi, Bohm-Jung Yang, Jieun Lee

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过调控WSe2-MoSe2异质结中的层间应变,打破C3旋转对称性改变莫尔超晶格几何,实现沿拉伸方向的偏振激子发射和优先扩散,为设计莫尔超晶格和编程激子输运提供新方法。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10512 2026-06-10 astro-ph.SR 新提交 78%

Turbulent Diffusion of Magnetic Field Lines in the Heliosphere

日球层中磁力线的湍流扩散

J. V. A. Joubert, R. D. Strauss, J. Light, N. E. Engelbrecht, N. H. Bian

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究太阳风湍流导致帕克螺旋随机化的磁力线扩散,通过随机微分方程数值模拟,发现1 AU处角分布标准差约25°,并量化了反向追踪时磁连接的概率。

Comments Accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11155 2026-06-10 cs.CV 新提交 77%

Mean Flow Distillation: Robust and Stable Distillation for Flow Matching Models

平均流蒸馏:面向流匹配模型的鲁棒稳定蒸馏方法

An Zhao, Shengyuan Zhang, Zhongjian Sun, Yixiang Zhou, Zejian Li, Ling Yang, Tianrun Chen, Lingyun Sun

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出平均流蒸馏(MFD)框架,通过时间低通滤波抑制优化噪声并保证轨迹一致性,实现流匹配模型的高保真单步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10368 2026-06-10 cs.SD cs.AI 新提交 71%

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

语音遇见ELF:用于语音识别和翻译的音频条件连续目标扩散

Xuanchen Li, Tianrui Wang, Yuheng Lu, Zikang Huang, Yu Jiang, Chenghan Lin, Chenrui Cui, Ziyang Ma, Xingyu Ma, Chunyu Qiang, Guochen Yu, Xie Chen, Longbiao Wang, Jianwu Dang

机构 * Tianjin University(天津大学) Shanghai Jiao Tong University(上海交通大学) Nankai University(南开大学)

专题命中 扩散模型 :diffusion(title)

AI总结 提出ELF-S2T,一种基于预训练ELF骨干的音频条件连续目标生成模型,通过音频强制训练和分类器自由引导,在LibriSpeech和CoVoST2上实现竞争性ASR和S2TT性能,并揭示识别与翻译错误均源于连续潜空间中的近距离混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10892 2026-06-10 cs.CV cs.AI 新提交 70%

Improving Text-Instance Alignment Of Foreground Conditioned Out-Painting Via Customized Concept Embedding

通过定制化概念嵌入改进前景条件外绘中的文本-实例对齐

Yihao Zhao, Xuan Han, Bin He, Mingyu You

机构 * College of Electronic and Information Engineering, Tongji University, Shanghai, China(电子信息工程学院,同济大学,上海,中国) State Key Laboratory of Autonomous Intelligent Unmanned Systems, Frontiers Science Center for Intelligent Autonomous Systems, Ministry of Education, Shanghai, China(自主智能无人系统国家重点实验室,智能自主系统前沿科学中心,教育部,上海,中国)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 针对前景条件外绘中文本驱动方法产生的伪影问题,提出定制化概念嵌入扩散框架,通过实例感知损失和语义保持提示模板定制概念嵌入,显著减少伪影并提升图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10450 2026-06-10 cs.CV cs.LG 新提交 57%

Few-step Generative Models as Lossy Compression

少步生成模型作为有损压缩

Fuma Kimishima, Jinjia Zhou

机构 * University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究将少步生成模型(Rectified Flow、CTM、MeanFlow)用于反向信道编码框架进行有损压缩,通过参数化等效和局部高斯近似实现无需重训练的编解码,在低分辨率基准上减少编解码时间并提升低比特率下的真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10364 2026-06-10 cs.CV 新提交 57%

Benchmarking stereo reconstruction for 3D printable Martian terrain models

用于3D打印火星地形模型的立体重建基准测试

Josephine Wang

机构 * MIT Cambridge, MA, USA(麻省理工学院,马萨诸塞州剑桥,美国)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对火星图像低纹理、不规则和部分观测的特点,评估从NASA好奇号图像估计立体深度、补全几何并导出可打印网格的流程,发现基准精度不直接迁移到火星地形重建,几何补全存在局部保真度与全局连通性的权衡。

Comments 9 pages, 7 figures, CVPR End-to-End 3D Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10190 2026-06-10 eess.SP 新提交 50%

Optimal Illumination via Joint Movement and Phase Optimization for Movable Antenna-RIS Configuration

可移动天线-RIS配置的联合移动与相位优化的最优照明

Yan Zhang, Nicola Marchetti, Indrakshi Dey

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出可移动天线增强RIS架构,利用随机微分方程建模天线移动,通过两时间尺度框架优化长期信噪比,实现高达36 dB稳态增益和16倍能效提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09893 2026-06-10 eess.IV cs.AI cs.LG 新提交 50%

Tractogram foundation model

TractFM:纤维束图基础模型

Guikun Chen, Yuqian Chen, Yijie Li, Yogesh Rathi, Nikos Makris, Fan Zhang, Wenguan Wang, Lauren J. O'Donnell

机构 * The State Key Lab of Brain-Machine Intelligence, Zhejiang University, Hangzhou(脑机智能国家重点实验室,浙江大学,杭州) Department of Radiology, Brigham and Women’s Hospital, Mass General Brigham, Boston(放射科,布里洛妇女医院,马萨诸塞总医院,波士顿) Harvard Medical School, Boston(哈佛医学院,波士顿) Academy of Medical Engineering and Translational Medicine, Tianjin University, Tianjin(医学工程与转化医学研究院,天津大学,天津) School of Information and Communication Engineering, University of Electronic Science and Technology of China, Chengdu(信息与通信工程学院,电子科技大学,成都) Psychiatry Neuroimaging Laboratory, Brigham and Women’s Hospital, Mass General Brigham, Boston(精神病神经影像实验室,布里洛妇女医院,马萨诸塞总医院,波士顿) Department of Psychiatry, Center for Morphometric Analysis, Massachusetts General Hospital, Boston(精神病科,形态分析中心,马萨诸塞总医院,波士顿)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出TractFM基础模型,直接从全脑纤维束集学习可复用表示,结合局部纤维编码器和置换等变纤维束编码器,通过密集解剖束分割预训练,实现纤维束级和受试者级任务的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11087 2026-06-10 cs.LG cs.AI 新提交 50%

Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning

强化学习中流策略的测试时梯度引导

Zhiyuan Zhou, Andy Peng, Charles Xu, Qiyang Li, Tobias Springenberg, Kevin Frans, Sergey Levine

机构 * UC Berkeley(加州大学伯克利分校) Physical Intelligence

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出QGF算法,通过预训练参考流策略和价值函数,在测试时利用价值梯度引导策略生成高价值动作,无需额外策略学习,在离线RL基准上优于现有测试时方法且与训练时方法竞争力相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11075 2026-06-10 cs.LG 新提交 50%

Exploring the Design Space of Reward Backpropagation for Flow Matching

探索流匹配的奖励反向传播设计空间

Ruoyu Wang, Boye Niu, Xiangxin Zhou, Yushi Huang, Tongliang Liu, Chi Zhang

机构 * Westlake University(西湖大学) Tencent Hunyuan(腾讯混元) University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :text-to-image(abstract)

AI总结 针对文本到图像流匹配模型,提出统一代理轨迹框架FlowBP,通过设计反向轨迹(稀疏重建、桥耦合、拉格朗日积分)解决直接奖励反向传播中的内存和梯度爆炸问题,在多个模型和指标上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11045 2026-06-10 cs.AI cs.LG 新提交 50%

What Fits (Into Few Tokens) Doesn't Overfit: Compression and Generalization in ML Research Agents

什么适合(少量标记)就不会过拟合:ML研究智能体中的压缩与泛化

Martin Andres Bertran, Aaron Roth, Zhiwei Steven Wu

机构 * Amazon Responsible AI(亚马逊负责任人工智能) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究LLM驱动的科研智能体在输出和输入压缩下能否保持性能,发现短提示和可压缩反馈足以复现高性能模型,支持成功策略位于低复杂度区域的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏