arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-26 至 2026-06-26 共收录 80 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 58 篇

2512.06624 2026-06-26 cond-mat.soft cond-mat.dis-nn physics.ao-ph physics.chem-ph 50%

Compression-driven jamming in porous cohesive aggregates

压缩驱动的多孔粘性聚集体中的阻塞现象

Sota Arakawa

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究压缩驱动阻塞行为,通过不同聚合方法制备三种初始聚集体,分析其形态对阻塞阈值的影响,发现不同聚合方法的阻塞阈值不同,压力与 packing 分数的关系表明弹性模量与阻塞阈值有关。

Comments Accepted for publication in Soft Matter

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07043 2026-06-26 cond-mat.mtrl-sci 版本更新 50%

Boron-assisted synthesis of compositionally complex amorphous oxides via short-range-order-constrained generative design

硼辅助合成成分复杂非晶氧化物:基于短程有序约束的生成式设计

Honglin Li, Chuhao Liu, Yongfeng Guo, Xiaoshan Luo, Yijie Chen, Guangsheng Liu, Yu Li, Zhenyu Wang, Jianzhuo Wu, Shouwei Zuo, Zhen Luo, Cheng Peng, Qinyu Jiang, Jialu Li, Cheng Ma, Zhuohang Xie, Jian Lv, Yufei Ding, Huabin Zhang, Mufan Li, Yanchao Wang, Wan-Lu Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一种硼辅助非晶化策略,通过短程有序约束的生成框架ApolloX设计成分复杂的多金属BOx非晶氧化物,实验验证了硼含量调控短程有序与非晶化的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16898 2026-06-26 math.OC 版本更新 50%

On the existence of optimal multi-valued decoders and their accuracy bounds for ill-posed inverse problems

关于不适定逆问题的最优多值解码器的存在性及其精度界

Nina Maria Gottschling, Paolo Campodonico, Vegard Antun, Anders C. Hansen

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对不适定逆问题中解码器多样性问题,提出统一框架,通过最坏情况和平均误差给出仅依赖于测量模型、模型类和噪声模型的通用精度界,并构造达到最低重建误差的集值变分解。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 4 篇

2606.27332 2026-06-26 cs.CV 新提交 57%

RoPEMover: Depth-Aware Object Relocation via Positional Embeddings

RoPEMover: 通过位置嵌入实现深度感知的物体重定位

Ipek Oztas, Duygu Ceylan, Aybars Bugra Aksoy, Aysegul Dundar

机构 * Bilkent University(比尔肯大学) Brown University(布朗大学) Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于扩散Transformer位置表示(RoPE)的几何感知物体运动方法,通过深度感知的2D RoPE扩展实现3D空间位移,在合成数据与少量真实图像训练下,实现物体身份保持、遮挡区域生成及阴影光照一致更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27192 2026-06-26 cs.CV 新提交 57%

LISA: Likelihood Score Alignment for Visual-condition Controllable Generation

LISA: 似然分数对齐用于视觉条件可控生成

Yanghao Wang, Hongxu Chen, Jiazhen Liu, Zhenqi He, Rui Liu, Zhen Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Huawei Research(华为研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出LISA方法,通过将侧网络中间特征与近似似然分数对齐,加速训练收敛并提升生成质量,且不增加推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18969 2026-06-26 math.OC 版本更新 50%

A Local Discontinuous Galerkin Method for Dirichlet Boundary Control Problems

Dirichlet边界控制问题的局部间断Galerkin方法

Peter Benner, Michael Hinze, Hamdullah Yücel

专题命中 可控生成 :diffusion(abstract)

AI总结 针对二维凸多边形域上对流扩散方程的L^2-Dirichlet边界控制问题,采用局部间断Galerkin方法离散,推导了全离散和变分离散控制逼近的先验误差估计,数值实验验证了方法性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23527 2026-06-26 cs.LG 版本更新 50%

Normalizing Flows are Capable Models for Continuous Control

归一化流是连续控制的有效模型

Raj Ghugare, Benjamin Eysenbach

机构 * Department of Computer Science(计算机科学系)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种归一化流架构,可无缝集成到强化学习算法中作为策略、Q函数和占用度量,在模仿学习、离线、目标条件和无监督RL中取得更高性能。

Comments Project page with code - https://rajghugare19.github.io/nf4rl/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 2 篇

2606.26171 2026-06-26 cs.CV cs.AI 新提交 85%

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

LCG: 基于稀疏关系注意力的一致长上下文图像生成

Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出LCG框架,利用稀疏关系注意力(SRA)和路由一致性约束(RCC),在长序列图像生成中保持语义和外观一致性,并构建了大规模数据集LCCD进行训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26618 2026-06-26 cs.CL 新提交 50%

Closing the Quality Gap in Low-Resource Text-to-Speech: LoRA Fine-Tuning of VoxCPM2 for Khmer and Korean

缩小低资源文本转语音的质量差距:针对高棉语和韩语的VoxCPM2 LoRA微调

Phannet Pov, Sovandara Chhoun, Hyun Woo Park, Wan-Sup Cho, Saksonita Khoeurn

机构 * Department of Big Data, Chungbuk National University(Chungbuk National University大数据系) Institute of Digital Research and Innovation, Cambodia Academy of Digital Technology(柬埔寨数字技术研究院) Department of Management Information Systems, Chungbuk National University(Chungbuk National University管理信息系) BigData Labs Co., Ltd.(BigData Labs公司)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 针对高棉语和韩语,使用LoRA微调VoxCPM2模型,在仅训练0.19%-3.03%参数的情况下,高棉语MOS从3.85提升至4.23,而韩语无提升,表明适配主要帮助基础模型表现差的语言。

Comments 5 pages, 1 figure, 4 tables. IEEE conference format (IEEEtran)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 5 篇

2606.26899 2026-06-26 cs.AI 新提交 71%

Generative Retrieval via Diffusion Transformer with Metric-Ordered Sequence Training and Hybrid-Policy Preference Optimization

基于扩散Transformer的生成式检索:度量有序序列训练与混合策略偏好优化

Chenghao Liu, Yu Zhang, Zhongtao Jiang, Kun Xu, Zhenwei An, Renzhi Wang, Zhao Wang, Jiachen Zhang, Yuxiao Zhang, Kun Xu, Songfang Huang

机构 * Peking University(北京大学)

专题命中 图像生成评测 :diffusion(title)

AI总结 针对模式保持的属性检索任务,提出MO-DiT+HPPO框架,通过度量有序训练和混合策略偏好优化,在八个领域分割中七个取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27376 2026-06-26 cs.CV 新提交 70%

Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

Ask, Solve, Generate: 通过自一致性奖励实现自我进化的统一多模态理解与生成

Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar, Abdelrahman Shaker, Fahad Khan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一个自我进化的训练框架,通过内部角色(提议者、求解者、生成者)和自一致性信号,无需人工标注或外部奖励模型,同时提升统一多模态模型的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07295 2026-06-26 cs.CV cs.AI cs.LG 版本更新 70%

Reconstruction Alignment Improves Unified Multimodal Models

重建对齐改进统一多模态模型

Ji Xie, Trevor Darrell, Luke Zettlemoyer, XuDong Wang

机构 * UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Duke University(杜克大学)

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出重建对齐(RECA),一种资源高效的后训练方法,利用视觉理解编码器嵌入作为密集文本提示,通过自监督重建损失对齐理解与生成,显著提升多种统一多模态模型的生成和编辑性能。

Comments 43 pages, 36 figures and 14 tables; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26498 2026-06-26 math.OC cs.LG 新提交 50%

Mean-Field PhiBE: Continuous-Time Mean-Field Reinforcement Learning from Discrete-Time Data

平均场 PhiBE:基于离散时间数据的连续时间平均场强化学习

Erhan Bayraktar, Martin Hernandez, Qinxin Yan, Yuhua Zhu

机构 * Department of Mathematics, University of Michigan, Ann Arbor, MI, USA(密歇根大学数学系,安阿伯,密歇根州,美国) Department of Statistics and Data Science, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校统计与数据科学系,加利福尼亚州,美国) Program in Applied and Computational Mathematics, Princeton University, Princeton, NJ, USA(普林斯顿大学应用与计算数学项目,普林斯顿,新泽西州,美国)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 针对仅离散时间数据可用但种群连续演化的模型无关连续时间平均场控制问题,提出平均场PhiBE方法,将离散时间信息融入Wasserstein空间上的连续时间PDE,并推导策略梯度定理,实现模型无关的演员-评论家算法,证明一阶一致性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09976 2026-06-26 cs.LG cs.RO 版本更新 50%

Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models

视觉-语言-动作模型的流匹配策略的强化微调

Mingyang Lyu, Yinqian Sun, Erliang Lin, Huangrui Li, Ruolin Chen, Feifei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知人工智能实验室,自动化研究所,中国科学院,北京,中国) Beijing Institute of AI Safety and Governance, China(北京人工智能安全与治理研究院,中国) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术国家重点实验室) Beijing Key Laboratory of Safe AI and Superalignment, China(北京安全人工智能与超对齐重点实验室,中国) University of Chinese Academy of Sciences (UCAS), Beijing, China(中国科学院大学(UCAS),北京,中国) Long-term AI,Beijing,China(长期人工智能,北京,中国)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 针对流匹配模型强化微调中重要性采样计算困难的问题,提出流策略优化算法,通过条件流匹配目标、结构感知信用分配等技术实现稳定在线微调,在LIBERO和ALOHA任务上超越基线。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 6 篇

2412.09959 2026-06-26 cs.CV 版本更新 79%

Towards Consistent and Efficient Dataset Distillation via Diffusion-Driven Selection

通过扩散驱动选择实现一致且高效的数据集蒸馏

Xinhao Zhong, Shuoyang Sun, Zhaoyang Xu, Xulin Gu, Bin Chen, Min Zhang, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Pengcheng Laboratory(鹏城实验室)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出利用扩散先验进行补丁选择而非生成的新框架,通过噪声预测和损失差异识别图像中独特区域,结合类内聚类和排序实现单步蒸馏,在多种指标和设置下优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27371 2026-06-26 cs.CV 新提交 70%

Don't Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance

不要停留在众数!通过特征自引导缓解预训练流模型中的多样性坍塌

Pradhaan S Bhat, Rishubh Parihar, Abhijnya Bhat, R. Venkatesh Babu

机构 * Indian Institute of Science(印度科学研究所) Stanford University(斯坦福大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种无需训练的自引导机制,通过分散批次生成中的内部特征并施加流形正则化,在几乎不增加推理成本的前提下缓解预训练流模型的多样性坍塌问题。

Comments Accepted by ECCV 2026. Project page: https://dont-settle-at-the-mode.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18974 2026-06-26 cs.CV 新提交 57%

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25006 2026-06-26 cs.LG 新提交 50%

Scalable Peptide Design via Memory-Efficient Equivariant Transformer

通过内存高效等变变压器实现可扩展的肽设计

Rui Jiao, Xiangzhe Kong, Yinjun Jia, Yijia Zhang, Ziyi Yang, Yang Liu, Jianzhu Ma

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Chemistry, Tsinghua University(清华大学化学系)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出内存高效等变变压器(MEET),通过线性内存缩放和几何特征改进,实现全原子肽的序列与结构协同设计,在生成质量、结合亲和力和多样性上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18195 2026-06-26 cs.CL 新提交 50%

Learning from the Self-future: On-policy Self-distillation for dLLMs

从自我未来学习:面向扩散LLM的在线自蒸馏

Yifu Luo, Zeyu Chen, Haoyu Wang, Xinhao Hu, Yuxuan Zhang, Zhizhou Sha, Shiwei Liu

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑工业大学) Nanyang Technological University(南洋理工大学) University of British Columbia(不列颠哥伦比亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) ELLIS Institute Tubingen(ELLIS蒂宾根研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tubingen AI Center(蒂宾根人工智能中心)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出首个面向扩散大语言模型的在线自蒸馏框架d-OPSD,通过自我生成答案作为后缀条件实现从自我未来经验学习,并将监督从词元级转向步骤级,在推理基准上以约10%的优化步骤超越RLVR和SFT基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13648 2026-06-26 math.PR cs.NA math.NA 版本更新 50%

Sticky CIR process with potential: invariant measure and exact sampling

具有势函数的粘性CIR过程:不变测度与精确采样

Tony Shardlow

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文研究了一维粘性CIR过程,该过程在[0,∞)上扩散,并在原点处具有粘性边界条件,出现在基于Hadamard-Langevin动力学的稀疏贝叶斯推断框架中。对于参数范围δ∈(1,2),其中原点可到达但不可吸收,证明了过程的良定性和不变测度的唯一性,该测度是零点质量与内部加权伽马型密度的混合。通过构造一个显式格林函数,用以构造零势情况下的精确采样器。对于非平凡势函数G,通过Girsanov测度变换建立倾斜不变测度的存在性和唯一性,并开发了两种采样算法:一种是修正的Metropolis-Hastings采样器,可精确采样目标不变测度;另一种是未调整的Langevin算法(ULA),每步成本较低但引入O(h)的偏差。数值实验验证了预测行为:Metropolis-Hastings采样器在所有步长下都能达到目标不变测度,而ULA表现出预期的O(h)偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏