arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-26 至 2026-06-26 共收录 17 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2503.15283 2026-06-26 cs.CV 版本更新 88%

TF-TI2I: Training-Free Text-and-Image-to-Image Generation via Multi-Modal Implicit-Context Learning in Text-to-Image Models

TF-TI2I:通过文本到图像模型中的多模态隐式上下文学习实现无需训练的文本与图像到图像生成

Teng-Fang Hsiao, Bo-Kai Ruan, Yi-Lun Wu, Tzu-Ling Lin, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 提出无需训练的TF-TI2I方法,利用MM-DiT架构中文本标记隐式学习视觉信息,通过参考上下文掩码和胜者全取模块实现选择性信息共享,并引入FG-TI2I基准,在复杂图像生成任务中表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28091 2026-06-26 cs.CV 版本更新 85%

Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation

Qwen-Image-Bench:从生成到创造——文本到图像评估

Niantong Li, Guangzheng Hu, Weixu Qiao, Ying Ba, Qichen Hong, Shijun Shen, Jinlin Wang, Fan Zhou, Jianye Kang, Xin Shang, Ziyi He, Wei Wang, Dalin Li, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Yuxiang Chen, Yan Shu, Yanran Zhang, Yilei Chen, Yixian Xu, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, Hongzhu Shi, Yi Wang, Bing Zhao, Hu Wei, Lin Qu, Chenfei Wu

机构 * Alibaba(阿里巴巴)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对现有文本到图像评估基准缺乏对真实世界保真度和创造性生成能力的考量,本文提出Qwen-Image-Bench,一个与专业艺术家共同设计的创作者中心基准,通过分层分类体系、1000个分层提示和基于Qwen3.6-27B的统一评判模型Q-Judger,实现细粒度、可归因的诊断,有效区分领先的T2I模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2602.04349 2026-06-26 cs.CV cs.AI 版本更新 57%

VecSet-Edit: Unleashing Pre-trained LRM for Mesh Editing from Single Image

VecSet-Edit:利用预训练的LRM进行单图像网格编辑

Teng-Fang Hsiao, Bo-Kai Ruan, Yu-Lun Liu, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VecSet-Edit,利用VecSet LRM进行单图像网格编辑,通过Mask引导的token播种和注意力对齐的token门控策略,结合漂移感知的token修剪和细节保留的纹理烘焙模块,实现高精度网格编辑。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 8 篇

2508.17434 2026-06-26 cs.CV 版本更新 79%

TinySR: Pruning Diffusion for Real-World Image Super-Resolution

TinySR:剪枝扩散模型用于现实世界图像超分辨率

Linwei Dong, Qingnan Fan, Yuhang Yu, Qi Zhang, Jinwei Chen, Yawei Luo, Changqing Zou

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co. Ltd(沃伊通信有限公司) Zhejiang Lab(浙江实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TinySR,一种针对现实世界图像超分辨率的紧凑高效扩散模型,通过动态块激活和扩展-腐蚀策略实现实时性能与高质量输出,相比教师模型TSD-SR在计算成本和参数量上分别减少5.68倍和83%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13354 2026-06-26 cond-mat.mtrl-sci cs.AI 版本更新 78%

Finetuning-Free Diffusion Model with Adaptive Constraint Guidance for Inorganic Crystal Structure Generation

无需微调的扩散模型结合自适应约束引导用于无机晶体结构生成

Auguste de Lambilly, Vladimir Baturin, David Portehault, Guillaume Lambard, Nataliya Sokolovska, Florence d'Alché-Buc, Jean-Claude Crivello

机构 * CNRS-Saint-Gobain-NIMS(法国国家科学研究中心-圣戈班-日本纳米科学研究所) Laboratory for Innovative Key Materials and Structures (LINK)(创新关键材料与结构实验室) Laboratory of Computational, Quantitative, and Synthetic Biology (CQSB)(计算、定量与合成生物学实验室) Data-driven Materials Design Group(数据驱动材料设计组) Center for Basic Research on Materials(材料基础研究中心) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信,巴黎理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出一种基于扩散模型的自适应约束引导生成框架,无需微调即可结合用户定义的物理化学约束,生成满足热力学稳定性和几何约束的无机晶体结构。

Comments Full article including supplementary information, 56 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18186 2026-06-26 math.NA cs.NA 版本更新 78%

Trajectory-Based RBF Collocation Method via Closest-Point Embedding for Surface Advection-Diffusion Equations

基于轨迹的径向基函数配点法通过最近点嵌入求解表面平流-扩散方程

Xiaobin Li, Leevan Ling, Yizhong Sun

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出基于轨迹的RBF配点法,通过特征处理与Kansa型RBF配点法解耦平流和扩散,利用最近点映射嵌入窄带域,证明与原表面PDE等价,数值实验验证稳定性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23814 2026-06-26 cs.CV cs.AI 版本更新 57%

Mapping License Plate Recoverability Under Extreme Viewing Angles for Opportunistic Urban Sensing

在极端视角下映射车牌可恢复性以实现机会性城市感知

Igor Adamenko, Orpaz Ben Aharon, Yehudit Aperstein, Alexander Apartsin

机构 * Afeka Academic College of Engineering(阿法卡工程学院) Holon Institute of Technology(霍隆理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文研究了在极端视角下通过机会性城市感知实现车牌识别的可恢复性问题,提出了一种任务无关的方法来量化恢复边界,结合合成退化参数密集扫描与两个总结指标,评估了不同恢复模型的性能。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12062 2026-06-26 cs.CV 版本更新 57%

Learning Language-Driven Sequence-Level Modal-Invariant Representations for Video-Based Visible-Infrared Person Re-Identification

基于语言驱动的序列级模态不变表示学习用于视频可见光-红外行人重识别

Xiaomei Yang, Antai Liu, Xizhan Gao, Fa Zhu, Sijie Niu, Giancarlo Fortino

机构 * Shandong Key Laboratory of Ubiquitous Intelligent Computing, School of Information Science and Engineering, University of Jinan(山东省 Ubiquitous Intelligent Computing 重点实验室,济南大学信息科学与工程学院) College of Information Science and Technology & Artificial Intelligence, Nanjing Forestry University(信息科学与技术及人工智能学院,南京林业大学) Department of Informatics, Modeling, Electronics, and Systems, University of Calabria(信息学、建模、电子与系统系,卡利博大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出LSMRL方法,通过CLIP的时空特征学习、语义扩散和跨模态交互模块,结合模态级损失,学习序列级模态不变表示,在VVI-ReID任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27275 2026-06-26 cond-mat.stat-mech 版本更新 50%

Non-stationary current fluctuations in 1D boundary-driven diffusive systems via Macroscopic Fluctuation Theory

一维边界驱动扩散系统中非平稳电流涨落的宏观涨落理论研究

Daisuke Suzuki, Tomohiro Sasamoto

专题命中 扩散模型 :diffusion(abstract)

AI总结 利用宏观涨落理论(MFT)精确推导了具有恒定扩散系数和任意迁移率的一维边界驱动扩散系统在弛豫过程中的电流方差,以及反射布朗运动(RBM)中电流的累积生成函数,展示了MFT框架对非稳态电流涨落的定量描述能力。

Comments 32 pages, 7 figures, v2: Typos corrected, simplified expressions and derivations added

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07043 2026-06-26 cond-mat.mtrl-sci 版本更新 50%

Boron-assisted synthesis of compositionally complex amorphous oxides via short-range-order-constrained generative design

硼辅助合成成分复杂非晶氧化物:基于短程有序约束的生成式设计

Honglin Li, Chuhao Liu, Yongfeng Guo, Xiaoshan Luo, Yijie Chen, Guangsheng Liu, Yu Li, Zhenyu Wang, Jianzhuo Wu, Shouwei Zuo, Zhen Luo, Cheng Peng, Qinyu Jiang, Jialu Li, Cheng Ma, Zhuohang Xie, Jian Lv, Yufei Ding, Huabin Zhang, Mufan Li, Yanchao Wang, Wan-Lu Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一种硼辅助非晶化策略,通过短程有序约束的生成框架ApolloX设计成分复杂的多金属BOx非晶氧化物,实验验证了硼含量调控短程有序与非晶化的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16898 2026-06-26 math.OC 版本更新 50%

On the existence of optimal multi-valued decoders and their accuracy bounds for ill-posed inverse problems

关于不适定逆问题的最优多值解码器的存在性及其精度界

Nina Maria Gottschling, Paolo Campodonico, Vegard Antun, Anders C. Hansen

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对不适定逆问题中解码器多样性问题,提出统一框架,通过最坏情况和平均误差给出仅依赖于测量模型、模型类和噪声模型的通用精度界,并构造达到最低重建误差的集值变分解。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 可控生成 2 篇

2601.18969 2026-06-26 math.OC 版本更新 50%

A Local Discontinuous Galerkin Method for Dirichlet Boundary Control Problems

Dirichlet边界控制问题的局部间断Galerkin方法

Peter Benner, Michael Hinze, Hamdullah Yücel

专题命中 可控生成 :diffusion(abstract)

AI总结 针对二维凸多边形域上对流扩散方程的L^2-Dirichlet边界控制问题,采用局部间断Galerkin方法离散,推导了全离散和变分离散控制逼近的先验误差估计,数值实验验证了方法性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23527 2026-06-26 cs.LG 版本更新 50%

Normalizing Flows are Capable Models for Continuous Control

归一化流是连续控制的有效模型

Raj Ghugare, Benjamin Eysenbach

机构 * Department of Computer Science(计算机科学系)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种归一化流架构,可无缝集成到强化学习算法中作为策略、Q函数和占用度量,在模仿学习、离线、目标条件和无监督RL中取得更高性能。

Comments Project page with code - https://rajghugare19.github.io/nf4rl/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 2 篇

2509.07295 2026-06-26 cs.CV cs.AI cs.LG 版本更新 70%

Reconstruction Alignment Improves Unified Multimodal Models

重建对齐改进统一多模态模型

Ji Xie, Trevor Darrell, Luke Zettlemoyer, XuDong Wang

机构 * UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Duke University(杜克大学)

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出重建对齐(RECA),一种资源高效的后训练方法,利用视觉理解编码器嵌入作为密集文本提示,通过自监督重建损失对齐理解与生成,显著提升多种统一多模态模型的生成和编辑性能。

Comments 43 pages, 36 figures and 14 tables; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09976 2026-06-26 cs.LG cs.RO 版本更新 50%

Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models

视觉-语言-动作模型的流匹配策略的强化微调

Mingyang Lyu, Yinqian Sun, Erliang Lin, Huangrui Li, Ruolin Chen, Feifei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知人工智能实验室,自动化研究所,中国科学院,北京,中国) Beijing Institute of AI Safety and Governance, China(北京人工智能安全与治理研究院,中国) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术国家重点实验室) Beijing Key Laboratory of Safe AI and Superalignment, China(北京安全人工智能与超对齐重点实验室,中国) University of Chinese Academy of Sciences (UCAS), Beijing, China(中国科学院大学(UCAS),北京,中国) Long-term AI,Beijing,China(长期人工智能,北京,中国)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 针对流匹配模型强化微调中重要性采样计算困难的问题,提出流策略优化算法,通过条件流匹配目标、结构感知信用分配等技术实现稳定在线微调,在LIBERO和ALOHA任务上超越基线。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 2 篇

2412.09959 2026-06-26 cs.CV 版本更新 79%

Towards Consistent and Efficient Dataset Distillation via Diffusion-Driven Selection

通过扩散驱动选择实现一致且高效的数据集蒸馏

Xinhao Zhong, Shuoyang Sun, Zhaoyang Xu, Xulin Gu, Bin Chen, Min Zhang, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Pengcheng Laboratory(鹏城实验室)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出利用扩散先验进行补丁选择而非生成的新框架,通过噪声预测和损失差异识别图像中独特区域,结合类内聚类和排序实现单步蒸馏,在多种指标和设置下优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13648 2026-06-26 math.PR cs.NA math.NA 版本更新 50%

Sticky CIR process with potential: invariant measure and exact sampling

具有势函数的粘性CIR过程:不变测度与精确采样

Tony Shardlow

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文研究了一维粘性CIR过程,该过程在[0,∞)上扩散,并在原点处具有粘性边界条件,出现在基于Hadamard-Langevin动力学的稀疏贝叶斯推断框架中。对于参数范围δ∈(1,2),其中原点可到达但不可吸收,证明了过程的良定性和不变测度的唯一性,该测度是零点质量与内部加权伽马型密度的混合。通过构造一个显式格林函数,用以构造零势情况下的精确采样器。对于非平凡势函数G,通过Girsanov测度变换建立倾斜不变测度的存在性和唯一性,并开发了两种采样算法:一种是修正的Metropolis-Hastings采样器,可精确采样目标不变测度;另一种是未调整的Langevin算法(ULA),每步成本较低但引入O(h)的偏差。数值实验验证了预测行为:Metropolis-Hastings采样器在所有步长下都能达到目标不变测度,而ULA表现出预期的O(h)偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏