arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-28 至 2026-07-28 共收录 141 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2607.22655 2026-07-28 cs.AI 新提交 50%

EventOD: Event-Aware OD Flow Generation via LLM-Guided Semantic Modulation

EventOD:通过大语言模型引导的语义调制实现事件感知的OD流生成

Jie Zhao, Jie Feng, Can Rong, Zhihan Hou, Peng Lu, Yong Li

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Zhongguancun Academy(中关村科学城研究院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工学院科研与技术联盟) Xiuzhong College, Tsinghua University(清华大学致理书院) Department of Automation, Central South University(中南大学自动化学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 研究在破坏性事件下估计OD流的问题,提出EventOD框架,利用大语言模型和轻量级适应模块,通过输入级调制实现事件感知适应,实验表明该方法能提高重建精度和分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22548 2026-07-28 cs.AI cs.LG cs.PF 新提交 50%

SeT-Diff: Towards Semantic Foundation Models for HPC Telemetry and Time-Series

SeT-Diff:面向高性能计算遥测和时间序列的语义基础模型

Giovanni B. Esposito, Francesco Antici, Daniele Cesarini, Andrea Bartolini

机构 * University of Bologna(博洛尼亚大学) CINECA(意大利国家科研计算中心)

专题命中 可控生成 :diffusion(abstract)

AI总结 针对数据中心计算节点建模需求,提出SeT-Diff基础模型,采用基于扩散的方法,在真实超级计算机数据集实验中,其重建任务平均绝对误差为0.0470,有零样本排列稳定性,单个模型可有效执行多种任务,是高性能计算系统有效的数据驱动数字孪生。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23391 2026-07-28 math.NA cs.NA 新提交 50%

The symmetric V-cycle can diverge under the multigrid axioms for cell-centred discretisations

在用于格心离散化的多重网格公理下,对称V循环可能发散

Ming Hei Wong

专题命中 可控生成 :diffusion(abstract)

AI总结 研究格心离散化下多重网格方法中标准对称V循环的收敛性,通过两种构造表明其可能发散,即使满足相关公理假设,而W循环仍一致收缩,还给出了平滑计数阈值与相关常数的关系及具体离散化中的发散情况。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23032 2026-07-28 math.OC 新提交 50%

Output Regulation for Linear Parabolic Systems Using Finite-Dimensional Tracking-Error-Based Control

基于有限维跟踪误差控制的线性抛物型系统输出调节

Bingsen Li, Emilia Fridman, George Weiss

专题命中 可控生成 :diffusion(abstract)

AI总结 研究一维扩散反应系统在干扰和参考信号由不稳定外系统生成时的输出调节问题,提出基于有限维跟踪误差的调节器设计方法,通过推导组合装置转化问题,利用模态分解法刻画可观测性,证明观测器增益性质并给出LMI条件,分析了含未知时变测量延迟的情况。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24619 2026-07-28 cond-mat.stat-mech physics.bio-ph 新提交 50%

Control of morphology and topology in a lattice model of branching morphogenesis

分支形态发生晶格模型中形态和拓扑的控制

Christian Hanauer, Frank Jülicher, Efe Ilker

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究提出结合非平衡物理与发育生物学思想的晶格模型,用于形态发生素控制的分支形态发生。通过局部算子控制拓扑,研究分支模式动力学,发现拓扑保持稳态簇的回转半径与簇大小呈幂律缩放,给出了不同晶格中的指数。

Comments Main text and appendix: 11 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 4 篇

2607.24140 2026-07-28 cs.CV 新提交 79%

Image Inpainting via Stochastic Dynamics

基于随机动力学的图像修复

Jiaqi Kuang, Zihao Guo, Zhongmin Qian

机构 * Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学牛津 - 苏州高等研究院) Institute for Advanced Research, Great Bay University(大湾区大学高等研究院) Mathematical Institute, University of Oxford(牛津大学数学研究所)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 研究图像修复问题,提出基于数据引导随机动力学的非参数方法,无需网络训练,通过反向随机微分方程及核加权校正引导重建,在多个数据集实验中表现优于其他方法,证明经验参考统计对图像修复的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02692 2026-07-28 cs.CV 79%

FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution

FiDeSR: 高保真且细节保留的一步扩散超分辨率

Aro Kim, Myeongjin Jang, Chaewon Moon, Youngjin Shin, Jinwoo Jeong, Sang-hyo Park

机构 * Kyungpook National University Korea Electronics Technology Institute

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 FiDeSR通过细节感知加权策略和残差-残差噪声细化,实现高保真且细节保留的一步扩散超分辨率

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 38270-38280

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22793 2026-07-28 eess.IV cs.CV 新提交 57%

Small, Bias-Free, Blind and Convolutional Denoiser: A compact ConvNeXt U-Net for blind Gaussian color-image denoising

小型、无偏差、盲态和卷积去噪器:用于盲高斯彩色图像去噪的紧凑型ConvNeXt U-Net

Nikolas Markou

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 研究针对盲高斯彩色图像去噪,提出结合多种要素的紧凑型无偏差ConvNeXt U-Net即BF-ConvUNeXt。通过特殊设计使其具有齐次性,能盲态泛化。训练单一模型,在多数据集多噪声水平下评估表现良好,虽略落后于最优技术,但参数少,还推动相关逆问题研究。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22924 2026-07-28 cs.CV 新提交 57%

Layering Virtual Try-On

分层虚拟试穿

Chun Feng, Bowei Chen, Mengyi Shan, Ira Kemelmacher-Shlizerman

机构 * University of Washington(华盛顿大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 研究针对现实中服装分层搭配的虚拟试穿难题,提出LVTON方法。先通过自动数据生成管道训练获取一般VTON先验知识,再在专用数据集微调学习分层逻辑,在LVTON基准及传统VTON基准上取得优异成果,展现零样本能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 2 篇

2607.23673 2026-07-28 cs.CV 新提交 79%

Contrastive Parameter Disentanglement for Multi-modal Remote Sensing Image Generation

用于多模态遥感图像生成的对比参数解缠

Yu Zhang, Wenda Zhao, Haojun Tang, Haipeng Wang

机构 * School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院) Unit 92728 of PLA(中国人民解放军92728部队)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 针对现有遥感图像生成方法局限,提出对比参数解缠框架,通过对比参数解缠模块、解缠优化策略及查询-键结构转移机制,实现多模态遥感图像高质量生成,在相关任务中性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22637 2026-07-28 cs.AI cs.IT math.IT 新提交 50%

Fast Cross-Scenario Adaptation of CSI Models via Channel Conditional Parameter Generation

通过信道条件参数生成实现CSI模型的快速跨场景自适应

Xudong Zou, Siyu Wu, Zunlei Feng, Jie Song, Yuanyu Wan, Mingli Song, Jiacong Hu

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(浙江大学杭州高新技术产业开发区(滨江)区块链与数据安全国家重点实验室)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 研究针对CSI模型在不同场景适应性差的问题,提出CCPG方法,通过组件冻结实验识别瓶颈,生成轻量级LoRA权重,经多种技术处理实现快速跨场景自适应,实验表明该方法能高效部署CSI模型用于6G通信。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 6 篇

2605.28736 2026-07-28 cs.RO 版本更新 80%

Imitation Learning for Robot Assistance in Open Surgery: A Multi-Policy Evaluation on Suture Following

开放手术中机器人辅助的模仿学习:针对缝合跟随的多策略评估

Xucheng Wang, Zhizhou Yang, Xiaoman Zhang, Sung Eun Kim, Romain Hardy, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院) Massachusetts General Hospital(麻省总医院)

专题命中 图像生成评测 :diffusion(summary_cn,abstract)

AI总结 本研究首次评估通用模仿学习在开放手术中用于外科医生-机器人协作辅助的可行性,以缝合跟随(每次缝合时助手执行的抓取-拉动-释放动作)为任务,通过比较四种策略(ACT、Diffusion Policy、SmolVLA、π₀)在28个训练模型上的表现,发现π₀在数据效率、背景鲁棒性和轨迹平滑性上最优,并在机器人缝合试验中达到92%的缝合完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19149 2026-07-28 cs.CR 版本更新 71%

ReVision : A Post-Hoc, Vision-Based Technique for Replacing Unacceptable Concepts in Image Generation Pipeline

ReVision:一种基于视觉的后处理技术,用于在图像生成管道中替换不可接受的概念

Gurjot Singh, Prabhjot Singh, Aashima Sharma, Maninder Singh, Ryan Ko

专题命中 图像生成评测 :image generation(title)

AI总结 ReVision是一种无需训练的后处理框架,通过视觉模型检测并替换图像生成中不安全的概念,提升安全性与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24560 2026-07-28 cs.CV cs.AI 新提交 57%

EgoPlay: Event-Triggered Video Editing for Egocentric Streams

EgoPlay:用于第一人称视角视频流的事件触发式视频编辑

Jinjie Mai, Gordon Guocheng Qian, Willi Menapace, Arpit Sahni, Chaoyang Wang, Ashkan Mirzaei, Runjia Li, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Rameen Abdal

机构 * Snap Inc.(Snap公司) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 研究第一人称视角视频流编辑问题,提出EgoPlay,通过微调预训练模型,在单个端到端模型中联合学习事件识别等,构建数据集训练双向视频扩散编辑器,在Ego4D基准测试中表现出色,优于现有基线。

Comments Accepted to SIGGRAPH Asia 2026 as a Conference Paper. Project page: https://egoplay2026.github.io/egoplay

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22745 2026-07-28 cs.CV cs.AI 新提交 57%

AI-generated Images Challenge Visual Trust in High-risk Scenarios

人工智能生成的图像在高风险场景中挑战视觉信任

Yi-Zhi Wang, Yichen Xiao, Linan Yue, Weibo Gao, Yichao Du, Pengfei Fang, Shimin Di, Min-Ling Zhang

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 研究聚焦人工智能生成图像在高风险场景下对视觉信任的挑战,提出SafeIMG基准,涵盖12个安全场景。评估专门探测器和视觉语言模型,发现它们检测可靠性不足,模型解释覆盖低,表明当前探测器在多方面欠缺,难以可靠评估此类图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19259 2026-07-28 cs.CV cs.AI 版本更新 57%

TextRich: A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

一个用于检测 GPT-Image-2 生成的含丰富文本图像的多领域基准

Yijin Wang, Shuyi Wang, Wenhan Zhang, Yuqi Ouyang

机构 * College of Computer Science(计算机科学学院)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 针对现有基准缺乏文本丰富图像检测的问题,构建了包含8602张图像、覆盖6个类别的多领域基准,评估5种检测器,发现性能高度依赖领域且易受JPEG压缩影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05680 2026-07-28 cs.LG cs.AI cs.CV 版本更新 57%

Infinite-Precision Autoregressive Modeling for Vector Graphics and Layouts

AGDC: 变长序列的自回归生成与联合离散连续空间

Yeonsang Shin, Insoo Kim, Bongkeun Kim, Keonwoo Bae, Bohyung Han

机构 * Seoul National University(首尔国立大学) Samsung Electronics(三星电子)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 AGDC通过联合建模离散和连续值,实现变长序列的高精度生成,适用于半导体设计等高精度领域。

Comments Code: https://github.com/yxxshin/IPAM

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 4 篇

2607.09133 2026-07-28 cs.CV cs.AI 版本更新 88%

IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation

IB-Flow:用于少步文本到图像生成的信息瓶颈引导的CFG蒸馏

Yiting Wang, Jingyi Zhang, Wenhu Zhang, Ke Chao, Yves Liang, Kun Cheng, Kang Zhao

机构 * Tsinghua University(清华大学) Wan Team, Alibaba Group(万团队,阿里巴巴集团) HKUST(香港科技大学) Beijing Normal University(北京师范大学)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 研究针对少步文本到图像生成中推理延迟问题,通过信息论将蒸馏建模为信息瓶颈引导的动态互信息博弈,提出双轨自适应框架,消除过度条件化伪影,在2步配置下实现SOTA生成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24157 2026-07-28 cs.CV 新提交 77%

UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling

UniGen-AR:通过自回归建模统一视觉生成

Zhipeng Bao, Zhen Zhu, Nupur Kumari, Anurag Bagchi, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) Toyota Research Institute(丰田研究院)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究统一视觉生成问题,提出UniGen-AR框架,将通用多模态语言模型与视觉自回归解码器配对,能为多任务生成图像值输出,相比基于扩散的基线,推理延迟低达19倍,确立视觉自回归建模为统一视觉生成的高效主干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24403 2026-07-28 cs.CV 新提交 74%

GenSplatCodec: Feed-Forward Gaussian Splatting Compression via One-Step Diffusion

GenSplatCodec:通过一步扩散实现前馈高斯点云压缩

Qiang Hu, Zhenlong Wu, Lei Huang, Zihan Zheng, Xiaoyun Zhang, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协同媒体网络创新中心)

专题命中 效率与蒸馏 :diffusion(title);分类 cs.CV

AI总结 研究针对前馈3D高斯点云压缩难题,提出GenSplatCodec统一编解码器,采用双流编码与几何引导生成解码,经三阶段优化策略,在多数据集实验中展现出优于现有方法的率失真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24377 2026-07-28 cs.LG cs.AI cs.CV 新提交 57%

MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention

MXAttention:用于MXFP4注意力的数据无关最优缩放和预归一化量化

Jianlin Yu, Jing Lin, Linghui Kong, Aiyue Chen, Weiyi Sun, Chenyu Zeng, Wangli Lan, Jinxi Li, Zhuo Zheng, Ziyang Yue, Danning Ke, Fei Yi, Tianchi Hu, Yuan Ding, Yiwu Yao, Junsong Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对基于扩散的视频生成模型中注意力二次成本的瓶颈,提出MXAttention框架,通过引入通用最优缩放和预归一化量化组件,缩小了MXFP4与FP16的成像质量差距,提升了帧级相似度,且性能与强大基线竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏