arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-15 至 2026-07-15 共收录 80 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 62 篇

2604.21427 2026-07-15 physics.plasm-ph astro-ph.EP physics.space-ph 版本更新 50%

Collisionless Phase Mixing Mimics Diffusive Transport in Radiation Belt Observations

无碰撞相混模拟辐射带观测中的扩散输运

Adnane Osmane, Xin An, Anton Artemyev, Oliver Allanson, Jay Albert, Miroslav Hanzelka

专题命中 扩散模型 :diffusion(abstract)

AI总结 辐射带观测中,无碰撞相混效应可产生类似扩散输运的观测信号,挑战传统扩散模型解释。

Comments Accepted in Physical Review Research, 45 pages, 4 Figures. Shortened abstract

Journal ref Phys. Rev. Research 8, 033104, (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05574 2026-07-15 cond-mat.mtrl-sci 版本更新 50%

A coupled fully kinetic hydrogen transport and ductile phase-field fracture framework for modeling hydrogen embrittlement

一种耦合完全动能氢传输与韧性相场断裂框架用于建模氢脆

Abdelrahman Hussein, Yann Charles, Jukka Kömi, Vahid Javaheri

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种耦合完全动能氢传输模型与几何相场断裂方法的综合框架,用于建模氢脆问题,重点研究氢在位错处的输运动力学及韧性断裂与氢诱导脆性断裂的相互作用。

Comments 16 pages, 8 figures

Journal ref International Journal of Plasticity (2026): 104765

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01230 2026-07-15 quant-ph 版本更新 50%

Entropy Flow of a Laser Beam

激光束的熵流

Howard M. Wiseman

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示了理想激光束的熵流特性,通过相位扩散率和粒子流计算熵流,对比了热束与激光束的差异。

Comments 3 pages

Journal ref Optics Letters 51, 3977-3979 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21326 2026-07-15 math.NA cs.NA 版本更新 50%

Discontinuous in time Virtual Element method for Darcy equations coupled with Multi Species Transport with First Order Reaction Network

用于耦合一阶反应网络的多物种输运的达西方程的时间不连续虚拟单元法

Ruben Caraballo, Franco Dassi

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究化学反应物种输运现象,用虚拟单元法离散速度场和物种浓度,通过不连续伽辽金格式进行时间积分,对完整模型简化后推导误差估计,数值实验验证其在时空上的任意阶精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07431 2026-07-15 physics.flu-dyn cond-mat.dis-nn cond-mat.soft nlin.CD physics.app-ph 50%

Harnessing elastic instabilities for enhanced mixing and reaction kinetics in porous media

利用弹性不稳定性增强多孔介质中的混合与反应动力学

Christopher A. Browne, Sujit S. Datta

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过添加柔性聚合物引发弹性不稳定性,有效增强多孔介质中溶质混合与反应动力学,实现混合效率提升和反应速率增强。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 5 篇

2607.06058 2026-07-15 quant-ph 版本更新 71%

SQGen: Structured Quantum Image Generation with Latent-Modulated Quantized Tensor Trains

SQGen:基于潜变量调制量化张量列车的结构化量子图像生成

Guang Lin, Qibin Zhao

专题命中 可控生成 :image generation(title)

AI总结 研究旨在解决NISQ硬件上直接从量子系统生成图像的问题,核心方法是提出基于潜变量调制量化张量列车的SQGen,主要贡献为能稳定训练,端到端生成图像且无需经典解码器,在真实量子硬件上有可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12206 2026-07-15 cs.CV cs.GR 新提交 62%

RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration

RegHead:通过前馈配准生成非拟人头部混合形状

Jiahao Luo, Hao Zhang, Jianqi Chen, Yijie He, Jiaxu Zou, Michael Vasilkovsky, Sergei Korolev, Sergey Tulyakov, Chaoyang Wang, Peter Wonka, James Davis, Jian Wang

机构 * UCSC(加州大学圣克鲁兹分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) KAUST(阿卜杜拉国王科技大学) Snap Inc.(Snap公司)

专题命中 可控生成 :image editing(abstract);分类 cs.CV、cs.GR

AI总结 针对非拟人头部头像构建语义混合形状集成本高的问题,提出含大规模数据集、特定运动表示及快速前馈配准模型的RegHead框架,实验表明其生成表情网格保真度高、速度快,还能实现实时重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12433 2026-07-15 cs.CV cs.AI 新提交 57%

ARDepth: Auto-regressive Monocular Depth Estimation with Progressive Visual Conditioning

ARDepth:基于渐进视觉条件的自回归单目深度估计

Zijie Wang, Wei Zhang, Weiming Zhang, Xiao Tan, Weikai Chen, Xiaoxu Li, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) Baidu Inc.(百度公司) LightSpeed Studios, Tencent America(美国光速工作室,腾讯) School of Computer Science and Artificial Intelligence, Lanzhou University of Technology(兰州理工大学计算机科学与人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究单目深度估计问题,提出ARDepth方法,将其作为结构化自回归生成任务,通过尺度渐进条件和语义感知引导,逐步构建深度表示,实现跨尺度结构一致的深度预测,验证了自回归生成是几何建模的有前景范式。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12456 2026-07-15 math.AP math.OC 新提交 50%

The regional control of a fractional spatio-temporal SIR model

分数阶时空SIR模型的区域控制

Sofwah Ahmad

专题命中 可控生成 :diffusion(abstract)

AI总结 研究有界区域上含分数阶扩散的非线性时空流行病学模型的区域最优控制问题,考虑疾病传播及两种控制方式,建立解的性质,证明最优控制存在并推导条件,发现集中接种疫苗可减轻疾病传播,给出数值模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27947 2026-07-15 cs.RO 版本更新 50%

SANTS: A State-Adaptive Scheduler for World Action Models

SANTS:面向世界动作模型的状态自适应调度器

Yirui Sun, Guangyu Zhuge, Keliang Liu, Jie Gu, Xinyu Bing, Zhongxue Gan, Chunxu Tian

机构 * Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Deep Computing Era Technology Co., Ltd(深计算时代科技有限公司)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出状态自适应噪声轨迹调度器(SANTS),通过根据视频状态动态选择去噪深度来优化视频到动作的扩散策略,在保持控制性能的同时大幅降低推理延迟。

Comments 17 pages, 5 figures, 8 tables. Project page: https://advanced-robotics-lab.github.io/SANTS/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 3 篇

2602.00995 2026-07-15 cs.CV 79%

VAMOS-OCTA: Vessel-Aware Multi-Axis Orthogonal Supervision for Inpainting Motion-Corrupted OCT Angiography Volumes

VAMOS-OCTA:面向血管的多轴正交监督用于修复运动受损的OCT血管成像体积

Nick DiSanto, Ehsan Khodapanah Aghdam, Han Liu, Jacob Watson, Yuankai K. Tao, Hao Li, Ipek Oguz

机构 * Department of Computer Science, Vanderbilt University(计算机科学系,范德比尔特大学) Digital Technology and Innovation, Siemens Healthineers(数字技术与创新,西门子医疗) Department of Biomedical Engineering, Vanderbilt University(生物医学工程系,范德比尔特大学)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 VAMOS-OCTA通过多轴正交监督方法提升运动受损OCT血管成像体积的修复效果,增强B扫描锐度和投影准确性。

Comments Accepted to SPIE Medical Imaging 2026

Journal ref Proc. SPIE 13925, Medical Imaging 2026: Image Processing, 139250T (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16157 2026-07-15 cs.CV 版本更新 57%

Fast and Accurate Image Restoration and Generation with Rank Enhanced Linear Attention

基于秩增强线性注意力的快速准确图像恢复与生成

Yuang Ai

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决Transformer自注意力二次复杂度问题,提出秩增强线性注意力(RELA)及高效视觉Transformer(LAformer),通过集成深度卷积丰富特征表示,经实验验证LAformer在图像恢复和生成任务中性能优且计算高效。

Comments Code: https://github.com/shallowdream204/LAformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12571 2026-07-15 cs.RO 新提交 50%

TrustVLA: Mechanism-Guided Inference-Time Defense Against Vision-Language-Action Backdoors

TrustVLA:针对视觉-语言-动作后门的机制引导推理时防御

Pinhan Fu, Xianda Guo, Xuetao Li, Wenke Huang, Ruilin Wang, Weiheng Zhao, Wei Sui, Mang Ye

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) D-Robotics(D-机器人公司) HUST(华中科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 图像修复 :inpainting(abstract)

AI总结 研究视觉-语言-动作模型中毒后门问题,通过两种攻击识别出紧凑因果足迹机制,基于此提出TrustVLA防御,能检测异常证据演变、定位支持并恢复观测,在多评估中降低攻击成功率且保持干净任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 3 篇

2607.12882 2026-07-15 cs.MM cs.IR 新提交 57%

What Would You Click? Personalized Video Thumbnail Generation with Preference-aware Highlight Retrieval

你会点击什么?基于偏好感知高光检索的个性化视频缩略图生成

Zhiyu He, Zecheng Zhao, Tong Chen, Zi Huang, Yiqun Liu, Min Zhang

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.MM

AI总结 研究针对视频平台个性化视频缩略图生成问题,提出两阶段框架,先通过偏好感知检索选取视觉锚点,再经VLM引导的扩散管道生成缩略图,实验和用户研究证明该方法性能优且能提升用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12592 2026-07-15 cs.CV 新提交 57%

WanToFight: Real-Time Generative Game Engine for Multi-Player Combat Interaction

WanToFight:用于多人战斗交互的实时生成游戏引擎

Li Hu, Guangyuan Wang, Peng Zhang, Bang Zhang

机构 * Alibaba Tongyi Lab(阿里巴巴通义实验室)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 WanToFight是用于多人战斗交互的实时生成游戏引擎,基于Wan-1.3B视频扩散变换器构建三个组件,解决了先前引擎未共同处理的问题,能结合多种玩法,在特定配置下维持30FPS,是首个此类集成系统。

Comments Project Page: https://humanaigc.github.io/wantofight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11919 2026-07-15 cs.NE cs.AI cs.CV cs.LG 新提交 57%

Do You Remember? Toward Memory-Centric Multimodal AI

你还记得吗?迈向以记忆为中心的多模态人工智能

Xuguang Yu, Weigang Zheng, Minyue Yu

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究针对当前多模态语言模型缺乏重建性记忆的问题,提出DoYouRemember三阶段架构,通过VQ-VAE、LoRA微调语言模型和扩散解码器实现,经实验发现语言模型隐藏状态视觉信息少,还解决了共享记忆矩阵训练问题,统一相关发现于信息论框架。

Comments 43 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 2 篇

2606.09076 2026-07-15 cs.CV 版本更新 57%

Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

超越标量奖励:将推理内化到分数分布中

Xin Jin, Huanqia Cai, Zhen Li, Zechao Zhan, Dengyang Jiang, Aiming Hao, Yuming Jiang, Xiangpeng Yang, Chunle Guo, Peng Gao, Ming-Ming Cheng, Steven C. H. Hoi

机构 * Alibaba Group(阿里巴巴集团) Nankai University(南开大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 提出Z-Reward框架,通过教师-学生模型将推理型奖励内化为紧凑VLM的分数分布,实现高效且准确的文本到图像优化。

Comments Z-Image Team Technical Report. Project page: https://srameo.github.io/projects/z-reward/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06796 2026-07-15 cs.RO 版本更新 50%

RoboDesign1M: A Large-scale Dataset for Robot Design Understanding

RoboDesign1M:用于机器人设计理解的大规模数据集

Tri Le, Toan Nguyen, Quang Tran, Quang Nguyen, Baoru Huang, Hoan Nguyen, Minh Nhat Vu, Tung D. Ta, Anh Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) University of Liverpool(利物浦大学) University of Information Technology(信息技术大学) Automation & Control Institute(自动化与控制研究所) Department of Creative Informatics(创意信息系) Faculty of Environment and Information Studies(环境与信息科学系)

专题命中 图像生成评测 :image generation(abstract)

AI总结 针对机器人设计领域缺乏大规模数据集的问题,介绍了含100万个样本的RoboDesign1M数据集,提出半自动数据收集管道,经多项实验评估,该数据集可推动机器人设计理解研究及相关自动化发展。

Comments 8 pages, accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 2 篇

2607.12287 2026-07-15 cs.RO 新提交 50%

Reducing Temporal Redundancy for Efficient Vision-Language-Action Inference

减少时间冗余以实现高效视觉-语言-动作推理

Yuzhou Wu, Yuxin Zheng, Muchun Niu, Yishan Yang, Tianhao Liu, hanwen kang, Jiajian Jing, Linfeng Zhang, Chuan Wen

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究针对VLA模型推理延迟高的问题,识别出时间冗余来源,提出系统级加速策略,在感知和动作生成上减少计算,经实验验证该策略能加速超2倍且保持高性能。

Comments 13pages, 7 figuers

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25233 2026-07-15 math.NA cs.NA 版本更新 50%

Highly Efficient Rank-Adaptive Sweep-based SI-DSA for the Radiative Transfer Equation via Mild Space Augmentation

通过温和的空间增强实现高效且适应性的秩适应性扫掠SI-DSA用于辐射传输方程

Wei Guo, Zhichao Peng

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出一种高效的秩适应性扫掠SI-DSA方法,通过温和的空间增强实现低秩求解,减少内存和计算时间,适用于多尺度问题。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏