arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-11 至 2026-08-11 共收录 166 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 122 篇

2608.09452 2026-08-11 cs.CV cs.CR 新提交 74%

A Content-Aware Pure Permutation with Intrinsic Avalanche Effect: Breaking the Diffusion-Permutation Dichotomy

具有内在雪崩效应的内容感知纯置换:打破扩散-置换二分法

Zahra Ghoraeian, Mohammad-Reza Sadeghi, Samaneh Mashhadi

机构 * Amirkabir University of Technology (Tehran Polytechnic)(阿米尔卡比尔理工大学(德黑兰理工)) Iran University of Science and Technology(伊朗科技大学)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 本文提出TCA算法,通过内容感知三角剖分实现纯像素置换,打破扩散-置换二分法,仅靠像素重定位即可产生差分敏感性,在50张图像实验中获NPCR=97.10%等优异安全性能。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08436 2026-08-11 cs.CV 新提交 74%

FreCast: Refining Radar Echo Intensity via Phase-Preserving Amplitude Residual Diffusion for Precipitation Nowcasting

FreCast:用于临近降水预报的保相振幅残差扩散雷达回波强度优化方法

Heping Fang, Zihuai Yin, Kaicheng Mao, Peiguang Zhang, Peng Yang

机构 * Southern University of Science and Technology(南方科技大学) Guangdong Provincial Key Laboratory of Brain-Inspired Intelligent Computation(广东省类脑智能计算重点实验室)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 FreCast是一种两阶段雷达回波预测框架,以初始预报的空间结构为约束校正回波强度偏差,在三个数据集上提升了预报技能,更好保留雨带与强降水结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09373 2026-08-11 cs.CV 新提交 70%

Preserve More Details: Mitigating Content Drift in Real-World Image Super-Resolution

保留更多细节:缓解真实世界图像超分辨率中的内容漂移

Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng

机构 * Xiaomi Corporation(小米公司)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 针对真实世界图像超分辨率中因低质量输入导致的内容漂移问题,提出双路径架构的新型单步扩散模型FSP-Diff,在标准基准上优于现有单步扩散方法。

Comments Accepted to ACM MM 2026. This is the author's accepted version. The definitive version is published in the Proceedings of ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08319 2026-08-11 cs.CV cs.LG 新提交 70%

A continually expandable foundation model for brain MRI

可持续扩展的脑MRI基础模型

Michail Mamalakis, Carmen Jimenez-Mesa, Yonghao Li, Hao Chen, Chao Li, Antonios Mamalakis, John Suckling, Richard Bethlehem, Stephen J. Price, Richard J. Gilbertson, Pietro Lio

机构 * University of Cambridge(剑桥大学) University of Málaga(马拉加大学)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出可扩展的Alcmaeon脑MRI基础模型,结合体积编码、潜在扩散生成与Graph-Blueprint Pruning,在跨临床领域扩展时遗忘程度更低,可支持多种任务,为持续发展的脑MRI基础模型提供了可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09110 2026-08-11 cs.CV cs.GR 新提交 62%

View-Adaptive Renderer for View-Consistent 2D-to-3D Generation

适用于视图一致的2D到3D生成的视图自适应渲染器

U-Chae Jun, Jaeeun Ko, Jiwoo Kang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对单目2D转3D生成的视图不一致与计算负担问题,提出视图自适应神经渲染框架,结合自注意力融合模块,在无扩散SDS监督下实现高效高保真3D重建,性能接近当前最优。

Journal ref Multimedia Systems, vol.32, pp. 511, Aug 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09926 2026-08-11 cs.CV 新提交 57%

Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning

学习世界如何演化:基于潜动态推理的外推视频世界模型

Haodong Li, Shaoteng Liu, Tianyu Wang, Chongjian Ge, Sihui Ji, Jiahan Zhang, Xin Lin, Haolin Lu, Zhe Lin, Manmohan Chandraker

机构 * UCSD(加利福尼亚大学圣迭戈分校) Adobe(奥多比公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对主流视频扩散模型未建模像素时间转换的问题,提出LDR方法,在PhyWorld基准上实现更优动态外推,参数更少、速度更快,是首个能泛化至训练分布外的视频世界模型

Comments Project page: https://lat-dyn-reason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09691 2026-08-11 cs.CV 新提交 57%

Diffuse the object, keep its label: curating detector training data from a few unlabeled photographs via VLM-built 3D vegetation scenes

扩散目标,保留其标签:通过VLM构建的3D植被场景从少量未标记照片中整理检测器训练数据

Mario Malizia, Marnix Enting, Rob Haelterman, Ken Hasselmann

机构 * Royal Military Academy(皇家军事学院) KU Leuven(鲁汶大学) Flanders Make(佛兰德制造研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究针对植被中小物体标记图像稀缺导致检测器跨站点泛化差的问题,通过VLM构建3D植被场景合成标记训练图像,实现无监督站点适应,在排雷基准上性能优于传统跨站点标签复用。

Comments Accepted at the Curated Data for Efficient Learning (CDEL) Workshop @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09579 2026-08-11 cs.CV 新提交 57%

You Only Flow Once: Calibrated and Real-Time Radar Pose Estimation with Multi-Hypothesis Normalizing Flows

仅一次流:基于多假设归一化流的校准且实时雷达位姿估计

Jonas Leo Mueller, Sebastian Hoefler, Dario Zanca, Naga Venkata Sai Jitin Jami, Thomas Altstidl, Bjoern M. Eskofier

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔兰根-纽伦堡大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) LMU München(慕尼黑大学) Helmholtz Zentrum München(慕尼黑亥姆霍兹中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对雷达位姿估计的歧义问题,提出MH-NFPG方法,结合时空Transformer与归一化流,实现高效实时的校准位姿估计,性能优于扩散模型。

Comments Accepted at the Winter Conference on Applications of Computer Vision (WACV) 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09493 2026-08-11 cs.CV 新提交 57%

GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction

GeoRoute:面向交通未来帧预测的几何感知混合推理方法

Khang Minh Le, Hieu Dinh Trung Pham, Luu Thanh Danh, Nam-Tien Le, Hieu Anh Ngo, Phuong Huu Vu Tran, Son Nguyen Minh Le, Nguyen Trong Nghia, Tu Tran Thi Cam, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) University of Science, Ho Chi Minh City(胡志明市科学大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08354 2026-08-11 cs.CV 新提交 57%

Tropical Cyclone Forecasting via Latent Rectified Flow using Satellite Imagery and Atmospheric Fields

基于卫星图像与大气场的潜式整流流热带气旋预报

Meheru Zannat, Sk. Md. Masudul Ahsan

机构 * Khulna University of Engineering & Technology(库尔纳工程技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出单步潜式整流流模型,联合预报热带气旋的卫星图像与大气场,采样速度快、预报精度高,路径误差较基线降低,为热带气旋预报提供高效方案。

Comments 9 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08167 2026-08-11 cs.CV cs.LG 新提交 57%

Wiener Representation Filtering for VLM Hallucination Suppression

用于抑制视觉语言模型幻觉的维纳表示滤波

Ameen Ali, Tamim Zoabi, Lidor Brami, Lior Wolf

机构 * Tel Aviv University(特拉维夫大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出一种无需训练的事后维纳表示滤波技术,通过离线校准校正视觉语言模型深层前馈输出投影,可在保持运行速度的同时降低其对象幻觉,在多类模型及基准上均验证了有效性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08125 2026-08-11 cs.CV 新提交 57%

Staying True to the Origin: Continuous Image Stylization with Smooth Transitions

忠于本源:具有平滑过渡的连续图像风格化

Rui Xu, Hanmo Zhang, Songhua Liu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对图像风格化的内容保留与过渡问题,提出两阶段训练策略及风格强度感知样条插值方法,让基于DiT的模型实现精确连续的风格强度控制,生成高保真结果。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08115 2026-08-11 cs.CV 新提交 57%

SUMI: Scalable Unified Model for 3D Point Cloud Inference

SUMI:用于三维点云推理的可扩展统一模型

Yanlong LI, Kanchana Thilakarathna

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对点云补全由粗到精范式中局部细节重构不足的问题,提出扩散增强细化模块SUMI,可集成到现有模型,在多个基准数据集上实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07863 2026-08-11 cs.CV eess.IV 新提交 57%

LHSDet: High-Resolution AI-Generated Image Detection via Visual Question Answering

LHSDet:基于视觉问答的高分辨率AI生成图像检测方法

Qian Yao, Jun-Jie Huang, Yongjun Wang, Luming Yang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) Academy of Military Science(军事科学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有AI生成图像检测方法忽略高分辨率细节、难以应对未知生成模型的问题,提出LHSDet,将检测任务转为视觉问答,采用三分支架构,在各类生成模型上实现高检测准确率与稳健性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02979 2026-08-11 cs.CV 版本更新 57%

Not All Frames Deserve Full Computation: Accelerating Autoregressive Video Generation via Selective Computation and Predictive Extrapolation

并非所有帧都值得完全计算:通过选择性计算和预测外推加速自回归视频生成

Hanshuai Cui, Zhiqing Tang, Zhi Yao, Fanshuai Meng, Weijia Jia, Wei Zhao

机构 * Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Shenzhen University of Advanced Technology(深圳理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SCOPE框架,通过三模式调度器和选择性计算,提升自回归视频扩散模型效率,在保持质量的同时实现4.73倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00633 2026-08-11 cs.CV cs.AI 版本更新 57%

From Alignment to Synthesis Contrastive Volumetric Grounding for Text-to-CT Generation

从对齐到合成:用于文本到CT生成的对比体 grounding

Daniele Molino, Camillo Maria Caruso, Filippo Ruffini, Paolo Soda, Valerio Guarrasi

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与干预部门,生物医学工程与放射物理学,乌梅拉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对文本到CT生成的视觉-语言对齐瓶颈,提出带结构化难负样本的3D-CLIP编码器,结合端到端潜在扩散模型,在CT-RATE数据集上实现了优于现有方法的性能。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07944 2026-08-11 eess.AS cs.SD 新提交 50%

VIOLET: High-Fidelity Violin Synthesis with Techniques and Dynamics

VIOLET:融合演奏技巧与动态的高保真小提琴合成

Baotong Tian, Cynthia Lu, Vincent K. M. Cheung, Ting-Kang Wang, Jonathan Churchill, Zhiyao Duan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出潜在扩散框架VIOLET,结合DiT与整流流,利用新整理的CSV-TD数据集训练,实现高保真可控小提琴合成,性能优于现有系统且接近顶级商业虚拟乐器。

Comments Accepted at ISMIR 2026; Code and Demo available at https://github.com/User-tian/VIOLET

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08406 2026-08-11 cs.LG 新提交 50%

Rethinking Learning-Based Influence Maximization: Simple Neural Surrogates and Native Discrete Search

重新思考基于学习的影响力最大化:简单神经代理与原生离散搜索

Yiqiao Liao, Parinaz Naghizadeh

机构 * UC San Diego(加利福尼亚大学圣迭戈分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对现有基于学习的影响力最大化框架的不足,提出SIMBA框架,采用轻量级神经代理与原生离散搜索,缩短求解时间并提升影响力传播与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08165 2026-08-11 cs.LG q-bio.QM q-bio.TO 新提交 50%

Predicting blood clot growth from sparse post-onset measurements with latent neural differential equations

利用隐式神经微分方程从发病后稀疏测量值预测血凝块生长

Lennon J. Shikhman, Ying Qian, He Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究基于隐式神经微分方程构建框架,结合稀疏血凝块测量数据推断未知参数并预测血栓生长,经七种方法对比,SNODE表现最优,为个性化血栓建模提供了新途径。

Comments 23 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07998 2026-08-11 cs.IR 新提交 50%

Give the Long-tail More SPACE: Promoting Provider Fairness in Next POI Recommendation

给长尾更多空间:提升下一个兴趣点(POI)推荐中的提供者公平性

Anran Zhang, Jiaqi Jiang, jiahui Jin, Yuhan Zhao

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究针对下一个POI推荐中主流模型曝光集中于热门POI、长尾商家曝光不足的问题,提出模型无关框架SPACE,通过三阶段方法提升长尾POI曝光,在保证推荐准确性的同时改善提供者公平性。

Comments 20th ACM Conference on Recommender Systems (RecSys '26), September 27-October 02, 2026, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07594 2026-08-11 cs.CL cs.AI 新提交 50%

Scaling Inherently Interpretable Language Models

扩展固有可解释的语言模型

Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail, Giang Nguyen, Isaac Plant, Muawiz Chaudhary, Nathaniel Monson, Saqib Azim, Zhichen Guo, Julius Adebayo

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究将可解释性作为训练约束而非事后补充,在多规模计算下验证了其随模型能力同步扩展的特性,通过Steerling-8B模型实现闭环干预,且性能优于更大计算量的同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07504 2026-08-11 cs.HC cs.AI econ.GN q-fin.EC 新提交 50%

Innovating with Generative AI: A Human Bottleneck Framework

生成式AI助力创新:人类瓶颈框架

Julian De Freitas, Ayelet Israeli, Gideon Nave, Artem Timoshenko, Olivier Toubia

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出人类瓶颈框架,分析生成式AI对创新过程各阶段瓶颈的影响,区分瓶颈类型并探讨AI对传统创新流程的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07477 2026-08-11 cs.HC cs.AI 新提交 50%

Designing for Ethical AI: HCI Feature Considerations to Improve Fairness and User Experience in AutoML use for Human Resources

面向伦理人工智能的设计:用于人力资源的自动机器学习(AutoML)中提升公平性与用户体验的人机交互(HCI)功能考量

Sundaraparipurnan Narayanan

专题命中 扩散模型 :diffusion(abstract)

AI总结 该论文结合多视角研究AutoML在人力资源招聘中的公平性,发现现有平台存在缺陷,提出五维度HCI公平评估框架,建议将公平性嵌入AutoML设计以提升伦理可持续性。

Comments 295 pages; Doctoral Thesis;28 figures; 42 tables; 248 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09840 2026-08-11 math.PR math.ST stat.ML stat.TH 新提交 50%

Langevin dynamics along the zero set of real-analytic potentials

实解析位势零集上的朗之万动力学

Martin Larsson

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对大参数下实解析位势的朗之万扩散,推导其在零集上的极限演化,发现演化偏向更高维奇异层,为随机梯度方法偏向泛化良好的奇异解提供了机制解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09817 2026-08-11 math.AP 新提交 50%

Nonlinear stability of large amplitude viscous shock wave for compressible magnetohydrodynamics flows

可压缩磁流体动力学流动的大振幅粘性激波的非线性稳定性

Lilu Sahu, T Raja Sekhar

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对可压缩磁流体动力学系统柯西问题,在无需假设粘性激波振幅与速度的情况下,证明了任意大振幅粘性激波在小初始扰动下的时间渐近稳定性,且适用于一般体积粘度,为该领域的稳定性研究提供了关键进展。

Comments Comments are welcome. 25 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09494 2026-08-11 math.NA cs.LG cs.NA math.AP math.PR 新提交 50%

Walk-on-Spheres Monte Carlo and deep neural network approximations of elliptic PDEs with drift and killing

带漂移和杀伤项的椭圆型偏微分方程的球面行走蒙特卡罗方法及深度神经网络近似

Konrad Kleinberg, Thomas Kruse

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文基于改进球面行走算法,提出带漂移和杀伤项的椭圆型PDE解的蒙特卡罗估计量与深度神经网络近似方法,证明其样本复杂度和参数规模均为多项式级,扩展了相关复杂度分析的适用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08608 2026-08-11 math.NA cs.CE cs.LG cs.NA 新提交 50%

ADEx-FNO: A Unified Ambient-Domain Framework for Fourier Neural Operators on Varying Geometries

ADEx-FNO:适用于不同几何结构的傅里叶神经算子的统一环境域框架

Roberto Nuca, Giovanni Testa, Luca Galimberti, Matteo Parsani

专题命中 扩散模型 :diffusion(abstract)

AI总结 ADEx-FNO是适配不同几何结构的FNO统一框架,无需可训练几何模块,在CFD算例中可初始化求解器以减少迭代次数、提升效率,在多类问题上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08411 2026-08-11 math.AP 新提交 50%

A transport-only null model for apparent heterogeneity in diffusively dosed organoid arrays

用于扩散给药类器官阵列中表观异质性的仅转运零模型

Jiguang Yu, Louis Shuo Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究开发了用于扩散给药肝癌类器官阵列的仅转运零模型,经多类验证显示其可作为评估实测类器官异质性的几何特异性基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07879 2026-08-11 math.PR 新提交 50%

Sharp Wasserstein Convergence Rates for Empirical Path Laws of Itô Processes

Itô过程经验路径律的Sharp Wasserstein收敛速率

Xihao He, Fengyi Yuan

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对Itô过程经验路径律,建立了(log N)^{-1/2}的Sharp Wasserstein收敛速率,采用自适应随机时间区间划分方法,其结果可应用于路径依赖SDE及McKean-Vlasov粒子系统相关估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07682 2026-08-11 math.AP 新提交 50%

Large time behavior of the solution to the Cauchy problem for viscous Hamilton-Jacobi equation on infinite graphs

无限图上粘性哈密顿-雅可比方程柯西问题解的长时间行为

Alan A. Tedeev

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对无限加权图上带梯度吸收项的粘性哈密顿-雅可比方程,结合Hardy与Hölder不等式,建立总质量衰减阈值,结果适用于含整数格等的多类图。

详情

展开后加载摘要…

URL PDF HTML 收藏