arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-07 至 2026-07-07 共收录 243 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 192 篇

2603.08982 2026-07-07 cs.CV 版本更新 57%

SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing

SVG-EAR:通过误差感知路由实现稀疏视频生成的无参数线性补偿

Xuanyi Zhou, Qiuyang Mang, Shuo Yang, Haocheng Xi, Jintao Zhang, Huanzhi Mao, Joseph E. Gonzalez, Kurt Keutzer, Ion Stoica, Alvin Cheung

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视频生成中扩散变换器二次注意力成本瓶颈问题,提出SVG-EAR,利用语义聚类后块内键值相似性,通过质心近似跳过块,用误差感知路由计算需精确补偿块,提升质量效率权衡并提高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01878 2026-07-07 cs.CV 版本更新 57%

CTForensics: A Comprehensive Dataset and Method for AI-Generated CT Image Detection

CTForensics:用于人工智能生成的CT图像检测的综合数据集和方法

Yiheng Li, Zichang Tan, Guoqing Xu, Yichun Yeh, Yang Yang, Zhen Lei

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究中心) Sangfor Technologies Inc.(深信服技术有限公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对人工智能生成CT图像检测难题,介绍含75990张二维CT图像的CTForensics数据集及十种生成模型样本,提出ESF-CTFD框架,实验表明该框架性能优且抗干扰强。

Comments under review, repo: https://github.com/liyih/CTForensics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00205 2026-07-07 eess.IV cs.AI cs.CV 版本更新 57%

Efficient Flow Matching for Sparse-View CT Reconstruction

用于稀疏视图CT重建的高效流匹配

Jiayang Shi, Lincen Yang, Zhong Li, Tristan van Leeuwen, Daniel M. Pelt, K. Joost Batenburg

机构 * Centrum Wiskunde en Informatica(数学与信息学研究中心) LIACS, Leiden University(莱顿大学LIACS) Great Bay University(大湾大学) Mathematical Institute, Utrecht University(乌得勒支大学数学研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究利用流匹配(FM)模型进行CT重建,因其确定性与数据一致性操作天然兼容。提出基于FM的CT重建框架及高效变体,通过重用预测速度场减少神经网络函数评估次数,提高推理效率,实验证明效果良好。

Journal ref MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08377 2026-07-07 cs.CV 版本更新 57%

UniVideo: Unified Understanding, Generation, and Editing for Videos

UniVideo:视频的统一理解、生成与编辑

Cong Wei, Quande Liu, Zixuan Ye, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhu Chen

机构 * University of Waterloo(多伦多大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 扩散模型 :image editing(abstract);分类 cs.CV

AI总结 提出UniVideo框架,采用双流设计,结合多模态大语言模型与多模态DiT进行视频生成等任务。统一多种视频任务于单范式,实验表明其性能出色,还支持任务组合与能力迁移,且发布了模型和代码。

Comments Project Website https://congwei1230.github.io/UniVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20446 2026-07-07 cs.CV 版本更新 57%

Learning to Generate Human-Human-Object Interactions from Textual Descriptions

从文本描述中学习生成人与人-物体交互

Jeonghyeon Na, Sangwon Baik, Inhee Lee, Junyoung Lee, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出建模两人与物体共享交互相关性的问题,通过新数据集和数据合成方法,利用分数扩散模型训练文本到人和物体交互及人和人交互模型,构建统一框架,可扩展到多人交互场景。

Comments Project Page: https://tlb-miss.github.io/hhoi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09423 2026-07-07 cs.CV 版本更新 57%

FunPhase: A Periodic Functional Autoencoder for Motion Generation via Phase Manifolds

FunPhase:通过相位流形进行运动生成的周期性功能自动编码器

Marco Pegoraro, Evan Atherton, Bruno Roy, Aliasghar Khani, Arianna Rampini

机构 * Autodesk Research(Autodesk研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究因空间几何与时间动态强耦合导致的自然人体运动学习难题。核心方法为引入FunPhase,用函数空间公式替代离散时间解码。主要贡献是统一运动预测与生成,泛化能力强,支持下游任务,重建误差低。

Comments Accepted at ICML26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15061 2026-07-07 cs.RO cs.CV 版本更新 57%

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13546 2026-07-07 cs.CV 版本更新 57%

NABLA: Neighborhood Adaptive Block-Level Attention

$\nabla$NABLA:邻域自适应块级注意力

Dmitrii Mikhailov, Aleksey Letunovskiy, Maria Kovaleva, Vladimir Arkhipkin, Vladimir Korviakov, Vladimir Polovnikov, Viacheslav Vasilev, Evelina Sidorova, Denis Dimitrov

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出NABLA,一种邻域自适应块级注意力机制,通过自适应稀疏性驱动阈值减少计算开销,保持生成质量,无需定制低层运算符,可无缝集成PyTorch的Flex Attention。实验表明,NABLA在训练和推理速度上提升2.7倍,几乎不牺牲定量指标和视觉质量。

Journal ref IEEE Access, vol. 14, pp. 64655-64665, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01790 2026-07-07 cs.SD cs.AI 版本更新 50%

Shao: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

Shao:将声学令牌语言模型扩展至高保真音乐生成

Jiafeng Liu, Yuanliang Dong, Hongjia Liu, Yuqing Cheng, Zhancheng Guo, Huijing Liang, Wenbo Zhan, Yuming Sun, Xiaobing Li, Feng Yu, Maosong Sun

机构 * Central Conservatory of Music(中央音乐学院) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出单一声学令牌层级内渐进建模音乐结构与保真度的框架,通过双阶段生成与混合注意力训练,无需异构空间即可实现高质量音乐生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02892 2026-07-07 econ.GN q-fin.EC 新提交 50%

Robots and the Public Finance of Disability Insurance

机器人与残疾保险公共财政

Duha T. Altindag, Reem El Cheikh Taha, John M. Nunley, R. Alan Seals

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究利用通勤区数据和转移份额设计,估计工业机器人暴露对社会保障残疾保险申请的影响,发现机器人降低申请,避免的申请流对应一定成本,揭示机器人暴露对社会保险成本有不同影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04775 2026-07-07 stat.ML cs.LG 新提交 50%

Non-asymptotic Convergence of Stochastic Gradient Descent in Score-based Generative Models

基于得分的生成模型中随机梯度下降的非渐近收敛性

Stanislas Strasman, Sobihan Surendran, Sylvain Le Corff

机构 * Sorbonne Université and Université Paris Cité, CNRS, LPSM(索邦大学和巴黎cité大学,法国国家科学研究中心,巴黎高等师范学院) LOPF, Califrais’ Machine Learning Lab(LOPF,Califrais机器学习实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对基于得分的生成模型训练优化性质不明问题,本文对两类场景下的随机梯度下降开展理论分析,推导收敛速率与误差边界,为实际权重选择提供理论指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05271 2026-07-07 cs.LG 新提交 50%

Target-Guided Selective Reweighting for Physics-Informed Neural Network Inverse Problems: A Transfer Learning Approach

面向物理信息神经网络逆问题的目标引导选择性重加权:一种迁移学习方法

Qian Hu, Bin Fan, Yao Xiao, Zhicheng Lin, Meixin Xiong

机构 * School of Computing and Data Science, Fujian University of Technology(福建工程学院计算与数据科学学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对物理信息神经网络逆问题迁移学习中的负迁移问题,提出TGSR-PINN方法,通过神经元目标评分与选择性软衰减,提升目标物理参数恢复精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04774 2026-07-07 cs.LG 新提交 50%

MARLIN: De Novo Molecular Structure Elucidation from Tandem Mass Spectra without a Ground-Truth Formula

MARLIN:从串联质谱中进行从头分子结构解析,无需真实分子式

Xujun Che, Xiuxia Du, Depeng Xu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究针对无分子式的串联质谱,提出MARLIN方法,通过自监督编码器和语言模型生成候选结构,用质量壳约束等确保准确性,在无真实分子式情况下表现出色,能可靠解析结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04652 2026-07-07 cs.RO 新提交 50%

KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation

KAM-WM:基于潜在世界模型的机器人操作运动学可供性地图

Xinyu Shao, Keru Zhou, Guowei Huang, Yajun Gao, Tongtong Cao, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究如何从少量演示中学习操作,提出KAM-WM框架,从冻结的潜在视频世界模型提取粗粒度方向交互线索,转化为运动学可供性地图,结合其他信息控制机器人,在实验中取得较好成果。

Comments 16 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04551 2026-07-07 cs.CE 新提交 50%

Dynamic Image-Informed Selection of Biomechanical Tumor Growth Models

生物力学肿瘤生长模型的动态图像信息选择

Abdullah Al Noman, Pratyush Kumar Singh, David A Hormuth, Danial Faghihi

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究胶质母细胞瘤进展中机械相互作用对其的影响。通过引入序贯贝叶斯推理和动态模型选择框架,利用纵向小鼠磁共振成像数据校准生物力学肿瘤生长模型参数,比较不同模型,得出机械耦合模型更优及应依个体评估本构假设的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03748 2026-07-07 cs.AI 新提交 50%

Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process

将交错多模态推理作为统一决策过程进行衔接

Zican Hu, Xuyang Hu, Yiming Liu, Zuwei Long, Wei Liu, Yunzhuo Hao, Jiawei Gu, Linjie Li, Yu Cheng, Zhenhong Sun, Weibo Gu, Xing Sun, Zhi Wang

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Washington(华盛顿大学) The Chinese University of Hong Kong(香港中文大学) Australian National University(澳大利亚国立大学)

专题命中 扩散模型 :image generation(abstract)

AI总结 研究统一多模态模型中强化学习优化多轮生成的问题,提出BRAID框架,将文本-图像-文本推理视为统一马尔可夫决策过程,通过单一强化学习目标联合优化文本和视觉生成,实验表明该框架性能优于基线。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03349 2026-07-07 cs.LG cs.AI 新提交 50%

PedestrianDiffusion: Multimodal Generative Denoising and Dense State Estimation for Inertial Navigation

行人扩散:用于惯性导航的多模态生成去噪和密集状态估计

I-Hao Lu, Dongsoo Han

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对消费级惯性导航受MEMS随机噪声限制问题,提出PedestrianDiffusion框架,将密集6D状态估计转化为连续条件去噪过程,引入零样本语义条件机制,用ODE求解器提升性能,在多基准测试中达先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03181 2026-07-07 cs.GT cs.AI 新提交 50%

Teaming Up with AI: Coordination and Cooperation

与人工智能合作:协调与协作

Nicole Immorlica, Inbal Talgam-Cohen

机构 * Yale University and Microsoft Research(耶鲁大学和微软研究院) Tel Aviv University(特拉维夫大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 探讨如何在劳动力中与人工智能协作以最大化经济价值并实现‘真正’协作。结合理论计算机科学和经济学,考虑协调与合作两层工具,展示基于算法和经济研究的方法可增强两者,为AI市场研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03171 2026-07-07 cs.LG cs.AI cs.DC 新提交 50%

Decentralised Federated Learning over Temporal Networks: The Role of Heterogeneities

时间网络上的去中心化联邦学习:异质性的作用

Arash Badie-Modiri, Chiara Boldrini, Lorenzo Valerio, János Kertész, Márton Karsai

机构 * National Research Council, Pisa(比萨国家研究委员会) Central European University, Vienna(维也纳中欧大学) Aalto University, Espoo(埃斯波阿尔托大学) HUN-REN Rényi Institute of Mathematics, Budapest(布达佩斯匈牙利科学院雷尼数学研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究去中心化联邦学习中结构和时间异质性的作用,通过映射揭示其与随机游走扩散过程的关系,指出忽视异质性会使收敛不切实际地快,分析现实网络发现异质性常致扩散和收敛变慢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02715 2026-07-07 cs.LG 新提交 50%

LiNO: Lifting based multiresolution neural operator

LiNO:基于提升的多分辨率神经算子

Himanshu Pandey, Subham Patel, Ratikanta Behera

机构 * Department of Computational and Data Sciences, Indian Institute of Science(计算与数据科学系,印度科学研究所) IISc Mathematics Initiative, Department of Mathematics, Indian Institute of Science(印度科学研究所数学倡议,数学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究旨在设计有效表示多尺度特征的算子,提出基于第二代小波提升方案的LiNO。通过参数化提升变换从数据学习多分辨率分解,在多个基准测试中性能出色,为科学机器学习提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05166 2026-07-07 math.AP 新提交 50%

Stability of vertically charged steady magnetic field in 3D incompressible magneto-micropolar fluids without magnetic and angular viscosity in a strip domain

三维不可压缩磁微极流体在带状区域中无磁粘性和角粘性时垂直带电稳定磁场的稳定性

Zefu Feng, Guangyi Hong, Jiahong Wu, Kun Zhao

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究三维不可压缩磁微极方程在带状区域无磁和角粘性时的正则性与稳定性问题,给出稳态设置,证明小扰动有全局正则稳定解且解随时间趋于无穷以近指数速率收敛到稳态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04943 2026-07-07 math.PR 新提交 50%

Approximation of Random Differential Equations Driven by Physical Brownian Motion with Fast Oscillating Noise

由具有快速振荡噪声的物理布朗运动驱动的随机微分方程的逼近

Qingming Zhao, Xueru Liu, Wei Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究由满足奇异摄动朗之万方程且具有缩放混合随机力的半鞅驱动的随机微分方程逼近。用扩散逼近法探索半鞅粗糙路径提升的极限,应用通用极限定理确定随机微分方程极限,还建立了混合随机力的迭代弱不变原理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04807 2026-07-07 math.AP 新提交 50%

Thresholds, fragmentation and symmetrization in parabolic equations

抛物方程中的阈值、碎片化与对称化

Matthieu Alfaro, Yihong Du, François Hamel, Lionel Roques

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究双稳型反应扩散方程有界非负解的大时间动力学,探讨阈值长度极限,给出极限为正和为零的条件,还研究碎片化初值影响及抛物方程质量集中原理,发现其一般不成立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04649 2026-07-07 math.AP 新提交 50%

Subcritical-mass global solvability in a doubly degenerate Keller-Segel system with signal production

具有信号产生的双退化凯勒-塞格尔系统中的亚临界质量全局可解性

Tobias Black, Genglin Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究双退化扩散的凯勒-塞格尔趋化系统初边值问题,通过广义能量解框架,证明当初始质量低于阈值\(m_0 = 4\pi\)(径向时为\(m_0 = 8\pi\)),系统有全局解。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04513 2026-07-07 math.OC cs.LG 新提交 50%

Constrained Flow Matching via Lagrangian Dual Flows

通过拉格朗日对偶流进行约束流匹配

Vince Kurtz, Alexander Davydov

机构 * DePaul University(德保罗大学) Rice University(里士满大学)

专题命中 扩散模型 :inpainting(abstract)

AI总结 研究在生成建模中加入推理时约束的问题,提出基于拉格朗日对偶动力学的拉格朗日对偶流技术,能保证非线性约束满足,算法简单有效并建立新理论联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04193 2026-07-07 math.PR 新提交 50%

Onsager--Machlup Functionals for Generalized Newtonian Equations of Motion with Time-Varying Fractional Noise

具有时变分数噪声的广义牛顿运动方程的昂萨格-马赫卢普泛函

Yanbin Zhu, Xiaomeng Jiang, Yong Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究一类由分数布朗运动驱动的退化随机微分方程的昂萨格-马赫卢普泛函,结合高斯相关不等式等方法控制耦合项,经正则性估计等得到泛函表达式及相关应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03813 2026-07-07 math.AP cs.NA math.NA 新提交 50%

Computational Oncology of Chemotaxis-Driven Tumour--Immune Spatial Patterning and Stability

趋化性驱动的肿瘤-免疫空间模式与稳定性的计算肿瘤学

Zonghao Liu, Jiguang Yu, Lei Su, Louis Shuo Wang, Yang Du, Jingfeng Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究肿瘤细胞、免疫效应细胞和趋化因子信号通过反应-扩散-趋化系统相互作用,建立计算肿瘤学模型,经无量纲化等处理,进行线性稳定性分析并验证相关结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03773 2026-07-07 math.AP 新提交 50%

Initial layer analysis of relaxation-time limit of the collisional QHD

碰撞量子流体动力学(QHD)弛豫时间极限的初始层分析

Paolo Antonelli, Pierangelo Marcati, Hao Zheng

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究碰撞量子流体动力学系统弛豫时间极限下初始层结构。用匹配渐近展开法,导出解关于弛豫时间参数τ的渐近描述,确定初始层时间尺度,构造内外展开,证明相关收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03677 2026-07-07 math.AP 新提交 50%

Dynamics of Chemotactic Gliding-Aggregation in Myxobacteria on Bounded Domains: Stochastic Modeling, Analysis, and Deep Neural Network Simulations

有界域上粘细菌趋化性滑动聚集的动力学:随机建模、分析和深度神经网络模拟

Fugui Ma, Zhimeng Ouyang, Wenyi Tian, Lei Wu

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出统一框架,整合随机建模、严格分析和基于深度神经网络的模拟,刻画粗糙表面异常滑动动力学,推导宏观模型并建立解理论,设计神经网络方法,数值实验验证框架有效性。

Comments 78 pages,23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03639 2026-07-07 math.PR cs.AI cs.NI math.ST stat.TH 新提交 50%

An AI-Assisted Solution to the Signed BAR Conjecture: Uniqueness in the Harrison--Reiman Class and a Completely-$\mathcal{S}$ Class Obstruction

带符号 BAR 猜想的人工智能辅助解决方案:哈里森 - 雷曼类中的唯一性和完全 - $\mathcal{S}$ 类障碍

Yiping Lu, Youheng Zhu

机构 * Department of Industrial Engineering and Management Sciences, McCormick School of Engineering, Northwestern University(工业工程与管理科学系,麦科马克工程学院,西北大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究多维反射扩散中带符号 BAR 猜想,用反射扩散路径可微性等证明稳定哈里森 - 雷曼数据有限带符号唯一性,还表明非奇异\(M\)矩阵假设是结构性的,给出完全 - $\mathcal{S}$ 类反例。

详情

展开后加载摘要…

URL PDF HTML 收藏