arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-13 至 2026-03-13 共收录 70 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 44 篇

2506.23543 2026-03-13 cs.CV 70%

Pyramidal Patchification Flow for Visual Generation

金字塔补丁化流用于视觉生成

Hui Li, Baoyou Chen, Liwei Zhang, Jiaye Li, Jingdong Wang, Siyu Zhu

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出金字塔补丁化流方法,通过动态调整补丁大小和线性投影提升视觉生成效率与性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12240 2026-03-13 cs.CV cs.LG 57%

BiGain: Unified Token Compression for Joint Generation and Classification

BiGain:联合生成与分类的统一标记压缩

Jiacheng Liu, Shengkun Tang, Jiacheng Cui, Dongkuan Xu, Zhiqiang Shen

机构 * VILA Lab, MBZUAI(MBZUAI视觉实验室) North Carolina State University(北卡罗来纳州立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 BiGain通过频率分离技术,实现生成与分类的统一标记压缩,提升扩散模型的加速性能和分类准确率,同时保持生成质量。

Comments CVPR 2026. Code: https://github.com/Greenoso/BiGain

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11984 2026-03-13 cs.CV 57%

Ada3Drift: Adaptive Training-Time Drifting for One-Step 3D Visuomotor Robotic Manipulation

Ada3Drift: 适应性训练时间漂移用于一步式三维视觉-运动机器人操作

Chongyang Xu, Yixian Zou, Ziliang Feng, Fanman Meng, Shuaicheng Liu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Ada3Drift通过将迭代细化从推理时间转移到训练时间,实现高保真的单步三维视觉-运动机器人操作生成,同时在少样本条件下提升性能并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08800 2026-03-13 cs.CV cs.AI cs.CL cs.HC cs.LG 57%

NeuralOS: Towards Simulating Operating Systems via Neural Generative Models

NeuralOS: 通过神经生成模型实现操作系统的模拟

Luke Rivard, Sun Sun, Hongyu Guo, Wenhu Chen, Yuntian Deng

机构 * University of Waterloo(滑铁卢大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 NeuralOS通过神经生成模型模拟操作系统GUI,能准确预测用户交互并生成逼真界面,展示了合成数据在模拟未安装应用上的潜力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17778 2026-03-13 cs.CV 57%

TextFlux: An OCR-Free DiT Model for High-Fidelity Multilingual Scene Text Synthesis

TextFlux:一种无需OCR的DiT模型用于高保真多语言场景文本合成

Yu Xie, Jielei Zhang, Pengyu Chen, Weihang Wang, Longwen Gao, Peiyi Li, Qian Qiao, Zhouhui Lian

机构 * bilibili Inc.(哔哩哔哩公司) OpenWPLab(开放WPLab) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 TextFlux是一种无需OCR的DiT模型,通过简化架构和训练流程,实现高保真多语言场景文本合成。

Comments Accepted to Eurographics 2026 (Computer Graphics Forum)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00622 2026-03-13 cs.RO cs.CV cs.LG 57%

Inference-Time Enhancement of Generative Robot Policies via Predictive World Modeling

生成式预测控制:通过预测世界建模增强推理时间的机器人策略

Han Qi, Haocheng Yin, Aris Zhu, Yilun Du, Heng Yang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 GPC通过预测世界建模在推理时间提升机器人策略,结合生成先验与前瞻性预测,实现测试时间适应,优于行为克隆并与其他基线方法相媲美。

Comments Acceptance to IEEE Robotics and Automation Letters. Website: https://computationalrobotics.seas.harvard.edu/GPC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12098 2026-03-13 eess.SY cs.SY math.CO math.OC 50%

Maximum-Entropy Random Walks on Hypergraphs

超图上的最大熵随机游走

Anqi Dong, Anzhi Sheng, Xin Mao, Can Chen

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于超图的最大熵随机游走框架,通过广播和融合机制建模高阶交互,并利用Kullback-Leibler散度投影推断转移核,以提升复杂系统中方向流动和信息扩散的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12080 2026-03-13 cond-mat.stat-mech cond-mat.soft math.PR 50%

Spatiotemporal Characterization of Active Brownian Dynamics in Channels

时空表征受限主动布朗运动在通道中的行为

Yanis Baouche, Mathis Guéneau, Christina Kurzthaler

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了受限主动布朗粒子在通道中的时空行为,通过分析首次通过性质和空间分布,揭示了主动运动对扩散过程的影响,并利用Siegmund对偶性解释了稳态状态的形成。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11995 2026-03-13 cond-mat.stat-mech math-ph math.MP 50%

What is a minimum work transition in stochastic thermodynamics?

在随机热力学中,什么是最小工作过渡?

Paolo Muratore-Ginanneschi, Julia Sanders

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文探讨了随机热力学中最小工作过渡的概念,指出在考虑控制协议速度限制后,最优控制问题需重新定义,并通过悬浮粒子模型验证了广义薛定谔桥的重要性。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19623 2026-03-13 physics.flu-dyn 50%

Taylor dispersion in variable-density, variable-viscosity pulsatile flows

泰勒弥散在变密度、变粘度脉动流中的表现

Prabakaran Rajamanickam, Adam D. Weiss

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究脉动流中变密度和变粘度条件下泰勒弥散现象,通过多重尺度分析建立有效混合模型,揭示剪切诱导弥散机制。

Journal ref Prog. Scale Model. Int. J. 7 (2026) 1-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11798 2026-03-13 cs.AI 50%

DocSage: An Information Structuring Agent for Multi-Doc Multi-Entity Question Answering

DocSage:一个多文档多实体问答的信息结构代理

Teng Lin, Yizhang Zhu, Zhengxuan Zhang, Yuyu Luo, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(abstract)

AI总结 DocSage通过动态模式发现、结构化信息提取和模式感知推理,解决多文档多实体问答中的跨文档证据链构建和实体关系推断问题,实现超过27%的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11761 2026-03-13 stat.ME 50%

Causal Influence Maximization with Steady-State Guarantees

具有稳态保证的因果影响最大化

Renjie Cao, Zhuoxin Yan, Xinyan Su, Zhiheng Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出CIM框架,在预算限制下通过两阶段方法最大化网络稳态潜在结果,提供因果推断与网络优化的结合及可证明的保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11508 2026-03-13 math.AP 50%

A Nash stratification inequality and global regularity for a chemotaxis-fluid system on general 2D domains

一个纳什分层不等式与一般二维域上化学趋化-流体系统的全局正则性

Alexander Kiselev, Naji A. Sarsam

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过改进的纳什不等式证明了二维化学趋化-流体系统在一般二维域上的全局正则性,解决了大质量数据导致的有限时间奇点问题。

Comments 62 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11260 2026-03-13 physics.flu-dyn cs.SY eess.SY 50%

Irreversible Port-Hamiltonian Formulations for 1-Dimensional fluid systems

不可逆端口哈密顿系统用于一维流体系统

Ahlam Ouardi, Arijit Sarkar, Hector Ramirez, Yann Le Gorrec

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种扩展的不可逆端口哈密顿系统框架,用于建模具有粘性耗散的非等熵流体,并确保热力学定律的满足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11232 2026-03-13 math.AP math.FA 50%

Long-time asymptotics for the heat kernel and for heat equation solutions on homogeneous trees

热核及树上热方程解的长时间渐进行为

Effie Papageorgiou

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究同构树上热核及热方程解的长时间渐进行为,推导热核渐进行为并证明解在l^p范数下的分解性质,揭示图几何对热扩散的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12559 2026-03-13 math.NA cs.NA 50%

Convergence Analysis of Block Newton Methods for 1D Shallow Neural Network Approximation

一维浅层神经网络近似中块牛顿方法的收敛性分析

Zhiqiang Cai, Anastassia Doktorova, Robert D. Falgout, César Herrera

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种用于一维浅层神经网络近似问题的块牛顿方法,并分析了其局部收敛性,同时允许在优化过程中减少参数数量以提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02337 2026-03-13 stat.ML cs.LG math.ST stat.TH 50%

Distribution estimation via Flow Matching with Lipschitz guarantees

通过具有Lipschitz保证的流匹配进行分布估计

Lea Kunkel

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过流匹配方法,在高维情况下改进了分布估计的收敛率,无需log-concavity假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12545 2026-03-13 cond-mat.mtrl-sci 50%

Tailored ordering enables high-capacity cathode materials

定制化排序使高容量正极材料成为可能

Tzu-chen Liu, Adolfo Salgado-Casanova, So Yubuchi, Bianca Baldassarri, Muratahan Aykol, Jun Yoshida, Hisatsugu Yamasaki, Yizhou Zhu, Steven B. Torrisi, Christopher Wolverton

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出计算有序框架,用于设计高容量无钴正极材料,通过元素统计和启发式方法实现相稳定与Li扩散的优化。

Comments 47 pages, 12 figures

Journal ref Adv. Energy Mater.15, no. 47 (2025): e03660

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11100 2026-03-13 cond-mat.mtrl-sci 50%

The Role of Hydrogen and Oxygen Interstitial Defects in Crystalline Si cells: Mechanism of Device Degradation in Humid Environment

氢和氧空位在晶硅电池中的作用:湿环境中器件退化机制

Bo Li, Feifei Zhang, Yu Pang, Jinyu Hu, Huiyan Zhao, Guocai Liu, Chao He, Xingtao An

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过理论分析揭示了湿环境中硅太阳能电池退化主要由氢空位引起,而非氧空位,为开发针对性缓解策略提供了理论依据。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12981 2026-03-13 cs.LG math.DG 50%

Riemannian Variational Flow Matching for Material and Protein Design

黎曼变分流匹配用于材料和蛋白质设计

Olga Zaghen, Floor Eijkelboom, Alison Pouplin, Cong Liu, Max Welling, Jan-Willem van de Meent, Erik J. Bekkers

专题命中 扩散模型 :diffusion(abstract)

AI总结 RG-VFM通过黎曼几何方法提升流形生成性能,有效捕捉流形结构并改进下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2510.26796 2026-03-13 cs.CV cs.GR 81%

See4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting

See4D: 通过自回归视频修复实现无姿态4D生成

Dongyue Lu, Ao Liang, Tianxin Huang, Xiao Fu, Yuyang Zhao, Baorui Ma, Liang Pan, Wei Yin, Lingdong Kong, Wei Tsang Ooi, Ziwei Liu

机构 * NUS(新加坡国立大学) HKU(香港大学) CUHK(香港中文大学) THU(清华大学) Shanghai AI Lab(上海人工智能实验室) Horizon Robotics(地平线机器人) NTU(国立科技大学)

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV、cs.GR

AI总结 See4D通过自回归视频修复实现无姿态4D生成,提升从随意视频到4D世界建模的实用性。

Comments Eurographics2026; 26 pages; 21 figures; 3 tables; project page: https://see-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12146 2026-03-13 cs.CV cs.AI cs.LG cs.MM 62%

FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance

FlashMotion: 通过轨迹引导的少步可控视频生成

Quanhao Li, Zhen Xing, Rui Wang, Haidong Cao, Qi Dai, Daoguo Dong, Zuxuan Wu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 FlashMotion通过轨迹引导和蒸馏方法实现了少步可控视频生成,提升了视频质量和轨迹准确性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12250 2026-03-13 cs.CV 57%

DVD: Deterministic Video Depth Estimation with Generative Priors

DVD:利用生成先验的确定性视频深度估计

Hongfei Zhang, Harold Haodong Chen, Chenfei Liao, Jing He, Zixin Zhang, Haodong Li, Yihao Liang, Kanghao Chen, Bin Ren, Xu Zheng, Shuai Yang, Kun Zhou, Yinchuan Li, Nicu Sebe, Ying-Cong Chen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DVD通过确定性方法将预训练视频扩散模型转化为单次通过深度回归器,解决视频深度估计中的生成与判别模型权衡问题,实现零样本性能提升并释放开源训练套件。

Comments Project: https://dvd-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12108 2026-03-13 cs.CV 57%

EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation

EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成

Yan Li, Ning Liao, Xiangyu Zhao, Shaofeng Zhang, Xiaoxing Wang, Yifan Yang, Junchi Yan, Xue Yang

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Corporation(微软公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11695 2026-03-13 cs.CV cond-mat.mtrl-sci 57%

PolyCrysDiff: Controllable Generation of Three-Dimensional Computable Polycrystalline Material Structures

PolyCrysDiff: 可控生成三维可计算多晶材料结构

Chi Chen, Tianle Jiang, Xiaodong Wei, Yanming Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PolyCrysDiff通过条件潜在扩散框架实现了可计算的多晶材料三维微结构可控生成,有效提升了晶粒属性控制精度,为多晶材料的优化设计提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09487 2026-03-13 cs.CV 57%

Semantic-Aware Reconstruction Error for Detecting AI-Generated Images

语义感知的重建误差用于检测AI生成图像

Ju Yeon Kang, Jaehong Park, Semin Kim, Ji Won Yoon, Nam Soo Kim

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出语义感知的重建误差(SARE)用于检测AI生成图像,通过分析图像与描述词引导重建间的语义差异,提升跨生成模型的检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2603.11323 2026-03-13 cs.CV 57%

UNet-AF: An alias-free UNet for image restoration

UNet-AF: 一种无别名的UNet用于图像恢复

Jérémy Scanvic, Quentin Barthélemy, Julián Tachella

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无别名UNet架构,通过选择先进的翻译等变层提升图像恢复任务中的等变性,实验显示其在性能和等变性方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 4 篇

2508.09202 2026-03-13 cs.CV cs.AI 70%

Personalized Feature Translation for Expression Recognition: An Efficient Source-Free Domain Adaptation Method

面向表情识别的个性化特征翻译:一种高效的无源域适应方法

Masoumeh Sharafi, Soufiane Belharbi, Muhammad Osama Zeeshan, Houssem Ben Salem, Ali Etemad, Alessandro Lameiras Koerich, Marco Pedersoli, Simon Bacon, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(蒙特利尔工程学院系统工程系LIVIA) LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(蒙特利尔工程学院软件与IT工程系LIVIA) Dept. of Health, Kinesiology, & Applied Physiology, Concordia University, Montreal, Canada(蒙特利尔大学健康、运动科学与应用生理学系) Montreal Behavioural Medicine Centre, CIUSSS Nord-de-l’Ile-de-Montréal, Canada(蒙特利尔行为医学中心,北岛-蒙特利尔CIUSSS) Dept. of Electrical and Computer Engineering, Queen’s University, Kingston, Canada(皇后大学电气与计算机工程系)

专题命中 个性化与一致性 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出SFDA-PFT方法,通过潜在空间中的特征翻译实现无源域适应,解决中性表情目标数据下的表情识别问题,提升隐私敏感场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12257 2026-03-13 cs.CV 57%

DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning

DreamVideo-Omni: 基于潜在身份强化学习的多主体视频定制与 Omni-运动控制

Yujie Wei, Xinyu Liu, Shiwei Zhang, Hangjie Yuan, Jinbo Xing, Zhekai Chen, Xiang Wang, Haonan Qiu, Rui Zhao, Yutong Feng, Ruihang Chu, Yingya Zhang, Yike Guo, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Zhejiang University(浙江大学) MMLab, The University of Hong Kong(香港大学MMLab) Nanyang Technological University(南洋理工大学) Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 DreamVideo-Omni通过渐进式两阶段训练范式,实现多主体视频定制与Omni-运动控制,采用条件感知嵌入和分层运动注入策略,提升身份保持与运动控制精度。

Comments Project Page: https://dreamvideo-omni.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10354 2026-03-13 cs.CV 57%

StyleGallery: Training-free and Semantic-aware Personalized Style Transfer from Arbitrary Image References

StyleGallery: 无需训练且语义感知的任意图像参考个性化风格迁移

Boyu He, Yunfan Ye, Chang Liu, Weishang Wu, Fang Liu, Zhiping Cai

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 StyleGallery通过语义感知和无需训练的框架,实现任意图像参考的个性化风格迁移,提升内容保留与风格化平衡能力。

Comments 18 pages, 23 figures, Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏