arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-06 至 2026-03-06 共收录 77 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 55 篇

2404.04037 2026-03-06 cs.CV cs.MM 62%

InstructHumans: Editing Animated 3D Human Textures with Instructions

InstructHumans: 基于指令的可动画3D人体纹理编辑

Jiayin Zhu, Linlin Yang, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Communication University of China(中国传媒大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 InstructHumans通过改进的SDS-E方法实现基于指令的3D人体纹理编辑,提升编辑一致性与细节保真度。

Comments Accepted for publication in IEEE Transactions on Multimedia (TMM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05454 2026-03-06 cs.CV 57%

Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes

超越零散接受:通过最长稳定前缀实现DLMs的快速且一致推理

Pengxiang Li, Joey Tsai, Hongwei Xue, Kunyu Shi, Shilin Yan

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 通过最长稳定前缀调度器,提升DLMs推理速度3.4倍,同时保持输出质量。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19210 2026-03-06 cs.CV 57%

Track Anything Behind Everything: Zero-Shot Amodal Video Object Segmentation

在一切之后跟踪任何东西:零样本无遮挡视频对象分割

Finlay G. C. Hudson, William A. P. Smith

机构 * Department of Computer Science University of York(计算机科学系约克大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 TABE通过单个查询掩码实现零样本无遮挡视频对象分割,利用预训练视频扩散模型进行生成补全,无需重新训练模型即可处理完全遮挡场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05219 2026-03-06 cs.CV cs.AI 57%

SPyCer: Semi-Supervised Physics-Guided Contextual Attention for Near-Surface Air Temperature Estimation from Satellite Imagery

SPyCer:半监督物理引导的上下文注意力用于从卫星图像估计近地空气温度

Sofiane Bouaziz, Adel Hafiane, Raphael Canals, Rachid Nedjai

机构 * INSA CVL, Université d’Orléans, PRISME UR 4229(INSA CVL,奥尔良大学,PRISME UR 4229) Université d’Orléans, INSA CVL, PRISME UR 4229(奥尔良大学,INSA CVL,PRISME UR 4229) Université d’Orléans, CEDETE, UR 1210(奥尔良大学,CEDETE,UR 1210)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SPyCer通过结合物理建模和卫星图像,实现高精度的近地空气温度估计,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05081 2026-03-06 cs.CV 57%

Orthogonal Spatial-temporal Distributional Transfer for 4D Generation

正交时空分布式转移用于4D生成

Wei Liu, Shengqiong Wu, Bobo Li, Haoyu Zhao, Hao Fei, Mong-Li Lee, Wynne Hsu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出正交时空分布式转移机制,通过解耦空间和时间潜在变量提升4D生成的质量和一致性。

Comments 9 pages, 6 figures, 3 tables, AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04874 2026-03-06 cs.CV cs.AI cs.LG 57%

Interpretable Pre-Release Baseball Pitch Type Anticipation from Broadcast 3D Kinematics

从广播3D运动学中可解释地提前预测棒球投掷类型

Jerrin Bright, Michelle Lu, John Zelek

机构 * Vision and Image Processing Lab(视觉与图像处理实验室) University of Waterloo(滑铁卢大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文通过分析棒球投手的3D运动学数据,提出了一种可解释的投球类型预测方法,在无球飞行数据的情况下达到80.4%的准确率,揭示了上半身机械在预测中的主导作用。

Comments Submitted to CVPRW'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04179 2026-03-06 cs.CV 57%

NOVA3R: Non-pixel-aligned Visual Transformer for Amodal 3D Reconstruction

NOVA3R:非像素对齐的视觉变换器用于模态3D重建

Weirong Chen, Chuanxia Zheng, Ganlin Zhang, Andrea Vedaldi, Daniel Cremers

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 NOVA3R通过非像素对齐的视觉变换器实现更准确的3D重建,解决了传统像素对齐方法在处理可见和不可见点及重叠区域结构上的局限。

Comments Accepted to ICLR 2026. Project Page: https://wrchen530.github.io/nova3r

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02852 2026-03-06 cs.CV 57%

Learnable Sparsity for Vision Generative Models

可学习的稀疏性用于视觉生成模型

Yang Zhang, Er Jin, Wenzhong Liang, Yanfei Dong, Ashkan Khakzar, Philip Torr, Johannes Stegmaier, Kenji Kawaguchi

机构 * National University of Singapore(新加坡国立大学) RWTH Aachen University(亚琛工业大学) University of Oxford(牛津大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种无需重新训练的扩散模型剪枝方法,通过学习可微掩码和时间步梯度检查点技术,实现高效参数压缩与性能保持。

Comments Project page: https://yangzhang-v5.github.io/EcoDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05487 2026-03-06 cs.RO 50%

Observing and Controlling Features in Vision-Language-Action Models

观察和控制视觉-语言-动作模型中的特征

Hugo Buurmeijer, Carmen Amo Alonso, Aiden Swann, Marco Pavone

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出通过特征可观察性和可控性研究,实现对视觉-语言-动作模型的在线适应与行为引导,提升其与用户需求的实时对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05395 2026-03-06 cs.LG 50%

On the Necessity of Learnable Sheaf Laplacians

可学习的sheaf拉普拉斯算子的必要性

Ferran Hernandez Caralt, Mar Gonzàlez i Català, Adrián Bazaga, Pietro Liò

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学) Microsoft(微软公司)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文探讨了可学习sheaf拉普拉斯算子在解决异质图过度平滑问题中的必要性,通过引入身份sheaf网络基线发现其性能与SNN变体相当,并指出实证结果与理论分析不符。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05388 2026-03-06 math.PR 50%

Controlled fields, rough stochastic calculus, and Itô-Wentzell-Alekseev-Gröbner identities

受控场、粗糙随机微积分及伊藤-文兹尔-阿列克谢夫-格罗伯纳恒等式

Jannis R. Dause, Peter K. Friz, Arnulf Jentzen, Jian Song

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种用于粗糙随机系统的时空受控场微积分,推导了粗糙随机伊藤-文兹尔公式,并基于前人工作建立了相关恒等式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05375 2026-03-06 cs.LG 50%

Robust Node Affinities via Jaccard-Biased Random Walks and Rank Aggregation

通过Jaccard偏倚随机游走和排名聚合实现鲁棒的节点亲和力

Bastian Pfeifer, Michael G. Schimek

机构 * Institute for Medical Informatics, Statistics and Documentation, Medical University Graz(医学信息学、统计与文档研究所,格拉茨医学大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 TopKGraphs通过Jaccard偏倚随机游走和排名聚合,提供一种鲁棒且可解释的节点相似性方法,适用于网络分析和机器学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05302 2026-03-06 cs.SD 50%

SLICE: Speech Enhancement via Layer-wise Injection of Conditioning Embeddings

通过分层注入条件嵌入进行语音增强

Seokhoon Moon, Kyudan Jung, Jaegul Choo

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出通过分层注入条件嵌入来提升语音增强效果,有效应对多种退化干扰。

Comments 5 pages, 1 figure, 4 tables, submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24945 2026-03-06 cond-mat.soft physics.comp-ph 50%

Energy-Conserving Contact Dynamics of Nonspherical Rigid-Body Particles

非球形刚体颗粒的节能接触动力学

Haoyuan Shi, Christopher J. Mundy, Gregory K. Schenter, Jaehun Chun

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种适用于任意凸刚体颗粒的节能接触动力学框架,用于研究非球形颗粒系统的非平衡动力学,具有稳定性高、应用广泛的特点。

Journal ref APL Computational Physics 2, 016108 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03858 2026-03-06 cs.DS cs.LG 50%

Differentially Private and Scalable Estimation of the Network Principal Component

具有差分隐私和可扩展性的网络主成分估计

Alireza Khayatian, Anil Vullikanti, Aritra Konar

机构 * ESAT-STADIUS KU Leuven(KU莱顿ESAT-STADIUS研究所) Department of Computer Science University of Virginia(弗吉尼亚大学计算机科学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于Propose-Test-Release框架的差分隐私主成分估计方法,通过实例特定机制在保证隐私的同时提升计算效率和实用性,首次解决了Densest-k-subgraph问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05276 2026-03-06 cs.LG cs.AI 50%

Whispering to a Blackbox: Bootstrapping Frozen OCR with Visual Prompts

对黑箱低语:通过视觉提示强化冻结OCR

Samandar Samandarov, Nazirjon Ismoiljonov, Abdullah Sattorov, Temirlan Sabyrbayev

机构 * Duke University(杜克大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过视觉提示框架Whisperer,利用行为克隆方法提升冻结OCR模型的性能,减少字符错误率8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05034 2026-03-06 econ.GN q-fin.EC 50%

The "Gold Rush" in AI and Robotics Patenting Activity. Do innovation systems have a role?

人工智能与机器人专利活动的“黄金时代”:创新系统是否起作用?

Giovanni Guidetti, Riccardo Leoncini, Mariele Macaluso

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了AI与机器人领域专利活动的长期动态,发现AI增强型机器人专利增长加速,各国AI与机器人整合程度差异显著。

Comments Revise and Resubmit at Technological Forecasting & Social Change

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04931 2026-03-06 math.AP 50%

Multi-Species Keller--Segel Systems: Analysis, Pattern Formation, and Emerging Mathematical Structures

多物种凯勒-塞格尔系统:分析、图案形成与新兴数学结构

Kolade M Owolabi, Eben Mare, Clara O Ijalana, Kolawole S Adegbie

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文综述了多物种凯勒-塞格尔系统的分析、图案形成及数学结构,探讨了关键机制与开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04845 2026-03-06 cs.RO 50%

Task-Relevant and Irrelevant Region-Aware Augmentation for Generalizable Vision-Based Imitation Learning in Agricultural Manipulation

面向农业操作的通用视觉模仿学习的任务相关与无关区域感知增强

Shun Hattori, Hikaru Sasaki, Takumi Hachimine, Yusuke Mizutani, Takamitsu Matsubara

机构 * Division of Information Science, Graduate School of Information Science, Nara Institute of Science and Technology (NAIST)(信息科学系,信息科学研究生院,奈良科学技术研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出DRAIL框架,通过区分任务相关与无关区域,提升农业操作中视觉模仿学习的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04730 2026-03-06 cs.LG 50%

Count Bridges enable Modeling and Deconvolving Transcriptomic Data

计数桥使能够建模和解卷积转录组数据

Nic Fishman, Gokul Gowri, Tanush Kumar, Jiaqi Lu, Valentin de Bortoli, Jonathan S. Gootenberg, Omar Abudayyeh

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) CNRS(法国国家科学研究中心) Beth Israel Deaconess Medical Center(贝塞斯达以色列德acons医院) Brigham and Women’s Hospital(布莱根妇女医院) Harvard Medical School(哈佛医学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 Count Bridges通过随机桥过程建模整数数据并实现解卷积,适用于单细胞基因表达和空间转录组分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04602 2026-03-06 cond-mat.soft cond-mat.stat-mech 50%

Perspective on "Active Brownian Particles Moving in a Random Lorentz Gas"

关于‘在随机洛伦兹气体中活动布朗粒子的运动’的视角

C. Reichhardt, C. J. O. Reichhardt

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究比较了活性粒子与布朗粒子在随机障碍物中的运动行为,发现活性粒子在特定条件下表现出更快的稳态达到和更低的有效扩散率。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04490 2026-03-06 astro-ph.GA astro-ph.CO 50%

The erasure of Galactic bar resonances by dark matter subhaloes

银河棒共振的暗物质次亚晕消失

Elliot Y. Davies, Adam M. Dillamore, Vasily Belokurov, Lina Necib

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究利用共振恒星探测暗物质次亚晕,发现低质量次亚晕对共振影响小,而整体CDM人口可能在棒寿命内消除共振,暗示局部次亚晕密度低于预期。

Comments 20 pages, 15 figures, submitted to MNRAS. Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20391 2026-03-06 cond-mat.other cond-mat.mtrl-sci physics.chem-ph 50%

Transient Plastic Spin Labeling with Chlorine Dioxide

氯 dioxide 的瞬态塑性自旋标签化

Bence G. Márkus, Sándor Kollarics, Kristóf Kály-Kullai, Bernadett Juhász, Dávid Beke, László Forró, Zoltán Noszticzius, Ferenc Simon

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究利用氯 dioxide 自由基在聚对苯二甲酸乙二醇酯中的自旋标签化技术,通过电子自旋共振光谱分析塑料分子的局部环境,并确定其在聚合物中的扩散系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09998 2026-03-06 math.AP 50%

Stability and bifurcation analysis in a mechanochemical model of pattern formation

机械化学模型中图案形成的稳定性与分岔分析

Szymon Cygan, Anna Marciniak-Czochra, Finn Münnich, Dietmar Oelz

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究通过机械化学反馈机制,在无需第二抑制剂的情况下,实现单峰模式的稳健形成。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04772 2026-03-06 cs.RO cs.SY eess.SY 50%

TEMPO-VINE: A Multi-Temporal Sensor Fusion Dataset for Localization and Mapping in Vineyards

TEMPO-VINE:一个多时序传感器融合数据集用于葡萄园的定位与建图

Mauro Martini, Marco Ambrosio, Judith Vilella-Cantos, Alessandro Navone, Marcello Chiaberge

机构 * Department of Electronics and Communications, Politecnico di Torino(电子与通信系,politecnico di torino大学) University Institute for Engineering Research, Miguel Hernández University(工程研究大学学院,miguel hernández大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 TEMPO-VINE数据集通过多时序传感器融合数据,为葡萄园的定位与建图提供全面的基准测试资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14020 2026-03-06 cs.LG cs.AI stat.ML 50%

Bures-Wasserstein Flow Matching for Graph Generation

Bures-Wasserstein 流匹配用于图生成

Keyue Jiang, Jiahao Cui, Xiaowen Dong, Laura Toni

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出BWFlow框架,通过Bures-Wasserstein最优传输设计平滑概率路径,提升图生成的训练和采样效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
1302.0173 2026-03-06 physics.optics 50%

Basic aspects of high-power semiconductor laser simulation

高功率半导体激光模拟的基本方面

Hans Wenzel

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究高功率半导体激光模拟中的模型与技术,探讨了宽孔径激光光学场特性及热透镜效应的影响。

Comments 13 pages, 11 figures

Journal ref IEEE Journal of Selected Topics in Quantum Electronics ( Volume: 19, Issue: 5, Sept.-Oct. 2013)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2512.01153 2026-03-06 cs.CV cs.AI cs.LG 79%

DPAC: Distribution-Preserving Adversarial Control for Diffusion Sampling

DPAC:分布保持对抗控制用于扩散采样

Han-Jin Lee, Han-Ju Lee, Jin-Seong Kim, Seok-Hwan Choi

机构 * Yonsei University(延世大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 DPAC通过在切空间上投影对抗梯度,保持分布并提升扩散采样质量,理论和实验均验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08344 2026-03-06 cs.CV cs.AI cs.HC 79%

SASG-DA: Sparse-Aware Semantic-Guided Diffusion Augmentation For Myoelectric Gesture Recognition

SASG-DA:基于稀疏性的语义引导扩散增强用于肌电信号手势识别

Chen Liu, Can Han, Weishi Xu, Yaqi Wang, Dahong Qian

机构 * School of Biomedical Engineering, Shanghai Jiao Tong University(生物医学工程学院,上海交通大学) Innovation Center for Electronic Design Automation Technology, Hangzhou Dianzi University(电子设计自动化技术创新中心,杭州电子科技大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 SASG-DA通过稀疏感知语义引导扩散增强方法,提升sEMG手势识别的样本忠实性和多样性,从而提高模型泛化能力。

Comments Accepted by IEEE Journal of Biomedical and Health Informatics (JBHI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04899 2026-03-06 cs.CV 57%

FC-VFI: Faithful and Consistent Video Frame Interpolation for High-FPS Slow Motion Video Generation

FC-VFI: 用于高帧率慢动作视频生成的忠实且一致的视频帧插值

Ganggui Ding, Hao Chen, Xiaogang Xu

机构 * Zhejiang University Chinese University of Hong Kong(浙江大学香港中文大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 FC-VFI通过引入时间建模策略和语义匹配线,实现了高帧率慢动作视频生成中的忠实且一致的帧插值。

Comments ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏