arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-12 至 2026-03-12 共收录 9 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 9 篇

2507.01957 2026-03-12 cs.CV cs.AI 79%

Locality-aware Parallel Decoding for Efficient Autoregressive Image Generation

具有局部性的并行解码以提高自回归图像生成的效率

Zhuoyang Zhang, Luke J. Huang, Chengyue Wu, Shang Yang, Kelly Peng, Yao Lu, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达) First Intelligence(第一智能)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出LPD方法,通过灵活的并行自回归建模和局部意识生成顺序,显著提升自回归图像生成的效率和质量。

Comments ICLR 2026 Oral. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09488 2026-03-12 cs.CV 70%

Streaming Autoregressive Video Generation via Diagonal Distillation

通过对角蒸馏实现流式自回归视频生成

Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Ming-Hsuan Yang, Weiyang Liu

机构 * South China University of Technology(南方科技大学) Westlake University(西湖大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Merced(加州大学默塞德分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出对角蒸馏方法,通过不对称生成策略和隐式光学流建模,在减少计算步骤的同时提升视频生成的运动质量和效率。

Comments ICLR 2026 (31 pages, 10 figures, project page: https://spherelab.ai/diagdistill/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10893 2026-03-12 cs.CV 57%

S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputs

S2D:基于稀疏到密集的3D重建方法,使用最少输入

Yuzhou Ji, Qijian Tian, He Zhu, Xiaoqi Jiang, Guangzhi Cao, Lizhuang Ma, Yuan Xie, Xin Tan

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chery Automobile(奇瑞汽车)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 S2D通过稀疏到密集的提升方法,在最少输入下实现高质量的3DGS重建,提升稀疏点云和3DGS的一致性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10583 2026-03-12 cs.CV 57%

Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution

属性作为检索:模型无关的AI生成图像属性

Hongsong Wang, Renxi Cheng, Chaolei Han, Jie Gui

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种模型无关的AI生成图像归因方法LIDA,通过实例检索问题解决深度伪造检测和图像归因的挑战。

Comments To appear in CVPR 2026, Code is at https://github.com/hongsong-wang/LIDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10340 2026-03-12 cs.CV cs.AI cs.RO cs.SY eess.SY 57%

Overcoming Visual Clutter in Vision Language Action Models via Concept-Gated Visual Distillation

通过概念门控视觉蒸馏克服视觉杂乱

Sangmim Song, Sarath Kodagoda, Marc Carmichael, Karthick Thiyagarajan

机构 * University of Technology Sydney(技术大学悉尼大学) Western Sydney University(西悉尼大学)

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV

AI总结 本研究提出概念门控视觉蒸馏方法,通过视觉蒸馏技术解决杂乱环境中视觉语言动作模型的精度-推理间隙问题,显著提升机器人操作的成功率。

Comments 7 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12229 2026-03-12 cs.CV 57%

Ultra-Low Bitrate Perceptual Image Compression with Shallow Encoder

超低比特率感知图像压缩与浅层编码

Tianyu Zhang, Dong Liu, Chang Wen Chen

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种非对称极值图像压缩框架,利用浅层编码器和单步扩散解码器实现超低比特率下的高保真度重建,同时提升编码效率和解码速度。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10760 2026-03-12 physics.space-ph 50%

Auroral Acceleration Generates Electron Beams in Jupiter's Middle Magnetosphere

极光加速在木星中间磁层中产生电子束

June Piasecki, Joachim Saur, George Clark, Barry H. Mauk, Annika Salveter, Jamey Szalay

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 朱诺任务发现木星中间磁层中的电子束源于极光加速过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10730 2026-03-12 math.NA cs.NA 50%

Efficient design of continuation methods for hyperbolic transport problems in porous media

高效设计用于多孔介质中双曲输运问题的持续法

Peter von Schultzendorff, Jakub Wiktor Both, Jan Martin Nordbotten, Tor Harald Sandve

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种基于熵解的同伦持续方法,用于高效求解多孔介质中复杂多相流问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10701 2026-03-12 cs.SD cs.AI 50%

AlphaFlowTSE: One-Step Generative Target Speaker Extraction via Conditional AlphaFlow

AlphaFlowTSE:通过条件AlphaFlow实现的一步生成目标说话人提取

Duojia Li, Shuhan Zhang, Zihan Qian, Wenxuan Wu, Shuai Wang, Qingyang Hong, Lin Li, Haizhou Li

机构 * School of Electronic Science and Engineering, Xiamen University, Xiamen, China(1 厦门大学电子科学与技术学院,厦门,中国) School of Informatics, Xiamen University, Xiamen, China(2 厦门大学信息学院,厦门,中国) School of Intelligence Science and Technology, Nanjing University, Suzhou, China(3 南京大学智能科学与技术学院,苏州,中国) Shenzhen Loop Area Institute, Shenzhen, China(4 深圳循环区研究所,深圳,中国) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, Shenzhen, China(5 香港中文大学人工智能学院,深圳,中国) The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(6 香港中文大学,沙田,香港特别行政区,中国)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 AlphaFlowTSE通过条件AlphaFlow实现一步生成目标说话人提取,提升目标语音保真度和真实混合泛化能力。

Comments Submitted to Interspeech 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏