arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2542 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2542 篇

2512.21710 2025-12-30 cs.CV 57%

RAPTOR: Real-Time High-Resolution UAV Video Prediction with Efficient Video Attention

RAPTOR: 用于高效视频注意的实时高分辨率无人机视频预测

Zhan Chen, Zile Guo, Enze Zhu, Peirong Zhang, Xiaoxuan Liu, Lei Wang, Yidan Zhang

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 RAPTOR通过高效视频注意机制实现了实时高分辨率视频预测,首次在Jetson AGX Orin上达到30 FPS以上,提升了无人机任务成功率18%。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04678 2025-12-30 cs.CV 57%

Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

奖励强制:基于奖励分布匹配蒸馏的高效流式视频生成

Yunhong Lu, Yanhong Zeng, Haobo Li, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Jiapeng Zhu, Hengyuan Cao, Zhipeng Zhang, Xing Zhu, Yujun Shen, Min Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) SIAS-ZJU SJTU(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 奖励强制通过EMA-Sink和Re-DMD提升流式视频生成效率与质量,实现23.1 FPS的高性能视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22096 2025-12-29 cs.CV 57%

Yume-1.5: A Text-Controlled Interactive World Generation Model

Yume-1.5:一种文本控制的交互式世界生成模型

Xiaofeng Mao, Zhen Li, Chuanhao Li, Xiaojie Xu, Kaining Ying, Tong He, Jiangmiao Pang, Yu Qiao, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 Yume-1.5通过文本控制和高效框架生成交互式连续世界,解决实时性能与文本控制能力的瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21867 2025-12-29 cs.CV 57%

DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation

DPAR:动态分块化用于高效的自回归视觉生成

Divyansh Srivastava, Akshay Mehra, Pranav Maneriker, Debopam Sanyal, Vishnu Raj, Vijay Kamarshi, Fan Du, Joshua Kimball

机构 * University of California, San Diego(加州大学圣地亚哥分校) Dolby Laboratories(杜比实验室)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 DPAR通过动态分块化技术提升自回归视觉生成效率,减少计算资源消耗并提高生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21857 2025-12-29 cs.CV 57%

Fast Inference of Visual Autoregressive Model with Adjacency-Adaptive Dynamical Draft Trees

视觉自回归模型快速推断的邻接自适应动态草案树

Haodong Lei, Hongsong Wang, Xin Geng, Liang Wang, Pan Zhou

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(东南大学新一代人工智能技术及交叉应用重点实验室(教育部)) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR),多模态人工智能系统国家重点实验室(MAIS),中国科学院自动化研究所(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computing and Information Systems, Singapore Management University(新加坡国立大学计算机与信息学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 ADT-Tree通过邻接自适应动态草案树提升视觉自回归模型的推断速度,实现3.13倍和3.05倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21338 2025-12-29 cs.CV 57%

HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming

HiStream: 通过消除冗余的流式传输实现高效的高分辨率视频生成

Haonan Qiu, Shikun Liu, Zijian Zhou, Zhaochong An, Weiming Ren, Zhiheng Liu, Jonas Schult, Sen He, Shoufa Chen, Yuren Cong, Tao Xiang, Ziwei Liu, Juan-Manuel Perez-Rua

机构 * Meta AI Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 HiStream通过空间、时间及时间步压缩优化,实现高分辨率视频生成的高效去噪,相比基线模型提升107.5倍速度并保持高质量。

Comments Project Page: http://haonanqiu.com/projects/HiStream.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16915 2025-12-19 cs.CV 57%

StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors

StereoPilot: 通过生成先验学习统一且高效的立体转换

Guibao Shen, Yihua Du, Wenhang Ge, Jing He, Chirui Chang, Donghao Zhou, Zhen Yang, Luozhou Wang, Xin Tao, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) CUHK(香港中文大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 StereoPilot通过生成先验学习实现高效立体转换,提升视觉保真度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14697 2025-12-17 cs.CV cs.AI cs.LG eess.SP 57%

Spherical Leech Quantization for Visual Tokenization and Generation

球面Leech量化用于视觉标记化与生成

Yue Zhao, Hanwen Jiang, Zhenlin Xu, Chutong Yang, Ehsan Adeli, Philipp Krähenbühl

机构 * UT Austin(得克萨斯大学奥斯汀分校) Stanford University(斯坦福大学) Adobe Research(Adobe研究院) Mistral AI

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于Leech格的球面量化方法,通过提高对称性和均匀分布,实现了更高效的图像标记化与生成。

Comments Tech report; project page: https://zhaoyue-zephyrus.github.io/npq/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01510 2025-12-17 cs.CV 57%

Luminance-Aware Statistical Quantization: Unsupervised Hierarchical Learning for Illumination Enhancement

具有亮度意识的统计量化:无监督分层学习用于照明增强

Derong Kong, Zhixiong Yang, Shengxi Li, Shuaifeng Zhi, Li Liu, Zhen Liu, Jingyuan Xia

机构 * College of Electronic Science and Technology, National University of Defense Technology(电子科学与技术学院,国防科技大学) College of Electronic and Information Engineering, Beihang University(电子与信息工程学院,北航)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LASQ框架,通过无监督分层学习实现照明增强,改进亮度转换建模,提升低光照图像恢复的适应性和泛化能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14095 2025-12-17 cs.CV 57%

AnchorHOI: Zero-shot Generation of 4D Human-Object Interaction via Anchor-based Prior Distillation

AnchorHOI: 通过基于锚点的先验蒸馏实现零样本4D人-物交互生成

Sisi Dai, Kai Xu

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 AnchorHOI通过基于锚点的先验蒸馏策略,结合视频扩散模型提升4D人-物交互生成的多样性和泛化能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18461 2025-12-16 cs.CV 57%

An Efficient and Harmonized Framework for Balanced Cross-Domain Feature Integration

一种高效且协调的平衡跨域特征整合框架

Shaoxu Li, Ye Pan

机构 * Shaoxu Li, Ye Pan Corresponding author(Shaoxu Li, Ye Pan 通讯作者)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种高效协调的跨域特征整合框架,通过定制模型和多模型组合提升内容与风格的平衡能力。

Comments https://github.com/lishaoxu1994/DiffStyler, AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08537 2025-12-10 cs.CV 57%

Fast-ARDiff: An Entropy-informed Acceleration Framework for Continuous Space Autoregressive Generation

Fast-ARDiff: 一种基于熵信息的连续空间自回归生成加速框架

Zhen Zou, Xiaoxiao Ma, Jie Huang, Zichao Yu, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 Fast-ARDiff通过联合优化AR和扩散组件,结合熵信息引导策略和动态调度器,实现高效连续空间自回归生成加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06022 2025-12-09 cs.SD cs.MM 57%

DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation

DreamFoley: 用于高保真视频到音频生成的可扩展视觉-语言模型

Fu Li, Weichao Zhao, You Li, Zhichao Zhou, Dongliang He

机构 * Bytedance Intelligent Creation Lab(字节跳动智能创作实验室) Zhejiang University(浙江大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.MM

AI总结 DreamFoley通过结合视觉-语言模型,提出了一种可扩展的视频到音频生成方法,实现了高保真音频生成并优化了训练效率与质量的平衡。

Comments 10 pages; Bytedance

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09261 2025-12-09 cs.CV 57%

Head-Aware KV Cache Compression for Efficient Visual Autoregressive Modeling

面向头部的KV缓存压缩以实现高效的视觉自回归建模

Ziran Qin, Youru Lv, Mingbao Lin, Hang Guo, Zeren Zhang, Danping Zou, Weiyao Lin

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 HACK通过面向头部的KV缓存压缩技术,有效降低VAR模型的注意力复杂度和内存开销,实现70%的缓存压缩率和1.57倍的推理加速。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08855 2025-12-08 cs.GR cs.CG 57%

Morphology-Preserving Remeshing Approach to Particulate Microstructures via Harmonic Decomposition

通过调和分解保持形态的颗粒微结构重新网格化方法

Mahmoud Shaqfa

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.GR

AI总结 本文提出了一种基于分层扩散的重新采样方法,用于生成高质量的颗粒微结构网格,保持表面形态及面积体积信息,提升数值模拟效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04040 2025-12-04 cs.CV 57%

RELIC: Interactive Video World Model with Long-Horizon Memory

RELIC:具有长时间记忆的交互式视频世界模型

Yicong Hong, Yiqun Mei, Chongjian Ge, Yiran Xu, Yang Zhou, Sai Bi, Yannick Hold-Geoffroy, Mike Roberts, Matthew Fisher, Eli Shechtman, Kalyan Sunkavalli, Feng Liu, Zhengqi Li, Hao Tan

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 RELIC通过统一框架实现长时记忆与实时交互,提升视频世界建模的准确性与稳定性。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03796 2025-12-04 cs.CV 57%

LSRS: Latent Scale Rejection Sampling for Visual Autoregressive Modeling

LSRS: 隐式尺度拒绝采样用于视觉自回归建模

Hong-Kai Zheng, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics, China(南京航空航天大学人工智能学院) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence, Nanjing, China(信息产业部模式分析与机器智能重点实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education, Nanjing, China(教育部脑机智能技术重点实验室)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 LSRS通过隐式尺度拒绝采样方法,在保持计算效率的同时提升视觉自回归模型的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08136 2025-12-04 cs.CV 57%

FantasyStyle: Controllable Stylized Distillation for 3D Gaussian Splatting

FantasyStyle: 用于3D高斯点云的可控风格化蒸馏

Yitong Yang, Yinglin Wang, Changshuo Wang, Huajie Wang, Shuting He

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FantasyStyle通过可控风格化蒸馏和多视图频率一致性,解决3DGS风格迁移中的多视图不一致和内容泄漏问题,提升风格化质量与视觉真实感。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00308 2025-12-02 cs.CV 57%

Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation

基于最优传输的分布几何对齐优化用于生成数据集蒸馏

Xiao Cui, Yulei Qin, Wengang Zhou, Hongsheng Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) CUHK MMLab(香港中文大学多媒体实验室) Independent Researcher(独立研究者)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于最优传输的分布几何对齐方法,通过优化传输距离提升数据集蒸馏效果,实验表明在ImageNet-1K上准确率提升至少4%。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21863 2025-12-01 cs.CV cs.LG stat.ML 57%

Saddle-Free Guidance: Improved On-Manifold Sampling without Labels or Additional Training

无鞍点指导:无需标签或额外训练的改进在流形上的采样

Eric Yeats, Darryl Hannan, Wilson Fearn, Timothy Doster, Henry Kvinge, Scott Mahan

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 无鞍点指导通过利用对数密度估计的正曲率,无需标签或额外训练,提升基于分数模型在流形上的采样效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21475 2025-11-27 cs.CV 57%

MobileI2V: Fast and High-Resolution Image-to-Video on Mobile Devices

MobileI2V: 一种适用于移动设备的快速高分辨率图像到视频生成方法

Shuai Zhang, Bao Tang, Siyuan Yu, Yueting Zhu, Jingfeng Yao, Ya Zou, Shanglin Yuan, Li Yu, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 MobileI2V通过轻量级扩散模型和优化策略,在移动设备上实现快速高分辨率图像到视频生成,生成速度提升10倍,质量与现有模型相当。

Comments Our Demo and code:https://github.com/hustvl/MobileI2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21136 2025-11-27 cs.CV cs.AI 57%

Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning

高效训练人类视频生成的熵引导优先级渐进学习

Changlin Li, Jiawei Zhang, Shuhao Liu, Sihao Lin, Zeyi Shi, Zhihui Li, Xiaojun Chang

机构 * Stanford University(斯坦福大学) North China Electric Power University(华北电力大学) University of Adelaide(阿德莱德大学) University of Technology Sydney(悉尼技术大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出熵引导优先级渐进学习方法,通过条件熵膨胀和自适应渐进计划,高效训练扩散模型生成人类视频,实现训练速度提升和内存消耗降低。

Comments Project page: https://github.com/changlin31/Ent-Prog

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20410 2025-11-26 cs.CV 57%

Image-Free Timestep Distillation via Continuous-Time Consistency with Trajectory-Sampled Pairs

无图像时间步蒸馏:通过连续时间一致性与轨迹采样对偶

Bao Tang, Shuai Zhang, Yueting Zhu, Jijun Xiang, Xin Yang, Li Yu, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 TBCM通过直接提取教师模型生成轨迹的潜在表示,实现无训练数据依赖的时间步蒸馏,提升效率和简洁性,同时在生成质量与资源消耗上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19835 2025-11-26 cs.CV cs.AI 57%

Rectified SpaAttn: Revisiting Attention Sparsity for Efficient Video Generation

校正SpaAttn:重新审视注意力稀疏性以实现高效的视频生成

Xuewen Liu, Zhikai Li, Jing Zhang, Mengjuan Chen, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Rectified SpaAttn,通过校正注意力分配提升视频生成效率,实现显著速度提升且保持生成质量。

Comments Code at https://github.com/BienLuky/Rectified-SpaAttn

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17690 2025-11-26 cs.CV cs.AI cs.LG 57%

Segmentation-Aware Generative Reinforcement Network (GRN) for Tissue Layer Segmentation in 3-D Ultrasound Images for Chronic Low-back Pain (cLBP) Assessment

面向慢性低背痛(cLBP)评估的3D超声图像组织层分割的分割感知生成强化网络(GRN)

Zixue Zeng, Xiaoyan Zhao, Matthew Cartier, Tong Yu, Jing Wang, Xin Meng, Zhiyu Sheng, Maryam Satarpour, John M Cormack, Allison Bean, Ryan Nussbaum, Maya Maurer, Emily Landis-Walkenhorst, Dinesh Kumbhare, Kang Kim, Ajay Wasan, Jiantao Pu

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 GRN通过整合分割损失反馈,实现图像生成与分割的联合训练,显著减少标注数据需求,提升3D超声图像中组织层分割的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00820 2025-11-24 cs.CV 57%

QuantFace: Efficient Quantization for Face Restoration

QuantFace: 面部修复的高效量化方法

Jiatong Li, Libo Zhu, Haotong Qin, Jingkai Wang, Linghe Kong, Guihai Chen, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 QuantFace通过低比特量化和自适应策略提升面部修复效率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16047 2025-11-21 cs.CV 57%

AMS-KV: Adaptive KV Caching in Multi-Scale Visual Autoregressive Transformers

AMS-KV: 多尺度视觉自回归变换器中的自适应KV缓存

Boxun Xu, Yu Wang, Zihu Wang, Peng Li

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 AMS-KV通过自适应KV缓存策略提升多尺度视觉自回归变换器的生成质量和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15499 2025-11-20 cs.CV 57%

Learning to Expand Images for Efficient Visual Autoregressive Modeling

学习扩展图像以实现高效的视觉自回归建模

Ruiqing Yang, Kaixin Zhang, Zheng Zhang, Shan You, Tao Huang

机构 * University of Electronic Science and Technology of China(电子科技大学) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Xidian University(西安电子科技大学) SenseTime Research(商汤科技研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出EAR模型,通过中心向外的生成方式提升视觉自回归模型的效率与生成质量,实现保真度与效率的最佳平衡。

Comments 16 pages, 18 figures, includes appendix with additional visualizations, submitted as arXiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13967 2025-11-19 eess.IV cs.CV 57%

PoCGM: Poisson-Conditioned Generative Model for Sparse-View CT Reconstruction

Changsheng Fang, Yongtong Liu, Bahareh Morovati, Shuo Han, Li Zhou, Hengyong Yu

机构 * Department of Electrical and Computer Engineering, University of Massachusetts Lowel(电气与计算机工程系,马萨诸塞大学洛伊尔分校)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

Comments 18th International Meeting on Fully 3D Image Reconstruction in Radiology and Nuclear Medicine, Shanghai, CHINA, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08945 2025-11-19 cs.CV cs.AI 57%

FGM-HD: Boosting Generation Diversity of Fractal Generative Models through Hausdorff Dimension Induction

Haowei Zhang, Yuanpei Zhao, Ji-Zhe Zhou, Mao Li

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

Comments 12 pages, AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏