arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6771 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2143 篇

2512.13313 2025-12-16 cs.CV 57%

KlingAvatar 2.0 Technical Report

KlingAvatar 2.0 技术报告

Kling Team, Jialu Chen, Yikang Ding, Zhixue Fang, Kun Gai, Yuan Gao, Kang He, Jingyun Hua, Boyuan Jiang, Mingming Lao, Xiaohan Li, Hui Liu, Jiwen Liu, Xiaoqiang Liu, Yuan Liu, Shun Lu, Yongsen Mao, Yingchao Shao, Huafeng Shi, Xiaoyu Shi, Peiqin Sun, Songlin Tang, Pengfei Wan, Chao Wang, Xuebo Wang, Haoxian Zhang, Yuanxing Zhang, Yan Zhou

机构 * Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 KlingAvatar 2.0 通过时空级联框架和多模态指令融合技术,实现了高效且高质量的长视频生成,提升了视觉清晰度和多模态对齐能力。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05115 2025-12-16 cs.CV 57%

Light-X: Generative 4D Video Rendering with Camera and Illumination Control

Light-X:具有摄像机和照明控制的生成式4D视频渲染

Tianqi Liu, Zhaoxi Chen, Zihao Huang, Shaocong Xu, Saining Zhang, Chongjie Ye, Bohan Li, Zhiguo Cao, Wei Li, Hao Zhao, Ziwei Liu

机构 * S-Lab, NTU(NTU的S-Lab) BAAI HUST(华中科技大学) AIR,THU(清华大学人工智能研究院) FNii, CUHKSZ(CUHKSZ的FNii) SJTU(上海交通大学) EIT (Ningbo)(宁波工程学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Light-X通过联合控制摄像机轨迹和光照,实现高质量4D视频生成,优于现有方法。

Comments Project Page: https://lightx-ai.github.io/ , Code: https://github.com/TQTQliu/Light-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11799 2025-12-15 cs.CV 57%

V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties

V-RGBX:具有精确内在属性控制的视频编辑

Ye Fang, Tong Wu, Valentin Deschaintre, Duygu Ceylan, Iliyan Georgiev, Chun-Hao Paul Huang, Yiwei Hu, Xuelin Chen, Tuanfeng Yang Wang

机构 * Fudan University(复旦大学) Adobe Research(Adobe研究院) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 V-RGBX通过端到端框架实现基于内在属性的视频编辑,支持直观且物理合理的视频修改,适用于物体外观和场景重照明等应用。

Comments Project Page: https://aleafy.github.io/vrgbx

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11293 2025-12-15 cs.CV 57%

Autoregressive Video Autoencoder with Decoupled Temporal and Spatial Context

具有解耦时间和空间上下文的自回归视频自编码器

Cuifeng Shen, Lumin Xu, Xingguo Zhu, Gengdai Liu

机构 * Zoom Communications(Zoom公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ARVAE通过解耦时间和空间上下文,实现高效视频压缩与重建,具备轻量模型和小数据优势,适用于视频生成等下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01004 2025-12-15 cs.CV cs.AI 57%

MoCA-Video: Motion-Aware Concept Alignment for Consistent Video Editing

MoCA-Video:面向一致视频编辑的运动感知概念对齐

Tong Zhang, Juan C Leon Alcazar, Victor Escorcia, Bernard Ghanem

机构 * Department of Computer Science(计算机科学系) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学科学与技术学院)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 MoCA-Video通过在冻结的视频扩散模型潜在空间中进行语义混合,实现无需训练的高质量视频编辑,通过动量修正和伽马残差模块提升时间稳定性和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09864 2025-12-11 cs.CV 57%

UniUGP: Unifying Understanding, Generation, and Planing For End-to-end Autonomous Driving

UniUGP:统一理解、生成与规划以实现端到端自动驾驶

Hao Lu, Ziyang Liu, Guangfeng Jiang, Yuanfei Luo, Sheng Chen, Yangang Zhang, Ying-Cong Chen

机构 * ByteDance Seed(字节跳动种子)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 UniUGP通过整合预训练视觉模型和视频生成模型,实现端到端自动驾驶中的场景推理、视频生成和轨迹规划,提升复杂场景下的性能和泛化能力。

Comments Project Page: https://seed-uniugp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09995 2025-12-11 cs.CV 57%

PlayerOne: Egocentric World Simulator

PlayerOne:第一人称真实世界模拟器

Yuanpeng Tu, Hao Luo, Xi Chen, Xiang Bai, Fan Wang, Hengshuang Zhao

机构 * HKU(香港大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(华盘实验室) HUST(华中科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PlayerOne通过第一人称真实世界模拟器实现了沉浸式探索,通过粗到细的训练流程和部分解耦运动注入方案,实现了对人类运动的精确控制和多样化场景的一致建模。

Comments Project page: https://playerone-hku.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08905 2025-12-10 cs.CV 57%

Self-Evolving 3D Scene Generation from a Single Image

从单张图像自演化生成3D场景

Kaizhi Zheng, Yue Fan, Jing Gu, Zishuo Xu, Xuehai He, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 EvoScene通过自演化框架从单张图像生成高质量3D场景,结合几何推理和视觉知识,实现结构和外观的逐步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06963 2025-12-09 cs.RO cs.AI cs.CV 57%

VideoVLA: Video Generators Can Be Generalizable Robot Manipulators

VideoVLA: 视频生成器可以成为通用的机器人操作器

Yichao Shen, Fangyun Wei, Zhiying Du, Yaobo Liang, Yan Lu, Jiaolong Yang, Nanning Zheng, Baining Guo

机构 * IAIR, Xi’an Jiaotong University(人工智能研究院、西安交通大学) Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 VideoVLA通过将视频生成模型转化为机器人VLA操作器,实现了动作与视觉后果的双预测,提升机器人操作的泛化能力。

Comments Project page: https://videovla-nips2025.github.io

Journal ref The Thirty-ninth Annual Conference on Neural Information Processing Systems(NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06674 2025-12-09 cs.CV 57%

RunawayEvil: Jailbreaking the Image-to-Video Generative Models

RunawayEvil: 对图像到视频生成模型的劫持

Songping Wang, Rufan Qian, Yueming Lyu, Qinglong Liu, Linzhuang Zou, Jie Qin, Songhua Liu, Caifeng Shan

机构 * PRLab, Nanjing University(南京大学PRLab) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 RunawayEvil是一种针对图像到视频生成模型的多模态劫持框架,通过自我进化机制实现动态攻击策略,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06022 2025-12-09 cs.SD cs.MM 57%

DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation

DreamFoley: 用于高保真视频到音频生成的可扩展视觉-语言模型

Fu Li, Weichao Zhao, You Li, Zhichao Zhou, Dongliang He

机构 * Bytedance Intelligent Creation Lab(字节跳动智能创作实验室) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 DreamFoley通过结合视觉-语言模型,提出了一种可扩展的视频到音频生成方法,实现了高保真音频生成并优化了训练效率与质量的平衡。

Comments 10 pages; Bytedance

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05969 2025-12-09 cs.CV cs.AI 57%

Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices

视频模型开始解决国际象棋、迷宫、数独、心理旋转和雷文矩阵任务

Hokin Deng

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 视频模型通过强化学习提升推理能力,在多项任务上达到60%的成功率。

Comments See $\href{https://grow-ai-like-a-child.com/video-reason/}{results}$ and $\href{https://github.com/hokindeng/VMEvalKit}{code}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07978 2025-12-08 cs.CV 57%

Martian World Model: Controllable Video Synthesis with Physically Accurate 3D Reconstructions

火星世界模型:可控视频合成与物理准确的3D重建

Longfei Li, Zhiwen Fan, Wenyan Cong, Xinhang Liu, Yuyang Yin, Matt Foutter, Panwang Pan, Chenyu You, Yue Wang, Zhangyang Wang, Yao Zhao, Marco Pavone, Yunchao Wei

机构 * BJTU(北京工业大学) UT Austin(德克萨斯大学奥斯汀分校) HKUST(香港科技大学) Stanford University(斯坦福大学) XMU(厦门大学) SBU(雪城大学) USC(南加州大学) NVIDIA(英伟达)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出M3arsSynth和MarsGen,通过物理准确的3D重建生成逼真的火星视频,提升任务模拟与机器人训练的可视化效果。

Comments Project Page: https://marsgenai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04483 2025-12-05 cs.CV 57%

DeRA: Decoupled Representation Alignment for Video Tokenization

DeRA: 解耦表示对齐用于视频标记化

Pengbo Guo, Junke Wang, Zhen Xing, Chengxu Liu, Daoguo Dong, Xueming Qian, Zuxuan Wu

机构 * Xi’an Jiaotong University(西安交通大学) Shanghai Innovation Institute(上海创新研究院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 DeRA通过解耦时空表示学习,提升视频标记化效率和性能,并在视频生成任务中取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25998 2025-12-05 cs.CV cs.AI 57%

VRWKV-Editor: Reducing quadratic complexity in transformer-based video editing

VRWKV-Editor: 降低基于变换器的视频编辑中的二次复杂度

Abdelilah Aitrouga, Youssef Hmamouche, Amal El Fallah Seghrouchni

机构 * International Artificial Intelligence Center of Morocco University Mohammed VI Polytechnic Rabat, Morocco(摩洛哥国际人工智能中心摩洛哥穆莱·伊沙克·穆莱·阿卜杜勒阿齐兹 polytechnic 大学拉巴特分校) University Mohammed VI Polytechnic Rabat, Morocco(摩洛哥穆莱·伊沙克·穆莱·阿卜杜勒阿齐兹 polytechnic 大学拉巴特分校) Sorbonne University, LIP6 - UMR 7606 CNRS, France(索邦大学,LIP6 - UMR 7606 CNRS,法国)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 VRWKV-Editor通过引入线性时空聚合模块,降低基于变换器的视频编辑模型的计算复杂度,实现3.7倍加速和60%内存节省,同时保持高质量的帧一致性和文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03013 2025-12-03 cs.CV cs.AI cs.GR 57%

In-Context Sync-LoRA for Portrait Video Editing

上下文同步LoRA用于肖像视频编辑

Sagi Polaczek, Or Patashnik, Ali Mahdavi-Amiri, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Simon Fraser University(Simon Fraser大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 Sync-LoRA通过上下文LoRA实现肖像视频编辑,保持帧同步和身份一致性,支持多样化的修改如外观变化和物体添加。

Comments Project page: https://sagipolaczek.github.io/Sync-LoRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23172 2025-12-02 cs.CV 57%

Fast Multi-view Consistent 3D Editing with Video Priors

快速多视角一致3D编辑与视频先验

Liyi Chen, Ruihuang Li, Guowen Zhang, Pengfei Wang, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出ViP3DE方法,利用视频生成模型的时间一致性先验,实现多视角一致的3D编辑,提升编辑质量和速度。

Comments accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00762 2025-12-02 cs.CV 57%

Seeing the Wind from a Falling Leaf

从飘落的树叶中看到风

Zhiyuan Gao, Jiageng Mao, Hong-Xing Yu, Haozhe Lou, Emily Yue-Ting Jia, Jernej Barbic, Jiajun Wu, Yue Wang

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种端到端可微逆图形框架,通过视频恢复不可见的物理力,应用于风场估计和基于物理的视频生成与编辑。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21475 2025-11-27 cs.CV 57%

MobileI2V: Fast and High-Resolution Image-to-Video on Mobile Devices

MobileI2V: 一种适用于移动设备的快速高分辨率图像到视频生成方法

Shuai Zhang, Bao Tang, Siyuan Yu, Yueting Zhu, Jingfeng Yao, Ya Zou, Shanglin Yuan, Li Yu, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MobileI2V通过轻量级扩散模型和优化策略,在移动设备上实现快速高分辨率图像到视频生成,生成速度提升10倍,质量与现有模型相当。

Comments Our Demo and code:https://github.com/hustvl/MobileI2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20809 2025-11-27 cs.CV 57%

Layer-Aware Video Composition via Split-then-Merge

通过分割后再融合的分层视频合成

Ozgur Kara, Yujia Chen, Ming-Hsuan Yang, James M. Rehg, Wen-Sheng Chu, Du Tran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 StM通过分割未标注视频并融合动态前景与背景层,提升生成视频合成的控制能力和数据效率。

Comments Project Webpage: https://split-then-merge.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20426 2025-11-26 cs.CV cs.AI 57%

Block Cascading: Training Free Acceleration of Block-Causal Video Models

块级级联:无训练加速块因果视频模型

Hmrishav Bandyopadhyay, Nikhil Pinnaparaju, Rahim Entezari, Jim Scott, Yi-Zhe Song, Varun Jampani

机构 * Stability AI SketchX, University of Surrey(SketchX, Surrey大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 块级级联通过无训练并行化技术,显著提升块因果视频模型的推理速度,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19435 2025-11-26 cs.CV 57%

Are Image-to-Video Models Good Zero-Shot Image Editors?

图像到视频模型是否是良好的零样本图像编辑器?

Zechuan Zhang, Zhenyuan Chen, Zongxin Yang, Yi Yang

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 IF-Edit通过无需微调的框架,利用预训练图像到视频扩散模型实现指令驱动的图像编辑,解决提示错位、冗余时间潜在特征和模糊后期帧问题,展现强大的推理能力和通用编辑竞争力。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14993 2025-11-26 cs.AI cs.CV 57%

Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification

多模态生成式AI:多模态大语言模型、扩散模型与统一

Xin Wang, Yuwei Zhou, Bin Huang, Hong Chen, Wenwu Zhu

机构 * Department of Computer Science, Beijing Information Science and Technology National Research Center, Tsinghua University(计算机系,北京信息科学与技术国家研究中心,清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文综述了多模态生成式AI,涵盖多模态LLMs、扩散模型及统一模型的设计与应用,探讨了统一理解和生成的方法及未来研究方向。

Comments 21 pages, 10 figures, 3 tables

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16655 2025-11-26 cs.CV 57%

MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence

MovieDreamer:用于生成连贯长视觉序列的分层生成

Canyu Zhao, Mingyu Liu, Wen Wang, Weihua Chen, Fan Wang, Hao Chen, Bo Zhang, Chunhua Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MovieDreamer通过结合自回归模型与扩散渲染,实现长时长视频生成,提升叙事连贯性和视觉质量。

Comments 30 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19401 2025-11-25 cs.CV cs.AI 57%

In-Video Instructions: Visual Signals as Generative Control

视频中的指令:将视觉信号作为生成控制

Gongfan Fang, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究提出通过视频中嵌入的视觉信号作为指令,实现可控的图像到视频生成,通过空间感知的指令分配提升多对象场景下的生成可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18919 2025-11-25 cs.CV cs.AI 57%

Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation

学习信任什么:基于贝叶斯先验引导的视觉生成优化

Ruiying Liu, Yuanzhi Liang, Haibin Huang, Tianshu Yu, Chi Zhang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出贝叶斯先验引导优化方法,通过建模奖励不确定性提升视觉生成模型的语义对齐和感知保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20840 2025-11-25 cs.RO cs.AI cs.MM 57%

Learning Primitive Embodied World Models: Towards Scalable Robotic Learning

学习原始具身世界模型:迈向可扩展的机器人学习

Qiao Sun, Liujia Yang, Wei Tang, Wei Huang, Kaixin Xu, Yongchao Chen, Mingyu Liu, Jiange Yang, Haoyi Zhu, Yating Wang, Tong He, Yilun Chen, Xili Dai, Nanyang Ye, Qinying Gu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan(复旦大学) SJTU(上海交通大学) NJUST(南京理工大学) THU(清华大学) Harvard(哈佛大学) ZJU(浙江大学) NJU(南京大学) USTC(中国科学技术大学) Tongji(同济大学) HKUST (GZ)(香港科技大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 提出原始具身世界模型(PEWM)以解决具身数据稀疏和高维问题,通过短视界视频生成实现细粒度对齐、降低学习复杂度并提高数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18277 2025-11-25 cs.CV 57%

Point-to-Point: Sparse Motion Guidance for Controllable Video Editing

点到点:用于可控视频编辑的稀疏运动引导

Yeji Song, Jaehyun Lee, Mijin Koo, JunHoo Lee, Nojun Kwak

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 Point-to-Point通过引入锚点标记,利用视频扩散模型的先验知识,实现可控视频编辑中运动与编辑的高质量保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16783 2025-11-24 cs.HC cs.AI cs.CV 57%

Generative Augmented Reality: Paradigms, Technologies, and Future Applications

生成增强现实:范式、技术与未来应用

Chen Liang, Jiawen Zheng, Yufeng Zeng, Yi Tan, Hengye Lyu, Yuhui Zheng, Zisu Li, Yueting Weng, Jiaxin Shi, Hanwang Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学) XMax.AI Ltd.(XMax.AI有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出生成增强现实(GAR)作为下一代AR范式,通过统一生成模型实现环境再合成,提升真实感与沉浸感,同时引发技术、内容生态及伦理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18137 2025-11-20 cs.LG cs.AI cs.CV cs.PF 57%

SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference

Jintao Zhang, Chendong Xiang, Haofeng Huang, Jia Wei, Haocheng Xi, Jun Zhu, Jianfei Chen

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究所,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) Institute for Interdisciplinary Information Sciences, Tsinghua University(交叉信息学院,清华大学) EECS, University of California, Berkeley(电子工程与计算机科学系,加州大学伯克利分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments @inproceedings{zhang2025spargeattn, title={Spargeattn: Accurate sparse attention accelerating any model inference}, author={Zhang, Jintao and Xiang, Chendong and Huang, Haofeng and Wei, Jia and Xi, Haocheng and Zhu, Jun and Chen, Jianfei}, booktitle={International Conference on Machine Learning (ICML)}, year={2025} }

Journal ref Proceedings of the 42 nd International Conference on Machine Learning, PMLR 267, 2025 (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏