arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4547
2605.08317 2026-05-12 cs.LG cs.AI

RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache

RDKV: 用于联合擦除和量化KV缓存的率-失真位分配

Junkai Zhang, Hang Guo, Luca Benini, Yawei Li

机构 * ETH Zurich(苏黎世联邦理工学院) Tsinghua University(清华大学)

AI总结 RDKV通过联合优化擦除与量化,提升长序列推理效率,实现9.1%的性能提升和97.81%的准确率恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08281 2026-05-12 cs.CV

Is Class Signal Clustered or Routed in Task-Induced Implicit Neural Representation Weight Spaces?

隐式神经表示中的类别信号是聚类还是路由?

Xinyi Guo, Mingyi He, Haobin Ding, Weiming Chen, Xinrui Chen, Jiawen Li, Di Zhang, Minxi Ouyang, Yizhi Wang, Xitong Ling

机构 * South China Normal University(南方科技大学) Beijing University of Chemical Technology(北京化工大学) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学)

AI总结 研究探讨了隐式神经表示中类别信号的几何结构,发现其并非简单聚类,而是通过读者路由实现可分类性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08276 2026-05-12 cs.CV

Beyond ViT Tokens: Masked-Diffusion Pretrained Convolutional Pathology Foundation Model for Cell-Level Dense Prediction

超越ViT标记:面向细胞级密集预测的掩码扩散预训练卷积病理基础模型

Weiming Chen, Xitong Ling, Zhenyang Cai, Xidong Wang, Jiawen Li, Tian Guan, Benyou Wang, Yonghong He

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Research Institute of Tsinghua, Pearl River Delta(清华大学 Pearl River Delta 研究院) The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳))

AI总结 本文提出ConvNeXt Masked-Diffusion模型,通过卷积生成预训练框架提升病理图像细胞级密集预测性能,实验表明其在有限标注条件下表现更优,优于现有ViT模型和端到端分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08250 2026-05-12 cs.CV cs.AI

Why Do DiT Editors Drift? Plug-and-Play Low Frequency Alignment in VAE Latent Space

为何DiT编辑器会漂移?VAE潜在空间中的插件式低频对齐

Xiaoce Wang, Sifan Zhou, Kaifei Wang, Leli Xu, Xuerui Qiu, Tao He, Ming Li

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学) CASIA University of Electronic Science and Technology of China(电子科技大学) Guangming Laboratory(光明实验室)

AI总结 本文从潜在空间频率角度研究DiT编辑器漂移问题,提出无需训练的VAE-LFA方法,通过低频对齐抑制语义漂移并保持高频细节,适用于白盒和黑盒DiT编辑器。

Comments 9 pages main paper, 12 figures, 25 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08142 2026-05-12 cs.LG cs.CL cs.CV

Reasoning emerges from constrained inference manifolds in large language models

推理源自大型语言模型中受限推断流形

Yanbiao Ma, Fei Luo, Linfeng Zhang, Chuangxin Zhao, Mingxuan Wang, Yinan Wu, Zhe Qian, Yang Lu, Long Chen, Zhao Cao, Xiaoshuai Hao, Ji-Rong Wen, Jungong Han

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Xiaomi EV(小米电动车) Xiamen University(厦门大学)

AI总结 研究通过分析推理过程中的内部表示演变,发现推理动态在高维空间中自组织为低维流形,但需满足表示能力、流形压缩和非退化信息体积等条件才能实现稳定推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08064 2026-05-11 cs.CV

Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment

Proxy3D: 通过语义聚类和对齐实现视觉-语言模型的高效3D表示

Jerry Jiang, Haowen Sun, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, Kurt Keutzer, Wenzhao Zheng

机构 * Tsinghua University(清华大学) Panasonic AI Lab(松下人工智能实验室) Panasonic DX-CPS(松下DX-CPS) UC Berkeley(伯克利大学)

AI总结 本文提出Proxy3D方法,通过语义和几何编码器提取场景特征并进行语义感知聚类,生成紧凑且全面的3D代理表示,提升视觉-语言模型在3D视觉问答、视觉定位和空间智能任务中的性能。

Comments Accepted by CVPR 2026. Project page: https://wzzheng.net/Proxy3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08054 2026-05-11 cs.CV

Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization

面向高约束人类动作生成的检索引导扩散噪声优化

Hanchao Liu, Fang-Lue Zhang, Shining Zhang, Tai-Jiang Mu, Shi-Min Hu

机构 * Tsinghua University(清华大学) University of New South Wales(新南威尔士大学)

AI总结 本文提出基于无训练扩散噪声优化框架的检索引导方法,通过关系任务解析和奖励引导掩码优化,解决高约束下的动作生成问题,提升虚拟代理行为合成能力。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07794 2026-05-11 cs.RO

NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models

NoiseGate: 在世界动作模型中学习每潜在时间步的调度作为信息门控

Wen Huang, Haoran Sun, Yongjian Guo, Yunxuan Ma, Haoran Li, Jing Long, Zhouying Mo, Zhong Guan, Yucheng Guo, Shuai Di, Junwu Xiong

机构 * Tsinghua University(清华大学) Peking University(北京大学) JDT AI Infra(JDT AI 基础设施) Tianjin University(天津大学)

AI总结 本文提出NoiseGate,通过学习每潜在时间步的调度作为信息门控策略,改进世界动作模型中的动作生成与未来观察建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07723 2026-05-11 cs.DL cs.AI cs.CY physics.soc-ph

LLM hallucinations in the wild: Large-scale evidence from non-existent citations

在现实世界中大型语言模型的幻觉:来自不存在引用的大规模证据

Zhenyue Zhao, Yihe Wang, Toby Stuart, Mathijs De Vaan, Paul Ginsparg, Yian Yin

机构 * Department of Information Science, Cornell University(信息科学系,康奈尔大学) Department of Sociology, University of California Los Angeles(社会学系,加州大学洛杉矶分校) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Haas School of Business, University of California Berkeley(哈斯商学院,加州大学伯克利分校)

AI总结 研究通过验证引用数据揭示LLM生成虚假引用的问题,发现2025年存在146932个虚假引用,且在AI应用快速发展的领域和语言特征显示AI辅助写作的论文中尤为严重,影响科学认可的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07630 2026-05-11 cs.CL cs.AI cs.LG

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

安全,还是仅仅无能?重新思考手机使用代理的安全性评估

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯文言) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

AI总结 本文提出PhoneSafety基准,通过700个关键安全时刻评估手机使用代理的安全性,发现更强的通用能力不等于更安全的选择,且无能行为更像是能力信号而非安全信号。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07605 2026-05-11 cs.RO

BrickCraft: Visuomotor Skill Composition with Situated Manual Guidance for Long-Horizon Interlocking Brick Assembly

BrickCraft: 基于情境手动指导的长视界互锁积木组装技能组合

Jichuan Yu, Bowei Li, Zhenran Tang, Guanxing Lu, Chuxiong Hu, Ruixuan Liu, Changliu Liu

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 BrickCraft通过情境手册将高层装配计划与物理执行连接,利用相对公式分解复杂任务为可重用的原始技能,实现长视界互锁积木组装。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07604 2026-05-11 cs.CV cs.AI

SAM 3D Animal: Promptable Animal 3D Reconstruction from Images in the Wild

SAM 3D Animal:基于图像的野外多动物3D重建的可提示框架

Xuyi Hu, Jin Lyu, Jiuming Liu, Yebin Liu, Silvia Zuffi, Liang An, Stefan Goetz

机构 * University of Cambridge(剑桥大学) Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) IMATI-CNR, Milan, Italy(意大利米兰IMATI-CNR研究所)

AI总结 本文提出SAM 3D Animal,首个可提示的多动物3D重建框架,基于SMAL+参数化动物模型,通过关键点和掩码提示实现拥挤和遮挡场景的可靠重建,利用Herd3D数据集在多个数据集上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04651 2026-05-11 cs.LG cs.CL

FAAST: Forward-Only Associative Learning via Closed-Form Fast Weights for Test-Time Supervised Adaptation

FAAST:通过闭式快速权重实现的前向仅关联学习用于测试时监督适应

Guangsheng Bao, Hongbo Zhang, Han Cui, Ke Sun, Yanbin Zhao, Juncai He, Yue Zhang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Shanghai Polytechnic University(上海理工大学)

AI总结 FAAST通过单次传递将标注示例分析性编译为快速权重,实现常数时间推理,减少适应时间90%并节省内存使用,适用于资源受限模型的高效监督任务适应。

Comments 9 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03327 2026-05-11 cs.LG cs.AI

DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment

DGPO:基于分布的策略优化用于细粒度信用分配

Hongbo Jin, Rongpeng Zhu, Zhongjing Du, Xu Jiang, Jingqi Tian, Qiaoman Zhang, Jiayu Ding

机构 * Peking University(北京大学) SJTU(上海交通大学) Tsinghua University(清华大学)

AI总结 DGPO通过引入分布引导的策略优化框架,解决传统方法在细粒度信用分配中的不足,通过Hellinger距离和熵门机制实现安全探索与有效区分真实推理突破,提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19697 2026-05-11 cs.CV

Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

揭示细粒度视觉痕迹:评估多模态交错推理链在多模态STEM任务中的表现

Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

机构 * Tsinghua University(清华大学) Meituan Inc(美团公司) Central South University(中南大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出StepSTEM基准,通过严格筛选的283个STEM问题,评估多模态大语言模型的跨模态推理能力,发现现有模型仍依赖文本推理,揭示了真实跨模态STEM推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15719 2026-05-11 cs.AI

Harnessing Pre-Resolution Signals for Future Prediction Agents

利用预决议信号为未来预测代理

Chuyang Wei, Maohang Gao, Zhixin Han, Kefei Chen, Yu Zhuang, Haoxiang Guan, Yanzhi Zhang, Yilin Cheng, Xiren Zhou, Huanhuan Chen, Jian Li, Jiyan He, Yu Shi, Yitong Duan, Shuxin Zheng

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) IIIS, Tsinghua University(清华大学人工智能研究院)

AI总结 本文提出通过预决议信号提升未来预测性能,通过Milkyway代理在未决问题多次回顾中提取信息,改进预测并增强后续准确性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11758 2026-05-11 cs.RO

HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model

HAIC:通过动态感知世界模型实现人形敏捷物体交互控制

Dongting Li, Xingyu Chen, Qianyang Wu, Bo Chen, Sikai Wu, Hanyu Wu, Guoyao Zhang, Liang Li, Mingliang Zhou, Diyun Xiang, Jianzhu Ma, Qiang Zhang, Renjing Xu

机构 * Tsinghua University(清华大学) HKUST(Guangzhou)(香港科技大学(广州)) ETH Zurich(苏黎世联邦理工学院) Xiaomi Robotics Lab(小米机器人实验室)

AI总结 本文提出HAIC框架,通过动态预测和空间优先级构建动态占用地图,实现人形机器人在复杂动态环境下与不同物体的稳健交互,提升敏捷任务和多物体长周期任务的完成能力。

Comments RSS 2026. Webpage: https://haic-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00568 2026-05-11 cs.CL

ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards

ReSeek:一种具有指导性奖励的自我纠正搜索代理框架

Shiyu Li, Yang Tang, Yifan Wang, Peiming Li, Xi Chen

机构 * Basic Algorithm Center, PCG, Tencent, Shenzhen, China(腾讯基本算法中心、PCG、腾讯,深圳,中国) Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生学院,清华大学,深圳,中国)

AI总结 本文提出ReSeek框架,通过引入自我纠正机制和密集指导性奖励函数,提升搜索代理在复杂任务中的表现和路径忠实度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11512 2026-05-11 cs.LG cs.AI

From Time Series Analysis to Question Answering: A Survey in the LLM Era

从时间序列分析到问答:在大语言模型时代的一次综述

Wei Li, Zhe Xie, Yuxuan Liang, Xinli Hao, Yunyao Cheng, Dan Pei, Xiaofeng Meng

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Aalborg University(奥胡斯大学)

AI总结 本文综述了大语言模型时代时间序列分析向时间序列问答的转变,探讨了TSQA在灵活性、经济性和通用性方面的选择指导及未来研究方向。

Comments Accepted by IJCAI 2026 Survey Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07461 2026-05-11 cs.CL

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

基于评分标准的思考:从外部评估者到内部推理指导

Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学)

AI总结 本文提出Think-with-Rubrics方法,通过将评分标准整合到推理过程中,使评分标准成为LLM生成的内部指导,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07385 2026-05-11 cs.GR cs.CV

Velocity-Space 3D Asset Editing

速度空间3D资产编辑

Hao Liu, Yuxuan Lin, Jingfeng Guo, Ruihang Chu, Junjie Wang, Ruotong Li, Yujiu Yang

机构 * Tsinghua University(清华大学) South China University of Technology(华南理工大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出VS3D框架,通过在采样器内部进行针对性干预,解决3D编辑中局部修改与保持其余部分的三大问题,包括身份泄漏、编辑信号放大和身份拖拽。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07346 2026-05-11 cs.CV

SoLAR: Error-Resilient Streamable Long-Horizon Free-Viewpoint Video Reconstruction with Anchor Activation and Latent Recalibration

SoLAR:基于锚点激活和潜在重构的抗误差流式长时自由视角视频重建

Haotian Zhang, Xu Mo, Yixin Yu, Guanhua Zhu, Jian Xue, Tongda Xu, Yan Wang, Jiaqi Zhang, Siwei Ma, Wen Gao

机构 * National Engineering Laboratory for Video Technology, School of Computer Science, Peking University(国家视频技术工程实验室,计算机科学学院,北京大学) School of Computer Science, Jilin University(吉林大学计算机科学学院) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

AI总结 SoLAR提出一种抗误差流式长时自由视角视频重建框架,通过动态锚点激活和潜在重构机制,在无需分组图像分区的情况下维持稳定重建质量,实现高效存储和实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07288 2026-05-11 cs.CV cs.AI

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

Sword: 通过动态潜在自举实现风格鲁棒的世界模型作为模拟器用于VLA策略后训练

Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Swinburne University of Technology(西敏大学) JDT AI Infra(JDT AI基础设施)

AI总结 本文提出Sword框架,通过结构引导的风格增强和动态潜在自举提升VLA模型在特定环境中的泛化能力、生成质量和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07180 2026-05-11 cs.CL

Learning Agent Routing From Early Experience

从早期经验学习代理路由

Yimin Wang, Jiahao Qiu, Xuan Qi, Xinzhe Juan, Jingzhe Shi, Zelin Zhao, Hongru Wang, Shilong Liu, Mengdi Wang

机构 * AI Lab, Princeton University(普林斯顿大学人工智能实验室) University of Michigan(密歇根大学) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息学院) Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学) King’s College London(伦敦国王学院)

AI总结 本文研究在冷启动条件下如何在轻量级LLM推理与完整代理执行间进行路由,提出无需训练的BoundaryRouter框架,通过早期行为经验和指导性推理决定是否直接使用LLM还是升级至代理,实验显示其在降低推理时间与提升性能方面优于其他方法。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06708 2026-05-11 cs.CV cs.AI

Visual Text Compression as Measure Transport

视觉文本压缩作为度量传输

Lv Tang, Tianyi Zheng, Yang Liu, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Tsinghua University(清华大学)

AI总结 本文通过度量传输理论分析视觉文本压缩,提出无标签路由准则和传输感知聚焦机制,提升压缩效率并优化下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06175 2026-05-11 cs.RO

VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts

VLA-GSE: 提升VLA中基于通用和专用专家的参数高效微调

Yuhua Jiang, Junjie Lu, Xinyao Qin, Xiaoyu Chen, Kaixin Wang, Feifei Gao, Li Zhao

机构 * Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

AI总结 VLA-GSE通过通用和专用专家机制提升VLA在机器人控制中的参数高效微调效果,保留预训练知识的同时提高适应能力,实验表明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00425 2026-05-11 cs.AI

AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning

AEM:多轮代理强化学习中的自适应熵调节

Haotian Zhao, Songlin Zhou, Yuxin Zhang, Stephen S. -T. Yau, Wenyu Zhang, Lun Tian, Tianshu Zhu, Yifeng Huang, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu

机构 * Baidu(百度) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 AEM通过自适应调节熵动态,改进多轮代理强化学习中的探索与利用平衡,无需监督即可提升性能。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24661 2026-05-11 cs.RO

Agent-Centric Observation Adaptation for Robust Visual Control under Dynamic Perturbations

以代理为中心的观测适应用于动态扰动下的鲁棒视觉控制

Zhengru Fang, Yu Guo, Fei Liu, Yuang Zhang, Yihang Tao, Senkang Hu, Wenbo Ding, Yuguang Fang

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

AI总结 本文提出ACO-MoE方法,通过结合路由的修复专家和前景掩码分支,解决动态扰动下的视觉控制问题,提升下游任务性能。

Comments Source code is available at https://github.com/fangzr/aco-moe-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15694 2026-05-11 cs.LG math.PR

Neural Continuous-Time Markov Chain: Discrete Diffusion via Decoupled Jump Timing and Direction

神经连续时间马尔可夫链:通过解耦的跳跃时间和方向实现离散扩散

Jingyuan Li, Xiaoyi Jiang, Fukang Wen, Wei Liu, Renqian Luo, Yi Zhu, Zuoqiang Shi, Pipi Hu

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京数学科学研究院) Wuhan University(武汉大学) MathonAI

AI总结 本文提出神经CTMC模型,通过解耦跳跃时间和方向参数化,提升离散扩散生成性能,实验表明其在TinyStories和OpenWebText上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18636 2026-05-11 cs.CV

Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering

注意力稀疏性是输入稳定的:通过离线稀疏性分析和在线QK共聚类实现训练自由的视频生成稀疏注意力

Jiayi Luo, Jiayu Chen, Jiankun Wang, Cong Wang, Hanxin Zhu, Qingyun Sun, Chen Gao, Zhibo Chen, Jianxin Li

机构 * SKLCCSE, School of Computer Science and Engineering, Beihang University(软件学院,北京航空航天大学) Beihang University(北京航空航天大学) School of Computer Science, Peking University(北京大学计算机学院) the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) BNRist, Tsinghua University(北京理工大学,清华大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出SVOO框架,通过离线层间稀疏性分析和在线双向共聚类实现训练自由的视频生成稀疏注意力,解决传统方法中层异质性和查询-键耦合问题,提升生成质量与速度的平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏