Attention Sinks Induce Gradient Sinks
注意力沉底引发梯度沉底
机构 * Tsinghua University(清华大学) ; Peking University(北京大学)
AI总结 研究从反向传播角度探讨注意力沉底与梯度沉底的关系,发现因果掩码下注意力沉底会引发梯度集中,且在预归一化架构中,大规模激活是训练时对梯度压力的适应性响应。
Comments 10 pages, 5 figures
高校专区
注意力沉底引发梯度沉底
机构 * Tsinghua University(清华大学) ; Peking University(北京大学)
AI总结 研究从反向传播角度探讨注意力沉底与梯度沉底的关系,发现因果掩码下注意力沉底会引发梯度集中,且在预归一化架构中,大规模激活是训练时对梯度压力的适应性响应。
Comments 10 pages, 5 figures
参数高效模态平衡对称融合用于多模态遥感语义分割
机构 * College of Land Science and Technology, China Agricultural University(中国农业大学土地科学与技术学院) ; Key Laboratory of Remote Sensing for Agri-Hazards, Ministry of Agriculture and Rural Affairs(农业农村部农业灾害遥感重点实验室) ; Faculty of Geosciences and Engineering, Southwest Jiaotong University(西南交通大学地质科学与工程学院) ; School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) ; Henan Polytechnic University(河南理工大学) ; Key Laboratory of Spatio-Temporal Information and Ecological Restoration of Mines, Ministry of Natural Resources of the People’s Republic of China(矿产资源时空信息与生态修复重点实验室) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; National Supercomputing Center in Shenzhen, Shenzhen, China(深圳国家超算中心) ; Ministry of Education Key Laboratory for Earth System Modeling and the Department of Earth System Science, Tsinghua University(地球系统模拟教育部重点实验室和清华大学地球系统科学系)
AI总结 本文提出MoBaNet,通过参数高效和模态平衡的对称融合框架,在减少可训练参数的同时提升多模态遥感语义分割的鲁棒性和平衡性。
Comments 14 pages, 6 figures
DancingBox:一种轻量级的基于物理代理的字符动画系统
机构 * University of Edinburgh 10 Crichton Street Edinburgh United Kingdom ; Inria, Universit\' e C\ o te d'Azur 2004 route des lucioles Valbonne France ; Tsinghua University No. 30 Shuangqing Road, Haidian District Beijing China ; University of Edinburgh ; Inria, Universit\' e C\ o te d'Azur ; Tsinghua University
AI总结 DancingBox通过将运动捕捉过程转化为数字提线木偶,利用日常物体的粗略运动生成逼真动画,降低了新手动画师的进入门槛。
Comments Accepted to CHI2026
通过合成视频学习可迁移的时间原语以实现视频推理
机构 * Zhejiang University(浙江大学) ; Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
AI总结 本文提出SynRL框架,通过合成视频训练模型的时间原语,提升视频推理能力,在15个基准测试中取得显著成效,合成数据在复杂场景中表现优于真实数据。
VeriAgent:一种集成工具的多智能体系统,具有进化记忆,用于PPA感知的RTL代码生成
机构 * Xiamen University(厦门大学) ; Tsinghua University(清华大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 本文提出一种集成EDA工具的多智能体框架,用于高质量Verilog代码生成,通过进化记忆机制实现功能正确性和PPA指标的联合优化。
AdaZoom-GUI: 基于自适应缩放的GUI定位与指令细化
机构 * Lenovo Research(联想研究院) ; Tsinghua University(清华大学)
AI总结 本文提出AdaZoom-GUI框架,通过指令细化模块和条件缩放策略提升GUI定位精度与指令理解,构建高质量数据集并采用GRPO训练模型,实现在高分辨率GUI理解中的最佳性能。
具有双分支编码器的物理信息深度混合Koopman车辆动力学模型用于分布式电动卡车
机构 * School of Vehicle and Mobility, and State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University, Beijing, China(车辆与移动系统学院和智能绿色车辆与移动系统国家重点实验室,清华大学,北京,中国) ; KargoBot Inc., Beijing, China(KargoBot公司,北京,中国)
AI总结 本文提出了一种基于Koopman算子理论的全数据驱动方法,用于复杂分布式电动卡车的动力学建模,通过双分支编码器和物理信息监督机制提升建模精度和兼容性。
Comments 13 pages, 8 tables, 7 figures
超越异常值:一种无需数据的分层混合精度量化方法,由数值和结构双敏感性驱动
机构 * The University of Hong Kong(香港大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Tencent(腾讯)
AI总结 本文提出NSDS方法,通过数值和结构双敏感性驱动分层混合精度量化,无需校准数据,在不同模型和任务中均优于基线方法。
基于视觉语言模型的递归推理用于估计长周期具身任务进度
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) ; Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。
Comments CVPR 2026
MG-Grasp:基于稀疏RGB观测的度量尺度几何6自由度抓取框架
机构 * The Department of Electronic Engineering, Tsinghua University, Beijing 100084, China(清华大学电子工程系,北京100084,中国) ; The Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(香港科学与技术大学电子与计算机工程系,香港,中国)
AI总结 本文提出MG-Grasp框架,利用双视角3D基础模型实现高精度6自由度抓取,通过稀疏RGB图像重建密集点云并生成稳定抓取方案,实验证明其在RGB基抓取方法中达到SOTA水平。
Comments 8 pages, 5 figures
OMNIFLOW:一种基于物理的多模态代理用于通用科学推理
机构 * Tsinghua University(清华大学) ; Tencent(腾讯) ; Shenzhen Loop Area Institute(深圳河套学院) ; Ocean University of China(海洋大学) ; HKUST (Guangzhou)(香港科技大学(广州))
AI总结 OMNIFLOW通过引入语义-符号对齐机制和物理引导的推理流程,实现了多模态模型在物理定律下的科学推理,显著提升了零样本泛化和少样本适应能力,提供透明且物理一致的推理报告。
AvatarForcing:通过局部-未来滑动窗口去噪实现一步流式谈话 avatars
机构 * Zhejiang University(浙江大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Tsinghua University(清华大学)
AI总结 本文提出AvatarForcing,一种一步流式扩散框架,通过局部-未来滑动窗口去噪实现高实时性谈话 avatars,实验证明其在34ms/帧下具备高质量视觉和唇同步性能。
超越短时间 horizon:VQ-记忆用于非马尔可夫仿真基准中的鲁棒长时间 manipulation
机构 * Tsinghua University(清华大学) ; Fudan University(复旦大学) ; Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))
AI总结 本文提出 RuleSafe 基准,通过 LLM 辅助仿真框架构建非马尔可夫任务,引入 VQ-Memory 以提升长时间规划和泛化能力。
Comments 9 pages
M3DLayout:一个多源的3D室内布局及结构描述数据集用于3D生成
机构 * Tsinghua University(清华大学) ; Beihang University(北京航空航天大学) ; Migu Beijing Research Institute(咪咕北京研究院)
AI总结 本文提出M3DLayout数据集,包含21367个布局和433k个物体实例,整合真实扫描、专业CAD设计和程序生成场景,为3D生成模型提供多样化的空间和语义学习基础。
Comments CVPR 2026; Project Page: https://graphic-kiliani.github.io/M3DLayout/