Universal YOCO for Efficient Depth Scaling
通用YOCO用于高效深度扩展
机构 * Microsoft Research(微软研究院) ; Tsinghua University(清华大学)
AI总结 本文提出通用YOCO(YOCO-U),结合递归计算与YOCO解码器解码器架构,实现更高效的推理效率与深度扩展能力,通过参数共享和浅层高效注意力层提升性能。
高校专区
通用YOCO用于高效深度扩展
机构 * Microsoft Research(微软研究院) ; Tsinghua University(清华大学)
AI总结 本文提出通用YOCO(YOCO-U),结合递归计算与YOCO解码器解码器架构,实现更高效的推理效率与深度扩展能力,通过参数共享和浅层高效注意力层提升性能。
通过分层特征优化增强联邦学习中的梯度反向攻击
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
AI总结 本文提出GIFD方法,通过分解GAN模型并搜索中间层的分层特征,提升梯度反向攻击的表达能力和泛化能力,同时引入正则化约束和OOD场景下的标签映射技术,实现像素级重建。
随机注意力:受连接组启发的随机路由用于表达性线性时间注意力
机构 * Tsinghua University(清华大学)
AI总结 本文提出Stochastic Attention,通过随机排列token序列提升注意力机制的表达性,实现更高效的全局通信,在预训练和推理任务中均优于传统方法。
HabitatAgent:一种端到端的多智能体系统用于住房咨询
机构 * Fangdongdong(方东东) ; Tsinghua University(清华大学) ; Columbia University(哥伦比亚大学)
AI总结 本文提出HabitatAgent,一种基于LLM的多智能体系统,通过四个专业角色提供可审计且可靠的住房咨询流程,实现高准确率的住房选择支持。
Comments Accepted at the DMO-FinTech Workshop (PAKDD 2026)
局部自信,全局停滞:扩散语言模型中的质量探索困境
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Tsinghua University(清华大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; McGill University(麦吉尔大学)
AI总结 本文探讨了扩散语言模型中质量与探索的矛盾,提出了一种平衡两者的方法,通过优化分布和采样策略提升生成质量与探索能力。
PReD:基于大语言模型的电磁感知、识别与决策基础多模态模型
机构 * Tsinghua University(清华大学) ; National University of Defense Technology(国防科技大学) ; Beihang University(北京航空航天大学) ; Tianjin University(天津大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学) ; Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; The Hong Kong University of Science and Technology(香港科技大学) ; Civil Aviation University of China(中国民航大学) ; Beijing Institute of Technology(北京理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 本文提出PReD,首个电磁领域基础模型,涵盖感知、识别与决策闭环,构建高质量多任务电磁数据集和评估基准,通过多阶段训练策略提升电磁领域能力,实验显示在PReD-Bench上达到最佳性能。
超越黄金数据:通过时间步选择性训练解决运动-视觉质量困境
机构 * Tsinghua University(清华大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
AI总结 本文提出TQD方法,通过时间步选择性训练解决视频生成中运动与视觉质量的矛盾,证明在不平衡数据上训练可超越传统高质量数据训练效果。
Comments Accepted to CVPR 2026
语义音频视觉导航在连续环境中
机构 * Wuhan University(武汉大学) ; Zhongguancun Academy(中关村学院) ; Shandong Jianzhu University(山东建筑大学) ; Nankai University(南开大学) ; Tsinghua University(清华大学) ; CASIA(中国科学院自动化研究所) ; UCAS(中国科学院大学)
AI总结 本文提出MAGNet模型,通过多模态Transformer实现语义目标推理,提升在连续空间中导航的鲁棒性与成功率。
Comments This paper has been accepted to CVPR 2026
MVSS:多视图结构化调查生成的统一框架
机构 * Beijing University of Technology(北京工业大学) ; Peking University(北京大学) ; Beihang University(北京航空航天大学) ; Tsinghua University(清华大学)
AI总结 本文提出MVSS框架,通过结构优先方法生成和对齐引用支撑的层级树、结构化比较表和调查文本,提升调查生成的结构组织和证据呈现质量。
ActErase: 一种无需训练的概念擦除范式通过激活重定向
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Peng Cheng Laboratory(鹏城实验室)
AI总结 本文提出无需训练的概念擦除方法ActErase,通过激活差异区域分析和动态替换输入激活,实现高效概念擦除,同时保持模型生成能力,且具有对抗攻击鲁棒性。
让模型分配其怀疑:通过 verbalized 概率分布进行置信度估计
机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
AI总结 本文通过生成 verbalized 概率分布提升置信度估计,系统实验显示其在多个 LLM 和任务中表现优异,推理效率高且计算节省显著,但也揭示了特定任务的局限性。
AlphaResearch:利用语言模型加速新算法发现
机构 * Tsinghua University(清华大学) ; New York University(纽约大学) ; Yale University(耶鲁大学)
AI总结 AlphaResearch通过迭代提出新想法、编程验证和优化研究提案,实现了在开放性问题上发现新算法的突破,其在六个开放性问题上的表现优于其他系统,尤其在圆圈排列问题上超越了人类和基线模型。
AgentExpt: 基于LLM的资源检索代理自动化AI实验设计
机构 * Tsinghua University(清华大学) ; Shandong University(山东大学) ; Northeastern University(东北大学)
AI总结 本文提出基于LLM的资源检索代理框架,通过自动化数据收集和集体感知增强检索,提升实验设计的自动化和可解释性,实验结果显示在Recall@20和HitRate@5上分别提升5.85%和8.30%。
Comments 10 pages
CLoD-GS:通过3D高斯散射实现连续细节层次
机构 * Tsinghua University(清华大学) ; AMAP(高德地图)
AI总结 本文提出CLoD-GS框架,利用3D高斯散射技术实现连续细节层次,通过动态调整高斯体透明度,实现单模型的平滑细节渐变,减少存储开销和视觉瑕疵。
Comments Accepted by ICLR 2026 poster
LPS-GNN:在拥有1000亿条边的图上部署图神经网络
机构 * Tsinghua University(清华大学) ; Sun Yat-sen University(中山大学) ; Tencent Inc(腾讯公司) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出LPS-GNN框架,通过优化图分区和子图增强策略,在单块GPU10小时内处理1000亿图节点,提升用户获取场景性能13.8%。
Journal ref ACM Transactions on Knowledge Discovery from Data (TKDD) (2026)
MATHDance:具有统一标记化的Mamba-Transformer架构用于高质量3D舞蹈生成
机构 * Renmin University of China(中国人民大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学) ; Beihang University(北京航空航天大学)
AI总结 本文提出MATHDance框架,通过两阶段设计提升音乐到舞蹈生成的一致性,采用Kinematic-Dynamic量化阶段和混合架构生成高质量3D舞蹈。
面向知识增强视觉推理的自动足球解说生成
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)
AI总结 本文提出GameSight模型,通过视觉推理与知识增强生成更准确的足球解说,提升解说质量与上下文相关性。
Comments Accepted by ICME 2026