IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse
IndexCache: 通过跨层索引复用加速稀疏注意力
机构 * Tsinghua University(清华大学)
AI总结 IndexCache通过跨层索引复用减少75%的计算量,提升预填和解码速度,有效优化稀疏注意力效率。
高校专区
IndexCache: 通过跨层索引复用加速稀疏注意力
机构 * Tsinghua University(清华大学)
AI总结 IndexCache通过跨层索引复用减少75%的计算量,提升预填和解码速度,有效优化稀疏注意力效率。
QChunker: 通过多智能体辩论学习问题感知的文本分块以实现领域RAG
机构 * School of Information, Renmin University of China(中国人民大学信息学院) ; School of Smart Governance, Renmin University of China(中国人民大学智能治理学院) ; School of Information, BRAIN, Renmin University of China(中国人民大学信息学院、BRAIN学院) ; School of Economics and Management, Tsinghua University(清华大学经济管理学院)
AI总结 QChunker通过多智能体辩论框架,提升RAG中文本分块的语义完整性和信息粒度,采用ChunkScore评估指标,实现更高效高质量的文本分块生成。
分词使多模态大语言模型能够理解、生成和编辑建筑平面图
机构 * Tsinghua University(清华大学) ; UC Berkeley(伯克利大学)
AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。
Comments 20 pages, 9 figures. Accepted to CVPR 2026
从宠物到机器人:MojiKit作为影响性人机交互设计的数据驱动工具包
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tsinghua University(清华大学) ; Beijing Institute of Technology(北京理工大学) ; Sichuan University(四川大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 MojiKit通过结合结构化参考卡片、拟人化机器人原型和行为控制工作室,为影响性人机交互设计提供数据驱动的系统化工具,帮助用户设计更多样化的机器人影响性行为。
Comments 25 pages, 11 figures, Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)
驯服OpenClaw:自主LLM代理威胁的分析与缓解
机构 * Ant Group & Tsinghua University(蚂蚁集团与清华大学) ; Tsinghua University(清华大学)
AI总结 本文分析了自主LLM代理OpenClaw的安全威胁,提出五层安全框架,揭示现有防御机制的不足,并提出包括插件审查、上下文过滤等在内的综合防御策略。
MANSION: 多楼层语言到3D场景生成用于长周期任务
机构 * Tsinghua University(清华大学) ; AgiBot ; McGill University, MILA - Quebec AI Institute(麦吉尔大学,魁北克人工智能研究所)
AI总结 MANSION是首个多楼层语言驱动的3D场景生成框架,能生成真实可导航的建筑环境,支持跨楼层长周期任务的开发与评估,同时配套发布MansionWorld数据集和任务语义编辑代理,为空间推理和规划提供关键测试平台。
Mango-GS: 通过多帧节点引导的4D高斯散射提升动态场景重建的空间-时间一致性
机构 * School of Software, Tsinghua University(清华大学软件学院)
AI总结 Mango-GS通过多帧节点引导的4D高斯散射方法,提升动态场景重建的空间-时间一致性,实现高保真重建与实时渲染。
GeoDiff4D: 基于几何的扩散模型用于4D头像重建
机构 * Tsinghua University(清华大学) ; Li Auto(利亚自动)
AI总结 GeoDiff4D通过几何感知扩散模型,结合表面法线和表情编码器,实现了高保真的4D头像重建,提升了视觉质量和跨身份泛化能力。
Comments 17 pages
混合策略强化学习可调节探索用于多模态推理
机构 * Aberystwyth University(阿伯里斯特维斯大学) ; Institute of Artificial Intelligence (TeleAl)(人工智能研究所) ; China Telecom(中国电信) ; Tsinghua University(清华大学)
AI总结 本文提出CalibRL框架,通过分布感知优势加权和非对称激活函数实现可控探索,提升多模态推理模型的探索与利用平衡。
Comments Published as a conference paper at ICLR 2026
GTR-Bench:评估视觉-语言模型中的地理时间推理
机构 * Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院) ; Peking University(北京大学) ; Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)
AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。
Comments ICLR 2026, 31 pages, 20 figures
基于变分模型的定制UNet图像分割:一种深度变分框架
机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) ; School of Mathematics, China University of Mining and Technology(中国矿业大学数学学院)
AI总结 本文提出VM_TUNet框架,结合变分模型与UNet,通过数据驱动操作和定制有限点法提升图像分割精度与可解释性。
天quant-S2S:通过整合气候状态构建全球亚季节至季节天气模型
机构 * Sun Yat-Sen University(中山大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学) ; National Supercomputing Center in Shenzhen(深圳国家超算中心) ; Huawei Technologies Co Ltd(华为技术有限公司)
AI总结 天quant-S2S通过整合气候状态和不确定性增强的Transformer,提升了亚季节至季节天气预测的准确性和稳定性。