RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache
RDKV: 用于联合擦除和量化KV缓存的率-失真位分配
机构 * ETH Zurich(苏黎世联邦理工学院) ; Tsinghua University(清华大学)
AI总结 RDKV通过联合优化擦除与量化,提升长序列推理效率,实现9.1%的性能提升和97.81%的准确率恢复。
高校专区
RDKV: 用于联合擦除和量化KV缓存的率-失真位分配
机构 * ETH Zurich(苏黎世联邦理工学院) ; Tsinghua University(清华大学)
AI总结 RDKV通过联合优化擦除与量化,提升长序列推理效率,实现9.1%的性能提升和97.81%的准确率恢复。
隐式神经表示中的类别信号是聚类还是路由?
机构 * South China Normal University(南方科技大学) ; Beijing University of Chemical Technology(北京化工大学) ; Tsinghua University(清华大学) ; Xi’an Jiaotong University(西安交通大学)
AI总结 研究探讨了隐式神经表示中类别信号的几何结构,发现其并非简单聚类,而是通过读者路由实现可分类性。
超越ViT标记:面向细胞级密集预测的掩码扩散预训练卷积病理基础模型
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Research Institute of Tsinghua, Pearl River Delta(清华大学 Pearl River Delta 研究院) ; The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳))
AI总结 本文提出ConvNeXt Masked-Diffusion模型,通过卷积生成预训练框架提升病理图像细胞级密集预测性能,实验表明其在有限标注条件下表现更优,优于现有ViT模型和端到端分割方法。
为何DiT编辑器会漂移?VAE潜在空间中的插件式低频对齐
机构 * Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Peking University(北京大学) ; CASIA ; University of Electronic Science and Technology of China(电子科技大学) ; Guangming Laboratory(光明实验室)
AI总结 本文从潜在空间频率角度研究DiT编辑器漂移问题,提出无需训练的VAE-LFA方法,通过低频对齐抑制语义漂移并保持高频细节,适用于白盒和黑盒DiT编辑器。
Comments 9 pages main paper, 12 figures, 25 pages in total
推理源自大型语言模型中受限推断流形
机构 * Renmin University of China(中国人民大学) ; Tsinghua University(清华大学) ; Xiaomi EV(小米电动车) ; Xiamen University(厦门大学)
AI总结 研究通过分析推理过程中的内部表示演变,发现推理动态在高维空间中自组织为低维流形,但需满足表示能力、流形压缩和非退化信息体积等条件才能实现稳定推理。
Proxy3D: 通过语义聚类和对齐实现视觉-语言模型的高效3D表示
机构 * Tsinghua University(清华大学) ; Panasonic AI Lab(松下人工智能实验室) ; Panasonic DX-CPS(松下DX-CPS) ; UC Berkeley(伯克利大学)
AI总结 本文提出Proxy3D方法,通过语义和几何编码器提取场景特征并进行语义感知聚类,生成紧凑且全面的3D代理表示,提升视觉-语言模型在3D视觉问答、视觉定位和空间智能任务中的性能。
Comments Accepted by CVPR 2026. Project page: https://wzzheng.net/Proxy3D
面向高约束人类动作生成的检索引导扩散噪声优化
机构 * Tsinghua University(清华大学) ; University of New South Wales(新南威尔士大学)
AI总结 本文提出基于无训练扩散噪声优化框架的检索引导方法,通过关系任务解析和奖励引导掩码优化,解决高约束下的动作生成问题,提升虚拟代理行为合成能力。
Comments Accepted to CVPR2026
NoiseGate: 在世界动作模型中学习每潜在时间步的调度作为信息门控
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; JDT AI Infra(JDT AI 基础设施) ; Tianjin University(天津大学)
AI总结 本文提出NoiseGate,通过学习每潜在时间步的调度作为信息门控策略,改进世界动作模型中的动作生成与未来观察建模。
在现实世界中大型语言模型的幻觉:来自不存在引用的大规模证据
机构 * Department of Information Science, Cornell University(信息科学系,康奈尔大学) ; Department of Sociology, University of California Los Angeles(社会学系,加州大学洛杉矶分校) ; Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) ; Haas School of Business, University of California Berkeley(哈斯商学院,加州大学伯克利分校)
AI总结 研究通过验证引用数据揭示LLM生成虚假引用的问题,发现2025年存在146932个虚假引用,且在AI应用快速发展的领域和语言特征显示AI辅助写作的论文中尤为严重,影响科学认可的公平性。
安全,还是仅仅无能?重新思考手机使用代理的安全性评估
机构 * Tencent Hunyuan(腾讯文言) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Tsinghua University(清华大学)
AI总结 本文提出PhoneSafety基准,通过700个关键安全时刻评估手机使用代理的安全性,发现更强的通用能力不等于更安全的选择,且无能行为更像是能力信号而非安全信号。
Comments work in progress
BrickCraft: 基于情境手动指导的长视界互锁积木组装技能组合
机构 * Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 BrickCraft通过情境手册将高层装配计划与物理执行连接,利用相对公式分解复杂任务为可重用的原始技能,实现长视界互锁积木组装。
SAM 3D Animal:基于图像的野外多动物3D重建的可提示框架
机构 * University of Cambridge(剑桥大学) ; Southern University of Science and Technology(南方科技大学) ; Tsinghua University(清华大学) ; IMATI-CNR, Milan, Italy(意大利米兰IMATI-CNR研究所)
AI总结 本文提出SAM 3D Animal,首个可提示的多动物3D重建框架,基于SMAL+参数化动物模型,通过关键点和掩码提示实现拥挤和遮挡场景的可靠重建,利用Herd3D数据集在多个数据集上取得最优结果。
FAAST:通过闭式快速权重实现的前向仅关联学习用于测试时监督适应
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Tsinghua University(清华大学) ; Shanghai Polytechnic University(上海理工大学)
AI总结 FAAST通过单次传递将标注示例分析性编译为快速权重,实现常数时间推理,减少适应时间90%并节省内存使用,适用于资源受限模型的高效监督任务适应。
Comments 9 pages, 6 figures, 10 tables
DGPO:基于分布的策略优化用于细粒度信用分配
机构 * Peking University(北京大学) ; SJTU(上海交通大学) ; Tsinghua University(清华大学)
AI总结 DGPO通过引入分布引导的策略优化框架,解决传统方法在细粒度信用分配中的不足,通过Hellinger距离和熵门机制实现安全探索与有效区分真实推理突破,提升大语言模型在复杂推理任务中的性能。
揭示细粒度视觉痕迹:评估多模态交错推理链在多模态STEM任务中的表现
机构 * Tsinghua University(清华大学) ; Meituan Inc(美团公司) ; Central South University(中南大学) ; Peking University(北京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出StepSTEM基准,通过严格筛选的283个STEM问题,评估多模态大语言模型的跨模态推理能力,发现现有模型仍依赖文本推理,揭示了真实跨模态STEM推理的潜力。
利用预决议信号为未来预测代理
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) ; IIIS, Tsinghua University(清华大学人工智能研究院)
AI总结 本文提出通过预决议信号提升未来预测性能,通过Milkyway代理在未决问题多次回顾中提取信息,改进预测并增强后续准确性。
Comments Work in progress
HAIC:通过动态感知世界模型实现人形敏捷物体交互控制
机构 * Tsinghua University(清华大学) ; HKUST(Guangzhou)(香港科技大学(广州)) ; ETH Zurich(苏黎世联邦理工学院) ; Xiaomi Robotics Lab(小米机器人实验室)
AI总结 本文提出HAIC框架,通过动态预测和空间优先级构建动态占用地图,实现人形机器人在复杂动态环境下与不同物体的稳健交互,提升敏捷任务和多物体长周期任务的完成能力。
Comments RSS 2026. Webpage: https://haic-humanoid.github.io/
ReSeek:一种具有指导性奖励的自我纠正搜索代理框架
机构 * Basic Algorithm Center, PCG, Tencent, Shenzhen, China(腾讯基本算法中心、PCG、腾讯,深圳,中国) ; Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生学院,清华大学,深圳,中国)
AI总结 本文提出ReSeek框架,通过引入自我纠正机制和密集指导性奖励函数,提升搜索代理在复杂任务中的表现和路径忠实度。
Comments ICML 2026
从时间序列分析到问答:在大语言模型时代的一次综述
机构 * Renmin University of China(中国人民大学) ; Tsinghua University(清华大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Aalborg University(奥胡斯大学)
AI总结 本文综述了大语言模型时代时间序列分析向时间序列问答的转变,探讨了TSQA在灵活性、经济性和通用性方面的选择指导及未来研究方向。
Comments Accepted by IJCAI 2026 Survey Track
基于评分标准的思考:从外部评估者到内部推理指导
机构 * Tsinghua University(清华大学) ; Renmin University of China(中国人民大学)
AI总结 本文提出Think-with-Rubrics方法,通过将评分标准整合到推理过程中,使评分标准成为LLM生成的内部指导,提升生成质量。
速度空间3D资产编辑
机构 * Tsinghua University(清华大学) ; South China University of Technology(华南理工大学) ; Peng Cheng Laboratory(鹏城实验室)
AI总结 本文提出VS3D框架,通过在采样器内部进行针对性干预,解决3D编辑中局部修改与保持其余部分的三大问题,包括身份泄漏、编辑信号放大和身份拖拽。
SoLAR:基于锚点激活和潜在重构的抗误差流式长时自由视角视频重建
机构 * National Engineering Laboratory for Video Technology, School of Computer Science, Peking University(国家视频技术工程实验室,计算机科学学院,北京大学) ; School of Computer Science, Jilin University(吉林大学计算机科学学院) ; Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)
AI总结 SoLAR提出一种抗误差流式长时自由视角视频重建框架,通过动态锚点激活和潜在重构机制,在无需分组图像分区的情况下维持稳定重建质量,实现高效存储和实时性能。
Sword: 通过动态潜在自举实现风格鲁棒的世界模型作为模拟器用于VLA策略后训练
机构 * Tianjin University(天津大学) ; Tsinghua University(清华大学) ; Swinburne University of Technology(西敏大学) ; JDT AI Infra(JDT AI基础设施)
AI总结 本文提出Sword框架,通过结构引导的风格增强和动态潜在自举提升VLA模型在特定环境中的泛化能力、生成质量和鲁棒性。
从早期经验学习代理路由
机构 * AI Lab, Princeton University(普林斯顿大学人工智能实验室) ; University of Michigan(密歇根大学) ; Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息学院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Edinburgh(爱丁堡大学) ; King’s College London(伦敦国王学院)
AI总结 本文研究在冷启动条件下如何在轻量级LLM推理与完整代理执行间进行路由,提出无需训练的BoundaryRouter框架,通过早期行为经验和指导性推理决定是否直接使用LLM还是升级至代理,实验显示其在降低推理时间与提升性能方面优于其他方法。
Comments 17 pages
视觉文本压缩作为度量传输
机构 * University of Alberta(阿尔伯塔大学) ; vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) ; Tsinghua University(清华大学)
AI总结 本文通过度量传输理论分析视觉文本压缩,提出无标签路由准则和传输感知聚焦机制,提升压缩效率并优化下游任务表现。
VLA-GSE: 提升VLA中基于通用和专用专家的参数高效微调
机构 * Microsoft Research Asia(微软亚洲研究院) ; Tsinghua University(清华大学)
AI总结 VLA-GSE通过通用和专用专家机制提升VLA在机器人控制中的参数高效微调效果,保留预训练知识的同时提高适应能力,实验表明其在多个基准测试中表现优异。
AEM:多轮代理强化学习中的自适应熵调节
机构 * Baidu(百度) ; Tsinghua University(清华大学) ; Fudan University(复旦大学)
AI总结 AEM通过自适应调节熵动态,改进多轮代理强化学习中的探索与利用平衡,无需监督即可提升性能。
Comments 30 pages
以代理为中心的观测适应用于动态扰动下的鲁棒视觉控制
机构 * City University of Hong Kong(香港城市大学) ; Tsinghua University(清华大学)
AI总结 本文提出ACO-MoE方法,通过结合路由的修复专家和前景掩码分支,解决动态扰动下的视觉控制问题,提升下游任务性能。
Comments Source code is available at https://github.com/fangzr/aco-moe-code
神经连续时间马尔可夫链:通过解耦的跳跃时间和方向实现离散扩散
机构 * Tsinghua University(清华大学) ; Beijing Institute of Mathematical Sciences and Applications(北京数学科学研究院) ; Wuhan University(武汉大学) ; MathonAI
AI总结 本文提出神经CTMC模型,通过解耦跳跃时间和方向参数化,提升离散扩散生成性能,实验表明其在TinyStories和OpenWebText上优于现有方法。
注意力稀疏性是输入稳定的:通过离线稀疏性分析和在线QK共聚类实现训练自由的视频生成稀疏注意力
机构 * SKLCCSE, School of Computer Science and Engineering, Beihang University(软件学院,北京航空航天大学) ; Beihang University(北京航空航天大学) ; School of Computer Science, Peking University(北京大学计算机学院) ; the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) ; School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) ; BNRist, Tsinghua University(北京理工大学,清华大学) ; Zhongguancun Academy(中关村学院)
AI总结 本文提出SVOO框架,通过离线层间稀疏性分析和在线双向共聚类实现训练自由的视频生成稀疏注意力,解决传统方法中层异质性和查询-键耦合问题,提升生成质量与速度的平衡。
Comments Accepted by ICML 2026