Executable Agentic Memory for GUI Agent
可执行代理记忆用于GUI代理
机构 * Tsinghua University, China(清华大学, 中国) ; Sun Yat-sen University, China(中山大学, 中国)
AI总结 本文提出EAM,一种结构化知识图谱,通过检索与执行过程提升GUI规划的鲁棒性,实验显示其在AndroidWorld上优于现有基线模型,并显著降低token成本。
高校专区
可执行代理记忆用于GUI代理
机构 * Tsinghua University, China(清华大学, 中国) ; Sun Yat-sen University, China(中山大学, 中国)
AI总结 本文提出EAM,一种结构化知识图谱,通过检索与执行过程提升GUI规划的鲁棒性,实验显示其在AndroidWorld上优于现有基线模型,并显著降低token成本。
多领域多任务图对齐指令微调的统一图语言模型
机构 * Tsinghua University(清华大学)
AI总结 本文提出UniGraphLM,通过多领域多任务GNN编码器学习可泛化的图表示,并与LLM进行自适应对齐,以解决跨领域和任务的图对齐问题。
TAR:基于文本语义的跨模态图像配准框架用于光学和SAR图像
机构 * Key Laboratory of Intelligent Perception and Image Understanding of Ministry of Education of China, School of Artificial Intelligence, Xidian University(中国教育部智能感知与图像理解重点实验室,西安电子科技大学人工智能学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
AI总结 本文提出TAR框架,通过文本语义先验缓解模态差距,提升跨模态特征学习,解决大形变下的光学与SAR图像配准问题。
OmniRefine: 一种面向对齐的协作压缩方法以提高多模态大语言模型的效率
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Pengcheng Laboratory(鹏城实验室)
AI总结 本文提出OmniRefine,一种无需训练的两阶段框架,通过跨模态对齐和协作压缩提升多模态大语言模型的推理效率与性能稳定性。
Sobolev正则化最大均值差异梯度流
机构 * Tsinghua University(清华大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; University College London(伦敦大学学院) ; Google Deepmind(谷歌DeepMind)
AI总结 本文提出Sobolev正则化最大均值差异(SrMMD)梯度流,通过梯度惩罚改善MMD目标的非凸性,提供连续和离散时间下的全局收敛性保证,且无需依赖等周假设。该方法适用于生成建模和采样任务。
UniVLR: 统一文本与视觉的视觉潜在推理用于多模态大语言模型
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; Zhongguancun Academy(中关村学院)
AI总结 UniVLR提出一种统一的视觉潜在推理框架,将文本推理和辅助视觉证据视为共享的视觉工作空间,通过压缩统一表示提升多模态大语言模型的视觉推理效率。
迈向通用游戏玩家:对游戏多元宇宙中基础模型的调查
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; MMLab, The University of Hong Kong(香港大学MMLab) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 本文探讨了在游戏多元宇宙中训练通用游戏玩家的基础模型,分析了数据集、模型、工具和基准四个支柱,并提出五阶段路线图,旨在实现能够同时创造和演化游戏世界的通用智能体。
Comments 51 pages, 7 figures, github: https://github.com/THUSI-Lab/Awesome-LFMs-Play-Games
SPECTRE:混合普通-并行推测服务用于资源高效的LLM推理
机构 * Tsinghua University(清华大学) ; AI Infra Team at JDT(AI基础设施团队) ; JD iCity, JD Technology, JD Intelligent Cities Research(京东i城、京东科技、京东智能城市研究院)
AI总结 SPECTRE通过利用未充分利用的尾部模型服务作为远程草稿生成器,提升大型模型推理效率,采用混合策略、推测优先调度和草稿压缩技术,实现并行处理,提升吞吐量并减少干扰。
高效利用GPU原生视频编解码器实现远程KV缓存重用
机构 * Nanjing University(南京大学) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))
AI总结 本文提出基于GPU原生视频编解码器的远程KV缓存重用方案,通过紧凑布局和高效传输减少TTFT,实验显示比现有方法提升3.51倍。
Comments Accepted by SIGCOMM 2026
从观测到状态:潜在时间序列预测
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Northwestern University(西北大学)
AI总结 本文提出LatentTSF方法,通过将时间序列预测从观测回归转向潜在状态预测,解决潜在混沌问题,提升预测准确性和表示质量。
Comments Accepted at ICML 2026
UnfoldLDM: 基于迭代潜在扩散先验的退化感知展开网络用于盲图像恢复
机构 * Duke University(杜克大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; Xiamen University(厦门大学)
AI总结 本文提出UnfoldLDM,结合深度展开网络与潜在扩散模型,解决盲图像恢复中的退化依赖和过平滑偏差问题,通过多粒度退化感知模块和退化抗性LDM提取先验,提升恢复质量与视觉效果。
Comments 6 figures, 11 tables
OpsAgent:一种用于微服务中 incident 管理的演进多智能体系统
机构 * Nankai University(南开大学) ; Alibaba Cloud(阿里云) ; Lenovo(联想) ; Tsinghua University(清华大学)
AI总结 本文提出 OpsAgent,一种轻量级自演进多智能体系统,通过训练自由数据处理器将异构可观测数据转化为结构化文本描述,并结合多智能体协作框架实现诊断推理的透明性和可审计性,实验证明其在微服务系统中的泛化性、可解释性和成本效益。
连续离散扩散:使你的扩散语言模型成为潜在推理器
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Microsoft Research(微软研究院) ; Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥)) ; Peking University(北京大学) ; Tsinghua University(清华大学)
AI总结 本文提出CCDD模型,结合连续和离散空间,提升扩散语言模型的表达能力和训练效果,通过联合多模态扩散过程实现高质量的生成与推理。
Comments 29 pages. Accepted to ICML 2026
MotionBench: 视觉语言模型视频细粒度运动理解的基准测试与改进
机构 * Tsinghua University(清华大学) ; Zhipu AI(智谱AI)
AI总结 MotionBench针对视觉语言模型在细粒度视频运动理解方面的不足,提出综合评估基准,通过六类运动导向问题类型评估模型运动层面感知能力,并提出Through-Encoder融合方法提升模型对有限序列长度内细粒度运动的感知。
Comments 20 pages
SafeSteer: 多模态大语言模型中的解码级防御机制
机构 * Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Kuaishou Technology(快手科技) ; School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Chongqing University(重庆大学) ; Wuhan University(武汉大学)
AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。
DiffScore:超越自回归似然的文本评估
机构 * Ant Group(蚂蚁集团) ; Tsinghua University(清华大学) ; Technical University of Munich(慕尼黑技术大学)
AI总结 DiffScore通过基于掩码大扩散语言模型的掩码重建方法,消除位置偏差,建立从局部流畅到全局连贯的评估体系,并提供诊断工具提升文本评估效果。
hindsight提示蒸馏:从无链式思维答案的SWE代理中获得引导式推理
机构 * Tsinghua University(清华大学)
AI总结 本文提出HHD方法,通过利用模型自身失败的自我回滚生成 hindsight提示,指导在线回滚完成任务,无需CoT标注,实验显示其在SWE-bench Verified上提升8%。
Comments 28 pages, 7 figures
基于条件记忆的增强项表示用于生成推荐
机构 * City University of Hong Kong(香港城市大学) ; Independent Researcher(独立研究者) ; Tsinghua University(清华大学)
AI总结 本文提出ComeIR框架,通过重构SID-token嵌入为项感知输入并恢复解码时的token粒度,解决生成推荐中项表示构造的瓶颈问题。
VidSplat:基于几何引导视频扩散先验的高斯点云重建
机构 * School of Software, Tsinghua University(清华大学软件学院) ; Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)
AI总结 VidSplat通过几何引导的视频扩散先验,解决稀疏视图下3D场景重建问题,提出免训练生成框架,迭代合成新视角以恢复完整3D场景。
Comments Accepted by SIGGRAPH Conference 2026. Project Page: https://tangjm24.github.io/VidSplat
DCVD:双通道跨模态融合用于联合漏洞检测与定位
机构 * Tsinghua University(清华大学) ; Hunan University(湖南大学) ; Dalian Maritime University(大连海事大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shenzhen University(深圳大学) ; Northwestern Polytechnical University(西北工业大学) ; Shandong University(山东大学) ; BNU-HKBU United International College(北京师范大学-香港浸会大学联合国际学院) ; Sun Yat-sen University(中山大学) ; Peng Cheng Laboratory(鹏城实验室) ; Guangzhou Intelligence Communications Technology Co., Ltd.(广州智能通信技术有限公司) ; The Fifth Electronic Research Institute of MIIT(中华人民共和国信息产业部第五电子研究所)
AI总结 本文提出DCVD框架,通过双通道融合实现功能级检测与语句级定位的联合优化,有效解决单一信息源和缺乏显式监督的问题。
超越最后一层:多层表示融合用于视觉标记化
机构 * Peking University(北京大学) ; Meituan Inc(美团公司) ; Tsinghua University(清华大学) ; IGDL
AI总结 本文提出DRoRAE,通过多层特征融合恢复丢失的视觉信息,提升图像生成质量,并揭示了表示丰富性与重建质量的log-linear关系。
学习蛋白质-蛋白质相互作用的优先级:一种模型无关的方法
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; National University of Singapore(新加坡国立大学) ; IDEA Research(IDEA研究院)
AI总结 本文提出L3-PPI方法,通过生物启发的L3路径正则化图提示学习,提升蛋白质相互作用预测性能。
Comments Accepted at ICML 2026
VulTriage:基于LLM的漏洞检测三路径上下文增强
机构 * Tsinghua University(清华大学) ; Henan University(河南大学) ; Dalian Maritime University(大连海事大学) ; The Chinese University of Hong Kong(香港中文大学) ; Northwestern Polytechnical University(西北工业大学) ; BNU-HKBU United International College(北京理工大学-香港大学联合国际学院) ; Southeast University(东南大学) ; Jilin University(吉林大学) ; Sun Yat-sen University(中山大学) ; Peng Cheng Laboratory(鹏城实验室) ; Guangzhou Intelligence Communications Technology Co., Ltd.(广州智能通信技术有限公司) ; The Fifth Electronic Research Institute of MIIT(信息产业部第五电子研究所)
AI总结 本文提出VulTriage框架,通过三路径上下文增强提升LLM在漏洞检测中的性能,实验表明其在关键指标上优于现有方法,且在低资源和类别不平衡场景下具有良好的泛化能力。
学习探索:通过探索意识策略优化实现代理推理的扩展
机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) ; School of Cyber Science and Technology, Sun Yat-sen University Shenzhen Campus, Shenzhen, China(中山大学深圳校区信息科学与技术学院) ; State Key Laboratory of Internet Architecture, Tsinghua University, Beijing, China(清华大学互联网体系结构国家重点实验室)
AI总结 本文提出一种探索意识强化学习框架,使LLM代理在不确定性高时主动探索,通过细粒度奖励函数和探索意识分组机制提升任务完成效率。
SkillMaster:迈向LLM代理自主技能掌握
机构 * Shandong University(山东大学) ; Zhongguancun Academy(中关村学院) ; Tsinghua University(清华大学) ; Southeast University(东南大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 SkillMaster通过轨迹引导技能复习、反事实效用评估和DualAdv-GRPO算法,使LLM代理能自主创建、优化和选择技能,提升任务成功率8.8%和9.3%。
安全对齐作为持续学习:通过正交梯度投影缓解对齐税
机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research(生命科学学院,IDG/麦戈文脑科学研究所) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center(计算机科学与技术系,人工智能研究所,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心) ; Tsinghua University, Beijing, China(清华大学,北京,中国)
AI总结 本文通过持续学习视角研究安全对齐与通用能力退化之间的权衡,提出OGPSA方法通过正交梯度投影提升安全性和实用性,实验显示在不同训练流程中显著改善安全-效用权衡。