Your Code Agent Can Grow Alongside You with Structured Memory
你的代码代理可以与你一同成长,借助结构化记忆
机构 * Tsinghua University(清华大学)
AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。
Comments Code Agent
高校专区
你的代码代理可以与你一同成长,借助结构化记忆
机构 * Tsinghua University(清华大学)
AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。
Comments Code Agent
Aura:通用多维外源整合用于航空时间序列
机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学) ; Hongshen College, Chongqing University(弘深学院、重庆大学) ; School of Software, Tsinghua University(软件学院、清华大学) ; China Southern Airlines(中国南方航空)
AI总结 本文提出Aura框架,通过整合多维外源因素提升航空时间序列预测精度,实验表明其在航空安全与可靠性方面具有广泛应用潜力。
HyReaL: 通过超复数空间表示学习进行属性图聚类
机构 * Tsinghua University(清华大学) ; Xiamen University(厦门大学) ; Shenzhen University(深圳大学) ; Northeastern University(东北大学) ; Hong Kong Baptist University(香港 Baptist大学)
AI总结 HyReaL通过引入超复数空间提升属性图聚类的表示学习,解决过平滑问题,增强属性耦合学习能力,无需过多图卷积层即可实现更有效的聚类。
Comments Accepted to DASFAA 2026
分子科学的多任务大规模推理模型
机构 * Pengcheng Laboratory(鹏城实验室) ; School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)
AI总结 本文提出多任务大规模推理模型,结合科学逻辑与深度学习,通过强化学习提升分子推理能力,在10项任务中实现50.3%的性能提升,验证了显式推理机制的有效性。
频谱防御对抗资源攻击在3D高斯点云中
机构 * Nanyang Technological University(南洋理工大学) ; UESTC ; Tsinghua University(清华大学) ; GigaAI ; VinUniversity(文大学)
AI总结 本文提出频谱防御方法,通过3D频率滤波和2D频谱正则化,有效抑制资源攻击导致的高斯点云过度增长,提升3DGS的鲁棒性、精度和安全性。
Cheers:解耦补丁细节与语义表示以实现统一的多模态理解和生成
机构 * Tsinghua University(清华大学) ; Xi’an Jiaotong University(西安交通大学) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 Cheers通过解耦补丁细节与语义表示,实现统一的多模态理解和生成,提升图像生成的保真度,并在多个基准测试中表现优异,同时实现4倍的token压缩效率。
Comments 17 pages, 5 figures
MoKus: 利用跨模态知识迁移实现知识感知的概念定制
机构 * Tsinghua University(清华大学) ; HKUST(香港科技大学)
AI总结 本文提出MoKus框架,通过跨模态知识迁移实现知识感知的概念定制,解决稀有token在预训练数据中缺失导致的性能不稳定问题,并引入KnowCusBench基准测试,验证了方法在概念定制任务中的优越性。
Comments Project Page: https://chenyangzhu1.github.io/MoKus/
CM-Bench:一个综合的跨模态特征匹配基准,连接可见图像和红外图像
机构 * School of Instrument Science and Opto-Electronics Engineering, Beijing Information Science and Technology University(北京信息科技大学仪器科学与光电工程学院) ; Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)
AI总结 本文提出CM-Bench,涵盖30种跨模态特征匹配算法,用于评估同源性估计、相对姿态估计和基于特征匹配的地理定位,包含自适应预处理和新的红外-卫星跨模态数据集。
从不完美的人类运动数据中学习竞技型人形网球技能
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Galbot Inc.(Galbot公司) ; Shanghai Qi Zhi Institute(上海启智研究所) ; Shanghai AI Laboratory(上海人工智能实验室)
AI总结 本文提出LATENT系统,通过不完美的网球运动数据学习人形机器人网球技能,提升真实场景中的网球表现。
人工智能供应链监管的经济学
机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院) ; Naveen Jindal School of Management, The University of Texas at Dallas(德克萨斯大学达拉斯分校纳文·金达尔管理学院)
AI总结 本文通过博弈模型分析AI供应链中政策干预对消费者剩余的影响,发现促进价格竞争的政策在高计算成本时有效,而促进质量竞争的政策始终提升消费者剩余。
Comments An earlier version of this paper, titled "The Economics of Fine-Tuning for Large-Scale AI Models," was presented at WISE 2023, where it won the Best Student Paper Award
对Cramér度量下分布贝尔曼算子的谱再审视
机构 * School of Electrical and Electronic Engineering, University College Dublin(电子工程学院) ; School of Vehicle and Mobility, Tsinghua University(车辆与移动技术学院) ; College of Artificial Intelligence, Tsinghua University(人工智能学院)
AI总结 本文研究分布强化学习中贝尔曼更新对分布的影响,通过Cramér度量分析贝尔曼算子的收缩性质,构建正则化谱希尔伯特表示以实现CDF层级几何结构。
用3D思考:从有限视角出发的几何想象引导的空间推理
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Meituan(美团) ; National University of Singapore(新加坡国立大学) ; Beihang University(北航) ; LMMs-Lab(LMMs实验室)
AI总结 本文提出3DThinker框架,通过利用图像中的丰富几何信息实现空间推理,无需3D先验输入或显式标注3D数据,在多个基准测试中优于现有方法。
Comments 25 pages, 17 figures
Journal ref CVPR 2026
AeroGPT:利用大规模音频模型进行航空发动机轴承故障诊断
机构 * School of Physics and Astronomy, The University of Edinburgh(爱丁堡大学物理与天文学学院) ; Glasgow College, University of Electronic Science and Technology of China(电子科技大学格拉斯哥学院) ; Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) ; Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) ; School of Mechanical Engineering, Northwestern Polytechnical University(西北工业大学机械工程学院) ; Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) ; City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院)
AI总结 本文提出AeroGPT框架,通过迁移通用音频知识到航空发动机轴承故障诊断,结合振动信号对齐和生成故障分类,实现无需后处理的可解释故障诊断,实验验证其在航空发动机轴承数据集上的高准确率。
IndexCache: 通过跨层索引复用加速稀疏注意力
机构 * Tsinghua University(清华大学)
AI总结 IndexCache通过跨层索引复用减少75%的计算量,提升预填和解码速度,有效优化稀疏注意力效率。
QChunker: 通过多智能体辩论学习问题感知的文本分块以实现领域RAG
机构 * School of Information, Renmin University of China(中国人民大学信息学院) ; School of Smart Governance, Renmin University of China(中国人民大学智能治理学院) ; School of Information, BRAIN, Renmin University of China(中国人民大学信息学院、BRAIN学院) ; School of Economics and Management, Tsinghua University(清华大学经济管理学院)
AI总结 QChunker通过多智能体辩论框架,提升RAG中文本分块的语义完整性和信息粒度,采用ChunkScore评估指标,实现更高效高质量的文本分块生成。
分词使多模态大语言模型能够理解、生成和编辑建筑平面图
机构 * Tsinghua University(清华大学) ; UC Berkeley(伯克利大学)
AI总结 HouseMind通过引入离散房间实例标记,实现了建筑平面图的统一理解和生成,具备高效且可控的布局生成能力。
Comments 20 pages, 9 figures. Accepted to CVPR 2026
从宠物到机器人:MojiKit作为影响性人机交互设计的数据驱动工具包
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tsinghua University(清华大学) ; Beijing Institute of Technology(北京理工大学) ; Sichuan University(四川大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 MojiKit通过结合结构化参考卡片、拟人化机器人原型和行为控制工作室,为影响性人机交互设计提供数据驱动的系统化工具,帮助用户设计更多样化的机器人影响性行为。
Comments 25 pages, 11 figures, Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)
驯服OpenClaw:自主LLM代理威胁的分析与缓解
机构 * Ant Group & Tsinghua University(蚂蚁集团与清华大学) ; Tsinghua University(清华大学)
AI总结 本文分析了自主LLM代理OpenClaw的安全威胁,提出五层安全框架,揭示现有防御机制的不足,并提出包括插件审查、上下文过滤等在内的综合防御策略。
MANSION: 多楼层语言到3D场景生成用于长周期任务
机构 * Tsinghua University(清华大学) ; AgiBot ; McGill University, MILA - Quebec AI Institute(麦吉尔大学,魁北克人工智能研究所)
AI总结 MANSION是首个多楼层语言驱动的3D场景生成框架,能生成真实可导航的建筑环境,支持跨楼层长周期任务的开发与评估,同时配套发布MansionWorld数据集和任务语义编辑代理,为空间推理和规划提供关键测试平台。
Mango-GS: 通过多帧节点引导的4D高斯散射提升动态场景重建的空间-时间一致性
机构 * School of Software, Tsinghua University(清华大学软件学院)
AI总结 Mango-GS通过多帧节点引导的4D高斯散射方法,提升动态场景重建的空间-时间一致性,实现高保真重建与实时渲染。
GeoDiff4D: 基于几何的扩散模型用于4D头像重建
机构 * Tsinghua University(清华大学) ; Li Auto(利亚自动)
AI总结 GeoDiff4D通过几何感知扩散模型,结合表面法线和表情编码器,实现了高保真的4D头像重建,提升了视觉质量和跨身份泛化能力。
Comments 17 pages
混合策略强化学习可调节探索用于多模态推理
机构 * Aberystwyth University(阿伯里斯特维斯大学) ; Institute of Artificial Intelligence (TeleAl)(人工智能研究所) ; China Telecom(中国电信) ; Tsinghua University(清华大学)
AI总结 本文提出CalibRL框架,通过分布感知优势加权和非对称激活函数实现可控探索,提升多模态推理模型的探索与利用平衡。
Comments Published as a conference paper at ICLR 2026
GTR-Bench:评估视觉-语言模型中的地理时间推理
机构 * Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院) ; Peking University(北京大学) ; Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所)
AI总结 GTR-Bench提出了一种新的基准,用于评估视觉-语言模型在地理时间推理中的能力,揭示了现有模型在空间和时间上下文利用、时间预测能力及地图数据整合方面的不足。
Comments ICLR 2026, 31 pages, 20 figures
基于变分模型的定制UNet图像分割:一种深度变分框架
机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) ; School of Mathematics, China University of Mining and Technology(中国矿业大学数学学院)
AI总结 本文提出VM_TUNet框架,结合变分模型与UNet,通过数据驱动操作和定制有限点法提升图像分割精度与可解释性。
天quant-S2S:通过整合气候状态构建全球亚季节至季节天气模型
机构 * Sun Yat-Sen University(中山大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学) ; National Supercomputing Center in Shenzhen(深圳国家超算中心) ; Huawei Technologies Co Ltd(华为技术有限公司)
AI总结 天quant-S2S通过整合气候状态和不确定性增强的Transformer,提升了亚季节至季节天气预测的准确性和稳定性。
无需训练的多步推理用于目标说话人提取
机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学,中国) ; Center for Speech and Language Technologies, BNRist, Tsinghua University, China(语音与语言技术中心,北京理工大学,中国)
AI总结 本文提出无需训练的多步推理方法,用于目标说话人提取,通过联合度量优化平衡不同评估目标,提升实际应用中的提取性能。
动态预测采样用于主动强化学习微调大推理模型
机构 * Department of Automation, Tsinghua University(清华大学自动化系)
AI总结 DPS通过动态预测方法减少回放成本,提升大推理模型的强化学习微调效率与性能。
Comments Accepted to ICLR 2026
4DEquine:从单目视频中解耦运动与外观进行4D马类重建
机构 * Southern University of Science and Technology(南方科技大学) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学)
AI总结 4DEquine通过解耦运动与外观重建,提出新框架实现高效4D马类重建,展示在真实数据集上的优越性能。
Comments Accepted to CVPR2026
LaTeX编译:在大语言模型时代面临的挑战
机构 * Southern University of Science and Technology(南方科技大学) ; Alibaba(阿里巴巴) ; Tsinghua University(清华大学) ; Rutgers University(罗格斯大学) ; Liii Network(Liii网络)
AI总结 本文提出Mogan STEM作为替代TeX的结构编辑器,通过高效的数据结构和按需插件加载,在编译效率、生成语义和工具生态系统等方面优于TeX,并展示了其在LLM微调中的优势。
Comments 25 pages, 12 figures
UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准
机构 * Tsinghua University(清华大学) ; University College London(伦敦大学学院) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Peking University(北京大学) ; Southwest Jiaotong University(西南交通大学) ; Zhejiang University(浙江大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Renmin University of China(中国人民大学) ; Southeast University(东南大学)
AI总结 UrbanAlign通过后处理方法实现VLM与人类偏好的对齐,无需修改模型权重,提升领域任务的准确性和可解释性。
Comments 26 pages