Boosting LLM Reasoning via Human-Inspired Reward Shaping
通过人类启发的奖励塑造提升大语言模型推理能力
机构 * Tsinghua University(清华大学) ; Southern University of Science and Technology(南方科技大学) ; Mind Lab
AI总结 本文提出T2T动态奖励框架,通过区分掌握与未掌握问题的不同学习策略,提升LLM推理性能,实验显示其在数学基准测试中优于现有方法。
高校专区
通过人类启发的奖励塑造提升大语言模型推理能力
机构 * Tsinghua University(清华大学) ; Southern University of Science and Technology(南方科技大学) ; Mind Lab
AI总结 本文提出T2T动态奖励框架,通过区分掌握与未掌握问题的不同学习策略,提升LLM推理性能,实验显示其在数学基准测试中优于现有方法。
FactNet:一个十亿级的知识图谱用于多语言事实 grounding
机构 * Tsinghua University(清华大学) ; Technical University of Munich(慕尼黑技术大学) ; ModelBest Inc.(ModelBest公司) ; Minzu University of China(民族大学)
AI总结 FactNet通过结合17亿条维基数据语句和301亿条证据指针,构建了一个十亿级多语言知识图谱,提供事实 grounding 的评估框架,并验证了跨语言结构的知识迁移能力。
学习率衰减如何浪费你在基于课程的学习中的最佳数据
机构 * Tsinghua University(清华大学) ; Peng Cheng Laboratory(鹏城实验室)
AI总结 本文指出学习率衰减与课程式预训练数据排序的不兼容性限制了预训练效果,通过调整衰减策略和模型平均可提升1.64%的基准表现。
GenExam:多学科文本到图像考试
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 GenExam是首个多学科文本到图像考试基准,包含10个学科1000个样本,通过四级分类评估模型的综合能力,揭示开源模型与闭源模型间的显著差距。
Comments Accepted by ICML 2026
LoRA in LoRA: 朝着参数高效架构扩展的方向:持续视觉指令微调
机构 * Hefei University of Technology(合肥工业大学) ; University of Amsterdam(阿姆斯特丹大学) ; Tsinghua University(清华大学)
AI总结 本文提出LiLoRA,一种高效的持续视觉指令微调架构扩展方法,通过共享LoRA矩阵A、低秩分解矩阵B以及余弦正则化损失,提升参数效率和任务学习性能。
Comments AAAI 2026 Oral Presentation. 9 pages
Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(24):19978--19986, 2026
神经场用于NV中心反向传感
机构 * Princeton University(普林斯顿大学) ; Tsinghua University(清华大学)
AI总结 本文研究了基于钻石中氮-空位中心的噪声传感反向问题,提出NeTMY神经场方法,通过改进的正则化和优化策略提升反向传感性能。
Comments 33 pages, 16 figures
群表示位置编码
机构 * Princeton University(普林斯顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; IIIS, Tsinghua University(清华大学人工智能研究院)
AI总结 GRAPE提出了一种基于群作用的位置编码框架,结合乘法旋转和加法logit偏置机制,扩展了RoPE和ALiBi的应用范围,适用于长上下文模型的位置几何设计。
Comments Published in ICLR 2026. Project Page: https://github.com/model-architectures/GRAPE