Thinking by Subtraction: Confidence-Driven Contrastive Decoding for LLM Reasoning
通过减法思考:基于置信度的对比解码用于大语言模型推理
机构 * Peking University, Beijing, China(北京大学) ; University of Edinburgh, Edinburgh, UK(爱丁堡大学)
AI总结 通过置信度驱动的对比解码方法提升大语言模型推理可靠性,减少输出长度并提高准确性。
高校专区
通过减法思考:基于置信度的对比解码用于大语言模型推理
机构 * Peking University, Beijing, China(北京大学) ; University of Edinburgh, Edinburgh, UK(爱丁堡大学)
AI总结 通过置信度驱动的对比解码方法提升大语言模型推理可靠性,减少输出长度并提高准确性。
社会交互语言模型间的神经同步
机构 * Peking University(北京大学) ; Eastern Institute of Technology(东部技术研究所) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 研究通过分析社会交互语言模型间的神经同步,探讨其社会行为表现与神经同步的关联性,揭示了人类与语言模型社会互动的内在相似性。
Comments Accepted at ICLR 2026
Proof-RM: 一种可扩展且通用的数学证明奖励模型
机构 * Peking University, Beijing, China(北京大学,北京,中国)
AI总结 Proof-RM通过构建可扩展的数据管道和训练证明检查奖励模型,提升LLM在数学证明验证中的准确性和泛化能力。
Comments Under review
DeepQuark: 一种用于多夸克束缚态的深度神经网络方法
机构 * School of Physics, Peking University, Beijing 100871, China(北京大学物理系) ; School of Physics, Southeast University, Nanjing 211189, China(东南大学物理系) ; School of Physics(物理系) ; Center of High Energy Physics, Peking University, Beijing 100871, China(北京大学高能物理中心)
AI总结 DeepQuark通过深度神经网络方法高效处理多夸克束缚态,展现出在核子、四夸克和五夸克系统中的优越性能,为探索非微扰QCD提供了新工具。
Comments 17 pages, 7 figures, 9 tables. Version published in PRL
Journal ref Phys. Rev. Lett. 136, 071901 (2026)
PartRAG:基于检索的分层3D生成与编辑
机构 * King’s College London(伦敦国王学院) ; Peking University(北京大学)
AI总结 PartRAG通过整合外部部分数据库和扩散变换器,实现基于检索的分层3D生成与编辑,提升多视角一致性和局部编辑能力。
M2F:大规模数学文献的自动化形式化
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) ; Huawei Technologies(华为技术有限公司) ; Center for Machine Learning Research, Peking University(北京大学机器学习研究中心)
AI总结 M2F通过端到端自动化形式化框架,在三周内将教科书转化为Lean库,实现96%的证明成功率。
StereoAdapter-2: 基于全局结构一致性的水下立体深度估计
机构 * The University of Melbourne(墨尔本大学) ; Peking University(北京大学) ; Australian Centre for Robotics(澳大利亚机器人中心)
AI总结 StereoAdapter-2通过引入基于选择性状态空间模型的ConvSS2D操作符,实现了高效的水下立体深度估计,提升了水下基准测试的性能。
RoboGene: 通过多样性驱动的代理框架提升VLA预训练以生成现实任务
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; The School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) ; Beijing Institute of Technology(北京理工大学) ; The School of Mechanical Engineering and Automation, Beihang University(北航机械工程与自动化学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室)
AI总结 RoboGene通过多样性驱动的代理框架生成多样化、物理合理的机器人操作任务,提升VLA预训练效果。
一次对齐,多语言受益:为LLM安全对齐强制多语言一致性
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; National University of Singapore(新加坡国立大学) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
AI总结 本文提出一种资源高效的多语言一致性对齐方法,通过多语言一致性损失实现多语言同时对齐,提升跨语言安全性和泛化能力。
Comments Accepted by ICLR 2026
MMA:多模态记忆代理
机构 * School of Computer Science, Peking University(北京大学计算机学院)
AI总结 MMA通过动态可靠性评分和冲突感知网络共识,提升多模态代理在长horizon任务中的记忆检索与决策能力,同时在多个基准测试中展现优越性能。
用人工智能掌握竞赛级物理
机构 * School of Physics, Peking University(物理系,北京大学) ; School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学系,北京大学) ; Center for High Energy Physics, Peking University(高能物理中心,北京大学)
AI总结 本文提出LOCA框架,通过逻辑链增强方法在物理竞赛中实现接近完美的成绩,展示了AI在复杂物理推理中的强大能力。
Comments 8 pages, 3 figures, Content from the previous article 2510.01249 is included
MC-LLaVA:多概念个性化视觉-语言模型
机构 * Peking University(北京大学) ; Intel Labs, China(英特尔实验室,中国)
AI总结 MC-LLaVA通过多概念指令微调和个性化提示提升视觉-语言模型的多概念个性化能力。
提示当动物是:基于位置恢复训练的时序动物行为 grounding
机构 * School of Artificial Intelligence, Chongqing University of Technology(重庆理工大学人工智能学院) ; National Key Laboratory of General Artificial Intelligence, Shenzhen Graduate School, Peking University(北京大学深圳研究生院国家通用人工智能实验室)
AI总结 本文提出 Port 框架,通过位置恢复训练提升动物行为时序 grounding 的准确性,在 Animal Kingdom 数据集上取得 38.52 的 IoU@0.3 成绩,并在 ICME 2024 挑战赛中表现突出。
Comments Accepted by ICMEW 2024
关于混合专家模型在结构复杂任务中的表达能力
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; AI for Science Institute, Beijing, China(北京人工智能科学研究院)
AI总结 本文研究了混合专家模型在结构复杂任务中的表达能力,证明了浅层和深层MoEs在低维性和稀疏性先验下能够高效近似复杂函数,并揭示了关键架构组件的作用。
Comments 28 pages, NeurIPS 2025 Spotlight
VerifyBench: 大型语言模型参考式奖励系统的基准测试
机构 * Zhejiang University(浙江大学) ; Meituan Group(美团集团) ; Peking University(北京大学) ; University of Electronic Science and Technology of China(电子科技大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 VerifyBench通过设计专门的基准测试评估基于参考的奖励系统,揭示现有验证器在复杂任务中的不足,推动推理模型训练的改进。
Comments ICLR 2026: https://openreview.net/forum?id=JfsjGmuFxz Project Page: https://zju-real.github.io/VerifyBench Dataset: https://huggingface.co/datasets/ZJU-REAL/VerifyBench Code: https://github.com/ZJU-REAL/VerifyBench
Safe-SDL:建立AI驱动自主实验室的安全边界与控制机制
机构 * Shanghai Innovation Institute(上海创新研究院) ; Nankai University(南开大学) ; East China Normal University(华东师范大学) ; AI for Science Institute, Beijing(北京人工智能科学研究院) ; Peking University(北京大学) ; DP Technology(DP技术公司) ; Shanghai Jiao Tong University(上海交通大学) ; National Key Laboratory of Advanced Micro and Nano Manufacture Technology, School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学国家先进微纳米制造技术重点实验室,集成电路学院,上海200240,中国)
AI总结 Safe-SDL通过建立安全边界和控制机制,解决AI驱动自主实验室中的语法到安全间隙问题,确保实验系统的安全性和一致性。
通过规范化的扩散模型重新思考对称性:应用于分子图生成
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Zhejiang University(浙江大学) ; Peking University(北京大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Princeton University(普林斯顿大学) ; University of California, San Diego(加州大学圣地亚哥分校)
AI总结 本文提出通过规范化的扩散模型生成分子图,利用几何谱和位置编码提升生成效果,优于等变基线方法。
Comments 32 pages
MoRL: 用于统一运动理解与生成的强化推理
机构 * The University of Sydney(悉尼大学) ; Peking University(北京大学) ; Nanyang Technological University(南洋理工大学)
AI总结 MoRL通过结合监督微调和强化学习,提升运动理解与生成的推理能力和现实感,并引入链式运动方法和大规模CoT数据集以增强推理效果。
AutoWebWorld: 通过有限状态机合成无限可验证的网页环境
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Peking University(北京大学)
AI总结 AutoWebWorld通过有限状态机合成可验证的网页环境,实现自动化搜索与验证流程,提升WebGUI代理性能。
学习具有部分感知的密集3D特征场以实现通用的可变形物体操作
机构 * Peking University(北京大学) ; Beijing Institute of Technology(北京理工大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出PA3FF,一种具有部分感知的密集3D特征场,用于提升可变形物体操作的泛化能力,通过对比学习训练,实现高效且通用的机器人操作
Comments Accept to ICLR 2026, Project page: https://pa3ff.github.io
协同的内层和跨层正则化损失用于MoE专家专业化
机构 * Peking University, Beijing, China(北京大学) ; Zhejiang Lab, Zhejiang, China(浙江实验室) ; AI for Science Institute, Beijing, China(AI for Science研究院)
AI总结 本文提出两种正则化损失,通过增强MoE的专业化和路由效率,提升模型性能和推理速度。
Comments preprint
GUI-GENESIS: 自动合成具有可验证奖励的高效环境以实现GUI代理训练
机构 * Key Lab of HCST (PKU), MOE ; SCS, Peking University, Beijing, China ; Tencent Inc., Shenzheng, China ; Hong Kong University of Science ; Department of Computer Science, University of Texas at Dallas, Richardson, USA ; School of Computing Science, Simon Fraser University, Burnaby, BC, Canada
AI总结 GUI-GENESIS通过自动合成高效GUI训练环境并提供可验证奖励,显著提升了GUI代理的训练效率和性能。
LM-Lexicon:通过和谐语义专家提升定义建模
机构 * BIGAI ; Baidu Inc.(百度公司) ; Peking University(北京大学)
AI总结 LM-Lexicon通过语义专家学习和混合架构提升定义建模效果,实现BLEU分数提升7%,并优化领域级路由机制
Comments EACL 2026 (Oral), 22 pages, 12 figures, 12 tables
ProAct:一种双系统框架用于主动具身社交代理
机构 * Peking University(北京大学)
AI总结 ProAct通过双系统框架实现主动具身社交代理,结合低延迟行为系统与慢速认知系统,提升交互的主动性和社会参与度。
Comments Project Page: https://proactrobot.github.io/
GREPO:图神经网络在仓库级Bug定位上的基准
机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) ; School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) ; College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)
AI总结 GREPO是首个用于仓库级Bug定位的GNN基准,包含86个Python仓库和47294个Bug修复任务,展示了GNN在Bug定位中的优越性能。
Comments 46 pages, 14figures
sleep2vec:用于异构夜间生物信号的统一跨模态对齐
机构 * Five Seasons Medical(五 Seasons 医疗) ; Tsinghua University(清华大学) ; Beijing Key Laboratory for Sleep Breathing Disorder(北京睡眠呼吸障碍重点实验室) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Technical University of Munich(慕尼黑技术大学)
AI总结 sleep2vec通过统一跨模态对齐和原理化缩放,实现了对异构夜间生物信号的高效、通用建模。
MEMTS: 通过参数化内存内化领域知识以实现时间序列基础模型的无检索领域适应
机构 * East China Normal University(东华师范大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 MEMTS通过参数化内存内化领域知识,实现时间序列基础模型的无检索领域适应,提升实时流处理效率。
在功能缩放定律下最优学习率调度:功率衰减与温升稳定衰减
机构 * Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) ; School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; AI for Science Institute, Beijing(北京人工智能科学研究院)
AI总结 本文在功能缩放定律下研究最优学习率调度,揭示了在不同任务难度下学习率调度的相变特性,并展示了功率衰减调度在核回归中的最优性能。
PAGCNet:一种具有姿态感知和几何约束的全景深度估计框架
机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) ; Suzhou Research Institute of HIT(哈尔滨工业大学苏州研究院) ; Institute of Digital Media, School of Electronic Engineering and Computer Science, Peking University(数字媒体学院,北京大学电子工程与计算机科学学院) ; PengChengLab, Shenzhen(鹏城实验室,深圳)
AI总结 PAGCNet通过姿态感知和几何约束框架,有效解决复杂室内场景中全景深度估计的挑战,提升深度估计精度。
核回归中的功能缩放定律:损失动态与学习率调度
机构 * Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) ; School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室) ; AI for Science Institute, Beijing(北京人工智能科学研究院)
AI总结 本文提出功能缩放定律,通过分析核回归模型中的损失动态,揭示学习率调度对训练效率的影响,并验证了WSD调度在大规模预训练中的有效性。
Comments 60 pages, accepted by NeurIPS 2025 as a spotlight paper