Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads
多模态大语言模型中通过CoRe头的功能稀疏性机制洞察
机构 * Soochow University(苏州大学) ; Peking University(北京大学)
AI总结 通过识别和分析CoRe头,揭示多模态大语言模型在跨模态检索中功能稀疏的结构特性,并验证其必要性及加速推理的潜力。
高校专区
多模态大语言模型中通过CoRe头的功能稀疏性机制洞察
机构 * Soochow University(苏州大学) ; Peking University(北京大学)
AI总结 通过识别和分析CoRe头,揭示多模态大语言模型在跨模态检索中功能稀疏的结构特性,并验证其必要性及加速推理的潜力。
ProSPy: 面向企业级Text-to-SQL的剖析驱动的SQL-Python智能体框架
机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) ; School of Software Technology(软件技术学院) ; Tencent TEG(腾讯科技集团) ; School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Zhejiang University(浙江大学)
AI总结 提出ProSPy框架,通过自动剖析、模式剪枝、中间视图获取和Python分析四阶段,结合SQL高效性与Python灵活性,解决企业级数据库Text-to-SQL中的模式异构、元数据不完整和复杂分析问题。
Comments 24 pages, 12 figures
基于混合截断损失的鲁棒稀疏支持向量机用于监督分类
机构 * School of Science, Beijing Forestry University(北京林业大学理学院) ; Translational Cancer Research Center, Peking University First Hospital(北京大学第一医院转化肿瘤研究中心)
AI总结 提出一种稀疏且有界的混合截断损失函数L_ht,构建L_ht-SVM模型用于单视图分类,并扩展为多视图MvL_ht-SVM,通过P-平稳点和交替方向乘子法实现高效优化,实验表明在准确率、稀疏性和鲁棒性上优于对比方法。
PlanBench-V: 面向视觉语言模型的空间规划地图基准
机构 * Behavioral and Spatial AI Lab(行为与空间人工智能实验室) ; Tongji University(同济大学) ; Peking University(北京大学) ; College of Architecture and Urban Planning(建筑与城市规划学院)
AI总结 为评估视觉语言模型在空间规划地图解读中的能力,构建了专家标注数据集SPMD,并提出基于感知、推理、关联、实施四阶段认知框架的基准PlanBench-V,实验表明当前模型在实施类任务上存在显著局限。
TextWand:场景文本编辑的统一框架
机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)
AI总结 提出TextWand统一框架,通过渲染和擦除原子操作分解复杂编辑任务,结合ORPE编码和RAS策略,实现场景文本的移除、生成和替换,并在新基准TextWand-Bench上超越现有模型。
平衡图像压缩与生成:自引导分词
机构 * Peking University(北京大学) ; Central Media Technology Institute, Huawei(华为中央媒体技术研究所)
AI总结 提出SelfBootTok方法,通过自引导学习将图像信息分解为全局和局部标记组,使生成器仅依赖全局标记,减少40%计算量并提升重建与生成质量,以64个标记实现1.56的gFID新纪录。
OSCAR: 面向机器人的全具身骨架条件世界动作模型
机构 * Peking University(北京大学) ; University of Michigan(密歇根大学) ; NVIDIA(英伟达)
AI总结 提出OSCAR,一种基于动作条件的视频世界模型,通过大规模数据管道和2D骨架渲染统一表示,实现跨机器人具身的泛化,并用于策略评估。
Comments Project page: https://wuzy2115.github.io/oscar-project-page/
SenseJudge: 以人为中心的偏好驱动判断框架
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) ; StepFun ; Xi’an Jiaotong University(西安交通大学)
AI总结 提出SenseJudge框架和SenseBench基准,通过融入用户偏好实现个性化判断和模型排名,实验证明其优于现有方法。
Comments ACL 2026 Findings
统一驾驶令牌:面向驾驶世界模型和规划的表示与几何引导的离散分词器
机构 * Peking University(北京大学) ; Xiaomi EV(小米电动车)
AI总结 提出一种表示引导与几何增强的离散分词器,通过联合监督学习紧凑令牌,同时优化重建保真度、表示一致性和规划性能。
ProfiliTable: 通过代理工作流实现基于轮廓的表格数据处理
机构 * School of CS & Key Lab of High Confidence Software Technologies (MOE), Peking University(计算机科学学院及高可信软件技术重点实验室(教育部),北京大学) ; Academy for Advanced Interdisciplinary Studies, Peking University(先进跨学科研究学院,北京大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学) ; School of CS & Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University(计算机科学学院及北京软件与硬件协同人工智能系统重点实验室,北京大学) ; Center for Machine Learning Research, Peking University(机器学习研究中心,北京大学)
AI总结 本研究提出ProfiliTable,一种基于动态轮廓的代理工作流框架,用于解决表格数据处理中的模糊指令、复杂任务结构和缺乏结构化反馈问题,通过交互探索、知识增强合成和反馈驱动细化,实现闭环优化,实验表明其在复杂多步骤场景中优于现有基线方法。
Trace2Skill: 将轨迹局部经验转化为可迁移的代理技能
机构 * ETH Zürich University of Zurich(苏黎世联邦理工学院) ; Peking University(北京大学) ; Zhejiang University(浙江大学) ; Qwen Large Model Application Team, Alibaba(阿里巴巴文心一言应用团队)
AI总结 本文提出Trace2Skill框架,通过归纳推理将广泛执行轨迹整合为统一的技能目录,有效提升代理技能的可迁移性和实用性,适用于多种领域。
Comments Work in Progress. May version add more experiments
超越模仿:基于强化学习的仿真-现实协同训练用于VLA模型
机构 * Tsinghua University(清华大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Zhongguancun Academy(中关村学院)
AI总结 本文提出基于强化学习的仿真-现实协同训练框架,通过结合仿真交互与真实世界数据,提升VLA模型的现实应用能力和泛化能力。
学习适应性并行执行以实现高效的代码定位
机构 * Ant Group(蚂蚁集团) ; Peking University(北京大学) ; Beijing Jiaotong University(北京交通大学)
AI总结 本文提出FuseSearch,通过将并行代码定位重新表述为联合质量-效率优化任务,采用两阶段SFT和RL训练方法学习适应性并行策略,以提高代码定位的效率和性能。
Comments Paper accepted to Findings of ACL 2026
Blade:一种使用扩散先验的无导数贝叶斯反演方法
机构 * California Institute of Technology(加州理工学院) ; University of Toronto(多伦多大学) ; Peking University(北京大学)
AI总结 本文提出Blade方法,通过使用扩散模型作为数据驱动的先验,解决无导数贝叶斯反演中高维非线性问题的后验估计问题,实现了准确且校准良好的后验分布。
通过强化学习训练一个模型以掌握跨层级的代理行为
机构 * Peking University(北京大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出CrossHA,一种统一的代理模型,能够掌握异构的动作空间并自主选择每一步轨迹中最有效的接口,通过结合冷启动监督微调和多轮组相对策略优化(GRPO)算法,实现适应性动作切换,在Minecraft开放世界中超过800个任务上展示了最先进的性能。
Comments Accepted to CVPR 2026 as a Highlight
GridPE: 一种基于网格细胞的统一位置嵌入方法用于任意维度空间
机构 * New York University(纽约大学) ; Peking University(北京大学) ; Imperial College London(伦敦帝国学院) ; Tongji University(同济大学)
AI总结 本文提出GridPE,一种受哺乳动物空间认知中六边形周期编码启发的新型位置嵌入框架,旨在解决高维时空任务中位置嵌入的理论保障问题,通过结合计算神经科学原理和调和分析,为任意维度空间提供统一的位置嵌入解决方案。
M$^3$Eval: 通过认知基础视频任务的多模态记忆评估
机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) ; Yuanpei College, Peking University(北京大学元培学院) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
AI总结 提出首个多模态模型记忆评估框架M$^3$Eval,通过认知心理学设计的视频任务系统评估模型在记忆保持、忠实性和鲁棒性上的表现,发现模型在并行视频流处理、干扰模式、时空记忆和符号记忆方面的显著缺陷。
Comments We present an evaluation designed for multi-modal memory in multi-modal models
SAID: 通过支架感知迭代解码加速基于扩散的语言模型
机构 * School of Computer Science, Peking University(北京大学计算机科学系)
AI总结 提出SAID框架,通过将去噪计算重新分配给支架令牌来加速扩散语言模型,并引入CHLG为低置信度令牌分配额外步骤,在LLaDA模型上实现最高9.1倍加速且保持竞争性能。
Comments Code: https://github.com/TH-AI-Lab-PKU/SAID
SemBlock: 扩散语言模型的语义边界动态块
机构 * School of Computer Science, Peking University(北京大学计算机学院)
AI总结 提出SemBlock框架,通过预测语义边界动态构建解码块,利用轻量预测器在冻结的LLaDA隐状态上训练,并在自然语言、数学和代码任务中优于固定块解码和AdaBlock。
Comments Code: https://github.com/TH-AI-Lab-PKU/SemBlock
PersonaTree: 面向LLM智能体人物理解的结构化生命周期记忆
机构 * School of ASEE, Beihang University, Beijing, China(北京航空航天大学航空科学与工程学院) ; The University of Hong Kong, Hong Kong, China(香港大学) ; Peking University, Beijing, China(北京大学) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) ; School of BME, Beihang University, Beijing, China(北京航空航天大学生物医学工程学院) ; CAIR and CECS, VinUniversity, Hanoi, Vietnam(越南河内 Vin 大学 CAIR 和 CECS)
AI总结 提出PersonaTree,一种结构化生命周期记忆框架,通过三级人物树和显式支持路径,将交互证据抽象为人物理解,在多个基准上取得领先性能。
SHB-AE:基于球谐波束形成的智能手机麦克风阵列Ambisonics编码与升级方法
机构 * Peking University(北京大学) ; Beijing Xiaomi Mobile Software Co., Ltd(北京小米移动软件有限公司) ; Xiaomi Communications Co., Ltd(小米通讯有限公司)
AI总结 针对智能手机麦克风阵列,提出一种基于球谐波束形成的Ambisonics编码与升级方法SHB-AE,通过设计各阶球谐函数的波束形成器,仅用四个非规则排列的麦克风即可实现四阶Ambisonics编码与升级。
Comments Accepted for presentation at AES Europe 2025 Convention (AES 158th Convention), Warsaw, Poland, May 22-24, 2025
Flow-HOA:基于流匹配的Ambisonics编码生成式联合优化
机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; School of Intelligence Science and Technology(智能科学与技术学院) ; Peking University(北京大学) ; Beijing Xiaomi Mobile Software Co., Ltd(北京小米移动软件有限公司) ; Xiaomi Communications Co., Ltd(小米通讯有限公司)
AI总结 提出Flow-HOA生成框架,通过条件流匹配联合优化时域、频谱和空间保真度,生成可部署的FIR编码滤波器组,在合成数据和真实录音上均优于强基线方法。
Comments Accepted for presentation at AES Europe 2026 Convention (AES 160th Convention), Copenhagen, Denmark, May 28-30, 2026
通过参数化内存扩展自进化智能体
机构 * Alibaba Group(阿里巴巴集团) ; Peking University(北京大学)
AI总结 提出TMEM框架,通过在线更新LoRA权重使智能体从经验中学习,从而在单轮交互中改变未来行为,并在多个基准上优于基于摘要和检索的方法。
D^2SD: 使用双重扩散草稿模型加速推测解码
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; HKUST(香港科技大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Ant Group(蚂蚁集团)
AI总结 提出D^2SD框架,通过双重扩散草稿模型和置信度引导的前缀树,提升推测解码的接受率,优于现有扩散方法和自回归推测解码基线。
当眼见不再为实——面向搜索辅助的视频虚假信息检测基准
机构 * CASIA(中国科学院自动化研究所) ; UCAS(中国科学院大学) ; BAAI(百度人工智能研究院) ; Tsinghua University(清华大学) ; Peking University(北京大学)
AI总结 提出EVID-Bench基准,通过跨视频对比和开放网络搜索检测视频虚假信息,涵盖9种操纵类型,评估前沿多模态模型发现准确率低且面临多种挑战。
Comments 52 pages
尖峰张量PCA中交替幂迭代的有限迭代局部动力学与热启动
机构 * Peking University(北京大学)
AI总结 研究固定阶非对称秩一张量模型中同步交替幂迭代的有限迭代局部理论,提出与初始化无关的误差分解和热启动机制。
Comments 67 pages, 0 figures. The paper studies local dynamics and warm-start analysis for alternating power iteration in spiked tensor PCA
重新审视具身思维链以实现可泛化的机器人操作
机构 * Tsinghua University(清华大学) ; Xiaomi Robotics(小米机器人) ; Peking University(北京大学) ; CASIA ; HKUST(GZ)(香港科技大学(广州)) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Wuhan University(武汉大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文通过构建最大规模具身思维链语料库,提出ERVLA模型,利用思维链作为表征塑造监督而非测试时推理,显著提升了机器人操作的可泛化性。
从答案到状态:大语言模型中化学推理的可验证过程级评估
机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) ; International Digital Economy Academy (IDEA)(国际数字经济学院)
AI总结 提出ChemCoTBench-V2基准,通过确定性规则和参考轨迹验证结构化化学推理步骤,揭示模型在最终答案正确性与推理状态一致性之间的差距。
Comments 23 pages, 6 figures, 14 tables
通过防御性推理对齐深度隐式偏好
机构 * Basic Algorithm Center, PCG, Tencent(腾讯基本算法中心) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)
AI总结 提出基于批判驱动推理对齐(CDRA)的方法,通过DeepPref基准和个性化生成过程奖励模型(Pers-GenPRM),将偏好对齐转化为结构化推理过程,以推断用户深层隐式偏好并实现防御性推理。
Journal ref ICLR 2026 Conference
LDA-1B:通过通用具身数据摄取扩展潜动力学动作模型
机构 * Peking University(北京大学) ; Galbot ; CASIA(中国科学院自动化研究所) ; BAAI(北京人工智能研究院) ; Tsinghua University(清华大学) ; Sun Yat-sen University(中山大学) ; NVIDIA
AI总结 提出LDA-1B机器人基础模型,通过统一格式的具身交互数据集EI-30k和结构化DINO潜空间中的动力学学习,联合建模动力学、策略和视觉预测,在接触丰富、灵巧和长时任务上分别提升高达21%、48%和23%。
Comments Accepted at RSS 2026, Project Page:https://pku-epic.github.io/LDA