DeepLatent: Think with Images via Parallel Latent Visual Reasoning
DeepLatent: 通过并行潜在视觉推理用图像思考
机构 * Baidu Inc.(百度公司) ; Peking University(北京大学)
AI总结 提出DeepLatent框架,通过LatentFormer并行生成潜在视觉状态,并结合连续空间强化学习优化潜在表示,在多个基准上达到最先进性能。
高校专区
DeepLatent: 通过并行潜在视觉推理用图像思考
机构 * Baidu Inc.(百度公司) ; Peking University(北京大学)
AI总结 提出DeepLatent框架,通过LatentFormer并行生成潜在视觉状态,并结合连续空间强化学习优化潜在表示,在多个基准上达到最先进性能。
GNMR: 低精度大语言模型训练的运行时稳定性控制
机构 * Peking University(北京大学) ; Huawei Technologies Ltd.(华为技术有限公司)
AI总结 针对低精度语言模型训练中的稳定性瓶颈,提出基于梯度范数与历史均值之比(GNMR)的轻量级运行时控制器,通过局部风险信号映射到有界恢复动作,在不改变数值格式或后端的情况下提升训练稳定性。
Comments 29 pages, 4 figures, 15 tables
技能还是跳过?通过双粒度偏好学习在智能体任务中学习选择性技能调用
机构 * Meituan(美团) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanjing University(南京大学) ; Peking University(北京大学)
AI总结 提出SelSkill框架,通过双粒度偏好学习实现选择性技能调用,在ALFWorld和BFCL上显著提升任务成功率和执行精度。
Comments 18 pages, 4 figures, 10 tables
CAST:用于GRPO的非特权裁剪非对称自教学与优势翻转
机构 * School of Software and Microelectronics, Peking University, Beijing(北京大学软件与微电子学院) ; School of Artificial Intelligence, Peking University, Beijing(北京大学人工智能学院) ; School of Computer Science, Peking University, Beijing(北京大学计算机科学学院) ; School of Future Technology, Peking University, Beijing(北京大学未来技术学院)
AI总结 提出CAST方法,通过无答案的自教师模型和双向局部优势符号翻转,解决GRPO中奖励稀疏和组相对优势消失的问题,提升数学推理性能。
Comments 10 pages
CLSP-REQA:基于Mamba-BiLSTM和置信门控干预的实时质量感知闭环癫痫发作预测框架
机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Mathematical Institute, University of Oxford(牛津大学数学研究所) ; School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) ; Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) ; Department of Mechanical Engineering, The University of British Columbia(不列颠哥伦比亚大学机械工程系) ; College of Life Sciences, Hunan Normal University(湖南师范大学生命科学学院) ; School of Electronics, Peking University(北京大学电子学院)
AI总结 提出CLSP-REQA框架,通过嵌入实时EEG质量评估模块和Mamba-BiLSTM骨干网络,结合分层非线性融合函数,在严格跨患者评估下实现优于现有方法的癫痫发作预测性能。
Comments 27 pages, 8 figures, submitted to Biomedical Signal Processing and Control
从人类视频到机器人操作:基于人类中心数据的可扩展视觉-语言-动作学习综述
机构 * Tsinghua University(清华大学) ; HKUST(香港科技大学) ; Xi’an Jiaotong University(西安交通大学) ; Fudan University(复旦大学) ; Microsoft Research Asia(微软亚洲研究院) ; Peking University(北京大学) ; Microsoft Zurich Project(微软苏黎世实验室)
AI总结 本文综述了如何将丰富的人类视频转化为视觉-语言-动作(VLA)模型的有效知识,分类了四种方法(潜在动作表示、预测世界模型、显式2D监督、显式3D重建),并指出了结构化非结构化视频、跨具身和视角的动作映射、以及评估协议设计三大挑战。
Comments Accepted to IJCAI 2026 Survey Track. Project page: https://aaronfengzy.github.io/HumanCentricToVLA-Survey/
追踪GenAI素养:通过认知网络分析揭示学术写作中的学生-AI交互模式
机构 * Department of Educational Technology, Graduate School of Education, Peking University(教育技术系,教育研究生院,北京大学)
AI总结 本研究利用学习分析和认知网络分析,通过分析162名学生在GenAI辅助摘要写作任务中的交互日志,揭示了高素养学生采用迭代优化和策略性提问,而低素养学生依赖直接生成命令的不同交互模式。
TrustLDM:语言扩散模型的可信度基准测试
机构 * State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(中国科学院自动化研究所,智能科学与技术学院,北京大学) ; CISPA Helmholtz Center for Information Security(信息安全研究所) ; School of EECS, Peking University(电子工程学院,北京大学) ; Institute for Artificial Intelligence, Peking University(人工智能研究所,北京大学)
AI总结 针对语言扩散模型(LDM)的可信度问题,提出TrustLDM基准,评估其在不同架构和恶意上下文下的安全性、隐私性和公平性,并开发自动评估框架TrustLDM-Auto以识别脆弱配置。
NanoSpec: 利用极简上下文词汇表加速推测解码
机构 * Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院) ; Key Laboratory of High Confidence Software Technologies (Peking University), Ministry of Education(教育部高可信软件技术重点实验室) ; School of Computer Science, Peking University, Beijing, China(北京大学计算机学院) ; State Key Laboratory of Networking(网络与交换技术国家重点实验室) ; School of Computer Science, Beijing University of Posts(北京邮电大学计算机学院)
AI总结 提出NanoSpec,一种无需训练的方法,通过动态构建极简上下文感知词汇表(平均<3k tokens),结合系统-算法协同设计,将推测解码的草稿生成时间平均减少51.6%,实现端到端加速1.17-1.29倍。
图纳维-斯托克斯网络
机构 * Northwest A&F University(西北农林科技大学) ; Corporate Research Center, Midea Group(美的集团企业研发中心) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Griffith University(格里菲斯大学) ; Bosch(博世)
AI总结 针对图神经网络中的过平滑问题,提出基于纳维-斯托克斯方程的图纳维-斯托克斯网络(GNSN),通过引入对流机制实现更高效的消息传递,并在12个真实数据集上取得最优分类性能。
OmniHuman:面向以人为中心的视频生成的大规模数据集与基准
机构 * Peking University(北京大学) ; WeChat Lab(微信实验室) ; Chinese Academy of Sciences(中国科学院)
AI总结 为解决现有数据集在场景多样性、交互建模和属性对齐方面的结构性缺陷,提出OmniHuman大规模多场景数据集及全自动标注流程,并建立OHBench三级评估体系,实现与人类感知高度一致的诊断。
Comments 19 pages, 6 figures
Render-of-Thought: 将文本思维链渲染为图像以进行视觉潜在推理
机构 * Tencent BAC(腾讯BAC) ; Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; School of Mathematics and Statistics, University of Glasgow(格拉斯哥大学数学与统计学学院)
AI总结 提出Render-of-Thought框架,通过将思维链的文本步骤渲染为图像,利用视觉语言模型的视觉编码器进行语义对齐,实现3-4倍令牌压缩和推理加速,同时保持竞争性能。
Comments Accepted by ACL 2026 Main Conference
自动猜想解决与形式化验证
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Westlake Institute for Advanced Study, Westlake University(西拉雅大学先进研究所) ; School of Mathematics, Tianjin University(天津大学数学学院) ; Research Institute for Mathematical Sciences, Kyoto University(京都大学数学研究所) ; Department of Mathematics, Stanford University(斯坦福大学数学系) ; IQuest Research(IQuest研究) ; New Cornerstone Science Laboratory, School of Mathematical Sciences, Peking University(北京大学数学科学学院新基石科学实验室) ; Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学国际数学研究所以及新基石科学实验室) ; Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) ; Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾大学先进研究所智能计算中心) ; Zhongguancun Academy(中关村学院)
AI总结 提出一个集成非形式化推理与形式化验证的自动框架,通过两个组件Rethlas和Archon解决研究级数学问题,并成功解决交换代数中的开放问题并在Lean 4中形式化验证。
Comments Code and resources are available at: Rethlas (https://github.com/frenzymath/Rethlas), Rethlas Results (https://github.com/frenzymath/Rethlas_results), Archon (https://github.com/frenzymath/Archon), and the formalization results (https://github.com/frenzymath/Anderson-Conjecture)
URDF-Anything+:面向仿真就绪铰接资产的端到端生成
机构 * Peking University(北京大学) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组) ; University of Washington(华盛顿大学)
AI总结 提出URDF-Anything+,一种端到端自回归扩散框架,从单张RGB图像直接生成仿真就绪的URDF模型,统一建模部件几何与铰接结构。
APEX-SQL: 通过智能体探索与数据对话实现Text-to-SQL
机构 * The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; LIGHTSPEED
AI总结 提出APEX-SQL框架,通过假设验证循环、逻辑规划、双路径剪枝、并行数据分析和确定性探索机制,解决静态模式表示在复杂企业数据库中的语义模糊和扩展性问题,在BIRD和Spider 2.0-Snow上取得领先性能。
Comments KDD 2026
RichControl: 面向文本到图像生成的、结构和外观丰富的免训练空间控制
机构 * Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出一种免训练框架,通过解耦条件特征的采样调度与去噪过程,并引入重启细化调度和外观丰富提示策略,在复杂条件下实现结构和外观平衡的受控生成。
DAG-Plan:生成有向无环依赖图用于双臂协作规划
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences (CASIA)(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院(CASIA)) ; School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机科学学院) ; Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) ; OpenGVLab, Shanghai AI Laboratory(上海人工智能实验室,OpenGVLab)
AI总结 提出DAG-Plan框架,首次使用有向无环图作为双臂协调的核心表示,通过一次LLM解析生成结构化DAG,实现自适应并行执行,在双臂厨房基准测试中成功率提升48%,执行效率提升84.1%。
Comments ICRA 2026
迈向简单且可证明的无参数自适应梯度方法
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系) ; School of Computing and Data Science, the University of Hong Kong(香港大学计算科学与数据科学学院) ; Bytedance Inc(字节跳动公司)
AI总结 提出 AdaGrad++ 和 Adam++ 两种简单无参数自适应梯度方法,在无需预设学习率的情况下实现与 AdaGrad 和 Adam 相当的收敛保证。
Comments 45 pages, 19 figures, 3 tables
利用拉普拉斯特征向量实现稳定且全局表达性的图表示
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Department of EECS, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) ; School of ECE, Georgia Institute of Technology(佐治亚理工学院电子与计算机工程系)
AI总结 提出一种利用可学习的O(p)-不变表示和平滑处理数值接近特征值的方法,以增强图神经网络中拉普拉斯特征向量的稳定性和全局表达性。
UniAudio-Token: 赋予语义语音分词器通用音频感知能力
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) ; Basic Model Technology Center, WeChat AI, Tencent Inc.(基础模型技术中心,微信AI,腾讯公司)
AI总结 提出UniAudio-Token框架,通过语义-声学基元(SAP)和语义-声学均衡(SAE)机制,在不牺牲语音能力的前提下为语义分词器注入通用音频感知,实现统一音频接口。
Comments 19 pages, 10 figures
AutoSci: 面向完整科学生命周期的以记忆为中心的智能体系统
机构 * Peking University(北京大学)
AI总结 提出AutoSci,一个以记忆为中心、支持完整科学生命周期的智能体系统,通过结构化记忆、多阶段流程、有向无环图增强和演化机制实现自动化科研。
跨模态临床知识整合用于乳腺X线报告生成
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Lingnan University(岭南大学) ; The Third Affiliated Hospital of Kunming Medical University, Yunnan Cancer Hospital, Peking University Cancer Hospital Yunnan(昆明医科大学第三附属医院、云南癌症医院、北京大学肿瘤医院云南分院) ; Guangzhou First People's Hospital, South China University of Technology(广州第一人民医院、华南理工大学) ; The Third Affiliated Hospital, Sun Yat-Sen University(中山大学第三附属医院) ; HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究院)
AI总结 提出MammoRG框架,通过两阶段训练模拟临床报告流程,整合BI-RADS指南和先验知识,提升报告生成的临床一致性。
Comments 16 pages, 5 figures
HetCCL:实现混合供应商异构集群的集体通信
机构 * Peking University(北京大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
AI总结 提出HetCCL框架,通过高效P2P传输和边界通信器机制,在异构集群中实现跨供应商的集体通信,消除主机-设备内存拷贝开销,并优化带宽利用率。
DARTS: 分布感知的主动展开轨迹塑造以加速LLM强化学习
机构 * School of Computer Science \& Beijing Key Laboratory of Software ; Hardware Cooperative Artificial Intelligence Systems, Peking University, Beijing, China ; School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China ; Institute of Computational Social Science, Peking University (Qingdao), Qingdao, China
AI总结 针对强化学习中长尾响应分布导致的效率瓶颈,提出分布感知的主动轨迹塑造方法,通过细粒度识别提示内长尾并削减无效冗余,实现高达1.77倍的加速而不损失模型性能。
Comments 16 pages, 14 figures, 5 tables. Accepted to ICML 2026
Feat2Go: 面向具身强化学习的视觉特征基础价值估计
机构 * Wangxuan Institute of Computer Technology, Peking University, China(北京大学计算机科学技术研究院)
AI总结 提出Feat2Go框架,通过预训练视觉世界模型提取补丁级子目标相似度并聚类语义阶段,训练具身价值模型预测结构进度以重塑终端奖励,显著提升VLA模型在单臂和双臂操作任务中的强化学习性能。
注释并非全部所需:面向无监督时间语句定位的跨模态知识迁移网络
机构 * Hubei Key Laboratory of Distributed System Security(湖北分布式系统安全重点实验室) ; Hubei Engineering Research Center on Big Data Security(湖北大数据安全工程研究中心) ; School of Cyber Science and Engineering(网络安全学院) ; Huazhong University of Science and Technology(华中科技大学) ; Peking University(北京大学) ; Henan University(河南大学) ; The Chinese University of Hong Kong(香港中文大学) ; Guangzhou University(广州大学) ; Protagolabs Inc.(Protagolabs公司)
AI总结 提出跨模态知识迁移网络,通过从图像-名词和视频-动词任务中迁移实体感知和事件感知知识,实现无监督时间语句定位,无需配对视频-查询标注。
Comments Published in Findings of EMNLP 2023
先见后议:用视觉证据对齐多智能体共识
机构 * Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Renmin University of China(中国人民大学) ; Shandong University(山东大学)
AI总结 提出EAGLE框架,通过显式暴露各智能体的视觉证据区域并相互验证,实现无需训练的多智能体视觉问答协作,提升共识可靠性。
Crafter: 面向多样化输入的可编辑科学图表生成的多智能体框架
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学) ; Peking University(北京大学)
AI总结 提出Crafter多智能体框架,通过结构化组合离散语义组件,实现跨图表类型和输入条件的可编辑科学图表生成,并引入CraftEditor将栅格输出转换为可编辑SVG,在CraftBench基准上显著优于现有方法。
Comments 24 pages, 11 figures
当Muon优化器遇到对抗训练:理论与实证研究
机构 * IT College, Shanghai Ocean University(上海海洋大学信息学院) ; School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) ; SEIE, Suzhou University of Science and Technology(苏州科技大学SEIE学院) ; DP Tech(DP科技) ; School of Mathematical Sciences, Peking University(北京大学数学科学学院)
AI总结 本文通过理论和实证研究,探讨Muon优化器(基于近似极分解的正交化更新)在对抗训练中的效果,发现其能限制矩阵更新的谱范数增长,在CNN和ViT上优于AdamW,与SGD竞争力相当。
GEM: 用于最优LLM数据策展的几何熵混合
机构 * The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学) ; Peking University, Beijing, China(北京大学) ; University of Science and Technology of China, Hefei, China(中国科学技术大学)
AI总结 提出GEM框架,通过将数据策展重构为超球面上的变分问题并采用MM算法优化,解决了分类缺陷和嵌入各向异性问题,在1.1B参数模型上实现下游准确率提升1.2%。
Comments ICML 2026 Poster