Mild Over-Parameterization Benefits Asymmetric Tensor PCA
轻度过参数化有助于非对称张量PCA
机构 * Peking University(北京大学)
AI总结 本文提出一种基于梯度下降的算法,在有限内存下通过轻度过参数化提升样本效率和问题结构适应性,实现近最优样本复杂度。
高校专区
轻度过参数化有助于非对称张量PCA
机构 * Peking University(北京大学)
AI总结 本文提出一种基于梯度下降的算法,在有限内存下通过轻度过参数化提升样本效率和问题结构适应性,实现近最优样本复杂度。
PhyMix:迈向物理一致的单图像3D室内场景生成的隐式-显式优化
机构 * Lingnan University(岭南大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Shenzhen University(深圳大学)
AI总结 本文提出PhyMix,通过隐式-显式优化框架,结合物理评估器提升生成场景的物理一致性,实现视觉真实且物理合理的3D室内场景生成。
SEPTQ:一种用于大型语言模型的简单且有效的后训练量化范式
机构 * Dalian University of Technology(大连理工大学) ; Peking University(北京大学) ; Shenzhen MSU-BIT University(深圳北理莫斯科大学) ; The Pennsylvania State University(宾夕法尼亚州立大学)
AI总结 SEPTQ提出了一种简化后训练量化流程的方法,通过重要性评分和静态全局确定量化位置,提升低比特量化下的性能。
Comments Accepted to KDD 2025. 12 pages, 10 figures
在李群上的自然梯度高斯近似滤波器用于机器人状态估计
机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) ; College of Engineering, Peking University(北京大学工学院) ; College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) ; Tsinghua-Efort Joint Research Center for EAI Computation and Perception(清华大学-埃夫特EAI计算与感知联合研究中心)
AI总结 本文提出在李群上基于自然梯度优化的高斯近似滤波器,用于解决机器人系统在李群流形上状态估计的非线性问题,通过避免局部线性化提高估计精度。
EvoDiagram:通过设计专业知识进化实现代理可编辑的图示创建
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学)
AI总结 EvoDiagram通过设计专业知识进化实现代理可编辑图示创建,解决自动系统在高保真图示生成中的挑战,提出中间画布方案和设计知识进化机制,释放CanvasBench基准测试。
MARS:通过边距感知验证释放推测解码的潜力
机构 * The University of Hong Kong(香港大学) ; McGill University(麦吉尔大学) ; Peking University(北京大学) ; gradient ; Alibaba Cloud(阿里云) ; Mila ; SimpleWay
AI总结 MARS通过边距感知验证策略提升LLM推理效率,无需额外训练,适应目标模型的决策稳定性,减少验证过程中的回滚成本,实验证明在不同模型规模上显著提升推理速度同时保持生成质量。
Comments 12 pages, 4 figures, 7 tables
DistDF:时间序列预测需要联合分布Wasserstein对齐
机构 * Xiaohongshu Inc.(小红书公司) ; College of Control Science and Technology, Zhejiang University(浙江大学控制科学与工程学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算与人工智能学院) ; State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) ; Squirrel AI(松鼠AI) ; Center for Data Science, Peking University(北京大学数据科学中心) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
AI总结 DistDF通过最小化预测序列与标签序列条件分布之间的分布差异,解决传统直接预测方法在标签序列自相关时的偏差问题,提升多种预测模型性能。
Journal ref ICLR 2026
蛋白质适应性预测的进化图谱
机构 * Zhejiang University(浙江大学) ; Peking University(北京大学) ; East China University of Science and Technology(华东理工大学) ; Chengdu University of Information Technology(成都信息工程大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Zhejiang University of Technology(浙江工业大学)
AI总结 本文提出EvoIF模型,通过整合进化信号提升蛋白质突变适应性预测性能,采用轻量结构和逆强化学习框架,在有限数据下实现高精度预测。
掩码训练用于从数字化多布局ECG图像中鲁棒性心律失常检测
机构 * Tianjin University of Technology(天津理工大学) ; Peking University(北京大学) ; HeartVoice Medical Technology(心语医疗科技) ; Capital Medical University(首都医科大学) ; Tianjin Medical University(天津医科大学) ; Tsinghua University(清华大学)
AI总结 本文提出PatchECG模型,通过自适应变量块计数缺失学习机制和掩码训练策略,解决ECG图像中时间不同步和部分黑屏问题,实现跨导联和时间依赖的鲁棒检测。
Comments 28 pages, 9 figures
Online3R: 基于几何基础模型的在线学习一致序列重建
机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; T-Stone Robotics Institute, The Chinese University of Hong Kong(香港中文大学天石机器人研究所) ; NVIDIA(英伟达) ; College of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院) ; School of Artificial Intelligence and Computer Science, Anqing Normal University(安庆师范大学人工智能与计算机科学学院)
AI总结 Online3R通过在线学习适应新场景,解决不一致问题,利用可学习的轻量视觉提示和自监督学习策略提升几何预测效率。
UIPress:将光学令牌压缩引入UI到代码生成
机构 * The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Technology Sydney(悉尼科技大学)
AI总结 本文提出UIPress,一种轻量级学习压缩模块,通过结合深度可分离卷积、元素引导的空间重加权和Transformer细化,将UI截图的视觉令牌从约6700压缩到256,结合LoRA实现表示差距桥接,提升效率并优于现有方法。
Comments 10 pages, 3 figures
VAG:用于具身数据合成的双流视频-动作生成
机构 * GigaAI ; Zhejiang University(浙江大学) ; Peking University(北京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。
Camera Artist: 一种多智能体框架用于电影语言叙事视频生成
机构 * School of Information and Communication Engineering, Communication University of China(中国传媒大学信息与通信工程学院) ; State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)
AI总结 Camera Artist通过引入专门的 cinematography shot agent,增强了镜头间叙事连贯性和电影语言表达,提升了视频叙事的连贯性和表现力。
DeepGuard:通过多层语义聚合实现安全代码生成
机构 * Chongqing University(重庆大学) ; The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全全国重点实验室,浙江大学) ; Peking University(北京大学)
AI总结 DeepGuard通过多层语义聚合提升代码生成的安全性,实验表明其在安全性和功能性上均优于基线模型,有效检测并减少不安全模式。
Comments ACL 2026 main conference
迈向英语作为第二或外语的语义表示:综述、构建与应用
机构 * School of the Chinese Nation Studies(中华民族学院) ; School of Liberal Arts, Minzu University of China(中央民族大学文学院) ; Department of Chinese Language and Literature, Peking University(北京大学中国语言文学系) ; Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)
AI总结 本文综述现有ESFL资源,提出基于建构主义理论的新型表示方法,构建包含1643个注释句子的高质资源,并验证其在第二语言习得研究中的应用价值。
BIAS:一种生物启发的视频显著性检测算法
机构 * Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) ; Chinese Institute for Brain Research, Beijing (CIBR)(北京脑科学与类脑研究中心)
AI总结 BIAS算法基于生物启发模型,结合动态视觉显著性检测,通过生物视网膜运动检测器提取时间特征,实现高效率显著性图生成,优于传统方法和深度学习模型,应用于交通事故分析效果显著。
增强残差校准与注意力机制的共振观测器
机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)
AI总结 本文提出结合残差校准和注意力机制的共振观测器,提升非线性动力系统中未测量变量推断的准确性,尤其改善传统方法在最坏情况下的表现。
Journal ref Physical Review E 2026
SIM1:物理对齐的模拟器作为零样本数据放大器在变形世界中
机构 * Shanghai AI Lab(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学)
AI总结 SIM1通过物理对齐的仿真方法,将稀疏观测转化为高保真的合成监督,实现变形物体 manipulation 的高效训练,取得与真实数据相当的性能。
Comments Website: https://internrobotics.github.io/sim1.github.io/
重振黑盒可解释性:通过代理模型实现LLM的可操作可解释性
机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术教育部重点实验室(北京大学)) ; School of Computer Science, Peking University(北京大学计算机学院)
AI总结 本文提出一种低成本代理框架,利用高效模型近似昂贵LLM的决策边界,通过统计验证局部对齐,实现可操作的可解释性,提升LLM优化效率。
Comments Accepted to ACL 2026 Main Conference
基于视觉的人形代理
机构 * Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Tongji University(同济大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; University of Michigan(密歇根大学)
AI总结 本文提出基于视觉的人形代理,通过两层架构实现自主行为,解决数字人主动行为在新环境中的问题,提升任务成功率和减少碰撞。
Comments Project page: https://alvinyh.github.io/VGHuman/
基于渲染的视频生成与基于代理的推理
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) ; Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) ; OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。
Comments Accepted to CVPR 2026
RoboAgent: 通过基本能力串联实现具身任务规划
机构 * Peking University(北京大学) ; XYZ Embodied AI(XYZ具身智能)
AI总结 本文提出RoboAgent,通过串联基本能力实现具身任务规划,利用单个VLM构建能力驱动的规划框架,结合多阶段训练方法提升规划效果。
Comments CVPR 2026
MinerU2.5-Pro: 推动大规模数据导向文档解析的极限
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出MinerU2.5-Pro,通过数据工程和训练策略设计提升文档解析性能,无需改变模型架构,在OmniDocBench v1.6上取得95.69的高分。
Comments Technical Report
WASD:定位关键神经元作为解释和控制大语言模型行为的充分条件
机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术教育部重点实验室(北京大学)) ; School of Computer Science, Peking University(北京大学计算机学院)
AI总结 WASD通过识别生成token的神经条件,提供更稳定准确的解释,并通过案例验证了控制模型行为的有效性。
MV-SAM3D:面向布局感知的多视图融合3D生成
机构 * Peking University(北京大学) ; JD Explore Academy(京东探索研究院)
AI总结 MV-SAM3D通过多视图一致性与物理合理性提升3D生成质量,无需额外训练,实现更可信的布局生成。
基于反射的任务适应用于自我改进的VLA
机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; JD Explore Academy(京东探索研究院) ; AIR, Tsinghua University(清华大学智能产业研究院)
AI总结 本文提出反射式自我适应框架,通过双路径架构实现快速自主任务适应,结合失败驱动的强化学习与成功驱动的质量引导微调,提升机器人在复杂任务中的适应效率和成功率。
缓解大多模态模型中的视觉上下文退化:一种无需训练的解耦代理框架
机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) ; Shandong University(山东大学)
AI总结 本文提出无需训练的解耦代理框架DRP,通过让LLM作为策略推理者与LMM作为观察者解耦,有效缓解多模态推理中的视觉退化问题,实验表明其在MathVision基准上准确率优于GPT-4o。
对黑盒LLM API进行基于排名的均匀性测试
机构 * University of Southern California(南加州大学) ; University of California, Berkeley(加州大学伯克利分校) ; Peking University(北京大学)
AI总结 本文提出一种基于排名的均匀性测试方法,用于验证黑盒LLM与本地部署的模型行为一致性,有效检测API提供者可能的模型替换或篡改行为,具有高准确性和低查询成本。
OmniTabBench:映射GBDT、神经网络和基础模型在大规模表格数据上的经验前沿
机构 * Huawei Cloud(华为云) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)
AI总结 本文提出OmniTabBench,最大的表格数据基准,包含3030个数据集,通过大规模实验验证各模型家族无单一优势,提供更清晰的指导。
StructKV: 保持结构骨架以实现可扩展的长上下文推理
机构 * UCAS-Terminus AI Lab, University of Chinese Academy of Sciences, China(中国科学院大学UCAS-Terminus AI实验室) ; National Engineering Research Center for Software Engineering, Peking University(北京大学国家软件工程研究中心)
AI总结 StructKV通过全局入度中心性、动态枢轴检测和结构传播与解耦方法,有效保留长距离依赖性和检索鲁棒性,提升长上下文推理效率。
Comments Accepted to ACL 2026 Findings, 14 pages