Self-Supervised On-Policy Distillation for Reasoning Language Models
自监督在线策略蒸馏用于推理语言模型
机构 * Tsinghua University(清华大学) ; Beihang University(北航大学)
AI总结 本文提出自监督在线策略蒸馏(SSOPD)方法,通过对比正确与错误的完成过程信号,提升推理语言模型的表现,实验表明在多个基准测试中优于GRPO和OPSD基线。
高校专区
自监督在线策略蒸馏用于推理语言模型
机构 * Tsinghua University(清华大学) ; Beihang University(北航大学)
AI总结 本文提出自监督在线策略蒸馏(SSOPD)方法,通过对比正确与错误的完成过程信号,提升推理语言模型的表现,实验表明在多个基准测试中优于GRPO和OPSD基线。
MemRepair:用于代理级漏洞修复的分层内存
机构 * Beihang University(北京航空航天大学) ; The University of Hong Kong(香港大学)
AI总结 本研究提出MemRepair,一种增强记忆的代理框架,通过分层记忆和动态反馈循环提高漏洞修复的可靠性,实现了在多个仓库级别的漏洞修复基准上的高修复率。
注意力劫持:跨查询的视觉-语言模型响应操控
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Beihang University(北京航空航天大学)
AI总结 本文研究了视觉-语言模型中跨查询响应操控问题,提出了一种新的对抗攻击方法Attention Hijacking,通过引导内部注意力分布保持图像主导模式,提高攻击在不同查询下的有效性。
Lever:智能手机上的推测LLM推理
机构 * Tsinghua University(清华大学) ; Beihang University(北航) ; University of Pittsburgh(匹兹堡大学)
AI总结 本文提出Lever系统,通过联合优化推测解码的三个阶段,在智能手机上实现高效的闪存支持的LLM推理,显著降低了推理延迟。
一种基于无监督聚类分析的超二次曲面拟合整体方法
机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学学院,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Robotics Institute, School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程与自动化学院机器人研究所)
AI总结 本文提出了一种新的方法,用于在存在噪声和异常值的情况下对点云进行超二次曲面拟合,通过无监督聚类分析重新定义问题,实现了刚性和变形超二次曲面的一体化拟合,同时提供了闭式解析解和收敛性证明。
Comments 20 pages, Code: https://github.com/zikai1/SuperquadricFitting
Journal ref IEEE TRANSACTIONS ON PATTERN ANALYSIS AND MACHINE INTELLIGENCE, 2026
ClawGym:一种构建有效Claw代理的可扩展框架
机构 * Gaoling School of Artificial Intelligence(人工智能学院) ; Renmin University of China(中国人民大学) ; IQuest Research(IQuest研究) ; Beihang University(北航)
AI总结 本文提出ClawGym框架,用于构建Claw式个人代理的全生命周期,通过合成可验证训练数据和强化学习方法提升代理效能。
LightZeroNav: 基于轻量级VLMs的连续环境中零样本视觉语言导航
机构 * Foshan Graduate School of Innovation, Northeastern University(创新研究生院,东北大学) ; Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学) ; School of Aeronautic Science and Engineering, Beihang University(航空科学与工程学院,北航) ; QingniaoAI, China(清北AI,中国)
AI总结 本文提出LightZeroNav,通过轻量级VLMs解决连续环境中零样本视觉语言导航的三大瓶颈,无需特定训练或图搜索,在RGB观测和轻量级Qwen3-VL-8B模型下实现与GPT-4o相当的性能。
你的推理模型是否在隐式地知道何时停止思考?
机构 * Beihang University(北京航空航天大学)
AI总结 本文研究了大推理模型在复杂推理任务中停止思考的隐式能力,提出SAGE方法提升推理效率与准确性。
实时对齐奖励模型超越语义
机构 * Beihang University(北京航空航天大学) ; Tsinghua University(清华大学) ; Renmin University of China(中国人民大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 本文提出R2M框架,通过实时利用策略模型反馈来对齐策略分布偏移,解决RLHF中奖励过拟合问题。
PropGuard: 通过传播感知探索与修复保障LLM-MAS
机构 * Beihang University(北航) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; City University of Hong Kong(香港城市大学)
AI总结 PropGuard通过构建双视角时空图,结合响应中心风险评估与全状态证据保存,实现对LLM-MAS中传播性攻击的检测与修复,有效降低攻击成功率并保持高任务防御效率。
Res²CLIP:基于残差到残差对齐的少样本通用异常检测
机构 * Beihang University(北航) ; University of Science and Technology Beijing(北京科技大学) ; Beijing Jiaotong University(北京交通大学)
AI总结 Res²CLIP通过残差到残差对齐解决少样本下类别泛化问题,消除细粒度特征差异和类特定偏差,提升跨类别泛化能力。
CLOVER:端到端自动驾驶规划的闭环价值估计与排序
机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) ; Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) ; School of Electronic Information Engineering, Beihang University(北航电子信息技术学院) ; National College for Excellent Engineers, Beihang University(北航卓越工程师学院)
AI总结 CLOVER通过闭环价值估计与排序框架,解决端到端自动驾驶规划中训练与评估不匹配的问题,通过生成器和评分器的轻量级架构提升规划器性能,实现更准确的候选轨迹排序。
通过观察上下文压缩实现高效终端智能体的自进化框架
机构 * University of Manchester(曼彻斯特大学) ; MAP 4 HKUST(GZ)(香港科技大学(广州)MAP 4) ; HKUST(香港科技大学) ; Beihang University(北京航空航天大学)
AI总结 本文提出TACO框架,通过自进化压缩规则提升终端智能体的效率与性能,实验表明在多个基准测试中均取得显著提升。
Comments 27 pages
AirNav: 一个大规模无人机视觉与语言导航数据集,包含自然且多样的指令
机构 * School of Intelligent Systems Engineering, Sun Yat-Sen University(中山大学智能系统工程学院) ; Beihang University(北京航空航天大学) ; Peking University(北京大学) ; Beijing University Of Posts and Telecommunications(北京邮电大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Xiamen University(厦门大学) ; National University of Defense Technology(国防科技大学)
AI总结 本文提出AirNav数据集,包含137K自然多样指令的导航样本,评估了多种方法,提出AirVLN-R1模型在测试中取得51.82%的成功率,并通过实际无人机实验验证了仿真到现实的迁移能力。
TopoEvo: 一种面向拓扑的自演化多智能体框架用于微服务中的根本原因分析
机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)
AI总结 针对微服务中观测数据异质性、故障传播和拓扑漂移问题,TopoEvo通过多模态对齐、拓扑约束推理和自演化机制,提升根本原因分析的鲁棒性与准确性。
Comments 12 pages
STAR: 一种针对微服务中RCA代理的阶段属性分诊与修复框架
机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)
AI总结 本文提出STAR框架,通过将RCA流程分解为四个阶段,提升微服务中RCA代理的可靠性与自修复能力。
Comments 11 pages
HiSem:面向遥感图像变化描述的层次语义解缠
机构 * College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) ; Research Center for Spatiotemporal Intelligence, Inner Mongolia University(内蒙古大学时空智能研究中心) ; Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(北航宇航学院航空航天智能科学与技术系) ; State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北航虚拟现实技术与系统国家重点实验室) ; China Mobile Communications Group Inner Mongolia Co., Ltd.(中国移动通信集团内蒙古有限公司)
AI总结 本文提出HiSem网络,通过层次化语义解缠模块解决遥感图像变化描述中语义纠缠问题,提升变化检测的准确性和描述质量。
BioHuman: 从视频中学习生物力学人体表示
机构 * Beihang University(北航) ; Tsinghua University(清华大学)
AI总结 本文提出BioHuman模型,通过视频输入联合预测人体运动和肌肉激活,建立视觉观测与内部生物力学状态的联系,展示了在多样化的主体和动作上准确重建运动和肌肉活动的能力。
MambaRain:多尺度Mamba-注意力框架用于0-3小时降水现在预报
机构 * School of Automation, Southeast University(东南大学自动化学院) ; Nanjing XinDa Institute of Meteorological Science and Technology(南京新达气象科学与技术研究所) ; Beijing Leninainfo Technology Co., Ltd.(北京 Leninainfo 技术有限公司) ; China CEC Engineering Corporation(中国 CEC 工程公司) ; School of Mathematical Sciences, Tongji University(同济大学数学科学学院) ; State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) ; College of Meteorology and Oceanography, National University of Defense Technology(国防科技大学气象学与海洋学学院) ; Key Laboratory of Transportation Meteorology of China Meteorological Administration, Nanjing Innovation Institute for Atmospheric Sciences(中国气象局交通运输气象重点实验室,南京大气科学创新研究院)
AI总结 本文提出MambaRain框架,结合Mamba的线性复杂度长程建模与自注意力机制,提升0-3小时降水现在预报精度,通过混合设计增强时空表征能力,实验显示在2-3小时预测中表现突出。
Comments 9 pages,7 figures
VMU-Diff:一种用于降水现在预测的粗到细多源数据融合框架
机构 * Department of Automation, Southeast University(东南大学自动化部门) ; State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) ; Key Laboratory of Transportation Meteorology, China Meteorological Administration(中国气象局交通运输气象重点实验室)
AI总结 本文提出VMU-Diff框架,通过粗阶段确定性模型预测全局运动趋势,细阶段概率模型生成精细预测细节,利用雷达和多波段卫星数据融合,提升短期降水预测精度。
Comments 5 pages, 2 figures
让机器人感受你的触摸:用于具身镜像共振的视觉-触觉皮层对齐
机构 * Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) ; Key Laboratory of Biomedical Engineering of Hainan Province, School of Biomedical Engineering, Hainan University(海南省生物医学工程重点实验室,海南大学生物医学工程学院) ; School of New Media Art and Design, Beihang University(北航艺术与设计学院) ; MoE Key Laboratory for Biomedical Photonics, Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(教育部生物医学光子学重点实验室,武汉光电研究所,华中科技大学)
AI总结 本文提出镜像触觉网络,通过多级约束实现视觉与触觉表征的语义、分布和几何对齐,使机器人能从RGB图像预测毫米级触觉信号,为具身镜像共振提供可解释的机器人感知路径。
享受RMSNorm的计算效率:层归一化
机构 * State Key Laboratory of Complex and Critical Software Environment (SKLCCSE)(复杂与关键软件环境国家重点实验室) ; Beihang University(北京航空航天大学) ; Hangzhou International Innovation Institute(杭州国际创新研究院)
AI总结 本文提出一种框架,确定任意DNN中的层归一化是否可替换为RMSNorm而不改变模型功能,通过折叠归一化操作提升效率,实验显示可提升2%-12%的推理速度。
Comments 33 pages, 21 figures
D-VLA:一种面向视觉-语言-动作模型的高并发分布式异步强化学习框架
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Tianjin University(天津大学) ; Beihang University(北航) ; JDT AI Infra(京东AI基础设施)
AI总结 本文提出D-VLA框架,通过平面解耦和四线异步流水线提升大规模视觉-语言-动作模型的并发性和效率,实验显示其在吞吐量和采样效率上优于主流框架。
FrameSkip: 从更信息丰富的较少帧中学习以在VLA训练中提升性能
机构 * Harbin Institute of Technology(哈尔滨理工大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Huazhong University of Science and Technology(华中科技大学) ; East China Normal University(华东师范大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Beihang University(北航) ; DeepCybo
AI总结 本文提出FrameSkip框架,通过选择高重要性帧来优化VLA训练,提升成功率与保留率的平衡,实现在三个基准测试中达到76.15%的成功率。
Comments GitHub: https://github.com/ZGC-EmbodyAI/FrameSkip
OpenAaaS:一种用于分布式材料信息学研究的开源代理即服务框架
机构 * National Key Laboratory of AI for Materials Science(人工智能材料科学国家重点实验室) ; Tianmushan Laboratory(天幕山实验室) ; Beihang University(北京航空航天大学)
AI总结 OpenAaaS提出一种开源的分层分布式代理即服务框架,通过代码流、数据不动原则实现跨领域安全集成,解决材料设计中的长期迭代和复杂机制问题。
Comments 20 pages 5 figures
解耦与发散条件化的提示用于多领域动态图基础模型
机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) ; Key Lab of Education Blockchain and Intelligent Technology, Ministry of Education, Guangxi Normal University(教育部教育区块链与智能技术重点实验室,广西师范大学) ; Department of Computer Science, University of Illinois at Chicago(伊利诺伊大学芝加哥分校计算机科学系)
AI总结 本文提出DyGFM,通过解耦和发散条件化提示策略,解决多领域动态图建模中的语义与时间不一致问题,提升跨域适应和下游任务性能。
CUBic:协调统一的双臂感知与控制框架
机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算高级创新中心,人工智能学院,北京航空航天大学) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; Peking University(北京大学)
AI总结 本文提出CUBic框架,通过统一感知模型解决双臂协调问题,采用共享表示学习提升任务成功率。
基于外部化攻击-防御共演的模型无关持续LLM安全
机构 * City University of Hong Kong(香港城市大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Wuhan University(武汉大学) ; Beihang University(北京航空航天大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
AI总结 本文提出EvoSafety框架,通过外部结构实现持续安全改进,采用对抗技能库和轻量防御模型,在单一训练中实现攻击探测与防御提升,实验显示其在Guard模式下防御成功率高达99.61%。
Comments 48 pages, 7 figures
KAST-BAR:基于知识的语义动态拓扑脑自回归建模用于通用神经解释
机构 * School of Automation Science and Electrical Engineering, Beihang University, Beijing, China.(自动化科学与电气工程学院,北航,北京,中国) ; School of Biological Science and Medical Engineering, Beihang University, Beijing, China.(生物科学与医学工程学院,北航,北京,中国) ; State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China.(虚拟现实技术与系统国家重点实验室,北航,北京,中国) ; T Magnetic Resonance Imaging Translational Medical Center, Department of Radiology, Southwest Hospital, Army Medical University (Third Military Medical University), Chongqing, China.(7T磁共振成像转化医学中心,放射科,西南医院,军医大学(第三军医大学),重庆,中国)
AI总结 KAST-BAR通过动态对齐多层级脑拓扑的生理表示与专家级语义空间,解决EEG基础模型在复杂时空拓扑建模和模态差距问题,实现跨任务的神经解释。
面向长周期具身智能体的工具对齐视觉-语言-动作模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Zhongguancun Academy(中关村学院) ; Beihang University(北京航空航天大学)
AI总结 本文提出VLAs-as-Tools方法,通过高阶视觉语言模型与专用工具协作,提升长周期任务的成功率与调用忠实度。