Multi-Stakeholder LLM Alignment: Decomposing Estimation from Aggregation
多方利益相关者LLM对齐:从聚合中分解估计
机构 * AMAP, Alibaba Group(阿里集团AMAP) ; Beihang University(北京航空航天大学)
AI总结 针对多方利益相关者任务中用户偏好冲突的问题,提出DecompR方法,通过反事实校准权重固定查询结构,独立估计角色效用,消除候选依赖的权重漂移并降低估计噪声。
高校专区
多方利益相关者LLM对齐:从聚合中分解估计
机构 * AMAP, Alibaba Group(阿里集团AMAP) ; Beihang University(北京航空航天大学)
AI总结 针对多方利益相关者任务中用户偏好冲突的问题,提出DecompR方法,通过反事实校准权重固定查询结构,独立估计角色效用,消除候选依赖的权重漂移并降低估计噪声。
HTMLCure:将浏览器体验转化为面向交互式HTML的状态引导修复
机构 * Beihang University(北京航空航天大学) ; IQuest Research(IQuest研究院) ; Peking University(北京大学)
AI总结 提出HTMLCure框架,通过浏览器交互执行、状态感知诊断和闭环修复引擎,从大规模HTML页面中筛选并修复可修复页面,显著提升SFT数据质量和模型性能。
Comments 27 pages, 11 figures. Code: https://github.com/wuyuVerse/HTMLCure
DV-SFT: 直接视觉监督用于细粒度视觉理解
机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; Zhongguancun Academy(中关村学院) ; Beihang University(北航) ; Zhongguancun Laboratory(中关村实验室) ; Southeast Academy of Information Technology, Beijing Institute of Technology(北京理工大学信息科学技术东南学院)
AI总结 提出DV-SFT方法,通过为视觉令牌构建显式令牌级监督信号,利用OCR场景中的直接视觉-文本对应关系,在不修改模型架构或增加前向传播的情况下,显著提升多模态大语言模型的细粒度视觉理解能力。
Comments Under Review
L-Learning:一种基于李雅普诺夫与拉格朗日力学的机器人高效稳定跟踪方法
机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)
AI总结 提出L-Learning框架,结合李雅普诺夫稳定性理论与拉格朗日力学,从数据中学习系统能量函数,实现高效、稳定且样本效率高的机器人轨迹跟踪。
Comments 9 pages, 4 figures, 4 tables
MedVol-R1:基于奖励驱动的证据基础用于体积推理分割
机构 * School of Biological Science and Medical Engineering, Beihang University, Beijing, China(生物科学与医学工程学院,北京航空航天大学) ; Center for Information and Computer Science, School of Science for Open and Environmental Systems, Graduate School of Science and Technology, Keio University, Kanagawa, Japan(信息与计算机科学中心,开放与环境系统科学学院,科技研究生学校,东京大学,神奈川,日本) ; Bytedance Inc., China(字节跳动公司,中国) ; Tsinghua University, Beijing, China(清华大学,北京,中国)
AI总结 提出MedVol-R1框架,通过强化学习将临床推理解耦为可验证的2D证据锚点,再传播为3D掩膜,实现体积推理分割,在多个基准上达到最优性能。
DirectFisheye-GS: 在三维高斯泼溅中通过跨视图联合优化实现原生鱼眼输入
机构 * BNRist, Tsinghua University(北京理工大学,清华大学) ; Beihang University(北航) ; JD.com, Beijing, China(京东(北京,中国)) ; Shanghai AI Lab(上海人工智能实验室)
AI总结 针对鱼眼相机输入导致的信息丢失和细节模糊问题,提出将鱼眼相机模型集成到3DGS框架中,并引入基于特征重叠的跨视图联合优化策略,实现无需预处理的原生鱼眼图像训练,提升重建质量。
Comments CVPR 2026 Highlight; Fix NSFC ID
自信号驱动的多LLM辩论以实现高效准确的推理
机构 * University of Cambridge(剑桥大学) ; Sorbonne Université(索邦大学) ; University of Science and Technology of China(中国科学技术大学) ; Beihang University(北航大学) ; Nanyang Technological University(南洋理工大学)
AI总结 提出一种利用模型级置信度和token级语义焦点两种自信号来自适应引导多LLM辩论过程的方法,在提高准确性的同时减少token消耗。
超越自我对话:基于LLM的多智能体系统的通信中心综述
机构 * School of Cyber Science and Technology, Beihang University, Beijing 100191, China(信息科学与技术学院,北京航空航天大学,北京100191,中国) ; The College of Cyber Security/College of Information Science and Technology, Jinan University, Guangzhou, China(网络安全学院/信息科学与技术学院,暨南大学,广州,中国) ; School of Computer Science and Engineering, Beihang University, Beijing 100083, China(计算机科学与工程学院,北京航空航天大学,北京100083,中国) ; School of Cyber Science and Technology, Beijing University of Posts and Telecommunications, Beijing 100876, China(信息科学与技术学院,北京邮电大学,北京100876,中国)
AI总结 本文从通信视角综述基于大语言模型的多智能体系统,提出一个整合系统级和系统内部通信的结构化框架,分析智能体交互机制、挑战及未来方向。
Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-50857-y}
当自我信念误导:面向可验证奖励的强化学习的主动标签获取
机构 * Meituan(美团) ; Beihang University(北京航空航天大学) ; Nanyang Technological University(新加坡国立大学)
AI总结 提出RLAVR框架,通过主动获取少量真实标签并与伪标签结合,利用CAG指标和CARE策略稳定训练并提升有限标注预算下的性能。
SFR-Net: 学习尺度截锥体表示用于超广域遥感图像分割
机构 * Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(航天智能科学与技术学院,北京航空航天大学) ; Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technologies, Ministry of Education, Beihang University(航天器设计优化与动态仿真技术重点实验室,北京航空航天大学) ; Shen Yuan Honors College, Beihang University(神元荣誉学院,北京航空航天大学) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,新加坡南洋理工大学)
AI总结 针对超广域遥感图像中地物尺度差异大和长距离上下文语义连续性问题,提出尺度截锥体表示网络(SFR-Net),通过构建尺度截锥体表示和级联跨尺度融合机制,在GID和FBPS数据集上分别提升mIoU 1.72%和4.29%。
Evo-Attacker: 用于LLM-MAS长时程工具攻击的记忆增强强化学习
机构 * Beihang University(北航) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; China Academy of Information and Communications Technology(信息通信技术研究院)
AI总结 提出Evo-Attacker,通过记忆增强强化学习框架将工具攻击建模为自进化过程,并引入Attack-Flow GRPO优化长时程信用分配,实验表明其优于基线方法。
Comments ACL 2026 main
EditCaption: 用于图像编辑指令合成的人工精炼SFT与HAE-DPO
机构 * Peking University(北京大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Tsinghua University(清华大学) ; Beihang University(北京航空航天大学) ; Xiaohongshu Inc.(小红书公司)
AI总结 提出EditCaption两阶段后训练流程,通过人工精炼SFT和基于难度自适应错误感知DPO(HAE-DPO)提升图像编辑指令合成质量,显著降低关键错误率并超越现有模型。
上下文展开赌博机:面向可验证奖励的强化学习
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Huawei(华为)
AI总结 针对RLVR中展开使用无差别、短视导致的问题,提出上下文赌博机框架,自适应选择高价值展开,提升训练效率与性能。
通过散景渲染提升单目度量深度估计
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; Beihang University(北航大学)
AI总结 提出BokehDepth两阶段框架,利用物理生成模型产生校准散景堆栈作为无监督几何信号,通过散景感知聚合模块提升单目深度估计的度量精度。
Comments Project Page: https://fogradio.github.io/BokehDepth_Project/
Journal ref ICML 2026
使用加权一阶模型计数解决组合计数问题
机构 * School of Artificial Intelligence, Jilin University, Changchun, China ; State Key Laboratory of Complex \& Critical Software Environment, Beihang University, China ; National Research Center for Educational Materials, China ; Tengen Intelligence Institute, China ; Czech Technical University in Prague, Prague, Czech Republic
AI总结 提出Cofola语言,通过类型化声明式编程和加权一阶模型计数(WFOMC)编译流水线,统一解决集合、多重集、排列、划分等组合计数问题。
Comments 47 pages, 9 figures
在你说话之前了解你:多轮对话中用于LLM个性化的用户状态建模
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; School of Artificial Intelligence, Beihang University(北航人工智能学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; German Institute of Human Nutrition Potsdam-Rehbruecke(德国人类营养研究所波茨坦-雷赫布鲁克)
AI总结 提出基于自由能原理的PUMA框架,通过显式用户状态模型和动作选择机制,将个性化对话从被动记忆检索转变为基于模型的用户演化决策,在医疗咨询基准上提升长期对话效果。
Comments 30pages, 3 figures
自监督动态异质退化建模用于统一零样本图像恢复
机构 * Beihang University(北航) ; Tsinghua University(清华大学)
AI总结 提出统一物理零样本图像恢复框架,通过将异质退化重参数化为同质分布并引入动态质量细化策略,实现单/混合退化下的最优性能。
AstroMind:基于大型语言模型的航天器行为推理高保真基准
机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; KTH Royal Institute of Technology(皇家理工学院) ; School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) ; School of Cyber Science and Technology, Beihang University(北京航空航天大学网络空间安全学院)
AI总结 针对航天器机动行为理解问题,提出基于高保真天体动力学模拟和真实观测约束的基准AstroMind,涵盖意图推断、参数估计和威胁评估三类任务,并评估多种开源模型表现。
SURGE: 二值神经网络中的替代梯度自适应
机构 * National College for Excellent Engineers, Beihang University, Beijing, China(北京航空航天大学优秀工程师学院) ; School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) ; School of Electronic and Information Engineering, Beihang University, Beijing, China(北京航空航天大学电子与信息工程学院) ; King Abdullah University of Science and Technology, Saudi Arabia(沙特国王 Abdullah 科学技术大学) ; Huawei Noah’s Ark Lab, China(华为诺亚实验室)
AI总结 针对二值神经网络中梯度失配和固定范围梯度裁剪导致的信息损失问题,提出一种基于理论的可学习梯度补偿框架SURGE,通过双路径梯度补偿器和自适应梯度缩放器实现偏差减少的梯度估计与动态平衡,在图像分类、目标检测和语言理解任务上达到最优性能。
Comments Accepted as a poster at the 43rd International Conference on Machine Learning (ICML 2026)
通过先验增强的音频大语言模型统一语音编辑检测与内容定位
机构 * Key Laboratory of Aerospace Information Security(航空信息安全与可信计算重点实验室) ; School of Cyber Science and Engineering(网络安全工程学院) ; Wuhan University(武汉大学) ; Independent Researcher(独立研究员) ; School of Computer Science and Technology(计算机科学与技术学院) ; Anhui University(安徽大学) ; Communication University of China(中国通信大学) ; Beihang University(北京航空航天大学)
AI总结 提出基于音频大语言模型的统一框架,通过生成式方法联合处理语音编辑检测和内容定位,并引入先验增强策略和声学一致性损失以提升性能。
ChronoGS:多时期场景中不变性与变化的解耦
机构 * Peking University(北京大学) ; Beijing Forestry University(北京林业大学) ; The University of Tokyo(东京大学) ; Beihang University(北航)
AI总结 提出ChronoGS,一种时间调制的高斯表示方法,通过统一锚点支架重建多时期场景,并解耦稳定与演化组件,实现时间一致的重建,同时发布ChronoScene基准数据集。
Comments CVPR26 Highlight
分裂-合并:一种基于差异的主特征值问题方法
机构 * LMIB of the Ministry of Education, School of Mathematical Sciences, Beihang University(教育部离散数学与信息检索重点实验室,北京航空航天大学数学科学学院) ; National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Northeastern University(工业智能与系统优化国家级前沿科学中心,东北大学)
AI总结 针对对称半正定矩阵的主特征对计算问题,提出一种基于差异的无约束优化框架,并设计分裂-合并算法,实现无矩阵、无参数迭代,收敛速度优于经典幂法。
IVR-R1:通过强化学习中的迭代视觉基础推理优化轨迹
机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; Kuaishou Technology(快手科技) ; Shenzhen Institute of Advanced Integration Technology, Shenzhen(深圳先进集成技术研究院)
AI总结 提出IVR-R1框架,利用奖励驱动的筛选机制和迭代再推理循环,在强化学习中动态校正多模态推理轨迹,以解决视觉幻觉和逻辑错误问题。
LoRA融合能否支持云边协作中的跨域任务?
机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) ; The Pennsylvania State University, University Park, USA(宾夕法尼亚州立大学) ; Beihang University, Beijing, China(北航大学)
AI总结 针对云边协作中跨域问题解决的需求,提出剪枝-训练-恢复框架和冲突解决模块LoRA-CR,发现现有LoRA融合方法在跨域基准MMLU-CD上表现不佳,而LoRA-CR通过缓解参数冲突将性能提升高达3.8%。
Comments 16 pages, 6 figures
点跟踪改进了世界动作模型
机构 * Aalto University(阿alto大学) ; ELLIS Institute Finland(ELLIS研究所芬兰) ; University of Oulu(奥卢大学) ; Sun Yat-sen University(中山大学) ; Peng Cheng Laboratory(鹏城实验室) ; Beihang University(北京航空航天大学)
AI总结 提出联合像素与跟踪的世界动作模型JOPAT,通过预测2D点跟踪和动作来提升机器人策略学习,在长时域、遮挡和离屏运动任务上优于纯像素方法。
基准测试与增强VLM对压缩图像的理解
机构 * Institute for AI Industry Research, Tsinghua University, Beijing, China(清华人工智能产业研究院) ; Beihang University, Beijing, China(北京航空航天大学) ; Beijing University of Technology, Beijing, China(北京理工大学)
AI总结 本文提出首个全面基准测试评估VLM对压缩图像的理解能力,分析性能差距来源,并设计通用适配器提升模型性能10%-30%。
Comments The paper is accepted by ICML 2026
解耦时空适配器用于细粒度羽毛球动作定位
机构 * School of Economics and Management, Beihang University(北京航空航天大学经济管理学院) ; Key Laboratory of Data Intelligence and Management, Beihang University, Ministry of Industry and Information Technology(信息产业部北京航空航天大学数据智能与管理重点实验室)
AI总结 针对细粒度羽毛球动作定位中复杂的时空动态,提出解耦时空适配器(DSTA),通过三个并行分支分别建模时间动态、垂直和水平空间变化,在Fine-Badminton数据集和ShuttleSet基准上实现最优性能且计算开销极小。
Comments 11 pages, 11figures
VGGT-Segmentor: 几何增强的跨视角分割
机构 * Hangzhou International Innovation Institute of Beihang University(北航杭州国际创新研究院) ; Beihang University(北京航空航天大学)
AI总结 针对不同视角下的实例分割难题,提出VGGT-Segmentor框架,结合VGGT的几何建模与新型Union分割头,通过掩码提示融合、点引导预测和迭代细化实现像素精确分割,并采用单图像自监督训练,在Ego-Exo4D基准上达到新最优性能。
通过信息增益改进掩码扩散模型的采样
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Massachusetts Institute of Technology(麻省理工学院) ; Shanghai Jiao Tong University(上海交通大学) ; Beihang University(北航) ; College of AI, Tsinghua University(清华大学人工智能学院)
AI总结 提出一种无需训练的Info-Gain采样器,利用掩码扩散模型的双向结构平衡即时不确定性与剩余掩码位置的信息增益,在推理、编码、创意写作和图像生成任务中优于现有采样器。
Comments https://github.com/yks23/Information-Gain-Sampler Accepted by ICML2026 Accepted by ICML2026
VideoTemp-o3:在智能视频思考中协调时间定位与视频理解
机构 * Shandong University(山东大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beihang University(北航) ; Southern University of Science and Technology(南方科技大学)
AI总结 提出VideoTemp-o3统一框架,通过联合建模视频定位与问答、设计统一掩码机制和专用奖励,解决长视频理解中采样效率低、定位弱和工作流僵化问题。
Comments ICML 2026