arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

2026-05-26 至 2026-05-26 共收录 16
2605.25864 2026-05-26 cs.LG cs.CL

When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards

当自我信念误导:面向可验证奖励的强化学习的主动标签获取

Li Wang, Xiaodong Lu, Xiaohan Wang, Yikun Ban, Jiajun Chai, Wei Lin, Tianhao Peng, Guojun Yin

机构 * Meituan(美团) Beihang University(北京航空航天大学) Nanyang Technological University(新加坡国立大学)

AI总结 提出RLAVR框架,通过主动获取少量真实标签并与伪标签结合,利用CAG指标和CARE策略稳定训练并提升有限标注预算下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25737 2026-05-26 cs.CV

SFR-Net: Learning Scale-Frustum Representations for Ultra-Wide Area Remote Sensing Image Segmentation

SFR-Net: 学习尺度截锥体表示用于超广域遥感图像分割

Chuyu Zhong, Keyan Chen, Qinzhe Yang, Bowen Chen, Zhengxia Zou, Zhenwei Shi

机构 * Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(航天智能科学与技术学院,北京航空航天大学) Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technologies, Ministry of Education, Beihang University(航天器设计优化与动态仿真技术重点实验室,北京航空航天大学) Shen Yuan Honors College, Beihang University(神元荣誉学院,北京航空航天大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,新加坡南洋理工大学)

AI总结 针对超广域遥感图像中地物尺度差异大和长距离上下文语义连续性问题,提出尺度截锥体表示网络(SFR-Net),通过构建尺度截锥体表示和级联跨尺度融合机制,在GID和FBPS数据集上分别提升mIoU 1.72%和4.29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25389 2026-05-26 cs.CR cs.AI cs.MA

Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MAS

Evo-Attacker: 用于LLM-MAS长时程工具攻击的记忆增强强化学习

Bingyu Yan, Xiaoming Zhang, Jinyu Hou, Chaozhuo Li, Ziyi Zhou, Yiming Hei, Litian Zhang

机构 * Beihang University(北航) Beijing University of Posts and Telecommunications(北京邮电大学) China Academy of Information and Communications Technology(信息通信技术研究院)

AI总结 提出Evo-Attacker,通过记忆增强强化学习框架将工具攻击建模为自进化过程,并引入Attack-Flow GRPO优化长时程信用分配,实验表明其优于基线方法。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08213 2026-05-26 cs.CV cs.AI

EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis

EditCaption: 用于图像编辑指令合成的人工精炼SFT与HAE-DPO

Xiangyuan Wang, Honghao Cai, Yunhao Bai, Chao Hui, Tianze Zhou, Haohua Chen, Hao Shi, Yuling Wu, Yao Hu, Xu Tang, Yibo Chen, Wei Zhu

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Xiaohongshu Inc.(小红书公司)

AI总结 提出EditCaption两阶段后训练流程,通过人工精炼SFT和基于难度自适应错误感知DPO(HAE-DPO)提升图像编辑指令合成质量,显著降低关键错误率并超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08499 2026-05-26 cs.LG cs.AI

Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards

上下文展开赌博机:面向可验证奖励的强化学习

Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Zhijun Chen, Yu Luo, Fuzhen Zhuang, Yikun Ban, Deqing Wang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Huawei(华为)

AI总结 针对RLVR中展开使用无差别、短视导致的问题,提出上下文赌博机框架,自适应选择高价值展开,提升训练效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12425 2026-05-26 cs.CV

Boosting Monocular Metric Depth Estimation via Bokeh Rendering

通过散景渲染提升单目度量深度估计

Hangwei Zhang, Armando Fortes, Tianyi Wei, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Beihang University(北航大学)

AI总结 提出BokehDepth两阶段框架,利用物理生成模型产生校准散景堆栈作为无监督几何信号,通过散景感知聚合模块提升单目深度估计的度量精度。

Comments Project Page: https://fogradio.github.io/BokehDepth_Project/

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24845 2026-05-26 cs.AI math.CO

Solving Combinatorial Counting Problems with Weighted First-Order Model Counting

使用加权一阶模型计数解决组合计数问题

Yuanhong Wang, Juhua Pu, Yuxu Zhou, Yuyi Wang, Ondřej Kuželka

机构 * School of Artificial Intelligence, Jilin University, Changchun, China State Key Laboratory of Complex \& Critical Software Environment, Beihang University, China National Research Center for Educational Materials, China Tengen Intelligence Institute, China Czech Technical University in Prague, Prague, Czech Republic

AI总结 提出Cofola语言,通过类型化声明式编程和加权一阶模型计数(WFOMC)编译流水线,统一解决集合、多重集、排列、划分等组合计数问题。

Comments 47 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24647 2026-05-26 cs.CL

Know You Before You Speak: User-State Modeling for LLM Personalization in Multi-Turn Conversation

在你说话之前了解你:多轮对话中用于LLM个性化的用户状态建模

Jiani Luo, Xiaoyan Zhao, Yang Zhang, Shuyi Miao, Bingbing Xu, Stefan Konigorski, Tat-Seng Chua

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) German Institute of Human Nutrition Potsdam-Rehbruecke(德国人类营养研究所波茨坦-雷赫布鲁克)

AI总结 提出基于自由能原理的PUMA框架,通过显式用户状态模型和动作选择机制,将个性化对话从被动记忆检索转变为基于模型的用户演化决策,在医疗咨询基准上提升长期对话效果。

Comments 30pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24593 2026-05-26 cs.CV

Self-supervised Dynamic Heterogeneous Degradation Modeling for Unified Zero-Shot Image Restoration

自监督动态异质退化建模用于统一零样本图像恢复

XiaoWan Hu, Jing Yang, HeNan Liu, HuaQiu Li, Mai Xu

机构 * Beihang University(北航) Tsinghua University(清华大学)

AI总结 提出统一物理零样本图像恢复框架,通过将异质退化重参数化为同质分布并引入动态质量细化策略,实现单/混合退化下的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24573 2026-05-26 cs.CL

AstroMind: A High-Fidelity Benchmark for Spacecraft Behavior Reasoning Based on Large Language Models

AstroMind:基于大型语言模型的航天器行为推理高保真基准

Hao Liu, Siyuan Yang, Qinglei Hu, Dongyu Li

机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) KTH Royal Institute of Technology(皇家理工学院) School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) School of Cyber Science and Technology, Beihang University(北京航空航天大学网络空间安全学院)

AI总结 针对航天器机动行为理解问题,提出基于高保真天体动力学模拟和真实观测约束的基准AstroMind,涵盖意图推断、参数估计和威胁评估三类任务,并评估多种开源模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10989 2026-05-26 cs.LG cs.AI

SURGE: Surrogate Gradient Adaptation in Binary Neural Networks

SURGE: 二值神经网络中的替代梯度自适应

Haoyu Huang, Boyu Liu, Linlin Yang, Yanjing Li, Yuguang Yang, Xuhui Liu, Canyu Chen, Zhongqian Fu, Baochang Zhang

机构 * National College for Excellent Engineers, Beihang University, Beijing, China(北京航空航天大学优秀工程师学院) School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) School of Electronic and Information Engineering, Beihang University, Beijing, China(北京航空航天大学电子与信息工程学院) King Abdullah University of Science and Technology, Saudi Arabia(沙特国王 Abdullah 科学技术大学) Huawei Noah’s Ark Lab, China(华为诺亚实验室)

AI总结 针对二值神经网络中梯度失配和固定范围梯度裁剪导致的信息损失问题,提出一种基于理论的可学习梯度补偿框架SURGE,通过双路径梯度补偿器和自适应梯度缩放器实现偏差减少的梯度估计与动态平衡,在图像分类、目标检测和语言理解任务上达到最优性能。

Comments Accepted as a poster at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21463 2026-05-26 cs.SD cs.AI

Unifying Speech Editing Detection and Content Localization via Prior-Enhanced Audio LLMs

通过先验增强的音频大语言模型统一语音编辑检测与内容定位

Jun Xue, Yi Chai, Yanzhen Ren, Jinshen He, Zhiqiang Tang, Zhuolin Yi, Yihuan Huang, Yuankun Xie, Yujie Chen

机构 * Key Laboratory of Aerospace Information Security(航空信息安全与可信计算重点实验室) School of Cyber Science and Engineering(网络安全工程学院) Wuhan University(武汉大学) Independent Researcher(独立研究员) School of Computer Science and Technology(计算机科学与技术学院) Anhui University(安徽大学) Communication University of China(中国通信大学) Beihang University(北京航空航天大学)

AI总结 提出基于音频大语言模型的统一框架,通过生成式方法联合处理语音编辑检测和内容定位,并引入先验增强策略和声学一致性损失以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18794 2026-05-26 cs.GR cs.CV

ChronoGS: Disentangling Invariants and Changes in Multi-Period Scenes

ChronoGS:多时期场景中不变性与变化的解耦

Zhongtao Wang, Jiaqi Dai, Qingtian Zhu, Yilong Li, Mai Su, Fei Zhu, Meng Gai, Shaorong Wang, Chengwei Pan, Yisong Chen, Guoping Wang

机构 * Peking University(北京大学) Beijing Forestry University(北京林业大学) The University of Tokyo(东京大学) Beihang University(北航)

AI总结 提出ChronoGS,一种时间调制的高斯表示方法,通过统一锚点支架重建多时期场景,并解耦稳定与演化组件,实现时间一致的重建,同时发布ChronoScene基准数据集。

Comments CVPR26 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15131 2026-05-26 math.OC cs.LG

Split-Merge: A Difference-based Approach for Dominant Eigenvalue Problem

分裂-合并:一种基于差异的主特征值问题方法

Xiaozhi Liu, Mengmeng Song, Yong Xia

机构 * LMIB of the Ministry of Education, School of Mathematical Sciences, Beihang University(教育部离散数学与信息检索重点实验室,北京航空航天大学数学科学学院) National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Northeastern University(工业智能与系统优化国家级前沿科学中心,东北大学)

AI总结 针对对称半正定矩阵的主特征对计算问题,提出一种基于差异的无约束优化框架,并设计分裂-合并算法,实现无矩阵、无参数迭代,收敛速度优于经典幂法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23997 2026-05-26 cs.CV cs.AI cs.LG

IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning

IVR-R1:通过强化学习中的迭代视觉基础推理优化轨迹

Chenghao Li, Fusheng Hao, Xikai Zhang, Likang Xiao, Yanwei Ren, Fuxiang Wu, Quan Chen, Liu Liu

机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Kuaishou Technology(快手科技) Shenzhen Institute of Advanced Integration Technology, Shenzhen(深圳先进集成技术研究院)

AI总结 提出IVR-R1框架,利用奖励驱动的筛选机制和迭代再推理循环,在强化学习中动态校正多模态推理轨迹,以解决视觉幻觉和逻辑错误问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23913 2026-05-26 cs.DC cs.CL

Can LoRA Fusion Support Cross-Domain Tasks in Cloud-Edge Collaboration?

LoRA融合能否支持云边协作中的跨域任务?

Yatong Wang, Fali Wang, Naibin Gu, Zheng Lin, Zhengxiao Liu, Dingyu Yao, Zhiwei Zhang, Jianxin Shi, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) The Pennsylvania State University, University Park, USA(宾夕法尼亚州立大学) Beihang University, Beijing, China(北航大学)

AI总结 针对云边协作中跨域问题解决的需求,提出剪枝-训练-恢复框架和冲突解决模块LoRA-CR,发现现有LoRA融合方法在跨域基准MMLU-CD上表现不佳,而LoRA-CR通过缓解参数冲突将性能提升高达3.8%。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏