arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 1225
2604.02808 2026-07-21 cs.CV 版本更新

CMCC-ReID: Cross-Modality Clothing-Change Person Re-Identification

CMCC-ReID: 跨模态服装变化人员重识别

Haoxuan Xu, Hanzi Wang, Guanglin Niu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Informatics, Xiamen University(厦门大学信息学院)

AI总结 本文提出CMCC-ReID任务,解决跨模态和服装变化的人员匹配问题,构建SYSU-CMCC基准数据集,并提出PIA网络,通过DBDL和BPL模块提升重识别性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16074 2026-07-20 cs.DC cs.AI cs.SE 新提交

JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models

JoyNexus:面向服务的视觉语言动作模型多租户训练后处理

Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai, Shuai Di, Xu Chu, Xiaotie Deng, Yicheng Gong, Junwu Xiong

机构 * Peking University(北京大学) Beihang University(北航) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

AI总结 针对VLA模型训练后处理问题,提出JoyNexus统一服务,解耦相关服务,多租户可通过API调用,引入组批处理提高效率,经评估能减少GPU时间,提升服务利用率。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15079 2026-07-20 cs.AI 版本更新

BrainPilot: Automating Brain Discovery with Agentic Research

BrainPilot:通过智能研究实现大脑发现自动化

Haoxuan Li, Tianci Gao, Jianhe Li, Yang Fan, Runze Shi, Weiran Wang, Tianxiang Zhao, Zezhao Wu, Xiaoyang Jiang, Qihui Zhang, Jia Li, Xiao Xiao, Kai Du, Xiaoxuan Jia, Chao Xie, Lu Mi

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qizhi Institute(上海期智研究院) Business School, Renmin University of China(中国人民大学商学院) School of Physics, Beihang University(北京航空航天大学物理学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Behavioral and Cognitive Neuroscience Center, Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院行为与认知神经科学中心) College of Engineering, Georgia Institute of Technology(佐治亚理工学院工程学院) School of Life Sciences & IDG/McGovern Institute for Brain Research, Tsinghua University(清华大学生命科学学院&清华-IDG/麦戈文脑科学研究院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) Weixian College, Tsinghua University(清华大学未央学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)

AI总结 研究针对脑科学研究整合证据难、人工智能代理有缺陷的问题,提出完全开源的多智能体系统BrainPilot,它有可追溯日志和验证结果,含知识库与技能库,经实验评估,其开源模型以低成本达先进框架性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06818 2026-07-20 cs.LG 版本更新

Rethinking the Global Knowledge of CLIP in Training-Free Open-Vocabulary Semantic Segmentation

重新思考CLIP的全局知识以实现无训练开放词汇语义分割

Jingyun Wang, Cilin Yan, Guoliang Kang

机构 * Beihang University(北航大学)

AI总结 本文提出GCLIP,通过重塑最后块注意力和Value嵌入来提取CLIP的全局知识,提升无训练开放词汇语义分割性能。

Comments TMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01244 2026-07-20 cs.CL 版本更新

Large-Scale Terminal Agentic Trajectory Generation from Dockerized Environments

从Docker化环境生成大规模终端代理轨迹

Siwei Wu, Yizhi Li, Yuyang Song, Wei Zhang, Yang Wang, Riza Batista-Navarro, Xian Yang, Mingjie Tang, Bryan Dai, Jian Yang, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) IQuest Research(IQuest研究) Beihang University(北航大学) Sichuan University(四川大学) Multimodal Art Projection Research Community(多模态艺术投影研究社区)

AI总结 本文提出TerminalTraj,通过Docker化环境生成高质量终端轨迹,提升代理模型在终端任务中的性能表现。

Comments Accepted as a Spotlight paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15278 2026-07-17 cs.CV 新提交

Hierarchical Denoising For Multi-Step Visual Reasoning

用于多步视觉推理的分层去噪

Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) The Hong Kong University of Science and Technology(香港科技大学) Beihang University(北京航空航天大学) Fuzhou University(福州大学) Muka Robotics(木卡机器人)

AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14510 2026-07-17 cs.AI 新提交

VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence

VLT:用于工业智能的视觉-语言-时间序列多模态基础模型

Haiteng Wang, Jingheng Yan, Xiaokang Wang, Lei Ren

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)

AI总结 针对工业时间序列单模态建模局限及连接时间序列与文本语义的挑战,提出VLT多模态基础模型,通过设计Time-MoE等机制联合建模多种模态,经实验验证其在多种复杂设置下优于现有方法,提升了鲁棒性和泛化能力。

Comments 18 pages, 13 figures, and 13 tables, including supplementary material. Haiteng Wang and Jingheng Yan contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10999 2026-07-17 cs.CV 版本更新

Conditioning Residuals for Diffusion Models via Representation Feedback

通过表示反馈对扩散模型的残差进行条件设定

Weilai Xiang, Hongyu Yang, Di Huang, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

AI总结 研究扩散模型中能否利用固有路径路由内部推断语义,提出条件残差这一轻量级反馈机制,通过反馈紧凑特征摘要提供自适应指导,实验显示其提升了生成性能及下游任务表现,还揭示了训练动态和特征结构的改进。

Comments Substantially revised and retitled. Code available at https://github.com/FutureXiang/ddae_plus_plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13101 2026-07-16 cs.LG cs.AI 新提交

TSSM: Triaxial State Space Model for Global Station Weather Forecasting with Temporal-Variable-Historical Modeling

TSSM:用于全球台站天气预报的具有时间可变历史建模的三轴状态空间模型

Songru Yang, Zili Liu, Tao Han, Ben Fei, Fenghua Ling, Lei Bai, Chang Liu, Xiangyang Ji, Zhenwei Shi, Zhengxia Zou

机构 * Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 研究针对全球台站天气预报中现有方法的局限,提出三轴状态空间模型TSSM,通过时间可变历史范式纳入历史数据,设计扫描捕捉多种特性,在多数据集上性能优异,尤其在长期和迭代预测及应对缺失观测方面优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12680 2026-07-15 cs.CV 新提交

ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning

ReflectVLN:通过反思推理训练视觉语言导航智能体

Jiahang Wang, Yirong Yang, Yanqing Zhu, Minghua Luo, Shichao Xie, Fei Liu, Mu Xu

机构 * Amap, Alibaba Group(高德软件有限公司,阿里巴巴集团) Beihang University(北京航空航天大学)

AI总结 研究针对现有视觉语言导航方法缺乏闭环机制问题,提出ReflectVLN框架,通过双向交互智能体决策,引入行动思维链训练方案,实验证明该框架在有限数据下提升成功率和路径效率,且具良好训练成本与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12678 2026-07-15 cs.CV cs.AI 新提交

Text-Aided Multi-Modal Panoptic Symbol Spotting for CAD Floor Plan Drawings

用于CAD平面图的文本辅助多模态全景符号识别

Yan Gong, Bohao Li, Bowen Du, Junchen Ye

机构 * CCSE Lab, Beihang University(北京航空航天大学CCSE实验室) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) The Hong Kong Polytechnic University(香港理工大学)

AI总结 针对CAD平面图全景符号识别中现有方法未充分利用文本注释的问题,提出多模态框架TextCAD,设计TACE编码注释语义,引入语义层次对齐框架,实验表明该方法有效提升符号识别性能并达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11245 2026-07-15 cs.SE cs.AI 版本更新

An Empirical Study for Android-to-OpenHarmony GUI Test Migration

从安卓到开源鸿蒙系统的图形用户界面测试迁移实证研究

Yakun Zhang, Xinjia Chen, Yiyun Chen, Yuxia Zhang, Mingyi Zhou, Xiang Gao, Shaokun Zhang, Li Li, Yunming Ye

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute of Technology(北京理工大学) Beihang University(北航) Peking University(北京大学)

AI总结 研究从安卓到开源鸿蒙系统的图形用户界面测试迁移问题,构建数据集,选择并适配两种先进迁移方法进行评估,发现现有方法效果不佳,进而提出增强方法ITeM-HM,显著提升了测试迁移成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09977 2026-07-15 cs.CV 版本更新

INFANiTE: Implicit Neural representation for high-resolution Fetal brain spatio-temporal Atlas learNing from clinical Thick-slicE MRI

INFANiTE:隐式神经表示用于高分辨率胎儿脑空间-时间大体图谱学习从临床厚切片MRI

Xiaotian Hu, Mingxuan Liu, Hongjia Yang, Tongxi Song, Yijin Li, Yifei Chen, Haoxiang Li, Zihan Li, Yingqi Hao, Ziyu Li, Yi Liao, Haibo Qu, Qiyuan Tian

机构 * Beihang University(北航大学) Tsinghua University(清华大学) Sichuan University(四川大学) University of Oxford(牛津大学)

AI总结 INFANiTE通过隐式神经表示方法,实现了从厚切片MRI中高效生成高分辨率胎儿脑空间-时间大体图谱,显著加快了图谱构建过程,提升了图谱的一致性、参考保真度和生物合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25834 2026-07-15 cs.AI cs.IR 版本更新

Action-Aware Generative Sequence Modeling for Short Video Recommendation

面向动作的生成序列建模用于短视频推荐

Wenhao Li, Zihan Lin, Zhengxiao Guo, Jie Zhou, Shukai Liu, Yongqi Liu, Chuan Luo, Chaoyi Ma, Ruiming Tang, Han Li

机构 * Kuaishou Inc.(快手公司) Beihang University(北航)

AI总结 本文提出A2Gen模型,通过时间维度细化用户动作并生成序列,提升短视频推荐的准确性和用户参与度。

Comments We request the retraction of our paper due to discrepancies in the authorship information (https://dl.acm.org/doi/10.1145/3805712.3809728). To ensure accurate representation of contributions, we plan to revise the authorship list and resubmit. Thank you for your understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11529 2026-07-14 cs.CV 新提交

Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory

解析、搜索与确认:基于思维链推理和结构化空间记忆的免训练空中视觉与对话导航

Yu Qi, Hongyu Li, Shaofei Huang, Tianrui Hui, Yaxiong Wang, Lechao Cheng, Zhun Zhong, Si Liu, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) Jianghuai Advance Technology Center(江淮先进技术中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) University of Macau(澳门大学)

AI总结 研究免训练环境下的空中视觉与对话导航任务,提出PSC - AVDN框架,结合解析 - 搜索 - 确认推理管道与结构化空间记忆,整合多种空间线索,在免训练设置中取得新的最优性能。

Comments 10 pages, 4 figures. Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 23859-23868

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11374 2026-07-14 cs.LG 新提交

Surprisingly Simple and Effective Multi-Domain Graph Foundation Model through Graph-to-Table Alignment

通过图到表对齐实现惊人简单且有效的多域图基础模型

Chunyu Hu, Tianyin Liao, Ge Lan, Xingxuan Zhang, Jianxin Li, Peng Cui, Ziwei Zhang

机构 * Nankai University(南开大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 研究如何让表格基础模型有效捕获图结构信息,提出GTAlign框架,先预训练图编码器捕获图表示,通过社区引导持续预训练弥合差距,应用于目标域推理,实验表明该框架在节点和图分类上显著优于基线,提供简单无文本的图基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11008 2026-07-14 cs.CV cs.AI 新提交

SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception

SynCLIP:用于鲁棒开放词汇密集感知的同义词一致语言-图像预训练

Mingjie Xie, Guangjun He, Dongli Xu, Youtian Lin, Hongjue Li, Pengming Feng, Jian Guan, Yue Deng

机构 * Beihang University(北京航空航天大学) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室) Nanjing University(南京大学) Harbin Engineering University(哈尔滨工程大学) Beijing Zhongguancun Academy(北京中关村科学城)

AI总结 研究针对开放词汇密集感知中同义词引起的定位不一致问题,提出SynCLIP框架,通过SSA和SAR模块增强注意力一致性与定位精度,构建SEViC支持预训练,实验证明该方法显著提升定位一致性并达领先性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10805 2026-07-14 cs.CL cs.LG 新提交

Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation

诊断和缓解基于策略的自蒸馏中的思维崩溃

Keqin Peng, Chen Li, Yuanxin Ouyang, Yancheng Yuan, Liang Ding

机构 * Beihang University(北京航空航天大学) Hong Kong Polytechnic University(香港理工大学) Alibaba Group(阿里巴巴集团)

AI总结 研究基于策略的自蒸馏在复杂推理任务中性能下降问题,发现思维崩溃陷阱。提出自适应双视角OPSD,通过动态调节自蒸馏目标缓解该问题,在多模型规模和数据集上实验验证其有效性,提升绝对平均准确率4.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10789 2026-07-14 cs.AI 新提交

Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging

成像101:在科学计算成像上对大语言模型编码智能体进行基准测试

Siyi Chen, Jiahe Ying, Yixuan Jia, Yuxuan Gu, Enze Ye, Weimin Bai, Zhijun Zeng, Shaochi Ren, Binhong Gao, Yubing Li, Tianhan Zhang, He Sun

机构 * College of Future Technology and the National Biomedical Imaging Center, Peking University(北京大学未来技术学院和国家生物医学成像中心) AI for Science Institute (AISI)(科学人工智能研究所) University of Michigan(密歇根大学) State Key Laboratory of Acoustics and Marine Information, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所声场声信息国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Astronautics, Beihang University(北京航空航天大学宇航学院) Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technologies, Ministry of Education(教育部航天器设计优化与动态仿真技术重点实验室)

AI总结 研究针对计算成像构建正确重建管道费力的问题,引入含57个任务的Imaging-101基准及三个评估轨道,评估七个前沿大语言模型,发现应用编码智能体于计算成像存在系统性挑战,指出技能增强、领域专业化智能体是可靠成像辅助的途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08765 2026-07-14 cs.CV 版本更新

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

通过几何感知预训练增强上下文全景生成

Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi

机构 * Insta360 Research(影石创新研究院) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Wuhan University(武汉大学)

AI总结 该研究提出两阶段框架Canvas360用于上下文全景生成,结合几何感知预训练与微调。通过构建数据集及特定建模方法,增强文本到全景生成,经实验验证其能提高全景图像保真度,在相关指标上表现优异。

Comments Project page: https://zry000.github.io/Canvas360/ Github: https://github.com/Insta360-Research-Team/Canvas360

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-07-14 cs.RO cs.AI cs.CL cs.CV 版本更新

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05235 2026-07-14 cs.CL 版本更新

FedMosaic: Federated Retrieval-Augmented Generation via Parametric Adapters

FedMosaic:通过参数适配器进行联邦检索增强生成

Zhilin Liang, Yuxiang Wang, Zimu Zhou, Hainan Zhang, Boyi Liu, Yongxin Tong

机构 * SKLCCSE Lab Beihang University Beijing China(SKLCCSE实验室 北航) Department of Data Science City University of Hong Kong Hong Kong China(数据科学系 香港城市大学) Beijing Advanced Innovation Center Beihang University Beijing China(北京先进创新中心 北航) Beihang University(北航) City University of Hong Kong(香港城市大学)

AI总结 研究针对隐私敏感领域,解决联邦检索增强生成中高存储通信及适配器聚合问题。核心方法是提出FedMosaic框架,聚类文档成多文档适配器并选择性聚合。主要贡献是准确率提高,存储和通信成本降低,且不共享原始文档。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16395 2026-07-14 cs.AI cs.SE 版本更新

LLM-Driven Collaborative Model for Untangling Commits via Explicit and Implicit Dependency Reasoning

基于显式和隐式依赖推理的大语言模型驱动的提交解缠协作模型

Bo Hou, Xin Tan, Kai Zheng, Fang Liu, Yinghao Zhu, Li Zhang

机构 * State Key Laboratory of Complex \& Critical Software Environment (SKLCCSE), School of Computer Science Engineering, Beihang University Beijing China SKLCCSE, School of Computer Science School of Computing Data Science, The University of Hong Kong Hong Kong SAR China Engineering, Beihang University Data Science, The University of Hong Kong

AI总结 针对开发者常产生的缠结提交问题,提出ColaUntangle协作框架,集成大语言模型驱动智能体,构建显式和隐式上下文捕捉信息,经实验验证,该框架在提交解缠任务中性能优于基线,凸显基于大语言模型协作框架的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10982 2026-07-14 cs.RO

GLC-SLAM: Gaussian Splatting SLAM with Efficient Loop Closure

GLC-SLAM:基于高效循环闭合的高斯点云SLAM

Ziheng Xu, Qingfeng Li, Chen Chen, Xuefeng Liu, Jianwei Niu

机构 * Beihang University(北航大学) Hangzhou Innovation Institute of Beihang University(北航杭州创新研究院)

AI总结 GLC-SLAM通过全局优化和高效循环闭合解决大规模环境中的SLAM漂移问题,提升密集建图性能。

Journal ref Expert Systems with Applications (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20730 2026-07-13 cs.CV 版本更新

Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback

循环渲染:通过视觉自反馈生成矢量图形

Guotao Liang, Zhangcheng Wang, Juncheng Hu, Haitao Zhou, Ziteng Xue, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北航软件学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) Paradigm(4Paradigm)

AI总结 本文提出Render-in-the-Loop方法,通过视觉上下文引导矢量图形生成,提升模型对视觉信息的利用效率,实现更高效的SVG生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05559 2026-07-13 cs.AI 版本更新

IFAR: Multi-Perspective and Multi-Level Causal Discovery with LLMs

IFAR:基于大语言模型的多视角多层次因果发现

Jinwei He, Feng Lu

机构 * Beihang University(北航大学)

AI总结 研究针对大语言模型溯因推理中多视角多层次原因这一挑战,提出IFAR框架,结合广义反向推理与正向验证,构建专门数据集,实验表明该框架能提升大语言模型溯因推理性能,在F1分数等方面有显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08180 2026-07-10 cs.CR cs.AI 新提交

Out of Sight: Compression-Aware Content Protection against Agentic Crawlers

视线之外:针对智能爬虫的压缩感知内容保护

Xuefei Wang

机构 * Beihang University(北航大学)

AI总结 研究基于LLM的智能体给在线内容带来的新威胁,提出CAPE框架,通过注入不可见扰动保护文本内容,在低查询预算下有效提升信息损失,实验证明其有效性与通用性,推动智能体时代内容保护研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08076 2026-07-10 cs.CV cs.AI 新提交

LDFE: Laplacian Decoupled Feature Enhancement Block for Dual-Stream CNN-based RGB-IR Object Detection

LDFE:用于基于双流 CNN 的 RGB-IR 目标检测的拉普拉斯解耦特征增强模块

Wenhao Dong, Xiaoyan Luo, Linlin Yang, Haodong Zhu, Xiaorong Shi, Guodong Guo, Baochang Zhang

机构 * Beihang University(北京航空航天大学) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复使用航天运输技术国家重点实验室) The School of Astronautics(航天学院) The National Key Laboratory of Integrated Air-Ground Navigation Technologies(集成空天地导航技术国家实验室) The State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室) The School of Artificial Intelligence(人工智能学院) Zhongguancun Academy(中关村学院) The School of Automation Science and Electrical Engineering(自动化科学与电气工程学院) Beijing Institute of Control and Electronics Technology(北京控制电子技术研究所) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Hangzhou Research Institute, School of Artificial Intelligence(杭州研究院,人工智能学院)

AI总结 研究基于双流 CNN 的 RGB-IR 目标检测问题,提出拉普拉斯解耦特征增强模块 LDFE,通过全局-局部分解等操作融合不同阶段特征,在多个数据集上显著提升目标检测性能,mAP 超 SOTA 方法。

Journal ref Pattern Recognition,Volume 179, Part D,2026,113935

详情

展开后加载摘要…

URL PDF HTML 收藏