TriDF: Triplane-Accelerated Density Fields for Few-Shot Remote Sensing Novel View Synthesis
TriDF: 三平面加速密度场用于少样本遥感新视角合成
机构 * Beihang University(北航大学)
AI总结 TriDF通过高效混合3D表示,实现少样本遥感新视角合成,提升速度与渲染质量
Comments Corrected metadata formatting
高校专区
TriDF: 三平面加速密度场用于少样本遥感新视角合成
机构 * Beihang University(北航大学)
AI总结 TriDF通过高效混合3D表示,实现少样本遥感新视角合成,提升速度与渲染质量
Comments Corrected metadata formatting
做自己的红队:通过自play和反思经验回放实现安全对齐
机构 * Beihang University(北京航空航天大学) ; Peking University(北京大学) ; Zhongguancun Laboratory(中关村实验室)
AI总结 通过自play和反思经验回放机制,使模型自主进化防御能力,提升安全对齐效果。
CAFEDistill: 通过联邦早退网络蒸馏学习个性化和动态模型
机构 * DS, City University of Hong Kong(DS,香港城市大学) ; SKLCCSE, Beihang University(SKLCCSE,北京航空航天大学)
AI总结 CAFEDistill通过冲突感知的联邦退出蒸馏框架,解决PFL中客户端异质性和深度干扰问题,提升模型准确性和降低推理成本。
Comments 12 pages, conference
AgriFM:一种多源时序遥感基础模型用于农业制图
机构 * Jockey Club STEM Lab of Quantitative Remote Sensing, Department of Geography, The University of Hong Kong, Hong Kong, China(香港大学地理系金钟STEM实验室) ; Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University, Beijing, China(北航航天智能科学与技术学院) ; School of Remote Sensing and Information Engineering, Wuhan University, China(武汉大学遥感与信息工程学院)
AI总结 AgriFM是一种多源时序遥感基础模型,通过改进的Video Swin Transformer架构实现多尺度时空特征提取,提升农业制图的准确性和效率。
SCE-SLAM:通过场景坐标嵌入实现尺度一致的单目SLAM
机构 * School of Computer Science and Engineering, State Key Laboratory of Complex & Critical Software Environment, Jiangxi Research Institute, Beihang University(计算机科学与工程学院、复杂与关键软件环境国家重点实验室、江西研究院、北航) ; Macquarie University(麦考瑞大学) ; Beijing Key Laboratory of Semiconductor Neural Network Intelligent Sensing and Computing Technology(北京半导体神经网络智能感知与计算技术重点实验室)
AI总结 SCE-SLAM通过场景坐标嵌入实现单目SLAM的尺度一致性,实验显示在KITTI上轨迹误差减少8.36米,同时保持36 FPS。
CogRail: 对智能铁路运输系统中认知入侵感知的视觉语言模型进行基准测试
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) ; School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) ; Signal & Communication Research Institute, China Academy of Railway Sciences(信号与通信研究所,中国铁路科学研究院) ; Beijing Huairou Academy of Parallel Sensing(北京怀柔平行感知院) ; School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) ; State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(智能交通系统国家重点实验室,交通科学与工程学院,北京航空航天大学)
AI总结 CogRail提出一个用于评估视觉语言模型在认知入侵感知任务中性能的基准,通过联合微调框架提升模型在时空推理和威胁分析中的表现。
DriveRX:一种用于跨任务自动驾驶的视觉-语言推理模型
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Zhongguancun Academy(中关村学院) ; Beihang University(北航)
AI总结 DriveRX是一种用于自动驾驶的视觉-语言推理模型,通过结构化推理提升多阶段决策能力,并在复杂驾驶条件下表现优异。
PARL:面向文档布局分析的位置感知关系学习网络
机构 * Unisound AI Technology Co.Ltd(Unisound人工智能技术有限公司) ; MAIS, Institute of Automation, CAS(MAIS,自动化研究所,中国科学院) ; Beihang University(北航) ; School of Computer Science and Technology, Tiangong University(天工大学计算机科学与技术学院)
AI总结 PARL提出一种无OCR的纯视觉框架,通过位置敏感性和关系结构建模文档布局,实现高效且鲁棒的布局分析。
FocalOrder:阅读顺序检测中的焦点偏好优化
机构 * Unisound AI Technology Co.Ltd(Unisound人工智能技术有限公司) ; MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) ; Beihang University(北航大学) ; School of Computer Science and Technology, Tiangong University(技术学院,天津大学)
AI总结 FocalOrder通过焦点偏好优化解决阅读顺序检测中位置差异问题,提升复杂文档结构处理能力。
ReasonTabQA: 一个全面的表格问题回答基准,用于现实世界工业场景
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) ; Chongqing University(重庆大学) ; Beihang University(北京航空航天大学)
AI总结 ReasonTabQA是一个针对现实工业场景的表格问题回答基准,通过引入TabCodeRL强化学习方法提升模型推理能力,揭示了工业级表格问答的复杂性。
DIVER: 动态迭代视觉证据推理用于多模态虚假新闻检测
机构 * Xinjiang University(新疆大学) ; AI Security Lab(360人工智能安全实验室) ; Beihang University(北航) ; Fudan University(复旦大学) ; Central South University(中南大学) ; Nanjing University(南京大学)
AI总结 DIVER通过动态迭代视觉证据推理提升多模态虚假新闻检测性能,利用文本和视觉证据融合优化检测效果。
Comments 13 pages
SciIF: 科学指令遵循基准测试以实现严谨的科学智能
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Sydney(悉尼大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Beihang University(北航大学)
AI总结 SciIF是一个评估模型在科学问题解决中严格遵守约束条件能力的多学科基准测试,通过显式证据验证科学有效性,提升LLM在科学逻辑框架中的可靠性。
在无结构环境中实现自动驾驶:我们已经取得了多大进展?
机构 * Research Center for Intelligent Computing Systems, SKLP, Institute of Computing Technology, Chinese Academy of Sciences(智能计算系统研究中心、SKLP、计算技术研究所、中国科学院) ; Harbin Engineering University(哈尔滨工程大学) ; Jianghuai Advance Technology Center, Anhui Provincial Key Laboratory of Humanoid Robot, Anhui Provincial Industry Innovation Center of Humanoid Robot(江淮先进技术中心、安徽省人形机器人重点实验室、安徽省人形机器人产业创新中心) ; Beihang University(北航) ; Test Center, National University of Defense Technology(测试中心、国防科技大学) ; National University of Defense Technology(国防科技大学) ; Unmanned Systems Technology Research Center, Defense Innovation Institute(无人系统技术研究中心、创新研究院)
AI总结 本文综述了无结构户外环境中自动驾驶的研究进展,涵盖多个关键技术领域,并讨论了未来研究方向。
Comments Accepted by Journal of Field Robotics (JFR) 2025; Survey paper; 59 pages
物理世界中的视觉对抗攻击与防御:综述
机构 * Institute of Artificial Intelligence, Beihang University(北航人工智能研究院) ; The Chinese University of HongKong(香港中文大学)
AI总结 本文综述了物理世界中视觉对抗攻击与防御,分析了攻击类型、防御方法及未来研究方向。
DVD:一种检测大规模语言模型评估中变体污染的稳健方法
机构 * Beihang University(北京航空航天大学) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。
Character-R1: 通过RLVR增强角色感知推理
机构 * Institute of Computing and Intelligence, Harbin Institute of Technology(计算与智能研究所,哈尔滨工业大学) ; Shenzhen Loop Area Institute (SLAI)(深圳环城研究院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学) ; Baidu Inc.(百度公司)
AI总结 Character-R1通过引入三种核心设计提升角色感知推理能力,有效解决角色扮演代理中的认知一致性问题。
NL2Repo-Bench: 向编码代理的长周期仓库生成评估迈进
机构 * Nanjing University(南京大学) ; Peking University(北京大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Beihang University(北航)
AI总结 NL2Repo-Bench通过评估编码代理在长周期内生成仓库的能力,揭示了自主软件开发中的核心挑战。
面向鲁棒且可控的文本到运动的掩码自回归扩散
机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) ; Hangzhou Innovation Institute(杭州创新院) ; Beihang University(北京航空航天大学)
AI总结 MoMADiff通过结合掩码建模与扩散过程,实现鲁棒且可控的文本到运动生成,优于现有方法。
Comments Accepted by ACM MM 2025
SkeletonX: 通过跨样本特征聚合实现数据高效的骨架动作识别
机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,北京航空航天大学,北京,中国)
AI总结 SkeletonX通过跨样本特征聚合实现高效骨架动作识别,在有限数据下提升性能,参数更少,效果更优。
Comments Accepted by IEEE Transactions on Multimedia (TMM). 13 pages, 7 figures, 11 tables
通过技能分类引导的数据合成实现大语言模型的组合泛化
机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北京航空航天大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Beijing Institute of Technology(北京理工大学) ; Institute of Computing Technology, CAS(中国科学院计算技术研究所)
AI总结 STEPS通过技能分类引导的数据合成提升大语言模型的组合泛化能力。
Comments The code and data for our methods and experiments are available at https://github.com/weiyifan1023/STEPS
多模态大语言模型在视觉丰富文档检索中的作用:一项综述
机构 * Beihang University(北航大学)
AI总结 本文综述了多模态大语言模型在视觉丰富文档检索中的应用,探讨了三种关键角色及其在RAG中的作用与权衡。
Comments 18 pages; accepted at AACL-IJCNLP 2025 (main conference)
声纳时刻:在音频地理定位中基准测试音频语言模型
机构 * The State Key Laboratory of Complex and Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北航) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Key Laboratory of Data Science and Intelligent Computing, International Innovation Institute, Beihang University(数据科学与智能计算重点实验室,国际创新研究院,北航)
AI总结 本文提出AGL1K基准,用于评估音频语言模型在音频地理定位中的能力,发现封闭源模型表现更优,语言线索在预测中起主导作用。
LongBench Pro: 一个更现实且全面的双语长上下文评估基准
机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
AI总结 LongBench Pro通过人机协作构建,提供1500个双语长上下文样本,评估46个模型发现长上下文优化比参数扩展更有效,有效上下文长度较短且存在跨语言偏差,混合思考设计具有潜在优势。
RobotDiffuse: 基于扩散模型的冗余机械臂运动规划与ROP障碍避让数据集
机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) ; School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院) ; Hangzhou Innovation Institute, Beihang University, Hangzhou, China(北京航空航天大学杭州创新研究院)
AI总结 RobotDiffuse通过扩散模型实现冗余机械臂运动规划,结合物理约束与点云编码器,并发布ROP数据集提升障碍避让性能。
RxnCaption:将反应图解析重新表述为视觉提示引导的描述生成
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Beihang University(北航) ; Peking University(北京大学) ; South China Normal University(华南师范大学) ; Northwestern Polytechnical University(西北工业大学)
AI总结 RxnCaption通过将反应图解析转化为视觉提示引导的描述生成任务,提升化学反应数据的机器可读性,并构建大规模数据集推动AI在化学领域的应用。
基于先验的DETR用于超声结节检测
机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) ; State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复使用航天运输技术国家重点实验室) ; Department of Ultrasound, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院肿瘤医院超声科) ; State Key Laboratory of Virtual Reality Technology and Systems, Ministry of Education(虚拟现实技术与系统国家重点实验室) ; the Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technology, Ministry of Education(航天器设计优化与动态仿真技术重点实验室)
AI总结 基于先验的DETR框架通过整合几何和结构先验,提升超声结节检测的准确性和鲁棒性。
GenCAMO: 基于场景图的环境感知与无掩码伪装图像密集标注生成
机构 * China University of Petroleum (East China)(中国石油大学(华东)) ; Southwest Jiaotong University(西南交通大学) ; Beijing Information Science and Technology University(北京信息科技大学) ; Beihang University(北航)
AI总结 GenCAMO通过生成模型合成高质量伪装数据,提升复杂伪装场景的密集预测性能。
RoboRefer: 向视觉语言模型在机器人中的空间指称推理迈进
机构 * School of Software, Beihang University(北京航空航天大学软件学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
AI总结 RoboRefer通过整合深度编码器和强化微调方法,实现了视觉语言模型在机器人中的空间指称推理,提升了复杂场景下的交互能力。
Comments Accepted by NeurIPS 2025. Project page: https://zhoues.github.io/RoboRefer/
具有流的抗噪声微小目标定位
机构 * Beihang University(北京航空航天大学) ; Communication University of China(中国传媒大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出TOLF框架,利用归一化流和不确定性引导优化,提升微小目标定位的抗噪声能力,并在AI-TOD数据集上提升AP 1.2%。
Comments 11 pages, 5 figures
MAESTRO:多智能体评估套件用于测试、可靠性与可观测性
机构 * Beihang University(北航大学)
AI总结 MAESTRO通过统一接口评估多智能体系统的测试、可靠性和可观测性,揭示架构对资源配置和性能权衡的核心影响。