arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 1231
2503.13347 2026-01-19 cs.CV

TriDF: Triplane-Accelerated Density Fields for Few-Shot Remote Sensing Novel View Synthesis

TriDF: 三平面加速密度场用于少样本遥感新视角合成

Jiaming Kang, Keyan Chen, Zhengxia Zou, Zhenwei Shi

机构 * Beihang University(北航大学)

AI总结 TriDF通过高效混合3D表示,实现少样本遥感新视角合成,提升速度与渲染质量

Comments Corrected metadata formatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10589 2026-01-16 cs.CR cs.CL

Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay

做自己的红队:通过自play和反思经验回放实现安全对齐

Hao Wang, Yanting Wang, Hao Li, Rui Li, Lei Sha

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Zhongguancun Laboratory(中关村实验室)

AI总结 通过自play和反思经验回放机制,使模型自主进化防御能力,提升安全对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10015 2026-01-16 cs.LG

CAFEDistill: Learning Personalized and Dynamic Models through Federated Early-Exit Network Distillation

CAFEDistill: 通过联邦早退网络蒸馏学习个性化和动态模型

Boyi Liu, Zimu Zhou, Yongxin Tong

机构 * DS, City University of Hong Kong(DS,香港城市大学) SKLCCSE, Beihang University(SKLCCSE,北京航空航天大学)

AI总结 CAFEDistill通过冲突感知的联邦退出蒸馏框架,解决PFL中客户端异质性和深度干扰问题,提升模型准确性和降低推理成本。

Comments 12 pages, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21357 2026-01-16 cs.CV cs.LG

AgriFM: A Multi-source Temporal Remote Sensing Foundation Model for Agriculture Mapping

AgriFM:一种多源时序遥感基础模型用于农业制图

Wenyuan Li, Shunlin Liang, Keyan Chen, Yongzhe Chen, Han Ma, Jianglei Xu, Yichuan Ma, Shikang Guan, Husheng Fang, Zhenwei Shi

机构 * Jockey Club STEM Lab of Quantitative Remote Sensing, Department of Geography, The University of Hong Kong, Hong Kong, China(香港大学地理系金钟STEM实验室) Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University, Beijing, China(北航航天智能科学与技术学院) School of Remote Sensing and Information Engineering, Wuhan University, China(武汉大学遥感与信息工程学院)

AI总结 AgriFM是一种多源时序遥感基础模型,通过改进的Video Swin Transformer架构实现多尺度时空特征提取,提升农业制图的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09665 2026-01-15 cs.CV

SCE-SLAM: Scale-Consistent Monocular SLAM via Scene Coordinate Embeddings

SCE-SLAM:通过场景坐标嵌入实现尺度一致的单目SLAM

Yuchen Wu, Jiahe Li, Xiaohan Yu, Lina Yu, Jin Zheng, Xiao Bai

机构 * School of Computer Science and Engineering, State Key Laboratory of Complex & Critical Software Environment, Jiangxi Research Institute, Beihang University(计算机科学与工程学院、复杂与关键软件环境国家重点实验室、江西研究院、北航) Macquarie University(麦考瑞大学) Beijing Key Laboratory of Semiconductor Neural Network Intelligent Sensing and Computing Technology(北京半导体神经网络智能感知与计算技术重点实验室)

AI总结 SCE-SLAM通过场景坐标嵌入实现单目SLAM的尺度一致性,实验显示在KITTI上轨迹误差减少8.36米,同时保持36 FPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09613 2026-01-15 cs.CV cs.AI

CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems

CogRail: 对智能铁路运输系统中认知入侵感知的视觉语言模型进行基准测试

Yonglin Tian, Qiyao Zhang, Wei Xu, Yutong Wang, Yihao Wu, Xinyi Li, Xingyuan Dai, Hui Zhang, Zhiyong Cui, Baoqing Guo, Zujun Yu, Yisheng Lv

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Signal & Communication Research Institute, China Academy of Railway Sciences(信号与通信研究所,中国铁路科学研究院) Beijing Huairou Academy of Parallel Sensing(北京怀柔平行感知院) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(智能交通系统国家重点实验室,交通科学与工程学院,北京航空航天大学)

AI总结 CogRail提出一个用于评估视觉语言模型在认知入侵感知任务中性能的基准,通过联合微调框架提升模型在时空推理和威胁分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20665 2026-01-14 cs.CV

DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving

DriveRX:一种用于跨任务自动驾驶的视觉-语言推理模型

Muxi Diao, Lele Yang, Hongbo Yin, Zhexu Wang, Yejie Wang, Daxin Tian, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Beihang University(北航)

AI总结 DriveRX是一种用于自动驾驶的视觉-语言推理模型,通过结构化推理提升多阶段决策能力,并在复杂驾驶条件下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07620 2026-01-13 cs.CV

PARL: Position-Aware Relation Learning Network for Document Layout Analysis

PARL:面向文档布局分析的位置感知关系学习网络

Fuyuan Liu, Dianyu Yu, He Ren, Nayu Liu, Xiaomian Kang, Delai Qiu, Fa Zhang, Genpeng Zhen, Shengping Liu, Jiaen Liang, Wei Huang, Yining Wang, Junnan Zhu

机构 * Unisound AI Technology Co.Ltd(Unisound人工智能技术有限公司) MAIS, Institute of Automation, CAS(MAIS,自动化研究所,中国科学院) Beihang University(北航) School of Computer Science and Technology, Tiangong University(天工大学计算机科学与技术学院)

AI总结 PARL提出一种无OCR的纯视觉框架,通过位置敏感性和关系结构建模文档布局,实现高效且鲁棒的布局分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07483 2026-01-13 cs.CV

FocalOrder: Focal Preference Optimization for Reading Order Detection

FocalOrder:阅读顺序检测中的焦点偏好优化

Fuyuan Liu, Dianyu Yu, He Ren, Nayu Liu, Xiaomian Kang, Delai Qiu, Fa Zhang, Genpeng Zhen, Shengping Liu, Jiaen Liang, Wei Huang, Yining Wang, Junnan Zhu

机构 * Unisound AI Technology Co.Ltd(Unisound人工智能技术有限公司) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Beihang University(北航大学) School of Computer Science and Technology, Tiangong University(技术学院,天津大学)

AI总结 FocalOrder通过焦点偏好优化解决阅读顺序检测中位置差异问题,提升复杂文档结构处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07280 2026-01-13 cs.CL

ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios

ReasonTabQA: 一个全面的表格问题回答基准,用于现实世界工业场景

Changzai Pan, Jie Zhang, Kaiwen Wei, Chenshuo Pan, Yu Zhao, Jingwang Huang, Jian Yang, Zhenhe Wu, Haoyang Zeng, Xiaoyan Gu, Weichao Sun, Yanbo Zhai, Yujie Mao, Zhuoru Jiang, Jiang Zhong, Shuangyong Song, Yongxiang Li, Zhongjiang He

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Chongqing University(重庆大学) Beihang University(北京航空航天大学)

AI总结 ReasonTabQA是一个针对现实工业场景的表格问题回答基准,通过引入TabCodeRL强化学习方法提升模型推理能力,揭示了工业级表格问答的复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07178 2026-01-13 cs.CV cs.AI

DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection

DIVER: 动态迭代视觉证据推理用于多模态虚假新闻检测

Weilin Zhou, Zonghao Ying, Chunlei Meng, Jiahui Liu, Hengyang Zhou, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang

机构 * Xinjiang University(新疆大学) AI Security Lab(360人工智能安全实验室) Beihang University(北航) Fudan University(复旦大学) Central South University(中南大学) Nanjing University(南京大学)

AI总结 DIVER通过动态迭代视觉证据推理提升多模态虚假新闻检测性能,利用文本和视觉证据融合优化检测效果。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04770 2026-01-13 cs.AI cs.DB

SciIF: Benchmarking Scientific Instruction Following Towards Rigorous Scientific Intelligence

SciIF: 科学指令遵循基准测试以实现严谨的科学智能

Encheng Su, Jianyu Wu, Chen Tang, Lintao Wang, Pengze Li, Aoran Wang, Jinouwen Zhang, Yizhou Wang, Yuan Meng, Xinzhu Ma, Shixiang Tang, Houqiang Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) University of Sydney(悉尼大学) Fudan University(复旦大学) Tsinghua University(清华大学) Beihang University(北航大学)

AI总结 SciIF是一个评估模型在科学问题解决中严格遵守约束条件能力的多学科基准测试,通过显式证据验证科学有效性,提升LLM在科学逻辑框架中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07701 2026-01-13 cs.RO

Autonomous Driving in Unstructured Environments: How Far Have We Come?

在无结构环境中实现自动驾驶:我们已经取得了多大进展?

Chen Min, Shubin Si, Xu Wang, Hanzhang Xue, Weizhong Jiang, Zitong Chen, Mengmeng Li, Jilin Mei, Erke Shang, Zhipeng Xiao, Bin Dai, Qi Zhu, Hao Fu, Dawei Zhao, Liang Xiao, Yiming Nie, Yu Hu

机构 * Research Center for Intelligent Computing Systems, SKLP, Institute of Computing Technology, Chinese Academy of Sciences(智能计算系统研究中心、SKLP、计算技术研究所、中国科学院) Harbin Engineering University(哈尔滨工程大学) Jianghuai Advance Technology Center, Anhui Provincial Key Laboratory of Humanoid Robot, Anhui Provincial Industry Innovation Center of Humanoid Robot(江淮先进技术中心、安徽省人形机器人重点实验室、安徽省人形机器人产业创新中心) Beihang University(北航) Test Center, National University of Defense Technology(测试中心、国防科技大学) National University of Defense Technology(国防科技大学) Unmanned Systems Technology Research Center, Defense Innovation Institute(无人系统技术研究中心、创新研究院)

AI总结 本文综述了无结构户外环境中自动驾驶的研究进展,涵盖多个关键技术领域,并讨论了未来研究方向。

Comments Accepted by Journal of Field Robotics (JFR) 2025; Survey paper; 59 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01671 2026-01-13 cs.CV

Visual Adversarial Attacks and Defenses in the Physical World: A Survey

物理世界中的视觉对抗攻击与防御:综述

Xingxing Wei, Bangzheng Pu, Shiji Zhao, Jiefan Lu, Baoyuan Wu

机构 * Institute of Artificial Intelligence, Beihang University(北航人工智能研究院) The Chinese University of HongKong(香港中文大学)

AI总结 本文综述了物理世界中视觉对抗攻击与防御,分析了攻击类型、防御方法及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04895 2026-01-09 cs.AI

DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation

DVD:一种检测大规模语言模型评估中变体污染的稳健方法

Renzhao Liang, Jingru Chen, Bo Jia, Bo Deng, Chenggang Xie, Yidong Wang, Ke Jin, Xin Wang, Linfeng Zhang, Cunxiang Wang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04611 2026-01-09 cs.CL

Character-R1: Enhancing Role-Aware Reasoning in Role-Playing Agents via RLVR

Character-R1: 通过RLVR增强角色感知推理

Yihong Tang, Kehai Chen, Xuefeng Bai, Benyou Wang, Zeming Liu, Haifeng Wang, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology(计算与智能研究所,哈尔滨工业大学) Shenzhen Loop Area Institute (SLAI)(深圳环城研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Baidu Inc.(百度公司)

AI总结 Character-R1通过引入三种核心设计提升角色感知推理能力,有效解决角色扮演代理中的认知一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12730 2026-01-09 cs.CL

NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents

NL2Repo-Bench: 向编码代理的长周期仓库生成评估迈进

Jingzhe Ding, Shengda Long, Changxin Pu, Huan Zhou, Hongwan Gao, Xiang Gao, Chao He, Yue Hou, Fei Hu, Zhaojian Li, Weiran Shi, Zaiyuan Wang, Daoguang Zan, Chenchen Zhang, Xiaoxu Zhang, Qizhi Chen, Xianfu Cheng, Bo Deng, Qingshui Gu, Kai Hua, Juntao Lin, Pai Liu, Mingchen Li, Xuanguang Pan, Zifan Peng, Yujia Qin, Yong Shan, Zhewen Tan, Weihao Xie, Zihan Wang, Yishuo Yuan, Jiayu Zhang, Enduo Zhao, Yunfei Zhao, He Zhu, Liya Zhu, Chenyang Zou, Ming Ding, Jianpeng Jiao, Jiaheng Liu, Minghao Liu, Qian Liu, Chongyang Tao, Jian Yang, Tong Yang, Zhaoxiang Zhang, Xinjie Chen, Wenhao Huang, Ge Zhang

机构 * Nanjing University(南京大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

AI总结 NL2Repo-Bench通过评估编码代理在长周期内生成仓库的能力,揭示了自主软件开发中的核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11013 2026-01-09 cs.CV cs.MM

Towards Robust and Controllable Text-to-Motion via Masked Autoregressive Diffusion

面向鲁棒且可控的文本到运动的掩码自回归扩散

Zongye Zhang, Bohan Kong, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute(杭州创新院) Beihang University(北京航空航天大学)

AI总结 MoMADiff通过结合掩码建模与扩散过程,实现鲁棒且可控的文本到运动生成,优于现有方法。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11749 2026-01-09 cs.CV

SkeletonX: Data-Efficient Skeleton-based Action Recognition via Cross-sample Feature Aggregation

SkeletonX: 通过跨样本特征聚合实现数据高效的骨架动作识别

Zongye Zhang, Wenrui Cai, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,北京航空航天大学,北京,中国)

AI总结 SkeletonX通过跨样本特征聚合实现高效骨架动作识别,在有限数据下提升性能,参数更少,效果更优。

Comments Accepted by IEEE Transactions on Multimedia (TMM). 13 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03676 2026-01-08 cs.CL cs.AI

Towards Compositional Generalization of LLMs via Skill Taxonomy Guided Data Synthesis

通过技能分类引导的数据合成实现大语言模型的组合泛化

Yifan Wei, Li Du, Xiaoyan Yu, Yang Feng, Angsheng Li

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Institute of Technology(北京理工大学) Institute of Computing Technology, CAS(中国科学院计算技术研究所)

AI总结 STEPS通过技能分类引导的数据合成提升大语言模型的组合泛化能力。

Comments The code and data for our methods and experiments are available at https://github.com/weiyifan1023/STEPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03262 2026-01-08 cs.IR cs.CL

Roles of MLLMs in Visually Rich Document Retrieval for RAG: A Survey

多模态大语言模型在视觉丰富文档检索中的作用:一项综述

Xiantao Zhang

机构 * Beihang University(北航大学)

AI总结 本文综述了多模态大语言模型在视觉丰富文档检索中的应用,探讨了三种关键角色及其在RAG中的作用与权衡。

Comments 18 pages; accepted at AACL-IJCNLP 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03227 2026-01-07 cs.SD cs.AI

The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization

声纳时刻:在音频地理定位中基准测试音频语言模型

Ruixing Zhang, Zihan Liu, Leilei Sun, Tongyu Zhu, Weifeng Lv

机构 * The State Key Laboratory of Complex and Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北航) Shanghai AI Laboratory(上海人工智能实验室) The Key Laboratory of Data Science and Intelligent Computing, International Innovation Institute, Beihang University(数据科学与智能计算重点实验室,国际创新研究院,北航)

AI总结 本文提出AGL1K基准,用于评估音频语言模型在音频地理定位中的能力,发现封闭源模型表现更优,语言线索在预测中起主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02872 2026-01-07 cs.CL cs.AI

LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark

LongBench Pro: 一个更现实且全面的双语长上下文评估基准

Ziyang Chen, Xing Wu, Junlong Jia, Chaochen Gao, Qi Fu, Debing Zhang, Songlin Hu

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 LongBench Pro通过人机协作构建,提供1500个双语长上下文样本,评估46个模型发现长上下文优化比参数扩展更有效,有效上下文长度较短且存在跨语言偏差,混合思考设计具有潜在优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19500 2026-01-07 cs.RO cs.LG

RobotDiffuse: Diffusion-Based Motion Planning for Redundant Manipulators with the ROP Obstacle Avoidance Dataset

RobotDiffuse: 基于扩散模型的冗余机械臂运动规划与ROP障碍避让数据集

Xudong Mou, Xiaohan Zhang, Tiejun Wang, Tianyu Wo, Cangbai Xu, Ningbo Gu, Rui Wang, Xudong Liu

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院) Hangzhou Innovation Institute, Beihang University, Hangzhou, China(北京航空航天大学杭州创新研究院)

AI总结 RobotDiffuse通过扩散模型实现冗余机械臂运动规划,结合物理约束与点云编码器,并发布ROP数据集提升障碍避让性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02384 2026-01-07 cs.CV

RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning

RxnCaption:将反应图解析重新表述为视觉提示引导的描述生成

Jiahe Song, Chuang Wang, Bowen Jiang, Yinfan Wang, Hao Zheng, Xingjian Wei, Chengjin Liu, Rui Nie, Junyuan Gao, Jiaxing Sun, Yubin Wang, Lijun Wu, Zhenhua Huang, Jiang Wu, Qian Yu, Conghui He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) Peking University(北京大学) South China Normal University(华南师范大学) Northwestern Polytechnical University(西北工业大学)

AI总结 RxnCaption通过将反应图解析转化为视觉提示引导的描述生成任务,提升化学反应数据的机器可读性,并构建大规模数据集推动AI在化学领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02212 2026-01-06 cs.CV

Prior-Guided DETR for Ultrasound Nodule Detection

基于先验的DETR用于超声结节检测

Jingjing Wang, Zhuo Xiao, Xinning Yao, Bo Liu, Lijuan Niu, Xiangzhi Bai, Fugen Zhou

机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复使用航天运输技术国家重点实验室) Department of Ultrasound, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院肿瘤医院超声科) State Key Laboratory of Virtual Reality Technology and Systems, Ministry of Education(虚拟现实技术与系统国家重点实验室) the Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technology, Ministry of Education(航天器设计优化与动态仿真技术重点实验室)

AI总结 基于先验的DETR框架通过整合几何和结构先验,提升超声结节检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01181 2026-01-06 cs.CV

GenCAMO: Scene-Graph Contextual Decoupling for Environment-aware and Mask-free Camouflage Image-Dense Annotation Generation

GenCAMO: 基于场景图的环境感知与无掩码伪装图像密集标注生成

Chenglizhao Chen, Shaojiang Yuan, Xiaoxue Lu, Mengke Song, Jia Song, Zhenyu Wu, Wenfeng Song, Shuai Li

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Southwest Jiaotong University(西南交通大学) Beijing Information Science and Technology University(北京信息科技大学) Beihang University(北航)

AI总结 GenCAMO通过生成模型合成高质量伪装数据,提升复杂伪装场景的密集预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04308 2026-01-06 cs.RO cs.AI cs.CV

RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics

RoboRefer: 向视觉语言模型在机器人中的空间指称推理迈进

Enshen Zhou, Jingkun An, Cheng Chi, Yi Han, Shanyu Rong, Chi Zhang, Pengwei Wang, Zhongyuan Wang, Tiejun Huang, Lu Sheng, Shanghang Zhang

机构 * School of Software, Beihang University(北京航空航天大学软件学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 RoboRefer通过整合深度编码器和强化微调方法,实现了视觉语言模型在机器人中的空间指称推理,提升了复杂场景下的交互能力。

Comments Accepted by NeurIPS 2025. Project page: https://zhoues.github.io/RoboRefer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00617 2026-01-05 cs.CV cs.AI

Noise-Robust Tiny Object Localization with Flows

具有流的抗噪声微小目标定位

Huixin Sun, Linlin Yang, Ronyu Chen, Kerui Gu, Baochang Zhang, Angela Yao, Xianbin Cao

机构 * Beihang University(北京航空航天大学) Communication University of China(中国传媒大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出TOLF框架,利用归一化流和不确定性引导优化,提升微小目标定位的抗噪声能力,并在AI-TOD数据集上提升AP 1.2%。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00481 2026-01-05 cs.NI cs.AI

MAESTRO: Multi-Agent Evaluation Suite for Testing, Reliability, and Observability

MAESTRO:多智能体评估套件用于测试、可靠性与可观测性

Tie Ma, Yixi Chen, Vaastav Anand, Alessandro Cornacchia, Amândio R. Faustino, Guanheng Liu, Shan Zhang, Hongbin Luo, Suhaib A. Fahmy, Zafar A. Qazi, Marco Canini

机构 * Beihang University(北航大学)

AI总结 MAESTRO通过统一接口评估多智能体系统的测试、可靠性和可观测性,揭示架构对资源配置和性能权衡的核心影响。

详情

展开后加载摘要…

URL PDF HTML 收藏