arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

共收录 1226
2512.24212 2026-04-02 cs.RO cs.CV

RANGER: A Monocular Zero-Shot Semantic Navigation Framework through Visual Contextual Adaptation

RANGER:通过视觉上下文适应的单目零样本语义导航框架

Ming-Ming Yu, Yi Chen, Börje F. Karlsson, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

AI总结 RANGER通过视觉上下文学习实现零样本语义导航,无需依赖深度和姿态信息,利用3D基础模型和视觉语言模型提升任务效率与环境适应性。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17312 2026-04-02 cs.CV

CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning

CodeDance: 一种动态集成工具的多模态大语言模型用于可执行视觉推理

Qi Song, Honglin Li, Yingchen Yu, Haoyi Zhou, Lin Yang, Song Bai, Qi She, Zilong Huang, Yunqing Zhao

机构 * Beihang University(北京航空航天大学) Westlake University(西湖大学) ByteDance Singapore(字节跳动新加坡) ByteDance China(字节跳动中国)

AI总结 CodeDance通过可执行代码实现视觉推理,结合多工具协作与自检机制,提升复杂任务的灵活性和可解释性,实验显示其在多个基准测试中优于现有方法。

Comments CVPR 2026. Project page: https://codedance-vl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14222 2026-04-02 cs.SD cs.GR cs.MM eess.AS

MATHDance: Mamba-Transformer Architecture with Uniform Tokenization for High-Quality 3D Dance Generation

MATHDance:具有统一标记化的Mamba-Transformer架构用于高质量3D舞蹈生成

Kaixing Yang, Xulong Tang, Ziqiao Peng, Yuxuan Hu, Xiangyue Zhang, Puwei Wang, Hongyan Liu, Jun He, Zhaoxin Fan

机构 * Renmin University of China(中国人民大学) Wuhan University(武汉大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

AI总结 本文提出MATHDance框架,通过两阶段设计提升音乐到舞蹈生成的一致性,采用Kinematic-Dynamic量化阶段和混合架构生成高质量3D舞蹈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00060 2026-04-02 stat.ML cs.IT cs.LG math.IT

Scaled Gradient Descent for Ill-Conditioned Low-Rank Matrix Recovery with Optimal Sampling Complexity

缩放梯度下降用于具有最优采样复杂度的病态低秩矩阵恢复

Zhenxuan Li, Meng Huang

机构 * School of Mathematical Sciences, Beihang University(北京航空航天大学数学科学学院)

AI总结 本文提出缩放梯度下降算法,实现低秩矩阵恢复问题中最优采样复杂度与改进的迭代复杂度,适用于一般低秩矩阵恢复问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00005 2026-04-02 cs.AI cs.CL

How Emotion Shapes the Behavior of LLMs and Agents: A Mechanistic Study

情绪如何塑造大语言模型和代理的行为:一种机制性研究

Moran Sun, Tianlin Li, Yuwei Zheng, Zhenhong Zhou, Aishan Liu, Xianglong Liu, Yang Liu

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出E-STEER框架,通过在隐藏状态中嵌入情绪作为可控变量,研究情绪对推理、生成、安全性和多步代理行为的影响,揭示情绪与行为之间的非单调关系。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29655 2026-04-01 cs.CV

Not All Frames Are Equal: Complexity-Aware Masked Motion Generation via Motion Spectral Descriptors

并非所有帧都平等:通过运动频谱描述符实现的复杂度感知遮蔽运动生成

Pengfei Zhou, Xiangyue Zhang, Xukun Shen, Yong Hu

机构 * Beihang University(北京航空航天大学) Wuhan University(武汉大学)

AI总结 本文提出运动频谱描述符(MSD)以提升遮蔽运动生成的复杂度感知能力,通过动态复杂度指导遮蔽、自注意力和采样,提升复杂运动生成质量及FID指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16790 2026-04-01 cs.SE cs.AI

InCoder-32B: Code Foundation Model for Industrial Scenarios

InCoder-32B:面向工业场景的代码基础模型

Jian Yang, Wei Zhang, Jiajun Wu, Junhang Cheng, Shawn Guo, Haowen Wang, Weicheng Gu, Yaxin Du, Joseph Li, Fanglin Xu, Yizhi Li, Lin Jing, Yuanbo Wang, Yuhan Gao, Ruihao Gong, Chuan Hao, Ran Tao, Aishan Liu, Tuney Zheng, Ganqu Cui, Zhoujun Li, Mingjie Tang, Chenghua Lin, Wayne Xin Zhao, Xianglong Liu, Ming Zhou, Bryan Dai, Weifeng Lv

机构 * Beihang University(北京航空航天大学) IQuest Research Shanghai Jiao Tong University(上海交通大学) ELLIS University of Manchester(曼彻斯特大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Langboat(朗博特)

AI总结 本文提出InCoder-32B,首个统一芯片设计、GPU内核优化等工业领域的32B参数代码基础模型,通过高效架构和多阶段训练方法,在通用和工业任务中均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19722 2026-04-01 cs.LG cs.AI

FedRG: Unleashing the Representation Geometry for Federated Learning with Noisy Clients

FedRG: 释放表示几何以在噪声客户端中进行联邦学习

Tian Wen, Zhiqin Yang, Yonggang Zhang, Xuefeng Jiang, Hao Peng, Yuwei Wang, Bo Han

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) TMLR Group, Hong Kong Baptist University(香港浸会大学TMLR组) Beihang University(北京航空航天大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出FedRG方法,通过表示几何优先原则识别噪声标签,结合自监督学习和球面vMF混合模型,提升联邦学习在异构场景下的鲁棒性与性能。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12766 2026-04-01 cs.CV

Catalyst4D: High-Fidelity 3D-to-4D Scene Editing via Dynamic Propagation

Catalyst4D: 通过动态传播实现高保真的3D到4D场景编辑

Shifeng Chen, Yihui Li, Jun Liao, Hongyu Yang, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhejiang Industrial Big Data and Robot Intelligent System Key Laboratory, Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院浙江省工业大数据与机器人智能系统重点实验室)

AI总结 本文提出Catalyst4D框架,通过动态传播实现高保真的4D场景编辑,保持时空一致性,优于现有方法。

Comments https://junliao2025.github.io/Catalyst4D-ProjectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11404 2026-03-31 cs.RO

ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models

ACoT-VLA:面向视觉-语言-动作模型的行动链式推理

Linqing Zhong, Yi Liu, Yifei Wei, Ziyu Xiong, Maoqing Yao, Si Liu, Guanghui Ren

机构 * Beihang University(北京航空航天大学) AgiBot

AI总结 本文提出ACoT-VLA,通过在动作空间中直接进行推理,改进视觉-语言-动作模型的行动生成,引入显式和隐式动作推理器,实验证明其在真实和仿真环境中的优越性。

Comments Accepted by Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19582 2026-03-31 cs.CV

ScenePilot-4K: A Large-Scale First-Person Dataset and Benchmark for Vision-Language Models in Autonomous Driving

ScenePilot-4K:一个大规模第一视角数据集和基准,用于自动驾驶中视觉-语言模型的安全感知学习与评估

Yujin Wang, Yutong Zheng, Wenxian Fan, Tianyi Wang, Hongqing Chu, Li Zhang, Bingzhao Gao, Daxin Tian, Jianqiang Wang, Hong Chen

机构 * Tongji University(同济大学) UT Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 本文提出ScenePilot-4K数据集,包含3847小时视频和27.7亿帧图像,用于评估视觉-语言模型在自动驾驶中的场景理解、空间感知、运动规划和语义对齐能力,揭示模型在几何感知和规划推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15090 2026-03-31 cs.DB cs.AI cs.CV

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

SciEGQA:一个用于科学证据基础问题回答与推理的数据集

Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The University of Hong Kong(香港大学) Baidu Inc.(百度公司)

AI总结 SciEGQA数据集通过精细标注和大规模自动构建,提升视觉语言模型在科学文档中的证据定位与推理能力。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21262 2026-03-31 cs.CV

vGamba: Attentive State Space Bottleneck for efficient Long-range Dependencies in Visual Recognition

vGamba:用于视觉识别中高效长程依赖的注意力状态空间瓶颈

Yunusa Haruna, Adamu Lawan, Shamsuddeen Hassan Muhammad, Jiaquan Zhang, Chaoning Zhang

机构 * NewraLab Beihang University(北京航空航天大学) Beijing GoerTek Alpha Labs(北京歌尔泰克阿尔法实验室) Imperial College London(伦敦帝国学院) University of Electronic Science and Technology of China(电子科技大学)

AI总结 vGamba通过引入轻量级状态空间模块替代传统瓶颈卷积,有效建模长程依赖,实现更高的计算和内存效率,适用于高分辨率视觉任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07603 2026-03-31 cs.CV

iiANET: Inception Inspired Attention Hybrid Network for efficient Long-Range Dependency

iiANET:受启发于 inception 的注意力混合网络用于高效长距离依赖

Haruna Yunusa, Adamu Lawan, Abdulganiyu Abdu Yusuf

机构 * NewraLab Beihang University(北京航空航天大学) Beijing GoerTek Alpha Labs(北京歌尔泰克阿尔法实验室) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出 iiANET,一种高效的混合视觉骨干网络,通过 iiABlock 模块结合改进的全局 r-MHSA 和卷积层,有效捕捉长距离依赖,提升复杂视觉识别任务的性能。

Comments 17 pages, 7 figures. Published in Transactions on Machine Learning Research (TMLR). Available at https://openreview.net/pdf?id=HGSjlgFodQ

Journal ref Transactions on Machine Learning Research (12/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27527 2026-03-31 cs.LG

Visualization of Machine Learning Models through Their Spatial and Temporal Listeners

通过空间和时间监听器可视化机器学习模型

Siyu Wu, Lei Shi, Lei Xia, Cenyang Wu, Zipeng Liu, Yingchaojie Feng, Liang Zhou, Wei Chen

机构 * School of Computer Science & Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Institute of Medical Technology, Peking University Health Science Center and National Institute of Health Data Science, Peking University(北京大学医学部医学技术研究院与北京大学健康数据科学国家研究所) School of Software, Beihang University(北京航空航天大学软件学院) National University of Singapore(新加坡国立大学) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文提出一种以模型为中心的两阶段框架,通过抽象监听器捕捉模型的空间和时间行为,并将其连接到经典信息可视化流程,分析显示可视化模型结果、定量/名义数据类型和统计图表是主要关注点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27179 2026-03-31 cs.CV

Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervision

基于推理的异常检测与定位:图像级监督

Yizhou Jin, Yuezhu Feng, Jinjin Zhang, Peng Wang, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

AI总结 本文提出基于图像级监督的异常检测与定位方法,利用大语言模型的推理能力实现像素级定位,无需额外组件或标注。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27112 2026-03-31 cs.CV

RailVQA: A Benchmark and Framework for Efficient Interpretable Visual Cognition in Automatic Train Operation

RailVQA: 一个用于自动列车操作中高效可解释视觉认知的基准和框架

Sen Zhang, Runmei Li, Zhichao Zheng, Yuhe Zhang, Jiani Li, Kailun Zhang, Tao Zhang, Wenjun Wu, Qunbo Wang

机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

AI总结 本文提出RailVQA-bench和RailVQA-CoM,旨在解决ATO中视觉感知与决策推理的高效可解释性问题,通过基准测试和框架提升认知泛化能力与跨领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20451 2026-03-31 cs.CL

MuVaC: A Variational Causal Framework for Multimodal Sarcasm Understanding in Dialogues

MuVaC:一种用于对话中多模态讽刺理解的变分因果框架

Diandian Guo, Fangfang Yuan, Cong Cao, Xixun Lin, Chuan Zhou, Hao Peng, Yanan Cao, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Beihang University(北京航空航天大学)

AI总结 本文提出MuVaC框架,通过变分因果推理实现多模态讽刺检测与解释的联合优化,提升对话中讽刺理解的鲁棒性。

Comments 12 pages, 7 figures. Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18600 2026-03-31 cs.CV

NeAR: Coupled Neural Asset-Renderer Stack

NeAR:耦合神经资产-渲染堆栈

Hong Li, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Ziyang Yan, Lixing Xiao, Zhaoxi Chen, Jianfeng Xiang, Shaocong Xu, Xuhui Liu, Yikai Wang, Baochang Zhang, Xiaoguang Han, Jiaolong Yang, Hao Zhao

机构 * BUAA(北京航空航天大学) BAAI(北京智源人工智能研究院) FNii, CUHKSZ(香港中文大学(深圳)未来网络创新研究院) HKUST(香港科技大学) NJU(南京大学) UniTn(特伦托大学) ZJU(浙江大学) NTU(南洋理工大学) THU(清华大学) BNU(北京师范大学) SSE, CUHKSZ(香港中文大学(深圳)理工学院) AIR, THU(清华大学智能产业研究院)

AI总结 NeAR通过耦合资产表示与渲染器设计,提升生成质量和一致性。引入Lighting-Homogenized SLAT和光照感知解码器,实现实时可重照明的3D高斯溅射生成,优于现有方法。

Comments Accepted by CVPR 2026. The project page: https://near-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26610 2026-03-30 cs.CV cs.AI

Think over Trajectories: Leveraging Video Generation to Reconstruct GPS Trajectories from Cellular Signaling

轨迹思考:利用视频生成从蜂窝信号中重建GPS轨迹

Ruixing Zhang, Hanzhang Jiang, Leilei Sun, Liangzhe Han, Jibin Wang, Weifeng Lv

机构 * The State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂与关键软件环境国家重点实验室) H3I, Beihang University(北京航空航天大学H3I) China Mobile Information Technology Center(中国移动信息技术中心)

AI总结 本文提出Sig2GPS方法,通过视频生成技术从蜂窝信号中重建高精度GPS轨迹,利用地图视觉域直接生成连续路径,提升轨迹数据挖掘的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26328 2026-03-30 cs.CV

Verify Claimed Text-to-Image Models via Boundary-Aware Prompt Optimization

通过边界感知提示优化验证声称的文本到图像模型

Zidong Zhao, Yihao Huang, Qing Guo, Tianlin Li, Anran Li, Kailong Wang, Jin Song Dong, Geguang Pu

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Nankai University(南开大学) Beihang University(北京航空航天大学) University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出边界感知提示优化方法,通过识别模型特定的边界相邻提示来验证文本到图像模型的真实性,实验显示其验证准确率优越。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24989 2026-03-30 cs.RO cs.AI

Learning Rollout from Sampling:An R1-Style Tokenized Traffic Simulation Model

从采样中学习:一种R1风格的分词交通仿真模型

Ziyan Wang, Peng Chen, Ding Li, Chiwei Li, Qichao Zhang, Zhongpu Xia, Guizhen Yu

机构 * State Key Laboratory of Intelligent Transportation System, Key Laboratory of Autonomous Transportation Technology for Special Vehicles, Ministry of Industry and Information Technology, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院,智能交通系统国家重点实验室,特种车辆自主运输技术重点实验室(工业和信息化部)) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所,多模态人工智能系统国家重点实验室)

AI总结 本文提出R1Sim模型,通过分词交通仿真结合熵引导采样和GRPO优化,实现探索与利用的平衡,生成真实安全的多智能体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21077 2026-03-30 cs.CV

CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models

CoVFT:面向多模态大语言模型的上下文感知视觉微调

Nan Zhou, Huiqun Wang, Yaoyan Zheng, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 本文提出CoVFT框架,通过整合上下文向量提取和上下文混合专家模块,解决多模态任务中视觉微调的不稳定性问题,实现更稳定的视觉更新。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15159 2026-03-30 cs.SE cs.AI cs.CL

To See is Not to Master: Teaching LLMs to Use Private Libraries for Code Generation

看清并非掌握:教LLM使用私有库进行代码生成

Yitong Zhang, Chengze Li, Ruize Chen, Guowei Yang, Xiaoran Jia, Yijie Ren, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Proxseer Inc.(Proxseer公司) School of Computer Science, Nanjing University(南京大学计算机科学与技术学院) Software Institute, Nanjing University(南京大学软件学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 本文提出PriCoder方法,通过自动生成数据教LLM有效调用私有库API,提升私有库代码生成能力,实验显示在多种设置下pass@1指标提升超20%。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16928 2026-03-30 cs.CV

Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features

重新思考基于扩散模型的视频超分辨率:利用对齐特征的密集引导

Jingyi Xu, Meisong Zheng, Ying Chen, Minglang Qiao, Xin Deng, Mai Xu

机构 * Beihang University(北京航空航天大学) State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室)

AI总结 本文提出DGAF-VSR方法,通过优化对齐和补偿机制提升视频超分辨率的感知质量、保真度和时间一致性。

Comments Accepted by CVPR 2026,20pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25170 2026-03-27 cs.CV cs.AI

Knowledge-Guided Adversarial Training for Infrared Object Detection via Thermal Radiation Modeling

基于热辐射建模的知识引导对抗训练用于红外目标检测

Shiji Zhao, Shukun Xiong, Maoxun Yuan, Yao Huang, Ranjie Duan, Qing Guo, Jiansheng Chen, Haibin Duan, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Security Department, Alibaba Group(阿里巴巴集团安全部) School of Computer Science, Nankai University(南开大学计算机学院) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)

AI总结 本文提出KGAT方法,利用红外物理知识提升目标检测的鲁棒性,通过热辐射关系建模优化对抗训练,实验表明在三个数据集上提升了准确性和抗攻击能力。

Comments Accepted for publication in the International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02787 2026-03-27 cs.RO cs.CV

Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols

通过视觉符号诊断、纠正并学习操纵失败

Xianchao Zeng, Xinyu Zhou, Youcheng Li, Jiayou Shi, Tianle Li, Liangming Chen, Lei Ren, Yong-Lu Li

机构 * Beihang University(北京航空航天大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ViFailback框架,通过视觉符号提升标注效率,并释放大规模数据集和基准测试,验证了框架在故障诊断和纠正中的有效性。

Comments Accepted by CVPR 2026. Project Website: https://x1nyuzhou.github.io/vifailback.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25083 2026-03-27 cs.CV cs.AI

Learning domain-invariant features through channel-level sparsification for Out-Of Distribution Generalization

通过通道级稀疏化学习领域不变特征以实现分布外泛化

Haoran Pei, Yuguang Yang, Kexin Liu, Juan Zhang, Baochang Zhang

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院)

AI总结 本文提出Hierarchical Causal Dropout方法,通过通道级因果掩码实现特征稀疏化,以分离因果特征与虚假特征,提升分布外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10700 2026-03-27 cs.CL cs.AI

LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution Shifts

大语言模型知其弱点:通过自然分布偏移揭示安全漏洞

Qibing Ren, Hao Li, Dongrui Liu, Zhanxu Xie, Xiaoya Lu, Yu Qiao, Lei Sha, Junchi Yan, Lizhuang Ma, Jing Shao

机构 * MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(人工智能大模型关键实验室,上海交通大学) Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文研究大语言模型对自然分布偏移的脆弱性,提出ActorBreaker攻击方法,通过识别有毒提示相关角色构建多轮提示,揭示模型安全漏洞,并构建安全数据集提升鲁棒性。

Comments ACL 2025 main conference. Code is available at https://github.com/AI45Lab/ActorAttack

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24393 2026-03-26 cs.RO

3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models

3D-Mix用于VLA:一种用于将基于VGGT的3D信息整合到视觉-语言-动作模型中的即插即用模块

Bin Yu, Shijie Lian, Xiaopeng Lin, Zhaolong Shen, Yuliang Wei, Haishan Liu, Changti Wu, Hang Yuan, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团自动化研究院) ZGCI(中钢集团信息研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) DeepCybo

AI总结 本文提出3D-Mix模块,通过语义条件门控融合机制提升视觉-语言-动作模型的3D感知能力,在标准化基准测试中实现最佳性能。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏