arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

2026-05-11 至 2026-05-11 共收录 9
2605.07915 2026-05-11 cs.CV

What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion

潜在扩散 manifold 中什么因素重要?面向潜在扩散的先验对齐自编码器

Zhengrong Yue, Taihang Hu, Mengting Chen, Haiyu Zhang, Zihao Pan, Tao Liu, Zikang Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Yali Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Beihang University(北航) Sun Yat-sen University(中山大学) Nankai University(南开大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文研究潜在 manifold 组织对扩散模型生成质量的影响,提出 PAE 显式构建潜在 manifold,提升训练效率和生成质量,达到新状态的 gFID 1.03。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07877 2026-05-11 cs.RO

Melding LLM and temporal logic for reliable human-swarm collaboration in complex scenarios

将大语言模型与时序逻辑融合以实现复杂场景中可靠的人-群智协作

Junfeng Chen, Yuxiao Zhu, An Zhuo, Xintong Zhang, Shuo Zhang, Guanghui Wen, Xiwang Dong, Meng Guo, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然与应用科学学院) School of Automaton, Southeast University(东南大学自动化学院) School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院)

AI总结 本文提出一种神经符号框架,结合时序逻辑与大语言模型,实现长周期人-群智协作,通过形式化任务规划与上下文感知推理,提升动态环境中任务规划的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02357 2026-05-11 cs.CV

Channel-Level Relation to Attentive Aggregation with Neighborhood-Homogeneity Constraint for Point Cloud Analysis

通道级关系与具有邻域同质性约束的注意聚合在点云分析中的应用

Jiaqi Shi, Jin Xiao, Xiaoguang Hu, Wenxuan Ji, Zichong Jia, Zifan Long, Tianyou Chen, Baochang Zhang

机构 * 1School of Automation Science Electrical Engineering, Beihang University, Beijing, China 2Wuhan Leaddo Measuring \& Control Technology, Wuhan, China 3School of Artificial Intelligence, Beihang University, Beijing, China Emails

AI总结 本文提出PointCRA网络,通过引入时间趋势变化作为新评估维度,解决现有空间和通道注意机制中权重维度坍缩导致的信息丢失问题,提升点云分析的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06747 2026-05-11 cs.CV

ReCLIP++: Learn to Rectify the Bias of CLIP for Unsupervised Semantic Segmentation

ReCLIP++: 学习校正CLIP的偏差以实现无监督语义分割

Jingyun Wang, Guoliang Kang

机构 * Beihang University(北航大学)

AI总结 本文提出ReCLIP++,通过显式建模和校正CLIP中的偏差以提升无监督语义分割性能,设计了参考提示和位置嵌入投影来分别编码类别偏好和空间偏好偏差,并通过矩阵乘法生成偏差logit图,再通过元素级减法校正logits,最后利用Gumbel-Softmax操作生成分割掩码。

Comments Extended version of our CVPR 24 paper, accepted by IJCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06679 2026-05-11 cs.LG

Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding

打破幻觉:当积极与消极在多模态解码中相遇

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics, Beihang University(北京航空航天大学航天学院) Longcat Interaction Team, Meituan(美团Longcat交互团队) Tianmushan Laboratory, Beihang University(北京航空航天大学天门山实验室)

AI总结 本文提出PND框架,通过在解码过程中引入正负对比路径,增强视觉真实性,无需重新训练即可在POPE、MME和CHAIR数据集上取得最佳性能。

Comments Accepted by CVPR 2026 (Conference on Computer Vision and Pattern Recognition). 11 pages, 5 figures. Code available at: https://github.com/JiangYubo4399/PND

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18636 2026-05-11 cs.CV

Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering

注意力稀疏性是输入稳定的:通过离线稀疏性分析和在线QK共聚类实现训练自由的视频生成稀疏注意力

Jiayi Luo, Jiayu Chen, Jiankun Wang, Cong Wang, Hanxin Zhu, Qingyun Sun, Chen Gao, Zhibo Chen, Jianxin Li

机构 * SKLCCSE, School of Computer Science and Engineering, Beihang University(软件学院,北京航空航天大学) Beihang University(北京航空航天大学) School of Computer Science, Peking University(北京大学计算机学院) the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) BNRist, Tsinghua University(北京理工大学,清华大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出SVOO框架,通过离线层间稀疏性分析和在线双向共聚类实现训练自由的视频生成稀疏注意力,解决传统方法中层异质性和查询-键耦合问题,提升生成质量与速度的平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18085 2026-05-11 cs.RO cs.AI

Continually Evolving Skill Knowledge in Vision Language Action Model

视觉语言动作模型中的持续演进技能知识

Yuxuan Wu, Guangming Wang, Zhiheng Yang, Tianchen Deng, Maoqing Yao, Brian Sheil, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Cambridge(剑桥大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) MIT SMART(麻省理工学院SMART实验室) AgiBot

AI总结 本文提出Stellar VLA框架,通过无需增加参数的持续模仿学习方法,实现视觉语言动作模型的持续知识积累,实验表明其在任务专精和知识转移方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05276 2026-05-11 cs.LG cs.AI cs.CL

SpikingBrain: Spiking Brain-inspired Large Models

SpikingBrain:基于大脑的高效大模型

Yuqi Pan, Yupeng Feng, Jinghao Zhuang, Siyu Ding, Han Xu, Zehao Liu, Bohan Sun, Yuhong Chou, Xuerui Qiu, Anlin Deng, Anjie Hu, Shurong Wang, Peng Zhou, Man Yao, Jibin Wu, Jian Yang, Guoliang Sun, Bo Xu, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑启发通用智能大模型重点实验室) Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Hong Kong Polytechnic University(香港理工大学) Zhongguancun Academy(中关村学院) Beihang University(北航) Zhejiang University(浙江大学) LuxiTech MetaX Integrated Circuit Co., Ltd(MetaX集成电路有限公司)

AI总结 本文提出SpikingBrain,一种受大脑启发的大模型,通过高效架构和算法优化,在非NVIDIA平台实现大规模LLM训练与推理,提升长上下文处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02382 2026-05-11 eess.IV cs.AI cs.CV

Benchmark of Segmentation Techniques for Pelvic Fracture in CT and X-ray: Summary of the PENGWIN 2024 Challenge

CT和X射线中骨盆骨折分割技术的基准测试:PENGWIN 2024挑战总结

Yudi Sang, Yanzhen Liu, Sutuke Yibulayimu, Yunning Wang, Benjamin D. Killeen, Mingxu Liu, Ping-Cheng Ku, Ole Johannsen, Karol Gotkowski, Maximilian Zenk, Klaus Maier-Hein, Fabian Isensee, Peiyan Yue, Yi Wang, Haidong Yu, Zhaohong Pan, Yutong He, Xiaokun Liang, Daiqi Liu, Fuxin Fan, Artur Jurgas, Andrzej Skalski, Yuxi Ma, Jing Yang, Szymon Płotka, Rafał Litka, Gang Zhu, Yingchun Song, Mathias Unberath, Mehran Armand, Dan Ruan, S. Kevin Zhou, Qiyong Cao, Chunpeng Zhao, Xinbao Wu, Yu Wang

机构 * Beijing Rossum Robot Technology Co., Ltd.(北京罗素机器人科技有限公司) Key Laboratory of Biomechanics and Mechanobiology, Ministry of Education, Beijing Advanced Innovation Center for Biomedical Engineering, School of Biological Science and Medical Engineering, Beihang University(生物力学与机械生物学重点实验室,教育部,北京生物医学创新中心,生物科学与医学工程学院,北航) Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Division of Medical Image Computing, German Cancer Research Center (DKFZ)(医学影像计算部,德国癌症研究中心(DKFZ)) Helmholtz Imaging, Heidelberg(海德堡大学医院影像中心) Smart Medical Imaging, Learning and Engineering (SMILE) Lab, Medical UltraSound Image Computing(智能医学影像、学习与工程(SMILE)实验室,医学超声影像计算)

AI总结 本文通过PENGWIN 2024挑战评估了CT和X射线中骨盆骨折分割技术,发现CT分割准确率较高,但X射线分割仍需进一步改进,揭示了分割方法的多样性及片段定义的不确定性。

Comments PENGWIN 2024 Challenge Report

详情

展开后加载摘要…

URL PDF HTML 收藏