arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

2026-04-14 至 2026-04-14 共收录 9
2604.11751 2026-04-14 cs.RO cs.AI

Grounded World Model for Semantically Generalizable Planning

基于语义泛化的世界模型用于规划

Quanyi Li, Lan Feng, Haonan Zhang, Wuyang Li, Letian Wang, Alexandre Alahi, Harold Soh

机构 * Independent(独立) EPFL(瑞士联邦理工学院洛桑) Beihang University(北京航空航天大学) University of Toronto(多伦多大学) NUS(新加坡国立大学)

AI总结 本文提出基于视觉-语言对齐潜在空间的世界模型,用于改进视觉-运动模型控制,实现更广泛的语义泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11611 2026-04-14 cs.CL cs.LG

Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation

利用和校准通过互信息自我评估的 hindsight 过程奖励

Jiashu Yao, Heyan Huang, Zeming Liu, Yuhang Guo

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学)

AI总结 本文提出MISE方法,通过生成自我评估提供密集奖励信号并校准环境反馈,使基于大语言模型的智能体能自主学习,理论证明其等价于结合互信息与KL散度的优化目标,实验表明其在无监督条件下优于基线方法。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11411 2026-04-14 cs.CV

Online Reasoning Video Object Segmentation

在线推理视频目标分割

Jinyuan Liu, Yang Wang, Zeyu Zhao, Weixin Li, Song Wang, Ruize Han

机构 * Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced(深圳大学计算机科学与人工智能学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Electrical and Information Engineering, Northeast Petroleum University(东北石油大学电气与信息工程学院)

AI总结 本文研究了在线推理视频目标分割,提出ORVOS框架和ORVOSB基准,通过持续更新分割提示和结构化时间令牌水库,在有限计算下实现长时序推理,解决严格因果性和指称转移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05505 2026-04-14 cs.CL

FlashMem: Distilling Intrinsic Latent Memory via Computation Reuse

FlashMem: 通过计算复用提炼内在潜在记忆

Yubo Hou, Zhisheng Chen, Tao Wan, Zengchang Qin

机构 * School of ASEE, Beihang University(北京航空航天大学ASEE学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) School of BME, Beijing Advanced Innovation Center for BME, Beihang University(北京航空航天大学生物医学工程学院/北京生物医学工程高精尖创新中心) CAIR and CECS, VinUniversity(VinUniversity计算与人工智能研究中心/计算机工程与计算机科学系)

AI总结 FlashMem通过计算复用直接从临时推理状态提炼内在记忆,消除冗余重参数化,提升推理效率和持久认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19172 2026-04-14 cs.CV

MetroGS: Efficient and Stable Reconstruction of Geometrically Accurate High-Fidelity Large-Scale Scenes

MetroGS: 高精度大规模场景高效稳定重建

Kehua Chen, Tianlu Mao, Xinzhu Ma, Hao Jiang, Zehao Li, Zihan Liu, Shuqin Gao, Honglong Zhao, Feng Dai, Yucheng Zhang, Zhaoqi Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beihang University(北京航空航天大学)

AI总结 本文提出MetroGS框架,通过分布式2D高斯点扩散表示和结构密集增强方案,结合单目与多视图优化策略,实现复杂城市环境中的高效高精度场景重建。

Comments Accepted by CVPR26; Project page: https://m3phist0.github.io/MetroGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10940 2026-04-14 cs.CV

AmodalSVG: Amodal Image Vectorization via Semantic Layer Peeling

AmodalSVG:基于语义层剥离的模态图像向量化

Juncheng Hu, Ziteng Xue, Guotao Liang, Anran Qi, Buyu Li, Sheng Wang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Igarashi Lab, The University of Tokyo(东京大学五十岚实验室) Bambu Lab Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

AI总结 AmodalSVG通过语义层剥离技术,实现对自然图像中遮挡区域的完整几何向量化,提升SVG的结构编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10923 2026-04-14 cs.CL cs.AI

Mem$^2$Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation

Mem$^2$Evolve:通过共进化能力扩展与经验蒸馏实现自进化智能体

Zihao Cheng, Zeming Liu, Yingyu Shan, Xinyi Wang, Xiangrong Zhu, Yunpu Ma, Hongru Wang, Yuhang Guo, Wei Lin, Yunhong Wang

机构 * Beihang University(北京航空航天大学) Beijing Institute of Technology(北京理工大学) Independent Researcher(独立研究者) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Edinburgh(爱丁堡大学)

AI总结 本文提出Mem$^2$Evolve框架,通过共进化能力扩展与经验蒸馏实现自进化智能体,实验显示其在多个任务和基准上的性能显著优于传统方法。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02756 2026-04-14 cs.LG

STDDN: A Physics-Guided Deep Learning Framework for Crowd Simulation

STDDN:一种基于物理的深度学习框架用于人群模拟

Zijin Liu, Xu Geng, Wenshuai Xu, Xiang Zhao, Yan Xia, You Song

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Beijing Digital Native Digital City Research Center(北京数字原生数字城市研究中心)

AI总结 本文提出STDDN框架,通过引入流体动力学的连续方程,结合神经普通微分方程和动态图学习模块,改进人群模拟的物理约束与效率,实现更稳定和高效的模拟性能。

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17022 2026-04-14 cs.CV cs.AI cs.CL cs.LG cs.MM

GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning

GoT-R1:通过强化学习提升MLLM的视觉生成推理能力

Chengqi Duan, Rongyao Fang, Yuqing Wang, Kun Wang, Linjiang Huang, Xingyu Zeng, Hongsheng Li, Xihui Liu

机构 * HKU MMLAB(香港大学多媒体实验室) CUHK MMLAB(香港中文大学多媒体实验室) Sensetime(商汤科技) Beihang University(北京航空航天大学) SUAT(上海人工智能实验室)

AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。

Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏