arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-04-15 至 2026-04-15 共收录 13
2604.12630 2026-04-15 cs.CV cs.CL

GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning

GeoAlign:用于MLLM空间推理的几何特征重定位

Zhaochen Liu, Limeng Qiao, Guanglu Wan, Tingting Jiang

机构 * National Engineering Research Center of Visual Technology, National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(视觉技术国家工程研究中心、多媒体信息处理国家重点实验室、计算机学院、北京大学) Meituan Inc.(美团公司) National Biomedical Imaging Center, Peking University(生物医学成像国家中心、北京大学)

AI总结 本文提出GeoAlign框架,通过动态聚合多层几何特征以解决MLLM在空间推理中的任务对齐偏差问题,实验表明其紧凑模型在多个基准测试中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12626 2026-04-15 cs.RO cs.CV

Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting

Habitat-GS:一种高保真导航仿真器与动态高斯点云

Ziyuan Xia, Jingyi Xu, Chong Cui, Yuanhong Yu, Jiazhao Zhang, Qingsong Yan, Tao Ni, Junbo Chen, Xiaowei Zhou, Hujun Bao, Ruizhen Hu, Sida Peng

机构 * Zhejiang University(浙江大学) Peking University(北京大学) XGRIDS UDeer AI Shenzhen University(深圳大学)

AI总结 本文提出Habitat-GS,通过整合3D高斯点云渲染和可驾驶高斯化身,提升导航仿真的视觉真实性和动态人类建模能力,实验表明其在跨领域泛化和人类感知导航中表现优异。

Comments Project page: https://zju3dv.github.io/habitat-gs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12565 2026-04-15 cs.RO cs.CV

Scalable Trajectory Generation for Whole-Body Mobile Manipulation

可扩展的全身体态移动操作轨迹生成

Yida Niu, Xinhai Chang, Xin Liu, Ziyuan Jiao, Yixin Zhu

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) Institute of Unmanned System, Beihang University(无人系统研究院,北航) School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室,北京大学) Yuanpei College, Peking University(元培学院,北京大学) Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence(具身智能实验室,PKU-武汉人工智能研究所)

AI总结 本文提出AutoMoMa框架,通过GPU加速整合运动学模型与并行轨迹优化,生成大规模物理有效轨迹数据,解决全身体态移动操作中规模、多样性和运动学精度的瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00655 2026-04-15 cs.CV

Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding

Mema:增强视觉-语言理解的内存增强适配器

Ying Liu, Yudong Han, Kean Shi, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Yangtze Delta Region Academy of Beijing Institude of Technology(北京理工大学长江三角洲地区研究院)

AI总结 本文提出Mema适配器,通过维护状态记忆积累层次视觉表示,提升多模态理解性能,实验验证其在复杂任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06794 2026-04-15 cs.AI

No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning

不再有陈旧的反馈:为开放世界智能体学习的共进化批评者

Zhicong Li, Lingjie Jiang, Yulan Hu, Xingchen Zeng, Yixia Li, Xiangwen Zhang, Guanhua Chen, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 赛洛岭人工智能学院) Amap, Alibaba Group(阿里巴巴集团 阿里地图) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出ECHO框架,通过同步共进化循环联合优化策略和批评者,解决开放世界环境中策略演变导致的反馈过时问题,提升长周期任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04282 2026-04-15 cs.AI

Synthetic POMDPs to Challenge Memory-Augmented RL: Memory Demand Structure Modeling

合成POMDPs挑战记忆增强型RL:内存需求结构建模

Yongyi Wang, Lingfeng Li, Bozhou Chen, Ang Li, Hanyu Liu, Qirui Zheng, Xionghui Yang, Wenxin Li

机构 * School of Computer Science, Peking University, Beijing 100871, China(北京大学计算机学院,北京100871,中国)

AI总结 本文提出定制化的POMDP环境设计,通过理论框架、线性动力学和奖励再分配方法,构建具有预定义内存需求结构的环境,以评估记忆增强型RL的挑战与性能。

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-026-52148-y}

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04227 2026-04-15 cs.CR cs.AI

Mobile GUI Agents under Real-world Threats: Are We There Yet?

移动GUI代理在现实威胁下的表现:我们已经到达了吗?

Guohong Liu, Jialei Ye, Jiacheng Liu, Yuanchun Li, Wei Liu, Pengzhi Gao, Jian Luan, Yunxin Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) University of Electronic Science and Technology of China(电子科学与技术大学) Peking University(北京大学) MiLM Plus, Xiaomi Inc.(MiLM Plus,小米公司)

AI总结 研究探讨了移动GUI代理在现实威胁下的性能问题,提出了一种可扩展的应用内容仪器化框架,通过动态任务环境和静态数据集验证代理在第三方内容干扰下的表现,发现代理性能显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17384 2026-04-15 cs.LG cs.CV stat.ML

Variational Autoencoding Discrete Diffusion with Enhanced Dimensional Correlations Modeling

变分自编码离散扩散与增强的维度相关性建模

Tianyu Xie, Shuchen Xue, Zijin Feng, Tianyang Hu, Jiacheng Sun, Zhenguo Li, Cheng Zhang

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Center for Statistical Science, Peking University(北京大学统计科学中心) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Huawei Foundation Model Dept(华为基金会模型部门) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出VADD框架,通过潜在变量建模增强离散扩散,提升样本质量,尤其在少量去噪步骤时表现优异。

Comments ICLR 2026 Poster; 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12537 2026-04-15 cs.CV cs.AI

MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models

MODIX:一种无需训练的多模态信息驱动的位置索引缩放

Ruoxiang Huang, Zhen Yuan

机构 * Peking University(北京大学)

AI总结 MODIX通过动态调整位置步长,基于模态特定贡献优化多模态模型的位置编码,提升多模态推理能力。

Comments Accepted by CVPR 2026 (Highlight). 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12506 2026-04-15 cs.CL cs.SD

Beyond Transcription: Unified Audio Schema for Perception-Aware AudioLLMs

超越转录:面向感知意识的统一音频架构

Linhao Zhang, Yuhan Song, Aiwei Liu, Chuhan Wu, Sijun Zhang, Wei Jia, Yuan Liu, Houfeng Wang, Xiao Zhou

机构 * Basic Model Technology Center, WeChat AI, Tencent Inc.(腾讯基本模型技术中心、微信AI、腾讯公司) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室、计算机学院、北京大学)

AI总结 本文提出统一音频架构(UAS),通过将音频信息划分为转录、语调和非语言事件三个组件,提升音频细粒度感知性能,同时保持推理能力。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12322 2026-04-15 cs.CV

Self-Adversarial One Step Generation via Condition Shifting

通过条件位移实现自对抗一步生成

Deyuan Liu, Peng Sun, Yansen Han, Zhenglin Cheng, Chuyan Chen, Tao Lin

机构 * Westlake University(西拉丘学院) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学)

AI总结 本文提出APEX框架,通过条件位移内生提取对抗信号,实现无需外部判别器的一步生成,提升生成质量与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07285 2026-04-15 cs.LG cs.AI

GTCN-G: A Residual Graph-Temporal Fusion Network for Imbalanced Intrusion Detection

GTCN-G:一种用于不平衡入侵检测的残差图-时间融合网络

Tianxiang Xu, Zhichao Wen, Xinyu Zhao, Qi Hu, Yan Li, Chang Liu

机构 * Peking University(北京大学) RWTH Aachen University(亚琛工业大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Northeastern University(东北大学) Thales Group(泰雷兹集团) Chinese Medical Information and Big Data Association(中国医学信息与大数据协会)

AI总结 本文提出GTCN-G模型,结合图卷积网络和门控时间卷积网络,通过残差学习机制解决数据不平衡问题,实验表明在二分类和多分类任务中性能优越。

Comments This preprint was submitted to IEEE TrustCom 2025. The accepted version will be published under copyright 2025 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22220 2026-04-15 cs.CL cs.SD

StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs

StableToken:一种抗噪声的语义语音分词器用于鲁棒的语音大语言模型

Yuhan Song, Linhao Zhang, Chuhan Wu, Aiwei Liu, Wei Jia, Houfeng Wang, Xiao Zhou

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Basic Model Technology Center, WeChat AI, Tencent Inc.(微信AI基础模型技术中心,腾讯公司)

AI总结 本文提出StableToken,通过共识机制提升语音分词器的稳定性,减少噪声下的单位编辑距离,提升语音大语言模型的鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏