arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-04-28 至 2026-04-28 共收录 17
2604.24575 2026-04-28 cs.CV

Diffusion Model as a Generalist Segmentation Learner

扩散模型作为通用分割学习者

Haoxiao Wang, Antao Xiang, Haiyang Sun, Peilin Sun, Changhao Pan, Yifu Chen, Minjie Hong, Weijie Wang, Shuang Chen, Yue Chen, Zhou Zhao

机构 * Zhejiang University(浙江大学) South China University of Technology(华南理工大学) Nanjing University(南京大学) Peking University(北京大学)

AI总结 本文提出DiGSeg,利用预训练扩散模型实现通用分割框架,通过编码图像和掩码到潜在空间,并结合CLIP对齐的文本路径,实现基于外观和任意文本提示的结构化分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24391 2026-04-28 cs.RO

FreqCache: Accelerating Embodied VLN Models with Adaptive Frequency-Guided Token Caching

FreqCache: 通过自适应频率引导的标记缓存加速具身VLN模型

Zihao Zheng, Xingyue Zhou, Zhihao Mao, Songyu Sun, Lingyue Zhang, Yulong Ao, Yupu Feng, Qiongqiong Zhang, Yonghua Lin, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence, BAAI(北京人工智能研究院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) School of EECS, Peking University(北京大学电子信息技术学院)

AI总结 本文提出FreqCache框架,通过频率域方法优化VLN模型中的标记缓存,解决传统视觉方法在视角迁移、边缘信息和场景时变性上的不足,实验显示其在计算效率上有1.59倍的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20711 2026-04-28 cs.DC cs.LG cs.RO

RoboECC: Multi-Factor-Aware Edge-Cloud Collaborative Deployment for VLA Models

RoboECC: 多因素感知的边缘-云计算协同部署用于VLA模型

Zihao Zheng, Hangyu Cao, Jiayu Chen, Sicheng Tian, Chenyue Li, Maoliang Li, Xinhao Sun, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院) School of Computer Science, South China University of Technology, Guangzhou, China(华南理工大学计算机科学学院) School of Artificial Intelligence, Beijing Normal University, Beijing, China(北京师范大学人工智能学院) School of EECS, Peking University, Beijing, China(北京大学电子工程与科学学院)

AI总结 本文提出RoboECC框架,通过模型-硬件协同分割策略和网络感知部署调整方法,解决VLA模型在边缘-云计算协同部署中的分割点识别和网络波动问题,实验显示其在效率提升与资源消耗之间取得良好平衡。

Comments This paper has been accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17573 2026-04-28 cs.RO cs.DB cs.LG

HeiSD: Hybrid Speculative Decoding for Embodied Vision-Language-Action Models with Kinematic Awareness

HeiSD:具有运动意识的具身视觉-语言-动作模型的混合推测解码

Zihao Zheng, Zhihao Mao, Sicheng Tian, Maoliang Li, Jiayu Chen, Xinhao Sun, Zhaobo Zhang, Xuanzhe Liu, Donggang Cao, Hong Mei, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of EECS, Peking University(北京大学电子工程与科学学院)

AI总结 本文提出HeiSD框架,结合draft-based和retrieval-based推测解码方法,通过验证跳过机制和序列放松接受策略提升效率,并引入基于运动的融合度量确定混合边界,实验证明在仿真和现实场景中均实现2.45倍以上的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01581 2026-04-28 cs.RO cs.LG

KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models

KERV:基于运动学的具身VLA模型的推测解码

Zihao Zheng, Zhihao Mao, Maoliang Li, Jiayu Chen, Xinhao Sun, Zhaobo Zhang, Donggang Cao, Hong Mei, Xiang Chen

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院) School of Computer Science, China University of Geosciences (Wuhan), Wuhan, China(中国地质大学(武汉)计算机科学学院)

AI总结 本文提出KERV框架,结合token域和运动学域预测,通过运动学卡尔曼滤波和动态调整策略提升VLA模型的推理速度,实验显示在多种任务中加速27%-37%且成功率损失极小。

Comments This paper has been accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00084 2026-04-28 cs.LG cs.AI cs.CL

Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs

学习以细化:LLMs中并行推理的自我细化

Qibin Wang, Pu Zhao, Shaohan Huang, Fangkai Yang, Lu Wang, Furu Wei, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Microsoft(微软) Peking University(北京大学)

AI总结 本文提出Generative Self-Refinement方法,通过并行生成候选答案并细化最终答案,提升LLM推理性能,实验显示其在多个数学基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06542 2026-04-28 cs.LG cs.DC cs.MA stat.ML

On the Surprising Effectiveness of a Single Global Merging in Decentralized Learning

在去中心化学习中单一全局融合的惊人效果

Tongtian Zhu, Tianyu Zhang, Mingze Wang, Zhanpeng Zhou, Can Wang

机构 * Zhejiang University(浙江大学) Mila, Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文研究了去中心化学习中通信调度策略,发现集中通信预算在后期阶段可显著提升测试性能,通过单一全局融合实现完全连接,有效提升高数据异质性下的学习性能。

Comments We discover and theoretically explain why and when a single global parameter merging in decentralized learning can recover the performance of federated learning, even in highly heterogeneous and communication-constrained environments

Journal ref ICLR 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23775 2026-04-28 cs.RO

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10708 2026-04-28 cs.SD cs.AI cs.CV cs.MM

Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni: 扩展多模态理解到多功能音频生成与编辑

Zeyue Tian, Binxin Yang, Zhaoyang Liu, Jiexuan Zhang, Ruibin Yuan, Hubery Yin, Qifeng Chen, Chen Li, Jing Lyu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) WeChat Vision, Tencent Inc(微信视觉,腾讯公司) Peking University(北京大学)

AI总结 Audio-Omni提出首个端到端框架,统一音频生成与编辑,结合多模态理解能力,通过冻结的多模态大语言模型与可训练的扩散变换器实现高保真合成,并构建大规模数据集提升音频编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29957 2026-04-28 cs.SE cs.LG

Think Anywhere in Code Generation

在代码生成中任意思考

Xue Jiang, Tianyu Zhang, Ge Li, Mengyang Liu, Taozhi Chen, Zhenhua Xu, Binhua Li, Wenpin Jiao, Zhi Jin, Yongbin Li, Yihong Dong

机构 * School of Computer Science, Peking University(1 计算机科学系,北京大学) Tongyi Lab, Alibaba Group(2 龙洋实验室,阿里巴巴集团)

AI总结 本文提出Think-Anywhere机制,使LLM在代码生成过程中可按需调用推理,通过冷启动训练和基于结果的强化学习奖励,实现适应性推理,提升代码生成性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14295 2026-04-28 cs.RO cs.MA

Aegis: Automated Error Generation and Attribution for Multi-Agent Systems

Aegis:多智能体系统的自动化错误生成与归因

Fanqi Kong, Ruijie Zhang, Huaxiao Yin, Guibin Zhang, Xiaofei Zhang, Ziang Chen, Zhaowei Zhang, Xiaoyuan Zhang, Song-Chun Zhu, Xue Feng

机构 * Peking University Beijing Institute of General Artificial Intelligence(北京大学北京通用人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出Aegis框架,通过自动化生成大规模多智能体系统错误数据,提升错误归因能力,实验表明其模型性能可与专有模型媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22905 2026-04-28 eess.IV cs.AI cs.CV

CT-Guided Spatially-varying Regularization for Voxel-Wise Deformable Whole-Body PET Registration

基于CT的局部变化正则化用于全身体积PET变形注册

Xiangcen Wu, Ruohua Chen, Sichun Li, Qianye Yang, Sheng Liu, Jianjun Liu, Zhaoheng Xie

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) Ren Ji Hospital, Shanghai Jiao Tong University(上海交通大学仁济医院) University of Oxford(牛津大学)

AI总结 本文提出基于CT的局部变化正则化方法,用于全身体积PET变形注册,通过CT体积构建voxel级正则化图,提高全身体积注册精度和器官对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21764 2026-04-28 cs.AI

Thinking with Reasoning Skills: Fewer Tokens, More Accuracy

通过推理技能思考:更少的标记,更高的准确性

Guangxiang Zhao, Qilong Shi, Xusen Xiao, Xiangzheng Zhang, Tong Yang, Lin Sun

机构 * Qiyuan Tech(启元科技) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 本文提出通过存储和检索推理技能来减少推理标记并提升性能,适用于编码和数学推理任务。

Comments 10 pages, The 64th Annual Meeting of the Association for Computational Linguistics -- Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26380 2026-04-28 cs.CL

Switch Attention: Towards Dynamic and Fine-grained Hybrid Transformers

切换注意力:面向动态和细粒度的混合变换器

Yusheng Zhao, Hourun Li, Bohan Wu, Yichun Yin, Lifeng Shang, Jingyang Yuan, Meng Zhang, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing(多媒体信息处理国家重点实验室) School of Computer Science, PKU-Anker LLM Lab, Peking University(计算机科学学院,PKU-Anker LLM实验室,北京大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 本文提出Switch Attention,一种动态路由全注意力与滑动窗口注意力的混合变换器,通过自适应正则化和持续预训练提升长上下文语言模型的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13240 2026-04-28 cs.SE cs.AI cs.CL cs.LG

KOCO-BENCH: Can Large Language Models Leverage Domain Knowledge in Software Development?

KOCO-BENCH: 大型语言模型能否在软件开发中利用领域知识?

Xue Jiang, Ge Li, Jiaru Qian, Xianjie Shi, Chenjie Li, Hao Zhu, Ziyu Wang, Jielun Zhang, Zheyu Zhao, Lingwei Wu, Kechi Zhang, Jia Li, Wenpin Jiao, Zhi Jin, Yihong Dong

机构 * School of Computer Science, Peking University(北京大学计算机科学系) School of Computer Science, Wuhan University(武汉大学计算机科学系)

AI总结 KOCO-BENCH旨在评估大型语言模型在软件开发中利用领域知识的能力,包含6个新兴领域、11个软件框架和25个项目,通过多粒度任务测试模型的知识获取与应用能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21275 2026-04-28 cs.DC cs.AI

InfiniPipe: Elastic Pipeline Parallelism for Efficient Variable-Length Long-Context LLM Training

InfiniPipe:弹性流水线并行用于高效可变长度长上下文LLM训练

Shiju Wang, Yujie Wang, Ao Sun, Fangcheng Fu, Zijian Zhu, Bin Cui, Xu Han, Kaisheng Ma

机构 * Tsinghua University(清华大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出弹性流水线并行和阶段感知切片级自适应检查点,以应对资源和工作负载异质性,实验证明InfiniPipe比现有系统快1.69倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01700 2026-04-28 cs.LG q-bio.QM

PoseX: AI Defeats Physics Approaches on Protein-Ligand Cross Docking

PoseX:人工智能击败物理方法在蛋白质-配体交叉对接

Yize Jiang, Xinze Li, Yuanyuan Zhang, Jin Han, Youjun Xu, Ayush Pandit, Zaixi Zhang, Mengdi Wang, Mengyang Wang, Minjie Shen, Guang Yang, Yejin Choi, Wu-Jun Li, Tianfan Fu, Fang Wu, Junhong Liu

机构 * Microcyto Purdue University(普渡大学) State Key Laboratory for Novel Software Technology at Nanjing University(南京大学新型软件技术国家重点实验室) Anew Therapeutics Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Peking University(北京大学) Virginia Tech(弗吉尼亚理工大学) Imperial College London(伦敦帝国理工学院)

AI总结 PoseX设计了一个开放源代码的基准测试,评估自我对接和交叉对接,通过23种方法和718/1312个数据集,发现AI方法在对接成功率上优于物理方法,并通过放松方法和结合口袋信息提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏