arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-04-21 至 2026-04-21 共收录 45
2508.02204 2026-04-21 cs.RO

TacMan-Turbo: Proactive Tactile Control for Robust and Efficient Articulated Object Manipulation

TacMan-Turbo:主动触觉控制用于稳健高效的机械臂物体操控

Zihang Zhao, Zhenghao Qi, Yuyang Li, Leiyao Cui, Zhi Han, Lecheng Ruan, Yixin Zhu

机构 * Peking University(北京大学) State Key Lab of General AI at Peking University(北京大学通用人工智能国家重点实验室) PKU-BingJi Joint Laboratory for Artificial Intelligence(北京大学-百度智云人工智能联合实验室) Wuhan Major Scientific and Technological Special Program(武汉重大科技专项) Hubei Embodied Intelligence Foundation Model Research and Development Program(湖北省具身智能基础模型研发计划) National Comprehensive Experimental Base for Governance of Intelligent Society(智能社会治理国家综合实验基地) LeapZenith AI Research(LeapZenith人工智能研究) Tsinghua University(清华大学) Embodied Intelligence Lab(具身智能实验室) PKU-Wuhan Institute for Artificial Intelligence(北京大学-武汉人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出TacMan-Turbo框架,通过主动触觉控制解决机械臂物体操控中有效性与效率的平衡问题,在200种模拟和真实物体上实现100%成功率,显著提升时间效率、动作效率和轨迹平滑度。

Comments Accepted for publication in the IEEE Transactions on Automation Science and Engineering (T-ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03480 2026-04-21 cs.RO cs.AI

SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning

SafeVLA: 通过约束学习实现视觉-语言-动作模型的安全对齐

Borong Zhang, Yuhao Zhang, Jiaming Ji, Yingshan Lei, Yishuai Cai, Josef Dai, Yuanpei Chen, Yaodong Yang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) PKU-PsiBot Joint Lab(北京大学PsiBot联合实验室) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出SafeVLA方法,通过约束学习整合安全约束,有效降低安全违规成本并提升任务成功率,同时确保安全性和泛化能力。

Comments Accepted by NeurIPS 2025 Spotlight Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16979 2026-04-21 cs.CV cs.CL

DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models

DOSE: 通过现成模型进行多模态大语言模型的数据选择

Biao Wu, Yiwu Zhong, Meng Fang, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) Peking University(北京大学) University of Liverpool(利物浦大学)

AI总结 本文提出DOSE方法,利用现成预训练模型筛选多模态数据,提升数据质量和对齐性,减少计算成本,增强数据多样性,使模型在标准VQA和数学基准测试中表现优异。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16858 2026-04-21 cs.CV

Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement

Q-DeepSight:利用图像激励思考用于图像质量评估与细化

Xudong Li, Jiaxi Tan, Ziyin Zhou, Yan Zhong, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出Q-DeepSight框架,通过多模态链式思考与工具增强证据获取,提升图像质量评估与细化的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16475 2026-04-21 cs.NE cs.AI

Spike-driven Large Language Model

基于脉冲的大型语言模型

Han Xu, Xuerui Qiu, Baiyu Chen, Xinhao Luo, Xingrun Xing, Jiahong Zhang, Bo Lei, Tiejun Huang, Bo Xu, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing 100049, China Brain-Inspired Models Group, Beijing Academy of Artificial Intelligence, Beijing 100862, China School of Future Technology, University of Chinese Academy of Sciences, Beijing 101408, China Zhongguancun Academy, Beijing 100094, China Pengcheng Laboratory, Guangdong 518055, China School of Advanced Inter-disciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China School of Computer Science, Peking University, Beijing 100871, China Key Laboratory of Brain Cognition Spiking Intelligence Lab, Tianqiao \& Chirssy Chen Institute, Shanghai 201203, China

AI总结 本文提出SDLLM,通过稀疏加法替代密集矩阵乘法,结合gamma-SQP编码和对称量化机制,有效降低脉冲 firing 率并提升性能,实验表明在脉冲基础上实现更高效且准确的大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16372 2026-04-21 cs.CL cs.AI

CFMS: Towards Explainable and Fine-Grained Chinese Multimodal Sarcasm Detection Benchmark

CFMS:迈向可解释且细粒度的中文多模态讽刺检测基准

Junzhao Zhang, Hsiu-Yuan Huang, Chenming Tang, Yutong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing(多媒体信息处理国家重点实验室) Peking University School of Computer Science(北京大学计算机科学学院) Peking University School of Software and Microelectronics(北京大学软件与微电子学院)

AI总结 本文提出CFMS,首个针对中文社交媒体的细粒度多模态讽刺检测数据集,包含2796对高质量图像-文本对,提供三层次标注框架,并提出PGDS方法在关键任务中优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09244 2026-04-21 cs.MM cs.CV cs.RO

2D or 3D: Who Governs Salience in VLA Models? -- Tri-Stage Token Pruning Framework with Modality Salience Awareness

2D或3D:谁在VLA模型中主导显著性?——具有模态显著性意识的三阶段令牌剪枝框架

Zihao Zheng, Sicheng Tian, Zhihao Mao, Lingyue Zhang, Chenyue Li, Ziyun Zhang, Hong Gao, Yuchen Huang, Yutong Xu, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ZTE Corporation(中兴通讯) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机科学学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

AI总结 本文提出三阶段令牌剪枝框架,通过捕捉2D/3D模态显著性的差异与动态,提升VLA模型的推理效率,实验显示在最小精度损失下实现2.55倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17550 2026-04-21 cs.LG cs.AI

MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning

MASPO:统一梯度利用、概率质量与信号可靠性以实现鲁棒且样本高效的LLM推理

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

AI总结 MASPO通过统一框架解决RLVR方法中梯度利用低效、概率质量不敏感和信号可靠性不对称的问题,提升LLM推理的鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04638 2026-04-21 cs.CL cs.AI

SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation

SpeechMedAssist: 有效且高效地适应语音语言模型用于医疗咨询

Sirry Chen, Jieyi Wang, Wei Chen, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institude(上海创新研究院) Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出SpeechMedAssist,一种能进行语音多轮交互的语音语言模型,通过分阶段训练减少对医疗语音数据的需求,提升医疗咨询场景下的效果和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02636 2026-04-21 cs.LG cs.CV

Joint Distillation for Fast Likelihood Evaluation and Sampling in Flow-based Models

基于流模型的快速似然评估与采样联合蒸馏

Xinyue Ai, Yutong He, Albert Gu, Ruslan Salakhutdinov, J Zico Kolter, Nicholas Matthew Boffi, Max Simchowitz

机构 * Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学)

AI总结 本文提出F2D2框架,通过联合蒸馏减少流模型采样和似然评估的NFE数量,实现高效计算与高精度似然估计。

Comments Project page: https://kellyyutonghe.github.io/f2d2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27486 2026-04-21 cs.LG cs.AI

FedAdamW: A Communication-Efficient Optimizer with Convergence and Generalization Guarantees for Federated Large Models

FedAdamW: 一种具有收敛性和泛化保证的联邦大模型高效优化器

Junkang Liu, Fanhua Shang, Hongying Liu, Yuxuan Tian, Yuanyuan Liu, Jin Liu, Kewen Zhu, Zhouchen Lin

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Medical College, Tianjin University(天津大学医学院) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院) State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(广州黄埔 Pazhou 实验室)

AI总结 本文提出FedAdamW,通过局部修正机制和解耦权重衰减缓解联邦学习中的局部过拟合和方差问题,理论证明其收敛速率并实验证明其在语言和视觉Transformer模型中的有效性。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01302 2026-04-21 cs.CL cs.CE

Aligning Language Models with Real-time Knowledge Editing

对齐语言模型与实时知识编辑

Chenming Tang, Yutong Yang, Kexue Wang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University School of Computer Science, Peking University(国家多媒体信息处理重点实验室,北京大学计算机学院,北京大学)

AI总结 本文提出CRAFT动态知识编辑数据集及KEDAS方法,通过多样编辑增强和自适应推理提升知识编辑性能,推动从静态更新向动态演化转变。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09885 2026-04-21 cs.CV

The Less You Depend, The More You Learn: Synthesizing Novel Views from Sparse, Unposed Images with Minimal 3D Knowledge

你依赖得越少,学到的越多:从稀疏、未定位图像中合成新视角的方法,仅需最小的3D知识

Haoru Wang, Kai Ye, Minghan Qin, Yangyan Li, Wenzheng Chen, Baoquan Chen

机构 * Peking University(北京大学) ByteDance Seed(字节跳动种子) Ant Group(蚂蚁集团) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文探讨了在数据量增加时,依赖较少3D知识的方法性能提升更快的现象,提出了一种无需显式场景结构和姿态标注的端到端NVS框架,实现了更高效的视角合成。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01770 2026-04-21 cs.CR cs.AI cs.LG cs.SE

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction

ReGA:通过表示引导抽象的基于模型的安全保障方法

Zeming Wei, Chengcan Wu, Meng Sun

机构 * Peking University(北京大学)

AI总结 本文提出ReGA框架,通过利用安全关键表示缩小模型分析在大规模语言模型中的可扩展性差距,有效区分安全与有害输入,提升LLM安全性。

Comments FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18232 2026-04-21 cs.LG cs.AI cs.CL

Two-Stage Regularization-Based Structured Pruning for LLMs

基于两阶段正则化的结构剪枝用于大语言模型

Mingkuan Feng, Jinyang Wu, Siyuan Liu, Shuai Zhang, Hongjian Fang, Ruihan Jin, Feihu Che, Pengpeng Shao, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Peking University(北京大学) Beijing National Research Center for Information Science and Technology(北京信息科学研究院)

AI总结 本文提出TRSP方法,通过两阶段正则化提升大语言模型结构剪枝效果,减少知识损失并无需重新训练,实验显示其优于现有方法,实现高效部署。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏