arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3042
2512.05941 2025-12-08 cs.CV cs.AI cs.CL

Zoom in, Click out: Unlocking and Evaluating the Potential of Zooming for GUI Grounding

聚焦,点击:解锁和评估缩放在GUI定位中的潜力

Zhiyuan Jiang, Shenghao Xie, Wenyi Li, Wenqiang Zu, Peihang Li, Jiahao Qiu, Siqi Pei, Lei Ma, Tiejun Huang, Mengdi Wang, Shilong Liu

机构 * Xi’an Jiaotong University(西安交通大学) Princeton University(普林斯顿大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) Michigan State University(密歇根州立大学)

AI总结 本文提出ZoomClick方法,通过引入缩放先验知识提升GUI定位性能,实现动态空间聚焦与自适应上下文切换,并在多个基准上取得最佳结果。

Comments Code is available at https://github.com/Princeton-AI2-Lab/ZoomClick

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05134 2025-12-08 cs.CV cs.DC cs.LG

InvarDiff: Cross-Scale Invariance Caching for Accelerated Diffusion Models

InvarDiff:跨尺度不变性缓存用于加速扩散模型

Zihao Wu

机构 * Peking University(北京大学)

AI总结 InvarDiff通过利用扩散模型中时间步和层尺度的跨尺度不变性,实现无需训练的加速方法,显著提升推理速度并保持图像保真度。

Comments 8 pages main, 8 pages appendix, 16 figures, 5 tables. Code: https://github.com/zihaowu25/InvarDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15436 2025-12-08 cs.CV

Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs

基于动态视觉搜索和缩放的自适应聚焦推理方法用于高效VLMs

Xintong Zhang, Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaowen Zhang, Yang Liu, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

机构 * organization= School of Computer Science \& Technology, Beijing Institute of Technology , city= Beijing , country= China organization= State Key Laboratory of General Artificial Intelligence, BIGAI , city= Beijing , country= China organization= School of Intelligence Science Technology, Peking University , city= Beijing , country= China organization= Guangdong Laboratory of Machine Perception Intelligent Computing, Shenzhen MSU--BIT University , city= Shenzhen , country= China organization= Department of Automation, Tsinghua University , city= Beijing , country= China

AI总结 本文提出基于动态视觉搜索和缩放的自适应聚焦推理方法,提升VLMs的多模态推理效率和实际应用效果。

Comments https://github.com/xtong-zhang/Chain-of-Focus

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04864 2025-12-05 cs.AI

Are Your Agents Upward Deceivers?

您的代理是向上欺骗者吗?

Dadi Guo, Qingyu Liu, Dongrui Liu, Qihan Ren, Shuai Shao, Tianyi Qiu, Haoran Li, Yi R. Fung, Zhongjie Ba, Juntao Dai, Jiaming Ji, Zhikai Chen, Jialing Tao, Yaodong Yang, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Alibaba Group(阿里巴巴集团)

AI总结 研究发现基于LLM的代理可能通过欺骗行为隐瞒失败,需加强缓解策略以确保安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04857 2025-12-05 cs.CV

Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens

自回归图像生成只需少量缓存的token

Ziran Qin, Youru Lv, Mingbao Lin, Zeren Zhang, Chanfan Gan, Tieyuan Chen, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Rakuten Peking University(北京大学)

AI总结 LineAR通过行级缓存压缩技术,在自回归图像生成中实现内存节省和吞吐量提升,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04837 2025-12-05 cs.CV

A Sanity Check for Multi-In-Domain Face Forgery Detection in the Real World

多域现实世界面部伪造检测的 sanity 检查

Jikang Cheng, Renye Yan, Zhiyuan Yan, Yaozhong Gan, Xueyi Zhang, Zhongyuan Wang, Wei Peng, Ling Liang

机构 * Peking University(北京大学) Nanjing University(南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Wuhan University(武汉大学) Stanford University(斯坦福大学)

AI总结 本文提出多域现实世界面部伪造检测范式,通过DevDet框架提升真实伪造区分能力,实现在无域指定条件下的准确判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04830 2025-12-05 cs.CV

FreeGen: Feed-Forward Reconstruction-Generation Co-Training for Free-Viewpoint Driving Scene Synthesis

FreeGen: 用于自由视角驾驶场景合成的前馈重建-生成协同训练

Shijie Chen, Peixi Peng

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

AI总结 FreeGen通过重建-生成协同训练框架,提升自由视角驾驶场景合成的插值一致性与外推真实感,实现最先进的性能。

Comments Novel View Synthesis, Driving Scene, Free Trajectory, Image Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04711 2025-12-05 cs.SD cs.AI

Large Speech Model Enabled Semantic Communication

基于大语音模型的语义通信

Yun Tian, Zhijin Qin, Guocheng Lv, Ye Jin, Kaibin Huang, Zhu Han

机构 * School of Electronics, Peking University(北京大学电子学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Department of Computer Science and Engineering, Kyung Hee University(庆熙大学计算机科学与工程系)

AI总结 本文提出基于大语音模型的语义通信系统,利用Mimi编解码器和LoRA微调技术,实现适应性压缩与鲁棒传输,支持低带宽下的高质量语音传输。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04680 2025-12-05 cs.SE cs.AI cs.HC

Generative AI for Self-Adaptive Systems: State of the Art and Research Roadmap

生成式人工智能在自适应系统中的应用:现状与研究路线图

Jialong Li, Mingyue Zhang, Nianyu Li, Danny Weyns, Zhi Jin, Kenji Tei

机构 * Waseda University(早稻田大学) Southwest University(西南大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学) Tokyo Institute of Technology(东京技术大学)

AI总结 本文探讨生成式人工智能在自适应系统中的应用现状与研究方向,分析其提升系统自主性和人机交互的潜力及挑战。

Comments Accepted by ACM Transactions on Autonomous and Adaptive Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04597 2025-12-05 cs.CV cs.AI cs.LG cs.RO

When Robots Should Say "I Don't Know": Benchmarking Abstention in Embodied Question Answering

机器人何时应说'我不知道':身体化问答中退避的基准测试

Tao Wu, Chuhao Zhou, Guangyu Zhao, Haozhi Cao, Yewen Pu, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学)

AI总结 本文研究了身体化问答中退避机制的重要性,通过构建AbstainEQA数据集,发现人类在退避任务中表现优异,而模型退避能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04515 2025-12-05 cs.CV

EgoLCD: Egocentric Video Generation with Long Context Diffusion

EgoLCD:基于长上下文扩散的自体视频生成

Liuzhou Zhang, Jiarui Ye, Yuanlei Wang, Ming Zhong, Mingju Cao, Wanke Xia, Bowen Zeng, Zeyu Zhang, Hao Tang

机构 * Peking University(北京大学) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

AI总结 EgoLCD通过结合长时稀疏KV缓存和LoRA扩展的注意力机制,实现了高效稳定的自体长上下文视频生成,提升了感知质量和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04135 2025-12-05 cs.LG

Decoding Large Language Diffusion Models with Foreseeing Movement

通过预见性移动解码大语言扩散模型

Yichuan Mo, Quan Chen, Mingjie Li, Zeming Wei, Yisen Wang

机构 * State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,智能科学与技术学院,北京大学) School of Mathematical Sciences, Peking University(数学学院,北京大学) CISPA Helmholtz Center for Information Security, Germany(信息安全赫尔姆霍兹中心,德国) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

AI总结 本文提出FDM和FDM-A方法,通过整合局部和全局考虑,提升大语言扩散模型的解码效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18533 2025-12-05 cs.CV

DE-KAN: A Kolmogorov Arnold Network with Dual Encoder for accurate 2D Teeth Segmentation

DE-KAN:一种带有双编码器的 Kolmogorov Arnold 网络用于准确的 2D 牙齿分割

Md Mizanur Rahman Mustakim, Jianwu Li, Sumya Bhuiyan, Mohammad Mehedi Hasan, Bing Han

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) National Engineering Research Center of Oral Biomaterials and Digital Medical Devices(口腔生物材料与数字医疗设备国家工程研究中心) Department of Statistics and Data Science, Jahangirnagar University(Jahangirnagar大学统计与数据科学系) Faculty of Information Technology, Beijing University of Technology(北京理工大学信息学院) Department of Orthodontics, Peking University School and Hospital of Stomatology, National Center for Stomatology, National Clinical Research Center for Oral Diseases, National Engineering Research Center of Oral Biomaterials and Digital Medical Devices(北京大学口腔医学院附属口腔医院、口腔疾病国家临床医学研究中心、口腔生物材料与数字医疗设备国家工程研究中心)

AI总结 DE-KAN 通过双编码器 Kolmogorov Arnold 网络实现高精度 2D 牙齿分割,实验显示其在 Dice 系数上比现有方法提升达 4.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01903 2025-12-05 cs.SD eess.AS

MelTok: 2D Tokenization for Single-Codebook Audio Compression

MelTok:单代码本音频压缩的2D分token化

Jingyi Li, Zhiyuan Zhao, Zhisheng Zhang, Yunfei Liu, Lijian Lin, Ye Zhu, Jiahao Wu, Qiuqiang Kong, Yu Li

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院) Chinese University of Hong Kong(香港中文大学) Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)

AI总结 MelTok通过二维分token化和基于分token的vocoder,实现单代码本下的高效音频压缩与高质量重建。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03905 2025-12-04 cs.CV

Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence

无监督视频翻译与编辑中的帧空间-时间对应

Shuai Yang, Junxin Lin, Yifan Zhou, Ziwei Liu, Chen Change Loy

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

AI总结 FRESCO通过整合帧内与帧间对应关系,提升视频翻译与编辑的空间-时间一致性,实现高质量、一致的视频生成。

Comments Code: https://github.com/Sunnycookies/FRESCO-v2, Project: https://williamyang1991.github.io/projects/FRESCOv2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03837 2025-12-04 cs.CV

Heatmap Pooling Network for Action Recognition from RGB Videos

用于RGB视频中动作识别的热图池化网络

Mengyuan Liu, Jinfu Liu, Yongkang Jiang, Bin He

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家通用人工智能重点实验室,北京大学深圳研究生院) Imaging Department, DJI Technology Co., Ltd(大疆技术创新有限公司影像部) TongJi University(同济大学)

AI总结 本文提出了一种用于视频中动作识别的热图池化网络,通过反馈池化模块提取稳健且简洁的人体特征,并结合多模态数据提升识别性能。

Comments Final Version of IEEE Transactions on Pattern Analysis and Machine Intelligence

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03538 2025-12-04 cs.RO

AdaPower: Specializing World Foundation Models for Predictive Manipulation

AdaPower: 为预测操纵专门化世界基础模型

Yuhang Huang, Shilong Zou, Jiazhao Zhang, Xinwang Liu, Ruizhen Hu, Kai Xu

机构 * National University of Defense Technology(国防科技大学) Peking University(北京大学) Shenzhen University(深圳大学)

AI总结 AdaPower通过时空测试时间训练和记忆持久性机制,将通用世界基础模型转化为专门模型,提升机器人任务成功率41%

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02852 2025-12-04 cs.LG stat.ME

Adaptive Decentralized Federated Learning for Robust Optimization

自适应去中心化联邦学习用于鲁棒优化

Shuyuan Wu, Feifei Wang, Yuan Gao, Rui Wang, Hansheng Wang

机构 * School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) School of Statistics, Renmin University of China(中国人民大学统计学院) School of Statistics and Data Science, Shanghai University of International Business and Economics(上海国际商务经济学院统计与数据科学学院) Guanghua School of Management, Peking University(北京大学光华管理学院)

AI总结 本文提出了一种自适应去中心化联邦学习方法,通过自适应调整客户端学习率来提升模型鲁棒性,无需先验知识且具有理论保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02457 2025-12-04 cs.CV

Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation

听觉有助于视觉吗?研究音频视频联合去噪用于视频生成

Jianzong Wu, Hao Lian, Dachao Hao, Ye Tian, Qingyu Shi, Biaolong Chen, Hao Jiang, Yunhai Tong

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出通过音频视频联合去噪提升视频生成质量,验证了跨模态训练对构建更物理基础的世界模型的潜力。

Comments Project page at https://jianzongwu.github.io/projects/does-hearing-help-seeing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19304 2025-12-04 cs.AI cs.CL cs.LG

AutoEnv: Automated Environments for Measuring Cross-Environment Agent Learning

AutoEnv:用于测量跨环境智能体学习的自动化环境

Jiayi Zhang, Yiran Peng, Fanqi Kong, Cheng Yang, Yifan Wu, Zhaoyang Yu, Jinyu Xiang, Jianhao Ruan, Jinlin Wang, Maojia Song, HongZhang Liu, Xiangru Tang, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepWisdom Peking University(北京大学) Singapore University of Technology and Design(新加坡科技设计大学) Sydney University(悉尼大学) Yale University(耶鲁大学) Université de Montréal & Mila(蒙特利尔大学及Mila)

AI总结 AutoEnv通过自动化生成异质环境和组件驱动的学习方法,探讨了跨环境智能体学习的挑战与扩展性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03142 2025-12-04 cs.CV

UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying

UniEdit-I: 基于迭代理解、编辑和验证的无训练图像编辑

Chengyu Bai, Jintao Chen, Xiang Bai, Yilong Chen, Qi She, Ming Lu, Shanghang Zhang

机构 * Peking University(北京大学)

AI总结 UniEdit-I通过在语义潜在空间中引入迭代理解、编辑和验证循环,实现了无训练的闭环图像编辑,无需微调或架构修改即可达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03724 2025-12-04 cs.CL

MemOS: A Memory OS for AI System

MemOS:人工智能系统中的内存操作系统

Zhiyu Li, Chenyang Xi, Chunyu Li, Ding Chen, Boyu Chen, Shichao Song, Simin Niu, Hanyu Wang, Jiawei Yang, Chen Tang, Qingchen Yu, Jihao Zhao, Yezhaohui Wang, Peng Liu, Zehao Lin, Pengyuan Wang, Jiahao Huo, Tianyi Chen, Kai Chen, Kehang Li, Zhen Tao, Huayi Lai, Hao Wu, Bo Tang, Zhengren Wang, Zhaoxin Fan, Ningyu Zhang, Linfeng Zhang, Junchi Yan, Mingchuan Yang, Tong Xu, Wei Xu, Huajun Chen, Haofen Wang, Hongkang Yang, Wentao Zhang, Zhi-Qin John Xu, Siheng Chen, Feiyu Xiong

机构 * MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) Research Institute of China Telecom(中国电信研究院) Tongji University(同济大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Renmin University of China(中国人民大学) Beihang University(北航) Shanghai Jiao Tong University(上海交通大学)

AI总结 MemOS是一种面向人工智能系统的内存操作系统,通过统一管理不同类型的内存资源,提升长上下文推理和持续个性化的能力。

Comments 36 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02914 2025-12-03 cs.AI cs.CL cs.LG

Martingale Score: An Unsupervised Metric for Bayesian Rationality in LLM Reasoning

马尔可夫得分:一种用于大语言模型推理中贝叶斯理性性的无监督度量标准

Zhonghao He, Tianyi Qiu, Hirokazu Shirado, Maarten Sap

机构 * University of Cambridge(剑桥大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究提出马尔可夫得分,用于评估大语言模型推理中的贝叶斯理性性,通过检测信念更新的违反情况来衡量求真能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06040 2025-12-03 math.ST cs.LG math.PR stat.ML stat.TH

The Algorithmic Phase Transition in Correlated Spiked Models

相关尖峰模型中的算法相变

Zhangsong Li

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 该研究提出了一种基于边装饰循环计数的算法,利用尖峰相关性在相关尖峰模型中实现信号检测与估计,展示了在传统方法不可行的 regime 中的计算优势。

Comments 72 pages; added results in the Wishart setting; abstract shortened to meet the arXiv requirement

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02502 2025-12-03 cs.IR cs.AI

AskNearby: An LLM-Based Application for Neighborhood Information Retrieval and Personalized Cognitive-Map Recommendations

AskNearby: 一种基于LLM的邻里信息检索与个性化认知地图推荐应用

Luyao Niu, Zhicheng Deng, Boyang Li, Nuoxian Huang, Ruiqi Liu, Wenjia Zhang

机构 * Peking University(北京大学) Qianmo Smart Link(千摩智能链接) New York University(纽约大学) Imperial College London(伦敦帝国学院) Tencent(腾讯) Tongji University(同济大学)

AI总结 AskNearby通过整合检索增强生成和认知地图模型,提升邻里信息检索与个性化推荐效果,解决局部生活信息可及性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09843 2025-12-03 cs.CV cs.RO

ST-Booster: An Iterative SpatioTemporal Perception Booster for Vision-and-Language Navigation in Continuous Environments

ST-Booster: 一种用于连续环境视觉-语言导航的迭代时空感知增强器

Lu Yue, Dongliang Zhou, Liang Xie, Erwei Yin, Feitian Zhang

机构 * Robotics and Control Laboratory, the School of Advanced Manufacturing and Robotics, and the State Key Laboratory of Turbulence and Complex Systems, Peking University(机器人与控制实验室、先进制造与机器人学院、湍流与复杂系统国家重点实验室,北京大学) Defense Innovation Institute, Academy of Military Sciences(国防创新研究院,军事科学院) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 ST-Booster通过多粒度感知和指令感知推理提升连续环境中视觉-语言导航的性能。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02013 2025-12-02 cs.RO

ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation

ManualVLA: 一种统一的VLA模型用于链式思维手动生成和机器人操作

Chenyang Gu, Jiaming Liu, Hao Chen, Runzhong Huang, Qingpo Wuwu, Zhuoyang Liu, Xiaoqi Li, Ying Li, Renrui Zhang, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The Chinese University of Hong Kong(香港中文大学) Simplexity Robotics Project(Simplexity机器人项目)

AI总结 ManualVLA通过融合多模态手册生成与动作执行,提升机器人长周期任务中的规划与操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01827 2025-12-02 cs.CV

CauSight: Learning to Supersense for Visual Causal Discovery

CauSight: 通过因果推理进行视觉因果发现

Yize Zhang, Meiqi Chen, Sirui Chen, Bo Peng, Yanxi Zhang, Tianyu Li, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tongji University(同济大学)

AI总结 CauSight通过因果推理进行视觉因果发现,利用因果图数据集和强化学习方法,实现对视觉因果关系的高效发现。

Comments project page: https://github.com/OpenCausaLab/CauSight

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20353 2025-12-02 math.PR cs.AI cs.LG stat.ML

A Unified Theory of $θ$-Expectations

θ-期望的统一理论

Qian Qi

机构 * Peking University, Beijing 100871, China(北京大学)

AI总结 本文提出一种基于混沌动力学的θ-期望理论,揭示了非凸随机控制问题的全新数学框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11842 2025-12-02 cs.CV cs.AI cs.LG

MoH: Multi-Head Attention as Mixture-of-Head Attention

MoH:多头注意力作为专家混合注意力

Peng Jin, Bo Zhu, Li Yuan, Shuicheng Yan

机构 * School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University, Shenzhen, China(电子与计算机工程系,深圳研究生院,北京大学,深圳,中国) Pengcheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) School of AI for Science, Shenzhen Graduate School, Peking University, Shenzhen, China(科学人工智能学院,深圳研究生院,北京大学,深圳,中国) National University of Singapore, Singapore(新加坡国立大学,新加坡)

AI总结 MoH通过将注意力头视为专家,提升推理效率并优化性能,仅使用部分注意力头即可超越传统多头注意力。

Comments Accepted by ICML 2025, code: https://github.com/SkyworkAI/MoH

详情

展开后加载摘要…

URL PDF HTML 收藏