Ensembling Pruned Attention Heads For Uncertainty-Aware Efficient Transformers
集成剪枝注意力头用于不确定性感知的高效变压器
Firas Gabetni, Giuseppe Curci, Andrea Pilzer, Subhankar Roy, Elisa Ricci, Gianni Franchi
机构
*
U2IS, ENSTA, Institut Polytechnique de Paris(U2IS、ENSTA、巴黎理工学院)
;
University of Trento(特伦托大学)
;
NVIDIA
;
University of Bergamo, Italy(意大利贝拉姆博大学)
;
Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)
;
AMIAD, Pôle Recherche, Palaiseau(AMIAD、研究部、帕莱索)
PriorGuide: Test-Time Prior Adaptation for Simulation-Based Inference
PriorGuide: 基于先验适应的模拟推理测试阶段方法
Yang Yang, Severi Rissanen, Paul E. Chang, Nasrulloh Loka, Daolang Huang, Arno Solin, Markus Heinonen, Luigi Acerbi
机构
*
Department of Computer Science, University of Helsinki, Finland(赫尔辛基大学计算机科学系,芬兰)
;
ELLIS Institute Finland(芬兰ELLIS研究所)
;
Department of Computer Science, Aalto University, Finland(芬兰阿尔托大学计算机科学系)
Efficient Autoregressive Inference for Transformer Probabilistic Models
高效变换器概率模型的自回归推断
Conor Hassan, Nasrulloh Loka, Cen-You Li, Daolang Huang, Paul E. Chang, Yang Yang, Francesco Silvestrin, Samuel Kaski, Luigi Acerbi
机构
*
Department of Computer Science, Aalto University, Finland(芬兰阿尔托大学计算机科学系)
;
ELLIS Institute Finland(芬兰ELLIS研究所)
;
Department of Computer Science, University of Helsinki, Finland(芬兰赫尔辛基大学计算机科学系)
;
Verda
;
Department of Computer Science, University of Manchester, UK(英国曼彻斯特大学计算机科学系)
The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
对齐之舞:联合训练代理以安全协作
Jingyu Zhang, Haozhu Wang, Eric Michael Smith, Sid Wang, Amr Sharaf, Mahesh Pasupuleti, Benjamin Van Durme, Daniel Khashabi, Jason Weston, Hongyuan Zhan
机构
*
Meta Superintelligence Labs(Meta超智能实验室)
;
Johns Hopkins University(约翰·霍普金斯大学)
BED-LLM: Intelligent Information Gathering with LLMs and Bayesian Experimental Design
BED-LLM:利用LLM和贝叶斯实验设计进行智能信息收集
Deepro Choudhury, Sinead Williamson, Adam Goliński, Ning Miao, Freddie Bickford Smith, Michael Kirchhof, Yizhe Zhang, Tom Rainforth
机构
*
University of Oxford(牛津大学)
;
Apple(苹果公司)
;
City University of Hong Kong(香港城市大学)
;
University of Somewhere(某大学)
;
Institute of Something(某研究所)
;
Company Ltd(某有限公司)
Foundation Model for Cardiac Time Series via Masked Latent Attention
通过掩码潜在注意力的心脏时间序列基础模型
Moritz Vandenhirtz, Samuel Ruipérez-Campillo, Simon Böhi, Sonia Laguna, Irene Cannistraci, Andrea Agostini, Ece Ozkan, Thomas M. Sutter, Julia E. Vogt
机构
*
Department of Computer Science, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机科学系,瑞士)
;
Department of Biomedical Engineering, University of Basel, Switzerland(巴塞尔大学生物医学工程系,瑞士)
Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping
构造性失真:通过注意力引导的图像扭曲改进MLLMs
Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra, Jeonghwan Kim, Madhav Kanda, Hyeonjeong Ha, Svetlana Lazebnik, Heng Ji, Unnat Jain
机构
*
University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Skan AI
;
Texas A&M University(德克萨斯大学阿姆斯特朗分校)
;
University of California, Irvine(加州大学 Irvine 分校)
Projected Coupled Diffusion for Test-Time Constrained Joint Generation
投影耦合扩散用于测试时间受限的联合生成
Hao Luan, Yi Xian Goh, See-Kiong Ng, Chun Kai Ling
机构
*
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
;
Faculty of Computer Science and Information Technology, Universiti Malaya(马来亚大学计算机科学与信息技术学院)
;
Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所)
On the Predictive Power of Representation Dispersion in Language Models
语言模型中表示分散度的预测能力研究
Yanhong Li, Ming Li, Karen Livescu, Jiawei Zhou
机构
*
University of Chicago(芝加哥大学)
;
University of Maryland(马里兰大学)
;
Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
;
Stony Brook University(史泰福布鲁克大学)
;
Allen Institute for AI(人工智能研究院)
机构
*
The University of Hong Kong(香港大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Fudan University(复旦大学)
;
Peking University(北京大学)
;
Nanjing University(南京大学)
;
East China Normal University(华东师范大学)
;
Yale University(耶鲁大学)