arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

EPFL(洛桑联邦理工学院)

2026-07-21 至 2026-07-21 共收录 5
2607.17733 2026-07-21 cs.LG cs.AI 新提交

MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference

MXSens:用于高效大语言模型推理的灵敏度感知混合精度量化

Simla Burcu Harma, Danila Mishin, Zhengyuan Su, Ayan Chakraborty, Elizaveta Kostenok, Dongho Ha, Babak Falsafi, Martin Jaggi, Yunho Oh, Amir Yazdanbakhsh

机构 * EPFL(洛桑联邦理工学院) Tsinghua University(清华大学) MangoBoost Inc.(芒果助推公司) Korea University(韩国大学) Google DeepMind(谷歌DeepMind)

AI总结 研究针对大语言模型推理中4位量化因异常值致精度降的问题,提出MXSens方法,基于列和层灵敏度分配混合尾数比特宽度,无需训练,利用MXINT块结构,在多模型任务中优于现有方法,平衡了量化的准确性与资源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17624 2026-07-21 cs.LG 新提交

Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks

变压器真的无所不能吗?论跨任务归纳偏差的兼容性

Damien Teney, Liangze Jiang, Hemanth Saratchandran, Simon Lucey

机构 * Idiap Research Institute(Idiap研究所) EPFL(洛桑联邦理工学院) Adelaide University(阿德莱德大学)

AI总结 研究探讨变压器对给定任务是否最优,提出为数据集优化变压器架构的方法,在算法玩具任务和代码语言建模数据集上实验,发现标准变压器非局部最优,简单替代方案有优劣,暗示有改进架构可支持多种能力。

Comments Published as a conference paper at ICLR 2026. https://github.com/idiap/lm-afs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16761 2026-07-21 stat.ML cs.LG math.PR 新提交

Dropout and Random Gradient Masking Are Asymptotically Equivalent in Large ResNets

在大型残差网络中,随机失活与随机梯度掩码渐近等价

Javier Maass, Lénaïc Chizat

机构 * École Polytechnique Fédérale de Lausanne(联邦理工学院洛桑校区) Institute of Mathematics(数学研究所) Department of Mathematics(数学系)

AI总结 研究随机失活与随机梯度掩码两种训练技术,发现在大型残差网络中,二者在深度和宽度渐近大时差异消失,都收敛到相同极限动态,此渐近等价性适用于多种变体,包括逐层随机失活。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08056 2026-07-21 q-bio.NC cs.RO 版本更新

The embodied brain: Bridging the brain, body, and behavior with biorealistic neuromechanical models

具身大脑:通过生物真实神经力学模型连接大脑、身体与行为

Sibo Wang-Chen, Pavan Ramdya

机构 * EPFL(瑞士联邦理工学院)

AI总结 本文综述生物真实神经力学模型,通过将人工神经控制器嵌入模拟环境中的身体模型,揭示神经、身体与环境交互的行为控制算法,并推动神经科学、机器人学和机器学习之间的交流。

Comments 18 pages, 4 figures (including 1 graphical abstract), 1 table

Journal ref Current Opinion in Neurobiology, 100, 103244 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05092 2026-07-21 cs.CV cs.CR cs.DC cs.LG eess.IV

PriPHiT: Privacy-Preserving Hierarchical Training of Deep Neural Networks

PriPHiT: 保护隐私的深度神经网络分层训练

Yamin Sepehri, Pedram Pad, Pascal Frossard, L. Andrea Dunbar

机构 * Signal Processing Laboratory (LTS4), École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑校区信号处理实验室) Centre Suisse d’Electronique et de Microtechnique (CSEM)(瑞士电子与微技术中心)

AI总结 PriPHiT通过在边缘设备和云服务器上分层训练深度神经网络,利用对抗性早期退出和噪声添加技术,在保护隐私的同时提升模型性能。

Comments 21 pages, 19 figures, 11 tables

Journal ref Published in IEEE Transactions on Multimedia, vol. 27, pp. 8803-8818, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏