arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 717 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 139 篇

2505.19155 2026-05-19 cs.CV cs.CL 86%

Sparse-to-Dense: A Free Lunch for Lossless Acceleration of Video Understanding in LLMs

稀疏到密集:一种无损加速视频理解的LLM免费午餐

Xuan Zhang, Cunxiao Du, Sicheng Yu, Jiawei Wu, Fengzhuo Zhang, Wei Gao, Qian Liu

机构 * Singapore Management University(新加坡国立管理学院) Sea AI Lab(Sea AI实验室) National University of Singapore(国立新加坡大学)

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种名为Sparse-to-Dense(StD)的解码策略,通过结合稀疏top-K注意力和密集全注意力模块,实现视频大语言模型(Video-LLMs)的无损加速,从而在处理长视频序列时显著提高处理速度。

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04746 2026-05-19 cs.CL cs.AI 86%

SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs

SignRoundV2:朝着关闭LLMs极低比特后训练量化性能差距的目标

Wenhua Cheng, Weiwei Zhang, Heng Guo, Haihao Shen, Zaner Ma

机构 * Intel(英特尔公司) Beijing Institute of Technology(北京理工大学)

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SignRoundV2框架,通过自适应混合精度策略和轻量稳定技术,在极低比特量化下保持高性能,实验表明在混合MXFP设置中实现接近无损性能,将性能差距缩小到约1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17707 2026-05-19 cs.CR 86%

Speed Kills: Exploring Confused Deputy Attacks Through Edge AI Accelerators

速度即杀:通过边缘AI加速器探索困惑代理攻击

Datta Manikanta Sri Hari Danduri, Aravind Kumar Machiry

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了通过边缘AI加速器(AIA)进行的困惑代理攻击(CDAs)问题,提出了一种基于大语言模型(LLM)的框架DeputyHunt,通过动态和静态分析提取相关信息,并发现六种主流AIA均存在CDAs的可行性,影响超过128个系统芯片(SOCs)和1亿台设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17613 2026-05-19 cs.AR cs.LG 85%

VeriCache: Turning Lossy KV Cache into Lossless LLM Inference

VeriCache: 将损失性KV缓存转换为无损LLM推理

Jiayi Yao, Samuel Shen, Kuntai Du, Shaoting Feng, Dongjoo Seo, Rui Zhang, Yuyang Huang, Yuhan Liu, Shan Lu, Junchen Jiang

机构 * University of Chicago(芝加哥大学) Tensormesh Inc.(Tensormesh公司) Samsung Semiconductor(三星半导体) Microsoft Research(微软研究院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出VeriCache框架,通过利用压缩的KV缓存生成token并验证其与完整KV缓存的一致性,实现了与完整KV缓存解码相同输出的同时保持高解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18475 2026-05-19 cs.LG cs.AI 85%

GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets

GAMMA:在任意预算下为混合精度模型进行全局位分配

Zhangyang Yao, Haiyan Zhao, Haoyu Wang, Tianbo Huang, Lihua Zhang, Xu Han

机构 * Beihang University(北航) Tsinghua University(清华) ByteDance Inc(字节跳动)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出GAMMA框架,通过后训练流水线学习模块级精度偏好,优化教师强制隐藏状态重建目标并利用整数规划实现精确预算分配,从而在任意预算下提升大语言模型的精度,优于固定精度基线和搜索基混合精度方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17379 2026-05-19 cs.CL cs.AI 85%

Learning Faster with Better Tokens: Parameter-Efficient Vocabulary Adaptation for Specialized Text Summarization

通过更好的令牌学习:用于专业文本摘要的参数高效词汇适应

Gunjan Balde, Soumyadeep Roy, Mainack Mondal, Niloy Ganguly

机构 * Dept. of Computer Science and Engg., IIT Kharagpur(印度Kharagpur理工学院计算机科学与工程系) Dept. of Medicine (Biomedical Informatics), Stanford University(斯坦福大学医学院(生物医学信息学))

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种参数高效的领域适应方法,通过结合词汇适应和预训练,提升大型语言模型在专业领域文本摘要任务中的性能,同时减少训练时间和参数数量。

Comments 16 pages. Accepted in the 64th Annual Meeting of the Association for Computational Linguistics [ACL (Main) 2026] as a long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17971 2026-05-19 cs.CR cs.AI 84%

Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

Babel: 通过混淆分布优化采样实现安全机制的 jailbreak 安全性

Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

机构 * Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) Southeast University(东南大学) University of Hong Kong(香港大学)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型安全机制中的内在漏洞,提出了一种高效的黑盒攻击框架Babel,通过系统性的混淆采样和反馈驱动的分布优化,实现了高成功率的jailbreak攻击,展示了在LLM安全研究中的稳健方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17138 2026-05-19 cs.LG cs.AI 84%

RAP: Runtime Adaptive Pruning for LLM Inference

RAP: 用于大语言模型推理的运行时自适应剪枝

Huanrong Liu, Chunlin Tian, Xuyang Wei, Qingbiao Li, Li Li

机构 * Faculty of Science and Technology, University of Macau, Macau, China(澳门大学科学与技术学院) School of Information and Software Engineering, University of Electronic Science and Technology of China, Chengdu, China(电子科技大学信息与软件工程学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAP,一种基于强化学习的弹性剪枝框架,通过动态调整压缩策略来适应运行时内存变化和异构KV缓存需求,首次在推理过程中同时考虑模型权重和KV缓存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17304 2026-05-19 cs.LG cs.CL 84%

Compress the Context, Keep the Commitments: A Formal Framework for Verifiable LLM Context Compression

压缩上下文,保持承诺:可验证大语言模型上下文压缩的正式框架

Natalia Trukhina, Vadim Vashkelis

机构 * Embedded Intelligence Lab (EMILAB)(嵌入式智能实验室)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Context Codec框架,通过语义层面的压缩方法,确保在压缩对话历史时保留关键承诺,解决现有方法在压缩过程中缺乏对语义承诺保留的明确规范的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17017 2026-05-19 cs.LG cs.AI 84%

When Dynamics Shift, Robust Task Inference Wins: Offline Imitation Learning with Behavior Foundation Models Revisited

当动态变化时,鲁棒任务推断胜出:重新审视具有行为基础模型的离线模仿学习

Rishabh Agrawal, Rahul Jain, Ashutosh Nayyar

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于行为基础模型(BFM)的框架,通过将任务推断建模为鲁棒最小最大优化问题,以应对动态变化,从而在不修改预训练的情况下实现对最坏动态扰动的适应。该方法在动态变化下显著优于标准BFM和鲁棒离线模仿学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19950 2026-05-19 cs.LG cs.AI cs.CL 83%

LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation

LogQuant: 一种基于对数分布的2位KV缓存量化技术,具有更优异的精度保持性能

Han Chen, Zicong Jiang, Zining Zhang, Bingsheng He, Pingyi Luo, Mian Lu, Yuqiang Chen

机构 * Paradigm(4Paradigm)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LogQuant通过基于对数的过滤机制实现KV缓存的2位量化,减少内存占用的同时保持高性能,实验表明其在吞吐量、批处理大小和准确性上均优于现有方法。

Comments Accepted by ICLR 2025 Workshop on Sparsity in LLMs (SLLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17093 2026-05-19 cs.CV cs.CL 83%

HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation

HEED:基于密度加权残差对齐的混合视觉-语言模型蒸馏

Yihao Liang, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出HEED方法,通过密度加权残差对齐改进混合视觉-语言模型蒸馏,提升在OCR和文档任务中的性能,同时在不同教师模型和混合架构上实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18226 2026-05-19 cs.CL cs.AI 82%

Context Memorization for Efficient Long Context Generation

上下文记忆用于高效长上下文生成

Yasuyuki Okoshi, Hao Mark Chen, Guanxi Lu, Hongxiang Fan, Masato Motomura, Daichi Fujiki

机构 * Institute of Science Tokyo, Japan(东京科学研究所) Imperial College London, UK(伦敦帝国学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种无需训练的上下文记忆方法,通过将前缀外部化为轻量级的预计算注意力状态查找表,以提高长上下文生成的准确性和效率,同时减少注意力计算的延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17885 2026-05-19 cs.CL cs.AI 82%

Multi-agent AI systems outperform human teams in creativity

多智能体AI系统在创造力上超越人类团队

Tiancheng Hu, Yixuan Jiang, Haotian Li, José Hernández-Orallo, Xing Xie, Nigel Collier, David Stillwell, Luning Sun

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了多智能体AI系统在创造力任务中的表现,发现其在四个多样化问题解决任务中,比单智能体和人类团队更具创造力,核心方法是通过语义空间路径分析生成过程,主要贡献是揭示了AI和人类团队在创造力预测上的不同机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15508 2026-05-19 cs.LG cs.CL 82%

STS: Efficient Sparse Attention with Speculative Token Sparsity

STS: 高效稀疏注意力与推测性标记稀疏性

Ceyu Xu, Jiangnan Yu, Yongji Wu, Yuan Xie

机构 * The Hong Kong University of Science and Technology(香港科技大学) UC Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STS,一种无需模型再训练的稀疏注意力机制,通过利用较小的草稿模型识别出的重要标记来预测更大目标模型的重要标记,从而在大规模语言模型推理中实现高效的稀疏注意力计算,显著提升速度并保持准确性。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14005 2026-05-19 cs.CL cs.LG 82%

Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding

毒藤:针对推测解码的隐秘加速-崩溃攻击

Shuoyang Sun, Chang Dai, Hao Fang, Kuofeng Gao, Xinhao Zhong, Yi Sun, Fan Mo, Shu-Tao Xia, Bin Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) South China University of Technology(华南理工大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Huawei Technology(华为技术)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Mistletoe攻击,通过优化降质目标和语义保留目标,隐秘地降低推测解码的接受长度τ,从而减少加速效果,同时保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12825 2026-05-19 cs.LG cs.AI 82%

Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion

Orthrus:通过双视角扩散实现内存高效的并行令牌生成

Chien Van Nguyen, Chaitra Hegde, Van Cuong Pham, Ryan A. Rossi, Franck Dernoncourt, Thien Huu Nguyen

机构 * University of Oregon(俄勒冈大学) Google DeepMind(谷歌DeepMind) Adobe Research(Adobe研究)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Orthrus结合自回归大语言模型的高保真生成与扩散模型的高速并行生成,通过双视角机制实现高效推理,提升速度7.8倍且内存开销极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04471 2026-05-19 cs.CL cs.AI 82%

MOSAIC: A Multilingual, Taxonomy-Agnostic, and Computationally Efficient Approach for Radiological Report Classification

MOSAIC:一种多语言、无类别依赖且计算高效的放射报告分类方法

Alice Schiavone, Marco Fraccaro, Lea Marie Pehrson, Silvia Ingala, Rasmus Bonnevie, Michael Bachmann Nielsen, Vincent Beliveau, Melanie Ganz, Desmond Elliott

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Neurobiology Research Unit, Copenhagen University Hospital(哥本哈根大学医院神经生物学研究单位) Unumed Aps(Unumed公司) Department of Diagnostic Radiology, Copenhagen University Hospital(哥本哈根大学医院诊断放射学系) Department of Clinical Medicine, University of Copenhagen(哥本哈根大学临床医学系) Cerebriu A/S(Cerebriu公司) Institute for Human Genetics, Medical University of Innsbruck(因斯布鲁克医学大学人类遗传学研究所)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 MOSAIC通过紧凑开放模型实现多语言、无类别依赖的放射报告分类,无需大量标注数据,且在多种影像模态和标签体系上表现优异,达到专家水平性能。

Comments 8 pages, 14 pages including references and appendix. 9 figures. Preprint

Journal ref Proceedings of the ClinicalNLP Workshop at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20216 2026-05-19 cs.CL cs.AI cs.LG 82%

Locally Coherent Parallel Decoding in Diffusion Language Models

局部相干并行解码在扩散语言模型中

Michael Hersche, Nicolas Menet, Ronan Tanios, Abbas Rahimi

机构 * IBM Research - Zurich(IBM瑞士研究实验室)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoDiLA方法,通过引入小型辅助自回归模型来解决扩散语言模型在并行解码中的相干性问题,从而在代码生成任务中实现更高的准确性和速度。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18066 2026-05-19 cs.OS cs.DC 82%

TIDAL: Recovering Temporal Phase for Cloud Block Storage Placement from LLM-Derived Semantics

TIDAL: 从LLM衍生的语义中恢复时间相位以实现云块存储中的卷放置

Difan Tan, Changlin Wan, Jiawen Liu, Hua Wang, Ke Zhou

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出TIDAL框架,通过从租户提供的元数据中恢复时间相位信息,解决云块存储中卷放置的互补性问题,显著降低过载频率和持续时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22570 2026-05-19 cs.CV 82%

CanViT: Toward Active-Vision Foundation Models

CanViT:迈向主动视觉基础模型

Yohaï-Eliel Berreby, Sabrina Du, Audrey Durand, B. Suresh Krishna

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究院) Université Laval(拉瓦尔大学)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 CanViT是首个任务和策略无关的主动视觉基础模型,通过场景相对RoPE结合视图Transformer和场景-wide潜在工作空间,提出Canvas Attention机制,实现高效推理和高分辨率扩展,并在ADE20K和ImageNet-1k上取得新突破。

Comments v2: additional results: 84.5% IN1k accuracy after fine-tuning and effect of canvas resolution. Code and weights: https://github.com/m2b3/CanViT-PyTorch

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20969 2026-05-19 cs.DC cs.LG 81%

TeleRAG: Efficient Retrieval-Augmented Generation Inference with Lookahead Retrieval

TeleRAG: 通过前瞻性检索实现高效的检索增强生成推理

Chien-Yu Lin, Keisuke Kamahori, Yiyu Liu, Xiaoxiang Shi, Madhav Kashyap, Yile Gu, Rulin Shao, Zihao Ye, Kan Zhu, Rohan Kadekodi, Stephanie Wang, Arvind Krishnamurthy, Luis Ceze, Baris Kasikci

机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, WA, USA(华盛顿大学保罗·G·艾伦计算机科学与工程学院,西雅图,华盛顿州,美国) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University, Cambridge, MA, USA(哈佛大学约翰·A·保罗森工程与应用科学学院,剑桥,马萨诸塞州,美国) Shanghai Jiao Tong University, Shanghai, China(上海交通大学,上海,中国)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出TeleRAG,一种通过前瞻性检索机制减少延迟并提高吞吐量的高效检索增强生成推理系统,该系统在有限的GPU内存下实现了更高的性能和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03409 2026-05-19 cs.AI 81%

Robust Agent Compensation (RAC): Teaching AI Agents to Compensate

鲁棒代理补偿(RAC):教AI代理补偿

Srinath Perera, Kaviru Hapuarachchi, Frank Leymann, Rania Khalaf

机构 * University of Stuttgart(斯图加特大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出了一种基于日志的恢复范式RAC,通过架构扩展实现安全网,可应用于大多数代理框架以支持可靠执行。RAC可在不修改现有代理代码的情况下启用,通过现有的扩展点在大多数现有代理框架中实现,并通过τ-bench和REALM-Bench验证,证明在解决复杂问题时,RAC在延迟和token经济性方面优于现有最先进的LLM-based恢复方法。

Comments Accepted at ACM Conference on AI and Agentic Systems (ACM CAIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04309 2026-05-19 cs.LG 81%

Activation Steering with a Feedback Controller

通过反馈控制器激活控制

Dung V. Nguyen, Hieu M. Vu, Nhi Y. Pham, Lei Zhang, Tan M. Nguyen

机构 * Department of Mathematics(数学系) Center for AI Research(人工智能研究中心) National University of Singapore(新加坡国立大学) VinUniversity(文大学) Torilab(Torilab实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PID激活控制方法,基于控制理论构建激活控制框架,通过P、I、D项实现激活对齐、误差累积和抑制超调,提升大语言模型行为控制的鲁棒性和可靠性。

Comments 10 pages in the main text. ICLR2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16479 2026-05-19 cs.IR cs.AI 81%

Policy-Grounded Dynamic Facet Suggestions for Job Search

基于政策的动态面建议用于求职搜索

Dan Xu, Baofen Zheng, Qianqi Shen, Jianqiang Shen, Wenqiong Liu, Chunnan Yao, Ping Liu, Rajat Arora, Kevin Kao, Hsiang Lin, Wanjun Jiang, Yusuke Takebuchi, Jingwei Wu, Wenjing Zhang

机构 * LinkedIn Corporation(LinkedIn公司)

专题命中 效率与部署 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 本文提出动态面建议(DFS)以提高求职搜索中的意图识别和相关职位检索,通过实时个性化语义属性推荐,结合离线分类整理、嵌入检索和小语言模型评分,提升建议精度和用户参与度。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18702 2026-05-19 cs.LG cs.AI 81%

Distilling Tabular Foundation Models for Structured Health Data

为结构化健康数据 distilling 表格基础模型

Aditya Tanna, Nassim Bouarour, Mohamed Bouadi, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs(Lexsi实验室)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了如何通过知识蒸馏将表格基础模型的预测行为转移到轻量级表格模型中,通过分层出折教师标签解决上下文泄露问题,在19个医疗数据集上验证了蒸馏学生模型在保持高AUC的同时显著提升了推理速度,并展示了多教师平均法并不总能超越最佳单教师。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18654 2026-05-19 cs.LG cs.AI 81%

Pocket Foundation Models: Distilling TFMs into CPU-Ready Gradient-Boosted Trees

口袋基础模型:将TFMs压缩成CPU可用的梯度提升树

Aditya Tanna, Nassim Bouarour, Mohamed Bouadi, Vinay kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs(Lexsi实验室)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种将高性能表格基础模型(TFMs)压缩成CPU原生梯度提升树的方法,以解决实时欺诈评分需求与现有模型性能之间的差距,同时在多个数据集上验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18635 2026-05-19 cs.LG cs.AI 81%

Data Presentation Over Architecture: Resampling Strategies for Credit Risk Prediction with Tabular Foundation Models

数据呈现与架构:用于表格基础模型的信用风险预测重采样策略

Aditya Tanna, Mitul Solanki, Mohamed Bouadi, Nassim Bouarour, Pratinav Seth, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在信用风险预测中,通过不同的上下文构建策略对表格基础模型性能的影响,发现上下文构建策略比模型架构对AUC-ROC指标的贡献更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24208 2026-05-19 cs.CL cs.LG 81%

Beyond Neural Incompatibility: Cross-Scale Knowledge Transfer in Language Models through Latent Semantic Alignment

超越神经不兼容:通过潜在语义对齐实现语言模型中的跨尺度知识转移

Jian Gu, Aldeida Aleti, Chunyang Chen, Hongyu Zhang

机构 * Monash University(墨尔本大学) Technical University of Munich(慕尼黑技术大学) Chongqing University(重庆大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出SemAlign方法,通过潜在语义对齐实现跨尺度知识转移,解决了不同架构和参数化模型间参数重用受限的问题,通过激活值作为转移介质,利用语义分解与重组稳定地实现知识迁移。

Comments an early-stage version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17653 2026-05-19 cs.LG cs.AI 81%

LLMForge: Multi-Backend Hardware-Aware Neural Architecture Search with Infinite-Head Attention for Edge Language Models

LLMForge: 多后端硬件感知的神经架构搜索与无限头注意力用于边缘语言模型

Xinting Jiang, Junyi Luo, Ruichen Qi, Kauna Lei, Ben Laurie, Gregory Kielian, Mehdi Saligane

机构 * Brown University(布朗大学) University of Michigan(密歇根大学) Google Research(谷歌研究)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLMForge,一种多后端硬件感知的神经架构搜索框架,通过无限头注意力扩展了每层注意力配置空间,并结合Forge-Former和Forge-DSE实现了高效的边缘语言模型架构搜索,最终在不同硬件子系统上获得了不同形状的架构,展示了在不同性能指标上的优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏