arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22116 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22116 篇

2607.23771 2026-07-28 cs.AI 新提交 91%

Training Language Models to Cooperate with Inference-Time Controllers

训练语言模型以与推理时控制器协作

Moumita Choudhury, Vanshaj Khattar, Jing Liu, Toshiaki Koike-Akino, Ankush Chakrabarty, Shlomo Zilberstein, Ye Wang

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 研究LLM性能依赖推理时控制器的问题,提出CALM框架,将其表述为多任务强化学习,通过模块级分解研究训练策略,评估显示该框架能提升推理时工作流程的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19704 2026-07-23 cs.LG stat.ML 新提交 91%

Efficient Clustering with Provable Guardrails for LLM Inference at Scale

大规模LLM推理中具有可证明护栏的高效聚类

Longshaokan Wang, Wai Tsang Keung, Punit Ghodasara, Roman Wang, Ali Dashti, Francesc Moreno-Noguer

机构 * Amazon(亚马逊)

专题命中 效率与部署 :LLM(title,title_cn);foundation model(abstract);分类 cs.LG

AI总结 研究针对大规模LLM推理成本和延迟瓶颈,提出两阶段聚类算法,先用Mini-batch K-Means生成初始聚类,再在其中选代表,能保证逐样本质量控制,运行高效且可扩展,相比常见方法有显著优势,部署后大幅降低成本和延迟。

Comments Accepted for presentation at ICML HiLD workshop 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28749 2026-07-03 cs.CY cs.AI cs.HC 版本更新 91%

Four Types of LLM Reliance and Their Predictors Among Undergraduate Writers: A Mixed-Methods Study at a Minority-Serving R1 University

本科写作者对LLM的四种依赖类型及其预测因素:一项在少数族裔服务R1大学的混合方法研究

Shahin Hossain

机构 * School of Education, University of Maryland, Baltimore County(大学教育学院,马里兰大学巴尔的摩县分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究在少数族裔服务大学通过混合方法识别出本科生的四种LLM依赖类型(策略型、工具型、对话型、依赖型),发现价值与成本信念预测依赖强度,AI素养预测依赖类型,且策略型用户在标准结果测量中得分最低。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30850 2026-07-01 cs.AI 新提交 91%

BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation

BayesBench: 评估多轮证据积累下LLM信念轨迹

Ankur Samanta, Akshayaa Magesh, Tal Lancewicki, Ayush Jain, Youliang Yu, Paul Sajda, Kaveh Hassani, Aditya Modi, Daniel R. Jiang, Yonathan Efroni

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超级智能实验室) Tel Aviv University(特拉维夫大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出BayesBench基准,通过三个渐进复杂任务评估LLM在多轮证据积累中的信念更新是否接近贝叶斯理性,发现规模提升改善潜在推理但未可靠转化为预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29526 2026-06-30 cs.LG 91%

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

优化训练策略的幻象:单调推理策略作为大语言模型强化学习的真正目标

Jing Liang, Hongyao Tang, Yi Ma, Yancheng He, Weixun Wang, Xiaoyang Li, Ju Huang, Wenbo Su, Jinyi Liu, Yan Zheng, Jianye Hao, Bo Zheng

机构 * Tianjin University(天津大学) Alibaba(阿里巴巴)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对LLM强化学习中训练-推理概率不一致导致的策略不稳定问题,提出单调推理策略改进(MIPI)目标及两阶段框架MIPU,通过推理侧间隙代理选择候选更新,提升推理性能与训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24970 2026-06-25 cs.LG 新提交 91%

Don't Go Breaking My LLM: The Impact of Pruning Attention Layers on Explanation Faithfulness and Confidence Calibration

不要破坏我的LLM:剪枝注意力层对解释忠实性和置信度校准的影响

Pietro Tropeano, Maria Maistro, Tuukka Ruotsalo, Christina Lioma

机构 * University of Copenhagen(哥本哈根大学) LUT University(拉赫蒂理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究剪枝LLM注意力层对解释忠实性和置信度校准的影响,发现尽管准确率保持,但忠实性和校准度常下降,表明模型置信度、可解释性与准确性之间存在错位。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21023 2026-06-23 cs.LG 新提交 91%

Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL

揭秘LLM推理中的数值不稳定性:使用HEAL实现关键任务的可复现推理

Zhenting Zhu, Lucas Thai, Shan Yu, Yicheng Liu, Yifan Qiao, Chenxi Wang, Harry Xu, Junyi Shu

机构 * UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM在关键任务中因16位精度导致输出不一致的问题,提出HEAL方法,通过INT16量化和代数误差补偿,在保持FP32精度的同时减少性能开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16014 2026-06-16 cs.HC cs.AI cs.MA 新提交 91%

Orchestrated Reality: From Role-Play to Living, Playable Game Worlds -- LLM-Driven World Simulation as a Parameterized-Action POMDP

编排现实:从角色扮演到活生生的、可玩的游戏世界——作为参数化动作POMDP的LLM驱动世界模拟

Yuhang Huang, Chenmiao Li, Chaowei Fang

机构 * The University of Tokyo(东京大学) Individual Researcher(个人研究员)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出编排现实框架,将LLM驱动的游戏世界形式化为参数化动作POMDP,通过单例编排代理维护规范JSON状态,实现数值状态、叙事声音和规则逻辑的统一协调。

Comments 9 pages, 2 figures. Work in progress. Yuhang Huang and Chenmiao Li contributed equall

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00975 2026-06-02 cs.CL 91%

Lost in Delusion: Examining LLM Safety Under User Delusions and Distress

迷失在妄想中:审视用户妄想与痛苦下的LLM安全性

Andrew Aquilina, Chetna Nihalani, Vasudha Varadarajan, Nathan S. Fishbein, Yu-Ru Lin, Maarten Sap

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学) Fordham University(福特汉姆大学)

专题命中 效率与部署 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 本研究通过多轮对话模拟,发现LLM在检测用户痛苦时表现良好,但在痛苦嵌入妄想时干预行为显著减少(高达4.5倍),并提出针对性提示策略以缩小这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26660 2026-06-02 cs.LG 91%

WINDQuant: Weight-Informed Neural Decision-Making for Global Mixed-Precision LLM Quantization

WINDQuant: 权重感知的全局混合精度大语言模型量化神经决策

Phong Nam Huu Nguyen, Khoi M. Le, Cong-Duy T Nguyen, Anh Tuan Luu, Thong Thanh Nguyen, Tho Quan

机构 * CAIR, VinUniversity, Vietnam(越南 VinUniversity 的 CAIR) Ho Chi Minh City University of Technology (HCMUT), VNU-HCM, Ho Chi Minh City, Vietnam(越南胡志明市技术大学 (HCMUT)) CCDS, Nanyang Technological University, Singapore(新加坡南洋理工大学的 CCDS) School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出基于强化学习的WINDQuant控制器,在全局存储预算下为列块分配位宽和量化策略,实现超低位LLM量化的细粒度混合精度,性能优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24217 2026-05-27 cs.AI cs.DC 91%

Identifying and Mitigating Systemic Measurement Bias in Production LLM Inference Benchmarks

识别和减轻生产级LLM推理基准中的系统性测量偏差

Ashok Chandrasekar, Jason Kramberger

机构 * Google(谷歌)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对生产级LLM推理基准中因客户端排队导致的测量偏差,提出基于多进程的无偏评估框架和归一化输出令牌时间(NTPOT)指标,实现高并发下的准确性能评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11788 2026-05-26 cs.DC cs.IT cs.LG cs.NI eess.SP math.IT 91%

Communication-Efficient Hybrid Language Model via Uncertainty-Aware Opportunistic and Compressed Transmission

基于不确定性感知的机会主义与压缩传输的通信高效混合语言模型

Seungeun Oh, Jinhyuk Kim, Jihong Park, Seung-Woo Ko, Jinho Choi, Tony Q. S. Quek, Seong-Lyun Kim

机构 * School of Electrical and Electronic Engineering, Yonsei University, South Korea(延世大学电气电子工程学院,韩国) Information Systems Technology and Design pillar, Singapore University of Technology and Design, Singapore 487372(新加坡科技设计大学信息系统技术与设计支柱,新加坡487372) Department of Smart Mobility Engineering, Inha University, South Korea(Inha大学智能移动工程系,韩国) School of Electrical and Mechanical Engineering, The University of Adelaide, Australia(阿德莱德大学电气与机械工程学院,澳大利亚) Singapore University of Technology and Design, Singapore 487372(新加坡科技设计大学,新加坡487372)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract)

AI总结 提出通信高效的混合语言模型CU-HLM,通过不确定性感知的机会主义传输和词汇表压缩,在保持97.4%准确率的同时实现高达206倍的令牌吞吐量提升。

Comments 17 pages, 13 figures, 5 tables; This article has been accepted for publication in IEEE Transactions on Communications. This is the author's accepted version; the final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04653 2026-05-26 cs.CR cs.LG 91%

Inference-Time Backdoors via Chat Templates: From LLM Supply Chains to Agentic System Compromise

通过聊天模板的推理时后门:从LLM供应链到代理系统妥协

Ariel Fogel, Omer Hofman, Eilon Cohen, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.LG

AI总结 提出一种通过恶意修改聊天模板实现推理时后门攻击的方法,无需修改模型权重或训练数据,在LLM、代理和多代理系统层面均能成功攻击,且能绕过现有防御。

Comments V3: Accepted to ICLR 2026 Trustworthy AI Workshop, V4: Submitted to CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08008 2026-05-18 cs.LG 91%

Beyond Sunk Costs: Boosting LLM Pre-training Efficiency via Orthogonal Growth of Mixture-of-Experts

超越沉没成本:通过专家混合的正交增长提升LLM预训练效率

Ruizhe Wang, Yucheng Ding, Xiao Liu, Yaoxiang Wang, Peng Cheng, Baining Guo, Zhengjun Zha, Yeyun Gong

机构 * ustc(中国科学技术大学) msra(微软亚洲研究院) stju(上海交通大学) xmu(厦门大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出正交增长策略,通过优化专家混合模型的深度和宽度,提升LLM预训练效率,实验证明在相同计算预算下,模型准确率提升10.6%。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06402 2026-05-08 cs.LG 91%

SparseForge: Efficient Semi-Structured LLM Sparsification via Annealing of Hessian-Guided Soft-Mask

SparseForge:通过Hessian引导的软掩码退火实现高效的半结构化LLM稀疏化

Liu Hanzuo, Chaofan Lin, Weixuan Sun, Yulong Wang, Key, Rayying, Mingyu Gao

机构 * Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SparseForge通过优化稀疏掩码而非扩大重训练token数量,实现高效的半结构化LLM稀疏化,提升稀疏恢复效率,实验显示其在准确率与效率的权衡上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05344 2026-05-08 cs.CV cs.AI cs.IR 91%

Open-SAT: LLM-Guided Query Embedding Refinement for Open-Vocabulary Object Retrieval in Satellite Imagery

Open-SAT: 一种基于LLM的查询嵌入细化方法用于卫星影像开放词汇物体检索

Md Adnan Arefeen, Biplob Debnath, Ravi K. Rajendran, Murugan Sankaradas, Srimat T. Chakradhar

机构 * North South University(北南大学) NEC Laboratories America(NEC实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Open-SAT通过LLM引导在推理阶段优化查询与卫星影像内容的对齐,提升开放词汇检索性能,实验表明其F1分数提升达16.04%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25326 2026-05-01 cs.AR cs.AI 91%

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

AHASD:异步异构架构用于移动设备上的LLM自适应草案推测解码

Ma Zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AHASD提出一种异步异构架构,通过任务级DLM-TLM解耦和熵历史感知草案控制,提升移动设备上LLM自适应草案推测解码的吞吐量和能效。

Comments 7 pages, 9 figures, accepted by DAC 2026, repo: https://github.com/MAdrid1011/AHASD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20913 2026-04-24 cs.LG 91%

FairyFuse: Multiplication-Free LLM Inference on CPUs via Fused Ternary Kernels

FairyFuse:通过融合三进制内核实现CPU上的无乘法LLM推理

Fei Zuo, Xiaoyan Xi, Quanyi Zeng, Feiyu Wang, Ho Fai Leung

机构 * Peking University(北京大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FairyFuse,通过融合三进制权重的八次实值子GEMV,实现CPU上的无乘法LLM推理,显著提升性能,单CPU达到32.4 tokens/s,质量接近FP16。

Comments 16 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17627 2026-04-21 cs.LG cs.DC cs.PF 91%

SLO-Guard: Crash-Aware, Budget-Consistent Autotuning for SLO-Constrained LLM Serving

SLO-Guard:面向SLO约束的LLM服务自动调优:崩溃感知、预算一致

Christian Lysenstøen

机构 * Inland Norway University of Applied Sciences(内陆挪威应用科学大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SLO-Guard通过结合热预算退火与树结构帕泽估计器,实现崩溃感知的自动调优,提升LLM服务在SLO约束下的预算一致性与稳定性。

Comments 20 pages, 6 figures, 5 tables. Code and raw per-trial JSONL data: https://github.com/Chrislysen/SLO-Guard

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12171 2026-04-15 cs.DC cs.LG 91%

PipeLive: Efficient Live In-place Pipeline Parallelism Reconfiguration for Dynamic LLM Serving

PipeLive: 高效的动态LLM服务中实时管道并行性重新配置

Xu Bai, Muhammed Tawfiqul Islam, Chen Wang, Adel N. Toosi

机构 * DisNet Lab(DisNet实验室) University of Melbourne(墨尔本大学) IBM Research(IBM研究院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PipeLive通过实时在地管道并行性重新配置提升动态LLM服务效率,采用改进的KV缓存布局和PageAttention扩展,实现KV缓存动态调整与增量修补机制,显著降低TTFT和重新配置开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06370 2026-02-09 cs.CL 91%

Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production

面向成本的模型选择用于文本分类:在生产环境中细调编码器与LLM提示之间的多目标权衡

Alberto Andres Valdes Gonzalez

机构 * Pontifical Catholic University of Chile(天主教智利大学)

专题命中 效率与部署 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出在生产环境中细调编码器与LLM提示之间的多目标权衡,发现微调编码器在成本和性能上优于LLM提示。

Comments 26 pages, 12 figures. Empirical benchmark comparing fine-tuned encoders and LLM prompting for text classification under cost and latency constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04240 2025-05-27 cs.CL 91%

DiffPO: Diffusion-styled Preference Optimization for Efficient Inference-Time Alignment of Large Language Models

Ruizhe Chen, Wenhao Chai, Zhifei Yang, Xiaotian Zhang, Joey Tianyi Zhou, Tony Quek, Soujanya Poria, Zuozhu Liu

机构 * Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江医学影像人工智能重点实验室) Zhejiang University(浙江大学) SUTD(新加坡科技设计大学) Princeton University(普林斯顿大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) A*STAR Centre for Frontier AI Research(A*STAR前沿人工智能研究中心)

专题命中 效率与部署 :preference optimization(title,abstract);large language model(title);language model(title);RLHF(abstract)

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15556 2023-10-26 cs.CL cs.IR 91%

TCRA-LLM: Token Compression Retrieval Augmented Large Language Model for Inference Cost Reduction

Junyi Liu, Liangzhi Li, Tong Xiang, Bowen Wang, Yiming Qian

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

Comments EMNLP 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05210 2023-09-19 cs.CL 91%

Understanding the Impact of Post-Training Quantization on Large Language Models

Somnath Roy

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10692 2026-08-12 cs.CL cs.AI 新提交 91%

SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information

SPIEval:评估大型语言模型作为处理分散个人信息的移动助手的能力

Junjie Ye, Zhuohui Sheng, Shaofan Liu, Yulun Zhu, Wenjie Fu, Dingwei Zhu, Ming Zhang, Yujiong Shen, Weichao Wang, Xin Zhao, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang, Pluto Zhou

机构 * Fudan University(复旦大学) Tencent Hunyuan Team(腾讯混元团队)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究推出基于五种认知能力的人工策划基准SPIEval,评估9种LLMs作为移动助手处理分散个人信息的能力,发现其准确率最高仅57.3%,存在信息定位等显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01997 2026-08-07 cs.LG cs.AI 版本更新 91%

On the Limits of Layer Pruning for Generative Reasoning in Large Language Models

关于生成推理中大语言模型层剪枝的极限

Safal Shrestha, Anubhav Shrestha, Aadim Nepal, Minwu Kim, Keith Ross

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 研究发现层剪枝在分类任务中有效压缩模型但生成推理任务表现较差,揭示了剪枝对算法能力如算术和括号生成的影响,指出在受限条件下生成推理能力恢复有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20535 2026-07-30 cs.CL cs.AI 版本更新 91%

ARC-Encoder: learning compressed text representations for large language models

ARC-Encoder:为大语言模型学习压缩文本表示

Hippolyte Pilchen, Edouard Grave, Patrick Pérez

机构 * Kyutai

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 ARC-Encoder是可将文本压缩为原词元数1/4或1/8的编码器,适配多类LLM解码器,在提升推理效率的同时保持最优性能,为大语言模型提供灵活高效的上下文压缩方案。

Comments Featured Certification

Journal ref Transactions on Machine Learning Research 2026 (https://openreview.net/forum?id=lU1P9dsqfn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10252 2026-07-14 cs.CR cs.CL cs.LG 新提交 91%

One Token Is Enough: Fingerprinting and Verifying Large Language Models from Single-Token Output Distributions

一个令牌就够了:从单令牌输出分布中对大语言模型进行指纹识别和验证

Tomas Bruckner

机构 * Faculty of Informatics and Statistics, Prague University of Economics and Business(信息与统计学院,布拉格经济与商业大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究如何从大语言模型单令牌输出分布中进行指纹识别和验证。通过定义行为指纹,利用对简单提示的回答分布,实现模型谱系恢复和验证,还发现生态系统异常,且相关协议等已发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23568 2026-06-23 cs.LG cs.CL 新提交 91%

SVD-Surgeon: Optimal Singular-Value Surgery for Large Language Model Compression

SVD-Surgeon:面向大语言模型压缩的最优奇异值手术

Mahmoud Safari, Frank Hutter

机构 * University of Freiburg(弗莱堡大学) Prior Labs ELLIS Institute Tübingen(蒂宾根ELLIS研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出SVD-Surgeon,一种无需训练的方法,将最优脑外科医生框架引入奇异值基,通过闭式更新保留的奇异值补偿截断损失,并基于显著性选择修剪值,可叠加于现有SVD压缩器上,改善困惑度-压缩权衡。

Comments 8 pages, 3 figures, 5 tables; appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22153 2026-06-23 cs.CR cs.AI cs.CL 新提交 91%

$π$-RAG: Oblivious Retrieval via Semantic Quantization and Transcendental Addressing for Large Language Models

$\pi$-RAG:通过语义量化和超越寻址实现的大语言模型遗忘检索

Aniket Wattamwar, Mrunal Kakirwar

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出$\pi$-RAG架构,利用$\pi$的数字作为超越熵源,通过语义量化层将用户输入映射到规范意图质心,生成$\pi$-key实现遗忘检索,保障数据隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏