arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-25 至 2026-06-25 共收录 44 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 44 篇

2606.25039 2026-06-25 cs.LG cs.AI cs.CL math.DS 新提交 92%

LLM-ACES: Closed-Loop Discovery of Dynamical Systems with LLM-Guided Adaptive Search

LLM-ACES:基于LLM引导的自适应搜索的动力学系统闭环发现

Nikhil Abhyankar, Sha Li, Sanchit Kabra, Naren Ramakrishnan, Yulia Gel, Chandan K. Reddy

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LLM-ACES框架,利用大语言模型引导的主动闭环搜索,联合优化符号假设构建与自适应数据采集,从数据中发现常微分方程,在122个系统上取得最低中位NMSE和高达52.4%的符号准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25442 2026-06-25 cs.CL 新提交 92%

PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models

PolicyAlign: 大型语言模型的直接基于策略的安全对齐

Chang Wu, Junfeng Fang, Houcheng Jiang, Kai Tang, Pengyu Cheng, Xiaoxi Jiang, Guanjun Jiang, Xiang Wang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出PolicyAlign框架,通过合成违规指令和策略敏感过滤,直接根据自然语言安全策略对齐LLM,提升安全性并保持低过度拒绝和通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25285 2026-06-25 cs.LG cs.AI 新提交 92%

EPTS: Elastic Post-Training Sparsity for Efficient Large Language Model Compression

EPTS:弹性后训练稀疏性用于高效大型语言模型压缩

Ke Xu, Jiaqi Wan, Wenhao Hu, Han Pu, Xiaoyun Wang

机构 * School of Artificial Intelligence(人工智能学院) Anhui University(安徽大学) School of Computer Science and Technology(计算机科学与技术学院) Tiangong University(天工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出弹性后训练稀疏性(EPTS)框架,通过单次优化生成单一弹性模型,支持多种稀疏度配置,解决传统方法需为每个稀疏度单独优化的效率问题。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22327 2026-06-25 cs.AI 新提交 92%

Geometry-Aware Online Scheduling for LLM Serving: From Theoretical Bound to System Practice

面向LLM服务的几何感知在线调度:从理论界到系统实践

Li Kong, Qi Qi, Yinyu Ye, Zijie Zhou

机构 * Gaoling School of Artificial Intelligence(人工智能学院) Renmin University of China(中国人民大学) Department of Management Science and Engineering(管理科学与工程系) Stanford University(斯坦福大学) Department of Industrial Engineering and Decision Analytics(工业工程与决策分析系) HKUST(香港科技大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM推理中KV缓存动态内存占用问题,提出Smallest Volume First (SVF)算法,通过几何感知调度优化性能,理论证明将竞争比从48降至5,并在vLLM中实现即插即用,显著降低平均和尾部延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23132 2026-06-25 cs.CR cs.AI 版本更新 92%

Verifiable Manifest Signing and Transparency Enforcement for Secure MCP-Based LLM Pipelines

可验证的清单签名与透明度强制:面向基于MCP的安全LLM流水线

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Foutse Khomh, Mohammad Hamdaqa

机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院) SæT Laboratory, Polytechnique Montréal(SæT实验室,蒙特利尔理工学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对MCP协议缺乏工具清单认证的问题,提出清单级强制层,通过策略验证、新鲜度检查、数字签名、执行前验证和Merkle透明度日志,实现低开销、可追溯的LLM工具调用安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25353 2026-06-25 cs.AR 新提交 91%

Cache-Resident LLM Inference in GB-Scale Last-Level Caches

GB级末级缓存中的缓存驻留LLM推理

Wanning Zhang, Tongzhou Gu, Marco Canini, Ceyu Xu, Jian Weng

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种缓存驻留执行模型,通过权重-注意力解耦架构和子算子依赖同步,在具有GB级末级缓存的CPU上实现LLM推理加速,TPOT提升2.04-13.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24970 2026-06-25 cs.LG 新提交 91%

Don't Go Breaking My LLM: The Impact of Pruning Attention Layers on Explanation Faithfulness and Confidence Calibration

不要破坏我的LLM:剪枝注意力层对解释忠实性和置信度校准的影响

Pietro Tropeano, Maria Maistro, Tuukka Ruotsalo, Christina Lioma

机构 * University of Copenhagen(哥本哈根大学) LUT University(拉赫蒂理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究剪枝LLM注意力层对解释忠实性和置信度校准的影响,发现尽管准确率保持,但忠实性和校准度常下降,表明模型置信度、可解释性与准确性之间存在错位。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18266 2026-06-25 cs.LG 版本更新 90%

A Probabilistic Framework for LLM-Based Model Discovery

基于LLM的模型发现的概率框架

Stefan Wahl, Raphaela Schenk, Ali Farnoud, Jakob H. Macke, Daniel Gedon

机构 * Machine Learning in Science, University of Tübingen, Tübingen, Germany(图宾根大学机器学习科学系,图宾根,德国) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心,图宾根,德国) Department Empirical Inference, Max Planck Institute for Intelligent Systems, Tübingen, Germany(经验推断部门,智能系统马克斯·普朗克研究所,图宾根,德国)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 将模型发现重新定义为概率推理问题,提出基于序贯蒙特卡洛采样的ModelSMC算法,利用LLM迭代提出和优化候选模型,并通过似然加权选择,在真实科学系统中发现可解释机制并改进后验预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25426 2026-06-25 cs.PF 新提交 89%

Above the Inner Loop: Exceeding Accelerate at LLM Prefill GEMM on the M1 AMX

在内循环之上:在M1 AMX上超越Accelerate的LLM预填充GEMM

Deyvik Bhan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 通过微基准测试发现M1 AMX的内循环受限于加载-发射,手写内核通过细粒度多线程面板和预打包权重两个部署级杠杆超越Accelerate,在12种LLM预填充GEMM形状上实现1.17倍到2.0倍的加速,且位精确。

Comments 11 pages, 2 figures, 6 tables. Code: https://github.com/dbhan08/inferc

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29919 2026-06-25 cs.SE 版本更新 89%

SkillReducer: Optimizing LLM Agent Skills for Token Efficiency

SkillReducer: 优化LLM代理技能的令牌效率

Yudong Gao, Zongjie Li, Yuanyuan Yuan, Zimo Ji, Pingchuan Ma, Shuai Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM代理技能中令牌浪费问题,提出SkillReducer两阶段优化框架,通过压缩路由描述和重构技能主体,实现48%描述压缩和39%主体压缩,同时提升功能质量2.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01708 2026-06-25 cs.DC cs.AI cs.LG 版本更新 89%

SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving

SplitZip:超快无损KV压缩用于解耦的大语言模型服务

Yipin Guo, Siddharth Joshi

机构 * University of Notre Dame IN, USA(诺丁汉大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SplitZip通过GPU友好的无损压缩技术,提升大规模LLM服务中KV缓存的传输效率,实现快速压缩和解压,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29813 2026-06-25 cs.SE 版本更新 89%

Compiling Code LLMs into Lightweight Executables

将代码LLM编译为轻量级可执行文件

Jieke Shi, Junda He, Zhou Yang, Chengran Yang, Mykhailo Klymenko, Thong Hoang, Xiwei Xu, Zhenchang Xing, David Lo

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Ditto框架,通过量化技术和LLVM编译优化,将代码LLM模型和推理程序编译为轻量级可执行文件,实现推理速度提升、内存和能耗降低,同时保持高精度。

Comments Accepted at the 34th ACM International Conference on the Foundations of Software Engineering (FSE 2026), 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-06-25 cs.CE 新提交 88%

Retrieval-Grounded Multilingual LLM Assistance for Island Smallholder Farmers

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02156 2026-06-25 cs.NI cs.AI 版本更新 88%

How Small Can 6G Reason? Scaling Tiny-to-Small Language Models for AI-Native Networks

6G 推理能有多小?面向 AI 原生网络的微小型语言模型缩放

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿联酋大学) Research Institute for Digital Future, Khalifa University, UAE(未来数字研究院,哈利法大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title);large language model(abstract);分类 cs.AI

AI总结 本文系统研究小型语言模型在 6G 网络语义推理中的缩放行为与部署效率,发现 1.5B-3B 参数的中等模型在确定性稳定性和计算效率间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23001 2026-06-25 cs.SE cs.LG cs.OS 新提交 87%

EnerInfer: Energy-Aware On-Device LLM Inference

EnerInfer: 能量感知的设备端大语言模型推理

Bohua Zou, Nian Liu, Binqi Sun, Matteo Mascherin, Debayan Roy, Yutao Liu, Yu Peng, Ning Jia, Haibo Chen

机构 * Technical University of Munich(慕尼黑技术大学) Huawei Hilbert Research Center (Dresden)(华为希利伯特研究中心(德累斯顿)) Huawei Central Software Institute(华为中央软件研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG

AI总结 针对设备端LLM推理中能量与散热瓶颈,提出EnerInfer框架,通过解耦预测与在线反馈动态调整NPU/DDR频率,在保证服务质量前提下提升能效达65%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18837 2026-06-25 cs.MA cs.AI cs.LG 新提交 87%

Skill-MAS: Evolving Meta-Skill for Automatic Multi-Agent Systems

Skill-MAS: 演化元技能以自动生成多智能体系统

Hehai Lin, Qi Yang, Chengwei Qin

机构 * Ant Group(蚂蚁集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Skill-MAS,通过将高层编排能力解耦为可演化的元技能,在无需参数更新的情况下实现经验保留,利用多轨迹采样和选择性反思优化元技能,在多个基准和LLM上取得显著性能提升且成本可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25324 2026-06-25 cs.CV 新提交 85%

Efficient Remote Sensing Instance Segmentation with Linear-Time State Space Distilled Visual Foundation Models

高效遥感实例分割:基于线性时间状态空间蒸馏的视觉基础模型

Qinzhe Yang, Keyan Chen, Jia Xu, Zhenwei Shi, Zhengxia Zou

机构 * Shen Yuan Honors College, Beihang University(北京航空航天大学沈元荣誉学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Qian Xuesen Laboratory of Space Technology, China Academy of Space Technology(中国空间技术研究院钱学森空间技术实验室)

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对Transformer在遥感实例分割中计算复杂度高的问题,提出基于知识蒸馏的线性复杂度状态空间模型RS4D,通过蒸馏ViT知识至轻量SSM骨干,实现参数减少8倍、FLOPs减少9倍且精度相当。

Comments 17 pages, 11 figures, has been published in IEEE TGRS vol. 64, pp. 5625417-5625417, 2026, Art no. 5625417, doi: 10.1109/TGRS.2026.3696104

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 5625417-5625417, 2026, Art no. 5625417

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24965 2026-06-25 cs.AI cs.LG 新提交 82%

Project Auto-World: Towards Automated Benchmarking of Neural Relational Reasoners

Project Auto-World: 迈向神经关系推理器的自动化基准测试

Anirban Das, Joanne Boisson, Irtaza Khalid, Sumita Garai, Steven Schockaert

机构 * Cardiff University(卡迪夫大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 利用大语言模型自动化生成基准测试实例,通过进化搜索和自主代理搜索发现困难样本,提升Edge Transformer的泛化能力,并应用于新世界以推动神经关系推理的自主研究。

Comments Submitted to NeurIPS 2026 E&D track. Code is available at https://github.com/autoworldrules/auto-world-rules

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25403 2026-06-25 eess.AS cs.AI cs.SD 交叉投稿 81%

CrossAccent-TTS: Cross-Lingual Accent-Intensity Controllable Text-to-Speech via Disentangled Speaker and Accent Representations

CrossAccent-TTS:通过解耦说话人和口音表示实现跨语言口音强度可控文本转语音

Ram Annamdevula, Ankit Tatawat, Ashishkumar P. Gudmalwar, Nirmesh J. Shah, Pankaj Wasnik

机构 * Media Analysis, Sony Research India(索尼印度研究机构媒体分析部)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CrossAccent-TTS框架,通过口音强度控制器(AIC)注入加权语言嵌入到口音子空间,实现跨语言口音控制与转换,同时保持说话人身份,在Indic Multilingual和L2-arctic数据集上优于基线。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25532 2026-06-25 cs.AI cs.AR cs.LG cs.MA 新提交 81%

Agentic evolution of physically constrained foundation models

物理约束基础模型的智能体演化

Jiangwei Zhang, Wen Sun, Chong Wang, Shiyao Li, Cheng Che, Chunjing Han, Dan Meng, Jian Yang, Yu Wang, Rui Hou

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出基于演化知识图谱的多智能体发现引擎,自动设计硬件兼容计算系统,在基础模型部署中演化出超越人工的压缩方法,实现大规模模型高效部署。

Comments 29 pages, 5 main figures and 4 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24898 2026-06-25 cs.LG cs.AI 新提交 81%

Dense Supervision Is Not Enough: The Readout Blind Spot in Looped Language Models

密集监督还不够:循环语言模型中的读出盲点

Rituraj Sharma, Tu Vu

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文揭示循环语言模型中密集交叉熵损失仅控制读出变量,忽略隐藏状态尺度,导致尺度失控;提出尺度可见读出、显式范数惩罚或尺度移除循环的修复方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25207 2026-06-25 cs.LG cs.AI cs.CL 新提交 80%

ASAP: Agent-System Co-Design for Wall-Clock-Centered Auto HPO Research for ML Experiments

ASAP: 面向ML实验的以挂钟时间为中心的自动HPO研究的智能体-系统协同设计

Taicheng Guo, Haomin Zhuang, Kehan Guo, Yujun Zhou, Nitesh V. Chawla, Olaf Wiest, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ASAP框架,通过智能体集成多种优化器并利用系统级优化(前缀稳定提示、推测并行、自适应调优)减少端到端挂钟时间,在多样HPO任务中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25160 2026-06-25 cs.RO cs.CV 新提交 78%

Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding

面向低延迟视觉语言模型:在自我中心视觉理解中实现双重正确预测

Qitong Wang, Fan Du, Pranav Maneriker, Jihui Jin, Christopher Rasmussen

机构 * Dolby Laboratories, Inc.(杜比实验室公司) University of Delaware(特拉华大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 针对人机协作中低延迟需求,提出基于双重正确预测的剪枝策略,在保持证据定位的同时提升预测准确性,在自我中心视频数据集上实现最高精度与双重正确性。

Comments International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24369 2026-06-25 cs.AI cs.DC cs.NI cs.PF 新提交 77%

Accelerating Disaggregated RL for Visual Generative LLMs with Diffusion-Based Parallelism and Trainer-Assisted Generation

加速面向视觉生成式大语言模型的解耦强化学习:基于扩散并行与训练器辅助生成

Sijie Wang, Zhengyu Qing, Zhiqiang Tan, Yiming Yin, Yeqing Zhang, Yaoyuan Wang, Qiang Wang, Xiaowen Chu, Shaohuai Shi

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)数据科学与分析学域) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出解耦强化学习框架DigenRL,通过生成轴流水线、时间步并行和弹性训练器辅助生成,解决扩散生成式大语言模型中执行气泡问题,实现1.56-2.10倍吞吐提升。

Comments Withdrawn by the authors pending resolution of intellectual property and institutional disclosure requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17917 2026-06-25 cs.LG cs.AI cs.CL cs.CV 版本更新 75%

Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding

Streaming-dLLM: 通过后缀剪枝和动态解码加速扩散大语言模型

Zhongyu Xiao, Zhiwei Hao, Jianyuan Guo, Yong Luo, Jia Liu, Jie Xu, Han Hu

机构 * School of information(信息学院) Electronics, Beijing Institute of Technology, Beijing(电子学院,北京理工大学,北京) Department of Computer Science, City University of Hong Kong, Hong Kong(计算机科学系,香港城市大学,香港) School of Computer Science, Wuhan University, Wuhan(计算机科学学院,武汉大学,武汉) School of Economics(经济学院) Management, Communication University of China, Beijing(管理学院,中国传媒大学,北京) School of Science(科学学院) Engineering, The Chinese University of Hong Kong (Shenzhen), Shenzhen(工程学院,香港中文大学(深圳),深圳)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Streaming-dLLM,通过空间上的注意力引导后缀建模剪枝冗余掩码令牌和时间上的动态置信度感知早停策略,实现无需训练的扩散大语言模型推理加速,最高达68.2倍加速且保持生成质量。

Comments Tech report. Code is available at https://github.com/xiaoshideta/Streaming-dLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25152 2026-06-25 cs.CL cs.AI 新提交 73%

Hitting a Moving Target: Test-Time Adaptation for AI Text Detection under Continual Distribution Shift

击中移动目标:持续分布漂移下AI文本检测的测试时适应

Kevin Ren, Manish Raghavan, Nikhil Garg

机构 * Cornell Tech(康奈尔科技) MIT(麻省理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种基于半监督学习的测试时适应方法,利用推理时未标记样本的同质性,应对AI文本检测中持续出现的分布漂移,显著优于现有监督检测器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24957 2026-06-25 cs.CL cs.LG 新提交 73%

Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding

Dustin: 用于高效长上下文推测解码的草稿增强稀疏验证

WenHung Lee, Jian-Jia Chen, Xiaolin Lin, Pei-Shuo Wang, Chi-Chih Chang, Chun-Che Yang, Ning-Chi Huang, Grace Li Zhang, Kai-Chiang Wu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Cornell University(康奈尔大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出Dustin框架,利用草稿模型的前瞻信号和目标模型的历史注意力,在推测解码中实现高效稀疏验证,显著加速长上下文生成。

Comments Accepted to ICML 2026. 9 pages main text, includes references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24915 2026-06-25 cs.CL cs.AI cs.IR 新提交 73%

Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction

错误感知的TF-IDF检索增强生成用于ASR错误纠正

Mohammad Aref Jafari-Raddani

机构 * Department of Computer Engineering, Qom University of Technology(库姆科技大学计算机工程系) Asa Electronic Akhtaran(阿萨电子阿赫塔兰公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种纯词法的错误感知检索增强生成框架,通过对称文本归一化和基于历史错误的稀疏对角惩罚矩阵,将FLEURS波斯语子集的错误感知命中率从53.7%提升至90.9%,最终词错误率从23.06%降至18.83%。

Comments 4 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25960 2026-06-25 cs.AI 新提交 70%

Agentic System as Compressor: Quantifying System Intelligence in Bits

智能体系统作为压缩器:用比特数衡量系统智能

Zihan Qin, Hongrui Zhang

机构 * Peking University(北京大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出将智能体系统视为压缩器,通过算术编码等方法以比特数衡量系统智能,在五个任务中验证智能体组件能减少编码长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25533 2026-06-25 cs.CR cs.CL 新提交 70%

Security and Privacy in Retrieval-Augmented Generation: Architectures, Threats, Defenses, and Future Directions for Building Trustworthy Systems

检索增强生成中的安全与隐私:构建可信系统的架构、威胁、防御与未来方向

Balamurugan Palanisamy, G S S Chalapathi, Vikas Hassija, Rajkumar Buyya

机构 * Department of Electrical and Electronics Engineering(电子与电气工程系) Birla Institute of Technology and Science, Pilani, Pilani Campus(比拉理工学院和科学学院,比拉校区) Department of Computer Engineering, KIIT University(计算机工程系,KIIT大学) Quantum Cloud Computing and Distributed Systems (qCLOUDS) Laboratory(量子云计算与分布式系统(qCLOUDS)实验室) Department of Computing and Information Systems(计算与信息系统系) The University of Melbourne(墨尔本大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了检索增强生成系统在集中式、设备端、联邦和混合范式下的隐私与安全挑战,提出了涵盖检索、上下文构建和生成阶段的统一威胁分类,并分析了攻击类别及防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏