arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1009 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1009 篇

2510.22963 2026-06-23 cs.CR cs.AI 版本更新 87%

When Compression Becomes an Attack Surface: Black-Box Attacks on Prompt-Compressed LLM Agents

当压缩成为攻击面:针对提示压缩的LLM智能体的黑盒攻击

Zesen Liu, Zhixiang Zhang, Yuchong Xie, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出当可信与不可信输入共享压缩预算时,攻击者可通过扰动不可信输入导致压缩器丢弃关键证据或安全护栏,并设计黑盒攻击COMA,平均攻击成功率达0.71。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29128 2026-06-11 cs.LG 版本更新 87%

Apertus LLM Family Expansion via Distillation and Quantization

通过蒸馏和量化扩展 Apertus LLM 系列

Andrei Panferov, Davit Melikidze, Martin Jaggi, Dan Alistarh

机构 * LLM Family Expansion via Distillation and Quantization(LLM家族通过蒸馏和量化进行扩展)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文通过蒸馏和量化方法,基于 Apertus 8B 模型低成本扩展出参数高达 4B 的模型系列,覆盖多种硬件约束并保持强准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08779 2026-06-10 cs.LG 版本更新 87%

Reformulate LLM Reinforcement Learning for Efficient Training under Black-box Discrepancy

重新制定LLM强化学习以在黑箱差异下高效训练

Jiashun Liu, Runze Liu, Xu Wan, Jing Liang, Hongyao Tang, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学) Tianjin University(天津大学)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.LG

AI总结 针对强化学习中的训练-推理差异问题,提出差异约束马尔可夫决策过程(DCMDP),通过拉格朗日松弛自适应平衡性能提升与差异控制,实现稳定高效训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21854 2026-06-09 cs.CV cs.AI 版本更新 87%

CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models

CrossVLA: 跨范式后训练和推理优化用于视觉-语言-动作模型

Zhi Liu

机构 * Tianjin University(天津大学)

专题命中 效率与部署 :post-training(title,abstract);SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文研究了视觉-语言-动作(VLA)模型的跨范式后训练方法,提出了CrossVLA框架,通过改进的连续动作流匹配估计器、对比LoRA和DoRA参数高效层的性能,并揭示了推理过程中去噪循环对延迟的影响,最终实现了在LIBERO数据集上的显著提升。

Comments Workshop draft, 14 pages, 4 figures. Code, ckpts, data: https://github.com/lz-googlefycy/vla-lab

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28617 2026-08-07 cs.AI cs.CL cs.CY cs.HC 版本更新 87%

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

AISPA:面向大语言模型应用的以用户为中心的系统提示审计框架

Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学) CMU(卡内基梅隆大学) UT Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) UCSB(加利福尼亚大学圣巴巴拉分校) WashU(华盛顿大学) OSU(俄亥俄州立大学) UCSC(加利福尼亚大学圣克鲁兹分校) Northwestern University(西北大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) KAUST(阿卜杜拉国王科技大学) MIT(麻省理工学院) University of Oxford(牛津大学) Institute for Decentralized AI(去中心化人工智能研究所)

专题命中 效率与部署 :large language model(title);language model(title);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出以用户为中心的AISPA框架,审计88款商业AI产品的3249条系统提示指令,发现其设计差异大、保护指令范围浅、长度增长但仍存问题指令,凸显系统提示需更高透明度与监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10367 2026-08-06 cs.CL cs.AI 版本更新 87%

Large-Small Model Collaboration for Enhancing Edge-Deployed Small Models

用于增强边缘部署小模型的大小模型协作

Peigen Liu, Yijiang Fan, Zixuan Xu, Yuren Mao, Longbin Lai, Ying Zhang

专题命中 效率与部署 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);language model(abstract);small language model(abstract)

AI总结 该研究提出自适应边缘-云框架G-Boost,通过动态选择推理或对数融合的协作方式,提升边缘部署小语言模型的任务性能,在两个数学推理数据集上优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14581 2026-08-04 cs.LG cs.AI 版本更新 87%

CARE: Context-Aware Ranking Evolution with Executable Scoring Programs for Budgeted Reaction Optimization

CARE:通过科学实验中的可审计证据审查控制LLM生成的策略

Guanyu Liu, Weiyi Kong, Chao Tang, Zeyu Wang, Boer Zhang, Baiqing Li, Peiyu Zhang, Tianyu Shi

机构 * University of Macau(澳门大学) University of Toronto(多伦多大学) UCLA(加州大学洛杉矶分校) Harvard University(哈佛大学) XtalPi(晶泰科技) McGill University(麦吉尔大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI、cs.LG

AI总结 提出CARE框架,通过可审计的干预门控机制,在保留非LLM优化器作为默认路径的同时,利用LLM修正挑战者排序策略,显著提升高通量实验优化性能。

Comments 27 pages, 5 figures. Code: https://github.com/SHITIANYU-hue/care

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15250 2026-07-22 cs.LG cs.AI 版本更新 87%

GQLA: Group-Query Latent Attention for Hardware-Adaptive Large Language Model Decoding

GQLA: 面向硬件自适应的大语言模型解码的分组查询潜在注意力

Fanxu Meng

机构 * Institute for Artificial Intelligence(人工智能研究院)

专题命中 效率与部署 :large language model(title);language model(title);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出GQLA,一种对MLA的极小修改,通过暴露MQA和GQA两种等价解码路径,使单一权重集在不同硬件(如H100和H20)上达到最优性能,并支持零冗余张量并行,同时通过TransGQLA将预训练GQA检查点转换为GQLA模型,显著压缩KV缓存。

Comments https://github.com/MuLabPKU/TransArch

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05482 2026-07-22 cs.AI cs.CL cs.MA 版本更新 87%

FinRAG-12B: A Production-Validated Recipe for Grounded Question Answering in Banking

FinRAG-12B:一家银行中基于事实的问题回答的生产验证配方

Denys Katerenchuk, Pablo Duboue, Keelan Evanini, David Gondek, Nithin Govindugari, Olivier Allauzen, Joshua Baptiste, David J More, Joshua Schechter

机构 * Kasisto Textualization NBME

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种高效框架,通过数据生成管道和校准拒绝机制,提升银行领域LLM的准确性与合规性,实现7.1个百分点的查询解决率提升。

Comments 7 pages, ACL 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04115 2026-07-15 cs.LG cs.AI 版本更新 87%

dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats

dMX: 低精度浮点格式的可微分混合精度分配

Giuseppe Franco, Ian Colbert, Pablo Monteagudo-Lago, Felix Marty, Nicholas Fraser

机构 * AMD

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出可微分混合精度量化框架 dMX,通过连续优化每层浮点格式参数并配合退火调度和正则化项,实现硬件兼容的 MXFP 格式分配,在 LLM 上取得帕累托最优效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07994 2026-06-09 cs.CL cs.AI 版本更新 87%

DYCP: Dynamic Context Pruning for Long-Form Dialogue with LLMs

DYCP:基于LLMs的长格式对话动态上下文修剪

Nayoung Choi, Jonathan Zhang, Jinho D. Choi

机构 * Computer Science Emory University(计算机科学 埃默里大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DYCP通过动态识别和检索对话段落,提升长格式对话中LLM的上下文管理效率,实现更精确的上下文选择和推理效率提升。

Comments Accepted (B) to TACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11688 2026-07-31 cs.NI cs.DC 版本更新 87%

GORGO: Online Tuning for Cross-Region Network-Aware LLM Serving

GORGO:面向跨区域网络感知的LLM服务的在线调优

Alessio Ricci Toniolo, Rome Thorstenson, Abinaya Dinesh

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出GORGO代理架构,通过可调参数综合考量网络延迟、预填充成本和排队延迟,并发布长上下文数据集ART-Chat-2.5M,利用进化策略优化p95 TTFT,在保留测试中p95 TTFT提升6.9-15.5%,端到端延迟提升14.3-30.9%。

Comments 12 pages, 4 figures. Code: https://github.com/Arcadia-Research-Team/GORGO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01415 2026-07-14 cs.MA 版本更新 87%

Evidence-Decision-Feedback: Theory-Driven Adaptive Scaffolding for LLM Agents

证据-决策-反馈:面向LLM代理的理论驱动自适应支架框架

Clayton Cohn, Siyuan Guo, Surya Rayala, Hanchen David Wang, Naveeduddin Mohammed, Umesh Timalsina, Shruti Jain, Angela Eeds, Menton Deweese, Pamela J. Osborn Popp, Rebekah Stanton, Shakeera Walker, Meiyi Ma, Gautam Biswas

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出EDF框架,通过Copa代理在真实课堂中展示其能有效引导反馈与学生理解一致,促进支架退化,并提供可解释的证据支持解释。

Comments Published as a long paper in the proceedings of the 27th International Conference on Artificial Intelligence in Education (AIED26)

Journal ref International Conference on Artificial Intelligence in Education. Cham: Springer Nature Switzerland, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05299 2026-06-16 cs.LG cs.AI cs.CL cs.SD 版本更新 87%

WavSLM: Single-Stream Speech Language Modeling via WavLM Distillation

WavSLM: 通过WavLM蒸馏的单流语音语言建模

Luca Della Libera, Cem Subakan, Mirco Ravanelli

机构 * Concordia University(康科迪亚大学) Mila-Quebec AI Institute(蒙特利尔AI研究所) Université Laval(拉瓦尔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出WavSLM,通过量化蒸馏WavLM自监督表示到单一码本并优化自回归下一块预测,实现无文本监督的单流语音语言建模,在一致性和生成任务上表现竞争。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10538 2026-08-17 cs.AI 版本更新 86%

SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models

SKILLER:面向小型语言模型可复用技能提取的语言级强化学习框架

Chenhao Dang, Siyuan Xiong, Conghui He, Weijia Li

专题命中 效率与部署 :language model(title,abstract);small language model(title);分类 cs.AI

AI总结 研究针对小型语言模型技能生成成本高的问题,提出SKILLER框架,经实验在多基准上优于现有方法,性能接近闭源模型,可大幅降低智能体技能部署成本。

Comments 15 pages, 6 figures, and 8 tables. Project and code: this https URL (https://github.com/DANG-ai/SKILLER)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08756 2026-08-14 cs.AI cs.NE 版本更新 86%

AHD Agent: Agentic Reinforcement Learning for Automatic Heuristic Design

AHD代理:用于自动启发式设计的代理强化学习

Haoze Lv, Ning Lu, Ziang Zhou, Yew-Soon Ong, Shengcai Liu

机构 * Guangdong Provincial Key Laboratory of Brain-Inspired Intelligent Computation(广东脑启发智能计算重点实验室) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Zhongguancun Academy(中关村学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AHD Agent,一种多轮框架,使LLM能主动决定生成启发式或调用工具获取环境证据,通过代理强化学习提升自动启发式设计效率。

Comments 8 pages, 7 figures for main content

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04426 2026-08-06 cs.AI 版本更新 86%

XGrammar-2: Dynamic and Efficient Structured Generation Engine for Agentic LLMs

XGrammar-2: 面向智能体LLM的高效动态结构化生成引擎

Linzhang Li, Yixin Dong, Guanjie Wang, Ziyi Xu, Alexander Jiang, Tianqi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Carnegie Mellon University, NVIDIA(卡内基梅隆大学,NVIDIA)

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 针对智能体LLM中动态结构化生成(如工具调用和响应协议)的挑战,提出XGrammar-2引擎,通过标签触发结构切换和跨语法子结构缓存实现高效编译与近零开销。

Comments 9 pages, ACM CAIS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05698 2026-08-04 cs.AI 版本更新 86%

AIC-VDS: Attention-Based In-Context Learning for Joint Velocity Control and Data Collection Scheduling in Multi-UAV-Assisted Pipeline Monitoring

AIC-VDS:面向多无人机辅助管道监测的联合速度控制与数据采集调度的基于注意力的上下文学习

Yousef Emami, Miguel Gutierrez Gaitan, Atefeh Hajijamali Arani, Jingjing Zheng, Hao Zhou

机构 * IEEE

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多无人机辅助管道监测中丢包率高的问题,提出AIC-VDS框架,通过注意力模块压缩输入后利用LLM生成调度与速度决策,可将平均提示长度降50%并稳定丢包率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17109 2026-07-30 cs.LG 版本更新 86%

SENSE: Efficient EEG-to-Text via Privacy-Preserving Semantic Retrieval

SENSE:通过隐私保护的语义检索实现高效的EEG到文本

Akshaj Murhekar, Christina Liu, Abhijit Mishra, Shounak Roychowdhury, Jacek Gwizdka

机构 * School of Information, The University of Texas at Austin(信息学院,德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SENSE通过本地语义检索和提示语言生成,实现无需微调LLM的EEG到文本转换,提升效率并保护隐私。

Comments Accepted to ACM International Conference on Multimodal Interaction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14675 2026-07-24 cs.RO cs.AI 版本更新 86%

An Intelligent-Cloud Edge Multimodal Interaction System for Robots

一种用于机器人的智能云边缘多模态交互系统

Zihan Guo, Xiaoqi Li

机构 * Hainan University(海南大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对复杂环境下资源受限机器人的交互问题,提出云边缘多模态交互框架,集成增强YOLO手势检测器与LLM、VLM智能体,改进手势检测方法,经实验验证该系统在手势检测精度、任务成功率及用户满意度方面表现良好,证明了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13093 2026-07-24 cs.CR cs.AI 版本更新 86%

Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models

大语言模型的高效且隐私感知的边缘云协作推理

Cheng Li, Jiexiong Liu, Yixuan Chen, Yi Li

机构 * KunlunMeta(昆仑元)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 研究大语言模型推理难题,提出基于端点认证键值缓存的边缘云协作推理框架,本地端点与云端分工协作,经优化支持多种设备,评估显示该框架能降延迟和载荷,性能与全云端推理相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19938 2026-07-15 cs.LG 版本更新 86%

A Replicate-and-Quantize Strategy for Plug-and-Play Load Balancing of Sparse Mixture-of-Experts LLMs

用于稀疏专家混合模型LLM插拔式负载平衡的复制和量化策略

Zijie Liu, Jie Peng, Jinhao Duan, Zirui Liu, Kaixiong Zhou, Mingfu Liang, Luke Simon, Xi Liu, Zhaozhuo Xu, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Minnesota Twin Cities(明尼苏达大学双城分校) North Carolina State University(北卡罗来纳州立大学) Meta AI Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Replicate-and-Quantize策略,通过动态工作量重新平衡提升稀疏混合专家模型LLM的推理效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18224 2026-07-02 cs.DC cs.LG 版本更新 86%

FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel

FSA:原生稀疏注意力核的一种替代高效实现

Ran Yan, Youhe Jiang, Zhuoming Chen, Haohui Mai, Beidi Chen, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对现有稀疏注意力核在GQA组中查询头数较少时效率低的问题,提出Flash Sparse Attention (FSA)核实现,通过优化循环顺序,在多种流行LLM上实现平均1.6倍核延迟降低和1.09倍端到端训练加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02982 2026-06-23 cs.PF cs.DC cs.LG 版本更新 86%

DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference

DriftSched: 多租户GPU推理中运行时令牌漂移下的自适应QoS感知调度

Kathiravan Palaniappan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出DriftSched框架,通过运行时反馈驱动的漂移补偿和自适应偏差校正,解决多租户LLM推理中令牌漂移导致的调度问题,在NVIDIA L4 GPU上实现平均38.8%的估计误差降低和42%的中位延迟改善。

Comments 19 pages, 34 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29299 2026-06-23 cs.CV cs.AI 版本更新 86%

Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models

口袋牙医:通过高效多模态大语言模型实现设备端牙科图像理解

Kai Bian, Xucheng Guo, Bin Chen, Lingyan Ruan, Yiran Shen, Ting Dang, Hong Jia

机构 * The University of Auckland, New Zealand(奥克兰大学) Shandong University, China(山东大学) The University of Melbourne, Australia(墨尔本大学)

专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 提出Pocket-Dentist基准,通过评估14种视觉语言模型发现紧凑模型(2B参数)在牙科图像理解中精度更高且计算成本更低,并在iPhone 17 Pro上实现低延迟部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05261 2026-06-09 cs.IR cs.LG 版本更新 86%

Improving User Experience with Personalized Review Ranking and Summarization

通过个性化评论排名和摘要提升用户体验

Muhammad Jawad Mufti, Omar Hammad, MD. Mahfuzur Rahman

机构 * Information and Computer Science Dept., King Fahd University of Petroleum and Minerals(信息与计算机科学系,国王法赫德石油与矿物大学) Interdisciplinary Research Center for Intelligent Secure Systems (IRC-ISS), King Fahd University of Petroleum and Minerals(智能安全系统交叉研究中心(IRC-ISS),国王法赫德石油与矿物大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出融合用户偏好建模、混合情感估计、方面级评论匹配和LLM摘要的个性化评论排名与摘要框架,在亚马逊数据集和用户研究中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23815 2026-08-17 cs.DB cs.AI cs.CL 版本更新 86%

Kalypso: Relational LLM Serving

卡利普索:关系型大语言模型服务

Hojae Son, Md Ashraful Islam, Huy Gia Cao, Hui Guan, Marco Serafini

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何提升大语言模型服务语义查询效率,提出关系型大语言模型服务,通过跨语义运算符流水线执行复用KV缓存状态,卡利普索系统利用自适应算法执行查询计划,解决在线调度问题,相比基线系统大幅提高查询完成时间。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18867 2026-08-11 cs.LG cs.CL 版本更新 86%

HindsightBench: A Black-Box Behavioral Audit Protocol for Parametric Hindsight in Time-Indexed LLM Decision Tasks

HindsightBench:用于时间索引语言模型决策任务中参数后见之明的黑盒行为审计协议

Haozhe Jia

机构 * University College Dublin(都柏林大学学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型在金融决策任务中泄露参数知识的问题,提出HindsightBench黑盒行为审计协议,通过特定矩阵、探测及指标分析参数后见之明,应用于多模型获三个主要模式,揭示模型特性及审计结果与服务的关系,还发布相关数据。

Comments 17 pages, 3 figures. Code, panel, and per-model audit rows: https://github.com/Khaozhe/hindsightbench (v1.0 release archived at doi:10.5281/zenodo.21453191)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01928 2026-08-06 cs.CL cs.LG 版本更新 86%

Esoteric Language Models: A Family of Any-Order Diffusion LLMs

深奥语言模型:一类任意阶扩散LLM

Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat

机构 * Cornell University(康奈尔大学) NVIDIA(英伟达)

专题命中 效率与部署 :language model(title,abstract);LLM(title_cn);分类 cs.CL、cs.LG

AI总结 提出Eso-LMs模型,融合自回归与掩码扩散范式,通过因果注意力实现精确似然计算和KV缓存,在速度-质量帕累托前沿上达到新最优。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24192 2026-07-30 cs.IT cs.CL cs.LG math.IT 版本更新 86%

LLM-based Source Code Compression via Thresholded Symbol Ranking

基于阈值符号排序的基于大语言模型的源代码压缩

Angelo Nardone, Paolo Ferragina

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究基于大语言模型的源代码无损压缩问题,提出两种阈值符号排序变体,将预测限制在前\(T\)个排名,通过通用压缩器联合压缩阈值外符号。实验表明该方法在压缩率和吞吐量上优于此前方法,在压缩速度频谱中提供新权衡点。

Comments This is the version of the paper submitted and then accepted for presentation at the 24th International Conference of the Italian Association for Artificial Intelligence (AIxIA 2026), Perugia, Italy, 6--9 October 2026. The paper will appear in the proceedings, published by Springer Verlag in the Lecture Notes in Artificial Intelligence (LNAI) series

详情

展开后加载摘要…

URL PDF HTML 收藏