arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-03 至 2026-06-03 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 72 篇

2606.03209 2026-06-03 cs.LG 87%

DECA: Decentralizing Block-Wise Adam for Efficient LLM Full-Parameter Fine-Tuning on Non-IID Data

DECA: 去中心化逐块Adam优化器用于非独立同分布数据上的高效大语言模型全参数微调

Yunsheng Yuan, Shaowei Li, Kai Wang, Zhongyuan Sun, Zheng Zhang, Kai Han, Jun Luo, Feng Li

机构 * School of Computer Science and Technology, Shandong University, Qingdao China(山东大学计算机科学与技术学院,青岛中国) School of Mathematical Science, Peking University, China(北京大学数学科学学院,中国) IEIT SYSTEM, China(IEIT SYSTEM,中国) School of Computer Science and Artificial Intelligence, Shanghai University of Finance and Economics, Shanghai, China(上海财经大学计算机科学与人工智能学院,上海中国) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院,新加坡)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对隐私敏感和资源受限环境中的大语言模型微调,提出DECA框架,通过逐块Adam优化和去中心化共识机制,在非独立同分布数据上实现高效的全参数微调,兼顾收敛速度、下游性能和资源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03967 2026-06-03 cs.CL cs.AI 87%

AlignAtt4LLM: Fast AlignAtt for Decoder-Only LLMs at IWSLT 2026 Simultaneous Speech Translation Task

AlignAtt4LLM:面向仅解码器LLM的快速AlignAtt方法在IWSLT 2026同声传译任务中的应用

Quentin Fuxa, Dominik Macháček

机构 * Charles University, MFF, ÚFAL(查理大学,人文学院,ÚFAL) University of Edinburgh(爱丁堡大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 提出AlignAtt4LLM系统,通过显式源文本跨度、离线选择翻译对齐头、选择性qk快速重放和运行时查询/键捕获,首次将AlignAtt策略应用于仅解码器LLM,在英德、英意同声传译中优于基线。

Comments Accepted to IWSLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03647 2026-06-03 cs.CR cs.AI cs.LG 87%

Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs

黑盒、自适应、高效、可迁移、有害、适用……攻击是破解LLM所需的一切

Vincent Limbach, Jonas Dornbusch, David Lüdke, Stephan Günnemann, Leo Schwinn

机构 * University of St. Gallen(圣加尔大学)

专题命中 效率与部署 :LLM(title_cn,abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 提出间接危害优化(IHO)方法,通过迭代偏好优化训练掩码扩散语言模型攻击器,实现黑盒、高效、可迁移的自适应攻击,显著提升对分层防御的破解成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03330 2026-06-03 cs.LG cs.AI cs.CR 87%

FLIPS: Instance-Fingerprinting for LLMs via Pseudo-random Sequences

FLIPS:通过伪随机序列为LLMs进行实例指纹识别

Gurvan Richardeau, Gohar Dashyan, Erwan Le Merrer, Gilles Tredan

机构 * Inria(法国国家信息与自动化研究所)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出FLIPS方法,利用生成的二进制随机序列中的偏差,在237个模型实例上实现96%(闭集)和90%(开集)的识别准确率,解决了现有指纹识别技术无法区分同一LLM不同配置的问题,为AI监管提供了实例级指纹识别新范式。

Comments 20 pages, 20 figures, 3 tables. 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03266 2026-06-03 cs.HC 87%

ReforMe: Re-Shaping Documents with Contextual Prompting and Layout-Aware Propagation

ReforMe: 通过上下文提示和布局感知传播重塑文档

Nabin Khanal, Tongyan Wang, Jui-Cheng Chiu, Ningning Nicole Kong, Hannah Yanhua Zong, Yingjie Victor Chen

专题命中 效率与部署 :LLM(summary_cn,abstract);prompting(title)

AI总结 提出一个交互式文档数字化系统,结合布局感知解析、OCR和基于LLM的重建,通过用户驱动精炼和布局感知传播机制,提高复杂文档的校正效率和结构化表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05207 2026-06-03 cs.IR cs.CL 86%

Core-based Hierarchies for Efficient GraphRAG

基于核心的高效图RAG层次结构

Jakir Hossain, Ahmet Erdem Sarıyüce

机构 * University at Buffalo(布法罗大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对图RAG中Leiden聚类不可复现的问题,提出用k-core分解替代,构建确定性、密度感知的层次结构,并设计轻量级启发式方法,在保证连接性的同时降低LLM成本,提升答案全面性和多样性。

Comments Accepted at the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11346 2026-06-03 cs.LG 86%

Fast and Expressive Multi-Byte Prediction with Probabilistic Circuits

基于概率电路的快速且富有表现力的多字节预测

Andreas Grivas, Lorenzo Loconte, Emile van Krieken, Piotr Nawrot, Yu Zhao, Euan Wielewski, Pasquale Minervini, Edoardo Ponti, Antonio Vergari

机构 * University of Cambridge(剑桥大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出MTPC框架,利用概率电路编码未来令牌的联合分布,在字节级LLM中实现快速生成,同时保持表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08782 2026-06-03 cs.CL 84%

MT-OSC: Path for LLMs that Get Lost in Multi-Turn Conversation

MT-OSC:解决大语言模型在多轮对话中迷失的路径

Jyotika Singh, Fang Tu, Miguel Ballesteros, Weiyi Sun, Sandip Ghoshal, Michelle Yuan, Yassine Benajiba, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MT-OSC框架,通过后台自动压缩对话历史(Condenser Agent)减少token量,提升多轮对话性能,在13个LLM上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01282 2026-06-03 cs.CV cs.AI 83%

Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model Enhancement

Align-KD:为移动视觉语言模型增强提取跨模态对齐知识

Qianhan Feng, Wenshuo Li, Tong Lin, Xinghao Chen

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University, China(通用人工智能国家重点实验室,智能科学与技术学院,北京大学,中国) Huawei Noah’s Ark Lab, China(华为诺亚方舟实验室,中国)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出Align-KD方法,通过蒸馏教师模型浅层跨模态对齐知识,指导1.7B学生模型学习视觉-文本匹配,在6个基准上平均提升2.0分。

Comments CVPR 2025 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03957 2026-06-03 cs.CL cs.AI cs.SD eess.AS 82%

Efficient ASR Training with Conversations that Never Happened

利用从未发生的对话进行高效的ASR训练

Máté Gedeon, Péter Mihajlik

机构 * Dept. of Telecommunications and Artificial Intelligence, Budapest University of Technology and Economics(电信与人工智能系,布达佩斯技术与经济大学) SpeechTex Ltd.(SpeechTex公司) ELTE Research Centre for Linguistics(ELTE语言研究所)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对低资源语言和特定领域,提出通过LLM生成对话场景、映射说话人属性到TTS语音配置文件并组装合成话语的增强流水线,实验表明合成对话能有效提升ASR性能,在匈牙利语基准上仅用67小时真实对话和636小时模拟数据即超越2700小时零样本模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02951 2026-06-03 cs.RO cs.AI cs.CL cs.CV cs.HC 82%

SCOPE: Real-Time Natural Language Camera Agent at the Edge

SCOPE:边缘实时自然语言相机代理

Nikolaj Hindsbo, Sina Ehsani, Pragyana Mishra

机构 * Armada AI

专题命中 效率与部署 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SCOPE模块化代理,用于自然语言控制的PTZ相机,在边缘部署实现实时感知、规划与控制,并通过仿真和物理实验评估延迟、准确性和错误模式。

Comments 9 pages, 4 figures, 6 tables. Accepted at HRI '26 (21st ACM/IEEE International Conference on Human-Robot Interaction), Edinburgh, Scotland, March 16--19, 2026. Code: https://github.com/HindsboNikolaj/SCOPE

Journal ref Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16003 2026-06-03 cs.CL cs.LG 82%

Learning without training: The implicit dynamics of in-context learning

无需训练的学习:上下文学习的内在动态

Benoit Dherin, Michael Munn, Hanna Mazzawi, Michael Wunder, Javier Gonzalvo

机构 * Google(谷歌)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过理论分析和实验证明,自注意力层与MLP的组合使Transformer块能够根据上下文隐式修改MLP权重,从而解释大语言模型在推理时无需权重更新即可进行上下文学习的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15713 2026-06-03 cs.LO cs.AI cs.PL 81%

Just Type It in Isabelle! AI Agents Drafting, Mechanizing, and Generalizing from Human Hints

Just Type It in Isabelle! AI Agents Drafting, Mechanizing, and Generalizing from Human Hints

Kevin Kappelmann, Maximilian Schäffeler, Lukas Stevens, Mohammad Abdulaziz, Andrei Popescu, Dmitriy Traytel

机构 * Department of Computer Science, University of Sheffield, United Kingdom(英国谢菲尔德大学计算机科学系) Department of Informatics, King’s College London, United Kingdom(英国伦敦国王学院信息学院) Department of Computer Science, University of Copenhagen, Denmark(丹麦哥本哈根大学计算机科学系)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究Isabelle中秩一多态λ项的类型标注问题,通过人类和AI代理(LLM)分别进行纸笔证明和自动形式化,并利用人类提示进行改进和泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03026 2026-06-03 cs.NE cs.AI cs.LG 81%

Spike-Aware C++ INT8 Inference for Sparse Spiking Language Models on Commodity CPUs

面向稀疏脉冲语言模型在商用CPU上的脉冲感知C++ INT8推理

Ting Liu

机构 * SymbolicLight Research(SymbolicLight研究院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种脉冲感知的C++推理运行时,利用稀疏二进制脉冲状态作为执行原语,结合混合布局、AVX2/FMA内核和INT8量化,在商用CPU上实现脉冲语言模型的高效解码,吞吐量优于同等规模稠密模型但质量略逊。

Comments 11 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03771 2026-06-03 cs.CR 80%

$π$Creds: Privately Inferred Credentials

$\pi$Creds: 私有推断凭证

Samuel Breckenridge, Dani Vilardell, Derek Leung, Andrés Fábrega, James Austgen, Farinaz Koushanfar, Ari Juels

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文提出$\pi$Creds,一种利用可信LLM推理生成隐私保护、兼容遗留系统的去中心化可验证凭证,扩展了凭证可认证的声明范围,并形式化了源受限对抗样本和认证隐蔽谓词投毒两类新威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03444 2026-06-03 cs.CV cs.AI 79%

PRISM: Synergizing Vision Foundation Models via Self-organized Expert Specialization

PRISM: 通过自组织专家专业化协同视觉基础模型

Ying Tang, Dong Li, Youjia Zhang, Zikai Song, Junqing Yu, Wei Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 提出PRISM框架,采用双流混合专家(MoE)架构,通过两阶段范式(先解构专家知识使其专业化,再动态重组为任务特定路径)解决视觉基础模型集成中的负迁移问题,在PASCAL-Context和NYUD-v2上达到新最优。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03054 2026-06-03 cs.AI 79%

ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents

ToolGate: 面向工具增强视觉语言智能体的令牌高效预调用控制

Anjie Liu, Yan Song, Zhixun Chen, Ziqin Gong, Zhongwei Yu, Jun Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University College London(伦敦大学学院) AI Lab, The Yangtze River Delta(长江三角洲人工智能实验室)

专题命中 效率与部署 :language agent(title,abstract);分类 cs.AI

AI总结 针对工具增强视觉语言智能体中工具调用成本高且不必要的问题,提出轻量级外部控制器ToolGate,通过轨迹文本和结构特征预测执行/跳过决策,在降低令牌成本的同时保持或提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09106 2026-06-03 cs.LG 79%

Learning Unmasking Policies for Diffusion Language Models

学习扩散语言模型的去掩码策略

Metod Jazbec, Theo X. Olausson, Louis Béthune, Pierre Ablin, Michael Kirchhof, João Monteiro, Victor Turrisi, Jason Ramapuram, Marco Cuturi

机构 * Apple(苹果公司) University of Amsterdam(阿姆斯特丹大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 针对扩散语言模型中的去掩码采样问题,提出基于强化学习训练轻量级策略,以替代手动调优的启发式方法,在保持性能的同时提升鲁棒性。

Comments V4: Accepted as an oral spotlight at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03748 2026-06-03 cs.CV cs.AI 77%

Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models

Ultralytics YOLO26: 统一的实时端到端视觉模型

Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu

机构 * Ultralytics

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出YOLO26,通过双头设计、MuSGD优化器、渐进损失和STAL标签分配策略,实现无NMS的端到端实时检测,并在实例分割、姿态估计等任务上取得一致提升。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02862 2026-06-03 cs.AI cs.MA 77%

Toward a Modular Architecture for Embedded AI Agent Systems at the Edge

面向边缘嵌入式AI智能体系统的模块化架构

Marcus Rüb, Michael Gerhards

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 提出一种模块化参考架构,通过分层设计解耦设备端和云端智能体,并引入治理层,解决嵌入式微控制器上部署自主AI的严格资源约束问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23725 2026-06-03 cs.LG 77%

MuLoCo: Muon is a practical inner optimizer for DiLoCo

MuLoCo: Muon 是 DiLoCo 的实用内部优化器

Benjamin Thérien, Xiaolong Huang, Aaron Defazio, Irina Rish, Eugene Belilovsky

机构 * FAIR at Meta(Meta 的 FAIR 部门) Mila Université de Montréal(蒙特利尔大学) Concordia University(康科迪亚大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出 MuLoCo,将 Muon 作为 DiLoCo 的内部优化器,通过产生方向更准确的伪梯度,在多个工作节点下提升大语言模型训练性能,并兼容量化、流式处理和长同步间隔。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22854 2026-06-03 cs.CL 77%

Train Once, Reuse Everywhere: Generalizable Implicit In-Context Learning by Routing Attention

一次训练,随处重用:通过路由注意力实现可泛化的隐式上下文学习

Jiaqian Li, Yanshu Li, Ligong Han, Ruixiang Tang, Wenya Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出In-Context Routing (ICR)方法,在注意力logits层面捕获可泛化的上下文学习模式,通过可学习的输入条件路由器调制注意力logits,实现高效的一次训练多次重用框架,在12个数据集上优于现有隐式ICL方法并展现强泛化能力。

Comments ICML 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03543 2026-06-03 cs.MA 75%

D2MDT: Department-aware Multidisciplinary Team Consultation with Deliberation for Efficient Clinical Prediction

D2MDT:基于科室感知的多学科团队会诊与审议以实现高效临床预测

Yongqi Liang, Qidong Liu, Chunze Yang, Lei Wu, Jiusong Ge, Ni Zhang, Chen Li

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出D2MDT框架,通过构建结构化EHR证据和语义证据、分配科室视角给医生智能体、引入残差审议机制仅更新未解决共识,实现高效多学科会诊并提升临床预测性能。

Comments Preprint. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18740 2026-06-03 cs.CV cs.AI cs.CL cs.LG 75%

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

Vision-OPD:通过在线策略自蒸馏学习多模态大语言模型的精细细节

Qianhao Yuan, Jie Lou, Xing Yu, Hongyu Lin, Le Sun, Xianpei Han, Yaojie Lu

机构 * Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Vision-OPD框架,通过在线策略自蒸馏将模型自身的局部区域感知能力迁移到全局图像策略,提升多模态大语言模型对细粒度视觉理解的准确性。

Comments Project page: https://github.com/VisionOPD/Vision-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20623 2026-06-03 cs.RO 75%

Latent Activation Editing: Inference-Time Refinement of Learned Policies for Safer Multirobot Navigation

潜在激活编辑:基于推理时策略精炼的安全多机器人导航

Satyajeet Das, Darren Chiu, Zhehui Huang, Lars Lindemann, Gaurav S. Sukhatme

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Automatic Control Laboratory, ETH Zürich(苏黎世联邦理工学院自动控制实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出潜在激活编辑(LAE)框架,通过在推理时在线检测并编辑中间激活,在不修改权重或架构的情况下降低预训练策略的碰撞率,在四旋翼导航中实现近90%的碰撞减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03762 2026-06-03 cs.LG cs.AI 73%

Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning

基于熵引导的工具感知优化用于高效智能体强化学习

Hongye Cao, Nuo Yan, Haoyuan Deng, Ziwei Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Nanyang Technological University(南洋理工大学) China Mobile NineVerse Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九章人工智能技术(北京)有限公司) Institute of Artificial Intelligence, NineVerse(九章人工智能研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出TAO-RL框架,通过工具感知轨迹过滤和熵引导探索解决智能体强化学习中工具使用导致的训练不稳定问题,在7个推理基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03022 2026-06-03 cs.CL cs.AI 73%

Hallucinations as Orthogonal Noise: Inference-Time Manifold Alignment via Dynamic Contextual Orthogonalization

幻觉作为正交噪声:通过动态上下文正交化实现推理时流形对齐

Mingkuan Zhao, Wentao Hu, Tianchen Huang, Yuheng Min, Suquan Chen, Yide Gao, Yanbo Zhai, Shuangyong Song, Xuelong Li

机构 * Xi’an Jiaotong University(西安交通大学) Xingchen AGI Lab(星辰AGI实验室) China Telecom AI Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司) Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种基于线性表示假设的几何框架,将大语言模型幻觉解释为残差流语义流形的正交噪声,并引入推理时干预方法动态上下文正交化(DCO),通过层间Z分数抑制机制选择性地衰减异常正交分量,在保持知识记忆的同时提升上下文忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20217 2026-06-03 cs.LG cs.AI 73%

KnapSpec: Self-Speculative Decoding via Adaptive Layer Selection as a Knapsack Problem

KnapSpec: 通过自适应层选择作为背包问题的自推测解码

Seongjin Cha, Gyuwan Kim, Dongsu Han, Tao Yang, Insu Han

机构 * KAIST(韩国科学技术院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出KnapSpec,一种无需训练的框架,将草稿模型选择重新表述为背包问题,通过解耦注意力与MLP层并建模其硬件特定延迟,使用并行动态规划算法自适应确定最优草稿配置,实现令牌吞吐量最大化。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03467 2026-06-03 cs.AI 70%

StepFinder: A Temporal Semantic Framework for Failure Attribution in Multi-Agent Systems

StepFinder:多智能体系统中故障归因的时间语义框架

Taiyu Zhu, Yifan Wu, Weilin Jin, Ying Li, Gang Huang

机构 * Peking University(北京大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出StepFinder框架,通过将执行日志编码为时间语义序列并利用时序建模与注意力模块,高效准确地定位多智能体系统中的故障根因步骤。

Comments 12 pages, 5 figures. Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03284 2026-06-03 cs.CL 70%

SEA-NLI: Natural Language Inference as a Lens into Southeast Asian Cultural Understanding

SEA-NLI:将自然语言推理作为理解东南亚文化的透镜

Peerawat Chomphooyod, Jian Gang Ngui, Yosephine Susanto, Attapol T. Rutherford, Alham Fikri Aji, Sarana Nutanong, Can Udomcharoenchaikit, Peerat Limkonchotiwat

专题命中 效率与部署 :LLM(abstract_cn);prompting(abstract);分类 cs.CL

AI总结 提出SEA-NLI基准,通过自然语言推理评估模型对东南亚文化的理解,发现现有模型表现不佳,文化适应和提示可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏