arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 778 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 133 篇

2505.16312 2026-06-23 cs.AI cs.CL 版本更新 92%

EquivPruner: Boosting Efficiency and Quality in LLM-Based Search via Action Pruning

EquivPruner:通过动作剪枝提升基于LLM的搜索效率与质量

Jiawei Liu, Qisi Chen, Jianshu Zhang, Quan Liu, Defu Lian

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) iFLYTEK Research(iFLYTEK研究院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM搜索中语义等价步骤导致的大量冗余消耗,提出EquivPruner方法,通过剪枝等价动作提升效率,并创建数学等价数据集MathEquiv训练轻量检测器,在多种任务中显著减少token消耗并提高准确性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22179 2026-06-23 cs.CL 新提交 92%

The Score Granularity Gap in Black-Box LLM Classification: A Comparative Study of Confidence Constructions

黑盒LLM分类中的分数粒度差距:置信度构建的比较研究

Ao Sun, Tian Sun, Jiaxing Geng

机构 * institutetext: 1 1(机构1) institutetext: 2 2(机构2) institutetext: 3 3(机构3)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究黑盒LLM分类中置信度分数的粒度差距,比较七种构建方法,发现单次口头置信度排名良好但取值有限,多查询聚合可帮助弱模型但可能降低强模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23345 2026-06-23 cs.AI 新提交 91%

Abstract representational geometry supports inference in large language models

抽象表征几何支持大型语言模型中的推理

Yunan Zeng, Yuwang Wang

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息科技学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本研究通过文本版情境反转学习范式,比较人类与LLM的行为和表征,发现LLM内部状态在推理时形成类似海马体的抽象几何结构,且该结构分层组织,高层次表征与推理相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23419 2026-06-23 cs.LG cs.AI 新提交 91%

GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

GRINQH:基于分级输入的量化层次结构用于高效LLM生成

Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann, Emre Neftci

机构 * Fakultät für Informatik, RWTH Aachen(亚琛工业大学计算机科学系) Fakultät für Elektrotechnik und Informationstechnik, RWTH Aachen(亚琛工业大学电气工程与信息技术系) Peter Grünberg Institut, Forschungszentrum Jülich GmbH(于利希研究中心彼得·格林贝格研究所)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出GRINQH框架,利用激活幅度动态分配权重通道精度,统一量化与稀疏化,加速LLM解码阶段,在Llama3和Qwen3上优于现有方法,实现2位生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21023 2026-06-23 cs.LG 新提交 91%

Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL

揭秘LLM推理中的数值不稳定性:使用HEAL实现关键任务的可复现推理

Zhenting Zhu, Lucas Thai, Shan Yu, Yicheng Liu, Yifan Qiao, Chenxi Wang, Harry Xu, Junyi Shu

机构 * UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM在关键任务中因16位精度导致输出不一致的问题,提出HEAL方法,通过INT16量化和代数误差补偿,在保持FP32精度的同时减少性能开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23568 2026-06-23 cs.LG cs.CL 新提交 91%

SVD-Surgeon: Optimal Singular-Value Surgery for Large Language Model Compression

SVD-Surgeon:面向大语言模型压缩的最优奇异值手术

Mahmoud Safari, Frank Hutter

机构 * University of Freiburg(弗莱堡大学) Prior Labs ELLIS Institute Tübingen(蒂宾根ELLIS研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出SVD-Surgeon,一种无需训练的方法,将最优脑外科医生框架引入奇异值基,通过闭式更新保留的奇异值补偿截断损失,并基于显著性选择修剪值,可叠加于现有SVD压缩器上,改善困惑度-压缩权衡。

Comments 8 pages, 3 figures, 5 tables; appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22153 2026-06-23 cs.CR cs.AI cs.CL 新提交 91%

$π$-RAG: Oblivious Retrieval via Semantic Quantization and Transcendental Addressing for Large Language Models

$\pi$-RAG:通过语义量化和超越寻址实现的大语言模型遗忘检索

Aniket Wattamwar, Mrunal Kakirwar

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出$\pi$-RAG架构,利用$\pi$的数字作为超越熵源,通过语义量化层将用户输入映射到规范意图质心,生成$\pi$-key实现遗忘检索,保障数据隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09781 2026-06-23 cs.NE cs.AI cs.CL cs.LG 版本更新 90%

Parameter-Efficient Neuroevolution for Diverse LLM Generation: Quality-Diversity Optimization via Prompt Embedding Evolution

参数高效神经进化用于多样化大语言模型生成:通过提示嵌入进化实现质量-多样性优化

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出QD-LLM框架,通过进化提示嵌入实现参数高效神经进化,提升大语言模型生成质量与多样性,实验显示其在多个基准测试中表现优异。

Comments 11 pages, 3 figures, 7 tables, 1 algorithm, 1 theorem. Accepted to GECCO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21869 2026-06-23 cs.CL cs.AI 新提交 90%

The Language-Energy Divide: Measuring Energy Costs of Multilingual LLM Inference

语言-能量鸿沟:衡量多语言大模型推理的能量成本

Naihao Deng, Alissa Shen, Yiming Feng, Joan Nwatu, Jae-Won Chung, Mosharaf Chowdhury, Yulong Chen, Rada Mihalcea

机构 * University of Michigan(密歇根大学) University of Cambridge(剑桥大学) University of Aberdeen(阿伯丁大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 系统研究多语言LLM推理的能量消耗,发现不同语言间每token能耗差异达8.3倍,总能耗差异达179倍,低资源语言能耗高且准确率低,建议将能量作为评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20640 2026-06-23 cs.AI cs.LG math.OC 新提交 90%

An LLM-Explainable DRL Framework for Passenger-Directed Autonomous Driving

面向乘客导向自动驾驶的LLM可解释DRL框架

Ouided Braoui, Meriem Bouali, Nadir Farhi

机构 * LITAN, ESTIN(LITAN,ESTIN) Cosys-Grettia, Univ Gustave Eiffel(Cosys-Grettia,古斯塔夫·埃菲尔大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出结合深度强化学习与大型语言模型可解释模块的框架,实现自适应驾驶控制并向乘客解释决策,平衡安全性、适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09613 2026-06-23 cs.CL cs.AI 新提交 90%

AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving

AGENTSERVESIM:面向多轮LLM智能体服务的硬件感知模拟器

Rakibul Hasan Rajib, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中佛罗里达大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出AGENTSERVESIM模拟器,通过程序编排器、工具模拟器、会话感知路由器和KV驻留模型等模块,在程序粒度上评估多轮LLM智能体服务策略,在CPU上以6%误差复现真实系统行为。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23521 2026-06-23 cs.DC cs.LG 新提交 90%

Concordia: JIT-Compiled Persistent-Kernel Checkpointing for Fault-Tolerant LLM Inference

Concordia: 用于容错LLM推理的即时编译持久内核检查点

Yuhang Gan, Yiwei Yang, Yuyi Li, Xiangyu Gao, Yichen Wang, Rain Jiang, Xiaoning Ding, Andi Quinn, Chen Qian

机构 * University of California Santa Cruz(加州大学圣克ruz分校) University of California, Davis(加州大学戴维斯分校) University of Washington(华盛顿大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对LLM推理中GPU状态丢失问题,提出Concordia运行时,利用设备驻留持久内核实现JIT编译的增量检查点,支持PTX/SASS级插桩,无需修改应用代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22840 2026-06-23 cs.LG 新提交 90%

RLM-Cascade: Response-Level Speculative Decoding for Cost-Efficient LLM API Serving

RLM-Cascade:用于成本高效LLM API服务的响应级推测解码

Haifeng Wu, Srinivasan Manoharan, Fangbo Tu, Junhua Zhao, Jian Wan

机构 * PayPal

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出RLM-Cascade代理层系统,通过响应级推测解码降低LLM API成本,在真实编码工作负载上实现45.8%成本降低和1.83倍延迟加速,同时保持或超越基线质量。

Comments 9 pages, 1 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20591 2026-06-23 cs.NI cs.AI 新提交 90%

Delay-Adaptive Speculation Control for Low-Latency Edge-Cloud LLM Inference

面向低延迟边缘-云LLM推理的延迟自适应推测控制

Kangkang Sun, Jianhua Li, Xiuzhen Chen, Junyi He, Minyi Guo

机构 * Shanghai Key Laboratory of Integrated Administration Technologies for Information Security, School of Computer Science, Shanghai Jiao Tong University(上海信息安全集成管理技术重点实验室,上海交通大学计算机科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(深圳大学理学院,香港中文大学(深圳))

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对分布式边缘-云推理中推测解码的草稿长度在线控制问题,提出延迟单调阈值最优策略,并设计在线算法UCB-SpecStop,在真实测试台上验证了相变预测,延迟降低达22.4%。

Comments 16 pages, 9 figures, submitted to an IEEE journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20577 2026-06-23 cs.NI cs.AI cs.DC 新提交 90%

Human-Less LLM Serving: Quantifying the Human Tax on Throughput

无人类交互的LLM服务:量化吞吐量中的人类税

Jianhui Lian, Li Chen, Dan Li, Yong Jiang

机构 * Tsinghua SIGS(清华大学SIGS) Beijing Zhongguancun Laboratory(北京中关村实验室) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过系统测量发现,为满足人类感知延迟的SLO(TTFT和TPOT),LLM服务系统在长上下文场景下牺牲了60-93%的吞吐量,并提出无人类交互服务模式以消除这一开销。

Comments 10 pages, 2 figures, 1 table. Preliminary work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14141 2026-06-23 cs.AI 版本更新 90%

Distribution-Aware Algorithm Design with LLM Agents

具有LLM代理的分布感知算法设计

Saharsh Koganti, Priyadarsi Mishra, Pierfrancesco Beneventano, Tomer Galanti

机构 * Texas A&M University(德克萨斯大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了学习可执行求解器代码而非预测器的场景,提出求解器提示抽象,并证明其在正确性和运行时间上的泛化能力,通过LLM代码代理在多个组合优化问题上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23729 2026-06-23 cs.CV cs.AI cs.LG eess.IV 版本更新 90%

LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models

LUQ: 多模态大语言模型的逐层超低位量化

Shubhang Bhatnagar, Andy Xu, Kar-Han Tan, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加州大学洛杉矶分校) HP Inc.(惠普公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出LUQ方法,通过逐层输出激活熵衡量功能复杂度,对简单层应用超低位量化,结合多模态校准,在LLaVA-1.5和Qwen-2.5-VL上实现低于4-bit量化,内存减少40%和31%,MME性能下降<10%。

Comments Published in Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20847 2026-06-23 eess.IV cs.MM 新提交 89%

LLM-Driven Heuristic Frame-Level Quantization Parameter Adaptation for VVenC

基于LLM的启发式帧级量化参数自适应调整用于VVenC

Liqiang He, Yingwen Zhang, Riyu Lu, Meng Wang, Shiqi Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出利用大语言模型自动设计帧级QP分配的率失真优化启发式,通过闭环进化框架迭代生成并评估候选算法,在VVenC上实现优于固定QP和拉格朗日基线的率失真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22968 2026-06-23 cs.AR 新提交 89%

MOCAP: Wafer-Scale-Chip-Oriented Memory-Orchestrated Chunked Pipelining Framework for Prefill-Only LLM Inference

MOCAP:面向晶圆级芯片的面向预填充LLM推理的内存协调分块流水线框架

Zichuan Wang, Huizheng Wang, Yuheng Xiao, Haonan Zuo, Taiquan Wei, Jinyi Deng, Chao Li, Yang Hu, Shouyi Yin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出MOCAP框架,通过内存平衡KV重分配和延迟平衡分块划分,解决晶圆级芯片上长上下文预填充中的内存和延迟不平衡问题,显著降低端到端延迟并提高吞吐量。

Comments 15 pages, 6 figures, accepted by APPT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22560 2026-06-23 cs.CR 新提交 89%

Evidence-Bound Gateway-Path Provenance for Third-Party LLM Inference

第三方LLM推理的证据绑定网关路径溯源

Fei Wang, Zebai Tian

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对第三方LLM网关中路由替换、隐藏回退等不可信问题,提出证据绑定架构,通过受信任执行环境分离控制面与执行面,实现可验证的路径溯源。

Comments 9 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22175 2026-06-23 cs.DC 新提交 89%

StickyInvoc: Rethinking Task Models for High-throughput Workflows in the LLM Era

StickyInvoc:重新思考LLM时代高通量工作流的任务模型

Thanh Son Phung, Douglas Thain

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM推理在高通量工作流中因反复加载模型参数导致的性能瓶颈,提出StickyInvoc任务模型,通过分离状态创建与销毁,将状态持久化复用,实现3.6倍加速。

Comments arXiv admin note: substantial text overlap with arXiv:2510.14024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10907 2026-06-23 cs.NI cs.DC 89%

RouterWise: Joint Resource Allocation and Routing for Latency-Aware Multi-Model LLM Serving

RouterWise: 多模型LLM服务中的联合资源分配与路由

Hossein Hosseini Kasnavieh, Gholamreza Haffari, Christopher Leckie, Adel N. Toosi

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对延迟敏感的多模型LLM服务,RouterWise通过联合资源分配与路由策略优化,提升输出质量并满足延迟目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22126 2026-06-23 cs.RO 版本更新 89%

EasyUUV: An LLM-Enhanced Universal and Lightweight Sim-to-Real Reinforcement Learning Framework for UUV Attitude Control

EasyUUV:一种用于UUV姿态控制的LLM增强通用轻量级仿真到现实强化学习框架

Guanwen Xie, Jingzehua Xu, Jiwei Tang, Yubo Huang, Zixi Wang, Shuai Zhang, Dongfang Ma, Juntian Qu, Xiaofan Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) School of Civil Engineering, Southwest Jiaotong University(西南交通大学土木工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) Ocean College, Zhejiang University(浙江大学海洋学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出EasyUUV框架,结合并行强化学习与混合控制架构,并集成多模态大语言模型自适应调整参数,实现UUV姿态控制的鲁棒性和泛化性,经仿真与实船验证。

Comments 12 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09003 2026-06-23 cs.DB 版本更新 89%

Orchestration for Domain-specific Edge-Cloud Language Models

面向特定领域的边缘-云端语言模型的编排

Prasoon Patidar, Alex Crown, Kevin Hsieh, Yifei Xu, Tusher Chakraborty, Ranveer Chandra, Yuvraj Agarwal

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 提出ECO-LLM系统,通过联合优化LLM服务流水线组件配置,在查询级别动态选择策略,在智能家居和智能汽车场景中相比GPT-4o准确率提升至90%,成本降低90%,延迟降低55%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20590 2026-06-23 cs.NI cs.AI 新提交 89%

Optimization-as-a-Service via Multi-Agent Large Language Model for Radio Access Networks

通过多智能体大语言模型实现无线接入网的优化即服务

Chaoqun You, Yueyue Dai, Xingqiu He, Yue Gao, Rahim Tafazolli, Yong Liang Guan

机构 * Fudan University(复旦大学) Huazhong University of Science and Technology(华中科技大学) University of Surrey(Surrey大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 提出将物理资源块分配问题作为大语言模型多智能体系统提供的优化即服务,通过场景理解、目标生成、求解器和反思智能体实现上下文感知的自校正公式,并引入单次反思蒸馏机制降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22430 2026-06-23 cs.CL cs.AI cs.LG 新提交 89%

Words as Difference Makers: How Large Language Models Determine Causal Structure in Text

词汇作为差异制造者:大型语言模型如何确定文本中的因果结构

Wolfgang Pietsch

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出大型语言模型通过变分归纳逻辑学习因果结构,并分析其训练过程与架构特征如何实现差异制造者识别。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21238 2026-06-23 cs.DC cs.AI cs.LG 新提交 89%

Recency/Frequency Adaptive KV Caching for Large Language Model Serving

面向大语言模型服务的近期/频率自适应KV缓存

Yang Shen, Meghana Madhyastha, Robert Underwood, Bogdan Nicolae, Randal Burns

机构 * Department of Computer Science, Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学计算机科学系) Argonne National Laboratory, Lemont, USA(阿贡国家实验室) Parasail, Inc., San Mateo, USA(Parasail公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG;foundation model(comments)

AI总结 针对LRU策略在多工作负载下缓存失效问题,提出自适应KV缓存,动态分配近期与高频KV块的空间,在合成文档问答中缓存命中率提升10.8%,首令牌时间降低12.6%。

Comments Accepted at the ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference (AdaptFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21732 2026-06-23 cs.CR cs.AI 新提交 89%

Safe to Check, Unsafe to Use: Relinking at the Compression Boundary of LLM Agents

安全检查,不安全使用:LLM代理压缩边界处的重链接

Zesen Liu, Zihan Zhang, Dongdong She

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI

AI总结 提出重链接漏洞,利用摘要压缩将分散的良性片段重组为恶意指令,并设计Relink工具自动化攻击,在四个长上下文代理基准上达到86.9%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22642 2026-06-23 cs.LG 版本更新 89%

Compress the Easy, Explore the Hard: Difficulty-Aware Entropy Regularization for Efficient LLM Reasoning

压缩简单问题,探索困难问题:面向高效LLM推理的难度感知熵正则化

Qin-Wen Luo, Sheng Ren, Xiang Chen, Rui Liu, Jun Fang, Naiqiang Tan, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) College of Computer Science and Technology(计算机科学与技术学院) Didichuxing Co. Ltd(滴滴出行有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出CEEH方法,通过难度感知的熵正则化,在强化学习中对简单问题压缩推理长度,对困难问题保持探索空间,从而在减少响应长度的同时维持推理准确性。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22496 2026-06-23 cs.PF cs.AI cs.LG 新提交 88%

Enabling Cloud-Level Accuracy in Edge AI through IoT Data Preprocessing

通过物联网数据预处理实现边缘AI的云端级精度

Aygün Varol, Katarzyna Kołodziej, Łukasz Sobczak, Michał Romaszewski, Przemysław Głomb, Naser Hossein Motlagh, Mirka Leino, Johanna Virkki

机构 * Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通信科学学院,塔尔皮耶大学) Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(理论与应用信息学研究所,波兰科学院) Department of Computer Science, University of Helsinki(计算机科学系,赫尔辛基大学) Satakunta University of Applied Sciences(萨塔昆塔应用科学大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对边缘部署的紧凑型LLM在原始传感器读数下数值推理弱的问题,提出结构化提示构建框架,通过逐步丰富文本表示(原始值、阈值描述、环境摘要标志)提升局部模型精度,实验表明该方法可将局部准确率从约50%提升至80%以上,同时保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏