SageSched: Efficient LLM Scheduling Confronting Demand Uncertainty and Hybridity
SageSched: 面对需求不确定性和混合性的高效LLM调度
专题命中 效率与部署 :LLM(title,abstract)
AI总结 SageSched通过结合提示内容和历史结果预测输出长度分布,同时考虑计算和内存成本,实现高效LLM调度,提升整体效率超过28.7%。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
SageSched: 面对需求不确定性和混合性的高效LLM调度
专题命中 效率与部署 :LLM(title,abstract)
AI总结 SageSched通过结合提示内容和历史结果预测输出长度分布,同时考虑计算和内存成本,实现高效LLM调度,提升整体效率超过28.7%。
MindfulAgents: 通过专家对齐的多智能体系统实现正念冥想的个性化
机构 * Columbia University(哥伦比亚大学) ; St. Margaret’s Episcopal School(圣玛格丽特教区学校) ; Carnegie Mellon University(卡内基梅隆大学) ; Worcester Polytechnic Institute(沃斯特理工学院) ; Institute for Social Research, University of Michigan(密歇根大学社会研究所) ; California State University Dominguez Hills(加州大学 Dominguez Hills 分校)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出MindfulAgents系统,利用大语言模型生成个性化正念冥想指导脚本,提升用户参与度和自我意识,减少压力,并通过实验验证其在长期冥想实践中的有效性。
Comments Accepted by CHI 2026; Zhihan Jiang and Yuang Fan contributed equally as second authors
跨家族推测预填:无训练长上下文压缩与小型草稿模型
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文研究跨家族推测预填技术,利用不同模型家族的轻量草稿模型实现无训练提示压缩,保留90-100%的完整提示性能并显著降低TTFT,表明推测预填依赖任务先验和语义结构。
Journal ref ICLR 2026 (WS)
ARL-Tangram:释放代理强化学习中的资源效率
机构 * School of Computer Science, Peking University(北京大学计算机科学系) ; LLM-Core Xiaomi(小智LLM核心)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 ARL-Tangram通过动作级 orchestration 实现细粒度外部资源共享与弹性调度,提升代理强化学习的资源利用效率,实验表明其在平均动作完成时间、训练步长速度和外部资源节约方面均有显著提升。
LightMoE: 通过专家替换减少混合专家冗余
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LightMoE框架,通过专家替换、自适应选择和分层构造提升混合专家模型的内存效率和性能,实验表明其在30%压缩下性能与LoRA相当,50%压缩下表现更优。
NeuroLoRA:基于情境的神经调节用于参数高效多任务适应
机构 * Shanghai University(上海大学) ; Fudan University(复旦大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 NeuroLoRA通过引入可学习的神经调节门和对比正交损失,提升多任务适应和持续学习能力,实验表明其在MMLU、GSM8K和ScienceQA上优于FlyLoRA和其他基线模型。
Comments work in progress
通过中间探针进行任务特定的知识蒸馏
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种通过冻结教师模型隐藏状态训练轻量级探针的方法,利用探针预测而非输出logits作为监督信号,提升四个推理基准测试的性能,尤其在数据有限时效果更显著。
令牌蒸馏:面向新令牌的注意力感知输入嵌入
机构 * Hasso Plattner Institute ELLIS Unit(波茨坦大学哈索普兰特纳研究所ELLIS单位) ; University of Copenhagen ELLIS Unit(哥本哈根大学ELLIS单位)
专题命中 效率与部署 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 本文提出令牌蒸馏方法,通过蒸馏原始分词获得的表示快速学习高质量新令牌嵌入,实验表明其优于现有基线。
Comments ICLR 2026 camera-ready
语言模型中的进化与压缩:关于人类对齐分类的出现
机构 * New York University(纽约大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究探讨LLM是否能进化出高效的人类对齐语义系统,通过颜色分类实验发现,大模型在复杂性和英语对齐性上表现各异,仅最强模型能复现人类近最优的信息瓶颈贸易-offs。
Comments Published as a conference paper at ICLR 2026 (The Fourteenth International Conference on Learning Representations). OpenReview: https://openreview.net/forum?id=s7gSTR2AqA¬eId=s7gSTR2AqA
MoEKD:混合专家知识蒸馏用于鲁棒且高性能的压缩代码模型
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 本文提出MoEKD框架,通过混合专家架构实现多专家知识蒸馏,提升压缩模型的鲁棒性和性能,实验表明在漏洞检测任务中,MoEKD在对抗鲁棒性和预测性能上均优于现有基线方法。
Comments Accepted to the Research Track of the Evaluation and Assessment in Software Engineering (EASE) 2026
AVION:从离线教师到提示调优网络的空域视觉-语言指令
机构 * The University of British Columbia, Okanagan(不列颠哥伦比亚大学奥克兰分校) ; The Ohio State University(俄亥俄州立大学) ; TerraSense Analytics(TerraSense分析)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 AVION提出一种知识蒸馏框架,通过构建语义丰富的文本原型和轻量级提示,提升视觉语言模型在遥感图像中的适应能力,提升少样本分类和跨模态检索性能。
Comments Accepted to CVPR 2026
一个监督者,多种模态:面向自主查询的自适应工具协调
专题命中 效率与部署 :SLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一个代理AI框架,通过动态分解用户查询并分配任务给不同模态的工具,提升多模态查询处理效率,实验显示在15类任务中准确回答时间减少72%,对话重做减少85%,成本降低67%。
Comments 19 pages, 3 figures; v2: corrected author metadata
统一解析器技术报告
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 Uni-Parser是一种面向科学文献和专利的工业级文档解析引擎,具备高吞吐量、高精度和低成本优势,采用模块化架构实现多模态细粒度对齐,支持大规模部署和扩展,适用于文献检索、摘要生成及化学结构提取等下游应用。
结构化蒸馏用于个性化代理记忆:11倍token减少并保持检索能力
专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种结构化蒸馏方法,将用户与代理的对话历史压缩至38个token,实现11倍压缩,同时保持检索性能,通过实验验证了压缩后检索质量的可靠性。
Comments 6 figures. Code: https://github.com/Process-Point-Technologies-Corporation/searchat
最大熵探索无需回放
专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本文提出EVE算法,通过迭代更新而非回放或分布估计,解决最大熵探索问题,实现高效高熵策略。
因果细胞上下文迁移学习(C3TL):一种用于预测未见扰动效应的高效架构
专题命中 效率与部署 :foundation model(abstract);分类 cs.LG
AI总结 本文提出一种轻量级框架,利用生物干预的结构特性,通过批量分子数据实现对新上下文的扰动效应预测,相比现有方法更高效且无需大规模数据。
Comments 12 Pages, 3 figures, Keywords: perturbation prediction, context transfer, lightweight, machine learning
Cheers:解耦补丁细节与语义表示以实现统一的多模态理解和生成
机构 * Tsinghua University(清华大学) ; Xi’an Jiaotong University(西安交通大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 效率与部署 :LLM(abstract);分类 cs.AI
AI总结 Cheers通过解耦补丁细节与语义表示,实现统一的多模态理解和生成,提升图像生成的保真度,并在多个基准测试中表现优异,同时实现4倍的token压缩效率。
Comments 17 pages, 5 figures
人工智能供应链监管的经济学
机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院) ; Naveen Jindal School of Management, The University of Texas at Dallas(德克萨斯大学达拉斯分校纳文·金达尔管理学院)
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI
AI总结 本文通过博弈模型分析AI供应链中政策干预对消费者剩余的影响,发现促进价格竞争的政策在高计算成本时有效,而促进质量竞争的政策始终提升消费者剩余。
Comments An earlier version of this paper, titled "The Economics of Fine-Tuning for Large-Scale AI Models," was presented at WISE 2023, where it won the Best Student Paper Award
具有混合专家的时空语义专家路由架构用于指代图像分割
专题命中 效率与部署 :language model(abstract);分类 cs.AI
AI总结 本文提出SERA架构,通过在视觉语言框架中引入轻量级表达感知专家细化,提升指代图像分割的时空一致性与边界精度,实验表明其在准确定位和精细边界界定上表现优异。
测试时策略用于更高效和准确的代理RAG
专题命中 效率与部署 :LLM(abstract);分类 cs.AI
AI总结 本文提出测试时改进Search-R1流程,通过上下文模块和去重模块提升RAG系统在复杂多跳问题中的效率和准确性,实验表明在HotpotQA和Natural Questions数据集上EM得分提高5.6%,检索次数减少10.5%。
BitDance: 通过二进制令牌扩展自回归生成模型
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI
AI总结 BitDance通过二进制令牌生成高熵表示,结合二进制扩散头和next-patch扩散方法,实现高效图像生成,达到最佳FID分数并显著提升推理速度。
Comments Code and models: https://github.com/shallowdream204/BitDance
MoE模型中的专家选择揭示(几乎)与文本相同的信息
专题命中 效率与部署 :language model(abstract);分类 cs.CL
AI总结 研究通过文本重建攻击揭示MoE模型中专家选择泄露的信息量,采用MLP和Transformer解码器实现高准确率的token恢复,指出专家选择应被视为敏感信息。
DRIFT-Net: 一种用于PDE学习的频谱耦合神经算子
机构 * University of New South Wales(新南威尔士大学)
专题命中 效率与部署 :foundation model(abstract);分类 cs.LG
AI总结 DRIFT-Net通过双分支设计融合频谱和图像信息,提升PDE动态学习的精度与效率,减少误差积累和漂移。
Comments Accepted at ICLR 2026
Mobile-VTON: 高保真设备端虚拟试衣
专题命中 效率与部署 :pretraining(abstract)
AI总结 本文提出Mobile-VTON,一种基于设备端的高保真虚拟试衣框架,通过模块化架构和隐私保护技术,在无需云端支持的情况下实现高质量试衣效果。
Comments The project page is available at: https://zhenchenwan.github.io/Mobile-VTON/
Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
三X:一种基于LLM的多语言语音识别系统,用于INTERSPEECH2025 MLC-SLM挑战
专题命中 领域大模型 :SLM(title,abstract);LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出Triple X系统,通过创新的编码器-适配器-LLM架构优化多语言对话场景的语音识别准确率,采用多阶段训练策略提升多语言识别性能,实验结果显示在开发和测试集上取得竞争力的词错误率表现。
Comments Accepted By Interspeech 2025 MLC-SLM workshop
构建PsyCogMetrics AI实验室以评估大语言模型并推进认知科学——一项三阶段行动设计科学研究
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文提出构建整合的云平台,通过三阶段行动设计科学方法改进大语言模型评估方法,结合心理学和认知科学理论,提出验证的评估设计。
Comments 10 pages. Prepared: April 2025; submitted: June 15, 2025; accepted: August 2025. In: Proceedings of the 59th Hawaii International Conference on System Sciences (HICSS 2026), January 2026
Journal ref Proceedings of the 59th Hawaii International Conference on System Sciences (HICSS), January 2026, pp. 6952-6961
深度安全攻击:从深度安全注意力头中劫持大语言模型
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文提出SAHA攻击框架,通过深入分析注意力头的漏洞,提升对抗样本生成的鲁棒性,实验显示其在ASR指标上优于现有方法。
领域内示例构造与基于大语言模型的多LLM扩展的LLM精炼
机构 * School of Computer Science and Technology, Soochow University, Suzhou, China(苏州大学计算机科学与技术学院) ; Center for Information and Language Processing (CIS), LMU Munich, Munich, Germany(慕尼黑莱茵恩大学信息与语言处理中心) ; Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心) ; Chalmers University of Technology, Gothenburg, Sweden(楚科奇技术大学)
专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出一种自动化的查询扩展框架,通过BM25-MonoT5流程构建领域内示例池,并利用无监督的聚类策略生成多样化的演示,再结合两个异构LLM生成扩展并由精炼LLM整合,实现稳定且高效的查询扩展。
Comments Preprint. This paper is under consideration at Pattern Recognition Letters
RXNRECer 通过主动学习和蛋白质语言模型实现细粒度酶功能注释
专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.LG
AI总结 RXNRECer利用主动学习和蛋白质语言模型直接预测酶促反应,克服传统EC编号方法的局限,提升预测精度和应用灵活性。
VLM4Rec:基于大视觉-语言模型的多模态语义表示推荐系统
机构 * University of Southern California(南加州大学)
专题命中 领域大模型 :language model(title,abstract);分类 cs.AI
AI总结 VLM4Rec通过语义对齐而非直接特征融合,提升多模态推荐性能,实验显示其优于原始视觉特征和融合方法。
Comments 13 pages, 4 figures, 1 table