arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 50 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 50 篇

2608.19794 2026-08-21 cs.AI cs.RO 新提交 92%

Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents

迈向通用具身智能:整合大语言模型、知识库与推理能力以构建下一代AI智能体

Fujiang Yuan, Xia Huang, Lusheng Wang, Jun Ding, Zhen Tian, Yuxin Wang, Shaojie Gu, Yuki Funabora, Yanhong Peng, Zebing Mao

机构 * College of Mechanical Engineering, Chongqing University of Technology(重庆理工大学机械工程学院) James Watt School of Engineering, University of Glasgow(格拉斯哥大学詹姆斯·瓦特工程学院) School of Energy and Power, Jiangsu University of Science and Technology(江苏科技大学能源与动力学院) Magnesium Research Center, Kumamoto University(熊本大学镁研究中心) Department of Information and Communication Engineering, Nagoya University(名古屋大学信息与通信工程系) State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文综述以LLM为核心的智能系统演进,提出整合LLMs、KBs、RA与具身性的概念框架,明确高效LLM部署等五大挑战,为开发复杂动态环境下的自适应多模态智能体提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19395 2026-08-21 cs.AR cs.AI cs.LG 新提交 92%

HYDRA: A Heterogeneous Chiplet DSE Framework for Serving Dynamic Hybrid LLM Workloads

HYDRA:面向动态混合大语言模型(LLM)工作负载的异构小芯片设计空间探索框架

Jiahao Lin, Alish Kanani, Sangwan Lee, Jaehyun Park, Umit Ogras

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HYDRA框架,针对异构小芯片系统上混合LLM服务的设计空间开展联合探索,实现了吞吐量与首token生成时间的显著提升,凸显架构与运行时策略协同设计的重要性。

Comments Accepted at IEEE/ACM ESWEEK (CASES) 2026; the official version will be available in IEEE TCAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23057 2026-08-21 cs.LG cs.CL cs.PF 版本更新 92%

RequestRouter: Request-Boundary Routing for Efficient Single-GPU LLM Inference

ModeSwitch-LLM:单GPU上跨模式LLM推理的轻量级阶段感知控制器

Aman Sunesh, Ali Alshehhi, Hivansh Dhakne

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校) New York University(纽约大学) United States(美国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种轻量级请求边界控制器ModeSwitch-LLM,通过基于工作负载特征在FP16、量化、推测解码等推理模式间路由请求,在单GPU上实现平均延迟加速2.10倍、每token能耗降低51.7%,且精度几乎无损。

Comments 5 pages, 2 figures. Accepted at the 2nd International Workshop on Low Carbon Computing (LOCO 2026), Lancaster University, United Kingdom, 10-11 September 2026. Part of the LOCO 2026 proceedings, arXiv:2608.02072 (https://arxiv.org/abs/2608.02072)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26170 2026-08-21 cs.CL 版本更新 92%

EvoSelect: Data-Efficient LLM Evolution for Targeted Task Adaptation

EvoSelect:面向目标任务的高效LLM进化

Ting-Wei Li, Sirui Chen, Jiaru Zou, Yingbing Huang, Tianxin Wei, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EvoSelect框架,通过迭代生成-选择-训练循环提升LLM在目标任务上的适应能力,通过最优传输和多样性机制优化数据选择,实验表明其在不同基准测试中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20280 2026-08-21 cs.DB cs.LG 新提交 90%

Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities, and Encoders

大语言模型(LLM)缓存应采用哪种驱逐策略?跨工作负载、容量和编码器的系统研究

Yash Kulkarni, Shubham Harkare, Arvind Suresh Yogesh Babu

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本研究使用CLEVER工具在多场景下对比多种LLM缓存驱逐策略,发现LFU性能最优,且当前操作点的答案可替换性低、阈值难跨模型迁移,建议部署时先验证答案有效性再测试次级策略差异。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19998 2026-08-21 cs.IR 新提交 89%

SCoRD: Semantic-Assisted Continual Retriever-Reranker Distillation for LLM-Based Recommendation

SCoRD:用于基于大语言模型(LLM)推荐的语义辅助持续检索-重排序蒸馏

Seunghyun Baek, Gyuseok Lee, Seunghan Lee, Wonbin Kweon, Dong Wang, SeongKu Kang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 SCoRD是面向非平稳数据流的LLM推荐两阶段流程的持续知识蒸馏框架,通过语义推理助手实现检索器与重排序器的高效协同适配,在真实数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19803 2026-08-21 cs.LG cs.AI cs.CL 新提交 89%

MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents

MileGPO:面向长 horizon LLM 智能体的基于图策略优化的里程碑推理

Bo Qian, Yuting Wu, Shuang Zeng, Huaiyu Wan, Dalin Zhang, Jiqiang Liu

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长 horizon LLM 智能体强化学习的信用分配难题,提出 MileGPO 方法,通过里程碑发现、RCS、PCC 三项设计提升性能,在 ALFWorld 和 WebShop 上达 SOTA 且分布差距小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19557 2026-08-21 cs.DC cs.MA 新提交 89%

When Do LLM Agents Help? Deadline-Aware Mixed-Criticality Task Scheduling at the Autonomous-Vehicle Edge

大语言模型智能体何时有用?自动驾驶车辆边缘的感知期限感知混合关键度任务调度

Reza Zakerian

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对自动驾驶车辆边缘MEC的混合关键度任务调度,构建强启发式算法,发现LLM控制平面仅在安全关键任务激增时优于静态启发式算法。

Comments 8 pages, 5 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19670 2026-08-21 cs.CL 新提交 89%

The Asymmetric Harms of LLM Compression

大语言模型压缩的非对称危害

Yuan Wu, Mairui Li, Lesia Semenova, Chudi Zhong

机构 * Rice University(莱斯大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Rutgers University(罗格斯大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过评估3个LLM、11种压缩方法,发现LLM压缩会引发知识保留、置信度及偏见的非对称变化,聚合指标无法捕捉,需对压缩模型开展细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19659 2026-08-21 cs.LG cs.DC 新提交 87%

FleetSieve: Decision-Critical Profiling for SLO-Aware LLM Fleet Configuration

FleetSieve:面向SLO感知的大语言模型集群配置的决策关键型性能分析

Huang Cheng, Scott Zhang, Aubert Li

机构 * Meta

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG

AI总结 FleetSieve是一种面向SLO感知的LLM集群配置的决策关键型性能分析方法,通过联合建模容量与尾部延迟选择测量,可减少GPU资源消耗,避免违反SLO,提升集群决策效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06127 2026-08-21 cs.AR cs.AI 版本更新 87%

PrefixAgent: An LLM-Powered Design Framework for Efficient Prefix Adder Optimization

PrefixAgent:一种基于大语言模型的高效前缀加法器优化设计框架

Dongsheng Zuo, Jiadong Zhu, Yang Luo, Yuzhe Ma

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究针对前缀加法器设计空间随位宽指数增长的优化难题,提出基于LLM的PrefixAgent框架,通过将任务拆分为两个子任务并利用等价图构建训练数据,在几乎所有配置下实现了更小的加法器面积,且在位宽更大时优势更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18764 2026-08-21 cs.IR 版本更新 87%

GateDiffInt: Gate-Mediated Controllable Diffusion and Multi-Intent LLM Distillation for User Behavior Modeling

GateDiffInt:用于用户行为建模的门控介导可控扩散与多意图大语言模型蒸馏

Jialong Duan, Zichen Zhang, Zirui Tu, Zheng Zhang, Zepeng Li, Qingyao Cui, Qinwen Wang, Yudan Liu, Luo Yang, Yao Hu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对现有排序模型难以解耦结构化意图的问题,提出GateDiffInt框架,通过可控扩散与LLM蒸馏实现意图感知表示,在公开及工业数据集和线上测试中均取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20973 2026-08-21 eess.AS cs.AI cs.CL 版本更新 86%

Towards Audio Token Compression in Large Audio Language Models

向大型音频语言模型中的音频标记压缩迈进

Saurabhchand Bhati, Samuel Thomas, Hilde Kuehne, Rogerio Feris, James Glass

机构 * MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出通过无监督分割和低秩适配器技术,压缩音频标记以提升大型音频语言模型在资源受限平台上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19752 2026-08-21 cs.SE 新提交 86%

A Fully Automated, Deployment-Aware Testing Pipeline for IoT-Based Automotive Applications

面向物联网汽车应用的全自动、感知部署的测试流水线

Denesa Zyberaj, Roman Vintonyak, Pascal Hirmer, Marco Aiello

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对物联网汽车应用的测试难题,提出结合LLM、VLM及人在回路机制的感知部署测试流水线,经CPDS案例验证可实现全需求覆盖与高准确率,适配OEM-供应商测试工作流。

Comments Submitted, accepted and presented at IoTBDS26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20169 2026-08-21 cs.CL cs.AI cs.LG 新提交 83%

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

Task-CoEvolve:通过自适应验证任务选择实现高效的智能体框架优化

Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Task-CoEvolve通过自适应验证任务选择,使LLM智能体框架与验证任务协同演化,在保持全集搜索最终性能的同时,减少80%评估次数,实现高效的智能体框架优化。

Comments Github: this https URL (https://github.com/Agent4Science-UTokyo/Task-CoEvolve)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19889 2026-08-21 cs.AI cs.PL 新提交 83%

Write Once, Run Everywhere: The Axon DSL for Shape-Safe and Framework-Agnostic LLM Architectures

一次编写,随处运行:用于形状安全且框架无关的大语言模型架构的Axon领域特定语言

Jacob Nielsen, Danial Namazifard, Lukas Galke Poech, Peter Schneider-Kamp

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型架构的可移植性与效率瓶颈,提出强类型领域特定语言Axon,可编译为多框架实现,在467项基准测试中实现显著加速,突破部署锁定问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18578 2026-08-21 cs.CL cs.LG 版本更新 82%

Compress and Forget: bitsandbytes Quantization Amplifies Proactive Interference in LLMs

压缩与遗忘:bitsandbytes量化放大了大语言模型中的主动干扰

Shayan Shahrabi-Farahani, Dara Rahmati

机构 * Shahid Beheshti University(沙希德·贝赫什提大学)

专题命中 效率与部署 :post-training(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现bitsandbytes 4位量化会放大大语言模型的主动干扰,降低高干扰场景下的检索准确率,其效应源于量化后的Transformer主干,对依赖长语义密集上下文的应用有额外成本。

Comments 21 pages, 6 figures, 11 tables. Author list formatting simplified. Code and data released at this https URL (https://github.com/ShayanShahrabi/compress-and-forget)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19628 2026-08-21 cs.AR 新提交 80%

A Thread-Register Decoupled GPU Execution Model for Efficient Tensor Computation

用于高效张量计算的线程-寄存器解耦GPU执行模型

Zihan Liu, Jingwen Leng, Yangjie Zhou, Yitong Ding, Guanlin Zhu, Yilu Huang, Chiheng Jin, Chen Zhang, Shixuan Sun, Yu Feng, Anbang Wu, Minyi Guo, Jian Weng, Jiajin Tu, Junsong Wang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对GPU张量计算流水线的固定并行度与粗粒度调度瓶颈,提出扩展SIMT模型的FIBER架构,通过线程-寄存器解耦实现动态并行缩放与细粒度调度,在LLM服务场景下获显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19662 2026-08-21 cs.CL 新提交 79%

ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents

ReCache:面向工具增强型大语言模型智能体的高效键值缓存复用与压缩

Yichu Fang, Sitong Wei, Haozhe Hu, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东方理工学院) Xi’an Jiaotong University(西安交通大学)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.CL

AI总结 ReCache是面向工具增强型大语言模型智能体的框架,通过资源级注意力与剪枝实现KV缓存复用压缩,在性能损失极小的情况下大幅降低推理计算与内存开销,已在多工具数据集基准上验证有效。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23487 2026-08-21 cs.AI 版本更新 79%

CADRE: Stable, Parameter Efficient Adaptation of Medical Vision Language Models with Bounded Forgetting and Prior Drift

CADRE:具有有界遗忘和先验漂移的稳定、参数高效的医学视觉语言模型适应

Rishabh Jha, Amrita Singh, Prashanna Chudal

机构 * Mindriser's Consortium, Kathmandu, Nepal(Mindriser's 联盟,加德满都,尼泊尔) University of Victoria, BC, Canada(维多利亚大学,不列颠哥伦比亚省,加拿大)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出CADRE框架,通过结合低秩适应与弹性权重巩固及先验锚定惩罚,在仅训练0.23%参数下实现医学视觉语言模型的高精度、低遗忘和正向反向迁移,遗忘率降低约七倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18738 2026-08-21 cs.CL 版本更新 79%

Remask, Don't Replace: Token-to-Mask Refinement in Diffusion Language Models

重新标记,而非替换:扩散大语言模型中的令牌到标记细化

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出Token-to-Mask(T2M)方法,通过重新标记可疑令牌而非覆盖来提升扩散大语言模型的准确性,在AIME 2025和CMATH上分别提升13.33和8.56个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19973 2026-08-21 cs.CV cs.AI 新提交 77%

Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training

基于协同蒸馏发现与双引导鲁棒训练的开放词汇三维目标检测

Shangbo Yuan, Jie Xu, Xiaofeng Zhu, Na Zhao

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Singapore University of Technology and Design(新加坡科技设计大学) School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 本研究提出含协同蒸馏发现与双引导训练的开放词汇3D目标检测框架,在SUN RGB-D等数据集上性能优于现有最优方法。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20210 2026-08-21 cs.IR cs.AI cs.CL cs.LG 新提交 75%

Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference

Daedalus-150M:专为CPU推理设计的卷积-注意力混合架构

Christos Koutsiaris

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出专为CPU推理设计的Daedalus-150M混合架构,在5项任务基准得分超预设线,击败多款更大数据训练的模型,解码速度随上下文长度增长优势显著。

Comments 8 pages, 2 figures, 10 tables. Code, weights and the measurement artefacts behind every number: this https URL (https://github.com/unseen1980/daedalus)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19677 2026-08-21 cs.DC cs.LG 新提交 74%

CacheRoute: Planned Prefix-Affinity Routing for Large-Scale LLM Serving

CacheRoute:面向大规模大语言模型服务的规划式前缀亲和路由

Huang Cheng

专题命中 效率与部署 :LLM(title);分类 cs.LG

AI总结 CacheRoute 是一种规划式前缀亲和路由方法,通过周期性路由规划解决大语言模型服务中前缀缓存复用与服务器过载的权衡,在 Llama-3.3-70B 模型上实现了更高 QPS 与 KV 缓存命中率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13710 2026-08-21 cs.LG 版本更新 74%

HBVLA: Pushing 1-Bit Post-Training Quantization for Vision-Language-Action Models

HBVLA: 推动面向视觉-语言-动作模型的1位后训练量化

Xin Yan, Zhenglin Wan, Feiyang Ye, Xingrui Yu, Hangyu Du, Yang You, Ivor Tsang

专题命中 效率与部署 :post-training(title);分类 cs.LG

AI总结 HBVLA通过改进的二值化框架,实现对视觉-语言-动作模型的高效1位量化,保留了高精度性能,适用于资源受限的机器人部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18521 2026-08-21 cs.AI cs.LG 版本更新 73%

Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval

哪些负样本重要?询问你的文本编码器:用于密集字幕检索的自适应相似度间隔

Haoyue Liu, Ye Chen, Zhichao Wang, Xiaoying Tang

机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对密集字幕检索中InfoNCE目标函数过早饱和的问题,提出HN-CLIP方法,通过文本编码器的文本-文本几何构建自适应相似度间隔,在四个基准上提升R@1,且训练速度更快,仅用20%数据即可达最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20316 2026-08-21 cs.AI 新提交 70%

Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation

潘多拉的AI模型路由盒:带代价价值估计的高效分配

Adam Fisch, Shubhendu Trivedi, Fantine Huot, William W. Cohen, Michael Kaisers, Mirella Lapata, Kate Larson, Jacob Eisenstein

机构 * Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对异构AI系统的查询路由问题,提出带代价价值估计的Pandora's Router集中式策略及Pandora's Bidder去中心化策略,可在保证路由质量的同时减少高成本估计器的使用,还能在不同场景优化分配效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19285 2026-08-21 cs.CV cs.LG 新提交 70%

Clustering and Token Denoising for Faster and More Robust VLMs

用于更快、更鲁棒的视觉语言模型(VLM)的聚类与令牌去噪

Baptiste Rossigneux, Inna Kucher, Vincent Lorrain, Emmanuel Casseau

机构 * Université Paris-Saclay(巴黎-萨克雷大学) Univ. Rennes(雷恩大学) Vsora(沃索拉公司)

专题命中 效率与部署 :LLM(abstract_cn);language model(abstract);分类 cs.LG

AI总结 本研究提出无需训练的ClustRS算法,通过聚类与残差收缩剪枝VLM的视觉令牌,在基准测试中实现显著性能提升,为高效抗噪VLM部署提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20061 2026-08-21 cs.LG cs.AI cs.CL 新提交 67%

Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

逐步扩展:面向大规模混合专家模型的计算高效超参数迁移

Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim

机构 * Kakao Corp.(Kakao公司) Upstage AI(Upstage人工智能公司)

专题命中 效率与部署 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出两步超参数迁移框架,利用小型代理模型外推大规模混合专家模型的最优学习率,仅需极低成本即可准确预测全规模模型的最优配置。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19202 2026-08-21 cs.AI cs.CL cs.LG 新提交 67%

Active Inference as Context Acquisition for AI Agents

主动推理作为AI智能体的上下文获取机制

Sanchayan Dutta, Sai Niranjan Ramachandran, Suvrit Sra

机构 * University of California, Davis(加利福尼亚大学戴维斯分校) Technical University of Munich(慕尼黑工业大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究将AI智能体的上下文获取权衡形式化为主动推理,在最优提问框架中验证其有效性,为智能体上下文获取层提供模型无关的设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏