arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-12 至 2026-08-12 共收录 62 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 62 篇

2608.10532 2026-08-12 cs.NI cs.LG 新提交 92%

Benchmarking LLM-Guided Control-Plane Policies for Backend Fault Isolation in HAProxy

对HAProxy中后端故障隔离的LLM引导控制平面策略进行基准测试

Aman Chauhan, Vishnu Pendyala

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文测试了不同规模和架构的LLM在HAProxy后端故障隔离中的策略效果,发现约3B有效参数的能力阈值,达标后可显著降低5xx错误,但会增加延迟与令牌开销,高效方案为阈值以上模型的非推理模式。

Comments 43 pages, 6 figures, 15 tables. Submitted to Journal of Network and Computer Applications (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09949 2026-08-12 cs.AI physics.bio-ph 新提交 92%

Closed-Loop LLM Co-Pilots for Digital Agriculture

面向数字农业的闭环大语言模型(LLM)协作副驾驶系统

Serge Kernbach

机构 * CYBRES GmbH(CYBRES有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究开发闭环LLM协作副驾驶系统,基于49通道植物传感器网络实现数字农业自主控制,通过三案例验证可缩短生产周期、降低能耗,提升成本价值比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08730 2026-08-12 cs.LG cs.DC cs.PF 版本更新 92%

Measuring and Reducing WebGPU Dispatch Overhead for LLM Inference

测量与降低用于大语言模型(LLM)推理的WebGPU调度开销

Jędrzej Maczan

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究针对WebGPU用于LLM推理时的调度开销问题,提出顺序调度测量方法,发现批大小为1时调度开销是瓶颈,核心贡献为明确该优化方向并指出调度摊销的改进路径。

Comments Accepted to The Fourth UK AI Conference 2026 as a full paper, to be published in Proceedings of Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10314 2026-08-12 cs.SE physics.comp-ph 新提交 91%

Does the way we write a theory change the program an LLM builds from it? A prospective randomized study of renderer format in LLM theory-to-program translation

我们撰写理论的方式会改变大语言模型(LLM)据此构建的程序吗?一项针对LLM理论转程序翻译中渲染器格式的前瞻性随机研究

Andre Panossian

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究通过前瞻性随机实验发现,LLM理论转程序翻译中渲染器格式未产生预测的行为几何,为该领域规范格式效应设定了边界并提供了可审计研究工具。

Comments 112 pages, 2 figures; includes supplementary material and five reproducibility annexes. Data: https://doi.org/10.5281/zenodo.21876518. Software: https://doi.org/10.5281/zenodo.21879576

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02329 2026-08-12 cs.DC 版本更新 91%

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference

驯服请求不平衡:面向解聚LLM推理的SLO感知调度

Qipeng Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对解聚LLM推理中请求长度长尾分布导致的预填阶段队头阻塞和解码阶段拖尾者利用率低的问题,提出SLO感知调度系统Kairos,通过预填侧的紧迫性优先级调度和解码侧的松弛引导自适应批处理,显著提升SLO达成率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11045 2026-08-12 cs.LG cs.CL 新提交 91%

ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization

ReRound:用于解决无校准LLM量化中中点歧义的重构舍入法

He-Yen Hsieh, H. T. Kung

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 ReRound是一种后训练量化方法,通过条件扩散模型解决无校准LLM量化的中点歧义,在小型LLM的3、4比特量化上优于标准RTN,性能接近依赖校准方法且无额外推理开销。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10692 2026-08-12 cs.CL cs.AI 新提交 91%

SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information

SPIEval:评估大型语言模型作为处理分散个人信息的移动助手的能力

Junjie Ye, Zhuohui Sheng, Shaofan Liu, Yulun Zhu, Wenjie Fu, Dingwei Zhu, Ming Zhang, Yujiong Shen, Weichao Wang, Xin Zhao, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang, Pluto Zhou

机构 * Fudan University(复旦大学) Tencent Hunyuan Team(腾讯混元团队)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究推出基于五种认知能力的人工策划基准SPIEval,评估9种LLMs作为移动助手处理分散个人信息的能力,发现其准确率最高仅57.3%,存在信息定位等显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10037 2026-08-12 cs.LG cs.AI 新提交 90%

DOCSCHISEL: Adaptive Tool Documentation Optimization Framework for LLM Agents

DOCSCHISEL:面向大语言模型智能体的自适应工具文档优化框架

You Lu, Kun Zhang, Bihuan Chen, Xin Peng

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LLM智能体工具文档的异质性与泛化问题,提出DocsChisel自适应优化框架,经实验较原始文档及EasyTool、DRAFT基线大幅提升任务成功率,且开销有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03645 2026-08-12 cs.CL cs.CY 90%

LLM-MC-Affect: LLM-Based Monte Carlo Modeling of Affective Trajectories and Latent Ambiguity for Interpersonal Dynamic Insight

LLM-MC-Affect: 基于大语言模型的蒙特卡洛建模:情感轨迹与潜在模糊性的人际动态洞察

Yu-Zheng Lin, Bono Po-Jen Shih, John Paul Martin Encinas, Elizabeth Victoria Abraham Achom, Karan Himanshu Patel, Jesus Horacio Pacheco, Sicong Shao, Jyotikrishna Dass, Soheil Salehi, Pratik Satam

机构 * University of Arizona(亚利桑那大学) Pennsylvania State University(宾夕法尼亚州立大学) Universidad de Sonora(索尔纳大学) University of North Dakota(北达科他大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出LLM-MC-Affect框架,通过概率建模方法,将情感视为连续的潜在概率分布,从而捕捉人际互动中的情感轨迹和潜在模糊性,为动态分析提供新的视角和方法。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03611 2026-08-12 cs.DC cs.AI 版本更新 90%

Astrolabe: Balancing Load in LLM Serving with Randomized Prediction-Guided Scheduling

Astrolabe:基于随机预测引导调度的大语言模型服务负载均衡

Wei Da, Evangelia Kalyvianaki

机构 * University of Cambridge(剑桥大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Astrolabe,一种用于LLM服务的随机预测引导调度器,结合响应长度估计等策略实现负载均衡,在多组基准测试中提升SLO容量、降低延迟并减少资源开销。

Comments 16 pages. Accepted at SYSTOR 2026. Camera-ready version with expanded evaluation and revisions. Previously circulated as "Block"; renamed "Astrolabe" to match the SYSTOR publication title

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04744 2026-08-12 cs.LG cs.AI 90%

Reward Guidance for Reinforcement Learning Tasks Based on Large Language Models: The LMGT Framework

Yongxin Deng, Xihe Qiu, Jue Chen, Xiaoyu Tan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Journal ref Knowledge-Based Systems, 322 (2025) 113689

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02068 2026-08-12 cs.CR cs.CL cs.LG 版本更新 88%

Robust and Secure Code Watermarking for Large Language Models via ML/Crypto Codesign

基于ML/密码学协同设计的大语言模型鲁棒安全代码水印

Ruisi Zhang, Neusha Javidnia, Nojan Sheybani, Farinaz Koushanfar

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究提出首个ML/密码学协同设计的RoSeMary框架,通过端到端训练结合CodeT5实现高质量代码水印,用零知识证明安全验证,兼具高检测准确率、抗攻击能力与高效性。

Comments accept to ACM TAISAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10459 2026-08-12 cs.CL cs.AI 新提交 88%

MD-ProTector: Positioning Multiple Data-Driven Prototypes for LLM-Generated Text Detection

MD-ProTector:为大语言模型生成文本检测定位多个数据驱动原型

Jinmo Han, Jimin Hong, Chanyeong Moon, Ju Yeon Kang, Seonuk Kim, Nam Soo Kim

机构 * Seoul National University(首尔大学)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 该研究针对LLM生成文本检测的类别内部差异问题,提出MD-ProTector模型,通过原型定位损失优化,在多基准测试中取得优于同类编码器方法的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10447 2026-08-12 cs.IR cs.AI 新提交 87%

Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging

基于模型合并的大语言模型推荐系统高效推理研究

Linh Dieu Le, Tong Chen, Shazia Sadiq, Hongzhi Yin, Ming Jin, Junliang Yu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对LLM推荐系统推理冗长导致成本高的问题,提出首个用于推理压缩的注意力头级细粒度模型合并框架,在不降低推荐准确率的前提下最多缩短24.3%的推理长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10538 2026-08-12 cs.AI 新提交 86%

SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models

SKILLER:面向小型语言模型可复用技能提取的语言级强化学习框架

Chenhao Dang, Siyuan Xiong, Conghui He, Weijia Li

专题命中 效率与部署 :language model(title,abstract);small language model(title);分类 cs.AI

AI总结 研究针对小型语言模型技能生成成本高的问题,提出SKILLER框架,经实验在多基准上优于现有方法,性能接近闭源模型,可大幅降低智能体技能部署成本。

Comments 15 pages, 6 figures, and 8 tables. Submitted to AAAI 2027. Project and code: https://github.com/DANG-ai/SKILLER

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08932 2026-08-12 cs.AR 版本更新 86%

From Indiscriminate to Targeted: Functionally Critical Signal-Driven Assertion Generation using LLMs for Efficient RTL Verification

从盲目到定向:通过功能关键信号驱动的LLM断言生成实现高效的RTL验证

Yonghao Wang, Hongqin Lyu, Boling Chen, Jiaxin Zhou, MinYang Bao, Wenchao Ding, Feng Gu, Zhiteng Chao, Jianan Mu, Kan Shi, Tiancheng Wang, Huawei Li

专题命中 效率与部署 :LLM(title_cn,summary_cn)

AI总结 本文提出AgileAssert框架,通过构建RTL语义图并识别关键信号,指导LLM生成定向断言,提升验证效率,减少断言数量并提高覆盖率。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07215 2026-08-12 cs.SE cs.PL 版本更新 86%

The CodeInverter Suite: Structure- and Data-Aware Binary Decompilation with Efficient LLMs

CodeInverter工具套件:基于结构与数据感知及高效大语言模型的二进制反编译技术

Peipei Liu, Jian Sun, Rongkang Sun, Li Chen, Zhaoteng Yan, Xiaoling Zhang, Dawei Wang, Dapeng Sun, Peizheng Zhang, Dan Li

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有LLM反编译方法在结构重构、数据恢复等方面的不足,本文提出含CIW、CID、CIMs的CodeInverter套件,经实验验证可显著提升反编译性能,CIM-6.7B达最优效果

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10939 2026-08-12 cs.CL cs.AI 新提交 85%

A Cost-Efficient Routing Pipeline for Multilingual Short-Text Classification Using Small Language Models

使用小型语言模型的低成本多语言短文本分类路由流水线

Wajdi Ben Saad, Safa Madiouni

专题命中 效率与部署 :language model(title);small language model(title);分类 cs.CL、cs.AI

AI总结 本研究提出一种使用小型语言模型的多语言短文本分类路由流水线,通过选择性翻译低资源语言提升分类性能,在两个基准上验证了该策略的有效性。

Comments Accepted for publication at the 16th International Conference on Advanced Computer Information Technologies (ACIT 2026), https://acit.tech/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09941 2026-08-12 cs.CL 新提交 84%

The Multilingual Quantization Tax: Structural Collapse and Typological Fragility in Edge SLMs

多语言量化代价:边缘端小型语言模型(SLM)中的结构崩溃与类型学脆弱性

Mohammad Wathiq Soualhi

专题命中 效率与部署 :SLM(title_cn,abstract_cn);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本研究针对Gemma 4、Qwen 3.5架构开展4比特量化的零样本多语言评估,发现量化存在类型学脆弱性等四类现象,揭示了量化代价的多语言差异。

Comments Under review at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11121 2026-08-12 stat.OT stat.ME 新提交 83%

Generative AI use in Statistical Research: A Literature Review and Code Generation Case Study

生成式AI在统计研究中的应用:文献综述与代码生成案例研究

Natalie Morosin, Adel Ahmadi Nadi, Michael P. Wallace

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过案例研究分析了ChatGPT-5和ScholarAI在统计研究的文献综述与代码生成中的应用,发现其需专业人员提示监督,可作为研究工具但无法替代专业方法论知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09921 2026-08-12 cs.LG 版本更新 83%

A Tale of Two Temperatures: Simple, Efficient, and Diverse Sampling from Diffusion Language Models

双温度的故事:从扩散语言模型中实现简单、高效且多样的采样

Theo X. Olausson, Metod Jazbec, Xi Wang, Armando Solar-Lezama, Christian A. Naesseth, Stephan Mandt, Eric Nalisnick

机构 * Massachusetts Institute of Technology(麻省理工学院) UvA-Bosch Delta Lab, University of Amsterdam(阿姆斯特丹大学UvA-Bosch Delta实验室) Johns Hopkins University(约翰霍普金斯大学) University of California, Irvine(加州大学尔湾分校)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出通过温和的温度化方法提升扩散语言模型采样多样性,实现高效且多样化的样本生成,优于现有方法。

Comments V2: accepted as a full conference paper at COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08240 2026-08-12 cs.CV cs.AI 版本更新 83%

Hybrid Token Compression for Vision-Language Models

HybridToken-VLM:用于视觉-语言模型的混合令牌压缩

Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Princeton University(普林斯顿大学) Snap Inc(Snap公司)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 HybridToken-VLM通过混合令牌压缩技术,在保持性能的同时显著提升视觉-语言模型的效率

Comments Accepted at CVPR 2026. Code available at https://github.com/jushengzhang/HybridToken-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10288 2026-08-12 cs.LG cs.CL 新提交 82%

Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference

幂律图注意力:缩放点积注意力的精确泛化,推理时的经验崩溃

Burc Gokden

机构 * Fromthesky Research Labs LLC(弗洛姆斯基研究实验室有限责任公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出PLGA注意力机制,其在$G_{LM}=I$时精确包含SDPA,还证明了推理崩溃定理,在测试样本上的分块与顺序评分结果与TruthfulQA度量偏差极小,相关证明核心已通过Lean 4机器验证。

Comments 61 pages, 1 figure, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00135 2026-08-12 cs.LG cs.AI 版本更新 82%

On Effectiveness and Efficiency of Agentic Tool-calling and RL Training

论智能体工具调用与强化学习训练的有效性与效率

Tong Liu, Cheng Qian, Matej Cief, Yuan He, Daniele Dan, Nikolaos Aletras, Gabriella Kazai

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文系统分析工具调用评估中的实现选择对结果敏感性的影响,并针对强化学习训练中的计算浪费提出两种加速技术。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11076 2026-08-12 cs.CV 新提交 82%

Foundation Model-Enabled Efficient Data Sampling (FEEDS): A label-efficient training strategy for pan-cancer, multi-tracer PET/CT datasets

基于基础模型的高效数据采样(FEEDS):用于泛癌、多示踪剂PET/CT数据集的标签高效训练策略

Biratal Raj Wagle, Bashirul Azam Biswas, Grant Chau, Matthew E. Maeder, Muhammad Azeem Arshad, Michael S. Leapman, James B. Yu, Indrani Bhattacharya

机构 * Geisel School of Medicine at Dartmouth(达特茅斯盖泽尔医学院) Dartmouth Hitchcock Medical Center(达特茅斯-希区柯克医疗中心) Yale University(耶鲁大学)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 该研究提出FEEDS策略,利用视觉基础模型嵌入选择信息性和多样性未标注病例,在减少70%标注负担时达到全标注训练性能,解决了PET/CT病灶分割的标签稀缺问题。

Comments Code is publicly available on https://github.com/Image-and-Multimodal-Data-Analytics/FEEDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10801 2026-08-12 cs.CV 新提交 82%

Evaluating Semantic and Spatial Guidance for Foundation Model Segmentation of Small-Scale PV in Remote Sensing Imagery

评估基础模型在遥感影像中小规模光伏分割的语义与空间引导

Roni Blushtein-Livnon, Tal Svoray, Osher Rafaeli, Michael Dorman, Itay Fischhendler, Havazelet Yahel, Emir Galilee

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Ben Gurion Institute for the Study of Israel & Zionism(本-古里安以色列与犹太复国主义研究所) Ben-Gurion Israel Research Institute(本-古里安以色列研究所)

专题命中 效率与部署 :foundation model(title,abstract);prompting(abstract)

AI总结 该研究评估了SAM3在遥感影像中小规模光伏分割中不同提示策略的效果,发现混合提示性能最优,仅需少量标注样本即可实现高效分割,为无电网地区光伏测绘提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06085 2026-08-12 cs.DC 82%

LAAFD: LLM-based Agents for Accelerated FPGA Design

LAAFD: 基于大语言模型的加速FPGA设计代理

Maxim Moraru, Kamalavasan Kamalakkannan, Jered Dominguez-Trujillo, Patrick Diehl, Atanu Barai, Julien Loiseau, Zachary Kent Baker, Howard Pritchard, Galen M Shipman

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 LAAFD利用大语言模型将通用C++转换为优化的Vitis HLS内核,实现高性能FPGA设计,同时降低专业门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10362 2026-08-12 cs.OS cs.AI 新提交 81%

MemSpec: Memory-Aware Runtime for Adaptive Draft Scheduling in Speculative Decoding on Edge Devices

MemSpec:边缘设备上推测解码中自适应草稿调度的内存感知运行时

Eunjeong Kim, Yeong Jun Jeon, Myeonggyun Han

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对边缘设备推测解码中内存受限导致自适应方法吞吐量提升不足的问题,提出MemSpec内存感知运行时,通过解耦草稿选择与执行等设计,使Jetson Orin Nano上的稳态生成吞吐量平均提升40.7%

Comments Published in LCTES 2026

Journal ref Proc. ACM LCTES 2026, 180-192 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10290 2026-08-12 cs.SE cs.AI cs.HC cs.PL 新提交 81%

Comprendia: AI-Augmented Code Comprehension

Comprendia:AI增强型代码理解工具

Costain Nachuma, Minhaz F. Zibran

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出一款名为Comprendia的Eclipse插件,通过集成结构依赖可视化、LLM代码解释、克隆检测及CVE风险叠加功能,为Java程序理解提供支持,在含已知克隆与漏洞的Java项目上验证了其有效性。

Comments 5 pages, 2 figures. Accepted at ICSME 2026, Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01418 2026-08-12 cs.CL 版本更新 81%

Cost-Efficient Estimation of General Abilities Across Benchmarks

跨基准的低成本能力估计

Michael Krumdick, Adam Wiemerslage, Seth Ebner, Charles Lovering, Chris Tanner

机构 * Kensho Technologies MIT(麻省理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过改进的多维项目反应理论模型与自适应项目选择方法,以低成本预测模型在未见任务上的性能,实现高效基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏