arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-03 至 2026-08-03 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 65 篇

2607.18529 2026-08-03 cs.HC cs.AI 版本更新 79%

EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration

EduPanel:用于教学视频的三智能体大语言模型评判器——可靠性、互补性和人类信任校准

Jia-Kai Dong, Yi-Cheng Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(NTU人工智能卓越研究中心)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 针对教学视频教学质量评估需求,提出基于评分标准、以学习者为条件的EduPanel大语言模型评判器,通过专门智能体分解评估,经多项分析实现高可靠性,能辅助教育评估,提高评分准确性且让专家可检测不可靠输出。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19827 2026-08-03 cs.CL cs.AI cs.IR 版本更新 79%

When Iterative RAG Beats Ideal Evidence: A Diagnostic Study in Scientific Multi-hop Question Answering

当迭代RAG优于理想证据:科学多跳问答中的诊断研究

Mahdi Astaraki, Mohammad Arshi Saloot, Ali Shiraee Kasmaee, Hamidreza Mahyar, Soheila Samiee

机构 * Faculty of Engineering, McMaster University, Canada(麦斯特大学工程学院,加拿大) BASF Canada Inc., Canada(巴斯夫加拿大公司,加拿大)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过化学多跳问答数据集,诊断发现迭代检索-推理循环在科学领域显著优于静态RAG上限,揭示了阶段式检索的优势与失败模式。

Comments 51 pages, 29 figures, Published in Transactions on Machine Learning Research (05/2026). OpenReview: https://openreview.net/forum?id=pa5TnBdyDP

Journal ref Transactions on Machine Learning Research (05/2026), ISSN 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10619 2026-08-03 cs.CL 版本更新 77%

Disentangling Similarity and Relatedness in Topic Models

在主题模型中区分相似性和相关性

Hanlin Xiao, Yang Wang, Mauricio A. Álvarez, Rainer Breitling

机构 * Manchester Institute of Biotechnology, The University of Manchester, UK(曼彻斯特生物技术研究所,曼彻斯特大学,英国) Department of Computer Science, The University of Manchester, UK(计算机科学系,曼彻斯特大学,英国) Department of Chemistry, The University of Manchester, UK(化学系,曼彻斯特大学,英国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 本文通过构建大规模合成基准和神经评分器,从心理语言学角度区分主题词之间的主题相关性和分类相似性,并证明两个维度对下游任务性能有不同影响。

Comments 26 pages, 9 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29055 2026-08-03 cs.LG cs.AI cs.MA 新提交 73%

Autonomous Repair for Multi-Agent Systems via Monte-Carlo Tree Search

基于蒙特卡洛树搜索的多智能体系统自主修复

Hanxiao Lu, Tianyi Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出基于蒙特卡洛树搜索的MARS框架,将多智能体系统修复建模为搜索过程,结合分类学增强评估与诊断引导扩展,在StateMAS基准上性能优于现有方法,且令牌消耗相当。

Comments Under conference review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18476 2026-08-03 stat.CO cs.AI cs.LG 版本更新 73%

AI4BayesCode: From Natural Language Descriptions to Validated Modular Stateful Bayesian Samplers

AI4BayesCode: 从自然语言描述到经过验证的模块化状态性贝叶斯采样器

Jungang Zou, Alex Ziyu Jiang, Qixuan Chen

机构 * Department of Biostatistics, Columbia University(哥伦比亚大学生物统计学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出AI4BayesCode系统,通过自然语言描述生成可运行且验证过的MCMC采样器,采用模块化设计和递归状态性编码范式,提升了贝叶斯模型的可靠性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28662 2026-08-03 cs.AI 新提交 70%

An Ontology-Guided, Deduplication-Aware Extraction Layer for Knowledge Graph Construction from Heterogeneous Documents

面向异构文档知识图谱构建的本体引导、去重感知抽取层

Vaibhav Dangaich, Kevin Lewis, Kundeshwar Pundalik

机构 * Konectu(科内克图)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一套本体引导的去重感知抽取层,用Qwen3.5-9B模型从异构文档抽取实体与关系,经五阶段优化后,在情报语料上使搜索召回率从70%升至95%且修正多类质量缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20219 2026-08-03 cs.CL 版本更新 70%

HalluTruthQA: A Fine-Grained Benchmark for Hallucination Detection, Localization, and Explanation in Arabic Question Answering

HalluTruthQA:阿拉伯语问答中幻觉检测、定位和解释的细粒度基准

Abdessalam Bouchekif, Mohammed-En-Nadhir Zighem, Salah Eddine Bekhouche, Hichem Telli, Somaya Eltanbouly, Shahd Gaben, Heba Sbahi, Samer Rashwani, Mutaz Al-Khatib, Emad Mohamed, Mohammed Ghaly, Abdenour Hadid

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) Qatar University(卡塔尔大学) University of Biskra(比斯克拉大学) University of the Basque Country(巴斯克大学) Nazarbayev University(纳扎尔巴耶夫大学) Universiti Malaysia Kelantan(马来西亚吉兰丹大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对阿拉伯语问答中幻觉检测等难题,提出HalluTruthQA细粒度基准,含多领域2400个示例。在零样本设置下评估四个开源模型,发现各任务考查不同能力,强调幻觉评估应拓展到定位、验证和解释事实错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19063 2026-08-03 cs.AI 版本更新 70%

Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs

质量行动保证:虚拟现实客观结构化临床考试中考官声明的多模态验证

Harry Rogers, Sally Shiels, Ashley Tomlinson, James Thomas, James Aylward, Nathan Gauge, Helen Higham, Alison Noble

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对VR儿科OSCEs中考官评分受主观因素影响问题,提出多模态框架QAA,结合约束时间动作对齐模型与大语言模型,通过对比动作与真实事件序列验证考官声明,提升了评估的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29495 2026-08-03 cs.AI 版本更新 70%

Cognitive World Model for Progressive BDI/E Trajectory Evaluation of Conversational Agents

用于过程级社会影响力评估的认知世界模型

Minghui Ma, Bin Guo, Hao Wang, Han Wang, Mengqi Chen, Jingqi Liu, Yan Liu

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出认知世界模型(CogWM),通过联合预测BDI/E认知状态和用户话语,实现从终端判断到过程跟踪的社会影响力对话评估,在四个场景中达到77.6%情感准确率。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29604 2026-08-03 cs.CR 新提交 67%

CWEEP: A Lexical Static Analysis Framework for CWE Early Prevention

CWEEP:用于CWE早期预防的词法静态分析框架

Bryan Kwan, Benjamin Tan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CWEEP是一种用于RTL安全弱点检测的静态分析框架,无需详细安全规范即可在RTL开发早期使用,能定位漏洞并提供修复建议,在3874个有漏洞模块数据集上的正确警告率达60.8%,远优于同类工具。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29222 2026-08-03 cs.CV 新提交 67%

Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs?

多模态大语言模型(MLLMs)时代,显著性目标检测的复兴时机已到?

Wenzhuo Zhao, Xiuzhi Li, Zhongkuan Mao, Ronghao Xian, Yao Jiang, Zhao Gao, Keren Fu, Qijun Zhao, Jian Cheng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对MLLMs时代SOD的能力不匹配问题,提出无训练框架FOCUS,在13类SOD基准上超越SOTA方法,推动SOD从特定任务监督转向零样本前景组织。

Comments 10 pages, 4 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29192 2026-08-03 cs.CV 新提交 67%

Locally Consistent Transductive Information Maximization for Few-Shot Remote Sensing Scene Classification

用于小样本遥感场景分类的局部一致直推式信息最大化

Karim El Khoury, Benoît Gérin, Benoît Macq, Christophe De Vleeschouwer

机构 * ICTEAM, UCLouvain(天主教鲁汶大学 ICTEAM 研究所)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 针对小样本遥感场景分类问题,提出LC-TIM方法,融合多源遥感基础模型亲和图,建立首个直推式小样本遥感场景分类基准,实验表明其性能优于现有方法。

Comments Accepted at ECCVW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28825 2026-08-03 cs.SE 新提交 67%

Building a Process-Modeling Tool using Agentic AI: An Experience Report on PM4Py-UCM

使用智能体AI构建流程建模工具:PM4Py-UCM的经验报告

Daniel Amyot

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文通过AI辅助构建开源流程建模工具PM4Py-UCM的深入案例,提出相关工具包与分类法,总结了开发经验教训及验证策略。

Comments 17 pages, 9 figures, 4 tables, submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07774 2026-08-03 cs.CR 版本更新 67%

ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents

ScopeJudge:用于进攻性安全代理的成本感知预执行门控

Shane Caldwell, Max Harley, Ads Dawson, Michael Kouremetis, Vincent Abruzzo, Will Pearce

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究进攻性安全代理中预执行门控,引入ScopeJudge数据集,含4897个工具调用。评估八个法官模型在五种转录策略下表现,发现静态策略不足,推荐成本敏感和召回优先操作点,以支持自主安全代理的实时监控和可扩展监督。

Comments 22 pages, 4 figures, 4 tables, 1 link to code, 1 link to dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01499 2026-08-03 cs.CV 版本更新 67%

Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation

Anti-Prompt: 针对文本引导的图像到视频生成的图像保护

Yeonghwan Song, Chanhui Lee, Jinsoo Park, Jeany Son

机构 * GIST(光州科学技术院) POSTECH(浦项科技大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出Anti-Prompt方法,通过向图像注入不可察觉的扰动,在文本引导的图像到视频生成中引发视觉不一致和结构失败,从而保护版权和隐私。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23531 2026-08-03 cs.CV 版本更新 67%

PixIE: Prompted Pixel-Space Low-Light Image Enhancement

PixIE: 提示驱动的像素空间低光照图像增强

Ruirui Lin, Guoxi Huang, David Bull, Nantheera Anantrasirichai

机构 * Visual Information Laboratory, University of Bristol, United Kingdom(布里斯托大学视觉信息实验室,英国)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract)

AI总结 提出PixIE框架,利用视觉基础模型的语义提示,通过跨尺度去噪和DINO提示像素块进行像素空间低光照图像增强,在多个基准上提升PSNR和LPIPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09223 2026-08-03 cs.CV 版本更新 67%

CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding

CREST: 曲率调节的事件中心采样用于高效长视频理解

Mehrajul Abadin Miraj, Abdul Mohaimen Al Radi, Shariful Islam Rayhan, Md. Tanvir Alam, Ismat Rahman, Yu Tian, Md Mosaddek Khan

机构 * Dept. of CSE, University of Dhaka(达卡大学计算机科学与工程系) Dept. of CSE, University of Central Florida(中央佛罗里达大学计算机科学与工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出一种无训练帧选择方法CREST,利用查询-帧相关性的时间几何(局部曲率)来指导采样,在固定预算下实现高效长视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05627 2026-08-03 cs.CV cs.AI cs.LG cs.RO 版本更新 62%

Leveraging Image Generators to Address Data Scarcity: The Gen4Regen Dataset for Forest Regeneration Mapping

利用图像生成器解决训练数据稀缺问题:Gen4Regen数据集用于森林再生制图

Gabriel Jeanson, David-Alexandre Duclos, William Larrivée-Hardy, Noé Cochet, Matěj Boxan, Anthony Deschênes, François Pomerleau, Philippe Giguère

机构 * Northern Robotics Laboratory, Université Laval, Québec, QC, G1V 0A6, Canada(拉瓦尔大学北部机器人实验室,魁北克,QC,G1V 0A6,加拿大) Département d'informatique et de génie logiciel, Université Laval, Québec, QC, G1V 0A6, Canada(拉瓦尔大学计算机与软件工程系,魁北克,QC,G1V 0A6,加拿大)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过Gen4Regen数据集和Nano Banana Pro模型生成高质量图像及语义掩码,解决森林再生物种分割中的数据稀缺和类别不平衡问题,提升F1分数15%以上。

Comments 33 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29124 2026-08-03 cs.CV cs.LG 新提交 57%

SciFigPlag-Bench: A Benchmark for Provenance-Aware Scientific Figure Plagiarism Detection

SciFigPlag-Bench:面向来源感知的科学图片抄袭检测基准

Zhiying Cui, Minghao Yang, Linlin Gao, Jie Liu, Pengyuan Li

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出SciFigPlag-Bench基准,用于科学图片的来源感知抄袭检测,含四类任务,实验发现视觉语言模型在细粒度来源推理等方面仍有挑战。

Comments 30 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28802 2026-08-03 cs.AI 新提交 57%

Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures

模型还是控制?一种以交互为中心的智能体故障定位分类法

Harsh Raj, Vipul Gupta, Anas Mahmoud, Razvan-Gabriel Dumitru, Darvin Yi, Aakash Sabharwal, Yunzhong He

机构 * Scale

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 该研究提出以交互为中心的智能体故障分类法,将故障定位到交互及责任组件,适用于多类智能体架构,经评估具有良好可重复性与结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09094 2026-08-03 cs.SD cs.CL 版本更新 57%

Few-Shot Contrastive Adaptation for Audio Abuse Detection in Low-Resource Indic Languages

少样本对比适应用于低资源印地语中音频滥用检测

Aditya Narayan Sankaran, Reza Farahbakhsh, Noel Crespi

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 本文探讨了CLAP模型在低资源印地语中直接从音频检测滥用语音的可能性,通过ADIMA数据集评估少样本对比适应的效果,发现CLAP能提供强跨语言音频表示,但少样本适应效果语言依赖且非单调。

Comments 12 pages, preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29658 2026-08-03 cs.SE 新提交 50%

Reusing Past Repairs Through Hierarchical Trajectory Abstraction for Coding Agents

通过分层轨迹抽象复用编码智能体的过往修复工作

Yisen Xu, Jiayuan Zhou, Ruiqi Pan, Tse-Hsun Chen

专题命中 评测与基准 :LLM(abstract)

AI总结 本研究提出STAIR框架,通过分层轨迹抽象复用编码智能体过往修复经验,在SWE-bench Verified上显著提升修复智能体的Pass@1指标,且计划可跨智能体泛化。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29545 2026-08-03 cs.CV 新提交 50%

MoRoute: Dynamic Routing for In-Context Multimodal Video Generation

MoRoute:面向上下文多模态视频生成的动态路由

Chong Gao, Jie Ma, Zhan Peng, Chongxiao Wang, Haoxue Wu, Jun Liang, Guanbin Li, Jing Li

机构 * Sun Yat-sen University(中山大学) HUJING Digital Media & Entertainment Group(沪景数字媒体娱乐集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :language model(abstract)

AI总结 MoRoute是采用动态层路由连接VLM与视频DiT的多模态视频生成框架,在三个基准数据集上均优于现有最优方法,提升了视频生成与编辑的性能。

Comments Project page: https://orange-3dv-team.github.io/MoRoute/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13415 2026-08-03 cs.CV 版本更新 50%

Distance-aware Soft Prompt Guidance for Multimodal Valence-Arousal Estimation

面向距离的软提示学习用于多模态愉悦-唤醒估计

Byeongjin Jung, Chanyeong Park, Sejoon Lim

机构 * Graduate School of Automobile and Mobility(汽车与移动研究生院) Department of Automobile and IT Convergence(汽车与IT融合系)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出一种多模态框架,通过引入距离感知的软提示学习,提升多模态愉悦-唤醒估计的精度,在无约束场景中取得良好效果。

Comments 8pages

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 5294-5301

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 36 篇

2607.28826 2026-08-03 cs.LG 新提交 93%

Distilling Knowledge from Large Language Models into Lightweight Reinforcement Learning Agents for Autonomous Cyber Operations

将大型语言模型中的知识蒸馏为用于自主网络操作的轻量级强化学习智能体

Konur Tholl, François Rivest, Mariam El Mezouar, Adrian Taylor, Ranwa Al Mallah

机构 * Royal Military College of Canada(加拿大皇家军事学院) Defence Research and Development Canada(加拿大国防研究与发展部) Polytechnique Montreal(蒙特利尔理工学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.LG

AI总结 该研究针对自主网络操作中强化学习智能体训练不稳定的问题,通过提示工程证明80亿参数网络安全LLM性能优于基线RL智能体,再经在线策略蒸馏将其防御知识迁移至仅64910参数的轻量级RL智能体,为前沿网络安全模型的实用化提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29136 2026-08-03 cs.CV 新提交 92%

On the Efficacy of Self-Supervised Point Cloud Encoders for Efficient 3D Large Language Models

自监督点云编码器在高效3D大语言模型中的效能研究

Yao Zheng, Tian Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该研究探究低成本自监督点云编码器能否替代昂贵多模态编码器用于3D-LLM,经实验发现其与架构存在强交互,为高性价比3D-LLM设计提供指南。

Comments 14 pages, 3 figures. This work has been previously released as a preprint on ChinaXiv (No. ChinaXiv:202607.00167, DOI: 10.12074/202607.00167)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28884 2026-08-03 cs.CR 新提交 91%

Hollow-LLM Attack: Computationally Trivial Weights in Zero-Knowledge Verification of LLM Inference

Hollow-LLM攻击:LLM推理零知识验证中的计算上微不足道的权重

Chen Gong, Beijie Liu, Mengyuan Li

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出Hollow-LLM攻击,利用LLM零知识验证的工作量缺口,通过嵌入幽灵权重使不诚实提供者以小模型成本生成有效证明,需额外措施绑定正确性与计算工作。

Comments Accepted to the 2026 IEEE Symposium on Security and Privacy (S&P 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25018 2026-08-03 cs.LG 版本更新 90%

Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference

共形级联:多层大语言模型推理的无分布精度保证

Yifan Dou, Shikan Lian, Shibo Li

机构 * Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对LLM级联推理成本高、置信分数校准不当等问题,提出共形级联框架,以共形预测集大小为推迟规则,提供无分布精度保证,在多基准测试中表现优于启发式级联,且无需模型训练,仅需黑盒API访问。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05150 2026-08-03 cs.SE cs.AI 版本更新 90%

Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation

编译AI:基于LLM的工作流自动化确定性代码生成

Geert Trooskens, Aaron Karlsberg, Anmol Sharma, Lamara De Brouwer, Max Van Puyvelde, Matthew Young, John Thickstun, Gil Alterovitz, Walter A. De Brouwer

机构 * XY.AI Labs, Palo Alto, CA(XY.AI实验室,帕洛阿尔托) Stanford University School of Medicine, Stanford, CA(斯坦福大学医学院,斯坦福) Cornell University, Department of Computer Science, Ithaca, NY(康奈尔大学计算机科学系,伊萨卡) Brigham and Women’s Hospital / Harvard Medical School, Boston, MA(布莱根妇女医院/哈佛医学院,波士顿)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究编译AI,一种大语言模型在编译阶段生成可执行代码,随后工作流确定性执行的范式。重点探讨其在高风险企业工作流中的应用,尤其在医疗领域,强调可靠性与可审计性。

Comments 14 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29575 2026-08-03 cs.DC cs.PF 新提交 89%

SLIM: Saturation-Aware Lightweight Performance Modeling for LLM Serving

SLIM:面向大语言模型服务的饱和度感知轻量级性能建模

Pol G. Recasens, Ferran Agullo, Yue Zhu, Chen Wang, Jordi Torres, Josep Ll. Berral

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对LLM服务吞吐量饱和问题,通过GPU剖析明确其源于解码阶段注意力内核的DRAM带宽饱和,提出SLIM半分析性能模型及BCA工具,可高效预测吞吐量与延迟并优化批处理配置。

Comments Pol G. Recasens and Ferran Agullo contributed equally to the work

详情

展开后加载摘要…

URL PDF HTML 收藏