arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2607.01977 2026-07-03 cs.AI 新提交 92%

OntoLearner: A Modular Python Library for Ontology Learning with Large Language Models

OntoLearner: 一个用于大语言模型本体学习的模块化Python库

Hamed Babaei Giglou, Jennifer D'Souza, Andrei Aioanei, Nandana Mihindukulasooriya, Sören Auer

机构 * TIB – Leibniz Information Centre for Science and Technology(TIB – 莱布尼茨科学与技术信息中心) L3S Research Center, Leibniz University of Hannover(L3S研究中心,莱布尼茨汉诺威大学) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出OntoLearner框架,统一本体访问、LLM驱动学习管道和标准化基准,通过跨领域大规模实验揭示本体学习的主要瓶颈是模型知识编码与本体组织的结构性不匹配。

Comments 30 pages. Under review at Nature Communications. This version is reformatted with a different section structure; content is unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25400 2026-06-25 cs.AI 新提交 92%

BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding

BrainAgent:一种大语言模型驱动的多智能体框架,用于自主脑信号理解

Yangxuan Zhou, Sha Zhao, Jiquan Wang, Shijian Li, Gang Pan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出LLM驱动的多智能体框架BrainAgent,通过分层架构将自然语言意图转化为可执行的处理流水线,实现脑信号分析的自动化与民主化。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24610 2026-06-24 cs.CL 新提交 92%

Same Lesson, Different Story: Cross-Lingual Reconstruction of Cultural Narratives in Large Language Models

同一教训,不同故事:大型语言模型中文化叙事的跨语言重构

Jory Alshaalan, Haya Albaker, Abeer Aldayel, Aljawharah Alabdullatif, Rehab Alahmadi

机构 * College of Computer and Information Sciences(计算机与信息科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 本研究通过跨语言谚语集和四种LLM生成叙事,评估模型在跨语言条件下是否保留文化意义,发现跨语言提示基本保留语义但改变叙事结构,且模型间存在强收敛。

Comments This paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24408 2026-06-24 cs.LG 新提交 92%

Natural Identifiers for Privacy and Data Audits in Large Language Models

大型语言模型中用于隐私和数据审计的自然标识符

Lorenzo Rossi, Bartłomiej Marek, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 提出自然标识符(NIDs)解决LLM隐私审计难题,无需重训练即可进行事后差分隐私审计和数据集推断。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22382 2026-06-23 eess.IV cs.AI cs.CV 新提交 92%

Large Language Model-Assisted Cleaning of Report-Derived Labels in a Large-Scale Chest CT Dataset

大型胸部CT数据集中基于大语言模型的报告衍生标签清洗

Yosuke Yamagishi, Atsushi Takamatsu, Mototsugu Sato, Tomohiro Kikuchi, Shouhei Hanaoka, Takeharu Yoshikawa, Osamu Abe

机构 * Division of Radiology and Biomedical Engineering, Graduate School of Medicine, The University of Tokyo(放射医学与生物医学工程系,东京大学医学研究生院) Department of Computational Diagnostic Radiology and Preventive Medicine, The University of Tokyo Hospital(计算诊断放射学与预防医学系,东京大学医院) Department of Radiology, Kanazawa University Hospital(金泽大学医院放射科) Faculty of Medicine, The University of Tokyo(东京大学医学系) Department of Radiology, School of Medicine, Jichi Medical University(立命馆大学医学系放射科) Department of Radiology, The University of Tokyo Hospital(东京大学医院放射科)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究利用大语言模型(GPT-5.4)清洗CT-RATE数据集中的标签-报告不一致性,通过放射科医生裁决验证,发现LLM辅助清洗能有效识别临床相关错误,并提升数据集质量。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16987 2026-06-16 cs.AI 新提交 92%

Consensus-based Agentic Large Language Model Framework for Harmonized Tariff Schedule Code Classification

基于共识的智能体大语言模型框架用于协调制度海关编码分类

Truong Thanh Hung Nguyen, Khanh Van Quynh Nguyen, Hoang-Loc Cao, Tri Duong, Phuc Ho, Van Pham, Loc Nguyen, Hung Cao

机构 * Analytics Everywhere Lab, University of New Brunswick(新不伦瑞克大学无处不在分析实验室) University of Economics Ho Chi Minh City(胡志明市经济大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出一种多智能体LLM框架,通过信息检索、语义检索、证据推理、共识验证和分层投票等方法,解决加拿大10位HTS编码分类难题,在3300条数据上验证了证据驱动和人工参与的必要性。

Comments Accepted at the 3rd International Conference of Resilience by Technology and Design (RTD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11672 2026-06-11 cs.CR cs.AI 新提交 92%

Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment

开源LLM代理能否取代静态应用安全测试工具?一项实证评估

Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

机构 * College of Engineering and Science, Florida Institute of Technology(工程学院与科学学院,佛罗里达理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 评估基于开源LLM的代理在静态应用安全测试中的性能,与SAST工具Bandit对比,发现当前不适合实际应用。

Comments Keywords: Agentic AI, Cybersecurity, Large Language Models, Static Application Security Testing, Model performance evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08071 2026-06-09 cs.CL 新提交 92%

SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

SurgiQ: 用于评估大语言模型手术理解的大规模多领域基准

Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi, Hamdan Alhadhrami, Preslav Nakov, Cesare Stefanini

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出SurgiQ基准,包含13,055道多选题,覆盖六个外科领域和四种题型,用于评估LLM的手术推理能力。实验显示最佳模型准确率仅68.1%,通用模型优于多数生物医学模型,表明当前医学专业化未能充分覆盖手术知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11623 2026-08-13 cs.LG cs.AI cs.NI eess.SP 新提交 92%

FM-LLM: A frequency-enhanced mixture-of-experts framework for adapting LLMs to time series forecasting

FM-LLM:一种用于适配大语言模型(LLMs)进行时间序列预测的频率增强型混合专家框架

Rentao Gu, Yihang Ding, Junjie Li, Yi Ding, Weijing Sang, Xiaoli Huo, Xin Qin, Yuefeng Ji

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Telecom Research Institute(中国电信研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出FM-LLM框架,通过频谱标记对齐器与非对称MoE解码器等设计,在11个基准的多数指标上优于现有LLM基线,且具备良好迁移性。

Journal ref R. Gu, Y. Ding, J. Li, Y. Ding, W. Sang, X. Huo, X. Qin, and Y. Ji, Knowl.-Based Syst., vol.341, p.115776, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08126 2026-08-11 cs.LG cs.CL 新提交 92%

Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk

准确集成,脆弱叙事:多尺度堆叠与LLM生成信用风险解释的保真度审计

Gregorius Reynaldi Pratama, Kuo-Kun Tseng

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本研究构建多尺度堆叠集成预测模型并测试LLM生成信用风险解释的保真度,发现预测性能提升有限,LLM生成的解释存在事实错误,需对生成解释进行验证。

Comments 13 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07499 2026-08-11 cs.HC cs.AI cs.CL 新提交 92%

Evaluation of Motivational Interviewing Counsellors with Task-Aware Multi-Stage LLM-Based Simulated Clients

基于任务感知多阶段大语言模型(LLM)模拟来访者的动机访谈咨询师评估

Jiading Zhu, Xinyu Cindy Wang, Thomas Nguyen, Yan Qing Lee, Osnat C. Melamed, Peter Selby, Jonathan Rose

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对动机访谈的关键唤起任务,提出Evoke-Sim任务感知多阶段LLM模拟来访者框架,用于戒烟场景下MI咨询师评估,其评估效果优于现有模拟来访者,为相关评估设定了更高标准。

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07378 2026-08-10 eess.AS cs.AI cs.LG 新提交 92%

LSEAD: A Privacy-Preserving LLM-Based Speech Analysis Framework for Early Alzheimer's Disease Screening

LSEAD:一种基于大语言模型(LLM)的隐私保护型语音分析框架,用于阿尔茨海默病(AD)早期筛查

Xin Wang, Yingchao Huang, Yuhan Su, Shanshan Yao, Wei Peng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于开源LLM的隐私保护语音分析框架LSEAD,在ADReSS系列数据集上使AD分类准确率提升最多5个百分点,为早期AD筛查提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04240 2026-08-06 cs.CL cs.AI 新提交 92%

Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

棋盘上的幻觉:工具增强型大语言模型(LLM)象棋评论评估

S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh, Pramod Viswanath

机构 * Princeton University(普林斯顿大学) Sentient Labs University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ACT-Eval框架,评估工具增强型LLM的象棋评论,发现事实幻觉普遍存在,工具可提升事实正确性但战略战术覆盖度仍有限。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22766 2026-07-28 cs.LG cs.AI 新提交 92%

Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation

超越夏普利值:用于大语言模型对齐和评估的基于影响的数据审核管道

Yunting Song, Matthew Watson, Peter Grabowski, Jun Qin

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(title,summary_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型数据质量问题,引入可扩展的基于影响的数据审核管道,通过映射语义邻域到有向图,利用参考LLM概率分布评估数据效用,转换为局部优势指标,有效清理数据集,揭示基准漏洞,确保数据完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09843 2026-07-08 cs.HC cs.AI cs.CL 新提交 92%

An LLM-Native Psychometric Instrument Reveals a Self-Report--Behavior Gap Across 25 Models

一个原生LLM的心理测量工具不能预测LLM行为:来自25个模型的证据

Juan Manuel Contreras

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过探索性因子分析从LLM行为中构建心理测量工具,发现LLM的自我报告与观察行为无关,揭示自我报告与人类判断之间的混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27009 2026-06-26 cs.AI cs.LG cs.MA 新提交 92%

Semantic Early-Stopping for Iterative LLM Agent Loops

迭代式LLM智能体循环的语义早停

Sahil Shrivastava

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对多智能体LLM循环中固定迭代次数终止的低效问题,提出基于语义相似度和质量评估的早停机制,理论证明终止确定性,实验表明无质量门控的语义早停在HotpotQA上节省38%操作token且性能持平。

Comments 7 pages, 5 figures, 4 tables. Open implementation, machine-checked theory, and reproducible harness: github.com/SahilShrivastava-Dev/semantic-halting-problem

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25750 2026-06-25 cs.CR cs.CL cs.LG 新提交 92%

RAS: Measuring LLM Safety Through Refusal Alignment

RAS: 通过拒绝对齐衡量LLM安全性

Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee

机构 * National Yang Ming Chiao Tung University Hon Hai Research Institute

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出白盒评估方法SafeVec,通过内部表示而非生成答案衡量LLM安全性,计算拒绝对齐分数RAS,实现快速、校准的安全评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19714 2026-06-19 stat.ML cs.AI cs.LG stat.CO stat.ME 新提交 92%

AURA: Adaptive Uncertainty-aware Refinement for LLM-as-a-Judge Auditing

AURA: 用于LLM作为评判审计的自适应不确定性感知精炼

Zilong Zhang, Yi-Ting Hung, Weiyi He, Junxi Zhang, Lei Ding, Chi-Kuang Yeh

机构 * Department of Mathematics and Statistics(数学与统计学系) Georgia State University(佐治亚州立大学) Department of Probability and Statistics(概率与统计学系) Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学) Concordia University(Concordia 大学) Department of Statistics(统计学系) University of Manitoba(曼尼托巴大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出AURA框架,通过自适应不确定性感知精炼,在少量人工验证下迭代学习人类一致性信号,优先审核不确定比较,提升LLM评判的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19376 2026-06-19 cs.LG cs.AI cs.IR 新提交 92%

Cost-Optimal LLM Routing with Limited User Feedback under User Satisfaction Guarantees

在用户满意度保证下基于有限用户反馈的成本最优LLM路由

Herbert Woisetschläger, Arastun Mammadli, Ryan Zhang, Shiqiang Wang

机构 * Technical University of Munich(慕尼黑工业大学) University of Exeter(埃克塞特大学) Horace Greeley High School(霍勒斯格里利高中)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM推理成本与服务质量之间的矛盾,提出SLARouter在线路由算法,利用稀疏单侧用户反馈学习成本最优策略,理论保证成本最优和SLA合规,实验显示成本降低高达2.2倍。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16368 2026-06-16 cs.CL cs.LG 新提交 92%

Evaluating LLM Personalization via Semantic Constraint Verification

通过语义约束验证评估LLM个性化

Xuran Li, Guanqin Zhang, Imran Razzak, Hakim Hacid, Eleanna Kafeza, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Technology Innovation Institute(技术创新研究所) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出NLICV框架,利用自然语言推理模型将句子映射到真值条件集,验证个性化约束,将LLM行为分为四类,与人类标注高度一致,并大幅降低延迟和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16206 2026-06-16 cs.AI cs.CL cs.CY cs.HC 新提交 92%

Measuring Whether LLM Tutors Teach or Solve: A Diagnostic for Educational Impact

衡量LLM导师是教学还是解题:教育影响的诊断方法

Junyi Yao, Zihao Zheng, Baichuan Li

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Department of Operations Research and Engineering Management, Southern Methodist University(南卫理公会大学运筹学与工程管理系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM作为教育导师时解题能力不等于教学支持的问题,提出基于解题导向与教学导向基准性能差距的诊断方法,通过MathTutorBench分析表明两者仅部分对齐,建议分开报告评分并明确保护学生能动性的标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13735 2026-06-15 cs.AR cs.AI cs.LG cs.PL 新提交 92%

VHDLSuite: Unified Pipeline for LLM VHDL Generation with Data Synthesis and Evaluation

VHDLSuite:面向LLM VHDL生成的统一流水线,包含数据合成与评估

Yijun Shen, Minghao Shao, Yichen Zhao, Zhuoyan Yu, Boyuan Chen, Yik-Cheung Tam, Muhammad Shafique

机构 * Center for Data Science, NYU Shanghai, China(纽约市立大学上海分校数据科学中心) NYU Tandon School of Engineering, USA(纽约大学Tandon工程学院) NYU Abu Dhabi, UAE(纽约大学阿布扎比分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出VHDLSuite基础设施,通过自动基准合成、可执行验证和多模型诊断分析,解决LLM在VHDL生成评估中的不足,并构建含200+问题的VHDLBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12117 2026-06-11 cs.CL cs.AI 新提交 92%

Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation

软提示调优用于公平且高效的LLM基准评估

Selen Erkan, Bastian Boll, Kristian Kersting, Björn Deiseroth, Letitia Parcalabescu

机构 * Aleph Alpha Research Lab(Aleph Alpha 研究实验室) TU Darmstadt(达姆施塔特工业大学) Hessian.AI(黑森人工智能中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出软提示调优方法,通过优化少量软提示向量使基础模型适应基准格式,公平评估其真实知识,效率高且无需完整后训练。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08400 2026-06-09 cs.SE cs.AI cs.CL 新提交 92%

Impacts of Histories and Models on LLM Grading: A Study in Advanced Software Engineering Courses

历史与模型对LLM评分的影响:高级软件工程课程研究

Qilin Zhou, Zhuo Wang, Yue Li, W. K. Chan

机构 * City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对研究生阅读报告评分负担重的问题,提出人机协同的LLM辅助评分流程,基于180份作业评估Grok和GPT的评分一致性与人类对齐,发现交互历史导致评分标准漂移,需特定操作缓解不公平。

Comments 5 pages, accepted by ISET 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06614 2026-06-08 cs.CL cs.AI cs.HC 新提交 92%

Re-Centering Humans in LLM Personalization

重新将人类置于LLM个性化中心

Lechen Zhang, Jiarui Liu, Tal August

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM个性化在合成数据与人类数据上的性能差距,通过收集人类对话和判断揭示系统在属性提取、相关属性配对和个性化响应生成阶段的局限性,并引入轻量级训练干预以缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09876 2026-07-14 cs.CV cs.AI q-bio.NC q-bio.QM 新提交 92%

Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data

Prompting-MammAlps:用于相机陷阱数据的细粒度文本到视频检索

Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis

机构 * Ecole Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学)

专题命中 评测与基准 :prompting(title,title_cn);LLM(abstract);language model(abstract);分类 cs.AI

AI总结 针对相机陷阱数据自动检索视频的难题,提出Prompting-MammAlps基准及细粒度可解释TVR方法,训练视觉变压器并结合大语言模型处理查询,在基准测试中取得较好成绩,优于零样本VLM。

Comments Accepted at ECCV 2026; Project page: https://cnai.epfl.ch/prompting-mammalps

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19347 2026-08-21 cs.SE 新提交 92%

Hype Meets Reality: Large Language Models as Mutators in Search-based Automated Program Repair of Simulink-Stateflow Models

炒作与现实的碰撞:大型语言模型作为基于搜索的Simulink-Stateflow模型自动化程序修复中的变异器

Ayesha Irshad, Pablo Valle, Jon Ayerdi, Aitor Arrieta

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文以Simulink/Stateflow建模的CPS为研究对象,扩展FlowRepair方法用LLM生成的变异替换部分算子,受控实验发现该方法大幅降低修复性能,分析指出盲目集成LLM到基于搜索的APR存在根本局限,需发展混合方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12292 2026-08-13 cs.CY 新提交 92%

Teaching a Large Language Model Tutor to Withhold the Answer: A Supervisor Architecture and an Evidence-Driven Method for Tuning Socratic Behavior

训练大型语言模型助教以保留答案:一种用于调整苏格拉底式行为的监督架构与证据驱动方法

Yusuf Pisan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出一种监督架构与证据驱动方法,训练LLM助教执行答案保留,通过自动评估调整苏格拉底式行为,使其在全部四个接受标准上达到完全合规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05921 2026-08-07 cs.SE 新提交 92%

Sensor-Level Fault Diagnosis for Automotive Software Validation Using Large Language Models

基于大语言模型的汽车软件验证传感器级故障诊断

Mohammad Abboush, Hamza Ouarrad, Andreas Rausch

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该研究提出两阶段框架,用经4-bit低秩适配的LLM对HIL平台的汽车传感器记录做故障诊断,最小模型准确率达81.6%,适配循环可在单商用加速器运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01451 2026-08-04 cs.SE 新提交 92%

Doc2CI: A Multi-Service Study of CI Configuration Generation Using Large Language Models

Doc2CI:基于大语言模型的CI配置生成多服务研究

Taher A. Ghaleb

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract_cn);language model(title,abstract_cn)

AI总结 本文通过构建DOC2CI基准评估LLM生成CI配置的能力,发现其结构有效性不足,提出无需训练的模式引导修复方法提升有效性,为相关工具开发提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏