arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2707 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2707 篇

2607.26451 2026-07-30 cs.SE 新提交 80%

ExplainBench: Evaluating Code Explanations from Agents

ExplainBench:评估智能体生成的代码解释

Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf, Abhik Roychoudhury

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对智能体代码解释缺乏评估基准的问题,提出ExplainBench基准,实验发现其对智能体的排名与SWE-bench Verified不同,还实现了解释审核智能体,可提升智能体解释的可信度。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26191 2026-07-30 cs.AI cs.CL cs.LG cs.SE 新提交 80%

Position: Evaluation Scores Are Perishable Knowledge Claims

Position: 评估分数是易逝的知识主张

Sankalp Gilda, Shlok Gilda

机构 * DeepThought Solutions(深度思考解决方案公司) Meta University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究指出语言模型评估存在信任膨胀问题,提出将评估分数视为具有形式性、范围性和有效性窗口的认知主张,建议添加元数据并采用最弱链聚合,发现HELM排行榜上两种聚合方式的前五名模型完全不重合。

Comments 7 pages, 1 figure, 1 table. Published at the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, San Diego

Journal ref Proceedings of the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, pages 1029-1035

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22642 2026-07-28 cs.AI cs.CL cs.LG cs.MA cs.SE 新提交 80%

CRAFT: Learn the Schema, Execute the Plan

CRAFT:学习模式,执行计划

Aakash Kolekar, Sahika Genc, Shahriar Shariat, Bunyamin Sisman, Tibor Mezi, Barbara Poblete, Shree Vandana Kachroo, Calvin Chi, Parth Parmar, Ari Singer, Prayaas Jain, Cindy Barker, Benoit Dumoulin

机构 * Amazon Advertising Foundations(亚马逊广告基金会) Amazon Web Services Agentic AI(亚马逊网络服务代理人工智能)

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究企业编码代理将自然语言分析请求转换为可执行代码时的问题,提出两阶段训练后方法 CRAFT,先进行模式剥离的 PLAN 监督微调,再用执行形状的强化学习,评估显示其在多方面有提升并减少负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19211 2026-07-22 cs.CY 新提交 80%

Do LLMs Ask the Right Questions? Evaluating GPT-Generated Surveys as Instruments for Measuring Social Attitudes

大语言模型提出的问题正确吗?评估GPT生成的调查问卷作为衡量社会态度的工具

Tina Behzad, Wenbo Li, Reuben Kline, Klaus Mueller

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究对比GPT生成的调查问卷和既定调查基线在三个社会领域的情况,发现GPT生成的问卷与人工设计工具能捕捉相同主要态度划分,但有差异,适合探索性和大规模分析,可补充专家设计工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11046 2026-07-14 cs.SE 新提交 80%

Retrieval-Oriented Code Representations in Agentic Bug Localization

面向检索的智能体漏洞定位中的代码表示

Genevieve Caumartin, Tse-Hsun, Chen, Diego Elias Costa

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 研究文件级漏洞定位中代码表示的作用,在LCA和SWE数据集上比较五种代码表示,通过实验发现角色感知摘要性价比最佳,结合互补结果和LLM排序可进一步提升效果,案例研究验证技术有效性,强调代码表示应是智能体定位管道的重要设计选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09553 2026-07-13 cs.SE 新提交 80%

Writing Bug Reports for Software Repair Agents: What Information Matters Most?

为软件修复代理编写错误报告:哪些信息最重要?

Vincenzo Luigi Bruno, Alessandro Giagnorio, Daniele Bifolco, Leon Wienges, Massimiliano Di Penta, Gabriele Bavota

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 研究软件开发中为软件修复代理编写错误报告的问题,通过对错误报告分类标注,用三个LLM主干运行mini-swe-agent,拟合回归模型,发现定位线索和建议修复等信息对代理成功更重要,传统对人类有用的信息作用较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06641 2026-07-09 cs.CL cs.AI cs.LG 新提交 80%

Healthier LLMs: Retrieval-Augmented Generation for Public Health Question Answering

更健康的语言模型:用于公共卫生问答的检索增强生成

Felix Feldman, Joshua Harris, Timothy Laurence, Leo Loman, Ollie Higgins, Fan Grayson, Poonam Soma, Bethany Pace-Bonello, Michael Borowitz, Toby Nonnenmacher

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大型语言模型在公共卫生问答受幻觉等限制的问题,采用检索增强生成方法,通过扩展基准并系统评估检索与生成选择,比较多种检索方式,引入评判方法,突出检索对可靠公共卫生问答的作用并提供实用指导。

Comments 19 Pages, 14 Main Text Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02357 2026-07-03 cs.CR cs.SE 新提交 80%

Cloak and Detonate: Scanner Evasion and Dynamic Detection of Agent Skill Malware

伪装与引爆:技能型恶意软件的扫描规避与动态检测

Zimo Ji, Congying Xu, Zongjie Li, Yudong Gao, Xin Wei, Shuai Wang, Shing-Chi Cheung

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对LLM编码代理技能市场中的恶意技能,提出两种规避静态扫描的方法(结构混淆和自提取技能打包),并设计基于沙箱运行时行为审计的检测系统SkillDetonate,实现97%检测率与2%误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01360 2026-07-03 cs.SE 新提交 80%

Benchmarking Code Improvement with Progressive, Adaptive, and Interactive Feedback

使用渐进式、自适应和交互式反馈对代码改进进行基准测试

Cuong Chi Le, Aashish Yadavally, Minh Le-Anh, Tien N. Nguyen

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出PAIR-Bench基准,通过渐进式提示和结构化反馈协议,细粒度评估大语言模型在代码改进中的修复能力、泛化能力和所需辅助程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01243 2026-07-03 cs.IR 新提交 80%

STRUCTSURVEY: Structured Agentic Retrieval for Automated Survey Paper Generation

STRUCTSURVEY: 结构化智能检索用于自动生成综述论文

Paolo Pedinotti, Enrico Santus

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出STRUCTSURVEY分层多智能体框架,通过动态构建实体、关系和主题分类的图表示,将结构推理从生成阶段转移到检索阶段,在ACL综述基准上相比嵌入检索基线平均提升ROUGE-1召回率2.9、ROUGE-2召回率1.0,且不降低精确度。

Comments 8 pages, 1 figure, appendices, SurgeLLM, RAG4Reports, ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17793 2026-07-03 cs.HC cs.DB 新提交 80%

Evaluating Social Engineering Risks in AI-based Interaction using Biometrics and a Gaming Setup

ARES: 一种用于人类-人工智能游戏中基于角色的社会工程风险自适应评估平台

Roberto Daza, Javier Irigoyen, Ivan Lopez, Raquel Rodriguez-Carvajal, Laura Gomez-Carbajo, Julian Fierrez, Ruben Tolosana, Aythami Morales

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出ARES平台,通过可控社交游戏审计LLM中介的社会决策中的自适应社会工程风险,支持人-人、人-AI和AI-AI设置,并收集多模态数据集以评估风险。

Comments 6 pages, 2 figures. Accepted at the IEEE International Carnahan Conference on Security Technology (ICCST 2026), October 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31744 2026-07-01 eess.SY cs.SY 新提交 80%

A Conversational Agentic Interface to Physics-Based Household Digital Twins for Residential Energy Decision Support

面向住宅能源决策支持的基于物理的家庭数字孪生对话代理接口

Costas Mylonas, Titos Georgoulakis, Magda Foti

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种对话代理框架,通过自然语言交互使基于物理的家庭能源模拟易于使用,结合家庭数字孪生与大型语言模型代理层,实现高可靠性的住宅能源决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31543 2026-07-01 cs.AI cs.CL cs.LG 新提交 80%

Modality-Driven Search with Holistic Trace Judging for ARC-AGI-2

基于模态驱动与整体轨迹判断的ARC-AGI-2求解方法

Johan Land

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对抽象推理中候选轨迹选择难题,提出模态驱动搜索生成多样化候选,并结合整体判断模型在长上下文中联合比较所有轨迹,在ARC-AGI-2上以低成本达到72.9%准确率,超越前沿模型。

Comments 37 pages, 4 figures; source code available at AGI" target="_blank" rel="noopener">https://github.com/beetree/ARC-AGI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31012 2026-07-01 cs.HC 新提交 80%

Evaluating Interactivity: Toward Automated Assessment of AI-Generated Explorable Explanations

评估交互性:迈向AI生成的可探索解释的自动化评估

Xiaozao Wang, Zhewei Wang, Hongyi Wen

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出EE-Eval框架,将交互性形式化为有限状态机,通过图度量和嵌入比较评估AI生成可探索解释的结构与语义相似性,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30809 2026-07-01 cs.CV cs.RO 新提交 80%

GaussLite: Online Task-Conditioned 3D Gaussian Splatting for Real-Time Robotic Mapping

GaussLite:面向实时机器人建图的任务条件化3D高斯泼溅

Annika Thomas, Mason Peterson, Jonathan P. How

机构 * Aerospace Controls Laboratory, MIT(麻省理工学院航空航天控制实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出GaussLite,一种任务驱动的3DGS建图系统,通过自然语言任务规范调节表示密度,利用LLM解析器提取目标并实时生成像素级相关性掩码,在有限资源下实现实时建图,ROI PSNR提升约2.72 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28237 2026-06-29 cs.RO 新提交 80%

Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors

释放无限运动:通过生成式视频先验扩展富有表现力的四足运动

Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出Uni-Mo全自动流水线,利用LLM和视频扩散模型生成四足机器人运动数据,通过身份一致性损失提取3D轨迹,训练真实机器人跟踪策略,并发布包含7488个语言标注运动的数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26633 2026-06-26 cs.DC 新提交 80%

Simulating Unified Tensor Resharding in heterogeneous AI systems

模拟异构AI系统中的统一张量重分片

Sumit Kumar, Sayantan Dasgupta, Kushal Mitra, Meet Dadhania, Rohan Sudhir Basugade, Praveen Tammana, Satananda Burla, Abed Mohammad Kamaluddin, Rinku Shah

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出异构感知模拟器Xsim,通过非均匀负载划分、定制环构建和分块分区等方法,准确模拟异构分布式LLM训练,误差小于5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25905 2026-06-25 cs.CV 新提交 80%

SurgAtlas: A Large-Scale Surgical Video-Language Dataset with 2,391 Hours of Open and Minimally Invasive Surgery

SurgAtlas:一个包含2,391小时开放和微创手术的大规模手术视频-语言数据集

Filippos Bellos, Andre S. Gala-Garza, Miaowei Wang, Alyssa M. Hardin, Ahmad M. Hider, Yayuan Li, Jing Bi, Susan Liang, Chenliang Xu, Donald S. Likosky, Jason J. Corso

机构 * University of Michigan(密歇根大学) University of Edinburgh(爱丁堡大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) University of Colorado(科罗拉多大学) University of Rochester(罗切斯特大学) Michigan Medicine(密歇根医学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract);pretraining(abstract)

AI总结 提出SurgAtlas,最大手术视频-语言数据集(15,291视频,2,391小时,18专科,5,000+术式),首次大规模纳入开放手术并建立基准,通过多层级自动标注管道生成丰富注释,微调Qwen3-VL-8B在多个基准上达到领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23339 2026-06-23 cs.RO 新提交 80%

When Robots Rate Their Own Interactions: Engagement Validity and the Strangeness Failure

当机器人评价自身交互:参与度有效性及陌生感失败

Victor Lockwood, Hasan Mahmud, Mohammad Javad Khojasteh, Prabu David, Jamison Heard

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出LLM驱动的机器人从自身视角完成标准化问卷的逆向评价方法,发现机器人在参与度维度与人类一致,但系统性地反转了舒适/陌生感维度,表明当前机器人缺乏评估陌生感所需的内在情感状态。

Journal ref IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22918 2026-06-23 cs.CV cs.GT 新提交 80%

Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

各有所尺:发现用于物理视频评估的每VLM分类体系

Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Darwin Research Center(华为达尔文研究中心) Imperial College London(伦敦帝国理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);prompting(abstract)

AI总结 提出JudgeFit方法,通过迭代优化为每个视觉语言模型发现其专属的物理视频评估分类体系,在16个VLM上平均相对提升约32%,并揭示模型特定盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22399 2026-06-23 cs.SD 新提交 80%

ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

ATCCaps: 一个面向空中交通管制识别的呼号感知语音数据集

Dongdong Li, Jianwei Song, Jianwei Wang, Zhe Wang

机构 * East China University of Science and Technology(华东理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出ATCCaps,一个基于真实无线电通话构建的呼号感知语音数据集,包含202.94小时音频和17万条话语,通过结合置信度感知的转录解析、ADS-B呼号元数据、规则过滤和LLM辅助字幕生成,支持ASR评估、呼号匹配和音频-文本检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21926 2026-06-23 cs.SE 新提交 80%

A11YRepair: Bridging Web Accessibility Barriers via Knowledge-Enhanced Divide-and-Conquer Repair

A11YRepair: 通过知识增强的分治修复弥合网络无障碍障碍

Kai Huang, Ling Zhu, Jian Zhang, Xiaofei Xie, Chunyang Chen

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对网络无障碍违规修复问题,提出基于LLM的分治框架A11YRepair,通过聚类关联违规并引入WCAG领域知识,实现多文件协调修复,在60个真实项目中优于现有方法。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21377 2026-06-23 cs.CR 新提交 80%

ARENA: An Architecture for Measuring the Transferability of Autonomous Cyber Defense

ARENA: 一种衡量自主网络防御可迁移性的架构

Sidnei Barbieri, Ágney Lopes Roth Ferraz, Wagner Comin Sonaglio, Gioliano de Oliveira Braga, Henrique Curi de Miranda, Lourenço Alves Pereira Júnior

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对生产环境安全运营中心数据难以公开的问题,提出一种从私有生产数据中提取、匿名化、结构化并验证SIEM数据的方法,在保护隐私的同时保留任务相关结构,并通过两个应用案例验证了隐私-效用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18553 2026-06-18 cs.CV 新提交 80%

Hierarchical Multi-Modal Retrieval for Knowledge-Grounded News Image Captioning

基于知识的分层多模态检索用于新闻图像描述生成

Minh-Loi Nguyen, Xuan-Vu Le, Long-Bao Nguyen, Hoang-Bach Ngo, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国立大学胡志明市分校理学院) Vietnam National University, Ho Chi Minh City(越南国立大学胡志明市分校)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出分层多模态文章检索增强的图像描述框架,通过结构感知检索和上下文精炼,结合VLM和LLM生成富含上下文细节的描述,在EVENTA 2025挑战赛中获得第5名。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18054 2026-06-17 eess.AS 新提交 80%

AI-based Cognitive-linguistic Features for Dementia Assessment in Picture Description

基于AI的认知语言特征在图片描述任务中的痴呆评估

Lingfeng Xu, Prad Kadambi, Samuel Goldinger, Visar Berisha, Kimberly D. Mueller, Julie Liss

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 提出七个针对Cookie Theft图片描述任务的临床构念,利用大语言模型生成严重度评分和解释,Claude 3.5 Sonnet在ADReSS数据集上达到85%准确率,专家一致性评分3.99/5,展示了LLM在可解释认知筛查中的潜力。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17391 2026-06-17 cs.CL cs.AI cs.LG 新提交 80%

NarrativeWorldBench: A Frontier-Saturated Benchmark and a Latent World Model for Long-Horizon Co-Creative Audio Drama

NarrativeWorldBench:面向长程共创音频剧的前沿饱和基准与潜在世界模型

Logan Mann, Abdur Rahman, Mohammad Saifullah, Taaha Kazi, Vasu Sharma

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Pocket FM

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出NarrativeWorldBench基准,在九种叙事结构指标上评估21个模型,并引入N-VSSM变分状态空间模型,通过Mamba-2骨干和事件条件后验在200集以上维持结构化潜在状态,在长弧一致性和可控性上超越Claude Opus 4.5。

Comments 10 pages. Accepted to the ICML 2026 Workshops on High-dimensional Learning Dynamics (HiLD) and Culture x AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16749 2026-06-16 cs.CV 新提交 80%

Structure-aware Knowledge-guided Heterogeneous Mamba for Zygomaticomaxillary Suture Assessment

结构感知知识引导的异构Mamba用于颧上颌缝评估

Xiaoqi Guo, Birui Chen, Xinquan Yang, Chaoyun Zhang, Xuefen Liu, Mianjie Zheng, Kun Tang, Xuguang Li, Wen Ma, Yanhua Xu, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Affiliated Stomatology Hospital of Kunming Medical University(昆明医科大学附属口腔医院) Shenzhen University General Hospital(深圳大学总医院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出首个ZMS公开数据集(3790张图像,覆盖4-24岁),并设计SKMamba框架,通过解耦双路径架构、隐式边缘提取器和跨模态语义对齐模块,实现自动化ZMS成熟度评估,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16650 2026-06-16 cs.SE 新提交 80%

Understanding Automated Web GUI Testing: An Empirical Study Across Exploration Strategies and State Abstractions

理解自动化Web GUI测试:跨探索策略和状态抽象的实证研究

Chenxu Liu, Wei Yang, Ying Zhang, Tao Xie

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过实证研究分析自动化Web GUI测试中探索策略(基于模型、强化学习、大语言模型)与状态抽象如何共同影响测试有效性,发现不同策略在代码覆盖、状态覆盖和故障发现上互补,状态抽象是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16121 2026-06-16 cs.CR 新提交 80%

Invisible Manipulation Channels in AI-Assisted Financial Advisory: Implications for Market Integrity and Regulatory Design

AI辅助金融咨询中的隐形操纵通道:对市场完整性与监管设计的影响

Liuyang Yao, Zhouyu Li, Junguang He, Ziyang You

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文发现并验证了LLM推理采样层的隐形操纵通道,该漏洞可系统性偏置AI金融意见,同时绕过输出审计和统计水印,并提出基于QRNG和TEE的硬件防御及四项监管修正。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15689 2026-06-16 cs.SE 新提交 80%

Bigger Isn't Always Better: A Comparative Evaluation of LLMs for Automated Code Review

更大未必更好:大型语言模型在自动化代码审查中的比较评估

Shivam Pankaj Kumar, Swati Bararia, Kislay Raj

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 评估五个LLM在代码审查中的表现,发现较小模型Claude Haiku 4.5以更低成本超越较大模型,并揭示合成数据高估能力、差异大小主导质量等关键发现。

Comments 7 pages, 4 figures, 13 tables, 13 references

详情

展开后加载摘要…

URL PDF HTML 收藏