arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31957 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31957 篇

2510.25799 2026-06-02 cs.CL 90%

LISTEN to Your Preferences: An LLM Framework for Multi-Objective Selection

LISTEN 你的偏好:面向多目标选择的LLM框架

Adam S. Jovine, Tinghan Ye, Francis Bahk, Jingjing Wang, Matthew Ford, David B. Shmoys, Peter I. Frazier

机构 * Cornell University(康奈尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出LISTEN框架,利用LLM作为决策代理,通过迭代优化内部偏好模型(LISTEN-U参数法或LISTEN-T非参数法)从自然语言中学习用户隐含偏好,实现多目标选择。

Comments Accepted at IJCAI-ECAI 2026 (the 35th International Joint Conference on Artificial Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11423 2026-06-02 cs.SI cs.CL 90%

Beyond the Crowd: LLM-Augmented Community Notes for Governing Health Misinformation

超越众包:基于LLM增强的社区笔记治理健康错误信息

Jiaying Wu, Zihang Fu, Haonan Wang, Fanxiao Li, Jiafeng Guo, Preslav Nakov, Min-Yen Kan

机构 * National University of Singapore(新加坡国立大学) Yunnan University(云南大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 针对X平台社区笔记在健康错误信息治理中延迟高的问题,提出CrowdNotes+框架,通过LLM增强笔记生成与评估,显著提升正确性、有用性和证据效用。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14771 2026-06-02 cs.AI 90%

OpenHospital: A Thing-in-itself Arena for Evolving and Benchmarking LLM-based Collective Intelligence

OpenHospital: 一个用于进化和基准测试基于LLM的集体智能的物自体竞技场

Peigen Liu, Rui Ding, Yuren Mao, Ziyan Jiang, Yuxiang Ye, Yunjun Gao, Ying Zhang, Renjie Sun, Longbin Lai, Zhengping Qian

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, Zhejiang Gongshang University(浙江工商大学共同富裕统计监测与智能治理实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Alibaba Cloud(阿里云)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出OpenHospital交互式竞技场,通过医生代理与患者代理的互动进化集体智能,采用数据在代理自身范式快速提升能力并提供医学熟练度和系统效率的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16167 2026-06-02 cs.MA cs.AI cs.GT 90%

Ev-Trust: An Evolutionarily Stable Trust Mechanism for Decentralized LLM-Based Multi-Agent Service Economies

Ev-Trust: 一种面向去中心化基于LLM的多智能体服务经济的演化稳定信任机制

Jiye Wang, Shiduo Yang, Ting Qiao, Jiayu Qin, Jianbin Li, Yu Wang, Yuanhe Zhao

机构 * School of Control and Computer Engineering, North China Electric Power University(控制与计算机工程学院,华北电力大学) State Grid Corporation of China(国家电网公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对去中心化LLM多智能体服务经济中欺诈成本降低、服务质量评估困难和服务内容不稳定三大脆弱性,提出Ev-Trust信任机制,通过交叉验证门、方差标准化漂移度量和信任信号嵌入收益函数,实现合作策略的演化稳定,实验表明恶意参与减少约60%,欺诈率降低约50%。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17648 2026-06-02 econ.GN cs.AI q-fin.EC 90%

Simulating Macroeconomic Expectations in Survey Experiments with LLM-based Economic Agents

基于LLM的经济主体在调查实验中模拟宏观经济预期

Jianhao Lin, Lexuan Sun, Yixin Yan

机构 * Lingnan College, Sun Yat-sen University(中山大学岭南学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一个利用基于大语言模型的经济主体(LLM Agents)模拟调查实验中宏观经济预期的框架,通过复现三种代表性调查设计验证其有效性,发现LLM Agents能生成与人类高度相似的预期分布并捕捉定性模式,其中先验信息对匹配分布至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00481 2026-06-02 cs.NI cs.AI cs.HC cs.MM cs.PF 90%

Make a Video Call with LLM: A Measurement Campaign over Six Mainstream Apps

用LLM进行视频通话:对六个主流应用的测量活动

Jiayang Xu, Xiangjie Huang, Zijie Li, Antariksh Verma, Zili Meng

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过自定义测试平台和在线平台,从质量、延迟、内部机制和系统开销四个维度对六个主流AI视频聊天应用进行基准测试,发现AI视频通话的网络延迟影响小于人类视频通话,AI代理能力对用户体验影响最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26942 2026-06-01 cs.AI cs.LO cs.SE 90%

Neuro-Symbolic Verification of LLM Outputs for Data-Sensitive Domains (extended preprint)

面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)

Paul Sigloch, Christoph Benzmüller

机构 * University of Bamberg(巴姆堡大学) Free University of Berlin(柏林自由大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种结合形式符号方法与神经语义分析的混合验证架构,用于检测LLM输出中的幻觉、不一致和隐私漏洞,在医疗设备损伤评估系统中实现83%的结构化实体幻觉检测率和72%的语义虚构检测率。

Comments Extended preprint version of accepted technical communication at KI 2026. 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00521 2026-06-01 cs.AI 90%

Diagnosing the Reliability of LLM-as-a-Judge via Item Response Theory

通过项目反应理论诊断LLM作为评判者的可靠性

Junhyuk Choi, Sohhyung Park, Chanhee Cho, Hyeonchu Park, Bugeun Kim

机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, Republic of Korea(Chung-Ang 大学人工智能系) Department of Industrial Engineering, Seoul National University, Seoul, Republic of Korea(首尔国立大学工业工程系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出基于项目反应理论(IRT)的两阶段诊断框架,通过内在一致性和人类对齐两个维度评估LLM作为评判者的可靠性,并提供可解释的诊断信号。

Comments Accepted ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10868 2026-06-01 cs.LG 90%

Go-UT-Bench: A Fine-Tuning Dataset for LLM-Based Unit Test Generation in Go

Go-UT-Bench:用于基于LLM的Go语言单元测试生成的微调数据集

Yashshi Pipalani, Hritik Raj, Rajat Ghosh, Vaishnavi Bhargava, Debojyoti Dutta

机构 * Nutanix

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 针对代码LLM训练数据不平衡问题,提出Go-UT-Bench数据集(5264对代码与单元测试),通过微调提升模型在Go语言单元测试生成任务上的性能,在超过75%的基准任务上优于基础模型。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30104 2026-05-29 cs.CL 90%

SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?

SEAL: 饱和基准能否通过LLM作为元裁判得以复兴?

Jiamin Chen, Yidi Wu, Qiexiang Wang, Qianben Chen, Yuchen Li, Yansen Zhang, Xiaokun Zhang, Wangchunshu Zhou, Chen Ma

机构 * ByteDance Inc.(字节跳动公司) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SEAL协议,通过自适应LLM元裁判从饱和基准中提取潜在排名信号,在代码生成、数学推理等任务上以更少调用实现高排名准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29800 2026-05-29 cs.CL 90%

Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels

九位评委,两张有效选票:相关错误削弱了LLM评估小组

Guneet Kohli

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过分析9个前沿LLM在自然语言推理任务上的投票行为,发现由于模型间存在高度相关的错误,评估小组的有效信息仅相当于约2个独立投票,实际准确率比独立投票理想情况低8-22个百分点,且增加评委或改进聚合算法均无法弥补这一差距。

Comments 14 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29653 2026-05-29 cs.AI 90%

PTCG-Bench: Can LLM Agents Master Pokémon Trading Card Game?

PTCG-Bench:LLM智能体能否掌握宝可梦集换式卡牌游戏?

Dongdong Hua, Yifei Sun, Renhong Huang, Feng Gao, Chunping Wang, Yang Yang

机构 * Zhejiang University(浙江大学) FinVolution Group(FinVolution集团)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PTCG-Bench基准,通过宝可梦集换式卡牌游戏评估LLM智能体的决策性能和自进化能力,并设计模块化消融实验分析智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29340 2026-05-29 cs.CL 90%

A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities

面向LLM安全评估的问答数据集研究:聚焦非法活动

Kenji Imamura, Masao Ideuchi, Atsushi Fujita

机构 * National Institute of Information and Communications Technology(日本信息与通信技术研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过人工分析AnswerCarefully数据集,提出额外信息、问答示例创建方法和评估准则,用于评估LLM在非法活动方面的安全性。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29274 2026-05-29 cs.CL 90%

Learnable Assessment Skills for LLM-based Automated Scoring: Rubric Construction via Iterative Optimization

基于LLM的自动评分中可学习的评估技能:通过迭代优化构建评分标准

Yun Wang, Xin Xia, Xuansheng Wu, Xiaoming Zhai, Ninghao Liu

机构 * School of Computing, University of Georgia, Athens, GA, USA(佐治亚大学计算机学院) AI4STEM Education Center, University of Georgia, Athens, GA, USA(佐治亚大学AI4STEM教育中心) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出一种迭代框架,使LLM能从评分经验中学习评估技能(即与题目无关的自然语言程序性知识),自动构建评分标准,无需人工干预,在ASAP-SAS数据集上超越专家编写的评分标准。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29225 2026-05-29 cs.AI 90%

BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents

BenchTrace: 用于测试LLM智能体反思能力和受控进化的基准

Jiahao Huang, Fei Cheng, Junfeng Jiang, Zefan Yu, Akiko Aizawa

机构 * University of Tokyo(东京大学) Kyoto University(京都大学) National Institute of Informatics(日本信息处理学会)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出BenchTrace基准,通过反思评估和进化评估两个任务,结合失败避免率(FAR)指标,系统评估LLM智能体的自我进化能力,实验发现当前模型在反思诊断和泛化上存在显著瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29059 2026-05-29 cs.SE cs.AI cs.CR 90%

SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers

SCDBench: 基于大语言模型的智能合约反编译基准

Kaihua Qin, Dawn Song, Arthur Gervais

机构 * University of Warwick(沃里克大学) UC Berkeley(伯克利大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有智能合约反编译评估缺乏统一基准的问题,提出SCDBench数据集与评估方法,通过四阶段累积评估(格式完整性、可编译性、ABI恢复、语义一致性)测试前沿LLM的反编译能力,发现语义一致性仍远未解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29048 2026-05-29 cs.CL 90%

LLMBridge: An LLM Pipeline for End-to-end Referential Bridging Resolution in English

LLMBridge:用于英语端到端指代桥接消解的LLM流水线

Lauren Levine, Amir Zeldes

机构 * Georgetown University(乔治城大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出基于LLM的端到端指代桥接消解系统LLMBridge,结合启发式预处理/后处理与LLM的自然语言推理能力,在三个英语数据集上超越现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29025 2026-05-29 cs.AI cs.CY cs.HC 90%

When Models Disagree: Rethinking LLM Evaluation for Public Comment Analysis

当模型存在分歧:重新思考用于公众评论分析的LLM评估

Aisha Najera, Alvin Moon, Vedant Srinivasan, Rajesh Veeraraghavan

机构 * AI Lab, Princeton University Engineering and Applied Sciences(普林斯顿大学人工智能实验室、工程与应用科学学院) RAND Corporation(RAND公司) Engineering and Applied Sciences(工程与应用科学) Science, Technology, and International Affairs(科学、技术与国际事务) Georgetown University(乔治·华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种解释性审计流程,利用多模型分歧检测解释复杂性,引导人工审查关注真正模糊的公众意见,以补充传统基于准确率的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23657 2026-05-29 cs.CL 90%

OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents

OpenSkillEval:自动审计LLM智能体的开放技能生态系统

Jiahao Ying, Boxian Ai, Wei Tang, Siyuan Liu, Yixin Cao

机构 * Singapore Management University(新加坡国立管理学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Joy Future Academy, JD(京东探索研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出自动评估框架OpenSkillEval,通过动态构建真实任务实例和收集社区技能,系统评估技能增强型智能体系统及技能本身,揭示技能可用性不保证有效使用、技能增强收益依赖模型和框架等关键发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08567 2026-05-29 cs.MA cs.CL 90%

ValueFlow: Measuring the Propagation of Value Perturbations in Multi-Agent LLM Systems

ValueFlow: 多智能体大语言模型中价值扰动的传播度量

Jinnuo Liu, Chuke Liu, Hua Shen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ValueFlow框架,通过56维价值数据集和LLM-as-a-judge协议,将价值漂移分解为智能体级响应行为与系统级结构效应,揭示价值对齐是系统级属性。

Comments Preprint. Under review. 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28483 2026-05-28 cs.AI cs.IR 90%

From Learning Resources to Competencies: LLM-Based Tagging with Evidence and Graph Constraints

从学习资源到能力:基于证据和图约束的LLM标签方法

Ngoc Luyen Le, Marie-Hélène Abel, Bertrand Laforge

机构 * Université de technologie de Compiègne, CNRS, Heudiasyc(法国图卢兹技术大学、CNRS、Heudiasyc实验室) Sorbonne Université, CNRS UMR 7585, LPMHE(巴黎大学、CNRS UMR 7585、LPMHE实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种端到端对齐流程,利用大语言模型作为受约束的、能产生证据的标签器,将学习资源链接到结构化能力框架,在计算机科学数据集上取得优于基线方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28308 2026-05-28 cs.CL 90%

HELEA: Hard-Negative Benchmark and LLM-based Reranking for Robust Entity Alignment

HELEA: 用于鲁棒实体对齐的硬负样本基准和基于LLM的重排序

Yoonjin Jang, Junwoo Kim, Youngjoong Ko

机构 * SungKyunKwan University(全州大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 针对现有实体对齐基准中模型依赖名称重叠而非关系结构的问题,提出同名的硬负样本增强策略生成质量可控的评估基准和训练语料,并设计HELEA两阶段框架(实体编码器检索+LLM重排序),在硬负样本基准上实现鲁棒对齐。

Comments 10 pages, 3 figures, 9 tables. Code and benchmarks available at https://github.com/Wnsdnl/HELEA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27766 2026-05-28 cs.AI 90%

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

Aman Priyanshu, Supriti Vijay, Esha Pahwa

机构 * Foundation AI USA(Foundation AI美国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过多智能体模拟平台评估LLM智能体在社交压力下的隐私泄露风险,发现多轮社交交互显著增加隐私泄露,且泄露具有社交传染性,即使有隐私指令也无法完全消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27566 2026-05-28 cs.AI 90%

DynaSchedBench: Calibrated Dynamic Scheduling Benchmarks and Observability Paradox in LLM-based Scheduling Agents

DynaSchedBench: 基于LLM的调度代理中的校准动态调度基准与可观测性悖论

Shijie Cao, Yuan Yuan, Jing Liu

机构 * School of Computer Science and Engineering, Beihang University, Beijing 100191, China(北航计算机科学与工程学院) Shenzhen Loop Area Institute, Shenzhen, China(深圳环城院) Qingdao Research Institute, Beihang University(北航青岛研究院) Hangzhou Innovation Institute, Beihang University(北航杭州创新院) School of Artificial Intelligence, Xidian University, Xi'an 710071, Shaanxi, China(西电人工智能学院) Guangzhou Institute of Technology, Xidian University, Guangzhou 510555, Guangdong, China(西电广州技术院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对动态柔性作业车间调度问题(DFJSP),提出DynaSchedBench诊断框架,通过顺序事件空间校准器(SESC)计算调度压力指数(SSI)对实例进行难度分层,并揭示LLM调度代理中的“可观测性悖论”:完整结构信息反而降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27444 2026-05-28 cs.IR cs.AI 90%

A Systematic Evaluation of Retrieval-Augmented Generation and Language Models for Space Operations

检索增强生成与语言模型在太空操作中的系统评估

Ruben Belo, Marta Guimarães, Cláudia Soares

机构 * NOVA LINCS Neuraspace Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文系统评估了结合大语言模型与信息检索技术的检索增强生成管道在太空操作中提取和综合领域知识的效果,比较了不同检索策略、嵌入模型和LLM回答对信息准确性、相关性和可靠性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00180 2026-05-28 cs.NI cs.CL 90%

RouteProfile: Graph-Based Profiling for Cold-Start LLM Routing

RouteProfile:基于图的冷启动LLM路由画像方法

Jingjun Xu, Hongji Pu, Tao Feng, Haozhen Zhang, Jiaxuan You, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 针对冷启动LLM路由中新模型缺乏交互数据的问题,提出基于图结构的RouteProfile框架,利用技术报告中的公开信号构建模型画像,实验表明结构化画像优于扁平基线,且模型家族元数据比基准域信息更可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00349 2026-05-28 cs.AI cs.MA 90%

COOP$^2$: Defining, Observing, and Repairing Cooperation in LLM Multi-Agent Systems

COOP$^2$: 定义、观察和修复LLM多智能体系统中的合作

Hanqing Yang, Narjes Nourzad, Shiyu Chen, Marie Siew, Jingdi Chen, Carlee Joe-Wong

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学) Singapore University of Technology and Design(新加坡科技设计大学) University of Arizona(亚利桑那大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出COOP$^2$框架,通过将高层合作动态与任务进度关联,定义可验证的合作任务,并开发COOP$^2$-Repair方法预测约束失败并引导修复,提升LLM多智能体系统的任务成功率和约束满足度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26911 2026-05-27 cs.AI 90%

TADDLE: A Tool-Augmented Agent for Detecting Deficient LLM-Generated Peer Reviews

TADDLE: 一种用于检测有缺陷的LLM生成同行评审的工具增强型代理

Hanqi Duan, Xiang Li

机构 * East China Normal University(东华大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM生成的同行评审难以检测缺陷的问题,提出TADDLE工具增强型代理,通过四个专用分析工具和两阶段半监督学习,在二元检测和多标签分类任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20251 2026-05-27 cs.SE cs.AI 90%

ProcCtrlBench: Evaluating Process-Level Defects and Control Preservation in LLM Coding Agents

ProcCtrlBench: 评估LLM编码智能体中的过程级缺陷与控制保持

Jiawei He, Jie Jia, Chenbo Liu, Chaoyi Xue, Yapeng Song, Xikai Yang, Dong Sun

机构 * Amap, Alibaba Group(阿里云)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出ProcCtrlBench基准,通过可复用的缺陷本体和标准化轨迹表示,从过程证据而非仅最终结果评估LLM编码智能体的执行质量,并引入控制保持量化执行过程的可解释性、可中断性等属性。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08455 2026-05-27 cs.LG cs.PL cs.SE 90%

CUDABeaver: Benchmarking LLM-Based Automated CUDA Debugging

CUDABeaver:基于LLM的自动化CUDA调试基准测试

Shiyang Li, Haoyang Chen, Mattia Fazzini, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 提出CUDABEAVER基准,通过协议条件指标pass@k(M,C,A)评估LLM修复CUDA代码的能力,揭示性能损失容忍度对成功率的影响。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏