arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2608.11022 2026-08-12 cs.DC cs.AI 新提交 86%

Workflow Cards: Structured Summaries of Workflow Executions Using Provenance Data

工作流卡片:利用溯源数据生成工作流执行的结构化摘要

Nicola Giuseppe Marchioro, Gabriele Padovani, Amal Gueroudji, Rafael Ferreira da Silva, Wesley Brewer, Valentine Anantharaj, Sandro Fiore, Renan Souza

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出工作流卡片,将工作流执行的溯源数据转化为可读的结构化摘要,填补了现有模型、数据卡片缺失执行级信息的空白,使LLM回答质量较传统查询提升近一倍。

Comments Accepted at eScience2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08942 2026-08-11 cs.CL 新提交 86%

Same Question, Different Answer? Measuring and Mitigating Prompt Privilege for Equitable AI Access

相同问题,不同答案?衡量与缓解提示特权以实现公平的AI访问

Lier Jin, Lan Hu, Binqi Shen, Hanyu Cai, Yuting Xin

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 该研究提出统一框架,引入PES指标与PET智能体,在MedQA基准上验证了提示特权的存在,PET可消除该差异,提升AI访问公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08700 2026-08-11 cs.AI 新提交 86%

PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

PluginEval:用于函数调用细粒度错误归因的诊断基准

Dongjie Xu, Julius, Hanchi Dong, Minghua Tang, Yuxuan Sun, Ziwei Nie, Zicheng Liu, Dujun Qing, Jiajie Xu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PluginEval是缓解现有函数调用基准局限的两阶段诊断基准,可细粒度归因错误,评估显示不同模型在难度级别和错误类别中存在性能差异,且其LLM判断器与人类标注一致性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07641 2026-08-11 cs.CL 新提交 86%

SurveyReview: A Reviewer-Aligned Benchmark for Survey Evaluators

SurveyReview:面向综述评估者的审稿人对齐基准

Yuheng Zhang, Yuanchun Wang, Fanjin Zhang, Ruyu Zhao, Juanzi Li, Jie Tang, Jing Zhang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM评估综述未与人类审稿人对齐的问题,提出SurveyReview基准及SurveyAlign基线,大幅提升自动评估与人类审稿人的对齐程度,为该领域提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06871 2026-08-10 cs.AI 新提交 86%

CEDAR: Agent-Orchestrated Tree Search for Goal-Directed Optimization of Complex Systems

CEDAR:面向复杂系统目标导向优化的智能体编排树搜索算法

Yingtao Tian

机构 * Sakana AI

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对复杂系统目标导向设计的难题,提出基于LLM智能体的CEDAR方法,通过LLM驱动的MCTS实现复杂系统的目标导向发现,减少人力投入并促进其跨领域应用。

Comments Accepted as Talk in ALIFE 2026: The 2026 Conference on Artificial Life

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06808 2026-08-10 cs.AI 新提交 86%

Evolving Parallel Algorithm Portfolios via Potential-Aware Instance Generation with LLMs

基于大语言模型的潜在感知实例生成的进化并行算法组合

Shaofeng Zhang, Shengcai Liu, Zhiyuan Wang, Ke Tang

机构 * Southern University of Science and Technology(南方科技大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM-ACP在少样本组合优化问题中泛化差的问题,提出PIAC框架,通过无需参考解的潜在增益指标和大语言模型生成多样实例,在TSP、CVRP上较基线实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06312 2026-08-07 cs.CL 新提交 86%

Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents

面向规则密集型国家标准文档评审的大语言模型基准测试与增强

Tao Wang, Qihao Yang, Rongjiao Liang, Lianghong Lin, Haitao Wang, Xinyu Cao, Tianyong Hao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对规则密集型国家标准文档评审推出首个基准GB/T-Bench,提出多智能体框架GB/T-Reviewer,实验显示其大幅缩小了LLM与专家在该任务上的能力差距,为高风险文档领域可信AI奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06197 2026-08-07 cs.AI 新提交 86%

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) Central South University(中南大学) The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04180 2026-08-06 cs.LG 新提交 86%

A Comparative Study of Feature Selection Methods for EHR Diagnosis Codes in Opioid Use Disorder Prediction

阿片类药物使用障碍预测中用于电子健康记录诊断代码的特征选择方法对比研究

Zihan Ding, Yinan Liu, Tengfei Ma, Rachel Wong, George Leibowitz, Benjamin Littenberg, Xia Zheng, Richard N. Rosenthal, Fusheng Wang

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) University of Vermont(佛蒙特大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究对比五种特征选择方法在阿片类药物使用障碍预测中的表现,发现NTK敏感性方法在准确性与稳定性间平衡最优,LLM引导选择可提供互补临床信号。

Comments Accepted at the AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02683 2026-08-05 cs.CR cs.AI 新提交 86%

$S^3$: Improving Agent Safety through Multi-Stage Defense

$S^3$:通过多阶段防御提升智能体安全性

Zibo Xiao, Haoyu Wang, Jun Sun

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体工作流的跨阶段安全风险问题,提出多阶段防御框架$S^3$,引入阶段特定安全技能,构建MSRB基准,实验显示其安全有效性和效用保留均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00006 2026-08-04 cs.AI 新提交 86%

Enhancing LLMs with Context-Specific Knowledge for Mitigating Misinformation in SMEs: A RAG-based Modeling and Analysis

用特定上下文知识增强大语言模型以缓解中小企业的错误信息:一种基于RAG的建模与分析

Md. Samiul Islam, Iqbal H. Sarker, Chadni Islam, Ahmad Mohsin, Ahmed Ibrahim, Helge Janicke

机构 * School of Science, Edith Cowan University(伊迪斯科文大学理学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对中小企业使用LLM时面临的错误信息问题,提出VectorRAG与GraphRAG方法,在LLaMA等模型上验证RAG可提升响应质量,助力可靠决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27267 2026-07-31 cs.CR cs.AI 新提交 86%

FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs

FAVA:基于证据支持的权限图的经验证智能体的形式化授权

Yifan Zhang, Xinkui Zhao, Sai Liu, Hengxuan Lou, Guanjie Cheng, Chang Liu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26710 2026-07-30 cs.LG 新提交 86%

PowerAtlas: Towards Electricity-Computing Co-Scheduling for Power Systems

PowerAtlas:面向电力系统的电-计算协同调度

Kaiwen Jiang, Siya Xu, Ziyue Zhu, Chao Yang, Anh Tuan Luu, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Grid Liaoning Electric Power Co., Ltd.(国网辽宁省电力有限公司) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PowerAtlas是用于电-计算协同调度的LLM智能体框架,整合多类约束生成可行方案,构建含2000个实例的ECBench基准,在11种LLM上验证了有效性。

Comments 17 pages, 9 figures, 5 tables. Code: https://github.com/JAVA-Jiang/PowerAtlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26314 2026-07-30 cs.CR cs.AI 新提交 86%

StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents

StealthBench:衡量自主进攻性安全智能体的操作隐蔽性

Ads Dawson, Adrian Wood

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员推出StealthBench基准,通过含三个LLM的评判小组评估自主进攻性安全智能体的OPSEC表现,发现无模型安全成功率超54%,证实OPSEC失败具系统性,该基准用于支持相关智能体开发与监控。

Comments 29 pages, 9 tables, 1 figure, 2 appendices. Code: https://github.com/GangGreenTemperTatum/stealthbench Dataset: https://huggingface.co/datasets/0xmoose/stealthbench Website: https://stealthbench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26212 2026-07-30 cs.SE cs.AI 新提交 86%

Multi-Agent Debate Strategies: Survey, Taxonomy, and Challenges

多智能体辩论策略:综述、分类与挑战

Quim Motger, Marc Oriol, Jordi Marco, Xavier Franch

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过对141项多智能体辩论研究的系统综述,提出三维分类法,揭示领域默认采用狭窄设计模式的问题,将分类法定位为研究图谱与基准框架,未来拟形式化为可执行规范以优化辩论配置。

Comments Under review at ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26067 2026-07-30 cs.CY cs.AI 新提交 86%

The Easy Trap: Why LLMs Underestimate Misconception-Driven Difficulty

易陷阱:为何大语言模型低估由误解驱动的难度

Amanda La Hadi, Muhammad Johan Alibasa, Guanliang Chen, A. Taufiq Asyhari

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究发现,用于教育评估难度估计的LLM会系统性低估由学习者误解驱动的数学题难度,提出“易陷阱”现象,其仅能捕捉难度大致排序,无法反映学生实际认知难度。

Comments This paper poster presented on 19th Educational Data Mining Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22471 2026-07-27 cs.SE cs.AI 新提交 86%

MineValiCoder: Reliable Code Generation with Test Case Quality Mining and Bipartite Graph-Based Mutual Validation

MineValiCoder:通过测试用例质量挖掘和基于二分图的相互验证实现可靠的代码生成

Zhen Zhao, Qihang Yang, Feifei Dai, Xiangfang Li, Bo Li

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对基于大语言模型的测试驱动开发中现有方法的不足,提出MineValiCoder框架,通过测试用例质量挖掘、并行TDD优化和二分图代码-测试相互验证三个模块,有效减轻LLM随机性,提升自动代码生成可靠性,在多基准测试中表现优异。

Comments 12 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20208 2026-07-23 cs.CL 新提交 86%

surprisal is Not a Theory

惊奇值并非一种理论

Andrés Buxó-Lugo, Aniello De Santo, Morgan Grobol, Ryan J. Hubbard, Cassandra L. Jacobs

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究指出惊奇值理论虽被视为计算层面解释,但大语言模型的发展未免除建模者相关表征决策,不加批判使用LLM - 惊奇值会模糊模型承诺,通过分析表明算法和架构选择影响语言模型概率计算,建议相关研究者重新评估概率互换做法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12884 2026-07-15 cs.CL 新提交 86%

Evaluating Large Language Models on Misconceptions in Multi-Turn Medical Conversations

在多轮医疗对话中的误解上评估大语言模型

Monica Munnangi, Saiph Savage

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 研究多轮医疗对话中模型对误解的处理,引入ThReadMed-QA数据集,用基于准则的框架评估五个大语言模型,发现前沿模型在后续轮次表现大幅下降,错误传播致性能降,强调需捕捉多轮行为的评估框架。

Comments Accepted to MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10286 2026-07-14 cs.AI cs.MA 新提交 86%

Can Agentic Trading Systems Pay for Their Own Intelligence?

智能交易系统能否为自身智能付费?

Qiqi Duan, Changlun Li, Chen Wang, Fan Zhang, Mengxiang Wang, Dayi Miao, Peixian Ma, Jiangpeng Yan, Liyuan Chen, Shuoling Liu, Preslav Nakov, Yuyu Luo, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI(悖论人工智能公司) E Fund Management Co., Ltd(易方达基金管理有限公司) MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)) The University of Tokyo(东京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于LLM的交易系统中智能体能否为自身智能付费的问题,引入TradeLens工具包进行评估,通过多方面分析发现可行性取决于智能到利润的转化,不同模型有不同失败模式,重构了此类交易智能体的评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08038 2026-07-10 cs.AI 新提交 86%

A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis

一种用于人工智能辅助鉴别诊断的面向安全的假设-演绎框架

Fan Ma, Mauro Giuffrè, Donald Wright, Kent McCann, Mark Iscoe, Lingfei Qian, Mingyang Jiang, Chi Wing Ng, Na Hong, Huan He, Cathy Shyr, Qingyu Chen, Lee Schwamm, Lucila Ohno-Machado, Hua Xu

机构 * Yale School of Medicine, Yale University(耶鲁大学医学院,耶鲁大学) Università degli Studi di Trieste(的里雅斯特大学) Vanderbilt University(范德堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对诊断错误威胁,提出AegisDx框架,通过协调LLM组件进行鉴别诊断、筛查危险情况、验证推理等。经多层面评估,该框架在诊断准确率及安全评分等方面表现优于独立LLM,为急性护理提供更优床边决策支持

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06839 2026-07-09 cs.LG cs.CV 新提交 86%

LEMUR 2: Unlocking Neural Network Diversity for AI

LEMUR 2:释放人工智能的神经网络多样性

Tolgay Atinc Uzun, Waleed Khalid, Saif U Din, Sai Revanth Mulukuledu, Akashdeep Singh, Chandini Vysyaraju, Raghuvir Duvvuri, Avi Goyal, Yashkumar Rajeshbhai Lukhi, Muhammad A. Hussain, Krunal Jesani, Usha Shrestha, Yash Mittal, Roman Kochnev, Pritam Kadam, Mohsin Ikram, Harsh R. Moradiya, Alice Arslanian, Dmitry Ignatov, Radu Timofte

机构 * University of Würzburg(维尔茨堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LEMUR 2旨在释放神经网络多样性,通过统一生成、评估和部署管道,利用多种方式生成超14000个不同架构及大量训练记录,采用特定管道进行自动部署和延迟基准测试,涵盖多模态任务,为LLM微调提供数据基础,推动相关新兴范式发展。

Comments 10 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03162 2026-07-07 cs.AI cs.HC 新提交 86%

APeB: Benchmarking Personalization Ability of Large Language Model Agents

APeB:大型语言模型智能体个性化能力基准测试

Garry Yang, Zizhe Chen, Xinru Chen, Yongqiang Chen, Jianxiang Wang, Deyu Zou, Linyi Ding, Jialiang Wu, Yunzhong He, Yu Gong, James Cheng, Huaixiao Tou

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00627 2026-07-02 cs.AI 新提交 86%

AGI Maze as a Benchmark Framework for World-Modeling Agents

AGI Maze:作为世界建模智能体的基准框架

Alexey Potapov

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AGI Maze框架,通过部分可观测网格迷宫任务评估LLM构建世界状态表示的能力,发现标准LLM在推理时无法内部表示迷宫,即使借助工作记忆也难以可靠求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31310 2026-07-01 cs.CL cs.MM 新提交 86%

LOPA: Enhancing Spoken Language Assessment via Latent Ordinal Prototype Alignment

LOPA:通过潜在序数原型对齐增强口语评估

Hong-Yun Lin, Fu-An Chao, Bi-Cheng Yan, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22723 2026-07-01 cs.CL 新提交 86%

BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

BLUEX v2: 对巴西大学入学考试开放性问题的大语言模型基准测试

João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

机构 * UNICAMP(坎皮纳斯州立大学) Tropic AI Maritaca AI

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对葡萄牙语开放性问题评估的不足,提出BLUEX v2基准,包含巴西两所顶尖大学第二阶段入学考试的395道题,采用LLM-as-a-judge评估21个模型,发现数学推理和图像理解是最难的能力维度。

Comments 15 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27959 2026-06-29 cs.CL 新提交 86%

An Empirical Analysis of Factual Errors in Human-Written Text and its Application

人类撰写文本中事实错误的实证分析及其应用

Kazuma Iwamoto, Kazumasa Omura, Shotaro Ishihara

机构 * Nikkei Inc.(日本产经公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过分析报纸文章修正,提炼人类事实错误分类,并评估LLM在合成和真实数据上的检测能力,发现GPT-5.4仅达52% F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22889 2026-06-23 cs.LG 新提交 86%

Physiology-Aware CNN and Zero-Shot Multimodal LLMs for ECG Image Classification: A Comparative Study

生理感知CNN与零样本多模态大语言模型在心电图图像分类中的比较研究

Khalil Ahammad, Derek Abbott, Mohsen Dorraki

机构 * School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息学院) Australian Institute for Machine Learning (AIML)(澳大利亚机器学习研究所) Pi MedTech(Pi医疗科技) School of Electrical and Electronic Engineering, Adelaide University(阿德莱德大学电子与电气工程学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究比较了零样本多模态大语言模型和生理感知CNN在正常/异常心电图图像分类中的表现,发现CNN模型稳定且准确,而LLM分类接近随机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20564 2026-06-23 cs.NI cs.AI cs.ET 新提交 86%

A Reproducible Semantic Benchmark for Multivendor DSM-to-CLI Translation

可复现的多厂商DSM到CLI语义基准测试

Jerônimo Menezes, Leonardo Bitzki, Diego Kreutz, Gefte Almeida, Marcio Pohlmann, Rodrigo Mansilha

机构 * Federal University of Rio Grande do Sul (UFRGS)(里约格朗德杜斯·鲁伊斯联邦大学) AI Horizon Labs(AI地平线实验室) PPGES -- Federal University of Pampa (UNIPAMPA)(PGEs -- 皮亚蒙特联邦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对网络意图翻译中语义正确性缺乏基准的问题,提出可复现的DSM-to-CLI语义基准,涵盖5种云LLM、3个厂商、5个用例,发现语义质量与可靠性正交,厂商效应主导,重复运行离散度预测投票不稳定。

Comments 10 pages, including 8 tables and 3 figures, submitted to Workshop on Artificial Intelligence in Networks and Communications (WIARC at SBRC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20517 2026-06-19 cs.AI cs.PL 新提交 86%

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

Multi-LCB: 将 LiveCodeBench 扩展到多种编程语言

Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

机构 * GigaCode Yandex School of Data Analysis, Applied AI Institute(Yandex数据分析学院,应用人工智能研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 Multi-LCB 基准,将 LiveCodeBench 的 Python 任务扩展到 12 种编程语言,评估 LLM 跨语言代码生成能力,发现 Python 过拟合和语言特定污染等问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏