arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 778 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 166 篇

2606.20603 2026-06-23 cs.CY 新提交 90%

A Survey of Large Language Models for Perception and Measurement of Human Psychology

大型语言模型在人类心理感知与测量中的综述

Yudong Li, Xiaoyi Chen, Jiawei Cai, Zehao Zhong, Haoyang Yang, Huajin Tang, Linlin Shen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文系统综述了大型语言模型(LLMs)作为人类心理测量工具的应用,从理论可行性、测量方法和应用效果三个维度构建分析框架,探讨其在人格评估和心理健康评价中的有效性及局限。

Comments Accepted by IEEE Transactions on Cognitive and Developmental Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29245 2026-06-23 cs.CR cs.CL cs.LG 版本更新 90%

Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content

LLM的隐式身份技术:跨数据集、模型和生成内容的指纹识别与水印

Bing Liu, Shunping Wang, Yufan Zhu, Xinyi Yu, Jing Huang, Linkang Du, Hongbin Pei, Wei Luo

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an, China(西安交通大学计算机科学与工程学院) State Grid Henan Marketing Service Center, Henan, China(国网河南营销服务中心) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) School of Information Technology, Deakin University, Geelong, Australia(迪金大学信息技术学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了LLM指纹识别和水印技术,提出隐式身份统一抽象,并基于生命周期分类法组织数据集、模型和生成内容的技术,建立评估框架。

Comments Accepted by IJCAI-ECAI 2026. 11 pages, 1 figure. Survey and taxonomy of LLM fingerprinting and watermarking for identity, provenance, generated-content attribution, and asset protection

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22706 2026-06-23 cs.AI 新提交 90%

Safety-Aware Evaluation of LLM-Generated Driver Intervention Messages through Multi-Task Risk Fusion

通过多任务风险融合的LLM生成驾驶员干预信息的安全感知评估

Keito Inoshita

机构 * Faculty of Business and Commerce, Kansai University(关西大学商学部) Data Science and AI Innovation Research Promotion Center, Shiga University(滋贺大学数据科学与人工智能创新研究推进中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出DSAIS指标,结合规则与LLM评估五个维度,通过多任务风险融合框架提升干预信息质量,实验表明多任务集成使上下文相关性提升9.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21071 2026-06-23 cs.CR cs.AI 新提交 90%

Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer

本地LLM智能体作为易受攻击的运行时:智能体运行时层的源代码审计

Zhengsong Zhang, Zongze Li, Jiawei Guo, Haipeng Cai

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo, SUNY(布法罗大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出CLAWAUDIT静态审计框架,通过STRIDE导出的五类漏洞分类法和自定义静态分析规则,评估本地LLM智能体运行时的安全弱点,在OpenClaw基准上显著提升召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20695 2026-06-23 cs.MA cs.AI 新提交 90%

How Much Coordination Gain Is Real? A Paired Noise-Floor Protocol for Multi-Agent LLM Benchmarks

真正的协调增益有多大?多智能体LLM基准测试的配对噪声底线协议

Alibek T Kaliyev, Artem Maryanskyy

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对多智能体LLM协调基准测试中微小增量不可靠的问题,提出配对噪声底线协议,通过配置等价对比发现典型效应量低于观测噪声包络,并定义协调活跃pass^k作为最低报告标准。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18774 2026-06-23 cs.LG 新提交 90%

RouteJudge: An Open Platform for Reproducible and Preference-Aware LLM Routing

RouteJudge: 一个可复现且偏好感知的LLM路由开放平台

Guannan Lai, Haoran Hu, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) SinapisAI

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 提出RouteJudge平台,通过匿名成对比较评估LLM路由策略的决策质量,并发布ORBIT工具箱标准化路由工作流,支持可复现和偏好感知的路由评估。

Comments Accepted by Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21438 2026-06-23 cs.CL 版本更新 90%

PROMPT2BOX: Uncovering Entailment Structure among LLM Prompts

PROMPT2BOX: 揭示LLM提示间的蕴含结构

Neeladri Bhuiya, Shib Sankar Dasgupta, Andrew McCallum, Haw-Shiuan Chang

机构 * CICS, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校计算机信息科学中心) Amazon AWS AI(亚马逊AWS人工智能) A10 Networks(A10网络)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出PROMPT2BOX方法,通过盒嵌入空间捕捉提示间的特异性关系,并开发降维技术,在层次聚类中比向量基线多发现8.9%的LLM弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09634 2026-06-23 cs.LG cs.CR 90%

LLM-FS: Zero-Shot Feature Selection for Effective and Interpretable Malware Detection

LLM-FS: 零样本特征选择用于有效且可解释的恶意软件检测

Naveen Gill, Ajvad Haneef K, Madhu Kumar S D

机构 * Department of Computer Science and Engineering(计算机科学与工程系) National Institute of Technology Calicut, India(印度卡利卡特国立理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了利用大语言模型进行零样本特征选择在恶意软件检测中的应用,通过对比传统方法,展示了其在准确性和可解释性上的优势。

Journal ref 2025 Conference on Building a Secure & Empowered Cyberspace (BuildSEC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21981 2026-06-23 cs.CL cs.LG 新提交 90%

Can LLMs Control Readability? A Multi-Dimensional Evaluation Framework for CEFR-Controlled Arabic Generation

LLM能否控制可读性?面向CEFR可控阿拉伯语生成的多维评估框架

Nour Rabih, Chatrine Qwaider, Ted Briscoe

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出一个多维评估框架,通过结构化提示和词汇约束,使指令跟随型LLM在CEFR可控阿拉伯语生成中达到高可读性一致性(余弦相似度0.91,可读性预测一致性0.99)。

Comments 15 PAGES, READIxTSAR WORKSHOP, LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22411 2026-06-23 cs.CL cs.AI 版本更新 90%

NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models

NeedleChain: 测量大型语言模型的完整上下文理解能力

Hyeonseok Moon, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 针对现有基准高估LLM上下文理解能力的问题,提出NeedleChain基准,通过全相关上下文测试模型整合所有证据的能力,并引入ROPE收缩策略提升全上下文整合。

Comments ACL2026 - findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22961 2026-06-23 cs.IR 新提交 89%

LLM-as-a-Judge for Reliable and Explainable Offline Evaluation in Top-K Recommendation

LLM-as-a-Judge:用于Top-K推荐中可靠且可解释的离线评估

Yue Que, Junyi Zhou, Xiaokun Zhang, Haiming Jin, Qiao Xiang, Chen Ma

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 针对离线评估中反馈偏差和缺乏解释的问题,提出基于LLM的语义代理和推理评分框架,提升评估可靠性与可解释性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21658 2026-06-23 hep-ex astro-ph.IM hep-ph 新提交 89%

Towards LLM-Powered Automation of a Dark Matter Constraint Repository

基于大语言模型的暗物质约束库自动化

Lanqing Yuan, Karthik Ramanathan

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 提出一个LLM流水线,从arXiv论文中提取暗物质约束曲线并生成拉取请求,在基准测试中达到90.5%的耦合类型分类准确率和0.33 dex的中位残差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13182 2026-06-23 cs.SE cs.AI 版本更新 89%

From Empirical Evaluation to Context-Aware Enhancement: Repairing Regression Errors with LLMs

从经验评估到上下文感知增强:使用LLM修复回归错误

Anh Ho, Thanh Le-Cong, Bach Le, Christine Rizkallah

机构 * The University of Melbourne(墨尔本大学) Singapore University of Technology and Design(新加坡科技与设计大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过构建回归错误基准RegressionBug4APR,评估传统APR和基于LLM的APR方法,发现上下文感知增强(引入错误诱导变更信息)使LLM-based APR修复成功率提升1.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21937 2026-06-23 cs.CY cs.AI cs.CL 新提交 89%

Latent Confidence Alignment for LLM Self-Assessment

潜在置信对齐用于大语言模型自我评估

Ting-Yu Chen, Tingting Yu, Pei-Cing Huang, Chan Hsu, Ming-Yen Lin, Yihuang Kang

机构 * Department of Information Management(信息管理系) National Sun Yat-Sen University(国立中山大学) Kaohsiung Medical University Hospital(高雄医学大学附设医院) Kaohsiung Medical University(高雄医学大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出基于Rasch模型的潜在置信对齐误差(LCAE)来评估LLM自我评估与潜在错误概率的一致性,并引入项目难度作为外部信号,实验表明该方法在不影响模型能力的情况下提升自我评估质量。

Comments 2026 IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22269 2026-06-23 cs.CL cs.AI cs.LG 新提交 89%

Evaluating Large Language Models for Hausa and Fongbe Machine Translation: Benchmarks, Failures, and Metric Reliability

评估大语言模型在豪萨语和丰贝语机器翻译中的表现:基准、失败与指标可靠性

Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲校区) North-West University(西北大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估了四种大语言模型在英语到豪萨语和丰贝语(两种西非低资源语言)的翻译质量,发现质量因语言而异,模型排名不一致,且自动指标与人类判断的相关性波动大,建议采用多指标评估并注意神经指标的局限性。

Comments 19 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21844 2026-06-23 cs.CL cs.CY 新提交 89%

Inverse Turing Bench: Evaluating Language Models as Judges of Human vs. AI Dialogue

逆图灵基准:评估语言模型作为人类与AI对话的裁判

William Hager, Ishika Rathi, Masum Hasan, Cameron Jones

机构 * University of Rochester(罗切斯特大学) Stony Brook University(石溪大学) Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title);prompting(abstract);分类 cs.CL

AI总结 提出逆图灵基准,评估LLM区分人类与AI多轮对话的能力,发现GPTZero、Claude Opus-4.6和GPT-5.5准确率最高,统计方法有语义盲点而语义方法易受角色提示影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09013 2026-06-23 cs.CL 新提交 88%

Beyond Averages: Evaluating LLMs on Human Survey Replication at the Distributional Level

超越平均值:在分布层面评估LLM对人类调查的复现能力

Jeonghyeon Moon, Jiwon Kim, Yeheum Lah, Yoonju Han, Yuncheol Kang

机构 * Ewha Womans University(梨花女子大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL

AI总结 本研究通过非公开的韩国方便面购买实验,在分布层面评估LLM复现人类调查响应的能力,发现均值匹配的模型可能产生更偏离人类的分布,且结构化角色和多模态输入提升对齐度,而推理提示则降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13864 2026-06-23 cs.CR cs.AI 版本更新 88%

HardSecBench: Benchmarking the Security Awareness of LLMs for Hardware Code Generation

HardSecBench: 对大型语言模型在硬件代码生成中的安全意识的基准测试

Qirui Chen, Jingxian Shuai, Shuangwu Chen, Shenghao Ye, Zijian Wen, Xufei Su, Jie Jin, Jiangming Li, Jun Chen, Xiaobin Tan, Jian Yang

机构 * University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) ZTE Corporation(中兴通讯)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出HardSecBench基准,包含924个任务覆盖Verilog RTL和固件C代码,评估LLM在硬件代码生成中的安全性,发现模型常满足功能需求但存在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23127 2026-06-23 cs.AI cs.CL cs.SE 新提交 88%

Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation

管理LLM智能体中的程序性记忆:控制、适应与评估

Julia Belikova, Rauf Parchiev, Evgeny Egorov, Grigorii Davydenko, Gleb Gusev, Andrey Savchenko, Maksim Makarenko

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出AFTER基准(382个企业任务,22种程序性技能),评估技能在任务、角色和模型间的迁移,实验表明程序性记忆可提升3.7-6.7点性能,跨模型准确率达73.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22329 2026-06-23 cs.CL cs.AI 新提交 88%

BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories

BabelJudge: 跨语言和智能体轨迹中LLM作为评判者可靠性的测量

Shreyas KC

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出BabelJudge基准,通过受控扰动生成已知标签的成对样本,无监督地测量评判模型的位置偏差、冗长偏差、顺序不一致和跨语言退化,发现Swahili顺序一致性接近随机。

Comments 8 pages, 4 figures. Source code, benchmark toolkit, and reproduction scripts at https://github.com/Shreyaskc/BabelJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20631 2026-06-23 cs.AI cs.LG 新提交 88%

Harnessing Agent Skills: Architectural Patterns and a Reference Architecture for Skill-Mediated LLM Agents

驾驭智能体技能:技能中介LLM智能体的架构模式与参考架构

Boming Xia, Liming Zhu, Zhenchang Xing, Qinghua Lu, Dino Sejdinovic, Xiwei Xu

机构 * Responsible AI Research (RAIR) Centre(负责任人工智能研究中心) Adelaide University(阿德莱德大学) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出十种经验性架构模式(五种核心、五种辅助)用于技能中介,并综合成包含供应链、中介、执行控制、证据与反馈四层的参考架构,通过跨实例化评估提供分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20629 2026-06-23 cs.MA cs.AI cs.LG 新提交 88%

Specialize Roles, Mix Deployments: Pushing the Cost-Accuracy Frontier of LLM Agent Teams

专业化角色,混合部署:推动LLM代理团队的成本-精度前沿

Yinsicheng Jiang, Liang Cheng, Yeqi Huang, Yufan Zhao, Zhan Lu, Li Dong, Wenda Li, Edoardo Ponti, Luo Mai

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出AgentCARD基准,通过角色感知评估和帕累托前沿分析,发现异构团队在成本-精度前沿上优于同构团队,混合部署可降低12倍成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00326 2026-06-23 cs.AI cs.CL cs.IR 88%

Agent-OM: Leveraging LLM Agents for Ontology Matching

Agent-OM:利用大语言模型代理进行本体匹配

Zhangcheng Qiang, Weiqing Wang, Kerry Taylor

机构 * Australian National University(澳大利亚国立大学) Monash University(墨尔本大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Agent-OM框架,结合检索与匹配代理及OM工具,有效提升复杂和少样本本体匹配任务性能,接近传统最佳表现。

Comments 31 pages - VLDB 2025 (Page 1-20), OM 2025 (Page 21-31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22977 2026-06-23 cs.CL cs.AI 新提交 87%

StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs

StatABench:评估大语言模型统计分析能力的数据集与框架

Youxin Zhu, Yixuan Ding, Peng Lai, Longyue Wang, Bingyi Jing, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Alibaba Group(阿里巴巴集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出StatABench基准,包含404道封闭题和30道开放建模任务,评估LLM在统计分析上的能力,实验显示最佳模型仅达68.6%准确率,揭示工具推理和建模决策等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09898 2026-06-23 cs.LG cs.AI 版本更新 87%

Learning Bug Context for PyTorch-to-JAX Translation with LLMs

学习 PyTorch 到 JAX 翻译中的 Bug 上下文

Hung Phan, Son Vu, Tuan Dinh, Nesreen Ahmed, Ali Payani, Ali Jannesari

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(Iowa State大学计算机科学系) Department of Human Science, Iowa State University, Ames, IA, USA(Iowa State大学人类科学系) Cisco AI Research, Outshift, San Jose, CA, USA(Cisco AI研究,Outshift,San Jose,加利福尼亚州,美国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对 LLM 在 PyTorch 到 JAX 代码翻译中易出错的问题,构建 T2J 基准(含 bug 及修复),通过上下文学习使弱 LLM 翻译质量提升达 20%。

Comments ICML Deep Learning for Code (DL4C) workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03908 2026-06-23 cs.CL cs.AI 87%

Still Not Quite There! Evaluating Large Language Models for Comorbid Mental Health Diagnosis

仍未完全到位!评估大型语言模型用于共病心理健康诊断

Amey Hengle, Atharva Kulkarni, Shantanu Patankar, Madhumitha Chandrasekaran, Sneha D'Silva, Jemima Jacob, Rashmi Gupta

机构 * University of Southern California(美国南加州大学) Georgia Institute of Technology(佐治亚理工学院) Sion Hospital(Sion医院) Clinical Psychotherapist(临床心理治疗师) Sophia College for Women(Sophia女子学院) Indian Institute of Technology Bombay(印度班加罗尔理工学院)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 本文提出ANGLES基准,用于从社交媒体帖子中分类抑郁症和焦虑共病,通过多标签分类提升诊断准确性,评估了从Mental-BERT到GPT-4等多种模型的性能,发现GPT-4表现最佳但F1分数仍低于72%。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22889 2026-06-23 cs.LG 新提交 86%

Physiology-Aware CNN and Zero-Shot Multimodal LLMs for ECG Image Classification: A Comparative Study

生理感知CNN与零样本多模态大语言模型在心电图图像分类中的比较研究

Khalil Ahammad, Derek Abbott, Mohsen Dorraki

机构 * School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息学院) Australian Institute for Machine Learning (AIML)(澳大利亚机器学习研究所) Pi MedTech(Pi医疗科技) School of Electrical and Electronic Engineering, Adelaide University(阿德莱德大学电子与电气工程学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究比较了零样本多模态大语言模型和生理感知CNN在正常/异常心电图图像分类中的表现,发现CNN模型稳定且准确,而LLM分类接近随机。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20564 2026-06-23 cs.NI cs.AI cs.ET 新提交 86%

A Reproducible Semantic Benchmark for Multivendor DSM-to-CLI Translation

可复现的多厂商DSM到CLI语义基准测试

Jerônimo Menezes, Leonardo Bitzki, Diego Kreutz, Gefte Almeida, Marcio Pohlmann, Rodrigo Mansilha

机构 * Federal University of Rio Grande do Sul (UFRGS)(里约格朗德杜斯·鲁伊斯联邦大学) AI Horizon Labs(AI地平线实验室) PPGES -- Federal University of Pampa (UNIPAMPA)(PGEs -- 皮亚蒙特联邦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对网络意图翻译中语义正确性缺乏基准的问题,提出可复现的DSM-to-CLI语义基准,涵盖5种云LLM、3个厂商、5个用例,发现语义质量与可靠性正交,厂商效应主导,重复运行离散度预测投票不稳定。

Comments 10 pages, including 8 tables and 3 figures, submitted to Workshop on Artificial Intelligence in Networks and Communications (WIARC at SBRC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07955 2026-06-23 cs.CL 版本更新 86%

Expert Preference-based Evaluation of Automated Related Work Generation

基于专家偏好的自动相关工作生成评估

Furkan Şahinuç, Subhabrata Dutta, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab) Department of Computer Science and Hessian Center for AI (hessian.AI) Technical University of Darmstadt(乌普萨拉知识处理实验室(UKP实验室)计算机科学系海斯赛人工智能中心(hessian.AI)达姆施塔特技术大学) Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(克诺尔兹塞学校卓越学习和智能系统(ELIZA))

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出GREP多轮评估框架,结合经典标准与专家偏好,通过细粒度分解和对比示例提升LLM评估相关工作质量的能力,与人类专家评估高度相关。

Comments Project page: https://ukplab.github.io/arxiv2025-expert-eval-rw/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05162 2026-06-23 cs.CL 版本更新 86%

Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results

注意差距...还是不注意?翻译错误和评估细节如何扭曲多语言结果

Jan-Thorsten Peter, David Vilar, Tobias Domhan, Dan Malkin, Markus Freitag

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文以数学领域为例,研究LLM在多语言上的性能差距,发现数据翻译错误和答案提取不一致导致虚假差距,提出半自动质量保证方法和建议,修正后差距基本消失。

详情

展开后加载摘要…

URL PDF HTML 收藏