arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2572 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2572 篇

2608.01012 2026-08-04 cs.CL cs.AI 新提交 92%

MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models

MedUPS:利用大语言模型辅助罕见医疗病例的诊断

Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav Rappoport

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 本研究提出MedUPS对齐框架及MedUPSQA数据集,通过强化学习使大语言模型对齐临床中游决策,提升了不同规模模型的下一步临床决策准确率,且小模型表现优于部分大模型。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29064 2026-08-03 cs.LG cs.AI 新提交 92%

Benchmarking Frontier Large Language Models Against Official Crash Database Coding Using Police Crash Narratives

基于警方事故叙述文本,对比前沿大语言模型与官方事故数据库编码的基准测试

Sudhir Bharati, Rajendra K C Khatri, Sudip Bharati

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究以阿肯色州2015-2025年的致命事故数据为对象,对比6种前沿大语言模型与官方事故数据库的编码效果,为事故编码领域的LLM应用提供了基准评估依据。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28282 2026-07-31 cs.CL cs.LG 新提交 92%

(Towards) Scalable Reliable Automated Evaluation with Large Language Models

面向可扩展的可靠自动化评估:基于大语言模型

Bertil Braun, Martin Forell

机构 * KIT(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出一种基于多LLM两两比较与Elo评分的自动化评估框架,可近似专家评估,减少人工干预,实现对LLM输出的高效可靠评估。

Comments 17 pages. Published in the Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2) at ACL 2025

Journal ref Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2), pages 320-336, Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26382 2026-06-26 cs.CL cs.AI cs.DL cs.HC cs.RO 新提交 92%

Charting the Growth of Social-Physical HRI (spHRI): A Systematic Review Pipeline Augmented by Small Language Models

绘制社会-物理人机交互(spHRI)的增长:由小型语言模型增强的系统综述流程

Mayumi Mohan, Ju-Hung Chen, Alexis E. Block

机构 * MPI for Intelligent Systems(马克斯·普朗克智能系统研究所) Case Western Reserve University(凯斯西储大学)

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对社会-物理人机交互领域术语碎片化和方法不一致的问题,本文评估了小型语言模型(<1.5B参数)在标题和摘要筛选中的辅助能力,发现其虽未达到人类水平,但能快速筛选并发现人类遗漏的论文,表明SLM可增强而非取代专家评审。

Comments 5 pages, 3 figures, 2 tables, Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21460 2026-06-23 cs.CL cs.AI 新提交 92%

Evaluation of Small Language Models for Arabic Language Processing

小型语言模型在阿拉伯语处理中的评估

Jumana Alsubhi, Ahmed Alhusayni, Abdulrahman Gharawi, Israa Hamdine, Alshaymaa Allahim, Lamees Alhumaid, Ahmad Shabana, Rafik Madani

机构 * Naseej Innovation Lab(纳赛伊创新实验室) Naseej for Technology(纳赛伊技术)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 本文评估了12种小型语言模型在阿拉伯语自然语言处理任务上的表现,构建了涵盖8个领域和10种语言技能的240项测试基准,发现模型大小并非决定因素,阿拉伯语对齐和指令遵循能力更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31371 2026-07-01 cs.LG cs.AI cs.CL 新提交 92%

Calibrating the Evaluator: Does Probability Calibration Mitigate Preference Coupling in LLM Agent Feedback Loops?

校准评估器:概率校准能否缓解LLM智能体反馈回路中的偏好耦合?

Zewen Liu

机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过概率校准评估器的成对判断来缓解LLM智能体反馈回路中的偏好耦合,实验表明校准将耦合系数降低20-49%,JS散度降低45-67%。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18422 2026-06-18 quant-ph 新提交 92%

Gatekeepers and Hallucinations: A Layered Evaluation Framework for LLM-Driven Quantum Circuit Generation

守门人与幻觉:LLM驱动的量子电路生成的分层评估框架

Christopher Coleman, Sharon Marfatia

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出分层评估框架,通过守门人筛选、电路保真度分析和设计熵指标,识别LLM在量子电路生成中的五种失败模式,并揭示评估基础设施本身可能引入错误。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12369 2026-06-11 cs.CY 新提交 92%

Should LLM Agents Decide in Social Simulations? Comparing Finite-State and LLM-Based Decision Policies

LLM智能体应在社会模拟中做决策吗?比较有限状态与基于LLM的决策策略

Alejandro Buitrago López, Javier Pastor-Galindo, José A. Ruipérez-Valiente

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究评估LLM作为在线社交网络模拟中动作选择器时,是否保持可解释的参考策略,发现LLM在某些配置下可近似但不可靠地保持策略,且速度远慢于马尔可夫链采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09852 2026-06-10 cs.HC cs.AI cs.CL cs.LG cs.MA cs.SE 新提交 92%

LLM-Based Code Documentation Generation and Multi-Judge Evaluation

基于LLM的代码文档生成与多裁判评估

Ikbel Ghrab, Mohamed Dhieb, Ismail Khenissi, Ines Abdeljaoued-Tej

机构 * University of Tunis El Manar(突尼斯国家理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出利用八种大语言模型自动生成代码文档,并通过多裁判评估框架(四个LLM从九个维度评分)提升文档质量,在医学物理库上实验显示最佳与最差模型性能差距达42%。

Comments ICAHS, \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

Journal ref Conference ICAHS IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02049 2026-07-03 cs.CL cs.AI cs.CY 新提交 92%

SPLIT: Cross-Lingual Empathy and Cultural Grounding in English and Ukrainian LLM Responses

SPLIT:英语和乌克兰语LLM回应中的跨语言共情与文化根基

Anna Chorna

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SPLIT基准测试,评估LLM在英语和乌克兰语危机情境下的共情准确性、语言自然性和文化根基,发现模型在乌克兰语中表现下降,且人类与AI评估者一致性弱。

Comments 19 pages, 5 figures, 3 tables. Benchmark paper introducing SPLIT for evaluating empathy, linguistic naturalness, and cultural grounding in English and Ukrainian LLM responses

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08061 2026-08-11 cs.AI 新提交 92%

CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models

CORDA:面向大语言模型的以伤害为核心的分层道德推理基准

Siddarth Singh, Victoria Williams, Simon Rosen, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Benjamin Rosman, Geraud Nangue Tasse, Steven James

机构 * University of the Witwatersrand(威特沃特斯兰德大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究提出CORDA基准,评估大语言模型的以伤害为核心的分层道德推理,发现多数模型优先避免直接个人伤害,部分模型无法遵循指定优先级,该基准填补了LLM道德评估的核心空白。

Comments 8 pages, 6 figures. Accepted at the Fourth International Workshop on Value Engineering in AI (VALE 2026), affiliated with IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07978 2026-08-11 cs.SE cs.AI 新提交 92%

Verication-driven closed-loop multi-agent large language modelframework for code-compliant structural design

验证驱动的闭环多智能体大语言模型框架:面向符合代码规范的结构设计

Jianbin Luo, Weibin Lin, Yiran Lin, Qing Wei, Wei Guo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出验证驱动的闭环多智能体LLM框架,通过耦合有限元验证系统与双节点结构提升结构设计的代码合规性,开源基准与脚本,性能提升显著且具可复现性。

Comments 20 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07651 2026-08-11 cs.AI cs.CV 新提交 92%

An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography

一种智能体AI框架克服了大型语言模型在眼底照相青光眼检测中的基本局限

Jalil Jalili, Hossein Taghizad, Anuwat Jiravarnsirikul, Christopher Bowd, Akram Belghith, Raheleh Kafieh, Christopher A. Girkin, Sally L. Baxter, Robert N. Weinreb, Linda M. Zangwill, Mark Christopher

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究开发的智能体AI框架整合LLM与专用深度学习工具,提升了眼底照相青光眼检测的准确率、一致性,纠正了仅用LLM的缺陷,具有通用性,或推动医学AI向多智能体系统转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00817 2026-08-04 cs.AI cs.HC stat.AP 新提交 92%

Large language models improve physician accuracy but lead to false reliance

大型语言模型可提高医师准确率,但会导致错误依赖

Tirtha Chanda, Christoph Wies, Franziska Schramm, Carina Nogueira Garcia, Nicolas B. Merl, Martin J. Hetz, Jochen S. Utikal, Phillip Tschandl, Cristian Navarrete-Dechent, Alexander Thiem, Jakob N. Kather, Consortium, Titus J. Brinker

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01977 2026-07-03 cs.AI 新提交 92%

OntoLearner: A Modular Python Library for Ontology Learning with Large Language Models

OntoLearner: 一个用于大语言模型本体学习的模块化Python库

Hamed Babaei Giglou, Jennifer D'Souza, Andrei Aioanei, Nandana Mihindukulasooriya, Sören Auer

机构 * TIB – Leibniz Information Centre for Science and Technology(TIB – 莱布尼茨科学与技术信息中心) L3S Research Center, Leibniz University of Hannover(L3S研究中心,莱布尼茨汉诺威大学) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出OntoLearner框架,统一本体访问、LLM驱动学习管道和标准化基准,通过跨领域大规模实验揭示本体学习的主要瓶颈是模型知识编码与本体组织的结构性不匹配。

Comments 30 pages. Under review at Nature Communications. This version is reformatted with a different section structure; content is unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25400 2026-06-25 cs.AI 新提交 92%

BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding

BrainAgent:一种大语言模型驱动的多智能体框架,用于自主脑信号理解

Yangxuan Zhou, Sha Zhao, Jiquan Wang, Shijian Li, Gang Pan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出LLM驱动的多智能体框架BrainAgent,通过分层架构将自然语言意图转化为可执行的处理流水线,实现脑信号分析的自动化与民主化。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24610 2026-06-24 cs.CL 新提交 92%

Same Lesson, Different Story: Cross-Lingual Reconstruction of Cultural Narratives in Large Language Models

同一教训,不同故事:大型语言模型中文化叙事的跨语言重构

Jory Alshaalan, Haya Albaker, Abeer Aldayel, Aljawharah Alabdullatif, Rehab Alahmadi

机构 * College of Computer and Information Sciences(计算机与信息科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 本研究通过跨语言谚语集和四种LLM生成叙事,评估模型在跨语言条件下是否保留文化意义,发现跨语言提示基本保留语义但改变叙事结构,且模型间存在强收敛。

Comments This paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24408 2026-06-24 cs.LG 新提交 92%

Natural Identifiers for Privacy and Data Audits in Large Language Models

大型语言模型中用于隐私和数据审计的自然标识符

Lorenzo Rossi, Bartłomiej Marek, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 提出自然标识符(NIDs)解决LLM隐私审计难题,无需重训练即可进行事后差分隐私审计和数据集推断。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22382 2026-06-23 eess.IV cs.AI cs.CV 新提交 92%

Large Language Model-Assisted Cleaning of Report-Derived Labels in a Large-Scale Chest CT Dataset

大型胸部CT数据集中基于大语言模型的报告衍生标签清洗

Yosuke Yamagishi, Atsushi Takamatsu, Mototsugu Sato, Tomohiro Kikuchi, Shouhei Hanaoka, Takeharu Yoshikawa, Osamu Abe

机构 * Division of Radiology and Biomedical Engineering, Graduate School of Medicine, The University of Tokyo(放射医学与生物医学工程系,东京大学医学研究生院) Department of Computational Diagnostic Radiology and Preventive Medicine, The University of Tokyo Hospital(计算诊断放射学与预防医学系,东京大学医院) Department of Radiology, Kanazawa University Hospital(金泽大学医院放射科) Faculty of Medicine, The University of Tokyo(东京大学医学系) Department of Radiology, School of Medicine, Jichi Medical University(立命馆大学医学系放射科) Department of Radiology, The University of Tokyo Hospital(东京大学医院放射科)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究利用大语言模型(GPT-5.4)清洗CT-RATE数据集中的标签-报告不一致性,通过放射科医生裁决验证,发现LLM辅助清洗能有效识别临床相关错误,并提升数据集质量。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16987 2026-06-16 cs.AI 新提交 92%

Consensus-based Agentic Large Language Model Framework for Harmonized Tariff Schedule Code Classification

基于共识的智能体大语言模型框架用于协调制度海关编码分类

Truong Thanh Hung Nguyen, Khanh Van Quynh Nguyen, Hoang-Loc Cao, Tri Duong, Phuc Ho, Van Pham, Loc Nguyen, Hung Cao

机构 * Analytics Everywhere Lab, University of New Brunswick(新不伦瑞克大学无处不在分析实验室) University of Economics Ho Chi Minh City(胡志明市经济大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出一种多智能体LLM框架,通过信息检索、语义检索、证据推理、共识验证和分层投票等方法,解决加拿大10位HTS编码分类难题,在3300条数据上验证了证据驱动和人工参与的必要性。

Comments Accepted at the 3rd International Conference of Resilience by Technology and Design (RTD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11672 2026-06-11 cs.CR cs.AI 新提交 92%

Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment

开源LLM代理能否取代静态应用安全测试工具?一项实证评估

Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

机构 * College of Engineering and Science, Florida Institute of Technology(工程学院与科学学院,佛罗里达理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 评估基于开源LLM的代理在静态应用安全测试中的性能,与SAST工具Bandit对比,发现当前不适合实际应用。

Comments Keywords: Agentic AI, Cybersecurity, Large Language Models, Static Application Security Testing, Model performance evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08071 2026-06-09 cs.CL 新提交 92%

SurgiQ: A Large-Scale Multi-Domain Benchmark for Evaluating Surgical Understanding in Large Language Models

SurgiQ: 用于评估大语言模型手术理解的大规模多领域基准

Ayah Al-Naji, Edoardo Fazzari, Saif Alkindi, Hamdan Alhadhrami, Preslav Nakov, Cesare Stefanini

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出SurgiQ基准,包含13,055道多选题,覆盖六个外科领域和四种题型,用于评估LLM的手术推理能力。实验显示最佳模型准确率仅68.1%,通用模型优于多数生物医学模型,表明当前医学专业化未能充分覆盖手术知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11623 2026-08-13 cs.LG cs.AI cs.NI eess.SP 新提交 92%

FM-LLM: A frequency-enhanced mixture-of-experts framework for adapting LLMs to time series forecasting

FM-LLM:一种用于适配大语言模型(LLMs)进行时间序列预测的频率增强型混合专家框架

Rentao Gu, Yihang Ding, Junjie Li, Yi Ding, Weijing Sang, Xiaoli Huo, Xin Qin, Yuefeng Ji

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Telecom Research Institute(中国电信研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出FM-LLM框架,通过频谱标记对齐器与非对称MoE解码器等设计,在11个基准的多数指标上优于现有LLM基线,且具备良好迁移性。

Journal ref R. Gu, Y. Ding, J. Li, Y. Ding, W. Sang, X. Huo, X. Qin, and Y. Ji, Knowl.-Based Syst., vol.341, p.115776, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08126 2026-08-11 cs.LG cs.CL 新提交 92%

Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk

准确集成,脆弱叙事:多尺度堆叠与LLM生成信用风险解释的保真度审计

Gregorius Reynaldi Pratama, Kuo-Kun Tseng

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本研究构建多尺度堆叠集成预测模型并测试LLM生成信用风险解释的保真度,发现预测性能提升有限,LLM生成的解释存在事实错误,需对生成解释进行验证。

Comments 13 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07499 2026-08-11 cs.HC cs.AI cs.CL 新提交 92%

Evaluation of Motivational Interviewing Counsellors with Task-Aware Multi-Stage LLM-Based Simulated Clients

基于任务感知多阶段大语言模型(LLM)模拟来访者的动机访谈咨询师评估

Jiading Zhu, Xinyu Cindy Wang, Thomas Nguyen, Yan Qing Lee, Osnat C. Melamed, Peter Selby, Jonathan Rose

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对动机访谈的关键唤起任务,提出Evoke-Sim任务感知多阶段LLM模拟来访者框架,用于戒烟场景下MI咨询师评估,其评估效果优于现有模拟来访者,为相关评估设定了更高标准。

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07378 2026-08-10 eess.AS cs.AI cs.LG 新提交 92%

LSEAD: A Privacy-Preserving LLM-Based Speech Analysis Framework for Early Alzheimer's Disease Screening

LSEAD:一种基于大语言模型(LLM)的隐私保护型语音分析框架,用于阿尔茨海默病(AD)早期筛查

Xin Wang, Yingchao Huang, Yuhan Su, Shanshan Yao, Wei Peng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于开源LLM的隐私保护语音分析框架LSEAD,在ADReSS系列数据集上使AD分类准确率提升最多5个百分点,为早期AD筛查提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04240 2026-08-06 cs.CL cs.AI 新提交 92%

Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary

棋盘上的幻觉:工具增强型大语言模型(LLM)象棋评论评估

S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh, Pramod Viswanath

机构 * Princeton University(普林斯顿大学) Sentient Labs University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ACT-Eval框架,评估工具增强型LLM的象棋评论,发现事实幻觉普遍存在,工具可提升事实正确性但战略战术覆盖度仍有限。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27155 2026-07-30 cs.AI cs.CL cs.HC 新提交 92%

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

OmegaUse-OfficeVal:基于经济基准的长周期办公套件任务LLM智能体评测基准

Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OmegaUse-OfficeVal是带经济基准的长周期办公套件任务LLM智能体评测基准,含100项任务,评测发现前沿LLM成本低速度快但质量未达人类水平,代码与数据集已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22766 2026-07-28 cs.LG cs.AI 新提交 92%

Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation

超越夏普利值:用于大语言模型对齐和评估的基于影响的数据审核管道

Yunting Song, Matthew Watson, Peter Grabowski, Jun Qin

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(title,summary_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型数据质量问题,引入可扩展的基于影响的数据审核管道,通过映射语义邻域到有向图,利用参考LLM概率分布评估数据效用,转换为局部优势指标,有效清理数据集,揭示基准漏洞,确保数据完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09843 2026-07-08 cs.HC cs.AI cs.CL 新提交 92%

An LLM-Native Psychometric Instrument Reveals a Self-Report--Behavior Gap Across 25 Models

一个原生LLM的心理测量工具不能预测LLM行为:来自25个模型的证据

Juan Manuel Contreras

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过探索性因子分析从LLM行为中构建心理测量工具,发现LLM的自我报告与观察行为无关,揭示自我报告与人类判断之间的混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏