Large Language Models Assisting Ontology Evaluation
大语言模型辅助本体评估
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本研究提出OE-Assist框架,利用大语言模型辅助本体评估,通过自动化和半自动化CQ验证提升效率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
大语言模型辅助本体评估
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本研究提出OE-Assist框架,利用大语言模型辅助本体评估,通过自动化和半自动化CQ验证提升效率。
对大型语言模型构建两级分数因子设计的系统评估
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)
AI总结 本文系统评估了GPT和Gemini模型在构建不同规模的两级分数因子设计中的性能,展示了其在优化设计生成中的有效性。
Comments 31 pages, 11 tables
开源大语言模型在协助日文病历报告写作中的性能评估
机构 * Department of Pathology, University of Yamanashi, Chuo, Japan(山梨大学病理科) ; Division of Pathology, Exploratory Oncology Research & Clinical Trial Center, National Cancer Center, Kashiwa, Japan(国立癌症中心探索肿瘤研究与临床试验中心病理科) ; Department of Preventive Medicine, Graduate School of Medicine, The University of Tokyo, Tokyo, Japan(东京大学医学部预防医学科) ; Department of Medical Oncology, National Cancer Center Hospital East, Kashiwa, Japan(国立癌症中心东医院医学肿瘤科) ; Department of Thoracic Surgery, National Cancer Center Hospital East, Kashiwa, Japan(国立癌症中心东医院胸外科)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文评估了开源大语言模型在协助日文病历报告写作中的性能,发现思维模型和医学专用模型在结构化报告和拼写纠正中表现优异,但解释性输出的偏好存在较大差异。
Comments 9 pages (including bibliography), 2 figures, 6 tables
AudioTrust: 音频大语言模型多维可信度基准测试
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 AudioTrust通过多维度评估音频大语言模型的可信度,揭示其在高风险音频场景下的局限性,为安全部署提供关键洞察。
Comments Accepted to ICLR 2026
多语言功能评估用于大语言模型
机构 * The Center for Tech Responsibility, Brown University(布朗大学技术责任中心) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文提出跨语言小学数学符号基准和跨语言指令跟随评估,通过多语言翻译功能基准模板,评估大语言模型在多语言环境中的性能和鲁棒性,发现CL-GSM Symbolic和CL-IFEval在多语言任务中表现更优。
Comments This is an updated version with details of the CL-GSM Symbolic and CL-IFEval datasets validation
MaterialFigBENCH:用于评估多模态大语言模型在大学级材料科学问题解决能力的基准数据集
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 MaterialFigBench是一个评估多模态大语言模型在材料科学问题中图表解读能力的基准数据集,通过137个问题测试模型在视觉理解和数值精度上的表现,揭示了当前模型在图表处理方面的不足。
Comments 27 pages, 4 tables, 6 figures
小型语言模型能利用它们检索到的信息吗?不同模型规模下的检索利用经验研究
专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.CL
AI总结 研究发现小型语言模型在检索信息时存在利用瓶颈,无法有效提取答案,且上下文干扰导致错误生成,表明RAG在小模型中效果有限。
Comments 10 pages, 5 figures, planning to submit to arr march 2026. Code and evaluation data: https://anonymous.4open.science/r/rag-utilization-study-C67F . Earlier draft preprint available on Zenodo: https://zenodo.org/records/18870116 (note: this arXiv submission is an updated draft)
以人为中心的LLM隐私审计:发现与摩擦
机构 * TU Berlin(柏林技术大学) ; Weizenbaum Institute for the Networked Society(网络化社会研究所) ; Columbia University(哥伦比亚大学) ; KU Leuven(根特大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了LLM隐私审计中的人机交互问题,通过LMP2工具发现模型对个人信息的关联预测准确率高,但用户对隐私保护的需求与模型输出的不确定性存在矛盾,提出了九项摩擦并提出未来研究方向。
ConCISE: 一种无需参考的LLM生成回答简洁性评估指标
机构 * Commonwealth Bank of Australia(澳大利亚共同银行)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出ConCISE指标,用于评估LLM生成回答的简洁性,通过三种压缩比计算和词删除方法,无需参考实现自动评估。
PersonaTrace: 基于LLM代理的数字足迹合成
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 PersonaTrace通过LLM代理生成多样且逼真的数字足迹,提升数据集的多样性和真实性,从而增强模型在真实任务中的表现。
Comments EACL 2026 Industry Track
SommBench:评估语言模型的品酒师专业能力
专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 SommBench是一个多语言基准,用于评估语言模型的品酒师专业能力,包含三个任务:葡萄酒理论问答、葡萄酒特征补全和食物-葡萄酒配对,测试模型在感官判断上的能力。
理解LLM在执行无害任务时遇到用户提供的有害内容的行为
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) ; Flexera(Flexera公司) ; Delft University of Technology(代尔夫特理工大学)
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究探讨了LLM在执行无害任务时遇到用户提供的有害内容时的行为,发现主流LLM在处理有害内容时未能维持伦理标准,且某些类别和任务更易引发有害响应。
Comments 21 pages, 11 figures
ICD编码理由的评估与大语言模型引导的学习
专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.AI
AI总结 本研究评估ICD编码中理由的可解释性,通过构建多粒度数据集和LLM引导学习方法,提升理由生成的合理性和模型决策的忠实性。
明目张胆:一种用于隐蔽大语言模型劫持的隐写术方法
机构 * College of Cyber Science, Key Laboratory of DISSec, Nankai University(网络安全学院、DISSec重点实验室、南开大学)
专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 StegoAttack通过隐写术在无害段落中嵌入有害查询,实现对大语言模型的高效隐蔽劫持。
通过结构化扰动评估基于LLM的项目申请评审
专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 本文通过结构化扰动评估基于LLM的项目评审,发现逐部分分析方法在检测和评分可靠性上表现最佳,但LLM反馈存在偏颇,需进一步优化。
CUAAudit: 视觉语言模型作为自主计算机使用代理的元评估
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI
AI总结 本文研究了视觉语言模型作为自主计算机使用代理审计员的元评估,发现尽管先进模型在准确性方面表现良好,但在复杂环境中性能下降,突显了现实部署中需考虑评估者可靠性与不确定性的重要性。
Comments This work has been accepted to appear at the HEAL @ CHI 2026 Worshop on Human-centered Evaluation and Auditing of Language Models
你让我这么做:测量LLM代理中指令文本诱导的私有数据泄露
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI
AI总结 研究发现LLM代理在处理嵌入文档指令时存在安全漏洞,导致高比例的数据泄露,且现有防御措施无法有效检测此类攻击。
Comments 14 pages
在大语言模型时代,词义诱导仍未能解决
专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL
AI总结 本文提出基于大语言模型的词义诱导方法,发现无监督方法难以超越'每个词根一个聚类'启发式方法,同时表明数据增强和Wiktionary利用对提升性能有帮助。
Comments Accepted at ACL 2025 (Findings)
奖励黑客代理:用于LLM机器学习工程代理的基准评估完整性
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI
AI总结 本研究提出RewardHackingAgents基准,用于评估机器学习工程代理的评估完整性,通过显式测量评估者篡改和训练测试泄漏两种妥协向量,展示评估完整性可作为核心指标进行验证。
理解父母在调节儿童与生成式AI聊天机器人互动中的意愿通过LLM生成的探测器
专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI
AI总结 本文通过LLM生成的探测器研究父母如何调节儿童与生成式AI聊天机器人的互动,发现父母关注当前控制所忽视的互动,需对话层面的透明度和个性化控制。
Comments 33 pages, 10 figures, Accepted to ACM CHI 2026
DriveCritic: 向基于情境的、与人类对齐的自动驾驶评估迈进:基于视觉-语言模型
机构 * University of Michigan(密歇根大学) ; NVIDIA(英伟达) ; Fudan University(复旦大学)
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI
AI总结 DriveCritic通过结合视觉-语言模型和情境意识,提升自动驾驶系统评估的准确性与人类对齐性。
Comments Accepted at ICRA 2026; 8 pages, 3 figures
WideSeek-R1: 探索通过多智能体强化学习进行广泛信息寻求的宽度扩展
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 WideSeek-R1通过多智能体强化学习框架,实现广泛信息寻求任务中的宽度扩展,提升多智能体系统的协同与并行执行能力,实验表明其性能优于单智能体模型。
Comments https://wideseek-r1.github.io/
FinRule-Bench:一个用于金融表和原则联合推理的基准
专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG
AI总结 FinRule-Bench是一个评估金融表与原则联合推理能力的基准,通过三个任务测试模型在规则验证、识别和多违规诊断中的表现,揭示LLMs在高风险金融分析中的局限性。
Comments 8 pages + Ethics Statement + References + Appendix
CR-Bench:评估AI代码审查代理的现实世界效用
机构 * Nutanix, Inc.(Nutanix公司)
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 CR-Bench通过引入基准数据集和细粒度评估流程,评估AI代码审查代理在现实世界中的效用,揭示了问题解决与假发现之间的权衡,为LLM驱动的代码审查代理发展提供基础。
在生物医学和多领域背景下对LLM进行成对因果发现的基准测试
专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本文评估了13个开源LLM在生物医学和多领域背景下进行成对因果发现的能力,发现现有模型在处理复杂因果关系时表现不佳,提出了统一的评估框架并公开数据以促进研究。
LLMs能否有效评估远监督命名实体标签?构建JudgeWEL数据集
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出利用维基百科和维基数据构建卢森堡语NER数据集JudgeWEL,通过LLM自动标注和验证,生成更大规模且更平衡的实体覆盖数据集,为低资源语言研究提供新资源。
Comments Accepted at LREC 2026
OpenClaw PRISM: 一种零fork、纵深防御的运行时安全层,用于工具增强的大语言模型代理
专题命中 评测与基准 :LLM(title,abstract)
AI总结 OpenClaw PRISM通过零fork运行时安全层,结合启发式和LLM扫描流程,提供纵深防御机制,以增强工具增强型大语言模型代理的安全性。
Comments 23 pages, 3 figures, 6 tables. Open-source system paper with benchmark artifact pipeline
基于基因组基础模型的跨物种抗菌素耐药性预测
专题命中 评测与基准 :foundation model(title,abstract)
AI总结 本研究提出基于基因组基础模型的跨物种抗菌素耐药性预测方法,通过分析嵌入表示和局部激活模式,提升模型在不同物种间的泛化能力。
Comments Master's thesis, Columbia University, Department of Computer Science
基于视觉语言模型的早期动作预测在人机交互中的决策感知不确定性评估
专题命中 评测与基准 :language model(title,abstract)
AI总结 本文提出了一种系统评估基于视觉语言模型的短期动作识别在人机交互中的不确定性方法,通过引入时间前缀评估协议和校准度量标准,揭示了部分观测下的误校准模式和失败模式,为信心门控的人机交互模块提供了可靠性证据。
AI代理能否达成一致?
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究发现,基于LLM的代理在无质押设置中难以可靠达成一致,群体规模增大和拜占庭代理的存在显著降低共识成功率,活锁问题主导了失败原因。