arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 717 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 160 篇

2601.02071 2026-05-19 cs.AI 90%

FormuLLA: A Large Language Model Approach to Generating Novel 3D Printable Formulations

FormuLLA:一种用于生成新型3D打印配方的大型语言模型方法

Adeshola Okubena, Yusuf Ali Mohammed, Moe Elbadawi

机构 * School of Biological and Behavioural Sciences, Queen Mary University of London(伦敦女王玛丽大学生物与行为科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出FormuLLA方法,利用微调后的大型语言模型推荐3D打印配方的辅料并预测丝材机械性能,揭示了模型选择和参数对性能的影响,指出小模型易遗忘及标准指标无法评估配方可加工性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16288 2026-05-19 cs.CY cs.CL 90%

When AI Tells You What You Want to Hear: Sycophantic Behavior of Large Language Models in Dementia Care Settings

当AI说你想听的话:大型语言模型在痴呆症护理环境中的趋炎附势行为

Christian Kolb

机构 * Christian Kolb

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究探讨了大型语言模型在痴呆症护理场景中是否因迎合社会期望而降低专业质量,通过五种提示测试四款模型,发现响应质量随提示框架增强而下降,提示框架显著影响响应质量。

Comments 10 pages, 4 figures. Exploratory study

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16284 2026-05-19 cs.CY cs.AI 90%

Measuring Changes in Instructor Class Design and Student Learning After the Release of Large Language Models (LLMs)

评估大型语言模型发布后教师课程设计和学生学习的变化

Amanda Potasznik, Daniel Haehn

机构 * University of Massachusetts, Boston(马萨诸塞大学波士顿分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 研究通过混合方法分析大学课程中LLM的使用对学生学习和教师教学的影响,结合定量分析和问卷调查数据,探讨学习成果的变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17000 2026-05-19 cs.LG cs.AI 90%

BoLT: A Benchmark to Democratize Black-box Optimization Research for Expensive LLM Tasks

BoLT:一个民主化黑盒优化研究的基准,用于昂贵的LLM任务

Ruth Wan Theng Chew, Zhiliang Chen, Apivich Hemachandra, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出BoLT基准,旨在通过提供真实LLM优化问题,促进黑盒优化方法在昂贵的大型语言模型任务中的研究和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18693 2026-05-19 cs.AI 90%

SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents

SkillGenBench: 评估LLM代理技能生成流水线的基准测试

Yifan Zhou, Zhentao Zhang, Ziming Cheng, Shuo Zhang, Qizhen Lan, Zhangquan Chen, Zhi Yang, QianyuXu, Ronghao Chen, Huacan Wang, Sen Hu

机构 * SJTU(上海交通大学) XJTU(西安交通大学) NUS(新加坡国立大学) QuantaAlpha(量子Alpha) THU(清华大学) SUFE(上海财经大学) NTU(国立.ntu) PKU(北京大学) UCAS(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出SkillGenBench,一个用于评估LLM代理技能生成流水线的基准测试,通过统一可控的协议评估技能生成过程,涵盖任务条件生成和任务无关生成两种模式,以及基于仓库和文档的两种程序来源,揭示技能生成在不同数据源中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02574 2026-05-19 cs.CR cs.AI 90%

LLM-Safety Evaluations Lack Robustness

大语言模型安全评估缺乏鲁棒性

Tim Beyer, Sophie Xhonneux, Simon Geisler, Gauthier Gidel, Leo Schwinn, Stephan Günnemann

机构 * Department of Computer Science \& Munich Data Science Institute, Technical University of Munich Canada AI CIFAR Chair

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文指出当前大语言模型安全对齐研究受到多种交织的噪声源阻碍,如小数据集、方法学不一致和不可靠的评估设置,导致难以公平评估和比较攻击与防御,阻碍了进展。我们系统分析了大语言模型安全评估流程,涵盖数据集整理、自动化红队优化策略、响应生成和响应评估使用LLM法官。在每个阶段,我们识别了关键问题并突出了其实际影响。我们还提出了一套减少未来攻击和防御论文评估中噪声和偏见的指南。最后,我们提出了对立观点,强调现有限制的实用原因。我们相信,未来研究解决这些问题将提高领域生成可比结果的能力,并实现可衡量的进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17453 2026-05-19 cs.CR cs.CL 90%

Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

勿信工具:在不可信工具反馈下评估和防御LLM代理

Lecheng Yan, Ruizhe Li, Xicheng Han, Wenxi Li, Binwu Wang, Longyue Wang, Chenyang Lyu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) University of Science and Technology of China(中国科学技术大学) University of Birmingham(伯明翰大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本研究探讨了在不可信工具反馈环境下评估和防御LLM代理的问题,提出了一种新的失败模式'认知中毒',并介绍了TRUST-Bench基准、GuardedJoint惩罚指标和VISTA-Guard框架,展示了轨迹感知的最终动作评分在安全与效用权衡中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14038 2026-05-19 cs.AI 90%

Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use

模型适应性工具必要性揭示了大语言模型工具使用中的知行差距

Yize Cheng, Chenrui Fan, Mahdi JafariRaviz, Keivan Rezaei, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学College Park分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在使用外部工具时的必要性问题,提出了一种基于模型自身性能的适应性工具必要性定义,并通过四个模型在算术和事实性问答数据集上的比较,发现工具必要性与实际调用行为之间存在显著的不匹配,揭示了LLM工具使用中的知行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17324 2026-05-19 cs.CR cs.AI 90%

ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents

ASPI:寻求澄清会放大LLM代理中的提示注入漏洞

Udari Madhushani Sehwag, Zhengyang Shan, Heming Liu, Dileepa Lakshan, Joseph Brandifino, Max Fenkell

机构 * Scale AI Boston University(波士顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Human Frontier Collective(人类前沿集体)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究探讨了LLM代理在执行任务时寻求澄清的行为对提示注入攻击的影响,发现这种行为会显著增加代理的脆弱性,并提出了ASPI基准测试来评估这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17775 2026-05-19 cs.CL cs.AI 90%

Systematic Evaluation of the Quality of Synthetic Clinical Notes Rephrased by LLMs at Million-Note Scale

在百万笔记规模上系统评估LLM重新表述的合成临床笔记质量

Jinghui Liu, Sarvesh Soni, Anthony Nguyen

机构 * Australian e-Health Research Centre, CSIRO, Australia(澳大利亚电子健康研究中心,CSIRO,澳大利亚) National Library of Medicine, National Institutes of Health, USA(国家医学图书馆,国立卫生研究院,美国)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究系统评估了LLM生成的合成临床笔记的质量,包括内在、外在和事实性评估,发现尽管在粗粒度任务中保留了核心临床信息和预测效用,但在细粒度任务如ICD编码中丢失了细节,通过分块重述可以缓解这一问题,但会降低事实准确性。研究还发现合成错误主要源于临床情境的误解、时间混淆、测量误差和虚构声明,同时展示了这些合成笔记可以有效增强罕见ICD代码的特定任务训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16386 2026-05-19 cs.CV 89%

Auditing Multimodal LLM Raters: Central Tendency Bias in Clinical Ordinal Scoring

对多模态大语言模型评分者的审计:临床顺序评分中的中间倾向偏差

Jiaqing Zhang, Sandeep Elluri, Bhanu Cherukuvada, Yonah Joffe, Jessica Sena, Miguel Contreras, Scott Siegel, Subhash Nerella, Catherine Price, Parisa Rashidi

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Department of Computer and Information Science and Engineering(计算机与信息科学与工程系) Department of Clinical and Health Psychology(临床与健康心理学系) Department of Biomedical Engineering(生物医学工程系)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文研究多模态大语言模型在临床顺序评分中的中间倾向偏差,通过基准测试发现三种前沿LLM在Clock Drawing Test评分中存在系统性压缩倾向,影响临床决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10930 2026-05-19 cs.HC 89%

Evaluating the False Trust Engendered by LLM Explanations

评估由LLM解释所引发的虚假信任

Vardhan Palod, Upasana Biswas, Subbarao Kambhampati

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过用户研究评估不同解释类型对用户判断AI答案正确性及产生虚假信任的影响,发现推理轨迹和事后解释具有说服力但不具信息性,而对比双解释能提升用户区分正确与错误输出的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05606 2026-05-19 cs.CL cs.HC 89%

OPeRA: A Dataset of Observation, Persona, Rationale, and Action for Evaluating LLMs on Human Online Shopping Behavior Simulation

OPeRA: 一个用于评估LLM在模拟人类在线购物行为上的表现的观察、人设、推理和行动数据集

Ziyi Wang, Yuxuan Lu, Wenbo Li, Amirali Amini, Bo Sun, Yakov Bart, Weimin Lyu, Jiri Gesi, Tian Wang, Jing Huang, Yu Su, Upol Ehsan, Malihe Alikhani, Toby Jia-Jun Li, Lydia Chilton, Dakuo Wang

机构 * Northeastern University(东北大学) University of Southern California(南加州大学) Stony Brook University(石溪大学) Independent Researcher(独立研究者) Ohio State University(俄亥俄州立大学) University of Notre Dame(Notre Dame 大学) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出OPeRA数据集,用于评估LLM在模拟人类在线购物行为上的能力,通过收集真实用户在在线购物会话中的观察、人设、推理和行动,建立首个评估LLM预测特定用户下一步行动和推理的基准。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17007 2026-05-19 cs.CL 89%

HalluScore: Large Language Model Hallucination Question Answering Benchmark

HalluScore: 大语言模型幻觉问答基准

Aisha Alansari, Hamzah Luqman

机构 * Department of Information and Computer Science, King Fahd University of Petroleum and Minerals(国王法赫德石油与矿物大学信息与计算机科学系) SDAIA-KFUPM Joint Research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本研究提出HalluScore基准,用于评估大语言模型在不同推理难度、知识领域、历史时间线和文化场景中的幻觉行为,通过827个精心编写的题目评估、检测和缓解幻觉,同时提供高质量的人类标注以识别不同模型的幻觉表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17565 2026-05-19 cs.AI cs.CL 89%

Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models

泛化还是记忆?国际象棋训练语言模型的脆弱性测试

Ethan Tang

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了国际象棋训练语言模型是泛化还是记忆,通过测试发现其高性能主要源于模式匹配,并展示了LLM-Modulo框架在提升国际象棋谜题解决性能上的效果,证明了与外部验证器结合的通用LLM比直接训练合成数据更灵活。

Comments 14 pages, 2 figures, 4 tables, 3 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17588 2026-05-19 cs.IR cs.CL 89%

From Isolated Scoring to Collaborative Ranking: A Comparison-Native Framework for LLM-Based Paper Evaluation

从孤立评分到协作排名:一种基于LLM的论文评估比较原生框架

Pujun Zheng, Jiacheng Yao, Jinquan Zheng, Chenyang Gu, Guoxiu He, Jiawei Liu, Yong Huang, Tianrui Guo, Wei Lu

机构 * School of Economics and Management, East China Normal University(东华大学经济管理学院) School of Information Management, Wuhan University(武汉大学信息管理学院) China Academic Degrees & Graduate Education Development Center(中国学位与研究生教育发展中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CNPE框架,通过整合比较机制于数据构建和模型学习,提升论文评估的相对质量判断,实验显示比DeepReview-14B平均提升21.8%。

Comments Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20650 2026-05-19 cs.CL cs.AI cs.CE 88%

FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information

FinTagging: 评估LLM提取和结构化财务信息

Yan Wang, Lingfei Qian, Xueqing Peng, Yang Ren, Keyi Wang, Yi Han, Dongji Feng, Fengran Mo, Shengyuan Lin, Qinchuan Zhang, Kaiwen He, Chenri Luo, Jianxing Chen, Junwei Wu, Chen Xu, Ziyang Xu, Jimin Huang, Guojun Xiong, Xiao-Yang Liu, Qianqian Xie, Jian-Yun Nie

机构 * Georgia Institute of Technology(佐治亚理工学院) Columbia University(哥伦比亚大学) California State University(加州州立大学) University of Montreal(蒙特利尔大学) Carnegie Mellon University(卡内基梅隆大学) Rensselaer Polytechnic Institute(莱斯利理工学院) The University of Manchester(曼彻斯特大学) Harvard University(哈佛大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FinTagging基准,用于评估LLM在提取和结构化财务信息方面的能力,通过分解为FinNI和FinCL两个子任务,揭示了LLM在细粒度概念链接上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10981 2026-05-19 cs.IR cs.AI cs.CL 88%

A Survey on Retrieval-Augmented Text Generation for Large Language Models

基于大型语言模型的检索增强文本生成综述

Yizheng Huang, Jimmy Huang

机构 * York University(约克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了检索增强文本生成方法,探讨了其在提升大型语言模型生成准确性和可靠性方面的核心方法与主要贡献。

Comments Ongoing Work

Journal ref ACM Computing Surveys, Volume 58, Issue 12, Article No.: 300, Pages 1 - 38, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18642 2026-05-19 eess.SY cs.SY 88%

A Benchmark on LLM-Based Power Flow Computation: Do More Structured Prompts Help?

基于LLM的潮流计算基准测试:结构化提示是否更有帮助?

Tingwei Chen, Kaiyang Huang, Kai Sun

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过对比三种LLM在不同提示格式下的表现,探讨了结构化提示在电力系统潮流计算中的有效性,并发现Gemini 2.5 Pro在简单叙述提示下表现最佳,但结构化提示反而降低了准确性,而GPT-3.5 Turbo在所有提示格式下均表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17044 2026-05-19 cs.AI 88%

PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language Models

PersonaArena: 用于评估和提升大语言模型层面角色扮演的动态模拟

Wenlong Shi, Jianxun Lian, Mingqi Wu, Haiming Qin, Mingyang Zhou, Xing Xie, Naipeng Chao, Hao Liao

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Microsoft Research Asia(微软亚洲研究院) Microsoft Gaming(微软游戏) Provincial Key Laboratory of Intelligent Communication and Digital Society Governance, Shenzhen University(深圳大学省级智能通信与数字社会治理重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出PersonaArena框架,通过动态模拟评估和提升大语言模型在角色扮演层面的能力,利用用户生成的社会内容构建细致的个性库,并在模拟社交环境中进行多轮上下文丰富的交互,通过多代理辩论裁判实现全面公正的评估。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01608 2026-05-19 cs.CV 88%

From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models

从像素到地点:一个系统性基准,用于评估大语言模型中的图像地理定位能力

Lingyao Li, Runlong Yu, Qikai Hu, Bowei Li, Min Deng, Yang Zhou, Xiaowei Jia

机构 * University of South Florida Tampa USA University of Alabama Tuscaloosa USA University of Michigan Ann Arbor USA Texas Tech University Lubbock USA Texas A \& M University College Station USA University of Pittsburgh Pittsburgh USA University of South Florida University of Alabama University of Michigan Texas Tech University Texas A \& M University University of Pittsburgh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出IMAGEO-Bench基准,系统评估大语言模型在图像地理定位中的准确性、距离误差、地理偏见和推理过程,揭示闭源模型在高资源区域表现优于欠代表区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23355 2026-05-19 cs.AI 87%

LEGO: An LLM Skill-Based Front-End Design Generation Platform

LEGO: 一个基于LLM技能的前端设计生成平台

Jincheng Lou, Ruohan Xu, Jiecheng Ma, Runzhe Tao, Xinyu Qu, Yibo Lin

机构 * School of IC, Peking University(北京大学集成电路学院) School of EECS, Peking University(北京大学电子信息技术学院) School of Microelectronics, Xidian University(西安电子科技大学微电子学院) Institute of EDA, Peking University(北京大学EDA研究院) Beijing Advanced Innovation Center for IC(北京集成电路先进创新中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出LEGO平台,通过将数字前端流程分解为六个独立步骤,并将每个代理能力表示为标准化的可组合电路技能,实现了高效的前端设计生成,显著提升了RTL设计自动化的效果。

Comments Accepted to ISEDA 2026. Best Paper Nomination. 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17292 2026-05-19 cs.AI cs.MA 87%

MetaCogAgent: A Metacognitive Multi-Agent LLM Framework with Self-Aware Task Delegation

MetaCogAgent: 一种具有自我意识的任务委托多智能体大语言模型框架

Chenyu Wang, Yang Shu

机构 * School of Computer and Artificial Intelligence, Zhengzhou University, Zhengzhou, China(郑州大学计算机与人工智能学院) Zhejiang University, Hangzhou, China(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MetaCogAgent框架,通过引入元认知自我评估单元,使每个智能体在执行任务前评估自身能力边界,从而提升任务准确性并减少API调用次数。

Comments 6 pages, submitted to IEEE SMC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17279 2026-05-19 cs.SE cs.AI 87%

Rover: Context-aware Conflict Resolution with LLM

Rover: 基于上下文的冲突解决系统

Qingyu Zhang, Junzhe Li, Jiayi Lin, Changhua Luo, Chenxiong Qian

机构 * The University of Hong Kong(香港大学) Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Rover,一种结合程序分析和大语言模型的冲突解决系统,通过多层代码属性图获取上下文感知提示,提升代码合并的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16264 2026-05-19 cs.HC cs.CL 87%

LLM-Based Intelligent Notification Composition: From Static Personalization to Context-Aware Persuasive Messaging

基于大语言模型的智能通知生成:从静态个性化到情境感知的说服性信息

Nilesh Agrawal

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本文提出利用大语言模型提升通知信息质量,通过六个维度评估其效果,展示LLM在提升CTR和说服性方面的贡献,并提出决策框架以指导LLM生成的应用。

Comments 17 pages, 1 figure, 7 tables. Code available at https://github.com/ndagrawal/LLMNotificationComposition

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10102 2026-05-19 cs.IR cs.AI cs.CL 87%

Trustworthiness in Retrieval-Augmented Generation Systems: A Survey

检索增强生成系统中的可信度:综述

Yujia Zhou, Wenbo Zhang, Jingying Shao, Yan Liu, Xiaoxi Li, Jiajie Jin, Hongjin Qian, Zheng Liu, Chaozhuo Li, Jason Chen Zhang, Zhicheng Dou, Philip S. Yu, Jiaxin Mao

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Hong Kong Polytechnic University(香港理工大学) Microsoft Research Asia(微软亚洲研究院) University of Illinois(伊利诺伊大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了检索增强生成系统中可信度的关键维度,提出Trust-RAG Compass框架,评估事实性、鲁棒性等六个方面,并建立评估基准,揭示不同LLM在可信度方面的性能差异,指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18144 2026-05-19 cs.AI 86%

Evidence-Grounded Frontier Mapping and Agentic Hypothesis Generation in Nanomedicine

基于证据的前沿映射与代理假设生成在纳米医学中

Christiaan G. A. Viviers, Koen de Bruin, Mirre M. Trines, Ayla M. Hokke, Roy van der Meel, Avi Schroeder, Twan Lammers, Willem J. M. Mulder, Fons van der Sommen

机构 * ARIA Lab, Signal Processing Systems, Department of Electrical Engineering, Eindhoven University of Technology(ARIA实验室,信号处理系统,电气工程系,埃因霍温理工大学) Laboratory of Chemical Biology, Department of Biomedical Engineering, Eindhoven University of Technology(化学生物学实验室,生物医学工程系,埃因霍温理工大学) The Louis Family Laboratory for Targeted Drug Delivery and Personalized Medicine Technologies, Department of Chemical Engineering, Technion - Israel Institute of Technology(定向药物输送与个性化医学技术实验室,化学工程系,技术离子-以色列理工学院) Department of Nanomedicine and Theranostics, Institute for Experimental Molecular Imaging (ExMI), RWTH Aachen University Hospital(纳米医学与诊疗学系,实验分子成像研究所(ExMI),亚琛工业大学医院) Department of Internal Medicine and Radboud Center for Infectious Diseases (RCI), Radboud University Medical Center(内科学系和Radboud感染疾病中心(RCI),Radboud大学医学中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出了一种结合文章嵌入、相似性图分析、稀疏前沿提取、结构化证据包检索和审计过的大型语言模型(LLM)工作流的系统pArticleMap,用于支持纳米医学研究方向的选择和假设生成,通过生成和评分基于引用的假设,实现了证据导向的研究辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16881 2026-05-19 cs.CL 86%

PaliBench: A Multi-Reference Blueprint for Classical Language Translation Benchmarks

PaliBench: 一种多参考框架用于经典语言翻译基准测试

Máté Metzger, Nadnapang Phophichit

机构 * Independent Researcher(独立研究者) International Buddhist Studies College(国际佛教研究学院) Mahachulalongkornrajavidyalaya University(玛哈切通拉翁皇家师范大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PaliBench,一种用于巴利语到英语翻译的基准测试,以及构建多参考翻译基准测试的方法,通过结合LLM辅助对齐、自动化验证、质量过滤、去重和多指标评估,生成包含1700段文本、8389个段落和约345,000个token的基准测试数据集,评估了十个现代大语言模型的性能。

Comments Preprint. This manuscript has not yet been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18660 2026-05-19 cs.HC 86%

Evaluating Multi-turn Human-AI Interaction

评估多轮人机交互

Shi Ding, Sijian Tan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了当前NLP评估方法的局限性,提出TCR框架用于评估人机交互,强调透明性、一致性和细化等维度,通过结构化评估提示和示例展示如何补充聚合指标和LLM作为评判者的方法。

Comments ACL 2026 EvalEval Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17892 2026-05-19 cs.AR 86%

CPPL: A Circuit Prompt Programming Language

CPPL:一种电路提示编程语言

Shuo Yin, Yihe Wang, Lancheng Zou, Xufeng Yao, Tinghuan Chen, Chen Bai, Zhengrong Wang, Tsung-Yi Ho, Bei Yu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CPPL,一种通过编译器中介的硬件设计框架,将LLM辅助的硬件生成转化为可静态检查的前端问题,从而提高硬件设计的可靠性、可分析性和后端优化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏