arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1309 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1309 篇

2606.00152 2026-08-07 cs.CR cs.AI 版本更新 90%

PrivacyPeek: Auditing What LLM-Based Agents Acquire, Not Just What They Say

PrivacyPeek: 审计基于LLM的智能体获取了什么,而不仅仅是它们说了什么

Mingxuan Zhang, Jiahui Han, Dadi Guo, Songze Li, Guanchu Wang, Na Zou, Dongrui Liu, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Southeast University(东南大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PrivacyPeek基准,通过检查工具调用轨迹和探针诱导,评估基于LLM的智能体在获取阶段不必要的敏感信息泄露,发现该问题普遍存在且现有防御效果有限。

Comments 21 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00737 2026-08-07 cs.AI 版本更新 90%

To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling

调用还是不调用:评估和优化LLM工具调用的框架

Qinyuan Wu, Soumi Das, Mahsa Amani, Arijit Nag, Seungeon Lee, Krishna P. Gummadi, Abhilasha Ravichander, Muhammad Bilal Zafar

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Ruhr University Bochum(博德姆鲁尔大学) UAR RC Trust(UAR RC信托)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一个基于决策理论的框架,从必要性、效用和可负担性三个关键因素评估LLM的网页搜索工具调用决策,并训练轻量级估计器优化调用,提升任务性能。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08091 2026-08-04 cs.CL 版本更新 90%

Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization

迈向鲁棒的基于大语言模型的裁判:偏见评估与去偏优化

Hongli Zhou, Hui Huang, Rui Zhang, Kehai Chen, Bing Xu, Conghui Zhu, Tiejun Zhao, Muyun Yang

机构 * Hongli Zhou(哈尔滨工业大学) Hui Huang(哈尔滨工业大学) Rui Zhang(哈尔滨工业大学) Kehai Chen(哈尔滨工业大学) Bing Xu(哈尔滨工业大学) Conghui Zhu(哈尔滨工业大学) Tiejun Zhao(哈尔滨工业大学) Muyun Yang(哈尔滨工业大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出JudgeBiasBench,通过系统量化LLM裁判偏见,提出偏见感知训练方法,减少偏见并保持评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13317 2026-07-30 cs.CL 版本更新 90%

SkillCAT: Contrastive, Assessment-Augmented and Topology-AwareSkill Self-Evolution for LLM Agents

SkillCAT: 面向LLM智能体的对比评估与拓扑感知技能自进化

Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Fudan University(复旦大学计算机学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SkillCAT框架,通过对比因果提取、评估增强进化和拓扑感知任务执行三阶段,实现无需训练的LLM智能体技能自进化,在多个基准上平均提升高达40.40%。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11325 2026-07-30 cs.IR cs.AI 版本更新 90%

Structured Belief State and the First Precision-Aware Benchmark for LLM Memory Retrieval

结构化信念状态与首个面向LLM记忆检索的精度感知基准

Jeffrey Flynt

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对现有LLM记忆系统基准仅评估答案质量而忽略检索精度的问题,提出独立于生成模型的检索精度基准PrecisionMemBench和结构化信念存储系统Tenure,实现89/89测试案例通过且平均精度1.0。

Comments v4 removes duplicate prose and adds external adoption

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06616 2026-07-27 cs.CL 版本更新 90%

Interpretable Depression Detection from Social Media Text Using LLM-Derived Embeddings

使用基于大语言模型的嵌入从社交媒体文本中进行可解释的抑郁症检测

Samuel Kim, Oghenemaro Imieye, Yunting Yin

机构 * Earlham College(埃尔哈姆学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究利用大语言模型和传统机器学习分类器,针对社交媒体文本进行三项心理健康预测任务。通过多数据集五折交叉验证实验发现,零样本LLMs在二元抑郁分类表现好,细粒度严重程度预测差;基于LLM摘要嵌入的监督模型性能更优,为构建有效可解释评估系统提供方向。

Comments This version of the contribution has been accepted for publication at ICAI 2026, after peer review but is not the Version of Record and does not reflect post-acceptance improvements, or any corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20324 2026-07-22 cs.MA cs.AI 版本更新 90%

When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines

当代理人意见不一致:多代理LLM流水线中的选择瓶颈

Artem Maryanskyy, Dmitry Budnikov, Alibek T. Kaliyev

机构 * Uber

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究多代理LLM流水线中团队多样性对输出质量的影响,提出选择瓶颈概念,通过数学公式确定多样性帮助或损害的临界点,并通过实验验证选择机制的重要性。

Comments v2: Updated author list to match the published version. Published in Applied Sciences (MDPI) 2026, DOI: 10.3390/app1010000

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06820 2026-07-21 cs.AI 版本更新 90%

When Direct Prediction Fails: Evidence from LLM-Based Misinformation Risk Evaluation

超越表面判断:LLM生成虚假信息的人类基础风险评估

Zonghuan Xu, Xiang Zheng, Yutao Wu, Xingjun Ma

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) City University of Hong Kong(香港城市大学) Deakin University(迪肯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究LLM生成虚假信息的风险评估,发现LLM法官在整体评分、项目排序和信号依赖上与人类存在显著差异,且法官间一致性高于人类读者,表明内部一致性不能作为读者反应代理的有效证据。

Comments 9 pages, 1 figure. Substantially revised and reorganized version of arXiv:2604.06820 based on the same study and data; adds stricter participant filtering, held-out prediction analyses, and additional robustness checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25031 2026-07-17 cs.AI 版本更新 90%

From Stateless to Situated: Building a Psychological World for LLM-Based Agents

从无状态到情境化:构建基于LLM的情感支持心理世界

Boning Zhao, Yutong Hu, Xinnuo Li

机构 * Tandon School of Engineering New York University New York, USA College of Arts \& Science New York University New York, USA

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LEKIA 2.0架构,通过分离认知层与执行层,构建可持续更新的情境结构,提升多轮交互中的稳定性与可控性,实现31%的改进。

Comments Accepted by WAICA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01311 2026-07-15 cs.CL 版本更新 90%

Catalyst-Agent: Autonomous heterogeneous catalyst screening with an LLM Agent

Catalyst-Agent:基于LLM Agent的自主异质催化剂筛选

Achuth Chandrasekhar, Janghoon Ock, Amir Barati Farimani

机构 * Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学机械工程系,匹兹堡,PA 15213,USA) Department of Chemical and Biomolecular Engineering, University of Nebraska--Lincoln, Lincoln, NE 68588, USA(内布拉斯加大学林肯分校化学与生物分子工程系,林肯,NE 68588,USA)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出Catalyst-Agent,一种基于MCP服务器和LLM的AI代理,通过OPTIMADE API探索材料数据库、利用UMA模型计算吸附能,实现闭环自主催化剂筛选,在ORR、NRR和CO2RR反应中成功率达33-41%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08359 2026-07-14 cs.CL 版本更新 90%

REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering

REAL:在语言模型引导中读取Transformer激活以进行精确定位

Li-Ming Zhan, Bo Liu, Chengqiang Xie, Jiannong Cao, Xiao-Ming Wu

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究旨在在不改变LLM参数的情况下引导其响应,核心挑战是识别关键内部模块。提出REAL框架,通过训练VQ - AE划分潜在空间,量化模块行为相关性来指导模块选择与引导强度。实验表明该方法能有效干预,提升真实性引导效果且具零样本泛化能力。

Comments need full paper rebuilding

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17476 2026-07-09 cs.CL 版本更新 90%

Zoom In Disparities in Healthcare LLM Q&A

放大医疗保健语言模型问答中的差异

Ipek Baris Schlicht, Burcu Sayin, Zhixue Zhao, Frederik M. Labonté, Cesare Barbera, Marco Viviani, Paolo Rosso, Lucie Flek

机构 * Universitat Politècnica de València(瓦伦西亚理工大学) University of Trento(特伦托大学) University of Sheffield(谢菲尔德大学) Bonn-Aachen International Center for Information Technology, University of Bonn(波恩-亚琛信息科技国际中心,波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) University of Pisa(比萨大学) University of Milano-Bicocca(米兰-比可卡大学) ValgrAI Valencian Graduate School and Research Network of Artificial Intelligence(瓦伦西亚人工智能研究生学校和研究网络)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多语言医疗保健问答中LLM的跨语言差异,构建多语言数据集,分析覆盖范围与响应对齐,通过案例研究发现差异显著,非英语维基百科上下文摘录可改善事实对齐,为构建公平多语言医疗AI系统提供途径。

Comments It is accepted to NLDB 2026: The paper can be accessed at https://link.springer.com/chapter/10.1007/978-3-032-29532-3_12

Journal ref NLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02509 2026-07-07 cs.CL 版本更新 90%

When Rating Scales Fall Short: LLM-Assisted Discovery of ADHD Signals in Turkish Teacher Narratives

当评分量表不足时:LLM辅助发现土耳其教师叙述中的ADHD信号

Baris Karacan, Irem Aktar Songur, Ahmet Ozaslan, Elvan Iseri

机构 * Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系) Department of Child and Adolescent Psychiatry, Gazi University(加齐大学儿童与青少年精神病学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过分析土耳其教师评估表中的结构化评分和开放式叙述,利用大语言模型辅助的主题发现方法,揭示了叙述文本中未被结构化量表捕捉的ADHD互补信号。

Comments 15 pages. Accepted to CLPsych 2026. Camera-ready author version. The final version will appear in the ACL Anthology

Journal ref In Proceedings of the 10th Workshop on Computational Linguistics and Clinical Psychology (CLPsych 2026), pages 368-382, San Diego, California, USA, 2026. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27898 2026-07-03 cs.AI 版本更新 90%

A Unified Framework for the Evaluation of LLM Agentic Capabilities

LLM 代理能力评估的统一框架

Pengyu Zhu, Lijun Li, Yaxing Lyu, Qianxin Luo, Jingyi Yang, Yi Liu, Tingfeng Hui, Xinyu Yuan, Li Sun, Sen Su, Jing Shao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chongqing University of Posts and Telecommunications(重庆邮电大学) North China Electric Power University(华北电力大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一个统一框架,通过标准化配置、固定 ReAct 架构和离线设置,分离框架与环境效应,实现 LLM 代理能力的公平评估,并在 7 个基准、24 个领域、15 个模型上进行了大规模实证分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00804 2026-06-25 cs.CR cs.AI cs.DB 版本更新 90%

Epistemic Bias Injection: Manipulating LLM Opinion via Selective Context Retrieval

认知偏见注入:通过选择性上下文检索操纵LLM观点

Hao Wu, Prateek Saxena

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究通过检索增强生成(RAG)数据库注入事实正确但认知偏见的段落,以操纵LLM输出立场,并提出基于几何度量的攻击与防御方法BiasDef。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16131 2026-06-24 cs.CL 版本更新 90%

SciZoom: A Large-scale Benchmark for Hierarchical Scientific Summarization across the LLM Era

SciZoom:面向LLM时代的大规模层次化科学摘要基准

Han Jang, Junhyeok Lee, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University Hospital(首尔国立大学医院) Seoul National University College of Medicine(首尔国立大学医学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 针对LLM时代科学摘要的多粒度需求,构建了包含2020-2025年四大ML顶会44946篇论文的基准,提供摘要、贡献和TL;DR三层摘要,压缩比达600:1,并揭示LLM辅助写作导致短语模式剧变和修辞风格同质化。

Comments 14 pages, 8 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21438 2026-06-23 cs.CL 版本更新 90%

PROMPT2BOX: Uncovering Entailment Structure among LLM Prompts

PROMPT2BOX: 揭示LLM提示间的蕴含结构

Neeladri Bhuiya, Shib Sankar Dasgupta, Andrew McCallum, Haw-Shiuan Chang

机构 * CICS, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校计算机信息科学中心) Amazon AWS AI(亚马逊AWS人工智能) A10 Networks(A10网络)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出PROMPT2BOX方法,通过盒嵌入空间捕捉提示间的特异性关系,并开发降维技术,在层次聚类中比向量基线多发现8.9%的LLM弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08552 2026-06-19 cs.DB cs.AI 版本更新 90%

Automated Standardization of Legacy Biomedical Metadata Using an Ontology-Constrained LLM Agent

使用本体约束的LLM代理自动化标准化遗留生物医学元数据

Josef Hardi, Martin J. O'Connor, Marcos Martinez-Romero, Jean G. Rosario, Stephen A. Fisher, Mark A. Musen

机构 * Division of Computational Medicine, Stanford University(斯坦福大学计算医学部) Department of Biology, University of Pennsylvania(宾夕法尼亚大学生物学系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出基于LLM的元数据标准化系统,通过实时查询标准指南和本体服务,在839条HuBMAP记录上验证,相比纯LLM方法显著提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25652 2026-06-17 cs.CL cs.CY 版本更新 90%

A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays

LLM评审员与律师协会考官对泰国律师资格考试自由回答论文的两阶段稳定性研究

Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot, Sarana Nutanong

机构 * VISAI AI(VISAI人工智能)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 通过泰国律师资格考试的自由回答论文评估,研究LLM评审员与人类考官在评分一致性上的不对称性,发现LLM评审员倾向于多数人类阅读而无法复制少数人类阅读。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04574 2026-06-17 cs.CL 版本更新 90%

FeedEval: Pedagogically Aligned Evaluation of LLM-Generated Essay Feedback

FeedEval: 面向教学法的LLM生成作文反馈评估

Seongyeub Chu, Jongwoo Kim, Munyong Yi

机构 * Graduate School of Data Science, KAIST(数据科学研究生院,韩国科学技术院) Department of Industrial & Systems Engineering, KAIST(工业与系统工程系,韩国科学技术院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出FeedEval框架,沿特异性、帮助性和有效性三个教学维度评估LLM生成的作文反馈,通过专用评估器筛选高质量反馈,提升下游评分和修订效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18003 2026-06-17 cs.CR cs.AI cs.CY 版本更新 90%

BadScientist: Can a Research Agent Write Convincing but Unsound Papers that Fool LLM Reviewers?

BadScientist: 研究代理能否写出令人信服但不严谨的论文来欺骗LLM审稿人?

Fengqing Jiang, Yichen Feng, Yuetai Li, Luyao Niu, Basel Alomair, Radha Poovendran

机构 * University of Washington(华盛顿大学) King Abdulaziz City for Science and Technology(卡布斯科学与技术城) HUMAIN

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出BadScientist框架,通过无需真实实验的呈现操纵策略生成造假论文,揭示LLM审稿系统存在系统性漏洞,造假论文接受率高达一定水平,且审稿人存在“担忧-接受冲突”,当前检测方法效果有限。

Comments ACL 2026; Project Page at https://bad-scientist.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19937 2026-06-17 cs.CL cs.SD eess.AS 版本更新 90%

ALAS: An Automatic Latent Alignment Score for Audio Language Models

ALAS:音频语言模型的自动潜在对齐分数

Pooneh Mousavi, Yingzhi Wang, Mirco Ravanelli, Cem Subakan

机构 * Concordia University(Concordia 大学) Mila-Quebec AI Institute(Mila-Quebec 人工智能研究所) Centrale Supelec(Centrale Supelec 研究院) Laval University(Laval 大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 提出ALAS指标,通过计算音频与文本表示的跨模态余弦相似度,无需训练即可评估语音-LLM的音频-文本对齐质量,揭示模型对齐深度与任务需求的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01365 2026-06-16 cs.AI 版本更新 90%

Early Diagnosis of Wasted Computation in Multi-Agent LLM Systems via Failure-Aware Observability

多智能体LLM系统中浪费计算资源的早期诊断:基于故障感知的可观测性

Xianyou Li, Weiran Yan, Yichao Wu, Penghao Liang, Mengwei Yuan, Jianan Liu, Jing Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种故障感知的可观测性框架,通过在线轨迹信号诊断多智能体LLM系统中的浪费计算,并在GAIA验证集上评估,揭示不同故障机制及其与资源消耗的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06143 2026-06-16 cs.CL 版本更新 90%

RoSE: Round-robin Synthetic Data Evaluation for Selecting LLM Generators without Human Test Sets

RoSE: 循环合成数据评估,无需人工测试集选择LLM生成器

Jan Cegin, Branislav Pecher, Ivan Srba, Jakub Simko

机构 * Kempelen Institute of Intelligent Technologies(凯姆佩尔智能技术研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出RoSE方法,通过训练小模型在候选生成器输出上,并在其他LLM合成样本上评估,以选择最佳LLM生成器,无需人工测试集,在多个语言和任务中优于其他内在启发式方法。

Comments 16 pages; EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01463 2026-06-15 cs.RO cs.AI cs.HC 版本更新 90%

Low-Burden LLM-Based Preference Learning: Personalizing Assistive Robots from Natural Language Feedback for Users with Paralysis

基于低负担LLM的偏好学习:通过自然语言反馈为瘫痪用户个性化辅助机器人

Keshav Shankar, Dan Ding, Wei Gao

机构 * Electrical and Computer Engineering(电气与计算机工程) Rehabilitation Science and Technology(康复科学与技术)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对严重运动障碍用户,提出一种低负担离线框架,利用大语言模型将非结构化自然语言反馈转化为确定性机器人控制策略,并通过职业治疗框架解码用户需求,显著降低用户负担。

Comments Accepted to IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18636 2026-06-11 cs.SE cs.AI 版本更新 90%

LaQual: An Automated Framework for LLM App Quality Evaluation

LaQual: 一种用于LLM应用质量评估的自动化框架

Yan Wang, Xinyi Hou, Junjun Si, Yanjie Zhao, Weiguo Lin, Haoyu Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出LaQual自动化框架,通过静态指标筛选和动态场景评估,实现LLM应用质量评估,与人类判断高度一致,可减少66.7%-81.3%候选应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21816 2026-06-09 cs.LG 版本更新 90%

Nonparametric LLM Evaluation from Preference Data

基于偏好数据的非参数化LLM评估

Dennis Frauen, Athiya Deviyani, Mihaela van der Schaar, Stefan Feuerriegel

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出非参数统计框架DMLRank,通过去偏机器学习从偏好数据中比较和排名大语言模型,引入广义平均排名分数,具有统计高效、兼容黑箱方法、结合预训练评估器和优化数据收集策略等优势。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04874 2026-06-08 cs.CL 版本更新 90%

Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents

Agent规划基准:LLM Agent规划能力的诊断框架

Haoyu Sun, Wenxuan Wang, Mingyang Song, Jujie He, Weinan Zhang, Yang Liu, Yang Yang, Yu Cheng

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学) Skywork AI University of California, Santa Cruz(加州大学圣克鲁兹分校) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出Agent规划基准(APB),通过4209个多模态案例和五个设置,诊断LLM Agent在长程规划、工具噪声鲁棒性、校准拒绝和推理时改进方面的系统弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01120 2026-06-08 cs.AI 版本更新 90%

Diagnosing LLM Arbitration Behavior over Pre-evidence Epistemic States in RAG-based Fact-Checking

诊断基于RAG的事实核查中LLM对证据前认知状态的仲裁行为

Yuxi Sun, Wenbo Shang, Wei Gao, Xin Huang, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) Singapore Management University(新加坡 Management 大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PAVE测试平台,通过将LLM验证器分为四种认知状态,评估其在检索增强生成事实核查中仲裁参数知识与检索证据的能力,发现不可靠且高度依赖模型的仲裁行为,并提出轻量级JSD测试时仲裁方法。

Comments Accepted to ACL-2026 Findings (voluntarily withdraw)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09403 2026-06-08 cs.CL 版本更新 90%

LLM as a Meta-Judge: Synthetic Data for NLP Evaluation Metric Validation

LLM作为元评判者:用于NLP评估指标验证的合成数据

Lukáš Eigler, Jindřich Libovický, David Hurych

机构 * Faculty of Mathematics and Physics, Charles University(数学与物理系,查尔斯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出LLM作为元评判者框架,通过控制语义退化生成合成数据替代人工判断,验证NLG评估指标,在多语言问答中元相关性超过0.9。

Comments 16 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏