arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-15 至 2026-05-15 共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 79 篇

2509.26100 2026-05-15 cs.AI 90%

AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models

AgenticEval: 向大型语言模型的代理和自演化安全评估迈进

Yixu Wang, Xin Wang, Yang Yao, Xinyuan Li, Xibang Yang, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The University of Hong Kong(香港大学) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI

AI总结 本文提出AgenticEval框架,通过自演化评估流程动态检测LLM安全风险,实验显示模型安全评分随评估强化而下降,揭示静态评估的局限性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08584 2026-05-15 cs.CL 90%

CounselBench: A Large-Scale Expert Evaluation and Adversarial Benchmarking of Large Language Models in Mental Health Question Answering

CounselBench: 一个大规模专家评估和对抗性基准测试,用于评估大型语言模型在心理健康问答中的表现

Yahan Li, Jifan Yao, John Bosco S. Bunyi, Adam C. Frank, Angel Hsing-Chi Hwang, Ruishan Liu

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系) Suzanne Dworak-Peck School of Social Work, University of Southern California(南加州大学苏兹安·德沃拉克-佩克社会工作学院) Department of Psychiatry and the Behavioral Sciences, University of Southern California(南加州大学精神病学与行为科学系) Annenberg School for Communication, University of Southern California(南加州大学安纳伯格通信学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 CounselBench通过100名心理健康专家评估GPT-4、LLaMA 3等模型在真实求助场景中的表现,揭示其在临床敏感性和安全风险方面的不足,并通过对抗性数据集深入分析模型失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14744 2026-05-15 cs.CL cs.AI cs.CY 90%

Mechanical Enforcement for LLM Governance:Evidence of Governance-Task Decoupling in Financial Decision Systems

针对LLM治理的机械执行:在金融决策系统中治理-任务解耦的证据

José Manuel de la Chica Rodríguez, Carlos Martí-González

机构 * Santander AI Lab(Santander AI实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出五种治理指标,用于评估政策在决策理由层面的合规性,并在合成银行领域比较纯文本治理与机械执行的效果,发现机械执行能显著提升决策信息内容和任务准确性,表明治理与任务评估是两个独立的维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14543 2026-05-15 cs.LG cs.AI 90%

RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation

RxEval: 一个处方级基准,用于评估LLM药物推荐

Shuhao Chen, Weisen Jiang, Changmiao Wang, Xiaoqing Wu, Xuanren Shi, Yu Zhang, James T. Kwok

机构 * The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Shenzhen University General Hospital(深圳大学人民医院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 RxEval通过多选题评估LLM处方能力,包含1547个问题,涵盖584名患者、18种诊断类别和969种药物,测试16个LLM显示其挑战性和区分性,F1值从45.18到77.10,最佳精确匹配仅46.10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08522 2026-05-15 cs.CL 90%

Coordinates of Capability: A Unified MTMM-Geometric Framework for LLM Evaluation

能力坐标:一种统一的MTMM-几何框架用于LLM评估

Adib Sakhawat, Tahsin Islam, Takia Farhin, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种统一的MTMM-几何框架,将九种评估指标统一到共享的潜在坐标空间中,通过三个正交维度分析模型能力,提供稳健且经验稳定的基准设计方法。

Comments The paper has mistake of undertaking political spaces to semantic dimensions. This needs to be removed because this is a fetal flaw in consideration. The initial hypothesis and premise needs to be rigorously formulated within the political landscape not generalizing the metrics. Hence a withdrawal for now is necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24586 2026-05-15 cs.SE cs.CL 90%

Comparing Developer and LLM Biases in Code Evaluation

比较开发者与LLM在代码评估中的偏见

Aditya Mittal, Ryan Shar, Zichu Wu, Shyam Agarwal, Tongshuang Wu, Chris Donahue, Ameet Talwalkar, Wayne Chi, Valerie Chen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出TRACE框架,评估LLM在代码评估中的偏见,发现LLM在与开发者偏好对齐方面表现不佳,揭示了人类与模型在代码质量标准上的系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03630 2026-05-15 cs.CL 90%

Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases

推理模型优于LLM-判官,但存在偏见

Hui Huang, Xuanxin Wu, Muyun Yang, Yuki Arase

机构 * Institute of Science Tokyo(东京科学研究院) Harbin Institute of Technology(哈尔滨工业大学) The University of Osaka(大阪大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文系统比较了推理模型在判断任务中的表现,发现其在准确性、指令遵循和抗攻击能力上优于非推理LLM,但存在显著偏见,提出PlanJudge策略以缓解偏见问题。

Comments Accepted by ACL 2026 Workshop EvalEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14312 2026-05-15 cs.SE 89%

Making OpenAPI Documentation Agent-Ready: Detecting Documentation and REST Smells with a Multi-Agent LLM System

使OpenAPI文档具备代理准备性:利用多代理LLM系统检测文档和REST气味

Rayfran Rocha Lima, Davi G. Assunção Pinheiro, Thiago Medeiros de Menezes

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 研究通过多代理LLM系统检测OpenAPI文档和REST相关问题,发现2450个气味,揭示微服务环境中结构有效性不保证语义准备性,推动API治理流程改进。

Comments 10 pages. Accepted in EASE 2026, 9-12 June 2026, Glasgow, Scotland, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13898 2026-05-15 cs.SE 89%

Bidirectional Empowerment of Metamorphic Testing and Large Language Models: A Systematic Survey

双向赋能:变形测试与大语言模型的相互促进:系统综述

Zheng Zheng, Zenghui Zhou, Yinwang Xu, Daixu Ren, Tsong Yueh Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文系统综述了93项研究,探讨变形测试与大语言模型之间的双向赋能关系,提出分类框架,分析其在验证、评估和自动化测试中的应用。

Comments Daixu Ren is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10346 2026-05-15 cs.CL cs.LG 88%

Geometry-Aware Decoding with Wasserstein-Regularized Truncation and Mass Penalties for Large Language Models

具有Wasserstein正则化截断和质量惩罚的几何感知解码

Arash Gholami Davoodi, Navid Rezazadeh, Seyed Pouyan Mousavi Davoudi, Pouya Pezeshkpour

机构 * Carnegie Mellon University(卡内基梅隆大学) Megagon Labs(Megagon实验室) University of California, Irvine(加州大学伊文斯顿分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Top-W解码方法,通过Wasserstein距离保持token嵌入空间几何特性,平衡概率质量与熵,提升大语言模型生成质量与创造力。

Comments 20 pages, 3 figures, 8 tables, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12034 2026-05-15 cs.SE cs.CR 88%

OpDiffer: LLM-Assisted Opcode-Level Differential Testing of Ethereum Virtual Machine

OpDiffer:基于LLM的以太坊虚拟机指令级差分测试

Jie Ma, Ningyu He, Jinwen Xi, Mingzhe Xing, Haoyu Wang, Ying Gao, Yinliang Yue

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 OpDiffer利用LLM和静态分析方法,针对EVM安全测试中的输入多样性不足和无法自动定位bug问题,提出指令级差分测试框架,发现26个未知bug,提升代码覆盖率达71.06%等。

Comments To appear in ISSTA'25

Journal ref Proc. ACM Softw. Eng. 2, ISSTA, Article ISSTA069 (2025), 1559-1582

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05465 2026-05-15 cs.CL 88%

Small Language Models (SLMs) Can Still Pack a Punch: A survey (updated 2026)

小型语言模型 (SLMs) 仍能大放异彩:一篇综述(更新 2026)

Akanksha Gupta, Bijo Thomas, Harshita Asnani, Phanindra Reddy Madduru, Samia Feroze, Shreyas Subramanian, Vikram Elango, Mecit Gungor

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

AI总结 本文综述了160篇论文,探讨小型语言模型在1-80亿参数范围内如何在性能、效率、可扩展性和成本之间取得平衡,展示小型模型可媲美甚至超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23023 2026-05-15 cs.AI 88%

Deceive, Detect, and Disclose: Large Language Models Play Mini-Mafia

欺骗、检测与揭露:大型语言模型扮演迷你黑帮

Davi Bastos Costa, Renato Vicente

机构 * TELUS Digital Research Hub(TELUS数字研究中心) Center for Artificial Intelligence and Machine Learning(人工智能与机器学习中心) Institute of Mathematics, Statistics and Computer Science(数学、统计与计算机科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出迷你黑帮游戏,通过分析语言模型在社交推理中的表现,揭示了模型在欺骗、检测和揭露能力上的差异,并展示了其作为评估语言模型交互能力的基准。

Comments Adds a validation section for the theoretical model and restructures the presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07509 2026-05-15 cs.SE 88%

MASPrism: Lightweight Failure Attribution for Multi-Agent Systems Using Prefill-Stage Signals

MASPrism:基于预填充阶段信号的轻量级多智能体系统故障归因

Yang Liu, Hongjiang Feng, Junsong Pu, Zhuangbin Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);language model(abstract);small language model(abstract)

AI总结 本文提出MASPrism,通过预填充阶段信号实现多智能体系统故障归因,利用小型语言模型提取负对数似然和注意力权重,提升故障源识别效率,实验显示在Who&When和TRAIL数据集上性能优异,速度提升显著。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14537 2026-05-15 cs.AI 87%

Cattle Trade: A Multi-Agent Benchmark for LLM Bluffing, Bidding, and Bargaining

牛市交易:一种多智能体基准,用于评估大语言模型在战略推理、对抗互动和资源约束下的表现

Robert Müller, Clemens Müller

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Cattle Trade基准,用于评估大语言模型在多智能体经济游戏中整合战略推理、对抗互动和资源分配的能力,揭示了智能体在资源管理与对抗策略中的表现差异。

Comments malgai workshop at iclr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14153 2026-05-15 cs.CR cs.AI 87%

ExploitBench: A Capability Ladder Benchmark for LLM Cybersecurity Agents

ExploitBench: 一个用于LLM网络安全代理的能力阶梯基准

Seunghyun Lee, David Brumley

机构 * Carnegie Mellon University(卡内基梅隆大学) Bugcrowd

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 ExploitBench通过16个可测量标志分解exploitation过程,评估模型在网络安全任务中的能力差异,揭示了公开部署模型与私有模型在exploitation能力上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13940 2026-05-15 cs.CR cs.AI 86%

AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills

AgentTrap: 评估LLM代理在第三方技能中抵御恶意运行行为的能力

Haomin Zhuang, Hanwen Xing, Yujun Zhou, Yuchen Ma, Yue Huang, Yili Shen, Yufei Han, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Southern California(南加州大学) LMU Munich(慕尼黑大学) Inria, France(法国国家信息与自动化技术研究院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 AgentTrap通过141个任务评估LLM代理在使用第三方技能时抵御恶意行为的能力,发现最关键的失败并非简单劫持,而是模型在完成用户任务时将不安全副作用视为正常流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15015 2026-05-15 cs.AI cs.CL cs.HC 86%

Small, Private Language Models as Teammates for Educational Assessment Design

小型私有语言模型作为教育评估设计的队友

Chris Davis Jaldi, Anmol Saini, Shan Zhang, Noah Schroeder, Cogan Shimizu, Eleni Ilkou

机构 * Wright State University(怀特州立大学) University of Florida(佛罗里达大学) TIB – Leibniz Information Centre for Science and Technology(莱布尼茨信息科学与技术研究中心)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究小型语言模型在教育评估设计中的有效性,通过对比大型语言模型和小型语言模型,评估生成质量并分析可靠性,发现小型模型在隐私和资源限制下表现优异,但模型评估仍存在系统性偏差,强调需引入人类在循环机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14679 2026-05-15 cs.CL cs.AI 86%

AI-assisted cultural heritage dissemination: Comparing NMT and glossary-augmented LLM translation in rock art documents

人工智能辅助文化遗产传播:比较NMT和术语增强大语言模型在岩画文档中的翻译

Vicent Briva-Iglesias, María Ferre-Fernández

机构 * Dublin City University(都柏林城市大学) CTTS(文化传承研究所) ADAPT Centre(适应中心) SALIS Universidad de Almería(阿尔梅里亚大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了NMT和术语增强大语言模型在岩画文档翻译中的表现,发现术语增强方法在术语准确性上更优,且在保持整体质量方面表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14120 2026-05-15 cs.LG cs.CL 86%

Mini-JEPA Foundation Model Fleet Enables Agentic Hydrologic Intelligence

Mini-JEPA基础模型舰队实现智能水文智能

Mashrekur Rahman

机构 * Dartmouth Libraries, Dartmouth College(达特茅斯图书馆,达特茅斯大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出Mini-JEPA基础模型舰队,通过路由代理为特定问题选择传感器,提升水文分析精度,实验显示其在土壤湿度、干旱和降水预测中优于AlphaEarth。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14932 2026-05-15 cs.CR 86%

Toward Securing AI Agents Like Operating Systems

向操作系统一样安全地保护AI代理

Lukas Pirch, Micha Horlboge, Patrick Großmann, Syeda Mahnur Asif, Klim Kireev, Thorsten Holz, Konrad Rieck

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过操作系统视角研究LLM代理的安全性,分析了现有开源代理的攻击面,并提出安全设计建议。

Comments 17 pages, under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12772 2026-05-15 cs.MM cs.CV 86%

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

JointAVBench: 一个用于联合音频视觉推理评估的基准测试

Jianghan Chao, Jianzhang Gao, Wenhui Tan, Yuchong Sun, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学香樟人工智能学院) Baichuan Inc(百川科技)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文提出JointAVBench基准测试,旨在评估多模态大语言模型在联合音频视觉推理中的表现,涵盖多模态依赖、多类音频信息和不同场景跨度,通过自动化流程生成问题并评估不同模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14761 2026-05-15 cs.AI cs.HC 85%

AI Outperforms Humans in Personalized Image Aesthetics Assessment via LLM-Based Interviews and Semantic Feature Extraction

人工智能在基于大语言模型的访谈和语义特征提取的个性化图像审美评估中胜过人类

Yoshia Abe, Tatsuya Daikoku, Yasuo Kuniyoshi

机构 * Graduate School of Information Science and Technology(信息科学与技术研究生院) The University of Tokyo(东京大学) Bunkyo-ku, Tokyo(东京都文京区)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合深度学习与大语言模型的系统,通过语义特征提取和主动收集偏好信息,准确预测个体图像审美评价,实验表明该系统在高评分图像上表现优异,优于人类预测者和自身再评估。

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09027 2026-05-15 cs.CL cs.AI cs.LG cs.MA 85%

GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives

GAMBIT:多智能体LLM集体中对抗鲁棒性的三模式基准

Alexandre Le Mercier, Chris Develder, Thomas Demeester

机构 * IDLab–T2K, Ghent University–imec(IDLab–T2K,根特大学–imec)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 GAMBIT是首个多智能体对抗鲁棒性基准,通过三模式评估和两个独立评分,测试在适应性对抗者下的 impostor 检测器性能,展示了零样本评估的误导性及快速 recalibration 方法的重要性。

Comments 46 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23477 2026-05-15 cs.CL 84%

MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring

MMTutorBench:首个多模态AI数学辅导基准

Tengchao Yang, Sichen Guo, Mengzhao Jia, Jiaming Su, Yuanyang Liu, Zhihan Zhang, Meng Jiang

机构 * Tongji University(同济大学) Fudan University(复旦大学) University of Notre Dame(圣母大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 MMTutorBench首次提出多模态AI数学辅导基准,包含685个围绕教学关键步骤构建的问题,通过六维度细粒度评估和三个任务(洞察发现、操作构建、操作执行)评估12个顶级MLLMs,揭示了专有与开源系统间的性能差异及OCR、少样本提示等对辅导质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14034 2026-05-15 cs.AI cs.CL cs.CY 84%

From Descriptive to Prescriptive: Uncover the Social Value Alignment of LLM-based Agents

从描述性到规范性:揭示基于大语言模型的智能体的社会价值对齐

Jinxian Qu, Qingqing Gu, Teng Chen, Luo Ji

机构 * Geely AI Lab(Geely人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于价值的框架,利用GraphRAG将原则转化为价值指令,通过检索合适指令引导智能体行为,基于马斯洛需求层次和普鲁奇克情感轮理论评估预期行为,实验显示在DAILYDILEMMAS基准上优于基线方法。

Comments Accepted by CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13858 2026-05-15 cs.NE cs.CL cs.LG 84%

A Hormone-inspired Emotion Layer for Transformer language models (HELT)

一种受激素启发的情感层用于Transformer语言模型(HELT)

Eslam Reda, Sara El-Metwally

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出HELT,通过生物启发的激素情感模块增强Transformer模型,以模拟人类情感处理。通过六种连续激素值模拟,提升模型对情感上下文的响应能力,实验表明在情感准确性与同理质量上优于基线模型。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14418 2026-05-15 cs.CR cs.AI 83%

The Great Pretender: A Stochasticity Problem in LLM Jailbreak

伟大的伪装者:大语言模型 jailbreak 中的一个随机性问题

Jean-Philippe Monteuuis, Cong Chen, Jonathan Petit

机构 * Core contributors(核心贡献者)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文研究了大语言模型 jailbreak 中随机性对攻击成功率的影响,提出新的评估和生成框架,发现攻击成功率存在不稳定性且易被高估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01847 2026-05-15 cs.AI 83%

NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles

NeuroState-Bench:一个用于LLM代理配置承诺完整性的校准基准

Xiao Jia

机构 * School of Artificial Intelligence(人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 NeuroState-Bench通过定义的侧查询探针而非隐激活来操作承诺完整性,包含144个确定性任务和306个侧查询探针,通过人类校准验证任务成功与承诺完整性之间的差异。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09246 2026-05-15 cs.IR cs.AI cs.CL 82%

Autofocus Retrieval: An Effective Pipeline for Multi-Hop Question Answering With Semi-Structured Knowledge

自动聚焦检索:一种基于半结构化知识的多跳问答有效流程

Derian Boer, Stephen Roth, Stefan Kramer

机构 * Institute of Computer Science(计算机科学研究所) Johannes Gutenberg University Mainz(美因茨约翰内斯·古腾堡大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Autofocus-Retriever框架,通过结合结构和文本检索方法,在三个STaRK问答基准测试中取得最佳零样本和一次样本结果,其性能由四个约束驱动检索步骤和四个补充处理步骤驱动。

Journal ref Transactions on Machine Learning Research 2026

详情

展开后加载摘要…

URL PDF HTML 收藏