arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-29 至 2026-05-29 共收录 125 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 125 篇

2602.16610 2026-05-29 cs.CL cs.AI cs.LG 92%

Who can we trust? LLM-as-a-jury for Comparative Assessment

我们该信任谁?LLM作为陪审团进行比较评估

Mengjie Qian, Guangzhi Sun, Mark J. F. Gales, Kate M. Knill

机构 * Department of Engineering, University of Cambridge, UK(剑桥大学工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM作为评估者时判断不一致和可靠性差异的问题,提出BT-sigma模型,通过引入判别参数联合推断项目排名和法官可靠性,优于平均聚合方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08654 2026-05-29 cs.CL cs.AI cs.LG 92%

From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

从评分标准到可靠分数:基于证据的文本评估与LLM裁判

Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Arizona State University(亚利桑那州立大学) Florida State University(佛罗里达州立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Rulers框架,通过三阶段推理(任务规范、结构化执行、事后校准)解决LLM在基于评分标准的文本评估中的执行漂移、归因不可验证和人类尺度错位问题,实现更可靠的评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29791 2026-05-29 cs.CL 92%

ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation

ActTraitBench: 通过人类行为验证量化大型语言模型中的知识-决策差距

Yutong Yang, Chenxi Miao, Weikang Li, Yunfang Wu

机构 * Peking University(北京大学) Baidu Inc(百度公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出ActTraitBench框架,基于人类数据建立心理测量方面与行为范式的一一映射,并通过分位数映射校准LLM评分分布,揭示LLM在自我报告与行为决策之间的知识-决策差距,并引入CoCA干预来缓解该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29667 2026-05-29 cs.CL 92%

Beyond English and Evasion: A Human-Annotated Multi-Domain Benchmark for High-Stakes LLM Safety Evaluation in Chinese

超越英语与规避:用于高风险LLM中文安全评估的人工标注多领域基准

Wajdi Zaghouani, Kholoud K. Aldous, Yicheng Gao

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract,journal_ref);language model(abstract,journal_ref);分类 cs.CL

AI总结 针对LLM在中文环境下安全系统失效的问题,构建了包含1,897个对抗性提示的人工标注基准ChiSafe-PAS,覆盖四个高风险领域,并提供完整标注以评估模型安全对齐。

Journal ref Proceedings of The fourth international workshop on the role of resources in the age of large language models RESOURCEFUL-2026 at LREC 2026, Palma de Mallorca, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29224 2026-05-29 cs.CL cs.AI cs.CR 92%

Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents

相关性即漏洞:网络检索如何削弱LLM智能体的安全对齐

Aditya Nawal, Manit Baser, Mohan Gurusamy

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AgentREVEAL框架,分析检索集成方式和内容属性如何导致LLM智能体安全退化,发现相关性是共同激活条件,并引入HarmURLBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30200 2026-05-29 cs.AI 92%

Double-Edged Sword or Sharp Tool? Designing and Evaluating Triadic LLM-Teacher Collaboration for K-12 Writing at Scale

双刃剑还是利器?设计与评估面向K-12写作规模化的三元LLM-教师协作

Canran Wang, Yuwen Yang, Zhen Wang, Ming Ma, Ding Yu, Chentai Wang, Keman Huang, Xiaoyong Du

机构 * Renmin University of China(中国人民大学) Central University of Finance and Economics(中央财经大学) Beijing HQ Intelligent Technology, Ltd.(北京HQ智能科技有限公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过开发一个三元协作系统,结合系统功能语言学与建议轨迹追踪管道,基于包含57,954篇作文的大规模实证数据,验证了LLM作为生成引擎、教师作为教学把关者的分工策略能有效提升写作质量,并发现语言扩展存在边际效用递减的天花板效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30103 2026-05-29 cs.LG 92%

Convergence Theory for Iterative LLM-Based Neural Architecture Search: A Parametric Cross-Entropy Framework with Closed-Form Proxy Reliability

基于迭代式LLM的神经架构搜索的收敛理论:一个具有闭式代理可靠性的参数化交叉熵框架

Santosh Premi Adhikari, Radu Timofte, Dmitry Ignatov

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 将迭代式LLM-NAS建模为参数化交叉熵方法,证明了收敛性、精英集概率几何收敛、增量生成有效性、MinHash-Jaccard去重防止模式崩溃以及代理可靠性闭式公式,并通过实验验证了理论预测。

Comments 14 pages, 2 figures, 2 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28966 2026-05-29 cs.CL cs.HC 92%

The Trust Paradox: How CS Researchers Engage LLM Leaderboards

信任悖论:CS研究人员如何使用LLM排行榜

Pouya Sadeghi, Anamaria Crisan, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过半结构化访谈,揭示计算机科学领域研究人员对LLM排行榜普遍存在“实用怀疑”矛盾态度,并基于发现提出设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24562 2026-05-29 cs.CL 92%

HaluNet: Learning Hallucination Risk from Internal Signals in LLM Question Answering

HaluNet:从LLM问答内部信号学习幻觉风险

Chaodong Tong, Qi Zhang, Zhuojun Jiang, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) China Industrial Control Systems Cyber Emergency Response Team(中国工业控制系统网络应急响应团队)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出HaluNet,利用单次生成的内部信号(token似然、预测熵和隐藏状态)估计答案级幻觉风险,通过LLM-as-a-Judge弱监督训练,在多个QA数据集上显著提升风险排序和错误检测率。

Comments 16 pages, 12 tables, and 11 figures. This version includes a major revision of the manuscript and updates the author list with the consent of all involved authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23573 2026-05-29 cs.CR cs.AI 92%

Uncovering Vulnerabilities of LLM-Assisted Cyber Threat Intelligence

揭示LLM辅助网络威胁情报中的脆弱性

Yuqiao Meng, Luoxi Tang, Feiyang Yu, Jinyuan Jia, Guanhua Yan, Ping Yang, Zhaohan Xi

机构 * Binghamton University(宾夕法尼亚州立大学) Duke University(杜克大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过人机协同分类框架,识别并验证了LLM在CTI推理中的三种领域特定认知失败模式(虚假关联、矛盾知识和受限泛化),并证明针对性防御可显著降低失败率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28848 2026-05-29 cs.CL cs.AI 91%

GPF-LiveNews: A Streaming Evaluation Protocol for Group-Conditioned Framing in Large Language Models

GPF-LiveNews: 大型语言模型中群体条件框架的流式评估协议

Mohd Ariful Haque, Fahad Rahman, Kishor Datta Gupta, Roy George

机构 * Clark Atlanta University(克拉克阿特兰大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 提出GPF-LiveNews流式评估协议,通过实时新闻锚点与身份标签组合,检测LLM输出中针对不同受众的语义敏感性和情感差异,用于审计群体条件框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29293 2026-05-29 cs.MA 91%

LLM-ALSO: LLM-Driven Adaptive Learning-Signal Optimization for Multi-Agent Reinforcement Learning

LLM-ALSO:基于大语言模型驱动的自适应学习信号优化用于多智能体强化学习

Xiaoguang Wu, Zhi Zheng, Hui Xiong

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对稀疏奖励下多智能体强化学习协调困难的问题,提出LLM-ALSO框架,通过迭代诊断、提议和验证机制利用大语言模型自适应优化奖励塑形配置,提升学习效率与性能。

Comments 14 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29815 2026-05-29 cs.AI cs.CL 91%

PRAIB: Peer Review AI Benchmark of Behaviour of LLM-Assisted Reviewing

PRAIB: 大语言模型辅助审稿行为的同行评审AI基准

Krzysztof Żurawicki, Julia Farganus, Arkadiusz Gaweł, Mateusz Bystroński, Tomasz Jan Kajdanowicz

机构 * Department of Artificial Intelligence(人工智能系)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出PRAIB框架,通过定义审稿特异性、风格和参与行为的指标,并基于11000条机器生成审稿与人类审稿的对比实验,揭示LLM审稿在评分、交叉引用和弱点识别方面与人类审稿的系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29420 2026-05-29 cs.AI cs.LG 91%

When Does Persona Prompting Actually Help? A Retrieval and Metric Analysis of Expert Role Injection in LLMs

角色提示何时真正有效?LLM中专家角色注入的检索与度量分析

Shuai Xiao, Su Liu, Weikai Zhou, Jialun Wu, Xinjie He, Zhiyuan Lin, Qiyang Xie

机构 * Independent Researchers(独立研究者)

专题命中 评测与基准 :LLM(title_cn,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 通过对比四种提示条件在1140个开放式问题上的表现,发现角色提示系统性地增加专家深度但降低清晰度,其效果高度依赖于问题类型和领域,且混合检索优于纯嵌入检索。

Comments 6 pages, 2 figures. Submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28108 2026-05-29 cs.CL 91%

Ask Now, Use Later: Benchmarking the Proactivity Gap in Long-Lived LLM Agents

现在询问,以后使用:评估长期 LLM 代理中的主动性差距

Bin Wu, Guanyun Zou, Bingbing Wang, Huan Zhao, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Noumena AI

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 针对长期 LLM 代理在跨会话中未能主动获取用户偏好而导致的主动性差距,提出 Ask-to-Remember (ATR) 基准 ATRBench,通过隐藏用户偏好作为真实值来量化该差距,并诊断出获取环节是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04704 2026-05-29 cond-mat.mtrl-sci cs.AI cs.CL 91%

AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials

AtomWorld: 评估大型语言模型在晶体材料空间推理能力的基准

Taoyuze Lv, Alexander Chen, Fengyu Xie, Chu Wu, Jeffrey Meng, Dongzhan Zhou, Yingheng Wang, Bram Hoex, Zhicheng Zhong, Tong Xie

机构 * University of New South Wales, NSW, Sydney, Australia(新南威尔士大学,新州,悉尼,澳大利亚) Suzhou Institute for Advanced Research, University of Science(苏州先进研究院,科学大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Cornell University(康奈尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL、cs.AI

AI总结 提出AtomWorld基准,通过十种基本原子结构操作评估LLM在材料科学中的空间推理能力,发现Claude Opus 4.6表现最佳但复杂空间关系操作成功率低,表明LLM更适合作为辅助工具而非完全自主的科研代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28999 2026-05-29 cs.CR cs.AI cs.CL cs.LG 90%

Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening

测量基于LLM的简历筛选中真实世界的提示注入攻击

Mohan Zhang, Yuqi Jia, Zhen Tan, Steven Jiang, Neil Zhenqiang Gong, Tianlong Chen, Dawn Song

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Duke University(杜克大学) Arizona State University(亚利桑那州立大学) hireEZ University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究首次系统性地分析了基于LLM的简历筛选应用中的提示注入攻击,通过设计专用检测器对约20万份真实简历进行测量,发现约1%的简历包含隐藏的提示注入,且近年来其流行度显著增加。

Comments Published in USENIX Security Symposium 2026; Code and artifacts are available at https://github.com/UNITES-Lab/resume-injection-measurement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29586 2026-05-29 cs.AI 90%

FinVerBench: Benchmark Validity and Calibration in Large Language Model Financial Statement Verification

FinVerBench: 大型语言模型财务报表验证中的基准有效性与校准

Silu Panda

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 提出FinVerBench基准,通过四类错误分类和SEC 10-K XBRL数据,评估LLM在财务报表数值一致性验证中的性能,发现校准和渲染选择显著影响结果,强调构造有效性而非最终排行榜。

Comments 37 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30315 2026-05-29 cs.CL cs.LG 90%

Resolution Diagnostics for Paired LLM Evaluation

配对LLM评估的分辨率诊断

Anany Kotawala

机构 * Princeton University(普林斯顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 针对公开LLM排行榜中配对排名未达到常规配对检验分辨率目标的问题,提出基于假设检验的配对评估框架,并引入分辨率比q=N/N*作为主要诊断指标,揭示了常用非配对Cohen-h-plus-(1-rho)捷径在接近比较区域存在约两倍的偏差。

Comments 16 pages, 7 figures, 12 tables. Accepted to the ICML 2026 Workshop on Hypothesis Testing, Seoul, South Korea, 2026. Copyright 2026 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29963 2026-05-29 cs.CR cs.AI cs.LG 90%

Honeyval: A Comprehensive Evaluation Framework for LLM-powered HTTP Honeypots

Honeyval: 基于LLM的HTTP蜜罐综合评估框架

Mark Vero, Fabian Kaczmarczyck, Ivan Petrov, Ilia Shumailov, Jamie Hayes, Niels Heinen, Tianqi Fan, Luca Invernizzi, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) Google DeepMind(谷歌DeepMind) AI Sequrity Company(AI安全公司) Independent(独立)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出Honeyval评估框架,通过16个后端应用、AI攻击代理、控制任务和可验证利用目标,系统评估LLM驱动的HTTP蜜罐,发现其相比规则基线能显著延长攻击交互、降低被前沿模型检测率,且保持成本优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26156 2026-05-29 cs.CR cs.AI cs.LG 90%

Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges

将偏见转化为漏洞:基于Bandit引导的LLM裁判风格操纵攻击

Xianglin Yang, Bryan Hooi, Gelei Deng, Tianwei Zhang, Jin Song Dong

机构 * School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出BITE黑盒对抗框架,将风格编辑选择建模为上下文Bandit问题,通过LinUCB策略自适应选择编辑以误导LLM裁判并人为提高评分,攻击成功率超65%。

Comments Accepted to the Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14584 2026-05-29 cs.LG cs.AI 90%

ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing

ReflexGrad: 基于进度门控双过程路由的LLM智能体片段内故障恢复

Ankush Kadu, Aswanth Krishnan

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出ReflexGrad双过程架构,通过进度门控路由在无演示条件下实现LLM智能体片段内故障恢复,显著提升任务成功率。

Comments 18 pages, 4 figures, 10 tables. Accepted at ICML 2026 FoGen Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30104 2026-05-29 cs.CL 90%

SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?

SEAL: 饱和基准能否通过LLM作为元裁判得以复兴?

Jiamin Chen, Yidi Wu, Qiexiang Wang, Qianben Chen, Yuchen Li, Yansen Zhang, Xiaokun Zhang, Wangchunshu Zhou, Chen Ma

机构 * ByteDance Inc.(字节跳动公司) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SEAL协议,通过自适应LLM元裁判从饱和基准中提取潜在排名信号,在代码生成、数学推理等任务上以更少调用实现高排名准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29800 2026-05-29 cs.CL 90%

Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels

九位评委,两张有效选票:相关错误削弱了LLM评估小组

Guneet Kohli

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过分析9个前沿LLM在自然语言推理任务上的投票行为,发现由于模型间存在高度相关的错误,评估小组的有效信息仅相当于约2个独立投票,实际准确率比独立投票理想情况低8-22个百分点,且增加评委或改进聚合算法均无法弥补这一差距。

Comments 14 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29653 2026-05-29 cs.AI 90%

PTCG-Bench: Can LLM Agents Master Pokémon Trading Card Game?

PTCG-Bench:LLM智能体能否掌握宝可梦集换式卡牌游戏?

Dongdong Hua, Yifei Sun, Renhong Huang, Feng Gao, Chunping Wang, Yang Yang

机构 * Zhejiang University(浙江大学) FinVolution Group(FinVolution集团)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PTCG-Bench基准,通过宝可梦集换式卡牌游戏评估LLM智能体的决策性能和自进化能力,并设计模块化消融实验分析智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29340 2026-05-29 cs.CL 90%

A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities

面向LLM安全评估的问答数据集研究:聚焦非法活动

Kenji Imamura, Masao Ideuchi, Atsushi Fujita

机构 * National Institute of Information and Communications Technology(日本信息与通信技术研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过人工分析AnswerCarefully数据集,提出额外信息、问答示例创建方法和评估准则,用于评估LLM在非法活动方面的安全性。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29274 2026-05-29 cs.CL 90%

Learnable Assessment Skills for LLM-based Automated Scoring: Rubric Construction via Iterative Optimization

基于LLM的自动评分中可学习的评估技能:通过迭代优化构建评分标准

Yun Wang, Xin Xia, Xuansheng Wu, Xiaoming Zhai, Ninghao Liu

机构 * School of Computing, University of Georgia, Athens, GA, USA(佐治亚大学计算机学院) AI4STEM Education Center, University of Georgia, Athens, GA, USA(佐治亚大学AI4STEM教育中心) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出一种迭代框架,使LLM能从评分经验中学习评估技能(即与题目无关的自然语言程序性知识),自动构建评分标准,无需人工干预,在ASAP-SAS数据集上超越专家编写的评分标准。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29225 2026-05-29 cs.AI 90%

BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents

BenchTrace: 用于测试LLM智能体反思能力和受控进化的基准

Jiahao Huang, Fei Cheng, Junfeng Jiang, Zefan Yu, Akiko Aizawa

机构 * University of Tokyo(东京大学) Kyoto University(京都大学) National Institute of Informatics(日本信息处理学会)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出BenchTrace基准,通过反思评估和进化评估两个任务,结合失败避免率(FAR)指标,系统评估LLM智能体的自我进化能力,实验发现当前模型在反思诊断和泛化上存在显著瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29059 2026-05-29 cs.SE cs.AI cs.CR 90%

SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers

SCDBench: 基于大语言模型的智能合约反编译基准

Kaihua Qin, Dawn Song, Arthur Gervais

机构 * University of Warwick(沃里克大学) UC Berkeley(伯克利大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有智能合约反编译评估缺乏统一基准的问题,提出SCDBench数据集与评估方法,通过四阶段累积评估(格式完整性、可编译性、ABI恢复、语义一致性)测试前沿LLM的反编译能力,发现语义一致性仍远未解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29048 2026-05-29 cs.CL 90%

LLMBridge: An LLM Pipeline for End-to-end Referential Bridging Resolution in English

LLMBridge:用于英语端到端指代桥接消解的LLM流水线

Lauren Levine, Amir Zeldes

机构 * Georgetown University(乔治城大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出基于LLM的端到端指代桥接消解系统LLMBridge,结合启发式预处理/后处理与LLM的自然语言推理能力,在三个英语数据集上超越现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏