arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1289 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1289 篇

2511.19517 2026-08-11 cs.LG cs.AI 版本更新 92%

Automating Deception: Scalable Multi-Turn LLM Jailbreaks

自动化欺骗:可扩展的多轮LLM欺骗攻击

Adarsh Kumarappan, Ananya Mujoo

机构 * California Institute of Technology(加州理工学院) Evergreen Valley College(埃弗格林谷学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自动化生成多轮LLM欺骗数据集的方法,揭示GPT家族模型在对话历史中的脆弱性,而Gemini 2.5 Flash则表现出极强的抗性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22148 2026-08-10 cs.AI cs.CL 版本更新 92%

Ratchet: How Reliable Must an LLM Judge Be to Retire a Skill?

Ratchet:一种最小化卫生的自演化LLM代理技能库

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS 生成式人工智能创新中心) HSBC Holdings Plc.(汇丰控股有限公司) HSBC Technology Center, China(汇丰技术中心,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Ratchet,一种单代理循环,使冻结的LLM能够自行编写、检索、整理和淘汰其自然语言技能,通过整合四个卫生机制提升技能库的生命周期管理,从而在MBPP+ hard-100数据集上显著提升性能。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15416 2026-08-04 cs.LG cs.AI 版本更新 92%

Margin-Adaptive Confidence Ranking for Reliable LLM Judgement

基于边际的置信度排名用于可靠的LLM判断

Gaojie Jin, Yong Tao, Lijia Yu, Tianjin Huang

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于边际的置信度排名方法,通过学习专用置信度估计器,改进LLM在人类判断一致性上的表现,通过模拟标注者多样性与边际排名公式,显式建模LLM区分人类一致与不一致案例的置信度,并推导出通用性保证。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30919 2026-07-07 cs.LG cs.AI 版本更新 92%

De-attribute to Forget for LLM Unlearning

De-attribute to Forget for LLM Unlearning

Xinyang Lu, Jiabao Pan, Rachael Hwee Ling Sim, See-Kiong Ng, Anthony Kum Hoe Tung, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于数据归因奖励的LLM遗忘框架DareU,通过强化学习降低生成响应与遗忘数据的归因分数,实现有效遗忘并平衡模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11354 2026-07-01 cs.AI cs.CL 版本更新 92%

ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences

ReplicatorBench:用于社会科学和行为科学中可复制性评估的LLM代理基准测试

Bang Nguyen, Dominik Soós, Qian Ma, Rochana R. Obadage, Zack Ranjan, Sai Koneru, Timothy M. Errington, Shakhlo Nematova, Sarah Rajtmajer, Jian Wu, Meng Jiang

机构 * University of Notre Dame(圣母大学) Old Dominion University(老道明大学) Pennsylvania State University(宾夕法尼亚州立大学) Independent Researcher(独立研究员) Uppsala University(乌普萨拉大学) Center for Open Science(开放科学中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReplicatorBench,一个端到端的基准测试,用于评估AI代理在可复制性研究中的能力,涵盖数据提取、实验设计与结果解释三个阶段,并开发了ReplicatorAgent框架以评估不同LLM和编程语言的性能。

Comments Accepted to KDD 2026 AI4Sciences Track, Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25665 2026-06-23 cs.CL cs.AI cs.DL cs.IR 版本更新 92%

LLM-ReSum: A Framework for LLM Reflective Summarization through Self-Evaluation

LLM-ReSum: 一个通过自我评估实现LLM反思性总结的框架

Huyen Nguyen, Haoxuan Zhang, Yang Zhang, Haihua Chen, Junhua Ding

机构 * dept. of Information Science University of North Texas Denton, Texas, USA(信息科学系 俄克拉荷马州立大学 丹顿 俄克拉荷马州 美国) dept. of Data Science University of North Texas Denton, Texas, USA(数据科学系 俄克拉荷马州立大学 丹顿 俄克拉荷马州 美国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM-ReSum框架,通过整合LLM评估与生成,提升低质量摘要的事实准确性与覆盖率,引入新的法律文档摘要基准PatentSumEval。

Comments This paper has been accepted as an invited paper for publication in Proceedings of The 12th IEEE International Conference on Big Data Computing Service and Machine Learning Applications. This is the accepted manuscript. The final authenticated version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00802 2026-06-18 cs.SE cs.CL cs.LG 版本更新 92%

GrowthHacker: Automated Off-Policy Evaluation Optimization Using Code-Modifying LLM Agents

GrowthHacker: 使用代码修改型LLM代理的自动离线策略评估优化

Jie JW Wu, Ayanda Patrick Herlihy, Ahmad Saleem Mirza, Ali Afoud, Fatemeh Fard

机构 * Michigan Technological University, Houghton(密歇根技术大学) Birmingham City University(伯明翰城市大学) University of British Columbia, Kelowna(不列颠哥伦比亚大学, 肯洛纳)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出GrowthHacker基准,利用LLM代理自动迭代修改代码以优化离线策略评估(OPE)实现,在Open Bandit Pipeline和Scope-RL上评估多种框架,证明基于LLM的代理可作为自动增长黑客持续改进OPE系统。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16902 2026-06-16 cs.AI cs.LG 版本更新 92%

LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?

LLM-WikiRace 基准测试:大语言模型在真实知识图谱上的规划能力有多强?

Juliusz Ziomek, William Bankes, Lorenz Wolf, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

机构 * University of Oxford, UK(牛津大学,英国) University College London (Centre for AI), UK(伦敦大学学院(人工智能中心),英国) University of Basel, Switzerland(巴塞尔大学,瑞士)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出 LLM-Wikirace 基准,通过维基百科超链接导航任务评估大语言模型的规划、推理与世界知识,发现模型在简单任务上超人类,但困难任务成功率仅 23%,且规划与长程推理是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17717 2026-06-11 cs.AI cs.LG 版本更新 92%

A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data

评估LLM生成数据的质量与可信度综述

Kaituo Zhang, Mingzhi Hu, Hoang Anh Duy Le, Fariha Kabir Torsha, Zhimeng Jiang, Minh Khai Bui, Chia-Yuan Chang, Yu-Neng Chuang, Zhen Xiong, Ying Lin, Guanchu Wang, Na Zou

机构 * University of Houston(德克萨斯大学休斯敦分校) Worcester Polytechnic Institute(沃思利理工学院) Rice University(里德大学) Texas A&M University(德克萨斯农工大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) University of Southern California(南加州大学) University of North Carolina at Charlotte(北卡罗来纳州立大学夏洛特分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LLM数据审计框架,从质量和可信度两个维度系统分类评估指标,分析六种模态数据生成方法的评估缺陷并给出改进建议。

Comments Published at TMLR. Title changed in the final version

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05751 2026-06-08 cs.CL cs.AI 版本更新 92%

Analysing Differences in Persuasive Language in LLM-Generated Text: Uncovering Stereotypical Gender Patterns

分析LLM生成文本中说服性语言的差异:揭示刻板的性别模式

Amalie Brogaard Pauli, Maria Barrett, Max Müller-Eberstein, Isabelle Augenstein, Ira Assent

机构 * Department of Computer Science, Aarhus University(阿arhus大学计算机科学系) AMD Silo AI University of Tokyo(东京大学) IT University of Copenhagen(哥本哈根IT大学) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出框架评估LLM生成说服性语言时受接收者性别、发送者意图和输出语言的影响,发现所有模型均存在显著的性别差异,反映性别刻板印象的语言倾向。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19308 2026-08-05 cs.SD cs.CL eess.AS 版本更新 92%

The Eloquence team submission for task 1 of MLC-SLM challenge

Eloquence团队针对MLC-SLM挑战赛任务1的提交

Lorenzo Concina, Jordi Luque, Alessio Brutti, Marco Matassoni, Yuchen Zhang

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) Telefónica Innovación Digital, Scientific Group(电信创新数字公司,科学小组) University of Essex(埃塞克斯大学)

专题命中 评测与基准 :SLM(title,title_cn);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 该研究针对MLC-SLM挑战赛任务1,探索三种多语言ASR方法,评估基线、利用SLAM-ASR框架训练投影器并研究对比学习与会话上下文的作用。

Comments Technical Report for MLC-SLM Challenge of Interspeech2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03391 2026-06-19 cs.DL cs.CY 版本更新 92%

More Parameters Than Populations: A Systematic Literature Review of Large Language Models within Survey Research

参数多于总体:调查研究中的大语言模型系统文献综述

Trent D. Buskirk, Florian Keusch, Leah von der Heyde, Adam Eck

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 通过系统文献综述,评估大语言模型在调查研究三个阶段(数据收集前、中、后)的应用,讨论其潜力与陷阱,并展望调查研究对LLM发展的贡献。

Comments This working paper is outdated as of June 2026 - please refer to the full version with substantive changes here: https://doi.org/10.31235/osf.io/eubj4_v1 This work was presented at NLPOR 2025 (non-archival): https://openreview.net/forum?id=0Hxhwa56Yg

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11650 2026-08-13 cs.CL 版本更新 92%

Investigating Learner-Aware Design of LLM-Generated Educational Feedback

哪种反馈适用于谁?LLM生成反馈元素在学习者特征中的差异效应

Momoka Furuhashi, Kouta Nakayama, Noboru Kawai, Takashi Kodama, Saku Sugawara, Kyosuke Takami

机构 * Tohoku University(东北大学) NII LLMC(日本信息处理学会LLMC研究中心) NII(日本信息处理学会) University of Tokyo(东京大学) Osaka Kyoiku University(大阪教养大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探讨了不同人格特征学习者对LLM生成反馈元素的接受差异,发现有效反馈元素有共同支持学习成果的模式,学习者主观偏好在人格集群中存在差异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05061 2026-08-12 cs.CL 版本更新 92%

No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding

无免费标签:缺乏人类基准的LLM作为评判的局限性

Michael Krumdick, Charles Lovering, Varshini Reddy, Seth Ebner, Chris Tanner

机构 * Kensho Technologies MIT(麻省理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BFF-Bench基准测试,通过专家评估LLM响应的正确性,揭示LLM作为评判在无人类基准时的局限性,显示当无正确参考时,LLM评判与人类专家的高一致性仅限于LLM能正确回答的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01629 2026-08-11 cs.CL 版本更新 92%

Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation

基准测试LLM作为裁判在长文本输出评估中的应用

Junjie Chen, Yuxi Dong, Haitao Li, Weihang Su, Yujia Zhou, Min Zhang, Yiqun Liu, Qingyao Ai

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) University of Science and Technology Beijing(北京科技大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LongJudgeBench基准,系统评估LLM裁判在长文本输出评估中的可靠性,发现当前模型存在显著可靠性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27887 2026-08-11 cs.AI q-fin.PM 版本更新 92%

PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

PortBench: 一种相关性感知的、全流水线的LLM驱动投资组合管理基准

Yuxuan Zhao, Sijia Chen, Ningxin Su

机构 * Yantai Research Institute of Harbin Engineering University(哈尔滨工程大学烟台研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出PortBench基准,通过静态QA和动态五阶段分配流水线评估LLM在投资组合管理中的表现,发现多数模型无法超越等权重分配,且存在推理错误累积和压力下大幅回撤的问题。

Comments Project page: https://portbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08531 2026-08-10 cs.AI 版本更新 92%

ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

VESTA: 一种全自动的LLM智能体场景生成与安全评估框架

Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng

机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Long-term AI(长期人工智能)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13280 2026-08-04 cs.SE cs.AI 版本更新 92%

Characterizing Readability Issue Patterns and the Role of Prompt Design in LLM-Generated Code

可读性光谱:LLM生成代码中的模式、问题和提示影响

Hengzhi Ye, Fengyuan Ran, Weiwei Xu, Minghui Zhou

机构 * Peking university(北京大学) Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM生成代码的可读性,发现其与人工编写代码相当,但存在特定问题模式,提示设计对可读性影响有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06605 2026-07-22 cs.LG 版本更新 92%

How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation

需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配

Shai Feldman, Yaniv Romano

机构 * Department of Computer Science(计算机科学系) Technion, Israel(技术ion, 以色列) Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DAPRO框架,通过动态预算分配在多轮LLM交互中提供事件发生时间的界限,解决静态方法效率低的问题,实验表明其在覆盖性和方差方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02104 2026-07-21 cs.LG 版本更新 92%

When Can You Debias an LLM Judge? Identifiability Limits, a Test, and Designs for Top-k Ranking

提出正确的比较:基于偏差感知的贝叶斯主动Top-k排序与LLM裁判

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM裁判存在噪声和系统性偏差(如偏好冗长或格式好的回答)的问题,提出将裁判过程建模为贝叶斯推断,引入显式的裁判特定偏差协变量,并设计一种Top-k感知的主动获取规则,以在固定比较预算下准确识别Top-k项。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05558 2026-07-21 cs.LG 版本更新 92%

Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents

自回归扩散世界模型用于LLM智能体的离线评估

Kaixuan Liu, Guojun Xiong, Weinan Zhang, Shengpu Tang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出ADWM框架,通过自回归扩散世界模型从预收集轨迹中模拟环境响应,实现无需在线交互的LLM智能体策略离线评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11504 2026-07-14 cs.LG cs.CR 版本更新 92%

CTFusion: A CTF-based Benchmark for LLM Agent Evaluation

CTFusion: 一种基于CTF的LLM代理评估基准

Dongjun Lee, Ga-eun Bae, Insu Yun

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出CTFusion,一种基于CTF的评估框架,通过减少竞争影响和数据污染,提升对LLM代理的评估可靠性。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD), ICML 2026. Revised to match the camera-ready version. OpenReview: https://openreview.net/forum?id=aUSUvS4dPL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16453 2026-07-10 cs.AI 版本更新 92%

RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments

RetailBench: 评估LLM代理在真实零售环境中的长周期自主决策与策略稳定性

Linghua Zhang, Jun Wang, Jingtong Wu, Zhisong Zhang

机构 * Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RetailBench基准,用于评估LLM代理在千天级超市运营模拟中的长周期决策能力,发现当前最强模型仍远落后于最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17314 2026-07-02 cs.SE cs.LG 版本更新 92%

Clotho: Measuring Task-Specific Pre-Generation Test Adequacy for LLM Inputs

Clotho:用于LLM输入的任务特定预生成测试充分性度量

Juyeon Yoon, Somin Kim, Robert Feldt, Shin Yoo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Chalmers University of Technology Gothenburg Sweden(楚德大学哥德堡瑞典) Chalmers University of Technology(楚德大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Clotho通过分析LLM隐藏状态直接估计输入难度,无需生成输出即可评估测试输入的有效性,提升测试效率并降低LLM执行成本。

Comments FSE 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14732 2026-07-01 physics.ed-ph cs.CL 版本更新 92%

LLM-as-a-judge validity in physics assessment depends more on the task than the model

LLM作为评判者在物理评估中的有效性更取决于任务而非模型

Will Yeadon, Tom Hardy, Paul Mackay, Elise Agra

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究评估LLM在不同物理评估格式(结构化问题、论文、科学图表)中的评分有效性,发现任务类型对评分准确性和排序一致性影响显著,而非模型能力。

Comments 29 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20094 2026-06-29 cs.AI 版本更新 92%

CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching

CausalFlip: 超越语义匹配的LLM因果判断基准

Yuzhe Wang, Yaochen Zhu, Jundong Li

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CausalFlip基准,通过构建语义相似但因果答案相反的问题对和噪声前缀评估,揭示LLM依赖语义匹配而非因果推理,并验证内化因果推理方法可提升因果基础。

Comments 8 pages plus references, 3 figures, 3 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16492 2026-06-29 cs.CL 版本更新 92%

Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety

在自毁之前检查自己:选择性退出提升LLM智能体安全性

Vamshi Krishna Bonagiri, Ponnurangam Kumaragurum, Khanh Nguyen, Benjamin Plaut

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出让LLM智能体在不确定时主动退出,通过ToolEmu框架在12个模型上评估,发现该方法在几乎不降低有用性的情况下显著提升安全性。

Comments Reliable ML and Regulatable ML workshops, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16116 2026-06-29 cs.CR cs.AI 版本更新 92%

DMind Benchmark: Toward a Holistic Assessment of LLM Capabilities across the Web3 Domain

DMind Benchmark:面向Web3领域LLM能力的全面评估

Enhao Huang, Pengyu Sun, Shuxun Wang, Zixin Lin, Alex Chen, Kaichun Hu, Joey Ouyang, Frank Li, Zhiyu Zhang, Haobo Wang, Yiming Li, Zhan Qin, James Yi, Gang Zhao, Ziang Ling, Lowes Yang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DMind Benchmark,覆盖Web3九个子领域,结合客观知识与开放推理任务,评估31个LLM,发现模型在安全审计等高推理任务中存在显著弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13300 2026-06-26 cs.CL 版本更新 92%

OI-Bench: An Option Injection Benchmark for Evaluating LLM Susceptibility to Directive Interference

OI-Bench:用于评估大语言模型对指令干扰敏感性的选项注入基准

Yow-Fu Liou, Yu-Chien Tang, Yu-Hsiang Liu, An-Zi Yen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国家阳明交通大学计算机科学系)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出选项注入基准OI-Bench,通过在多选题界面中嵌入误导性指令,系统评估12个LLM对16种指令干扰的脆弱性,揭示模型存在显著漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02219 2026-06-25 cs.CL 版本更新 92%

Am I More Pointwise or Pairwise? Revealing Position Bias in Rubric-Based LLM-as-a-Judge

我是更偏向逐点还是成对?揭示基于评分标准的LLM作为评判者的位置偏差

Yuzheng Xu, Tosho Hirasawa, Tadashi Kozuno, Yoshitaka Ushiku

机构 * OMRON SINIC X NexaScience

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究基于评分标准的LLM评估中的位置偏差,发现其类似多项选择,模型倾向于选择特定位置的选项,偏差方向因模型而异,且评分标准顺序也会影响结果。

详情

展开后加载摘要…

URL PDF HTML 收藏