arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-01 至 2026-06-01 共收录 79 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 5 篇

2605.30677 2026-06-01 cs.CR cs.AI cs.SE 79%

Investigating Detection and Obfuscation of Prompt Injection Attacks Against Software Reverse Engineering AI Agents

针对软件逆向工程AI代理的提示注入攻击的检测与混淆研究

Brian Crawford, Patrick McClure

机构 * Dept. of Computer Science(计算机科学系) Naval Postgraduate School(海军学院)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本研究针对软件逆向工程AI代理面临的提示注入攻击,提出了检测反编译器输出中提示注入字符串的防御策略,并探索了攻击混淆及相应防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30534 2026-06-01 cs.CR 78%

Strengthening Polymorphic Prompt Assembling: Dynamic Separator Generation Against Emerging Prompt Injection Attacks

强化多态提示组装:针对新兴提示注入攻击的动态分隔符生成

Nima Dorzhiev, Peng Liu

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 提出动态每请求分隔符生成方法,利用基于时间戳、会话标识和加密随机数的域分离SHA-256摘要,将攻击成功率从0.88降至0.38,并消除静态分隔符泄露风险。

Comments 5 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30454 2026-06-01 cs.CR cs.AI 57%

The Surface You Test Is Not the Surface That Breaks

测试的表面并非断裂的表面

Shifat E Arman, Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文发现工具增强的LLM代理对提示注入的脆弱性依赖于攻击表面(工具输出 vs 工具描述),提出自适应攻击率并强调评估需报告每个表面的脆弱性。

Comments 8 Figures, 8 Tables, Under Review at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与事实性 8 篇

2605.30675 2026-06-01 cs.CL cs.AI 81%

Human-Alignment, Calibration, and Activation Patterns in Large Language Model Uncertainty

大型语言模型不确定性中的人类对齐、校准与激活模式

Kyle Moore, Jesse Roberts, Daryl Watson, William Ward, Grayson Heyboer

机构 * Vanderbilt University(范德比大学) Tennessee Technological University(田纳西技术大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型的不确定性与人类不确定性的相似性,通过分析行为与内部激活模式,发现模型在多项选择和开放式事实回忆数据集上同时存在对齐与校准,并描述了指令微调的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08204 2026-06-01 cs.CL cs.AI 81%

Human-Alignment and Calibration of Inference-Time Uncertainty in Large Language Models

大型语言模型中推理时间不确定性的人类对齐与校准

Kyle Moore, Jesse Roberts, Daryl Watson

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估了多种推理时间不确定性度量,发现它们与人类群体不确定性高度对齐,尽管与人类答案偏好不一致,但在正确性相关性和分布分析上表现出中等到强校准证据。

Comments We have discovered a critical error in the normalized entropy calculation that may have substantially inflated nearly all results herein. We have since fixed this error in a new work, but we believe that the new work is sufficiently dissimilar in focus, methods, dataset, and results as to be misleading if presented as a simple replacement. As such, we propose removal and retraction instead

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30381 2026-06-01 cs.LG cs.AI 79%

When LLMs Learn to Be Consistently Wrong: A Multi-Model Study of Linear Representations of Synthetic Deception

当LLM学会一致错误:合成欺骗的线性表示的多模型研究

Vahideh Zolfaghari

机构 * Algoverse AI Research Medical Sciences Education Research Center, Mashhad University of Medical Sciences(马什哈德大学医学科学教育研究中心) Student Research Committee, Department of Health Information Technology and Management, Medical Informatics, School of Allied Medical Sciences, Shahid Beheshti University of Medical Sciences(谢赫·贝赫什提大学医学科学学院学生研究委员会,健康信息科技与管理系,医学信息学)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 通过LoRA微调五个Transformer模型的诚实与欺骗变体,使用线性探针检测合成欺骗,发现早期层即可达到近完美AUC,支持线性表示假说,并揭示两种表示机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31445 2026-06-01 cs.GT cs.AI cs.CL cs.LG 67%

Used Car Salesbots? Honesty and Credulity of LLMs as Bargaining Agents under Partial Information

二手车销售机器人?作为讨价还价代理的LLM在部分信息下的诚实与轻信

Antonio Valerio Miceli-Barone, Vaishak Belle, Shay B. Cohen

机构 * University of Edinburgh(爱丁堡大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究LLM代理在模拟讨价还价场景中的表现,发现它们偏离博弈论均衡,尝试撒谎但无法有效利用信息不对称,且优化财务效用会增强谈判能力但增加不诚实行为。

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30585 2026-06-01 cs.LG cs.AI cs.CE 62%

Benchmarking Machine Learning Uncertainty Quantification Methodologies for Predicting Turbine Gas Temperature Degradation

机器学习不确定性量化方法在预测涡轮燃气温度退化中的基准测试

Jostein Barry-Straume, Changmin Son, Adrian Sandu, Gavan Burke, Rekha Sundararajan, Andrew Rimell, James G. Steinrock

机构 * Computational Science Laboratory(计算科学实验室) Department of Computer Science(计算机科学系) Virginia Tech(弗吉尼亚理工大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了五种预测区间构建方法(Delta法、贝叶斯蒙特卡洛Dropout、Bootstrap法、下上界估计和均值方差估计),在统一实验框架下评估其捕捉涡轮燃气温度神经网络预测不确定性的能力,并基于覆盖概率、归一化平均预测区间宽度和覆盖宽度准则等指标比较了各方法的可靠性、锐度及权衡,为发动机健康管理中的预测区间方法选择和调优提供了实用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30911 2026-06-01 cs.CV cs.AI 57%

What Makes LVLMs Hallucinate Less? Unveiling the Architectural Factors Behind Hallucination Robustness

什么使LVLMs更少产生幻觉?揭示影响幻觉鲁棒性的架构因素

Yusheng He, Jizhe Zhou, Xia Du, Zheng Lin, Jun Luo, Jiancheng Lv

机构 * School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(计算机科学学院,机器学习与产业智能工程研究中心,四川大学) School of Computer and Information Engineering, Xiamen University of Technology(计算机与信息工程学院,厦门理工大学) Department of Electrical and Computer Engineering, University of Hong Kong(电气与计算机工程系,香港大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文通过将架构设计分解为语言基础、视觉表示和语义对齐三个维度,并引入CoSimUE基准,系统探索了架构因素对LVLMs幻觉鲁棒性的影响,发现模型参数扩展效果有限,而增强视觉编码器、语言基础和语义对齐能分别减少不同类型的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26942 2026-06-01 cs.AI cs.LO cs.SE 57%

Neuro-Symbolic Verification of LLM Outputs for Data-Sensitive Domains (extended preprint)

面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)

Paul Sigloch, Christoph Benzmüller

机构 * University of Bamberg(巴姆堡大学) Free University of Berlin(柏林自由大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出一种结合形式符号方法与神经语义分析的混合验证架构,用于检测LLM输出中的幻觉、不一致和隐私漏洞,在医疗设备损伤评估系统中实现83%的结构化实体幻觉检测率和72%的语义虚构检测率。

Comments Extended preprint version of accepted technical communication at KI 2026. 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04457 2026-06-01 stat.ML cs.LG 57%

Benchmarking Uncertainty and its Disentanglement in multi-label Chest X-Ray Classification

多标签胸部X光分类中的不确定性及其解缠基准测试

Simon Baur, Wojciech Samek, Jackie Ma

机构 * Fraunhofer Heinrich-Hertz-Institut(弗劳恩霍夫海因里希-赫兹研究所) Technische Universität Berlin(柏林技术大学) The Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本研究使用MIMIC-CXR-JPG数据集,对多标签胸部X光分类任务中的13种不确定性量化方法进行基准测试,评估了卷积和Transformer架构,并扩展了三种方法到多标签设置,揭示了不同方法和架构在不确定性估计和解缠认知与偶然不确定性方面的优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 安全评测 23 篇

2605.31021 2026-06-01 cs.AI cs.CL cs.LG 82%

A Persona-Based Evaluation Framework for Pluralistic Alignment in Generative AI

基于人格的生成式AI多元对齐评估框架

Atahan Karagoz

机构 * Atahan Karagöz(阿塔汗·卡拉戈兹)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种状态空间约束仿真框架,通过合成认知轮廓替代单一评估函数,实现反映真实世界共识变异性的多元、视角依赖的基准测试,并分析仿真评估者的稳定性问题,论证动态调节机制的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31360 2026-06-01 cs.LG cs.AI 81%

dashi: A Python library for Dataset Shift Characterization to Support Trustworthy AI Development and Deployment

dashi: 一个用于数据集偏移表征以支持可信AI开发和部署的Python库

David Fernández-Narro, Pablo Ferri, Ángel Sánchez-García, Juan M. García-Gómez, Carlos Sáez

机构 * Biomedical Data Science Lab, Instituto Universitario de Tecnologías de la Información y Comunicaciones, Universitat Politècnica de Valéncia(生物医学数据科学实验室,信息与通信技术大学,巴塞罗那理工大学)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍dashi,一个开源Python库,通过无监督(基于信息几何和非参数统计流形)和有监督方法,对数据集偏移进行探索、量化和表征,以支持AI生命周期中的可信度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05875 2026-06-01 cs.HC cs.AI cs.CV 79%

Towards a Humanized Social-Media Ecosystem: AI-Augmented HCI Design Patterns for Safety, Agency & Well-Being

迈向人性化的社交媒体生态系统:面向安全、自主与福祉的AI增强人机交互设计模式

Mohd Ruhul Ameen, Akif Islam

机构 * College of Engineering(工程学院) Computer Sciences Marshall University Huntington, WV, USA(计算机科学马歇尔大学亨廷顿州威斯康星州) Department of Computer Science(计算机科学系) Engineering University of Rajshahi Rajshahi 6205, Bangladesh(工程 Rajshahi 大学 Rajshahi 6205 巴基斯坦)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出Human-Layer AI(HL-AI)框架,通过浏览器端用户拥有的可解释中介,在不依赖平台合作的情况下赋予用户实时控制权,实现内容重写、完整性检测、信息流定制、行为中断和恢复模式等五种设计模式,以提升社交媒体安全性与用户福祉。

Comments 6 pages, 5 tables, 7 figures, and 2 algorithm tables. Accepted at International Conference on Signal Processing, Information, Communication and Systems (SPICSCON 2025)

Journal ref 2025 IEEE International Conference on Signal Processing, Information, Communication and Systems (SPICSCON)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30650 2026-06-01 cs.CR 78%

When AI Meets Wall Street: A Survey on Trustworthy AI in Fintech

当AI遇见华尔街:金融科技中可信AI综述

Qingwen Zeng, Zhenghao Zhao, Yitian Yang, Yiqi Zhu, Fangchen Liu, Zhaoge Bi, Moe Thandar Kyaw Wynn, Kim-Kwang Raymond Choo, Huaming Chen

专题命中 安全评测 :trustworthy(title);prompt injection(abstract)

AI总结 本文提出一个以生命周期为中心、机制驱动的统一框架,将金融AI分为训练更新、部署推理、运营监控三个阶段,并构建金融AI安全与鲁棒性分类法,涵盖17种攻击子类型,分析其算法策略、可行性约束、隐蔽性与持久性及下游金融后果,最后指出开放挑战并规划研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30654 2026-06-01 cs.CL cs.AI cs.HC 73%

EUDAIMONIA: Evaluating Undesirable Dynamics in AI

EUDAIMONIA: 评估AI中的不良动态

Jun Rui Huang, Wang Bill Zhu, Ziyi Liu, Nathanael Fast, Ravi Iyer, Robin Jia

机构 * University of Southern California(南加州大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出Social AI Design Code框架,并通过EUDAIMONIA基准测试评估22个最新LLM在社交互动中对用户福祉的符合程度,发现即使最强模型也违反约30%的设计要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30018 2026-06-01 cs.CL cs.LG 73%

Latent Performance Profiling of Large Language Models

大型语言模型的潜在性能剖析

Tanmoy Chakraborty, Ayan Sengupta, Suparna Bhattacharya, Partha Pratim Chakrabarti, Amlan Chakrabarti, Supratik Chakraborty, Partha Pratim Das, Lipika Dey, Richa Singh, Mayank Vatsa

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi(印度理工学院德里分校电子工程系) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里分校人工智能学院) Hewlett Packard Enterprise, India(印度惠普企业公司) Department of Computer Science & Engineering, Indian Institute of Technology Kharagpur(印度理工学院Khargapur分校计算机科学与工程系) A.K.Choudhury School of Information Technology, University of Calcutta, India(印度加尔各答大学信息科技学院) Department of Computer Science & Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) Department of Computer Science, Ashoka University, India(阿什oka大学计算机科学系) Department of Computer Science & Engineering, Indian Institute of Technology Jodhpur(印度理工学院朱罗普分校计算机科学与工程系)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 提出潜在性能剖析(LPP)框架,通过隐藏激活和输出分布提取任务无关的诊断指标,揭示模型内在特性,补充传统基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30698 2026-06-01 cs.CV cs.AI cs.MA 70%

Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

先见后议:用视觉证据对齐多智能体共识

Yuhan Wang, Shuochen Chang, Yalin Feng, Dongsheng Ma, Yuanzi Li, Zhengren Wang, Yinglong Yang, Yufei Chen, Yikang Wang, Shaoxu Sun, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Shandong University(山东大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出EAGLE框架,通过显式暴露各智能体的视觉证据区域并相互验证,实现无需训练的多智能体视觉问答协作,提升共识可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30590 2026-06-01 cs.LG cs.AI cs.CL 67%

Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents

反事实评估揭示临床LLM和智能体的隐藏能力画像

Matt Turk

机构 * Protege Data Lab(Protege数据实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出因果敏感性评分(CSS),通过沿五个临床维度变异肿瘤病例来评估模型是否按预期方向更新推荐,发现与覆盖度指标排名相反,并揭示所有前沿模型在手术状态干预上的安全盲点。

Comments Accepted to RLEval @ ACM CAIS 2026 (Workshop on Methods and RL Environments for Evaluating AI Agents) and selected for an invited talk based on reviewer ratings. 4-page short paper + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30646 2026-06-01 cs.CL cs.AI 62%

Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs

同一患者,不同措辞,不同诊断?评估临床大语言模型中的语义稳定性

Mahdi Alkaeed, Adnan Qayyum, Nabeel Abo Kashreef, Muhammad Bilal, Junaid Qadir

机构 * Department of Computer Science and Engineering, College of Engineering, Qatar University(卡塔尔大学计算机科学与工程系) College of Science and Engineering, Hamad Bin Khalifa University (HBKU)(哈马德·本·卡伊夫大学(HBKU)理学院) Primary Health Care Corporation (PHCC)(初级卫生保健公司) Birmingham City University(伯明翰城市大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对临床大语言模型对语义等价但措辞不同的提示敏感的问题,提出基于自然语言推理的语义验证框架和三个量化指标,评估16个开源通用与医学模型,发现领域专业化并不一致地提升或降低鲁棒性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30452 2026-06-01 cs.LG cs.AI math.OC 62%

A Unified Framework for Gradient Aggregation in Multi-Objective Optimization

多目标优化中梯度聚合的统一框架

Zeou Hu, Kelvin Ho, Yaoliang Yu

机构 * Cheriton School of Computer Science(切尔顿计算机科学学院) University of Waterloo(滑铁卢大学) Vector Institute(向量研究所) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出一个统一框架,通过充分对齐条件建立梯度聚合方法的收敛率,并引入基于CVaR的capped MGDA算法,在对抗联邦学习中验证鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12440 2026-06-01 cs.CL cs.AI 62%

MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts

MedFact:大型语言模型在中文医学文本上的事实核查能力基准测试

Jiayi He, Yangmin Huang, Qianyun Du, Xiangying Zhou, Zhiyang He, Jiaxue Hu, Xiaodong Tao, Lixian Lai

机构 * Xunfei Healthcare Technology Co., Ltd.(讯飞医疗科技有限公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 为评估LLM在中文医学文本中的事实核查能力,构建了包含2116个专家标注实例的MedFact基准,涵盖13个专科、8种错误类型等,并发现模型在错误定位上表现不足,存在“过度批评”现象。

Comments Accepted to The Fifth Workshop on Generation, Evaluation, and Metrics (GEM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31268 2026-06-01 cs.CL 57%

Mellum2 Technical Report

Mellum2 技术报告

Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev, Kseniia Lysaniuk, Madeeswaran Kannan, Ivan Dolgov, Nikita Pavlichenko

机构 * JetBrains Constructor University(Constructor大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文介绍 Mellum 2,一个12B参数(每token激活2.5B)的混合专家语言模型,专攻软件工程,通过架构创新和训练优化在代码生成、数学推理等基准上达到4B-14B开源模型的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30916 2026-06-01 cs.LG cs.GT econ.TH 57%

Welfare, Improvability, and Variance: A Principal-Agent Approach to Optimal Benchmark Item Aggregation

福利、可改进性与方差:最优基准测试项聚合的主-代理方法

Andreas Haupt, Justin Hartenstein, Anka Reuel, Mykel Kochenderfer, Sanmi Koyejo

机构 * Department of Economics & Computer Science(经济与计算机科学系) Institute for Computational and Mathematical Engineering(计算与数学工程研究所) Department of Computer Science(计算机科学系) Department of Aeronautics & Astronautics(航空与航天系)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 提出将基准测试建模为多任务主-代理博弈,通过福利、可改进性和方差三个维度评估项目,并应用于OLMES数据集识别帕累托劣势项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30693 2026-06-01 cs.CR cs.CL 57%

Triaging Threats to Specialized Guardrails

针对专用护栏的威胁分类

Wenjie Jacky Mo, Xiaofei Wen, Rui Cai, Boyu Zhu, Sicong Jiang, Zihan Wang, Minglai Yang, Zhe Zhao, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出GuardZoo统一基准和RouteGuard路由专家框架,通过将对话分流至专用护栏,解决单一护栏在多种威胁域上的任务干扰问题,提升细粒度检测和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25110 2026-06-01 cs.CL 57%

DEBATE: A Large-Scale Benchmark for Evaluating Opinion Dynamics in Role-Playing LLM Agents

DEBATE:用于评估角色扮演LLM代理中观点动态的大规模基准

Yun-Shiuan Chuang, Ruixuan Tu, Chengtao Dai, You Li, Smit Vasani, Binwei Yao, Michael Henry Tessler, Sijia Yang, Dhavan Shah, Robert Hawkins, Junjie Hu, Timothy T. Rogers

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出DEBATE基准,通过多轮公共消息和Likert量表信念数据,评估多代理角色扮演LLM模拟中观点动态的真实性,发现零样本设置下代理组过度收敛,而监督微调可改善立场对齐并减少组级收敛误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15778 2026-06-01 cs.CL 57%

*-PLUIE: Personalisable metric with Llm Used for Improved Evaluation

*-PLUIE:使用大语言模型改进评估的可个性化度量

Quentin Lemesle, Léane Jourdan, Daisy Munson, Pierre Alain, Jonathan Chevelu, Arnaud Delhay, Damien Lolive

机构 * Univ Rennes, CNRS, IRISA, EXPRESSION(里尔大学、法国国家科学研究中心、IRISA、EXPRESSION) Nantes Université, École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学、南特中央理工学院、法国国家科学研究中心、LS2N、UMR 6004) Univ Rennes, CNRS, IRISA, SOTERN(里尔大学、法国国家科学研究中心、IRISA、SOTERN) Univ of South Brittany, CNRS, IRISA, ARCHIMEDIA(布列塔尼南部大学、法国国家科学研究中心、IRISA、ARCHIMEDIA)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出*-PLUIE,一种基于困惑度的可个性化LLM评判度量,通过任务特定提示变体实现与人类判断的更强相关性,同时保持低计算成本。

Comments Accepted at *SEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01011 2026-06-01 cs.MA cs.AI 57%

Multi-Agent Teams Hold Experts Back

多智能体团队阻碍专家发挥

Aneesh Pappu, Batu El, Hancheng Cao, Carmelo di Nolfo, Yanchao Sun, Meng Cao, James Zou

机构 * stanford(斯坦福大学) apple(苹果公司) goizueta business school, emory(埃默里大学戈izueta商学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究自组织多智能体LLM团队在无约束协调下无法匹配专家性能,发现整合妥协行为是主要瓶颈,导致性能损失高达41.1%。

Comments Accepted at the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00521 2026-06-01 cs.AI 57%

Diagnosing the Reliability of LLM-as-a-Judge via Item Response Theory

通过项目反应理论诊断LLM作为评判者的可靠性

Junhyuk Choi, Sohhyung Park, Chanhee Cho, Hyeonchu Park, Bugeun Kim

机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, Republic of Korea(Chung-Ang 大学人工智能系) Department of Industrial Engineering, Seoul National University, Seoul, Republic of Korea(首尔国立大学工业工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出基于项目反应理论(IRT)的两阶段诊断框架,通过内在一致性和人类对齐两个维度评估LLM作为评判者的可靠性,并提供可解释的诊断信号。

Comments Accepted ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19448 2026-06-01 cs.LG cs.CR 57%

From Internal Diagnosis to External Auditing: A VLM-Driven Paradigm for Data-Free Online Backdoor Defense

从内部诊断到外部审计:一种VLM驱动的数据自由在线后门防御范式

Binyan Xu, Fan Yang, Xilin Dai, Di Tang, Kehuan Zhang

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) Sun Yat-sen University, China(中山大学) Zhejiang University, China(浙江大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出一种从内部诊断到外部语义审计的范式转变,利用通用视觉语言模型(VLM)作为外部语义门控,通过PRISM框架(原型精炼与统计监控检查)实现数据自由的在线后门防御,在17个数据集和11种攻击类型上达到最先进性能。

Comments 25 pages, 10 figures, 19 tables. To appear in the Proceedings of the 43 rd International Conference on Machine Learning (ICML '26)

详情

展开后加载摘要…

URL PDF HTML 收藏