arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-08 至 2026-05-08 共收录 27 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 27 篇

2605.05662 2026-05-08 cs.CL cs.AI 88%

XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity

XL-SafetyBench: 一个基于国家的跨文化安全基准,用于LLM安全性和文化敏感性

Dasol Choi, Eugenia Kim, Jaewon Noh, Sang Seo, Eunmi Kim, Myunggyo Oh, Yunjin Park, Brigitta Jesica Kartono, Josef Pichlmeier, Helena Berndt, Sai Krishna Mendu, Glenn Johannes Tungka, Özlem Gökçe, Suresh Gehlot, Katherine Pratt, Amanda Minnich, Haon Park

机构 * AIM Intelligence(AIM智能研究院) Microsoft(微软公司) Korea AISI(韩国人工智能研究所) KT Corporation(KT公司) BMW Group(宝马集团) Coinbase(Coinbase公司) Technical University of Munich(慕尼黑技术大学) Ankara University(安卡拉大学) Cyril Amarchand Mangaldas(Cyril Amarchand Mangaldas法律事务所) Seoul National University(首尔国立大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 XL-SafetyBench通过5500个跨10个国家语言对的测试案例,评估LLM在文化敏感性和安全性的表现,揭示了前沿模型的安全性与文化意识无耦合关系,以及本地模型在安全与文化敏感性间的线性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06576 2026-05-08 cs.LG 87%

On the Safety of Graph Representation Learning

图表示学习的安全性研究

Xiaoguang Guo, Zehong Wang, Ziming Li, Shawn Spitzel, Soonwoo Kwon, Tianyi Ma, Yanfang Ye, Chuxu Zhang

机构 * University of Connecticut(康涅狄格大学) University of Notre Dame(圣约翰大学)

专题命中 安全评测 :safety(title,summary_cn);分类 cs.LG

AI总结 本文提出GRL-Safety评估框架,评估十二种图表示学习方法在不同安全轴上的表现,揭示安全行为受表示设计与受压图因素交互影响,指出基础模型在特定轴上具有优势,揭示部署中仍存在能力缺口。

Comments Preprint. 10 pages main text, appendices included

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05750 2026-05-08 cs.LG cs.CL 86%

RVPO: Risk-Sensitive Alignment via Variance Regularization

基于方差正则化的风险敏感对齐:RVPO

Ivan Montero, Tomasz Jurczyk, Bhuwan Dhingra

机构 * Apple(苹果公司)

专题命中 安全评测 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RVPO框架,通过在优势聚合中惩罚奖励方差,将目标从最大化总和转为最大化一致性,提升多目标对齐的可靠性。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06327 2026-05-08 cs.CL cs.AI cs.LG 85%

Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity

在开放权重大语言模型中测量评估-情境差异:一种配对提示协议及其初步证据表明对齐-流水线特定异质性

Florian A. D. Burnat, Brittany I. Davidson

机构 * University of Bath(巴斯大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种配对提示协议,用于测量开放权重大语言模型中因任务框架不同而引起的评估-情境差异,发现不同模型在评估和部署情境下的行为存在显著异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06161 2026-05-08 cs.AI cs.SE 83%

Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges

超越准确性:将政策不变性作为LLM安全裁判的可靠性测试

Shihao Weng, Yang Feng, Xiaofei Xie

机构 * Nanjing University(南京大学) Singapore Management University(新加坡国立管理学院)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出政策不变性作为LLM安全裁判可靠性测试,通过三个可测试原则揭示现有裁判在面对规范性变化和结构性重写时的失效模式,并提出政策不变性分数和裁判卡报告协议以评估裁判可靠性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05678 2026-05-08 cs.AI 83%

Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering

风险链:大型推理模型中的安全故障及通过自适应多原则引导的缓解

Xiaomin Li, Jianheng Hou, Zheyuan Deng, Zhiwei Zhang, Taoran Li, Binghang Lu, Bing Hu, Yunhan Zhao, Yuexing Hao

机构 * Harvard University(哈佛大学) University of Southern California(南加州大学) Brown University(布朗大学) Pennsylvania State University(宾夕法尼亚州立大学) Texas A&M University(德克萨斯阿姆大学) Purdue University(普渡大学) University of California, Irvine(加州大学 Irvine 分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究发现大型推理模型在推理轨迹中存在额外安全风险,提出自适应多原则引导方法降低不安全内容出现率,提升整体安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06652 2026-05-08 cs.LG cs.AI cs.CL 82%

When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels

在没有基准的情况下:在无标签的情况下验证比较LLM安全性评分

Sushant Gautam, Finn Schwall, Annika Willoch Olstad, Fernando Vallecillos Ruiz, Birk Torpmann-Hagen, Sunniva Maria Stordal Bjørklund, Leon Moonen, Klas Pettersen, Michael A. Riegler

机构 * Simula Metropolitan Center for Digital Engineering(Simula 数字工程中心) Oslo Metropolitan University(奥斯陆 Metropolitan 大学) University of Oslo(奥斯陆大学) Simula Research Laboratory(Simula 研究实验室) Norwegian Directorate of Health(挪威健康 Directorate)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出在无标签情况下验证LLM安全性的方法,通过构建仪器有效性链来替代真实标签,通过实验验证其有效性,并展示了在不同场景下的应用和结果。

Comments SimpleAudit Repository: https://github.com/kelkalot/simpleaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06529 2026-05-08 cs.AI cs.LG 81%

Market-Alignment Risk in Pricing Agents: Trace Diagnostics and Trace-Prior RL under Hidden Competitor State

定价代理中的市场对齐风险:轨迹诊断与隐藏竞争状态下的轨迹先验强化学习

Peiying Zhu, Sidi Chang

机构 * Blossom AI Blossom AI Labs(Blossom AI 实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在部分可观测环境下,定价代理因无法观测竞争者状态导致的市场对齐失败,提出轨迹先验强化学习方法以修复此类问题。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06024 2026-05-08 cs.AI 79%

Strat-LLM: Stratified Strategy Alignment for LLM-based Stock Trading with Real-time Multi-Source Signals

Strat-LLM:基于实时多源信号的LLM股票交易分层策略对齐

Wenliang Huang, Zengyi Yu

机构 * School of Economics(经济学院) Zhejiang University of Technology(浙江工业大学) Faculty of Education(教育学院) East China Normal University(华东师范大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Strat-LLM框架,通过分层策略对齐提升LLM在股票交易中的表现,实验显示不同模式下模型在风险控制和收益获取上的差异。

Comments Accepted by the 2026 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06132 2026-05-08 cs.AI 79%

Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents

Claw-Eval: 向可信的自主代理评估迈进

Bowen Ye, Rang Li, Qibin Yang, Yuanxin Liu, Linli Yao, Hanglong Lv, Zhihui Xie, Chenxin An, Lei Li, Lingpeng Kong, Qi Liu, Zhifang Sui, Tong Yang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The University of Hong Kong(香港大学)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 Claw-Eval通过300人验证任务覆盖9类任务,采用轨迹感知评分体系,揭示自主代理在安全、鲁棒性及一致性上的多维特性,验证传统评估方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05748 2026-05-08 cs.AI 79%

Evaluating Explainability in Safety-Critical ATR Systems: Limitations of Post-Hoc Methods and Paths Toward Robust XAI

评估安全关键ATR系统中的可解释性:事后方法的局限性及稳健XAI的路径

Vanessa Buhrmester, David Muench, Dimitri Bulatov, Michael Arens

机构 * Fraunhofer Institute of Optronics, System Technologies(弗劳恩霍夫光学与系统技术研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文评估安全关键ATR系统中可解释性方法的局限性,指出事后方法的不足,并探讨更稳健的XAI方向,强调需超越视觉合理解释以支持可靠决策。

Comments 15 pages, 1 image 1 table, ICPR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20822 2026-05-08 cs.CL cs.AI 79%

MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs

MediEval: 一个统一的医疗基准,用于评估大语言模型在患者上下文和知识引导推理中的表现

Zhan Qu, Michael Färber

机构 * TU Dresden and ScaDS.AI(德累斯顿理工大学和ScaDS.AI)

专题命中 安全评测 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI

AI总结 MediEval通过整合MIMIC-IV电子健康记录与统一的知识库,系统评估医疗模型的知识基础和上下文一致性,识别关键失败模式并提出CoRFu方法提升准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05835 2026-05-08 cs.CL cs.CY 73%

Evaluation Awareness in Language Models Has Limited Effect on Behaviour

语言模型中的评估意识对行为影响有限

Amelie Knecht, Lucas Florin, Thilo Hagendorff

机构 * University of Stuttgart(斯图加特大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 研究通过测试不同语言模型和基准测试,发现评估意识(VEA)对模型行为影响有限,注入或移除VEA对答案分布影响较小,提示高VEA率不能简单视为策略性行为或对齐篡改的证据。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06439 2026-05-08 cs.CY cs.CV cs.ET 70%

From Review to Design: Ethical Multimodal Driver Monitoring Systems for Risk Mitigation, Incident Response, and Accountability in Automated Vehicles

从评审到设计:面向风险缓解、事故响应和问责的伦理多模态驾驶员监控系统

Bilal Khana, Waseem Shariff, Rory Coyne, Muhammad Ali Farooq, Peter Corcoran

机构 * C3I Imaging Lab, School of Engineering, University of Galway(Galway大学工程学院C3I成像实验室) Royal College of Surgeons in Ireland(爱尔兰皇家外科医师学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY

AI总结 本文提出针对自动驾驶车辆中多模态驾驶员监控系统的设计框架,解决伦理和法律挑战,强调透明、可信和以人为本的设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04378 2026-05-08 cs.LG cs.CV stat.ML 70%

Aligned explanations in neural networks

神经网络中的对齐解释

Corentin Lobet, Francesca Chiaromonte

机构 * Institute of Economics and L’EMbEDS, Sant’Anna School of Advanced Studies(经济学研究所和L’EMbEDS,圣安娜高级研究院) Dept. of Statistics and Huck Institutes of the Life Sciences, Penn State University(统计系和生命科学学院,宾夕法尼亚州立大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出PiNets,一种伪线性架构,通过实例级线性模型实现解释与预测的对齐,验证了其在图像分类和分割任务中解释的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 70%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 安全评测 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13075 2026-05-08 cs.CL cs.AI 62%

DeEscalWild: A Real-World Benchmark for Automated De-Escalation Training with SLMs

DeEscalWild:一个用于自动缓和训练的现实世界基准数据集

Md Hasebul Hasan, Krity Haque Charu, Eshwara Prasad Sridhar, Shuchisnigdha Deb, Mohammad A. Islam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Industrial, Manufacturing, and Systems Engineering(工业、制造与系统工程系) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DeEscalWild基准数据集,通过多阶段流程从公开视频库中提取真实警察与平民互动数据,用于训练小型语言模型的缓和任务,实验表明经过该数据微调的SLMs在多个指标上优于基线模型。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01839 2026-05-08 cs.LG cs.AI q-bio.GN 62%

DOGMA: Weaving Structural Information into Data-centric Single-cell Transcriptomics Analysis

DOGMA: 将结构信息编织进数据导向的单细胞转录组学分析

Ru Zhang, Xunkai Li, Yaxin Deng, Sicheng Liu, Daohan Su, Qiangqiang Dai, Hongchao Qin, Rong-Hua Li, Guoren Wang, Jia Li

机构 * Department of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学系) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学(广州))

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 DOGMA通过多级生物先验知识对原始数据进行结构重塑和语义增强,结合统计对齐和细胞本体学,提升细胞图谱的生物基础性和跨物种对齐能力。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05463 2026-05-08 cs.LG cs.AI 62%

Robustness of Graph Self-Supervised Learning to Real-World Noise: A Case Study on Text-Driven Biomedical Graphs

图自监督学习在现实世界噪声中的鲁棒性:基于文本驱动的生物医学图的案例研究

Othmane Kabal, Mounira Harzallah, Fabrice Guillet, Hideaki Takeda, Ryutaro Ichise

机构 * National Institute of Informatics(国家信息研究所) Institute of Science Tokyo(东京科学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了图自监督学习在现实世界噪声下的鲁棒性,提出NATD-GSSL框架,通过对比噪声图与清洁图评估方法,发现关系重建对噪声敏感而特征重建更鲁棒,GNN架构对噪声也有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06816 2026-05-08 cs.CL cs.CY cs.HC 62%

How do datasets, developers, and models affect biases in a low-resourced language?: The Case of the Bengali Language

数据集、开发者和模型如何影响低资源语言中的偏见?:孟加拉语的案例

Dipto Das, Shion Guha, Bryan Semaan

机构 * Department of Computer Science University of Toronto Toronto Ontario Canada(计算机科学系多伦多大学多伦多安大略加拿大) Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) Department of Information Science University of Colorado Boulder Boulder Colorado United States(信息科学系科罗拉多大学波德 Boulder科罗拉多美国) University of Toronto(多伦多大学) University of Colorado Boulder(科罗拉多大学波德)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文研究了孟加拉语中基于性别、宗教和国籍身份的偏见问题,通过分析mBERT和BanglaBERT模型发现,尽管语义内容相似,但模型仍存在偏见,揭示了算法审计中方法论和数据来源的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06635 2026-05-08 cs.CL 57%

Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents

被引用但未验证:解析和评估LLM深度研究代理中的源归属

Hailey Onweller, Elias Lumer, Austin Huber, Pia Ramchandani, Vamse Kumar Subbiah, Corey Feld

机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S(普华永道商业技术与创新办公室,美国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出首个源归属评估框架,通过AST解析器大规模评估LLM生成的Markdown报告中的引用,从链接有效性、内容相关性和事实准确性三个维度验证引用可靠性,揭示了表面引用质量与事实可靠性之间的关键断层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06191 2026-05-08 cs.AI 57%

Systematic Evaluation of Large Language Models for Post-Discharge Clinical Action Extraction

大型语言模型在出院后临床行动提取中的系统评估

Shivali Dalmia, Ananya Mantravadi, Prasanna Desikan

机构 * Centific AI Research(Centific AI研究) Centific Global Solutions, Inc.(Centific全球解决方案公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文系统评估了零样本和少样本大型语言模型在安全关键的出院后临床行动提取中的表现,提出两阶段提取框架以提升临床任务的可操作性,并分析标注不一致性和模型推理与标注规范的对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03962 2026-05-08 cs.CL cs.IR 57%

How Does A Text Preprocessing Pipeline Affect Ontology Matching?

文本预处理流程如何影响本体匹配?

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang

机构 * Australian National University(澳大利亚国立大学) Monash University(莫纳什大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文研究了文本预处理流程对本体匹配的影响,发现阶段1的分词和标准化比阶段2的停用词去除和词干提取更有效,并提出两种修复虚假映射的新方法。

Comments 14 pages, 16 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20628 2026-05-08 cs.LG math.OC 57%

Position: Adopt Constraints Over Fixed Penalties in Deep Learning

位置:在深度学习中采用约束而非固定罚分

Juan Ramirez, Meraj Hashemizadeh, Simon Lacoste-Julien

机构 * Mila - Quebec AI Institute and DIRO, Université de Montréal(蒙特利尔大学Mila-魁北克人工智能研究所和DIRO)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文探讨了在深度学习中非协商性约束应直接建模而非用固定罚分替代,指出固定罚分在非凸问题中不等价,且会弱化硬约束为可权衡的软惩罚,导致求解错误。

Comments Code available at https://github.com/merajhashemi/constraints-vs-penalties

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21034 2026-05-08 cs.HC 50%

White Paper: Human-AI Collaboration in Conflict Analysis: Text Classifier Development with Peacebuilders

白皮书:冲突分析中的人机协作:与和平建设者共同开发文本分类器

Allan Kipyator Kipkemboi Cheboi, Julie Hawke, Hussam Abualfatah, Andrew Sutjahjo, Daniel Burkhardt Cerigo, Rachael Olpengs, William OBrien

专题命中 安全评测 :alignment(abstract)

AI总结 本文描述了肯尼亚和苏丹的和平建设者与数据科学家合作,开发基于AI的文本分类器以监控网络极化和仇恨言论,强调参与式标注过程和模型评估的改进效果。

Comments 17 pages, 5 tables V2 published with Build Up report formatting; no content changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05391 2026-05-08 cs.HC 50%

Every(bot) Makes Mistakes: Coding Big Five Personalities, Context, and Tone into an LLM Chatbot Recovery Code Framework

每个( bot )都会犯错:将大五人格、情境和语气编码到LLM聊天机器人恢复代码框架中

Rachel Hill, Tom Owen, Julian Hough

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一个结合大五人格、情境和语气的LLM聊天机器人恢复代码框架,通过实验验证其在提升错误恢复质量方面的有效性。

Comments 14 pages of main content, 3 figures, 4 tables, 9 appendices. This paper has been submitted to the Becker Friedman Institute 2026 AI in Social Sciences conference for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13281 2026-05-08 cs.CV 50%

VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?

VideoASMR-Bench: AI生成的ASMR视频能否欺骗视觉语言模型和人类?

Jiaqi Wang, Weijia Wu, Yi Zhan, Rui Zhao, Ming Hu, James Cheng, Wei Liu, Philip Torr, Kevin Qinghong Lin

机构 * The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Monash University(墨尔本大学) Video Rebirth University of Oxford(牛津大学)

专题命中 安全评测 :alignment(abstract)

AI总结 VideoASMR-Bench通过细粒度音频视觉感知和感官沉浸性评估AI生成ASMR视频的检测能力,揭示了当前VLMs在识别AI生成ASMR视频上的不足以及VGMs生成逼真ASMR视频的能力。

Comments Code is at https://github.com/video-reality-test/video-reality-test, page is at https://video-reality-test.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏