arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-22 至 2026-05-22 共收录 24 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 24 篇

2602.07340 2026-05-22 cs.LG 88%

Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control

通过选择性几何控制重新审视LLM安全对齐的鲁棒性

Yonghui Yang, Wenjian Tao, Jilong Liu, Xingyu Zhu, Junfeng Fang, Weibiao Huang, Le Wu, Richang Hong, Tat-Sent Chua

机构 * National University of Singapore(新加坡国立大学) Hefei University of Technology(合肥工业大学) ST Engineering Ltd., Singapore(新加坡ST工程有限公司)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 本文通过优化几何视角重新审视LLM安全对齐的鲁棒性,提出ShaPO框架,通过选择性几何控制在对齐关键参数子空间上强制最坏对齐目标,提升安全鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13372 2026-05-22 cs.AI cs.LG 86%

MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents

MoralityGym:用于评估序列决策代理中分层道德对齐的基准

Simon Rosen, Siddarth Singh, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Victoria Williams, Benjamin Rosman, Geraud Nangue Tasse, Steven James

机构 * University of the Witwatersrand(威特沃特斯兰大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MoralityGym基准,通过将道德规范表示为有序的规范约束,评估序列决策代理中分层道德对齐的挑战,展示了98个伦理困境问题,并通过心理学和哲学的见解改进了伦理决策方法。

Comments Accepted at AAMAS 2026

Journal ref Proc of the 25th International Conference on Autonomous Agents and Multiagent Systems AAMAS 2026, Paphos, Cyprus, May 25 to 29, 2026, IFAAMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22720 2026-05-22 cs.AI cs.HC 83%

Can AI Make Conflicts Worse? An Alignment Failure in LLM Deployment Across Conflict Contexts

AI 是否会加剧冲突?在冲突情境下LLM部署中的对齐失败

Andrii Kryshtal

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了AI模型在冲突情境下可能产生的对齐失败问题,通过测试九种模型配置,发现其在处理冲突相关场景时存在错误等价、否认种族灭绝和未能识别种族歧视术语等问题,提出了首个评估框架以提高AI在冲突情境下的安全性。

Comments Preprint. 8 pages, 2 figures. Code and evaluation framework: https://github.com/akryshtal/conflict-sensitivity-eval-bloom

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21712 2026-05-22 cs.CL 83%

Broadening Access to Transportation Safety Data with Generative AI: A Schema-Grounded Framework for Spatial Natural Language Queries

通过生成式AI拓宽交通安全管理数据的可及性:一种基于模式的时空自然语言查询框架

Mahdi Azhdari, Eric J. Gonzales

机构 * Department of Civil and Environmental Engineering, University of Massachusetts Amherst(麻省大学阿姆赫斯特分校土木与环境工程系)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出了一种基于模式的自然语言接口,利用大型语言模型解释用户意图,同时保持确定性和可审查的执行,以解决交通安全管理数据访问不均的问题,通过整合事故记录、道路属性和地理空间数据,提升公共部门的安全规划能力。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15338 2026-05-22 cs.LG cs.CL 81%

Discovering Implicit Large Language Model Alignment Objectives

发现隐式大语言模型对齐目标

Edward Chen, Sanmi Koyejo, Carlos Guestrin

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Obj-Disco框架,通过自动分解对齐奖励信号为可解释的目标,解决现有方法的不足,验证了框架在多种任务和模型上的鲁棒性,并发现潜在的对齐偏差。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15774 2026-05-22 cs.CL 79%

MemEvoBench: Benchmarking Safety Risks from Memory Misevolution in LLM Agents

MemEvoBench: 评估LLM代理中内存误进化带来的安全风险

Weiwei Xie, Shaoxiong Guo, Fan Zhang, Tian Xia, Xue Yang, Lizhuang Ma, Junchi Yan, Qibing Ren

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shandong University(山东大学) Duke University(杜克大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出MemEvoBench,首个评估LLM代理长期内存安全性的基准,针对对抗性内存注入、噪声工具输出和偏见反馈,通过7个领域36种风险类型的问题任务和20个Agent-SafetyBench环境改编的工作流任务,验证了内存进化对安全性的重大影响,指出静态提示防御不足,亟需加强LLM代理内存进化的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14987 2026-05-22 cs.CL cs.DB 77%

Beyond Benchmark Islands: Toward Representative Trustworthiness Evaluation for Agentic AI

超越基准岛屿:面向代理AI的代表性可信度评估

Jinhu Qi, Yifan Li, Minghao Zhao, Wentao Zhang, Zijian Zhang, Yaoman Li, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Macao Polytechnic University(澳门理工学院) Jilin University(吉林大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出了一种基于五属性的代理可信度定义,并引入了Holographic Agent Assessment Framework(HAAF)框架,通过场景 manifold 的静态策略分析、沙盒模拟、社会伦理对齐评估和分布感知采样,实现对代理系统在社会技术场景中的可信度评估,展示了其在13个模型家族上的跨家族迁移实验结果。

Comments 9 pages, 3 figures, 8 tables. Submitted to the Agent4IR Workshop at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20665 2026-05-22 cs.CV cs.AI 74%

The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm

视见之代价:在单体范式内实现可信的多模态推理

Karan Goyal

机构 * IIIT Delhi, India(德里印度理工学院)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文提出了一种新的多模态评估方法,通过信息论视角揭示了多模态推理中的视见代价问题,提出了三个新指标并提出了语义充分性准则,挑战了传统多模态评估方法。

Comments Addresses practical viability of Vlabel construction. Writing is grounded. Acknowledgement is duly added

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09252 2026-05-22 cs.CL 70%

LLM Agents Already Know When to Call Tools -- Even Without Reasoning

LLM Agents Already Know When to Call Tools -- Even Without Reasoning

Chung-En Sun, Linbo Liu, Ge Yan, Zimo Wang, Tsui-Wei Weng

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 安全评测 :trustworthy(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出When2Tool基准,通过18个环境研究工具调用的必要性,发现模型已能识别何时需要调用工具,但生成时未能有效利用此知识,提出Probe&Prefill方法显著减少工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16545 2026-05-22 cs.LG cs.AI cs.CL 67%

Symphony for Speech-to-Text: Supporting Real-Time Medical Voice Interfaces

Symphony for Speech-to-Text: 支持实时医疗语音接口

Arne Nix, Robert James, Lasse Borgholt, Anna B. Ekner, Lana Krumm, Julius Severin, Dan Engel, Lars Maaløe, Jakob Havtorn

机构 * Corti

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Symphony for Speech-to-Text,一种医疗级实时语音识别系统,通过分解转录过程为识别、格式化和上下文校正等专业化组件,优化医学术语召回,实现实时临床结构文本生成,并在医疗场景中显著优于现有系统,同时在通用领域表现不逊。

Comments Updated with a correction and improvement to Symphony's performance in spoken punctuation evaluation (R_punct, P_punct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06597 2026-05-22 cs.CL cs.AI cs.LG 67%

UniSD: Towards a Unified Self-Distillation Framework for Large Language Models

UniSD:面向大语言模型的统一自蒸馏框架

Yiqiao Jin, Yiyang Wang, Lucheng Fu, Yijia Xiao, Yinyi Luo, Haoxin Liu, B. Aditya Prakash, Josiah Hester, Jindong Wang, Srijan Kumar

机构 * Georgia Institute of Technology(佐治亚理工学院) University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出UniSD框架,系统研究自蒸馏方法,通过整合多种机制提升监督可靠性、表征对齐和训练稳定性,从而在多个基准和模型上验证自蒸馏的有效性,并构建出性能最优的UniSDfull流水线。

Comments Website: https://unifiedsd.github.io/ Code: https://github.com/Ahren09/UniSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22608 2026-05-22 cs.CL cs.AI 62%

Agentic CLEAR: Automating Multi-Level Evaluation of LLM Agents

Agentic CLEAR: 自动化多层级评估LLM代理

Asaf Yehudai, Lilach Eden, Michal Shmueli-Scheuer

机构 * IBM Research(IBM研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Agentic CLEAR框架,通过多层级细粒度分析实现LLM代理的自动化评估,提供高质量的数据驱动反馈并预测任务成功率。

Comments ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22455 2026-05-22 cs.CV cs.AI cs.LG physics.optics 62%

Making the Discrete Continuous: Synthetic RAW Augmentations for Fine-Grained Evaluation of Person Detection Performance in Low Light

使离散的成为连续的:合成RAW增强用于细粒度评估人检测性能在低光环境

Valeria Pais, Malena Mendilaharzu, Daniele Faccio, Luis Oala, Christoph Clausen, Bruno Sanguinetti

机构 * University of Glasgow(格拉斯哥大学) Dotphoton

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种合成RAW增强方法,用于在低光条件下更准确地评估人检测模型的性能,通过生成与相机传感器噪声模型匹配的低光样本,以改善基准测试的数据覆盖。

Comments Accepted non-archival paper at the CVPR 2026 AUTOPILOT Workshop (Autonomous Understanding Through Open-world Perception and Integrated Language Models for On-road Tasks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22568 2026-05-22 cs.CR cs.AI 57%

Measuring Security Without Fooling Ourselves: Why Benchmarking Agents Is Hard

在不欺骗自己的情况下衡量安全:为什么基准测试智能体是困难的

Sahar Abdelnabi, Chris Hicks, Konrad Rieck, Ahmad-Reza Sadeghi

机构 * ELLIS Institute Tübingen & MPI-IS & Tübingen AI Center(图宾根ELLIS研究所及MPI-IS与图宾根人工智能中心) The Alan Turing Institute(艾伦·图灵研究所) BIFOLD & Technische Universität Berlin(BIFOLD与柏林技术大学) Technische Universität Darmstadt(达姆施塔特技术大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文探讨了在安全关键角色中评估AI代理的基准测试存在的核心挑战,包括基准漏洞、时间滞后的不准确性以及运行时的不确定性,并提出了构建更可靠和可信评估框架的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21413 2026-05-22 cs.AI 57%

Teaching AI Through Benchmark Construction: QuestBench as a Course-Based Practice for Accountable Knowledge Work

通过基准构建教学AI:QuestBench作为一门课程实践以实现问责知识工作

Haiyang Shen, Jiuzheng Wang, Taian Guo, Mugeng Liu, Wenchun Jing, Chongyang Pan, Siqi Zhong, Zhiyang Chen, Weichen Bi, Yudong Han, Xiaoying Bai, Yun Ma

机构 * Peking University(北京大学) Advanced Institute of Big Data(大数据高级研究院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过构建基准来教学AI,介绍QuestBench作为一门课程实践,帮助学生理解在AI时代知识工作的责任。

Comments 24 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12506 2026-05-22 cs.LG 57%

On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs

关于RL微调VLMs的鲁棒性和链式思维一致性

Rosie Zhao, Anshul Shah, Xiaoyu Zhu, Xinke Deng, Zhongyu Jiang, Yang Yang, Joerg Liebelt, Arnab Mondal

机构 * Apple(苹果公司) OpenAI

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文研究了RL微调VLMs在视觉推理任务中的鲁棒性和链式思维一致性,发现文本扰动和CoT不一致会显著降低模型的鲁棒性和信心,而闭源模型在保持鲁棒性和推理一致性方面表现更佳,指出这一差距源于当前开源RL微调的不足而非任务本身的限制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20302 2026-05-22 cs.LG cs.CV 57%

Neural Collapse by Design: Learning Class Prototypes on the Hypersphere

按设计实现神经崩溃:在超球面上学习类别原型

Panagiotis Koromilas, Theodoros Giannakopoulos, Mihalis A. Nicolaou, Yannis Panagakis

机构 * The Cyprus Institute(塞浦路斯研究所) University of Athens(雅典大学) Archimedes AI/Athena Research Center(阿基米德AI/阿泰纳研究中心) University of Cyprus(塞浦路斯大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文研究了监督分类的理论最优解神经崩溃(NC),指出交叉熵(CE)和监督对比学习(SCL)两种主流范式在实践中无法达到该最优解。作者提出通过在超球面上对比原型的方法,改进了CE和SCL,从而在多个基准测试中实现了更接近NC的性能。

Comments 43rd International Conference on Machine Learning (ICML 2026); Code: https://github.com/pakoromilas/nc_by_design

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17998 2026-05-22 cs.SE cs.AI 57%

Verify-Gated Completion as Admission Control in a Governed Multi-Agent Runtime: A Bounded Architecture Case Study

验证门控完成作为受控多智能体运行时的准入控制:一个有界架构案例研究

Hai-Duong Nguyen, Xuan-The Tran

机构 * Vietnam Maritime University(越南海防大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文研究了验证门控完成作为受控多智能体运行时的准入控制机制,通过一个有界参考实现,探讨了可审计的验证门控完成所能支持的信息,并分析了其在不同场景下的表现和限制。

Comments 39 pages, 2 figures, 17 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17596 2026-05-22 cs.AI 57%

NeuSymMS: A Hybrid Neuro-Symbolic Memory System for Persistent, Self-Curating LLM Agents

NeuSymMS:一种混合神经符号记忆系统,用于持久、自管理的LLM代理

Mujahid Sultan, Sri Thuraisamy, Daya Rajaratnam

机构 * iVedha Corporation(iVedha公司) MLSoft Inc.(MLSoft公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 NeuSymMS通过混合神经符号架构,使LLM代理能够在多个会话中学习、记忆和推理用户信息,其核心方法是结合神经网络的事实提取和基于CLIPS的专家系统,主要贡献是提出了一个支持自管理记忆的双视野记忆模型。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15606 2026-05-22 cs.AR 50%

Spec2Cov: An Agentic Framework for Code Coverage Closure of Digital Hardware Designs

Spec2Cov: 一种用于数字硬件设计代码覆盖率闭合的代理框架

Sean Lowe, Elias Hilaneh, Alma Babbit, Nakul Gopalan, Vidya Chhabria, Aman Arora

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出了一种基于代理框架的代码覆盖率闭合方法,利用大型语言模型和硬件仿真器的协同工作,自动迭代生成测试刺激以加速覆盖率闭合,并在不同复杂度的设计上实现了高达49%的覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22068 2026-05-22 cs.CV 50%

COCOTree: A Dataset and Benchmark for Open Tree-Structured Visual Decomposition

COCOTree: 一个用于开放树状视觉分解的数据集和基准

Junhyub Lee, Seunghun Chae, Hyosu Kim

机构 * Chung-Ang University(Chung-Ang大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出COCOTree数据集和基准,通过自动化生成管道和开放词汇空间,实现了对复杂物理组装的长尾分布的捕捉,并提出了Open Tree Quality (OTQ)评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21882 2026-05-22 cs.CV 50%

Thermo-VL: Extending Vision-Language Models to Thermal Infrared Perception

Thermo-VL:扩展视觉语言模型以适应热红外感知

Rusiru Thushara, Yasiru Ranasinghe, Jay Paranjape, Vishal M. Patel

机构 * Department of Electrical & Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出Thermo-VL,一种基于热红外感知的视觉语言模型,通过引入可训练的热编码器和文本引导的双注意力融合模块,提升了低光照条件下的多光谱融合能力,并在热红外和RGB+热红外推理任务中取得显著成果。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21824 2026-05-22 cs.CR cs.SE 50%

Quality-Assured Fuzz Harness Generation via the Four Principles Framework

通过四项原则框架实现质量保障的模糊测试 harness 生成

Ze Sheng, Dmitrijs Trizna, Luigino Camastra, Zhicheng Chen, Qingxiao Xu, Jeff Huang

专题命中 安全评测 :safety(abstract)

AI总结 本文提出QuartetFuzz,一种自主的harness生成系统,通过四项原则框架(逻辑正确性、API协议合规性、安全边界尊重和入口点充分性)系统地提高生成harness的正确性,并在多个开源项目上验证了其有效性,发现了多个漏洞并修复了部分问题。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21788 2026-05-22 cs.CV cs.RO 50%

SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching

SceneGraphGrounder: 通过结构化场景图匹配实现零样本3D视觉定位

Xuefei Sun, Xujia Zhang, Brendan Crowe, Doncey Albin, Christoffer Heckman

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出SceneGraphGrounder框架,通过结构化场景图匹配将3D定位问题转化为结构化图匹配问题,利用视觉标记提示策略从2D视图推断物体间关系,并在3D场景图中建立持久编码,从而在ScanRefer基准测试中实现了零样本条件下与现有方法相当的性能,并在真实机器人部署中验证了其在长周期物理环境中的鲁棒空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏