arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2605.14604 2026-05-15 cs.AI cs.HC 79%

Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks

谄媚是一种教育安全风险:为什么LLM导师需要谄媚基准

Enkelejda Kasneci, Gjergji Kasneci

机构 * Technical University of Munich, Munich, Germany(慕尼黑技术大学,慕尼黑,德国) Munich Center for Machine Learning, Munich, Germany(慕尼黑机器学习中心,慕尼黑,德国)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文探讨LLM导师需通过谄媚基准测试来评估其在教育中的安全风险,指出模型在面对社会-知识压力时的脆弱性及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14420 2026-05-15 cs.AI 79%

DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping

DVMap:通过高共识人口价值映射实现细粒度多元化价值对齐

Pengyun Zhu, Yuqi Ren, Zhen Wang, Lei Yang, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院 TJUNLP 实验室,中国)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出DVMap框架,通过多维人口约束实现细粒度多元化价值对齐,利用结构化推理机制和群体相对策略优化,提升模型在跨人口、国家和价值测试中的泛化能力。

Comments Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26100 2026-05-15 cs.AI 79%

AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models

AgenticEval: 向大型语言模型的代理和自演化安全评估迈进

Yixu Wang, Xin Wang, Yang Yao, Xinyuan Li, Xibang Yang, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The University of Hong Kong(香港大学) East China Normal University(华东师范大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出AgenticEval框架,通过自演化评估流程动态检测LLM安全风险,实验显示模型安全评分随评估强化而下降,揭示静态评估的局限性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13579 2026-05-14 cs.AI 79%

Position: Assistive Agents Need Accessibility Alignment

位置:辅助代理需要可访问性对齐

Jie Hu, Changyuan Yan, Yu Zheng, Ziqian Wang, Jiaming Zhang

机构 * School of Artificial Intelligence and Robotics(人工智能与机器人学院) Hunan University(湖南大学) Changsha, China(中国长沙)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文指出辅助代理设计需考虑可访问性对齐,通过分析778个任务实例,揭示现有代理在辅助场景中的失败原因,并提出生命周期导向的设计流程。

Comments 9 pages, 1 figures, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12882 2026-05-14 cs.CL cs.CV 79%

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

CiteVQA:可信赖文档智能的证据归因基准测试

Dongsheng Ma, Jiayu Li, Zhengren Wang, Yijie Wang, Jiahao Kong, Weijun Zeng, Jutao Xiao, Jie Yang, Wentao Zhang, Bin Wang, Conghui He

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 CiteVQA通过要求模型返回元素级边界框引用,评估文档理解中的证据归因,揭示了现有评估方法的可靠性缺口,主要贡献是引入Strict Attributed Accuracy指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12799 2026-05-14 cs.MA cs.CY cs.MM 79%

Synthesizing the Expert: A Validated Multimodal Dataset for Trustworthy AI-Assisted Swimming Coaching

合成专家:一个经过验证的多模态数据集用于可信的人工智能辅助游泳教练

Ahmad Al-Kabbany, Esraa Kassem

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

AI总结 本文提出一个多模态数据集,用于构建可信的人工智能游泳教练系统,通过多代理LLM架构生成1864个验证的'问题-上下文-答案'三元组,提升自动化指导的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02022 2026-05-14 cs.AI 79%

ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis

ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断

Yu Li, Haoyu Luo, Yuejin Xie, Yuqian Fu, Zhonghao Yang, Shuai Shao, Qihan Ren, Wanying Qu, Yanwei Fu, Yujiu Yang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) KAUST(卡塔尔人工智能科学中心) East China Normal University(华东师范大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12332 2026-05-13 cs.AI 79%

Towards Automated Air Traffic Safety Assessment Around Non-Towered Airports Using Large Language Models

基于大语言模型的非塔台机场飞行安全评估自动化方法研究

Torsten Darrell, Mahyar Ghazanfari, Jordan Kam, Alexandre Bayen, Amin Tabrizian, Peng Wei

机构 * Research Intern, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系研究实习生) Ph.D. Student, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系博士生) Undergraduate Student, Aerospace Program, University of California, Berkeley(加州大学伯克利分校航空航天项目本科生) Full Professor, Department of Electrical Engineering and Computer Science, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系教授) Ph.D. Student, Department of Computer Science, George Washington University(乔治华盛顿大学计算机科学系博士生) Associate Professor, Department of Mechanical and Aerospace Engineering, George Washington University(乔治华盛顿大学机械与航空航天工程系副教授)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出利用视觉语言模型分析非塔台机场CTAF通讯、气象数据和飞行轨迹,通过实证研究和合成数据验证,展示框架在识别飞行冲突中的有效性,表明VLM在非塔台机场安全评估中的潜力。

Comments 25 pages, 17 figures, 5 tables, Accepted to AIAA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11769 2026-05-13 cs.CL 79%

Safety-Oriented Evaluation of Language Understanding Systems for Air Traffic Control

面向安全的语言理解系统在空交通管制中的评估

Yujing Chang, Yash Guleria, Duc-Thinh Pham, Nhut-Huy Pham, Ningli Wang, Vu N. Duong, Sameer Alam

机构 * ATMRI, Nanyang Technological University (NTU), Singapore(航空交通管理研究所,南洋理工大学(NTU),新加坡) School of Management, Indian Institute of Technology Mandi, India(管理学院,印度理工学院曼迪分校,印度) Centre of AI Research, VinUniversity, Vietnam(人工智能研究中心,文大学,越南)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出面向安全的评估框架,揭示现有LLM在空交通管制中的可靠性不足,指出需建立后果意识的评估协议以确保AI辅助系统的安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11712 2026-05-13 cs.AI 79%

Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance

迈向稳定的值对齐:引入独立模块以实现一致的价值引导

Wenhao Chen, Sirui Sun, Shengyuan Bai, Guojie Song

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) Yuanpei College, Peking University(北京大学元培学院) State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 安全评测 :alignment(title);safety(abstract);分类 cs.AI

AI总结 本文提出SVGT模型,通过独立的价值模块解决大语言模型与人类价值观对齐的问题,采用独立价值建模和显式行为引导,提升价值表达的稳定性,实验显示有效降低有害评分。

Comments Accepted to ICML 2026 (Spotlight). 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11693 2026-05-13 cs.AI 79%

Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

超越文本的衡量:通过质量、对齐和多样性评估多模态摘要

Abid Ali, Diego Molla-Aliod, Usman Naseem

机构 * School of Computing, Macquarie University(麦考瑞大学计算学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出MM-Eval框架,整合文本质量、跨模态对齐和视觉多样性评估,通过学习聚合模型优化多模态摘要的综合评价,揭示事实一致性对整体质量的关键作用。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11687 2026-05-13 cs.AI 79%

Persistent and Conversational Multi-Method Explainability for Trustworthy Financial AI

持久且可对话的多方法可解释性用于可信金融AI

Georgios Makridis, Georgios Fatouros, John Soldatos, George Katsis, Dimosthenis Kyriazis

机构 * University of Piraeus, Greece(希腊比雷埃克斯大学) ExpertAI-Lux S.à r.l(ExpertAI-Lux公司)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出一种用于金融情感分析的以人为中心的可解释AI架构,结合持久化存储、多方法解释三角验证和自动化评估,提升金融AI的可信度和可解释性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10386 2026-05-12 cs.AI 79%

GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic

GuardAD: 通过马尔可夫安全逻辑保障自动驾驶MLLMs

Tianyuan Zhang, Peng Yue, Zihao Peng, Jiangfan Liu, Zonghao Ying, Jiakai Wang, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 GuardAD通过马尔可夫逻辑形式化提升自动驾驶MLLMs的安全性,减少事故率并提升任务性能,经实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10146 2026-05-12 cs.AI cs.CR 79%

Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing

在恶意知识编辑下知识密集推理安全风险的基准测试

Qinghua Mao, Xi Lin, Jinze Gu, Jun Wu, Siyuan Li, Yuliang Chen

机构 * School of Computer Science(计算机科学学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出EditRisk-Bench,通过整合恶意场景和多级推理任务,系统评估知识编辑对推理行为的影响,揭示恶意知识编辑导致错误推理的风险因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08486 2026-05-12 cs.CY 79%

Teachers' Perceived Benefits and Risks of AI Across Fifty-Five Countries: An Audit of LLM Alignment and Steerability

教师对AI在教育中的感知益处与风险:对LLM对齐与可控性的审计

Yan Tao, Olga Viberg, Deepak Varuvel Dennison, Zhikun Wu, René F. Kizilcec

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

AI总结 研究通过分析55国教师对AI的感知益处与风险,评估LLM在教育领域应用的对齐与可控性,揭示模型输出与现实差异,警示LLM不能替代教师直接反馈。

Comments Accepted as full paper to the 13th ACM Conference on Learning @ Scale (L@S'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01307 2026-05-12 cs.SE cs.AI 79%

Document Retrieval Augmented Fine-Tuning (DRAFT) for safety-critical software assessments

用于安全关键软件评估的文档检索增强微调(DRAFT)

Regan Bolton, Mohammadreza Sheikhfathollahi, Simon Parkinson, Vanessa Vulovic, Gary Bamford, Dan Basher, Howard Parkinson

机构 * Digital Transit Limited, 3M Buckley Innovation Centre, UK, HD1 3BD(数字交通有限公司,3M Buckley创新中心,英国,HD1 3BD) Department of Computer Science, University of Huddersfield, UK, HD1 3DH(计算机科学系,赫德瑟菲尔德大学,英国,HD1 3DH)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出DRAFT方法,通过引入双检索架构和半自动化数据集生成,提升大型语言模型在安全关键合规评估中的准确性与证据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06230 2026-05-11 cs.AI cs.DC 79%

Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence

Safactory:一个可扩展的代理基础设施,用于训练可信的自主智能

Xinquan Chen, Zhenyun Yin, Shan He, Bin Huang, Shanzhe Lei, Pengcheng Shi, Kun Cai, Bei Chen, Bangwei Liu, Zeyu Kang, Chao Huang, Yang Zhang, Wenjie Li, Ruijun Ge, Yajie Wang, Tianshun Fang, Tianyang Xu, Yiwen Cong, Meng Jin, Gaolei Li, Xuansheng Wu, Linhan Liu, Zijing He, An Li, Yan Teng, Xin Tan, Dongrui Liu, Jing Shao, ChaoChao Lu, Ji He, Jie Li, Chunfeng Song, Jinya Xu, Fan Song, Shujie Wang, Jianmin Qian, Jie Hou, Xuhong Wang, Yingchun Wang, Hui Wang, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出Safactory,一个可扩展的代理工厂,用于训练可信的自主智能。该框架整合了三个紧密耦合的平台,以实现长期决策、工具使用和真实环境交互的可靠性和连续改进。

Comments 50 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03728 2026-05-11 cs.CV cs.AI 79%

CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval

CSMCIR: 基于记忆库的增强对称对齐用于复合图像检索

Zhipeng Qian, Zihan Liang, Yufei Ma, Ben Chen, Huangyu Dai, Yiwei Ma, Jiayi Ji, Chenyi Lei, Han Li, Xiaoshuai Sun

机构 * Kuaishou Technology(快播科技) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出CSMCIR,通过多级链式思维提示策略、对称双塔架构和熵基记忆库策略,实现高效查询-目标对齐,提升复合图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06024 2026-05-08 cs.AI 79%

Strat-LLM: Stratified Strategy Alignment for LLM-based Stock Trading with Real-time Multi-Source Signals

Strat-LLM:基于实时多源信号的LLM股票交易分层策略对齐

Wenliang Huang, Zengyi Yu

机构 * School of Economics(经济学院) Zhejiang University of Technology(浙江工业大学) Faculty of Education(教育学院) East China Normal University(华东师范大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Strat-LLM框架,通过分层策略对齐提升LLM在股票交易中的表现,实验显示不同模式下模型在风险控制和收益获取上的差异。

Comments Accepted by the 2026 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06132 2026-05-08 cs.AI 79%

Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents

Claw-Eval: 向可信的自主代理评估迈进

Bowen Ye, Rang Li, Qibin Yang, Yuanxin Liu, Linli Yao, Hanglong Lv, Zhihui Xie, Chenxin An, Lei Li, Lingpeng Kong, Qi Liu, Zhifang Sui, Tong Yang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The University of Hong Kong(香港大学)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 Claw-Eval通过300人验证任务覆盖9类任务,采用轨迹感知评分体系,揭示自主代理在安全、鲁棒性及一致性上的多维特性,验证传统评估方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05748 2026-05-08 cs.AI 79%

Evaluating Explainability in Safety-Critical ATR Systems: Limitations of Post-Hoc Methods and Paths Toward Robust XAI

评估安全关键ATR系统中的可解释性:事后方法的局限性及稳健XAI的路径

Vanessa Buhrmester, David Muench, Dimitri Bulatov, Michael Arens

机构 * Fraunhofer Institute of Optronics, System Technologies(弗劳恩霍夫光学与系统技术研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文评估安全关键ATR系统中可解释性方法的局限性,指出事后方法的不足,并探讨更稳健的XAI方向,强调需超越视觉合理解释以支持可靠决策。

Comments 15 pages, 1 image 1 table, ICPR workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00731 2026-05-04 cs.SI cs.AI 79%

Empowering Heterogeneous Graph Foundation Models via Decoupled Relation Alignment

通过解耦关系对齐增强异质图基础模型

Ziyu Zheng, Yaming Yang, Zhe Wang, Ziyu Guan, Wei Zhao

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出DRSA方法,通过解耦特征语义与关系结构,解决异质图中跨类型特征偏移和领域内关系缺口问题,提升跨域和少样本知识迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00689 2026-05-04 cs.CL cs.CR 79%

ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models

ML-Bench&Guard: 政策导向的多语言安全基准与大型语言模型的防护机制

Yunhan Zhao, Zhaorun Chen, Xingjun Ma, Yu-Gang Jiang, Bo Li

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Fudan University(复旦大学) University of Chicago(芝加哥大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出ML-Bench和ML-Guard,通过区域法规构建多语言安全基准,并开发基于扩散模型的防护系统,实现文化与法律一致的多语言安全评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00326 2026-05-04 cs.CL cs.CV 79%

Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification

零样本二元视觉语言安全分类中的提示诱导分数方差

Charles Weng, Dingwen Li, Alexander Martin

机构 * Johns Hopkins University(约翰霍普金斯大学) Independent(独立)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究发现零样本视觉语言模型安全分类器的单提示首词概率在语义等价提示改写下不可靠,提出训练自由的均值集成方法提升模型性能,推荐提示家族评估与均值聚合作为标准无标签可靠性基准。

Comments Preprint. 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00227 2026-05-04 cs.CL 79%

Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations

基于角色的AI陪伴在多轮对话中的安全性评估

Prerna Juneja, Lika Lomidze

机构 * Seattle University(西雅图大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出首个端到端可扩展框架,用于可控模拟和评估AI陪伴应用的多轮交互安全性,通过构建角色、生成场景、模拟对话及评估危害,分析Replika对高风险用户群体的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14044 2026-05-01 cs.CV cs.AI 79%

OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving

OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶

Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) MEGVII Technology(美科维七科技) AFARI

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14719 2026-05-01 cs.AI 79%

Policy-Grounded Safety Evaluation of 20 Large Language Models

基于政策的安全性评估:20个大语言模型

Juan Manuel Contreras

机构 * Aymara

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出Aymara AI平台,用于生成和管理定制化的政策导向安全性评估。通过评估20个商业大语言模型在10个现实安全领域中的表现,揭示了模型在不同领域中的显著性能差异,强调了构建可扩展、可定制工具的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26411 2026-04-30 cs.LG 79%

Unifying Runtime Monitoring Approaches for Safety-Critical Machine Learning: Application to Vision-Based Landing

统一运行时监控方法以确保安全关键机器学习:应用于基于视觉的着陆

Mathieu Dario, Florent Chenevier, Kévin Delmas, Joris Guerin, Jérémie Guiochet

机构 * LAAS-CNRS(法国图卢兹Laas--cnrs研究所) University of Toulouse(图卢兹大学) Thales(泰勒斯) ONERA(法国国家航空器研究与测试中心) Espace-Dev, IRD, Université de Montpellier(Espace-Dev, 法国国家农业与食品研发机构, 图卢兹大学) Universidade Federal do Rio Grande do Norte(巴西北里奥格兰德联邦大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出统一框架,将运行时监控分为三种类型,通过航空安全应用实验验证其有效性,促进监控设计与评估。

Comments 15 pages, 5 figures, 3 tables, submitted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14858 2026-04-30 cs.AI cs.SE 79%

Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-Codex

轨迹安全评估与诊断的基准测试:OpenClaw和Codex中的ATBench-Claw和ATBench-Codex

Zhonghao Yang, Yu Li, Yanxu Zhu, Tianyi Zhou, Yuejin Xie, Haoyu Luo, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出ATBench-Claw和ATBench-Codex,用于评估和诊断OpenClaw和Codex环境中的轨迹安全,通过定制安全分类法实现基准测试的可扩展性。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24902 2026-04-29 cs.CY cs.SE 79%

Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains

微调后的安全性漂移:来自高风险领域的证据

Emaan Bilal Khan, Amy Winecoff, Miranda Bogen, Dylan Hadfield-Menell

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 研究发现微调导致的安全性变化显著且不一致,挑战了基于基础模型的安全性假设,需重新评估微调模型以管理下游风险。

详情

展开后加载摘要…

URL PDF HTML 收藏