arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-01 至 2026-05-01 共收录 19 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 19 篇

2512.01166 2026-05-01 cs.CY 83%

Evaluating AI Providers' Frontier Safety Frameworks

评估AI提供商的前沿安全框架

Lily Stelling, Malcolm Murray, Bruno Galizzi, Max Schaffelder, Siméon Campos, Henry Papadatos

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.CY

AI总结 本文评估12家AI公司的前沿安全框架,通过65项加权标准评估四个维度,发现框架存在诸多缺失或不明确之处,评分范围从34%到8%,建议未来需完善以提升问责功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22500 2026-05-01 cs.CV cs.AI 83%

OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment

OR-VSKC:通过合成数据引导对齐解决手术室中的视觉-语义知识冲突

Weiyi Zhao, Xiaoyu Tan, Liang Liu, Sijia Li, Youwei Song, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) Tencent YouTu Lab(腾讯优图实验室) Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出OR-VSKC基准,通过合成数据引导对齐解决手术室中的视觉-语义知识冲突,评估多模态大语言模型的可靠性,并展示微调后的模型在未见视角上的鲁棒性。

Comments 13 pages, 5 figures. The dataset and appendix are available at https://github.com/zgg2577/VS-KC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14044 2026-05-01 cs.CV cs.AI 79%

OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving

OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶

Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) MEGVII Technology(美科维七科技) AFARI

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14719 2026-05-01 cs.AI 79%

Policy-Grounded Safety Evaluation of 20 Large Language Models

基于政策的安全性评估:20个大语言模型

Juan Manuel Contreras

机构 * Aymara

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出Aymara AI平台,用于生成和管理定制化的政策导向安全性评估。通过评估20个商业大语言模型在10个现实安全领域中的表现,揭示了模型在不同领域中的显著性能差异,强调了构建可扩展、可定制工具的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02515 2026-05-01 cs.CL cs.AI cs.LG 75%

FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning

FinChain:可验证链式思维金融推理的符号基准

Zhuohan Xie, Daniil Orel, Rushil Thareja, Dhruv Sahnan, Hachem Madmoun, Fan Zhang, Debopriyo Banerjee, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Jinyan Su, Aaryamonvikram Singh, Rui Xing, Rania Elbadry, Chen Xu, Haonan Li, Fajri Koto, Ivan Koychev, Tanmoy Chakraborty, Yuxia Wang, Salem Lahlou, Veselin Stoyanov, Sophia Ananiadou, Preslav Nakov

机构 * MBZUAI Syllogia The University of Tokyo(东京大学) The Fin AI(Fin AI) Cornell University(康奈尔大学) The University of Melbourne(墨尔本大学) IIT Delhi(德里理工学院) The University of Manchester(曼彻斯特大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FinChain通过符号模板和可执行代码实现可验证的金融链式推理,评估26种LLM发现其在符号金融推理中存在明显缺陷,领域适应和数学增强的微调模型能显著缩小差距。

Comments 24 pages, includes 12 figures and 9 tables; introduces the FinChain benchmark and ChainEval metric

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27132 2026-05-01 cs.AI 70%

TRUST: A Framework for Decentralized AI Service v.0.1

TRUST:一种去中心化AI服务框架v.0.1

Yu-Chao Huang, Zhen Tan, Mohan Zhang, Pingzhi Li, Zhuo Zhang, Tianlong Chen

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 TRUST框架通过去中心化方法解决高风险领域中大型推理模型和多智能体系统可靠性验证的问题,采用HDAG、DAAN协议和多层共识机制,提升透明性、鲁棒性和隐私保护,实现安全且可问责的AI部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17469 2026-05-01 cs.CL cs.HC 70%

Cross-Lingual Sentiment Misalignment: Auditing Multilingual Language Models for Inversion Risk, Dialectal Representation, and Affective Stability

跨语言情感不一致:审计多语言语言模型以检测反向风险、方言表示和情感稳定性

Nusrat Jahan Lia, Shubhashis Roy Dipta

机构 * Institute of Information Technology University of Dhaka(达卡大学信息科技学院) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文通过控制基准框架评估多语言Transformer模型在平行孟加拉语-英语句子对上的表现,揭示了模型在情感反向、同理心不对称和方言表示中的问题,提出需引入情感稳定性指标以提升跨语言可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27283 2026-05-01 cs.CL cs.AI cs.LG 67%

Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents

学习何时记忆:风险敏感的上下文老虎机用于具有回避意识的记忆检索的LLM编码代理

Mehmet Iscan

机构 * PythaLab Yildiz Technical University(Yildiz技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RSCB-MC方法,通过风险敏感的上下文老虎机机制,解决编码代理在记忆检索中的安全性和有效性问题,实现非注入和回避作为首要安全动作。

Comments 26 pages, 7 figures, 10 tables. Code and deterministic local artifacts are available at the repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08418 2026-05-01 cs.LG cs.AI 62%

Taxon: Hierarchical Tax Code Prediction with Semantically Aligned LLM Expert Guidance

Taxon: 基于语义对齐的LLM专家指导的层级税码预测

Jihang Li, Qing Liu, Zulong Chen, Jing Wang, Wei Wang, Chuanfei Xu, Zeyi Wen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Taxon框架,通过语义对齐和专家指导实现层级税码预测,结合多专家架构和语义一致性模型,在实际业务中提升准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12622 2026-05-01 cs.AI cs.CR cs.ET cs.LG cs.SY eess.SY 62%

The AI Risk Repository: A Comprehensive Meta-Review, Database, and Taxonomy of Risks From Artificial Intelligence

人工智能风险仓库:人工智能风险的全面元综述、数据库和分类

Peter Slattery, Alexander K. Saeri, Emily A. C. Grundy, Jess Graham, Michael Noetel, Risto Uuk, James Dao, Soroush Pour, Stephen Casper, Neil Thompson

机构 * MIT AI Risk Initiative(麻省理工学院人工智能风险倡议)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文构建了首个公开可访问的人工智能风险数据库,通过系统综述和专家咨询,分类了777个风险,涵盖因果因素和领域分类,为协调管理AI风险提供基础。

Journal ref Patterns 101517 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28049 2026-05-01 cs.AI 57%

Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems

不依赖代理的生产环境SQL准确性评估

Taslim Jamal Arif, Kuldeep Singh

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出STEF框架,通过自然语言输入和生成的SQL进行生产环境文本到SQL系统的评估,无需数据库模式或参考查询,实现持续监控和改进反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27953 2026-05-01 cs.AI cs.CV 57%

The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models

视觉提示对视觉语言模型合作行为的影响

Kenneth J. K. Ong

机构 * ST Engineering, Singapore(1 ST工程,新加坡)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文研究了视觉提示如何影响视觉语言模型在囚徒困境中的合作行为,通过图像内容和颜色奖励矩阵实验,发现图像内容和颜色提示对模型决策模式有影响,不同模型的敏感性和缓解效果各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27789 2026-05-01 cs.SE cs.AI 57%

Test Before You Deploy: Governing Updates in the LLM Supply Chain

部署前测试:在LLM供应链中管理更新

Mohd Sameen Chishti, Damilare Peter Oyinloye, Jingyue Li

机构 * Department of Computer Science(计算机科学系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种部署侧治理框架,通过定义模型行为规则、按部署风险分类的测试套件和兼容性门禁来管理LLM更新,解决模型演变中的兼容性问题。

Comments 4 pages, 1 figure, accepted to The 2nd International Workshop on Large Language Model Supply Chain Analysis (LLMSC2026) co-located with FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27744 2026-05-01 cs.AI 57%

Consumer Attitudes Towards AI in Digital Health: A Mixed-Methods Survey in Australia

消费者对数字健康中AI的态度:澳大利亚混合方法调查

Wei Zhou, Rashina Hoda, Joycelyn Ling

机构 * Digital Health CRC(数字健康CRC)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究通过混合方法调查澳大利亚275名参与者,探讨消费者对医疗AI的接受度、信任及风险认知,并评估AI生成与医生撰写的咨询摘要的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27415 2026-05-01 cs.LG 57%

ChipLingo: A Systematic Training Framework for Large Language Models in EDA

ChipLingo: 一种面向电子设计自动化的大语言模型系统化训练框架

Lei Li, Xingwen Yu, Jianguo Ni, Junxuan Zhu, Jieqiong Zhang, Jian Zhao, Zhi Liu

机构 * Ickylin AI Team(Ickylin AI团队)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出ChipLingo系统化训练框架,通过多源数据构建、预训练优化和指令对齐,提升大语言模型在EDA领域的性能,实验表明其在EDA-Bench上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05192 2026-05-01 cs.CR cs.AI 57%

From surveillance to signalling: escalation channels as environmental controls for agentic AI

从监控到信号:冲突通道作为代理AI的环境控制

Francesca Gomez

机构 * Wiser Human

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文研究了通过环境控制引导代理AI选择授权路径的方法,设计并评估了两种冲突通道,显著降低了有害行为的发生率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28084 2026-05-01 eess.SY cs.SY 50%

Intelligent Self-tuning Active EMI Filtering for Electrified Automotive Power Systems Using Reinforcement Learning

基于强化学习的智能自适应电磁干扰滤波器用于电动汽车电力系统

Mahuizi Lu, Kelin Jia, Rajib Goswami, Yukun Hu

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于强化学习的智能自适应电磁干扰滤波器,通过马尔可夫决策过程动态调整滤波参数,提升电磁兼容性和系统效率,实验显示在宽频范围内实现25-30dB的干扰衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14988 2026-05-01 cs.CV 50%

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

在细粒度图像任务上评估大型视觉-语言模型:全面评估

Hong-Tao Yu, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27261 2026-05-01 cs.DB 50%

SynSQL: Synthesizing Relational Databases for Robust Evaluation of Text-to-SQL Systems

SynSQL: 为文本到SQL系统的稳健评估合成关系数据库

Mohammadamin Habibollah, Davood Rafiei

专题命中 安全评测 :alignment(abstract)

AI总结 SynSQL通过合成语义一致的关系数据库,揭示了文本到SQL系统在固定基准数据库外的性能下降,为研究LLM的结构化数据合成能力提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏