Evaluating AI Providers' Frontier Safety Frameworks
评估AI提供商的前沿安全框架
专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.CY
AI总结 本文评估12家AI公司的前沿安全框架,通过65项加权标准评估四个维度,发现框架存在诸多缺失或不明确之处,评分范围从34%到8%,建议未来需完善以提升问责功能。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
评估AI提供商的前沿安全框架
专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.CY
AI总结 本文评估12家AI公司的前沿安全框架,通过65项加权标准评估四个维度,发现框架存在诸多缺失或不明确之处,评分范围从34%到8%,建议未来需完善以提升问责功能。
OR-VSKC:通过合成数据引导对齐解决手术室中的视觉-语义知识冲突
机构 * Shanghai University of Engineering Science(上海工程技术大学) ; Tencent YouTu Lab(腾讯优图实验室) ; Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI
AI总结 本文提出OR-VSKC基准,通过合成数据引导对齐解决手术室中的视觉-语义知识冲突,评估多模态大语言模型的可靠性,并展示微调后的模型在未见视角上的鲁棒性。
Comments 13 pages, 5 figures. The dataset and appendix are available at https://github.com/zgg2577/VS-KC
OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶
机构 * ShanghaiTech University(上海科技大学) ; Tsinghua University(清华大学) ; Tongji University(同济大学) ; Shanghai Jiao Tong University(上海交通大学) ; MEGVII Technology(美科维七科技) ; AFARI
专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI
AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。
基于政策的安全性评估:20个大语言模型
机构 * Aymara
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本文提出Aymara AI平台,用于生成和管理定制化的政策导向安全性评估。通过评估20个商业大语言模型在10个现实安全领域中的表现,揭示了模型在不同领域中的显著性能差异,强调了构建可扩展、可定制工具的重要性。
FinChain:可验证链式思维金融推理的符号基准
机构 * MBZUAI ; Syllogia ; The University of Tokyo(东京大学) ; The Fin AI(Fin AI) ; Cornell University(康奈尔大学) ; The University of Melbourne(墨尔本大学) ; IIT Delhi(德里理工学院) ; The University of Manchester(曼彻斯特大学)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 FinChain通过符号模板和可执行代码实现可验证的金融链式推理,评估26种LLM发现其在符号金融推理中存在明显缺陷,领域适应和数学增强的微调模型能显著缩小差距。
Comments 24 pages, includes 12 figures and 9 tables; introduces the FinChain benchmark and ChainEval metric
TRUST:一种去中心化AI服务框架v.0.1
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 TRUST框架通过去中心化方法解决高风险领域中大型推理模型和多智能体系统可靠性验证的问题,采用HDAG、DAAN协议和多层共识机制,提升透明性、鲁棒性和隐私保护,实现安全且可问责的AI部署。
跨语言情感不一致:审计多语言语言模型以检测反向风险、方言表示和情感稳定性
机构 * Institute of Information Technology University of Dhaka(达卡大学信息科技学院) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文通过控制基准框架评估多语言Transformer模型在平行孟加拉语-英语句子对上的表现,揭示了模型在情感反向、同理心不对称和方言表示中的问题,提出需引入情感稳定性指标以提升跨语言可靠性。
学习何时记忆:风险敏感的上下文老虎机用于具有回避意识的记忆检索的LLM编码代理
机构 * PythaLab ; Yildiz Technical University(Yildiz技术大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出RSCB-MC方法,通过风险敏感的上下文老虎机机制,解决编码代理在记忆检索中的安全性和有效性问题,实现非注入和回避作为首要安全动作。
Comments 26 pages, 7 figures, 10 tables. Code and deterministic local artifacts are available at the repository listed in the paper
Taxon: 基于语义对齐的LLM专家指导的层级税码预测
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Alibaba Group(阿里巴巴集团) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Taxon框架,通过语义对齐和专家指导实现层级税码预测,结合多专家架构和语义一致性模型,在实际业务中提升准确性与鲁棒性。
人工智能风险仓库:人工智能风险的全面元综述、数据库和分类
机构 * MIT AI Risk Initiative(麻省理工学院人工智能风险倡议)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文构建了首个公开可访问的人工智能风险数据库,通过系统综述和专家咨询,分类了777个风险,涵盖因果因素和领域分类,为协调管理AI风险提供基础。
Journal ref Patterns 101517 (2026)
不依赖代理的生产环境SQL准确性评估
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出STEF框架,通过自然语言输入和生成的SQL进行生产环境文本到SQL系统的评估,无需数据库模式或参考查询,实现持续监控和改进反馈。
视觉提示对视觉语言模型合作行为的影响
机构 * ST Engineering, Singapore(1 ST工程,新加坡)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文研究了视觉提示如何影响视觉语言模型在囚徒困境中的合作行为,通过图像内容和颜色奖励矩阵实验,发现图像内容和颜色提示对模型决策模式有影响,不同模型的敏感性和缓解效果各异。
部署前测试:在LLM供应链中管理更新
机构 * Department of Computer Science(计算机科学系)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出了一种部署侧治理框架,通过定义模型行为规则、按部署风险分类的测试套件和兼容性门禁来管理LLM更新,解决模型演变中的兼容性问题。
Comments 4 pages, 1 figure, accepted to The 2nd International Workshop on Large Language Model Supply Chain Analysis (LLMSC2026) co-located with FSE 2026
消费者对数字健康中AI的态度:澳大利亚混合方法调查
机构 * Digital Health CRC(数字健康CRC)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 研究通过混合方法调查澳大利亚275名参与者,探讨消费者对医疗AI的接受度、信任及风险认知,并评估AI生成与医生撰写的咨询摘要的优劣。
ChipLingo: 一种面向电子设计自动化的大语言模型系统化训练框架
机构 * Ickylin AI Team(Ickylin AI团队)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出ChipLingo系统化训练框架,通过多源数据构建、预训练优化和指令对齐,提升大语言模型在EDA领域的性能,实验表明其在EDA-Bench上表现优异。
从监控到信号:冲突通道作为代理AI的环境控制
机构 * Wiser Human
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文研究了通过环境控制引导代理AI选择授权路径的方法,设计并评估了两种冲突通道,显著降低了有害行为的发生率。
Comments 10 pages
基于强化学习的智能自适应电磁干扰滤波器用于电动汽车电力系统
专题命中 安全评测 :safety(abstract)
AI总结 本文提出基于强化学习的智能自适应电磁干扰滤波器,通过马尔可夫决策过程动态调整滤波参数,提升电磁兼容性和系统效率,实验显示在宽频范围内实现25-30dB的干扰衰减。
在细粒度图像任务上评估大型视觉-语言模型:全面评估
机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) ; Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) ; University of Copenhagen, Denmark(丹麦哥本哈根大学)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。
Comments Accepted to ICLR 2026
SynSQL: 为文本到SQL系统的稳健评估合成关系数据库
专题命中 安全评测 :alignment(abstract)
AI总结 SynSQL通过合成语义一致的关系数据库,揭示了文本到SQL系统在固定基准数据库外的性能下降,为研究LLM的结构化数据合成能力提供新视角。