Trustworthy Anomaly Detection: A Survey
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG
Comments Paper list, see https://github.com/yuan-shuhan/trustworthy-anomaly-detection-papers
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG
Comments Paper list, see https://github.com/yuan-shuhan/trustworthy-anomaly-detection-papers
MechELK:一种用于激发大型语言模型中潜在知识的机制可解释性框架
机构 * Dongguk University(东国大学)
专题命中 安全评测 :alignment(abstract,abstract_cn);safety(abstract);AI safety(abstract);分类 cs.CL
AI总结 提出MechELK框架,通过定位、验证和激发三个阶段,利用稀疏自编码器特征分析和因果探测等方法,从大型语言模型中提取隐藏知识,在TruthfulQA等基准上平均激发准确率达84.7%。
AI代理安全防护的比较评估
机构 * Beijing Caizhi Tech(北京彩智科技)
专题命中 安全评测 :safety(summary_cn,abstract);分类 cs.AI
AI总结 本文比较了DKnownAI Guard与AWS Bedrock Guardrails、Azure Content Safety和Lakera Guard在AI代理安全场景中的性能,发现DKnownAI在召回率和真正负样本率上表现最佳。
设计行为代码(DBCs):一种以分类为导向的分层治理基准用于大型语言模型
专题命中 安全评测 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)
AI总结 本文提出DBC基准,用于评估大型语言模型中的行为治理层,通过三臂实验展示DBC在降低风险暴露率和提升合规性方面的效果。
Comments 14 pages, 3 figures
从语音记录到AI代理:知识提取、RAG整合及对话式AI助手的鲁棒评估
机构 * Amity Research and Application Center (ARAC)(阿米蒂研究与应用中心)
专题命中 安全评测 :alignment(abstract);safety(abstract);red teaming(abstract);prompt injection(abstract)
AI总结 本文提出了一种端到端框架,通过历史通话记录构建和评估对话式AI助手,利用知识提取和RAG整合提升事实准确性和鲁棒性。
Comments 9 pages, 2 figures, 1 table
视觉语言模型对分裂图像有害输入攻击的鲁棒性
机构 * Pennsylvania State University(宾夕法尼亚州立大学) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)
专题命中 安全评测 :alignment(abstract);RLHF(abstract);safety(abstract);jailbreak(abstract)
AI总结 本研究提出分裂图像视觉陷阱攻击(SIVA),揭示视觉语言模型在面对分裂图像攻击时的安全漏洞,并通过对抗性知识蒸馏算法提升跨模型攻击效果。
Comments 22 Pages, long conference paper
机构 * Apart Research ; AI Safety Cape Town ; University of Chicago(芝加哥大学) ; Stanford University(斯坦福大学) ; Sentience Institute(意识研究所)
专题命中 安全评测 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Preprint. This work has been submitted to the Multi-Agent Systems Workshop at ICML 2025 for review
机构 * Graduate School of Business(商学院) ; Stanford University(斯坦福大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);harmlessness(abstract);trustworthy(abstract)
机构 * University of Washington(华盛顿大学) ; NVIDIA(NVIDIA公司) ; Cambridge(剑桥) ; Stanford(斯坦福大学) ; MIT(麻省理工学院) ; Harvard(哈佛大学) ; Anthropic(Anthropic公司)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 34 pages, 11 figures, see associated data at https://huggingface.co/datasets/kellycyy/AIRiskDilemmas and code at https://github.com/kellycyy/LitmusValues
机构 * School of Computing, Dublin City University(都柏林城市大学计算机学院) ; Insight SFI Research Centre for Data Analytics(数据分析SFI研究中心) ; North China Electric Power University(华北电力大学) ; Harbin Institute of Technology (Weihai)(威海工业大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);AI safety(abstract)
监管批准并不足够:FDA clearance医疗设备中可信赖AI报告的缺口
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY、cs.LG
AI总结 该研究分析2021-2025年FDA获批的519份AI/ML医疗设备报告,发现可信赖AI报告存在显著缺口,获批年份或临床领域不影响报告透明度,仅监管批准不足以证明AI可信赖性。
立场:对齐社区正在无意之中构建审查者的工具包
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY
AI总结 该立场论文指出现代AI对齐方法是两用技术,可能被恶意滥用,呼吁社区讨论其滥用风险并提出缓解策略。
Comments Accepted as oral paper at ICML 2026
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
LODESTAR:可信赖熵是被引导的,而非仅被测量——强化偏振器防止冻结型大语言模型(LLM)被错误证据误导而自信出错
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.LG
AI总结 LODESTAR是首个通过强化学习训练偏振器、依据第三方冻结型LLM的不确定性评分文本干预的方法,可提升检索增强问答的F1值等指标,减少模型读取误导性段落的概率。
Comments 28 pages, 3 figures
量化治疗型大语言模型(LLMs)的临床安全性与环境影响之间的关系
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY
AI总结 该研究量化治疗型LLMs的临床安全性与环境影响的关系,发现安全分布高端存在非线性权衡,额外测试时计算未必提升安全,提出动态模型选择等可持续部署方法。
从提示工程到行为对齐:用于推荐评估的个性化大语言模型评判者
机构 * Netflix(网飞公司)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对离线推荐评估中LLM存在的双向合理化问题,提出序列行为对齐框架,经真实日志验证,其Macro-F1较零样本基线提升32.19%,可缓解失效模式且无需人工管道开销。
SkillConsist:通过双向图对齐检测智能体技能中的不一致性
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 SkillConsist针对智能体技能不一致检测的挑战,通过双向图对齐等技术构建基准并取得优于基线的检测性能,提升了技能一致性检测效果。
Comments 11 pages, 3 figures
价值的进化起源:对AI对齐、感知能力和生存风险的启示
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY
AI总结 该研究通过追溯生物价值的进化起源,论证LLMs无内在生存动机与感知能力,正交性论点不适用于它们,AI对齐的核心挑战是确保LLMs应用习得的伦理价值。
Comments submitted chapter for book: T. Veloz & C. Rittberg (Eds.), AI and Human Values. Springer
数字健康中的可信AI:鲁棒性与可解释性的综合综述
机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) ; School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG
AI总结 本综述针对数字健康领域可信AI研究缺口,构建框架梳理鲁棒性与可解释性的技术进展、应用考量与评估指标,为相关开发提供支持。
Comments Preprint of the paper published in Progress in Biomedical Engineering. 26 pages, 5 figures
Journal ref Progress in Biomedical Engineering, Volume 8, Number 2, Article 022007, 2026
评分规则!文本评估指标的统计对齐与策略对齐
机构 * University of Michigan(密歇根大学) ; Peking University(北京大学) ; Microsoft Research(微软研究院) ; Northwestern University(西北大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对文本评估指标,提出统计与策略对齐概念及三项测试原则,开发基于互信息的指标设计框架,发现 LLM-as-a-Judge 相关性高但易操纵,新指标鲁棒性强且相关性具竞争力。
注意间隙:任务条件化的语言和视觉模型忽略它们本可报告的安全关键信号
机构 * PolymathMinds Lab(PolymathMinds 实验室)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究揭示任务条件化会导致语言和视觉模型抑制对共存安全关键信号的报告,形成“注意间隙”,且该现象在多种模型和任务中普遍存在,不随规模增大而减弱,使基准安全与实际安全脱钩。
Comments 62 pages (31-page article and 31-page supplementary information), 8 figures, 4 tables. v3: corrects the author metadata to the sole author, Kwan Soo Shin; revised title and abstract; adds cross-vendor and flagship validation, signal-detection and specified-task controls, and dual-process probes. Reproducibility deposit: doi:10.5281/zenodo.20826823
Chem World:用于可信赖化学性质预测的大规模基准及物理信息框架
机构 * Cleer Science(克利尔科学公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Imperial College London(伦敦帝国学院) ; Tsinghua University(清华大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究推出整合17类超80万分子样本的Chem World化学性质预测基准,并提出Mixture-PINN物理信息神经网络框架,经实验验证其可提升预测性能,为可信赖AI系统研发奠定基础。
对齐目标问题:人类、人工智能系统及其设计者的道德判断分歧
机构 * The University of Hong Kong(香港大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY
AI总结 研究探讨了人类、AI系统及其设计者在道德判断上的差异,通过实验发现人类设计的AI行为会引发更强烈的道德约束,揭示了价值对齐的挑战。
Comments ACM FAccT 2026
MEDIC:对LLM在临床应用中的安全性和实用性领先指标的综合评估
机构 * M42
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 MEDIC通过综合评估框架揭示LLM在临床应用中的安全性和实用性差异,强调需采用组合方法以应对多维度性能权衡。
Comments Published in Transactions on Machine Learning Research (06/2026)
大语言模型在心理健康领域的检索增强生成:量化分层安全架构中检索的增量贡献
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 研究数字心理健康干预中,通过在名为Wysa的DMHI里对比启用和禁用检索增强生成(RAG)模式,评估六个大语言模型,计算相关指标并测试差异,发现RAG虽致误报增加,但符合安全原则,是提升LLM驱动的DMHIs相关性能的有前景方法。
Comments 11 pages, 6 figures
用于可靠洪水预测的上下文感知概念蒸馏
机构 * School of Computer Science and Engineering, The Hebrew University of Jerusalem(耶路撒冷希伯来大学计算机科学与工程学院) ; Institute of Earth Sciences, The Hebrew University of Jerusalem(耶路撒冷希伯来大学地球科学研究所) ; Hebrew University Business School, The Hebrew University of Jerusalem(耶路撒冷希伯来大学商学院)
专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG
AI总结 针对深度学习模型‘黑箱’问题阻碍洪水预测信任度的挑战,提出上下文感知概念蒸馏框架CACD,引入无监督管道和残差超网络,经全球多流域评估,该模型高保真且优于黑箱基线,平衡了AI准确性与决策透明度。
Comments to be published in IJCAI 2026 proceedings
可掩码性指数:预测预训练语言模型中的任务目标对齐
机构 * Sirjan University of Technology(锡尔詹理工大学) ; Department of Computer Engineering(计算机工程系)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 研究提出可掩码性指数(MI),用于评估知识关系适合的提示方式,通过掩码与未掩码模板的DepthRank分数差异计算。在ATOMIC2020基准上评估发现MI与下游生成性能正相关,有助于选择提示模板和策略提取预训练语言模型的关系知识。
JANUS:预见长期智能体安全中的潜在风险
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 研究长期智能体安全潜在风险,提出JANUS框架,通过多智能体模拟合成轨迹,经预测与裁决耦合任务学习共享策略,用CoAA-RL联合优化,所产生的Vanguard模型提升了智能体安全防护及任务完成率。
通过可靠性感知多引擎融合实现可靠的蛋白质-配体结合亲和力预测
机构 * University of Southern California(南加州大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG
AI总结 研究针对蛋白质-配体结合亲和力预测中引擎结果不一致问题,提出RELIABLE-BA框架,通过三步实现多引擎预测,经实验验证其能提升预测竞争力和不确定性校准,可筛选高置信对减少误差,是首个结合证据融合与上下文可靠性的预测框架。
不可转移的安全性:可部署医学语言模型中的跨语言临床正确性漂移
机构 * AI SafetyX(人工智能安全X)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY
AI总结 研究资源匮乏健康环境中可部署医学语言模型的跨语言临床正确性漂移,构建英语-豪萨语问题对评估六个模型,发现本地可部署模型临床正确性下降,前沿模型较稳定,缺陷源于可部署层而非语言或临床材料。