FLARE-AI: Flaw Reporting for AI
FLARE-AI:AI缺陷报告
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 针对AI系统缺陷报告生态碎片化问题,提出开源系统FLARE-AI,通过条件逻辑和早期分类简化报告创建,支持标准化机器可读报告分发,降低报告门槛并提升互操作性。
Comments Accepted to ICML 2026
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
FLARE-AI:AI缺陷报告
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 针对AI系统缺陷报告生态碎片化问题,提出开源系统FLARE-AI,通过条件逻辑和早期分类简化报告创建,支持标准化机器可读报告分发,降低报告门槛并提升互操作性。
Comments Accepted to ICML 2026
SpeechEQ: 社交感知语音对话模型的情商基准测试
机构 * New York University(纽约大学) ; NVIDIA(英伟达) ; Carnegie Mellon University(卡内基梅隆大学) ; NYU Shanghai(上海纽约大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。
PHANTOM:面向视觉-语言模型的多模态对抗攻击大规模数据集
机构 * The Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所(AI4I)) ; HikmaAI S.r.l.(HikmaAI有限责任公司)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 提出一个大规模开源对抗攻击数据集PHANTOM,涵盖10个高级类别和55个子类别的有害意图,包含47,524个对抗样本,旨在降低对抗研究门槛,促进VLM鲁棒性和安全性的系统评估。
Comments The dataset has been released at: https://huggingface.co/datasets/it4lia/PHANTOM
神经符号驱动:基于规则忠实推理的驾驶VLA
机构 * Texas A&M University(德克萨斯农工大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Maryland(马里兰大学) ; University of California, Riverside(加利福尼亚大学河滨分校) ; University of Pittsburgh(匹兹堡大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 提出神经符号驱动框架,利用规则规划器的决策轨迹监督驾驶VLA,实现推理与运动生成的因果耦合,显著降低轨迹误差和碰撞率。
基于队列锚定的电子健康记录基础模型:从风险评分到可审计的同行队列
机构 * National University of Singapore(新加坡国立大学)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 提出CAFM框架,将患者队列作为一等对象融入学习流程,通过四个阶段提升数据质量、组织表示并支持可审计决策,以解决基础模型在临床部署中的可解释性、分布偏移和临床对齐问题。
面向地方政府AI保障的生成式负责任AI数据评估模式(GRAIDES)
机构 * AI Innovation Lab, Westminster City Council(威斯敏斯特市议会人工智能创新实验室)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
AI总结 提出轻量级开源数据模型GRAIDES,用于集中管理生成式AI的可观测性,通过代码、架构和统计评估蓝图,在组织层面实现系统保障,并在威斯敏斯特市议会案例中验证了人机对齐测量。
DeFAb:基础模型中可废止溯因的可验证基准
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出DeFAb基准,通过将知识库转换为可验证的溯因实例,评估基础模型在可废止推理中的创造力与理论推理能力,发现前沿模型准确率远低于符号求解器。
Comments 33 pages, 14 figures, 23 tables. Dataset: https://huggingface.co/datasets/PatrickAllenCooper/DeFAb ; code and evaluation harness: https://github.com/PatrickAllenCooper/blanc
解码推理型LLM中的隐藏欺骗:用于欺骗审计的激活解释器
机构 * Zhejiang University(浙江大学) ; Griffith University(格里菲斯大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 提出STATEWITNESS,一种通过解码目标模型隐藏状态来生成自然语言查询答案和结构化报告的激活解释器,在欺骗检测中平均AUROC达0.916,优于现有方法。
Comments Under review
不想让你的大语言模型(LLM)推荐核打击?试试用日语提问
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI;trustworthy(journal_ref)
AI总结 该研究发现,用日语提问可降低部分LLM在核打击场景中的发动率,其机制为模型的推理语言而非输入语言,且仅适用于在英语中已存在犹豫的模型,表明LLM安全行为具语言依赖性。
Journal ref Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), Jul 2026, San Diego, United States. pp.489-502
人类与人工智能——促进可信且可理解的协作
专题命中 安全评测 :trustworthy(title)
AI总结 该研究围绕人类与AI的可信可理解协作,通过在线调查分析12个可解释性与可控性相关方面,发现二者受普遍重视但意见分散,受个人视角等多因素影响。
Comments Comments: 19 pages, dual-language (English and German)
面向基于大语言模型的软件的可信验收测试的需求增强生成技术
专题命中 安全评测 :trustworthy(title)
AI总结 该研究针对基于大语言模型的软件的验收测试缺口,提出需求增强生成技术与置信度校准级联判定方法,经工业案例验证可提升预言机质量、准确率与成本效率,具备工业可行性。
Comments Accepted at ASE2026
自信但不可靠:对基于脑MRI的视觉语言模型的行为安全审计
机构 * Georgia State University(佐治亚州立大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Emory University(埃默里大学) ; TReNDS Center(TReNDS中心)
专题命中 安全评测 :safety(title)
AI总结 本研究对6个指令微调VLMs开展脑MRI行为安全审计,发现其置信度校准差、存在大量高置信度错误,提出医学图像VLM评估需报告置信度可靠性等指标。
PERA:一种感知-推理-行动接口,用于6G的传感、认知推理和可信智能体响应
专题命中 安全评测 :trustworthy(title)
AI总结 研究针对下一代网络实现中传统机器学习和大语言模型的局限,提出基于感知-推理-行动(PERA)范式的生成网络智能,用多任务架构取代边缘模型,降低复杂性与能耗,通过案例研究验证其在链路状态分类和波束预测上的有效性。
Comments 9 pages, 5 figures, 1 table, magazine paper, submitted to IEEE for possible publication
面向代码大语言模型的知识对齐:针对演化API的对比性遗忘
专题命中 安全评测 :alignment(title)
AI总结 提出对比性遗忘方法CURE,在抑制废弃API的同时鼓励正确替代,使代码LLM适应演化库,实验表明该方法优于现有基线。
Comments The paper has been peer reviewed and accepted to the 42nd International Conference on Software Maintenance and Evolution (ICSME 2026)
TextDS: 分布偏移下场景文本检测的参数高效表示对齐
机构 * School of Electrical Engineering, Xi’an Jiaotong University(西安交通大学电气工程学院) ; Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系)
专题命中 安全评测 :alignment(title)
AI总结 提出TextDS框架,通过视觉基础模型、逐步LoRA适应和公共子空间融合,仅用4.9M参数实现跨域和退化条件下的鲁棒场景文本检测。
Comments Accepted by ECCV 2026. Project page: https://github.com/ZChenDang/TextDS
相同问题,不同答案?衡量与缓解提示特权以实现公平的AI访问
专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract);分类 cs.CL
AI总结 该研究提出统一框架,引入PES指标与PET智能体,在MedQA基准上验证了提示特权的存在,PET可消除该差异,提升AI访问公平性。
用于可泛化深度伪造视频检测的多智能体取证推理
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 针对深度伪造检测的现有方法泛化性不足问题,本文构建含10万视频的FaceVid-Forensics-100K数据集,提出多智能体取证推理框架,在域外测试集上性能优于GPT、Gemini等模型。
Comments 22 pages, 8 figures, 14 tables
面向规则密集型国家标准文档评审的大语言模型基准测试与增强
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL
AI总结 该研究针对规则密集型国家标准文档评审推出首个基准GB/T-Bench,提出多智能体框架GB/T-Reviewer,实验显示其大幅缩小了LLM与专家在该任务上的能力差距,为高风险文档领域可信AI奠定基础。
镜像审视:微调引发的副作用对齐偏差内省
机构 * Institute of Science Tokyo(东京科学大学) ; ZOZO Research(ZOZO研究所) ; Stanford University(斯坦福大学) ; Waseda University(早稻田大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 该研究针对微调引发的副作用对齐偏差问题,提出了Delta感知内省适配器(DAIA),构建了对应数据集,实验显示DAIA性能优于现有内省适配器且泛化性良好。
面向强化学习的鲁棒通用效用方法
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 针对通用效用强化学习的部署效用误指定问题,提出极小极大学习框架及两种收敛随机算法,经LLM安全对齐等实验验证了其有效性。
超越组件测试:验证智能体AI系统
机构 * University of Messina(墨西拿大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 该综述综合257篇相关文献,构建五维分类法分析智能体AI系统验证问题,指出现有方法的缺口,提出面向生命周期的研究议程,主张需在上下文中验证智能体轨迹以实现可信部署。
Comments 61 pages, 3 figures, to be submitted to Springer Artificial Intelligence Review
基于世界模型的具身智能安全性:威胁、防御与评估的生命周期
专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。
已标注评分的概念论证数据集
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 该研究构建了含多维度专家评分的概念论证数据集,提出两种评分函数并基准测试多模型,发现模型性能与通用能力排名相关。
音频大语言模型中基于韵律的越狱:一项对照研究与机制分析
机构 * City University of Hong Kong(香港城市大学) ; City University of Hong Kong (Dongguan)(香港城市大学(东莞))
专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 该研究通过控制文本内容改变语音传递预设构建评估协议与基准,发现特定韵律特征的语音能提升音频大语言模型的越狱成功率,表明语音传递是音频大语言模型安全评估的重要因素。
Comments Accepted at ACM Multimedia 2026 (ACM MM '26). 9 pages, 3 figures. Supplementary material included
Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10-14, 2026, Rio de Janeiro, Brazil
印度评估:一个在印度语言和文化背景下评估大语言模型的开放基准框架
专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 Inspect India Evals是在印度语言文化背景下评估大语言模型的开放框架,基于Inspect AI平台构建,含六个基准。测试五个模型,Sarvam-M 24B和Gemma 2 27B表现最佳,各模型在多语言安全测试中表现一致,DPI安全得分有差异,框架公开可扩展。
Comments 19 pages, 9 figures, 7 tables
人工智能生成的图像在高风险场景中挑战视觉信任
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 研究聚焦人工智能生成图像在高风险场景下对视觉信任的挑战,提出SafeIMG基准,涵盖12个安全场景。评估专门探测器和视觉语言模型,发现它们检测可靠性不足,模型解释覆盖低,表明当前探测器在多方面欠缺,难以可靠评估此类图像。
重新审视零样本摘要:对大语言模型摘要器可信度的实证研究
机构 * Department of Computer Science, University of Delhi(德里大学计算机科学系) ; Department of Statistics, Ramjas College, University of Delhi(德里大学拉姆贾斯学院统计系)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 研究针对大语言模型零样本摘要的稳定性与可信度问题,提出两级诊断协议,通过文档级稳定性分析及分层样本观察估计稳定性指数,经对三种文档类型的三个LLM摘要器实证研究,揭示差异,推动相关研究发展。
Comments 28 pages, Under review in a journal
VLT:用于工业智能的视觉-语言-时间序列多模态基础模型
机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) ; School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 针对工业时间序列单模态建模局限及连接时间序列与文本语义的挑战,提出VLT多模态基础模型,通过设计Time-MoE等机制联合建模多种模态,经实验验证其在多种复杂设置下优于现有方法,提升了鲁棒性和泛化能力。
Comments 18 pages, 13 figures, and 13 tables, including supplementary material. Haiteng Wang and Jingheng Yan contributed equally to this work
无声警报:一种用于跨模型和量化级别比较危险识别的J空间协议
机构 * HSE University(俄罗斯高等经济大学)
专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 研究提出JADR协议,通过J空间测量模型内部表示,不依赖外部评判模型,计算本地运行。应用于六个模型跨越三种权重表示形式,以SafetyAUC指标比较,能显著区分不同安全机制模型,捕捉量化差异。
Comments 17 pages, 12 figures
认知立场灵活性探测:测量大语言模型中提示条件下的语域转换
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL
AI总结 研究大语言模型在不同归因提示下的认知立场灵活性,引入ESFP基准,涵盖多类别多模板项目,从四个维度评估模型响应,发现认知灵活性与模型能力正交,立场内容密度信号最强。