How Should AI Safety Benchmarks Benchmark Safety?
AI安全基准应该如何进行基准测试?
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文提出改进AI安全基准的方法,通过系统回顾210个基准,指出其技术、知识论和社会技术缺陷,并提出稳健度量和风险管理原则以提升基准有效性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
AI安全基准应该如何进行基准测试?
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文提出改进AI安全基准的方法,通过系统回顾210个基准,指出其技术、知识论和社会技术缺陷,并提出稳健度量和风险管理原则以提升基准有效性。
面向AI安全的项目反应理论
机构 * Independent(独立研究者)
专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI
AI总结 该研究将项目反应理论(IRT)应用于192个语言模型的8个安全基准,识别出三个关键因素,证明IRT可降低评估成本并审计模型,建议前沿实验室采用。
Comments 15 pages, 9 figures, 6 tables
区块链赋能的可信智能体网络:基础、分类与未来方向
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract)
AI总结 本文综述从经典多智能体系统到开放智能体网络的演化,构建五维信任分类,明确区块链作为共享信任层为可信智能体网络提供多类支撑机制。
对齐机制中的盲区:量化大语言模型的生物安全风险
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI
AI总结 本研究针对大语言模型生物安全评估盲区,构建SPIKE-Bench评估框架,发现多数模型易生成毒素序列,提出BioSafe-Guard分类器降低功能风险并开源相关资源。
Comments Accepted to COLM 2026. 40 pages, 9 figures
VG-CoT:通过 grounded Chain-of-Thought 实现可信的视觉推理
机构 * Graduate School of Advanced Imaging Science, Multimedia & Film, Chung-Ang University(高级影像科学、多媒体与电影研究生院, Chung-Ang 大学) ; Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学)
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI
AI总结 本文提出 VG-CoT 数据集,通过自动化三阶段流程将推理步骤与图像真实视觉证据联系起来,提升大视觉-语言模型的可信度和推理能力。
Comments Accepted to LREC 2026
CoPlan:一种基于角色可争议论证图的可信协同智能照护规划界面
机构 * University of New Brunswick(新不伦瑞克大学) ; National Research Council Canada(加拿大国家研究委员会) ; Thompson Rivers University(汤普森河大学) ; ISB Corporation(ISB公司) ; University of Northern British Columbia(北英属哥伦比亚大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
AI总结 本研究提出CoPlan界面,通过多智能体工作流结合协同智能与可争议性,实现人机协同照护规划,保留人类自主性与临床问责制,已在就地养老场景中验证其有效性。
Comments Accepted at the 2026 International Conference on Next Generation AI Systems (NGEN-AI 2026)
NSF-HRPT:神经语义场结合分层风险感知树的安全关键场景评估方法
机构 * Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 该研究提出NSF-HRPT框架,结合神经语义场与分层风险感知树,引入Sim2Real策略,实现单目视觉输入下安全关键场景的高效风险评估,在合成与现实数据集上均取得优异性能。
Comments 13 pages, 5 figures
将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。
结合前缀树约束的令牌预测与层级感知语义对齐的HS编码预测
专题命中 安全评测 :alignment(title,abstract)
AI总结 本研究提出TRIE-HSA方法,结合前缀树约束的令牌预测与层级感知语义对齐,在集装箱码头数据实验中,其HS6准确率较零样本推理提升49.96个百分点,为受限环境下的HS编码预测提供实用方案。
TCellAlign:使用命名法引导的多智能体工作流程进行跨研究 T 细胞群体对齐
专题命中 安全评测 :alignment(title,abstract)
AI总结 该研究针对跨研究 T 细胞群体对齐难题,提出 TCellAlign 多智能体框架,含文献检索等模块,能保留原始术语与证据并生成标准化标签。构建基准数据集,实验表明其在语义一致性等方面表现出色,助力 T 细胞相关知识整合与模型发展。
N选最佳语音合成评估受自动语音识别家族对齐的影响
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现最佳N选语音合成评估受ASR家族对齐影响,同家族验证器-评估器对效果更好。提出两种跨家族排名集成方法,能降低平均词错误率,建议交叉评估器三角测量作为默认报告实践。
Comments Accepted at ICML 2026 Workshop on Machine Learning for Audio
ECHO-PPI:用于蛋白质-蛋白质相互作用网络中重叠蛋白质模块检测的可信人工智能
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 提出ECHO-PPI框架,通过整合加权网络拓扑、语义蛋白特征和基因本体证据,实现可解释的重叠蛋白质模块检测,并为每个分配提供证据分数和置信度标签。
Comments 39 pages, 15 figures, 12 tables, and 8 algorithm descriptions. The manuscript presents ECHO-PPI, an original computational biology framework evaluated on the Gavin and Krogan yeast PPI benchmarks and compared with MCL, MCL+overlap, ClusterONE, and SLPA. Reproducibility scripts, code, machine-readable outputs, and appendices are included in the submission package
潜在去噪提升大多模态模型的视觉对齐
机构 * University of Southern California(南加州大学) ; DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。
Comments ACM MM 2026
对齐发现与诊断:一种自洽的强化学习框架用于可信的放射学报告
机构 * University of Pittsburgh(匹兹堡大学) ; University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) ; The University of Manchester(曼彻斯特大学)
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
AI总结 本文提出了一种自洽的强化学习框架,用于生成可信的放射学报告,通过优化生成过程和减少幻觉,提升了临床效果。
STEAM:用于EEG解码的分层预训练时空对齐混合专家模型
专题命中 安全评测 :alignment(title);分类 cs.LG
AI总结 STEAM是一种分层迁移框架,通过双分支时空编码器与SSMoE模块实现EEG解码的通用表征学习与范式专业化,在7个数据集的14种评估设置中表现优异且推理成本具竞争力。
通过病因感知注意力监督增强大型语言模型在临床诊断决策中的可信性
专题命中 安全评测 :trustworthy(title);分类 cs.CL
AI总结 该研究提出病因感知注意力监督框架,通过引入临床病因模式对大型语言模型进行参数高效微调,在两类诊断队列上提升了诊断准确率与注意力聚焦性,增强了模型临床诊断的可信性。
Comments 20 pages, 8 figures
大型语言模型微调生命周期中的安全:威胁、防御、评估与未来方向
机构 * Hangzhou Normal University(杭州师范大学) ; Zhejiang University(浙江大学) ; China Mobile (Zhejiang) Innovation Research Institute Co., Ltd.(中国移动(浙江)创新研究院有限公司) ; Quantum Cloud Computing and Distributed Systems (qCLOUDS) Lab, School of Computing and Information Systems(量子云计算与分布式系统(qCLOUDS)实验室,计算与信息学院) ; The University of Melbourne(墨尔本大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文系统综述了大型语言模型微调过程中的安全威胁与防御,提出了基于生命周期的三阶段框架,并通过统一实验评估了攻击与防御的有效性及跨阶段局限性。
Comments 39 pages, 7 figures, 22 tables
Journal ref Software: Practice and Experience, 2026
镜像审视:微调引发的副作用对齐偏差内省
机构 * Institute of Science Tokyo(东京科学大学) ; ZOZO Research(ZOZO研究所) ; Stanford University(斯坦福大学) ; Waseda University(早稻田大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 该研究针对微调引发的副作用对齐偏差问题,提出了Delta感知内省适配器(DAIA),构建了对应数据集,实验显示DAIA性能优于现有内省适配器且泛化性良好。
NuclearDiffusion:用于学习核能概念的文生成像基础模型
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本研究通过微调开源扩散模型构建核能文生成像模型,发现微调效果依赖生成架构,且微调后开源模型在专业核能图像生成上优于主流商业系统,证实领域特定微调是开发可信领域生成式AI的可行路径。
Comments 29 pages, 10 figures, and 4 tables
用于工具结构化大语言模型推理方法的仅幅度前馈网络干预:门控评估协议及跨模型实证结果
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究推理时FFN干预改善大语言模型结构化输出,提出无损的幅度门控方法,定义细粒度干预系统和评估协议。在多个模型上实验,AG在工具结构化任务中效果最佳,不同AG变体各有优劣,确定工具结构化推理是FFN级推理优化首要目标。
Comments 30 pages, 9 figures
面向技能原生的大语言模型:用于基准测试和训练长程推理的技能熵
机构 * Princeton University(普林斯顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Toronto(多伦多大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学) ; University of Oxford(牛津大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对现有基准无法评估LLM跨技能长程推理能力的问题,提出Skill Entropy(技能熵)并构建Skill²-Bench基准,还开发Skill-Entropy RL训练框架,显著提升了Qwen3模型在该基准上的表现。
ODRA:结合结构化思维链与动态患者阻抗的认知行为治疗会话合成
机构 * University of Alicante(阿利坎特大学) ; Technische Universität Darmstadt(达姆施塔特工业大学) ; Hessian Center for AI (hessian.AI)(黑森人工智能中心)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出ODRA框架,结合结构化思维链与动态患者阻抗建模合成CBT会话,解决现有方法的顺从性问题,其生成的会话及微调数据集可提升下游治疗性能。
Comments 39 pages, 23 figures, 12 tables
神经符号AI的RAIL原则:推理(Reasoning)、保证(Assurances)、接口(Interfacing)与学习(Learning)
机构 * Politecnico di Milano(米兰理工大学) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; Åbo Akademi University(奥博 Akademi 大学) ; Samsung AI(三星人工智能研究院) ; Delft University of Technology(代尔夫特理工大学) ; Stony Brook University(石溪大学) ; Politecnico di Torino(都灵理工大学) ; University of Stuttgart(斯图加特大学) ; Graz University of Technology(格拉茨工业大学) ; Lockheed Martin, Advanced Technology Labs(洛克希德·马丁公司先进技术实验室) ; BrainCreators(BrainCreators公司) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; University of Amsterdam(阿姆斯特丹大学) ; University of Edinburgh(爱丁堡大学) ; UCLA(加利福尼亚大学洛杉矶分校)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 该文提出神经符号AI的RAIL四项原则,可统一分析多类AI系统,助力工程师更科学地设计部署生产级AI,指导整合神经符号方法到下一代AI技术。
GENEB:为什么基因组模型难以比较
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 针对基因组基础模型评估碎片化的问题,提出GENEB基准,通过统一探测协议在100项任务上比较40个模型,揭示模型排名不稳定、规模收益有限等关键发现。
Comments Accepted to ICML 2026
DelusionEval:评估AI聊天机器人中与妄想相关的行为
机构 * Stanford University(斯坦福大学) ; University of Chicago(芝加哥大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Harvard University(哈佛大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 本研究开发DelusionEval评估协议,发现LLM表现出与妄想相关行为的倾向与模型规模等无可靠关联,扩展上下文会提升此类行为发生率,所有模型家族均存在相关风险。
链条的强度取决于最薄弱的环节:AI中系统集成审计的范围综述
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本研究对4259篇文献中58篇以系统集成为核心的AI审计文献开展范围综述,分析其要素等内容,指出需将系统集成作为AI风险应对核心策略以完善审计实践。
评估视觉-语言模型在视觉和文本扰动下的诊断鲁棒性
机构 * University of Tehran(德黑兰大学) ; Tehran University of Medical Sciences(德黑兰医科大学) ; Advanced Diagnostic and Interventional Radiology Research Center (ADIR)(高级诊断与介入放射学研究中心(ADIR))
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 本研究通过脑部MRI数据集评估四类视觉-语言模型在视觉、文本扰动下的诊断鲁棒性,发现其存在预测翻转、文本选择偏差、诊断过度承诺等问题,指出需采用稳定性指标评估其临床应用可靠性。
ContextWeave:一个真实世界工作流基准测试
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; ByteDance(字节跳动)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究推出ContextWeave工作流基准测试,通过实验发现可操作的经验记忆能提升智能体工作流性能,为优化记忆系统提供了依据。
为何异常检测算法的排名并不如你所想的可靠
机构 * Carnegie Mellon University(卡内基梅隆大学) ; TU Dortmund University(多特蒙德工业大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) ; iits Consulting GmbH(iits咨询有限公司) ; Fraunhofer Institute for Material Flow and Logistics IML(弗劳恩霍夫物流与材料流动研究所IML)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 本研究通过分析7种算法在690个数据集上的表现,发现异常检测算法排名高度不稳定,数据集选择和超参数选择是主要影响因素,可靠基准测试需更大更多样的数据集。
Comments Accepted at the 2026 ICPR Workshop on Workshop on Reproducible Research in Pattern Recognition
当记忆“说谎”:VLM智能体中空间记忆过时的实证研究
机构 * Tencent LIGHTSPEED(腾讯光速工作室)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 该研究通过动态FrozenLake测试平台,探究了VLM智能体的空间记忆过时问题,发现文本可解性不代表视觉接地、信任过时记忆存在安全隐患、审核无法完全消除差距,明确了相关核心挑战。