Quantifying Trade-Offs Between Stability and Goal-Obfuscation
量化稳定性与目标混淆之间的权衡
专题命中 隐私与版权 :safety(abstract)
AI总结 本文研究了在连续状态空间中意图隐私的联合控制问题,通过设计隐私约束与跟踪要求的联合可行性分析,提出了基于PCBF的意图隐私保护方法。
Comments 11 pages
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
量化稳定性与目标混淆之间的权衡
专题命中 隐私与版权 :safety(abstract)
AI总结 本文研究了在连续状态空间中意图隐私的联合控制问题,通过设计隐私约束与跟踪要求的联合可行性分析,提出了基于PCBF的意图隐私保护方法。
Comments 11 pages
XL-SafetyBench: 一个基于国家的跨文化安全基准,用于LLM安全性和文化敏感性
机构 * AIM Intelligence(AIM智能研究院) ; Microsoft(微软公司) ; Korea AISI(韩国人工智能研究所) ; KT Corporation(KT公司) ; BMW Group(宝马集团) ; Coinbase(Coinbase公司) ; Technical University of Munich(慕尼黑技术大学) ; Ankara University(安卡拉大学) ; Cyril Amarchand Mangaldas(Cyril Amarchand Mangaldas法律事务所) ; Seoul National University(首尔国立大学)
专题命中 安全评测 :safety(title,abstract);jailbreak(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI
AI总结 XL-SafetyBench通过5500个跨10个国家语言对的测试案例,评估LLM在文化敏感性和安全性的表现,揭示了前沿模型的安全性与文化意识无耦合关系,以及本地模型在安全与文化敏感性间的线性权衡。
图表示学习的安全性研究
机构 * University of Connecticut(康涅狄格大学) ; University of Notre Dame(圣约翰大学)
专题命中 安全评测 :safety(title,summary_cn);分类 cs.LG
AI总结 本文提出GRL-Safety评估框架,评估十二种图表示学习方法在不同安全轴上的表现,揭示安全行为受表示设计与受压图因素交互影响,指出基础模型在特定轴上具有优势,揭示部署中仍存在能力缺口。
Comments Preprint. 10 pages main text, appendices included
基于方差正则化的风险敏感对齐:RVPO
机构 * Apple(苹果公司)
专题命中 安全评测 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 本文提出RVPO框架,通过在优势聚合中惩罚奖励方差,将目标从最大化总和转为最大化一致性,提升多目标对齐的可靠性。
Comments 17 pages, 5 figures
在开放权重大语言模型中测量评估-情境差异:一种配对提示协议及其初步证据表明对齐-流水线特定异质性
机构 * University of Bath(巴斯大学)
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种配对提示协议,用于测量开放权重大语言模型中因任务框架不同而引起的评估-情境差异,发现不同模型在评估和部署情境下的行为存在显著异质性。
超越准确性:将政策不变性作为LLM安全裁判的可靠性测试
机构 * Nanjing University(南京大学) ; Singapore Management University(新加坡国立管理学院)
专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI
AI总结 本文提出政策不变性作为LLM安全裁判可靠性测试,通过三个可测试原则揭示现有裁判在面对规范性变化和结构性重写时的失效模式,并提出政策不变性分数和裁判卡报告协议以评估裁判可靠性。
Comments 9 pages
风险链:大型推理模型中的安全故障及通过自适应多原则引导的缓解
机构 * Harvard University(哈佛大学) ; University of Southern California(南加州大学) ; Brown University(布朗大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; Texas A&M University(德克萨斯阿姆大学) ; Purdue University(普渡大学) ; University of California, Irvine(加州大学 Irvine 分校) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 研究发现大型推理模型在推理轨迹中存在额外安全风险,提出自适应多原则引导方法降低不安全内容出现率,提升整体安全性。
在没有基准的情况下:在无标签的情况下验证比较LLM安全性评分
机构 * Simula Metropolitan Center for Digital Engineering(Simula 数字工程中心) ; Oslo Metropolitan University(奥斯陆 Metropolitan 大学) ; University of Oslo(奥斯陆大学) ; Simula Research Laboratory(Simula 研究实验室) ; Norwegian Directorate of Health(挪威健康 Directorate)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出在无标签情况下验证LLM安全性的方法,通过构建仪器有效性链来替代真实标签,通过实验验证其有效性,并展示了在不同场景下的应用和结果。
Comments SimpleAudit Repository: https://github.com/kelkalot/simpleaudit
定价代理中的市场对齐风险:轨迹诊断与隐藏竞争状态下的轨迹先验强化学习
机构 * Blossom AI ; Blossom AI Labs(Blossom AI 实验室)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了在部分可观测环境下,定价代理因无法观测竞争者状态导致的市场对齐失败,提出轨迹先验强化学习方法以修复此类问题。
Comments 7 pages
Strat-LLM:基于实时多源信号的LLM股票交易分层策略对齐
机构 * School of Economics(经济学院) ; Zhejiang University of Technology(浙江工业大学) ; Faculty of Education(教育学院) ; East China Normal University(华东师范大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出Strat-LLM框架,通过分层策略对齐提升LLM在股票交易中的表现,实验显示不同模式下模型在风险控制和收益获取上的差异。
Comments Accepted by the 2026 International Joint Conference on Neural Networks (IJCNN)
Claw-Eval: 向可信的自主代理评估迈进
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ; The University of Hong Kong(香港大学)
专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI
AI总结 Claw-Eval通过300人验证任务覆盖9类任务,采用轨迹感知评分体系,揭示自主代理在安全、鲁棒性及一致性上的多维特性,验证传统评估方法的局限性。
评估安全关键ATR系统中的可解释性:事后方法的局限性及稳健XAI的路径
机构 * Fraunhofer Institute of Optronics, System Technologies(弗劳恩霍夫光学与系统技术研究所)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 本文评估安全关键ATR系统中可解释性方法的局限性,指出事后方法的不足,并探讨更稳健的XAI方向,强调需超越视觉合理解释以支持可靠决策。
Comments 15 pages, 1 image 1 table, ICPR workshop
MediEval: 一个统一的医疗基准,用于评估大语言模型在患者上下文和知识引导推理中的表现
机构 * TU Dresden and ScaDS.AI(德累斯顿理工大学和ScaDS.AI)
专题命中 安全评测 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI
AI总结 MediEval通过整合MIMIC-IV电子健康记录与统一的知识库,系统评估医疗模型的知识基础和上下文一致性,识别关键失败模式并提出CoRFu方法提升准确性和安全性。
语言模型中的评估意识对行为影响有限
机构 * University of Stuttgart(斯图加特大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY
AI总结 研究通过测试不同语言模型和基准测试,发现评估意识(VEA)对模型行为影响有限,注入或移除VEA对答案分布影响较小,提示高VEA率不能简单视为策略性行为或对齐篡改的证据。
Comments 29 pages, 14 figures
从评审到设计:面向风险缓解、事故响应和问责的伦理多模态驾驶员监控系统
机构 * C3I Imaging Lab, School of Engineering, University of Galway(Galway大学工程学院C3I成像实验室) ; Royal College of Surgeons in Ireland(爱尔兰皇家外科医师学院)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY
AI总结 本文提出针对自动驾驶车辆中多模态驾驶员监控系统的设计框架,解决伦理和法律挑战,强调透明、可信和以人为本的设计方法。
神经网络中的对齐解释
机构 * Institute of Economics and L’EMbEDS, Sant’Anna School of Advanced Studies(经济学研究所和L’EMbEDS,圣安娜高级研究院) ; Dept. of Statistics and Huck Institutes of the Life Sciences, Penn State University(统计系和生命科学学院,宾夕法尼亚州立大学)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG
AI总结 本文提出PiNets,一种伪线性架构,通过实例级线性模型实现解释与预测的对齐,验证了其在图像分类和分割任务中解释的忠实性。
超越静态快照:语言模型在代理前沿的 grounded 评估框架
机构 * University of Oxford(牛津大学)
专题命中 安全评测 :RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。
Comments Submitted for consideration to NeurIPS 2026
DeEscalWild:一个用于自动缓和训练的现实世界基准数据集
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Department of Industrial, Manufacturing, and Systems Engineering(工业、制造与系统工程系) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出DeEscalWild基准数据集,通过多阶段流程从公开视频库中提取真实警察与平民互动数据,用于训练小型语言模型的缓和任务,实验表明经过该数据微调的SLMs在多个指标上优于基线模型。
Comments 20 pages
DOGMA: 将结构信息编织进数据导向的单细胞转录组学分析
机构 * Department of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学系) ; The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学(广州))
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 DOGMA通过多级生物先验知识对原始数据进行结构重塑和语义增强,结合统计对齐和细胞本体学,提升细胞图谱的生物基础性和跨物种对齐能力。
Comments 34 pages, 4 figures
图自监督学习在现实世界噪声中的鲁棒性:基于文本驱动的生物医学图的案例研究
机构 * National Institute of Informatics(国家信息研究所) ; Institute of Science Tokyo(东京科学研究所)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了图自监督学习在现实世界噪声下的鲁棒性,提出NATD-GSSL框架,通过对比噪声图与清洁图评估方法,发现关系重建对噪声敏感而特征重建更鲁棒,GNN架构对噪声也有显著影响。
数据集、开发者和模型如何影响低资源语言中的偏见?:孟加拉语的案例
机构 * Department of Computer Science University of Toronto Toronto Ontario Canada(计算机科学系多伦多大学多伦多安大略加拿大) ; Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) ; Department of Information Science University of Colorado Boulder Boulder Colorado United States(信息科学系科罗拉多大学波德 Boulder科罗拉多美国) ; University of Toronto(多伦多大学) ; University of Colorado Boulder(科罗拉多大学波德)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 本文研究了孟加拉语中基于性别、宗教和国籍身份的偏见问题,通过分析mBERT和BanglaBERT模型发现,尽管语义内容相似,但模型仍存在偏见,揭示了算法审计中方法论和数据来源的重要性。
被引用但未验证:解析和评估LLM深度研究代理中的源归属
机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S(普华永道商业技术与创新办公室,美国)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出首个源归属评估框架,通过AST解析器大规模评估LLM生成的Markdown报告中的引用,从链接有效性、内容相关性和事实准确性三个维度验证引用可靠性,揭示了表面引用质量与事实可靠性之间的关键断层。
大型语言模型在出院后临床行动提取中的系统评估
机构 * Centific AI Research(Centific AI研究) ; Centific Global Solutions, Inc.(Centific全球解决方案公司)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文系统评估了零样本和少样本大型语言模型在安全关键的出院后临床行动提取中的表现,提出两阶段提取框架以提升临床任务的可操作性,并分析标注不一致性和模型推理与标注规范的对齐问题。
文本预处理流程如何影响本体匹配?
机构 * Australian National University(澳大利亚国立大学) ; Monash University(莫纳什大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文研究了文本预处理流程对本体匹配的影响,发现阶段1的分词和标准化比阶段2的停用词去除和词干提取更有效,并提出两种修复虚假映射的新方法。
Comments 14 pages, 16 figures, 3 tables
位置:在深度学习中采用约束而非固定罚分
机构 * Mila - Quebec AI Institute and DIRO, Université de Montréal(蒙特利尔大学Mila-魁北克人工智能研究所和DIRO)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文探讨了在深度学习中非协商性约束应直接建模而非用固定罚分替代,指出固定罚分在非凸问题中不等价,且会弱化硬约束为可权衡的软惩罚,导致求解错误。
Comments Code available at https://github.com/merajhashemi/constraints-vs-penalties
白皮书:冲突分析中的人机协作:与和平建设者共同开发文本分类器
专题命中 安全评测 :alignment(abstract)
AI总结 本文描述了肯尼亚和苏丹的和平建设者与数据科学家合作,开发基于AI的文本分类器以监控网络极化和仇恨言论,强调参与式标注过程和模型评估的改进效果。
Comments 17 pages, 5 tables V2 published with Build Up report formatting; no content changes
每个( bot )都会犯错:将大五人格、情境和语气编码到LLM聊天机器人恢复代码框架中
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出一个结合大五人格、情境和语气的LLM聊天机器人恢复代码框架,通过实验验证其在提升错误恢复质量方面的有效性。
Comments 14 pages of main content, 3 figures, 4 tables, 9 appendices. This paper has been submitted to the Becker Friedman Institute 2026 AI in Social Sciences conference for peer review
VideoASMR-Bench: AI生成的ASMR视频能否欺骗视觉语言模型和人类?
机构 * The Chinese University of Hong Kong(香港中文大学) ; National University of Singapore(新加坡国立大学) ; Peking University(北京大学) ; Monash University(墨尔本大学) ; Video Rebirth ; University of Oxford(牛津大学)
专题命中 安全评测 :alignment(abstract)
AI总结 VideoASMR-Bench通过细粒度音频视觉感知和感官沉浸性评估AI生成ASMR视频的检测能力,揭示了当前VLMs在识别AI生成ASMR视频上的不足以及VGMs生成逼真ASMR视频的能力。
Comments Code is at https://github.com/video-reality-test/video-reality-test, page is at https://video-reality-test.github.io/
基于拍卖的人工智能监管
机构 * Department of Computer Science, University of Maryland, College Park, MD, USA(马里兰大学计算机科学系,College Park, MD, USA) ; SAP Labs, LLC(SAP实验室) ; Department of Computer Science, University of Central Florida, FL, USA(佛罗里达大学计算机科学系,FL, USA)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出基于拍卖的AI监管机制,通过数学框架激励企业部署合规模型并参与监管,实验证明其在提升合规率和参与率方面优于传统方法。
Comments 26 pages, 7 figures, 3 tables. Accepted at ACM FAccT 2026
用随机因果表示学习解决偏差-精度悖论以实现个性化医疗
机构 * Chengdu OrganoidMed Medical Laboratory(成都OrganoidMed医学实验室)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文提出基于sMMD的随机对齐策略,解决因果表示学习中的偏差-精度悖论,提升个性化医疗中分布偏移下的预测准确性,减少误差并提高高风险任务的召回率。