Data Station: Delegated, Trustworthy, and Auditable Computation to Enable Data-Sharing Consortia with a Data Escrow
专题命中 安全评测 :trustworthy(title)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(title)
专题命中 安全评测 :trustworthy(title)
Comments 18 pages, 9 figures, submitted to IDC 2023, for associated appendix: https://gist.github.com/jessvb/fa1d4c75910106d730d194ffd4d725d3
专题命中 安全评测 :trustworthy(title)
Comments 6 Pages, 6 figures
专题命中 安全评测 :safety(title)
Comments Accepted at HCOMP '22 and at CHI'22 Workshop on Human-Centered Perspectives in Explainable AI (HCXAI)
专题命中 安全评测 :trustworthy(title)
Comments Prepared for the Astronomical Data Analysis Software and Systems (ADASS) XXXI Proceedings
专题命中 安全评测 :trustworthy(title)
专题命中 安全评测 :trustworthy(title)
Comments UMAP '20: Proceedings of the 28th ACM Conference on User Modeling, Adaptation and Personalization
Journal ref UMAP 2020: Proceedings of the 28th ACM Conference on User Modeling, Adaptation and Personalization
专题命中 安全评测 :trustworthy(title)
Journal ref IEEETransactionsonRobotics,pp(99):1-16,2020
专题命中 安全评测 :trustworthy(title)
专题命中 安全评测 :trustworthy(title)
Comments 9 pages, 9 figures, 2018 IEEE International Conference on Fuzzy Systems
专题命中 安全评测 :alignment(title)
RubRIX:基于评分标准的风险缓解在护理人员-AI交互中
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; OSF HealthCare(OSF医疗集团) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 RubRIX提出了一种基于评分标准的框架,用于评估护理人员-AI交互中的风险,通过实证方法减少LLM响应的风险组件,为高负担情境下的AI支持系统提供评估方法。
Journal ref Findings of the Association for Computational Linguistics: ACL 2026
解码层面禁忌:大语言模型鲁棒性的诊断压力测试
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文提出Decoding-Level Taboo这一零提示诊断压力测试,通过干预logit空间迫使大语言模型偏离标称路径,评估发现其鲁棒性与参数规模、指令对齐正相关,该测试还可用于生成合成数据集等场景。
DREAMS:基于密度泛函理论的智能体材料模拟研究引擎
机构 * Department of Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程系,密歇根大学,安阿伯,密歇根州,美国) ; Max-Planck-Institute for Sustainable Materials, Materials Informatics, Düsseldorf, Germany(可持续材料研究所,材料信息学,杜塞尔多夫,德国) ; Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程,密歇根大学,安阿伯,密歇根州,美国)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 本文提出基于DFT的分层多智能体框架DREAMS,通过多层安全防护提升LLM智能体材料模拟的可信度,在Sol27LC基准等任务中表现优异,可平衡可信度与成本,推动自主材料模拟发展。
Comments 47 pages, 44 pages of Supporting Information
相同问题,不同答案?衡量与缓解提示特权以实现公平的AI访问
专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract);分类 cs.CL
AI总结 该研究提出统一框架,引入PES指标与PET智能体,在MedQA基准上验证了提示特权的存在,PET可消除该差异,提升AI访问公平性。
评估智能体系统对抗恶意诱导危害的鲁棒性
机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)
专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.LG
AI总结 该研究提出智能体系统危害分类法与BAD-ACTS基准,评估LLM类智能体对抗恶意诱导的鲁棒性,发现其攻击成功率达40%-90%,并提出零样本消息监控防御方法。
用于可泛化深度伪造视频检测的多智能体取证推理
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 针对深度伪造检测的现有方法泛化性不足问题,本文构建含10万视频的FaceVid-Forensics-100K数据集,提出多智能体取证推理框架,在域外测试集上性能优于GPT、Gemini等模型。
Comments 22 pages, 8 figures, 14 tables
面向规则密集型国家标准文档评审的大语言模型基准测试与增强
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL
AI总结 该研究针对规则密集型国家标准文档评审推出首个基准GB/T-Bench,提出多智能体框架GB/T-Reviewer,实验显示其大幅缩小了LLM与专家在该任务上的能力差距,为高风险文档领域可信AI奠定基础。
镜像审视:微调引发的副作用对齐偏差内省
机构 * Institute of Science Tokyo(东京科学大学) ; ZOZO Research(ZOZO研究所) ; Stanford University(斯坦福大学) ; Waseda University(早稻田大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 该研究针对微调引发的副作用对齐偏差问题,提出了Delta感知内省适配器(DAIA),构建了对应数据集,实验显示DAIA性能优于现有内省适配器且泛化性良好。
面向强化学习的鲁棒通用效用方法
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 针对通用效用强化学习的部署效用误指定问题,提出极小极大学习框架及两种收敛随机算法,经LLM安全对齐等实验验证了其有效性。
FinToolBench:评估LLM代理在真实金融工具使用中的表现
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Hunan University(湖南大学) ; Xiamen University(厦门大学) ; Tencent(腾讯) ; UCAS(中国科学技术大学) ; Tongji University(同济大学)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 FinToolBench是首个评估金融工具学习代理真实世界表现的基准,通过760个可执行金融工具和295个严格查询,评估时效性、意图类型和合规性等关键维度。
超越组件测试:验证智能体AI系统
机构 * University of Messina(墨西拿大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 该综述综合257篇相关文献,构建五维分类法分析智能体AI系统验证问题,指出现有方法的缺口,提出面向生命周期的研究议程,主张需在上下文中验证智能体轨迹以实现可信部署。
Comments 61 pages, 3 figures, to be submitted to Springer Artificial Intelligence Review
基于世界模型的具身智能安全性:威胁、防御与评估的生命周期
专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。
已标注评分的概念论证数据集
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 该研究构建了含多维度专家评分的概念论证数据集,提出两种评分函数并基准测试多模型,发现模型性能与通用能力排名相关。
LLM2Vec-Gen:从大型语言模型生成嵌入向量
机构 * McGill University(麦吉尔大学) ; Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ; ServiceNow Research(ServiceNow研究院) ; Cohere ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 LLM2Vec-Gen通过自监督学习生成大型语言模型的嵌入向量,无需微调,提升MTEB基准测试性能,并保留语义和推理能力。
Comments Accepted to COLM 2026
音频大语言模型中基于韵律的越狱:一项对照研究与机制分析
机构 * City University of Hong Kong(香港城市大学) ; City University of Hong Kong (Dongguan)(香港城市大学(东莞))
专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 该研究通过控制文本内容改变语音传递预设构建评估协议与基准,发现特定韵律特征的语音能提升音频大语言模型的越狱成功率,表明语音传递是音频大语言模型安全评估的重要因素。
Comments Accepted at ACM Multimedia 2026 (ACM MM '26). 9 pages, 3 figures. Supplementary material included
Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10-14, 2026, Rio de Janeiro, Brazil
印度评估:一个在印度语言和文化背景下评估大语言模型的开放基准框架
专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 Inspect India Evals是在印度语言文化背景下评估大语言模型的开放框架,基于Inspect AI平台构建,含六个基准。测试五个模型,Sarvam-M 24B和Gemma 2 27B表现最佳,各模型在多语言安全测试中表现一致,DPI安全得分有差异,框架公开可扩展。
Comments 19 pages, 9 figures, 7 tables
人工智能生成的图像在高风险场景中挑战视觉信任
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 研究聚焦人工智能生成图像在高风险场景下对视觉信任的挑战,提出SafeIMG基准,涵盖12个安全场景。评估专门探测器和视觉语言模型,发现它们检测可靠性不足,模型解释覆盖低,表明当前探测器在多方面欠缺,难以可靠评估此类图像。
重新审视零样本摘要:对大语言模型摘要器可信度的实证研究
机构 * Department of Computer Science, University of Delhi(德里大学计算机科学系) ; Department of Statistics, Ramjas College, University of Delhi(德里大学拉姆贾斯学院统计系)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 研究针对大语言模型零样本摘要的稳定性与可信度问题,提出两级诊断协议,通过文档级稳定性分析及分层样本观察估计稳定性指数,经对三种文档类型的三个LLM摘要器实证研究,揭示差异,推动相关研究发展。
Comments 28 pages, Under review in a journal
VLT:用于工业智能的视觉-语言-时间序列多模态基础模型
机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) ; School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 针对工业时间序列单模态建模局限及连接时间序列与文本语义的挑战,提出VLT多模态基础模型,通过设计Time-MoE等机制联合建模多种模态,经实验验证其在多种复杂设置下优于现有方法,提升了鲁棒性和泛化能力。
Comments 18 pages, 13 figures, and 13 tables, including supplementary material. Haiteng Wang and Jingheng Yan contributed equally to this work