Eliciting Harmful Capabilities by Fine-Tuning On Safeguarded Outputs
通过在受保护的输出上微调来激发有害能力
机构 * MATS ; Anthropic ; Scale AI
AI总结 通过在受保护的输出上微调,研究揭示了如何利用诱骗攻击在开源模型中激发有害能力,展示了输出级保护措施在缓解生态系统风险方面的局限性。
大厂专区
通过在受保护的输出上微调来激发有害能力
机构 * MATS ; Anthropic ; Scale AI
AI总结 通过在受保护的输出上微调,研究揭示了如何利用诱骗攻击在开源模型中激发有害能力,展示了输出级保护措施在缓解生态系统风险方面的局限性。
MASK基准:在人工智能系统中区分诚实与准确性
机构 * Center for AI Safety(人工智能安全中心) ; Scale AI
AI总结 本文提出MASK基准,通过大规模人工数据集区分LLM的准确性和诚实性,发现大模型虽更准确但不更诚实,简单干预可提升诚实度,强调需加强评估与干预以确保模型可信。
Comments Website: https://www.mask-benchmark.ai
对抗样本并非皆相同
机构 * Scale AI ; CrowdStrike ; EleutherAI
AI总结 本文提出对抗样本分为两种类型,通过集成度量方法分析其构成,重新审视对抗鲁棒性相关现象。
提升法再审视:对基于线性规划的集成方法的基准测试与推进
机构 * Industrial Engineering and Management Science University of Twente(特文特大学工业工程与管理科学学院) ; CIRRELT & SCALE-AI Chair in Data-Driven Supply Chains Polytechnique Montréal(蒙特利尔大学数据驱动供应链联合主席) ; LAAS-CNRS Université de Toulouse(图卢兹大学CNRS LAAS研究所)
AI总结 本文提出两种新的基于线性规划的提升方法,通过大规模实验展示其在多种数据集上的性能,证明其在使用浅层树时可超越现有启发式方法,并产生更稀疏的集成。
Comments Published in Transactions on Machine Learning Research (2025), see: https://openreview.net/forum?id=lscC4PZUE4
基于点的进展:围绕科学目标重新构建语言模型基准测试
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Scale AI
AI总结 本文提出以科学目标为导向的语言模型基准测试环境,通过标准化数据集和训练框架,推动语言模型领域的科学进步。
思维链可监控性:AI安全的新且脆弱的机会
机构 * UK AI Security Institute(英国人工智能安全研究所) ; Apollo Research(阿波罗研究) ; METR ; University of Montreal(蒙特利尔大学) ; Mila ; Anthropic ; OpenAI(开放人工智能研究所) ; Google DeepMind(谷歌DeepMind) ; Truthful AI ; UC Berkeley(伯克利大学) ; Center for AI Safety(人工智能安全中心) ; AI Futures Project(人工智能未来项目) ; Amazon(亚马逊) ; Scale AI ; Magic ; Meta ; Redwood Research(红木研究)
AI总结 本文探讨了通过监控AI思维链来提升安全性的潜力,指出其脆弱性并呼吁进一步研究和投资。
推进自动驾驶:DepthSense与雷达与空间注意力
机构 * School of Electrical Engineering and Computer Science, Gwangju Institute of Science and Technology(全州科学技术院电气工程与计算机科学学院) ; Division of National Science and Technology Data (Large Scale AI Research Group), Korea Institute of Science and Technology Information (KISTI)(国家科学技术数据 division(大规模人工智能研究组),韩国科学技术信息研究院) ; Department of Information Systems, College of Computer Sciences and Information Technology, King Faisal University(国王法尔萨大学信息系统系,计算机科学与信息科技学院)
AI总结 DepthSense通过结合雷达与单目相机数据,提升自动驾驶中的深度估计精度,采用编码器-解码器架构和空间注意力机制,实现高效且准确的深度感知。
Journal ref IEEE Sensors Journal 2025
开放权重生物基础模型的生物风险评估最佳实践
机构 * Scale AI ; SecureBio ; Center for AI Safety(AI安全中心) ; Princeton University(普林斯顿大学)
AI总结 本文提出BioRiskEval框架,用于评估开放权重生物基础模型的鲁棒性,揭示现有数据过滤方法的局限性,并强调需进一步研究安全策略。
Comments 17 Pages, 5 figures
机构 * Scale AI ; University of Maryland(马里兰大学) ; University of Chicago(芝加哥大学) ; Washington University, St. Louis(圣路易斯华盛顿大学) ; McGill University(麦吉尔大学) ; University of California, Berkeley(加州大学伯克利分校)
Comments 27 pages, 21 figures, pre-print
机构 * Department of Computer Science and Operations Research Université de Montréal(计算机科学与运筹学系,蒙特利尔大学) ; GERAD & Department of Decision Sciences HEC Montréal(GERAD与决策科学系,蒙特利尔HEC) ; CIRRELT & SCALE-AI Chair in Data-Driven Supply Chains, Department of Mathematical and Industrial Engineering, Polytechnique Montréal(CIRRELT与数据驱动供应链主席职位,数学与工业工程系,蒙特利尔Polytechnique)
Journal ref European Journal of Operational Research 320(2), 2025 271-289
机构 * Center for AI Safety(人工智能安全中心) ; Scale AI
Comments Website: https://www.remotelabor.ai
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Seoul National University(首尔国立大学) ; Qatar Computing Research Institute(卡塔尔计算研究所) ; Google(谷歌) ; George Washington University(乔治华盛顿大学) ; Stanford University(斯坦福大学) ; Scale AI ; University of Washington(华盛顿大学)
机构 * Open-Thought ; Scale AI ; University College London(伦敦大学学院)
Comments NeurIPS 2025 Spotlight. For code, see https://github.com/open-thought/reasoning-gym
机构 * Scale AI
机构 * Google(谷歌) ; Vanderbilt University(范德比大学) ; Cornell University(康奈尔大学) ; DeepMind(深Mind) ; University of Alberta(阿尔伯塔大学) ; Virginia Tech(弗吉尼亚理工学院) ; Scale AI
机构 * Scale AI
Comments 12 pages, 7 figures, submitted to NeurIPS
机构 * Anthropic ; Scale AI ; Redwood Research
机构 * Scale AI
机构 * Scale AI
机构 * University of Toronto(多伦多大学) ; Vector Institute for Artificial Intelligence(向量人工智能研究所) ; Scale AI Research Chair in Data-Driven Algorithms for Modern Supply Chains(数据驱动算法现代供应链研究席位)
Comments ICML 2025
机构 * Scale-AI Chair, Polytechnique Montréal(Polytechnique Montréal 的 Scale-AI 教席) ; Ensai, Université de Rennes(Université de Rennes 的 Ensai) ; CentraleSupélec, Université de Rennes(Université de Rennes 的 CentraleSupélec)
机构 * Cl\' e ment Elvira CentraleSupelec, CNRS, IETR - UMR 6164, Rennes, France Th\' e o Guyard Scale-AI Chair, Polytechnique Montr\' e al, Canada C\' e dric Herzet Ensai, CNRS, CREST - UMR 9194, Rennes, France
机构 * Scale AI
机构 * Scale AI
Comments ICLR '25 Workshop on Spurious Correlation and Shortcut Learning