arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Scale AI

共收录 54
2601.13528 2026-01-21 cs.CR cs.AI cs.CL cs.LG cs.SE

Eliciting Harmful Capabilities by Fine-Tuning On Safeguarded Outputs

通过在受保护的输出上微调来激发有害能力

Jackson Kaunismaa, Avery Griffin, John Hughes, Christina Q. Knight, Mrinank Sharma, Erik Jones

机构 * MATS Anthropic Scale AI

AI总结 通过在受保护的输出上微调,研究揭示了如何利用诱骗攻击在开源模型中激发有害能力,展示了输出级保护措施在缓解生态系统风险方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03750 2026-01-07 cs.LG cs.AI cs.CL cs.CY

The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems

MASK基准:在人工智能系统中区分诚实与准确性

Richard Ren, Arunim Agarwal, Mantas Mazeika, Cristina Menghini, Robert Vacareanu, Brad Kenstler, Mick Yang, Isabelle Barrass, Alice Gatti, Xuwang Yin, Eduardo Trevino, Matias Geralnik, Adam Khoja, Dean Lee, Summer Yue, Dan Hendrycks

机构 * Center for AI Safety(人工智能安全中心) Scale AI

AI总结 本文提出MASK基准,通过大规模人工数据集区分LLM的准确性和诚实性,发现大模型虽更准确但不更诚实,简单干预可提升诚实度,强调需加强评估与干预以确保模型可信。

Comments Website: https://www.mask-benchmark.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00577 2026-01-05 cs.LG

Adversarial Samples Are Not Created Equal

对抗样本并非皆相同

Jennifer Crawford, Amol Khanna, Fred Lu, Amy R. Wagoner, Stella Biderman, Andre T. Nguyen, Edward Raff

机构 * Scale AI CrowdStrike EleutherAI

AI总结 本文提出对抗样本分为两种类型,通过集成度量方法分析其构成,重新审视对抗鲁棒性相关现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18242 2025-12-22 cs.LG

Boosting Revisited: Benchmarking and Advancing LP-Based Ensemble Methods

提升法再审视:对基于线性规划的集成方法的基准测试与推进

Fabian Akkerman, Julien Ferry, Christian Artigues, Emmanuel Hebrard, Thibaut Vidal

机构 * Industrial Engineering and Management Science University of Twente(特文特大学工业工程与管理科学学院) CIRRELT & SCALE-AI Chair in Data-Driven Supply Chains Polytechnique Montréal(蒙特利尔大学数据驱动供应链联合主席) LAAS-CNRS Université de Toulouse(图卢兹大学CNRS LAAS研究所)

AI总结 本文提出两种新的基于线性规划的提升方法,通过大规模实验展示其在多种数据集上的性能,证明其在使用浅层树时可超越现有启发式方法,并产生更稀疏的集成。

Comments Published in Transactions on Machine Learning Research (2025), see: https://openreview.net/forum?id=lscC4PZUE4

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11183 2025-12-15 cs.LG

Progress over Points: Reframing LM Benchmarks Around Scientific Objectives

基于点的进展:围绕科学目标重新构建语言模型基准测试

Alwin Jin, Sean M. Hendryx, Vaskar Nath

机构 * Georgia Institute of Technology(佐治亚理工学院) Scale AI

AI总结 本文提出以科学目标为导向的语言模型基准测试环境,通过标准化数据集和训练框架,推动语言模型领域的科学进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11473 2025-12-09 cs.AI cs.LG stat.ML

Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety

思维链可监控性:AI安全的新且脆弱的机会

Tomek Korbak, Mikita Balesni, Elizabeth Barnes, Yoshua Bengio, Joe Benton, Joseph Bloom, Mark Chen, Alan Cooney, Allan Dafoe, Anca Dragan, Scott Emmons, Owain Evans, David Farhi, Ryan Greenblatt, Dan Hendrycks, Marius Hobbhahn, Evan Hubinger, Geoffrey Irving, Erik Jenner, Daniel Kokotajlo, Victoria Krakovna, Shane Legg, David Lindner, David Luan, Aleksander Mądry, Julian Michael, Neel Nanda, Dave Orr, Jakub Pachocki, Ethan Perez, Mary Phuong, Fabien Roger, Joshua Saxe, Buck Shlegeris, Martín Soto, Eric Steinberger, Jasmine Wang, Wojciech Zaremba, Bowen Baker, Rohin Shah, Vlad Mikulik

机构 * UK AI Security Institute(英国人工智能安全研究所) Apollo Research(阿波罗研究) METR University of Montreal(蒙特利尔大学) Mila Anthropic OpenAI(开放人工智能研究所) Google DeepMind(谷歌DeepMind) Truthful AI UC Berkeley(伯克利大学) Center for AI Safety(人工智能安全中心) AI Futures Project(人工智能未来项目) Amazon(亚马逊) Scale AI Magic Meta Redwood Research(红木研究)

AI总结 本文探讨了通过监控AI思维链来提升安全性的潜力,指出其脆弱性并呼吁进一步研究和投资。

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.05265 2025-11-25 cs.RO cs.CV cs.LG

Advancing Autonomous Driving: DepthSense with Radar and Spatial Attention

推进自动驾驶:DepthSense与雷达与空间注意力

Muhamamd Ishfaq Hussain, Zubia Naz, Muhammad Aasim Rafique, Moongu Jeon

机构 * School of Electrical Engineering and Computer Science, Gwangju Institute of Science and Technology(全州科学技术院电气工程与计算机科学学院) Division of National Science and Technology Data (Large Scale AI Research Group), Korea Institute of Science and Technology Information (KISTI)(国家科学技术数据 division(大规模人工智能研究组),韩国科学技术信息研究院) Department of Information Systems, College of Computer Sciences and Information Technology, King Faisal University(国王法尔萨大学信息系统系,计算机科学与信息科技学院)

AI总结 DepthSense通过结合雷达与单目相机数据,提升自动驾驶中的深度估计精度,采用编码器-解码器架构和空间注意力机制,实现高效且准确的深度感知。

Journal ref IEEE Sensors Journal 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27629 2025-11-24 cs.CR cs.AI

Best Practices for Biorisk Evaluations on Open-Weight Bio-Foundation Models

开放权重生物基础模型的生物风险评估最佳实践

Boyi Wei, Zora Che, Nathaniel Li, Udari Madhushani Sehwag, Jasper Götting, Samira Nedungadi, Julian Michael, Summer Yue, Dan Hendrycks, Peter Henderson, Zifan Wang, Seth Donoughe, Mantas Mazeika

机构 * Scale AI SecureBio Center for AI Safety(AI安全中心) Princeton University(普林斯顿大学)

AI总结 本文提出BioRiskEval框架,用于评估开放权重生物基础模型的鲁棒性,揭示现有数据过滤方法的局限性,并强调需进一步研究安全策略。

Comments 17 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07685 2025-11-12 cs.AI cs.CL cs.LG

ResearchRubrics: A Benchmark of Prompts and Rubrics For Evaluating Deep Research Agents

Manasi Sharma, Chen Bo Calvin Zhang, Chaithanya Bandi, Clinton Wang, Ankit Aich, Huy Nghiem, Tahseen Rabbani, Ye Htet, Brian Jang, Sumana Basu, Aishwarya Balwani, Denis Peskoff, Marcos Ayestaran, Sean M. Hendryx, Brad Kenstler, Bing Liu

机构 * Scale AI University of Maryland(马里兰大学) University of Chicago(芝加哥大学) Washington University, St. Louis(圣路易斯华盛顿大学) McGill University(麦吉尔大学) University of California, Berkeley(加州大学伯克利分校)

Comments 27 pages, 21 figures, pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10374 2025-11-11 math.OC cs.LG

A Survey of Contextual Optimization Methods for Decision Making under Uncertainty

Utsav Sadana, Abhilash Chenreddy, Erick Delage, Alexandre Forel, Emma Frejinger, Thibaut Vidal

机构 * Department of Computer Science and Operations Research Université de Montréal(计算机科学与运筹学系,蒙特利尔大学) GERAD & Department of Decision Sciences HEC Montréal(GERAD与决策科学系,蒙特利尔HEC) CIRRELT & SCALE-AI Chair in Data-Driven Supply Chains, Department of Mathematical and Industrial Engineering, Polytechnique Montréal(CIRRELT与数据驱动供应链主席职位,数学与工业工程系,蒙特利尔Polytechnique)

Journal ref European Journal of Operational Research 320(2), 2025 271-289

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26787 2025-10-31 cs.LG cs.AI cs.CL

Remote Labor Index: Measuring AI Automation of Remote Work

Mantas Mazeika, Alice Gatti, Cristina Menghini, Udari Madhushani Sehwag, Shivam Singhal, Yury Orlovskiy, Steven Basart, Manasi Sharma, Denis Peskoff, Elaine Lau, Jaehyuk Lim, Lachlan Carroll, Alice Blair, Vinaya Sivakumar, Sumana Basu, Brad Kenstler, Yuntao Ma, Julian Michael, Xiaoke Li, Oliver Ingebretsen, Aditya Mehta, Jean Mottola, John Teichmann, Kevin Yu, Zaina Shaik, Adam Khoja, Richard Ren, Jason Hausenloy, Long Phan, Ye Htet, Ankit Aich, Tahseen Rabbani, Vivswan Shah, Andriy Novykov, Felix Binder, Kirill Chugunov, Luis Ramirez, Matias Geralnik, Hernán Mesura, Dean Lee, Ed-Yeremai Hernandez Cardona, Annette Diamond, Summer Yue, Alexandr Wang, Bing Liu, Ernesto Hernandez, Dan Hendrycks

机构 * Center for AI Safety(人工智能安全中心) Scale AI

Comments Website: https://www.remotelabor.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02175 2025-10-31 cs.CL

AI Debate Aids Assessment of Controversial Claims

Salman Rahman, Sheriff Issaka, Ashima Suvarna, Genglin Liu, James Shiffer, Jaeyoung Lee, Md Rizwan Parvez, Hamid Palangi, Shi Feng, Nanyun Peng, Yejin Choi, Julian Michael, Liwei Jiang, Saadia Gabriel

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Seoul National University(首尔国立大学) Qatar Computing Research Institute(卡塔尔计算研究所) Google(谷歌) George Washington University(乔治华盛顿大学) Stanford University(斯坦福大学) Scale AI University of Washington(华盛顿大学)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24760 2025-10-21 cs.LG cs.AI cs.CL

REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards

Zafir Stojanovski, Oliver Stanley, Joe Sharratt, Richard Jones, Abdulhakeem Adefioye, Jean Kaddour, Andreas Köpf

机构 * Open-Thought Scale AI University College London(伦敦大学学院)

Comments NeurIPS 2025 Spotlight. For code, see https://github.com/open-thought/reasoning-gym

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02663 2025-10-06 cs.LG cs.AI

TutorBench: A Benchmark To Assess Tutoring Capabilities Of Large Language Models

Rakshith S Srinivasa, Zora Che, Chen Bo Calvin Zhang, Diego Mares, Ernesto Hernandez, Jayeon Park, Dean Lee, Guillermo Mangialardi, Charmaine Ng, Ed-Yeremai Hernandez Cardona, Anisha Gunjal, Yunzhong He, Bing Liu, Chen Xing

机构 * Scale AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00263 2025-10-02 cs.CL

Judging with Confidence: Calibrating Autoraters to Preference Distributions

Zhuohang Li, Xiaowei Li, Chengyu Huang, Guowang Li, Katayoon Goshvadi, Bo Dai, Dale Schuurmans, Paul Zhou, Hamid Palangi, Yiwen Song, Palash Goyal, Murat Kantarcioglu, Bradley A. Malin, Yuan Xue

机构 * Google(谷歌) Vanderbilt University(范德比大学) Cornell University(康奈尔大学) DeepMind(深Mind) University of Alberta(阿尔伯塔大学) Virginia Tech(弗吉尼亚理工学院) Scale AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14922 2025-06-26 cs.CY cs.LG

FORTRESS: Frontier Risk Evaluation for National Security and Public Safety

Christina Q. Knight, Kaustubh Deshpande, Ved Sirdeshmukh, Meher Mankikar, Scale Red Team, SEAL Research Team, Julian Michael

机构 * Scale AI

Comments 12 pages, 7 figures, submitted to NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18032 2025-06-24 cs.LG

Why Do Some Language Models Fake Alignment While Others Don't?

Abhay Sheshadri, John Hughes, Julian Michael, Alex Mallen, Arun Jose, Janus, Fabien Roger

机构 * Anthropic Scale AI Redwood Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11425 2025-06-24 cs.CL cs.AI

Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards

Jeff Da, Clinton Wang, Xiang Deng, Yuntao Ma, Nikhil Barhate, Sean Hendryx

机构 * Scale AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13923 2025-06-23 cs.LG cs.AI cs.CL

Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models

Vaskar Nath, Elaine Lau, Anisha Gunjal, Manasi Sharma, Nikhil Baharte, Sean Hendryx

机构 * Scale AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15794 2025-06-11 cs.LG cs.AI cs.CL cs.LO

Self-Supervised Transformers as Iterative Solution Improvers for Constraint Satisfaction

Yudong W. Xu, Wenhao Li, Scott Sanner, Elias B. Khalil

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Scale AI Research Chair in Data-Driven Algorithms for Modern Supply Chains(数据驱动算法现代供应链研究席位)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06373 2025-06-10 cs.MS cs.LG math.OC

El0ps: An Exact L0-regularized Problems Solver

Théo Guyard, Cédric Herzet, Clément Elvira

机构 * Scale-AI Chair, Polytechnique Montréal(Polytechnique Montréal 的 Scale-AI 教席) Ensai, Université de Rennes(Université de Rennes 的 Ensai) CentraleSupélec, Université de Rennes(Université de Rennes 的 CentraleSupélec)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03974 2025-06-05 math.OC cs.LG stat.ML

A Generic Branch-and-Bound Algorithm for $\ell_0$-Penalized Problems with Supplementary Material

Clément Elvira, Théo Guyard, Cédric Herzet

机构 * Cl\' e ment Elvira CentraleSupelec, CNRS, IETR - UMR 6164, Rennes, France Th\' e o Guyard Scale-AI Chair, Polytechnique Montr\' e al, Canada C\' e dric Herzet Ensai, CNRS, CREST - UMR 9194, Rennes, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09638 2025-05-30 cs.CL cs.AI

Jailbreaking to Jailbreak

Jeremy Kritz, Vaughn Robinson, Robert Vacareanu, Bijan Varjavand, Michael Choi, Bobby Gogov, Scale Red Team, Summer Yue, Willow E. Primack, Zifan Wang

机构 * Scale AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05704 2025-05-12 cs.CL cs.AI

Assessing Robustness to Spurious Correlations in Post-Training Language Models

Julia Shuieh, Prasann Singhal, Apaar Shanker, John Heyer, George Pu, Samuel Denton

机构 * Scale AI

Comments ICLR '25 Workshop on Spurious Correlation and Shortcut Learning

详情

展开后加载摘要…

URL PDF HTML 收藏