arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Scale AI

共收录 10
2608.11669 2026-08-13 cs.LG cs.AI cs.CL 新提交

Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

规则丢弃(Rubric Dropout):缓解以规则为奖励的强化学习中奖励黑客行为的简单方法

Minglai Yang, Xinyu Guo, Utkarsh Tyagi, Mian Zhang, Razvan Dumitru, Sunjie Hou, Yunzhong He, Daniel Yue Zhang, Ying Liu

机构 * Scale AI University of Arizona(亚利桑那大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

AI总结 该研究针对以规则为奖励的强化学习中的奖励黑客行为,提出Rubric Dropout方法,在医学和科学规则上训练Qwen3-8B,可提升分布外基准的黄金评判分数、降低黑客指标,30-50%丢弃比例效果最优。

Comments 18 pages, 7 figures, 4 tables. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07796 2026-08-11 cs.AI 新提交

CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

CliniCARE-Bench:电子健康记录中医疗推理的临床校准审计

Veronica Chatrath, Bryan Zhu, George Pu, Jingxuan Fan, Apaar Shanker, Varun Ursekar, Anahita Sharma, Jason Qin, Keqi Han, Soham Dinesh Tiwari, Soham Dan, Vijay Kalmath, Yuan Li, Daniel Yue Zhang, Chenguang Wang, Zainab Doctor, Zhijun Yin, Nigam H. Shah, Yuan Xue

机构 * Scale AI Emory University(埃默里大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Vanderbilt University Medical Center(范德堡大学医学中心) Stanford School of Medicine(斯坦福医学院) Stanford Health Care(斯坦福医疗保健系统) Clinical Excellence Research Center(临床卓越研究中心)

AI总结 本研究推出首个面向部署的临床智能体基准CliniCARE-Bench,评估智能体对真实纵向电子健康记录的医疗推理,发现原始准确率夸大调查质量,无缺陷准确率更低且会重新排序排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06301 2026-08-07 cs.AI cs.CL cs.LG 新提交

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

HarnessOpt-Bench:评估大型语言模型的 harness 优化能力

Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

机构 * Scale AI

AI总结 本研究提出HarnessOpt-Bench基准,评估前沿LLM在高成本随机评估下的端到端harness优化能力,发现优化器模型差异大于编码harness、原生harness非始终更优,该能力具可测性与提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25182 2026-07-29 cs.CL cs.AI cs.IR 新提交

TabRank: Chain-of-Thought Distillation for Table Re-Rankers

TabRank:表格重排器的思维链蒸馏

Adarsh Singh, Kushal Raj Bhandari, Jianxi Gao, Soham Dan, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) Scale AI

AI总结 研究针对表格检索训练推理重排器的问题,提出TabRank框架,通过构建数据集并探索两种训练紧凑推理模型的变体,经压力测试,该方法在多表格检索数据集上显著提升性能,有效推广到多表格推理。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16122 2026-07-20 cs.AI cs.LG 新提交

CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data

CRAFT:聚类评分标准以诊断大型语言模型的能力短板并生成针对性的微调数据

Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong He

机构 * Scale AI(Scale人工智能公司)

AI总结 研究针对评估应指导模型改进及提供训练数据的问题,提出CRAFT方法,将评分标准评估数据集转化为模型能力短板诊断,通过聚类能力描述、评估模型节点等生成微调数据,实验表明该方法能更精准诊断模型弱点并提升性能。

Comments 18 pages, 3 Tables, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07762 2026-07-10 cs.LG math.OC 新提交

Trustworthy Machine Learning through the Lens of Combinatorial Optimization: Survey and Research Perspectives

从组合优化视角看可信机器学习:综述与研究展望

Thibaut Vidal, Julien Ferry

机构 * CIRRELT & SCALE-AI Chair in Data-Driven Supply Chains, Department of Mathematics and Industrial Engineering, Polytechnique Montreal(CIRRELT与数据驱动供应链的SCALE-AI主席、数学与工业工程系,蒙特利尔大学)

AI总结 探讨如何从组合优化视角实现可信机器学习,回顾并综合其与组合优化交叉领域进展,涵盖训练及训练后多任务,指出组合优化公式比纯启发式方法更具优势,虽有挑战,但在可信机器学习系统设计和部署中作用将增大。

Comments 67 pages, 16 mathematical highlights

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25380 2026-06-25 cs.CL 新提交

A Survey of Toxicity Detection and Mitigation Strategies for Multilingual Language Models

多语言语言模型毒性检测与缓解策略综述

Soham Dan, Himanshu Beniwal, Thomas Hartvigsen

机构 * Scale AI Indian Institute of Technology Gandhinagar(印度理工学院甘地讷格尔分校) University of Virginia(弗吉尼亚大学)

AI总结 综述多语言大模型的毒性检测与缓解方法,包括威胁模型、检测方法(跨语言编码器、翻译流水线等)和缓解策略(数据过滤、偏好调优等),指出语言覆盖不均、文化依赖等挑战。

Comments Accepted to the Findings of ACL, 2026

Journal ref Findings of ACL, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21654 2026-06-23 cs.AI cs.CL 新提交

ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks

ChainWorld: 从原子OSWorld任务组合成长时桌面工作负载

Vincent Siu, Manasi Sharma, Dawn Song, Daniel Yue Zhang, Chenguang Wang

机构 * Scale AI University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克鲁兹分校)

AI总结 提出ChainWorld,通过方向兼容性搜索将原子OSWorld任务组合成长时桌面工作负载,包含347条长度为2-4的任务链,评估四种智能体,最高完成率31%,揭示单轮与多轮评估的不同失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07822 2026-06-19 cs.CL cs.AI cs.LG 新提交

The ACUTE Protocol: Operationalizing Language Model Activations for Better Calibration, Utility, and Trust

ACUTE协议:操作语言模型激活以实现更好的校准、效用和信任

Nishant Subramani, Palash Goyal, Yiwen Song, Mani Malek, Yuan Xue, Tomas Pfister, Hamid Palangi

机构 * Carnegie Mellon University(卡内基梅隆大学) Google(谷歌) Scale AI

AI总结 提出ACUTE协议,通过操作语言模型激活来估计置信度,平衡校准与信息性,在多项选择问答、工具调用和科学文档摘要等任务上优于强基线,提升校准、效用和可信度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12507 2026-06-12 cs.LG 新提交

Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers

基于评分标准的自蒸馏:无需评分标准验证器的后训练

MohammadHossein Rezaei, Anas Mahmoud, Zihao Wang, Utkarsh Tyagi, Advait Gosai, Razvan-Gabriel Dumitru, Aakash Sabharwal, Bing Liu, Yunzhong He

机构 * Scale AI

AI总结 提出RGSD方法,通过将评分标准作为条件蒸馏到学生模型,无需验证器即可实现密集逐令牌学习,在医学和科学领域达到与基于评判的GRPO相当的评分标准满足率。

详情

展开后加载摘要…

URL PDF HTML 收藏