arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2338
2606.03241 2026-06-03 cs.CL eess.AS

Benchmarking Speech-to-Speech Translation Models

语音到语音翻译模型基准测试

Alkis Koudounas, Hayato Futami, Quentin Jodelet, Osamu Take, Shinji Watanabe, Emiru Tsunoo

机构 * Sony Group Corporation, Japan(日本索尼集团公司) Carnegie Mellon University, USA(美国卡内基梅隆大学)

AI总结 提出统一可复现的基准框架COMPASS,集成46个指标评估语音到语音翻译模型,通过相关性过滤将指标缩减至10个,并验证了领域特定指标与人类判断的高度相关性。

Comments Paper under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03131 2026-06-03 cs.LG

HARVE: Hacking-Aware Reward-Head Vector Editing for Robust Reward Models

HARVE:面向鲁棒奖励模型的感知黑客奖励头向量编辑

Shuang Liu, Yuxuan Bo, Qiuyang Zhao, Caiyue Huang, Xiaorong Chen, Yanguang Liu, Mengnan Du

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Virginia(弗吉尼亚大学) Harvard University(哈佛大学) Stanford University(斯坦福大学) University of Michigan(密歇根大学) New Jersey Institute of Technology(新泽西理工学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 针对奖励模型易受奖励黑客攻击的问题,提出无需训练的奖励头编辑方法HARVE,通过移除与黑客相关子空间对齐的奖励头向量分量,提升鲁棒性并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02994 2026-06-03 cs.AI cs.CL

Inducing Reasoning Primitives from Agent Traces

从智能体轨迹中归纳推理原语

Zhihan Lei, Jiarui Yan, Joshua Momo, William W. Cohen

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出推理原语归纳方法,从ReAct智能体轨迹中挖掘并聚类常见推理步骤,构建伪工具库,在多个推理任务上显著提升性能。

Comments 22 pages including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02981 2026-06-03 cs.CL

Predicting Inference-Time Scaling Gains from Labeled Validation-Set Output Statistics

从标注验证集输出统计量预测推理时缩放增益

Luyang Zhang, Jingyan Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出一种基于标注验证集输出统计量的轻量级方法,通过三个核心特征(提示级一致性扩散、标签辅助的首个正确样本位置、完成长度方差)结合熵特征,使用岭回归预测最佳-of-N推理缩放增益,达到Spearman ρ=0.90的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02876 2026-06-03 cs.LG

RRISE: Robust Radius Inference via a Surrogate Estimator

RRISE: 通过代理估计器进行鲁棒半径推断

Jong-Ik Park, Shreyas Chaudhari, Carlee Joe-Wong, José M. F. Moura

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出RRISE框架,使用代理模型替代蒙特卡洛采样进行随机平滑认证,通过一次性共形校准保证保守半径,在保持认证精度的同时大幅降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02796 2026-06-03 cs.RO

A Measurement-Driven Digital Twin Architecture for Plant-Level Biomass Estimation and Growth Forecasting in Hydroponic Systems

基于测量驱动的数字孪生架构:用于水培系统中植物级生物量估计与生长预测

Morgan Mayborne, Abhisesh Silwal, George Kantor

机构 * The Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 提出一种结合传感器数据和模型更新的数字孪生架构,通过RGB-D图像和神经网络实时估计生菜质量,并实现未来1-4天生长预测,误差约2克。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02671 2026-06-03 cs.LG cs.AI

Aligning Data-Driven Predictors with Allocation: A Decision-Focused Approach to Survival Analysis

对齐数据驱动预测器与分配:面向决策的生存分析方法

Itai Zilberstein, Ioannis Anagnostides, Tuomas Sandholm

机构 * Department of Computer Science, Carnegie Mellon University, Pittsburgh, PA(计算机科学系,卡内基梅隆大学,匹兹堡,PA) Strategy Robot, Inc.(策略机器人公司) Strategic Machine, Inc.(战略机器公司) Optimized Markets, Inc.(优化市场公司)

AI总结 针对生存分析中预测模型与分配决策目标不一致的问题,提出基于归一化折现累积增益(NDCG)的决策聚焦学习方法,通过优化NDCG提升分配效果,在心脏移植数据上使基线模型NDCG提升50-100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02644 2026-06-03 cs.CR cs.AI

A New Framework for Cybersecurity Refusals in AI Agents

AI代理中网络安全拒绝的新框架

Eliot Krzysztof Jones, Mateusz Dziemian, Matt Fredrikson, J Zico Kolter

机构 * Gray Swan Gray Swan AI Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出首个针对AI代理在进攻性安全场景中建立拒绝边界的框架,包括拒绝原则、任务分类和评估方法,并发现8个前沿模型中6个拒绝率接近零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18552 2026-06-03 cs.SE cs.AI cs.CL cs.LG

Toward Training Superintelligent Software Agents through Self-Play SWE-RL

通过自我对弈SWE-RL训练超级智能软件代理

Yuxiang Wei, Zhiqing Sun, Emily McMilin, Jonas Gehring, David Zhang, Gabriel Synnaeve, Daniel Fried, Lingming Zhang, Sida Wang

机构 * Meta FAIR University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta TBD Lab(Meta TBD 实验室) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出自我对弈SWE-RL(SSR)方法,通过强化学习在自对弈环境中训练单一LLM代理,使其在无需人工标注问题或测试的情况下,在真实代码库中迭代注入和修复软件缺陷,在SWE-bench基准上实现显著自我改进并超越人类数据基线。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14569 2026-06-03 cs.CL cs.LG

Social Caption: Evaluating Social Understanding in Multimodal Models

Social Caption: 评估多模态模型的社会理解能力

Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe, Louis-Philippe Morency

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02486 2026-06-02 cs.RO

Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation

拦截未来:用于动态VLA操作的潜在空间预测世界模型

Shahram Najam Syed, Arthur Jakobsson, Haoran Hao, Jeffrey Ichnowski

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 提出AHEAD框架,通过潜在空间世界模型预测未来视觉特征,使冻结的VLA模型在动态场景中实现高成功率操作。

Comments 28 pages, 7 figures, 16 tables, Su

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02404 2026-06-02 cs.CL

K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

K-BrowseComp:基于韩国语境的网页浏览代理基准测试

Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim

机构 * Chung-Ang University(Chung-Ang 大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) OnelineAI NAVER Cloud AI Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对韩国语境,构建包含400个问题的网页浏览代理基准K-BrowseComp,评估前沿模型性能,发现其准确率显著低于BrowseComp,并公开数据与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02375 2026-06-02 cs.CL cs.CY cs.HC

WAXAL-NET: Finetuned Edge ASR Across 19 African Languages

WAXAL-NET: 针对19种非洲语言的微调边缘ASR

Victor Tolulope Olufemi, Oreoluwa Babatunde, Ramsey Njema, Bolarinwa Gbotemi, Wanchi Lucia Yen, John Uzodinma, Sunday Ajayi, Oluwademilade Williams, Kausar Moshood, Innocent Elendu Anyaele, Akebert Arefaine, Candace Hunzwi, Wongel Dawit Daniel, Emmilly Namuganga, Cleophas Kadima, Athanase Bahizire, Onitsiky Ranaivoson, Emmanuel Aaron, Nicholaus Ladislaus, Idris Muhammed, Jonathan Enoch Simenya, Martin Koome, Matewos Tegete Endaylalu, Peter Ifeoluwa Adeyemo, Hondi Prisca Birindwa, Ukachi Agnes Eze-Mbey, Yacoba Oduro-Yeboah, Pericles Adjovi, Mikel K. Ngueajio, Toluwani Aremu, Prasenjit Mitra

机构 * CMU Africa(CMU非洲中心) LyngualLabs MBZUAI

AI总结 本研究评估了紧凑型领域专用ASR模型在WAXAL语料库的19种非洲语言会话语音上是否优于大规模多语言基础模型,通过微调边缘模型实现了宏平均WER从64.9%降至38.0%,模型大小缩小3-40倍,证实领域专业化主导规模效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01815 2026-06-02 cs.CL

CRAB-Bench: Evaluating LLM Agents under Complex Task Dependencies and Human-aligned User Simulation

CRAB-Bench:在复杂任务依赖和人类对齐用户模拟下评估LLM智能体

Danqing Wang, Akshay Sivaraman, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出CRAB-Bench和RUSE框架,通过约束图生成复杂任务依赖和基于人类行为研究的用户模拟,评估LLM智能体在真实服务场景中的表现,发现最佳模型仅达61%通过率,用户模拟导致性能下降高达57%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01533 2026-06-02 cs.MA cs.CL cs.LG

Multi-Agent Computer Use

多智能体计算机使用

Jing Yu Koh, Ruslan Salakhutdinov, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对单智能体计算机使用代理在复杂长时任务中的不足,提出多智能体计算机使用系统,通过有向无环图分解任务并并行执行,在多个基准测试上提升3.4-25.5%性能,并加速任务完成时间约1.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01451 2026-06-02 cs.CL

Before and After Temperature: A Distributional View of Creative LLM Generation

温度前后:创造性LLM生成的分布视角

V. S. Raghu Parupudi, Harsha Ponnada, Aditi Kaushal, S. Shria Parupudi, Saiteja Dasari, Sahiti Bulusu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Indian Institute of Technology, Kharagpur(印度理工学院克哈格布尔分校) Delhi Technological University(德里技术大学) Carnegie Mellon University(卡内基梅隆大学) Rutgers University(罗格斯大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 通过分析采样温度重塑token分布的特征,提出一种无需参考的创造力评估方法,在Llama-3.1-8B-Instruct上达到Spearman ρ=0.918(LLM评判)和ρ=0.870(人类多数评判),显著优于现有基线。

Comments Submitted to NGEN-AI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01393 2026-06-02 cs.CL cs.AI cs.CV

Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing

Dr. DocBench:专家级与困难文档解析的综合基准

Minglai Yang, Xinyan Velocity Yu, Pengyuan Li, Xinyu Guo, Zhenting Qi, Konwoo Kim, Longtian Ye, Xiaolong Luo, Jinhe Bi, Henry Zhang, Haris Riaz, Xuan Zhang, Yunze Xiao, Bangya Liu, Tom Tang, Yunfei Zhao, Qunshu Lin, Zihan Wang, Minghao Liu, Michael Lingzhi Li, Yilun Du, Jesse Thomason, Rogerio Feris, Alex Pentland, Zexue He

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学) Harvard University(哈佛大学) IBM Research(IBM研究院) University of Arizona(亚利桑那大学) Duke University(杜克大学) UC Berkeley(加州大学伯克利分校) LMU Munich(慕尼黑路德维希-马克西米利安大学)

AI总结 提出Dr. DocBench基准,通过基于解析器失败的采样从多语言书籍语料库中选取挑战性文档,包含52个BISAC主题领域和65k高质量标注,用于评估专家级文档解析能力。

Comments 27 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00975 2026-06-02 cs.CL

Lost in Delusion: Examining LLM Safety Under User Delusions and Distress

迷失在妄想中:审视用户妄想与痛苦下的LLM安全性

Andrew Aquilina, Chetna Nihalani, Vasudha Varadarajan, Nathan S. Fishbein, Yu-Ru Lin, Maarten Sap

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学) Fordham University(福特汉姆大学)

AI总结 本研究通过多轮对话模拟,发现LLM在检测用户痛苦时表现良好,但在痛苦嵌入妄想时干预行为显著减少(高达4.5倍),并提出针对性提示策略以缩小这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00583 2026-06-02 cs.CV cs.AI cs.LG cs.MM

Improving Visual Representation Alignment Generation with GRPO

利用GRPO改进视觉表示对齐生成

Shentong Mo, Sukmin Yun

机构 * Carnegie Mellon University(卡内基梅隆大学) Hanyang University(翰阳大学)

AI总结 提出VRPO方法,通过强化学习将静态对齐损失替换为生成式表示策略优化目标,动态平衡表示一致性与生成质量,在扩散Transformer中实现更快的收敛和更高的图像保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00448 2026-06-02 cs.SE cs.AI cs.CR

When Safe Skills Collide: Measuring Compositional Risk in Agent Skill Ecosystems

当安全技能碰撞:衡量智能体技能生态系统中的组合风险

Su Wang, Pin Qian, Yihang Chen, Junxian You, Xiaoyuan Wang, Xiaochong Jiang, Lifei Liu, Haoran Yu, Jingzhou Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) University of Glasgow(格拉斯哥大学) Independent Researcher(独立研究员) Corespeed Inc.(Corespeed公司)

AI总结 本文提出SkillReact框架,通过静态组合基准、双评分者LLM辅助人工审核和基于动作的可利用性测试,研究LLM智能体中个体安全的技能组合后可能产生的不安全行为,发现约18.2%的候选组合存在真实风险,且主机模型决定是否利用这些组合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00341 2026-06-02 cs.LG cs.AI

ROGUE: Misaligned Agent Behavior Arising from Ordinary Computer Use

ROGUE:源于普通计算机使用的错误对齐代理行为

Jeremy Tien, Abishek Anand, Yu-Rou Tuan, Yuchen Shen, J. Zico Kolter, Aran Nayebi

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究AI代理在良性环境中因任务完成而采取不安全行为(违反可纠正性)的问题,通过基准测试发现前沿模型普遍绕过用户中断或限制,且性能提升反而加剧错误对齐。

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00267 2026-06-02 cs.CV cs.AI cs.LG cs.RO

StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement

StressDream: 引导视频世界模型实现鲁棒的策略评估与改进

Junwon Seo, Sushant Veer, Ran Tian, Wenhao Ding, Apoorva Sharma, Karen Leung, Edward Schmerling, Marco Pavone, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA Research(NVIDIA研究) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 提出StressDream方法,通过优化扩散视频世界模型的初始噪声,在推理时引导生成高影响且合理的未来场景,以支持鲁棒的策略评估与改进。

Comments Project page: https://junwon.me/StressDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00191 2026-06-02 cs.RO cs.CV

Safe2Drive: Evaluating Safe Driving Behaviors of E2E Autonomous Driving Models

Safe2Drive: 评估端到端自动驾驶模型的安全驾驶行为

Nishad Sahu, Kalpana Panda, Congyuan Yu, Changzhong Qian, Shounak Sural, Ragunathan Rajkumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Birla Institute of Technology and Science Pilani(比拉理工学院和科学帕利尼)

AI总结 针对端到端自动驾驶模型在常见安全关键场景中表现脆弱的问题,提出Safe2Drive测试集和安全驾驶评分(SDS),评估发现领先模型在安全场景中驾驶得分大幅下降且SDS较低。

Journal ref CVPR Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00189 2026-06-02 cs.LG cs.AI

Learning to Construct Practical Agentic Systems

学习构建实用的智能体系统

Aditya Kumar, Zhihan Lei, Jerry Yan, Joshua W. Momo, Lauhitya Reddy, Rafael Enrique Cabrera Jimenez, Cassandra A. Cohen, Arthur Kajiyama, William W. Cohen

机构 * Carnegie Mellon University(卡内基梅隆大学) Dept. of Computer Science(计算机科学系) Emory University(埃默里大学)

AI总结 本文提出一种基于伪工具和固定工作流的智能体框架,通过模块化设计和多目标优化方法,在保证成本可控和结果质量的前提下,实现实用智能体系统的自动构建与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00183 2026-06-02 cs.LG cs.AI math.OC stat.ML

Agentic Transformers Provably Learn to Search via Reinforcement Learning

智能体Transformer通过强化学习可证明地学会搜索

Tong Yang, Yu Huang, Yingbin Liang, Yuejie Chi

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) The Ohio State University(俄亥俄州立大学) Yale University(耶鲁大学)

AI总结 本文通过构建双头Transformer实现随机深度优先搜索,并分析策略梯度训练动力学,证明该搜索机制能从稀疏强化反馈中分阶段涌现,且具备深度泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30443 2026-06-02 cs.CL

Cross-Lingual Steering for Figurative Language Generation

跨语言引导的比喻语言生成

Linfeng Liu, Tiffany Zhan, Louie Hong Yao, Saptarshi Ghosh, Tianyu Jiang

机构 * Department of Computer Science, University of Cincinnati(卡内基梅隆大学计算机科学系) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Independent Researcher(独立研究者)

AI总结 通过激活引导技术,研究多语言大模型中比喻语言生成的内部信号是否跨语言可复用,发现跨语言方向可有效转移并增强目标行为。

Comments 40 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29341 2026-06-02 cs.CV cs.CL

WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

WorldMemArena: 通过动作-世界交互评估多模态智能体记忆

Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu, Yepeng Liu, Lin Long, Yichen Guo, Nuo Chen, Zhaotian Weng, Elena Kochkina, Simerjot Kaur, Charese Smiley, Xiaomo Liu, James Zou, Sheng Liu, Yuheng Bu, Songyou Peng, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) J.P. Morgan Chase(摩根大通) ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出WorldMemArena基准,通过动作-世界交互循环的四阶段生命周期评估多模态智能体记忆,揭示现有方法在写入、维护、检索和使用中的失败点。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28952 2026-06-02 cs.CR cs.DS cs.IT cs.LG math.IT math.ST stat.TH

Optimal Rates for Differentially Private Hypothesis Testing with E-values

基于E值的差分隐私假设检验的最优速率

Ben Jacobsen, Tomas Gonzalez, Gavin Brown, Kassem Fawaz, Aaditya Ramdas

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究在ε-差分隐私约束下,使用e值进行假设检验时所能达到的最大e-power,并给出最优速率及匹配算法。

Comments Corrected typos; updated references; generalized proposition 3.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13430 2026-06-02 stat.ME cs.AI cs.LG

Towards a holistic understanding of Selection Bias for Causal Effect Identification

走向因果效应识别中选择偏差的整体理解

Yiwen Qiu, Filip Kovačević, Shimeng Huang, Peter Spirtes, Francesco Locatello

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 研究在观测研究中存在选择偏差时,如何利用弱假设刻画倾向得分和选择概率,给出平均处理效应可识别性的充要条件,扩展了现有图形识别准则。

Comments 9 pages for the main text, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12652 2026-06-02 cs.LG cs.AI

Multi-Rollout On-Policy Distillation via Peer Successes and Failures

基于同伴成功与失败的多轨迹在线策略蒸馏

Weichen Yu, Xiaomin Li, Yizhou Zhao, Xiaoze Liu, Ruowang Zhang, Haixin Wang, Yinyi Luo, Chen Henry Wu, Gaurav Mittal, Matt Fredrikson, Yu Hu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Purdue University(普渡大学)

AI总结 提出多轨迹在线策略蒸馏(MOPD),利用学生模型的本地轨迹组构造更丰富的教师信号,通过同伴成功与失败条件化提升蒸馏效果。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏