Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling
通过多模态深度扩展适应文本LLM到语音
机构 * Tohoku University(东北大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出多模态深度扩展方法,通过在冻结的文本LLM中插入新层并仅训练这些层来适应语音数据,实验表明其在ASR性能上接近全微调,且文本能力退化更少。
高校专区
通过多模态深度扩展适应文本LLM到语音
机构 * Tohoku University(东北大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出多模态深度扩展方法,通过在冻结的文本LLM中插入新层并仅训练这些层来适应语音数据,实验表明其在ASR性能上接近全微调,且文本能力退化更少。
EditCtrl: 解耦的局部和全局控制用于实时生成视频编辑
机构 * Meta Reality Labs(Meta现实实验室) ; Carnegie Mellon University(卡内基梅隆大学) ; Meta AI
AI总结 本文提出EditCtrl,通过局部和全局控制模块实现高效视频修复,提升编辑质量和计算效率,支持多区域编辑和内容传播。
Comments Project page: https://yehonathanlitman.github.io/edit_ctrl
用分析方法评估教育LLM:关于反馈中性别偏见的案例研究
机构 * University College London, UCL Knowledge Lab(伦敦大学学院,UCL知识实验室) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文通过600篇真实学生作文,利用嵌入式基准框架检测LLM在形成性反馈中的偏见,发现隐性性别提示比显性提示更易引发语义偏移,揭示了LLM在反馈中持续存在的性别偏见。
Comments 21 pages, 7 figures
从领域理解到设计准备:一种支持生成式AI学习的软件工程教学指南
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文探讨了利用生成式AI辅助学习在软件工程领域理解与建模方法中的应用,通过实验发现AI tutor在准确性与相关性方面表现优异,但支持性不足,提出17项教学实践以优化AI辅助学习效果。
可泛化的密集奖励用于长周期机器人任务
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon Robotics(亚马逊机器人) ; UT Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出VLLR框架,结合外部奖励和内部奖励提升长周期机器人任务性能,通过任务分解和自信心引导实现无需人工奖励工程的高效训练。
Comments Project page: https://silongyong.github.io/vllr_project_page/
基于对话的支持可能并不足够:比较对话式和嵌入式LLM反馈在数学证明学习中的比较
机构 * Carnegie Mellon University(卡内基梅隆大学) ; The University of Hong Kong(香港大学)
AI总结 研究评估了GPTutor系统对大学离散数学课程的影响,发现对话式反馈单独使用可能无法有效提升考试成绩,而嵌入式反馈与学习表现相关性较低。
Comments 9 pages, 4 figures. Accepted at AIED 2026. Camera-ready version with updated references