Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models
Audio-DeepThinker:渐进式推理感知强化学习用于音频语言模型中高质量推理链涌现
机构 * Tencent AI Lab(腾讯AI实验室) ; The Hong Kong University of Science(香港科技大学)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL
AI总结 本文提出Audio-DeepThinker框架,通过混合奖励和渐进式课程学习提升音频推理质量,实现高质量推理链涌现,取得多项评测冠军。