Learning When to Think While Listening in Large Audio-Language Models
在大音频语言模型中学习何时在聆听时思考
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出一种可学习的等待-思考-回答控制机制,通过多奖励强化学习优化大音频语言模型在流式语音交互中的推理时机,在提升准确率的同时减少响应延迟。
Comments 19 pages, 4 figures, 6 tables
高校专区
在大音频语言模型中学习何时在聆听时思考
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出一种可学习的等待-思考-回答控制机制,通过多奖励强化学习优化大音频语言模型在流式语音交互中的推理时机,在提升准确率的同时减少响应延迟。
Comments 19 pages, 4 figures, 6 tables
JetViT: 高效高分辨率视觉Transformer与训练后注意力搜索
机构 * MIT(麻省理工学院) ; University of Pennsylvania(宾夕法尼亚大学) ; NVIDIA(NVIDIA公司) ; Physical Intelligence(物理智能)
AI总结 提出JetViT混合架构视觉Transformer,通过训练后注意力搜索将预训练全注意力ViT转换为高效混合注意力变体,在高分辨率图像上实现更高推理效率且不损失精度。
Comments Accepted to CVPR 2026 Findings
NSF-SciFy:从NSF资助数据库中挖掘科学主张
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出NSF-SciFy数据集,从40万篇NSF摘要中提取280万条科学主张,通过零样本提示联合提取主张和研究提案,并在三个下游任务中微调语言模型取得显著提升。
Comments ACL 2026. 19 pages, 7 figures, 11 tables