MOSS Transcribe Diarize Technical Report
MOSS 语音转录与说话人识别技术报告
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、eess.AS
AI总结 MOSS转录与识别通过端到端多模态大语言模型,实现了说话人属性化和时间戳化的转录,解决了现有系统在上下文窗口、长距离说话人记忆和时间戳输出方面的不足。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
MOSS 语音转录与说话人识别技术报告
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、eess.AS
AI总结 MOSS转录与识别通过端到端多模态大语言模型,实现了说话人属性化和时间戳化的转录,解决了现有系统在上下文窗口、长距离说话人记忆和时间戳输出方面的不足。
超越玩笑:用于检测和解释表情包中有害幽默的多角度推理
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究如何检测和解释表情包中有害幽默,提出MAR-12框架,利用视觉语言模型,从十二个角度解读表情包,经注意力机制和原型分类器预测,在多数据集上准确率超现有方法,且能给出有说服力的解释。
Comments Accepted for Publication at AAAI-ICWSM 2027
通过强化学习进行推理引导的部件级视觉定位
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究部件级视觉定位难题,提出OP - HRG粗到细推理引导定位策略,先定位父物体再定位部件,经自我检查反思结果,引入部件感知GRPO框架训练,训练的4B模型性能优异且可迁移到推理分割。
Comments ECCV 2026
VTAP 夹爪:指尖传感与视觉触觉主动手掌协同实现灵巧的手中操作
机构 * Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) ; Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)
专题命中 其他多模态 :multi-modal(abstract)
AI总结 研究提出集成 VTAP 和触觉阵列传感器手指的夹爪,利用指掌协同与多模态感知实现操作。通过双模态手掌扩展能力,提出重定向框架。经多任务实验验证,该夹爪及框架为灵巧夹爪设计等提供实用参考架构。
Comments 8 pages, 10 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project webpage: https://yuhochau.github.io/vtap/