MAJIC: Leveraging Articulatory Motion for Speech-based Emotion Recognition
MAJIC: 利用发音运动进行基于语音的情感识别
专题命中 音频语音多模态 :multimodal(abstract)
AI总结 提出MAJIC多模态情感识别系统,通过融合下颌和面部肌肉的发音运动特征与音频特征,在多种语言和场景下实现93%准确率和91%F1分数,优于纯音频基线。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
MAJIC: 利用发音运动进行基于语音的情感识别
专题命中 音频语音多模态 :multimodal(abstract)
AI总结 提出MAJIC多模态情感识别系统,通过融合下颌和面部肌肉的发音运动特征与音频特征,在多种语言和场景下实现93%准确率和91%F1分数,优于纯音频基线。
缺失的层次:为什么教育科技需要设计时的生成式用户界面,而非仅运行时个性化
专题命中 音频语音多模态 :multimodal(abstract)
AI总结 针对教育科技中运行时生成式UI导致可访问性不足的问题,提出在创作层采用基于卡片的语义单元编码,由生成式AI在教学设计时生成多种界面表示,经教师验证后交付,实现公平可扩展的适应性教育。
Comments Accepted at the NextGen Learning Interfaces Workshop in AIED 2026
碳纤维铺层的人机协同操作
机构 * Automation Technology and Mechanical Engineering, Tampere University(坦佩雷大学自动化技术与机械工程系)
专题命中 音频语音多模态 :multimodal(abstract)
AI总结 针对柔性材料自动化处理困难的问题,本文提出结合语音指令、视觉腕部跟踪和力/柔顺控制的多模态方法,实现碳纤维铺层的高效人机协同操作。
Comments Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)
DuplexOmni:用于全双工交互的实时听、看、思考和说话
专题命中 音频语音多模态 :multimodal(abstract)
AI总结 提出DuplexOmni方法,通过异步协作的交互层(端到端实时处理流式音视频并生成响应)和思考层(复杂推理与工具使用)实现实时多模态全双工交互,并开发Writer-Director管道构建训练数据,在多个基准上表现优异。
Earth-OneVision:将遥感多模态大语言模型扩展到更多传感器模态和任务
机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing (SBIIP), Beijing Institute of Technology(北京理工大学空间智能信息处理国家重点实验室) ; Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) ; Key Laboratory of Technology in Geo-Spatial Information Processing and Application System, Chinese Academy of Sciences(中国科学院地理空间信息处理与应用系统技术重点实验室) ; Advanced Research Institute of Multidisciplinary Sciences, Beijing Institute of Technology(北京理工大学前沿交叉科学研究院) ; School of Mechatronical Engineering, Beijing Institute of Technology(北京理工大学机电学院) ; School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) ; School of Electronics, Peking University(北京大学电子学院) ; School of Computer Science and Hubei Key Laboratory of Intelligent Geo-Information Processing(华中科技大学计算机科学与技术学院&湖北省智能地理信息处理重点实验室)
专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出Earth-OneVision,一个2B参数的RS-MLLM,通过全粒度视觉语言对齐、空间语言同构序列化和渐进式跨模态适应机制,统一六种传感器模态和九类任务,在多个基准上达到或超越4B-72B模型。
在不断演变的领域上进行连续视频 - MLLM 适应
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; Hong Kong Polytechnic University(香港理工大学) ; The University of Southern Queensland(南昆士兰大学)
专题命中 视频多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV
AI总结 研究视频多模态大语言模型对不断演变领域的适应问题,提出分布感知专家路由框架 DAER,通过保持领域隔离的轻量级专家、引入多种路由和优化机制,在域增量基准上评估,结果优于现有方法。
Comments Accepted to ACM MM 2026
基于注意力的MLLM选择器在测试时对长视频进行高效帧选择
机构 * ZJU(浙江大学) ; NJU(南京大学) ; CSU(中南大学) ; Microsoft(微软公司) ; NJUST(南京理工大学)
专题命中 视频多模态 :MLLM(title,title_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 研究利用MLLMs中验证选择提取层的跨模态注意力构建无训练的DAFS帧选择器,通过查询条件聚合提取帧级证据,将候选池大小和每帧令牌预算联合分配问题用动态规划解决,在Video-MME上表现出色,且无需重新训练即可跨多种模型和任务泛化。
Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解
机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) ; Wuhan University(武汉大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; CASIA(中国科学院自动化研究所) ; University of Tokyo(东京大学) ; University of Liverpool(利物浦大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; UC Merced(加州大学默塞德分校)
专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 提出人类视角下视频理解的三个功能能力(观看、记忆、推理),构建统一框架分析视频MLLM的感知、记忆、推理和预测,并总结挑战、方法、应用及未来方向。
用于全模态密集视频字幕的并行自回归解码
机构 * National University of Singapore(新加坡国立大学)
专题命中 视频多模态 :omni-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 研究密集视频字幕生成,提出并行自回归框架,利用事件间弱局部依赖重组因果依赖图,引入全局规划和事件分解并行解码机制,提升效率与字幕性能。
Comments ECCV 2026. Project website: https://github.com/showlab/PadCaptioner
多模态大语言模型作为视频研究中的合成参与者:一项评估
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.MM
AI总结 本研究评估多模态大语言模型在视频感知任务中模拟人类主观评分的表现,发现模型存在偏差且与人类一致性有限。
Comments Accepted to SocialLLM @ ICWSM 2026
CausalMoE:基于模式路由异构专家的十亿规模多模态基础模型用于格兰杰因果发现
机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) ; National Institute of Health Data Science, and Institute for Artificial Intelligence, Peking University(北京大学健康医疗大数据国家研究院、人工智能研究院)
专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.AI
AI总结 提出CausalMoE,一种十亿规模多模态格兰杰因果基础模型,通过模式路由混合异构专家解耦动态机制,结合因果自注意力与LLM/VLM先验,实现稀疏因果图恢复,在监督和少样本场景中达到最优。
从模态到命题:多模态智能的语言中心框架
机构 * NVIDIA(英伟达) ; University of Ottawa(渥太华大学)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 该研究提出多模态数据语言表示框架,将观察结果表示为原子命题,通过全局语义码本统一为共享词汇表,置于可解释空间,实现跨模态理解等,还在自动驾驶等数据上进行了展示。
GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所) ; Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司) ; Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司) ; School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) ; Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)
专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 提出GRACE框架,通过提取时间有序的主谓宾三元组和视觉实体裁剪,增强视频MLLM对细粒度情感线索的提取与推理,在Pitts数据集上提升Qwen2.5-VL和Qwen3-VL性能。
Comments 13 pages, 5 figures
HyperClaim:用于视频虚假信息检测的细粒度跨模态超图推理
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM
AI总结 HyperClaim是一种用于视频虚假信息检测的判别式时间超图框架,通过细粒度跨模态超图推理,在FactGuard协议下的三个数据集上准确率优于基线方法。
Comments 13 pages, including supplementary material
HAS:用于多模态大语言模型视频摘要的高亮引导注意力转向
机构 * Tufts University(塔夫茨大学)
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 针对视频摘要,提出HAS方法,通过全局找连续帧级高亮分布并作为注意力转向向量,让多模态大语言模型在推理时更关注高亮帧,避免丢失信息,在多种基准测试中性能出色。
基于事件的多模态自我运动估计中学习表征的几何结构研究
机构 * Politecnico di Milano(米兰理工大学)
专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究基于事件的多模态自我运动估计中多模态网络的几何结构,通过跨模态注意力架构融合多模态信号并训练,分析潜在空间几何和注意力动态,揭示相关特性,架起分析估计理论与数据驱动融合的桥梁。
Comments 5 pages, 3 figures, to be published in SPAICE 2026
用于多模态纵向图像插补与插值的隐式神经表示
机构 * University Hospital Augsburg(奥格斯堡大学医院) ; University of Augsburg(奥格斯堡大学) ; Technical University of Munich(慕尼黑工业大学) ; Bavarian Cancer Research Center (BZKF)(巴伐利亚癌症研究中心) ; Swabian Children’s Cancer Center(施瓦本儿童癌症中心)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 该研究针对临床纵向MRI数据缺失等问题,提出条件隐式神经表示模型,经儿科脑肿瘤数据验证,可显著改进插值效果,置信度估计可靠。
超越独立优化:多模态边缘智能中的压缩、混合专家路由和量化交互
机构 * Nirma University(尼玛大学) ; Singapore Institute of Technology(新加坡理工学院) ; Marwadi University(马尔瓦迪大学)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 研究多模态边缘智能中高效推理受多种因素限制,回顾相关模型进展,指出技术间相互影响不能独立优化,介绍关键设计权衡,引入视频MoE模型诊断方法,强调多方面开放研究方向。
学习检测跨模态否定:潜在表示分析与基于注意力的解决方案
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI
AI总结 研究跨模态否定检测难题,提出新型跨模态注意力架构,分析发现文本与视觉否定的不对称性,结合自监督视频表示推进时间否定建模,为多模态系统学习语义对齐表示提供新方法。
Comments This manuscript is an accepted version of the article (published at ICNLP2026). Published in IEEE Xplore, DOI:10.1109/ICNLP69856.2026.11527861 document: https://ieeexplore.ieee.org/abstract/document/11527861
Journal ref 2026 8th International Conference on Natural Language Processing (ICNLP), Xi'an, China, 2026, pp. 613-622
通过语义检索和时间重排实现多模态视频到音乐推荐
机构 * Graduate School of Culture Technology, KAIST(韩国釜山科学技术大学文化科技研究生院) ; Gaudio Lab, Inc(Gaudio实验室)
专题命中 视频多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM
AI总结 提出用于视频到音乐推荐的两阶段框架VTMR,第一阶段通过全局嵌入检索语义兼容候选,第二阶段关注时间序列重排。实验显示该框架能提升推荐效果,人类偏好研究表明其在总体偏好上与商业基线相当,音乐质量优于生成基线。
Comments Accepted for publication at The Machine Learning for Audio workshop at ICML 2026
增强视听视频字幕的时间与跨模态对齐
机构 * Nanjing University, State Key Laboratory for Novel Software Technology(南京大学,计算机软件新技术国家重点实验室) ; Meituan(美团)
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 提出TCA-Captioner框架,通过观察-检查-纠正迭代策略和密集交互数据集,解决视听字幕中的模态分离与时间不一致问题,实现精准的视听绑定与因果动态建模。
Comments ECCV 2026
推理,再推理:跨视角重访提升空间推理
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视频多模态 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 提出ReRe框架,通过生成互补新视角视频让MLLM先推理再验证,无需训练即可显著提升空间推理性能。
Comments ICML 2026
AirKey:用于零训练鲁棒PIN推断的多模态声学辅助WiFi感知
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 AirKey是一种多模态感知框架,通过利用IEEE 802.11机制和声学信号辅助WiFi感知,实现零训练鲁棒PIN推断,准确率超现有单模态方案4倍,可在6次尝试内恢复设备解锁PIN,凸显智能界面的隐私漏洞。
Comments Accepted by ACM MM 2026
MultiToP:学习修补视觉令牌以减轻视频大型多模态模型中的幻觉
机构 * Zhejiang University(浙江大学) ; Sun Yat-sen University(中山大学) ; East China Normal University(华东师范大学)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出MultiToP框架,通过轻量级视觉令牌修补器动态替换不可靠视觉令牌,结合信息引导排名校准和稀疏正则化,在不修改原模型情况下减少视频多模态模型幻觉,显著提升F1分数和问答准确率。
Comments Preprint
用于高效长视频理解的证据驱动型动态视觉选择器
专题命中 视频多模态 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 本文提出基于目标MLLM内部注意力证据的动态视觉选择框架EviSelect,通过GRPO优化的随机策略实现高效长视频理解,在三个基准上性能更优,视觉token减少约50%、端到端加速3.9倍。
Comments Project Page: https://zhangbo135.github.io/EviSelect/
OmniScientist:一种全模态全学科的AI科学家
机构 * National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学)
专题命中 视频多模态 :omni-modal(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出全模态AI科学家OmniScientist,通过端到端全模态流水线处理多学科异构原始证据,在36个真实案例中完成从原始数据到手稿的全流程,性能优于仅用预计算特征的系统,为通用AI科学家提供可行方案。
Comments 30 pages, 13 figures, 19 tables. Project page: https://omni-scientist.github.io/
Video-DeepResearch:迈向新一代多模态深度研究智能体
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 该研究提出Video-DR智能体框架,通过解耦感知-探索流水线与分阶段工具解锁解决现有多模态模型的模态偏差和知识泄漏问题,构建基准并在视频问答任务上取得SOTA性能。
DeepVoyager-VL:为长视野多模态智能体激励视觉在环搜索
机构 * PKU(北京大学) ; HKUST(GZ)(香港科技大学(广州)) ; NUDT(中国人民解放军国防科技大学) ; OUC(中国海洋大学) ; HITSZ(哈尔滨工业大学(深圳)) ; Huawei Cloud BU(华为云业务部)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 针对现有多模态深度搜索忽视视觉中间推理作用的局限,提出DeepVoyager-VL框架,构建多模态事件图合成数据,设计智能体框架实现主动视觉获取,经10个基准实验验证其有效性。
See2Think:多模态模型是否真正利用中间视觉状态?
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出See2Think评估框架,通过See2ThinkBench和VAoT测试多模态模型对中间视觉状态的依赖,发现视觉推理具模型与环境依赖性,准确渲染是瓶颈,受损反馈会使模型准确率降超10个百分点。
Comments 10 pages, 5 figures, and 8 tables
睁开模型之眼:视频与上下文感知的多模态反馈预测
机构 * Korea University(韩国大学) ; Kyung Hee University(庆熙大学)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 研究视频与上下文感知的多模态反馈预测问题,提出CAMA - BC框架,利用多层多模态对齐,分上下文对齐和反馈对齐两阶段,显著优于现有方法及简单多模态基线,尤其在识别复杂反馈上效果突出。
Comments 18 pages, Accepted at ACL 2026
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, pp. 3738-3755, 2026