arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-10 至 2026-03-10 共收录 151 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 15 篇

2603.07989 2026-03-10 cs.CV 79%

AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models

AutoTraces:通过多模态大语言模型实现自回归轨迹预测

Teng Wang, Yanting Lu, Ruize Wang

机构 * Southeast University(东南大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 AutoTraces通过多模态大语言模型实现自回归轨迹预测,采用创新的轨迹标记方案和自动链式推理机制,提升长周期预测精度与跨场景泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21497 2026-03-10 cs.CV 79%

See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs

看见它,说出它,排序:一种无需训练的迭代框架用于LVLMs中的视觉引导多模态推理

Yongchang Zhang, Oliver Ma, Tianyi Liu, Guangquan Zhou, Yang Chen

机构 * Southeast University(东南大学) University of Oxford(牛津大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出无需训练的迭代框架,通过视觉证据监督推理步骤,减少多模态推理中的幻觉问题,提升推理准确性。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06263 2026-03-10 cs.CV 74%

iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models

iLLaVA: 图像的价值少于三分之一的输入标记在大型多模态模型中

Lianyu Hu, Liqing Gao, Fanhua Shang, Liang Wan, Wei Feng

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) School of Computer Science and Technology, Tiangong University(天津工大学计算机科学与技术学院) Key Research Center for Surface Monitoring and Analysis of Relics, State Administration of Cultural Heritage(文物表面监测与分析关键研究中心,国家文物局)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 iLLaVA通过联合优化图像编码器和LLM,减少冗余标记并提升吞吐量,实现更高效的多模态模型性能。

Comments Accepted by ICLR2026,code is released at https://github.com/hulianyuyy/iLLaVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07952 2026-03-10 cs.CV 70%

VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer

VisualAD: 通过视觉变换器实现无语言零样本异常检测

Yanning Hou, Peiyuan Li, Zirui Liu, Yitong Wang, Yanran Ruan, Jianfeng Qiu, Ke Xu

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Anhui University, Hefei, China(光电信息采集与防护技术国家重点实验室,安徽大学,合肥,中国) School of Artificial Intelligence, Anhui University, Hefei, China(人工智能学院,安徽大学,合肥,中国) College of Intelligence Science and Technology, National University of Defense Technology, Changsha, China(智能科学与技术学院,国防科技大学,长沙,中国)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 VisualAD通过纯视觉变换器实现无语言零样本异常检测,引入可学习标记和空间感知模块,提升异常检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20980 2026-03-10 cs.CV cs.AI 62%

CrystaL: Spontaneous Emergence of Visual Latents in MLLMs

CrystaL: MLLMs中视觉潜在特征的自发涌现

Yang Zhang, Danyang Li, Yuxuan Li, Xin Zhang, Tianyu Xie, Mingming Cheng, Xiang Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CrystaL通过显式对齐注意力模式和预测分布,实现视觉潜在特征的自发涌现,提升细粒度视觉理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08347 2026-03-10 cs.CV 57%

Local-Global Prompt Learning via Sparse Optimal Transport

通过稀疏最优传输实现局部-全局提示学习

Deniz Kizaroğlu, Ülku Tuncer Küçüktas, Emre Çakmakyurdu, Alptekin Temizel

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 SOT-GLP通过稀疏最优传输实现局部-全局提示学习,提升少样本分类和分布外检测性能。

Comments 9 pages, 3 figures, 4 tables. Code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11549 2026-03-10 cs.CV 57%

ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?

ODI-Bench: MLLMs能否理解沉浸式全向环境?

Liu Yang, Huiyu Duan, Ran Tao, Juntao Cheng, Sijing Wu, Yunhao Li, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) Tianjin University(天津大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 ODI-Bench旨在评估多模态大语言模型对全向图像沉浸环境的理解能力,通过定制基准和Omni-CoT方法提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08124 2026-03-10 cs.RO cs.AI cs.LG 57%

SaiVLA-0: Cerebrum--Pons--Cerebellum Tripartite Architecture for Compute-Aware Vision-Language-Action

SaiVLA-0:基于大脑-脑桥-小脑三元架构的计算感知视觉-语言-动作

Xiang Shi, Wenlong Huang, Menglin Zou, Xinhai Sun

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 SaiVLA-0提出基于大脑-脑桥-小脑三元架构的计算感知视觉-语言-动作系统,通过模块化设计提升效率与稳定性,初步实验显示训练时间减少且成功率显著提升。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10932 2026-03-10 cs.CR cs.AI cs.RO 57%

DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models

DropVLA: 对视觉-语言-动作模型的行动级后门攻击

Zonghuan Xu, Jiayu Li, Yunhan Zhao, Xiang Zheng, Xingjun Ma, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身AI研究院,复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身AI重点实验室) City University of Hong Kong(香港城市大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 DropVLA是一种针对视觉-语言-动作模型的行动级后门攻击,通过有限的数据污染实现对特定动作的精准操控,验证了在现实环境中的有效性。

Comments 8 pages, 6 tables, 3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05202 2026-03-10 cs.CV 57%

SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images

SPEX:一种用于光谱遥感图像土地覆盖提取的视觉-语言模型

Dongchen Si, Di Wang, Erzhong Gao, Xiaolei Qin, Liu Zhao, Jing Zhang, Minqiang Xu, Jianbo Zhan, Jianshe Wang, Lin Liu, Bo Du, Liangpei Zhang

机构 * College of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) iFlytek Co., Ltd.(iFlytek公司) National Engineering Research Center of Speech and Language Information Processing(语音与语言信息处理国家工程研究中心) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(湖北省多媒体与网络通信工程重点实验室,武汉大学) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 SPEX是一种专为光谱遥感图像土地覆盖提取设计的多模态视觉-语言模型,通过多尺度特征聚合和多光谱视觉预训练等技术,实现了精确的像素级解释和可解释的预测生成。

Comments Accepted to IEEE TGRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07343 2026-03-10 cs.LG cs.AI 57%

Learning Concept Bottleneck Models from Mechanistic Explanations

从机制解释学习概念瓶颈模型

Antonio De Santis, Schrasing Tong, Marco Brambilla, Lalana Kagal

机构 * Politecnico di Milano(米兰理工大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出机制CBM模型,通过从黑盒模型自身学习的概念构建瓶颈层,提升模型的可解释性和预测性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06958 2026-03-10 cs.LG cs.CL 57%

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

Chart-RL: 通过可验证奖励的强化学习实现通用图表理解

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li

机构 * Oracle AI

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08495 2026-03-10 cs.LG stat.ML 50%

Efficient Credal Prediction through Decalibration

通过去校准实现高效的可信预测

Paul Hofman, Timo Löhr, Maximilian Muschalik, Yusuf Sale, Eyke Hüllermeier

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) DFKI (DSA)(德意志联邦防务研究所)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 本文提出了一种基于相对似然的高效可信预测方法,通过去校准技术实现对复杂模型的高效可信集生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08122 2026-03-10 cs.RO 50%

Towards Human-Like Manipulation through RL-Augmented Teleoperation and Mixture-of-Dexterous-Experts VLA

通过强化学习增强的遥控操作与混合的灵巧专家VLA实现人机操作

Tutian Tang, Xingyu Ji, Wanli Xing, Ce Hao, Wenqiang Xu, Lin Shao, Cewu Lu, Qiaojun Yu, Jiangmiao Pang, Kaifeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Sharpa Shanghai AI Lab(上海人工智能实验室) Zhongguancun Academy(中关村学院) National University of Singapore(新加坡国立大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出IMCopilot和MoDE-VLA框架,通过强化学习和多模态融合提升机器人灵巧操作能力,实现接触丰富的手内任务性能提升。

Comments Project Homepage: https://sites.google.com/view/mode-vla

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18570 2026-03-10 cs.LG 50%

VISTA: Vision-Language Inference for Training-Free Stock Time-Series Analysis

VISTA:面向无训练股票时间序列分析的视觉-语言推理

Tina Khezresmaeilzadeh, Parsa Razmara, Seyedarmin Azizi, Mohammad Erfan Sadeghi, Erfan Baghaei Potraghloo

机构 * University of Southern California(南加州大学)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 VISTA通过结合文本和视觉信息,利用无训练的视觉-语言模型实现股票时间序列预测,实验结果显示其在预测精度上显著优于传统方法。

Comments Accepted to the CVPR 2025 Workshop on Transformers for Vision (T4V): accepted-papers" target="_blank" rel="noopener">https://sites.google.com/view/t4v-cvpr25/accepted-papers

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 18 篇

2512.03034 2026-03-10 cs.CV 88%

MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation

MAViD:一种多模态框架用于音频-视觉对话理解和生成

Youxin Pang, Jiajun Liu, Lingfeng Tan, Yong Zhang, Feng Gao, Xiang Deng, Zhuoliang Kang, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV

AI总结 MAViD提出了一种多模态框架,通过Conductor-Creator架构实现音频-视觉对话的理解与生成,结合自回归和扩散模型提升长时多模态内容生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21900 2026-03-10 cs.SD eess.AS 85%

EmoOmni: Bridging Emotional Understanding and Expression in Omni-Modal LLMs

EmoOmni:弥合情感理解与表达在多模态大语言模型中的鸿沟

Wenjie Tian, Zhixian Zhao, Jingbin Hu, Huakang Chen, Haohe Liu, Binshen Mu, Lei Xie

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安,中国) University of Surrey, Guildford, United Kingdom(萨里大学,Guildford,英国)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 EmoOmni通过引入情感链式思维机制,提升多模态情感对话中的理解与表达能力,构建了评估基准并验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17234 2026-03-10 cs.MM cs.AI cs.CV 85%

Taming Modality Entanglement in Continual Audio-Visual Segmentation

驯服持续音频-视觉分割中的模态纠缠

Yuyang Hong, Qi Yang, Tao Zhang, Zili Wang, Zhaojin Fu, Kun Ding, Bin Fan, Shiming Xiang

机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) MAIS, Institute of Automation(自动化研究所MAIS) School of Intelligent Science and Technology, University of Science and Technolog Beijing(智能科学与技术学院,北京理工大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出CAVS任务和CMR框架,通过解决多模态语义漂移和共现混淆问题,提升持续音频-视觉分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07263 2026-03-10 cs.SD eess.AS 83%

Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning

看见上下文:通过多模态推理实现丰富的视觉上下文感知语音识别

Wenjie Tian, Mingchen Shao, Bingshen Mu, Xuelong Geng, Chengyou Wang, Yujie Liao, Zhixian Zhao, Ziyu Zhang, Jingbin Hu, Mengqi Wei, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 本文提出VASR,通过多模态推理融合丰富视觉上下文,解决音频-视觉语音识别中的单模态主导问题,实现更准确的语音识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08126 2026-03-10 cs.CV cs.AI cs.LG cs.SD eess.AS 82%

Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows

Foley-Flow:基于掩码音频-视觉对齐和动态条件流的协调视频到音频生成

Shentong Mo, Yibing Song

机构 * CMU / MBZUAI DAMO Academy, Alibaba Group(卡内基梅隆大学 / MBZUAI 大学 DAMO 院,阿里巴巴集团) DAMO Academy, Alibaba Group(DAMO 院,阿里巴巴集团) Hupan Laboratory(虎盘实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 FoleyFlow通过掩码建模和动态条件流实现视频到音频的协调生成,提升语义与节奏一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06991 2026-03-10 cs.SD cs.LG 82%

Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification

基于多模态大语言模型的低资源音频分类中可解释属性的自适应发现

Kosuke Yoshimura, Hisashi Kashima

机构 * Kyoto University(京都大学)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文提出利用多模态大语言模型自适应发现可解释音频属性,提升低资源音频分类的效率和准确性。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08034 2026-03-10 cs.CV cs.AI 81%

Solution to the 10th ABAW Expression Recognition Challenge: A Robust Multimodal Framework with Safe Cross-Attention and Modality Dropout

解决第10届ABAW表情识别挑战的方案:一种具有安全交叉注意力和模态dropout的鲁棒多模态框架

Jun Yu, Naixiang Zheng, Guoyuan Wang, Yunxiang Zhang, Lingsi Zhu, Jiaen Liang, Wei Huang, Shengping Liu

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种鲁棒多模态框架,通过安全交叉注意力和模态dropout处理现实环境中的遮挡和缺失模态问题,提升情绪识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07090 2026-03-10 cs.CR cs.AI cs.CV 81%

mAVE: A Watermark for Joint Audio-Visual Generation Models

mAVE:联合音频-视觉生成模型的水印

Luyang Si, Leyi Pan, Lijie Wen

机构 * School of Software, Tsinghua University(清华大学软件学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI

AI总结 mAVE是一种为联合音频-视觉生成模型原生设计的水印框架,通过加密绑定音频和视频潜在向量,提供对交换攻击的强安全保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08282 2026-03-10 cs.CL 79%

Using Multimodal and Language-Agnostic Sentence Embeddings for Abstractive Summarization

利用多模态和语言无关的句子嵌入进行抽象摘要

Chaimae Chellaf, Salima Mdhaffar, Yannick Estève, Stéphane Huet

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出SBARThez框架,利用多模态和多语言句子嵌入提升抽象摘要的准确性与跨语言能力。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19821 2026-03-10 cs.CV 79%

Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering

基于查询引导的时空频交互的音乐音频视觉问答

Kun Li, Michael Ying Yang, Sami Sebastian Brandt

机构 * University of Twente(特文特大学) University of Bath(巴斯大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种查询引导的时空频交互方法,通过整合问题引导的线索和频域特性,提升音频-视觉问答的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08249 2026-03-10 eess.AS cs.CL eess.IV 62%

Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data

在零音频视频资源场景中利用合成视觉数据进行音频视觉语音识别的提升

Pol Buitrago, Pol Gàlvez, Oriol Pareras, Javier Hernando

机构 * Barcelona Supercomputing Center (BSC), Spain(巴塞罗那超级计算中心(BSC)) Universitat Politècnica de Catalunya (UPC), Spain(巴塞罗那理工大学(UPC))

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出了一种在缺乏真实音频视频资源的情况下,通过合成视觉数据提升音频视觉语音识别性能的方法,实现了在资源匮乏语言上的高效识别。

Comments 6 pages, 3 figures, Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02593 2026-03-10 cs.CL cs.MA cs.NE cs.SD eess.AS 62%

Spoken Conversational Agents with Large Language Models

基于大语言模型的语音对话代理

Chao-Han Huck Yang, Andreas Stolcke, Larry Heck

机构 * NVIDIA Research(NVIDIA研究)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文探讨了如何通过大语言模型构建语音对话代理,涵盖从级联到端到端系统的路径,以及跨模态对齐和联合训练等关键技术,同时讨论了隐私、安全和评估中的开放问题。

Comments Accepted to EMNLP 2025 Tutorial

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22321 2026-03-10 cs.SD cs.AI eess.AS 62%

SUBARU: A Practical Approach to Power Saving in Hearables Using SUB-Nyquist Audio Resolution Upsampling

SUBARU:一种用于助听器的实用节能方法,利用SUB-Nyquist音频分辨率上采样

Tarikul Islam Tamiti, Sajid Fardin Dipto, Luke Benjamin Baja-Ricketts, David C Vergano, Anomadarshi Barua

机构 * George Mason University(乔治·马歇尔大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 SUBARU通过子奈奎斯特采样和低位分辨率ADC实现助听器的节能,降低功耗3.31倍,并在移动平台上实现高效的语音增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08312 2026-03-10 cs.CL 57%

Learning Multiple Utterance-Level Attribute Representations with a Unified Speech Encoder

学习多语句层面的属性表示:统一的语音编码器

Maryem Bouziane, Salima Mdhaffar, Yannick Estève

机构 * LIA - Avignon Université, France(阿维尼翁大学LIA中心,法国)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出统一的后训练框架,使语音基础模型能生成多种语句层面的表示,用于多语言语音检索和说话人识别。

Comments Submitted to Interspeech

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07966 2026-03-10 cs.CV 57%

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

用眼睛倾听:跨时空的自体视觉共指基准测试

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) Tencent Robotics X(腾讯机器人X) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。

详情

展开后加载摘要…

URL PDF HTML 收藏