arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-28 至 2026-04-28 共收录 132 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 15 篇

2602.07605 2026-04-28 cs.CV cs.AI 84%

Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning

Fine-R1: 通过链式推理使多模态大语言模型在细粒度视觉识别中脱颖而出

Hulingxiao He, Zijun Geng, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所)

专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Fine-R1通过链式推理监督微调和三元组增强策略优化,提升多模态大语言模型在细粒度视觉识别中的表现,仅用4次训练即超越现有模型。

Comments Published as a conference paper at ICLR 2026. The models are available at https://huggingface.co/collections/StevenHH2000/fine-r1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22855 2026-04-28 cs.CV 81%

Evaluating Remote Sensing Image Captions Beyond Metric Biases

超越度量偏差的遥感图像描述评估

Ziyun Chen, Fan Liu, Liang Yao, Chuanyi Zhang, Yuye Ma, Wei Zhou

机构 * Hohai University(河海大学) Cardiff University(卡迪夫大学)

专题命中 图文多模态 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出ReconScore指标,通过文本重建能力评估描述质量,发现未微调的MLLM在零样本遥感图像描述任务中表现更优,并引入无需训练的RemoteDescriber方法提升语义精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23079 2026-04-28 cs.CV cs.AI 73%

From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models

从像素到解释:结合CNN-Transformer集成、视觉可解释性和视觉语言模型的可解释性糖尿病视网膜病变分级

Pir Bakhsh Khokhar, Carmine Gravino, Fabio Palomba, Sule Yildirim Yayilgan, Sarang Shaikh

机构 * Department of Informatics, University of Salerno(萨勒诺大学信息学院) Department of Information Security and Communication Technology (IIK), Norwegian University of Science and Technology(挪威科技大学信息安全部)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结合强判别模型与多模态解释的方法,利用APTOS 2019基准评估六种CNN和Transformer模型,通过集成策略提升分级一致性,并利用视觉语言模型生成可解释的视网膜病变分级结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08598 2026-04-28 cs.IR cs.CV 70%

Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search

预训练后再适应:面向基于文本的人脸搜索的不确定性感知测试时间适应

Jiahao Zhang, Shaofei Huang, Yaxiong Wang, Zhedong Zheng

机构 * University of Macau(澳门大学) Hefei University of Technology(合肥工业大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出一种预训练后再适应方法,通过离线测试时间适应减少对目标域标注数据的依赖,引入不确定性感知测试时间适应框架以提升人像搜索系统的鲁棒性和效率。

Comments Accepted to ACM SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23276 2026-04-28 cs.CV cs.AI cs.CL 67%

Lightweight and Production-Ready PDF Visual Element Parsing

轻量且适用于生产的PDF视觉元素解析

Meizhu Liu, Yassi Abbasi, Matthew Rowe, Michael Avendi, Paul Li

机构 * Oracle AI

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出一种轻量级PDF解析框架,通过空间启发式、布局分析和语义相似性结合,实现高准确率的视觉元素检测与标题关联,提升多模态RAG检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24346 2026-04-28 cs.CV cs.AI 62%

SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters

SycoPhantasy: 量化小型开放权重视觉-语言模型中趋炎附势行为与幻觉现象以评估奇幻角色的视觉-语言评分

Arya Shah, Deepali Mishra, Chaklam Silpasuwanchai

机构 * IIT Gandhinagar(印度加尔各答理工学院) IIT Kanpur(印度坎浦尔理工学院) Asian Institute of Technology(亚洲理工学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文研究小型开放权重VLM在评估图像-文本对齐时是否存在趋炎附势行为,通过引入布林系数量化模型评分与视觉证据的不匹配程度,发现模型规模与趋炎附势率呈负相关。

Comments 13 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24339 2026-04-28 cs.CV cs.AI 62%

See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection

看得更远,想得更深:通过低级视觉线索和反思提升VLM的推理能力

Zhiheng Wu, Tong Wang, Shuning Wang, Naiming Liu, Yumeng Zhang

机构 * Baidu Inc.(百度公司) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ForeSight框架,通过低级视觉线索和有效视觉反馈提升VLM推理能力,构建新数据集CG-SalBench,并验证其在参数规模相同和部分指标上优于现有SOTA模型。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04733 2026-04-28 cs.CV cs.AI 62%

Discovering Failure Modes in Vision-Language Models using RL

通过强化学习发现视觉-语言模型的失败模式

Kanishk Jain, Qian Yang, Shravan Nayak, Parisa Kordjamshidi, Nishanth Anand, Aishwarya Agrawal

机构 * Mila – Québec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Michigan State University(密歇根州立大学) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于强化学习的框架,自动发现视觉-语言模型在特定数据分布上的失败模式,通过生成问题来识别模型在细粒度视觉细节和技能组合上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24642 2026-04-28 cs.CV 57%

Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics

探测CLIP对360度文本和视觉语义的理解

Hai Wang, Xiaochen Yang, Mingzhi Dong, Jing-Hao Xue

机构 * Department of Statistical Science, University College London, UK(伦敦大学统计科学系) School of Mathematics and Statistics, University of Glasgow, UK(格拉斯哥大学数学与统计学学院) Department of Computer Science, University of Bath, UK(巴斯大学计算机科学系)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文探讨CLIP模型对360度全景图像-文本对语义对齐的评估能力,提出新的评价方法,发现CLIP在处理360度视觉语义时存在局限,并提出LoRA微调框架以提升其理解能力。

Comments Project Page: https://littlewhitesea.github.io/360Semantics.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24589 2026-04-28 cs.AI astro-ph.GA astro-ph.IM 57%

A systematic evaluation of vision-language models for observational astronomical reasoning tasks

对视觉语言模型在观测天文学推理任务中的系统评估

Wenke Ren, Hengxiao Guo, Wenwen Zuo, Xiaoman Zhang

机构 * Shanghai Astronomical Observatory, Chinese Academy of Sciences(上海天文台,中国科学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文系统评估了视觉语言模型在观测天文学推理任务中的表现,发现模型性能依赖于模态,且物理知识 grounding 对提升准确性至关重要。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14837 2026-04-28 cs.CL 57%

V-SEAM: Visual Semantic Editing and Attention Modulating for Causal Interpretability of Vision-Language Models

V-SEAM:视觉语义编辑与注意力调节用于视觉-语言模型的因果可解释性

Qidong Wang, Junjie Hu, Ming Jiang

机构 * Tongji University(同济大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出V-SEAM框架,结合视觉语义编辑和注意力调节,提升视觉-语言模型的因果可解释性,通过多级语义分析增强模型性能。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24146 2026-04-28 cs.CV 57%

EXACT: an explainable anomaly-aware vision foundation model for analysis of 3D chest CT

EXACT:一种可解释的异常感知视觉基础模型,用于3D胸部CT分析

Xuguang Bai, Mingxuan Liu, Tongxi Song, Yifei Chen, Hongjia Yang, Kasidit Anmahapong, Zihan Li, Ying Zhou, Qiyuan Tian

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) Department of Radiology, Mianyang Central Hospital(绵阳市中心医院放射科) Center for Biomedical Imaging Research, Tsinghua University(清华大学生物医学成像研究中心)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 EXACT通过学习空间解析表示,提升3D胸部CT的异常检测与可解释性,优于现有医学基础模型,适用于多疾病诊断和报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23996 2026-04-28 cs.CV 57%

SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs

SMoES:在MoE-VLMs中的软模态引导专家专业化

Zi-Hao Bo, Yaqian Li, Anzhou Hou, Rinyoichi Takezoe, Ertao Zhao, Tianxiang Pan, Jiale Yan, Mo Guang, Kaiwen Long

机构 * Li Auto Inc.(李自动公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SMoES,通过动态软模态评分、专家分组机制和互信息正则化,提升MoE-VLMs的模态感知专家专业化,实验显示在多模态和语言任务上平均提升0.9%和4.2%,通信开销降低56.1%,吞吐量提升12.3%。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23934 2026-04-28 eess.SY cs.SY 50%

VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions

VLM-VPI:一种用于改进自动驾驶车辆-行人交互的视觉语言推理框架

Qingwen Pu, Kun Xie, Yuxiang Liu

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出VLM-VPI框架,结合多模态感知、视觉场景理解和意图推理,提升自动驾驶中行人意图识别和安全控制,实验证明其在安全性和效率上的提升。

Comments 40 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23272 2026-04-28 cs.RO 50%

Modular Sensory Stream for Integrating Physical Feedback in Vision-Language-Action Models

模块化感觉流:整合物理反馈在视觉-语言-动作模型中

Jimin Lee, Huiwon Jang, Myungkyu Koo, Jungwoo Park, Jinwoo Shin

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Seoul National University(首尔国立大学)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 本文提出MoSS框架,通过模块化感觉流整合多种物理信号,提升视觉-语言-动作模型的行动预测能力。

Comments 14 pages, 8 figures, Project page: https://jiminlx.github.io/MoSS

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 14 篇

2604.10708 2026-04-28 cs.SD cs.AI cs.CV cs.MM 85%

Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni: 扩展多模态理解到多功能音频生成与编辑

Zeyue Tian, Binxin Yang, Zhaoyang Liu, Jiexuan Zhang, Ruibin Yuan, Hubery Yin, Qifeng Chen, Chen Li, Jing Lyu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) WeChat Vision, Tencent Inc(微信视觉,腾讯公司) Peking University(北京大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 Audio-Omni提出首个端到端框架,统一音频生成与编辑,结合多模态理解能力,通过冻结的多模态大语言模型与可训练的扩散变换器实现高保真合成,并构建大规模数据集提升音频编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08618 2026-04-28 eess.AS cs.CV cs.SD 84%

VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models

VAPO:基于多模态大语言模型的端到端幻灯片增强语音识别

Rui Hu, Delai Qiu, Yining Wang, Shengping Liu, Jitao Sang

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司) State Key Laboratory of AI Safety, Beijing(人工智能安全国家重点实验室)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

AI总结 VAPO通过多目标强化学习优化多模态大语言模型,解决视觉干扰问题,提升幻灯片增强语音识别的准确率和领域专用实体识别性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24191 2026-04-28 cs.CV 83%

Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning

Omni-o3:深度嵌套多模态推理用于 deliberative 音视频推理

Zhicheng Zhang, Wentao Gu, Weicheng Wang, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Jufeng Yang

机构 * Nankai University(南开大学) Pengcheng Laboratory(鹏城实验室) Kuaishou Technology(快手科技) Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田))

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 Omni-o3通过深度嵌套推理策略,解决多模态交互中搜索空间大且冗余的问题,提升音视频推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23692 2026-04-28 cs.GR cs.CV 79%

Personalizing Causal Audio-Driven Facial Motion via Dynamic Multi-modal Retrieval

通过动态多模态检索个性化因果音频驱动面部运动

Xuangeng Chu, Yu Han, Wei Mao, Shih-En Wei

机构 * The University of Tokyo, Codec Avatars Lab, Meta(东京大学,Codec Avatars实验室,Meta) Codec Avatars Lab, Meta(Codec Avatars实验室,Meta)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种端到端的因果框架,通过动态多模态风格检索实现个性化因果面部运动生成,解决实时流媒体与高保真个性化之间的矛盾,提升低延迟并利用无结构风格参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23860 2026-04-28 cs.CV cs.AI 73%

Exploring Audio Hallucination in Egocentric Video Understanding

探索第一人称视频理解中的音频幻觉

Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

机构 * Meta University Of Maryland, College Park(马里兰大学学院公园分校)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了第一人称视频中音频幻觉问题,提出自动评估框架和分类体系,发现先进AV-LLMs在回答声音相关问题时存在较高幻觉率。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23935 2026-04-28 cs.CV 70%

2nd of the 5th PVUW MeViS-Audio Track: ASR-SaSaSa2VA

第五届PVUW MeViS-Audio Track的第二名:ASR-SaSaSa2VA

Zhiyu Wang, Xudong Kang, Shutao Li

机构 * Hunan University(湖南大学)

专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出ASR-SaSaSa2VA框架,通过ASR将音频转换为文本描述,结合预训练文本引导视频分割模型实现高效的音频引导视频分割,解决了计算复杂度高、对齐困难和数据依赖性强的问题。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03525 2026-04-28 cs.CL cs.AI eess.AS 67%

Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies

基于语音的认知筛查:大型语言模型适应策略的系统评估

Fatemeh Taherinezhad, Mohamad Javad Momeni Nezhad, Sepehr Karimi, Sina Rashidi, Ali Zolnour, Maryam Dadkhah, Yasaman Haghbin, Hossein AzadMaleki, Maryam Zolnoori

机构 * Columbia University Irving Medical Center(哥伦比亚大学伊文思医疗中心) School of Nursing, Columbia University(哥伦比亚大学护理学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文系统评估了大型语言模型在痴呆症检测中的适应策略,发现上下文学习、推理增强提示和参数高效微调等方法对模型性能有显著影响,展示了适配模型在语音筛查中的有效性。

Journal ref https://ai.jmir.org/2026/1/e82608

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23632 2026-04-28 cs.CV cs.MM cs.SD 62%

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

Hallo-Live: 实时流式联合音频-视频虚拟形象生成与异步双流及以人类为中心的偏好蒸馏

Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Baidu(百度)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Hallo-Live框架,通过异步双流扩散与人类中心偏好蒸馏实现高保真实时音频视频虚拟形象生成,达到高吞吐量与低延迟,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23284 2026-04-28 cs.CL cs.AI 62%

Au-M-ol: A Unified Model for Medical Audio and Language Understanding

Au-M-ol:医疗音频与语言理解的统一模型

Meizhu Liu, Nistha Mitra, Paul Li, Amine Abdaoui, Adam Ledyard, Tao Sheng

机构 * Oracle AI Science(Oracle AI科学) Neuramill

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Au-M-ol模型,通过整合音频处理与大语言模型,提升医疗语音识别等任务的性能,实验显示其将词错误率降低56%,在噪声和专业术语等挑战下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22817 2026-04-28 eess.AS cs.CL cs.LG cs.SD 62%

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions

In-Sync: 语音感知大语言模型在ASR中的适应性改进:基于词级时间戳预测

Xulin Fan, Vishal Sunder, Samuel Thomas, Mark Hasegawa-Johnson, Brian Kingsbury, George Saon

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research(IBM研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出通过词级时间戳预测提升ASR性能,采用轻量训练策略增强对齐鲁棒性,实验证明在多个数据集上提升了时间戳准确性和整体ASR表现。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23909 2026-04-28 cs.CV 57%

AMAVA: Adaptive Motion-Aware Video-to-Audio Framework for Visually-Impaired Assistance

AMAVA:一种自适应的动觉感知视频到音频框架,用于视障协助

Benjamin Klein, Kazi Ruslan Rahman, Sanchita Ghose

机构 * Department of Computer Science, San Francisco State University(计算机科学系,旧金山州立大学) Department of Mathematics, San Francisco State University(数学系,旧金山州立大学) Department of Computer Engineering, San Francisco State University(计算机工程系,旧金山州立大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 AMAVA通过将移动设备视频转换为相关声音效果或语音描述,帮助视障人士更高效地感知环境,提升导航安全性和信心。

Comments 8 pages, 7 figures. Published in the Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289

Journal ref In Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23717 2026-04-28 cs.SD cs.CL 57%

HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

HeadRouter: 任务自适应音频标记压缩中的动态头部权重路由

Peize He, Yaodi Luo, Xiaoqian Liu, Xuyang Liu, Jiahang Deng, Yaosong Du, Bangyu Li, Xiyan Gui, Yuxuan Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) DAIL Tech(DAIL科技) Northeastern University(东北大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 HeadRouter通过动态评估不同音频任务中注意力头的重要性,实现高效的音频标记压缩,实验表明其在多个基准上均取得最佳压缩效果。

Comments Homepage: https://dabdans.github.io/HeadRouter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00626 2026-04-28 cs.SD cs.CL 57%

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models

沉默也重要:无关音频对大音频-语言模型文本推理的影响

Chen-An Li, Tzu-Han Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能研究中心)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 研究探讨无关音频对大音频-语言模型文本推理的影响,发现非信息性音频会降低准确率并增加预测波动,提出自一致性策略能提升稳定性但增加计算成本。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23077 2026-04-28 cs.IR 50%

Adopting State-of-the-Art Pretrained Audio Representations for Music Recommender Systems

采用最新预训练音频表示用于音乐推荐系统

Yan-Martin Tamm, Anna Aljanaki

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 本文评估了九种预训练模型在音乐推荐系统中的表现,发现其在传统MIR任务与冷热启动场景中性能差异显著,揭示了后端模型捕捉的音乐信息方面存在差异。

Comments Extended version of arXiv:2409.08987. Accepted for publication in the Special Issue "Highlights of RecSys '24" in ACM Transactions on Recommender Systems (TORS)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 13 篇

2601.20597 2026-04-28 cs.CV 83%

StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval

StructAlign:结构化跨模态对齐用于连续文本到视频检索

Shaokun Wang, Weili Guan, Jizhou Han, Jianlong Wu, Yupeng Hu, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学) Shandong University(山东大学)

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出StructAlign,通过结构化跨模态对齐方法解决连续文本到视频检索中的模态错位和特征漂移问题,提升模型持续学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏