arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-17 至 2026-06-17 共收录 73 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 13 篇

2606.17741 2026-06-17 eess.SY cs.HC cs.SY 新提交 78%

A Wearable Multimodal Ultrasound+Inertial System for Real-Time Virtual Reality Interaction

用于实时虚拟现实交互的可穿戴多模态超声+惯性系统

Giusy Spacone, Sebastian Frey, Enzo Baraldi, Mattia Orlandi, Luca Benini, Andrea Cossettini

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出基于前臂和上臂超声与惯性传感的完全可穿戴多模态接口,结合WULPUS平台和Unity VR环境,通过多模态学习实现手部姿态和前臂位置估计,在三个任务中在线成功率超88%。

Comments 8 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12863 2026-06-17 cs.LG 新提交 78%

Multimodal Graph Negative Learning

多模态图负学习

Zhengyu Wu, Xu Wang, Hongchao Qin, Xunkai Li, Guang Zeng, Rong-Hua Li, Guoren Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出GraphMNL框架,通过负学习解决多模态属性图中节点级分支语义不平衡问题,避免主导分支偏差传播,在Grocery和Reddit M数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10759 2026-06-17 cs.IR 新提交 78%

miniReranker: Efficient Multimodal Reranking through Visual Cache Reuse and Interaction Sparsity

miniReranker: 通过视觉缓存重用和交互稀疏性实现高效多模态重排序

Yingqi Fan, Xuan Lu, Anhao Zhao, Junlong Tong, Ping Nie, Kai Zou, Yunpu Ma, Wei Zhang, Xiaoyu Shen

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出miniReranker,通过视觉优先格式、早期退出、窄交互带和嵌入器引导剪枝,将重排序运行时间降至密集实现的1%以下,同时保持96%以上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09770 2026-06-17 q-bio.NC cs.LG 新提交 78%

Discovering Functionally Selective Brain Regions with a Deep Topographic Multimodal Model

发现功能选择性脑区:一种深度地形多模态模型

Badr AlKhamissi, Johannes Mehrer, Lara Marinov, Ahmed Abdelaal, Abdulkadir Gokce, Martin Schrimpf

机构 * University of California, Berkeley(加州大学伯克利分校) Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出Topo-Omni模型,通过空间平滑微调预训练基础模型,在单一连续虚拟皮层上整合视觉、听觉和语言/认知处理,产生与人类神经影像一致的多模态聚类,并用于发现新脑区。

Comments Preprint. First two author contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17678 2026-06-17 cs.CV cs.AI 新提交 62%

See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

先看后答:基于充分性驱动的强化学习实现视觉证据预对齐

Yilian Liu, Sicong Leng, Guoshun Nan, Junyi Zhu, Jiayu Huang, Minghao Sun, Xuancheng Zhu, Yisong Chen, Zexian Wei, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) China Telecom(中国电信)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17650 2026-06-17 cs.CV cs.CL 新提交 62%

MambaCount: Efficient Text-guided Open-vocabulary Object Counting with Spatial Sparse State Space Duality Block

MambaCount: 基于空间稀疏状态空间对偶块的高效文本引导开放词汇目标计数

Hao-Yuan Ma, Li Zhang, Minjie Qiang, Jie Gao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出MambaCount框架,通过空间稀疏状态空间对偶块解决Mamba在非因果视觉任务中的双向依赖限制和空间token高熵问题,实现线性复杂度的开放词汇目标计数,在FSC-147上取得12.23的测试MAE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18072 2026-06-17 eess.AS 新提交 57%

One-Step Token-to-Waveform Generation with MeanFlow in Latent Space

基于潜在空间中MeanFlow的一步式Token到波形生成

Zheqi Dai, Guangyan Zhang, Zhen Ye, Jingyu Li, Haolin He, Chunyat Wu, Yiwen Guo, Qiuqiang Kong

专题命中 多模态训练与对齐 :multimodal(abstract);分类 eess.AS

AI总结 提出MeanFlow在高度压缩潜在空间中实现一步式Token2Wav生成,解决多步流匹配解码器的速度-质量权衡,RTF提升17倍且质量损失可忽略。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17921 2026-06-17 cs.MM 新提交 57%

OlfactProfile: Profile-Conditioned Odor Prediction from Audiovisual Content

OlfactProfile: 基于用户嗅觉特征从视听内容预测气味

Zhengyu Lou, Bosheng Qin, Yanan Wang, Duanduan Yin, Wentao Ye, Yu Xin

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.MM

AI总结 提出OlfactProfile框架,通过结构化场级用户嗅觉特征调制,实现从视听内容预测气味,优于基线模型和通用多模态大模型,在背景气味和情感气味预测上提升显著。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 5 篇

2606.17118 2026-06-17 cs.LG cs.AI 新提交 83%

MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化

Yuanteng Chen, Peisong Wang, Zhilei Liu, Nanxin Zeng, Yuantian Shao, Shiqiang Lang, Tao Liu, Chuangyi Li, Qinghao Hu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对MoE多模态大语言模型在专家重要性估计中存在的跨模态和视觉内偏差,提出模态分解的专家级混合精度量化框架MODE,通过分解选择频率、过滤冗余视觉令牌并评估模态敏感性,在给定预算下分配比特宽度,在W3A16下平均性能损失控制在2.9%以内。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00215 2026-06-17 cs.CV cs.CL 版本更新 81%

Disentangling Perception and Reasoning in Multimodal LLMs via Reward Design

通过奖励设计解耦多模态大语言模型中的感知与推理

Omar Sharif, Eftekhar Hossain, Nikhil Singh, Patrick Ng

机构 * Department of Computer Science, Dartmouth College(达特茅斯大学计算机科学系) Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系) Independent Researcher(独立研究者)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究多模态大模型中感知与推理的瓶颈,发现感知是主要约束,并通过奖励设计提升视觉基础推理,平均提升5.56分。

Comments 24 pages, 15 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17953 2026-06-17 cs.CV 新提交 70%

MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

MLLMs 先正确后错误:追踪并纠正后层文本偏见

Xingming Li, Ao Cheng, Qiyao Sun, Xixiang He, Xuanyu Ji, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Intelligent Game and Decision Lab(智能博弈与决策实验室)

专题命中 其他多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 发现多模态大语言模型在中间层形成正确视觉预测,但最终输出时被文本覆盖,通过检测预测方向变化(85%失败转向文本,89%成功转向视觉)提出无训练方法CALRD,在冲突基准上提升高达9.4%。

Comments Accepted at IJCAI 2026. 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17674 2026-06-17 astro-ph.GA 新提交 50%

TOPoS VII. Age-metallicity relation in the Galactic halo and assembly of the Milky Way

TOPoS VII. 银河晕中的年龄-金属丰度关系与银河系的组装

P. Bonifacio, Y. Lebreton, I. Koutsouridou, Y. Zou, D. Romano, S. Salvadori, L. Sbordone, L. Monaco, E. Caffau, M. Spite, P. François

专题命中 其他多模态 :multi-modal(abstract)

AI总结 利用TOPoS样本中次巨星的高精度Gaia视差和贝叶斯推断代码SPInS,结合BaSTI恒星演化轨迹,研究银河晕的年龄-金属丰度关系,发现多模态分布揭示了晕、厚盘和薄盘的三条年龄-金属丰度关系,并支持并合在银河系早期演化中的重要作用。

Comments Astronomy & Astrophysics - A&A, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16795 2026-06-17 gr-qc astro-ph.CO astro-ph.HE astro-ph.IM 版本更新 50%

Sequential simulation-based inference for extreme mass ratio inspirals

极端质量比旋近的序贯模拟推断

Philippa S. Cole, James Alvey, Lorenzo Speri, Christoph Weniger, Uddipta Bhardwaj, Davide Gerosa, Gianfranco Bertone

专题命中 其他多模态 :multi-modal(abstract)

AI总结 针对LISA等空间引力波探测中极端质量比旋近的搜索和参数估计难题,提出序贯模拟推断方法(截断边缘神经比率估计),将11维参数空间体积缩小10^6-10^7倍,并提供非自旋系统的1维边缘建议分布。

Comments 12 pages, 9 figures plus appendices, v2 matches published version

详情

展开后加载摘要…

URL PDF HTML 收藏