arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-28 至 2026-07-28 共收录 140 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 28 篇

2602.19349 2026-07-28 cs.CV cs.AI 版本更新 62%

UP-Fuse: Uncertainty-guided LiDAR-Camera Fusion for 3D Panoptic Segmentation

UP-Fuse:基于不确定性引导的激光雷达-摄像头融合用于3D全景分割

Rohit Mohan, Florian Drews, Yakov Miron, Daniele Cattaneo, Abhinav Valada

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 UP-Fuse通过不确定性引导的融合框架,提升激光雷达与摄像头在3D全景分割中的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.11546 2026-07-28 cs.CL cs.AI 版本更新 62%

Like a Baby: Visually Situated Neural Language Acquisition

像婴儿一样:视觉情境下的神经语言习得

Alexander G. Ororbia, Ankur Mali, Mary Alexandria Kelly, David Reitter

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 研究视觉情境对神经语言模型下一词预测的好处,引入多模态神经架构,微调预训练BERT嵌入,发现多模态环境下语言模型表现更好,符合情境认知理论,不同语言和模型中视觉情境训练优势明显。

Comments Final submission (camera-ready), accepted to ACL 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22952 2026-07-28 eess.AS 新提交 57%

Disentangling the Interpretive and Predictive Roles of LIWC: Controlled Substitution in Depression-Related Classification

解开语言调查与单词计数(LIWC)的解释性和预测性作用:抑郁症相关分类中的受控替换

Hsiang-Chen Yeh, Xiutian Zhao, Aurosweta Mahapatra, Shreeram Suresh Chandra, Ryan L. Boyd, Berrak Sisman

专题命中 多模态训练与对齐 :multimodal(abstract);分类 eess.AS

AI总结 研究探讨LIWC在抑郁症相关分类中的作用,通过与三种局部替换版本比较,在多语料库中评估其对分类的影响,结果显示其在固定表示下增益有限,作为解释层有用,但结论不适用于特定架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23921 2026-07-28 cs.CV 新提交 57%

DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering

DDVT:用于视觉问答中答案定位的动态双级视觉Transformer融合网络

Yue Zhang, Xiangyu Li, Wanshu Fan, Xin Yang, Dongsheng Zhou

机构 * National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University(大连大学软件工程学院计算机辅助设计国家地方联合工程实验室) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 研究视觉问答中答案定位问题,提出动态双级视觉Transformer融合网络DDVT,含问题引导的动态区域级模块和跨模态多尺度聚合模块,能精确定位相关视觉内容并融合文本特征,实验证明其性能优于现有方法。

Comments Accepted by CGI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23600 2026-07-28 cs.CV 新提交 57%

ConFusion: Continuous Fusion Space Learning for Fine-Grained Controllable Infrared and Visible Image Fusion

ConFusion:用于细粒度可控红外与可见光图像融合的连续融合空间学习

Guo Yurong, He Yufei, Li Yonghao, Chang Dongliang, Zhang Ke, Ma Zhanyu

机构 * North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究可控红外与可见光图像融合,提出ConFusion框架,通过高斯条件空间感知调制学习连续融合空间,采用双分支架构及相关模块实现实例级细粒度可控融合,实验证明其在融合质量和下游任务上达先进水平。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23046 2026-07-28 cs.CV 新提交 57%

Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs

用于高分辨率多模态大语言模型中高效视觉令牌剪枝的结构化冗余建模

Jouwon Song, Woohyeong Kim, Kyeongbo Kong

机构 * LG Electronics(LG电子) Pusan National University(釜山国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对高分辨率多模态大语言模型视觉令牌爆炸致延迟瓶颈问题,提出单向前向剪枝器SFPruner,通过语义引导岭杠杆方案和基于排名的方向掩码两个互补机制,在单次前向传递中实现冗余感知重要性选择,有效减少令牌选择时间并保持性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14807 2026-07-28 cs.CV cs.RO 版本更新 57%

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

HiMemVLN:通过分层记忆系统增强开源零样本视觉-语言导航的可靠性

Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HiMemVLN,通过分层记忆系统提升开源零样本视觉-语言导航的可靠性,解决导航遗忘问题,实现实验环境下的性能提升。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24260 2026-07-28 cs.LG 新提交 50%

KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems

KAP:弥合大语言模型系统中知识选择与运行时消耗的差距

Shuo Wang, Fang Xi, Wenyuan Huang, Qing Wang, Junming Su

机构 * QiYuanLab(启元实验室)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究大语言模型系统中知识选择与运行时消耗的差距,提出知识访问规划(KAP)范式,通过建立通用中间表示编译知识信号控制KV访问,以GraphSpec实例化,改变长上下文生成扩展轨迹,提升运行时消耗效率。

Comments 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-07-28 cs.IR 新提交 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 11 篇

2607.24539 2026-07-28 cs.AI cs.SY eess.SY 新提交 79%

Task-Conditional Faithfulness Auditing of Multimodal LLMs for Grid Diagnosis

用于电网诊断的多模态大语言模型的任务条件忠实性审计

Tianqiao Zhao, Meng Yue, Jianhui Wang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) Brookhaven National Laboratory(布鲁克海文国家实验室) Southern Methodist University(南卫理公会大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型用于电网诊断时答案准确性与证据使用的问题,提出通用框架进行任务条件忠实性审计,通过比较多种依赖并设计校正和重新审计机制,经案例研究验证了框架检测、诊断及纠正相关失败的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23700 2026-07-28 cs.AI 新提交 79%

Offline-Online Curriculum RL for Multimodal Reasoning

用于多模态推理的离线-在线课程强化学习

Wendi Deng, Hang Du, Guoshun Nan, Haokun Tian, Jiaqi Yu, Xinlei Cao, Jaile Li, Jingfeng Chen, Ling Deng, Ting Li, Hao Yang, Jun Liu, Xudong Jiang, Sicong Leng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) BUPT Shenzhen Institute(北京邮电大学深圳研究院) Carnegie Mellon University(卡内基梅隆大学) Lancaster University(兰卡斯特大学) Nanyang Technological University(南洋理工大学) China Telecom Corporation Limited Sichuan Branch(中国电信股份有限公司四川分公司) Changsha University of Science & Technology(长沙理工大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究多模态推理中模型中间步骤有缺陷的问题,提出$O^2$-CritiCuRL框架,通过离线多步展开分析和在线渐进式强化学习策略,区分关键与冗余步骤,提升模型性能及训练和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07632 2026-07-28 cs.LG cs.AI 版本更新 79%

Sheaf-Laplacian Obstruction and Projection Hardness for Cross-Modal Compatibility on a Modality-Independent Site

sheaf-Laplacian 障碍与投影难度分析跨模态兼容性在模态无关站点

Tibor Sloboda

机构 * Faculty of Informatics and Information Technology, Slovak Technical University(斯洛伐克技术大学信息学与信息技术学院) aleph0 s. r. o.

专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.AI

AI总结 本文提出统一框架分析学习表示中的跨模态兼容性,通过模态无关邻域站点和有限维实内积空间细胞sheaf,定义投影难度和sheaf-Laplacian障碍,分析两种失败模式并推导稳定性与误差界。

Comments 31 pages, 7 figures, submitted to Annals of Mathematics and Artificial Intelligence of Springer Nature, post-major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23489 2026-07-28 cs.HC 新提交 78%

Multimodal Data Comprehension: Understanding How Visual-Textual Chains of Information Influence Data Interpretation

多模态数据理解:理解视觉-文本信息链如何影响数据解释

Arran Zeyu Wang, Fuling Sun, Danielle Albers Szafir

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究多模态数据理解中视觉与文本信息链对数据解释的影响,提出用可视化优先链和文本优先链呈现信息的实验范式,通过比较发现不同链的理解特点,为多模态信息整合及有效数据通信设计提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24534 2026-07-28 cond-mat.stat-mech cond-mat.mtrl-sci 新提交 78%

Amortized Posteriors for Estimation of Material Constitutive Parameters from Multimodal Measurements on Small Punch Tests

基于小冲孔试验多模态测量估计材料本构参数的摊销后验

Mohammad Ali Seyed Mahmoud, Aditya Venkatraman, Raj Mahat, Samantha Mitra, Surya R. Kalidindi

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究从小冲孔试验多模态测量估计材料本构参数问题,提出将高斯过程代理与条件流匹配相结合的摊销无似然框架,避免手工似然和重复采样,通过实验证明该方法能有效收缩后验,建立了强大的无似然推断框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24187 2026-07-28 cs.AI 新提交 70%

Myopia Prevention and Control 3.0: Artificial Intelligence--Driven Risk Stratification, Proactive Monitoring, and Personalized Intervention

近视防控3.0:人工智能驱动的风险分层、主动监测和个性化干预

Tieniu Wang, Cangzhu Huang, Qianhui Li

机构 * Shanghai Nile Intelligent Technology Co., Ltd.(上海尼罗智能科技有限公司) Beijing Tanyuan Academy of Intelligent Sensing(北京潭渊智能传感研究院)

专题命中 其他多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 研究借助人工智能、数字传感等技术推动近视防控从被动变主动精准模式。通过多模态数据机器学习预测风险、可穿戴等监测及个性化干预形成闭环。评估各阶段证据,讨论相关挑战并给出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24017 2026-07-28 cs.CV cs.AI 新提交 62%

Disentangling Semantic Attention from Structural Bias in the Attention Manifold

在注意力流形中分离语义注意力与结构偏差

Pengkun Jiao, Bin Zhu, Jingjing Chen, Yu-gang Jiang

机构 * Fudan University(复旦大学) Singapore Management University(新加坡管理大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型中注意力机制对无信息视觉 tokens 关注过多的问题,提出无需训练的 SPAR 方法,通过净化噪声和重分配注意力,有效恢复真实视觉基础且计算开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24113 2026-07-28 cs.RO cs.AI cs.HC 新提交 57%

A Case Study on the Acceptance of a Humanoid Robotic Head Employed in Three Public Spaces

关于在三个公共场所使用的仿人机器人头部接受度的案例研究

Marcel Heisler, Luca Randecker, Christian Becker-Asano

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究仿人机器人头部在公共场所的接受度,通过情感模拟后端处理自然语言生成多模态响应,邀请访客交流。结果显示用户有使用意愿,公共场所更适配,多语言响应受欢迎,但响应时间待改进。

Comments accepted at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026) Kitakyushu, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22734 2026-07-28 cs.CV eess.IV physics.geo-ph 新提交 57%

Fast Fourier Convolutional GAN for 30 m Clear-Sky Land Surface Temperature Gap-Free Reconstruction

用于30米晴空陆地表面温度无间隙重建的快速傅里叶卷积生成对抗网络

Marwa Alfouly, Smajil Halilovic, Nils Bochow, Thomas Hamacher, Niklas Boers, Konrad Schindler

机构 * Technical University of Munich(慕尼黑工业大学) Helmholtz Centre for Polar and Marine Research, Alfred Wegener Institute(亥姆霍兹极地与海洋研究中心阿尔弗雷德·韦格纳研究所) Swiss Federal Institute of Technology Zurich (ETH Zurich)(瑞士联邦理工学院苏黎世分校)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对卫星LST数据因云层有间隙、重建难问题,提出多模态快速傅里叶卷积生成对抗网络,利用快速傅里叶卷积实现全局感受野,由卫星观测和SAR数据引导,能恢复大量缺失区域,重建效果好。

Comments 35 pages, 9 figures, Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22989 2026-07-28 stat.CO stat.ME 新提交 50%

SuSIE: Subset Simulation with Intrepid Exploration

SuSIE:具有无畏探索的子集模拟

Adwait Sharma, Promit Chakroborty, Michael D. Shields

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究子集模拟框架在多失效区域等复杂情况下估计结构可靠性的挑战,提出用改进的无畏MCMC采样器替代传统方法,经示例验证该方法能解决复杂特征,有效估计失效概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23298 2026-07-28 cs.HC 新提交 50%

Cross Sensory Co-Design Tools and Interaction Qualities

跨感官协同设计工具与交互质量

Albrecht Kurze, Klaus Stephan

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究跨感官交互设计难题,核心方法是开发Loaded Dice和Wheel of Plush工具,利用技术联觉原理及简单交互方案实现传感器与执行器映射,主要贡献为助力跨感官交互设计及探索新应用领域。

Comments In "Workshop Cross-Sensory Futures: Rewiring Perception in HCI" at CHI 2026. April 13, 2026. Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏