arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-28 至 2026-07-28 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 11 篇

2607.24539 2026-07-28 cs.AI cs.SY eess.SY 新提交 79%

Task-Conditional Faithfulness Auditing of Multimodal LLMs for Grid Diagnosis

用于电网诊断的多模态大语言模型的任务条件忠实性审计

Tianqiao Zhao, Meng Yue, Jianhui Wang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) Brookhaven National Laboratory(布鲁克海文国家实验室) Southern Methodist University(南卫理公会大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型用于电网诊断时答案准确性与证据使用的问题,提出通用框架进行任务条件忠实性审计,通过比较多种依赖并设计校正和重新审计机制,经案例研究验证了框架检测、诊断及纠正相关失败的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23700 2026-07-28 cs.AI 新提交 79%

Offline-Online Curriculum RL for Multimodal Reasoning

用于多模态推理的离线-在线课程强化学习

Wendi Deng, Hang Du, Guoshun Nan, Haokun Tian, Jiaqi Yu, Xinlei Cao, Jaile Li, Jingfeng Chen, Ling Deng, Ting Li, Hao Yang, Jun Liu, Xudong Jiang, Sicong Leng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) BUPT Shenzhen Institute(北京邮电大学深圳研究院) Carnegie Mellon University(卡内基梅隆大学) Lancaster University(兰卡斯特大学) Nanyang Technological University(南洋理工大学) China Telecom Corporation Limited Sichuan Branch(中国电信股份有限公司四川分公司) Changsha University of Science & Technology(长沙理工大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究多模态推理中模型中间步骤有缺陷的问题,提出$O^2$-CritiCuRL框架,通过离线多步展开分析和在线渐进式强化学习策略,区分关键与冗余步骤,提升模型性能及训练和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07632 2026-07-28 cs.LG cs.AI 版本更新 79%

Sheaf-Laplacian Obstruction and Projection Hardness for Cross-Modal Compatibility on a Modality-Independent Site

sheaf-Laplacian 障碍与投影难度分析跨模态兼容性在模态无关站点

Tibor Sloboda

机构 * Faculty of Informatics and Information Technology, Slovak Technical University(斯洛伐克技术大学信息学与信息技术学院) aleph0 s. r. o.

专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.AI

AI总结 本文提出统一框架分析学习表示中的跨模态兼容性,通过模态无关邻域站点和有限维实内积空间细胞sheaf,定义投影难度和sheaf-Laplacian障碍,分析两种失败模式并推导稳定性与误差界。

Comments 31 pages, 7 figures, submitted to Annals of Mathematics and Artificial Intelligence of Springer Nature, post-major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23489 2026-07-28 cs.HC 新提交 78%

Multimodal Data Comprehension: Understanding How Visual-Textual Chains of Information Influence Data Interpretation

多模态数据理解:理解视觉-文本信息链如何影响数据解释

Arran Zeyu Wang, Fuling Sun, Danielle Albers Szafir

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究多模态数据理解中视觉与文本信息链对数据解释的影响,提出用可视化优先链和文本优先链呈现信息的实验范式,通过比较发现不同链的理解特点,为多模态信息整合及有效数据通信设计提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24534 2026-07-28 cond-mat.stat-mech cond-mat.mtrl-sci 新提交 78%

Amortized Posteriors for Estimation of Material Constitutive Parameters from Multimodal Measurements on Small Punch Tests

基于小冲孔试验多模态测量估计材料本构参数的摊销后验

Mohammad Ali Seyed Mahmoud, Aditya Venkatraman, Raj Mahat, Samantha Mitra, Surya R. Kalidindi

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究从小冲孔试验多模态测量估计材料本构参数问题,提出将高斯过程代理与条件流匹配相结合的摊销无似然框架,避免手工似然和重复采样,通过实验证明该方法能有效收缩后验,建立了强大的无似然推断框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24187 2026-07-28 cs.AI 新提交 70%

Myopia Prevention and Control 3.0: Artificial Intelligence--Driven Risk Stratification, Proactive Monitoring, and Personalized Intervention

近视防控3.0:人工智能驱动的风险分层、主动监测和个性化干预

Tieniu Wang, Cangzhu Huang, Qianhui Li

机构 * Shanghai Nile Intelligent Technology Co., Ltd.(上海尼罗智能科技有限公司) Beijing Tanyuan Academy of Intelligent Sensing(北京潭渊智能传感研究院)

专题命中 其他多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 研究借助人工智能、数字传感等技术推动近视防控从被动变主动精准模式。通过多模态数据机器学习预测风险、可穿戴等监测及个性化干预形成闭环。评估各阶段证据,讨论相关挑战并给出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24017 2026-07-28 cs.CV cs.AI 新提交 62%

Disentangling Semantic Attention from Structural Bias in the Attention Manifold

在注意力流形中分离语义注意力与结构偏差

Pengkun Jiao, Bin Zhu, Jingjing Chen, Yu-gang Jiang

机构 * Fudan University(复旦大学) Singapore Management University(新加坡管理大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型中注意力机制对无信息视觉 tokens 关注过多的问题,提出无需训练的 SPAR 方法,通过净化噪声和重分配注意力,有效恢复真实视觉基础且计算开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24113 2026-07-28 cs.RO cs.AI cs.HC 新提交 57%

A Case Study on the Acceptance of a Humanoid Robotic Head Employed in Three Public Spaces

关于在三个公共场所使用的仿人机器人头部接受度的案例研究

Marcel Heisler, Luca Randecker, Christian Becker-Asano

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究仿人机器人头部在公共场所的接受度,通过情感模拟后端处理自然语言生成多模态响应,邀请访客交流。结果显示用户有使用意愿,公共场所更适配,多语言响应受欢迎,但响应时间待改进。

Comments accepted at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026) Kitakyushu, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22734 2026-07-28 cs.CV eess.IV physics.geo-ph 新提交 57%

Fast Fourier Convolutional GAN for 30 m Clear-Sky Land Surface Temperature Gap-Free Reconstruction

用于30米晴空陆地表面温度无间隙重建的快速傅里叶卷积生成对抗网络

Marwa Alfouly, Smajil Halilovic, Nils Bochow, Thomas Hamacher, Niklas Boers, Konrad Schindler

机构 * Technical University of Munich(慕尼黑工业大学) Helmholtz Centre for Polar and Marine Research, Alfred Wegener Institute(亥姆霍兹极地与海洋研究中心阿尔弗雷德·韦格纳研究所) Swiss Federal Institute of Technology Zurich (ETH Zurich)(瑞士联邦理工学院苏黎世分校)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对卫星LST数据因云层有间隙、重建难问题,提出多模态快速傅里叶卷积生成对抗网络,利用快速傅里叶卷积实现全局感受野,由卫星观测和SAR数据引导,能恢复大量缺失区域,重建效果好。

Comments 35 pages, 9 figures, Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22989 2026-07-28 stat.CO stat.ME 新提交 50%

SuSIE: Subset Simulation with Intrepid Exploration

SuSIE:具有无畏探索的子集模拟

Adwait Sharma, Promit Chakroborty, Michael D. Shields

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究子集模拟框架在多失效区域等复杂情况下估计结构可靠性的挑战,提出用改进的无畏MCMC采样器替代传统方法,经示例验证该方法能解决复杂特征,有效估计失效概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23298 2026-07-28 cs.HC 新提交 50%

Cross Sensory Co-Design Tools and Interaction Qualities

跨感官协同设计工具与交互质量

Albrecht Kurze, Klaus Stephan

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究跨感官交互设计难题,核心方法是开发Loaded Dice和Wheel of Plush工具,利用技术联觉原理及简单交互方案实现传感器与执行器映射,主要贡献为助力跨感官交互设计及探索新应用领域。

Comments In "Workshop Cross-Sensory Futures: Rewiring Perception in HCI" at CHI 2026. April 13, 2026. Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏