arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-18 至 2026-08-18 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 8 篇

2607.11621 2026-08-18 cs.AI cs.CL cs.LG 版本更新 81%

Lesioned Multimodal Language Models Reproduce Aphasic Picture-Naming Patterns

受损多模态语言模型再现失语症患者的图片命名模式

Yong Yang, Xiang Guan, Sophie Arheix-Parras, Saeed Ahmadi, Roger Newman-Norlund, Leonardo Bonilha, Christopher Rorden, Julius Fridriksson, Rutvik H. Desai, Srihari Nelakuditi

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究未针对临床模拟设计的通用语言模型能否再现失语症患者图片命名错误模式,通过对多模态语言模型进行扰动配置,建立定量框架再现个体失语症错误模式,表明语言模型或可成为中风后失语症患者数字替身。

Comments 15 pages, 8 figures; supplementary materials (18 pages, 6 sections) included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14951 2026-08-18 cs.LG eess.IV q-bio.QM stat.ML 新提交 78%

PathFinder: Joint Decompositions of Linked Multimodal Datasets

PathFinder:链接多模态数据集的联合分解方法

Ying-Qiu Zheng, Alex Fung, Stephen M Smith, Rogier B Mars, Saad Jbabdi

机构 * Oxford Centre for Integrative Neuroimaging(牛津整合神经成像中心) University of Oxford(牛津大学)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 PathFinder是一种通用的联合矩阵分解框架,可分析未必共享同一维度的多模态数据集,能发现跨模态等的共同模式并预测缺失数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16709 2026-08-18 cs.CV cs.AI cs.LG 新提交 76%

MIRROR: Multimodal Intelligent Radiology Reasoning and Observation Reporter

MIRROR:多模态智能放射学推理与观察报告生成器

Vignesh Nagarajan, Sriram Venkatapathy

机构 * Texas A&M University(德克萨斯农工大学) Capital One(第一资本金融公司) IIT Hyderabad(印度理工学院海得拉巴分校)

专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 MIRROR是一款多模态智能放射学报告生成原型,通过分离分类、定位与文本生成环节实现可审计的放射学发现,在ChestMNIST数据集上达到0.729的宏平均AUROC,但受类别不平衡影响存在决策弃权问题。

Comments 8 pages, 5 figures, 5 tables, 24 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15115 2026-08-18 cs.CV 新提交 57%

Perspective-Invariant Attack with Enhanced Transferability of Adversarial Examples

具有增强对抗样本迁移性的视角不变攻击

Kaisheng Liang, Yiming Cao, Bin Xiao

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对对抗样本跨模型迁移性带来的安全威胁,提出视角不变攻击(PIA)及其扩展PIA-Mix,通过多自由度顶点采样策略提升对抗样本迁移性,实验显示其性能优于当前最优基于迁移的攻击方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14878 2026-08-18 stat.ME 新提交 50%

Quantification and Decomposition of Uncertainty Using Sliced-Normal Distribution: With Applications to NASA Data

基于切片正态分布的不确定性量化与分解:在NASA数据中的应用

Arindam RoyChowdhury, Luis G. Crespo, Henry Lam

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文改进了切片正态(SN)分布框架,将其参数估计转化为凸优化问题,明确其表达能力并提出高维拟合流程,在NASA失速飞行数据上验证了该方法可捕捉非线性依赖模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15489 2026-08-18 eess.SP eess.SY 新提交 50%

Contours-Seeking Proposal Density Particle Filter and Resilient Terrain-Referenced Navigation

轮廓搜索提议密度粒子滤波与弹性地形基准导航

Junwoo Park, Hyochoong Bang

专题命中 其他多模态 :multimodal(abstract)

AI总结 针对粒子滤波退化问题,提出含高斯混合随机强迫机制的轮廓搜索采样策略,经实验验证可降低权重方差、提升有效样本量,在恶劣场景下仍能可靠运行。

Comments 17 pages. Author's accepted version. Published in IEEE Transactions on Aerospace and Electronic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16572 2026-08-18 cs.RO 新提交 50%

ViHaTeleop: A Low-Cost, Lightweight Visual-Haptic Teleoperation System for Dexterous Manipulation Learning

ViHaTeleop:一种用于灵巧操作学习的低成本轻量型视觉-触觉遥操作系统

Fucai Zhu, Yanhou Lai, Paul Maestre, Koichi Hashimoto

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 ViHaTeleop是一款低成本轻量型视觉-触觉遥操作系统,结合SLAM、相机跟踪与LRA反馈,经实验验证其可提升接触关键任务的操作成功率与主观体验,支持从演示到策略训练的完整流程。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15520 2026-08-18 cs.LG 新提交 50%

Guaranteed Adaptive Modality Acquisition: When the Policy Chooses Its Own Calibration Group

带保证的自适应模态获取:策略选择自身校准组时

Melika Baghi

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究针对自适应模态获取中策略诱导分组破坏条件校准假设的问题,提出RouteCert方法,在临床心电图任务及掩码多模态基准上实现了高回答比例与低分歧率的良好性能。

Comments 23 pages, 4 figures, 14 tables. Includes appendix with full proofs and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏