arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-19 至 2026-08-19 共收录 74 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2608.16962 2026-08-19 eess.IV 新提交 78%

Clinical Pathways Matter for Multimodal Deep Learning in Early Alzheimers Disease Detection

临床路径对早期阿尔茨海默病检测中的多模态深度学习至关重要

Yao Lu, Solveig Kristina Hammonds, Alvaro Fernandez-Quilez

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究提出基于SigLIP的零样本多模态框架,结合结构MRI与常规临床变量,在ADNI队列中实现早期阿尔茨海默病风险分层,性能优于传统模型,且可扩展至纵向数据。

Comments Published

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21693 2026-08-19 cs.LG 版本更新 78%

TiMi: Empower Time Series Transformers with Multimodal Mixture of Experts

TiMi: 通过多模态专家混合增强时间序列变换器

Jiafeng Lin, Yuxuan Wang, Huakun Luo, Jianmin Wang, Zhongyi Pei

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 TiMi通过多模态专家混合机制,利用大语言模型生成未来推断以提升时间序列预测的因果推理能力,实现多模态数据的有效整合与高精度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17414 2026-08-19 cs.CV cs.PL 新提交 70%

REChart: Reasoning-Efficient Chart Editing with Large Reasoning Models

REChart:基于大型推理模型的推理高效图表编辑方法

Yuanbang Liu, Chenxi Ruan, Yihan Hou, Qiong Luo, Wei Zeng

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 REChart是两阶段训练框架,通过过程级监督提升图表编辑的保真度与推理效率,在两个基准上实现同规模开源模型最优性能,推理token用量降低79.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17550 2026-08-19 cs.CV cs.CL 新提交 62%

Code as Representation: A Compilable Parsing Paradigm for Academic Documents

代码作为表示:学术文档的可编译解析范式

Rihui Jin, Jun Wang, chengyuan zhu, Liang Mingyu, Yue Gao, Li Yunxuan, Kuicai Dong, Guilin Qi, Lin Ren, Yongrui Chen, Xinbang Dai, Jiaqi Li, Tongtong Wu, Gholamreza Haffari

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对学术PDF难以被机器处理的问题,提出CADP可编译解析范式,构建CADP-Bench基准并测试SOTA MLLMs,发现前沿模型仍难生成高保真可执行重构,该基准已开放供研究。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12852 2026-08-19 cs.CL cs.AI 版本更新 62%

Falsehood and Impossibility Are Different Directions in an AI's Representation of Language

AI对语言的表征中,虚假与不可能是不同的方向

Yoon Pyo Lee

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过对Gemma 3 4B IT模型的激活分析,发现其内部能区分语言的不可能性与虚假,但将偶然虚假混同于矛盾,且不可能性表征与真值、语义异常表征方向不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17425 2026-08-19 cs.CV 新提交 57%

GSToken: Geometry-Structured Gaussian Tokens for Compact 3D Medical Image Representation

GSToken:用于紧凑三维医学图像表示的几何结构化高斯令牌

Xiaoduo Li, Quan Gu

机构 * Taiyuan University of Technology(太原理工大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出GSToken,一种带显式几何信息的高斯令牌,通过冻结令牌生成器的评估协议验证其在多模态脑肿瘤分割中,比容量匹配基线更优,可提升三维医学图像表示的信息密度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17667 2026-08-19 math.ST 版本更新 50%

Rapid Bayesian Computation and Estimation for Neural Networks via Log-Concave Coupling

Curtis McDonald, Andrew R. Barron

专题命中 多模态训练与对齐 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 7 篇

2608.10448 2026-08-19 cs.AI 版本更新 89%

Rationale-Guided Learning for Multimodal Emotion Recognition

基于理由引导学习的多模态情感识别

Sujung Oh, Jung Uk Kim, Sangmin Lee

专题命中 其他多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态情感识别忽略人类因果推理的问题,提出理由引导学习框架,结合双加工理论与MLLM生成的理由训练模型,在IEMOCAP和MELD基准取得最优性能,且推理无额外开销。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17399 2026-08-19 cs.CL 新提交 81%

An Investigation of Translationese in the Generations of Multilingual Large Language Models

多语言大语言模型生成文本中的翻译腔研究

Maria Valentini, Téa Wright, Julisa Granados, Eliana Colunga, Katharina von der Wense

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) University of California Berkeley(加州大学伯克利分校) Johannes Gutenberg University Mainz(美因茨约翰内斯·古腾堡大学)

专题命中 其他多模态 :MLLM(summary_cn,abstract);分类 cs.CL

AI总结 本文探究多语言大语言模型生成文本是否存在翻译腔,对比直接翻译的翻译腔差异,通过多种方法评估MLLM生成文本的翻译腔特征。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05163 2026-08-19 physics.optics cond-mat.mes-hall quant-ph 版本更新 78%

Topology and criticality in non-Hermitian multimodal optical resonators through engineered losses

通过可控损耗实现非厄米多模光学谐振器中的拓扑与临界性

Elizabeth Louis Pereira, Hongwei Li, Andrea Blanco-Redondo, Jose L. Lado

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本研究提出多模非厄米晶格模型,证实其可呈现拓扑模式与临界性,分析其对损耗波动等的鲁棒性,发现可通过外部规范场调控局域化特性,为可控非厄米拓扑设计提供新策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17151 2026-08-19 cs.CV cs.LG 新提交 70%

Lymphocyte Mimicry Correction via Region-Level Tissue Reasoning and Unbalanced Optimal Transport

基于区域级组织推理与非平衡最优传输的淋巴细胞模拟修正

Xiang Li, Yuqi Wang, Casey C. Heirman, Jihye Heo, Kyle J. Lafata

机构 * Duke University(杜克大学)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对细胞模拟导致的病理细胞分类歧义问题,提出Loki-OT方法,结合区域级组织推理与非平衡最优传输,在TCGA-BRCA队列上取得更优性能。

Comments 13 pages, 3 figures. Accepted to the MICCAI 2026 COMPAYL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17447 2026-08-19 cs.CV 新提交 57%

NGS-Marker: Robust Native Watermarking for 3D Gaussian Splatting

NGS-Marker:面向3D高斯溅射(3DGS)的鲁棒原生水印

Hao Qin, Yukai Sun, Luyuan Chen, Mengxu Lu, Feng Zhang, Ming Kong, Zhenhong Du, Qiang Zhu

机构 * Zhejiang University(浙江大学) Zhejiang Key Laboratory of Geographic Information Science(浙江省地理信息科学重点实验室)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对现有3D高斯溅射水印技术无法抵御部分侵权的问题,提出NGS-Marker原生水印框架,通过联合训练的注入器与解码器及梯度渐进注入策略实现全场景覆盖,可抵御部分侵权并支持混合与多模态水印,具备实际部署灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24028 2026-08-19 astro-ph.EP 版本更新 50%

Micron-Scale Technosignatures: How a Cubic Metre of Lunar Regolith May Begin to Constrain the Number of Past Technological Civilisations in the Galaxy

微米级技术特征:一立方米月球风化层如何开始约束银河系中过去技术文明的数量

Lewis J. Pinault, Brian C. Lacki, Ian A. Crawford, Andrew P. V. Siemion

专题命中 其他多模态 :multi-modal(abstract)

AI总结 研究提出通过分析月球风化层中微米级人造颗粒来约束银河系技术文明数量,结合星际输运和风化层混合模型,给出无检测时的上限约0.09地球质量当量。

Comments Originally submitted to the International Journal of Astrobiology on 10 March 2026; this is revised version 4, in response to reviewer comments, resubmitted 17 August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19428 2026-08-19 cond-mat.mtrl-sci 版本更新 50%

Mapping optical, chemical, structural features in ZrO2 via cross-sectional SEM-Cathodoluminescence correlation microscopy

通过交叉截面SEM-阴极发光相关显微镜映射ZrO2的光学、化学和结构特征

Ricardo Vidrio, Yuhan Tong, Junliang Liu, Bil Schneider, William O. Nachlas, Nathan Curtis, Maryam Zahedian, Alexander Kvit, Hongliang Zhang, Zefeng Yu, Ximeng Wang, Yongfeng Zhang, Adrien Couet, Jennifer T. Choy

专题命中 其他多模态 :multi-modal(abstract)

AI总结 通过交叉截面SEM-阴极发光相关显微镜研究ZrO2中光学、化学和结构特征的关联,揭示缺陷与微结构对电荷传输的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏