arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-21 至 2026-08-21 共收录 70 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 14 篇

2608.19598 2026-08-21 cs.CV cs.AI cs.CL cs.MM 新提交 70%

PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment

PEA-DPO:用于多模态大语言模型对齐的感知增强型直接偏好优化

Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对多模态大语言模型偏好优化存在的视觉不敏感性问题,提出PEA-DPO框架,利用视觉偏好信号缓解该问题,提升多模态对齐效果并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19355 2026-08-21 cs.MM cs.CV 新提交 62%

GRACE: Grounded Reasoning via Adapter Composition and Evidence-Aware Calibration for Educational Visual Question Answering

GRACE:基于适配器组合与证据感知校准的教育视觉问答的接地推理

Xinjin Li, Yudi Xia, Xi Zhao, Yiliu Xu, Yining Liu, Cheng Lu, Yujian Long, Yu Ma, Jinghan Cao, Liang Fan, Yeyun Xu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 针对教育视觉问答的问题-选项捷径问题,提出GRACE框架,利用结构化教育状态实现参数高效多模态适配,在ScienceQA上提升了多项准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19788 2026-08-21 eess.IV cs.CV 新提交 57%

MOSAIC: Modality-agnostic Spectral Alignment for Federated Image-level Weakly Supervised Tumor Segmentation under Client-specific Missing Modalities

MOSAIC:面向客户端特定缺失模态的联邦图像级弱监督肿瘤分割的模态无关频谱对齐方法

Tarun Kumar Garg, Vaanathi Sundaresan

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本研究针对客户端特定缺失模态的联邦图像级弱监督肿瘤分割问题,提出MOSAIC框架,通过模态对齐模块、频谱原型对齐损失及联邦优化网络,在三个脑肿瘤基准上取得显著优于基线的性能,仅用图像级标签接近全监督精度,且支持动态客户端加入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18738 2026-08-21 cs.CL 版本更新 57%

Remask, Don't Replace: Token-to-Mask Refinement in Diffusion Language Models

重新标记,而非替换:扩散大语言模型中的令牌到标记细化

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Token-to-Mask(T2M)方法,通过重新标记可疑令牌而非覆盖来提升扩散大语言模型的准确性,在AIME 2025和CMATH上分别提升13.33和8.56个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00107 2026-08-21 cs.LG cs.AI eess.SP 版本更新 57%

Virtual Sensing to Enable Real-Time Monitoring of Inaccessible Locations & Unmeasurable Parameters

虚拟传感实现不可达位置与不可测参数的实时监测

Kazuma Kobayashi, Farid Ahmed, Jaewan Park, Subhankar Sarkar, Seid Koric, Souvik Chakraborty, Syed Bahauddin Alam

机构 * Plasma & Radiological Engineering Department, Grainger College of Engineering, Nuclear, University of Illinois Urbana-Champaign(等离子体与辐射工程系,格拉inger工程学院,核能,伊利诺伊大学厄巴纳-香槟分校) Mechanical Science and Engineering Department, Grainger College of Engineering, University of Illinois Urbana-Champaign(机械科学与工程系,格拉inger工程学院,伊利诺伊大学厄巴纳-香槟分校) National Center for Supercomputing Applications, Urbana, IL, USA(国家超级计算应用中心,伊利诺伊州厄巴纳,美国) Department of Applied Mechanics, Indian Institute of Technology Delhi, New Delhi, India(应用力学系,印度理工学院德里,新德里,印度) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(Yardi人工智能学院,印度理工学院德里)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 针对能量系统中物理传感器无法部署的实时监测问题,提出基于神经算子的虚拟传感框架MIMONet,将稀疏边界测量映射到内部场,在多种热流体系统中实现亚毫秒级高精度推理。

Comments New analysis and results are added

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19281 2026-08-21 cs.RO cs.HC 新提交 50%

APPROVE: Visual End-User-in-the-Loop Robot Programming with LLMs

APPROVE:结合大型语言模型的面向视觉端用户的机器人编程

Bijan Kavousian, Miray Özakkas, Josefine Monnet, Oliver Petrovic, Christian Brecher

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 APPROVE是一种结合LLMs的多模态端用户机器人编程框架,通过Blockly可视化程序并支持用户确认、修改或拒绝,还可存储复用已确认功能,解决了现有系统透明度不足、意图对齐差、复用有限的问题,提升了用户信任与编程灵活性。

Comments Accepted for publication in Procedia CIRP, Proceedings of the 20th CIRP Conference on Intelligent Computation in Manufacturing Engineering (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 4 篇

1905.11395 2026-08-21 cs.LG stat.ML 版本更新 82%

Multi-Modal Graph Interaction for Multi-Graph Convolution Network in Urban Spatiotemporal Forecasting

用于城市时空预测的多图卷积网络的多模态图交互

Lingyu Zhang, Xu Geng, Zhiwei Qin, Hongjun Wang, Xiao Wang, Ying Zhang, Jian Liang, Guobin Wu, Xuan Song, Yunhai Wang

专题命中 其他多模态 :multi-modal(title,abstract);multimodal(abstract)

AI总结 本研究针对城市时空预测问题,提出低层分组GCN与高层多线性关系GCN的多模态图交互方法,在网约车需求预测任务上优于现有基准模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07104 2026-08-21 cs.CV cs.AI 版本更新 79%

Extended to Reality: Prompt Injection in 3D Environments

扩展到现实:3D环境中的提示注入

Zhuoheng Li, Ying Chen

专题命中 其他多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究提出PI3D攻击,通过在3D环境中放置带文本的物理物体来注入提示,挑战多模态大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20117 2026-08-21 cs.LG 新提交 50%

SAE-Xplainers: Rule-Based Feature Interpretation for Extreme Earth Events

SAE-Xplainers:面向极端地球事件的基于规则的特征解释器

Hugo Porta, Emanuele Dalsasso, Chang Xu, Theo Gnassounou, Devis Tuia

专题命中 其他多模态 :multi-modal(abstract)

AI总结 针对极端地球事件分析中SAE模型可解释性不足的问题,提出基于地理位置调制输入的SAE及规则型SAE-Xplainers集成模型,在火灾预测等三类任务上验证了其性能与解释能力。

Comments 22 pages, 16 Figures, Under Review. A non-archival 2-page version was accepted as an oral presentation at Climate Informatics 2026 (Extended Abstract ID 66, this https URL (https://github.com/freddy0218/ClimateInformatics2026/tree/main) ), and a non-archival 4-page version was accepted as an oral presentation at the AICC Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20245 2026-08-21 cond-mat.mes-hall 新提交 50%

Coulomb blockade-like transport and enhanced memory in organic transistors embedded with sub-nm Pt nanoparticles for neuromorphic computing

用于神经形态计算的嵌入亚纳米铂纳米颗粒(PtNPs)的有机晶体管中类库 block 输运与增强型存储

Arash Ghobadi, Thomas B. Kallaos, Abhi Abhijeet, Stephen C. Klue, Joseph C. Mathai, Carsten A. Ullrich, Shubhra Gangopadhyay, Suchismita Guha

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究开发嵌入亚纳米PtNPs的有机晶体管,利用类库 block 输运实现大存储窗口,兼具长短时程可塑性,为神经形态计算中STP的实现提供新路径。

Comments 19 pages, 4 figures plus supplemental information (7 pages, 8 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏