arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-24 至 2026-04-24 共收录 39 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2603.07961 2026-04-24 cs.CV 77%

SGG-R$^{\rm 3}$: From Next-Token Prediction to End-to-End Unbiased Scene Graph Generation

SGG-R$^{\rm 3}$: 从单token预测到端到端无偏场景图生成

Jiaye Feng, Qixiang Yin, Yuankun Liu, Tong Mo, Weiping Li

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Zhongguancun Academy(中关村学院)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出SGG-R$^{\rm 3}$框架,通过结合任务特定的推理过程和强化学习优化,解决场景图生成中的关系稀疏和长尾问题,提升生成效果和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21573 2026-04-24 cs.CV q-bio.QM 74%

CHRep: Cross-modal Histology Representation and Post-hoc Calibration for Spatial Gene Expression Prediction

CHRep: 跨模态组织切片表示与事后校准用于空间基因表达预测

Changfan Wang, Xinran Wang, Donghai Liu, Fei Su, Lulu Sun, Zhicheng Zhao, Zhu Meng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Peking University Third Hospital(北京大学第三医院)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

AI总结 CHRep通过两阶段框架提升组织切片到基因表达的预测鲁棒性,结合结构感知表示学习与事后校准,提升滑片级变化下的稳定性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20769 2026-04-24 cs.CV 70%

Information Bottleneck-Guided Heterogeneous Graph Learning for Interpretable Neurodevelopmental Disorder Diagnosis

信息瓶颈引导的异构图学习用于可解释性神经发育障碍诊断

Yueyang Li, Lei Chen, Wenhao Dong, Shengyu Gong, Zijian Kang, Boyang Wei, Weiming Zeng, Hongjie Yan, Lingbin Bian, Zhiguo Zhang, Wai Ting Siok, Nizhuan Wang

机构 * Department of Language Science and Technology, The Hong Kong Polytechnic University(香港理工大学语言科学与技术系) Laboratory of Digital Image and Intelligent Computation, Shanghai Maritime University(上海 Maritime 大学数字图像与智能计算实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出I2B-HGNN框架,结合信息瓶颈原理指导脑连接建模与跨模态特征融合,实现高分类准确率和可解释性生物标志物识别。

Journal ref Neurocomputing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21160 2026-04-24 cs.CV 57%

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

通过几何奖励信用分配强化点-视觉-语言模型的3D理解

Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han

机构 * Northwestern Polytechnical University(西北工业大学) Southern University of Science and Technology(南方科技大学) The University of Sheffield(谢菲尔德大学) Hengqin Laboratory(横琴实验室) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出几何奖励信用分配框架,通过分离整体监督信号并定向反馈,提升点-视觉-语言模型的3D结构对齐能力,同时引入重投影一致性项约束物理可行性,从而提升3D KPA和重投影一致性评分。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03476 2026-04-24 cs.CV 57%

Anatomy-Aware Text-Visual Fusion with Dual-Perspective Prompts for Fine-Grained Lumbar Spine Segmentation

具有双视角提示的解剖感知文本-视觉融合用于细粒度腰椎分割

Sheng Lian, Jianlong Cai, Dengfeng Pan, Guang-Yong Chen, Hao Xu, Fan Zhang, Guodong Fan, Shuo Li

机构 * College of Computer and Data Science(计算机与数据科学学院) Shandong Technology and Business University(山东科技商务大学) Engineering Research Center of Big Data Intelligence (Fuzhou University)(大数据智能工程研究中心(福州大学)) The Chinese University of Hong Kong(香港中文大学) Case Western Reserve University(凯斯西储大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出ATM-Net框架,通过解剖感知文本引导的多模态融合机制,提升腰椎细粒度分割精度,实验表明其在MRSpineSeg和SPIDER数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21056 2026-04-24 physics.med-ph 50%

Radiomics-Guided Vision Transformers for Survival Analysis

基于放射组学的视觉变换器用于生存分析

Qiyuan Shi, Yi Li

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出一种结合放射组学与视觉变换器的模型,通过多模态Cox框架和对比对齐提升生存分析的预测性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 3 篇

2604.21032 2026-04-24 cs.CV 79%

Unlocking Multi-Spectral Data for Multi-Modal Models with Guided Inputs and Chain-of-Thought Reasoning

通过引导输入和推理链解锁多光谱数据以多模态模型

Dahun Kim, Ganesh Satish Mallya, Anelia Angelova

机构 * Google DeepMind(谷歌DeepMind)

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的方法,将多光谱数据引入标准RGB-only LMMs的推理流程中,提升性能。通过适应非RGB输入并注入领域特定信息和推理链推理,实现多模态模型在遥感任务中的零样本性能提升。

Comments Accepted to IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21404 2026-04-24 cs.HC cs.CY 78%

Neurodiversity and Technostress: Towards a Multimodal Research Design for Evaluating Subjective, Physiological, and Behavioral Responses

神经多样性与技术压力:一种多模态研究设计,用于评估主观、生理和行为反应

Lisa van den Heuvel, Igor Ivkić, René Riedl

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出一种多模态研究设计,系统比较神经多样性与神经典型个体在标准化数字压力条件下的反应,整合主观感知、生理激活和行为表现,推动更包容的数字工作设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19537 2026-04-24 cs.HC 78%

InvestChat: Exploring Multimodal Interaction via Natural Language, Touch, and Pen in an Investment Dashboard

InvestChat:通过自然语言、触控和笔在投资仪表板中探索多模态交互

Sarah Lykke Tost, Adson Lucas de Paiva Sales, Henrik Østergaard, Vaishali Dhanoa, Gabriela Molina León

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 InvestChat通过多模态输入提升投资探索体验,研究发现自然语言触控和笔输入能增强用户参与度,参与者在不同模态间互补使用,自然语言效果最佳。

Comments Poster accepted at AVI 2026; DOI included

详情

展开后加载摘要…

URL PDF HTML 收藏