arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-29 至 2026-07-29 共收录 79 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 14 篇

2607.25818 2026-07-29 cs.CV 新提交 83%

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

SepPrune:一种基于分隔符的高效多模态大语言模型剪枝框架

Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

机构 * University of Science and Technology of China(中国科学技术大学) ChangXin Memory Technologies(长鑫存储技术有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对多模态大语言模型视觉令牌计算成本高的问题,提出SepPrune剪枝方法,以模态分隔符令牌为统一查询来排序和选择视觉令牌,复用内置投影参数,无需架构更改,在Qwen2.5-VL-7B上实验取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21831 2026-07-29 cs.CV 版本更新 83%

End-to-End 3-D Spatiotemporal Perception with Multimodal Fusion and V2X Collaboration

端到端3D时空感知与多模态融合及V2X协作

Zhenwei Yang, Yibo Ai, Weidong Zhang

机构 * National Center for Materials Service Safety(材料服务安全国家中心) University of Science and Technology Beijing(北京科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 XET-V2X通过多模态融合与V2X协作,实现端到端3D时空感知,提升复杂交通场景下的检测与跟踪性能。

Comments 21 pages, 10 figures

Journal ref IEEE Internet of Things Journal, vol. 13, no. 15, pp. 33456-33475, 1 Aug.1, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25820 2026-07-29 cs.CV 新提交 79%

Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion

基于大语言模型衍生成分标签和多模态融合的食品图像分割

Jui-Feng Chi, Wei-Ta Chu, Sheng-Long Lin

机构 * National Cheng Kung University(国立成功大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有食品图像分割模型在相似成分和罕见类别上表现不佳的问题,提出两个多模态模块LIM-F和LIM-Q,利用大语言模型衍生标签提升分割性能,在FoodSeg103基准测试中取得领先,且内存消耗增加适度,为细粒度食品理解提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25322 2026-07-29 cs.AI 新提交 79%

From Cellular Responses to Pharmacological Domains: Multimodal Zero-Shot Drug Representation Learning

从细胞反应到药理学领域:多模态零样本药物表示学习

Jintao Huang, Lu Leng, Ziyuan Yang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态药物发现中存在的问题,提出PMRD框架,通过分离机制因素、构建共识反应域、增强机制候选、动态加权及结合互补表示等方法,实现多模态零样本药物性质预测,提升预测效果并减少化合物间冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20993 2026-07-29 cs.LG cs.AI stat.ML 版本更新 79%

Annotation-Assisted Learning of Treatment Policies From Multimodal Electronic Health Records

借助注释的学习:从多模态电子健康记录中学习治疗策略

Henri Arno, Thomas Demeester

机构 * Department of Information Technology Ghent University - imec(信息科技系根特大学 - imec)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出AACE方法,通过专家注释辅助学习多模态EHR中的因果策略,提升治疗决策效果。

Comments Accepted at Machine Learning for Healthcare (MLHC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24747 2026-07-29 cs.CR cs.HC 新提交 78%

Multimodal User Authentication Method via Fusion of Keystroke Dynamics and Glove-Based Hand Kinematics

通过击键动力学和基于手套的手部运动学融合的多模态用户认证方法

Issei Hyakuda, Lei Jing

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对击键动力学受环境影响问题,提出融合击键动力学与手部运动学的多模态认证框架,用定制手套捕获特征,经混合架构融合,通过“未见”评估协议验证,该方法能有效提升认证准确率,融合模态增强了生物识别辨别力。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22712 2026-07-29 cs.CV cs.AI physics.optics 版本更新 73%

scMIR: a vision-language foundation model for single-cell light microscopy image representation

scMIR:用于单细胞光学显微镜图像表示的视觉语言基础模型

Yifan Shang, Jiahui Tan, Xiangxiang Zeng, Renjie Zhou

专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究针对单细胞光学显微镜图像分析难题,提出scMIR模型,通过自监督图像重建与文本引导跨模态对齐,在多图像文本对上预训练,在多种复杂任务中表现出色,优于现有方法,具备强泛化能力,能推动高通量表型分析工作流程标准化和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25669 2026-07-29 cs.AI 新提交 57%

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

OmniDelta:用于OmniLLMs中令牌压缩的技能驱动预算分配

Haoyang Huang, Wenjie Huang, Tianqi Xu, Hongyaoxing Gu, Kang Tan, Yikai Fu, Yuhao Shen, Tianyu Liu, Baolin Zhang, Jun Zhang, Xinyi Hu, Jun Dai, Shuang Ge, Lei Chen, Yue Li, Mingchen Wang, Meng Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Alibaba(阿里巴巴)

专题命中 多模态训练与对齐 :omni-modal(abstract);分类 cs.AI

AI总结 研究针对OmniLLMs长音频-视频令牌序列成本高的问题,提出技能驱动的OmniDelta框架,通过构建技能池、结合意图与内容感知分配预算,能与现有策略结合,实验证明其在多个基准上建立新的准确性-效率前沿,减少内存并加速推理。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25377 2026-07-29 cs.CV cs.GR 新提交 57%

Gaussian Volumetric Representation for Efficient Shear-Warp Visualization

用于高效剪切变形可视化的高斯体表示

Mayuri Mathur, Ojaswa Sharma

机构 * Indraprastha Institute of Information Technology Delhi(德里英迪拉甘地信息技术学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究针对医学图像可视化计算成本高的问题,提出基于高斯的体表示,用蒙特卡罗体估计和课程学习策略优化,能从稀疏监督中学习解剖细节与纹理,降低计算成本,支持高效渲染多模态医学数据集,实现高帧率和高压缩比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23297 2026-07-29 cs.CV 版本更新 57%

PRIMA: Pre-Training with Risk-Integrated Image--Metadata Alignment for Medical Diagnosis with LLM-Based Feature Aggregation

PRIMA:通过大语言模型进行风险集成图像-元数据对齐的医学诊断预训练

Yiqing Wang, Chunming He, Ziyun Yang, Maria Woodward, Ming-Chen Lu, Mercy Pawar, Leslie Niziol, Sina Farsiu

机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学眼科与视觉科学系)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出PRIMA框架,通过检索增强生成策展风险-疾病关联专家语料库优化文本编码器,用双编码器预训练策略及四个互补损失函数弥合模态差距,融合特征用于疾病分类,性能优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25339 2026-07-29 cs.IR 新提交 50%

SPARC: Sequence-aware Progressive Attribute Routing and Compression Framework for Generative Recommendation

SPARC:用于生成式推荐的序列感知渐进式属性路由与压缩框架

Chang Liu, Changfa Wu, Hui Qian, Binbin Cao, Jian Wu, Yuliang Yan, Han Zhu, Bo Zheng

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究针对生成式推荐中现有离散语义ID问题,提出SPARC框架,通过建模序列依赖、路由多表示到插槽及轻量级交互,在不增输入长度下丰富用户历史表示,实验证明其性能优于基线,改进源于上下文条件信息保留。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 8 篇

2607.25021 2026-07-29 cs.AI cs.HC cs.MA cs.SE 新提交 79%

Chart-Supported or Model-Supplied? Examining MLLM-Generated Claims for Accessible Visualization

图表支持还是模型提供?审视多模态大语言模型生成的可访问可视化声明

Ishrat Jahan Eliza, Md Dilshadur Rahman

专题命中 其他多模态 :MLLM(title);multimodal(abstract);分类 cs.AI

AI总结 研究多模态大语言模型生成可视化声明的证据基础,通过对多种来源、模型及输入条件的探索性研究,分析模型标签与数值一致性,发现可访问图表上下文有作用,添加图像及无上下文提示效果不佳,推动可区分证据支持声明与模型解释的描述系统发展。

Comments Submitted to the 3rd Workshop on Accessible Data Visualization, IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25324 2026-07-29 cs.CV cs.AI 新提交 62%

Balanced Soft mixture-of-expert model for Glaucoma Detection

用于青光眼检测的平衡软专家混合模型

Sai Venkatesh Chilukoti, Krishna Rauniyar, Min Shi, Xiali Hei

机构 * University of Louisiana at Lafayette(路易斯安那大学拉斐特分校) School of Computing and Informatics(计算与信息学院)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对青光眼检测,提出含三个专家及负载平衡损失的平衡软专家混合模型,解决多模态学习问题,其性能通过AUC衡量,超越多种基线和模型,还可推广至其他疾病检测。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13454 2026-07-29 cs.CV cs.AI 版本更新 62%

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24806 2026-07-29 q-bio.NC cs.AI 新提交 57%

Decoding Error-Related Potentials under Multisensory Feedback with Varying Congruency

在具有不同一致性的多感官反馈下解码错误相关电位

Yixin Liu, Kang Yin, Hye-Bin Shin, Seong-Whan Lee

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究在多模态视觉、听觉和触觉反馈及可控感官一致性下的ErrP解码挑战,采用基于多分支EEGNet的架构及辅助监督学习策略,经迷宫观察任务实验,该方法在异质感官条件下分类性能一致且准确度提高,提升了ErrP解码稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25792 2026-07-29 cs.NI 新提交 50%

The Model in the Middle: Toward AI-Native Real-Time Communication

中间的模型:迈向人工智能原生实时通信

Ziqian Liu, Minghao Li, Yiming Qiu

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究迈向人工智能原生实时通信,提出将模型视为有状态计算中间盒的新观点,探索网络感知推理调度等三个跨阶段协调机会,构建Conflux验证,结果显示在网络退化时响应延迟等有改善,呼吁建立相关实时通信堆栈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25312 2026-07-29 cs.LG 新提交 50%

Guiding Posterior Exploration with Optimizer-Derived Geometry

用优化器派生几何引导后验探索

Moritz Schlager, Emanuel Sommer, Thomas Möllenhoff, David Rügamer

机构 * TUM(慕尼黑工业大学) LMU Munich(慕尼黑大学) RIKEN AIP(理化学研究所先进智能项目中心)

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究贝叶斯神经网络不确定性量化中高维多峰后验分布探索的计算成本问题,提出基于优化器派生几何的预处理采样策略,可减少采样预热阶段,提升性能与稳定性,且无额外计算成本,经多数据集和架构验证。

Comments Accepted for presentation at the OPTIMAL Workshop at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16123 2026-07-29 cs.RO 版本更新 50%

BayesContact: Uncertain Pose Estimation via Visuo-Tactile Proposals and Simulation-based Inference

BayesContact:通过视觉触觉提议和基于模拟的推理进行不确定姿态估计

Aditya Kamireddypalli, Matias Mattamala, Joao Moura, Russell Buchanan, Sethu Vijayakumar, Subramanian Ramamoorthy

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Department of Mechanical and Mechatronics Engineering, University of Waterloo(滑铁卢大学机械与机电工程系)

专题命中 其他多模态 :multimodal(abstract)

AI总结 针对富含接触操作中姿态估计难题,提出BayesContact框架,通过融合视觉与触觉信息及基于模拟的推理来维护物体姿态信念,经模拟预测与真实观测对比更新信念,提升了姿态可观测性与插入成功率。

Comments Update funding sources

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00433 2026-07-29 cond-mat.mtrl-sci 版本更新 50%

In situ Gas-Cell Electron Microscopy Reveals Pressure-Selected Restructuring Pathways in AuRu Ammonia Catalysts

反应条件下的氨催化剂演变揭示于环境和多模式电子显微镜

Amy S. McKeown-Green, Parivash Moradifar, Zisheng Zhang, Cedric Lim, Andrew Barnum, Lin Yuan, Robert Sinclair, Frank Abild-Pedersen, Colin Ophus, Jennifer A. Dionne

专题命中 其他多模态 :multimodal(abstract)

AI总结 通过环境和多模式电子显微镜研究,揭示了AuRu催化剂在反应条件下的结构演变机制,揭示了氢驱动的纳米空洞形成及压力对重构的影响。

Comments First two authors contributed equally to this work. First two and final author are corresponding authors. This work was conducted at Stanford University

详情

展开后加载摘要…

URL PDF HTML 收藏