arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-14 至 2026-08-14 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 7 篇

2508.08199 2026-08-14 cs.CV 版本更新 85%

Generalizable Operating Room Expert with Multimodal Enhancement

具备多模态增强能力的可泛化手术室专家

Peiqi He, Zhenhao Zhang, Yixiang Zhang, Jiaxin Liu, Xiongjun Zhao, Shaoliang Peng

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对手术室空间建模的局限,提出仅用RGB图像推理的多模态大语言模型OR-Expert,通过内部推导空间线索实现三维推理,在手术室基准上达SOTA且泛化性良好。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05154 2026-08-14 cs.CL cs.CV 版本更新 84%

RIG-RoPE: Relation-Stratified Multimodal Attention with Instance-Local Rotary Geometry and Representation-Aware Traversal Coordinates

RIG-RoPE:具有时长感知时间坐标的关系与实例门控旋转位置编码

Donggen Li

机构 * Sichuan University(四川大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究针对多模态场景中静态多维位置分配的局限,提出RIG-RoPE机制,通过关系与实例门控及时长感知时间坐标优化位置编码,未增加可学习参数,确立了相关公式与验证路径。

Comments 24 pages, 2 figures. Major theoretical revision: reformulated cross-instance geometry, null-relation analysis, relation-stratified normalization, and representation-aware traversal coordinates; expanded related work and implementation details. Preliminary technical report; empirical validation is left to future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13385 2026-08-14 cs.CV 新提交 83%

When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL

何时仅需任务向量?隐式多模态上下文学习的经验理论

Jiaqian Li

机构 * Brown University(布朗大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出选择-实现假说,通过受控多模态任务和VQA基准研究发现,静态任务向量的成功取决于演示诱导变化的跨查询共享程度,为隐式多模态上下文学习的方法选择提供了统一经验理论。

Comments Accepted by Empirical Theory in Representation Learning @ ECCV 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12944 2026-08-14 cs.LG eess.IV stat.ML 新提交 78%

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

CardioState-JEPA:面向共享心脏表征的延迟感知跨模态学习

Hamza Shafiq, Hung Manh Pham, Bin Zhu, Pan Zhou, Jun Hu, Aaqib Saeed

机构 * Singapore Management University(新加坡管理大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 CardioState-JEPA是一种延迟感知跨模态心脏基础模型,通过对齐ECG、PPG、PCG的共享生理表征,在25项下游任务上显著提升了各模态的分类性能,实现了异质心脏信号的相互监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12852 2026-08-14 cs.CL cs.AI 新提交 62%

Falsehood and Impossibility Are Different Directions in an AI's Representation of Language

AI对语言的表征中,虚假与不可能是不同的方向

Yoon Pyo Lee

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过对Gemma 3 4B IT模型的激活分析,发现其内部能区分语言的不可能性与虚假,但将偶然虚假混同于矛盾,且不可能性表征与真值、语义异常表征方向不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13045 2026-08-14 cs.CV 新提交 57%

P2Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation

P2Fusion:基于提示的双先验蒸馏红外-可见光图像渐进融合

Yi Shi, Huichao Xie, Yuqing Wang, Mingyu Wang, Kaihui Yang, Yu Liu, Ruitao Lu, Lizhe Li, Junwei Han, Dingwen Zhang

机构 * Northwestern Polytechnical University(西北工业大学) Hefei University of Technology(合肥工业大学) Rocket Force University of Engineering(火箭军工程大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对红外-可见光图像融合的信息差异挑战,提出基于双固有提示的P2Fusion框架,结合Teach-to-Fuse机制与GDER模块,在多数据集上实现SOTA性能并提升下游感知鲁棒性。

Comments Accepted by ECCV 2026. Website: https://p2fusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03089 2026-08-14 cs.LG cs.AI 版本更新 57%

Constitutional On-Policy Safe Distillation

宪法性在策略安全蒸馏

Ming Wen, Yuxuan Liu, Kun Yang, Yunhao Feng, Zhuoer Xu, Yuhao Sun, Shiwen Cui, Xiang Zheng, Yi Liu, Xingjun Ma, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 针对在策略自蒸馏在安全对齐中因宪法条件导致教师分布收缩、表达能力下降的问题,提出宪法性在策略安全蒸馏(COPSD),通过交叉SFT冷启动校准教师分布,再进行宪法条件在策略蒸馏,在12个基准上实现了更优的安全-有用性权衡并降低安全税。

详情

展开后加载摘要…

URL PDF HTML 收藏