arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-21 至 2026-07-21 共收录 135 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 27 篇

2607.17813 2026-07-21 cs.RO cs.SY eess.SY 新提交 50%

A2RL V\textsubscript{max}: The A2RL autonomous racing dataset for long-range, high-speed perception and multi-vehicle interaction

A2RL V下标max:用于远程、高速感知和多车辆交互的A2RL自动驾驶数据集

Marvin Klemp, Dominic Ebner, Cornelius Schröder, Davide Malvezzi, László Turányi, Riccardo Donati, Ilia Schminik, Xia Ning, Yanxin Zhou, Matthew Flagg, Christoph Stiller, Markus Lienkamp, Marko Bertogna, Gergely Bári, Andreas Birk, Ren Jin, Chen Lv, Johannes Betz

机构 * Institute of Measurement and Control Systems, Karlsruhe Institute of Technology(测量与控制系统研究所,卡尔斯鲁厄理工学院) Institute of Automotive Technology, Technical University of Munich(汽车技术研究所,慕尼黑工业大学) Professorship of Autonomous Vehicle Systems, Technical University of Munich(自动驾驶车辆系统教授职位,慕尼黑工业大学) University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学) Humda Lab, Széchenyi István University(胡姆达实验室,塞切尼·伊什特万大学) Politecnico di Milano(米兰理工大学) Constructor University(康斯坦丁大学) Beijing Institute of Technology(北京理工大学) Nanyang Technological University(南洋理工大学) Code 19 Racing(代码19赛车) Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich(慕尼黑机器人与机器智能研究所(MIRMI),慕尼黑工业大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 介绍A2RL V下标max开源数据集,专为高速自动驾驶和多车辆交互感知任务设计,含多样场景数据及专业标注激光雷达点云,以开发者友好格式提供,还对相关检测和跟踪方法做了实现与评估。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 13 篇

2607.16203 2026-07-21 cs.LG cs.AI cs.CL 新提交 82%

DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth

DocOCR-Eval:一种无需真实标签的基于校正的OCR工具选择框架

Zihan Xu, Puzhen Wu, Lawrence Chun Man Lau, Wei Liu, Sirui Li, Yifan Peng, Yihao Ding

专题命中 多模态Agent :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对文档解析中OCR工具选择难题,尤其是标签稀缺情况,提出无标注评估框架DocOCR-Eval。它采用三阶段校正和排序策略,通过跨多个MLLM聚合改善与基于标注排名的对齐,能在现实有限标签设置中实现可靠OCR工具选择并提供实用指导。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17143 2026-07-21 cs.DC 新提交 82%

EdgeCoInfer: Hierarchical Collaborative Inference for On-Device Multimodal Large Models

EdgeCoInfer:用于设备端多模态大模型的分层协作推理

Lin Tan, Songtao Guo, Mingyan Li, David K. Y. Yau

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)

AI总结 针对边缘环境中多模态大模型面临的挑战,提出EdgeCoInfer框架,通过模型间功能模块共享和模型内细粒度划分实现粒度自适应部署,采用混合进化分层强化学习解决问题,实验表明该框架能提高任务完成率并降低系统成本和内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11459 2026-07-21 cs.CL cs.CV 版本更新 81%

Octopus v3: Technical Report for On-device Sub-billion Multimodal AI Agent

章鱼v3:用于设备端低于十亿参数的多模态人工智能代理的技术报告

Wei Chen, Zhiyuan Li

机构 * Stanford University(斯坦福大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究针对多模态人工智能代理将图像数据转化为可行动结果的挑战,引入含功能令牌概念的多模态模型,优化至小于10亿参数,能处理中英文,可在多种边缘设备高效运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00446 2026-07-21 cs.AI 版本更新 79%

Benchmarking Agentic Newswriting via Journalistic Workflows

通过新闻工作流程对智能新闻写作进行基准测试

Yen-Che Chien, Kuang-Da Wang, Wei-Yao Wang, Wen-Chih Peng

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Sony Group Corporation(索尼集团)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 研究智能体在新闻写作工作流程中的表现,引入NEWSAGENT基准,给定写作指令和部分材料,评估智能体搜索、选信息及改草稿能力,发现其检索事实尚可,但规划和叙事整合有困难,为评估智能体能力提供现实测试平台。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07008 2026-07-21 cs.CV cs.LG 版本更新 70%

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making

不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Sanyi Zhang, Kangwei Liu, Shiming Liu, Zhangcheng Wang, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Communication University of China(中国传媒大学) Imperial College London(伦敦帝国学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17136 2026-07-21 cs.SE cs.AI cs.HC cs.LG 新提交 57%

Teach it to stop, not just to click

教它停止,而不仅仅是点击

Barada Sahu, Shivesh Pandey

机构 * Cabal AI Para AI

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究智能体计算机使用强化学习中单次运行结果的误导性,通过验证器引导修复35B智能体,发现成功率受上游方差主导,修复能力分两层,框架级修复有条件,还发现自身过度断言,发布库用于k种子报告,首次进行多模态分段聚合策略内自蒸馏更新。

Comments 15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17095 2026-07-21 cs.AI 新提交 57%

Fourier Geometric Wind Power Forecasting with Numerical Weather Prediction

基于数值天气预报的傅里叶几何风力发电预测

Shiyuan Piao, Fan Zehui, Yang Liu, Hong Cheng, Juepeng Zheng, Jie Zhou, Fugee Tsung

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Goldwind Science and Technology Co.,Ltd(金风科技股份有限公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究针对风力发电预测难题,提出多模态框架,整合SCADA数据与NWP预测。先分解输入特征,再用几何编码器和傅里叶神经算子建模,实验表明该模型优于现有基线,凸显基于物理设计的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17038 2026-07-21 cs.AI 新提交 57%

Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making

奖励驱动的大语言模型智能体工作流程:合成用于自主决策的部分可观测马尔可夫决策过程(POMDP)路由与自我修正

Amez Amanj Ali, Kuo-Kun Tseng

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究针对LLM智能体应用挑战,设计优化工作流程,合成多种AI范式,引入POMDP路由和自我修正奖励模型,整合多模态输入与强化学习原则,实验显示相比主流基线任务成功率等提升24.5%,为自主系统AI技术开发提供参考框架。

Comments 29 pages, 1 table, native TikZ/pgfplots diagrams. Code available at https://github.com/01Amez/RLAW_Implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16492 2026-07-21 cs.CV 新提交 57%

WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding

WeedExpert-R1:通过强化学习激励多模态大语言模型进行精准杂草定位的植物推理

Zonglin Yang, Wei-Zhen Liang, Nevin Lawrence, Xin Qiao, Benjamin Riggan, Chi-En Chiang, Fuchen Li

机构 * University of Nebraska-Lincoln(内布拉斯加大学林肯分校) Panhandle Research and Extension Center(狭长地带研究与推广中心)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 研究针对精准杂草控制问题,提出通过可验证奖励学习视觉基础植物推理的WeedExpert-R1模型,利用特定合成管道生成数据微调,经群体相对策略优化训练。该模型在多种杂草测试中表现优异,优于同类模型,展现开放词汇能力和跨区域部署潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04334 2026-07-21 cs.AI 版本更新 57%

Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure

图形用户界面代理相信它们的眼睛吗?诊断状态信念对像素与结构的依赖

Guijia Zhang, Yuxun Chen, Yuheng Qi, Harry Yang

机构 * Shenzhen University(深圳大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究多模态GUI代理状态信念来源,通过对310个真实探针进行单通道干预形式化视觉状态依赖并测量,核心指标是感知融合差距,发现文本状态信念依赖结构,图像精度高,错误会导致行动失败。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17527 2026-07-21 cs.HC 新提交 50%

Sidekick: Designing Communication for Effective Multitasking with Computer Use Agents

Sidekick:与计算机使用代理进行有效多任务通信的设计

Ruei-Che Chang, Wenqian Xu, Dingzeyu Li, Bryan Wang, Anhong Guo

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究针对计算机使用代理文本反馈问题,开发Sidekick原型系统,在不同交互阶段用多模态反馈传达其状态,经30人参与的研究验证其能显著提升多任务性能,有效支持进度感知等,还展示了应用前景及对人机协作的意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09540 2026-07-21 cs.IR 版本更新 50%

From Raw IDs to Semantic Planning: How Recommender Systems Utilize Information at Scale

从原始ID到语义规划:推荐系统如何大规模利用信息

Changhong Jin, Shiqiu Yang, Roger Zhe Li, Yingjie Niu, Aghiles Salah, Mete Sertkan, Zheng Ju, Xingsheng Guo, Huifeng Guo, Ruihai Dong, Barry Smyth

专题命中 多模态Agent :multimodal(abstract)

AI总结 探讨推荐系统如何利用信息,分析原始ID主导早期发展及语义信息封装于ID的原因,引入语义规划为未来方向,指出转变需在模型设计、评估及协调多方目标等方面做出改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05298 2026-07-21 cs.RO 版本更新 50%

GhostShell: Streaming LLM Function Calls for Concurrent Embodied Programming

GhostShell:用于并发实体编程的流式大语言模型函数调用

Jian Gong, Youwei Huang, Bo Yuan, Ming Zhu, Zhou Liao, Jianhang Liang, Juncheng Zhan, Jinke Wang, Hang Shu, Zihao Xu, Mingyue Xiong, Yanjun Ye, Yufan Zu, Yang Zhou, Yihan Ding, Xuannian Chen, Xingyu Lu, Runjie Ban, Bingchao Huang

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究提出GhostShell方法,利用大语言模型进行实体系统的流式和并发行为编程。通过定义函数令牌及多通道调度算法协调调用,在机器人原型上评估,该方法在任务完成率等方面表现出色,尤其在协调并发动作上优势明显。

Comments 22 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 23 篇

2603.16461 2026-07-21 cs.CV 版本更新 92%

GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models

GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知

Jiaxin Zhang, Junjun Jiang, Haijie Li, Youyu Chen, Kui Jiang, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Huawei(华为)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。

Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16260 2026-07-21 cs.LG cs.AI cs.CV 新提交 84%

AdaSurvMamba: Dynamic Fusion and Semantic Scanning for Multimodal Survival Analysis

AdaSurvMamba:用于多模态生存分析的动态融合与语义扫描

Jialong Zhong, Tingwei Liu, Baokun Yue, Jingjing Li, Yongri Piao, Miao Zhang, Leiye Liu, Jiahong Jiang, Wei Ji, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of Alberta(阿尔伯塔大学) Yale University(耶鲁大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态生存分析中传统方法的局限,提出AdaSurvMamba框架,含DSIR模块动态调制跨模态交互强度、SAS模块重组令牌成连续序列,实验证明该框架在五个TCGA队列上比现有方法有优势。

Comments MICCAI 2026 Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18920 2026-07-21 cs.IR cs.AI 版本更新 83%

SynGR: Unleashing the Potential of Cross-Modal Synergy for Generative Recommendation

SynGR:释放跨模态协同在生成推荐中的潜力

Wei Chen, Xingyu Guo, Shuang Li, Fuwei Zhang, Meng Yuan, Jing Fan, Zhao Zhang, Deqing Wang, Fuzhen Zhuang

机构 * School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院) School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出SynGR框架,通过显式鼓励生成过程中的跨模态依赖,以捕捉新兴物品语义,从而提升生成推荐性能。

Comments Accepted by ICML 2026, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17657 2026-07-21 cs.AI cs.CV cs.MM 新提交 82%

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

OrientSAM:通过方向感知空间对齐减轻多模态空间推理中以相机为中心的捷径

Wenxiao Fan, Hang Yin, Kan Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究多模态模型空间推理中以相机为中心的问题,提出OrientSAM框架,通过方向感知令牌、傅里叶角度编码及课程学习策略注入方向信息并改善推理,构建数据管道生成监督,实验证明其在多任务中表现出色,能减轻捷径行为,实现更强大的以对象为中心的空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14410 2026-07-21 cs.LG q-bio.GN 版本更新 82%

LATTICE: Graph Self-Supervised Learning for Multimodal Spatial Omics Integration

LATTICE:用于多模态空间组学整合的图自监督学习

Jagan Mohan Reddy Dwarampudi, Veena Kochat, Suresh Satpati, Hien Van Nguyen, Kunal Rai, Tania Banerjee

机构 * University of Houston(休斯顿大学) MD Anderson Cancer Center(MD安德森癌症中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究针对多模态空间组学整合下游分析常采用单模态管道的问题,提出LATTICE框架,通过构建空间邻域图并训练TransformerConv编码器,在黑色素瘤队列实验中实现多模态整合,提升相关指标,为该领域提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21693 2026-07-21 cs.AI 版本更新 81%

Deterministic Hallucination Detection in Medical VQA via Confidence-Evidence Bayesian Gain

医学VQA中通过置信度-证据贝叶斯增益实现确定性幻觉检测

Mohammad Asadi, Tahoura Nedaee, Jack W. O'Sullivan, Euan Ashley, Ehsan Adeli

机构 * Department of Electrical Engineering, Stanford University, CA, USA(电气工程系,斯坦福大学) Department of Biology, Stanford University, CA, USA(生物学系,斯坦福大学) Division of Cardiology, Department of Medicine, Stanford University, CA, USA(心脏病学部,医学系,斯坦福大学) Department of Biomedical Data Science, Stanford University, CA, USA(生物医学数据科学系,斯坦福大学) Department of Computer Science, Stanford University, CA, USA(计算机科学系,斯坦福大学) Department of Psychiatry and Behavioral Sciences, Stanford University, CA, USA(精神病学与行为科学系,斯坦福大学)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出CEBaG方法,利用模型自身log概率中的不一致置信度和弱视觉证据敏感性,实现无需随机采样和外部模型的确定性幻觉检测,在医疗MLLM和VQA基准测试中取得最佳AUC表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17351 2026-07-21 cs.AI cs.RO 新提交 79%

DeeperRadar: End-to-End MIMO Radar Design and Multi-Modal Fusion for Autonomous Vehicle Perception

深度雷达:用于自动驾驶车辆感知的端到端MIMO雷达设计与多模态融合

Eli Goldenshluger, Barak Pinkovich, Chaim Baskin

机构 * Technion–Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 深度雷达以雷达为中心,通过端到端学习稀疏采集模式,共同设计雷达传感与多模态3D检测。其可学习的MIMO设计模块在融合网络中训练,由其他传感器监督。在RADIal数据集上评估,能发现稀疏配置,降低成本与复杂性,表明最优设计取决于融合堆栈和感知任务。

Comments Accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17257 2026-07-21 cs.RO cs.AI 新提交 79%

Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion

通过延迟感知引导融合实现异步多模态扩散策略组合

Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Noematrix(无矩阵) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态扩散策略在模态差异下的融合问题,提出LAG - Fusion框架,通过延迟感知引导融合实现异步策略组合,推导参考帧重定位规则,在接触丰富操纵实验中提升了策略响应性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16366 2026-07-21 cs.RO cs.AI 新提交 79%

PRISM: Multimodal Terrain Mapping for Rover Navigation in Unstructured Environments

PRISM:非结构化环境中用于漫游车导航的多模态地形映射

Raul Castilla-Arquillo, Carlos Perez-del-Pulgar, Levin Gerdes, Alfonso Garcia-Cerezo, Miguel A. Olivares-Mendez

机构 * SnT, University of Luxembourg(卢森堡大学安全、可靠性和信任跨学科中心) Department of Automation and Systems Engineering, Universidad de Málaga, Andalucía Tech(马拉加大学自动化与系统工程系,安达卢西亚技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对非结构化环境中漫游车导航问题,提出PRISM多模态感知系统,利用定制传感器套件和OmniUnet网络,经新数据集验证及现场实验,可在资源受限设备上高效生成可通行性地图,实现漫游车自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16233 2026-07-21 cs.LG cs.AI 新提交 79%

Token-Level Cross-Modal Transformer with Contrastive Multi-Task Learning for Breast Cancer Subtype Classification and Survival Prediction

用于乳腺癌亚型分类和生存预测的具有对比多任务学习的令牌级跨模态变换器

Suxing Liu Byungwon Min

机构 * Jiangxi Arts & Ceramics Technology Institute(江西艺术陶瓷科技职业学院) Mokwon University(木浦大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.AI

AI总结 针对整合异质模态进行癌症亚型分类和生存预测的挑战,提出令牌级跨模态变换器及对比多任务学习方法,克服现有方法在模态交互、融合方式及目标优化上的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30994 2026-07-21 cs.MM 版本更新 79%

Dynamic Interaction-Aware and Causality-Disentangled Framework for Multimodal Sentiment Analysis

动态交互感知与因果解耦的多模态情感分析框架

Guangyuan Dong, Ziwei Hong, Shenghao Liu, Chenyu Wu, Yuanyuan Fang, Zihao Li, Xudong Zhang, Bingchen Liu, Yuchen Zhang, Haitao Ding, Zhenzhou Zhou, Ziyu Song

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 提出动态多模态因果解耦与自适应融合框架(MCAF),通过因果干预模块解耦语言模态的偏见,动态路由器实时评估交互状态并自适应融合,以及条件扩散去噪模块过滤噪声,在CMU-MOSI和CMU-MOSEI上取得最优分类性能。

Comments This preprint is withdrawn for unauthorized posting and incorrect author metadata.It was uploaded without full consent of all co-authors, with wrong name and affiliation information. We withdraw it to avoid copyright disputes. This corrects submission irregularities only, not academic content or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24679 2026-07-21 cs.AI eess.SP 版本更新 79%

Multi-modal cross-domain mixed fusion model with dual disentanglement for fault diagnosis under unseen working conditions

用于未知工况下故障诊断的具有双重解缠的多模态跨域混合融合模型

Pengcheng Xia, Yixiang Huang, Chengjin Qin, Chengliang Liu

机构 * State Key Laboratory of Mechanical System and Vibration(机械系统与振动国家重点实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.AI

AI总结 针对未知工况下故障诊断问题,提出具有双重解缠的多模态跨域混合融合模型,通过双重解缠框架、跨域混合融合策略和三模态融合机制,实现多模态表示学习与域泛化,实验验证该方法优于先进方法及各组件有效性。

Comments Accepted for publication in Mechanical Systems and Signal Processing

Journal ref Mechanical Systems and Signal Processing, Volume 258, 2026, 114693

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18931 2026-07-21 cs.CV 版本更新 79%

Enhancing Vision Foundation Models via Multimodal Continual Pre-Training

通过多模态持续预训练增强视觉基础模型

Yitong Chen, Lingchen Meng, Wujian Peng, Jun Tao, Chenjie Xu, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Baosight Software Co., Ltd.(上海博视软件有限公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 研究通过多模态持续预训练增强视觉基础模型,提出M-CPT框架,用持续位置嵌入处理不同分辨率视觉输入,通过特征对齐目标提升视觉与文本表示一致性,实验证明该框架能提升多模态理解性能并保持标准视觉任务表现。

Comments Code is available in https://github.com/ShareLab-SII/CoMP-MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16789 2026-07-21 cs.LG 新提交 78%

MultiLoReFT: Decoupling Shared and Modality-Specific Subspaces in Multimodal Learning via Low-Rank Representation Fine-Tuning

MultiLoReFT:通过低秩表示微调在多模态学习中解耦共享和特定模态子空间

Sana Tonekaboni, Viktoria Schuster, Caroline Uhler

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究针对多模态模型训练障碍,提出MultiLoReFT框架,通过低秩表示微调,将低秩适应扩展到多模态,学习可解释投影子空间解耦信息,能在多模态预测时揭示信息分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17033 2026-07-21 cs.LG physics.chem-ph 新提交 71%

ChemFusion: A Multimodal Cross-Attention Network for Reaction Yield Prediction

ChemFusion:用于反应产率预测的多模态交叉注意力网络

Qiwei Han, Chi Zhou

机构 * Duke University(杜克大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 研究过渡金属催化反应产率预测难题,提出ChemFusion多模态交叉注意力网络,融合电子特征与3D原子坐标,用交叉注意力机制,在交叉偶联库基准测试中性能出色,还能自主学习识别和惩罚空间位阻,提供物理可解释性。

Comments 10 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20720 2026-07-21 cs.CV cs.AI cs.RO 版本更新 62%

Li-ViP3D++: Query-Gated Deformable Camera-LiDAR Fusion for End-to-End Perception and Trajectory Prediction

Li-ViP3D++:基于查询的可变形相机-激光雷达融合用于端到端感知与轨迹预测

Matej Halinkovic, Nina Masarykova, Alexey Vinel, Marek Galinski

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Slovak University of Technology(斯洛伐克技术大学) Halmstad University(哈马比大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Li-ViP3D++通过引入查询门控可变形融合技术,实现了端到端感知与轨迹预测,提升了自动驾驶系统的鲁棒性和效率。

Comments Published in IEEE Access. The version of record is available at DOI: 10.1109/ACCESS.2026.3709080

Journal ref IEEE Access, vol. 14, pp. 102999-103012, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏