arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 184 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 184 篇

2607.03229 2026-07-07 cs.DC 新提交 88%

HyperParallel-Mpipe: A Composable Algebra System for Optimizing MLLM Training over Supernode Clusters

HyperParallel-Mpipe:用于在超级节点集群上优化多模态大语言模型训练的可组合代数系统

Chong Li, Zhengdao Yu, Nelson Lossing, Thibaut Tachon, Pierre Leca, Etienne Filhol, Yujie Yuan, Chong Bao, Teng Su

专题命中 其他多模态 :MLLM(title,summary_cn);multimodal(abstract)

AI总结 分析多模态大语言模型(MLLM)训练痛点,引入Mpipe,用调度代数从紧凑调度规范推导运行时行为,得出多模态感知异构并行调度transpose,在Ascend 910C NPU集群上加速显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02020 2026-07-03 cs.AI 新提交 85%

Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails

持续多模态学习中的隐藏遗忘:当准确率幸存但基础失效时

Qianyu Chen, Canran Xiao, Runxuan Tang

机构 * Nanyang Technological University(南洋理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对持续多模态学习中模型答案准确但证据使用方式改变的问题,提出无重放依赖约束框架RCL,通过冻结旧模型、反事实干预估计证据依赖并联合优化,有效降低隐藏遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12724 2026-08-14 cs.LG 新提交 85%

MAG: MAnifold Guided Semi-Supervised Multi-modal In-Context Learning

MAG:流形引导的半监督多模态上下文学习

Zirui Cheng, Xun Xu, Tiankai Chen, Fady Rezk, Bowen Zheng, Xiaodong Shi, Shijie Li, Kangkang Lu, Bharadwaj Veeravalli, Nancy F. Chen

专题命中 其他多模态 :multi-modal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本研究提出MAG框架,通过将未标记多模态数据用于半监督传播的演示选择,提升多模态大语言模型的上下文学习性能,在8个基准的标签稀缺场景下优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06938 2026-08-10 cs.CV cs.AI 新提交 84%

Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

文本中的去偏:相信你的视觉:面向视觉反常识推理的文本锚定跨模态迁移

Chen Ling, Hanqian Li, Dongnan Liu, Keyu Qian, Jungang Li, Xinglong liu, Shiyi Wang, Xin Dong, Pengcheng Zhu, Wei Zhou, Linjian Mo, Nai Ding

机构 * Ant Group(蚂蚁集团)

专题命中 其他多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型视觉反常识推理中语言先验干扰问题,提出文本锚定数据构建流程及后训练框架 TACT,实现无需视觉数据的跨模态去偏,提升模型视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27790 2026-07-31 cs.CL cs.AI 新提交 84%

Semantic-Aligned Structural Abstraction for Multimodal Sentiment Analysis

面向多模态情感分析的语义对齐结构抽象

Wei Chen, Junkai Li, Tongguan Wang, Hui Liu, Feiyue Xue, Chuanxiang Ma, Ying Sha

机构 * Huazhong Agricultural University(华中农业大学) Hubei University(湖北大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有多模态情感分析方法无法建模情感语义的局限,提出SentiLLM框架,通过双流显著性-上下文校准机制实现语义对齐结构抽象,在四个数据集上取得优异性能。

Comments Accepted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31825 2026-07-01 cs.CV cs.AI 新提交 84%

Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning

打破失败级联:面向医学多模态推理的步骤感知强化学习

Junha Jung, Minbyul Jeong, Suhyeon Lim, Sungwook Jung, Jaehoon Yun, Taeyun Roh, Mujeen Sung, Jaewoo Kang

机构 * Korea University(高丽大学) Upstage AI Kyung Hee University(庆熙大学) KAIST(韩国科学技术院) Hanyang University College of Medicine(汉阳大学医学院) AIGEN Sciences

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出步骤感知强化学习算法MRPO,通过为早期错误推理步骤分配指数级惩罚,打破失败级联,显著提升医学视觉问答准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19371 2026-06-19 cs.LG cs.AI cs.CV 新提交 84%

ProMUSE: Progressive Multi-modal Uncertainty-guided Staged Evidential Alzheimer Disease Classification

ProMUSE: 渐进式多模态不确定性引导的分阶段证据阿尔茨海默病分类

Long Doan, Branden Chen, Ethan Litton, Huan Huang, Jiajing Huang, Yixin Xie, Weihua Zhou, Nandakumar Narayanan, Chen Zhao

机构 * Kennesaw State University(肯尼索州立大学) Michigan Technological University(密歇根理工大学) University of Iowa(爱荷华大学)

专题命中 其他多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出ProMUSE,一种渐进式多模态不确定性引导的分阶段证据网络,通过自适应决定何时需要额外模态,在保持准确性的同时降低数据采集成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10240 2026-08-12 cs.IR cs.LG cs.MM 新提交 83%

Sequential Modality Dropout for Robust Multi-Modal Sequential Recommendation

用于鲁棒多模态序列推荐的序列模态丢弃(Sequential Modality Dropout, SMD)

Guanqun Yang, Wenlong Zhang

专题命中 其他多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出序列模态丢弃(SMD),通过训练时随机擦除模态流提升多模态序列推荐器的鲁棒性,在四个骨干网络和亚马逊数据集上显著提升了缺失模态下的推荐准确率,且几乎不损失完整模态性能。

Comments Accepted at CIKM 2026. Code: https://github.com/guanqun-yang/SMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01922 2026-08-04 cs.CL 新提交 83%

TRAM: Enhancing Multimodal Reasoning with Trajectory-Derived Auxiliary Memory

TRAM:利用轨迹衍生辅助记忆增强多模态推理

Kang Liu, Zijing Wang, Yongkang Liu, Mengjie Zhao, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 TRAM是一种无需训练的多模态推理增强方法,通过轨迹衍生辅助记忆整合推理信息,在4种MLRM变体的8个基准测试中提升了多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15713 2026-07-20 eess.SP cs.AI cs.LG 新提交 83%

Map as a Prompt: Learning Multi-Modal Spatial-Signal Foundation Models for Cross-scenario Wireless Localization

地图作为提示:学习用于跨场景无线定位的多模态空间信号基础模型

Yong Chu, Xun Zhou, Zenglin Xu, Hui Wang, Yue Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shanghai Academy of AI for Science(上海人工智能科学研究院) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院)

专题命中 其他多模态 :multi-modal(title);multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 针对无线定位在不同环境中面临的挑战及现有方法的局限,提出多模态基础模型SigMap,通过循环自适应掩码策略和“地图即提示”框架学习无线表示并实现跨场景适应,实验证明其性能领先且零样本泛化能力强。

Comments 17pages, 9 figures, poster in International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03184 2026-07-07 cs.CV 新提交 83%

BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception

BVS:用于细粒度感知的基于多模态大语言模型的贝叶斯视觉搜索

Geng Li, Yuxin Peng

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在超高分辨率图像细粒度感知的难题,提出BVS框架,将感知设为连续空间尺度流形上的全局优化问题,通过先验引导与后验校正提升性能。

Comments Accepted by ICML 2026. Project page with code: https://github.com/PKU-ICST-MIPL/BVS_ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17118 2026-06-17 cs.LG cs.AI 新提交 83%

MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化

Yuanteng Chen, Peisong Wang, Zhilei Liu, Nanxin Zeng, Yuantian Shao, Shiqiang Lang, Tao Liu, Chuangyi Li, Qinghao Hu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对MoE多模态大语言模型在专家重要性估计中存在的跨模态和视觉内偏差,提出模态分解的专家级混合精度量化框架MODE,通过分解选择频率、过滤冗余视觉令牌并评估模态敏感性,在给定预算下分配比特宽度,在W3A16下平均性能损失控制在2.9%以内。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08464 2026-06-09 cs.CV 新提交 83%

TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

TVI-CoT: 面向多模态理解的文本-视觉交错思维链推理

Lianyu Hu, Xiaoyu Ma, Zeqin Liao, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 提出TVI-CoT框架,通过可学习控制令牌实现文本推理与视觉特征访问的动态交错,解决多模态LLM在推理过程中无法访问视觉特征的问题,在多个基准上取得最优结果。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27938 2026-07-31 cs.HC 新提交 82%

VizPilot: Automated Onboarding for SVG-based Composite Visualizations using Multimodal LLMs

VizPilot:基于多模态大语言模型的SVG复合可视化自动引导系统

Nishaanthini Gnanavel, Yong Wang

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 VizPilot是基于多模态大语言模型的SVG复合可视化自动引导工具,通过双模块实现自动生成交互式引导,经评估可降低创作工作量并减轻用户认知负荷,提升复合可视化可用性。

Comments Accepted by IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22565 2026-06-23 cs.CL cs.AI cs.CV 新提交 82%

Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

轻看,重思:多模态思维链推理能做什么和不能做什么

Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文系统探究多模态思维链推理在12个感知与推理任务上的表现,发现CoT对感知任务有副作用,但对数学、科学等多图像推理有效,且现有开源多模态推理模型提升有限,视觉推理仍是瓶颈。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09301 2026-06-09 cs.LG 新提交 82%

PRISM: Topology-Aware Cross-Modal Imputation for Modality-Deficient Federated Graph Learning

PRISM: 面向模态缺失联邦图学习的拓扑感知跨模态插补

Zekai Chen, Miao Zhang, Jiayang Xing, Xunkai Li, Xun Wu, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 其他多模态 :cross-modal(title,abstract);multimodal(abstract)

AI总结 针对联邦图学习中客户端级模态缺失问题,提出拓扑感知跨模态插补框架PRISM,通过联邦检索缺失模态语义并利用拓扑控制注入局部图传播,在六个多模态图数据集上平均提升4.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10154 2026-08-12 cs.CL cs.AI 新提交 81%

Multimodal Item Parameter Estimation using Simulated Response Probabilitie

基于模拟响应概率的多模态题目参数估计

Christopher Ormerod, YoungKoung Kim

机构 * College Board(大学理事会)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究基于Qwen3.5微调多模态大语言模型,利用含图像与文本的多项选择题训练语料,通过学习学生能力相关的选择概率,实现了题目参数的准确估计。

Comments Submitted and Accepted for AIME-Con 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04348 2026-08-06 cs.CV cs.AI cs.LG stat.ML 新提交 81%

iStructTab: Structured Feature Sequencing for Multimodal Learning of Image and Tabular Data

iStructTab:面向图像与表格数据多模态学习的结构化特征排序

Al Zadid Sultan Bin Habib, Md Younus Ahamed, Prashnna Gyawali, Gianfranco Doretto, Donald A. Adjeroh

机构 * West Virginia University(西弗吉尼亚大学) The University of Utah(犹他大学) Scientific Computing and Imaging Institute(科学计算与成像研究所)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 iStructTab基于图增强描述子排序算法(GEDS),将其融入感知顺序的高效Transformer框架,在多模态基准上有效减少特征分散,提升了图像与表格数据多模态学习的预测性能及鲁棒性。

Comments This paper has been accepted for presentation at the 28th International Conference on Pattern Recognition (ICPR 2026) in Lyon, France Code: https://github.com/zadid6pretam/iStructTab PyPI: pip install istructtab

Journal ref International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11621 2026-07-14 cs.AI cs.CL cs.LG 新提交 81%

Lesioned Multimodal Language Models Reproduce Aphasic Picture-Naming Patterns

受损多模态语言模型再现失语症患者的图片命名模式

Yong Yang, Xiang Guan, Sophie Arheix-Parras, Saeed Ahmadi, Roger Newman-Norlund, Leonardo Bonilha, Christopher Rorden, Julius Fridriksson, Rutvik H. Desai, Srihari Nelakuditi

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究未针对临床模拟设计的通用语言模型能否再现失语症患者图片命名错误模式,通过对多模态语言模型进行扰动配置,建立定量框架再现个体失语症错误模式,表明语言模型或可成为中风后失语症患者数字替身。

Comments 15 pages, 8 figures; supplementary materials (18 pages, 6 sections) included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05798 2026-07-08 cs.CV cs.AI 新提交 81%

Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning

回答前分割:用于多模态大语言模型视觉推理的像素定位

Yake Wei, Yuan Wang, Fengyun Rao, Jing Lyu, Di Hu

专题命中 其他多模态 :MLLM(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文针对多模态大语言模型视觉推理,提出SegAnswer方法,将放大单元从边界框转为像素级分割掩码,能精准定位感兴趣区域,过滤冗余信息,与视觉令牌构建方式更契合,经多基准测试验证了其在像素定位及分割任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07759 2026-08-11 eess.SP cs.AI 新提交 79%

CFD-Guided Detection of Concept Drift in Multimodal Physiologic Signals

CFD引导的多模态生理信号概念漂移检测

Farouk Ganiyu Adewumi, Timothy Oladunni, Rochak Ghimire, Kosisochukwu Ogbuanya, Sanaa Reeves, Sandy Akoy

专题命中 其他多模态 :multimodal(title);cross-modal(abstract);分类 cs.AI

AI总结 本研究提出PECS生理稳定性框架,将模型内部变化与信号可测量变化对比,在多生理信号数据集上验证其性能优于基线,可用于可穿戴心血管AI的概念漂移监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28652 2026-08-03 q-bio.OT cs.AI stat.AP 新提交 79%

HenTwin: A Multimodal Digital Twin Framework for Longitudinal Biological State Monitoring in Laying Hens

HenTwin:用于蛋鸡纵向生物状态监测的多模态数字孪生框架

Yashan Dhaliwal, Shreya Rao, Suresh Neethirajan

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究提出HenTwin多模态数字孪生框架,通过五层物联网架构整合多模态数据构建蛋鸡生物状态模型,验证了其稳定性与跨房间适用性,为精准畜牧养殖提供了状态感知的数字孪生解决方案。

Comments 24 pages, 18 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27286 2026-07-31 eess.IV cs.CV 新提交 79%

Toward Multi-Modal Deep Learning for Pulmonary Disease Classification: A Texture-Based Machine Learning Pilot Study on Public Chest X-Ray Data

面向肺部疾病分类的多模态深度学习:基于公开胸部X线数据的纹理机器学习试点研究

Yogisri Pujitha Chinthoti

专题命中 其他多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本研究通过公开胸部X线数据开展试点,用HOG、GLCM等特征结合经典分类器区分COVID-19与其他肺炎,为未来多模态深度学习架构研究提供方向。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26909 2026-07-30 cs.CL 新提交 79%

Dual-Path LLM Reasoning for Multimodal Few-Shot Knowledge Graph Completion

用于多模态少样本知识图谱补全的双路径大语言模型推理

Jinlan Liu, Zhiying Tu, Yongchao Xing, Yicheng Liu, Bolin Zhang, Dianbo Sui, Dianhui Chu, Hongliang Sun

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究针对多模态少样本知识图谱补全难题,提出双路径大语言模型推理框架DuPLeR,结合多模态LLM先验与事实支撑构建校准关系图,经实验验证其在数据稀缺场景下性能稳健。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25021 2026-07-29 cs.AI cs.HC cs.MA cs.SE 新提交 79%

Chart-Supported or Model-Supplied? Examining MLLM-Generated Claims for Accessible Visualization

图表支持还是模型提供?审视多模态大语言模型生成的可访问可视化声明

Ishrat Jahan Eliza, Md Dilshadur Rahman

专题命中 其他多模态 :MLLM(title);multimodal(abstract);分类 cs.AI

AI总结 研究多模态大语言模型生成可视化声明的证据基础,通过对多种来源、模型及输入条件的探索性研究,分析模型标签与数值一致性,发现可访问图表上下文有作用,添加图像及无上下文提示效果不佳,推动可区分证据支持声明与模型解释的描述系统发展。

Comments Submitted to the 3rd Workshop on Accessible Data Visualization, IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24539 2026-07-28 cs.AI cs.SY eess.SY 新提交 79%

Task-Conditional Faithfulness Auditing of Multimodal LLMs for Grid Diagnosis

用于电网诊断的多模态大语言模型的任务条件忠实性审计

Tianqiao Zhao, Meng Yue, Jianhui Wang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) Brookhaven National Laboratory(布鲁克海文国家实验室) Southern Methodist University(南卫理公会大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型用于电网诊断时答案准确性与证据使用的问题,提出通用框架进行任务条件忠实性审计,通过比较多种依赖并设计校正和重新审计机制,经案例研究验证了框架检测、诊断及纠正相关失败的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23700 2026-07-28 cs.AI 新提交 79%

Offline-Online Curriculum RL for Multimodal Reasoning

用于多模态推理的离线-在线课程强化学习

Wendi Deng, Hang Du, Guoshun Nan, Haokun Tian, Jiaqi Yu, Xinlei Cao, Jaile Li, Jingfeng Chen, Ling Deng, Ting Li, Hao Yang, Jun Liu, Xudong Jiang, Sicong Leng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) BUPT Shenzhen Institute(北京邮电大学深圳研究院) Carnegie Mellon University(卡内基梅隆大学) Lancaster University(兰卡斯特大学) Nanyang Technological University(南洋理工大学) China Telecom Corporation Limited Sichuan Branch(中国电信股份有限公司四川分公司) Changsha University of Science & Technology(长沙理工大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究多模态推理中模型中间步骤有缺陷的问题,提出$O^2$-CritiCuRL框架,通过离线多步展开分析和在线渐进式强化学习策略,区分关键与冗余步骤,提升模型性能及训练和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21085 2026-07-24 cs.CV 新提交 79%

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

Geo3R:减轻多模态大语言模型中的空间推理幻觉

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Tong Jia, Ying Li

机构 * Peking University(北京大学) Joy Future Academy(京东探索研究院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 多模态大语言模型推理空间关系易产生幻觉,现有方法效果有限。本文定义空间推理幻觉及常见场景,提出无训练的Geo3R框架,结合几何证据和结构化3D推理减轻幻觉,实验证明该框架显著减少幻觉,优于现有模型和方法。

Comments Accepted by ACM MM 2026. This is the arXiv preprint version, not the camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18153 2026-07-21 cs.CV 新提交 79%

Robust Multimodal Dynamic Object Segmentation

鲁棒多模态动态目标分割

Zhe Xin, Hanzhi Chang, Penghui Huang, Yinian Mao, Guoquan Huang

机构 * Meituan UAV(美团无人机) University of Delaware(特拉华大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对动态目标分割难题,提出整合多模态线索的框架,设计结合Transformer与特征聚类模块的网络进行分类,引入新后处理方法,在动态目标分割和静态场景重建任务中取得最优性能。

Comments Accepted by IEEE International Conference on Robotics & Automation ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17262 2026-07-21 cs.CL 新提交 79%

Should Missing Modalities Always Be Necessary to Repair for Multi-modal Sentiment Analysis?

多模态情感分析中缺失模态总是需要修复吗?

Yubo Gao, Haotian Wu, Xiaoyu Xu, Yibo Yan, Hong Chen, Ruoshui Peng, Fei Pan, Puay Siew Tan, Zhuoran Gao, Yonghua Hei, Jie Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学) Singapore Institute of Manufacturing Technology, A*STAR(新加坡制造技术研究所,新加坡科技研究局) Lingnan University(岭南大学)

专题命中 其他多模态 :multi-modal(title);multimodal(abstract);分类 cs.CL

AI总结 研究多模态情感分析中缺失模态是否总需修复,提出SIEVE方法,通过比较直接预测与修复分支,从样本损失差距得经验充分性信号,经证据门路由输入,与修复无关,实验证明其能改进修复主干并接近最优值。

详情

展开后加载摘要…

URL PDF HTML 收藏