arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-22 至 2026-07-22 共收录 22 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2509.25699 2026-07-22 cs.CV 版本更新 79%

AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning

AIM-CoT:基于主动信息的多模态链式推理用于视觉-语言推理

Xiping Li, Jianghong Ma

机构 * The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 图文多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 本文提出AIM-CoT框架,通过上下文增强注意力图生成、主动视觉探测和动态注意力转移触发,改进视觉语言模型的证据选择与插入触发,提升视觉-语言推理性能。

Comments Accepted by ACL 2026 Main Conference. 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15875 2026-07-22 cs.RO cs.AI 版本更新 77%

Fly0: Persistent Metric Anchoring for Zero-Shot Aerial Vision-Language Navigation

Fly0: 解耦语义定位与几何规划以实现零样本空中导航

Zhenxing Xu, Yihong Lu, Weidong Bao, Zhengqiu Zhu, Jingxuan Zhou, Zhichuang Wang, Ji Wang, Lihua Liu, Wei He

机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) National University of Defense Technology(国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) Information Support Force Engineering University(信息支援力量工程大学)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 Fly0通过解耦语义推理与几何规划,实现零样本空中导航,提升导航成功率和减少导航误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01848 2026-07-22 cs.CV 版本更新 57%

Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance

语义丰富性还是几何推理?VLM视觉不变性的脆弱性

Jason Qiu, Zachary Meurer, Xavier Thomas, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究揭示VLM在基本几何变换下的脆弱性,指出其在空间不变性与等变性上的不足,影响物体识别的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2512.04692 2026-07-22 cs.HC 版本更新 50%

Interactive Communication -- cross-disciplinary perspectives from psychology, acoustics, and technology

交互式通信——来自心理学、声学和技术的跨学科视角

Mareike Daeglau, Stephan Getzmann, Moritz Bender, Janina Fels, Rainer Martin, Alexander Raake, Isabel S. Schiller, Sabine J. Schlittmeier, Katrin Schoenenberg, Felix Stärz, Leon O. H. Kroczek

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文从跨学科视角介绍交互式通信,整合心理机制与多方面限制,概述理论框架、总结关键方法,讨论辅助听力技术等应用及伦理考量,强调人类能力与技术系统共同塑造交互式通信,整合相关研究要点。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2607.18217 2026-07-22 cs.CV 版本更新 89%

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement

HOMIE:通过多模态智能增强实现以人为对象的视频个性化

Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV

AI总结 研究以人为对象的视频个性化问题,提出HOMIE框架,统一处理主体间和主体内输入设置。通过更好的MLLM集成策略、自注意力中的全局多模态引导及模态参考嵌入,在多任务中达最优性能。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14702 2026-07-22 cs.CV cs.AI 版本更新 81%

Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach

第十一届ABAW竞赛中的团队RAS:多模态矛盾情绪识别方法

Elena Ryumina, Maxim Markitantov, Alexandr Axyonov, Fedor Shchetinin, Timur Abdulkadirov, Dmitry Ryumin, Alexey Karpov

机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences (SPC RAS)(俄罗斯科学院圣彼得堡联邦研究中心) HSE University(圣彼得堡高等经济学院) ITMO University(圣彼得堡国立信息技术机械与光学大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对第十一届ABAW竞赛的视频级矛盾情绪和犹豫情绪识别,提出以文本为中心的多模态方法,用文本残差融合模型结合多种特征,实验表明该方法能有效提高识别性能,无需大型模型集成。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08716 2026-07-22 cs.CV 版本更新 79%

Great X: A Unified Multi-Modal Simulator Bridging the Sim2Real Gap for 6G

Great X:一种统一的多模态模拟器,弥合6G的模拟与现实差距

Yuan Gao, Kongwu Huang, Jun Jiang, Shiyi Mu, Shugong Xu

机构 * Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 针对6G无线研究中多模态数据集收集难题及现有模拟器不足,提出在虚幻引擎实现统一单引擎模拟器Great-X,集成光线追踪等技术,构建含大量同步样本的Great-MCD,实验显示其性能优于现有模拟器及测量数据基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13715 2026-07-22 cs.CV 版本更新 57%

MVGD-Net: A Novel Motion-aware Video Glass Surface Detection Method

MVGD-Net: 一种新颖的运动感知视频玻璃表面检测网络

Yiwei Lu, Hao Huang, Tao Yan

机构 * Tao Yan(谭燕)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MVGD-Net通过利用视频中运动不一致特性,提出新颖网络检测玻璃表面,结合多模块融合与大规模数据集提升检测性能。

Comments This paper has been accepted by the 40th AAAI Conference on Artificial Intelligence (AAAI-26). It contians 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15579 2026-07-22 cs.RO cs.HC 版本更新 50%

PACE: Persona Adaptation through Conversational Elicitation in Human-Robot Interaction

PACE:通过人机交互中的对话启发实现角色适应

Peizhen Li, Longbing Cao, Megani Rajendran, Timothy Liu, Aik Beng Ng, Simon See

机构 * Macquarie University(麦考瑞大学) NVIDIA(英伟达)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究如何让类人机器人有可适应角色,提出PACE框架,通过用户问答动态生成角色,经提高结构化提示,经系统集成转化为行为,实证评估显示其对人机交互多方面有积极影响,为部署个性化等身份开辟途径。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态生成 2 篇

2607.12982 2026-07-22 cs.AI cs.MA cs.SC 版本更新 79%

FormalAnalyticGeo: A Neural-Symbolic Based Framework for Multimodal Analytic Geometry Problem Generation

形式分析几何:一种基于神经符号的多模态解析几何问题生成框架

Ruoran Xu, Wending Gao, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 研究解析几何问题生成,提出基于神经符号的FormalAnalyticGeo框架,利用CDL及四个大语言模型组件,无需人工注释自动生成问题,形成闭环,生成的AnalyticGeo7K数据集问题误差小,框架和数据集将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20651 2026-07-22 cs.CV 版本更新 57%

RubricRL: Simple Generalizable Rewards for Text-to-Image Generation

RubricRL:文本到图像生成的简单通用奖励

Xuelu Feng, Yunsheng Li, Ziyu Wan, Zixuan Gao, Junsong Yuan, Dongdong Chen, Chunming Qiao

机构 * University at Buffalo(布法罗大学) Microsoft CoreAI(微软核心人工智能)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出RubricRL框架,通过为每个提示动态构建可分解的检查表(如对象正确性、属性准确性等),并由多模态评判器独立评估,实现可解释、可组合的奖励设计,提升文本到图像生成的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态评测 4 篇

2607.15176 2026-07-22 cs.AI cs.CL cs.HC 版本更新 84%

Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy

用于科学可视化素养的多模态大语言模型基准测试

Patrick Phuoc Do, Chau M. Ta, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 研究对六个多模态大语言模型进行科学可视化素养基准测试,涵盖多种技术和任务类型。通过封闭世界协议评估闭源和开源模型,与人类参与者数据对比。发现模型表现不均,Gemini最强,开源模型低于人类基线,明确SciVis素养对评估多模态AI系统的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13024 2026-07-22 cs.CL 版本更新 57%

Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses

眼泪还是欢呼?通过文化诱发的差异情感反应基准测试LLMs

Chongyuan Dai, Yaling Shen, Zihan Gao, Jia Li, Yishun Jiang, Yaxiong Wang, Liu Liu, Zongyuan Ge, Jinpeng Hu

机构 * Hefei University of Technology(合肥工业大学) Monash University(墨尔本大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出CEDAR基准,通过文化诱发的差异情感反应评估LLMs,揭示语言一致性和文化契合度之间的脱节,展示文化根植的情感理解仍是模型的重大挑战。

Comments ACL 2026 SAC Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16727 2026-07-22 cs.CV cs.LG 版本更新 57%

Pain in 3D: Generating Controllable Synthetic Faces for Automated Pain Assessment

3D 中的疼痛:生成用于自动疼痛评估的可控合成面部

Xin Lei Lin, Soroush Mehraban, Abhishek Moturu, Babak Taati

机构 * Vector Institute(向量研究所) KITE Research Institute(KITE研究机构) University Health Network(大学健康网络) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Medical Imaging, University of Toronto(多伦多大学医学成像系) Institute of Biomedical Engineering, University of Toronto(多伦多大学生物医学工程研究所)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对面部表情自动疼痛评估面临的数据稀缺等问题,提出3DPain数据集及三阶段框架合成多视图面部,还引入ViTPain框架,为可推广的自动疼痛评估建立了可控、多样且基于临床的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11899 2026-07-22 cs.CV 版本更新 57%

Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models

阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准

Futa Waseda, Shojiro Yamabe, Daiki Shiono, Kento Sasaki, Tsubasa Takahashi

机构 * Turing Inc.(Turing公司) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) Tohoku University(东北大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。

Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态Agent 3 篇

2605.13632 2026-07-22 cs.RO cs.CV 版本更新 57%

Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models

引导、思考、行动:面向视觉-语言-动作模型的交互式具身推理

Yiran Ling, Qing Lian, Jinghang Li, Qing Jiang, Tianming Zhang, Xiaoke Jiang, Chuanxiu Liu, Jie Liu, Lei Zhang

机构 * Futian Laboratory(福田实验室) Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) School of Robotics, Hunan University(湖南大学机器人学院) South China University of Technology(华南理工大学) Visincept(Visincept公司) National Key Laboratory of Smart Farm Technologies and Systems(智能农业技术与系统国家重点实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出GTA-VLA框架,通过允许用户用显式视觉提示引导机器人策略,实现空间可调节的具身推理。该框架整合了外部指导与内部任务规划,提升了在视觉歧义和错误恢复中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14079 2026-07-22 cs.AI 版本更新 57%

FormGym: Doing Paperwork with Agents

FormGym:用智能体完成文书工作

Matthew Toles, Rattandeep Singh, Isaac Song, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 FormGym提出一个表格填写基准测试,通过FieldFinder工具提升智能体在表格定位和填写任务中的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17049 2026-07-22 cs.SE cs.RO 版本更新 50%

Evaluating Uncertainty and Quality of Visual Language Action-enabled Robots

评估具有视觉语言动作能力的机器人的不确定性和质量

Pablo Valle, Chengjie Lu, Shaukat Ali, Aitor Arrieta

机构 * Mondragon University(蒙dragon大学) Simula Research Laboratory(Simula研究实验室)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 研究针对具有视觉语言动作能力的机器人,采用八个不确定性指标和五个质量指标,通过大规模实证研究评估其有效性,发现部分指标与人类评估有相关性且能区分任务执行质量,挑战了仅依赖成功率的评估做法。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态训练与对齐 3 篇

2602.06409 2026-07-22 cs.CR 版本更新 88%

VENOMREC: Cross-Modal Interactive Poisoning for Targeted Promotion in Multimodal LLM Recommender Systems

VENOMREC: 多模态交互性污染用于多模态大语言模型推荐系统中的定向推广

Guowei Guan, Yurong Hao, Jiaming Zhang, Tiantong Wu, Fuyao Zhang, Tianxiang Chen, Longtao Huang, Cyril Leung, Wei Yang Bryan Lim

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract)

AI总结 VENOMREC通过跨模态交互性污染技术,在多模态大语言模型推荐系统中实现定向推广,有效提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04733 2026-07-22 cs.CL cs.LG 版本更新 79%

LP-SFT: Local-Preserving Supervised Fine-Tuning via Multimodal Entropy Structure

LP-SFT:通过多模态熵结构进行局部保持监督微调

Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 研究监督微调中存在的问题,利用香农和雷尼熵分析揭示预训练模型的多模态熵结构,提出LP-SFT目标,在多领域实验中提升性能,平衡准确率和k准确率。

Comments 20 pages, 3 figures. Code is available at https://github.com/Wakaka161/LP-SFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19863 2026-07-22 cs.CV 版本更新 57%

Brewing Stronger Features: Dual-Teacher Distillation for Multispectral Earth Observation

酿造更强的特征:多光谱地球观测的双教师蒸馏

Filip Wolf, Blaž Rolih, Luka Čehovin Zajc

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅纳大学计算机与信息科学学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出双教师对比蒸馏框架,用于多光谱地球观测,通过结合多光谱和光学教师,实现跨模态表示学习,提升多光谱和光学数据的性能。

Comments Accepted to CVPR 2026 as Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他多模态 1 篇

2606.15830 2026-07-22 cs.NE math.OC 版本更新 50%

MSC-CMA-ES: Structure-Aware Restarts for CMA-ES via Cyclic Nearest-Better Basin Discovery

MSC-CMA-ES:通过循环最近更好盆地发现实现CMA-ES的结构感知重启

Dimitar Nedanovski, Svetoslav Nenov, Dimitar Pilev

专题命中 其他多模态 :multimodal(abstract)

AI总结 提出MSC-CMA-ES,通过循环最近更好聚类划分盆地、逐盆地重启并排除冗余访问,在组合函数上达到BIPOP-CMA-ES的2.7倍固定预算目标覆盖率。

Comments 13 pages, 5 figures, 4 tables. Code and full results: https://github.com/snenovgmailcom/cma_es_project

详情

展开后加载摘要…

URL PDF HTML 收藏