arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-12 至 2026-03-12 共收录 52 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 7 篇

2511.05271 2026-03-12 cs.CV cs.AI 81%

DeepEyesV2: Toward Agentic Multimodal Model

DeepEyesV2:迈向代理多模态模型

Jack Hong, Chenxiao Zhao, ChengLin Zhu, Weiheng Lu, Guohai Xu, Xing Yu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 DeepEyesV2通过两阶段训练方法实现代理多模态模型,结合数据构建、训练优化和评估,提升现实世界推理与工具调用能力。

Comments Accepted to ICLR2026. Homepage: https://visual-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09689 2026-03-12 cs.CV cs.AI 62%

AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering

AutoViVQA:一个大规模自动构建的数据集用于越南语视觉问答

Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AutoViVQA数据集,利用变压器架构进行越南语视觉问答,结合文本和视觉预训练,并在多语言环境下系统比较自动评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10990 2026-03-12 cs.CV 57%

Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity

过于生动以至于不真实?生成式颜色真实性的基准测试与校准

Zhengyao Fang, Zexi Jia, Yijia Zhong, Pengcheng Luo, Jinchao Zhang, Guangming Lu, Jun Yu, Wenjie Pei

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出颜色真实性数据集和度量标准,通过多模态编码器和自适应指导尺度提升生成图像的颜色真实性,构建了评估与改进的渐进框架。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10463 2026-03-12 cs.CV 57%

Learning to Wander: Improving the Global Image Geolocation Ability of LMMs via Actionable Reasoning

学习漫游:通过可操作推理提升LMMs的全球图像地理定位能力

Yushuo Zheng, Huiyu Duan, Zicheng Zhang, Xiaohong Liu, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 通过可操作推理提升LMMs的全球图像地理定位能力,提出GeoAoT框架和WanderBench基准,实现交互式地理定位探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11099 2026-03-12 cs.CV 57%

A Survey on Interpretability in Visual Recognition

视觉识别中可解释性的综述

Qiyang Wan, Chengzhi Gao, Ruiping Wang, Xilin Chen

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文综述了视觉识别中可解释性的发展,从意图、对象、呈现和方法学角度建立多维分类法,总结了关键评估指标,并探讨了多模态大语言模型的可解释性及实际应用。

Comments 20 pages, 8 figures, 7 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.04796 2026-03-12 cs.CV 57%

In Pursuit of Many: A Review of Modern Multiple Object Tracking Systems

追寻众多:现代多目标跟踪系统的综述

Mk Bashar, Samia Islam, Kashifa Kawaakib Hussain, Md. Bakhtiar Hasan, A. B. M. Ashikur Rahman, Md. Hasanul Kabir

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文综述了现代多目标跟踪系统的发展,涵盖从基于检测到端到端设计的演变,以及基于变压器、生成模型等架构的最新进展,并探讨了基准趋势和实际部署中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 6 篇

2603.01607 2026-03-12 cs.AI cs.LG 79%

CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework

CARE:迈向多模态医学推理中的临床问责的证据基础代理框架

Yuexi Du, Jinglu Wang, Shujie Liu, Nicha C. Dvornek, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) Department of Biomedical Engineering, Yale University(耶鲁大学生物医学工程系) Department of Radiology & Biomedical Imaging, Yale University(耶鲁大学放射学与生物医学成像系)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 CARE通过证据基础的代理框架提升多模态医学推理的准确性与问责性,结合解耦的专业模型和明确证据,实现更可靠的医学AI。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16410 2026-03-12 cs.CV 79%

REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

REALM:一种用于高斯点划法上开放世界3D推理分割和编辑的MLLM-代理框架

Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Peking University(北京大学)

专题命中 多模态Agent :MLLM(title,abstract);分类 cs.CV

AI总结 REALM通过MLLM-代理框架实现开放世界3D推理分割和编辑,支持多种3D交互任务。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21100 2026-03-12 astro-ph.GA astro-ph.IM 78%

Disk Wind Feedback from High-mass Protostars. V. Application of Multi-Modal Machine Learning to Characterize Outflow Properties

高质恒星喷流反馈。V. 多模式机器学习在喷流性质表征中的应用

Duo Xu, Ioana A. Stelea, Joshua S. Speagle, Yichen Zhang, Jonathan C. Tan

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出多模式深度学习方法,通过结合空谱信息表征喷流性质,克服投影偏差,提升高质恒星形成研究的可解释性与鲁棒性。

Comments ApJ accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10220 2026-03-12 cs.CV cs.AI cs.RO 62%

Robotic Ultrasound Makes CBCT Alive

机器人超声使CBCT活起来

Feng Li, Ziyuan Li, Zhongliang Jiang, Nassir Navab, Yuan Bi

机构 * Chair for Computer-Aided Medical Procedures and Augmented Reality, Technical University of Munich(计算机辅助医学程序与增强现实 chair,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) The University of Hong Kong(香港大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 利用机器人超声实现动态CBCT更新,通过实时估计组织变形提升手术导航精度

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14482 2026-03-12 cs.CV cs.AI 62%

TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning

TikArt: 通过强化学习稳定引导孔细粒度视觉推理

Hao Ding, Zhichuan Yang, Weijie Ge, Ziqin Gao, Chaoyi Lu, Lei Zhao

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 TikArt通过强化学习引导孔机制提升细粒度视觉推理,结合语言推理与Zoom、Segment操作,实现多模态证据获取与持久记忆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10268 2026-03-12 cs.SE 50%

SpecOps: A Fully Automated AI Agent Testing Framework in Real-World GUI Environments

SpecOps:一种在真实GUI环境中完全自动化的AI代理测试框架

Syed Yusuf Ahmed, Shiwei Feng, Chanwoo Bae, Calix Barrus Xiangyu Zhang

专题命中 多模态Agent :multimodal(abstract)

AI总结 SpecOps是一种全新的自动化AI代理测试框架,通过专门设计的LLM代理处理四个阶段,实现对真实GUI环境中复杂代理的高效测试与验证。

Comments Accepted to ICSE 2026

Journal ref Proceedings of the IEEE/ACM International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 9 篇

2601.13879 2026-03-12 cs.MM cs.CL cs.CV 85%

Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring

链式推理压缩不应盲目:通过双路径锚定实现高效的多模态推理的V-Skip

Dongxu Zhang, Yiding Sun, Cheng Tan, Wenbiao Yan, Ning Yang, Jihua Zhu, Haijun Zhang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology, Shenzhen(深圳哈尔滨工业大学) University of Science and Technology Beijing(北京科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 V-Skip通过双路径锚定机制解决多模态推理中令牌剪枝的盲目性问题,实现高效的推理速度提升与精度保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10877 2026-03-12 cs.CL 83%

From Images to Words: Efficient Cross-Modal Knowledge Distillation to Language Models from Black-box Teachers

从图像到词语:高效的跨模态知识蒸馏用于从黑盒教师模型向语言模型转移

Ayan Sengupta, Shantanu Dixit, Md Shad Akhtar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi, India(印度德里印度理工学院) Indraprastha Institute of Information Technology Delhi, India(印度德里印度信息科技学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出ARMADA框架,通过高效的跨模态知识蒸馏方法,从黑盒视觉-语言模型向语言模型转移知识,实现性能提升且无需昂贵预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10370 2026-03-12 cs.CV 83%

GeoSense: Internalizing Geometric Necessity Perception for Multimodal Reasoning

GeoSense: 内化几何必要性感知以实现多模态推理

Ruiheng Liu, Haihong Hao, Mingfei Han, Xin Gu, Kecheng Zhang, Changlin Li, Xiaojun Chang

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 GeoSense通过内化几何必要性感知,提升多模态推理的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09480 2026-03-12 cs.CV 57%

Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity

剪枝冗余,保留本质:通过协同重要性-多样性压缩视觉语言模型中的视觉标记

Zhengyao Fang, Pengyuan Lyu, Chengquan Zhang, Guangming Lu, Jun Yu, Wenjie Pei

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 PruneSID通过协同重要性-多样性方法有效压缩视觉语言模型中的视觉标记,实现高精度与高效能的平衡。

Comments accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10872 2026-03-12 cs.CV 57%

Bilevel Layer-Positioning LoRA for Real Image Dehazing

双层层位定位LoRA用于真实图像去雾

Yan Zhang, Long Ma, Yuxin Feng, Zhe Huang, Fan Zhou, Zhuo Su

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) National Engineering Research Center of Digital Life(数字生活国家工程研究中心) Dalian University of Technology(大连理工大学) Xidian University(西安电子科技大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出双层层位定位LoRA方法,通过文本引导损失和自动层搜索提升真实图像去雾的适应性和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10360 2026-03-12 cs.CV 57%

One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination

一个token,两种命运:通过视觉token操控构建统一框架以对抗大语言模型幻觉

Zhan Fa, Yue Duan, Jian Zhang, Lei Qi, Yinghuan Shi

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :MLLM(abstract);分类 cs.CV

AI总结 通过视觉token操控构建统一框架,有效减少大语言模型幻觉,提升POPE准确性2%。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08937 2026-03-12 cs.GR cs.CV cs.LG eess.IV stat.ML 57%

Rethinking Few-Shot Image Fusion: Granular Ball Priors Enable General-Purpose Deep Fusion

重新思考少样本图像融合:粒度球先验使通用深度融合成为可能

Minjie Deng, Yan Wei, An Wu, Yuncan Ouyang, Hao Zhai, Qianyao Peng

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出粒度球先验方法,通过自适应损失函数实现少样本图像融合,提升融合质量和模型效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10871 2026-03-12 cs.RO 50%

FG-CLTP: Fine-Grained Contrastive Language Tactile Pretraining for Robotic Manipulation

FG-CLTP: 用于机器人操作的细粒度对比语言触觉预训练

Wenxuan Ma, Chaofan Zhang, Yinghao Cai, Guocai Yao, Shaowei Cui, Shuo Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 FG-CLTP通过细粒度对比学习提升机器人触觉感知,实现高精度分类和控制,减少误差并增强跨传感器泛化能力。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10442 2026-03-12 cs.LG stat.ML 50%

GGMPs: Generalized Gaussian Mixture Processes

GGMPs: 通用高斯混合过程

Vardaan Tekriwal, Mark D. Risser, Hengrui Luo, Marcus M. Noack

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 GGMPs是一种基于高斯过程的多模态条件密度估计方法,通过局部混合拟合和异方差训练提升非高斯数据的分布近似能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 1 篇

2603.10010 2026-03-12 cs.CL cs.AI 62%

FERRET: Framework for Expansion Reliant Red Teaming

FERRET:扩展依赖的红队框架

Ninareh Mehrabi, Vitor Albiero, Maya Pavlova, Joanna Bitton

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 FERRET框架通过多方面的扩展机制,提升多模态对抗对话的有效性和效率,优于现有红队方法。

详情

展开后加载摘要…

URL PDF HTML 收藏