arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-06 至 2026-04-06 共收录 59 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2604.03094 2026-04-06 cs.CV cs.AI 62%

A Data-Centric Vision Transformer Baseline for SAR Sea Ice Classification

一种面向数据的视觉Transformer基线用于SAR海冰分类

David Mike-Ewewie, Panhapiseth Lim, Priyanka Kumar

机构 * The University of Texas Permian Basin(德克萨斯大学二叠纪盆地分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于SAR的视觉Transformer基线,用于解决极地海冰分类中的类别不平衡问题,通过对比不同损失函数的性能,验证了聚焦损失在稀有冰类中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03172 2026-04-06 cs.CV 57%

EffiMiniVLM: A Compact Dual-Encoder Regression Framework

EffiMiniVLM:一种紧凑的双编码回归框架

Yin-Loon Khor, Yi-Jie Wong, Yan Chai Hum

机构 * Universiti Malaya(马来亚大学) Universiti Tunku Abdul Rahman(拉曼大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EffiMiniVLM,一种紧凑的双编码回归框架,通过高效网络和轻量级回归头,在冷启动场景中实现高质量产品预测,具有低资源消耗和高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02934 2026-04-06 cs.CV 57%

PolyReal: A Benchmark for Real-World Polymer Science Workflows

PolyReal:一个用于现实世界聚合物科学工作流程的基准

Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Tongji University(同济大学) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 PolyReal是一个新的多模态基准,用于评估大规模语言模型在聚合物实验全流程中的能力,揭示了模型在实践任务上的不足,填补了评估空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02545 2026-04-06 cs.AI 57%

Competency Questions as Executable Plans: a Controlled RAG Architecture for Cultural Heritage Storytelling

能力问题作为可执行计划:一种受控的RAG架构用于文化遗产叙事

Naga Sowjanya Barla, Jacopo de Berardinis

机构 * School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于知识图谱的神经符号架构,通过将能力问题转化为可执行叙事计划,提升文化遗产叙事的准确性和可审计性,通过Live Aid KG进行验证,比较了三种RAG策略的优劣。

Comments Accepted at the 23rd European Semantic Web Conference (ESWC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17722 2026-04-06 cs.CV 57%

Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions

视觉-语言模型能计数吗?一个合成基准和基于注意力的干预分析

Saurav Sengupta, Nazanin Moradinasab, Jiebei Liu, Donald E. Brown

机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文通过合成基准和注意力干预分析,探讨了视觉-语言模型在计数任务中的表现,揭示了视觉和语言复杂性对计数准确率的影响,并展示了针对性的注意力重加权对计数行为的改进。

Comments Accepted at COGVL Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03088 2026-04-06 cs.IR 50%

ADSeeker: A Knowledge-Grounded Reasoning Framework for Industry Anomaly Detection and Reasoning

ADSeeker: 一种基于知识的推理框架用于工业异常检测与推理

Kai Zhang, Zekai Zhang, Xihe Sun, Anpeng Wang, Jingmeng Nie, Qinghui Chen, Han Hao, Jianyuan Guo, Jinglin Zhang

专题命中 多模态评测 :multimodal(abstract)

AI总结 ADSeeker通过整合视觉文档知识库和查询图像-知识检索增强生成框架,提升工业异常检测性能,提出层次稀疏提示机制和类型级特征以提取异常模式,构建大规模AD数据集MulA,实现零样本状态下的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 4 篇

2511.15279 2026-04-06 cs.RO cs.CV 57%

Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception

看、聚焦、理解:用于具身感知的机器人眼球

Jiashu Yang, Yifan Han, Yucheng Xie, Ning Guo, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dalian University of Technology(大连理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出EyeVLA框架,通过整合视觉感知、语言理解和物理摄像头控制,实现语言引导的主动视觉感知。该框架在500个真实样本上训练,使机器人在50种不同场景中完成任务的平均完成率为96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07553 2026-04-06 cs.CL 57%

VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents

VeriOS: 基于查询的人机GUI交互以实现可信操作系统代理

Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 VeriOS通过引入查询驱动的人机GUI交互框架,提升操作系统代理在不可信环境中的任务完成能力,实验显示其在不可信场景中性能显著提升,同时保持正常场景下的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02759 2026-04-06 cs.RO 50%

OMNI-PoseX: A Fast Vision Model for 6D Object Pose Estimation in Embodied Tasks

OMNI-PoseX:一种用于具身任务中6D物体姿态估计的高效视觉模型

Michael Zhang, Wei Ying, Fangwen Chen, Shifeng Bai, Hanwen Kang

机构 * KernalMind Tech Co., Ltd.(KernalMind科技有限公司)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出OMNI-PoseX,一种结合开放词汇感知与SO(3)感知的高效视觉模型,通过轻量级多模态融合策略实现稳定且高效的6D姿态估计,并在多个基准测试中展示了SOTA的精度和实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10970 2026-04-06 cs.CY cs.HC 50%

Simulating Couple Conflict: Designing A Multi-Agent System for Therapy Training and Practice

模拟夫妻冲突:为治疗训练和实践设计一个多智能体系统

Canwen Wang, Angela Chen, Catherine Bao, Siwei Jin, Holly Swartz, Tongshuang Wu, Robert E Kraut, Haiyi Zhu

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出一个多智能体系统,用于模拟夫妻治疗中的复杂情感动态,通过结构化交互阶段提升治疗师的实践能力与反馈准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 14 篇

2604.02816 2026-04-06 cs.CV cs.AI 84%

QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models

QAPruner: 量化感知的多模态大语言模型视觉标记剪枝

Xinhao Wang, Zhonyu Xia, Zhiwei Lin, Zhe Li, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出QAPruner框架,通过结合量化误差模拟与异常强度指标,实现多模态大语言模型的视觉标记剪枝与后训练量化联合优化,提升低比特下的推理精度。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21331 2026-04-06 cs.CV cs.AI 84%

The More, the Merrier: Contrastive Fusion for Higher-Order Multimodal Alignment

更多更好:用于高阶多模态对齐的对比融合

Stefanos Koutoupis, Michaela Areti Zervou, Konstantinos Kontras, Maarten De Vos, Panagiotis Tsakalides, Grigorios Tsagkatakis

机构 * Foundation for Research and Technology-Hellas(希腊研究与技术基金会) University of Crete(克里特大学) KU Leuven(鲁汶大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出对比融合框架,通过联合嵌入个体模态及其融合组合,捕捉高阶依赖关系,提升多模态对齐效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02771 2026-04-06 cs.CR 82%

ContractShield: Bridging Semantic-Structural Gaps via Hierarchical Cross-Modal Fusion for Multi-Label Vulnerability Detection in Obfuscated Smart Contracts

ContractShield:通过层次交叉模态融合弥合语义-结构差距以实现多标签漏洞检测

Minh-Dai Tran-Duong, Nguyen Hai Phong, Nguyen Chi Thanh, Doan Minh Trung, Tram Truong-Huu, Van-Hau Pham, Phan The Duy

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

AI总结 ContractShield通过三级融合机制有效关联多互补特征,提升智能合约漏洞检测鲁棒性,实现89%的Hamming得分和五种主要漏洞类型的91%F1-score。

Comments 9 figures, 8 tables, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02492 2026-04-06 cs.CV cs.AI 81%

Token-Efficient Multimodal Reasoning via Image Prompt Packaging

通过图像提示包装实现高效的多模态推理

Joong Ho Choi, Jiayang Zhao, Avani Appalla, Himansh Mukesh, Dhwanil Vasani, Boyi Qian

机构 * BNY Pittsburgh US(美国匹兹堡)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出图像提示包装方法,通过将结构化文本嵌入图像以减少文本令牌开销,并在多个数据集和模型上验证其效果,展示了在多模态系统设计中视觉编码的重要性。

Comments 9 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02396 2026-04-06 cs.CV cs.AI 81%

Environment-Aware Channel Prediction for Vehicular Communications: A Multimodal Visual Feature Fusion Framework

面向环境的车用通信信道预测:一种多模态视觉特征融合框架

Xuejian Zhang, Ruisi He, Minseok Kim, Inocent Calist, Mi Yang, Ziyi Qi

机构 * Graduate School of Science and Technology, Niigata University(新潟大学研究生院科学与技术系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态视觉特征融合框架,利用GPS数据、车辆全景RGB图像及语义分割和深度估计提取语义、深度和位置特征,通过三分支架构和 squeeze-excitation 注意力门控模块实现自适应多模态融合,实现路径损耗、时延扩展、到达方位扩展、离开方位扩展和角功率谱的联合预测。

Comments 13 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02338 2026-04-06 cs.LG cs.CL cs.CV 81%

LiME: Lightweight Mixture of Experts for Efficient Multimodal Multi-task Learning

LiME:轻量级专家混合用于高效的多模态多任务学习

Md Kowsher, Haris Mansoor, Nusrat Jahan Prottasha, Ozlem Garibay, Victor Zhu, Zhengping Ji, Chen Chen

机构 * UCF(中佛罗里达大学) Coventry University(考文垂大学) Axon(Axon公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 LiME通过轻量级调制实现专家专业化,减少可训练参数并提升泛化能力,实验表明其在多模态多任务基准上性能优异且训练更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02818 2026-04-06 physics.ao-ph 78%

MAG-Net: Physics-Aware Multi-Modal Fusion of Geostationary Satellite and Radar for Severe Convective Precipitation Nowcasting

MAG-Net:融合静止卫星和雷达的物理感知多模态融合用于强对流降水nowcasting

Dandan Chen, Yaqiang Wang, Anyuan Xiong, Enda Zhu

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 MAG-Net通过融合静止卫星和雷达数据,利用物理约束提升对强对流降水的nowcasting性能,优于现有确定性和生成性模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02689 2026-04-06 cs.CV cs.AI 62%

Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs

Efficient3D: 一种用于3D多模态大语言模型中自适应和去偏token减少的统一框架

Yuhui Lin, Siyue Yu, Yuxing Yang, Guangliang Cheng, Jimin Xiao

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Efficient3D框架,通过去偏视觉token重要性估计器和自适应token再平衡策略,实现3D MLLMs的高效推理,提升性能并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02397 2026-04-06 cs.CV cs.AI 62%

Variational Encoder--Multi-Decoder (VE-MD) for Privacy-by-functional-design (Group) Emotion Recognition

变分编码器-多解码器(VE-MD)用于隐私-by-功能设计(群体)情绪识别

Anderson Augusma, Dominique Vaufreydaz, Fédérique Letué

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学, 法国国家科学研究中心, 格勒诺布尔国立理工学院, 信息学实验室) Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学, 法国国家科学研究中心, 格勒诺布尔国立理工学院, 让·库尔坦研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VE-MD框架,通过约束模型仅预测群体层面情绪,避免个体监控,提升群体情绪识别性能,实验显示其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18545 2026-04-06 cs.CV cs.AI 62%

CoDA: Exploring Chain-of-Distribution Attacks and Post-Hoc Token-Space Repair for Medical Vision-Language Models

CoDA:探索链式分布攻击及事后令牌空间修复用于医疗视觉-语言模型

Xiang Chen, Fangfang Yang, Chunlei Meng, Yuxian Dong, Ang Li, Yiwei Wei, Jiahuan Long, Jiujiang Guo, Chengyin Hu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoDA框架,通过构建临床合理的流程偏移,评估医疗视觉-语言模型在真实临床工作流中的可靠性,发现零样本性能显著下降,并引入事后修复策略提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02870 2026-04-06 cs.CV 61%

Token Warping Helps MLLMs Look from Nearby Viewpoints

令牌扭曲帮助多模态大语言模型从近处视角观察

Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV;MLLM(comments)

AI总结 本文研究令牌扭曲如何帮助多模态大语言模型从近处视角理解场景,发现反向令牌扭曲在视角变化中更稳定且能更好保持语义一致性。

Comments CVPR 2026, Project Page: https://token-warping-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03072 2026-04-06 cs.CV 57%

MI-Pruner: Crossmodal Mutual Information-guided Token Pruner for Efficient MLLMs

MI-Pruner:跨模态互信息引导的令牌修剪器用于高效的大语言模型

Jiameng Li, Aleksei Tiulpin, Matthew B. Blaschko

机构 * Faculty of Medicine, University of Oulu, Finland(芬兰奥卢大学医学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MI-Pruner,通过计算视觉与文本特征间的互信息来指导令牌修剪,无需依赖注意力机制,实现高效的大语言模型推理。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21584 2026-04-06 cs.CV 57%

TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs

TARS:最小最大令牌自适应偏好策略用于减少多模态大语言模型中的幻觉

Kejia Zhang, Keda Tao, Zhiming Luo, Chang Liu, Jiasheng Tang, Huan Wang

机构 * Xiamen University(厦门大学) Westlake University(西湖大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) AWS AI Lab, Amazon(亚马逊AWS AI实验室) Hupan Laboratory(湖畔实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TARS通过最小最大优化问题重构直接偏好优化,通过对抗性令牌扰动减少多模态大语言模型中的幻觉,通过频域对齐损失提升隐藏表征,优于标准DPO并超越数据增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02501 2026-04-06 eess.SP 50%

ECG Foundation Models and Medical LLMs for Agentic Cardiovascular Intelligence at the Edge: A Review and Outlook

ECG基础模型与医疗大语言模型用于边缘端心血管智能:综述与展望

Mudassir Hasan Khan, Ahmad Nayfeh, Mudassir Masood, Ali Ahmad Al-Shaikhi, Muhammad Mahboob Ur Rahman, Tareq Y. Al-Naffouri

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文综述了用于心血管疾病诊断、监测和临床决策支持的ECG基础模型和医疗大语言模型,探讨了其在边缘计算中的应用及未来发展方向。

Comments 18 pages, 4 figures, 4 tables, under review with a journal

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 5 篇

2604.02483 2026-04-06 physics.flu-dyn cs.AI 79%

A Multimodal Vision Transformer-based Modeling Framework for Prediction of Fluid Flows in Energy Systems

一种基于多模态视觉Transformer的建模框架,用于能量系统中流体流动的预测

Kiran Yalamanchi, Shivam Barwey, Ibrahim Jarrah, Pinaki Pal

机构 * Transportation and Power Systems Division, Argonne National Laboratory(阿贡国家实验室交通与电力系统部)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于Transformer的建模框架,用于预测复杂流体流动,通过多模态数据集训练模型,实现跨分辨率和模态的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02820 2026-04-06 cs.RO 78%

MFE: A Multimodal Hand Exoskeleton with Interactive Force, Pressure and Thermo-haptic Feedback

MFE:一种具有交互力、压力和热触觉反馈的多模态手外骨骼

Ziyuan Tang, Yitian Guo, Chenxi Xiao

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出MFE多模态手外骨骼,通过20自由度捕捉手部姿态,提供力、压力和热觉反馈,提升远程操作系统的感知与交互体验。

Comments 8 pages, 7 figures, 2 tables

Journal ref IEEE Robotics and Automation Letters 11 (2026) 3756-3763

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08945 2026-04-06 cs.HC 78%

PassAI: explainable artificial intelligence algorithm for soccer pass analysis using multimodal information resources

PassAI:一种利用多模态信息资源的可解释人工智能算法用于足球传球分析

Ryota Takamido, Jun Ota, Hiroki Nakamoto

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 PassAI通过结合跟踪数据和传球者赛季统计数据,实现了足球传球成功与失败的分类,并解释其决策依据,提升了体育领域AI算法的性能和可解释性。

Comments 25 pages, 7 figures, 2 tables. IEEE Access (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02903 2026-04-06 cs.CV cs.AI 62%

RayMamba: Ray-Aligned Serialization for Long-Range 3D Object Detection

RayMamba:基于射线对齐的长距离3D目标检测串行化

Cheng Lu, Mingqian Ji, Shanshan Zhang, Zhihao Li, Jian Yang

机构 * School of Computer Science and Technology, Nanjing University of Science and Technology(南京理工大学计算机科学与技术学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RayMamba通过射线对齐策略优化稀疏场景下的3D目标检测,提升远距离场景的上下文建模效率,实现mAP和NDS的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13394 2026-04-06 cs.LG stat.ML 50%

Fast and Robust Simulation-Based Inference With Optimization Monte Carlo

快速且鲁棒的基于模拟的推断与优化蒙特卡罗

Vasilis Gkolemis, Christos Diou, Michael U. Gutmann

机构 * Harokopio University of Athens(雅典哈罗科皮奥大学) ATHENA Research Center(雅典娜研究中心) University of Edinburgh(爱丁堡大学)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种基于优化蒙特卡罗的方法,通过将随机模拟推断转化为确定性优化问题,实现高效且准确的后验推断,减少运行时间并提升鲁棒性。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏