arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-13 至 2026-07-13 共收录 54 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 11 篇

2607.08798 2026-07-13 cs.GR cs.CV 新提交 83%

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

GReFEM:多模态大语言模型作为用于物理引导的3D网格细化的零样本语义助手

Kartik Bali, Mahish K. Guru, Christian J Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling(材料系统建模研究所) Helmholtz Zentrum Hereon(海德堡研究中心Hereon) Institute of Material and Process Design(材料与加工设计研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究探索多模态大语言模型能否作为有限元网格细化的零样本几何代理,引入GReFEM框架及orthoViews视图选择模块,经实证评估发现其展示出强大零样本能力,能准确遵循复杂指令,比盲目启发式方法更精确,定义了基础模型在自动模拟中作为语义助手的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09654 2026-07-13 cs.CV cs.AI 新提交 82%

Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models

十年视觉语言人工智能模型中准确性和视觉认知错误的演变

Shravan Murlidaran, Miguel P. Eckstein

机构 * Psychological & Brain Sciences, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校心理与脑科学系) Department of Computer Science, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校计算机科学系) Department of Electrical and Computer Engineering, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校电气与计算机工程系)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究十年间视觉语言模型进展,引入CSB数据集,评估模型在其上及MS-COCO样本中的准确性与视觉认知错误类型,发现MLLM消除简单与复杂场景描述准确性差距,几乎消除多数错误类型,为模型发展提供全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新 82%

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

专题命中 多模态评测 :MLLM(title_cn,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08790 2026-07-13 q-bio.QM 新提交 78%

DentiAsk: A VQA Benchmark for Multimodal Reasoning in Panoramic Dental Radiographs

DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试

Debesh Jha, Tapas Kumar Dutta, Roshan Paudel, Onkar Kishor Susladkar, Aashish Ghimire, Anupam Dhakal, Sabin Adhikari, Nand Kumar Yadav, Deepak Ranjan Nayak, Pravin Pawar, William C. W. Chen, Glenda Reynolds

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09583 2026-07-13 cs.CV 新提交 70%

Promptable Concept Segmentation from Above: Evaluating SAM 3's Zero-Shot and One-Shot Capabilities in Remote Sensing

从上方进行可提示的概念分割:评估SAM 3在遥感中的零样本和单样本能力

Mohammad Dabaja, Turgay Celik

机构 * University of Agder(阿格德大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究在严格零样本和单样本约束下,对SAM 3在遥感场景分类等任务中的能力进行评估。核心方法是对SAM 3结构调整并隔离提示模态来诊断对齐机制,还制定代理评估协议。主要贡献是揭示跨模态干扰,表明SAM 3避免过拟合但受分辨率等限制,指明微调方向。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09528 2026-07-13 cs.LG cs.CR cs.DB cs.SI 新提交 67%

TSAI-MetaFraud: A Benchmark Dataset for Financial Fraud Transaction and Behavioral Risk Detection in Metaverse Ecosystems

TSAI-MetaFraud:用于元宇宙生态系统中金融欺诈交易和行为风险检测的基准数据集

Refat Ishrak Hemel, Ehsan Hallaji, Roozbeh Razavi-Far

机构 * tsai-unb(tsai - 新不伦瑞克大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 针对元宇宙平台带来的欺诈等新挑战及现有数据集局限性,提出TSAI-MetaFraud基准数据集,整合多类信息与欺诈场景,定义多项基准任务并进行基线评估,为元宇宙生态系统相关研究提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17717 2026-07-13 cs.CR cs.AI stat.AP stat.ML 版本更新 57%

Machine Learning for Network Attacks Classification and Statistical Evaluation of Adversarial Learning Methodologies for Synthetic Data Generation

基于机器学习的网络攻击分类及对抗学习方法在合成数据生成中的统计评估

Iakovos-Christos Zarkadis, Christos Douligeris

机构 * University of Piraeus(希腊比雷埃乌斯大学) Dept. of Informatics(信息学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文通过统一多模态NIDS数据集,利用机器学习算法和对抗学习生成合成数据,评估其真实性、效用和隐私性,为入侵检测提供稳定模型。

Comments Accepted at IEEE ISCC 2026, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09323 2026-07-13 cs.RO 新提交 50%

Effects of Robotic Touch on Older Users During Walking Guidance by a Humanoid Robot

类人机器人步行引导过程中机器人触摸对老年用户的影响

Leonie Leven, Marko Ackermann, Christian Werner, Melina Schmetterer, Theresa Buchner, Monika Eckstein, Katja Mombaur

专题命中 多模态评测 :multimodal(abstract)

AI总结 研究老年人在机器人步行引导中对不同触摸模式的感知与响应,通过多模态评估方法,发现交互时压力略升但总体接受,较大交互力条件下距离更小,为机器人步行引导辅助设计提供见解,表明老年人更喜欢轻柔稳定触摸。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13123 2026-07-13 cs.HC 版本更新 50%

From Adaptation to Intelligence: A Systematic Review of Data, Strategies, and Impact in Personalized VR

从适应性到智能性:个性化虚拟现实中数据、策略及影响的系统综述

Tangyao Li, Yitong Zhu, Hai-Ning Liang, Yuyang Wang

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文对VR个性化研究进行系统综述,聚焦沉浸时用户数据驱动的自适应策略,综合多领域研究成果总结五阶段框架,揭示新兴趋势,明确数据、建模和评估挑战,为更有效及以用户为中心的VR系统指明研究方向。

Comments 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 2 篇

2607.09521 2026-07-13 cs.AI 新提交 79%

SAGEAgent: A Self-Evolving Agent for Cost-Aware Modality Acquisition in Multimodal Survival Prediction

SAGEAgent:用于多模态生存预测中成本感知模态获取的自进化智能体

Chongyu Qu, Can Cui, Zhengyi Lu, Junchao Zhu, Tianyuan Yao, Junlin Guo, Juming Xiong, Yanfan Zhu, Yuechen Yang, Bennett A. Landman, Yuankai Huo

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 研究多模态生存预测中如何平衡预测准确性与临床侵入性,提出基于自进化大语言模型的SAGEAgent,通过多种记忆和工具为患者决定诊断方式,实验证明其能在胶质瘤队列中降低获取负担并保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16966 2026-07-13 cs.CR cs.AI 74%

Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning

视觉 inception:通过多模态记忆污染在代理推荐系统中妥协长期规划

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 本文提出视觉 inception 攻击,通过污染用户上传的图片在代理推荐系统中影响长期规划,提出 CognitiveGuard 防御框架以降低攻击风险。

Comments 17 pages, 6 figures, 16 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 20846-20862, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 9 篇

2606.23964 2026-07-13 cs.LG cs.CV q-bio.QM 新提交 83%

3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy

3D掩码自编码器是显微镜体积和多模态细胞表示的鲁棒学习器

Amirhossein Kardoost, Lion Gleiter, Tingying Peng, Carsten Marr

机构 * Institute of AI for Health & Helmholtz AI, Computational Health Center, Helmholtz Munich – German Research Center for Environmental Health(亥姆霍兹慕尼黑中心 - 德国环境健康研究中心,计算健康中心,健康人工智能研究所与亥姆霍兹人工智能) Department of Medicine III, Ludwig-Maximilian-University Hospital(路德维希-马克西米利安大学医院第三内科) Department of Physics, Ludwig-Maximilian-University(路德维希-马克西米利安大学物理系) German Cancer Consortium (DKTK), partner site Munich(德国癌症联盟(DKTK)慕尼黑合作站点) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 系统比较2D和3D掩码自编码器在体积显微镜数据上的表现,发现3D模型在下游任务中更优,并通过跨模态对齐和频域正则化进一步提升性能,在蛋白质相互作用和定位任务上达到最先进水平。

Comments Code is available at: https://github.com/marrlab/mae3d-opencell

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18822 2026-07-13 cs.CV 版本更新 79%

Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations

鲁棒的自监督跨模态超分辨率对抗真实世界错位观测

Xiaoyu Dong, Jiahuan Li, Ziteng Cui, Naoto Yokoya

机构 * The Univsrsity of Tokyo(东京大学) RIKEN AIP(理化学研究所)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 RobSelf通过自监督方法实现鲁棒的跨模态超分辨率,通过误对齐感知的特征翻译和内容感知的参考滤波器提升性能和效率。

Comments ECCV 2026. Supp: https://drive.google.com/file/d/1fqTYuSY7Qp7PFHiHViZs7y6lz6Bws7ws/view?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09515 2026-07-13 cs.RO 新提交 78%

One-Shot Multimodal Learning from Demonstration with Force-Constrained Elastic Maps

基于力约束弹性映射的一次性多模态示范学习

Brendan Hertel, Jonathan Spanos, Navya Garg, Reza Azadeh

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多数示范学习方法忽视力与环境相互作用的问题,提出一次性多模态LfD框架。通过多模态概率分割提取力感知运动原语,扩展弹性映射表示并结合外力约束学习轨迹模型,经实验验证该方法具有多模态分割、力感知再现及跨平台通用性。

Comments 8 pages, 6 figures, 4 tables. Accepted for publication at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09488 2026-07-13 cs.CV 新提交 77%

SigLIP-HD by Fine-to-Coarse Supervision

通过从细到粗的监督实现SigLIP-HD

Lihe Yang, Zhen Zhao, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 研究如何在低成本下实现精细视觉感知,提出SigLIP-HD,采用从细到粗监督设计,基于SigLIP 2模型构建,在相同推理预算下能产生更好视觉令牌,在多基准测试中结果优于基线模型。

Comments ICLR 2026. Code and model: https://github.com/LiheYoung/SigLIP-HD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09481 2026-07-13 cs.CV cs.AI 新提交 73%

Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation

用于文本引导医学分割的骨干网络与语言引导解耦

Yungeng Liu, Xuanzi Fang, Haijin Zeng, Qi Dai, Yongyong Chen

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) NingBo No.2 Hospital(宁波第二医院)

专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究针对文本引导医学分割中模型组件紧密耦合问题,提出可转移骨干层次适配器框架BTHA,通过稳定特征级接口、分层监督策略和自适应门控语义引导适配器,有效提升分割效果且计算开销适度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09143 2026-07-13 cs.CV 新提交 70%

Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing

编织光与时间:用于密集RGB-事件解析的统一谐波-几何表示学习

Chenxu Peng, Chongtian zhou, Dicheng Liu, Bo-Wen Yin, Yimian Dai, Xialei Liu, Ming-Ming Cheng, Xiang Li

机构 * NKIARI(鹏城实验室) VCIP, CS, Nankai University(南开大学视觉计算与图像处理研究室) AAIS, Nankai University(南开大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 研究针对RGB-事件解析中统一主干应用的挑战,提出Evita统一主干,嵌入几何视差校正等协同学习模块,构建N-ImageNetV2及预训练协议,经多基准评估,其实现新指标,在实时多模态上精度-延迟权衡表现卓越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18043 2026-07-13 cs.CL cs.AI cs.CV 版本更新 67%

GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs

GrAInS:基于梯度的大语言模型和视觉语言模型推理时引导方法

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对推理时引导LLMs和VLMs的方法局限,提出GrAInS。该方法基于梯度归因识别关键令牌构建引导向量,推理时调整激活。实验显示其性能优于微调及现有基线,能在保持模型流畅性和通用能力的同时提升多项指标。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09126 2026-07-13 cs.CV cs.CL 新提交 62%

VTaMo: Video-Text Alignment Model for Sign Language Translation

VTaMo:用于手语翻译的视频-文本对齐模型

Junyi Hu, Zhewen He, Haomian Huang, Aoxiang Yang, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign科技)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 研究手语翻译问题,提出VTaMo框架,通过局部、全局对齐及位置对齐对比学习实现多粒度对齐,在多个数据集实验中展现领先性能,各组件贡献互补。

Comments 18 pages, 5 figures, 8 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09351 2026-07-13 cs.CV 新提交 61%

Simon-SR: Spatially Adaptive Modulation and Visual Prompt Adaptation for Text-Reinforced Super-Resolution

Simon-SR:用于文本增强超分辨率的空间自适应调制和视觉提示适配

Haotong Cheng, Yuxuan Li, Zijie Cui, Rongling Tan, Chenyuan Wang

机构 * College of Electronic Science and Engineering, Jilin University(吉林大学电子科学与工程学院)

专题命中 多模态训练与对齐 :multi-modal(abstract,comments);分类 cs.CV

AI总结 针对单图像超分辨率问题,提出Simon-SR框架,利用可学习提示进行语义挖掘和文本-图像融合,结合对比提示学习与空间自适应细化,实验证明该方法超越现有技术,在多项指标上有明显提升。

Comments Multi-modal Single Image Super-Resolution

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 4 篇

2607.09261 2026-07-13 cs.RO 新提交 78%

Validating Virtual Reality for Studying Multimodal Human-Robot Interaction in Socially Aware Robot Navigation

验证虚拟现实技术在社交感知机器人导航中研究多模态人机交互的有效性

Hariharan Arunachalam, Phani Teja Singamaneni, Rachid Alami

机构 * LAAS-CNRS, Universite de Toulouse(法国国家科学研究中心图卢兹分部,图卢兹大学) Inria Nancy(法国国家信息与自动化研究所南锡分部)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究VR在社交感知机器人导航中研究多模态人机交互的适用性,通过受试者内研究,让参与者在现实与VR环境中与机器人交互,结果显示VR能捕捉交互行为,可成为研究多模态行为的可靠灵活平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27048 2026-07-13 cs.RO 版本更新 78%

SpikeATac: A Multimodal Tactile Finger with Taxelized Dynamic Sensing for Dexterous Manipulation

SpikeATac: 一种多模态触觉指尖,具有像素化动态传感的灵活操作

Eric T. Chang, Peter Ballentine, Zhanpeng He, Do-Gon Kim, Kai Jiang, Hua-Hsuan Liang, Joaquin Palacios, William Wang, Pedro Piacenza, Ioannis Kymissis, Matei Ciocarlie

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 SpikeATac通过结合动态和静态触觉传感技术,实现对易碎物体的灵活操控,利用强化学习优化力调节能力。

Comments 8 pages, 8 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22784 2026-07-13 cs.CV cs.AI cs.RO 版本更新 76%

Single-Frame Point-Pixel Registration via Supervised Cross-Modal Feature Matching

基于监督跨模态特征匹配的单帧点像素配准

Yu Han, Zhiwei Huang, Yanting Zhang, Fangjun Ding, Shen Cai, Xiaoyu Tang, Yanchao Dong, Rui Fan

机构 * School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)

专题命中 其他多模态 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 研究激光雷达点云和相机图像的点像素配准难题,提出基于投影的无检测器框架及重复性评分机制,通过实验证明该方法在单帧激光雷达下能达先进性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09171 2026-07-13 nlin.AO math-ph math.MP 新提交 50%

Paths to synchronization in the Kuramoto model with inertia

具有惯性的Kuramoto模型中的同步路径

Cook Hyun Kim, Yeomoon Kim, Stefano Boccaletti, B. Kahng

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究有惯性的Kuramoto模型,探究单峰高斯和多峰均匀两种本征频率分布形式,发现其产生不同同步簇,导致序参量行为及同步路径不同,为惯性复杂系统集体同步动力学提供新视角。

Comments 31 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏