arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2981 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 621 篇

2607.24424 2026-07-28 cs.CV 新提交 74%

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning

MAViE:用于细粒度视觉感知和高效多模态推理的多尺度自适应视觉编码器

Shaofei Lei

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 研究针对视觉语言模型问题,提出多尺度自适应视觉编码器MAViE,通过融合多层特征、进行令牌路由及引入相关策略,在统一框架下实验,减少视觉令牌数量,提升多任务分数并降低处理时间,还给出模型设计与评估协议。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23542 2026-07-28 cs.CV 新提交 74%

GaitFace: A Multimodal Dataset for Long-Range Person Identification

GaitFace:一个用于远距离人员识别的多模态数据集

Alain Komaty, Luis S. Luevano, Vidit Vidit, Anjith George, Zeina Al Amine, Sébastien Marcel

机构 * Idiap Research Institute(伊迪阿普研究所)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 介绍用于远距离人员识别的多模态数据集GaitFace,利用预注册和“野外”捕获数据反映真实边境场景,通过基准测试揭示当前面部和步态模型在低分辨率和高视角下的关键漏洞,为无约束生物识别研究提供公共基准。

Comments Accepted in IJCB 2026 , see https://idiap.ch/paper/gaitface/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08317 2026-07-10 cs.AI 新提交 74%

Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

盲点基准:评估多模态模型中的盲点

Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé

机构 * École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 研究旨在评估多模态模型盲点,引入盲点基准,收集学生原始问题并标注,提出任务分类法和自动评分管道。分析发现闭源前沿模型超越开源模型,各模型在不同任务类型表现各异,凸显该基准对识别模型弱点的价值。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03261 2026-07-08 cs.CV 新提交 74%

OmniLayout: A Schematic-Coupled Multimodal Benchmark for Constraint-Aware Geometric Reasoning in PCB Layout

OmniLayout:用于印刷电路板布局中约束感知几何推理的原理图耦合多模态基准测试

Taiting Lu, Kaiyuan Lin, Mingjia Wang, Haolin Ye, Runze Liu, Yuxin Tian, Vahe Melkonyan, Haoyu Wang, Muchuan Wang, Chufan Hong, Yifan Yang, Sung-Liang Chen, Yi-Chao Chen, Yicheng Jin, Mahanth Gowda

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research(微软研究院) Binghamton University(宾汉姆顿大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 介绍OmniLayout基准测试,用于评估大语言模型在印刷电路板布局放置推理。含1681个工业级原理图耦合PCB布局及四项任务,揭示当前大语言模型在PCB布局放置上有诸多局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28322 2026-07-01 cs.CV 新提交 74%

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

PerceptionRubrics:将多模态评估校准至人类感知

Yana Wei, Hongbo Peng, Yanlin Lai, Liang Zhao, Kangheng Lin, En Yu, Keyu Lv, Han Zhou, Yin Tang, Haodong Li, Mitt Huang, Hangyu Guo, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) StepFun Tsinghua University(清华大学) Independent Researcher(独立研究者)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 提出基于准则的评估框架PerceptionRubrics,通过双流准则和门控评分机制,解决基准分数饱和而实际脆弱性问题,揭示可靠性差距、开源与闭源感知差异,并实现与人类感知的高度对齐。

Comments ICML 2026. Project page: https://weiyana.github.io/PerceptionRubrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24770 2026-06-24 cs.CY cs.AI cs.LG 新提交 74%

Context-Aware Prediction of Student Quiz Performance with Multimodal Textbook Features

基于多模态教材特征的情境感知学生测验表现预测

Samin Khan

机构 * Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 本研究通过提取CourseKata教材中复习题的文字和图像特征,结合学生历史表现,将章节测验预测准确率相对提升9.1%,表明情境感知模型能利用内容特征改进预测。

Comments 4 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24388 2026-06-24 cs.AI cs.LG 新提交 74%

PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models

PHANTOM:面向视觉-语言模型的多模态对抗攻击大规模数据集

Simone Gallivanone, Hossein Khodadadi, Mauro Dore, Mauro Medda, Nicola Franco

机构 * The Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所(AI4I)) HikmaAI S.r.l.(HikmaAI有限责任公司)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 提出一个大规模开源对抗攻击数据集PHANTOM,涵盖10个高级类别和55个子类别的有害意图,包含47,524个对抗样本,旨在降低对抗研究门槛,促进VLM鲁棒性和安全性的系统评估。

Comments The dataset has been released at: https://huggingface.co/datasets/it4lia/PHANTOM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19067 2026-06-18 cs.RO cs.CV 新提交 74%

Sensor Configuration Matters: A Systematic Evaluation of Multimodal SLAM on Quadruped Robots

传感器配置至关重要:四足机器人多模态SLAM的系统评估

Roberto Corlito, Fabian Schmidt, Nils Seibert, Markus Enzweiler, Abhinav Valada, Arne Roennau

机构 * Machine Intelligence and Robotics Lab, Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院智能机器人实验室) Institute for Intelligent Systems, Esslingen University of Applied Sciences(埃森堡应用科学大学智能系统研究所) Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 针对四足机器人运动中的传感器配置问题,系统评估了视觉、视觉-惯性和LiDAR-视觉-惯性SLAM方法,发现立体相机、全局快门和适当惯性集成能显著提升定位鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14251 2026-06-15 cs.CV 新提交 74%

HiST: A Hierarchical Sparse Transformer for Cross-Modal Spatial Transcriptomics Modeling

HiST:用于跨模态空间转录组建模的分层稀疏Transformer

Weiyi Wu, Xinwen Xu, Xingjian Diao, Siting Li, Zhi Wei, Alma Andersson, Jiang Gui

机构 * New Jersey Institute of Technology(新泽西理工学院) Stevens Institute of Technology(史蒂文斯理工学院) Karolinska Institutet(卡罗林斯卡学院) Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :cross-modal(title);分类 cs.CV

AI总结 提出HiST,一种分层稀疏Transformer,通过稀疏窗口注意力和分辨率变换算子实现高效的多尺度空间转录组推断,显著降低计算开销并提升预测性能。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09453 2026-06-09 cs.CV 新提交 74%

GD-MIL: Grade-Disentangled Multiple Instance Learning for Multimodal Biochemical Recurrence Prediction in Prostate Cancer

GD-MIL:用于前列腺癌多模态生化复发预测的等级解耦多实例学习

Dasari Naga Raju

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 针对前列腺癌生化复发预测,提出GD-MIL方法,通过梯度反转等级对抗训练实现H&E全切片图像特征与Gleason等级解耦,融合临床变量后C-index达0.704,显著优于临床基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16480 2026-08-18 cs.CV cs.AI 新提交 73%

RISE: Roadside Infrastructure Sequence Understanding across 3D Tracking and Structured Vision-Language Reasoning

RISE:跨三维跟踪与结构化视觉-语言推理的路边基础设施序列理解

Yanbo Jiang, Haotian Zheng, Jiahao Wang, Hanxiao Ren, Yitao Xu, Yining Xing, Zehong Ke, Hao Cheng, Yiqian Tu, Jinhao Li, Zhiyuan Xuan, Fang Zhang, Jianqiang Wang

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究提出RISE框架,结合仅图像的三维跟踪方法与结构化视觉-语言推理,构建含33910个问答对的RISE-VQA数据集,通过RISE-Bench评估任务,揭示相关挑战并验证域自适应与时间上下文的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02615 2026-08-05 cs.CL cs.AI 新提交 73%

OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reasoning

OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准

Ahnaf Munir, Dannong Wang, Michael W. McDonald, Mubarak Shah, Pegah Khosravi, Yu Tian

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OncoTriad-QA多模态癌症问答基准及OncoVLM模型,实验显示OncoVLM经微调后在泛癌问答任务上优于现有模型,该基准可用于相关模型的训练与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27066 2026-07-30 cs.CV cs.AI 新提交 73%

SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence

SciFigAlign:通过微调视觉内容与稿件证据的对齐来对科学图表进行评分

Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文构建了含3857张科学图表的标注数据集,提出基于稿件证据的多模态评分器SciFigAlign,其在测试集上的MAE为0.3524,相对最佳LLM基准降低59%误差,证实需视觉与稿件证据的学习对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15418 2026-07-20 cs.AI cs.CV 新提交 73%

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

DrawingVQA:建筑图纸上多深度视觉文本推理的真实世界基准测试

Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard

机构 * Louisiana State University(路易斯安那州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 DrawingVQA针对建筑图纸多深度视觉文本推理设计基准测试,利用图纸与问答对,提出双分类框架评估模型,揭示模型与专家表现差距,为领域特定多模态推理及AI与工程工作流程整合奠定基础。

Comments CVPR 2026 Findings accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02934 2026-07-07 cs.CV cond-mat.mtrl-sci cs.AI 新提交 73%

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

MatPhaseBench:用于材料相图理解的语义引导基准测试

Hanwen Wang, Sihan Liang, Zhiwei Liu, Yangang Wang, Wei Yan, Yuqin Liu, Zongguo Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) University of Manchester(曼彻斯特大学) Institute of Metal Research, Chinese Academy of Sciences(中国科学院金属研究所) China University of Geosciences(中国地质大学)

专题命中 多模态评测 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 介绍用于材料相图理解的MatPhaseBench基准测试,从文献选图与文字构建,有复杂科学图像理解、图文全面对齐、高质量人工监督文本采集三个关键特性,实验显示当前VLM距专家理解有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26029 2026-06-25 cs.CV cs.AI 新提交 73%

TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

TriViewBench: 多视图结构推理中受控复杂度缩放

Yu-Yang Chen, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出TriViewBench基准,通过合成3D场景控制物体数量和遮挡,评估18个多模态大模型在多视图推理中的能力层次和性能退化,发现跨视图空间表示是瓶颈。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19103 2026-06-18 cs.CV cs.AI 新提交 73%

ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL

ProductConsistency:通过SFT和RL改进基于指令的图像编辑中的产品身份保持

Mukund Khanna, Raj Singh Yadav, Kunal Singh

机构 * Fractal Analytics

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对基于指令的图像编辑中产品特征保持不足的问题,提出ProductConsistency数据集和循环一致性奖励,结合监督微调与强化学习,显著提升产品一致性、文本渲染和视觉质量。

Comments CVPR HiGen 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09634 2026-06-09 cs.CV cs.AI 新提交 73%

ATN3D: Density-Aware LiDAR-Radar Early 3D Object Detection Under Extreme Sparsity

ATN3D:面向极端稀疏性的密度感知激光雷达-雷达早期3D目标检测

Debojyoti Biswas, Xianbiao Hu

机构 * University of California, Berkeley(加州大学伯克利分校) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对远距离稀疏感知下早期融合丢失信息、通道监督不均衡的问题,提出ATN3D框架,通过密度感知融合、占用门控邻域聚合、证据条件通道自注意力和距离感知损失,在VoD数据集上显著提升远距离检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07590 2026-08-11 stat.AP q-bio.QM 新提交 71%

Uncertainty-Aware Missing-Data Multimodal Latent for Fetal-Growth Analysis

用于胎儿生长分析的不确定性感知缺失数据多模态潜在模型

Tiago Cortinhal, César Díaz-Parga, Gabriel Bernardino, Marta Nuñez-Garcia

专题命中 多模态评测 :multimodal(title)

AI总结 该研究提出线性高斯因子模型,对977例胎儿的四类测量数据拟合后发现测量模块几乎独立,可通过边缘化缺失值得到反映可用数据不确定性的生长谱,其重建残差还可用于数据质量筛选。

Comments https://github.com/TiagoCortinhal/fgr-geometry

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08641 2026-08-11 cs.CR 新提交 71%

Whose Refusal Is It? The Unmeasured Contribution of Black-Box Multimodal Guardrails

这是谁的拒绝?黑盒多模态安全护栏的未被衡量的贡献

Haoyu Zhang, Xiao Luo, Haowen Xu, Yi Feng, Shibo Zheng, Mohammad Zandsalimy, Shanu Sushmita

专题命中 多模态评测 :multimodal(title)

AI总结 该研究指出黑盒多模态安全护栏的评估指标混淆了护栏与目标模型的弃权贡献,通过实验揭示了有效载荷通道和内部读取文本对护栏贡献的影响,并修正了相关评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11931 2026-07-15 cs.HC 新提交 71%

Reading the Eyes in VR: Multimodal Modeling of Social Intelligence

在虚拟现实中解读眼神:社会智能的多模态建模

Mohammad Fahim Abrar, Shayla Sharmin, Roghayeh Leila Barmaki

专题命中 多模态评测 :multimodal(title)

AI总结 研究通过在 Unity 中为桌面和 VR 实现 RMET 并进行 2x2 混合研究,探究呈现媒介和反馈对 RMET 行为的影响。结果表明即时反馈影响注视和脑电,呈现媒介无客观差异,VR 可用性高,为 RMET 在受控环境作过程感知评估任务提供证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04647 2026-07-07 stat.ML cs.LG stat.CO 新提交 71%

Integrating Neural Encoders in Bayesian Generalized Linear Mixed Models for Multimodal Data

为多模态数据将神经编码器集成至贝叶斯广义线性混合模型中

Yuankang Zhao, Youngsoo Baek, Felipe A. Medeiros, Samuel Berchuck, Matthew M. Engelhard

机构 * Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计与生物信息学系) Department of Ophthalmology, University of Miami(迈阿密大学眼科系)

专题命中 多模态评测 :multimodal(title)

AI总结 针对传统广义线性混合模型无法适配高维多模态数据的问题,该研究联合训练模态专属神经编码器与GLMM目标,通过方差校正随机梯度MCMC实现推断,兼顾效应可解释性与多模态纵向数据的可扩展不确定性分析。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13900 2026-06-15 cond-mat.mtrl-sci 新提交 71%

Multi-modal machine learning analysis of GaSe molecular beam epitaxy growth conditions

GaSe分子束外延生长条件的多模态机器学习分析

Mingyu Yu, Isaiah A. Moses, Wesley F. Reinhart, Stephanie Law

专题命中 多模态评测 :multi-modal(title)

AI总结 提出机器学习引导的GaSe薄膜MBE生长框架,利用RHEED原位诊断与XRD、AFM非原位表征,通过无监督学习、互信息分析和监督学习揭示生长条件对薄膜质量的影响,实现异常检测与预测优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12158 2026-08-13 cs.CV 新提交 70%

Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉

Byungoh Ko, Jinyoung Park, Jongha Kim, Jeehye Na, Jaewon Cho, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 多模态评测 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09519 2026-08-11 cs.CV cs.LG 新提交 70%

XFeat Revisited: Reproducibility and Evaluation of a Lightweight Image Matcher

XFeat 再探讨:轻量级图像匹配器的可复现性与评估

Lazar Đoković, Aimee Lin

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究复现并评估轻量级图像匹配器XFeat,发现其在部分基准数据集上表现接近或优于原始检查点,同时揭示其架构设计的局限性及跨模态匹配的性能边界。

Comments 21 pages, 6 figures. Published in Transactions on Machine Learning Research (TMLR); Reproducibility Certification

Journal ref Transactions on Machine Learning Research, August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00068 2026-08-04 cs.CV 新提交 70%

SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining

SafeBuild-Bench:一种具有图增强数据挖掘能力的时序鲁棒建筑安全基准

Yi Cui, Zilin Wang, Yijie Xu, Qianyi Cai, Huizai Yao, Shuai Jiang, Bingzhuo Zhong, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 研究人员构建了图增强数据挖掘的时序鲁棒建筑安全基准SafeBuild-Bench,开发可扩展验证的GEMS流水线,发现现有多模态大语言模型对建筑安全理解仍不足。

Comments Accepted by KDD 2026. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16401 2026-07-21 cs.CV 新提交 70%

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

Apple-$π$:基于视频对基于法律的物理智能进行思维基准测试

Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对视频模型评估仅看输出层面的不足,提出Apple-PI基准,含数据集、协议和评估套件三部分,通过对11个模型测试发现其距可靠世界模拟器差距大,并揭示了一些瓶颈与差距,为指导视频模型发展提供诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09583 2026-07-13 cs.CV 新提交 70%

Promptable Concept Segmentation from Above: Evaluating SAM 3's Zero-Shot and One-Shot Capabilities in Remote Sensing

从上方进行可提示的概念分割:评估SAM 3在遥感中的零样本和单样本能力

Mohammad Dabaja, Turgay Celik

机构 * University of Agder(阿格德大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究在严格零样本和单样本约束下,对SAM 3在遥感场景分类等任务中的能力进行评估。核心方法是对SAM 3结构调整并隔离提示模态来诊断对齐机制,还制定代理评估协议。主要贡献是揭示跨模态干扰,表明SAM 3避免过拟合但受分辨率等限制,指明微调方向。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08191 2026-07-10 cs.CV 新提交 70%

Dual-Correlation Hypergraph Network for Unaligned RGBT Video Object Detection and A Large-scale Benchmark

用于未对齐RGBT视频目标检测的双相关超图网络及大规模基准数据集

Qishun Wang, Yapeng Li, Bin Luo, Zhengzheng Tu, Chenglong Li

机构 * Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室) School of Computer Science and Technology(计算机科学与技术学院) Anhui University(安徽大学) School of Artificial Intelligence(人工智能学院)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对RGBT视频目标检测中图像对空间未对齐问题,提出双相关超图网络DHNet,通过设计PSAM和DHFM模块捕获互补信息,还构建DVT-VOD1000数据集,实验表明该网络检测精度达最优,数据集和代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03795 2026-07-07 cs.CV 新提交 70%

InfraNet: Quality-Aware RGB Guidance for Efficient Infrared Object Detection

InfraNet:用于高效红外目标检测的质量感知RGB引导

Zichao Feng, Haodong Zhu, Jingying Yang, Sheng Xu, Yangyang Ren, Yuguang Yang, Xuhui Liu, Juan Zhang, Tian Wang, Linlin Yang, Baochang Zhang

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村科学城) Communication University of China(中国传媒大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对多模态感知系统在不利视觉条件下目标检测的挑战,提出InfraNet框架,采用非对称架构及质量感知融合模块,设计两种变体,实验表明其在低光等条件下准确且高效。

详情

展开后加载摘要…

URL PDF HTML 收藏