arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 600 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 600 篇

2607.02934 2026-07-07 cs.CV cond-mat.mtrl-sci cs.AI 新提交 73%

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

MatPhaseBench:用于材料相图理解的语义引导基准测试

Hanwen Wang, Sihan Liang, Zhiwei Liu, Yangang Wang, Wei Yan, Yuqin Liu, Zongguo Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) University of Manchester(曼彻斯特大学) Institute of Metal Research, Chinese Academy of Sciences(中国科学院金属研究所) China University of Geosciences(中国地质大学)

专题命中 多模态评测 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 介绍用于材料相图理解的MatPhaseBench基准测试,从文献选图与文字构建,有复杂科学图像理解、图文全面对齐、高质量人工监督文本采集三个关键特性,实验显示当前VLM距专家理解有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26029 2026-06-25 cs.CV cs.AI 新提交 73%

TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

TriViewBench: 多视图结构推理中受控复杂度缩放

Yu-Yang Chen, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出TriViewBench基准,通过合成3D场景控制物体数量和遮挡,评估18个多模态大模型在多视图推理中的能力层次和性能退化,发现跨视图空间表示是瓶颈。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19103 2026-06-18 cs.CV cs.AI 新提交 73%

ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL

ProductConsistency:通过SFT和RL改进基于指令的图像编辑中的产品身份保持

Mukund Khanna, Raj Singh Yadav, Kunal Singh

机构 * Fractal Analytics

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对基于指令的图像编辑中产品特征保持不足的问题,提出ProductConsistency数据集和循环一致性奖励,结合监督微调与强化学习,显著提升产品一致性、文本渲染和视觉质量。

Comments CVPR HiGen 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09634 2026-06-09 cs.CV cs.AI 新提交 73%

ATN3D: Density-Aware LiDAR-Radar Early 3D Object Detection Under Extreme Sparsity

ATN3D:面向极端稀疏性的密度感知激光雷达-雷达早期3D目标检测

Debojyoti Biswas, Xianbiao Hu

机构 * University of California, Berkeley(加州大学伯克利分校) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对远距离稀疏感知下早期融合丢失信息、通道监督不均衡的问题,提出ATN3D框架,通过密度感知融合、占用门控邻域聚合、证据条件通道自注意力和距离感知损失,在VoD数据集上显著提升远距离检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07590 2026-08-11 stat.AP q-bio.QM 新提交 71%

Uncertainty-Aware Missing-Data Multimodal Latent for Fetal-Growth Analysis

用于胎儿生长分析的不确定性感知缺失数据多模态潜在模型

Tiago Cortinhal, César Díaz-Parga, Gabriel Bernardino, Marta Nuñez-Garcia

专题命中 多模态评测 :multimodal(title)

AI总结 该研究提出线性高斯因子模型,对977例胎儿的四类测量数据拟合后发现测量模块几乎独立,可通过边缘化缺失值得到反映可用数据不确定性的生长谱,其重建残差还可用于数据质量筛选。

Comments https://github.com/TiagoCortinhal/fgr-geometry

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08641 2026-08-11 cs.CR 新提交 71%

Whose Refusal Is It? The Unmeasured Contribution of Black-Box Multimodal Guardrails

这是谁的拒绝?黑盒多模态安全护栏的未被衡量的贡献

Haoyu Zhang, Xiao Luo, Haowen Xu, Yi Feng, Shibo Zheng, Mohammad Zandsalimy, Shanu Sushmita

专题命中 多模态评测 :multimodal(title)

AI总结 该研究指出黑盒多模态安全护栏的评估指标混淆了护栏与目标模型的弃权贡献,通过实验揭示了有效载荷通道和内部读取文本对护栏贡献的影响,并修正了相关评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11931 2026-07-15 cs.HC 新提交 71%

Reading the Eyes in VR: Multimodal Modeling of Social Intelligence

在虚拟现实中解读眼神:社会智能的多模态建模

Mohammad Fahim Abrar, Shayla Sharmin, Roghayeh Leila Barmaki

专题命中 多模态评测 :multimodal(title)

AI总结 研究通过在 Unity 中为桌面和 VR 实现 RMET 并进行 2x2 混合研究,探究呈现媒介和反馈对 RMET 行为的影响。结果表明即时反馈影响注视和脑电,呈现媒介无客观差异,VR 可用性高,为 RMET 在受控环境作过程感知评估任务提供证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04647 2026-07-07 stat.ML cs.LG stat.CO 新提交 71%

Integrating Neural Encoders in Bayesian Generalized Linear Mixed Models for Multimodal Data

为多模态数据将神经编码器集成至贝叶斯广义线性混合模型中

Yuankang Zhao, Youngsoo Baek, Felipe A. Medeiros, Samuel Berchuck, Matthew M. Engelhard

机构 * Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计与生物信息学系) Department of Ophthalmology, University of Miami(迈阿密大学眼科系)

专题命中 多模态评测 :multimodal(title)

AI总结 针对传统广义线性混合模型无法适配高维多模态数据的问题,该研究联合训练模态专属神经编码器与GLMM目标,通过方差校正随机梯度MCMC实现推断,兼顾效应可解释性与多模态纵向数据的可扩展不确定性分析。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13900 2026-06-15 cond-mat.mtrl-sci 新提交 71%

Multi-modal machine learning analysis of GaSe molecular beam epitaxy growth conditions

GaSe分子束外延生长条件的多模态机器学习分析

Mingyu Yu, Isaiah A. Moses, Wesley F. Reinhart, Stephanie Law

专题命中 多模态评测 :multi-modal(title)

AI总结 提出机器学习引导的GaSe薄膜MBE生长框架,利用RHEED原位诊断与XRD、AFM非原位表征,通过无监督学习、互信息分析和监督学习揭示生长条件对薄膜质量的影响,实现异常检测与预测优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12158 2026-08-13 cs.CV 新提交 70%

Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉

Byungoh Ko, Jinyoung Park, Jongha Kim, Jeehye Na, Jaewon Cho, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 多模态评测 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09519 2026-08-11 cs.CV cs.LG 新提交 70%

XFeat Revisited: Reproducibility and Evaluation of a Lightweight Image Matcher

XFeat 再探讨:轻量级图像匹配器的可复现性与评估

Lazar Đoković, Aimee Lin

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究复现并评估轻量级图像匹配器XFeat,发现其在部分基准数据集上表现接近或优于原始检查点,同时揭示其架构设计的局限性及跨模态匹配的性能边界。

Comments 21 pages, 6 figures. Published in Transactions on Machine Learning Research (TMLR); Reproducibility Certification

Journal ref Transactions on Machine Learning Research, August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00068 2026-08-04 cs.CV 新提交 70%

SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining

SafeBuild-Bench:一种具有图增强数据挖掘能力的时序鲁棒建筑安全基准

Yi Cui, Zilin Wang, Yijie Xu, Qianyi Cai, Huizai Yao, Shuai Jiang, Bingzhuo Zhong, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 研究人员构建了图增强数据挖掘的时序鲁棒建筑安全基准SafeBuild-Bench,开发可扩展验证的GEMS流水线,发现现有多模态大语言模型对建筑安全理解仍不足。

Comments Accepted by KDD 2026. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27856 2026-07-31 cs.CV 新提交 70%

Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation

基准测试用于小样本医学图像分割的基础模型与大语言模型

Jinghong Liu, Yuchuan Deng, Fanping Liu, Meng Huang, Xirong Li

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16401 2026-07-21 cs.CV 新提交 70%

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

Apple-$π$:基于视频对基于法律的物理智能进行思维基准测试

Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对视频模型评估仅看输出层面的不足,提出Apple-PI基准,含数据集、协议和评估套件三部分,通过对11个模型测试发现其距可靠世界模拟器差距大,并揭示了一些瓶颈与差距,为指导视频模型发展提供诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09583 2026-07-13 cs.CV 新提交 70%

Promptable Concept Segmentation from Above: Evaluating SAM 3's Zero-Shot and One-Shot Capabilities in Remote Sensing

从上方进行可提示的概念分割:评估SAM 3在遥感中的零样本和单样本能力

Mohammad Dabaja, Turgay Celik

机构 * University of Agder(阿格德大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究在严格零样本和单样本约束下,对SAM 3在遥感场景分类等任务中的能力进行评估。核心方法是对SAM 3结构调整并隔离提示模态来诊断对齐机制,还制定代理评估协议。主要贡献是揭示跨模态干扰,表明SAM 3避免过拟合但受分辨率等限制,指明微调方向。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08191 2026-07-10 cs.CV 新提交 70%

Dual-Correlation Hypergraph Network for Unaligned RGBT Video Object Detection and A Large-scale Benchmark

用于未对齐RGBT视频目标检测的双相关超图网络及大规模基准数据集

Qishun Wang, Yapeng Li, Bin Luo, Zhengzheng Tu, Chenglong Li

机构 * Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室) School of Computer Science and Technology(计算机科学与技术学院) Anhui University(安徽大学) School of Artificial Intelligence(人工智能学院)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对RGBT视频目标检测中图像对空间未对齐问题,提出双相关超图网络DHNet,通过设计PSAM和DHFM模块捕获互补信息,还构建DVT-VOD1000数据集,实验表明该网络检测精度达最优,数据集和代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03795 2026-07-07 cs.CV 新提交 70%

InfraNet: Quality-Aware RGB Guidance for Efficient Infrared Object Detection

InfraNet:用于高效红外目标检测的质量感知RGB引导

Zichao Feng, Haodong Zhu, Jingying Yang, Sheng Xu, Yangyang Ren, Yuguang Yang, Xuhui Liu, Juan Zhang, Tian Wang, Linlin Yang, Baochang Zhang

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村科学城) Communication University of China(中国传媒大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对多模态感知系统在不利视觉条件下目标检测的挑战,提出InfraNet框架,采用非对称架构及质量感知融合模块,设计两种变体,实验表明其在低光等条件下准确且高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27413 2026-06-29 q-bio.GN cs.AI 新提交 70%

GRAFT: Biological Graph and Hypergraph Benchmarks for Linked Gene Expression and Phenotypic Trait Prediction in Arabidopsis thaliana

GRAFT:用于拟南芥连锁基因表达与表型性状预测的生物图与超图基准

Manuel Serna-Aguilera, Vanshika Jindal, Fiona L. Goggin, Jiamei Li, Aranyak Goswami, Alexander Bucksch, Suxing Liu, Khoa Luu

机构 * Department of Electrical Engineering and Computer Science, University of Arkansas(电气工程与计算机科学系,亚拉巴马大学) Department of Entomology and Plant Pathology, University of Arkansas(昆虫学与植物病理学系,亚拉巴马大学) Department of Animal Science, University of Arkansas(动物科学系,亚拉巴马大学) School of Plant Sciences, University of Arizona(植物科学学院,亚利桑那大学) Georgia State University(佐治亚州立大学) CVIU Lab, University of Arkansas(CVIU实验室,亚拉巴马大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 提出GRAFT多模态数据集,整合拟南芥基因表达与表型性状数据,支持表型预测和可解释图学习,并基准测试回归与超图基线方法。

Comments arXiv admin note: text overlap with arXiv:2508.14934

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24539 2026-06-24 cs.CV 新提交 70%

PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

PointVG-R: 通过视觉思维链在多模态大语言模型中内化几何推理以实现精确指向定位

Ling Li, Bowen Liu, Zinuo Zhan, Jianhui Zhong, Ziyu Zhu, Bingcai Wei, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Wuhan University(武汉大学)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 提出PointVG-R,通过强化学习和冷启动数据内化几何推理,结合视觉思维链数据集EgoPoint-CoT,在指向性视觉定位任务中实现mIoU提升15.86个点的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20103 2026-06-19 cs.CV 新提交 70%

Geometry-Preserving in 3D Gaussian Splatting for LiDAR-Camera Extrinsic Calibration

3D高斯溅射中保持几何结构的LiDAR-相机外参标定

Kyoleen Kwak, Daeho Kim, Jeong Woon Lee, Hyoseok Hwang

机构 * Kyung Hee University(庆熙大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对LiDAR-相机标定中跨模态特征稀缺问题,提出通过多视图LiDAR深度监督和阻止光度梯度更新高斯空间参数来保持3DGS代理的度量几何,提升标定精度。

Comments Accepted to ECCV 2026. 15 pages (excluding references), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13258 2026-06-17 cs.AI 新提交 70%

MOSAIC: Modality-Specific Adaptation for Incremental Continual Learning in Parkinson's Disease Gait Assessment

MOSAIC: 帕金森病步态评估中增量持续学习的模态特定适应

Minlin Zeng, Zhipeng Zhou, Yang Qiu, Martin J. McKeown, Zhiqi Shen

机构 * Nanyang Technological University(南洋理工大学) Pacific Parkinson's Research Centre, University of British Columbia(不列颠哥伦比亚大学太平洋帕金森研究中心)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对帕金森病步态评估中模态增量场景,提出MOSAIC框架,通过模态特定预热、统计解耦MSBN架构和课程引导排斥目标,解决跨模态蒸馏不可靠、统计偏移和可塑性下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16749 2026-06-16 cs.CV 新提交 70%

Structure-aware Knowledge-guided Heterogeneous Mamba for Zygomaticomaxillary Suture Assessment

结构感知知识引导的异构Mamba用于颧上颌缝评估

Xiaoqi Guo, Birui Chen, Xinquan Yang, Chaoyun Zhang, Xuefen Liu, Mianjie Zheng, Kun Tang, Xuguang Li, Wen Ma, Yanhua Xu, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Affiliated Stomatology Hospital of Kunming Medical University(昆明医科大学附属口腔医院) Shenzhen University General Hospital(深圳大学总医院)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出首个ZMS公开数据集(3790张图像,覆盖4-24岁),并设计SKMamba框架,通过解耦双路径架构、隐式边缘提取器和跨模态语义对齐模块,实现自动化ZMS成熟度评估,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14025 2026-06-15 cs.CV 新提交 70%

GarmentSketch: Large-scale Sketch-to-Fashion Benchmark

GarmentSketch:大规模草图到时尚基准

Duong-Duy-Khang Bui, Minh-Tan Pham, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。

Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07962 2026-06-09 cs.CV 新提交 70%

ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?

ChronoPhyBench:多模态大语言模型真正理解世界还是仅仅利用语言先验?

Bin Zhu, Yanhao Jia, Kexin Zhao, Jie Wang, Munan Ning, Hao Li, Yuwei Niu, Tanqing Sun, Huangchong Yan, Mingjun Pan, Xinyi Wu, Qishen Yin, Yunyang Ge, Shuai Zhao, Li Yuan

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Rabbitpre Intelligence Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出ChronoPhyBench基准,通过视频上下文和文本描述强制模型进行物理状态推理,揭示当前开源模型物理推理能力仍处初级阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07953 2026-06-09 cs.AI 新提交 70%

Unification of Closed-Open Industrial Detection Scenarios: New Large-Scale Benchmarks,Challenges and Baselines

闭集与开集工业检测场景的统一:新的大规模基准、挑战与基线

Zekai Zhang, Jinglin Zhang, Qinghui Chen, Gang Li, Da Chen, Shuainan Jing, He Wang, Dagang Li, Cong Liu, Cong Bai, Shengyong Chen

机构 * Shandong University(山东大学) University Paris Dauphine, PSL Research University, CNRS, UMR 7534(巴黎多芬纳大学,PSL研究大学,法国国家科学研究中心,UMR 7534) Qilu University of Technology(齐鲁工业大学) Zhejiang University of Technology(浙江工业大学) Nova University of Lisbon(里斯本新大学) Macau University of Science and Technology(澳门科技大学) Tianjin University of Technology(天津理工大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对工业缺陷检测中数据集稀缺和人工提示依赖问题,提出含百万样本的MMIOC-1M基准和RTVPNet网络,通过专家辅助域投影、能量稀疏采样和双向文本-视觉交互实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20990 2026-07-24 cs.ET 新提交 67%

LivePhys: Transforming Static Physics Problems into Interactive Simulations via a Scan-to-Play Framework

LivePhys:通过扫描即播放框架将静态物理问题转化为交互式模拟

Xiaowei Dai, Ziyu Luo, Xiangwen Zhang, Xiaoming Chen, Juan Wu, Yonghong Ke

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 研究针对教科书中静态物理问题学习的高认知负担,提出LivePhys框架,通过多模态处理构建中间表示,用大语言模型推理并由物理引擎执行生成交互式模拟,显著提升模拟性能并降低学习者认知负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20092 2026-07-23 cs.CV cs.AI cs.CL 新提交 67%

ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

ENTRAP-VL:视觉语言模型中双上下文夹带的分类探测器

Karan Goyal, Afreen Hossain, Debojyoti Das, Vishal Bhutani

机构 * IIIT Delhi(德里信息技术学院) Dr. Ambedkar Institute of Technology(阿姆贝德卡尔技术学院) Heritage Institute of Technology(遗产技术学院) PwC(普华永道)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究视觉语言模型中上下文夹带现象,提出需构建分类结构化双模态工具。引入ENTRAP-VL数据集,含1500个项目,跨八类,分文本和视觉夹带流,提供工具、分类法及评估协议,助力社区严格研究该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09528 2026-07-13 cs.LG cs.CR cs.DB cs.SI 新提交 67%

TSAI-MetaFraud: A Benchmark Dataset for Financial Fraud Transaction and Behavioral Risk Detection in Metaverse Ecosystems

TSAI-MetaFraud:用于元宇宙生态系统中金融欺诈交易和行为风险检测的基准数据集

Refat Ishrak Hemel, Ehsan Hallaji, Roozbeh Razavi-Far

机构 * tsai-unb(tsai - 新不伦瑞克大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 针对元宇宙平台带来的欺诈等新挑战及现有数据集局限性,提出TSAI-MetaFraud基准数据集,整合多类信息与欺诈场景,定义多项基准任务并进行基线评估,为元宇宙生态系统相关研究提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05989 2026-07-08 cs.CR 新提交 67%

ProvICS: A Provenance-based Intrusion Detection for Industrial Control Systems

ProvICS:一种基于溯源的工业控制系统入侵检测方法

Md Neyamul Islam Shibbir, Deepak K Tosh

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 针对工业控制系统因信息技术与运营技术融合面临多阶段网络攻击,且基于溯源的入侵检测系统在工业网络物理系统中适用性待探索的问题,提出ProvICS多模态溯源数据集,经实验验证其能有效检测攻击事件,填补现有基准空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05614 2026-07-08 cs.CL cs.AI cs.CV 新提交 67%

BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension

BaFCo:用于复杂孟加拉语表格理解的文档理解基准

Abu Tyeb Azad, Ishita Sur Apan, Fahim Ahmed, Sumaiya Karim Katha, Ezharuddin Jubaer, Armun Alam, Pranjal Kumar Nandi, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

机构 * Wichita State University(威奇托州立大学) Center for Computational & Data Sciences(计算与数据科学中心) University of Dhaka(达卡大学) Amazon GenAI(亚马逊生成式人工智能)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对孟加拉语表格理解因高质量标注数据稀缺受限的问题,引入BaFCo基准数据集,涵盖多领域复杂表格。定义细粒度标注模式,评估多种MLLMs,发现其理解孟加拉语表格有局限,尤其在定位细粒度实体方面。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏