arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2607.08489 2026-07-10 cs.CV cs.AI cs.HC 新提交 62%

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

VEGAS:通过注视进行与人类对齐的视频字幕评估

Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AMD(超威半导体公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉语言模型视频字幕忽视观众注意力问题,提出VEGAS无需训练的度量标准,利用注视采样个性化文本,通过拒绝采样选字幕,实验表明其能使字幕更好对齐人类焦点,提升下游检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11539 2026-07-08 cs.CV cs.AI 版本更新 62%

CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space

CLAY:视觉相似性模拟能力在视觉-语言嵌入空间中的条件性

Sohwi Lim, Lee Hyoseok, Jungjoon Park, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 CLAY通过重构预训练视觉-语言模型的嵌入空间,实现基于文本条件的灵活相似性计算,提升多条件检索效率与准确性。

Comments CVPR 2026, Project page: https://sohwi-lim.github.io/CLAY

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03900 2026-07-07 cs.CV cs.LG 新提交 62%

USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning

USE:一种用于测试时提示调整的统一自集成框架

Siru Jiang, Jian Liang, Ran He, Tieniu Tan

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所国家智能机器人实验室及模式识别实验室) Nanjing University(南京大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 重新审视测试时提示调整(TPT),揭示其优化可视为从自生成伪标签隐式学习,在此基础上提出统一自集成框架(USE),优化时引入自集成策略,实验表明USE及其自集成策略表现出色。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29888 2026-06-30 cs.LG cs.CV 62%

Same Concept, Different Directions: Cross-Modal Feature Heterogeneity in Sparse Autoencoders

同一概念,不同方向:稀疏自编码器中的跨模态特征异质性

Chungpa Lee, Jihoon Kwon, Kyle Min, Jy-yong Sohn

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 发现视觉-语言模型中同一概念在不同模态下的特征方向不一致(跨模态特征异质性),并提出训练模态特定稀疏自编码器后对齐对应特征的方法,提升重建保真度和跨模态检索与概念引导性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12282 2026-06-30 cs.CV cs.AI 62%

CytoCLIP: Learning Cytoarchitectural Characteristics in Developing Human Brain Using Contrastive Language Image Pre-Training

CytoCLIP:利用对比语言图像预训练学习发育人类大脑的细胞架构特征

Pralaypati Ta, Sriram Venkatesaperumal, Keerthi Ram, Mohanasankar Sivaprakasam

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 CytoCLIP通过对比语言图像预训练框架学习人类大脑细胞架构特征,通过低分辨率和高分辨率模型变体实现区域分类和跨模态检索,实验表明其在整体区域和高分辨率图像分类中表现优异。

Journal ref Neuroinformatics, Volume 24, article number 38 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11421 2026-06-25 cs.CV cs.LG 版本更新 62%

BOFA: Bridge-Layer Orthogonal Low-Rank Fusion for CLIP-Based Class-Incremental Learning

BOFA: 基于CLIP的类增量学习中的桥接层正交低秩融合

Lan Li, Tao Hu, Da-Wei Zhou, Jia-Qi Yang, Han-Jia Ye, De-Chuan Zhan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出BOFA框架,通过将适应限制在CLIP的跨模态桥接层并使用正交低秩融合防止遗忘,无需额外参数或数据回放,实现高效类增量学习。

Comments Accepted by AAAI 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(27): 22967-22975, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22352 2026-06-23 cs.LG cs.AI 新提交 62%

On the Sparsity-Storage-Accuracy Tradeoff in Parsimoniously Activated Dictionary Learning

稀疏性-存储-精度权衡在简约激活字典学习中的研究

Zihui Zhao, Yuanbo Tang, Yang Li

机构 * Tsinghua University, Institute of Data and Information(清华大学数据与信息研究院) Shenzhen Key Laboratory of Ubiquitous Data Enabling(深圳泛在数据赋能重点实验室)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出简约激活字典学习(PADL)的结构化生成模型解释,推导出稀疏性、存储成本与重建精度之间的权衡关系,并开发出无需手动调参的高效算法,在视觉基准上取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20177 2026-06-23 cs.CV cs.AI 新提交 62%

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

评估与增强遥感多模态大语言模型的否定理解能力

Haochen Han, Jue Wang, Alex Jinpeng Wang, Fangming Liu

机构 * Peng Cheng Laboratory(鹏城实验室) Tsinghua University(清华大学) Central South University(中南大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出RS-Neg基准评估遥感MLLMs的否定理解,并设计NeFo方法通过测试时学习利用约5%未标注样本显著提升模型性能。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22645 2026-06-23 cs.CV cs.AI 版本更新 62%

HERMAN: Hierarchical Representation Matching for CLIP-based Class-Incremental Learning

HERMAN: 基于CLIP的类增量学习中的层次表示匹配

Zhen-Hao Xie, Yan Wang, Lan Li, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

机构 * School of Artificial Intelligence and the State Key Laboratory for Novel Software Technology, Nanjing University(人工智能学院和新型软件技术国家重点实验室,南京大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出HERMAN方法,利用LLM递归生成判别性文本描述,匹配不同语义层次并自适应路由,解决CLIP在类增量学习中的灾难性遗忘问题,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17118 2026-06-17 cs.LG cs.AI 新提交 62%

MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化

Yuanteng Chen, Peisong Wang, Zhilei Liu, Nanxin Zeng, Yuantian Shao, Shiqiang Lang, Tao Liu, Chuangyi Li, Qinghao Hu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对MoE多模态大语言模型在专家重要性估计中存在的跨模态和视觉内偏差,提出模态分解的专家级混合精度量化框架MODE,通过分解选择频率、过滤冗余视觉令牌并评估模态敏感性,在给定预算下分配比特宽度,在W3A16下平均性能损失控制在2.9%以内。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10803 2026-06-10 cs.CL cs.AI cs.CV 新提交 62%

Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use

超越API:探索多模态大语言模型在物理工具使用中的极限

Zhixin Ma, Yutong Zhou, Yongqi Li, Chong-Wah Ngo, Wenjie Li

机构 * Singapore Management University(新加坡管理大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出PhysTool-Bench基准,评估多模态大语言模型在真实场景中识别物理工具并规划使用的能力,发现最强模型仅完成21%任务,揭示感知与规划双重缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09868 2026-06-10 cs.LG cs.AI 新提交 62%

SPACE: Source-free Proxy Anchor Concept Erasure for MLLMs

SPACE: 面向多模态大语言模型的无源代理锚点概念擦除

Zhijing Zhang, Jiaqi Ding, Qianshan Wei, Nan Zhou, Jiaqi Li, Yongliang Wu, Tongxin Zhu, Xiaolin Fang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SPACE框架,首个针对多模态大语言模型的无源机器遗忘方法,通过文本引导的代理锚点选择和双约束语义隔离,在不访问目标数据的情况下擦除概念,并保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13428 2026-05-27 cs.CV cs.AI 62%

"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models

PhyWorldBench:文本到视频模型中物理真实性的全面评估

Jing Gu, Xian Liu, Yu Zeng, Ashwin Nagarajan, Fangrui Zhu, Daniel Hong, Yue Fan, Qianqi Yan, Kaiwen Zhou, Ming-Yu Liu, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) NVIDIA Research(NVIDIA研究) Northeastern University(东北大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出PhyWorldBench基准,通过1050个提示评估12个视频生成模型在物理规律遵循上的表现,并引入反物理类别,利用多模态大语言模型进行零样本评估。

Comments 35 pages, 21 figures

Journal ref ICLR 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14635 2026-05-15 cs.CV cs.AI 62%

MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models

MultiEmo-Bench:多标签视觉情绪分析用于多模态大语言模型

Tianwei Chen, Takuya Furusawa, Yuki Hirakawa, Ryotaro Shimizu, Mo Fan, Takashi Wada

机构 * ZOZO NEXT Inc.(ZOZO NEXT公司)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个多标签视觉情绪分析基准数据集,用于评估多模态大语言模型对图像引发情绪的预测能力。通过改进标注方案,提供更可靠的数据集,并评估了多个模型在情绪预测上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04692 2026-05-14 cs.CL cs.AI cs.CV 62%

Is a Picture Worth a Thousand Words? Adaptive Multimodal Fact-Checking with Visual Evidence Necessity

图片胜过千言吗?基于视觉证据必要性的自适应多模态事实核查

Jaeyoon Jung, Yejun Yoon, Kunwoo Park

机构 * School of AI Convergence, Soongsil University(顺斯利大学人工智能融合学院) MAUM AI Inc.(MAUM人工智能公司) Department of Intelligent Semiconductors, Soongsil University(顺斯利大学智能半导体系)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文挑战了多模态证据普遍提升性能的假设,提出AMuFC框架,通过分析和验证器模型自适应使用视觉证据,提升事实核查准确性。

Comments preprint, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11722 2026-05-13 cs.CV cs.LG 62%

EPIC: Efficient Predicate-Guided Inference-Time Control for Compositional Text-to-Image Generation

EPIC: 用于组合文本到图像生成的高效谓词引导推理控制

Sunung Mun, Sunghyun Cho, Jungseul Ok

机构 * Graduate School of Artificial Intelligence, POSTECH(人工智能研究生院,POSTECH) Department of Computer Science & Engineering, POSTECH(计算机科学与工程系,POSTECH)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.LG

AI总结 EPIC通过谓词引导的搜索方法提升组合式文本到图像生成的准确性,减少计算成本,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19182 2026-05-08 cs.CV cs.AI 62%

SOWing Information: Cultivating Contextual Coherence with MLLMs in Image Generation

信息播种:利用大规模语言模型在图像生成中培养上下文一致性

Yuhan Pei, Ruoyu Wang, Yongqi Yang, Ye Zhu, Olga Russakovsky, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SOW方法,通过多模态大语言模型实现文本-视觉到图像生成,提升图像像素级条件保真度和视觉语义一致性。

Comments Project page: https://pyh-129.github.io/SOW/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23195 2026-04-28 cs.CV cs.AI 62%

AnalogRetriever: Learning Cross-Modal Representations for Analog Circuit Retrieval

AnalogRetriever: 为模拟电路检索学习跨模态表示

Yihan Wang, Lei Li, Yao Lai, Jing Wang, Yan Lu

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Cambridge(剑桥大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AnalogRetriever,通过构建高质量数据集和三模态检索框架,实现跨模态的模拟电路检索,实验表明其在六个方向上的Recall@1达到75.2%,显著优于现有方法。

Comments 10 pages, 7 figures. Yihan Wang and Lei Li contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20544 2026-04-23 cs.CV cs.AI 62%

Evian: Towards Explainable Visual Instruction-tuning Data Auditing

Evian:迈向可解释的视觉指令微调数据审计

Zimu Jia, Mingjie Xu, Andrew Estornell, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ByteDance Seed(字节跳动种子)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Evian框架,通过分解评估模型响应的三大认知组件,解决数据审计中逻辑一致性与事实准确性不足的问题,验证高质量小规模数据优于大规模低质量数据。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07415 2026-04-21 cs.CV cs.CL cs.LG 62%

RA-RRG: Multimodal Retrieval-Augmented Radiology Report Generation with Key Phrase Extraction

RA-RRG:结合关键短语提取的多模态检索增强放射学报告生成

Jonggwon Park, Byungmu Yoon, Soobum Kim, Kyoyun Choi

机构 * DEEPNOID Inc.(DEEPNOID公司) Department of Artificial Intelligence and Data Science, Sejong University(Sejong大学人工智能与数据科学系)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 RA-RRG通过结合多模态检索与大语言模型生成放射学报告,减少幻觉和计算需求,实验显示在CheXbert指标上优于现有模型。

Comments ACL 2026, Findings of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16175 2026-04-20 cs.AI cs.CV 62%

MARCH: Multi-Agent Radiology Clinical Hierarchy for CT Report Generation

MARCH:多智能体放射科临床层级用于CT报告生成

Yi Lin, Yihao Ding, Yonghui Wu, Yifan Peng

机构 * Weill Cornell Medicine(韦尔·科恩医学中心) University of Western Australia(西澳大学) University of Florida(佛罗里达大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 MARCH通过模拟放射科专业层级,采用多智能体框架提升CT报告生成的临床准确性和语言准确性。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13777 2026-04-14 cs.CV cs.AI cs.SD 62%

Sat2Sound: A Unified Framework for Zero-Shot Soundscape Mapping

Sat2Sound:一种用于零样本声音景观映射的统一框架

Subash Khanal, Srikumar Sastry, Aayush Dhakal, Adeel Ahmad, Abby Stylianou, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Taylor Geospatial(泰勒地理空间) Saint Louis University(圣路易斯大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Sat2Sound通过融合多模态数据,实现地球表面声音分布的零样本映射,通过对比学习和代码本对齐学习发现跨模态的'声音景观概念',在GeoSound和SoundingEarth基准上取得最佳性能。

Comments Accepted to EarthVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06901 2026-04-09 cs.CE cs.AI cs.CV cs.CY cs.ET 62%

XR-CareerAssist: An Immersive Platform for Personalised Career Guidance Leveraging Extended Reality and Multimodal AI

XR-CareerAssist:一种结合扩展现实与多模态AI的沉浸式个性化职业指导平台

N. D. Tantaroudas, A. J. McCracken, I. Karachalios, E. Papatheou, V. Pastrikakis

机构 * Institute of Communications and Computer Systems (ICCS)(通信与计算机系统研究所) DASKALOS-APPS National Technical University of Athens(雅典国家技术大学) University of Exeter(埃克塞特大学) CVCOSMOS Ltd(CVCOSMOS有限公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出XR-CareerAssist平台,结合扩展现实与多模态AI,提供沉浸式、多语言的职业指导。系统整合语音识别、神经机器翻译、对话训练助手、视觉-语言模型和3D虚拟形象,通过动态Sankey图展示职业轨迹,实验显示高准确率和用户满意度。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04953 2026-04-08 cs.CV cs.AI cs.HC cs.IR cs.MM 62%

Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity

生成AI用于视频预告片合成:从提取启发式方法到自回归创造力

Abhishek Dharmaratnakar, Srivaths Ranganathan, Debanshu Das, Anushree Sinha

机构 * Google LLC(谷歌有限责任公司)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了自动视频预告片生成领域从启发式提取到深度生成合成的转变,探讨了自回归Transformer、LLM协同流程和文本到视频基础模型等生成技术,并讨论了高保真神经合成的伦理挑战。

Comments 7 pages, 3 figures, accepted in WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09228 2026-04-07 cs.CV cs.AI 62%

Clear Roads, Clear Vision: Advancements in Multi-Weather Restoration for Smart Transportation

清晰的道路,清晰的视野:智能交通中多天气恢复的进展

Vijay M. Galshetwar, Praful Hambarde, Prashant W. Patil, Akshay Dudhane, Sachin Chaudhary

机构 * Finolex Academy of Management and Technology(Finolex管理与技术学院) Drone Lab, Centre for Artificial Intelligence and Robotics, IIT Mandi(印度理工学院曼迪分校人工智能与机器人中心无人机实验室) Mehta Family School of Data Science and Artificial Intelligence, IIT Guwahati(印度理工学院古瓦哈提分校梅塔家族数据科学与人工智能学院) SPACE42 Centre of Excellence: Artificial Intelligence, School of Computer Science, UPES Dehradun(UPES德拉敦分校计算机科学学院人工智能卓越中心)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了图像和视频恢复技术,以缓解天气引起的视觉障碍,分类了传统方法和数据驱动模型,并讨论了多天气系统和未来方向。

Comments Accepted for publication in IEEE Transactions on Intelligent Transportation Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03454 2026-04-07 cs.CV cs.AI 62%

RDFace: A Benchmark Dataset for Rare Disease Facial Image Analysis under Extreme Data Scarcity and Phenotype-Aware Synthetic Generation

RDFace:一种用于罕见疾病面部图像分析的基准数据集,在极端数据稀缺和表型意识合成生成下

Ganlin Feng, Yuxi Long, Hafsa Ali, Erin Lou, Fahad Butt, Qian Liu, Yang Wang, Pingzhao Hu

机构 * Western University(西安大略大学) Concordia University(康考迪亚大学) University of Toronto(多伦多大学) University of Winnipeg(温尼伯大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 RDFace包含456张儿童面部图像,涵盖103种罕见遗传疾病,旨在开发和评估在低数据条件下高效的人工智能模型,通过合成生成和数据增强提升诊断准确率。

Comments Accepted to CVPR 2026. 8 pages main paper + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03296 2026-04-07 cs.CV cs.AI 62%

3D-IDE: 3D Implicit Depth Emergent

3D-IDE: 3D隐式深度涌现

Chushan Zhang, Ruihan Lu, Jinguang Tong, Yikai Wang, Hongdong Li

机构 * School of Computing, Australian National University(澳大利亚国立大学计算学院) School of EECS, The University of Queensland(昆士兰大学电气工程与计算机科学学院) FreiNexus School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-IDE方法,通过几何自监督学习实现3D感知的隐式涌现,消除了深度和姿态依赖,提升推理效率和多任务性能。

Comments CVPR 2026 accepted. Project page: https://chushanzhang.github.io/3D-IDE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00799 2026-04-06 cs.CV cs.CL cs.LG 62%

Multimodal Language Models Cannot Spot Spatial Inconsistencies

多模态语言模型无法发现空间不一致性

Om Khangaonkar, Hadi J. Rad, Hamed Pirsiavash

机构 * University of California, Davis(加州大学戴维斯分校) Shell(壳牌) TU Delft(代尔夫特理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 研究探讨多模态大语言模型在识别3D几何空间不一致性方面的不足,提出生成空间不一致图像对的方法,发现先进模型在该任务上表现欠佳,揭示其对物理世界理解的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11448 2026-03-31 cs.LG cs.CV 62%

Hierarchical Concept Embedding & Pursuit for Interpretable Image Classification

层次化概念嵌入与追求用于可解释的图像分类

Nghia Nguyen, Tianjiao Ding, René Vidal

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出HCEP框架,通过在潜在空间中诱导概念嵌入的层次结构,利用层次稀疏编码恢复图像中的概念,提升分类可解释性与精度。

Comments To be published in Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23627 2026-03-26 cs.CV cs.AI 62%

Ukrainian Visual Word Sense Disambiguation Benchmark

乌克兰视觉词义消歧基准

Yurii Laba, Yaryna Mohytych, Ivanna Rohulia, Halyna Kyryleyza, Hanna Dydyk-Meush, Oles Dobosevych, Rostyslav Hryniv

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个评估乌克兰视觉词义消歧任务的基准,通过八种多语言大模型测试,发现乌克兰与英语在该任务上存在显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏