arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4454 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4454 篇

2601.14921 2026-01-22 cs.RO cs.AI 79%

Vision-Language Models on the Edge for Real-Time Robotic Perception

边缘计算上的视觉-语言模型用于实时机器人感知

Sarat Ahmad, Maryam Hafeez, Syed Ali Raza Zaidi

机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文研究了在边缘计算平台上部署视觉-语言模型以提高机器人感知的实时性与准确性,通过实验对比边缘与云部署的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13705 2026-01-21 cs.CV 79%

Reasoning or Pattern Matching? Probing Large Vision-Language Models with Visual Puzzles

推理还是模式匹配?通过视觉谜题探测大型视觉-语言模型

Maria Lymperaiou, Vasileios Karampinis, Giorgos Filandrianos, Angelos Vlachos, Chrysoula Zerva, Athanasios Voulodimos

机构 * National Technical University of Athens(国家技术大学雅典) Instituto de Telecomunicações(电信研究所)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文通过视觉谜题探测大型视觉-语言模型的推理能力,揭示其在泛化、感知与推理整合及执行一致性方面的局限,并提出未来基准和系统的发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11801 2026-01-21 cs.RO cs.AI 79%

RobotDesignGPT: Automated Robot Design Synthesis using Vision Language Models

RobotDesignGPT: 基于视觉语言模型的自动化机器人设计合成

Nitish Sontakke, K. Niranjan Kumar, Sehoon Ha

机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.AI

AI总结 RobotDesignGPT利用视觉语言模型实现自动化机器人设计,通过用户提示和参考图像生成美观且运动学有效的机器人设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07695 2026-01-16 cs.CV 79%

Smooth Operator: Smooth Verifiable Reward Activates Spatial Reasoning Ability of Vision-Language Model

平滑操作符:平滑可验证奖励激活视觉-语言模型的空间推理能力

Siwen Jiao, Tianxiong Lv, Kangan Qian, Chenxu Zhao, Xiuyuan Zhu, Tianlun Li, Xiaolong Cheng, Jinyu Li, Zhihao Liao, Yang Cai

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出平滑可验证奖励激活方法,通过平滑操作符和绝对保持GRPO框架提升视觉-语言模型对3D场景的理解能力,实现性能与数据效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02064 2026-01-16 cs.CV 79%

RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video

RTV-Bench: 通过实时视频对多模态大语言模型的连续感知、理解和推理进行基准测试

Shuhang Xun, Sicheng Tao, Jungang Li, Yibo Shi, Zhixin Lin, Zhanhui Zhu, Yibo Yan, Hanqian Li, Linghao Zhang, Shikang Wang, Yixin Liu, Hanbo Zhang, Ying Ma, Xuming Hu

机构 * HIT(哈尔滨工业大学) HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) XJTU(西安交通大学) SDU(山东大学) CityU(城市大学) HUST(华中科技大学)

专题命中 视觉推理 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

AI总结 RTV-Bench通过实时视频对多模态大语言模型的连续感知、理解和推理能力进行细粒度基准测试,揭示了实时模型在长时段视频处理中的性能优势与局限。

Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track;

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08292 2026-01-14 cs.CV 79%

KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?

KidVis: 多模态大语言模型是否具备六岁儿童的视觉感知能力?

Xianfeng Wang, Kaiwei Zhang, Qi Jia, Zijian Chen, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 KidVis研究通过对比人类儿童与多模态大语言模型在视觉能力上的表现,揭示了当前模型在基础视觉感知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06461 2026-01-13 cs.CR cs.CV cs.ET 79%

VIPER Strike: Defeating Visual Reasoning CAPTCHAs via Structured Vision-Language Inference

VIPER Strike: 通过结构化视觉-语言推理击败视觉推理验证码

Minfeng Qi, Dongyang He, Qin Wang, Lefeng Zhang

机构 * City University of Macau(澳门城市大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

AI总结 ViPer通过结构化视觉-语言推理框架,有效解决视觉推理验证码问题,实现高达93.2%的成功率,优于现有方法,同时提出TSR策略提升防御效果。

Comments Accepted by Usenix Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16769 2026-01-12 cs.AI cs.CL 79%

See or Say Graphs: Agent-Driven Scalable Graph Structure Understanding with Vision-Language Models

见或说图:基于视觉语言模型的 agent 驱动可扩展图结构理解

Shuo Han, Yukun Cao, Zezhong Ding, Zengyi Gao, S Kevin Zhou, Xike Xie

机构 * University of Science and Technology of China(中国科学技术大学) Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,USTC) MIRACLE Center, Suzhou Institute for Advance Research, USTC(MIRACLE中心,苏州先进研究所,USTC)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 GraphVista 是一种基于视觉语言模型的 agent 驱动框架,通过分层图检索和模态协调机制,实现大规模图结构理解的可扩展性和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02968 2026-01-07 cs.AI 79%

Rationale-Grounded In-Context Learning for Time Series Reasoning with Multimodal Large Language Models

基于理由的上下文学习用于多模态大语言模型的时间序列推理

Qingxiang Liu, Zhiqing Cui, Xiaoliang Luo, Yuqian Wu, Zhuoyang Jiang, Huaiyu Wan, Sheng Sun, Lvchun Wang, Wei Yu, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) China Mobile (Jiangxi) Virtual Reality Technology Co., Ltd.(中国移动(江西)虚拟现实技术有限公司) School of Computer and Information Technology, Beijing Jiaotong University(北京交通大学计算机与信息学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本研究提出RationaleTS方法,通过基于理由的上下文学习提升多模态大语言模型在时间序列推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01984 2026-01-06 cs.CV 79%

Thinking with Blueprints: Assisting Vision-Language Models in Spatial Reasoning via Structured Object Representation

基于蓝图的思考:通过结构化物体表示协助视觉-语言模型进行空间推理

Weijian Ma, Shizhao Sun, Tianyu Yu, Ruiyu Wang, Tat-Seng Chua, Jiang Bian

机构 * National University of Singapore(新加坡国立大学) Microsoft Research, Asia(微软亚洲研究院) Tsinghua University(清华大学) University of Toronto(多伦多大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 通过结构化物体表示提升视觉-语言模型的空间推理能力,引入蓝图嵌入推理轨迹、蓝图意识奖励和反捷径数据增强技术。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01718 2026-01-06 cs.AI 79%

Yuan3.0 Flash: An Open Multimodal Large Language Model for Enterprise Applications

Yuan3.0 Flash:面向企业应用的开源多模态大语言模型

YuanLab. ai, :, Shawn Wu, Sean Wang, Louie Li, Darcy Chen, Allen Wang, Jiangang Luo, Xudong Zhao, Joseph Shen, Gawain Ma, Jasper Jia, Marcus Mao, Claire Wang, Hunter He, Carol Wang, Zera Zhang, Jason Wang, Chonly Shen, Leo Zhang, Logan Chen, Qasim Meng, James Gong, Danied Zhao, Penn Zheng, Owen Zhu, Tong Yu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 Yuan3.0 Flash通过RAPO算法提升企业任务性能,实现高效多模态大语言模型开源

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21871 2025-12-29 cs.CL cs.AI cs.CR cs.CY 79%

Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?

弥合版权鸿沟:大型视觉-语言模型是否能识别并尊重受版权保护的内容?

Naen Xu, Jinghuai Zhang, Changjiang Li, Hengyu An, Chunyi Zhou, Jun Wang, Boyu Xu, Yuyuan Li, Tianyu Du, Shouling Ji

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文研究大型视觉-语言模型在处理受版权保护内容时的合规性问题,提出了一种新的工具增强防御框架以降低侵权风险。

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20417 2025-12-24 cs.CV cs.MA 79%

Chain-of-Anomaly Thoughts with Large Vision-Language Models

基于大视觉-语言模型的异常思维链

Pedro Domingos, João Pereira, Vasco Lopes, João Neves, David Semedo

机构 * NOVALINCS, NOVA School of Science and Technology(NOVALINCS、NOVA科学与技术学院) NOVALINCS, Universidade da Beira Interior(NOVALINCS、贝拉内尔大学) DeepNeuronic

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出CoAT框架,通过引入异常偏见提升大视觉-语言模型在异常检测和分类任务中的性能。

Comments 2 pages, 3 figures, 1 table. Accepted for RECPAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19526 2025-12-23 cs.AI 79%

QuantiPhy: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models

QuantiPhy:一种评估视觉-语言模型物理推理能力的定量基准

Li Puyin, Tiange Xiang, Ella Mao, Shirley Wei, Xinye Chen, Adnan Masood, Li Fei-fei, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 视觉推理 :vision-language model(title);VLM(abstract);分类 cs.AI

AI总结 QuantiPhy通过定量评估视觉-语言模型的物理推理能力,揭示其在运动学属性推断中的数值准确性与定性合理性之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07276 2025-12-23 cs.CV 79%

Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery

Geo3DVQA:基于航拍影像评估视觉-语言模型在三维地理空间推理中的表现

Mai Tsujimoto, Junjue Wang, Weihao Xuan, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 Geo3DVQA通过评估视觉-语言模型在三维地理空间推理中的表现,揭示了RGB影像在3D空间分析中的局限性,并展示了领域特定指令微调对模型性能的提升。

Comments Accepted at WACV 2026. 32 pages long including the appendix. Revision details are provided in the supplements

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14257 2025-12-17 cs.CV 79%

Enhancing Visual Programming for Visual Reasoning via Probabilistic Graphs

通过概率图增强视觉编程用于视觉推理

Wentao Wan, Kaiyu Wu, Qingyang Ma, Nan Kang, Yunjie Chen, Liang Lin, Keze Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV

AI总结 通过构建概率图解决视觉编程非可微问题,提升视觉推理任务的性能。

Comments 13 Pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14052 2025-12-17 cs.CV cs.CL 79%

HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices

HyperVL: 一种高效的多模态大语言模型用于边缘设备

HyperAI Team, Yuchen Liu, Kaiyang Han, Zhiqiang Xia, Yuhang Dong, Chen Song, Kangyu Tang, Jiaming Xu, Xiushi Feng, WenXuan Yu, Li Peng, Mingyang Wang, Kai Wang, Changpeng Yang, Yang Li, Haoyu Lu, Hao Wang, Bingna Xu, Guangyao Liu, Long Huang, Kaibin Guo, Jinyang Wu, Dan Wu, Hongzhen Wang, Peng Zhou, Shuai Nie, Shande Wang, Runyu Shi, Ying Huang

机构 * HyperAI Team(HyperAI团队) Xiaomi Corporation(小米公司)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 HyperVL是一种为边缘设备优化的高效多模态大语言模型,通过图像分块、视觉分辨率压缩和双一致性学习技术,实现低延迟、低功耗的多模态推理。

Comments Technical report of Xiaomi HyperAI Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05943 2025-12-15 cs.AI 79%

TRACE: A Framework for Analyzing and Enhancing Stepwise Reasoning in Vision-Language Models

TRACE:一种用于分析和增强视觉-语言模型逐步推理的框架

Shima Imani, Seungwhan Moon, Lambert Mathias, Lu Zhang, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 TRACE通过辅助推理集和一致性评估,提升视觉-语言模型的推理透明性和错误检测能力,促进模型改进和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06328 2025-12-09 cs.CV 79%

ReCAD: Reinforcement Learning Enhanced Parametric CAD Model Generation with Vision-Language Models

ReCAD: 基于强化学习的参数化CAD模型生成增强框架

Jiahao Li, Yusheng Luo, Yunzhong Lou, Xiangdong Zhou

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 ReCAD通过强化学习增强参数化CAD模型生成,利用预训练模型生成高精度CAD模型,显著提升几何精度和语义保真度。

Comments Accepted as an Oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05111 2025-12-05 cs.CV 79%

ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

ARM-Thinker: 通过智能工具使用和视觉推理强化多模态生成奖励模型

Shengyuan Ding, Xinyu Fang, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiangyu Zhao, Haodong Duan, Xiaoyi Dong, Jianze Liang, Bin Wang, Conghui He, Dahua Lin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :visual reasoning(title);grounding(abstract);分类 cs.CV

AI总结 ARM-Thinker通过智能工具使用和视觉推理提升多模态奖励模型的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02170 2025-12-04 cs.AI 79%

Flowchart2Mermaid: A Vision-Language Model Powered System for Converting Flowcharts into Editable Diagram Code

流程图2Mermaid:一种基于视觉-语言模型的系统,用于将流程图转换为可编辑的图表代码

Pritam Deka, Barry Devereux

机构 * Queen’s University Belfast(女王大学贝尔法斯特)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 Flowchart2Mermaid通过视觉-语言模型将流程图图像转换为可编辑的Mermaid代码,提供结构化文本表示和混合初始化的编辑功能,提升流程图的可重用性和版本控制能力。

Comments Submitted to EACL 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12861 2025-12-01 cs.CL cs.CV 79%

From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models

从感知到推理:深度思考赋能多模态大语言模型

Wenxin Zhu, Andong Chen, Yuchen Song, Kehai Chen, Conghui Zhu, Ziyan Chen, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Global Tone Communication Technology(全球语音通信技术)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出多模态链式思维方法,旨在提升多模态大语言模型的推理能力,通过系统性综述分析其理论基础、实现方法及未来发展方向。

Comments Survey; 7 figures, 3 tables, 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19343 2025-11-25 cs.CV 79%

Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning

Syn-GRPO:面向多模态大语言模型感知推理的自进化数据合成

Qihan Huang, Haofei Zhang, Rong Wei, Yi Wang, Rui Tang, Mingli Song, Jie Song

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(Manycore科技公司)

专题命中 视觉推理 :MLLM(title,abstract);分类 cs.CV

AI总结 Syn-GRPO通过自进化数据合成提升多模态大语言模型的感知推理能力,采用数据服务器与GRPO工作流协同生成高质量多样化训练数据,实验验证其在视觉感知任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17909 2025-11-25 cs.AI 79%

ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models in Chemistry

ChemVTS-Bench: 评估多模态大语言模型在化学中的视觉-文本-符号推理能力

Zhiyuan Huang, Baichuan Yang, Zikun He, Yanhong Wu, Fang Hongyu, Zhenhe Liu, Lin Dongsheng, Bing Su

机构 * Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学) South China University of Technology(华南理工大学) Gaotu Techedu Inc(高图科技公司)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 ChemVTS-Bench通过多模态输入评估大语言模型在化学中的视觉-文本-符号推理能力,揭示了结构化学的挑战及多模态融合的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17036 2025-11-24 cs.CL cs.CV 79%

Do Vision-Language Models Understand Visual Persuasiveness?

视觉-语言模型理解视觉说服力吗?

Gyuwon Park

机构 * Department of Computer Science and Engineering, UNIST(计算机科学与工程系,UNIST)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文研究视觉-语言模型对视觉说服力的理解,发现模型在链接说服对象与沟通意图方面存在局限。

Comments 8 pages (except for reference and appendix), 5 figures, 7 tables, to be published in NeurIPS 2025 Workshop: VLM4RWD

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16853 2025-11-24 cs.CV 79%

Towards Unified Vision Language Models for Forest Ecological Analysis in Earth Observation

面向地球观测森林生态分析的统一视觉语言模型

Xizhe Xue, Xiao Xiang Zhu

机构 * Xizhe Xue 1, 2 Xiao Xiang Zhu 1, 2

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV

AI总结 REO-Instruct提出首个面向地球观测森林生态分析的统一视觉语言模型基准,旨在解决描述与回归任务中的多模态感知与生物物理变量对齐问题。

Comments AAAI2026 AI for Environmental Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16150 2025-11-21 cs.CV 79%

Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval

基于推理的嵌入:利用多模态大语言模型推理提升多模态检索

Chunxu Liu, Jiyuan Yang, Ruopeng Gao, Yuhan Zhu, Feng Zhu, Rui Zhao, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Sensetime Research(商汤科技研究院) Beijing Institute of Technology(北京理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉推理 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出基于推理的嵌入方法,利用多模态大语言模型的推理能力提升多模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15722 2025-11-21 cs.AI 79%

Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods

多模态大语言模型中的空间推理:任务、基准和方法的调查

Weichen Liu, Qiyao Xue, Haoming Wang, Xiangyu Yin, Boyuan Yang, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本文调查多模态大语言模型中的空间推理问题,从认知角度分类任务和基准,分析评估方法与改进策略,揭示模型与人类推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11916 2025-11-18 cs.AI 79%

An Analysis of Architectural Impact on LLM-based Abstract Visual Reasoning: A Systematic Benchmark on RAVEN-FAIR

Sinan Urgun, Seçkin Arı

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.AI

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18145 2025-11-13 cs.CV 79%

CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models

Xiao An, Jiaxing Sun, Zihan Gui, Wei He

机构 * State Key Lab. LIESMARS, Wuhan University(武汉大学遥感信息与地学实验室国家重点实验室)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025 Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏