arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2506.10085 2026-03-03 cs.CV cs.AI 81%

VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision-Language Models

VITA:通过视觉语言模型的测试时间适应实现零样本价值函数

Christos Ziakas, Alessandra Russo

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 VITA通过测试时间适应提升视觉语言模型的零样本价值估计能力,实现跨任务和环境的泛化,优于现有方法。

Comments International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03135 2026-03-03 cs.CV cs.AI cs.CL 81%

OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models

OmniSpatial:迈向视觉语言模型的空间推理综合基准

Mengdi Jia, Zekun Qi, Shaochen Zhang, Wenyao Zhang, Xinqiang Yu, Jiawei He, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Xian Jiaotong University(西安交通大学) Shanghai Jiao Tong University(上海交通大学) Galbot Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 OmniSpatial是一个基于认知心理学的综合性空间推理基准,通过动态推理、复杂空间逻辑等四个类别,评估视觉语言模型在空间推理上的能力与局限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00206 2026-03-03 cs.CV cs.AI 81%

TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models

TACIT基准:一个生成和判别模型的程序化视觉推理基准

Daniel Nobrega Medeiros

机构 * Independent Researcher(独立研究者)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI

AI总结 TACIT基准提出一个程序化视觉推理测试,包含10个任务和6个领域,通过生成和判别双轨评估模型在空间导航、抽象模式完成等任务中的推理能力。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24014 2026-03-02 cs.CV cs.AI 81%

Interpretable Debiasing of Vision-Language Models for Social Fairness

可解释的视觉-语言模型社会公平性偏见消除

Na Min An, Yoonna Jang, Yusuke Hirota, Ryo Hachiuma, Isabelle Augenstein, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) University of Copenhagen(哥本哈根大学) NVIDIA(英伟达公司)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出DeBiasLens框架,通过稀疏自编码器局部化VLM中的社会属性神经元,以可解释的方式消除模型中的社会偏见,同时保持语义知识。

Comments 25 pages, 30 figures, 13 Tables Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19372 2026-02-24 cs.RO cs.CV cs.LG 81%

Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization

看得更远且更聪明:基于价值引导的多路径反射用于VLM策略优化

Yanting Yang, Shenyuan Gao, Qingwen Bu, Li Chen, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出了一种基于价值引导的多路径反射方法,用于提升VLM在机器人操作任务中的策略优化性能,通过解耦状态评估与动作生成,提高决策鲁棒性并减少推理时间。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17779 2026-02-24 cs.CV cs.LG 81%

U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding

U2-BENCH:在超声理解上评估大视觉-语言模型的基准测试

Anjie Le, Henan Liu, Yue Wang, Zhenyu Liu, Rongkun Zhu, Taohan Weng, Jinze Yu, Boyang Wang, Yalun Wu, Kaiwen Yan, Quanlin Sun, Meirui Jiang, Jialun Pei, Siya Liu, Haoyun Zheng, Zhoujun Li, Alison Noble, Jacques Souquet, Xiaoqing Guo, Manxi Lin, Hongcheng Guo

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 U2-BENCH首次提出评估大视觉-语言模型在超声理解上的基准测试,涵盖分类、检测、回归和文本生成任务,评估23种最新模型,揭示其在图像分类上的优势及在空间推理和临床语言生成上的挑战。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15950 2026-02-24 cs.CV cs.LG 81%

Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families

视觉-语言模型能识别正方形吗?文本识别在三种模型家族中介导空间推理

Yuval Levental

机构 * Rochester Institute of Technology(罗切斯特技术学院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本研究发现视觉-语言模型在处理非文本视觉元素时存在空间定位能力缺陷,文本识别性能显著优于其本机视觉路径。

Comments 9 pages, 3 figures, 2 tables. Workshop-length paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16537 2026-02-19 cs.CV cs.AI cs.CL cs.RO 81%

RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics

RoboSpatial: 教授机器人2D和3D视觉-语言模型空间理解能力

Chan Hee Song, Valts Blukis, Jonathan Tremblay, Stephen Tyree, Yu Su, Stan Birchfield

机构 * The Ohio State University(俄亥俄州立大学) NVIDIA(英伟达)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 RoboSpatial通过构建大规模空间理解数据集,提升机器人2D和3D视觉-语言模型的空间推理能力。

Comments CVPR 2025 (Oral); Project Website: https://chanh.ee/RoboSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05847 2026-02-17 cs.AI cs.CV 81%

OmniVideo-R1: Reinforcing Audio-visual Reasoning with Query Intention and Modality Attention

OmniVideo-R1: 通过查询意图和模态注意力强化音频视觉推理

Zhangquan Chen, Jiale Tao, Ruihuang Li, Yihao Hu, Ruitao Chen, Zhantao Yang, Xinlei Yu, Haodong Jing, Manyuan Zhang, Shuai Shao, Biao Wang, Qinglin Lu, Ruqi Huang

机构 * tencent(腾讯)

专题命中 视觉推理 :visual reasoning(title);grounding(abstract);分类 cs.CV、cs.AI

AI总结 OmniVideo-R1通过查询意图和模态注意力机制,提升多模态推理能力,在多个基准上超越现有基线模型。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11241 2026-02-13 cs.CV cs.LG 81%

Active Zero: Self-Evolving Vision-Language Models through Active Environment Exploration

主动零:通过主动环境探索实现自我进化的视觉-语言模型

Jinghan He, Junfeng Fang, Feng Xiong, Zijun Yao, Fei Shen, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究所) Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 Active-Zero通过主动环境探索实现视觉-语言模型的自我进化,提升推理和理解任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07833 2026-02-10 cs.CV cs.AI cs.CL 81%

SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models

SPD-Faith Bench: 诊断和改进多模态大语言模型中的推理忠实性

Weijiang Lv, Yaoxuan Feng, Xiaobo Xia, Jiayu Wang, Yan Jing, Wenchao Chen, Bo Chen

机构 * Xidian University(西安电子科技大学) National University of Singapore(新加坡国立大学) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 SPD-Faith Bench通过细粒度图像差异推理诊断并改进多模态大语言模型中的推理忠实性,揭示了感知盲区和感知-推理脱节的系统性失败模式,并提出SAGE框架提升视觉路由和推理与感知的一致性。

Comments 53 pages, 42 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02043 2026-02-03 cs.CV cs.AI 81%

Auto-Comp: An Automated Pipeline for Scalable Compositional Probing of Contrastive Vision-Language Models

Auto-Comp: 一种用于可扩展组合探测对比视觉-语言模型的自动化流水线

Cristian Sbrolli, Matteo Matteucci, Toshihiko Yamasaki

机构 * Politecnico di Milano(米兰理工学院) The University of Tokyo(东京大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Auto-Comp通过自动化生成可扩展基准,揭示了对比视觉-语言模型在组合推理中的普遍缺陷及视觉-语言上下文的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01163 2026-02-03 cs.CV cs.AI 81%

Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models

基于多模态大语言模型的语义感知无人机着陆地评估:从遥感图像

Chunliang Hua, Zeyuan Yang, Lei Zhang, Jiayang Sun, Fengwen Chen, Chunlan Zeng, Xiao Hu

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) LASER, International Digital Economy Academy(LASER,国际数字经济学院) Department of Electronic Engineering, East China Normal University(电子工程系,华东师范大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于多模态大语言模型的无人机着陆地评估方法,通过语义感知与多模态融合提升风险识别精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11020 2026-01-27 cs.CV cs.AI 81%

GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation

GeoVLMath: 通过跨模态奖励增强视觉-语言模型中的几何推理以辅助线创建

Shasha Guo, Liang Pang, Xi Wang, Yanling Wang, Huawei Shen, Jing Zhang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 GeoVLMath通过跨模态奖励模型提升视觉-语言模型在复杂立体几何问题中的几何推理能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16520 2026-01-26 cs.CV cs.AI cs.CL 81%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06944 2026-01-13 cs.CV cs.AI 81%

SketchJudge: A Diagnostic Benchmark for Grading Hand-drawn Diagrams with Multimodal Large Language Models

SketchJudge: 一种用于用多模态大语言模型评分手绘图的诊断基准

Yuhang Su, Mei Wang, Yaoyao Zhong, Guozhang Li, Shixing Li, Yihan Feng, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 SketchJudge是一个用于评估多模态大语言模型在评分手绘图任务中诊断能力的基准,通过1015份手绘学生回答验证了当前视觉-语言对齐在符号和嘈杂环境中的脆弱性。

Comments 8 pages for the main text (excluding references and the limitations section); 37 pages in total including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06801 2026-01-13 cs.AI cs.LG 81%

Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy

通过delta思考:通过微分视觉推理策略激励强化学习

Shujian Gao, Yuan Wang, Jiangtao Yan, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 通过微分视觉推理策略增强强化学习的视觉理解能力,提升多模态任务性能。

Comments 24 pages, 10 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04891 2026-01-09 cs.CV cs.LG 81%

Scaling Vision Language Models for Pharmaceutical Long Form Video Reasoning on Industrial GenAI Platform

在工业生成式AI平台上扩展视觉语言模型用于制药长格式视频推理

Suyash Mishra, Qiang Li, Srikanth Patil, Satyanarayan Pati, Baddu Narendra

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出工业GenAI框架,解决制药领域长格式视频推理问题,通过多模态架构和实证分析提升效率并揭示现有VLMs的限制。

Comments Submitted to the Industry Track of Top Tier Conference; currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03534 2026-01-08 cs.CL cs.CV cs.HC cs.LG 81%

Persona-aware and Explainable Bikeability Assessment: A Vision-Language Model Approach

具有人格意识和可解释性的自行车适应性评估:一种视觉-语言模型方法

Yilong Dai, Ziyi Wang, Chenguang Wang, Kexin Zhou, Yiheng Qian, Susu Xu, Xiang Yan

机构 * University of Alabama(阿拉巴马大学) University of Maryland, College Park(马里兰大学学院公园分校) Stony Brook University(石溪大学) University of Florida(佛罗里达大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种视觉-语言模型框架,通过人格意识和可解释性方法评估自行车适应性,解决道路环境复杂性和用户感知异质性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00742 2026-01-01 cs.CV cs.AI eess.IV 81%

Zoomer: Adaptive Image Focus Optimization for Black-box MLLM

Zoomer: 为黑盒大语言模型实现自适应图像聚焦优化

Jiaxu Qian, Chendong Wang, Yifan Yang, Chaoyun Zhang, Huiqiang Jiang, Xufang Luo, Yu Kang, Qingwei Lin, Anlan Zhang, Shiqi Jiang, Ting Cao, Tianjun Mao, Suman Banerjee, Guyue Liu, Saravan Rajmohan, Dongmei Zhang, Yuqing Yang, Qi Zhang, Lili Qiu

机构 * Microsoft(微软公司) Peking University(北京大学) University of Wisconsin Madison(威斯康星大学麦迪逊分校) University of Southern California(南加州大学)

专题命中 视觉推理 :MLLM(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Zoomer通过自适应图像聚焦优化提升黑盒MLLM的多模态理解能力,显著提升准确性并减少token使用

Comments TMLR accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22275 2025-12-30 cs.CV cs.AI 81%

The Illusion of Clinical Reasoning: A Benchmark Reveals the Pervasive Gap in Vision-Language Models for Clinical Competency

临床推理的幻觉:一个基准揭示了视觉语言模型在临床能力方面的广泛差距

Dingyu Wang, Zimu Yuan, Jiajun Liu, Shanggui Liu, Nan Zhou, Tianxing Xu, Di Huang, Dong Jiang

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出B&J基准测试,揭示了视觉语言模型在临床推理任务中存在显著的多模态整合能力不足问题,强调需在多模态整合和视觉理解上取得突破才能实现临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21243 2025-12-25 cs.RO cs.AI cs.LG 81%

LookPlanGraph: Embodied Instruction Following Method with VLM Graph Augmentation

LookPlanGraph: 一种基于视觉语言模型图增强的具身指令跟随方法

Anatoly O. Onishchenko, Alexey K. Kovalev, Aleksandr I. Panov

机构 * MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室)

专题命中 视觉推理 :VLM(title);vision language model(abstract);分类 cs.AI、cs.LG

AI总结 LookPlanGraph通过动态更新场景图实现具身指令跟随,利用视觉语言模型增强环境感知,优于静态场景图方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19512 2025-12-25 cs.CV cs.AI 81%

Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation

Anatomy-R1: 通过解剖相似性课程和群体多样性增强多模态大语言模型的解剖推理

Ziyang Song, Zelin Zang, Zuyao Chen, Xusheng Liang, Dong Yi, Jinlin Wu, Hongbin Liu, Jiebo Luo, Zhen. Lei

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Anatomy-R1通过解剖相似性课程和群体多样性增强方法提升多模态大语言模型在医学影像中的解剖推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22737 2025-12-19 cs.CV cs.AI 81%

CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models

CompareBench: 一个用于评估视觉比较推理能力的视觉-语言模型基准

Jie Cai, Kangning Yang, Lan Fu, Jiaming Ding, Jinlong Li, Huiming Sun, Daitao Xing, Jinglin Shen, Zibo Meng

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 CompareBench是一个用于评估视觉-语言模型中视觉比较推理能力的基准,揭示了当前模型在时间排序、空间关系和基本计数上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10384 2025-12-12 cs.CV cs.AI 81%

Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies

基于大视觉语言模型的细粒度识别:基准测试与优化策略

Cong Pang, Hongtao Yu, Zixuan Chen, Lewei Lu, Xin Lou

机构 * ShanghaiTech University(上海科技大学) Southeast University(东南大学) SenseTime Research(商汤科技研究院)

专题命中 视觉推理 :visual language model(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FROW基准测试和优化策略,通过马赛克数据和开放世界数据提升大视觉语言模型的细粒度识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15690 2025-12-03 cs.AI cs.LG cs.MM 81%

GRAFT: GRaPH and Table Reasoning for Textual Alignment -- A Benchmark for Structured Instruction Following and Visual Reasoning

GRAFT:用于文本对齐的图和表推理——一个结构化指令遵循和视觉推理的基准

Abhigya Verma, Sriram Puttagunta, Seganrasan Subramanian, Sravan Ramachandran

机构 * ServiceNow

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 GRAFT基准通过结构化图表和表格及多步骤问题,评估大语言模型在视觉文本对齐、指令遵循和视觉推理方面的综合能力。

Comments 25 pages, 10 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12263 2025-12-02 cs.CV cs.AI 81%

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models

CrossVid: 一个用于评估多模态大语言模型在跨视频推理中的综合基准

Jingyao Li, Jingyun Wang, Molin Tan, Haochen Wang, Cilin Yan, Likun Shi, Jiayin Cai, Xiaolong Jiang, Yao Hu

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 CrossVid是首个用于评估多模态大语言模型跨视频推理能力的综合基准,通过多样化的任务和数据集验证了模型在复杂视频推理任务中的表现。

Comments Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23112 2025-12-01 cs.CV cs.LG 81%

MathSight: A Benchmark Exploring Have Vision-Language Models Really Seen in University-Level Mathematical Reasoning?

MathSight: 一个探索视觉语言模型在大学级数学推理中是否真正看到的基准

Yuandong Wang, Yao Cui, Yuxin Zhao, Zhen Yang, Yangfu Zhu, Zhenzhou Shao

机构 * Capital Normal University(首都师范大学) Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 MathSight基准测试通过对比不同视觉输入条件,探索视觉语言模型在大学级数学推理中视觉信息的真实贡献。

Comments Comments: 32 pages, 15 figures, 9 tables, includes appendix. Project page: https://cnu-bot-group.github.io/MathSight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20795 2025-11-27 cs.CV cs.AI 81%

Revisiting KRISP: A Lightweight Reproduction and Analysis of Knowledge-Enhanced Vision-Language Models

重新审视 KRISP:一种轻量级的知识增强视觉-语言模型的再现与分析

Souradeep Dutta, Keshav Bulia, Neena S Nair

机构 * Centre For Digital Health(数字健康中心) Indian Institute of Technology Bombay(孟买印度理工学院) Department of Metallurgical engineering & Material science(冶金工程与材料科学系) Department of Bioscience & Bioengineering(生物科学与生物工程系)

专题命中 视觉推理 :vision-language model(title);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本研究重新审视 KRISP,通过轻量级模型揭示知识增强 VQA 的设计缺陷与资源受限下的有效性。

Comments 7 pages , 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18572 2025-11-25 cs.CV cs.LG 81%

GeoReasoner: Geo-localization with Reasoning in Street Views using a Large Vision-Language Model

GeoReasoner: 基于大规模视觉-语言模型的街景地理定位

Ling Li, Yu Ye, Yao Zhou, Bingchuan Jiang, Wei Zeng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tongji University(同济大学) Independent Researcher(独立研究者) Information Engineering University(信息工程大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 GeoReasoner通过整合外部知识和改进的微调方法,提升了街景地理定位的性能,优于现有模型并节省训练资源。

详情

展开后加载摘要…

URL PDF HTML 收藏