arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4463 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4463 篇

2603.01301 2026-03-03 cs.CV 77%

When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains

当RL帮助医疗VLMs时?解构视觉、SFT和RL增益

Ahmadreza Jeddi, Kimia Shaban, Negin Baghbanzadeh, Natasha Sharan, Abhishek Moturu, Elham Dolatabadi, Babak Taati

机构 * University of Toronto, Canada(多伦多大学) Vector Institute, Canada(向量研究所) KITE Research Institute, University Health Network, Canada(KITE研究机构) York University, Canada(约克大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 研究通过解构视觉、SFT和RL增益,发现RL在模型已有支持时最有效,SFT扩展支持使RL有效,提出边界意识的配方并实现强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14362 2026-03-03 cs.CV 77%

DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning

DeepEyes: 通过强化学习激励'图像思考'

Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 DeepEyes通过强化学习实现图像引导的推理,无需预训练数据,提升多模态任务性能。

Comments Accepted by ICLR2026. Ziwei, Michael, Jack, and Chenxiao are equal-contribution. The list order is random

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23959 2026-03-02 cs.CV 77%

Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought

通过图像作为连续动作进行思考:数值视觉链式推理

Kesen Zhao, Beier Zhu, Junbao Zhou, Xingyu Zhu, Zhongqi Yue, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Chalmers University of Technology(楚克理工大学) University of Gothenburg(哥德堡大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 NV-CoT通过将图像推理动作空间扩展为连续欧几里得空间,提升MLLMs的定位精度和回答准确性,同时加速训练收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11027 2026-01-28 cs.CV 77%

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

Vlaser:具有协同具身推理能力的视觉-语言-动作模型

Ganlin Yang, Tianyi Zhang, Haoran Hao, Weiyun Wang, Yibin Liu, Dehui Wang, Guanzhou Chen, Zijian Cai, Junting Chen, Weijie Su, Wengang Zhou, Yu Qiao, Jifeng Dai, Jiangmiao Pang, Gen Luo, Wenhai Wang, Yao Mu, Zhi Hou

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Fudan University(复旦大学) Tsinghua University(清华大学) NUS(新加坡国立大学) Northeastern University(东北大学) Shenzhen University(深圳大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13680 2026-01-26 cs.CL cs.LG 77%

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

VMMU:一个多任务多模态理解和推理基准

Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

机构 * KAIST(韩国科学技术院) MBZUAI(慕布扎伊大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.LG

AI总结 VMMU是一个评估视觉语言模型在非英语环境下多模态理解和推理能力的基准,通过2500个多模态问题测试模型对视觉和文本信息的整合与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14602 2026-01-22 cs.CV 77%

3D Space as a Scratchpad for Editable Text-to-Image Generation

3D空间作为可编辑的文本到图像生成的草稿纸

Oindrila Saha, Vojtech Krs, Radomir Mech, Subhransu Maji, Matheus Gadelha, Kevin Blackburn-Matzen

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Adobe Research(Adobe研究)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual language model(abstract);分类 cs.CV

AI总结 本文提出一种基于3D空间推理的文本到图像生成方法,通过可编辑的3D网格实现空间一致性,提升图像生成的精度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11633 2026-01-21 cs.CV 77%

Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images

超越准确率:评估图像推理中的 grounded 视觉证据

Xuchen Li, Xuzhao Li, Renjie Pi, Shiyu Hu, Jian Zhao, Jiahui Gao

机构 * ZGCA(中钢集团自动化研究院) NTU(国立.ntu) HKUST(香港科技大学) HKU(香港大学) ZGCI(中钢集团信息院)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 ViEBench 是一个用于评估视觉语言模型图像推理能力的基准,通过细粒度视觉证据和双轴矩阵评估模型在不同任务复杂度下的推理表现。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05939 2026-01-12 cs.CV 77%

Context-Aware Decoding for Faithful Vision-Language Generation

面向上下文的解码方法用于忠实的视觉-语言生成

Mehrdad Fazli, Bowen Wei, Ziwei Zhu

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的上下文嵌入注入方法,通过利用上下文嵌入信号在解码过程中保持视觉一致性,有效减少视觉-语言模型中的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22998 2026-01-01 cs.AI 77%

TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM

TIM-PRM:利用工具集成PRM验证多模态推理

Peng Kuang, Xiangxiang Wang, Wentao Liu, Jian Dong, Kaidi Xu

机构 * Zhejiang University(浙江大学) iFLYTEK AI Research Institute(iFLYTEK人工智能研究院) City University of Hong Kong(香港城市大学)

专题命中 视觉推理 :InternVL(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 TIM-PRM通过工具集成PRM验证多模态推理,有效解决视觉幻觉和逻辑不一致问题,实验表明其在性能和可解释性上优于现有模型。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18211 2025-12-23 cs.RO cs.AI 77%

LLaViDA: A Large Language Vision Driving Assistant for Explicit Reasoning and Enhanced Trajectory Planning

LLaViDA: 一种用于显式推理和增强轨迹规划的大型语言视觉驾驶助手

Yudong Liu, Spencer Hallyburton, Jiwoo Kim, Yueqian Lin, Yiming Li, Qinsi Wang, Hui Ye, Jingwei Sun, Miroslav Pajic, Yiran Chen, Hai Li

机构 * Duke University(杜克大学) Georgia State University(佐治亚州立大学) University of Florida(佛罗里达大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 LLaViDA通过视觉-语言模型实现显式推理和轨迹规划,提升自动驾驶的轨迹规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17227 2025-12-22 cs.CV 77%

Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning

学习何时观察:一种解耦的课程学习框架,用于多模态推理中的战略感知

Siqi Yang, Zilve Gao, Haibo Qiu, Fanfan Liu, Peng Shi, Zhixiong Zeng, Qingmin Liao, Lin Ma

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出了一种解耦课程学习框架,通过分阶段训练提升多模态推理中的抽象推理与战略视觉感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16461 2025-12-19 cs.CV cs.RO 77%

SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning

SNOW:基于世界知识的时空场景理解用于开放世界具身推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业联合会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 SNOW通过整合视觉语言模型与点云几何,实现统一的4D场景理解,提升开放世界具身推理的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08580 2025-12-11 cs.RO cs.AI 77%

Mind to Hand: Purposeful Robotic Control via Embodied Reasoning

Mind to Hand: 通过具身推理实现目的性机器人控制

Peijun Tang, Shangjin Xie, Binyan Sun, Baifu Huang, Kuncheng Luo, Haotian Yang, Weiqi Jin, Jianan Wang

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.AI

AI总结 Lumo-1通过具身推理实现目的性机器人控制,结合视觉语言动作模型提升机器人推理与动作协调能力。

Comments 49 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07203 2025-12-09 cs.CV 77%

MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning

MMRPT:通过遮蔽视觉依赖推理的多模态强化预训练

Xuhui Zheng, Kang An, Ziliang Wang, Yuhang Wang, Faqiang Qian, Yichao Wu

机构 * SenseTime(秒速科技)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

AI总结 MMRPT通过强化学习提升多模态预训练效果,利用视觉基础推理增强模型对视觉内容的理解能力。

Comments 7 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01821 2025-12-09 cs.CV 77%

Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling

通过想象看见:通过隐式空间世界建模学习场景几何

Meng Cao, Haokun Lin, Haoyuan Li, Haoran Tang, Rongtao Xu, Dong An, Xue Liu, Ian Reid, Xiaodan Liang

机构 * MBZUAI SYSU(南方科技大学) PKU(北京大学) Spatialtemporal AI(时空人工智能)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出MILO和RePE,通过隐式空间世界建模提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18964 2025-11-25 cs.AI 77%

Synthesizing Visual Concepts as Vision-Language Programs

合成视觉概念作为视觉-语言程序

Antonia Wüst, Wolfgang Stammer, Hikaru Shindo, Lukas Helff, Devendra Singh Dhami, Kristian Kersting

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.AI

AI总结 本研究提出视觉-语言程序(VLP),结合视觉模型的感知灵活性与程序合成的系统推理能力,通过生成结构化视觉描述并编译成神经符号程序,提升复杂逻辑推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17308 2025-11-24 cs.CV 77%

SpatialGeo:Boosting Spatial Reasoning in Multimodal LLMs via Geometry-Semantics Fusion

SpatialGeo:通过几何-语义融合提升多模态大语言模型的空间推理能力

Jiajie Guo, Qingpeng Zhu, Jin Zeng, Xiaolong Wu, Changyong He, Weida Wang

机构 * School of Computer Science and Technology, Tongji University, Shanghai, China(计算机科学与技术学院,同济大学,上海,中国)

专题命中 视觉推理 :LLaVA(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 SpatialGeo通过几何-语义融合提升多模态大语言模型的空间推理能力,实验表明在空间推理任务中准确率提升8.0%且内存消耗减少50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17352 2025-11-12 cs.CV cs.CL 77%

OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles

Yihe Deng, Hritik Bansal, Fan Yin, Nanyun Peng, Wei Wang, Kai-Wei Chang

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV

Comments 23 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04220 2025-11-06 cs.CV 77%

Struct2D: A Perception-Guided Framework for Spatial Reasoning in MLLMs

Fangrui Zhu, Hanhui Wang, Yiming Xie, Jing Gu, Tianye Ding, Jianwei Yang, Huaizu Jiang

机构 * Northeastern University(东北大学) Microsoft Research(微软研究院) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments NeurIPS 2025, code link: https://github.com/neu-vi/struct2d

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25760 2025-11-04 cs.CV 77%

Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks

Xu Zheng, Zihao Dongfang, Lutao Jiang, Boyuan Zheng, Yulong Guo, Zhenquan Zhang, Giuliano Albanese, Runyi Yang, Mengjiao Ma, Zixin Zhang, Chenfei Liao, Dingcheng Zhen, Yuanhuiyi Lyu, Yuqian Fu, Bin Ren, Linfeng Zhang, Danda Pani Paudel, Nicu Sebe, Luc Van Gool, Xuming Hu

专题命中 视觉推理 :visual question answering(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08003 2025-10-10 cs.CV 77%

CIR-CoT: Towards Interpretable Composed Image Retrieval via End-to-End Chain-of-Thought Reasoning

Weihuang Lin, Yiwei Ma, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12009 2025-10-09 cs.CV 77%

CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion

Yolo Yunlong Tang, Gen Zhan, Li Yang, Yiting Liao, Chenliang Xu

机构 * ByteDance(字节跳动)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21922 2025-09-29 cs.CV 77%

Spatial Reasoning in Foundation Models: Benchmarking Object-Centric Spatial Understanding

Vahid Mirjalili, Ramin Giahi, Sriram Kollipara, Akshay Kekuda, Kehui Yao, Kai Zhao, Jianpeng Xu, Kaushiki Nag, Sinduja Subramaniam, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);InternVL(abstract);分类 cs.CV

Comments 4 pages, NeurIPS Workshop SpaVLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14142 2025-09-18 cs.CV 77%

MARS2 2025 Challenge on Multimodal Reasoning: Datasets, Methods, Results, Discussion, and Outlook

Peng Xu, Shengwu Xiong, Jiajun Zhang, Yaxiong Chen, Bowen Zhou, Chen Change Loy, David A. Clifton, Kyoung Mu Lee, Luc Van Gool, Ruiming He, Ruilin Yao, Xinwei Long, Jirui Huang, Kai Tian, Sa Yang, Yihua Shao, Jin Feng, Yue Zhong, Jiakai Zhou, Cheng Tang, Tianyu Zou, Yifang Zhang, Junming Liang, Guoyou Li, Zhaoxiang Wang, Qiang Zhou, Yichen Zhao, Shili Xiong, Hyeongjin Nam, Jaerin Lee, Jaeyoung Chung, JoonKyu Park, Junghun Oh, Kanggeon Lee, Wooseok Lee, Juneyoung Ro, Turghun Osman, Can Hu, Chaoyang Liao, Cheng Chen, Chengcheng Han, Chenhao Qiu, Chong Peng, Cong Xu, Dailin Li, Feiyu Wang, Feng Gao, Guibo Zhu, Guopeng Tang, Haibo Lu, Han Fang, Han Qi, Hanxiao Wu, Haobo Cheng, Hongbo Sun, Hongyao Chen, Huayong Hu, Hui Li, Jiaheng Ma, Jiang Yu, Jianing Wang, Jie Yang, Jing He, Jinglin Zhou, Jingxuan Li, Josef Kittler, Lihao Zheng, Linnan Zhao, Mengxi Jia, Muyang Yan, Nguyen Thanh Thien, Pu Luo, Qi Li, Shien Song, Shijie Dong, Shuai Shao, Shutao Li, Taofeng Xue, Tianyang Xu, Tianyi Gao, Tingting Li, Wei Zhang, Weiyang Su, Xiaodong Dong, Xiao-Jun Wu, Xiaopeng Zhou, Xin Chen, Xin Wei, Xinyi You, Xudong Kang, Xujie Zhou, Xusheng Liu, Yanan Wang, Yanbin Huang, Yang Liu, Yang Yang, Yanglin Deng, Yashu Kang, Ye Yuan, Yi Wen, Yicen Tian, Yilin Tao, Yin Tang, Yipeng Lin, Yiqing Wang, Yiting Xi, Yongkang Yu, Yumei Li, Yuxin Qin, Yuying Chen, Yuzhe Cen, Zhaofan Zou, Zhaohong Liu, Zhehao Shen, Zhenglin Du, Zhengyang Li, Zhenni Huang, Zhenwei Shao, Zhilong Song, Zhiyong Feng, Zhiyu Wang, Zhou Yu, Ziang Li, Zihan Zhai, Zijian Zhang, Ziyang Peng, Ziyun Xiao, Zongshu Li

专题命中 视觉推理 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments ICCV 2025 MARS2 Workshop and Challenge "Multimodal Reasoning and Slow Thinking in the Large Model Era: Towards System 2 and Beyond''

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08679 2025-09-17 cs.CV 77%

ByDeWay: Boost Your multimodal LLM with DEpth prompting in a Training-Free Way

Rajarshi Roy, Devleena Das, Ankesh Banerjee, Arjya Bhattacharjee, Kousik Dasgupta, Subarna Tripathi

机构 * Kalyani Government Engineering College(卡利尼政府工程学院) Intel Labs(英特尔实验室)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01370 2025-09-10 cs.CV cs.CL 77%

Understanding Museum Exhibits using Vision-Language Reasoning

Ada-Astrid Balauca, Sanjana Garai, Stefan Balauca, Rasesh Udayakumar Shetty, Naitik Agrawal, Dhwanil Subhashbhai Shah, Yuqian Fu, Xi Wang, Kristina Toutanova, Danda Pani Paudel, Luc Van Gool

机构 * ETH Zürich, Switzerland(苏黎世联邦理工学院,瑞士) Indian Institute of Technology, Varanasi (IIT BHU)(印度瓦拉纳西理工学院(IIT BHU)) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);visual question answering(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06409 2025-09-09 cs.AI 77%

Teaching AI Stepwise Diagnostic Reasoning with Report-Guided Chain-of-Thought Learning

Yihong Luo, Wenwu He, Zhuo-Xu Cui, Dong Liang

机构 * Fujian University of Technology(福建工程学院) Fujian Provincial Key Laboratory of Big Data Mining and Applications(福建省大数据挖掘与应用重点实验室) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences(生物医学成像科学与系统重点实验室,中国科学院)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12543 2025-09-09 cs.CV 77%

REVEAL -- Reasoning and Evaluation of Visual Evidence through Aligned Language

Ipsita Praharaj, Yukta Butala, Badrikanath Praharaj, Yash Butala

机构 * Carnegie Mellon University(卡内基梅隆大学) VIT Bhopal(维捷商学院)

专题命中 视觉推理 :vision-language model(abstract);vision language model(abstract);visual reasoning(abstract);分类 cs.CV

Comments 4 pages, 6 figures, International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20766 2025-08-08 cs.CV 77%

Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback

Yang Chen, Yufan Shen, Wenxuan Huang, Sheng Zhou, Qunshu Lin, Xinyu Cai, Zhi Yu, Jiajun Bu, Botian Shi, Yu Qiao

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18661 2025-08-05 cs.CV cs.RO 77%

Eyes Will Shut: A Vision-Based Next GPS Location Prediction Model by Reinforcement Learning from Visual Map Feed Back

Ruixing Zhang, Yang Zhang, Tongyu Zhu, Leilei Sun, Weifeng Lv

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏