arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-31 至 2026-03-31 共收录 112 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 7 篇

2512.17396 2026-03-31 cs.CV cs.AI cs.CL 84%

RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering

RadImageNet-VQA:一个大规模的CT和MRI数据集用于放射学视觉问答

Léo Butsanets, Charles Corbière, Julien Khlaut, Pierre Manceron, Corentin Dancette

机构 * Raidium Université de Paris Cité, Hôpital Européen Georges Pompidou, AP-HP(巴黎西岱大学,乔治·蓬皮杜欧洲医院,AP-HP) Department of Vascular and Oncological Interventional Radiology, INSERM(血管与肿瘤介入放射学系,法国国家健康与医学研究院)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RadImageNet-VQA数据集,包含750万张图像和750万个问题-答案对,涵盖异常检测、解剖识别和病理识别三大任务,验证了视觉语言模型在细粒度病理识别上的局限性。

Comments Preprint, 33 pages, 15 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28363 2026-03-31 cs.CV 83%

SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering

SEA:通过元素级常识视觉问答评估草图抽象效率

Jiho Park, Sieun Choi, Jaeyoon Seo, Minho Sohn, Yeana Kim, Jihie Kim

机构 * Dongguk University(东国大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出SEA指标,通过元素级常识视觉问答评估草图抽象效率,引入CommonSketch数据集,验证了草图抽象效率的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15090 2026-03-31 cs.DB cs.AI cs.CV 79%

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

SciEGQA:一个用于科学证据基础问题回答与推理的数据集

Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The University of Hong Kong(香港大学) Baidu Inc.(百度公司)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 SciEGQA数据集通过精细标注和大规模自动构建,提升视觉语言模型在科学文档中的证据定位与推理能力。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28504 2026-03-31 astro-ph.SR astro-ph.IM 78%

JW-VL: A Vision-Language Model for Solar Physics

JW-VL:用于太阳物理的视觉-语言模型

Mingfu Shao, Hui Wang, Liyue Tong, Yuyang Li, Cunshi Wang, Jiaben Lin, Suo Liu, Haiqing Xu, Yin Zhang, Jing Huang

专题命中 视觉问答 :vision-language model(title,abstract)

AI总结 本文提出JW-VL模型,专为太阳物理设计,整合多波段观测数据,实现从原始观测数据到图像识别、活动分析和OCR的端到端处理,同时构建多波段图像基准数据集。

Comments 16 Pages,8figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27403 2026-03-31 cs.LG cs.AI 62%

Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling

基于符合采样的通用化证书的条件事实性控制大语言模型

Kai Ye, Qingtao Pan, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 视觉问答 :VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出条件事实性控制框架CFC,通过增强分位数回归定义连续特征条件接受阈值,实现条件覆盖保证,并在理论和实验上证明其高效性与稳定性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12533 2026-03-31 cs.CV 57%

Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering

你看到我指向的是什么?基于手势的 egocentric 视频问答

Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出 EgoPointVQA 数据集和基准,结合 Hand Intent Tokens 提升手势引导的 egocentric 问答性能,HINT-14B 在多个任务上超越现有最佳模型。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26670 2026-03-31 cs.IR cs.CL 50%

SRAG: RAG with Structured Data Improves Vector Retrieval

SRAG:基于结构化数据的RAG改进向量检索

Shalin Shah, Srikanth Ryali, Ramasubbu Venkatesh

机构 * Anvai AI

专题命中 视觉问答 :grounding(abstract)

AI总结 SRAG通过引入结构化信息提升向量检索性能,实验显示在问答系统中提升30%的评分,尤其在比较、分析和预测类问题上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 16 篇

2603.27558 2026-03-31 cs.CV 85%

Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models

通过事件流学习在极端光照下视觉感知

Baoheng Zhang, Jiahui Liu, Gui Zhao, Weizhou Zhang, Yixuan Ma, Jun Jiang, Yingxian Chen, Wilton W. T. Fok, Xiaojuan Qi, Hayden Kwok-Hay So

机构 * The University of Hong Kong(香港大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Event-MLLM,通过动态融合事件流与RGB帧进行全光视觉推理,引入光照指示器和光照校正损失,解决极端光照下多模态大语言模型的感知与推理问题。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18151 2026-03-31 cs.DC cs.AR cs.CV cs.LG cs.NI 84%

AVERY: Intent-Driven Adaptive VLM Split Computing via Embodied Self-Awareness for Efficient Disaster Response Systems

AVERY:基于具身自感知的意图驱动自适应VLM分发计算以实现高效的灾害响应系统

Rajat Bhattacharjya, Sing-Yao Wu, Hyunwoo Oh, Chaewon Nam, Suyeon Koo, Mohsen Imani, Elaheh Bozorgzadeh, Nikil Dutt

机构 * University of California, Irvine(加州大学尔湾分校) Kookmin University(国民大学)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 AVERY通过意图驱动的自适应分发计算框架,在资源受限平台高效部署VLM,利用双流分发策略提升灾害响应系统实时查询能力,实现更高的准确性和更低的能耗。

Comments Paper is currently under review. Authors' version posted for personal use and not for redistribution. Previous version of the preprint was titled: 'AVERY: Adaptive VLM Split Computing through Embodied Self-Awareness for Efficient Disaster Response Systems'

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25848 2026-03-31 cs.CV cs.AI 84%

More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models

更多思考,更少准确性?关于视觉-语言模型中推理的双重性质

Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Fabian Waschkowski, Lukas Wesemann, Peter Tu, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) University of Melbourne(墨尔本大学) GE Research(GE全球研究院)

专题命中 视觉推理 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究揭示了视觉-语言模型中推理的双重性质:虽然增强了逻辑推理能力,但可能导致感知基础能力下降,通过提出VAPO方法改进了模型对视觉信息的依赖。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03821 2026-03-31 cs.CV cs.AI 84%

Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

超越识别:评估视觉语言模型中的视觉视角理解

Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

机构 * University of Warsaw(华沙大学) Polish Academy of Sciences(波兰科学院) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) IDEAS NCBR Lute

专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文通过144个视觉任务评估VLMs的视觉视角理解能力,发现模型在场景理解上表现优异,但在空间推理和视角理解上存在明显不足。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26742 2026-03-31 cs.CL cs.LG 84%

Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages

多语言视觉语言模型是否同样具备推理能力?一种针对印度语言的跨语言视觉推理审计

Swastik R

机构 * Indian Institute of Information Technology, Raichur(印度信息技术学院赖丘尔分校)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.LG;VLM(comments)

AI总结 本文通过将MathVista、ScienceQA和MMMU的980道题翻译成印度语言,评估了8种VLM在七种语言中的表现,发现切换至印度语言时准确率下降9.8-25个百分点,且达罗毗荼语比印欧语下降更多,链式推理反而降低了部分语言的性能。

Comments 16 pages, 10 figures, 6 tables. Code and data: https://github.com/QuantumByte-01/multilingual-vlm-reasoning-audit Dataset: https://huggingface.co/datasets/Swastikr/multilingual-vlm-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27375 2026-03-31 cs.CV 79%

Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models

弥合可验证奖励下的视觉表征与强化学习在大视觉-语言模型中的应用

Yuhang Han, Yuyang Wu, Zhengbo Jiao, Yiyu Wang, Xuyang Liu, Shaobo Wang, Hanlin Xu, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) Huawei(华为) HKUST (GZ)(香港科技大学(广州))

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出KAWHI机制,通过整合结构化视觉信息提升大视觉-语言模型的多模态推理性能,改进现有统一奖励优化方法。

Comments Homepage: \url{https://kawhiiiileo.github.io/KAWHI_PAGE/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21356 2026-03-31 cs.CV 79%

ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models

ShotBench:视觉语言模型中的专家级电影叙事理解

Hongbo Liu, Jingwen He, Yi Jin, Dian Zheng, Yuhao Dong, Fan Zhang, Ziqi Huang, Yinan He, Yangguang Li, Weichao Chen, Yu Qiao, Wanli Ouyang, Shengjie Zhao, Ziwei Liu

机构 * Tongji University(同济大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ShotBench基准测试,用于评估视觉语言模型对电影叙事语言的理解能力,通过专家标注的3500多对问答数据揭示现有模型在细粒度视觉线索和复杂空间推理上的不足,并开发ShotVL模型在该基准上取得新突破。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28651 2026-03-31 cs.AI 70%

Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning

不是搜索,而是扫描:在面向学术论文推理的扫描任务上基准测试大语言模型

Rongjin Li, Zichen Tang, Xianghe Wang, Xinyi Hu, Zhengyu Wang, Zhengyu Lu, Yiling Huang, Jiayuan Chen, Weisheng Tan, Jiacheng Liu, Zhongjun Yang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出ScholScan基准,通过扫描式任务评估大语言模型在学术论文推理中的能力,发现检索增强生成方法在扫描任务上无显著提升,揭示了当前模型在该任务上的系统性缺陷。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27349 2026-03-31 cs.CV cs.CL 70%

Inference-Time Structural Reasoning for Compositional Vision-Language Understanding

推理时的结构推理用于组合性视觉-语言理解

Amartya Bhattacharya

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出统一评估和增强框架,评估四种架构各异的VLMs在Winoground基准上的表现,通过结构化关系先验提升模型能力,发现SG增强对已有能力强的模型有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27201 2026-03-31 cs.CV 70%

Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models

理解并缓解多模态推理链模型中的幻觉

Ji Ma, Wei Suo, Peng Wang, Yanning Zhang

机构 * School of Computer Science and Ningbo Institute, Northwestern Polytechnical University, China(西北工业大学计算机学院和宁波研究院) National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, China(国家空天地海一体化大数据应用技术国家工程实验室)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文研究多模态推理链模型中的幻觉问题,发现其源于联想推理步骤中的虚假文本生成,提出一种有效策略缓解幻觉,实验表明方法效果显著且可与其他缓解方法结合提升性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27571 2026-03-31 cs.HC 67%

RAGent: Physics-Aware Agentic Reasoning for Training-Free mmWave Human Activity Recognition

RAGent:面向无训练毫米波人类活动识别的物理感知代理推理

Mingda Han, Huanqi Yang, Zehua Sun, Wenhao Li, Yanni Yang, Guoming Zhang, Yetong Cao, Weitao Xu, Pengfei Hu

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract)

AI总结 RAGent通过物理感知代理推理实现无训练毫米波人类活动识别,利用雷达知识库进行证据驱动推理,无需领域特定训练或适应,实现跨领域鲁棒识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26737 2026-03-31 cs.CV cs.AI 62%

Beyond Static Visual Tokens: Structured Sequential Visual Chain-of-Thought Reasoning

超越静态视觉标记:结构化的顺序视觉推理

Guangfu Guo, Xiaoqian Lu, Yue Feng, Mingming Sun

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结构化顺序视觉推理方法,通过构建视觉重要性图谱并按判别顺序进行推理,提升多模态模型的视觉认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28353 2026-03-31 cs.CV 57%

VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning

VistaGEN: 通过多视角视觉语言推理实现一致的驾驶视频生成与细粒度控制

Li-Heng Chen, Ke Cheng, Yahui Liu, Lei Shi, Shi-Sheng Huang, Hongbo Fu

机构 * Hong Kong University of Science and Technology(香港科技大学) Meituan, Inc.(美团) Beijing Normal University(北京师范大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 本文提出VistaGEN,通过多视角视觉语言推理实现驾驶视频生成的细粒度控制与时空一致性,引入多视角视觉语言评估器和对象级细化模块,提升长视频生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27967 2026-03-31 cs.CV 57%

Learning Multi-View Spatial Reasoning from Cross-View Relations

从跨视图关系学习多视图空间推理

Suchae Jeong, Jaehwi Song, Haeone Lee, Hanna Kim, Jian Kim, Dongjun Lee, Dong Kyu Shin, Changyeon Kim, Dongyoon Hahm, Woogyeol Jin, Juheon Choi, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Hanyang University(汉阳大学) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Cross-View Relations数据集,通过训练视觉语言模型提升多视图空间推理能力,在MindCube和RoboSpatial基准测试中取得显著提升,并在RoboCasa任务中提高机器人操作成功率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27060 2026-03-31 cs.CV 57%

VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation

VIRST:用于时空分割的视频指导推理助手

Jihwan Hong, Jaeyoung Do

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

AI总结 VIRST提出一种端到端框架,统一全局视频推理与像素级分割预测,通过时空融合模块和时间动态锚点更新器,提升动态场景下的分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11410 2026-03-31 cs.CV 57%

Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs Supplementary

看见并不意味着定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yang, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出DORI基准,通过分解定向为四个维度,揭示多模态模型在物体定向任务中的系统性不足,指出其依赖分类启发式而非几何推理。

Comments This is a replacement and updated version for submission arXiv:2505.21649 : Right Side Up? Disentangling Orientation Understanding in MLLMs with Fine-grained Multi-axis Perception Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 33 篇

2603.28662 2026-03-31 cs.LG cs.AI 84%

AMIGO: Agentic Multi-Image Grounding Oracle Benchmark

AMIGO:代理多图像接地 oracle 评估基准

Min Wang, Ata Mahjoubfar

机构 * Target Corporation(塔吉特公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 AMIGO 评估基准通过长周期交互检测隐藏目标,要求模型在严格协议下通过属性问题逐步识别目标,强调不确定性下的问题选择、约束跟踪和细粒度区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28333 2026-03-31 cs.CV cs.AI 84%

Integrating Multimodal Large Language Model Knowledge into Amodal Completion

将多模态大语言模型知识整合到无模态补全中

Heecheol Yun, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28069 2026-03-31 cs.CV cs.AI 84%

MolmoPoint: Better Pointing for VLMs with Grounding Tokens

MolmoPoint:通过接地标记提升VLMs的指针能力

Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MolmoPoint,通过直接选择包含目标概念的视觉标记来改进VLMs的指针机制,提升图像、GUI和视频指针任务性能,并提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09326 2026-03-31 cs.CV 83%

OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models

OddGridBench: 暴露多模态大语言模型在细粒度视觉差异敏感性方面的不足

Tengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li, Lin Ma, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen Technology University(深圳技术大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Meituan(美团)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出OddGridBench基准,评估多模态大语言模型的视觉差异敏感性,发现其检测能力远低于人类,提出OddGrid-GRPO框架提升模型细粒度视觉辨别能力。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27410 2026-03-31 q-bio.NC cs.AI cs.CV 81%

Grounding Social Perception in Intuitive Physics

将社会感知 grounded 在直观物理学中

Lance Ying, Aydan Y. Huang, Aviv Netanyahu, Andrei Barbu, Boris Katz, Joshua B. Tenenbaum, Tianmin Shu

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过结合直观心理学与直观物理学的推理过程来解释社会感知,通过PHASE数据集和SIMPLE模型验证了物理基础的社会推理能力。

Comments 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28120 2026-03-31 cs.CV 79%

MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding

MedLoc-R1: 为基于GRPO的医疗视觉接地任务的性能感知课程奖励调度

Guangjing Yang, Ziyuan Qin, Chaoran Zhang, Chenlin Du, Jinlin Wang, Wanran Sun, Zhenyu Zhang, Bing Ji, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Emory University(埃默里大学) Peking University(北京大学) Shandong University(山东大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出MedLoc-R1框架,通过性能感知奖励调度提升医疗视觉接地任务的定位准确性和训练稳定性,无需引入辅助网络。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26690 2026-03-31 cs.RO cs.AI cs.CV 73%

SpatialPoint: Spatial-aware Point Prediction for Embodied Localization

SpatialPoint: 体感-aware 点预测用于具身定位

Qiming Zhu, Zhirui Fang, Tianming Zhang, Chuanxiu Liu, Xiaoke Jiang, Lei Zhang

机构 * Visincept Research(Visincept 研究院) Tsinghua University(清华大学) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SpatialPoint框架,通过整合结构化深度信息提升具身定位性能,采用260万样本RGB-D数据集进行训练与评估,在真实机器人部署中验证了其在抓取、放置和导航任务中的有效性。

Comments 19 pages, 12 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏