arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-05 至 2026-03-05 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 12 篇

2603.03437 2026-03-05 cs.CV 83%

Beyond Accuracy: Evaluating Visual Grounding In Multimodal Medical Reasoning

超越准确率:评估多模态医学推理中的视觉语义

Anas Zafar, Leema Krishna Murali, Ashish Vashist

机构 * The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) Cohere Labs(Cohere实验室) Eisai Inc.(艾伯维公司) Indian Institute of Science, Bangalore(班加罗尔印度科学研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 该研究提出反事实评估框架,通过测量视觉依赖性得分和幻觉视觉推理率,揭示仅文本强化学习在多模态医学推理中降低视觉依赖性的问题。

Comments 12 pages, 2 figures, 2 tables, medical VQA / multimodal reasoning evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03983 2026-03-05 cs.CV cs.AI 73%

GeoSeg: Training-Free Reasoning-Driven Segmentation in Remote Sensing Imagery

GeoSeg: 无需训练的推理驱动遥感图像分割

Lifan Jiang, Yuhang Pei, oxi Wu, Yan Zhao, Tianrun Wu, Shulong Yu, Lihui Zhang, Deng Cai

机构 * State Key lab of CAD\&CG, Zhejiang University UniTTEC Co. Ltd. Wuchan Zhongda Chengtou (Ningbo) Holdings. Ltd.

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 GeoSeg通过结合大规模语言模型推理与精确定位,无需训练实现遥感图像分割的高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11538 2026-03-05 cs.CV 70%

Reinforcing Video Reasoning Segmentation to Think Before It Segments

强化视频推理分割以在分割前思考

Sitong Gong, Lu Zhang, Yunzhi Zhuge, Xu Jia, Pingping Zhang, Huchuan Lu

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.CV

AI总结 Veason-R1通过组相对策略优化和链式思维初始化,提升视频推理分割的结构化推理能力,实现更准确的时空定位和鲁棒性。

Comments 12 pages

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07957 2026-03-05 astro-ph.IM astro-ph.HE 67%

In-Orbit GRB Identification Using LLM-based model for the CXPD CubeSat

利用基于大语言模型的模型进行轨道上伽马射线暴识别

Cunshi Wang, Zuke Feng, Difan Yi, Yuyang Li, Lirong Xie, Huanbo Feng, Yi Liu, Qian Liu, Yang Huang, Hongbang Liu, Xinyu Qi, Yangheng Zheng, Ali Luo, Guirong Xue, Jifeng Liu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出基于大语言模型的轨道上伽马射线暴识别方法,通过模拟数据训练模型,实现高精度分类和光谱指数估计,为未来轨道上实时GRB检测提供技术基础。

Comments 16 pages, 8 figures, accepted by RAA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04002 2026-03-05 cs.CV cs.AI 62%

Discriminative Perception via Anchored Description for Reasoning Segmentation

通过锚定描述实现的判别感知用于推理分割

Tao Yang, Qing Zhou, Yanliang Li, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DPAD方法,通过生成描述性标题来增强推理分割的判别能力,提升推理链的聚焦性和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03343 2026-03-05 q-bio.NC cs.AI cs.LG 62%

Neuro-Symbolic Decoding of Neural Activity

神经符号解码神经活动

Yanchen Wang, Joy Hsu, Ehsan Adeli, Jiajun Wu

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 NEURONA通过结合符号推理与fMRI基础,提升神经活动解码的准确性和泛化能力。

Comments ICLR 2026. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03762 2026-03-05 cs.CV 57%

Seeing as Experts Do: A Knowledge-Augmented Agent for Open-Set Fine-Grained Visual Understanding

如同专家所见:一个知识增强的代理用于开放集细粒度视觉理解

Junhan Chen, Zilu Zhou, Yujun Tong, Dongliang Chang, Yitao Luo, Zhanyu Ma

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 KFRA通过知识增强推理代理实现开放集细粒度视觉理解,提升推理准确率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24178 2026-03-05 cs.CL cs.AI 57%

MuSaG: A Multimodal German Sarcasm Dataset with Full-Modal Annotations

MuSaG:一个包含完整模态标注的多模态德语讽刺数据集

Aaron Scott, Maike Züfle, Jan Niehues

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

AI总结 MuSaG是一个包含多模态标注的德语讽刺数据集,通过对比人类标注与多种模型性能,揭示了多模态模型在现实场景中的改进需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01222 2026-03-05 cs.CL cs.AI 57%

WebDS: An End-to-End Benchmark for Web-based Data Science

WebDS: 一种端到端的基于网络的数据科学基准

Ethan Hsu, Hong Meng Yam, Ines Bouissou, Aaron Murali John, Raj Thota, Josh Koe, Vivek Sarath Putta, G K Dharesan, Alexander Spangher, Shikhar Murty, Tenghao Huang, Christopher D. Manning

机构 * Stanford University(斯坦福大学) Pinetree Research(Pinetree研究公司) University of California, Berkeley(加州大学伯克利分校) Singapore University of Technology and Design(新加坡科技设计大学) University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 WebDS提出了一种端到端的基于网络的数据科学基准,旨在评估代理在复杂多步骤任务中的表现,揭示当前LLM在实际数据科学任务中的性能差距。

Comments 14 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06912 2026-03-05 cs.RO cs.AI 57%

A Bayesian Framework for Active Tactile Object Recognition, Pose Estimation and Shape Transfer Learning

基于贝叶斯框架的主动触觉物体识别、姿态估计与形状迁移学习

Haodong Zheng, Andrei Jalba, Raymond H. Cuijpers, Wijnand IJsselsteijn, Sanne Schoenmakers

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出基于贝叶斯框架的主动触觉系统,结合定制粒子滤波器与高斯过程隐面,实现物体识别、姿态估计与形状迁移学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04107 2026-03-05 physics.ins-det hep-ex 50%

The CMS ME0 Upgrade: Enhancing Forward Muon Reconstruction at the HL-LHC

CMS ME0升级:提升HL-LHC前方缪子重建

Anureet Kaur

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 CMS ME0升级通过六层站扩展伪横坐标覆盖范围,提升HL-LHC前方缪子重建的灵敏度和精度。

Comments 5 pages, 6 figures, Proceedings of the 31st International Symposium on Lepton Photon Interactions at High Energies (LP2025). https://cds.cern.ch/record/2952677

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11291 2026-03-05 cs.RO 50%

H-WM: Robotic Task and Motion Planning Guided by Hierarchical World Model

H-WM:由分层世界模型引导的机器人任务和运动规划

Jinbang Huang, Wenyuan Chen, Zhiyuan Li, Oscar Pang, Xiao Hu, Lingfeng Zhang, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Tongtong Cao, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 H-WM通过结合逻辑和视觉世界模型,实现机器人任务和运动规划中的鲁棒长视界推理与稳定引导。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏