arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-09 至 2026-04-09 共收录 15 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 15 篇

2604.06849 2026-04-09 cs.CV 83%

Vision-Language Model-Guided Deep Unrolling Enables Personalized, Fast MRI

基于视觉-语言模型的深度展开实现个性化快速MRI

Fangmao Ju, Yuzhu He, Zhiwen Xue, Chunfeng Lian, Jianhua Ma

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出PASS框架,利用视觉-语言模型指导深度展开网络,实现任务导向的快速成像,通过动态个性化成像流程提升MRI图像质量及诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06824 2026-04-09 cs.CV 79%

Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

生成、分析与优化:基于MLLM元推理的无训练声源定位

Subin Park, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学)

专题命中 视觉定位与Grounding :MLLM(title);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出无训练的声源定位框架,利用多模态大语言模型的推理能力,通过生成-分析-优化流程实现声源定位,实验表明在单源和多源基准上表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00643 2026-04-09 cs.CV 79%

Grounding Surgical Action Triplets with Instrument Instance Segmentation: A Dataset and Target-Aware Fusion Approach

通过仪器实例分割接地手术动作三元组:一个数据集和目标感知融合方法

Oluwatosin Alabi, Meng Wei, Charlie Budd, Tom Vercauteren, Miaojing Shi

机构 * Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出通过仪器实例分割接地手术动作三元组,引入CholecTriplet-Seg数据集和TargetFusionNet架构,提升手术场景中动作理解的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06711 2026-04-09 cs.CV cs.CL 77%

Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation

通过组件导向的多模态知识增强专门化大型模型进行甲骨文解读

Jianing Zhang, Runan Li, Honglin Pang, Ding Xia, Zhou Zhu, Qian Zhang, Chuntao Li, Xi Yang

机构 * College of Software, Jilin University(吉林大学软件学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) School of Archaeology, Jilin University(吉林大学考古学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MoE, China(教育部知识驱动人机智能工程研究中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出一种基于组件的多模态知识增强框架,利用视觉语言模型和语言模型代理进行组件识别与语义推理,通过专家标注的OB-Radix数据集提升甲骨文解读的精度与细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06581 2026-04-09 cs.CV 70%

MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding

MedGRPO:异构医学视频理解的多任务强化学习

Yuhao Su, Anwesa Choudhuri, Zhongpai Gao, Benjamin Planche, Van Nguyen Nguyen, Meng Zheng, Yuhan Shen, Arun Innanje, Terrence Chen, Ehsan Elhamifar, Ziyan Wu

机构 * Northeastern University(东北大学) United Imaging Intelligence(联影智能)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出MedGRPO框架,通过跨数据集奖励归一化和医学LLM评判器提升医学视频理解的训练效果,建立基础基准和训练方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06285 2026-04-09 cs.CR cs.AI cs.CV 66%

Harnessing Hyperbolic Geometry for Harmful Prompt Detection and Sanitization

利用双曲几何进行有害提示检测与净化

Igor Maljkovic, Maria Rosaria Briglia, Iacopo Masi, Antonio Emanuele Cinà, Fabio Roli

机构 * University of Genoa(热那亚大学) Sapienza University of Rome(罗马大学) University of Cagliari(卡利亚里大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI;VLM(comments)

AI总结 本文提出HyPE和HyPS方法,利用双曲几何空间检测和净化有害提示,提升视觉语言模型的安全性与鲁棒性。

Comments Paper accepted at ICLR 2026. Webpage available at: https://hype-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06770 2026-04-09 cs.CV cs.AI 62%

FlowExtract: Procedural Knowledge Extraction from Maintenance Flowcharts

FlowExtract:从维护流程图中提取过程知识

Guillermo Gil de Avalle, Laura Maruster, Eric Sloot, Christos Emmanouilidis

机构 * University of Groningen(格罗宁根大学) Philips Consumer Lifestyle B.V.(飞利浦消费生活方式有限公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlowExtract,通过分离元素检测与连接性重建,利用YOLOv8和EasyOCR提取标准流程图节点,结合新边检测方法实现高精度连接提取,优于视觉语言模型基线,为可查询的过程知识表示提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13354 2026-04-09 cs.CV cs.LG 62%

AgriPath: A Systematic Exploration of Architectural Trade-offs for Crop Disease Classification

AgriPath:作物疾病分类架构权衡的系统探索

Hamza Mooraj, George Pantazopoulos, Alessandro Suglia

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文系统比较了CNN、对比视觉语言模型和生成式VLM在作物疾病分类中的表现,揭示了不同架构在不同场景下的性能差异,强调部署环境对架构选择的影响。

Comments 11 pages main text, 24 pages total including references and appendix. 6 figures, 14 tables. Code and dataset will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22396 2026-04-09 cs.CV cs.AI 62%

Asking like Socrates: Socrates helps VLMs understand remote sensing images

像苏格拉底提问:苏格拉底帮助VLMs理解遥感图像

Run Shao, Ziyu Li, Zhaoyang Zhang, Linrui Xu, Xinran He, Hongyuan Yuan, Bolei He, Yongxing Dai, Yiming Yan, Yijun Chen, Wang Guo, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Baidu Inc.(百度公司) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RS-EoT方法,通过迭代视觉证据寻求机制和两阶段强化学习策略,解决遥感图像中伪推理问题,提升视觉证据基础的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06765 2026-04-09 cs.CL cs.AI 57%

TeamLLM: A Human-Like Team-Oriented Collaboration Framework for Multi-Step Contextualized Tasks

TeamLLM: 一种类人团队导向的多步骤上下文任务协作框架

Xiangyu Wang, Jin Wu, Haoran Shi, Wei Xia, Jiarui Yu, Chanjin Zheng

机构 * Department of Educational Psychology, East China Normal University(华东师范大学教育心理学系) Lab of Artificial Intelligence for Education, East China Normal University(华东师范大学教育人工智能实验室) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Cascadia Institute for Neurotechnology (CIN)(卡斯卡迪亚神经技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 TeamLLM通过引入四类团队角色和三阶段多LLM协作机制,提升多步骤上下文任务性能,提出CGPST基准测试集并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06696 2026-04-09 cs.AI 57%

AgentGate: A Lightweight Structured Routing Engine for the Internet of Agents

AgentGate: 一种轻量级的结构化路由引擎用于物联网代理

Yujun Cheng, Enfang Cui, Hao Qin, Zhiyuan Liang, Qi Xu

机构 * School of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能学院) China Telecom Research Institute(中国电信研究院) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出AgentGate,一种轻量级结构化路由引擎,用于在资源受限条件下高效且隐私友好的代理系统,通过分阶段决策和结构化接地提升路由效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06279 2026-04-09 physics.plasm-ph cs.AI 57%

Plasma GraphRAG: Physics-Grounded Parameter Selection for Gyrokinetic Simulations

等离子体图RAG:用于磁流体动力学模拟的物理基础参数选择

Ruichen Zhang, Feda AlMuhisen, Chenguang Wan, Zhisong Qu, Kunpeng Li, Youngwoo Cho, Kyungtak Lim, Virginie Grandgirard, Xavier Garbet

机构 * Nanyang Technological University(南洋理工大学) CEA, IRFM(法国原子能委员会,磁聚变研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Physical and Mathematical Sciences, Nanyang Technological University(南洋理工大学物理与数学科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Plasma GraphRAG,结合图检索增强生成与大语言模型,实现自动化、物理基础的参数范围识别,提升模拟可靠性并加速科学发现。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09677 2026-04-09 cs.AI 57%

Logics-Parsing-Omni Technical Report

逻辑-解析-全能技术报告

Xin An, Jingyi Cai, Xiangyang Chen, Huayao Liu, Peiting Liu, Peng Wang, Bei Yang, Xiuwen Zhu, Yongfan Chen, Yan Gao, Yuan Gao, Baoyu Hou, Guangzheng Hu, Shuzhao Li, Weixu Qiao, Weidong Ren, Yanan Wang, Boyu Yang, Fan Yang, Jiangtao Zhang, Lixin Zhang, Lin Qu, Hu Wei, Xiaoxiao Xu, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Omni Parsing框架,通过三级层次结构实现多模态解析,整合整体检测、细粒度识别和多级解释,构建证据锚定机制以提升逻辑推理能力,释放Logics-Parsing-Omni模型并发布评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06882 2026-04-09 cs.RO cs.SY eess.SP eess.SY 50%

Telecom World Models: Unifying Digital Twins, Foundation Models, and Predictive Planning for 6G

电信世界模型:统一数字孪生、基础模型和预测规划用于6G

Hang Zou, Yuzhi Yang, Lina Bariah, Yu Tian, Yuhuan Lu, Bohao Wang, Anis Bara, Brahim Mefgouda, Hao Liu, Yiwei Tao, Sergy Petrov, Salma Cheour, Nassim Sehad, Sumudu Samarakoon, Chongwen Huang, Samson Lasaulce, Mehdi Bennis, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(哈利法大学数字未来研究所) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) University of Oulu(奥卢大学) Aalto University(阿尔托大学) Université de Lorraine, CNRS, CRAN(洛林大学,法国国家科学研究中心,CRAN)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出电信世界模型(TWM),结合数字孪生与基础模型,解决6G网络中动态建模、不确定性处理和多层控制规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07189 2026-04-09 cs.CL 50%

Agent-Driven Corpus Linguistics: A Framework for Autonomous Linguistic Discovery

基于代理的语料库语言学:一种自主语言发现的框架

Jia Yu, Weiwei Yu, Pengfei Xiao, Fukun Xing

机构 * Zhejiang International Studies University(浙江外国语学院) Tianjin University(天津大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于代理的语料库语言学框架,通过大语言模型与语料库查询引擎的交互,实现自动化的语言研究,提升研究效率并降低技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏