Retrieval Grounding Latent Reasoning for Dense Retrieval
用于密集检索的检索 grounding 潜在推理
机构 * Meituan(美团)
专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI
AI总结 本文提出用于密集检索的 RGLT 框架,结合过程监督蒸馏与检索 grounding 监督优化潜在推理轨迹,在推理密集型检索基准上优于基线且保持高效推理。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
用于密集检索的检索 grounding 潜在推理
机构 * Meituan(美团)
专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI
AI总结 本文提出用于密集检索的 RGLT 框架,结合过程监督蒸馏与检索 grounding 监督优化潜在推理轨迹,在推理密集型检索基准上优于基线且保持高效推理。
INFORM-CT:整合LLM和VLM用于腹部CT的偶发发现管理
机构 * GE Healthcare Technology and Innovation Center(GE医疗技术与创新中心) ; Boston Medical Center(波士顿医疗中心)
专题命中 视觉定位与Grounding :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出基于LLM和VLM的计划-执行框架,用于提高腹部CT偶发发现的检测、分类和报告效率与精度,通过自动化流程提升临床应用效果。
Comments Spotlight presentation at the 9th International Conference on Medical Imaging with Deep Learning (MIDL) 2026 Additional code and implementation details available at this https URL (https://idan-tankel.github.io/InformCT_ProjectPage/)
IoUPD:用于多模态大语言模型视觉定位的IoU感知特权蒸馏
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; State Key Laboratory of Communication Content Cognition(通信内容认知技术国家重点实验室) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);分类 cs.CV
AI总结 研究多模态大语言模型视觉定位中训练与评估不匹配问题,提出IoUPD方法,利用真实框作特权指导,训练时学生模型接收原始信息,教师模型接收增强提示,经监督微调与特权蒸馏损失训练,推理时无需额外模块,实验显示该方法有改进。
Comments 16 pages, 7 figures, 10 tables
MedPlex:用于临床基础医学分割的深度视觉-语言协同适配
机构 * Wayne State University(韦恩州立大学) ; Henry Ford Health(亨利福特医疗集团) ; Institute for AI and Data Science Wayne State University(韦恩州立大学人工智能与数据科学研究院)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 MedPlex是一种端到端VLM框架,通过双向融合和两级概念对齐,实现医学图像分割的视觉-语言协同适配,在CT、MR的多类医学分割任务中达到最优性能。
Comments Accepted By BMVC-2026
无校正控制的基础:大语言模型的真值追踪剖面
机构 * Humber Polytechnic(亨伯理工学院) ; University of Toronto(多伦多大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI
AI总结 本文研究大语言模型中无校正控制的基础问题,提出路径剖面概念以分析真值追踪,指出纯文本模型继承的模式可提供衍生可应答性,不同方法对任务的真值追踪改进可能与表面改进不一致。
Comments 24 pages, 1 figure, 1 table. A six-page methodological supplement, reproducible R script, and constructed data are included as ancillary files
AutoSchema:面向异构知识图谱的智能体文本转SPARQL的实时模式接地
机构 * The University of Tokyo(东京大学) ; National Institute for Materials Science(国立材料科学研究所) ; RIKEN Center for Advanced Intelligence Project(理化学研究所高级智能项目中心)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG
AI总结 提出无需训练的AutoSchema框架,用于异构知识图谱的智能体文本转SPARQL的实时模式接地,在多项生物医学KGQA等任务中优于TogoMCP,可支持未记录RDF图谱。
CodeOCR: 关于视觉语言模型在代码理解中的有效性
机构 * Shanghai Jiao Tong University China ; Hohai University China ; Singapore Management University Singapore ; Imperial College London United Kingdom ; East China Normal University \& Shanghai Innovation Institute China ; Chongqing University China ; Shanghai Jiao Tong University ; Hohai University ; Singapore Management University ; Imperial College London ; East China Normal University \& Shanghai Innovation Institute ; Chongqing University
专题命中 视觉定位与Grounding :vision language model(title)
AI总结 本文探讨多模态大语言模型在代码理解中的有效性,发现其可通过图像压缩显著提升效率,并在代码克隆检测等任务中表现出更强的抗压缩能力。
Comments ISSTA 2026 camera ready. Code and data are available at this https URL (https://github.com/YerbaPage/CodeOCR)
SCVIB:面向多轮个性化定位的可编辑状态条件视觉实例绑定
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 该研究提出多轮个性化定位设置SCVIB,结合TT-VG与VEGA方法构建测试平台,解决多轮定位中支持证据利用不足问题,相关指标优于对比方法。
NEURON:一种面向临床可解释性的神经符号系统
机构 * University of North Texas(北卡罗来纳大学达顿分校) ; Texas Tech University Health Sciences Center(德克萨斯农工大学健康科学中心)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 NEURON结合医学本体和机器学习模型,提升预测可靠性与临床可解释性,通过RAG层生成自然语言解释,在MIMIC-IV数据集上提升AUC至0.84-0.88。
我们能否防御AI生成视频对现实世界危机事件的攻击?对检测器、生成器及社交传播的系统性评估
专题命中 视觉定位与Grounding :MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 本研究推出RA-Bench基准,系统评估AI生成视频检测器、生成器及社交传播特性,发现现有检测器泛化性差、难以检测逼真生成视频,需鲁棒检测器。
Comments 63 pages, 20 figures, 32 tables
基于ISO标准的非功能性需求(NFR)规范是否能提升大语言模型(LLM)的代码生成能力?针对丰富干预方式、结构化干预方式与自然语言基线的对比研究
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 该研究对比了ISO标准下丰富自然语言、结构化JSON与单行基线三种NFR规范对LLM代码生成的影响,发现前者可提升代码静态质量,且语义内容比格式更重要。
Comments 11 pages, 2 figures, Accepted for publication at the 20th Brazilian Symposium on Software Components, Architectures, and Reuse (SBCARS 2026)
Wyvern:用于生成基于事实的多模态报告的智能体框架
机构 * Politecnico di Torino(都灵理工大学) ; Huawei Research(华为研究院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 针对生成式模型内容缺乏事实依据的问题,提出Wyvern多智能体框架生成多模态技术报告,经评估其图像信息量、报告实用性及引用指标均优于基准方法。
大语言模型不承担“跳跃”的代价
机构 * Birla Institute of Technology and Science, Pilani(毕拉理工与科学学院皮拉尼分校)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究指出LLMs无法完成催生科学发现的溯因“跳跃”,因固定权重Transformer推理缺乏认知误差与物理代价的耦合,提出机器溯因需更深层物理机制的核心观点。
Comments 14 pages
HAM-RAG:面向结构保真交错生成的层级感知多模态检索增强生成
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文针对现有多模态RAG方法丢失结构化文档层级信息的问题,提出HAM-RAG框架,引入HAM-Bench基准验证,使多模态平均性能提升17.3%,为可靠多模态助手提供了层级感知的基础信号。
TeachMateGPT:面向科学课程材料的多智能体知识基教学评估生成框架
机构 * Ahsanullah University of Science and Technology(阿赫桑乌拉科技大学) ; American International University - Bangladesh(孟加拉国美国国际大学) ; Jashore University of Science and Technology(杰索尔科技大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 TeachMateGPT作为多智能体知识基框架,通过四项改进解决现有RAG系统局限,生成的科学评估题提升了忠实度与相关性,相关数据集经教师评分验证。
生成无奖励的评判标准以减少智能体评估中的过度打分
机构 * Trinity College Dublin(都柏林三一学院) ; University College Dublin(都柏林大学学院) ; Dublin City University(都柏林城市大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究提出 RubricForge 方法,从带标签轨迹生成无奖励的智能体评判标准,可减少智能体评估中的过度打分,在 tau-bench 和 WebShop 上的表现优于通用 G-Eval 评判器。
先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击
机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) ; School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) ; State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) ; Alibaba Group(阿里巴巴集团) ; School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.LG
AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。
基于理论的评估揭示了LLM个性化中的作者身份差距
机构 * April 2026(2026年4月)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文通过理论指导的评估方法,揭示了LLM个性化中作者身份差距的问题,采用三种测量传统评估四种个性化方法,发现理论指导的指标能提供更准确的基准。
Comments Accepted at CTB Workshop, ICML 2026