2507.11936 2026-08-07 cs.CL cs.AI cs.CV cs.LG 67% A Survey of Deep Learning for Geometry Problem Solving 深度学习在几何问题求解中的应用综述 Jianzhe Ma, Wenxuan Wang, Qin Jin 机构 * Renmin University of China(中国人民大学) 纠错 专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG AI总结 本文综述了深度学习在几何问题求解中的应用,涵盖相关任务、方法、评估指标及未来方向,旨在提供实践参考以推动该领域发展。 Comments ACL 2026 Main Conference 详情 DOI 10.18653/v1/2026.acl-long.1829 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.05715 2026-08-07 cs.RO cs.AI 新提交 57% Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots 用一张纸劫持机器人:对VLM控制机器人的物理提示注入的系统研究 S. M . Bhagya P. Samarakoon, M. A. Viraj J. Muthugala, W. K. R. Sachinthana, Mohan Rajesh Elara 专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI AI总结 该研究针对VLM控制的分拣机器人,系统分析了四类物理提示注入攻击的成功率,发现其存在显著脆弱性,且三种简单防御措施可大幅降低风险。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.05131 2026-08-07 cs.CV cs.AI 版本更新 57% OPD-V: Visual On-Policy Self-Distillation with Modality Balance OPD-V:结合模态平衡的视觉在线策略自蒸馏 Aniri, Jinhe Bi, Peng Liao, Zengjie Jin, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua 机构 * National University of Singapore(新加坡国立大学) ; Ludwig Maximilian University of Munich(慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Sun Yat-sen University(中山大学) 纠错 专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI AI总结 该研究针对多模态大语言模型的模态不平衡问题,提出视觉在线策略自蒸馏范式OPD-V,通过正、负教师模型实现模态平衡,在多基准与骨干上提升推理性能并降低训练成本。 Comments Corrected the uploaded manuscript. Project Page:https://github.com/aniri15/OPD-V 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2601.21124 2026-08-07 cs.SD cs.AI eess.AS 版本更新 57% PhaseCoder: Microphone Geometry-Agnostic Spatial Audio Understanding for Multimodal LLMs PhaseCoder: 无关麦克风几何的多模态大语言模型空间音频理解 Artem Dementyev, Wazeer Zulfikar, Sinan Hersek, Pascal Getreuer, Anurag Kumar, Vivek Kumar 机构 * Google DeepMind(谷歌DeepMind) ; Media Lab, MIT(媒体实验室,麻省理工学院) ; Google AR(谷歌AR) 纠错 专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI AI总结 PhaseCoder是一种无需麦克风几何结构的Transformer空间音频编码器,能够生成空间嵌入并使LLM实现复杂空间推理和转录任务。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.06170 2026-08-07 cs.RO cs.CV 新提交 50% Prior-SG: Task and Prior Driven Region Segmentation for Scene Graphs in Arbitrarily-Structured Environments Prior-SG:面向任意结构环境中场景图的任务与先验驱动区域分割 Giorgio Tonetti, Laurent Kneip, Abel Gawel, Marco Hutter 机构 * RAI Institute(RAI研究所) ; ETH Zurich(苏黎世联邦理工学院) 纠错 专题命中 视觉空间推理 :reasoning(abstract) AI总结 提出Prior-SG框架,将场景图生成视为概率对齐问题,通过融合异构专家与拓扑先验提升任意结构环境的语义区域分割精度,实现零样本本体灵活性。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2608.05389 2026-08-07 cs.CV 新提交 50% Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model 基于视觉语言基础模型的文本引导多序列胶质瘤亚区分割细化 Zach Eidex, Yu-nong Lin, Mojtaba Safari, Sean Pitroda, Ralph Weichselbaum, Zhen Tian, Xiaofeng Yang 机构 * Emory University School of Medicine(埃默里大学医学院) ; The University of Chicago(芝加哥大学) ; Winship Cancer Institute(温希普癌症研究所) 纠错 专题命中 视觉空间推理 :planning(abstract) AI总结 该研究开发基于VoxTell的轻量级框架,用3D视觉语言基础模型实现文本引导的胶质瘤亚区分割细化,在BraTS-GLI及跨数据集测试中提升了分割的DSC指标,支持作为临床医生在环工具的进一步评估。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2604.11402 2026-08-07 cs.CV 版本更新 50% SCD4VPR: Multi-modal Scene Change Detection for Long-term Visual Place Recognition Database Update 基于视觉-语言表示学习的场景变化检测 Diwei Sheng, Vijayraj Gohil, Satyam Gaba, Zihan Liu, Giles Hamilton-Fletcher, John-Ross Rizzo, Yongqing Liang, Chen Feng 机构 * New York University(纽约大学) 纠错 专题命中 视觉空间推理 :reasoning(abstract) AI总结 本文提出LangSCD框架,通过融合语言和视觉信息提升场景变化检测的鲁棒性,引入几何-语义匹配模块和多类标注数据集NYC-CD,实验证明其在多个基准上的优越性能。 Comments 9 pages, 6 figures, 6 tables 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图