Thinking with Visual Grounding
视觉锚定思维
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出视觉锚定思维方法,让视觉语言模型在推理时交替生成自然语言和视觉锚点(点或框),并通过合成数据管道和锚定感知强化学习训练,在计数和空间推理任务上显著提升性能。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
视觉锚定思维
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出视觉锚定思维方法,让视觉语言模型在推理时交替生成自然语言和视觉锚点(点或框),并通过合成数据管道和锚定感知强化学习训练,在计数和空间推理任务上显著提升性能。
强制延迟:在多模态大语言模型级联中操纵路由决策
机构 * Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出强制延迟攻击(FDA),通过对抗性图像攻击降低弱模型置信度,迫使级联系统将查询路由到强模型,揭示了MLLM级联在计算分配上的安全漏洞。
自主智能体导航中学习非线性模型预测控制的贝叶斯优化
机构 * Talos Robotics AI
专题命中 视觉空间推理 :planning(abstract);分类 cs.LG
AI总结 提出一种无地图框架,结合滚动时域规划与非线性MPC,利用贝叶斯优化自动调参,在仿真和实物四足机器人上实现高效导航。
Comments Published at the IEEE ICRA 2026 Xplore Workshop (Oral), Cross-Disciplinary aspects of Exploration in Robotics, Reinforcement Learning, and Search
人类增强循环建模(HELM):基于智能体的混凝土桥梁护栏有限元建模
机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) ; Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑系) ; School of Architecture, University of Miami(迈阿密大学建筑学院)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出HELM框架,通过人机协作将有限元建模分解为可验证的检查点,在MASH TL-4和TL-5条件下将自主建模成功率从20%提升至75%。
VeriGeo: 可控几何问题生成与数值和分析验证
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出VeriGeo框架,通过可执行推理轨迹和三级验证流水线,实现用户约束下的可控几何问题生成,并利用验证引导的反思修复无效生成,提升数据可靠性。
Comments 32 pages, 4 figures, 9 tables
对抗性概念搜索:从特征几何预测组合错误
机构 * Brown University(布朗大学) ; University of Southern California(南加州大学) ; Harvard University(哈佛大学) ; Boston University(波士顿大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 利用LLM的表征几何预测其组合失败模式,发现概念编码近正交时可靠组合,编码接近时因干扰导致失败,无需评估具体输入即可预测错误。
GeoDial:面向几何问题求解的多模态对话式辅导数据集,包含可视化辅导轮次
机构 * ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; Bocconi University(博科尼大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出GeoDial数据集,包含1300+几何师生对话,通过可扩展标注协议整合对话行为、视觉高亮和反馈,微调视觉语言模型发现其难以生成准确图解高亮。
用于三维框架系统自动化结构分析的主体化大型语言模型
机构 * Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) ; School of Architecture, University of Miami(迈阿密大学建筑学院) ; HBC Engineering Company(HBC工程公司) ; Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出一种主体化LLM框架,通过投影表示和智能体流水线实现从自然语言输入到3D框架的自动化结构分析,平均准确率达90%。
Architect-Ant: 可编辑的建筑平面图自动家具布置
机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) ; Miami University(迈阿密大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出基于微调视觉语言模型的可编辑自动家具布置框架Architect-Ant,通过领域特定语言编码布局并优化,生成符合建筑约束的合理布局。
Comments 17 pages, 10 figures
Earth-OneVision:将遥感多模态大语言模型扩展到更多传感器模态和任务
机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing (SBIIP), Beijing Institute of Technology(北京理工大学空间智能信息处理国家重点实验室) ; Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) ; Key Laboratory of Technology in Geo-Spatial Information Processing and Application System, Chinese Academy of Sciences(中国科学院地理空间信息处理与应用系统技术重点实验室) ; Advanced Research Institute of Multidisciplinary Sciences, Beijing Institute of Technology(北京理工大学前沿交叉科学研究院) ; School of Mechatronical Engineering, Beijing Institute of Technology(北京理工大学机电学院) ; School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) ; School of Electronics, Peking University(北京大学电子学院) ; School of Computer Science and Hubei Key Laboratory of Intelligent Geo-Information Processing(华中科技大学计算机科学与技术学院&湖北省智能地理信息处理重点实验室)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出Earth-OneVision,一个2B参数的RS-MLLM,通过全粒度视觉语言对齐、空间语言同构序列化和渐进式跨模态适应机制,统一六种传感器模态和九类任务,在多个基准上达到或超越4B-72B模型。
WebChallenger: 一个可靠且高效的通用型Web智能体
机构 * ML Collective ; longsurf.ai ; Independent(独立研究者)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL
AI总结 提出WebChallenger框架,通过PageMem结构化页面表示、分治观察、轻量探索记忆和复合动作工作流,复现人类认知优势,使开源模型在多个Web导航基准上接近前沿专有系统性能。
RunAgent SuperBrowser: 基于人类浏览行为的自主网页导航理论
机构 * RunAgent AI
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出SuperBrowser自主网页导航代理,通过模仿人类浏览的感知-认知-行动三元机制,在Mind2Web Hard基准上以89.47%成功率超越现有开源研究代理。
Comments 31 pages, 8 figures, preprint/work in progress
从风险函数到语言空间:Cox监督的生存风险蒸馏到大语言模型
机构 * Centre for Big Data Research in Health, the University of New South Wales(新南威尔士大学健康大数据研究中心)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 提出将Cox比例风险模型的时间事件风险信息迁移到大语言模型中的方法,通过文本提示微调Qwen模型,在三个数据集上取得有竞争力的区分度和校准性,并发现隐藏状态呈现连续风险梯度。
构建用于HPC代码现代化的智能体AI
机构 * San Diego Supercomputer Center(圣地亚哥超级计算机中心) ; University of California, San Diego(加州大学圣地亚哥分校) ; La Jolla, California, United States(圣地亚哥, 加州, 美国)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出一种结构化智能体AI方法,通过手动示例、持续可构建性和限制会话范围,成功将6万行Fortran MPI代码在数月内转换为C++ OpenMP并行代码。
Comments 10 pages
通过发起野生的代码理解之旅来投射SWE代理新兴思维模式
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文通过有限工具接口让SWE代理在真实代码库中探索,提出Ada框架,利用观察透镜分析代理的导航、证据选择、综合、基础化和停止行为,将轨迹数据转化为可比较的行为画像。
GVC-Seg: 基于几何视觉对应的免训练3D实例分割
机构 * Victoria University of Wellington(惠灵顿维多利亚大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Southern University of Science and Technology(南方科技大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出GVC-Seg,一种免训练的3D实例分割方法,通过几何与视觉特征对应消除多模型集成中的置信度偏差,在多个基准上达到最优性能。
Comments 10 pages, 5 figures
最后一个可见像素:探究视觉-语言模型中的精细尺度感知
机构 * University of Luxembourg(卢森堡大学) ; Foyer S.A. ; Université Paris-Saclay(巴黎-萨克雷大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出FineSightBench基准,通过4-48像素尺度分离感知与推理任务,发现视觉-语言模型感知在12像素饱和,推理在更大尺度仍受限,揭示精细视觉推理的根本缺陷。
Comments 25 pages
基于视觉基础模型的注意力一致纵向医学视觉问答
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Yale Biomedical Imaging Institute(耶鲁大学生物医学成像研究所)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出一种注意力引导的编码器-解码器框架,通过轻量级配准和自适应掩码生成,结合辅助损失函数,实现胸部X光片的纵向医学视觉问答,在Medical-Diff-VQA基准上取得优异性能。
Comments Accepted to CVPR 2026 Workshop PHAROS-AIF-MIH
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6448-6458
Graph-MambaNav:利用对象关系知识的时空图Mamba用于目标对象导航
机构 * School of Internet of Things Engineering, Wuxi University(无锡大学物联网工程学院) ; School of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本研究提出Graph-MambaNav,一种结合LLM常识对象关系的目标感知时空图编码框架,通过节点排序与Mamba建模实现高效导航,在仿真环境表现优异且泛化性好,经真实机器人部署验证有效。
Comments Accepted by IEEE Robotics and Automation Letters (IEEE RA-L), will transfer to 2027 IEEE International Conference on Robotics & Automation (ICRA)
双流形几何引导的表示学习:核空间与数据空间的自适应耦合
机构 * School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) ; Guangdong Provincial Key Laboratory of Medical Image Processing, Southern Medical University(南方医科大学广东省医学图像重点实验室)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 该研究提出双流形视角,构建KGFT轻量级模块,结合利用与探索模式及深度感知策略,在ResNet等架构的图像分类等任务上取得一致性能提升,验证了方法的通用性与有效性。
视觉-语言模型能否从机器人的第一人称视角图像评估人际距离风险?
机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) ; University of Turin(都灵大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 该研究评估了InternVL、Qwen-VL、SmolVLM三种VLM在机器人第一人称视角图像人际距离危险分类中的表现,发现Qwen-VL经特定优化后高危险召回率更高,当前VLM在相关推理定位上仍有局限。
Comments Accepted at the EMR 2026 workshop at ECCV 2026 (non-archival)
生成式AI时代的地理可视化重构:领域专家的见解
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本研究通过访谈20位地理可视化专家,探究生成式AI对地理可视化实践的影响,发现其拓展了相关能力但转移了瓶颈,提出需领域特定方法实现负责任应用,为相关实践、教育等提供启示。
多智能体目标存在性验证与学习型掩码几何优化:2026年第8届LSVOS挑战赛MeViS-Text赛道获胜报告
机构 * Soongsil University(崇实大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本研究提出SSUPER方案,通过多智能体审计解耦存在性验证、StyleRefiner优化掩码几何,获2026年LSVOS挑战赛MeViS-Text赛道冠军,最终得分0.9081339614。
LEGO:分层语言高斯溅射
机构 * Wuhan University(武汉大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。
Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/
RefineAny3D:作为语义对齐的深度细化用于单目3D检测
机构 * Michigan State University(密歇根州立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 视觉空间推理 :chain-of-thought(abstract)
AI总结 RefineAny3D将单目3D检测的深度细化转化为视觉对齐问题,通过VLM实现无需数值预测的深度修正,在多类检测工具上均有性能提升且可泛化。
基于旅游视频先验的面向目标的导航指令生成
机构 * Uni-Ubi AI(优必爱人工智能) ; Zhejiang University(浙江大学) ; Tongji University(同济大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。
AtlasVLA:面向视觉-语言-动作模型的持久化世界-自我状态建模
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 AtlasVLA是一种新型VLA模型框架,通过双记忆架构实现持久化世界-自我状态建模,在仅用腕部单目相机的情况下,在LIBERO等基准及真实世界长时序任务中性能超越多视图基线。
Prior-SG:面向任意结构环境中场景图的任务与先验驱动区域分割
机构 * RAI Institute(RAI研究所) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出Prior-SG框架,将场景图生成视为概率对齐问题,通过融合异构专家与拓扑先验提升任意结构环境的语义区域分割精度,实现零样本本体灵活性。
基于视觉语言基础模型的文本引导多序列胶质瘤亚区分割细化
机构 * Emory University School of Medicine(埃默里大学医学院) ; The University of Chicago(芝加哥大学) ; Winship Cancer Institute(温希普癌症研究所)
专题命中 视觉空间推理 :planning(abstract)
AI总结 该研究开发基于VoxTell的轻量级框架,用3D视觉语言基础模型实现文本引导的胶质瘤亚区分割细化,在BraTS-GLI及跨数据集测试中提升了分割的DSC指标,支持作为临床医生在环工具的进一步评估。
HiSC:用于高效3D场景理解的分层空间聚类令牌压缩
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。
Comments Accepted by ACM MM 2026