arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3352 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3352 篇

2608.10864 2026-08-12 cs.CV 新提交 78%

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models

面向视觉语言模型空间推理的多视图关系蒸馏

Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09682 2026-08-11 cs.CV 新提交 78%

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

用工具思考,而非用像素思考:工具调用作为视觉推理的文本支架

Jiahao Shao, Yuanbo Yang, Yiyi Liao, Yujun Shen, Ceyuan Yang, Yinghao Xu

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 该研究提出工具调用支架假设,引入TextCall方法验证返回图像冗余,仅用结构化文本支架即可实现视觉推理,降低延迟并消除工具API调用,结论适用于现有相关基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08648 2026-08-11 cs.CV 新提交 78%

Agentic Visual Reasoning in Whole-Slide Pathology Images via Active Perception

基于主动感知的全切片病理图像智能体视觉推理

Jingyun Chen, Fengchun Liu, Linghan Cai, Songhan Jiang, Shenjin Huang, Hongpeng Wang, Lequan Yu, Yongbing Zhang

机构 * College of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 该研究提出AdaptivePath主动感知框架,通过序列决策实现千兆像素病理切片的视觉推理,在病理VQA基准及TCGA六队列癌症亚型分类上取得最优性能,辅助病理学家诊断。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04451 2026-08-10 cs.CV 版本更新 78%

RemoteZero: Geospatial Reasoning with Zero Labels

RemoteZero:零样本地理空间推理

Liang Yao, Fan Liu, Shengxiang Xu, Chuanyi Zhang, Rui Min, Shimin Di, Yuhui Zheng

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04130 2026-08-06 cs.CV 新提交 78%

Radar4D-VLM: Proposal-Grounded Temporal 4D Radar Reasoning Across Frozen Language Models

Radar4D-VLM:基于提议的跨冻结语言模型的时序4D雷达推理

Jiaju Han, Xuemeng Sun, Qike Zhang, Xiang Chen, Luwei Yang, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出仅用雷达的时序视觉-语言模型Radar4D-VLM,结合提议的时序目标标记等,在K-Radar验证集上表现优异,且雷达标记接口兼容多款冻结语言骨干,为雷达多模态推理奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03187 2026-08-05 cs.NE 新提交 78%

NeuroMosaic: Anatomically Grounded Multimodal Large Language Modeling for Molecularly Aware Glioma Reasoning from 3D MRI and Clinical Narratives

NeuroMosaic:基于解剖学的多模态大语言模型,用于从3D MRI和临床叙事中进行分子感知的胶质瘤推理

Yantong Liu, Zheyu Zhang, Runpeng Liu, Mu Xitang, Seong-Yoon Shin, Hyun-Ae Lee

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 该研究针对多模态医疗大语言模型在神经肿瘤学中的结构缺陷,提出NeuroMosaic模型,通过多模块架构实现胶质瘤的准确推理,在多个数据集上取得优异性能,验证了解剖学索引路由机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00743 2026-08-04 cs.CV 新提交 78%

LUT: Latent Utility Training for Visual Reasoning

LUT:用于视觉推理的隐式效用训练

Jiaxuan Kang, Siyu Chen, Mingda Li, Mingjie Liu, Tianyue Wang, Zhaoyang Wei, Yongheng Zhang, Yanchao Hao, Zheng Wei

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00518 2026-08-04 cs.CV 新提交 78%

GuideGround: VLM-guided Semantic Understanding and Viewpoint-aware Reasoning for 3D Visual Grounding

GuideGround:用于3D视觉定位的VLM引导语义理解与视点感知推理

Yiwen Wang, Yuyang Deng, Yihao Long, Xi Zhao

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 GuideGround是一种VLM引导的3D视觉定位框架,用VLM生成的语义描述替代闭集分类、逐视图保留假设并经VLM验证,在ReferIt3D基准上性能优于现有SOTA。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28595 2026-07-31 cs.CV 新提交 78%

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Beacon:智能体何时及如何执行智能体视觉推理

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

机构 * Peking University(北京大学) Kling Team(Kling团队) HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZJU(浙江大学) THU(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27145 2026-07-30 cs.CV 新提交 78%

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理

Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

机构 * Heritage Institute of Technology(遗产技术学院) Kalyani Government Engineering College(卡利亚尼政府工程学院) IAIRO Intel Corporation(英特尔公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22039 2026-07-30 cs.CV 版本更新 78%

OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning

OmniAD:基于多模态推理的工业异常检测与理解

Shifang Zhao, Yiheng Lin, Lu Han, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) Visual Intelligence + X International Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际合作实验室) Key Laboratory of Noise and Vibration Research, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所噪声与振动重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 OmniAD是融合视觉与文本推理的多模态框架,以Text-as-Mask Encoding等技术实现工业异常检测与理解,在MMAD基准性能超Qwen2.5-VL-7B等模型,代码与模型将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21722 2026-07-27 cs.CV 新提交 78%

Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints

保持一致!利用一致性约束增强大视觉语言模型中的鲁棒视觉推理

Liqiang Jing, Xiong Zhou, Siddharth Varia, Neha Anna John, Xinya Du, Vassilis N. Ioannidis

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Amazon Web Services(亚马逊网络服务公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究针对LVLMs在视觉推理任务中较脆弱的问题,引入ConVBench基准及逻辑一致性等评估指标,提出ConVLM,通过基于GRPO的强化学习及一致性奖励改进LVLM推理,利用自动生成的问答对和双重奖励设计提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21085 2026-07-24 cs.CV 新提交 78%

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

Geo3R:减轻多模态大语言模型中的空间推理幻觉

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Tong Jia, Ying Li

机构 * Peking University(北京大学) Joy Future Academy(京东探索研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 多模态大语言模型推理空间关系易产生幻觉,现有方法效果有限。本文定义空间推理幻觉及常见场景,提出无训练的Geo3R框架,结合几何证据和结构化3D推理减轻幻觉,实验证明该框架显著减少幻觉,优于现有模型和方法。

Comments Accepted by ACM MM 2026. This is the arXiv preprint version, not the camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20515 2026-07-24 cs.CV 版本更新 78%

S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

S-Agent:空间工具使用激发空间智能推理

Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong, Zhaoxi Chen, Fangfu Liu, Tao Wang, Kim-Hui Yap, Ziwei Liu

机构 * NTU(南洋理工大学) THU(清华大学) ByteDance(字节跳动) NWPU(西北工业大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出S-Agent空间工具使用智能体范式,通过时空证据积累和层次化工具集,将VLM作为语义规划器,实现连续多视图图像和视频的空间推理,在无训练下提升开源和闭源VLM性能,并基于S-300K轨迹微调得到紧凑空间智能体S-Agent-8B。

Comments Project Page : https://Ropedia.github.io/S-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17599 2026-07-21 cs.CV 新提交 78%

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

ConsiSpace:学习几何一致性对视频空间推理很重要

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang

机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00931 2026-07-21 cs.RO cs.CV 78%

VL-Nav: Neuro-Symbolic Reasoning-based Vision-Language Navigation

VL-Nav: 一种基于神经符号的方法用于基于推理的视觉语言导航

Yi Du, Taimeng Fu, Zhipeng Zhao, Shaoshu Su, Zitong Zhan, Qiwei Du, Zhuoqun Chen, Bowen Li, Chen Wang

机构 * Spatial AI & Robotics Lab, University at Buffalo, USA(美国布法罗大学空间人工智能与机器人实验室) Robotics Institute, Carnegie Mellon University, USA(卡内基梅隆大学机器人研究所)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出VL-Nav,一种结合神经推理与符号引导的视觉语言导航系统,通过任务规划和探索系统提升机器人在复杂环境中的导航能力,实验证明其在室内和室外场景中均取得较高成功率。

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07530 2026-07-21 cs.RO 版本更新 78%

ICLR: In-Context Imitation Learning with Visual Reasoning

ICLR: 基于视觉推理的上下文模仿学习

Toan Nguyen, Weiduo Yuan, Songlin Wei, Hui Li, Daniel Seita, Yue Wang

机构 * University of Southern California(南加州大学) Autodesk Research(Autodesk研究)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 ICLR通过结合视觉推理与上下文模仿学习,提升机器人在复杂任务中的适应性和泛化能力。

Comments Accepted to IROS 2026. Project website: https://toannguyen1904.github.io/ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14544 2026-07-17 cs.CV 新提交 78%

3D Geometric Tooth Alignment Planning via Deep Reinforcement Learning

通过深度强化学习进行3D几何牙齿对齐规划

Yong Li, Jianwen Lou, Jiayue Ma, Yao-Xiang Ding, Youyi Zheng, Haihua Zhu

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Stomatology Hospital, Zhejiang University School of Medicine(浙江大学医学院附属口腔医院)

专题命中 视觉空间推理 :planning(title,abstract)

AI总结 研究针对3D几何牙齿对齐规划问题,提出基于深度强化学习的框架。利用马尔可夫决策过程,结合三项创新:基于Transformer的智能体、动态掩码方案和两阶段课程学习策略,在数据集上评估,该方法在路径安全和效率上优于基线,提供自动化正畸对齐规划方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12503 2026-07-16 cs.CV 版本更新 78%

DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs

DynTrace:用于多模态大语言模型中4D时空推理的动态对象证据跟踪

Rongxin Gao, Yuzhi Huang, Dongxuan Liu, Chu Li, Zhenye Wang, Jie Wu, Shuzhao Xie, Jingyan Jiang, Xinghao Ding, Xiaotong Tu, Yue Huang

机构 * Xiamen University(厦门大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究针对多模态大语言模型在连续动态场景感知中跟踪动态对象证据的局限,提出DynTrace框架,含DTV和DT-Token两个互补组件,能为模型提供基于几何视觉先验和结构化时空轨迹的动态对象证据,在多个基准测试中达先进水平。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11173 2026-07-14 cs.CV 新提交 78%

When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning

当深度以文字表述比图像展示更好用时:用于视觉语言空间推理的深度序数提示

Quynh Vo, Phuc Dao, Cong-Duy Nguyen, Thong Nguyen

机构 * National University of Singapore(新加坡国立大学) Center of AI Research, VinUniversity(文大人工智能研究中心)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究视觉语言模型空间推理难题,提出深度序数提示(DOP)方法,该方法无需训练,将单目深度转换为序数文本提示,在伪深度提供可靠排序时可改善空间推理,简单且针对性强,与其他无需训练的深度提示方法有竞争力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05716 2026-07-14 cs.CV 版本更新 78%

Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

场景图思维:增强多模态大语言模型的结构化视觉推理

Zhiwei Yang, Yuanchen Wu, Nan Zhang, Yucong Meng, Ke Yan, Shouhong Ding

机构 * Fudan University(复旦大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对多模态大语言模型忽视结构化关系的问题,提出场景图思维(SaGe)范式,通过自动数据引擎转换数据、构建训练数据,采用两阶段图对齐训练范式,在多模态基准测试中取得显著改进,提升细粒度感知和推理能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17889 2026-07-14 cs.CV 版本更新 78%

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理

Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin, Yunyun Shi, Xuecheng Wu

机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13132 2026-07-14 cs.CV 版本更新 78%

SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis

SplatReasoner:通过新颖视图合成增强具身推理与基础能力

Kim Yu-Ji, Dahye Lee, Kim Jun-Seong, Nam Hyeon-Woo, GeonU Kim, Yongjin Kwon, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh

机构 * POSTECH KAIST(韩国科学技术院) ETRI(韩国电子电信研究院) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究针对视觉语言模型应用于具身场景理解受固定视角限制的问题,提出SplatReasoner框架,利用3D高斯点云将新颖视图合成引入推理过程,经实验验证该方法能提升具身推理和3D基础能力。

Comments Accepted at ECCV 2026. Project page: https://splatreasoner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12939 2026-07-13 cs.RO 版本更新 78%

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用

Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) YXGN Robotics(YXGN机器人) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学) Huazhong University of Science and Technology(华中科技大学) Xiamen University(厦门大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 RoboStream通过时空融合令牌和因果时空图实现持久记忆,解决机器人长时间任务中的几何锚定和状态追踪问题,提升长期任务表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20644 2026-07-10 cs.CV 版本更新 78%

Vision-Language Memory for Spatial Reasoning

用于空间推理的视觉语言记忆

Zuntao Liu, Yi Du, Taimeng Fu, Shaoshu Su, Cherie Ho, Chen Wang

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究针对当前视觉语言模型在视频空间推理中未达人类水平的问题,提出VLM²,通过双记忆模块,即工作记忆和情景记忆,实现固定成本下的高效空间推理,在多基准测试中取得最优性能,推动视觉空间智能发展。

Comments Accepted to European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06165 2026-07-08 cs.RO 新提交 78%

EAGOR: Embodied Reasoning in Omni-direction

EAGOR:全方位的具身推理

Shriram Damodaran, Soumyaratna Debnath, Yan Wu, Wei-Yun Yau, Addison Lin Wang

机构 * EmPACT Lab, NTU Singapore Institute for Infocomm Research, A*STAR Singapore(EmPACT实验室,南洋理工大学信息与通信研究所,A*STAR新加坡)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究针对现有视觉语言模型在处理360°观测时方向估计不一致的问题,提出无需训练的几何感知框架EAGOR,将方向推理表述为球面上的递归贝叶斯估计,引入球谐信念场,实验证明其性能优于现有方法。

Comments 12 Pages, 7 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03614 2026-07-07 cs.CV 新提交 78%

IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning

IDEAL-Bench:用于分析3D布局推理的室内数据集和评估套件

Yuening Cai, Junwei Zhou, Youran Qu, Yu-Wing Tai

机构 * Department of Computer Science Dartmouth College(达特茅斯学院计算机科学系)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 介绍IDEAL-Bench评估套件,让视觉语言模型预测室内场景结构化3D布局,基于IDEAL-Scenes数据集,评估15个模型发现任务待解、模型存在不对称性及排名差异,为下一代模型空间智能评估铺路。

Comments 36 pages. Project page: https://ideal3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27318 2026-07-07 cs.CV 版本更新 78%

Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning

Q-GeoMem:面向视频空间推理的问题引导几何记忆

Xianqiang Gao, Qizhi Chen, Delin Qu, Haoming Song, Zhigang Wang, Bin Zhao, Dong Wang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) TeleAI

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出Q-GeoMem框架,通过问题引导的几何记忆机制,结合细粒度上下文库和语义几何证据库,在视频空间推理任务中实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13742 2026-07-07 cs.HC 版本更新 78%

Spatial Balancing: Designing an LLM-Powered Spatial Externalization Interface for Iterative Science Communication Writing

空间平衡:利用空间推理在LLM辅助科学传播写作中平衡科学阐述与叙述吸引力

Kexue Fu, Jiaye Leng, Yawen Zhang, Jingfei Huang, Yihang Zuo, Runze Cai, Zijian Ding, Ray LC, Shengdong Zhao, Qinyuan Lei

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出SpatialBalancing系统,通过结合人类空间推理与大语言模型的语义能力,提升科学传播写作中科学严谨性与叙述吸引力的平衡。

Comments DIS '26

Journal ref In Designing Interactive Systems Conference (DIS '26), June 13-17, 2026, Singapore, Singapore. ACM, New York, NY, USA, 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06575 2026-07-07 cs.RO cs.CV 版本更新 78%

Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies

通过本体感知进行思考:用于VLA策略的状态基础视觉令牌选择

Fangyuan Wang, Peng Zhou, Jiaming Qi, Shipeng Lyu, Chengyang He, David Navarro-Alarcon, Guodong Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东区技术研究所) Great Bay University(大湾大学) Northeast Forestry University(东北林业大学) National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究VLA模型中本体感知应用问题,提出ThinkProprio方法,将本体感知离散化为视觉语言模型(VLM)词汇令牌,与指令共同作用在VLM计算前选视觉补丁,贡献是提升性能、降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏