Schema-Agnostic Graph Reasoning Agent for Hybrid Knowledge Graphs
面向混合知识图谱的模式无关图推理智能体
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出图推理智能体GRA,探索混合知识图谱,在工业基准UFK-M上准确率优于全上下文智能体,读取令牌更少,增益源于选择性访问。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
面向混合知识图谱的模式无关图推理智能体
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出图推理智能体GRA,探索混合知识图谱,在工业基准UFK-M上准确率优于全上下文智能体,读取令牌更少,增益源于选择性访问。
RISE:跨三维跟踪与结构化视觉-语言推理的路边基础设施序列理解
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出RISE框架,结合仅图像的三维跟踪方法与结构化视觉-语言推理,构建含33910个问答对的RISE-VQA数据集,通过RISE-Bench评估任务,揭示相关挑战并验证域自适应与时间上下文的益处。
面向AI友好的制图学:理解颜色设计如何影响基础模型在顺序 choropleth 地图上的空间推理
机构 * School of Geographic Sciences, Hunan Normal University(湖南师范大学地理科学学院) ; Hunan Key Laboratory of Geospatial Big Data Mining and Application(湖南省地理空间大数据挖掘与应用重点实验室) ; School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与通信工程学院) ; School of Geography and Information Engineering, China University of Geosciences(中国地质大学(武汉)地理与信息工程学院) ; Advanced Interdisciplinary Institute of Satellite Applications, State Key Laboratory of Earth Surface Processes and Resource Ecology, Faculty of Geographical Science, Beijing Normal University(北京师范大学地理科学学部卫星应用先进交叉研究院、地表过程与资源生态国家重点实验室)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究探究颜色设计对基础模型空间推理的影响,构建基准评估多模态模型,发现顺序颜色排序和足够对比度对机器地图理解关键,为AI友好制图提供实证指导。
Comments 42 pages, 12 figures, 13 tables
MetaReason:通过编辑元信息实现精确的交错多模态推理以解决几何问题
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出MetaReason框架,构建TutorGeo与ExamGeo数据集,结合监督微调与强化学习,实现几何问题的精确交错多模态推理,性能优于现有开源模型。
PolyComp:面向多模态模型组合式3D空间推理的基于多立方体(polycube)的基准测试集
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究推出PolyComp基准测试集,考察多模态模型的组合式3D空间推理能力,测试了GPT-5.6 Sol等模型的准确率与成本,并发布了120个问题。
想象感知标记增强多模态语言模型的空间推理能力
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(Allen人工智能研究所) ; Microsoft(微软) ; OpenAI(开放人工智能研究院)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。
通过目光思考:将眼动作为视觉推理监督用于医学视觉语言模型
机构 * School of Computing, University of Georgia(佐治亚大学计算机学院) ; Department of Computer Science and Engineering, University of Texas, Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) ; Massachusetts General Hospital, Harvard Medical School(麻省总医院哈佛医学院) ; Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 通过引入眼动标记,利用时间有序的注视轨迹引导医学VLM的视觉推理,提升放射学任务的性能与鲁棒性。
通过对比注意力实现聚焦:增强视觉语言模型的视觉推理能力
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of California, Merced(加州大学默塞德分校)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究针对VLMs在复杂环境下性能下降的问题,提出无训练方法CARVE,通过像素级注意力对比提取任务相关视觉信号,在开源模型上实现最高75%的性能提升,为提升视觉推理提供了高效路径。
通过表格网格导航和逐步推理提示实现高效的表格问答
机构 * Vision Intelligence Lab, IIIT Allahabad, Prayagraj, India(视觉智能实验室,印度拉贾斯坦邦阿拉哈巴德)
专题命中 视觉空间推理 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种无需训练的表格问答方法,通过TableGrid导航和Progressive Inference Prompting框架,提升了表格问答的精度和效率,并在多个数据集上验证了其有效性。
Comments Accepted for Presentation in ICDAR 2026, Vienna, Austria
面向通信高效自动驾驶的风险自适应边云视觉推理
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本研究提出风险自适应边云视觉推理架构,通过车载交通评估触发云端VLM推理,在自动驾驶中减少54.1%云端请求量,同时保持任务成功率并降低AEB触发次数,实现通信效率与性能的平衡。
Comments 7 pages, 4 figures, 5 tables
GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测
机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) ; Independent Researcher(独立研究员) ; National Center for Research (NCR)(国家研究中心)
专题命中 视觉空间推理 :reasoning(title)
AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。
Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026
GaussianDWM++:用于统一场景理解、编辑与多模态生成的语言接地3D高斯驾驶世界模型
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) ; Tsinghua University(清华大学) ; Chongqing Afari Intelligent Drive Co., Ltd.(重庆阿法瑞智能驾驶有限公司) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 该研究提出GaussianDWM++,通过基础特征高斯分词器等模块构建统一框架,在多类驾驶任务中实现场景理解、编辑与多模态生成,性能达当前最优。
超越单一物体:用大语言模型学习三维关系
机构 * AIST(日本国立 Advanced Industrial Science and Technology(AIST)) ; University of Tsukuba(筑波大学) ; University of Technology Nuremberg(纽伦堡工业大学) ; University of Oxford(牛津大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有3D-LLMs难以开展多物体间详细比较的问题,提出含MO3D数据集、Multi-3DLLM模型及Mini-apps基准的框架,该模型在MO3D任务上超越所有基线且对单物体分类有正向迁移
Comments Accepted to CVPR 2026
MUSE:一种用于理解和操控大语言模型驱动的数据科学系统的交互式元智能体
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出交互式元智能体MUSE,通过重构执行轨迹、支持上下文交互与混合意图操控,提升用户对大语言模型驱动的数据科学系统的理解与控制,经15人被试间研究验证可提高任务效率与用户信心。
Comments To appear in the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), November 2-5, 2026, Detroit, MI, USA
VibeWorlding:多模态智能体能否端到端构建3D开放世界?
机构 * HKUST(GZ)(香港科技大学(广州)) ; Tencent(腾讯) ; AI Thrust ; TEG AIPD
专题命中 视觉空间推理 :verifier(abstract);分类 cs.AI
AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。
Comments preprint
为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL
AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。
GraphLoom:面向多模态KG-RAG的可靠性校准图证据路由
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Aristotle University(亚里士多德大学) ; Dashub(达舒布)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 提出GraphLoom框架,通过可靠性校准的图证据路由实现多模态KG-RAG,在ScienceQA等数据集上提升了答案质量与证据忠实度。
大语言模型及其对力学与空间几何的认知能力
机构 * University of Innsbruck(因斯布鲁克大学) ; University of Augsburg(奥格斯堡大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究构建了全自动基准MecEng,评估32个开放权重及2个专有LLMs的机械工程认知,发现其刚体任务成功率达86.0%,但柔性多体任务仍具挑战,且该能力正快速提升但仍易出错。
L-COIN:用于亚太赫兹低轨卫星网络中博弈论分布式计算卸载的大语言模型辅助反事实推理
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 该研究针对亚太赫兹低轨卫星网络的分布式计算卸载问题,提出L-COIN框架,结合LLM与反事实推理,降低卸载成本10.9%-27.7%,提升了时变场景下的卸载性能。
SAGE-OR:面向手术室的半监督自适应场景图生成
机构 * Concordia University(康考迪亚大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 SAGE-OR是面向手术室的半监督自适应场景图生成框架,采用解耦范式,轻量高效,在4D-OR基准上F1达76%,经无监督手部增强后达86%,可低成本适配新手术场景。
Comments Accepted at BMVC 2026
I-Perceive:一种基于语言指令的主动感知基础模型
机构 * Shanghai Innovation Institute(上海创新研究院) ; Beihang University(北京航空航天大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 I-Perceive是一种基于自然语言指令的主动感知基础模型,通过融合视觉-语言模型与几何基础模型,实现了对开放意图场景的有效感知与推理。