Understanding Dynamic Scenes in Ego Centric 4D Point Clouds
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
Comments Accepted as a poster to AAAI 2026; will be published in the proceedings
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
Comments Accepted as a poster to AAAI 2026; will be published in the proceedings
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
机构 * Institute of Information Science and Technologies (ISTI)(信息科学与技术研究所) ; National Research Council of Italy (CNR)(意大利国家研究理事会) ; Department of Computer Science(计算机科学系) ; University of Pisa(比萨大学) ; University College Dublin (UCD)(都柏林大学学院) ; School of Computer Science(计算机科学学院)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 7 pages, 3 figures, 5 tables
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; Xiamen University(厦门大学) ; SenseTime Research(商汤科技研究院) ; Zhejiang University(浙江大学) ; Nanjing University(南京大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
Comments 35 pages
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
Comments Accepted by ICRA 2025
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICML 2024. The first four authors contribute equally. Project page: https://embodied-generalist.github.io
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Project page: https://janghyuncho.github.io/Cube-LLM
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICLR 2021; Data, code, and videos are available at alfworld.github.io
Evidence-RL:面向证据密集型视觉推理
机构 * National University of Singapore(新加坡国立大学) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Tsinghua University(清华大学) ; Tencent(腾讯)
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
AI总结 针对视觉-语言模型依赖语言先验等问题,提出反事实证据解缠方法,结合GRPO框架在9个基准和4种骨干模型上优于现有基于RL的后训练方法。
Comments 22 pages, 10 figures
多模态空间推理的视觉信用审计
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
AI总结 该研究提出视觉信用审计(VCA)方法,分解多模态空间推理基准的成功维度,发现部分模型决策正确但未获图像额外信用,验证了其在评估模型视觉关系响应上的有效性。
Comments 20 pages, 2 figures. Code: https://github.com/SouthWinter/VCA
多模态大语言模型空间推理中空间词汇偏差的机制诊断
机构 * Kyoto University(京都大学) ; NII LLMC(日本国立信息与通信技术研究所语言模型中心) ; RIKEN AIP(日本理化学研究所先进理工研究所) ; Case Western Reserve University(凯斯西储大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The University of Osaka(大阪大学) ; University of Tokyo(东京大学)
专题命中 视觉空间推理 :reasoning(title);分类 cs.CL
AI总结 本文发现多模态大语言模型存在空间词汇偏差,即添加空间关系词会吸引模型选择该选项,并通过机制可解释性工具揭示偏差主要源于语言侧而非视觉侧,最后提出轻量级LLM-only DPO更新可有效缓解偏差。
LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航
机构 * University of Science and Technology of China(中国科学技术大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Stanford University(斯坦福大学) ; Amap, Alibaba Group(阿里巴巴集团高德地图) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
AI总结 LatentPilot通过利用未来观测作为训练数据源,学习动作条件的视觉动态,无需访问未来帧即可实现场景感知的视觉-语言导航,实验在多个基准上取得新SOTA结果。
Comments Project page:https://abdd.top/latentpilot/
如何使LLM具备3D能力?LLM中空间推理的综述
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guang Zhou)(香港科学与技术大学(广州))
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
AI总结 本文综述了将LLM与3D空间理解结合的方法,提出分类体系,涵盖图像、点云和混合模态方法,并讨论了当前限制与未来研究方向。
Comments 9 pages, 5 figures
Journal ref IJCAI 2025
双重视觉推理关于街道网络:基于图的RAG与定性空间表示
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
AI总结 本文提出一种基于图的RAG方法,利用定性空间表示提升LLM在行人导航中的路线指引能力。
语言模型的统一认知意识理论:锚定语义、激活阈值与涌现推理
机构 * Stanford University(斯坦福大学) ; UIUC(伊利诺伊大学香槟分校)
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
AI总结 该研究提出统一认知意识理论,通过语义锚定解释语言模型如何将预训练能力转化为目标导向行为,并通过实验验证了锚定强度对模型性能的影响。
Comments 21 pages, 7 figure, 4 table
机构 * Greenwich Vietnam FPT University(越南格林威治FPT大学)
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
Comments 25 pages, 3 figures
机构 * Computational Linguistics, Department of Linguistics University of Potsdam(乌特雷赫特大学语言学系计算语言学部) ; German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)柏林)
专题命中 视觉空间推理 :reasoning(title);分类 cs.CL
Comments 17 pages
机构 * Department of Mechanical Engineering(机械工程系) ; Rajshahi University of Engineering and Technology(拉贾沙希工程与技术大学) ; Department of Industrial and Production Engineering(工业与生产工程系) ; Shahjalal University of Science and Technology(沙赫jalal科学与技术大学) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) ; Department of Urban and Regional Planning(城市与区域规划系) ; Department of Computer Science Engineering(计算机科学与工程系) ; United International University(联合国际大学)
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
专题命中 视觉空间推理 :planning(title);分类 cs.LG
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
Comments 7 Figures, 2 Tables, 11 Pages
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
Comments 6 pages, 7 figures
专题命中 视觉空间推理 :reasoning(title);分类 cs.CL
Comments 13 pages, 4 figures. Code released at https://github.com/groundlight/vlm-visual-demonstrations
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
Comments 5 pages, 1 figure, 1 table, accepted in Embodied AI 2024 Workshop held in conjunction with CVPR 2024
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI
Comments 26 pages
Journal ref Spatial Cognition and Computation - 2020
专题命中 视觉空间推理 :reasoning(title);分类 cs.AI