Correlation and Navigation in the Vocabulary Key Representation Space of Language Models
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments This paper is 12 pages long and represents the initial draft, version 1
专题命中 视觉空间推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL
Comments CORLW 2023
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments RSS 2023. Project page: https://concept-fusion.github.io Explainer video: https://www.youtube.com/watch?v=rkXgws8fiDs Code: https://github.com/concept-fusion/concept-fusion
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
Comments Accepted on CVPR2021; Implementation will be available at https://github.com/HanqingWangAI/SSM-VLN
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG
专题命中 视觉空间推理 :planning(abstract,comments);reasoning(abstract)
Comments 6 figures, 2 tables, Accepted to Robotics: Science and Systems (RSS) 2025 Workshop on Robot Planning in the Era of Foundation Models (FM4RoboPlan)
PROBE:基于操作的视觉问答(使用VLM智能体)
机构 * NVIDIA(英伟达)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 针对现实杂乱环境中需操作遮挡物体的视觉问答问题,提出PROBE框架,含模拟器、基准测试集及微调方案,提升VLM智能体性能并验证模拟到现实的迁移。
GaussianDWM++:用于统一场景理解、编辑与多模态生成的语言接地3D高斯驾驶世界模型
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) ; Tsinghua University(清华大学) ; Chongqing Afari Intelligent Drive Co., Ltd.(重庆阿法瑞智能驾驶有限公司) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 该研究提出GaussianDWM++,通过基础特征高斯分词器等模块构建统一框架,在多类驾驶任务中实现场景理解、编辑与多模态生成,性能达当前最优。
OccPlanner:面向像素目标导航的目标感知占用条件扩散规划器
机构 * Changhong Intelligent Robot(长虹智能机器人) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 该研究针对像素目标导航的3D目标定位与无碰撞规划难题,提出OccPlanner模型,引入L3ROcc生成监督,在仿真中大幅提升导航成功率,还验证了其仿真到真实的迁移适配性。
Comments Technical report. 11 pages, 6 figures, and 2 tables
持久故事世界模拟与连续角色定制
机构 * Xiamen University(厦门大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ; Fuxi AI Lab, Netease Inc.(福克斯AI实验室,网易公司)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出EverTale,通过统一LoRA模块实现连续角色自定义,引入质量门和区域聚焦采样策略,提升多角色视觉叙事的准确性和一致性。
GeoBridge:用于生成式图像地理定位的解耦语义条件机制
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; School of Advanced Interdisciplinary Sciences(先进交叉科学学院) ; School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院) ; Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 GeoBridge是一种解耦语义条件机制,通过连接冻结语义MLLM与黎曼流匹配头,在IM2GPS3K数据集上25/200/750公里阈值下准确率达38.67/52.89/70.37,提升了生成式图像地理定位性能,属解码侧算法贡献。
空间思维链:面向视觉语言模型的模态无关空间定位
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 该研究提出轻量架构无关框架Space Tokens,将空间信息蒸馏为连续token融入VLMs的思维链,在VSI-Bench上提升两款模型性能,在尺寸估计任务达SOTA,实现高效空间推理。
深度学习在几何问题求解中的应用综述
机构 * Renmin University of China(中国人民大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文综述了深度学习在几何问题求解中的应用,涵盖相关任务、方法、评估指标及未来方向,旨在提供实践参考以推动该领域发展。
Comments ACL 2026 Main Conference
RynnBrain 1.1:迈向更具能力和通用性的具身基础模型
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(湖畔实验室)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 介绍RynnBrain 1.1具身基础模型家族,其经统一框架训练,相比1.0版本有改进。开发RynnBrain - VLA并部署。该模型在多方面成果显著,初始化策略表现优,联合训练提升了得分和成功率。
Comments KL,BH,MZ,TZ,ZC,ZW,SL,XL,XL,BY,MZ,JL,RD contribute equally. Project Lead: Kehan Li and Xin Li project: https://alibaba-damo-academy.github.io/RynnBrain github: https://github.com/alibaba-damo-academy/RynnBrain huggingface: https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11 modelscope: https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11
CinemaTraj:用LLM智能体为3D场景合成原子相机轨迹
机构 * Technical University of Munich(慕尼黑工业大学) ; Huawei Dresden Research Center(华为德累斯顿研究中心)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 CinemaTraj是将LLM智能体与3D场景图结合的框架,可从自然语言生成带旁白的3D场景相机轨迹,在真实环境中优于现有方法。
Comments 17 pages, including 8-page main paper, references, and supplementary material; project page: https://cinematraj.github.io/
G2-Nav:用于机器人社交导航的基于视觉语言的地面与防护代价地图
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 研究针对机器人社交导航问题,提出G2-Nav框架,将VLM语义推理转化为视觉语言代价地图,经开放集感知评估区域和代理,结合语义验证与高频安全检查,实现非结构化环境下安全、高效且符合社会规范的自主导航。
Comments submitted
用于动态视觉语言导航的从慢速推理器到快速规划器的逐令牌潜在流
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; National University of Singapore(新加坡国立大学) ; Zhejiang University(浙江大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 针对动态视觉语言导航中语言推理慢与规划需即时的矛盾,提出SPARK-VLN双系统框架,通过三个模块将慢速VLM推理器知识流到快速规划器,引入新基准套件,提高了导航成功率、社会合规性及推理效率。
EmbodiedDiffusion:用于异构机器人导航的端到端可通行性引导视觉扩散
机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科沃科学与技术研究所)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 针对自主导航中视觉可通行性估计问题,EmbodiedDiffusion框架利用无规划器合成监督等,同时预测可通行性地图与生成可行轨迹,经训练提炼语义到轻量级模型,能快速适应新平台,在多机器人室内环境中实现高效导航与轨迹生成。
Comments This work has been submitted for publication and is currently under review
DM-KG:一种提升街景图像中视觉语言模型空间认知的新方法
机构 * Institute of Surveying and Mapping, Information Engineering University(信息工程大学测绘学院) ; Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences(中国科学院地理科学与资源研究所)
专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract)
AI总结 研究针对视觉语言模型在街景图像空间认知方面的不足,提出DM-KG框架,通过提取实体关系、结合全景分割与深度估计计算坐标并编码知识图,有效提升模型空间推理准确性,降低误差,为地理视觉问答提供新框架。
SpaceDrive: 在基于视觉语言模型的自动驾驶中引入空间感知
机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) ; University of Tübingen(图宾根大学) ; Tübingen AI Center(图宾根人工智能中心) ; TU Munich(慕尼黑工业大学) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; University of Stuttgart(斯图加特大学) ; UCLA(加州大学洛杉矶分校)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 本文提出SpaceDrive框架,通过将空间信息作为显式位置编码来增强基于VLM的自动驾驶系统对精细3D空间关系的理解,从而提升规划精度和开放环性能。
基于强化学习的目标导航方法中什么重要?实证研究与统一框架
机构 * Computer Vision and Geometry Group, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机视觉与几何组) ; Robotics and Perception Group, University of Zurich, Switzerland(苏黎世大学机器人与感知组) ; Robotic Systems Lab, ETH Zurich, Switzerland(苏黎世联邦理工学院机器人系统实验室) ; Princeton Robotic Intelligence and SysteMs group, Princeton University, USA(普林斯顿大学机器人智能与系统组) ; Microsoft, Switzerland(微软公司)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 研究目标导航中基于强化学习方法各组件影响,通过分解导航管道为感知、策略和测试时增强三组件进行实证研究,引入统一框架,构建增强系统达领先性能,提供见解与建议,凸显当前智能体与人类导航差距。
CoMind:从多视角理解人类协作活动
机构 * ETH Zurich(苏黎世联邦理工学院) ; MPI for Informatics(马克斯·普朗克信息研究所) ; Microsoft Switzerland(微软瑞士公司) ; TU Munich(慕尼黑工业大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 研究旨在填补人类协作认知过程研究空白,引入CoMind数据集,整合多模态数据并标注,建立相关基准,有助于开发和评估能建模复杂社会互动及推理人类行为的AI系统。
Comments Accepted to ECCV 2026
PixelPilot:用于端到端自动驾驶的可扩展视觉-语言-动作模型
机构 * MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(教育部人工智能重点实验室,上海交通大学人工智能研究院) ; Central Research Institute, Huawei(华为中央研究院)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 针对现有视觉-语言-动作模型在自动驾驶场景中数据可扩展性有限等问题,提出PixelPilot,采用解耦规划和提升范式,通过知识灌输策略学习,提升了模型性能。
Comments Accepted by ECCV 2026
ACE-Brain-0.5:用于物理智能体人工智能的统一具身基础模型
机构 * ACE-Brain Team(ACE-Brain团队)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 研究针对具身人工智能从模块向物理智能体发展的问题,提出ACE-Brain-0.5统一基础模型,通过耦合的五个功能及SSR+等方法,提升空间感知等能力,在多基准测试中有进步。
潜在噪声掩码:减少多模态大语言模型中的视觉冗余
机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学和电子学(iOPEN)、西北工业大学) ; Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院、中国电信(TeleAI)) ; Fudan University(复旦大学) ; The University of Hong Kong(香港大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 提出Lens框架,通过轻量级LET令牌为视觉令牌评分,并注入自适应噪声抑制低相关令牌,在不改变模型结构的情况下提升多模态推理性能。
Comments 21 pages, 7 figures;
E3VS-Bench:一个用于3D高斯散射场景中视角依赖主动感知的基准
机构 * The University of Tokyo, Japan(东京大学) ; National Institute of Informatics, Japan(日本信息处理学会) ; The University of Osaka, Japan(大阪大学) ; Advanced Telecommunications Research Institute International, Japan(国际先进电信研究机构)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 E3VS-Bench通过5自由度视角控制,评估在真实3D环境中视角依赖现象的主动感知能力,测试模型在多视角探索中的表现。
Comments Project page: https://k0uya.github.io/e3vs-proj/
基于闭环VLM代理的文本引导的6D物体姿态重排
机构 * Seoul National University RLWRLD(首尔大学 RLWRLD)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 本文提出通过闭环VLM代理实现文本引导的6D物体姿态重排,引入多视角推理、坐标系可视化和单轴旋转预测等技术,提升VLM在3D场景中推理目标物体姿态的能力,且在不同VLM上均有效。