Bridging the Gap between 2D and 3D Visual Question Answering: A Fusion Approach for 3D VQA
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments To be published in AAAI 24
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments To be published in AAAI 24
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
Comments 18 pages, 13 figures
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at AAAI 2024
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Project Page: : https://vis-www.cs.umass.edu/3dllm/
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICLR 2023. First two authors contributed equally. Project website: https://sqa3d.github.io
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
Comments CoRL 2022
专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
Comments 20 pages
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
Comments NeurIPS 2020
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Journal ref LREC 2020
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments To appear at BMVC 2019. 15 pages, 5 figures
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 20 pages, 13 figures, Webpage: https://embodiedqa.org/
GeoResponder:迈向构建用于时间敏感灾害响应的地理空间大语言模型
机构 * Qatar Computing Research Institute(卡塔尔计算研究所)
专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.CL、cs.AI
AI总结 GeoResponder通过分层指令微调课程,赋予大语言模型空间推理能力,通过在不同认知层中分层地理空间学习,使模型能够有效处理灾害响应中的道路网络、坐标和基础设施访问问题,显著优于现有基础模型和领域特定基线。
Comments 16 pages, 5 figures, Major revision with new geospatial reasoning framework (GeoResponder), previously titled "RoadMind"
机构 * Meta AI ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG
Comments Preliminary version accepted as a spotlight in NeurIPS 2025 Workshop on Efficient Reasoning
机构 * Player2
专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG
Comments International Conference on Computer Vision Workshop on Multi-Modal Reasoning for Agentic Intelligence
专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG
Comments 8 pages; accepted to the Perception as Generative Reasoning workshop of the 33rd Conference on Neural InformationProcessing Systems (NeurIPS 2019)
超越单一物体:用大语言模型学习三维关系
机构 * AIST(日本国立 Advanced Industrial Science and Technology(AIST)) ; University of Tsukuba(筑波大学) ; University of Technology Nuremberg(纽伦堡工业大学) ; University of Oxford(牛津大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对现有3D-LLMs难以开展多物体间详细比较的问题,提出含MO3D数据集、Multi-3DLLM模型及Mini-apps基准的框架,该模型在MO3D任务上超越所有基线且对单物体分类有正向迁移
Comments Accepted to CVPR 2026
GCPO:针对大语言模型的rollout强化学习中子空间几何的诊断与约束
机构 * Shanghai AI Lab(上海人工智能实验室)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 GCPO通过几何约束策略优化方法,诊断rollout强化学习的子空间几何问题,在大语言模型后训练中提升了多任务性能并解决了训练不稳定等问题
Comments 15 pages, 10 figures
大型语言模型行为演化的映射与测量
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本研究构建三种互补差异度,分析32个大型语言模型的行为,发现模型家族形成聚类、跨家族距离随时间减小等规律,且该方法具有标签无关性与鲁棒性。
可操作的幻觉检测:将潜在不确定性转化为智能体批判
机构 * Samsung Research America(美国三星研究院)
专题命中 视觉空间推理 :self-correction(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。
Comments 22 pages, 6 figures
语言的成本:质心擦除揭示并利用多模态语言模型中的模态竞争
机构 * Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; USI Lugano(卢加诺大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究发现多模态语言模型在视觉任务中表现不佳,通过质心替换方法揭示语言表征优于视觉,通过文本质心对比解码提升准确率,不同训练方法影响结果。
Comments 37 pages, 8 figures, 28 tables
大型语言模型在创造性思维过程中与人类大脑对齐
机构 * EPFL(瑞士联邦理工学院洛桑) ; Università della Svizzera italiana (USI)(意大利语区大学(瑞士)) ; Wesleyan University(卫斯理大学) ; Paris Brain Institute (ICM)(巴黎大脑研究所) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了在创造性思维过程中,fMRI数据揭示了大脑与不同规模LLM之间的对齐关系,发现模型大小和想法原创性影响对齐程度,且训练目标影响表示与人类创造力神经几何的匹配程度。
Comments Accepted at COLM 2026
SleepVLM:基于视觉语言模型的可解释且规则驱动的睡眠分期
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出SleepVLM,一种基于规则驱动的视觉语言模型,通过多通道PSG波形图像进行睡眠分期,并生成符合AASM评分标准的临床可读解释,在保持高准确率的同时提升可解释性。
链式视觉思维:通过连续视觉标记教学VLMs更好地看到和思考
机构 * UC Berkeley(加州大学伯克利分校) ; UCLA(洛杉矶大学) ; Panasonic AI Research(松下人工智能研究)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 COVT通过连续视觉标记提升VLMs的视觉推理能力,使模型在多个基准测试中性能提升3%-16%。
Comments Project page: https://wakalsprojectpage.github.io/covt-website/
AgenticSCR: 一种用于检测初期漏洞的自主代理安全代码审查
机构 * The University of Melbourne(墨尔本大学) ; Monash University(莫纳什大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 AgenticSCR通过结合LLMs、自主决策和语义记忆,有效检测预提交阶段的初期漏洞,优于传统SAST工具和静态LLM基线。
Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE'26 Industry-Track)
SpatioLM:面向视觉-语言模型的通用物理空间智能
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 SpatioLM是一种参数高效的视觉-语言模型,通过内置空间视觉模块和伪深度、相机监督提升空间智能,在VSI-Bench获71.6分,还可迁移至具身操纵任务,同时保留通用能力。
Comments 27 pages,13 figures,16 tables
Slot2Text:面向高效且空间可追溯的手术多模态大语言模型的以对象为中心的视觉分词
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 Slot2Text将视觉输入转为槽潜变量,推出双模式手术MLLM,在多基准上实现高效推理,Slot2Text-Fast大幅降本,Slot2Text-Reason支持可追溯空间推理。
Comments 17 pages, 8 Figures