Question Aware Vision Transformer for Multimodal Reasoning
专题命中 视觉空间推理 :reasoning(title,abstract)
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(title,abstract)
专题命中 视觉空间推理 :reasoning(title,abstract)
Comments Typo fixed
专题命中 视觉空间推理 :reasoning(title,abstract)
专题命中 视觉空间推理 :reasoning(title,abstract)
Comments 12 pages, 6 figures. arXiv admin note: substantial text overlap with arXiv:2207.12647
专题命中 视觉空间推理 :reasoning(title,abstract)
专题命中 视觉空间推理 :reasoning(title,abstract)
Comments ECCV 2022. Code: http://github.com/ChengShiest/REP-ERU
专题命中 视觉空间推理 :reasoning(title,abstract)
专题命中 视觉空间推理 :reasoning(title,abstract)
Comments AAAI 2023 RL Ready for Production Workshop
专题命中 视觉空间推理 :reasoning(title,abstract)
Comments Accepted by CVPR 2023. The code is available at https://github.com/XiangyangLi20/KERM
专题命中 视觉空间推理 :reasoning(title,abstract)
Comments Project page: http://cic.tju.edu.cn/faculty/likun/projects/Narrator
专题命中 视觉空间推理 :reasoning(title,abstract)
专题命中 视觉空间推理 :reasoning(title,abstract)
专题命中 视觉空间推理 :reasoning(title,abstract)
Comments 11 pages, 9 figures; Accepted at Findings of EMNLP 2022. arXiv admin note: substantial text overlap with arXiv:2212.03433
专题命中 视觉空间推理 :reasoning(title,abstract)
Comments Accepted in NeurIPS 2022; Project website: https://cshizhe.github.io/projects/vil3dref.html
专题命中 视觉空间推理 :reasoning(title,abstract)
专题命中 视觉空间推理 :reasoning(title,abstract)
专题命中 视觉空间推理 :reasoning(title,abstract)
专题命中 视觉空间推理 :planning(title,abstract)
专题命中 视觉空间推理 :reasoning(title,abstract)
Comments arXiv admin note: text overlap with arXiv:2007.01072
专题命中 视觉空间推理 :reasoning(title,abstract)
Comments Accepted by IJCAI 2020. SOLE copyright holder is IJCAI (international Joint Conferences on Artificial Intelligence)
专题命中 视觉空间推理 :reasoning(title,abstract)
专题命中 视觉空间推理 :reasoning(title,abstract)
Comments Accepted to ICCV 2019 (Oral)
专题命中 视觉空间推理 :planning(title,abstract)
Comments 3 pages, 6 figures, IROS'13 Workshop on Robots and Sensors integration in future rescue INformation system (ROSIN'13)
空间记忆智能体:用于空间智能的基于经验的过程记忆
机构 * Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.AI
AI总结 该研究提出SMA框架,让冻结VLM智能体无需外部空间工具,通过无参数更新自进化提升空间推理,在多基准和模型上表现最优,提供了空间自进化的实用路径。
Comments Under Review
空间智商:通过分层能力测试解构空间智能
机构 * NVIDIA Research(英伟达研究院) ; Yale University(耶鲁大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。
REST:基于零样本目标导航的视界探索Steiner树
机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(智能城市物联网国家重点实验室,澳门大学) ; University of Michigan(密歇根大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI
AI总结 REST通过构建开放词汇3D地图、生成以代理为中心的路径树以及利用LLM推理选择最佳路径,在多个基准测试中实现了高成功率和高效路径效率。
Comments Accepted to IROS'26
WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型
机构 * Tongji University(同济大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。
Comments 20 pages, 7 figures
SMDD-Bench: 大语言模型能否解决真实世界的小分子药物设计任务?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stealth Pennsylvania State University(隐形宾夕法尼亚州立大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 提出SMDD-Bench基准,通过502个多轮长时任务实例评估LLM在真实小分子药物设计中的表现,发现最优模型GPT5.4仅解决40.2%任务。
BINDER: 基于开放词汇命令的即时自适应移动操作
机构 * Seoul National University(首尔国立大学) ; ECE, ASRI and IPAI in SNU(SNU的电子工程系、先进机器人研究所和智能感知与人工智能实验室)
专题命中 视觉空间推理 :reasoning(abstract,abstract_cn);planning(abstract);分类 cs.AI
AI总结 BINDER通过分离战略规划与连续环境监控,结合多模态大语言模型和视频大语言模型,实现动态环境下的高效移动操作,提升鲁棒性和适应性。
Comments 12 pages, 8 figures
无边界的长语音合成
机构 * MiLM Plus, Xiaomi Inc., China(小米公司MiLM Plus,中国) ; Nanjing University, China(南京大学,中国) ; WeNet Open Source Community(WeNet开源社区)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 本文提出无边界的长语音合成框架,通过统一能力集实现多说话人合成和长文本生成,采用全局-句子-token注释策略和连续分词器提升指令遵循能力,构建分层控制协议栈实现多模态输入到结构化生成命令的转换。