arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-16 至 2026-03-16 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 12 篇

2603.05869 2026-03-16 cs.CV 85%

PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues

PatchCue: 通过基于补丁的视觉提示增强视觉语言模型推理

Yukun Qi, Pei Fu, Hang Li, Yuhan Liu, Chao Jiang, Bin Qin, Zhenbo Luo, Jian Luan

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出PatchCue,一种基于补丁的视觉提示方法,通过两阶段训练提升VLMs的视觉推理能力,在多项任务中表现优于像素级和点级提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22645 2026-03-16 cs.CV 85%

GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes

GeoZero:从零开始激励地理空间场景的推理

Di Wang, Shunyu Liu, Wentao Jiang, Fengxiang Wang, Yi Liu, Xiaolei Qin, Zhiming Luo, Chaoyang Zhou, Haonan Guo, Jing Zhang, Bo Du, Dacheng Tao, Liangpei Zhang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 GeoZero通过构建两个数据集和A$^2$GRPO方法,使大语言模型在无预定义推理链监督下实现地理空间推理,提升了遥感任务的推理多样性和准确性。

Comments Code, data, and models are available at https://github.com/MiliLab/GeoZero

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12669 2026-03-16 cs.CV cs.LG 79%

Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning

视觉验证增强的VLMs融合以实现高效的视觉推理

Selim Furkan Tekin, Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Margaret L. Loper, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出V3Fusion方法,通过融合多种视觉语言模型,利用焦点误差多样性与CKA-focal度量来提升视觉推理性能,实验显示在多个基准上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18632 2026-03-16 cs.CV cs.AI 79%

Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views

用3D思考:从有限视角出发的几何想象引导的空间推理

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xufang Luo, Mingze Sun, Zihao Pan, Xiang An, Yan Feng, Peng Pei, Xunliang Cai, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Meituan(美团) National University of Singapore(新加坡国立大学) Beihang University(北航) LMMs-Lab(LMMs实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出3DThinker框架,通过利用图像中的丰富几何信息实现空间推理,无需3D先验输入或显式标注3D数据,在多个基准测试中优于现有方法。

Comments 25 pages, 17 figures

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12597 2026-03-16 cs.LG cs.AI cs.HC cs.MA cs.SE 73%

Feynman: Knowledge-Infused Diagramming Agent for Scalable Visual Designs

Feynman: 一种融合知识的图表生成代理,用于可扩展的视觉设计

Zixin Wen, Yifu Cai, Kyle Lee, Sam Estep, Josh Sunshine, Aarti Singh, Yuejie Chi, Wode Ni

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Feynman代理,通过知识组件枚举和代码规划生成高质量图表-描述对,构建了可扩展的图表生成流水线,并创建了视觉语言基准Diagramma。

Comments A previous version was submitted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12538 2026-03-16 cs.CV cs.AI 57%

Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentation

具有混合专家的时空语义专家路由架构用于指代图像分割

Alaa Dalaq, Muzammil Behzad

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SERA架构,通过在视觉语言框架中引入轻量级表达感知专家细化,提升指代图像分割的时空一致性与边界精度,实验表明其在准确定位和精细边界界定上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23228 2026-03-16 cs.CV cs.AI 57%

MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction

MovieTeller: 借助工具的电影概要与ID一致的渐进抽象

Yizhi Li, Xiaohan Chen, Miao Jiang, Wentao Tang, Gaoang Wang

机构 * Central Universities(中央高校) National Natural Science Foundation of China(中国国家自然科学基金委员会) Research Fund for International Scientists of National Natural Science Foundation of China(中国国家自然科学基金委员会国际科学家研究基金)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 MovieTeller通过工具增强的渐进抽象生成电影概要,解决传统VLM在长视频摘要中的身份一致性和叙事连贯性问题,提升事实准确性与一致性。

Comments 6 pages, CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13185 2026-03-16 cs.CV 50%

Towards Spatio-Temporal World Scene Graph Generation from Monocular Videos

从单目视频生成时空世界场景图

Rohith Peddi, Saurabh, Shravan Shanmugam, Likhitha Pallapothula, Yu Xiang, Parag Singla, Vibhav Gogate

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出World Scene Graph Generation任务,通过ActionGenome4D数据集,引入三种方法解决未观测物体推理问题,推动视频场景理解向世界中心、时间持久和可解释的方向发展。

Comments https://github.com/rohithpeddi/WorldSGG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12936 2026-03-16 cs.RO cs.CV 50%

MotionAnymesh: Physics-Grounded Articulation for Simulation-Ready Digital Twins

MotionAnymesh:基于物理的运动模拟数字双胞胎生成

WenBo Xu, Liu Liu, Li Zhang, Dan Guo, RuoNan Liu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出MotionAnymesh框架,通过结合物理先验知识和几何物理联合估计,解决静态3D网格转化为可交互数字双胞胎的难题,提升模拟精度和物理可行性。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08881 2026-03-16 cs.CV 50%

SATGround: A Spatially-Aware Approach for Visual Grounding in Remote Sensing

SATGround:一种面向遥感视觉语义的时空感知方法

Aysim Toker, Andreea-Maria Oncescu, Roy Miles, Ismail Elezi, Jiankang Deng

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SATGround方法,通过结构化定位机制提升卫星图像视觉语义理解,结合语言和空间信息增强定位精度,在多个遥感基准测试中取得显著提升,包括比先前方法提升33.2%的视觉语义定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21105 2026-03-16 cs.CV 50%

RLM: A Vision-Language Model Approach for Radar Scene Understanding

RLM:一种用于雷达场景理解的视觉-语言模型方法

Pushkal Mishra, Kshitiz Bansal, Dinesh Bharadia

机构 * University of California San Diego(加州大学圣地亚哥分校) Blue River Technology

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出RadarVLM,通过结构化空间语言监督学习统一的场景表示,改进了雷达场景理解中的空间推理能力,实验显示其在生成描述和车辆分割任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12708 2026-03-16 cs.CV 50%

FSDAM: Few-Shot Driving Attention Modeling via Vision-Language Coupling

FSDAM:通过视觉-语言耦合实现少样本驾驶注意力建模

Kaiser Hamid, Can Cui, Khandakar Ashrafi Akbar, Ziran Wang, Nade Liang

机构 * Texas Tech University(德克萨斯理工大学) Purdue University(普渡大学) Towson University(托逊大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出FSDAM框架,通过90个标注示例实现驾驶注意力预测与结构化解释生成,利用视觉-语言耦合减少标注需求,提升自动驾驶中的人机协作可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏