arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3361 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3361 篇

2402.15933 2024-02-27 cs.CV cs.AI cs.CL cs.LG 67%

Bridging the Gap between 2D and 3D Visual Question Answering: A Fusion Approach for 3D VQA

Wentao Mo, Yang Liu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To be published in AAAI 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02695 2024-02-07 cs.RO cs.CV 67%

VoroNav: Voronoi-based Zero-shot Object Navigation with Large Language Model

Pengying Wu, Yao Mu, Bingxian Wu, Yi Hou, Ji Ma, Shanghang Zhang, Chang Liu

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04047 2023-12-29 cs.CV cs.AI cs.CL cs.LG 67%

CAVEN: An Embodied Conversational Agent for Efficient Audio-Visual Navigation in Noisy Environments

Xiulong Liu, Sudipta Paul, Moitreya Chatterjee, Anoop Cherian

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.05608 2023-10-09 cs.CV cs.AI cs.CL cs.LG 67%

Differentiable Outlier Detection Enable Robust Deep Multimodal Analysis

Zhu Wang, Sourav Medya, Sathya N. Ravi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12981 2023-07-25 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

3D-LLM: Injecting the 3D World into Large Language Models

Yining Hong, Haoyu Zhen, Peihao Chen, Shuhong Zheng, Yilun Du, Zhenfang Chen, Chuang Gan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project Page: : https://vis-www.cs.umass.edu/3dllm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07474 2023-04-14 cs.CV cs.AI cs.CL cs.LG 67%

SQA3D: Situated Question Answering in 3D Scenes

Xiaojian Ma, Silong Yong, Zilong Zheng, Qing Li, Yitao Liang, Song-Chun Zhu, Siyuan Huang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2023. First two authors contributed equally. Project website: https://sqa3d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03767 2023-04-10 cs.CV 67%

Embodied Concept Learner: Self-supervised Learning of Concepts and Mapping through Instruction Following

Mingyu Ding, Yan Xu, Zhenfang Chen, David Daniel Cox, Ping Luo, Joshua B. Tenenbaum, Chuang Gan

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments CoRL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.11201 2022-07-25 cs.CV cs.AI cs.CL cs.LG 67%

Target-Driven Structured Transformer Planner for Vision-Language Navigation

Yusheng Zhao, Jinyu Chen, Chen Gao, Wenguan Wang, Lirong Yang, Haibing Ren, Huaxia Xia, Si Liu

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.11742 2022-02-25 cs.CV 67%

Think Global, Act Local: Dual-scale Graph Transformer for Vision-and-Language Navigation

Shizhe Chen, Pierre-Louis Guhur, Makarand Tapaswi, Cordelia Schmid, Ivan Laptev

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.04097 2021-10-12 cs.RO cs.CV 67%

Deep Learning for Embodied Vision Navigation: A Survey

Fengda Zhu, Yi Zhu, Vincent CS Lee, Xiaodan Liang, Xiaojun Chang

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.07793 2020-12-24 cs.CV 67%

Generative 3D Part Assembly via Dynamic Graph Learning

Jialei Huang, Guanqi Zhan, Qingnan Fan, Kaichun Mo, Lin Shao, Baoquan Chen, Leonidas Guibas, Hao Dong

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments NeurIPS 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.09551 2020-07-21 cs.CL cs.AI cs.CV cs.LG 67%

Understanding Spatial Relations through Multiple Modalities

Soham Dan, Hangfeng He, Dan Roth

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref LREC 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.04950 2019-08-15 cs.CV cs.AI cs.CL cs.LG 67%

VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering

Cătălina Cangea, Eugene Belilovsky, Pietro Liò, Aaron Courville

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To appear at BMVC 2019. 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.08755 2019-02-20 cs.CV 67%

No Blind Spots: Full-Surround Multi-Object Tracking for Autonomous Vehicles using Cameras & LiDARs

Akshay Rangesh, Mohan M. Trivedi

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.11543 2017-12-04 cs.CV cs.AI cs.CL cs.LG 67%

Embodied Question Answering

Abhishek Das, Samyak Datta, Georgia Gkioxari, Stefan Lee, Devi Parikh, Dhruv Batra

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 20 pages, 13 figures, Webpage: https://embodiedqa.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19354 2026-03-27 cs.CL cs.AI 66%

GeoResponder: Towards Building Geospatial LLMs for Time-Critical Disaster Response

GeoResponder:迈向构建用于时间敏感灾害响应的地理空间大语言模型

Ahmed El Fekih Zguir, Ferda Ofli, Muhammad Imran

机构 * Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.CL、cs.AI

AI总结 GeoResponder通过分层指令微调课程,赋予大语言模型空间推理能力,通过在不同认知层中分层地理空间学习,使模型能够有效处理灾害响应中的道路网络、坐标和基础设施访问问题,显著优于现有基础模型和领域特定基线。

Comments 16 pages, 5 figures, Major revision with new geospatial reasoning framework (GeoResponder), previously titled "RoadMind"

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08567 2025-11-12 cs.LG cs.AI 66%

The Path Not Taken: RLVR Provably Learns Off the Principals

Hanqing Zhu, Zhenyu Zhang, Hanxian Huang, DiJia Su, Zechun Liu, Jiawei Zhao, Igor Fedorov, Hamed Pirsiavash, Zhizhou Sha, Jinwon Lee, David Z. Pan, Zhangyang Wang, Yuandong Tian, Kai Sheng Tai

机构 * Meta AI The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

Comments Preliminary version accepted as a spotlight in NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16774 2025-10-21 cs.LG cs.AI 66%

Learning to play: A Multimodal Agent for 3D Game-Play

Yuguang Yue, Irakli Salia, Samuel Hunt, Christopher Green, Wenzhe Shi, Jonathan J Hunt

机构 * Player2

专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

Comments International Conference on Computer Vision Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.14361 2019-11-01 cs.LG cs.AI stat.ML 66%

Object-oriented state editing for HRL

Victor Bapst, Alvaro Sanchez-Gonzalez, Omar Shams, Kimberly Stachenfeld, Peter W. Battaglia, Satinder Singh, Jessica B. Hamrick

专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG

Comments 8 pages; accepted to the Perception as Generative Reasoning workshop of the 33rd Conference on Neural InformationProcessing Systems (NeurIPS 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15710 2026-08-18 cs.CV cs.AI cs.CL 新提交 62%

Beyond Single Object: Learning 3D Relations with Large Language Models

超越单一物体:用大语言模型学习三维关系

Kohsuke Ide, Ryousuke Yamada, Yue Qiu, Xianzheng Ma, Yoshihiro Fukuhara, Hirokatsu Kataoka, Yutaka Satoh

机构 * AIST(日本国立 Advanced Industrial Science and Technology(AIST)) University of Tsukuba(筑波大学) University of Technology Nuremberg(纽伦堡工业大学) University of Oxford(牛津大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有3D-LLMs难以开展多物体间详细比较的问题,提出含MO3D数据集、Multi-3DLLM模型及Mini-apps基准的框架,该模型在MO3D任务上超越所有基线且对单物体分类有正向迁移

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11674 2026-08-13 cs.LG cs.AI 新提交 62%

GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs

GCPO:针对大语言模型的rollout强化学习中子空间几何的诊断与约束

Kai Yang, Jingwei Xu, Wanyu Wang, Kai-Yuan Guo, Zhenbo Yu, Yi Wang, Yu Qiao

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GCPO通过几何约束策略优化方法,诊断rollout强化学习的子空间几何问题,在大语言模型后训练中提升了多任务性能并解决了训练不稳定等问题

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11027 2026-08-12 cs.LG cs.CL 新提交 62%

Mapping and Measuring the Behavioral Evolution of Large Language Models

大型语言模型行为演化的映射与测量

Dong Qiao, Chris Ding, Jicong Fan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究构建三种互补差异度,分析32个大型语言模型的行为,发现模型家族形成聚类、跨家族距离随时间减小等规律,且该方法具有标签无关性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 62%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 视觉空间推理 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14363 2026-08-11 cs.CL cs.AI cs.CV 版本更新 62%

The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models

语言的成本:质心擦除揭示并利用多模态语言模型中的模态竞争

Akshay Paruchuri, Ishan Chatterjee, Henry Fuchs, Ehsan Adeli, Piotr Didyk

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) USI Lugano(卢加诺大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现多模态语言模型在视觉任务中表现不佳,通过质心替换方法揭示语言表征优于视觉,通过文本质心对比解码提升准确率,不同训练方法影响结果。

Comments 37 pages, 8 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03480 2026-08-11 q-bio.NC cs.AI cs.CL 版本更新 62%

Large Language Models Align with the Human Brain during Creative Thinking

大型语言模型在创造性思维过程中与人类大脑对齐

Mete Ismayilzada, Simone A. Luchini, Abdulkadir Gokce, Badr AlKhamissi, Antoine Bosselut, Antonio Laverghetta, Lonneke van der Plas, Roger E. Beaty

机构 * EPFL(瑞士联邦理工学院洛桑) Università della Svizzera italiana (USI)(意大利语区大学(瑞士)) Wesleyan University(卫斯理大学) Paris Brain Institute (ICM)(巴黎大脑研究所) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了在创造性思维过程中,fMRI数据揭示了大脑与不同规模LLM之间的对齐关系,发现模型大小和想法原创性影响对齐程度,且训练目标影响表示与人类创造力神经几何的匹配程度。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26738 2026-08-06 cs.CV cs.AI cs.CL 版本更新 62%

SleepVLM: A Rule-Grounded Vision-Language Model for Auditable Sleep Staging

SleepVLM:基于视觉语言模型的可解释且规则驱动的睡眠分期

Guifeng Deng, Pan Wang, Mengfan Niu, Jiquan Wang, Shuying Rao, Junyi Xie, Xi'ang Chen, Sha Zhao, Gang Pan, Wanjun Guo, Tao Li, Haiteng Jiang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SleepVLM,一种基于规则驱动的视觉语言模型,通过多通道PSG波形图像进行睡眠分期,并生成符合AASM评分标准的临床可读解释,在保持高准确率的同时提升可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19418 2026-08-06 cs.CV cs.AI cs.LG 版本更新 62%

Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens

链式视觉思维:通过连续视觉标记教学VLMs更好地看到和思考

Yiming Qin, Bomin Wei, Jiaxin Ge, Konstantinos Kallidromitis, Stephanie Fu, Trevor Darrell, XuDong Wang

机构 * UC Berkeley(加州大学伯克利分校) UCLA(洛杉矶大学) Panasonic AI Research(松下人工智能研究)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 COVT通过连续视觉标记提升VLMs的视觉推理能力,使模型在多个基准测试中性能提升3%-16%。

Comments Project page: https://wakalsprojectpage.github.io/covt-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19138 2026-08-05 cs.CR cs.AI cs.LG cs.SE 版本更新 62%

AgenticSCR: An Autonomous Agentic Secure Code Review for Immature Vulnerabilities Detection

AgenticSCR: 一种用于检测初期漏洞的自主代理安全代码审查

Wachiraphan Charoenwet, Kla Tantithamthavorn, Patanamon Thongtanunam, Hong Yi Lin, Minwoo Jeong, Ming Wu

机构 * The University of Melbourne(墨尔本大学) Monash University(莫纳什大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AgenticSCR通过结合LLMs、自主决策和语义记忆,有效检测预提交阶段的初期漏洞,优于传统SAST工具和静态LLM基线。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE'26 Industry-Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01899 2026-08-04 cs.CV cs.CL cs.LG 新提交 62%

SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

SpatioLM:面向视觉-语言模型的通用物理空间智能

Jing Wu, Jianhua Wu, Jiayi Guan, Jiahong Chen, Jinghui Lu, Hangjun Ye, Bingzhao Gao, Long Chen

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 SpatioLM是一种参数高效的视觉-语言模型,通过内置空间视觉模块和伪深度、相机监督提升空间智能,在VSI-Bench获71.6分,还可迁移至具身操纵任务,同时保留通用能力。

Comments 27 pages,13 figures,16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01473 2026-08-04 cs.CV cs.CL cs.LG 新提交 62%

Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

Slot2Text:面向高效且空间可追溯的手术多模态大语言模型的以对象为中心的视觉分词

Guiqiu Liao, Matjaz Jogan, Daniel A. Hashimoto

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Slot2Text将视觉输入转为槽潜变量,推出双模式手术MLLM,在多基准上实现高效推理,Slot2Text-Fast大幅降本,Slot2Text-Reason支持可追溯空间推理。

Comments 17 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏