arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2104.08492 2021-04-20 cs.AI cs.LG 62%

A Self-Supervised Auxiliary Loss for Deep RL in Partially Observable Settings

Eltayeb Ahmed, Luisa Zintgraf, Christian A. Schroeder de Witt, Nicolas Usunier

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.07764 2021-02-18 cs.RO cs.AI cs.CV cs.LG cs.NE 62%

End-to-End Egospheric Spatial Memory

Daniel Lenton, Stephen James, Ronald Clark, Andrew J. Davison

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Conference paper at ICLR 2021. Implementation: https://github.com/ivy-dl/memory Project page: https://djl11.github.io/ESM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.00229 2021-02-05 cs.CL cs.AI cs.CV 62%

Multimodal Text Style Transfer for Outdoor Vision-and-Language Navigation

Wanrong Zhu, Xin Eric Wang, Tsu-Jui Fu, An Yan, Pradyumna Narayana, Kazoo Sone, Sugato Basu, William Yang Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments EACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.14359 2020-12-29 cs.AI cs.CV cs.LG cs.RO 62%

Commonsense Visual Sensemaking for Autonomous Driving: On Generalised Neurosymbolic Online Abduction Integrating Vision and Semantics

Jakob Suchan, Mehul Bhatt, Srikrishna Varadarajan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments This is a preprint / review version of an accepted contribution to be published as part of the Artificial Intelligence Journal (AIJ).? The article is an extended version of an IJCAI 2019 publication [74, arXiv:1906.00107]

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.03912 2020-12-08 cs.CV cs.AI cs.LG cs.RO 62%

MultiON: Benchmarking Semantic Map Memory using Multi-Object Navigation

Saim Wani, Shivansh Patel, Unnat Jain, Angel X. Chang, Manolis Savva

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments Project page: https://shivanshpatel35.github.io/multi-ON/ ; the first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.01928 2020-11-04 cs.LG cs.AI cs.RO stat.ML 62%

Generalization to New Actions in Reinforcement Learning

Ayush Jain, Andrew Szot, Joseph J. Lim

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments ICML 2020. Videos and code: https://sites.google.com/view/action-generalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.01298 2020-10-06 cs.LG cs.AI cs.RO stat.ML 62%

Beyond Tabula-Rasa: a Modular Reinforcement Learning Approach for Physically Embedded 3D Sokoban

Peter Karkus, Mehdi Mirza, Arthur Guez, Andrew Jaegle, Timothy Lillicrap, Lars Buesing, Nicolas Heess, Theophane Weber

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.00562 2020-10-02 cs.CL cs.AI cs.CV 62%

ISAAQ -- Mastering Textbook Questions with Pre-trained Transformers and Bottom-Up and Top-Down Attention

Jose Manuel Gomez-Perez, Raul Ortega

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication as a long paper in EMNLP2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.13165 2020-08-05 cs.RO cs.AI cs.LG 62%

Relational Graph Learning for Crowd Navigation

Changan Chen, Sha Hu, Payam Nikdel, Greg Mori, Manolis Savva

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments Accepted to IROS 2020. Added links to codes and video demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.00849 2020-06-23 cs.CV cs.CL cs.LG cs.MM 62%

Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers

Zhicheng Huang, Zhaoyang Zeng, Bei Liu, Dongmei Fu, Jianlong Fu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.04109 2020-02-12 cs.RO cs.AI cs.LG 62%

On Reward Shaping for Mobile Robot Navigation: A Reinforcement Learning and SLAM Based Approach

Nicolò Botteghi, Beril Sirmacek, Khaled A. A. Mustafa, Mannes Poel, Stefano Stramigioli

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.12612 2019-10-16 cs.RO cs.AI cs.CV cs.LG 62%

Learning Navigation Subroutines from Egocentric Videos

Ashish Kumar, Saurabh Gupta, Jitendra Malik

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.08792 2019-09-20 cs.RO cs.AI cs.LG 62%

Agent Prioritization for Autonomous Navigation

Khaled S. Refaat, Kai Ding, Natalia Ponomareva, Stéphane Ross

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments 8 pages, accepted to IEEE/RSJ International Conference on Robots and Systems (IROS) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10092 2019-04-09 cs.CV cs.AI cs.CL cs.RO 62%

Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation

Xin Wang, Qiuyuan Huang, Asli Celikyilmaz, Jianfeng Gao, Dinghan Shen, Yuan-Fang Wang, William Yang Wang, Lei Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments CVPR 2019 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.04325 2018-06-12 cs.LG cs.AI stat.ML 62%

Efficient Model-Based Deep Reinforcement Learning with Variational State Tabulation

Dane Corneil, Wulfram Gerstner, Johanni Brea

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments Accepted at ICML 2018; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.01203 2018-06-05 cs.LG cs.AI stat.ML 62%

Relational inductive bias for physical construction in humans and machines

Jessica B. Hamrick, Kelsey R. Allen, Victor Bapst, Tina Zhu, Kevin R. McKee, Joshua B. Tenenbaum, Peter W. Battaglia

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments In Proceedings of the Annual Meeting of the Cognitive Science Society (CogSci 2018)

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.00653 2018-03-05 cs.LG cs.AI cs.CV cs.RO 62%

Semi-parametric Topological Memory for Navigation

Nikolay Savinov, Alexey Dosovitskiy, Vladlen Koltun

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments Published at International Conference on Learning Representations (ICLR) 2018. Project website at https://sites.google.com/view/SPTM

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01904 2025-02-06 cs.CV cs.AI 61%

Virgo: A Preliminary Exploration on Reproducing o1-like MLLM

Yifan Du, Zikang Liu, Yifan Li, Wayne Xin Zhao, Yuqi Huo, Bingning Wang, Weipeng Chen, Zheng Liu, Zhongyuan Wang, Ji-Rong Wen

专题命中 视觉空间推理 :reasoning(abstract,comments);分类 cs.AI

Comments Technical Report on Slow Thinking with LLMs: Visual Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06834 2026-08-21 cs.LG 版本更新 57%

Graph Machine: Exploring Edge Mechanisms as an Inductive Bias

图机:将边机制作为归纳偏置的探索

Lintai Hou

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出Graph Machine架构,含边增强注意力与以边为中心的引用两种边机制,在数独任务上优于Transformer基线,证明显式边机制是有前景的架构设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18647 2026-08-20 cs.RO cs.LG 新提交 57%

Progressive Experience Fusion for Multi-Task World Model Control in Endovascular Navigation

用于血管内导航多任务世界模型控制的渐进式经验融合

Harry Robertshaw, Maxence Boels, Nikola Fischer, Sebastien Ourselin, Christos Bergeles, Alejandro Granados, Thomas C Booth

机构 * School of Biomedical Engineering & Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院) Surgical & Interventional Engineering(外科与介入工程)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 本研究提出渐进式经验融合(PEF)训练多任务TD-MPC2控制器,在血管内导航任务中提升了成功率,可实现跨血管结构迁移与患者特异性微调,为临床应用提供概念验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18628 2026-08-20 cs.CV cs.CL 新提交 57%

When Safety Overrides Vision: Exploring Dynamics between Vision Influence and Safety Alignment in Vision-Language Models

当安全覆盖视觉时:探索视觉语言模型中视觉影响与安全对齐之间的动态关系

Mehak Gupta, Tanmoy Chakraborty

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究探究对齐视觉语言模型中安全诱导弃权的内部解码动态,发现安全对齐未抑制感知接地,抑制拒绝相关表征可恢复接地回答,揭示了其一种新的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15265 2026-08-20 cs.AI 版本更新 57%

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯) AI Thrust TEG AIPD

专题命中 视觉空间推理 :verifier(abstract);分类 cs.AI

AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17950 2026-08-19 cs.CL 新提交 57%

Do Large Language Models Play Six Degrees of Separation? Measuring Topological Compression in Long-Context Manifolds

大型语言模型是否遵循六度分隔理论?测量长上下文流形中的拓扑压缩

Md. Faiyaz Abdullah Sayeedi

机构 * BRAC University(BRAC大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过分析LLM隐藏状态流形的几何结构,发现深度推理层的语义锚点遵循六度分隔理论,该拓扑特性可用于RAG的零样本幻觉检测,为评估事实可靠性提供了几何指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17044 2026-08-19 cs.CV cs.AI 新提交 57%

The 10th AI City Challenge

第10届AI City挑战赛

Zheng Tang, Shuo Wang, David C. Anastasiu, Ming-Ching Chang, Anuj Sharma, Quan Kong, Munkhjargal Gochoo, Jun-Wei Hsieh, Tomasz Kornuta, Zhedong Zheng, Renran Tian, Judah Goldfeder, Fulgencio Navarro, Yuxing Wang, Yizhou Wang, Sameer Satish Pusegaonkar, Anqi Li, Nalin Dadhich, Ridham Kachhadiya, Dhanishtha Patil, Haoquan Liang, Jiajun Li, Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Shuyu Yang, Ashutosh Kumar, Rong Wang, Rafael Martin Nieto, Peter Christiansen, Ahmed Abduljawad, Mohanrasu Shanmugam, Nadeem Shaik, Sujit Biswas, Xunlei Wu, Vidya Murali, Rama Chellappa

机构 * Santa Clara University(圣克拉拉大学) University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Iowa State University(爱荷华州立大学) Woven by Toyota(丰田编织公司) United Arab Emirates University(阿拉伯联合酋长国大学) National Yang Ming Chiao Tung University(国立阳明交通大学) University of Macau(澳门大学) North Carolina State University(北卡罗来纳州立大学) Columbia University(哥伦比亚大学) Milestone Systems(里程碑系统公司) Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。

Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16978 2026-08-19 cs.RO cs.LG 新提交 57%

VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation

VLCP:用于机器人操纵的视觉语言控制策略闭环代码重规划

Dhia Naouali, Minghan Wu, Claudia Wong, Abhinav Puthran, Omar G. Younis

机构 * University of Monastir(莫纳斯提尔大学) St. Mildred’s-Lightbourn School(圣米尔德雷德-莱特本学校) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学) Silverstream AI(银流人工智能公司) Mila -- Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 VLCP是一种无需训练的机器人操纵策略,通过在单回合内每K步由VLM重写控制代码闭合循环,在57项任务的评估中综合成功率达35.1%,较开环策略提升十倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16181 2026-08-18 cs.HC cs.AI 新提交 57%

MUSE: An Interactive Meta-Agent for Understanding and Steering LLM-powered Data Science Systems

MUSE:一种用于理解和操控大语言模型驱动的数据科学系统的交互式元智能体

Wei-Hao Chen, Weixi Tong, Yuan Tian, Chenglong Wang, Tianyi Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出交互式元智能体MUSE,通过重构执行轨迹、支持上下文交互与混合意图操控,提升用户对大语言模型驱动的数据科学系统的理解与控制,经15人被试间研究验证可提高任务效率与用户信心。

Comments To appear in the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), November 2-5, 2026, Detroit, MI, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15085 2026-08-18 cs.CL 新提交 57%

Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs

为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性

Yihang Du, Juhao Liang, Zhengzhao Lai, Siyu Li, Yan Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15056 2026-08-18 cs.AI 新提交 57%

GraphLoom: Reliability-Calibrated Graph Evidence Routing for Multimodal KG-RAG

GraphLoom:面向多模态KG-RAG的可靠性校准图证据路由

Zafar Ali, Asad Khan, Aalia Malik, Pavlos Kefalas

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Aristotle University(亚里士多德大学) Dashub(达舒布)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出GraphLoom框架,通过可靠性校准的图证据路由实现多模态KG-RAG,在ScienceQA等数据集上提升了答案质量与证据忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14615 2026-08-18 cs.AI 新提交 57%

Large Language Models and their Awareness of Mechanics and Spatial Geometry

大语言模型及其对力学与空间几何的认知能力

Johannes Gerstmayr, Sebastian Weyrer, Tobias Möltner, Peter Manzl, Michael Pieber

机构 * University of Innsbruck(因斯布鲁克大学) University of Augsburg(奥格斯堡大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究构建了全自动基准MecEng,评估32个开放权重及2个专有LLMs的机械工程认知,发现其刚体任务成功率达86.0%,但柔性多体任务仍具挑战,且该能力正快速提升但仍易出错。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13921 2026-08-17 cs.AI 新提交 57%

When Personal Memory Has No Single Answer: Evaluating LLM Agents under Irreducible Conflict

当个人记忆没有唯一答案时:评估大语言模型智能体在不可约冲突下的表现

Lu Yang, Shusheng Xu, Zhuoran Li, Tongkai Yang, Longbo Huang

机构 * Ant Group(蚂蚁集团)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对大语言模型智能体的记忆冲突问题,提出了基准TANGLE并评估其表现,发现现有方法存在缺陷,进而提出冲突感知行动策略CAAP。

详情

展开后加载摘要…

URL PDF HTML 收藏