arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2509.19212 2025-09-24 cs.CL cs.AI 62%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments A lightweight and model-agnostic decoding framework that dynamically adjusts token generation based on multimodal context

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18282 2025-09-24 cs.RO cs.AI cs.LG 62%

PEEK: Guiding and Minimal Image Representations for Zero-Shot Generalization of Robot Manipulation Policies

Jesse Zhang, Marius Memmel, Kevin Kim, Dieter Fox, Jesse Thomason, Fabio Ramos, Erdem Bıyık, Abhishek Gupta, Anqi Li

机构 * University of Washington(华盛顿大学) NVIDIA(NVIDIA公司) University of Southern California(南加州大学) Allen Institute for AI(人工智能研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21531 2025-09-23 cs.CV cs.AI cs.CL cs.RO 62%

How Much Do Large Language Models Know about Human Motion? A Case Study in 3D Avatar Control

Kunhang Li, Jason Naradowsky, Yansong Feng, Yusuke Miyao

机构 * The University of Tokyo(东京大学) Peking University(北京大学) NII LLMC(日本信息机构大语言模型中心)

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11417 2025-09-18 cs.RO cs.AI cs.CV cs.LG 62%

Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations

Shresth Grover, Akshay Gopalkrishnan, Bo Ai, Henrik I. Christensen, Hao Su, Xuanlin Li

机构 * UC San Diego(圣迭戈大学) Hillbot

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Project Page: https://gen-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09594 2025-09-12 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 62%

ObjectReact: Learning Object-Relative Control for Visual Navigation

Sourav Garg, Dustin Craggs, Vineeth Bhat, Lachlan Mares, Stefan Podgorski, Madhava Krishna, Feras Dayoub, Ian Reid

机构 * University of Adelaide, Australia(澳大利亚阿德莱德大学) IIIT Hyderabad, India(印度海得拉巴IIIT) MBZUAI, UAE(阿联酋MBZUAI)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments CoRL 2025; 23 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04441 2025-08-29 stat.ML cs.AI cs.LG math.CT 62%

The Joys of Categorical Conformal Prediction

Michele Caprio

机构 * The University of Manchester(曼彻斯特大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14704 2025-08-21 cs.AI cs.CL 62%

MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers

Ziyang Luo, Zhiqi Shen, Wenzhuo Yang, Zirui Zhao, Prathyusha Jwalapuram, Amrita Saha, Doyen Sahoo, Silvio Savarese, Caiming Xiong, Junnan Li

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Website: https://mcp-universe.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13564 2025-08-20 cs.CV cs.AI cs.LG cs.RO 62%

The 9th AI City Challenge

Zheng Tang, Shuo Wang, David C. Anastasiu, Ming-Ching Chang, Anuj Sharma, Quan Kong, Norimasa Kobori, Munkhjargal Gochoo, Ganzorig Batnasan, Munkh-Erdene Otgonbold, Fady Alnajjar, Jun-Wei Hsieh, Tomasz Kornuta, Xiaolong Li, Yilin Zhao, Han Zhang, Subhashree Radhakrishnan, Arihant Jain, Ratnesh Kumar, Vidya N. Murali, Yuxing Wang, Sameer Satish Pusegaonkar, Yizhou Wang, Sujit Biswas, Xunlei Wu, Zhedong Zheng, Pranamesh Chakraborty, Rama Chellappa

机构 * NVIDIA Corporation(NVIDIA公司) Santa Clara University(圣克拉拉大学) University at Albany, SUNY(纽约州立大学阿尔巴尼分校) Iowa State University(爱荷华州立大学) Woven by Toyota, Japan(日本丰田公司) United Arab Emirates University(阿拉伯联合酋长国大学) National Yang-Ming Chiao-Tung University(国家阳明交通大学) University of Macau(澳门大学) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Summary of the 9th AI City Challenge Workshop in conjunction with ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08120 2025-08-12 cs.LG cs.AI cs.CV 62%

Vision-Based Localization and LLM-based Navigation for Indoor Environments

Keyan Rahimi, Md. Wasiul Haque, Sagar Dasgupta, Mizanur Rahman

机构 * Brown University(布朗大学) The University of Alabama(阿拉巴马大学) Department of Civil Construction & Environmental Engineering(土木建设与环境工程系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10905 2025-08-07 cs.AI cs.CV cs.LG 62%

Learning to Inference Adaptively for Multimodal Large Language Models

Zhuoyan Xu, Khoi Duc Nguyen, Preeti Mukherjee, Saurabh Bagchi, Somali Chaterji, Yingyu Liang, Yin Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Published at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10341 2025-07-29 cs.RO cs.AI cs.LG 62%

Affordance-Guided Reinforcement Learning via Visual Prompting

Olivia Y. Lee, Annie Xie, Kuan Fang, Karl Pertsch, Chelsea Finn

机构 * Stanford University(斯坦福大学) Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 6 figures. IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17787 2025-07-25 cs.LG cs.AI 62%

Hyperbolic Deep Learning for Foundation Models: A Survey

Neil He, Hiren Madhu, Ngoc Bui, Menglin Yang, Rex Ying

机构 * Yale University(耶鲁大学) Hong Kong University of Science(香港科学大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 11 Pages, SIGKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05195 2025-07-23 cs.LG cs.CL cs.CV 62%

Exploring How Generative MLLMs Perceive More Than CLIP with the Same Vision Encoder

Siting Li, Pang Wei Koh, Simon Shaolei Du

机构 * University of Washington(华盛顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments ACL 2025; 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03572 2025-07-21 cs.HC cs.AI cs.CL 62%

From Code to Compliance: Assessing ChatGPT's Utility in Designing an Accessible Webpage -- A Case Study

Ammar Ahmed, Margarida Fresco, Fredrik Forsberg, Hallvard Grotli

机构 * Department of Computer Science, Norwegian University of Science and Technology(计算机科学系,挪威科学技术大学) Department of Design, Norwegian University of Science and Technology(设计系,挪威科学技术大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10000 2025-07-15 cs.AI cs.CL 62%

On The Role of Intentionality in Knowledge Representation: Analyzing Scene Context for Cognitive Agents with a Tiny Language Model

Mark Burgess

机构 * Mark Burgess(独立研究者)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19546 2025-07-15 cs.AI cs.LG 62%

Bongard in Wonderland: Visual Puzzles that Still Make AI Go Mad?

Antonia Wüst, Tim Woydt, Lukas Helff, Inga Ibs, Wolfgang Stammer, Devendra S. Dhami, Constantin A. Rothkopf, Kristian Kersting

机构 * AIML Lab, TU Darmstadt(AIML实验室,德累斯顿技术大学) Hessian Center for AI (hessian.ai)(黑森人工智能中心) Institute of Psychology, TU Darmstadt(心理学研究所,德累斯顿技术大学) Centre for Cognitive Science, TU Darmstadt(认知科学中心,德累斯顿技术大学) German Center for AI (DFKI)(德国人工智能中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02505 2025-07-10 cs.AI cs.CV cs.LG cs.RO 62%

ROCKET-2: Steering Visuomotor Policy via Cross-View Goal Alignment

Shaofei Cai, Zhancun Mu, Anji Liu, Yitao Liang

机构 * Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) Team CraftJarvis(CraftJarvis团队)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05254 2025-07-08 cs.CV cs.AI cs.LG cs.MA cs.RO 62%

From Marginal to Joint Predictions: Evaluating Scene-Consistent Trajectory Prediction Approaches for Automated Driving

Fabian Konstantinidis, Ariel Dallari Guerreiro, Raphael Trumpp, Moritz Sackmann, Ulrich Hofmann, Marco Caccamo, Christoph Stiller

机构 * Pre-Development of Automated Driving, CARIAD SE(自动化驾驶前期开发,CARIAD SE) Technical University of Munich (TUM)(慕尼黑技术大学) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments Accepted at International Conference on Intelligent Transportation Systems 2025 (ITSC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23270 2025-07-01 cs.CV cs.AI cs.LG 62%

Token Activation Map to Visually Explain Multimodal LLMs

Yi Li, Hualiang Wang, Xinpeng Ding, Haonan Wang, Xiaomeng Li

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments ICCV2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21976 2025-06-30 cs.LG cs.AI cs.CV cs.MA cs.RO 62%

SceneDiffuser++: City-Scale Traffic Simulation via a Generative World Model

Shuhan Tan, John Lambert, Hong Jeon, Sakshum Kulshrestha, Yijing Bai, Jing Luo, Dragomir Anguelov, Mingxing Tan, Chiyu Max Jiang

机构 * Waymo LLC(Waymo公司) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20917 2025-06-27 cs.CL cs.AI 62%

Optimising Language Models for Downstream Tasks: A Post-Training Perspective

Zhengyan Shi

机构 * Faculty of Engineering(工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21909 2025-06-27 cs.CL cs.LG cs.SE 62%

SceneGenAgent: Precise Industrial Scene Generation with Coding Agent

Xiao Xia, Dan Zhang, Zibo Liao, Zhenyu Hou, Tianrui Sun, Jing Li, Ling Fu, Yuxiao Dong

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.LG

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05414 2025-06-09 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 62%

SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing

Mingfei Chen, Zijun Cui, Xiulong Liu, Jinlin Xiang, Caleb Zheng, Jingyuan Li, Eli Shlizerman

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Project website with demo videos: https://zijuncui02.github.io/SAVVY/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00958 2025-05-14 cs.CV cs.CL cs.LG 62%

2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining

Wenqi Zhang, Hang Zhang, Xin Li, Jiashuo Sun, Yongliang Shen, Weiming Lu, Deli Zhao, Yueting Zhuang, Lidong Bing

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06507 2025-05-13 cs.AI cs.CV cs.LG 62%

Text-to-CadQuery: A New Paradigm for CAD Generation with Scalable Large Model Capabilities

Haoyang Xie, Feng Ju

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04972 2025-05-09 cs.RO cs.AI cs.CV cs.LG cs.NI 62%

AI and Vision based Autonomous Navigation of Nano-Drones in Partially-Known Environments

Mattia Sartori, Chetna Singhal, Neelabhro Roy, Davide Brunelli, James Gross

机构 * KTH Royal Institute of Technology(皇家理工学院) Inria France(法国国家信息与自动化研究所) University of Trento(特伦托大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments in DCOSS-IoT 2025, Wi-DroIT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10146 2025-05-09 cs.LG cs.AI 62%

GeoUni: A Unified Model for Generating Geometry Diagrams, Problems and Problem Solutions

Jo-Ku Cheng, Zeren Zhang, Ran Chen, Jingyang Deng, Ziran Qin, Jinwen Ma

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Electronic, Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15388 2025-04-23 cs.AI cs.LG cs.MA 62%

Investigating Relational State Abstraction in Collaborative MARL

Sharlin Utke, Jeremie Houssineau, Giovanni Montana

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 39 No. 20 (2025), 20947-20955

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03312 2025-04-22 cs.CV cs.AI cs.LG 62%

Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters

Kevin Y. Li, Sachin Goyal, Joao D. Semedo, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10786 2025-04-17 cs.CV cs.AI cs.LG 62%

Visual Language Models show widespread visual deficits on neuropsychological tests

Gene Tangtartharakul, Katherine R. Storrs

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 31 pages, 3 figures, 1 supplementary document with 1 figure and 51 sample images; corrected typo in Fig 1

详情

展开后加载摘要…

URL PDF HTML 收藏