arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2406.04952 2024-08-30 cs.CL cs.AI 62%

Quantifying Geospatial in the Common Crawl Corpus

Ilya Ilyankou, Meihui Wang, Stefano Cavazzi, James Haworth

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted as a poster to ACM SIGSPATIAL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11788 2024-08-22 cs.AI cs.CL cs.CV cs.SE 62%

DreamFactory: Pioneering Multi-Scene Long Video Generation with a Multi-Agent Framework

Zhifei Xie, Daniel Tang, Dingwei Tan, Jacques Klein, Tegawend F. Bissyand, Saad Ezzini

专题命中 视觉空间推理 :CoT(abstract);分类 cs.CL、cs.AI

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04482 2024-08-09 cs.CV cs.AI cs.LG cs.RO 62%

SegXAL: Explainable Active Learning for Semantic Segmentation in Driving Scene Scenarios

Sriram Mandalika, Athira Nambiar

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 7 figures. To appear in the proceedings of the 27th International Conference on Pattern Recognition (ICPR), 01-05 December, 2024, Kolkata, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16364 2024-08-06 cs.CL cs.LG cs.MM 62%

Where Do We Go from Here? Multi-scale Allocentric Relational Inference from Natural Spatial Descriptions

Tzuf Paz-Argaman, Sayali Kulkarni, John Palowitch, Jason Baldridge, Reut Tsarfaty

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

Journal ref EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15941 2024-07-09 cs.RO cs.AI cs.CV cs.LG 62%

Explore until Confident: Efficient Exploration for Embodied Question Answering

Allen Z. Ren, Jaden Clark, Anushri Dixit, Masha Itkina, Anirudha Majumdar, Dorsa Sadigh

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Robotics: Science and Systems (RSS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19967 2024-07-01 cs.CL cs.AI 62%

Into the Unknown: Generating Geospatial Descriptions for New Environments

Tzuf Paz-Argaman, John Palowitch, Sayali Kulkarni, Reut Tsarfaty, Jason Baldridge

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Journal ref ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11069 2024-06-18 cs.CV cs.AI cs.CL 62%

WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences

Yujie Lu, Dongfu Jiang, Wenhu Chen, William Yang Wang, Yejin Choi, Bill Yuchen Lin

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments link: https://hf.co/spaces/WildVision/vision-arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09455 2024-06-17 cs.CV cs.AI cs.CL 62%

Pandora: Towards General World Model with Natural Language Actions and Video States

Jiannan Xiang, Guangyi Liu, Yi Gu, Qiyue Gao, Yuting Ning, Yuheng Zha, Zeyu Feng, Tianhua Tao, Shibo Hao, Yemin Shi, Zhengzhong Liu, Eric P. Xing, Zhiting Hu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Website: https://world-model.maitrix.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17272 2024-06-07 cs.LG cs.AI 62%

DPN: Decoupling Partition and Navigation for Neural Solvers of Min-max Vehicle Routing Problems

Zhi Zheng, Shunyu Yao, Zhenkun Wang, Xialiang Tong, Mingxuan Yuan, Ke Tang

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01031 2024-05-28 cs.CL cs.AI 62%

Peacock: A Family of Arabic Multimodal Large Language Models and Benchmarks

Fakhraddin Alwajih, El Moatez Billah Nagoudi, Gagan Bhatia, Abdelrahman Mohamed, Muhammad Abdul-Mageed

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00876 2024-05-03 cs.CV cs.AI cs.LG 62%

Beyond Human Vision: The Role of Large Vision Language Models in Microscope Image Analysis

Prateek Verma, Minh-Hao Van, Xintao Wu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03480 2024-04-16 cs.RO cs.AI cs.CL 62%

Can an Embodied Agent Find Your "Cat-shaped Mug"? LLM-Guided Exploration for Zero-Shot Object Navigation

Vishnu Sashank Dorbala, James F. Mullen, Dinesh Manocha

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 10 pages

Journal ref IEEE Robotics and Automation Letters 9.5 (2024) 4083-4090

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14178 2024-04-01 cs.CL cs.CV cs.LG 62%

mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality

Qinghao Ye, Haiyang Xu, Guohai Xu, Jiabo Ye, Ming Yan, Yiyang Zhou, Junyang Wang, Anwen Hu, Pengcheng Shi, Yaya Shi, Chenliang Li, Yuanhong Xu, Hehong Chen, Junfeng Tian, Qi Qian, Ji Zhang, Fei Huang, Jingren Zhou

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Working in Process

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12921 2024-03-15 cs.LG cs.AI 62%

Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning

Juan Rocamonde, Victoriano Montesinos, Elvis Nava, Ethan Perez, David Lindner

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Presented at International Conference on Learning Representations (ICLR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03170 2024-03-12 cs.MM cs.AI cs.CL cs.CV cs.CY 62%

SNIFFER: Multimodal Large Language Model for Explainable Out-of-Context Misinformation Detection

Peng Qi, Zehong Yan, Wynne Hsu, Mong Li Lee

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments To appear in CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11971 2024-03-04 cs.CV cs.CL cs.LG cs.MM 62%

EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE

Junyi Chen, Longteng Guo, Jia Sun, Shuai Shao, Zehuan Yuan, Liang Lin, Dongyu Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05188 2024-02-09 cs.RO cs.AI cs.CL 62%

InCoRo: In-Context Learning for Robotics Control with Feedback Loops

Jiaqiang Ye Zhu, Carla Gomez Cano, David Vazquez Bermudez, Michal Drozdzal

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17600 2024-02-01 cs.CL cs.AI cs.CV 62%

Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data

Chenhui Zhang, Sherrie Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 62 pages; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06082 2024-01-25 cs.AI cs.CL cs.CV 62%

VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View

Raphael Schumann, Wanrong Zhu, Weixi Feng, Tsu-Jui Fu, Stefan Riezler, William Yang Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06437 2024-01-17 cs.GR cs.AI cs.CL 62%

3D-PreMise: Can Large Language Models Generate 3D Shapes with Sharp Features and Parametric Control?

Zeqing Yuan, Haoxuan Lan, Qiang Zou, Junbo Zhao

专题命中 视觉空间推理 :self-correction(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05332 2023-11-29 cs.CV cs.AI cs.CL cs.RO 62%

On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving

Licheng Wen, Xuemeng Yang, Daocheng Fu, Xiaofeng Wang, Pinlong Cai, Xin Li, Tao Ma, Yingxuan Li, Linran Xu, Dengke Shang, Zheng Zhu, Shaoyan Sun, Yeqi Bai, Xinyu Cai, Min Dou, Shuanglu Hu, Botian Shi, Yu Qiao

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16091 2023-11-28 cs.RO cs.AI cs.CV cs.LG cs.MA 62%

Interactive Autonomous Navigation with Internal State Inference and Interactivity Estimation

Jiachen Li, David Isele, Kanghoon Lee, Jinkyoo Park, Kikuo Fujimura, Mykel J. Kochenderfer

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16038 2023-11-28 cs.CV cs.AI cs.LG 62%

OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving

Wenzhao Zheng, Weiliang Chen, Yuanhui Huang, Borui Zhang, Yueqi Duan, Jiwen Lu

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

Comments Code is available at: https://github.com/wzzheng/OccWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12820 2023-11-23 cs.CV cs.AI cs.CL eess.IV 62%

MSG-BART: Multi-granularity Scene Graph-Enhanced Encoder-Decoder Language Model for Video-grounded Dialogue Generation

Hongcheng Liu, Zhe Chen, Hui Li, Pingjie Wang, Yanfeng Wang, Yu Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 5 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10983 2023-11-21 cs.CV cs.AI cs.LG 62%

Multiple View Geometry Transformers for 3D Human Pose Estimation

Ziwei Liao, Jialiang Zhu, Chunyu Wang, Han Hu, Steven L. Waslander

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12513 2023-11-07 cs.CV cs.CL cs.LG 62%

Is BERT Blind? Exploring the Effect of Vision-and-Language Pretraining on Visual Language Understanding

Morris Alper, Michael Fiman, Hadar Averbuch-Elor

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted to CVPR 2023. Project webpage: https://isbertblind.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17817 2023-10-23 cs.RO cs.AI cs.LG 62%

Act3D: 3D Feature Field Transformers for Multi-Task Robotic Manipulation

Theophile Gervet, Zhou Xian, Nikolaos Gkanatsios, Katerina Fragkiadaki

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10474 2023-10-16 cs.RO cs.AI cs.CV cs.LG 62%

A Universal Semantic-Geometric Representation for Robotic Manipulation

Tong Zhang, Yingdong Hu, Hanchen Cui, Hang Zhao, Yang Gao

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments CoRL 2023. Project website: https://semantic-geometric-representation.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02172 2023-10-04 cs.HC cs.AI cs.LG 62%

Lyfe Agents: Generative agents for low-cost real-time social interactions

Zhao Kaiya, Michelangelo Naim, Jovana Kondic, Manuel Cortes, Jiaxin Ge, Shuying Luo, Guangyu Robert Yang, Andrew Ahn

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11382 2023-09-21 cs.RO cs.AI cs.CL cs.CV 62%

Discuss Before Moving: Visual Language Navigation via Multi-expert Discussions

Yuxing Long, Xiaoqi Li, Wenzhe Cai, Hao Dong

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI

Comments Submitted to ICRA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏