arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2511.15271 2025-11-20 cs.CV cs.LG 57%

Graph Query Networks for Object Detection with Automotive Radar

Loveneet Saini, Hasan Tercan, Tobias Meisen

机构 * University of Wuppertal(乌珀塔尔大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments Accepted in WACV 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15194 2025-11-20 cs.RO cs.AI 57%

Eq.Bot: Enhance Robotic Manipulation Learning via Group Equivariant Canonicalization

Jian Deng, Yuandong Wang, Yangfu Zhu, Tao Feng, Tianyu Wo, Zhenzhou Shao

机构 * Beijing Key Laboratory of Light Industrial Robot and Safety Verification, Capital Normal University(北京工业机器人与安全验证重点实验室,首都师范大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Software, Beihang University(北航软件学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 12 pages, 4 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14160 2025-11-19 cs.CV cs.AI cs.RO 57%

RynnEC: Bringing MLLMs into Embodied World

Ronghao Dang, Yuqian Yuan, Yunxuan Mao, Kehan Li, Jiangpin Liu, Zhikai Wang, Xin Li, Fan Wang, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(虎盘实验室) Zhejiang University(浙江大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments The technical report of RynnEC, an embodied cognition MLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13970 2025-11-19 cs.AI cs.CV 57%

Scene Graph-Guided Generative AI Framework for Synthesizing and Evaluating Industrial Hazard Scenarios

Sanjay Acharjee, Abir Khan Ratul, Diego Patino, Md Nazmus Sakib

机构 * Ph.D. Student, Dept. of Civil Eng., University of Texas at Arlington. E-mail Assistant Professor, Dept. of Computer Sci. \& Eng., University of Texas at Arlington. E-mail Assistant Professor, Dept. of Civil Eng., University of Texas at Arlington. E-mail

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15222 2025-11-18 cs.AI cs.CV cs.MA 57%

See it. Say it. Sorted: Agentic System for Compositional Diagram Generation

Hantao Zhang, Jingyang Liu, Ed Li

机构 * Yale University(耶鲁大学) University of Edinburgh(爱丁堡大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09883 2025-11-18 cs.CV cs.AI 57%

3D-Aware Vision-Language Models Fine-Tuning with Geometric Distillation

Seonho Lee, Jiho Choi, Inha Kang, Jiwook Kim, Junsung Park, Hyunjung Shim

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00844 2025-11-18 cs.CV cs.LG 57%

PRISM-0: A Predicate-Rich Scene Graph Generation Framework for Zero-Shot Open-Vocabulary Tasks

Abdelrahman Elskhawy, Mengze Li, Nassir Navab, Benjamin Busam

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12002 2025-11-18 cs.LG cs.CV 57%

Selecting Fine-Tuning Examples by Quizzing VLMs

Tenghao Ji, Eytan Adar

机构 * University of Michigan(密歇根大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10810 2025-11-17 cs.AI 57%

HARNESS: Human-Agent Risk Navigation and Event Safety System for Proactive Hazard Forecasting in High-Risk DOE Environments

Ran Elgedawy, Sanjay Das, Ethan Seefried, Gavin Wiggins, Ryan Burchfield, Dana Hewit, Sudarshan Srinivasan, Todd Thomas, Prasanna Balaprakash, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(奥克勒斯国家实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15434 2025-11-14 cs.CV cs.LG 57%

Semantic4Safety: Causal Insights from Zero-shot Street View Imagery Segmentation for Urban Road Safety

Huan Chen, Ting Han, Siyu Chen, Zhihao Guo, Yiping Chen, Meiliu Wu

机构 * School of Geospatial Engineering and Science, Sun Yat-sen University(地理空间工程与科学学院,中山大学) School of Geographical and Earth Sciences, University of Glasgow(地理与地球科学学院,格拉斯哥大学) School of Economics and Management, Shanxi University(经济学与管理学院,山西大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

Comments 11 pages, 10 figures, The 8th ACM SIGSPATIAL International Workshop on AI for Geographic Knowledge Discovery (GeoAI '25), November 3--6, 2025, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08892 2025-11-13 cs.AI 57%

Lumine: An Open Recipe for Building Generalist Agents in 3D Open Worlds

Weihao Tan, Xiangyang Li, Yunhao Fang, Heyuan Yao, Shi Yan, Hao Luo, Tenglong Ao, Huihui Li, Hongbin Ren, Bairen Yi, Yujia Qin, Bo An, Libin Liu, Guang Shi

机构 * ByteDance Seed(字节跳动种子) NTU(国立科技大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06087 2025-11-11 cs.CV cs.AI 57%

Hybrid CNN-ViT Framework for Motion-Blurred Scene Text Restoration

Umar Rashid, Muhammad Arslan Arshad, Ghulam Ahmad, Muhammad Zeeshan Anjum, Rizwan Khan, Muhammad Akmal

机构 * Department of Electrical Engineering, University of Engineering & Technology, New Campus, Lahore, Pakistan(电子工程系,工程科技大学,新校区,拉合尔,巴基斯坦) Department of Electrical, Electronic, and Future Technologies, Sheffield Hallam University, Sheffield S1 1WB, UK(电子、电气与未来技术系,谢菲尔德哈姆大学,谢菲尔德 S1 1WB,英国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17047 2025-11-11 cs.CV cs.AI 57%

Controllable Hybrid Captioner for Improved Long-form Video Understanding

Kuleen Sasse, Efsun Sarioglu Kayi, Arun Reddy

机构 * Johns Hopkins University Applied Physics Laboratory(约翰霍普金斯大学应用物理实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24838 2025-11-11 cs.CV cs.AI 57%

VideoCAD: A Dataset and Model for Learning Long-Horizon 3D CAD UI Interactions from Video

Brandon Man, Ghadi Nehme, Md Ferdous Alam, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03227 2025-11-07 cs.HC cs.AI cs.MM 57%

Node-Based Editing for Multimodal Generation of Text, Audio, Image, and Video

Alexander Htet Kyaw, Lenin Ravindranath Sivalingam

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Accepted to NeurIPS 2025, Conference on Neural Information Processing Systems, Workshop on Generative and Protective AI for Content Creation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00362 2025-11-04 cs.CV cs.AI cs.GR 57%

Oitijjo-3D: Generative AI Framework for Rapid 3D Heritage Reconstruction from Street View Imagery

Momen Khandoker Ope, Akif Islam, Mohd Ruhul Ameen, Abu Saleh Musa Miah, Md Rashedul Islam, Jungpil Shin

机构 * University of Rajshahi(拉贾沙希大学) Marshall University(马歇尔大学) University of Aizu(御所大学) University of Asia Pacific(亚洲太平洋大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 6 Pages, 4 figures, 2 Tables, Submitted to ICECTE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00120 2025-11-04 cs.CV cs.AI 57%

VLM6D: VLM based 6Dof Pose Estimation based on RGB-D Images

Md Selim Sarowar, Sungho Kim

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments This paper has been accepted to IEIE( The Institute Of Electronics and Information Engineering, South Korea) Fall,2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20278 2025-11-03 q-bio.QM cs.LG 57%

The cell as a token: high-dimensional geometry in language models and cell embeddings

William Gilpin

机构 * Department of Physics, The University of Texas at Austin, Austin, Texas 78712, USA(德克萨斯大学奥斯汀分校物理系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments 4 pages, 2 figures

Journal ref Bioinformatics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11664 2025-11-03 cs.AI 57%

VRoPE: Rotary Position Embedding for Video Large Language Models

Zikang Liu, Longteng Guo, Yepeng Tang, Tongtian Yue, Junxian Cai, Kai Ma, Qingbin Liu, Xi Chen, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Basic Algorithm Center, Tencent(腾讯基础算法中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments EMNLP 2025 Main Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25668 2025-10-30 cs.AI cs.MM 57%

ALDEN: Reinforcement Learning for Active Navigation and Evidence Gathering in Long Documents

Tianyu Yang, Terry Ruas, Yijun Tian, Jan Philip Wahle, Daniel Kurzawe, Bela Gipp

机构 * University of Göttingen(戈丁根大学) University of Notre Dame(诺特大学) State and University Library of Göttingen(戈丁根州立大学图书馆)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17977 2025-10-30 cs.RO cs.AI 57%

Autonomous 3D Exploration in Large-Scale Environments with Dynamic Obstacles

Emil Wiman, Ludvig Widén, Mattias Tiger, Fredrik Heintz

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments 6 pages, 6 figures

Journal ref 2024 IEEE International Conference on Robotics and Automation (ICRA), Yokohama, Japan, 2024, pp. 2389-2395,

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14926 2025-10-30 cs.AI 57%

TraveLLM: Could you plan my new public transit route in face of a network disruption?

Bowen Fang, Zixiao Yang, Xuan Di

机构 * Department of Industrial Engineering and Operations Research, Columbia University(工业工程与运营管理系,哥伦比亚大学) Department of Civil Engineering and Engineering Mechanics, Columbia University(土木工程与工程力学系,哥伦比亚大学) Data Science Institute, Columbia University(数据科学研究院,哥伦比亚大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Accepted to ITSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23691 2025-10-29 cs.AI 57%

Game-TARS: Pretrained Foundation Models for Scalable Generalist Multimodal Game Agents

Zihao Wang, Xujing Li, Yining Ye, Junjie Fang, Haoming Wang, Longxiang Liu, Shihao Liang, Junting Lu, Zhiyong Wu, Jiazhan Feng, Wanjun Zhong, Zili Li, Yu Wang, Yu Miao, Bo Zhou, Yuanfan Li, Hao Wang, Zhongkai Zhao, Faming Wu, Zhengxuan Jiang, Weihao Tan, Heyuan Yao, Shi Yan, Xiangyang Li, Yitao Liang, Yujia Qin, Guang Shi

机构 * Bytedance Seed(字节跳动种子)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22917 2025-10-29 cs.RO cs.AI 57%

HyPerNav: Hybrid Perception for Object-Oriented Navigation in Unknown Environment

Zecheng Yin, Hao Zhao, Zhen Li

机构 * Future Network of Intelligence Institute(Shenzhen)(智能未来网络研究所(深圳)) Tsinghua University(清华大学) The Chinese University of Hongkong(Shenzhen)(香港大学(深圳))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21839 2025-10-28 cs.CV cs.AI 57%

Evaluating ChatGPT's Performance in Classifying Pneumonia from Chest X-Ray Images

Pragna Prahallad, Pranathi Prahallad

机构 * Emerald High School(埃默尔德高中)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20838 2025-10-27 cs.AI cs.MA 57%

Sketch2BIM: A Multi-Agent Human-AI Collaborative Pipeline to Convert Hand-Drawn Floor Plans to 3D BIM

Abir Khan Ratul, Sanjay Acharjee, Somin Park, Md Nazmus Sakib

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25033 2025-10-24 cs.CV cs.LG 57%

VT-FSL: Bridging Vision and Text with LLMs for Few-Shot Learning

Wenhao Li, Qiangchang Wang, Xianjing Meng, Zhibin Wu, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Shenzhen Loop Area Institute(深圳河套学院) School of Computing and Artificial Intelligence, Shandong University of Finance and Economics(山东财经大学计算机与人工智能学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19031 2025-10-23 cs.HC cs.AI cs.CY 57%

CLiVR: Conversational Learning System in Virtual Reality with AI-Powered Patients

Akilan Amithasagaran, Sagnik Dakshit, Bhavani Suryadevara, Lindsey Stockton

机构 * The University of Texas at Tyler(德克萨斯理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17830 2025-10-23 physics.app-ph cs.AI 57%

Multi-Agent Design Assistant for the Simulation of Inertial Fusion Energy

Meir H. Shachar, Dane M. Sterbentz, Harshitha Menon, Charles F. Jekel, M. Giselle Fernández-Godino, Nathan K. Brown, Ismael D. Boureima, Yue Hao, Kevin Korner, Robert Rieben, Daniel A. White, William J. Schill, Jonathan L. Belof

机构 * Sandia National Laboratories(桑迪亚国家实验室) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Corrected the author's list metadata to match that found in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00939 2025-10-23 cs.CV cs.CL 57%

WikiVideo: Article Generation from Multiple Videos

Alexander Martin, Reno Kriz, William Gantt Walden, Kate Sanders, Hannah Recknor, Eugene Yang, Francis Ferraro, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人机语言技术卓越中心) University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments Repo can be found here: https://github.com/alexmartin1722/wikivideo

详情

展开后加载摘要…

URL PDF HTML 收藏