arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2412.14233 2026-01-28 cs.CV 50%

Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception

通过视觉属性增强描述性标题以实现多模态感知

Yanpeng Sun, Jing Hao, Ke Zhu, Jiang-Jiang Liu, Yuxiang Zhao, Xiaofan Li, Na Zhao, Zechao Li, Jingdong Wang

机构 * NJUST(南京理工大学) Baidu VIS(百度视觉部) HKU(香港大学) NJU(南京大学) SUTD(新加坡科技设计大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出EDC方法,通过整合视觉专家的低级和细粒度属性,提升图像标题的描述质量,以增强多模态感知能力。

Comments An open-source Agent for generating detailed image captions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17123 2026-01-27 cs.HC cs.CV cs.RO 50%

Acoustic Field Video for Multimodal Scene Understanding

用于多模态场景理解的声学场视频

Daehwa Kim, Chris Harrison

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出声学场视频作为多模态场景理解的新输入方式,通过整合空间声学数据显著提升视觉-语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09954 2026-01-26 cs.CV 50%

The Spatial Blindspot of Vision-Language Models

视觉-语言模型的空间盲区

Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A, Kranthi Kiran, Wesley Tam, Bala Krishna S Vegesna

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出通过改进图像编码器和2D位置编码来提升视觉-语言模型的空间推理能力,以解决其在空间关系捕捉上的不足。

Comments Work done as part of the EleutherAI SOAR Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15780 2026-01-23 cs.CV 50%

Assessing Situational and Spatial Awareness of VLMs with Synthetically Generated Video

通过合成视频评估VLMs的情境与空间意识

Pascal Benschop, Justin Dauwels, Jan van Gemert

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一个合成基准,评估VLMs在区分暴力与无害活动、跨视角角色绑定及细粒度轨迹对齐方面的性能,发现其表现仅略高于随机水平,且稳定颜色线索仅部分缓解了问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14622 2026-01-22 cs.RO 50%

Probing Prompt Design for Socially Compliant Robot Navigation with Vision Language Models

通过视觉语言模型探索社交合规机器人导航的提示设计

Ling Xiao, Toshihiko Yamasaki

机构 * Hokkaido University(北海道大学) The University of Tokyo(东京大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文通过设计社交合规的提示策略,提升小型视觉语言模型在机器人导航中的行动准确性,发现与自我竞争的提示设计效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14352 2026-01-22 cs.RO 50%

RoboBrain 2.5: Depth in Sight, Time in Mind

RoboBrain 2.5:视觉深度,思维时间

Huajie Tan, Enshen Zhou, Zhiyu Li, Yijie Xu, Yuheng Ji, Xiansheng Chen, Cheng Chi, Pengwei Wang, Huizhu Jia, Yulong Ao, Mingyu Cao, Sixiang Chen, Zhe Li, Mengzhen Liu, Zixiao Wang, Shanyu Rong, Yaoxu Lyu, Zhongxia Zhao, Peterson Co, Yibo Li, Yi Han, Shaoxuan Xie, Guocai Yao, Songjing Wang, Leiduo Zhang, Xi Yang, Yance Jiao, Donghai Shi, Kunchang Xie, Shaokai Nie, Chunlei Men, Yonghua Lin, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * BAAI RoboBrain Team(百度人工智能研究院RoboBrain团队)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 RoboBrain 2.5通过提升3D空间推理和时间值估计,增强具身智能在复杂精细操作中的物理基础和执行感知能力。

Comments 37 pages, 13 figures, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13886 2026-01-21 cs.CV 50%

Revisiting Multi-Task Visual Representation Learning

重新审视多任务视觉表示学习

Shangzhe Di, Zhonghua Zhai, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI) ByteDance Seed(字节跳动种子)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 MTV框架通过多任务学习结合视觉-语言对比、自监督和密集空间目标,提升空间推理能力的同时保持全局语义理解。

Comments Code: https://github.com/Becomebright/MTV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13273 2026-01-21 eess.SY cs.SY 50%

Safe Navigation in Cluttered Environments Via Spline-Based Harmonic Potential Fields

通过样条基础调和势场在杂乱环境中实现安全导航

Theodor-Gabriel Nicu, Florin Stoican, Daniel-Mihail Ioan, Ionela Prodan

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种基于样条调和势场的方法,用于在杂乱环境中安全导航,通过控制策略引导代理沿预设单元序列移动,确保目标跟踪和障碍回避。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05839 2026-01-21 cs.CV 50%

GeoSurDepth: Harnessing Foundation Model for Spatial Geometry Consistency-Oriented Self-Supervised Surround-View Depth Estimation

GeoSurDepth:利用基础模型实现以空间几何一致性为导向的自监督周围视图深度估计

Weimin Liu, Wenjun Wang, Joshua H. Meng

机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility, School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China(1 智能绿色车辆与移动国家重点实验室,车辆与移动学院,清华大学,北京100084,中国) California PATH, University of California, Berkeley, CA, United States(2 加州PATH,加州大学伯克利分校,加州,美国)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 GeoSurDepth通过利用基础模型和几何一致性,实现了更鲁棒的自监督周围视图深度估计,验证了其在自动驾驶中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12766 2026-01-21 cs.CV cs.SY eess.SY 50%

Spatial-VLN: Zero-Shot Vision-and-Language Navigation With Explicit Spatial Perception and Exploration

空间视觉导航:具有显式空间感知和探索的零样本视觉-语言导航

Lu Yue, Yue Fan, Shiwei Lian, Yu Zhao, Jiaxin Yu, Liang Xie, Feitian Zhang

机构 * Robotics and Control Laboratory, School of Advanced Manufacturing and Robotics, and the State Key Laboratory of Turbulence and Complex Systems, Peking University(机器人与控制实验室、先进制造与机器人学院,以及湍流与复杂系统国家重点实验室,北京大学) Defense Innovation Institute, Academy of Military Sciences, Beijing(国防科技创新研究院,军事科学院,北京) Tianjin Artificial Intelligence Innovation Center, Tianjin(天津人工智能创新中心,天津) Institute of Computing and Intelligence, Harbin Institute of Technology (Shenzhen)(计算与智能学院,哈尔滨工业大学(深圳))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Spatial-VLN通过增强空间感知和探索机制,提升零样本视觉-语言导航在复杂环境中的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13947 2026-01-21 eess.IV cs.CV 50%

Real-Time Reconstruction of 3D Bone Models via Very-Low-Dose Protocols

通过极低剂量协议实时重建3D骨模型

Yiqun Lin, Haoran Sun, Yongqing Li, Rabia Aslam, Lung Fung Tse, Tiange Cheng, Chun Sing Chui, Wing Fung Yau, Victorine R. Le Meur, Meruyert Amangeldy, Kiho Cho, Yinyu Ye, James Zou, Wei Zhao, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学电子与计算机工程系) Koln 3D Technology (Medical) Limited, Hong Kong SAR(香港特别行政区科隆3D技术(医疗)有限公司) Department of Physics, Beihang University, Beijing, China(北京航空航天大学物理系) Union Hospital, Hong Kong SAR(香港特别行政区联合医院) Dental Materials Science, Division of Applied Oral Sciences and Community Dental Care, Faculty of Dentistry, The University of Hong Kong, Hong Kong SAR(香港大学牙科学院牙体材料科学系) Department of Orthopaedics and Traumatology, The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学骨科及创伤外科学系) Department of Management Science and Engineering, Stanford University, Stanford, CA, USA(斯坦福大学管理科学与工程系) Department of Biomedical Data Science, Stanford University, Stanford, CA, USA(斯坦福大学生物医学数据科学系)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本研究提出SSR-KD框架,通过双平面X光在30秒内快速重建高精度3D骨模型,降低辐射暴露并提升术中应用的实用性。

Comments Accepted to npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16475 2026-01-21 cs.HC cs.RO 50%

LLM-Glasses: GenAI-driven Glasses with Haptic Feedback for Navigation of Visually Impaired People

LLM-Glasses: 基于生成式AI的具有触觉反馈的眼镜用于盲人导航

Issatay Tokmurziyev, Miguel Altamirano Cabrera, Muhammad Haris Khan, Yara Mahmoud, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology (Skoltech)(斯克尔科沃科学与技术研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 LLM-Glasses通过生成式AI和触觉反馈为视障人士提供导航支持,实验显示其在不同障碍物环境下具有较高的导航准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10725 2026-01-19 cs.RO math.OC 50%

Multi-Agent Formation Navigation Using Diffusion-Based Trajectory Generation

基于扩散的多智能体编队导航

Hieu Do Quang, Chien Truong-Quoc, Quoc Van Tran

机构 * Department of Mechatronics, School of Mechanical Engineering, Hanoi University of Science and Technology(机械工程系,河内科学与技术大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出基于扩散模型的多智能体编队导航方法,通过生成领头者中点轨迹实现平滑运动,有效应对复杂环境中的编队控制问题。

Comments 8 pages, 3 figures, full version of a paper submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11574 2026-01-19 cs.CV 50%

Evaluating Foundation Models' 3D Understanding Through Multi-View Correspondence Analysis

通过多视角对应分析评估基础模型的3D理解

Valentina Lilova, Toyesh Chakravorty, Julian I. Bibo, Emma Boccaletti, Brandon Li, Lívia Baxová, Cees G. M. Snoek, Mohammadreza Salehi

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种无需微调的3D场景理解基准,评估基础模型在多视角下的3D推理能力,展示DINO编码器在大视角变化下的竞争力。

Comments NeurIPS 2025 UniReps workshop, to be published in PMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10208 2026-01-16 cs.RO 50%

Terrain-Adaptive Mobile 3D Printing with Hierarchical Control

地形自适应移动三维打印与分层控制

Shuangshan Nors Li, J. Nathan Kutz

机构 * Department of Electrical and Computer Engineering, University of Washington, USA(电气与计算机工程系,华盛顿大学) Department of Applied Mathematics, University of Washington, USA(应用数学系,华盛顿大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本研究提出了一种结合人工智能与分层控制的地形自适应移动三维打印框架,通过多传感器融合和闭环控制实现高精度打印与移动性平衡。

Comments Submitted to the 43rd International Symposium on Automation and Robotics in Construction (ISARC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07143 2026-01-13 cs.HC 50%

EZBlender: Efficient 3D Editing with Plan-and-ReAct Agent

EZBlender:基于计划与反应代理的高效3D编辑

Hao Wang, Wenhui Zhu, Shao Tang, Zhipeng Wang, Xuanzhao Dong, Xin Li, Xiwen Chen, Ashish Bastola, Xinhao Huang, Yalin Wang, Abolfazl Razi

专题命中 视觉空间推理 :planning(abstract)

AI总结 EZBlender通过结合计划与反应机制,实现高效且语义忠实的3D编辑,提升Human AI协作效率与经济性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22976 2026-01-13 cs.CV 50%

From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D

从二维空间到三维空间:教视觉语言模型感知和推理三维世界

Jiahui Zhang, Yurui Chen, Yanpeng Zhou, Yueming Xu, Ze Huang, Jilin Mei, Junhui Chen, Yu-Jie Yuan, Xinyue Cai, Guowei Huang, Xingyue Quan, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出了一种基于2D空间数据生成和标注的管道,构建了SPAR-7M数据集和SPAR-Bench基准,通过训练和微调提升视觉语言模型在三维空间感知和推理中的性能。

Comments Project page: https://logosroboticsgroup.github.io/SPAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06652 2026-01-13 cs.RO 50%

Follow the Signs: Using Textual Cues and LLMs to Guide Efficient Robot Navigation

跟随标识:利用文本线索和大语言模型引导高效的机器人导航

Jing Cao, Nishanth Kumar, Aidan Curtis

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出利用大语言模型和符号模式提升机器人在稀疏环境中高效导航的能力,通过文本线索预测目标位置并优化路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04734 2026-01-09 cs.CV 50%

AIVD: Adaptive Edge-Cloud Collaboration for Accurate and Efficient Industrial Visual Detection

AIVD:自适应边缘-云协作用于准确高效的工业视觉检测

Yunqing Hu, Zheming Yang, Chang Zhao, Qi Guo, Meng Gao, Pengcheng Li, Wen Ji

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 AIVD通过边缘-云协作提升工业视觉检测的精度与效率,采用轻量边缘检测与云MLLM协同,结合高效微调策略和动态调度算法,实现高吞吐低延迟的资源优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18951 2026-01-09 cs.CV 50%

TopoBDA: Towards Bezier Deformable Attention for Road Topology Understanding

TopoBDA: 向贝塞尔可变形注意力迈进:道路拓扑理解

Muhammet Esat Kalfaoglu, Halil Ibrahim Ozturk, Ozsel Kilinc, Alptekin Temizel

机构 * Graduate School of Informatics, Middle East Technical University(信息学院,中东部技术大学) Togg/Trutek AI Team(Togg/Trutek人工智能团队)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 TopoBDA通过贝塞尔可变形注意力提升道路拓扑理解,结合多模态数据增强性能。

Comments Project page: https://artest08.github.io/TopoBDA.github.io/

Journal ref Neurocomputing, Vol. 670, 132360 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03713 2026-01-08 cs.CV 50%

BREATH-VL: Vision-Language-Guided 6-DoF Bronchoscopy Localization via Semantic-Geometric Fusion

BREATH-VL:基于视觉-语言引导的6自由度支气管镜定位:通过语义-几何融合

Qingyao Tian, Bingyu Yang, Huai Liao, Xinyan Huang, Junyong Li, Dong Yi, Hongbin Liu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Pulmonary and Critical Care Medicine, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院呼吸与危重症医学科) Centre of AI and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(香港科学院人工智能与机器人中心) School of Biomedical Engineering and Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 BREATH-VL通过融合语义和几何信息,实现高精度的6自由度支气管镜定位,减少定位误差并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03449 2026-01-08 cs.RO 50%

FIRE-VLM: A Vision-Language-Driven Reinforcement Learning Framework for UAV Wildfire Tracking in a Physics-Grounded Fire Digital Twin

FIRE-VLM:一种基于视觉-语言驱动的强化学习框架,用于在物理基础火灾数字孪生中无人机火灾跟踪

Chris Webb, Mobin Habibpour, Mayamin Hamid Raha, Ali Reza Tavakkoli, Janice Coen, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学) University of Nevada, Reno(内华达大学拉斯维加斯分校) NSF NCAR(国家科学基金会NCAR)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 FIRE-VLM是一种基于视觉-语言模型的强化学习框架,用于在物理基础火灾数字孪生中实现无人机火灾跟踪,通过结合物理术语与VLM语义的奖励设计,提升了火灾检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13683 2026-01-08 cs.CV 50%

I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners

I-Scene: 3D实例模型是隐式可泛化的空间学习者

Lu Ling, Yunhao Ge, Yichen Sheng, Aniket Bera

机构 * Purdue University(普渡大学) NVIDIA Research(英伟达研究)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 I-Scene提出了一种基于3D实例模型的隐式空间学习方法,通过重新编程生成器实现跨场景的泛化能力,展示了其在空间推理和生成中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02864 2026-01-07 eess.IV cs.CV 50%

Lesion Segmentation in FDG-PET/CT Using Swin Transformer U-Net 3D: A Robust Deep Learning Framework

利用Swin Transformer U-Net 3D进行FDG-PET/CT病变分割:一种稳健的深度学习框架

Shovini Guha, Dwaipayan Nandi

机构 * Machine Learning (of Aff.) Institute of Engineering(人工智能与机器学习研究所)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出SwinUNet3D框架,结合Transformer与U-Net,实现FDG-PET/CT病变分割,提升分割精度与效率。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24133 2026-01-06 physics.chem-ph physics.comp-ph physics.data-an 50%

Bridging Visual Intuition and Chemical Expertise: An Autonomous Analysis Framework for Nonadiabatic Dynamics Simulations via Mentor-Engineer-Student Collaboration

弥合视觉直觉与化学专业性:通过导师-工程师-学生协作的自主分析框架实现非绝热动力学模拟分析

Yifei Zhu, Jiahui Zhang, Binni Huang, Zhenggang Lan

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VisU通过导师-工程师-学生协作框架,实现非绝热动力学模拟分析的自动化,减少人工依赖,提升机理发现的直观性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11480 2026-01-06 cs.CV 50%

CADMorph: Geometry-Driven Parametric CAD Editing via a Plan-Generate-Verify Loop

CADMorph: 通过计划-生成-验证循环实现几何驱动的参数化CAD编辑

Weijian Ma, Shizhao Sun, Ruiyu Wang, Jiang Bian

机构 * Fudan University(复旦大学) Microsoft Research, Asia(微软亚洲研究院) University of Toronto(多伦多大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 CADMorph通过计划-生成-验证循环实现几何驱动的参数化CAD编辑,利用预训练模型在数据稀少情况下保持结构、语义和形状保真度,超越现有方法并支持下游应用。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23019 2026-01-06 cs.RO 50%

Stairway to Success: An Online Floor-Aware Zero-Shot Object-Goal Navigation Framework via LLM-Driven Coarse-to-Fine Exploration

通往成功的阶梯:一种通过LLM驱动的粗到细探索的在线楼层感知零样本物体-目标导航框架

Zeying Gong, Rong Li, Tianshuai Hu, Ronghe Qiu, Lingdong Kong, Lingfeng Zhang, Guoyang Zhao, Yiyi Ding, Junwei Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出ASCENT框架,通过LLM驱动的粗到细探索实现在线楼层感知零样本物体-目标导航,无需预建地图或重新训练,适用于多楼层环境。

Comments Accepted to IEEE Robotics and Automation Letters (RAL). Project Page at https://zeying-gong.github.io/projects/ascent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25008 2026-01-05 cs.CV 50%

FoundationSLAM: Unleashing the Power of Depth Foundation Models for End-to-End Dense Visual SLAM

FoundationSLAM: 释放深度基础模型的力量以实现端到端的密集视觉SLAM

Yuchen Wu, Jiahe Li, Fabio Tosi, Matteo Poggi, Jin Zheng, Xiao Bai

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 FoundationSLAM通过结合深度基础模型与几何推理,实现端到端的密集视觉SLAM,提升轨迹精度和重建质量,实现实时18 FPS运行。

Comments Accept at AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23024 2025-12-30 cs.CV 50%

With Great Context Comes Great Prediction Power: Classifying Objects via Geo-Semantic Scene Graphs

大_context带来大预测能力:通过地-语义场景图进行物体分类

Ciprian Constantinescu, Marius Leordeanu

机构 * National University of Science and Technology(科学与技术国家大学) POLITEHNICA Bucharest(布加勒斯特POLITEHNICA)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出了一种基于地-语义场景图的上下文感知物体分类框架,通过整合深度估计与全景分割模型,显著提升分类准确率至73.4%,优于传统方法和多模态大语言模型。

Comments This paper is a development of the visual riddle game with Human-AI interaction, entitled "GuessWhat - Riddle Eye with AI", developed by Ciprian Constantinescu (POLItEHNICA Bucharest), Serena Stan (Instituto Cervantes Bucarest) and Marius Leordeanu (POLITEHNICA Bucharest), which was the winner (1st place) of the NeoArt Connect NAC 2025 Scholarship Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19083 2025-12-25 cs.RO 50%

CoDrone: Autonomous Drone Navigation Assisted by Edge and Cloud Foundation Models

CoDrone:由边缘和云基础模型辅助的自主无人机导航

Pengyu Chen, Tao Ouyang, Ke Luo, Weijie Hong, Xu Chen

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 CoDrone通过整合云-边-端协作计算框架和基础模型,提升无人机自主导航性能,实现更高效和精确的环境感知与动态适应。

Comments This paper is accepted by the IEEE Internet of Things Journal (IoT-J) for publication in the Special Issue on "Augmented Edge Sensing Intelligence for Low-Altitude IoT Systems"

详情

展开后加载摘要…

URL PDF HTML 收藏