arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2602.19505 2026-02-24 cs.CV 50%

Test-Time Computing for Referring Multimodal Large Language Models

测试时计算用于指代多模态大语言模型

Mingrui Wu, Hao Chen, Jiayi Ji, Xiaoshuai Sun, Zhiyuan Liu, Liujuan Cao, Ming-Ming Cheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) VCIP, CS, Nankai University(VCIP,计算机科学,南开大学) Tsinghua University(清华大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ControlMLLM++通过注入可学习的视觉提示实现多模态大语言模型的测试时适应,提升细粒度视觉推理能力。

Comments arXiv admin note: substantial text overlap with arXiv:2407.21534

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19063 2026-02-24 cs.CV 50%

Direction-aware 3D Large Multimodal Models

具有方向感知的3D大多模态模型

Quan Liu, Weihao Xuan, Junjue Wang, Naoto Yokoya, Ling Shao, Shijian Lu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出方向感知的3D大多模态模型,通过补充自身姿态并改进点云数据对齐,提升3D多模态模型的性能和通用性。

Comments In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10116 2026-02-24 cs.CV cs.RO 50%

SAGE: Scalable Agentic 3D Scene Generation for Embodied AI

SAGE: 适用于具身人工智能的可扩展代理3D场景生成

Hongchi Xia, Xuan Li, Zhaoshuo Li, Qianli Ma, Jiashu Xu, Ming-Yu Liu, Yin Cui, Tsung-Yi Lin, Wei-Chiu Ma, Shenlong Wang, Shuran Song, Fangyin Wei

机构 * NVIDIA University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Cornell University(康奈尔大学) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SAGE通过代理框架生成可扩展的3D环境,用于具身人工智能的策略训练和泛化能力提升。

Comments Project Page: https://research.nvidia.com/labs/dir/sage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18424 2026-02-23 cs.CV cs.RO 50%

CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation

CapNav:基于能力条件的室内导航基准测试

Xia Su, Ruiqi Chen, Benlin Liu, Jingwei Ma, Zonglin Di, Ranjay Krishna, Jon Froehlich

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 CapNav基准测试评估VLMs在不同移动约束下室内导航能力,发现其性能随约束增加而下降,且先进模型仍难以处理空间推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07825 2026-02-20 cs.CV 50%

Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model

点语言模型:通过桥接大型3D语言模型实现任意对象分割

Zhuoxu Huang, Mingqi Gao, Jungong Han

机构 * Department of Computer Science, Aberystwyth University(计算机科学系,阿伯里斯特维斯大学) School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 点语言模型通过桥接大型3D语言模型与密集3D点云,解决表示不一致问题,提升3D对象分割的准确性和鲁棒性。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13909 2026-02-17 cs.RO cs.CV 50%

High-fidelity 3D reconstruction for planetary exploration

高保真行星探测的3D重建

Alfonso Martínez-Petersen, Levin Gerdes, David Rodríguez-Martínez, C. J. Pérez-del-Pulgar

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种结合NeRF和高斯点绘的自动化3D重建管道,用于在极端环境下实现高保真的行星探测

Comments 7 pages, 3 figures, conference paper

Journal ref IEEE Conference on Artificial Intelligence (CAI) 2026, Special Session on AI for Space Exploration

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13479 2026-02-17 cs.CV cs.HC 50%

GLIMPSE : Real-Time Text Recognition and Contextual Understanding for VQA in Wearables

GLIMPSE:面向可穿戴设备的实时文本识别与上下文理解的视频大语言模型

Akhil Ramachandran, Ankit Arun, Ashish Shenoy, Abhay Harpale, Srihari Jayakumar, Debojeet Chatterjee, Mohsen Moslehpour, Pierce Chuang, Yichao Lu, Vikas Bhardwaj, Peyman Heidari

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 GLIMPSE通过混合架构在可穿戴设备上实现低功耗的实时文本识别与上下文理解,提升视频大语言模型在资源受限设备上的VQA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04419 2026-02-17 cs.RO 50%

Integrated Exploration and Sequential Manipulation on Scene Graph with LLM-based Situated Replanning

基于场景图的LLM定位再规划集成探索与顺序操作

Heqing Yang, Ziyuan Jiao, Shu Wang, Yida Niu, Si Liu, Hangxin Liu

机构 * Beihang University(北航大学) State Key Laboratory of General Artificial Intelligence(一般人工智能国家重点实验室) University of California, Los Angeles(加州大学洛杉矶分校) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 EPoG通过结合基于图的全局规划器与LLM的定位局部规划器,实现探索与顺序操作规划的无缝结合,有效提升机器人在部分已知环境中的任务执行效率。

Comments 8 pages, 7 figures; accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10080 2026-02-17 cs.CV 50%

BEVTraj: Map-Free End-to-End Trajectory Prediction in Bird's-Eye View with Deformable Attention and Sparse Goal Proposals

BEVTraj: 无地图端到端鸟瞰图轨迹预测方法,采用可变形注意力和稀疏目标提案

Minsang Kong, Myeongjun Kim, Sang Gu Kang, Hejiu Lu, Yupeng Zhong, Sang Hun Lee

机构 * Department of Automobile and IT Convergence, Kookmin University(汽车与IT融合系,韩国釜山大学) Department of Automotive Engineering, Kookmin University(汽车工程系,韩国釜山大学) Graduate School of Automobile and Mobility, Kookmin University(汽车与移动研究生院,韩国釜山大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 BEVTraj通过可变形注意力和稀疏目标提案实现无地图端到端鸟瞰图轨迹预测,提升自动驾驶的鲁棒性和灵活性。

Comments Submitted to IEEE Transactions on Intelligent Transportation Systems (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13041 2026-02-16 cs.CV 50%

Implicit-Scale 3D Reconstruction for Multi-Food Volume Estimation from Monocular Images

隐式尺度多食物体积估计的单目图像三维重建

Yuhao Chen, Gautham Vinod, Siddeshwar Raghavan, Talha Ibn Mahmud, Bruce Coburn, Jinge Ma, Fengqing Zhu, Jiangpeng He

机构 * University of Waterloo(滑铁卢大学) Purdue University(普渡大学) Indiana University(印第安纳大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出隐式尺度三维重建方法,用于单目图像中多食物体积估计,通过基准数据集验证了基于几何的重建方法在准确性和鲁棒性上的优势。

Comments Paper accepted to 2026 IEEE Southwest Symposium on Image Analysis and Interpretation. The dataset can be downloaded at: https://www.kaggle.com/competitions/3d-reconstruction-from-monocular-multi-food-images/data

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14978 2026-02-16 cs.RO 50%

PA-MPPI: Perception-Aware Model Predictive Path Integral Control for Quadrotor Navigation in Unknown Environments

PA-MPPI:感知-aware的模型预测路径积分控制用于未知环境中的四旋翼导航

Yifan Zhai, Rudolf Reiter, Davide Scaramuzza

机构 * University of Zurich(苏黎世大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 PA-MPPI通过结合感知信息,提升了四旋翼在未知环境中的导航能力,能够有效探索未知区域并规划替代路径。

Journal ref IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12062 2026-02-13 cs.RO 50%

HoloBrain-0 Technical Report

HoloBrain-0 技术报告

Xuewu Lin, Tianwei Lin, Yun Du, Hongyu Xie, Yiwei Jin, Jiawei Li, Shijie Wu, Qingze Wang, Mengdi Li, Mengao Zhao, Ziang Li, Chaodong Huang, Hongzhe Bi, Lichao Huang, Zhizhong Su

机构 * Horizon Robotics

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 HoloBrain-0 提出了一种融合视觉、语言和动作的框架,通过预训练和后训练范式,在模拟和现实任务中取得领先性能,并开源完整生态系统促进机器人研究。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11862 2026-02-13 cs.RO 50%

LAMP: Implicit Language Map for Robot Navigation

LAMP:机器人导航的隐式语言地图

Sibaek Lee, Hyeonwoo Yu, Giseop Kim, Sunwook Choi

机构 * Department of Intelligent Robotics, Sungkyunkwan University(智能机器人学系,全北国立大学) NAVER LABS Department of Robotics and Mechatronics Engineering, DGIST(机器人与机电工程系,韩国科学技术院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 LAMP通过隐式语言地图实现高效机器人导航,结合隐式神经场与稀疏图进行粗到细路径优化,提升大环境下的内存效率和目标精度。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). Project page: https://lab-of-ai-and-robotics.github.io/LAMP/

Journal ref IEEE Robotics and Automation Letters (RA-L), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19191 2026-02-10 cs.CV 50%

Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models

像阅读文本一样理解图像:视觉-语言模型中的序列图像理解

Yueyan Li, Chenggong Zhao, Zeyuan Zang, Caixia Yuan, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出通过序列化方法理解图像内容,揭示视觉-语言模型中对象识别与空间感知的机制,改进解码效率并增强空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08071 2026-02-10 cs.CV 50%

ViT-5: Vision Transformers for The Mid-2020s

ViT-5:2020年代中期的视觉变换器

Feng Wang, Sucheng Ren, Tiezheng Zhang, Predrag Neskovic, Anand Bhattad, Cihang Xie, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ViT-5通过改进组件和架构,提升了视觉变换器的性能和泛化能力,成为2020年代中期更优的视觉骨干网络。

Comments Code is available at https://github.com/wangf3014/ViT-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17815 2026-02-09 cs.RO 50%

Less Is More: Scalable Visual Navigation from Limited Data

少即是多:从有限数据实现可扩展的视觉导航

Yves Inglin, Jonas Frey, Changan Chen, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利加州大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出Less is More方法,通过结合有限专家示范与规划器生成的监督,实现高效视觉导航。

Comments v2: Minor text edits, reference formatting fixes, and project page link added

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22936 2026-02-06 cs.CV 50%

PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models

PPE:用于多模态大语言模型中token压缩的位置保持嵌入

Mouxiao Huang, Borui Jiang, Dehua Zheng, Hailin Hu, Kai Han, Xinghao Chen

机构 * Huawei Technologies(华为技术有限公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 PPE通过保持位置信息提升多模态大语言模型的token压缩效率和性能

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03781 2026-02-04 cs.RO 50%

A Scene Graph Backed Approach to Open Set Semantic Mapping

基于场景图的开放集合语义映射方法

Martin Günther, Felix Igelbrink, Oscar Lima, Lennart Niecksch, Marian Renz, Martin Atzmueller

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出基于场景图的开放集合语义映射方法,通过实时更新三维语义场景图,实现大规模环境中的稳定、可验证的映射结构,提升感知与高层推理的一致性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11442 2026-02-04 cs.CV 50%

MultiMAE for Brain MRIs: Robustness to Missing Inputs Using Multi-Modal Masked Autoencoder

MultiMAE用于脑部MRI:通过多模态掩码自编码器提高对缺失输入的鲁棒性

Ayhan Can Erdur, Christian Beischl, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C Peeken

机构 * Department of Radiation Oncology, TUM University Hospital, Munich, Germany(辐射肿瘤科,技术大学慕尼黑医院,慕尼黑,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(医疗与医学人工智能教研室,技术大学慕尼黑(TUM)) TUM University Hospital, Munich, Germany(技术大学慕尼黑医院,慕尼黑,德国) Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(图像引导诊断与治疗人工智能教研室,技术大学慕尼黑(TUM)) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国) Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,伦敦,英国) Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑合作伙伴站点,慕尼黑,德国) Institute of Radiation Medicine (IRM), Department of Radiation Sciences (DRS), Helmholtz Center Munich, Munich, Germany(辐射医学研究所(IRM),辐射科学部门(DRS),慕尼黑海德堡中心,慕尼黑,德国)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 MultiMAE通过多模态掩码自编码器提升脑部MRI在缺失输入下的鲁棒性,实现分割和分类任务的性能提升。

Comments Official implementation: https://github.com/chris-beischl/multimae-for-brain-mri

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03371 2026-02-04 cs.CV 50%

Multi-Resolution Alignment for Voxel Sparsity in Camera-Based 3D Semantic Scene Completion

基于体素稀疏性的多分辨率对齐方法用于基于摄像头的3D语义场景补全

Zhiwen Yang, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出多分辨率对齐方法,通过多分辨率特征对齐和关键分布一致性损失缓解基于摄像头的3D语义场景补全中的体素稀疏性问题。

Comments 15 pages, 6 figures, accepted by TIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00708 2026-02-04 cs.RO 50%

USS-Nav: Unified Spatio-Semantic Scene Graph for Lightweight UAV Zero-Shot Object Navigation

USS-Nav: 一体化空间语义场景图用于轻量级无人机零样本物体导航

Weiqi Gai, Yuman Gao, Yuan Zhou, Yufan Xie, Zhiyang Liu, Yuze Wu, Xin Zhou, Fei Gao, Zhijun Meng

机构 * School of Aeronautic Science and Engineering, Beihang University, Beijing 100191, China(北京航空航天大学航空科学与工程学院) State Key Laboratory of Industrial Control Technology, Zhejiang University, Hangzhou 310027, China(浙江大学工业控制技术状态重点实验室) Differential Robotics, Hangzhou 311121, China(杭州差分机器人)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 USS-Nav通过构建一体化空间语义场景图,实现轻量级无人机在未知环境中的高效零样本物体导航,提升计算效率和实时更新能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14943 2026-02-04 cs.HC 50%

State of the Art of LLM-Enabled Interaction with Visualization

大语言模型赋能的可视化交互现状

Mathis Brossier, Tobias Isenberg, Konrad Schönborn, Jonas Unger, Mario Romero, Johanna Björklund, Anders Ynnerman, Lonni Besançon

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文系统回顾了大语言模型与可视化交互的研究现状,分析了6个维度的48篇论文,突出了新兴设计模式和评估挑战,旨在指导未来LLM增强的可视化研究和系统设计。

Comments Submitted to STARs of EuroVis'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00865 2026-02-03 cs.CV 50%

Distill3R: A Pipeline for Democratizing 3D Foundation Models on Commodity Hardware

Distill3R: 一种在通用硬件上普及3D基础模型的流水线

Brandon Leblanc, Charalambos Poullis

机构 * Immersive and Creative Technologies Lab(沉浸与创意技术实验室) Concordia University(康科迪亚大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Distill3R通过压缩蒸馏技术,在通用硬件上实现3D基础模型的高效训练,使实验室能以低成本进行3D视觉研究与部署。

Comments Submitted to the Canadian Conference on Robotics and Vision (CRV). 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00650 2026-02-03 cs.CV 50%

A Hybrid Mamba-SAM Architecture for Efficient 3D Medical Image Segmentation

一种用于高效3D医学图像分割的混合Mamba-SAM架构

Mohammadreza Gholipour Shahraki, Mehdi Rezaeian, Mohammad Ghasemzadeh

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种混合Mamba-SAM架构,结合冻结SAM编码器与Mamba模型,提升3D医学图像分割的效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00463 2026-02-03 cs.CV 50%

PSGS: Text-driven Panorama Sliding Scene Generation via Gaussian Splatting

PSGS:通过高斯点划法实现文本驱动的全景滑动场景生成

Xin Zhang, Shen Chen, Jiale Zhou, Lei Li

机构 * East China University of Science and Technology(东华大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 PSGS通过高斯点划法和双阶段框架实现高质量文本驱动全景场景生成,提升3D场景的真实感和细节保真度。

Comments Accepted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22376 2026-02-02 cs.CV 50%

FlexMap: Generalized HD Map Construction from Flexible Camera Configurations

FlexMap:从灵活的相机配置构建通用HD地图

Run Wang, Chaoyi Zhou, Amir Salarpour, Xi Liu, Zhi-Qi Cheng, Feng Luo, Mert D. Pesé, Siyu Huang

机构 * School of Computing, Clemson University School of Engineering \& Technology, University of Washington

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 FlexMap通过几何感知基础模型和跨帧注意力机制,实现从灵活相机配置构建通用HD地图,提升了自动驾驶系统在传感器失效和配置变化时的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21751 2026-01-30 cs.CV 50%

Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation

动态拓扑感知:突破视觉语言导航中的粒度刚性

Jiankun Peng, Jianyuan Guo, Ying Xu, Yue Liu, Jiashuang Yan, Xuanwei Ye, Houhua Li, Xiaoming Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 视觉空间推理 :planning(abstract)

AI总结 DGNav通过动态拓扑导航框架,解决视觉语言导航中的粒度刚性问题,提升导航效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21506 2026-01-30 cs.RO cs.SY eess.SY 50%

IROS: A Dual-Process Architecture for Real-Time VLM-Based Indoor Navigation

IROS: 一种用于实时基于视觉语言模型的室内导航的双过程架构

Joonhee Lee, Hyunseung Shin, Jeonggil Ko

机构 * Yonsei University(延世大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 IROS是一种结合视觉语言模型上下文推理与轻量级感知模块的双过程架构,实现低延迟的室内导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19850 2026-01-28 cs.CV 50%

EgoHandICL: Egocentric 3D Hand Reconstruction with In-Context Learning

EgoHandICL: 以自身为中心的3D手重建与上下文学习

Binzhu Xie, Shi Qiu, Sicheng Zhang, Yinqiao Wang, Hao Xu, Muzammal Naseer, Chi-Wing Fu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(医学智能与XR研究院,香港中文大学) Department of Computer Science, Khalifa University(计算机科学系,哈利法大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 EgoHandICL通过上下文学习框架提升以自身为中心的3D手重建的鲁棒性和一致性,结合视觉语言模型和掩码自动编码器实现更精确的手-物体交互推理。

Comments Accepted in ICLR 2026, Codebase: https://github.com/Nicous20/EgoHandICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19433 2026-01-28 cs.CV 50%

RoamScene3D: Immersive Text-to-3D Scene Generation via Adaptive Object-aware Roaming

RoamScene3D: 通过自适应物体感知漫游实现沉浸式文本到3D场景生成

Jisheng Chu, Wenrui Li, Rui Zhao, Wangmeng Zuo, Shifeng Chen, Xiaopeng Fan

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) Nanyang Technological University(南洋理工大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 RoamScene3D通过自适应物体感知漫游实现沉浸式文本到3D场景生成,结合语义推理和几何约束提升场景一致性与逼真度。

详情

展开后加载摘要…

URL PDF HTML 收藏