arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 199 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 199 篇

2604.03316 2026-07-28 cs.CV 版本更新 50%

When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models

当汇点帮助或伤害:面向大视觉-语言模型的注意力汇点统一框架

Jiho Choi, Jaemin Kim, Sanghwan Kim, Seunghoon Hong, Jin-Hwi Park

机构 * KAIST(韩国科学技术院) Chung-Ang University(中央大学) Technical University of Munich(慕尼黑工业大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究了大视觉-语言模型中注意力汇点的影响,提出统一框架分析其作为冗余 artifacts 或全局先验的作用,并通过 Layer-wise Sink Gating 模块平衡全局推理与局部证据。

Comments Acknowledgments updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14807 2026-07-28 cs.CV cs.RO 版本更新 50%

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

HiMemVLN:通过分层记忆系统增强开源零样本视觉-语言导航的可靠性

Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

专题命中 视觉空间推理 :CoT(abstract)

AI总结 本文提出HiMemVLN,通过分层记忆系统提升开源零样本视觉-语言导航的可靠性,解决导航遗忘问题,实现实验环境下的性能提升。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00288 2026-07-28 cs.RO cs.CV 版本更新 50%

UAV-ON: A Benchmark for Open-World Object Goal Navigation with Aerial Agents

UAV-ON:用于空中智能体的开放世界目标导航基准测试

Jianqiang Xiao, Yuexuan Sun, Yixin Shao, Boxi Gan, Rongqiang Liu, Yanjin Wu, Weili Guan, Xiang Deng

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 介绍用于空中智能体开放世界目标导航的UAV-ON基准测试,含14个环境及1270个目标对象,通过实例级指令编码。实现多种基线方法评估,结果凸显空中导航和语义目标基础的复合挑战,推动复杂环境下无人机可扩展自主性研究。

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16619 2026-07-24 cs.RO cs.MA 版本更新 50%

SAGE: A Socially-Aware Generative Engine for Heterogeneous Multi-Agent Navigation

SAGE:用于异构多智能体导航的社会感知生成引擎

Lan Hu, Minghui Liwang, Wenbo Zhu, Xinlei Yi, Yiguang Hong, Xianbin Wang, Zhenzhen Jiao, Seyyedali Hosseinalipour

机构 * Guohao School, Tongji University(同济大学国豪书院) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能无人系统科学中心) Tongji University(同济大学) Western University(西安大略大学) Aeromind Technology Co., Ltd.(深圳智元科技有限公司) University at Buffalo-SUNY(纽约州立大学布法罗分校)

专题命中 视觉空间推理 :planning(abstract)

AI总结 针对开放人机环境中异构多智能体导航问题,提出SAGE,通过有向异构图和异构图变换器编码交互,扩散生成模块建模轨迹,无训练安全-社会能量引导机制优化轨迹,实验验证其有效性及可扩展性。

Comments 16 pages, 5 figures, and 14 tables. Includes supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13318 2026-07-24 cs.CV 版本更新 50%

Reflecting Process Expertise in Procedural Material Generation

在程序材质生成中反映过程专业知识

Kunal Gupta, Gaurav Joshi, Yen-Ru Chen, Seemandhar Jain, Ishit Mehta, Manmohan Chandraker

机构 * University of California San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究聚焦程序材质生成,核心方法是将其作为检索时的过程推理,利用专家演示、教程视频等提取轨迹并合成材质图。主要贡献是生成的材质编辑少、更符合专业策略,且相比先前系统有更好的生成和编辑性能。

Comments Accepted to ECCV 2026. Project page: https://materialapprentice.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31533 2026-07-24 cs.CV 版本更新 50%

MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

MV-GEL:语言驱动的多视图网格几何实体定位

Kartik Bali, Roland Aydin

机构 * Helmholtz Zentrum Hereon(亥姆霍兹赫里恩研究中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(汉堡工业大学连续介质与材料力学研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出MV-GEL框架,通过语言查询定位网格上的细粒度几何实体,利用视角选择模块GELviews优先选择可观察性高的视角,结合VLM分割和光线投射提升定位精度。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22819 2026-07-24 cs.CV 版本更新 50%

Cambrian-P: Pose-Grounded Video Understanding

Cambrian-P: 基于姿态的视频理解

Jihan Yang, Zifan Zhao, Xichen Pan, Shusheng Yang, Junyi Zhang, Bingyi Kang, Hu Xu, Shang-Wen Li, Saining Xie

机构 * New York University(纽约大学) UC Berkeley(加州大学伯克利分校) Meta FAIR

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究提出Cambrian-P,一种增强的视频多模态大语言模型,通过引入可学习的相机令牌和姿态回归头,利用姿态作为轻量级监督信号,显著提升了空间推理能力,并在多个视频问答基准上实现了SOTA表现。

Comments Project Page: https://cambrian-mllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03920 2026-07-21 cs.RO 版本更新 50%

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

LH-AVLN:长距离视听语言导航基准测试

Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 介绍长距离视听语言导航基准LH-AVLN,结合多目标任务执行等。提出免训练参考智能体PAG-Nav,可维护语义地图并规划。实验表明现有智能体完成任务有困难,PAG-Nav提供更强诊断基线。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19541 2026-07-21 cs.MA cs.HC 版本更新 50%

FOCAL: Filtered On-device Continuous Activity Logging for Efficient Personal Desktop Summarization

FOCAL:过滤的本地连续活动日志用于高效的个人桌面摘要

Haoran Yin, Zhiyuan Wen, Jiannong Cao, Bo Yuan, Ruosong Yang

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 FOCAL通过多代理系统实现高效的本地桌面流摘要,减少资源消耗并提升任务召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14302 2026-07-21 cs.CV 版本更新 50%

Geometrically Consistent Multi-View Scene Generation from Freehand Sketches

从自由手绘图生成几何一致的多视角场景

Ahmed Bourouis, Savas Ozkan, Andrea Maracani, Yi-Zhe Song, Mete Ozay

机构 * Samsung Research, UK(三星研究院(英国)) SketchX, University of Surrey, UK(SketchX,塞维利亚大学(英国))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出从单张自由手绘图生成几何一致的多视角场景,通过自定义数据集、并行摄像头感知注意力适配器和稀疏对应监督损失提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16461 2026-07-21 cs.CV 版本更新 50%

GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models

GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知

Jiaxin Zhang, Junjun Jiang, Haijie Li, Youyu Chen, Kui Jiang, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Huawei(华为)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。

Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06570 2026-07-21 cs.RO 版本更新 50%

Unsupervised Discovery of Failure Taxonomies from Deployment Logs

无监督发现部署日志中的故障分类

Aryaman Gupta, Yusuf Umut Ciftci, Somil Bansal

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出无监督发现部署日志中的故障分类方法,通过视觉-语言推理和语义聚类,提升机器人系统鲁棒性和故障监控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08982 2026-07-21 cs.CV 版本更新 50%

CityLoc: 6DoF Pose Distributional Localization for Text Descriptions in Large-Scale Scenes with Gaussian Representation

CityLoc:基于高斯表示的大规模场景文本描述的6自由度姿态分布定位

Qi Ma, Runyi Yang, Bin Ren, Nicu Sebe, Ender Konukoglu, Luc Van Gool, Danda Pani Paudel

机构 * Computer Vision Lab, ETH Zurich(苏黎世联邦理工学院计算机视觉实验室) University of Pisa(比萨大学) University of Trento(特伦托大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究大规模场景文本描述的6自由度姿态分布定位问题,核心方法是用基于扩散架构结合预训练文本编码器细化姿态,经3D高斯渲染提高精度,通过与标准方法对比验证其在多数据集上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12630 2026-07-20 cs.RO cs.CV 版本更新 50%

Instance-Enriched Semantic Maps for Visual Language Navigation

用于视觉语言导航的实例增强语义地图

Jiho Hong, Eunae Kang, Sanghyun Kim, Young-Sik Shin

机构 * Department of Mechanical Engineering, Kyung Hee University(庆熙大学机械工程系) Advanced Institutes of Convergence Technology (AICT)(融合技术高级研究院) School of Mechanical Engineering, Kyungpook National University(庆北国立大学机械工程学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究视觉语言导航问题,提出实例增强语义地图框架,通过实例级二维半丰富信息映射、基于大语言模型的鲁棒查询处理和存储高效的语义表示,提升导航性能,在相关实验中取得优于基线的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16839 2026-07-17 cs.CV 版本更新 50%

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa:用于多模态理解的大型扩散语言模型

Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Adobe Research(Adobe研究) Salesforce Research(Salesforce研究)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27745 2026-07-16 cs.CV 版本更新 50%

Panoramic Scene Understanding: A Survey from Distortion-Aware Engineering to Sphere-Native Modeling

全景场景分析:从畸变感知工程到球面原生基础建模的综述

Qinfeng Zhu, Lei Fan

机构 * University of Liverpool(利物浦大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文综述全景场景分析从投影适应、畸变感知工程到球面原生建模的演进,指出当前方法无法同时实现严格球面等变性和重用预训练基础模型权重,并揭示评估协议中的五个系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21268 2026-07-16 cs.CV 版本更新 50%

Vision Transformers and Convolutional Neural Networks for Land Use Scene Classification

视觉Transformer与卷积神经网络在土地利用场景分类中的应用

Arun D. Kulkarni

机构 * Computer Science Department, University of Texas at Tyler(德克萨斯理工大学计算机科学系)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文比较了视觉Transformer和CNN在遥感土地利用场景分类中的性能,发现CNN在有限训练样本和局部纹理特征强的场景中表现稳健,而ViT在数据充足时能更好地捕捉全局空间关系,但计算成本更高。

Comments 11 pages

Journal ref International Journal of Advanced Computer Science and Applications, vol. 17, no. 7, 2026,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06537 2026-07-14 cs.RO 版本更新 50%

UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation

UniLM-Nav:零样本最后一英里导航的统一框架

Zhuofan Zhang, Tianxu Wang, Guoxi Zhang, Yixiong Lin, Xilin Wang, Hongming Xu, Qing Li, Song-Chun Zhu, Lifeng Fan

机构 * Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究移动操作中最后一英里导航问题,提出UniLM-Nav统一框架,通过多模态大语言模型后端分解任务为视图选择、功能接地和姿态推理,在OVMM基准上优于现有方法,还验证了在实际机器人上的适用性。

Comments Project page: https://unilm-nav.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06534 2026-07-14 cs.CV 版本更新 50%

CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models

CAIRN:使用拓扑感知大型多模态模型进行跨房间3D场景理解

He Liang, Chenyang Ma, Yiming Zhang, Sangyun Shin, Andrew Markham, Niki Trigoni, Yuhang He

机构 * University of Oxford(牛津大学) Microsoft(微软公司) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对现有3D-LLMs不能处理多房间场景问题,提出拓扑感知3D-LLM即CAIRN。其将Transformer注意力与场景层次对齐,通过多种方式增强模型能力。在新基准CAIRN-MR上实验,CAIRN在多房间任务中大幅超越前人,单房间任务也具竞争力。

Comments Project Page: https://oceansdepp.github.io/cairn_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12322 2026-07-13 cs.CV 版本更新 50%

Zero-shot 3D General Obstacle Detection via Multimodal Foundation Models and Geometry

通过多模态基础模型和几何进行零样本3D通用障碍物检测

Tamás Matuszka, Péter Hajas, Dávid Szeghy

机构 * aiMotive

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对自动驾驶中通用障碍物检测难题,提出结合多模态基础模型与几何推理的免训练零样本方法,能精准定位达100米,借基础模型先验提升召回率,还可实现可扩展自动标注。

Comments Accepted to CVPR 2026 AUTOPILOT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新 50%

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05240 2026-07-10 cs.RO cs.CV 版本更新 50%

StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

StreamVLN:通过快慢上下文建模实现流式视觉与语言导航

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21133 2026-07-09 cs.RO 版本更新 50%

Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum

通过主动空间大脑和可泛化动作小脑的人形全身 manipulation

Zhizhao Liang, Yi-Lin Wei, Xuhang Chen, Mu Lin, Yi-Xiang He, Zhexi Luo, Jun-Hui Liu, Kun-Yu Lin, Wei-Shi Zheng

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University(工程学院,中山大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种通用的人形 locomotion-manipulation 框架,通过主动空间大脑和可泛化动作小脑来解决复杂3D环境中空间理解困难和动作生成泛化困难的问题,展示了在多种任务和环境中的强性能。

Comments Project page: https://leungchaos.github.io/Humanoid-Whole-Body-Manipulation-via-Active-Spatial-Brain-and-Generalizable-Action-Cerebellum/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13808 2026-07-08 cs.CV 版本更新 50%

VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models

VisCoP:用于视觉语言模型视频域适应的视觉探测

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学查塔努加分校) Elorian AI(Elorian人工智能公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对视觉语言模型在新领域性能下降问题,提出参数高效的VisCoP框架,通过可学习视觉探测器增强视觉编码器,在多种适应设置下评估,该框架优于现有策略,能有效适应新领域且保留源域能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01204 2026-07-03 cs.CV 版本更新 50%

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen: 桌面场景生成与机器人操作的交互式仿真

Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) D-Robotics Horizon Robotics

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。

Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23365 2026-07-02 cs.CV 版本更新 50%

SpatialMosaic: A Multiview VLM Dataset for Partial Visibility

SpatialMosaic:一个多视角VLM数据集用于部分可见性

Kanghee Lee, Jungi Hong, Sion Lee, Injae Lee, Minseok Kwak, Kwonyoung Ryu, Jaesik Park

机构 * Seoul National University(首尔大学) University College London(伦敦大学学院) Kyung Hee University(庆熙大学) POSTECH(浦项科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SpatialMosaic数据集,通过多视角图像生成2M问答对,引入SpatialMosaic-Bench基准测试,结合3D重建模型的混合框架提升空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06254 2026-07-02 cs.CV cs.RO eess.IV 版本更新 50%

NOVA: Next-step Open-Vocabulary Autoregression for 3D Multi-Object Tracking in Autonomous Driving

NOVA:自动驾驶中3D多目标跟踪的下一步开放词汇自回归

Kai Luo, Xu Wang, Rui Fan, Kailun Yang

机构 * College of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与运载工程学院) State Key Laboratory of Intelligent Autonomous Systems, Tongji University(同济大学智能自主系统国家重点实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出NOVA方法,通过自回归关联将3D多目标跟踪转化为轨迹条件时空语义序列完成,利用大语言模型实现开放词汇泛化,在nuScenes等数据集上显著提升新类别跟踪性能。

Comments Accepted to IROS 2026. Code will be available at https://github.com/xifen523/NOVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19326 2026-07-02 cs.CV 版本更新 50%

MonoMSK: Monocular 3D Musculoskeletal Dynamics Estimation

MonoMSK: 单目3D肌肉骨骼动力学估计

Farnoosh Koleini, Hongfei Xue, Ahmed Helmy, Pu Wang

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出MonoMSK混合框架,结合数据驱动与物理仿真,从单目视频估计生物力学真实的3D人体运动(运动学与动力学),通过ODE仿真和逆动力学实现高精度运动与力估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30608 2026-07-01 cs.CV 版本更新 50%

UnfoldArt: Zero-Shot Recovery of Full Articulated 3D Objects from Text or Image

UnfoldArt: 从文本或图像零样本恢复完整关节式3D物体

Mohamed el Amine Boudjoghra, Ivan Laptev, Angela Dai

机构 * Technical University of Munich(慕尼黑工业大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出首个辩论驱动代理方法,结合视觉语言模型和视频生成先验,从文本或图像零样本重建关节式3D物体的结构、运动与隐藏几何。

Comments Project page: https://aminebdj.github.io/unfoldart

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18747 2026-07-01 cs.CV 版本更新 50%

URoPE: Universal Relative Position Embedding across Geometric Spaces

URoPE: 在几何空间中实现通用的相对位置嵌入

Yichen Xie, Depu Meng, Chensheng Peng, Yihan Hu, Quentin Herau, Masayoshi Tomizuka, Wei Zhan

机构 * Applied Intuition(应用直觉) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 URoPE扩展了RoPE,使模型能在不同视角或维度的几何空间中处理位置信息,适用于多任务如视图合成、3D检测等,提升模型在几何推理中的表现。

Comments Accepted by ECCV 2026. Code is available: https://urope-pe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏