arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4109 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 381 篇

2606.06534 2026-06-08 eess.IV cs.AI 新提交 57%

Attention Consistent Longitudinal Medical Visual Question Answering Guided by Vision Foundation Models

基于视觉基础模型的注意力一致纵向医学视觉问答

Jialin Wu, Qianru Zhang, Georges El Fakhri, Xiaofeng Liu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Yale Biomedical Imaging Institute(耶鲁大学生物医学成像研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种注意力引导的编码器-解码器框架,通过轻量级配准和自适应掩码生成,结合辅助损失函数,实现胸部X光片的纵向医学视觉问答,在Medical-Diff-VQA基准上取得优异性能。

Comments Accepted to CVPR 2026 Workshop PHAROS-AIF-MIH

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6448-6458

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17975 2026-08-19 cs.GR cs.CV 新提交 50%

aDSL: Agentic 3D Creation via Joint Agent-Program Design

aDSL:通过智能体-程序联合设计实现智能体驱动的3D内容创建

Rui-Huan Wang, Si-Tong Wei, Jia-Qi He, Heng-Yi Wei, Baoquan Chen, Peng-Shuai Wang

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究联合设计以智能体为中心的领域特定语言aDSL与角色专业化多智能体系统,通过“规划-执行-评审”循环提升3D内容创建的鲁棒性等,在文本到形状等任务上优于LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17535 2026-08-19 cs.CV 新提交 50%

GroupForward: Building Referable 3D Scenes via Instance-Grouped Feed-Forward Gaussian Splatting

GroupForward:通过实例分组前馈高斯溅射构建可参考的3D场景

Qijian Tian, Zimeng Wu, Xuhong Wang, Lizhuang Ma, Xin Tan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 GroupForward是一种实例分组前馈高斯溅射模型,可从稀疏多视图图像重建3D场景,结合RSRF实现复杂3D参考推理,提升了语义重建与参考推理的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16174 2026-08-18 eess.SY cs.SY 新提交 50%

L-COIN: LLM-Assisted Counterfactual Inference for Game-Theoretic Distributed Computation Offloading in Sub-THz LEO Satellite Networks

L-COIN:用于亚太赫兹低轨卫星网络中博弈论分布式计算卸载的大语言模型辅助反事实推理

Jinhao Yi, Weijun Gao, Chong Han

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究针对亚太赫兹低轨卫星网络的分布式计算卸载问题,提出L-COIN框架,结合LLM与反事实推理,降低卸载成本10.9%-27.7%,提升了时变场景下的卸载性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15336 2026-08-18 cs.CV 新提交 50%

SAGE-OR: Semi-supervised Adaptive Scene Graph Generation for Operating Rooms

SAGE-OR:面向手术室的半监督自适应场景图生成

Brandon Leblanc, Charalambos Poullis

机构 * Concordia University(康考迪亚大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SAGE-OR是面向手术室的半监督自适应场景图生成框架,采用解耦范式,轻量高效,在4D-OR基准上F1达76%,经无监督手部增强后达86%,可低成本适配新手术场景。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13723 2026-08-17 cs.RO 新提交 50%

Graph-MambaNav: Spatial-Temporal Graph Mamba Leveraging Object-Relation Knowledge for Object-Goal Navigation

Graph-MambaNav:利用对象关系知识的时空图Mamba用于目标对象导航

Leyuan Sun, Genxin Chen, Linwei Ye, Yan Zhang, Xi Kan, Yanfei Sun

机构 * School of Internet of Things Engineering, Wuxi University(无锡大学物联网工程学院) School of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出Graph-MambaNav,一种结合LLM常识对象关系的目标感知时空图编码框架,通过节点排序与Mamba建模实现高效导航,在仿真环境表现优异且泛化性好,经真实机器人部署验证有效。

Comments Accepted by IEEE Robotics and Automation Letters (IEEE RA-L), will transfer to 2027 IEEE International Conference on Robotics & Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12737 2026-08-14 cs.CV 新提交 50%

Dual-Manifold Geometry Guided Representation Learning: Adaptive Coupling between Kernel and Data Spaces

双流形几何引导的表示学习:核空间与数据空间的自适应耦合

Wencong Zhang, Yue Zhang, Meiyan Huang, Wei Yang, Qianjin Feng

机构 * School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Guangdong Provincial Key Laboratory of Medical Image Processing, Southern Medical University(南方医科大学广东省医学图像重点实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究提出双流形视角,构建KGFT轻量级模块,结合利用与探索模式及深度感知策略,在ResNet等架构的图像分类等任务上取得一致性能提升,验证了方法的通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12515 2026-08-14 cs.CV cs.RO 新提交 50%

Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

视觉-语言模型能否从机器人的第一人称视角图像评估人际距离风险?

Vladyslava Rudas, Dmytro Kuzmenko

机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) University of Turin(都灵大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究评估了InternVL、Qwen-VL、SmolVLM三种VLM在机器人第一人称视角图像人际距离危险分类中的表现,发现Qwen-VL经特定优化后高危险召回率更高,当前VLM在相关推理定位上仍有局限。

Comments Accepted at the EMR 2026 workshop at ECCV 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12059 2026-08-13 cs.CY 新提交 50%

Reconfiguring Geovisualization in the Age of Generative AI: Insights from Domain Experts

生成式AI时代的地理可视化重构:领域专家的见解

Mengyi Wei, Chenyu Zuo, Jiaying Xue, Nianhua Liu, Dongsheng Chen, Shengkai Wang, Yu Feng, Liqiu Meng

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究通过访谈20位地理可视化专家,探究生成式AI对地理可视化实践的影响,发现其拓展了相关能力但转移了瓶颈,提出需领域特定方法实现负责任应用,为相关实践、教育等提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11458 2026-08-13 cs.CV 新提交 50%

Multi-Agent Target-Existence Verification and Learned Mask Geometry Refinement: Winning Report of the MeViS-Text Track at the 8th LSVOS Challenge 2026

多智能体目标存在性验证与学习型掩码几何优化:2026年第8届LSVOS挑战赛MeViS-Text赛道获胜报告

Jungyoon Lee, Gyuil Lim, Doeon Kim, Seong-heum Kim

机构 * Soongsil University(崇实大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出SSUPER方案,通过多智能体审计解耦存在性验证、StyleRefiner优化掩码几何,获2026年LSVOS挑战赛MeViS-Text赛道冠军,最终得分0.9081339614。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10057 2026-08-12 cs.CV 新提交 50%

LEGO: Leveled Language Gaussian Splatting

LEGO:分层语言高斯溅射

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。

Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09147 2026-08-11 cs.CV 新提交 50%

RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection

RefineAny3D:作为语义对齐的深度细化用于单目3D检测

Zhihao Zhang, Gengwei Zhang, Tianlong Chen, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉空间推理 :chain-of-thought(abstract)

AI总结 RefineAny3D将单目3D检测的深度细化转化为视觉对齐问题,通过VLM实现无需数值预测的深度修正,在多类检测工具上均有性能提升且可泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08596 2026-08-11 cs.CV 新提交 50%

Goal-oriented Navigation Instruction Generation with Tour Video Priors

基于旅游视频先验的面向目标的导航指令生成

Fangdi Li, Juncheng Liao, Changxu Cheng, Jiazhi Wang, Senda Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi AI(优必爱人工智能) Zhejiang University(浙江大学) Tongji University(同济大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06729 2026-08-10 cs.RO cs.CV 新提交 50%

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

AtlasVLA:面向视觉-语言-动作模型的持久化世界-自我状态建模

Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao, Mingming Yu, Xingjian He, Jie Jiang, Jing Liu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 AtlasVLA是一种新型VLA模型框架,通过双记忆架构实现持久化世界-自我状态建模,在仅用腕部单目相机的情况下,在LIBERO等基准及真实世界长时序任务中性能超越多视图基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06170 2026-08-07 cs.RO cs.CV 新提交 50%

Prior-SG: Task and Prior Driven Region Segmentation for Scene Graphs in Arbitrarily-Structured Environments

Prior-SG:面向任意结构环境中场景图的任务与先验驱动区域分割

Giorgio Tonetti, Laurent Kneip, Abel Gawel, Marco Hutter

机构 * RAI Institute(RAI研究所) ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出Prior-SG框架,将场景图生成视为概率对齐问题,通过融合异构专家与拓扑先验提升任意结构环境的语义区域分割精度,实现零样本本体灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05389 2026-08-07 cs.CV 新提交 50%

Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model

基于视觉语言基础模型的文本引导多序列胶质瘤亚区分割细化

Zach Eidex, Yu-nong Lin, Mojtaba Safari, Sean Pitroda, Ralph Weichselbaum, Zhen Tian, Xiaofeng Yang

机构 * Emory University School of Medicine(埃默里大学医学院) The University of Chicago(芝加哥大学) Winship Cancer Institute(温希普癌症研究所)

专题命中 视觉空间推理 :planning(abstract)

AI总结 该研究开发基于VoxTell的轻量级框架,用3D视觉语言基础模型实现文本引导的胶质瘤亚区分割细化,在BraTS-GLI及跨数据集测试中提升了分割的DSC指标,支持作为临床医生在环工具的进一步评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04610 2026-08-06 cs.CV 新提交 50%

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

HiSC:用于高效3D场景理解的分层空间聚类令牌压缩

Jiuhe Qu, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03851 2026-08-05 cs.CV 新提交 50%

LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation

LiteMVS:结合基础模型蒸馏与专家聚合的高效多视图立体匹配

Tianbao Zhang, Zeyu Liu, Shuyu Wu, Fanxing Li, Zhaoxin Fan, Wenjun Wu, Danping Zou

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 LiteMVS是集成平面扫描几何推理与单目先验的轻量多视图深度模型,通过MoE和基础模型蒸馏提升重建质量与效率,在ScanNetv2等数据集上表现优异。

Comments CVPR 2026 Workshop accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03109 2026-08-05 cs.CV cs.RO 新提交 50%

Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis

结合三维骨架提取与语言分析的多模态植物根表型分析

Jiakai Lin, Zijun Li, Guoyu Lu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究提出多模态机器人AI框架,结合W-LBC无监督三维骨架提取与证据优先语言建模,微调GPT实现12种植物根表型的可解释分析,建立了定量与语义结合的根表型统一分析范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03084 2026-08-05 cs.CV 新提交 50%

SUV: Future Scene Understanding as Video Generation for End-to-End Driving

SUV:将未来场景理解建模为视频生成的端到端驾驶

Yibo Yuan, Jiacheng Fu, Jiangtong Zhu, Yi Li, Jianhua Han, Meng Tian, Zhuohan Liu, Zhiwei Xiong, Hang Xu, Jianwu Fang, Jianru Xue

专题命中 视觉空间推理 :planning(abstract)

AI总结 SUV是将未来场景理解建模为视频生成的端到端驾驶框架,其在NAVSIM-v2和WOD-E2E基准上优于近期SOTA方法,实现了更优的轨迹规划性能。

Comments 16 pages, 5 figures. Code: https://github.com/ASH-2046/SUV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03064 2026-08-05 cs.CV 新提交 50%

Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation

基于全局图验证的VLM驱动3D室内场景生成优化

Jialu Huang, Yingxuan You, Fei Wang, Zheng Dang

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究针对VLM驱动3D室内布局生成中全局一致性与物理可行性不足的问题,提出结合GSV与GPFS的混合策略,实现了该任务的当前最优性能。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00779 2026-08-04 cs.RO 新提交 50%

SIPTraj: Map-Free End-to-End Trajectory Prediction via Physics-Guided Scene Interaction

SIPTraj:无高精地图的物理引导场景交互端到端轨迹预测

Feifei Liu, Zejun Wei, Haozhe Wang, Yazhi Ye, Yuying Zhang, Jintao Cheng, Chi Man Vong, Xieyuanli Chen, Xiaoyu Tang

机构 * School of Data Science and Engineering, Xingzhi College, South China Normal University(华南师范大学行知学院数据科学与工程学院) Hong Kong University of Science and Technology(香港科技大学) University of Macau(澳门大学) College of Intelligence Science and Technology, National University of Defense Technology(国防科技大学智能科学学院) School of Electronic Science and Engineering, South China Normal University(华南师范大学电子科学与工程学院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 SIPTraj是一种无高精地图的端到端轨迹预测框架,通过分层智能体-场景编码器和物理引导迭代解码器解决场景锚定与物理可行性问题,在两个数据集上性能优于现有方法,推理无需高精地图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00652 2026-08-04 cs.RO 新提交 50%

Assistant Placement Aria: A Benchmark for Egocentric Placement Assistance

助手放置基准Aria:面向以自我为中心的放置辅助任务的基准

Amir Belder, Gonçalo Dias Pais, Refael Vivanti, Omri Carmi, Daniel DeTone, Oren Shrout, Ido Gattegno, Ayellet Tal

机构 * Reality Labs, Meta inc.(Meta公司现实实验室) Technion, institute of technology(以色列理工学院) Sensei

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出首个虚拟放置基准Assistant Placement Aria,涵盖三类以人为中心的放置任务,在基准上评估了多个基础模型,推动虚拟放置领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00502 2026-08-04 cs.CV 新提交 50%

SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance

SpatialAfford:教紧凑视觉语言模型(VLMs)关注何处与定位何处以实现 affordance

Yufei Zhang, Chenlu Zhan, Donghui Sun, Xiaoxin Chen, Hongwei Wang

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SpatialAfford 是一个两阶段框架,通过空间注意力对齐和空间感知 GRPO,使紧凑 4B VLMs 在多个基准上的 affordance 定位性能优于更强的 7B+ 基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00110 2026-08-04 cs.CV 新提交 50%

Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models

蒸馏RGB可恢复的内容:面向仅RGB视觉-语言模型的特权3D证据

Yanbin Hu, Jin Cui, Jun Ye, Jiepeng Zhou, Jiangcheng Song, Boran Zhao, Pengju Ren

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出特权3D证据蒸馏框架,将训练时的3D证据转化为仅RGB视觉-语言模型的空间推理能力,使仅RGB学生模型在11项指标上均优于基线,验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29600 2026-08-03 cs.RO 新提交 50%

HAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language Navigation

HAM-VLN:利用分层智能体记忆实现零样本视觉与语言导航

An Liu, Bingxi Liu, Hongyu Ding, Yixuan Jiang, Yaran Chen, Fulin Tang, Cong Leng, Hong Zhang, Jian Cheng

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出HAM-VLN零样本VLN方法,通过分层智能体记忆缓解长程导航的记忆与推理瓶颈,提升导航指标并缩短上下文长度,在多个基准数据集上取得优异零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26595 2026-07-30 cs.CV 新提交 50%

SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM

SpatialQ:基于视觉的多模态大语言模型(MLLM)理解3D Gaussian Splatting场景质量

Jingxuan Su, Shenglin Wang, Tiesong Zhao, Ge Li, Wei Gao

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Fuzhou University(福州大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对3DGS场景质量评估的局限,本文提出SpatialQ框架,通过VGGT编码器与Qwen-MLLM实现结构感知的多模态质量评估,解决传统IQA仅依赖2D线索的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26196 2026-07-30 cs.CV 新提交 50%

Rad-JEPA 3D: Radiology Joint-Embedding Predictive Model for 3D Computed Tomography

Rad-JEPA 3D:用于三维计算机断层扫描的放射学联合嵌入预测模型

Quoc-Huy Trinh, Minh-Van Nguyen, Ulas Bagci

机构 * Northwestern University(西北大学) Technical University of Denmark(丹麦技术大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Rad-JEPA 3D是用于3D CT的自监督联合嵌入预测框架,采用混合H-Mamba编码器与HSOR正则化,在12万次CT扫描预训练后,在器官识别、空间推理等任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25243 2026-07-29 cs.DB 新提交 50%

AuthentiCity: A Multi-Source Provenance-Aware Knowledge Graph and Benchmark for 3D City Models

真实性:用于3D城市模型的多源溯源感知知识图谱及基准测试

Huynh Duc An Son Nguyen, Lukas Arzoumanidis, Youness Dehbi

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对城市数字孪生多源数据整合难题,提出多源溯源感知的3D城市知识图谱AuthentiCity,整合多城市多类型数据。引入两个基准测试系列,通过自然语言到查询翻译及图表示学习评估,展示其在多任务中的优势,为相关研究提供数据及测试支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22325 2026-07-27 cs.CV cs.RO 新提交 50%

Geometric 2D Scene Graph Generation

几何二维场景图生成

Christoph Jahn, Urs Waldmann, Bastian Goldluecke

机构 * Mercedes-Benz AG(梅赛德斯-奔驰股份公司) Department of Computer and Information Science, University of Konstanz(康斯坦茨大学计算机与信息科学系)

专题命中 视觉空间推理 :planning(abstract)

AI总结 针对消费品生产及机器人装配中部件装配关系表示问题,提出不依赖语义数据、可处理小数据集的方法。利用Faster R-CNN输出经处理生成邻接矩阵,输入基于aGCN架构的暹罗网络表征连接,在玩具模型部件数据集上验证了该方法。

Comments Accepted at the 18th International Conference on Agents and Artificial Intelligence ICAART 2026, Marbella, Spain

Journal ref Jahn, C., Waldmann, U. and Goldluecke, B. (2026). Geometric 2D Scene Graph Generation. In Proceedings of the 18th International Conference on Agents and Artificial Intelligence - ICAART 2026

详情

展开后加载摘要…

URL PDF HTML 收藏