arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 753 信号源:cs.CV, cs.GR, cs.RO

1. 点云 245 篇

2607.00148 2026-07-02 cs.RO cs.CV 新提交 62%

3D Point World Models: Point Completion Enables More Accurate Dynamics Learning

3D点云世界模型:点云补全实现更准确的动力学学习

Skand Peri, Hung Nguyen, Chanho Kim, Li Fuxin, Stefan Lee

机构 * Oregon State University(俄勒冈州立大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 提出3D点云世界模型(3DPWM),通过先补全部分点云再学习动作条件动力学,实现长时程可靠推演和精确成本评估,支持多种机器人操作任务。

Comments 21 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23062 2026-06-23 cs.GR cs.CV 新提交 62%

VolHuMe: a High-Resolution Large Scale Dataset of Volumetric Human Meshes

VolHuMe:高分辨率大规模体积人体网格数据集

Giulia Martinelli, Niccolò Bisagno, Nicola Garau, Esa Rahtu, Nicola Conci

机构 * University of Trento(特伦托大学) CNIT Tampere University(塔尔基大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.GR

AI总结 提出VolHuMe数据集,包含104名受试者的高质量4D人体扫描,提供SMPL-X、高分辨率网格等多模态真值,用于3D/4D人体重建基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22439 2026-06-23 cs.CV cs.RO 新提交 62%

Curvature-aware 3D length estimation of greenhouse cucumbers using RGB-D imaging and cubic spline arc-length integration

基于RGB-D成像和三次样条弧长积分的曲率感知温室黄瓜三维长度估计

Manveen Kaur, Rajmeet Singh, Saeed Mozaffri, Shahpour Alirezaee

机构 * University of Windsor(温莎大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 提出CucumberVision框架,结合YOLO26n分割、SAM精细化掩膜和三次样条弧长积分,实现温室黄瓜非接触式长度估计,在48次捕获中平均绝对百分比误差为4.13%,优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18583 2026-06-18 cs.CV cs.RO 新提交 62%

Aerial-ground LiDAR place recognition with patch-level self-supervised learning and expanded reciprocal re-ranking

空地激光雷达地点识别:基于块级自监督学习和扩展互逆重排序

Yandi Yang, Xianghong Zou, Jianping Li, Haofeng Xie, Saurav Uprety, Hongzhou Yang, Naser El-Sheimy

机构 * University of Calgary(卡尔加里大学) Nanchang University(南昌大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 提出一种空地激光雷达地点识别框架,通过多尺度块级自监督学习缩小域差距,并利用扩展互逆重排序算法减少误检,在多个数据集上显著提升检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16569 2026-06-16 cs.CV cs.RO 新提交 62%

PROSE: Training-Free Egocentric Scene Registration with Vision-Language Models

PROSE: 基于视觉语言模型的无训练自我中心场景配准

Zhiang Chen, Nahyuk Lee, Boyang Sun, Taein Kwon, Marc Pollefeys, Zuria Bauer, Sunghwan Hong

机构 * ETH Zurich(苏黎世联邦理工学院) VGG, University of Oxford(牛津大学VGG实验室) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 提出PROSE方法,利用预训练视觉语言模型将RGB序列提升为对象级3D场景图,通过对象高度先验和相同/不同查询匹配实例,无需训练或深度传感器即可实现自我中心场景配准,在Aria基准上超越几何和场景图基线。

Comments Project page: https://rckola.github.io/prose/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12728 2026-06-15 cs.RO cs.CV cs.LG 新提交 62%

EquiDexFlow: Contact-Grounded SE(3)-Equivariant Dexterous Grasp Generative Flows

EquiDexFlow: 基于接触的SE(3)-等变灵巧抓取生成流

Clinton Enwerem, John S. Baras, Calin Belta

机构 * Institute for Systems Research, University of Maryland, College Park(马里兰大学帕克分校系统研究所)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 提出EquiDexFlow,一种SE(3)-等变流匹配模型,联合预测腕部姿态、关节角度、指尖接触、表面法线和接触力,通过将接触投影到物体表面并将力约束在库仑摩擦锥内,确保物理稳定抓取,在16自由度Allegro手上实现零摩擦违规和最佳综合分数。

Comments 22 pages, 11 figures, 11 tables. Project page with videos, code, and checkpoints: https://equidexflow.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08844 2026-06-09 cs.CV cs.RO 新提交 62%

Geometry-Aware Fisheye-LiDAR Fusion for Robust 3D Object Detection in Low-Overlap Setups

几何感知鱼眼-激光雷达融合用于低重叠设置下的鲁棒3D目标检测

Xiangzhong Liu, Xihao Wang, Hao Shen

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 针对稀疏视角下鱼眼相机与激光雷达的几何畸变和低重叠问题,提出几何感知混合融合框架,通过畸变感知LSS模块和双注意力校正模块实现极坐标与笛卡尔特征融合,在三个基准上提升检测精度。

Comments 8 pages, 4 figures, submitted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06878 2026-06-08 cs.RO cs.CV 新提交 62%

A Cross-view Fusion Framework for Robust 6-DoF Grasp Pose Estimation

一种用于鲁棒6-DoF抓取姿态估计的跨视图融合框架

Kangjian Zhu, Haobo Jiang, Jianjun Qian, Jin Xie

机构 * Nanjing University of Science and Technology(南京理工大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV、cs.RO

AI总结 提出跨视图融合框架,通过辅助视图缓解遮挡,利用自监督对比学习增强点云特征的空间一致性和方向区分性,并设计跨视图对齐圆柱体集成模块融合抓取相关几何,提升角落视图下的6-DoF抓取姿态估计鲁棒性。

Comments Corresponding author: Jin Xie

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18429 2026-06-23 cs.CV cs.AI cs.LG 新提交 61%

CAOA -- Completion-Assisted Object-CAD Alignment

CAOA -- 补全辅助的物体-CAD对齐

Hiranya Garbha Kumar, Minhas Kamal, Balakrishnan Prabhakaran

机构 * University at Albany(奥尔巴尼大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV;3D vision(journal_ref)

AI总结 提出CAOA方法,结合语义感知点云补全和对称感知相对位姿估计,在Scan2CAD上实现17%精度提升,并发布S2C-Completion数据集。

Comments GitHub: https://github.com/MinhasKamal/CAOA

Journal ref Thirteenth International Conference on 3D Vision (3DV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11578 2026-06-11 cs.CV 新提交 61%

Contactless 3D Human Body Measurement Using Depth Cameras for Smart Health Monitoring

基于深度相机的非接触式3D人体测量用于智能健康监测

Martha Asare, Xuan Wang, Juan Lopez Alvarenga, Lois Akosua Serwaa, Jinghao Yang

机构 * Department of Computer(计算机系) Department of Information(信息系) Department of Human Genetics(人类遗传学系) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 点云 :point cloud(abstract,comments);分类 cs.CV

AI总结 提出一种基于深度相机和3D点云的非接触式人体测量框架,通过空间滤波、地标选择及体素/网格分析实现身高、臂展、体积和表面积等关键指标的准确估计。

Comments 6 pages, 4 figures. Depth camera-based framework for contactless anthropometric measurement and geometric analysis using 3D point clouds

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10594 2026-06-10 cs.CV 新提交 61%

Segment and Select: Vision-Language Segmentation in 3D Scenarios

Segment and Select: 3D场景中的视觉-语言分割

Yulin Chen, Zhihang Zhong, Yuenan Hou

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学)

专题命中 点云 :3D vision(abstract,comments);分类 cs.CV

AI总结 提出SEGA3D范式,通过掩码候选生成器、大语言模型和语义空间选择器实现3D场景中基于语言指令的细粒度分割,在ScanNet和Matterport3D上分别提升8.3和5.3 mIoU。

Comments The core idea is to reformulate 3D vision-language segmentation as the segment-and-select paradigm (free from the superpoint dependency)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14428 2026-08-17 cs.CV 新提交 57%

GhostPoint: Self-Supervised Representation Learning by Hallucinating Occluded LiDAR Structure

GhostPoint:通过幻觉生成被遮挡的激光雷达结构实现自监督表示学习

Mohamed Abdelsamad, Bin Yang, Michael Ulrich, Miao Zhang, Yakov Miron, Alexandru Paul Condurache, Abhinav Valada

机构 * Bosch Center for AI(博世人工智能中心) University of Freiburg(弗莱堡大学) University of Luebeck(吕贝克大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 GhostPoint是一种自监督学习框架,通过实例体素膨胀幻觉生成激光雷达被遮挡区域特征,在nuScenes和Waymo数据集上提升了下游3D检测性能,尤其适用于稀疏扫描和有限标签场景。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14049 2026-08-17 cs.RO 新提交 57%

FlatLab: A Unified Methodology Framework and Simulation-Based Benchmark for Robotic Manipulation of Flat Objects

FlatLab:面向扁平物体机器人操作的统一方法论框架及基于仿真的基准测试

Xingyu Zhu, Wenshuo Han, Zhouyu Wang, Yuran Wang, Ruihai Wu, Hao Dong, Fan Tang, Hechang Chen, Hyung Jin Chang, Yixing Gao

机构 * Jilin University(吉林大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) University of Birmingham(伯明翰大学)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 该研究针对扁平物体机器人操作泛化能力有限的问题,提出含策略生成器与执行模块的统一框架,并构建FlatLab仿真基准,方法泛化效果优于现有基线。

Comments This paper is accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13284 2026-08-14 cs.RO 新提交 57%

Predictive Relative-Velocity Steering for Safe Robotic Manipulator Teleoperation in Dynamic Environments

动态环境下安全机器人操纵器遥操作的预测相对速度转向方法

Changhao Hu, Zeyi Liu, Songqiao Hu, Shuang Liu, Zihan Meng, Xiao He

机构 * Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 针对动态环境下机器人遥操作的安全问题,提出轻量级模块化预测相对速度转向框架,可提升末端执行器避障率并缓解死锁,仿真与物理实验验证了其有效性。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12537 2026-08-14 cs.CV 新提交 57%

Surface-to-Skeleton 3D Cephalometry: Estimating Hidden Skeletal Landmarks from CT-Derived External Soft-Tissue Surfaces

表面到骨骼的3D头影测量:从CT衍生的外部软组织表面估计隐藏的骨骼标志点

Tomoki Abe, Taiki Kanaya, Kazuki Saita, Mao Noda, Chie Tachiki, Yasushi Nishii, Hideo Saito

机构 * Keio University(庆应义塾大学) Tokyo Dental College(东京齿科大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 该研究构建表面到骨骼任务,用集成层次化点云模型从CT衍生外部软组织表面估计隐藏骨骼标志点,在40个留存患者中取得2.97mm的骨骼标志点平均径向误差,证实了隐藏骨骼标志点推断的可行性。

Comments Accepted to AI4M3D Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12148 2026-08-13 cs.GR 新提交 57%

MVFM-3DAD: Multi-view Flow Matching for 3D Anomaly Detection via Density Proxy Estimation

MVFM-3DAD:基于密度代理估计的三维异常检测多视图流匹配方法

Liangwei Li, Lin Liu, Jing Zhang, Xiaohui Du, Ruqian Hao, Xinwei Li, Hanzhe Liang, Juanxiu Liu

专题命中 点云 :point cloud(abstract);分类 cs.GR

AI总结 该研究针对现有三维异常检测方法的局限性,提出MVFM-3DAD框架,将3DAD转化为密度代理估计,在Real3D-AD等数据集上性能优于竞争方法。

Comments ICIG 2026 oral presentation, 13 pages, 3 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11645 2026-08-13 cs.CV 新提交 57%

Cloak of Invisibility: Real-Time Privacy-Preserving Volumetric Video Streaming

隐形斗篷:实时隐私保护的体视频流

Hossein Khalili, Philip Do, Alexander Vilesov, Kittipat Apicharttrisorn, Nader Sehatbakhsh

机构 * University of California Los Angeles(加利福尼亚大学洛杉矶分校) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 针对体视频流的隐私挑战,提出实时源端隐私系统InViStream,结合目标检测与深度感知掩码等技术,在多视角场景中实现高效隐私保护与实时重建,取得优异性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11263 2026-08-13 cs.CV 新提交 57%

GeoUniPR: A Geometry-Consistent Unified Framework for Cross-Modal Place Recognition

GeoUniPR:用于跨模态地点识别的几何一致性统一框架

Wonbong Kim, Jiatong Xiao, Rui Li, Xufei Wang, Qiwen Gu, Junqiao Zhao, Chen Ye, Guang Chen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Research Institute for Intelligent Autonomous System, Tongji University(同济大学上海智能自主系统研究院) Shanghai Innovation Institute(上海创新研究院)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本研究提出GeoUniPR框架,通过构建几何一致性深度图像视图并引入SC-InfoNCE损失,在无需复杂对齐模块的情况下,实现了跨模态地点识别的最优性能与良好泛化能力。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11017 2026-08-12 cs.CV cs.AI cs.HC cs.MM 新提交 57%

R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆

Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng Wang

机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) Shanghai Jiao Tong University(上海交通大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。

Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09997 2026-08-12 cs.LG cs.CV 新提交 57%

Transformer Geometry Observatory TGO-IV: Developmental Topology Observatory

Transformer几何观测站TGO-IV:发展拓扑观测站

Kaustubh Kapil, Kishor P. Upla

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 该研究针对Transformer可解释性研究中表示演变分析的不足,提出基于持续同调的Transformer几何观测站TGO-IV拓扑框架,通过多种拓扑工具全面分析表示点云的全局拓扑演变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07564 2026-08-11 eess.IV cs.AI cs.CV 新提交 57%

Coarse-to-Fine Registration of Jawbone CT and Intraoral Scan Data Using GeDi and ICP with Pseudo-IOS Ground Truth

基于GeDi与ICP及伪口腔扫描数据真值的颌骨CT与口腔扫描数据的由粗到精配准

Sho Mitarai, Hikaru Kayo, Hisashi Ozaki, Yuichiro Imai, Megumi Nakao

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本研究提出伪IOS评估框架,结合GeDi与ICP实现颌骨CT与口腔扫描数据的由粗到精配准,实验表明该方法精度优于单独使用GeDi,且受金属伪影影响较小。

Comments 9 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09590 2026-08-11 cs.CV 新提交 57%

TeaMatch: Teachable Cross-Modal Representation Learning for 2D-3D Matching

TeaMatch:用于2D-3D匹配的可教学跨模态表示学习

Chongjian Wang, Junjie Gao

机构 * Shandong University of Science and Technology(山东科技大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本研究提出TeaMatch框架,将可教学性作为跨模态表示学习准则,提升2D-3D匹配鲁棒性,可无缝集成到现有匹配流水线,在相关基准上实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08701 2026-08-11 cs.RO 新提交 57%

Anchor-Based AI Approach for Pre-Crash Object Detection Utilizing Micro-Doppler Signatures in Automotive Radar

基于锚的人工智能方法:利用汽车雷达中的微多普勒特征进行碰撞前目标检测

Patrick Zaumseil, Rainer Engert, Dagmar Steinhauser, Jonathan Wache, Soumya Dewangan, Thomas Brandmeier

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 该研究提出基于锚的AI模型,结合雷达微多普勒特征与创新雷达图像膨胀技术,提升碰撞前目标检测性能,在动态场景中优于现有汽车雷达跟踪方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07757 2026-08-11 cs.CV 新提交 57%

Rethinking 3D Segmentation from Individual LiDAR Scans: Incidence-Aware Sampling on the SIP Benchmark

从单个激光雷达扫描数据重新思考三维分割:SIP基准上的入射角感知采样

Seongyong Kim, Jingdao Chen, Yong Kwon Cho

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 针对单个激光雷达扫描的三维分割,本研究在SIP基准上提出入射角感知采样策略,提升了非平面构件等的分割性能,降低了对采样分辨率的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07579 2026-08-11 cs.CV cs.AI 新提交 57%

Geometry Beats Estimated Depth: RGB-Only Multi-Camera 3D Tracking under Sim2Real

几何胜过估计深度:Sim2Real 场景下仅用 RGB 的多相机 3D 跟踪

Abdullah Naeem, Anav Katwal, Ayon Dey, Noman Khan, Md Tamjidul Hoque

机构 * LSU New Orleans(路易斯安那州立大学新奥尔良分校) PinPark, Inc.(PinPark公司)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 在 Sim2Real 场景下,研究人员通过实验验证跨视图几何一致性而非单目深度精度决定仅用 RGB 的多相机 3D 跟踪性能,提出几何优先流水线并取得显著优于伪激光雷达方法的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06307 2026-08-07 cs.CV 新提交 57%

UQ-Loc: Uncertainty-Aware LiDAR Scene Coordinate Regression

UQ-Loc:感知不确定性的激光雷达场景坐标回归

Jacek Komorowski

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 UQ-Loc扩展LightLoc架构,添加各向同性高斯协方差头,采用NLL损失结合kNN正则化训练,改进SC2-PCR求解器推理,提升6自由度定位精度并校准不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05804 2026-08-07 cs.CV 新提交 57%

Ordered Diffusion for 3D Human Registration

用于三维人体配准的有序扩散模型

Mattia Masiero, Ilya A. Petrov, Daniel Cremers, Gerard Pons-Moll, Riccardo Marin

机构 * University of Tübingen(蒂宾根大学) Tübingen AI Center(蒂宾根人工智能中心) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本研究针对三维人体配准的不确定性问题,提出ODin模型,将配准建模为三维扩散过程,实现了更优性能并大幅缩短配准时间。

Comments Accepted at GCPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05774 2026-08-07 cs.CV cs.LG 新提交 57%

SR-JEPA: Learning Predictive Latent State in 3D Scenes

SR-JEPA:在3D场景中学习预测性隐状态

Zihan Zhou, Qifu Wen, Xi Zeng

机构 * Boston University(波士顿大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出SR-JEPA,一种面向场景级点云的原生点JEPA,通过仅使用自包含的3D EMA目标训练,在3D场景实体缺失时可查询预测隐状态,在ARKitScenes和Sr3D数据集上取得了良好的语义预测性能,揭示了可组合的3D预测状态。

Comments 17 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05389 2026-08-07 cs.CV 新提交 57%

Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model

基于视觉语言基础模型的文本引导多序列胶质瘤亚区分割细化

Zach Eidex, Yu-nong Lin, Mojtaba Safari, Sean Pitroda, Ralph Weichselbaum, Zhen Tian, Xiaofeng Yang

机构 * Emory University School of Medicine(埃默里大学医学院) The University of Chicago(芝加哥大学) Winship Cancer Institute(温希普癌症研究所)

专题命中 点云 :3D vision(abstract);分类 cs.CV

AI总结 该研究开发基于VoxTell的轻量级框架,用3D视觉语言基础模型实现文本引导的胶质瘤亚区分割细化,在BraTS-GLI及跨数据集测试中提升了分割的DSC指标,支持作为临床医生在环工具的进一步评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03763 2026-08-05 cs.CV 新提交 57%

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架

Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏