arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

2026-04-01 至 2026-04-01 共收录 31 信号源:cs.CV, cs.GR, cs.RO

1. 三维重建 5 篇

2507.11539 2026-04-01 cs.CV cs.AI cs.LG 70%

Streaming 4D Visual Geometry Transformer

流式4D视觉几何变换器

Dong Zhuo, Wenzhao Zheng, Jiahe Guo, Yuqi Wu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 三维重建 :3D vision(abstract);3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出一种流式视觉几何变换器,通过因果变换器架构实现低延迟的4D视觉几何重建,结合知识蒸馏和高效注意力机制,提升在线场景下的推理速度与重建质量。

Comments Code is available at: https://github.com/wzzheng/StreamVGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29847 2026-04-01 cs.GR cs.CV cs.HC 62%

CADReasoner: Iterative Program Editing for CAD Reverse Engineering

CADReasoner: 用于CAD逆向工程的迭代程序编辑

Soslan Kabisov, Vsevolod Kirichuk, Andrey Volkov, Gennadii Savrasov, Marina Barannikov, Anton Konushin, Andrey Kuznetsov, Dmitrii Zhemchuzhnikov

机构 * Lomonosov Moscow State University(莫斯科国立大学) Université Paris Dauphine(巴黎多芬大学) Innopolis University(因诺波利斯大学) FusionBrain Lab(FusionBrain实验室)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV、cs.GR

AI总结 CADReasoner通过迭代优化几何差异,提升CAD逆向工程的精度与效率,实现多视角渲染与点云的融合,并在多个基准测试中取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30045 2026-04-01 cs.CV 57%

OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation

OmniRoam:通过长视界全景视频生成实现世界漫游

Yuheng Liu, Xin Lin, Xinke Li, Baihan Yang, Chen Wang, Kalyan Sunkavalli, Yannick Hold-Geoffroy, Hao Tan, Kai Zhang, Xiaohui Xie, Zifan Shi, Yiwei Hu

机构 * University of California, Irvine(加州大学尔湾分校) University of California, San Diego(加州大学圣地亚哥分校) City University of Hong Kong(香港城市大学) University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe研究院)

专题命中 三维重建 :3D reconstruction(abstract);分类 cs.CV

AI总结 本文提出OmniRoam框架,利用全景视频生成实现长视界场景漫游,通过预览和精炼阶段提升视频质量和一致性,实验表明其在视觉质量、可控性和长期一致性方面优于现有方法。

Comments Code is available at https://github.com/yuhengliu02/OmniRoam

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01142 2026-04-01 cs.CV 57%

ArtLLM: Generating Articulated Assets via 3D LLM

ArtLLM: 通过3D语言模型生成拟合资产

Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学)

专题命中 三维重建 :point cloud(abstract);分类 cs.CV

AI总结 ArtLLM通过3D语言模型直接从完整3D网格生成高质量拟合资产,解决了传统方法在关节拟合和部分检索中的局限,提升了部分布局和关节预测的准确性。

Comments CVPR 2026. Project page: https://authoritywang.github.io/artllm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09082 2026-04-01 cs.CV cs.AI cs.LG 57%

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

AVA-Bench:用于视觉基础模型的原子视觉能力基准

Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院) Boston University(波士顿大学)

专题命中 三维重建 :spatial understanding(abstract);分类 cs.CV

AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。

Comments Accepted by CVPR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏

2. NeRF 1 篇

2602.23574 2026-04-01 cs.CV cs.AI cs.LG 70%

Evidential Neural Radiance Fields

可信神经辐射场

Ruxiao Duan, Alex Wong

机构 * Yale University(耶鲁大学)

专题命中 NeRF :NeRF(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出可信神经辐射场,通过单次前向传递直接量化aleatoric和epistemic不确定性,提升三维场景建模的可靠性与精度。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Gaussian Splatting 7 篇

2603.29394 2026-04-01 cs.CV 87%

AA-Splat: Anti-Aliased Feed-forward Gaussian Splatting

AA-Splat:抗锯齿前馈高斯点划

Taewoo Suh, Sungpyo Kim, Jongmin Park, Munchurl Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);3D reconstruction(abstract);novel view synthesis(abstract)

AI总结 AA-Splat通过引入OBBL设计,解决FF-3DGS在非分布采样下的渲染问题,实现任意分辨率的鲁棒抗锯齿渲染,相比DepthSplat在NVS性能上提升5.4-7.5dB。

Comments Please visit our project page at https://kaist-viclab.github.io/aasplat-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27516 2026-04-01 cs.CV 83%

SGS-Intrinsic: Semantic-Invariant Gaussian Splatting for Sparse-View Indoor Inverse Rendering

SGS-Intrinsic: 语义不变的高斯点散布用于稀疏视角室内逆向渲染

Jiahao Niu, Rongjia Zheng, Wenju Xu, Wei-Shi Zheng, Qing Zhang

机构 * Sun Yat-sen University(中山大学) Amazon(亚马逊) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);分类 cs.CV

AI总结 SGS-Intrinsic通过构建语义和几何先验引导的密集高斯语义场,实现高精度几何重建和材料光照分离,提升稀疏视角下的逆向渲染质量。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29209 2026-04-01 cs.CV 83%

LightHarmony3D: Harmonizing Illumination and Shadows for Object Insertion in 3D Gaussian Splatting

LightHarmony3D:在3D高斯散射场景中和谐光照与阴影以实现物体插入

Tianyu Huang, Zhenyang Ren, Zhenchen Wan, Jiyang Zheng, Wenjie Wang, Runnan Chen, Mingming Gong, Tongliang Liu

机构 * The University of Sydney(悉尼大学) The University of Melbourne(墨尔本大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);3DGS(abstract);分类 cs.CV

AI总结 本文提出LightHarmony3D框架,通过生成模块预测HDR环境映射,实现光照一致的物体插入,提升3D高斯散射场景的光照和阴影真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29296 2026-04-01 cs.CV 79%

MotionScale: Reconstructing Appearance, Geometry, and Motion of Dynamic Scenes with Scalable 4D Gaussian Splatting

MotionScale:通过可扩展的4D高斯点划法重建动态场景的外观、几何和运动

Haoran Zhou, Gim Hee Lee

机构 * National University of Singapore(新加坡国立大学)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出MotionScale框架,通过可扩展的4D高斯点划法实现动态场景的高保真重建,解决复杂环境中3D几何和时间一致运动的恢复问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29185 2026-04-01 cs.CV 79%

Hierarchical Visual Relocalization with Nearest View Synthesis from Feature Gaussian Splatting

基于特征高斯点云的层次视觉重定位

Huaqi Tao, Bingxi Liu, Guangcheng Chen, Fulin Tang, Li He, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 Gaussian Splatting :Gaussian Splatting(title,abstract);分类 cs.CV

AI总结 本文提出SplatHLoc框架,利用特征高斯点云进行层次视觉重定位,通过自适应视角检索和混合特征匹配提升重定位精度与鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29192 2026-04-01 cs.RO 70%

Efficient Camera Pose Augmentation for View Generalization in Robotic Policy Learning

高效的相机姿态增强用于机器人策略学习中的视角泛化

Sen Wang, Huaiyi Dong, Jingyi Tian, Jiayi Li, Zhuo Yang, Tongtong Cao, Anlin Chen, Shuang Wu, Le Wang, Sanping Zhou

机构 * Xi'an Jiaotong University(西安交通大学) Noah's Ark Lab(诺亚方舟实验室)

专题命中 Gaussian Splatting :Gaussian Splatting(abstract);3DGS(abstract);分类 cs.RO

AI总结 本文提出GenSplat框架,通过新颖视角渲染实现视角泛化的策略学习,利用3D高斯点云重建和3D先验蒸馏策略,增强策略在空间扰动下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12766 2026-04-01 cs.CV 70%

Catalyst4D: High-Fidelity 3D-to-4D Scene Editing via Dynamic Propagation

Catalyst4D: 通过动态传播实现高保真的3D到4D场景编辑

Shifeng Chen, Yihui Li, Jun Liao, Hongyu Yang, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Zhejiang Industrial Big Data and Robot Intelligent System Key Laboratory, Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院浙江省工业大数据与机器人智能系统重点实验室)

专题命中 Gaussian Splatting :NeRF(abstract);3DGS(abstract);分类 cs.CV

AI总结 本文提出Catalyst4D框架,通过动态传播实现高保真的4D场景编辑,保持时空一致性,优于现有方法。

Comments https://junliao2025.github.io/Catalyst4D-ProjectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 点云 9 篇

2603.25165 2026-04-01 cs.CV 79%

Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds

迈向3D场景理解的基础模型:点云的实例感知自监督学习

Bin Yang, Mohamed Abdelsamad, Miao Zhang, Alexandru Paul Condurache

机构 * Bosch Research, Robert Bosch GmbH(博世研究,罗伯特·博世有限公司) Institute for Neuro- and Bioinformatics, University of Lübeck(神经与生物信息学研究所,吕贝克大学)

专题命中 点云 :point cloud(title,abstract);分类 cs.CV

AI总结 本文提出PointINS框架,通过几何感知学习增强点云表示,引入ODR和SCR正则化策略,提升实例定位性能,在多个数据集上实现更优的mAP和PQ指标。

Comments The paper was accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29822 2026-04-01 eess.SP 78%

Conditional Diffusion-Based Point Cloud Imaging for UAV Position and Attitude Sensing

基于条件扩散的点云成像用于无人机位置和姿态感知

Xinhong Dai, Yuan Gao, Hao Jiang, Xiaojun Yuan, Xin Wang

专题命中 点云 :point cloud(title,abstract)

AI总结 本文提出一种基于条件扩散模型的点云成像方法,用于无人机位置和姿态感知,通过电磁点云提取无人机的空间信息和电磁特性,提升成像精度和姿态识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12194 2026-04-01 cs.RO 57%

UniLGL: Learning Uniform Place Recognition for FOV-limited/Panoramic LiDAR Global Localization

UniLGL:学习适用于视场受限/全景激光雷达全局定位的统一地方识别

Hongming Shen, Xun Chen, Yulin Hui, Zhenyu Wu, Wei Wang, Qiyang Lyu, Tianchen Deng, Danwei Wang

机构 * School of Automation, Hangzhou Dianzi University(杭州电子科技大学自动化学院)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 UniLGL通过编码完整点云生成空间和材质均匀性,结合多BEV融合网络实现统一特征提取,引入视角不变假设提升异构激光雷达的鲁棒性,最终在真实环境中验证了其在高精度定位与多无人机协同探索中的有效性。

Journal ref IEEE TRANSACTIONS ON ROBOTICS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06874 2026-04-01 cs.CV 57%

MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

MVGGT:多模态视觉几何 grounded 变换器用于多视角3D指称表达分割

Changli Wu, Haodong Wang, Jiayi Ji, Yutian Yao, Chunsai Du, Jihua Kang, Yanwei Fu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ByteDance(字节跳动) Tianjin University of Science and Technology(天津科技大学)

专题命中 点云 :point cloud(abstract);分类 cs.CV

AI总结 本文提出MVGGT,一种高效的端到端框架,通过双分支设计将语言信息整合到稀疏视角的几何推理中,解决稀疏视角下的优化障碍,建立首个强基线,实现高精度和快速推理。

Comments Accepted to CVPR 2026; Project Website: https://mvggt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06285 2026-04-01 cs.RO 57%

DCReg: Decoupled Characterization for Efficient Degenerate LiDAR Registration

DCReg: 用于高效退化LiDAR配准的解耦表征

Xiangcheng Hu, Xieyuanli Chen, Mingkai Jia, Jin Wu, Ping Tan, Steven L. Waslander

机构 * Hong Kong University of Science and Technology(香港科技大学) National University of Defense Technology(国防科技大学) University of Science and Technology Beijing(北京科技大学) University of Toronto(多伦多大学)

专题命中 点云 :point cloud(abstract);分类 cs.RO

AI总结 本文提出DCReg方法,通过解耦配准问题中的退化因素,提高配准稳定性与精度,实验显示在多种环境中实现更高的定位精度和更快的计算速度。

Comments 27 pages, 19 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29187 2026-04-01 cs.NI 50%

Needle in a Haystack: Tracking UAVs from Massive Noise in Real-World 5G-A Base Station Data

在5G-A基站数据中寻找飞鸟:从海量噪声中跟踪无人机

Chengzhen Meng, Chenming He, Yidong Jiang, Xiaoran Fan, Dequan Wang, Lingyu Wang, Jianmin Ji, Yanyong Zhang

专题命中 点云 :point cloud(abstract)

AI总结 本文提出BSense系统,利用商业5G-A基站点云数据实现无人机跟踪,通过多层框架过滤噪声,提升检测准确率和定位精度。

Comments 14 pages, 26 figures, to appear in ACM MobiSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29072 2026-04-01 cond-mat.stat-mech cs.LG math.AT 50%

How much of persistent homology is topology? A quantitative decomposition for spin model phase transitions

持久同调中有多大成分是拓扑学?用于铁磁模型相变的定量分解

Matthew Loftus

机构 * Cedar Loop LLC

专题命中 点云 :point cloud(abstract)

AI总结 本文通过引入f_topo指标,定量分解持久同调信号中拓扑成分的比例,发现H_1统计量在系统规模增大时具有拓扑特征,而H_0统计量主要受密度驱动。

Comments 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03520 2026-04-01 math.NA cs.NA 50%

Model order reduction via Lie groups

通过李群进行模型降阶

Yannik P. Wotte, Patrick Buchfink, Silke Glas, Federico Califano, Stefano Stramigioli

专题命中 点云 :point cloud(abstract)

AI总结 本文提出基于李群的模型降阶框架MORLie,用于近似高维流形动力系统,能处理非等变动力学并提供新的非侵入性方法,实验显示其误差界低于Kolmogorov N-宽度,适用于多种应用。

Comments 25 pages, 22 figures

Journal ref Communications in Nonlinear Science and Numerical Simulation, Volume 160, 2026, 109973, ISSN 1007-5704

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16706 2026-04-01 cs.CR 50%

Rotation, Scale, and Translation Resilient Black-box Fingerprinting for Intellectual Property Protection of EaaS Models

旋转、缩放和翻译鲁棒的黑盒指纹识别用于EaaS模型知识产权保护

Hongjie Zhang, Zhiqi Zhao, Hanzhou Wu, Zhihua Xia, Athanasios V. Vasilakos

专题命中 点云 :point cloud(abstract)

AI总结 本文提出一种针对EaaS模型的鲁棒黑盒指纹识别框架,通过嵌入空间拓扑结构的几何分析实现模型所有权验证,克服了传统水印方法在RST攻击下的脆弱性。

Journal ref IEEE Transactions on Dependable and Secure Computing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 新视角合成 2 篇

2603.29734 2026-04-01 cs.CV 70%

GRVS: a Generalizable and Recurrent Approach to Monocular Dynamic View Synthesis

GRVS:一种通用且递归的方法用于单目动态视图合成

Thomas Tanay, Mohammed Brahimi, Michal Nazarczuk, Qingwen Zhang, Sibi Catley-Chandar, Arthur Moreau, Zhensong Zhang, Eduardo Pérez-Pellitero

专题命中 新视角合成 :Gaussian Splatting(abstract);novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出GRVS方法,通过递归循环和动态输入平面扫描,实现高精度的单目动态视图合成,优于现有多种基于高斯点划和扩散的方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29022 2026-04-01 cs.CV 57%

UltraG-Ray: Physics-Based Gaussian Ray Casting for Novel Ultrasound View Synthesis

UltraG-Ray:基于物理的高斯射线投射用于新型超声成像合成

Felix Duelmer, Jakob Klaushofer, Magdalena Wysocki, Nassir Navab, Mohammad Farid Azampour

机构 * Chair for Computer Aided Medical Procedures (CAMP), Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序教席) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 新视角合成 :novel view synthesis(abstract);分类 cs.CV

AI总结 本文提出UltraG-Ray,通过学习3D高斯场和物理模块生成更真实的超声B模图像,提升成像真实性与质量。

Comments Accepted at MIDL 2026 / to appear in PMLR

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 3D生成 5 篇

2603.18782 2026-04-01 cs.CV cs.AI 88%

Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priors

Points-to-3D: 基于点云先验的结构感知3D生成

Jiatong Xia, Zicheng Duan, Anton van den Hengel, Lingqiao Liu

机构 * Australian Institute for Machine Learning, University of Adelaide, Australia(澳大利亚阿德莱德大学澳大利亚机器学习研究所)

专题命中 3D生成 :point cloud(title,abstract);3D generation(title,abstract);分类 cs.CV

AI总结 本文提出Points-to-3D框架,利用点云先验生成可控的3D资产和场景,通过结构修复网络和分阶段采样策略提升几何精度和渲染质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29387 2026-04-01 cs.CV cs.AI 83%

Extend3D: Town-Scale 3D Generation

Extend3D:城镇级3D生成

Seungwoo Yoon, Jinmo Kim, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 3D生成 :3D generation(title,abstract);point cloud(abstract);分类 cs.CV

AI总结 本文提出Extend3D,一种无需训练的3D场景生成方法,通过扩展潜在空间并结合SDEdit实现3D补全与优化。

Comments CVPR 2026, Project Page: http://seungwoo-yoon.github.io/extend3d-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29592 2026-04-01 cs.GR cs.CV 73%

Bioinspired123D: Generative 3D Modeling System for Bioinspired Structures

生物启发123D:用于生物启发结构的生成3D建模系统

Rachel K. Luu, Markus J. Buehler

专题命中 3D生成 :point cloud(abstract);3D generation(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Bioinspired123D,一种轻量级模块化代码-几何管道,通过参数化程序直接生成可制造的3D结构,而非密集视觉表示。系统基于生物启发3D模型,结合多模态检索增强生成和视觉-语言模型批评者,实现了高效的文本到3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12052 2026-04-01 cs.CV cs.GR 73%

A Text-to-3D Framework for Joint Generation of CG-Ready Humans and Compatible Garments

为生成兼容服装的CG-ready人类和服装联合生成的文本到3D框架

Zhiyao Sun, Yu-Hui Wen, Ho-Jui Fang, Sheng Ye, Matthieu Lin, Tian Lv, Yong-Jin Liu

专题命中 3D生成 :NeRF(abstract);3DGS(abstract);分类 cs.CV、cs.GR

AI总结 本文提出Tailor框架,通过语义解析、几何感知服装生成和一致纹理合成,实现高保真定制3D人像和物理兼容服装,优于现有方法。

Comments Project page: https://human-tailor.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29089 2026-04-01 cs.CV cs.AI cs.GR 62%

WorldFlow3D: Flowing Through 3D Distributions for Unbounded World Generation

WorldFlow3D: 通过3D分布流动实现无界世界生成

Amogh Joshi, Julian Ost, Felix Heide

机构 * Princeton University(普林斯顿大学) Torc Robotics

专题命中 3D生成 :3D generation(abstract);分类 cs.CV、cs.GR

AI总结 WorldFlow3D通过流动3D分布生成无界3D世界,具备快速收敛、高精度结构与纹理生成能力,并在真实和合成场景中验证了跨领域泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 空间理解 1 篇

2512.00818 2026-04-01 cs.AI cs.CV 57%

Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning

Med-CMR:一个整合视觉证据和临床逻辑的细粒度基准,用于医疗复杂多模态推理

Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jiangning Zhang, Xiaobin Hu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Tongji University(同济大学) Ruijin Hospital(瑞金医院) Technical University of Munich(慕尼黑工业大学) Zhejiang University(浙江大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 Med-CMR通过细粒度分解医疗多模态推理能力,设计挑战性任务并覆盖广泛高质量数据,评估18种先进大语言模型,发现GPT-5在多项选择题和开放性评分中表现最佳,但专业医疗大语言模型并不总能超越强通用模型,长尾泛化成为主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏