arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Zhejiang University(浙江大学)

2026-03-18 至 2026-03-18 共收录 10
2603.16844 2026-03-18 cs.CV

M^3: Dense Matching Meets Multi-View Foundation Models for Monocular Gaussian Splatting SLAM

M^3:密集匹配与多视角基础模型结合的单目高斯点云SLAM

Kerui Ren, Guanghao Li, Changjian Jiang, Yingxiang Xu, Tao Lu, Linning Xu, Junting Dong, Jiangmiao Pang, Mulin Yu, Bo Dai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 本文提出M^3,结合多视角基础模型与单目高斯点云SLAM,通过引入匹配头提升密集对应关系,增强跟踪稳定性,在多种基准上取得优异的位姿估计和场景重建性能。

Comments Project page: https://city-super.github.io/M3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16781 2026-03-18 cs.CV cs.AI

IOSVLM: A 3D Vision-Language Model for Unified Dental Diagnosis from Intraoral Scans

IOSVLM:一种用于从牙科内窥扫描进行统一牙科诊断的3D视觉-语言模型

Huimin Xiong, Zijie Meng, Tianxiang Hu, Chenyi Zhou, Yang Feng, Zuozhu Liu

机构 * ZJU-UIUC Institute, Zhejiang University, Haining, 314400, China(浙大浙ICU研究所,浙江大学,海宁,314400,中国) Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine, Hangzhou, 310058, China(口腔医院,口腔医学院,浙江大学医学院,杭州,310058,中国) Angelalign Research Institute, Angel Align Inc., Shanghai, 200011, China(天使对齐研究院,天使对齐公司,上海,200011,中国)

AI总结 本文提出IOSVLM,一种端到端的3D视觉-语言模型,利用点云表示内窥扫描,并结合大规模多源数据集,提升牙科诊断和生成式视觉问答的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13856 2026-03-18 cs.LG cs.CV

OrigamiBench: An Interactive Environment to Synthesize Flat-Foldable Origamis

OrigamiBench: 一个用于合成可折叠折纸的交互环境

Naaisha Agarwal, Yihan Wu, Yichang Jian, Yikuan Hu, Nishad Mansoor, Mohan Li, Yifei Peng, Wang-Zhou Dai, Yao-Xiang Ding, Emanuele Sansone

机构 * Independent Researcher(独立研究者) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与计算机图形学国家重点实验室) Computer Science Northeastern University(东北大学计算机科学系) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) CSAIL / ESAT MIT / KU Leuven(MIT / KU Leuven)

AI总结 OrigamiBench通过交互式环境测试模型在折叠策略中的因果推理能力,发现单纯扩大模型规模无法有效生成多步骤折叠策略,表明视觉与语言表征仍需加强整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16341 2026-03-18 cs.CV

PKINet-v2: Towards Powerful and Efficient Poly-Kernel Remote Sensing Object Detection

PKINet-v2: 向强大且高效的多核遥感目标检测迈进

Xinhao Cai, Liulei Li, Gensheng Pei, Zeren Sun, Yazhou Yao, Wenguan Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) State Key Lab. of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室)

AI总结 本文提出PKINet-v2,通过统一的多核卷积框架解决遥感图像中几何与空间复杂性的挑战,提升检测精度与效率,实验表明其在多个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16306 2026-03-18 cs.CV

DriveFix: Spatio-Temporally Coherent Driving Scene Restoration

DriveFix:时空一致的驾驶场景修复

Heyu Si, Brandon James Denis, Muyang Sun, Dragos Datcu, Yaoru Li, Xin Jin, Ruiju Fu, Yuliia Tatarinova, Federico Landi, Jie Song, Mingli Song, Qi Guo

机构 * Zhejiang University(浙江大学) Huawei(华为)

AI总结 DriveFix提出一种多视角修复框架,通过交错扩散变换器架构和几何感知损失,实现驾驶场景时空一致性,提升4D世界建模的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16139 2026-03-18 cs.CV

Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training

重新思考UMM视觉生成:面向高效图像-only预训练的掩码建模

Peng Sun, Jun Xie, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学)

AI总结 本文提出IOMM框架,通过两阶段训练提升UMM视觉生成效率与性能,实验显示其在GenEval和WISE上优于现有基线。

Comments https://github.com/LINs-lab/IOMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06289 2026-03-18 cs.CV

FlowMotion: Training-Free Flow Guidance for Video Motion Transfer

FlowMotion: 无需训练的视频运动迁移流动引导

Zhen Wang, Youcan Xu, Jun Xiao, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) State key lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文提出FlowMotion,一种无需训练的视频运动迁移框架,通过直接利用基于流动的T2V模型预测输出,实现高效灵活的运动迁移。通过提取潜在预测的运动表示,对齐源视频与生成视频的运动模式,并引入速度正则化策略以稳定优化。

Comments CVPR 2026, Code: https://github.com/HKUST-LongGroup/FlowMotion

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01953 2026-03-18 cs.RO cs.AI cs.CV

Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy

闭环动作块与动态修正的训练无关扩散策略

Pengyuan Wu, Pingrui Zhang, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Institute of Artificial Intelligence, China Telecom Corp Ltd(中国电信人工智能研究院)

AI总结 本文提出DCDP框架,结合动作块生成与实时修正,提升动态场景下的适应性,无需重新训练,计算量仅增加5%,在动态PushT模拟中适应性提升19%。

Comments Accepted by ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26683 2026-03-18 cs.CL cs.AI

Evontree: Ontology Rule-Guided Self-Evolution of Large Language Models

Evontree:基于本体规则的大型语言模型自进化

Mingchen Tu, Zhiqiang Liu, Juan Li, Liangyurui Liu, Junjie Wang, Lei Liang, Wen Zhang

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Ant Group(蚂蚁集团)

AI总结 本文提出Evontree方法,通过提取领域本体知识、检测不一致性和自蒸馏微调,提升低资源专业领域LLM的自进化能力,实验表明其在医疗问答基准上准确率提升达3.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18229 2026-03-18 cs.CV

Unbiased Object Detection Beyond Frequency with Visually Prompted Image Synthesis

超越频率的无偏目标检测:基于视觉提示的图像合成

Xinhao Cai, Liulei Li, Gensheng Pei, Tao Chen, Jinshan Pan, Yazhou Yao, Wenguan Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室)

AI总结 本文提出基于生成的去偏框架,通过视觉提示图像合成解决目标检测中的偏见问题,改进了稀有类别的性能,提升了生成图像的布局准确性。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏