arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-07-02 至 2026-07-02 共收录 7
2606.01825 2026-07-02 cs.CV cs.MM 版本更新

ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search

ROGLE: 基于自动区域监督的鲁棒全局-局部对齐用于文本行人搜索

Chaodong Jia, Zequn Xie, Xibei Jia, Sihang Cai, Shulei Wang, Tao Jin

机构 * Zhejiang University(浙江大学)

AI总结 提出ROGLE框架,通过自动区域-句子匹配策略和多重粒度学习,解决文本行人搜索中细粒度对齐不足的问题,并在新基准P-VLG上取得最优性能。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16085 2026-07-02 cs.CV cs.AI 版本更新

Interact3D: Compositional 3D Generation of Interactive Objects

Interact3D: 交互式物体的组合3D生成

Hui Shan, Keyang Luo, Ming Li, Sizhe Zheng, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Adobe Fudan University(复旦大学)

AI总结 提出Interact3D框架,通过统一3D引导场景、两阶段组合流水线(全局到局部几何对齐和基于SDF的优化)以及闭环智能体修正策略,从单张图像生成物理合理的交互式3D组合物体,解决遮挡和空间关系保持问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12056 2026-07-02 cs.AI cs.CL 版本更新

XSkill: Continual Learning from Experience and Skills in Multimodal Agents

XSkill: 多模态智能体中的经验与技能持续学习

Guanyu Jiang, Zhaochen Su, Xiaoye Qu, Yi R. Fung

机构 * Zhejiang University(浙江大学)

AI总结 提出XSkill双流框架,通过视觉经验与技能的知识提取、检索和自适应,实现多模态智能体在开放场景中无需参数更新的持续学习,显著提升工具使用和推理泛化能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18765 2026-07-02 cs.CV cs.AI 版本更新

NI-Tex: Non-isometric Image-based Garment Texture Generation

NI-Tex: 基于非等距图像的服装纹理生成

Hui Shan, Ming Li, Haitao Yang, Kai Zheng, Sizhe Zheng, Yanwei Fu, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学)

AI总结 针对非等距图像与3D服装网格间的纹理生成问题,提出结合物理模拟数据集、非等距图像编辑和迭代烘焙的框架,生成高质量PBR纹理。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12110 2026-07-02 cs.CV cs.AI 版本更新

MediRound: Multi-Round Entity-Level Reasoning Segmentation in Medical Images

MediRound:医学图像中的多轮实体级推理分割

Qinyue Tong, Ziqian Lu, Jun Liu, Rui Zuo, Zheming Lu, Yueming Jin

机构 * Zhejiang University(浙江大学) Zhejiang Sci-Tech University(浙江理工大学) National University of Singapore(新加坡国立大学)

AI总结 提出多轮实体级医学推理分割任务MEMR-Seg,构建大规模数据集MR-MedSeg,并设计基线模型MediRound,通过判断与纠正机制缓解错误传播,在医学教育场景中优于传统方法。

Comments In this version, we have improved some suboptimal expressions in the manuscript and completed the authors' information, such as ORCID IDs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00654 2026-07-02 cs.CV 版本更新

RC-GeoCP: Geometric Consensus for Radar-Camera Collaborative Perception

RC-GeoCP:雷达-相机协同感知的几何一致性

Xiaokai Bai, Lianqing Zheng, Runwei Guan, Siyuan Cao, Songkai Wang, Huiliang Shen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Automotive Studies, Tongji University(同济大学汽车学院) Thrust of Artificial Intelligence, Hong Kong University of Science and Technology(香港科技大学人工智能研究所)

AI总结 提出首个4D雷达与相机协同感知框架RC-GeoCP,通过雷达锚定几何一致性解决深度模糊和空间分散导致的错位,实现高效通信与全局一致表示。

Comments 11 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20857 2026-07-02 cs.RO 版本更新

Multi-Embodiment Robotic Retargeting via Guided Diffusion Model

基于引导扩散模型的多体机器人重定向

Zhefeng Cao, Ben Liu, Shunpeng Yang, Sen Li, Wei Zhang, Hua Chen

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟校区联合学院) LimX Dynamics

AI总结 提出统一图条件扩散框架,利用图结构编码不同机器人拓扑几何特征,通过基于能量的引导损失训练,实现跨异构体的运动重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏