arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-07-02 至 2026-07-02 共收录 19
2607.01222 2026-07-02 cs.CV 新提交

Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models

Ink3D: 通过视频生成模型雕刻具有极其复杂纹理的3D资产

Yue Han, Chong Li, Zhening Liu, Cong Huang, Fang Deng, Yong Liu, Fangyun Wei, Yan Lu

机构 * ZGCA & ZGCI(ZGCA 和 ZGCI) Microsoft Research(微软研究院) Zhejiang University(浙江大学) HKUST(香港科技大学)

AI总结 提出Ink3D框架,利用大规模视频生成模型合成复杂纹理,通过OrbitPainter生成密集轨道扫描视频,并用TextureOptimizer进行神经烘焙以生成一致纹理。

Comments Accepted to ECCV 2026. Project page: https://yuehan99.github.io/Ink3D-TextureGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01191 2026-07-02 cs.CV 新提交

Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

感知到推理:解耦感知与推理用于细粒度视觉推理

Hongxing Li, Xiufeng Huang, Dingming Li, Wenjing Jiang, Zixuan Wang, Haolei Xu, Hanrong Zhang, Haiwen Hong, Longtao Huang, Hui Xue, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 提出Perceive-to-Reason (P2R)框架,将细粒度视觉推理解耦为感知和推理两阶段,并引入PRA-GRPO强化学习策略,在多个高分辨率基准上显著提升性能。

Comments Code: https://github.com/ZJU-REAL/Perceive-to-Reason

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00916 2026-07-02 cs.CV 新提交

Condensing Large-Scale Datasets Directly with Minimal Information Loss

直接以最小信息损失压缩大规模数据集

Xinyi Shang, Peng Sun, Bei Shi, Zixuan Wang, Tao Lin

机构 * University College London(伦敦大学学院) Zhejiang University(浙江大学) Westlake University(西湖大学) University of Macau(澳门大学)

AI总结 针对现有数据集蒸馏方法因隐式双压缩导致信息损失和跨架构泛化差的问题,提出CIM框架,通过直接量化并最小化原始与合成数据集间的信息差距,实现高保真信息压缩,在ImageNet-1K上以IPC=10、80分钟训练达到48.7% Top-1准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00796 2026-07-02 cs.LG 新提交

Task-Relevant Representation Decoupling for Visual Reinforcement Learning Generalization

面向视觉强化学习泛化的任务相关表示解耦

Jinwen Wang, Youfang Lin, Xiaobo Hu, Qian Xu, Shuo Wang, Zhuo Chen, Kai Lv

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence, School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院交通数据挖掘与具身智能北京市重点实验室) CSSC Intelligent Innovation Research Institute(中国船舶集团智能创新研究院) Zhejiang University(浙江大学)

AI总结 提出自监督任务相关表示解耦算法T2RD,通过表示一致性、交叉重建和交叉动态预测分离任务相关与无关特征,在控制任务中实现SOTA泛化性能。

Comments 23 pages, 13 figures

Journal ref ACM Transactions on Multimedia Computing, Communications and Applications (TOMM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00671 2026-07-02 cs.LG cs.AI 新提交

Multi-Label Node Classification with Label Influence Propagation

多标签节点分类中的标签影响传播

Yifei Sun, Zemin Liu, Bryan Hooi, Yang Yang, Rizal Fathony, Jia Chen, Bingsheng He

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Capital One GrabTaxi Holdings Pte. Ltd.(GrabTaxi控股私人有限公司)

AI总结 提出标签影响传播(LIP)模型,通过分解GNN的消息传递为传播和变换操作,量化标签间影响,构建标签影响图传播高阶影响,动态调整学习过程,在多标签节点分类任务上超越现有方法。

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00544 2026-07-02 cs.CV 新提交

GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine

GEAR-Seg:用于推理分割和数据引擎的基于可解释智能体

Yanan Wang, Wen Li, Yibin Ying, Zhenghao Fei

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科创中心)

AI总结 提出GEAR-Seg,一种解耦的智能体框架,通过将像素转换为属性文本实现可解释推理分割,零样本性能优异,并可作为数据引擎构建大规模基准GEAR-131K。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00522 2026-07-02 cs.CV 新提交

Restore3D: Breathing Life into Broken Objects with Shape and Texture Restoration

Restore3D:通过形状和纹理修复为破损物体注入生机

Xiaolong Shen, Zongxin Yang, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学)

AI总结 提出Restore3D框架,利用多视图图像同时修复破损物体的几何形状和纹理,通过自动数据生成、掩码自感知模块和深度感知掩码修正器生成高分辨率多视图图像,再经粗到细重建获得带纹理的3D网格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00491 2026-07-02 cs.CV cs.AI cs.CL 新提交

MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos

MindEdit-Bench:基于野外照片的VLM中对象级反事实空间推理基准

Leyuan Yu, Xiao Tang, Minghao Liu, Xinyuan Li, Xiaokai Bai, Sheng Zhou, Qunshu Lin, Weihao Xuan, Naoto Yokoya

机构 * ZODA Zhejiang University(浙江大学) Tongji University(同济大学) The University of Tokyo(东京大学)

AI总结 提出MindEdit-Bench基准,包含六项空间推理任务,其中两项新任务(L4和L5)测试对象级反事实推理,VLM平均准确率仅8%-31%,远低于人类的81%-97%。

Comments 18 pages, 7 figures. Dataset available at https://huggingface.co/datasets/ZODAOfficial/MindEdit-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00464 2026-07-02 cs.LG cs.CL 新提交

MolSafeEval: A Benchmark for Uncovering Safety Risks in AI-Generated Molecules

MolSafeEval: 揭示AI生成分子安全风险的基准

Tong Xu, Xinzhe Cao, Zhihui Zhu, Keyan Ding, Huajun Chen

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙大-杭州全球科技创新中心) University of Oxford(牛津大学)

AI总结 提出MolSafeEval基准,通过构建分子安全知识图谱和基于大语言模型的推理,系统评估四类分子生成模型的安全风险,揭示当前方法的漏洞。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00588 2026-07-02 cs.CL 新提交

Low Perplexity is Repetition: A One-Dimensional Self-Conditioning Attractor in Continuous Diffusion LMs

低困惑度即重复:连续扩散语言模型中的一维自调节吸引子

Shuai Zhang, Zijie Chen, Hongliang He, Lun Du, Zhenzhong Lan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团)

AI总结 发现连续扩散语言模型(如ELF)的低困惑度源于过度重复,提出一维吸引子机制并设计ACE方法消除重复,提升文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31092 2026-07-02 cs.LG 新提交

Fora: From Weight-Space to Function-Space Protection in Capability-Preserving Fine-Tuning

Fora: 从权重空间到函数空间的保护在保持能力的微调中

Rui Zhou, Tianci Xie

机构 * Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学)

AI总结 提出函数空间保护方法FORA,通过输入激活协方差的主方向投影,在微调中保留模型原有能力,实验表明优于权重空间投影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08492 2026-07-02 cs.CV cs.AI 新提交

Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation

眼见为实:基于视觉锚点的提示重写对齐用于文本到图像生成

Xuanyi Liu, Deyi Ji, Junyu Lu, Jing Wang, Lanyun Zhu, Qianxiong Xu, Xuhang Chen, Tianrun Chen, Siwei Ma

机构 * Peking University(北京大学) Tencent(腾讯) Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学) University of Cambridge(剑桥大学) Zhejiang University(浙江大学)

AI总结 提出FaithRewriter框架,利用多模态大模型生成中间视觉线索,结合大语言模型生成视觉锚定的增强提示,再蒸馏至小模型,以缩小用户意图与生成图像之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01825 2026-07-02 cs.CV cs.MM 版本更新

ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search

ROGLE: 基于自动区域监督的鲁棒全局-局部对齐用于文本行人搜索

Chaodong Jia, Zequn Xie, Xibei Jia, Sihang Cai, Shulei Wang, Tao Jin

机构 * Zhejiang University(浙江大学)

AI总结 提出ROGLE框架,通过自动区域-句子匹配策略和多重粒度学习,解决文本行人搜索中细粒度对齐不足的问题,并在新基准P-VLG上取得最优性能。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16085 2026-07-02 cs.CV cs.AI 版本更新

Interact3D: Compositional 3D Generation of Interactive Objects

Interact3D: 交互式物体的组合3D生成

Hui Shan, Keyang Luo, Ming Li, Sizhe Zheng, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Adobe Fudan University(复旦大学)

AI总结 提出Interact3D框架,通过统一3D引导场景、两阶段组合流水线(全局到局部几何对齐和基于SDF的优化)以及闭环智能体修正策略,从单张图像生成物理合理的交互式3D组合物体,解决遮挡和空间关系保持问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12056 2026-07-02 cs.AI cs.CL 版本更新

XSkill: Continual Learning from Experience and Skills in Multimodal Agents

XSkill: 多模态智能体中的经验与技能持续学习

Guanyu Jiang, Zhaochen Su, Xiaoye Qu, Yi R. Fung

机构 * Zhejiang University(浙江大学)

AI总结 提出XSkill双流框架,通过视觉经验与技能的知识提取、检索和自适应,实现多模态智能体在开放场景中无需参数更新的持续学习,显著提升工具使用和推理泛化能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18765 2026-07-02 cs.CV cs.AI 版本更新

NI-Tex: Non-isometric Image-based Garment Texture Generation

NI-Tex: 基于非等距图像的服装纹理生成

Hui Shan, Ming Li, Haitao Yang, Kai Zheng, Sizhe Zheng, Yanwei Fu, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学)

AI总结 针对非等距图像与3D服装网格间的纹理生成问题,提出结合物理模拟数据集、非等距图像编辑和迭代烘焙的框架,生成高质量PBR纹理。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12110 2026-07-02 cs.CV cs.AI 版本更新

MediRound: Multi-Round Entity-Level Reasoning Segmentation in Medical Images

MediRound:医学图像中的多轮实体级推理分割

Qinyue Tong, Ziqian Lu, Jun Liu, Rui Zuo, Zheming Lu, Yueming Jin

机构 * Zhejiang University(浙江大学) Zhejiang Sci-Tech University(浙江理工大学) National University of Singapore(新加坡国立大学)

AI总结 提出多轮实体级医学推理分割任务MEMR-Seg,构建大规模数据集MR-MedSeg,并设计基线模型MediRound,通过判断与纠正机制缓解错误传播,在医学教育场景中优于传统方法。

Comments In this version, we have improved some suboptimal expressions in the manuscript and completed the authors' information, such as ORCID IDs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00654 2026-07-02 cs.CV 版本更新

RC-GeoCP: Geometric Consensus for Radar-Camera Collaborative Perception

RC-GeoCP:雷达-相机协同感知的几何一致性

Xiaokai Bai, Lianqing Zheng, Runwei Guan, Siyuan Cao, Songkai Wang, Huiliang Shen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Automotive Studies, Tongji University(同济大学汽车学院) Thrust of Artificial Intelligence, Hong Kong University of Science and Technology(香港科技大学人工智能研究所)

AI总结 提出首个4D雷达与相机协同感知框架RC-GeoCP,通过雷达锚定几何一致性解决深度模糊和空间分散导致的错位,实现高效通信与全局一致表示。

Comments 11 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20857 2026-07-02 cs.RO 版本更新

Multi-Embodiment Robotic Retargeting via Guided Diffusion Model

基于引导扩散模型的多体机器人重定向

Zhefeng Cao, Ben Liu, Shunpeng Yang, Sen Li, Wei Zhang, Hua Chen

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟校区联合学院) LimX Dynamics

AI总结 提出统一图条件扩散框架,利用图结构编码不同机器人拓扑几何特征,通过基于能量的引导损失训练,实现跨异构体的运动重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏