arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Zhejiang University(浙江大学)

2026-03-24 至 2026-03-24 共收录 22
2603.22228 2026-03-24 cs.CV cs.AI

SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性

Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22102 2026-03-24 cs.CV cs.GR cs.RO

FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenario

FreeArtGS: 自由移动场景下的关节高斯溅射重建

Hang Dai, Hongwei Fan, Han Zhang, Duojin Wu, Jiyao Zhang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机科学系,北京大学CFCS) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) PrimeBot

AI总结 FreeArtGS通过自由移动部分分割、关节估计和端到端优化,实现高可扩展性的自由移动关节物体重建,实验表明其在真实资产生成中具有实用性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21701 2026-03-24 cs.CV cs.AI

Rethinking Token Reduction for Large Vision-Language Models

重新思考大型视觉-语言模型中的标记缩减

Yi Wang, Haofei Zhang, Qihan Huang, Anda Cao, Gongfan Fang, Wei Wang, Xuan Jin, Jie Song, Mingli Song, Xinchao Wang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) School of Software Technology, Zhejiang University(浙江大学软件学院) National University of Singapore(新加坡国立大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出MetaCompress,一种基于学习的无提示方法,解决多轮视觉问答中标记缩减的挑战,通过统一压缩映射提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21647 2026-03-24 cs.CV cs.LG

FedCVU: Federated Learning for Cross-View Video Understanding

FedCVU: 联邦学习用于跨视图视频理解

Shenghan Zhang, Run Ling, Ke Cao, Ao Ma, Zhanjie Zhang

机构 * Software College, Northeastern University, Shenyang, China(东北大学软件学院) University of Science and Technology of China, Hefei, China(中国科学技术大学) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Zhejiang University, Hangzhou, China(浙江大学)

AI总结 FedCVU通过VS-Norm、CV-Align和SLA解决联邦学习在跨视图视频理解中的异质视角、分布偏差和通信开销问题,提升未见视角性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21520 2026-03-24 cs.CL

Generalizable Self-Evolving Memory for Automatic Prompt Optimization

通用可推广的自我进化记忆用于自动提示优化

Guanbao Liang, Yuanchen Bei, Sheng Zhou, Yuheng Qin, Huan Zhou, Bingxin Jia, Bin Li, Jiajun Bu

机构 * Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Alibaba Group(阿里巴巴集团)

AI总结 本文提出MemAPO框架,通过双记忆机制积累可推广的提示经验,提升提示优化的泛化能力和持续改进能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19610 2026-03-24 cs.CV

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

ParallelVLM: 无损视频-大语言模型加速与视觉对齐感知并行推测解码

Quan Kong, Yuhao Shen, Yicheng Ji, Huan Li, Cong Wang

机构 * Zhejiang University(浙江大学)

AI总结 ParallelVLM通过并行化阶段和无偏验证器引导剪枝策略,有效提升视频理解任务的解码效率,实现3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17775 2026-03-24 cs.CL cs.AI cs.LG

CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution

CoVerRL: 通过生成器-验证器共进化打破无标签推理中的共识陷阱

Teng Pan, Yuchen Yan, Zixuan Wang, Ruiqing Zhang, Guiyang Hou, Wenqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen

机构 * Zhejiang University(浙江大学) Baidu Inc.(百度公司)

AI总结 CoVerRL通过生成器-验证器共进化机制,解决无标签强化学习中因自洽性最大化导致输出多样性下降的问题,提升数学推理能力。

Comments Project Page: https://zju-real.github.io/CoVerRL Code: https://github.com/ZJU-REAL/CoVerRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04090 2026-03-24 cs.CV

Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction

Gen3R:3D场景生成与前馈重建的结合

Jiaxin Huang, Yuanbo Yang, Bangbang Yang, Lin Ma, Yuewen Ma, Yiyi Liao

机构 * Zhejiang University(浙江大学) ByteDance Project(字节跳动项目)

AI总结 Gen3R通过结合基础重建模型的强先验与视频扩散模型,实现3D场景生成,生成RGB视频及3D几何数据,实验显示其在单图和多图条件下达到SOTA结果。

Comments Project page: https://xdimlab.github.io/Gen3R/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04619 2026-03-24 cs.CV

Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence

去噪以跟踪:利用视频扩散先验进行鲁棒对应

Tianyu Yuan, Yuanbo Yang, Lin-Zhuo Chen, Yao Yao, Zhuzhong Qian

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

AI总结 本文提出HeFT框架,利用预训练视频扩散模型的视觉先验进行零样本点跟踪,通过分析内部表示揭示注意力头在匹配、语义理解和位置编码中的不同专长,并提出基于头和频率的特征选择策略提升跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21138 2026-03-24 cs.CV

Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues

通过视觉提示的成果-奖励强化学习激励生成零样本学习

Wenjin Hou, Xiaoxiao Sun, Hehe Fan

机构 * CCAI, Zhejiang University(浙江大学计算机辅助设计与计算机图形学国家重点实验室) Stanford University(斯坦福大学) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与计算机图形学国家重点实验室)

AI总结 本文提出RLVC框架,通过强化学习和视觉提示提升生成零样本学习的性能,实验显示在三个基准上取得state-of-the-art结果,提升4.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20911 2026-03-24 cs.AI cs.CY

Do LLM-Driven Agents Exhibit Engagement Mechanisms? Controlled Tests of Information Load, Descriptive Norms, and Popularity Cues

基于大语言模型的智能体是否表现出参与机制?信息负荷、描述性规范和流行度线索的受控测试

Tai-Quan Peng, Yuan Tian, Songsong Liang, Dazhen Deng, Yingcai Wu

机构 * Department of Communication, Michigan State University(密歇根州立大学通讯系) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院)

AI总结 本文通过社交媒体信息负荷和描述性规范的受控实验,探讨基于大语言模型的智能体参与机制,发现参与度受信息负荷和规范影响,流行度线索的敏感性因情境而异,强调方法论对模拟通信研究的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20857 2026-03-24 cs.CV cs.GR

Fast and Robust Deformable 3D Gaussian Splatting

快速且鲁棒的可变形3D高斯点散布

Han Jiao, Jiakai Sun, Lei Zhao, Zhanjie Zhang, Wei Xing, Huaizhong Lin

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文提出FRoG框架,通过粗到细的时间嵌入策略和深度误差引导采样提升动态场景重建的效率与鲁棒性,实现高速渲染和高质量视觉效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20842 2026-03-24 cs.LG

A Knowledge-Informed Pretrained Model for Causal Discovery

基于知识的因果发现预训练模型

Wenbo Xu, Yue He, Yunhai Wang, Xingxuan Zhang, Kun Kuang, Yueguo Chen, Peng Cui

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

AI总结 本文提出一种整合弱先验知识的因果发现预训练模型,通过双源编码器-解码器架构和多样预训练数据集,提升模型在不同先验强度下的适应能力,实验显示在分布内、分布外及现实数据集上均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20669 2026-03-24 cs.RO cs.CV

ToFormer: Towards Large-scale Scenario Depth Completion for Lightweight ToF Camera

ToFormer:面向大规模场景深度补全的轻量级ToF相机

Juncheng Chen, Tiancheng Lai, Xingpeng Wang, Bingxin Liao, Baozhe Zhang, Chao Xu, Yanjun Cao

机构 * State Key Laboratory of Industrial Control Technology, Institute of Cyber Systems and Control, Zhejiang University, Hangzhou, China(浙江大学工业控制技术状态重点实验室,系统与控制研究所,杭州,中国) Huzhou Institute of Zhejiang University, Huzhou, China(浙江大学湖州研究院,湖州,中国) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

AI总结 本文提出全栈框架,通过多传感器平台收集大规模真实世界ToF样本,构建首个LASER-ToF数据集,并设计传感器感知深度补全网络,结合3D-2D联合传播池和多模态交叉协方差注意力模块,提升非均匀ToF深度稀疏性下的建模效果和3D-2D融合效率,实现轻量级部署和大规模场景映射。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20584 2026-03-24 cs.CV

Improving Diffusion Generalization with Weak-to-Strong Segmented Guidance

通过弱到强分段引导提升扩散模型泛化能力

Liangyu Yuan, Yufei Huang, Mingkun Lei, Tong Zhao, Ruoyu Wang, Changxi Chi, Yiwei Wang, Chi Zhang

机构 * Westlake University(西湖大学) Tongji University(同济大学) Zhejiang University(浙江大学) University of California at Merced(加州大学默塞德分校)

AI总结 本文提出SGG方法,通过弱到强原则结合CFG和AG的优势,提升扩散模型泛化能力,并在训练和推理阶段验证其有效性。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07496 2026-03-24 cs.CR cs.AI

From Thinker to Society: Security in Hierarchical Autonomy Evolution of AI Agents

从思考者到社会:AI智能体分层自主性演化的安全问题

Xiaolei Zhang, Lu Zhou, Xiaogang Xu, Jiafei Wu, Tianyu Du, Heqing Huang, Hao Peng, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Independent Researcher(独立研究者) Zhejiang Normal University(浙江师范大学) School of Software Technology, Zhejiang University(浙江大学软件学院) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学)

AI总结 研究探讨了AI智能体分层自主性演化中的安全挑战,提出三级安全框架并分析现有防御措施的不足,旨在指导可信AI智能体系统的多层防御架构设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01498 2026-03-24 cs.CV

Tri-path DINO: Feature Complementary Learning for Remote Sensing Multi-Class Change Detection

三路径DINO:用于遥感多类变化检测的特征互补学习

Kai Zheng, Hang-Cheng Dong, Shoulei Liu, Zhenkai Wu, Fupeng Wei, Lei Ding, Wei Zhang

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Instrumentation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学仪器科学与工程学院) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院) Ningbo Haichuang Group Co., Ltd.(宁波海创集团有限公司) School of Software Technology, Zhejiang University(浙江大学软件学院) School of Information Engineering, North China University of Water Resources and Electric Power(中国北方水利电力大学信息工程学院) Department of Geo-spatial Information, Information Engineering University(信息工程大学地理信息学院) Innovation Center of Yangtze River Delta, Zhejiang University(长三角创新中心,浙江大学)

AI总结 本文提出Tripath DINO架构,通过三路径互补特征学习策略提升预训练模型在复杂垂直领域快速适应能力,实现了在Gaza和SECOND数据集上的多类变化检测最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01396 2026-03-24 cs.CV

All Patches Matter, More Patches Better: Enhance AI-Generated Image Detection via Panoptic Patch Learning

所有补丁都重要,更多补丁更好:通过全景补丁学习增强AI生成图像检测

Zheng Yang, Ruoxin Chen, Zhiyuan Yan, Ke-Yue Zhang, Xinghe Fu, Shuang Wu, Xiujun Shu, Taiping Yao, Shouhong Ding, Zequn Qin, Xi Li

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Youtu Lab, Tencent(腾讯优图实验室) Peking University(北京大学) Wechat Pay, Tencent(腾讯微信支付) School of Software Technology, Zhejiang University(浙江大学软件技术学院)

AI总结 本文提出全景补丁学习框架,通过随机补丁替换和补丁级对比学习,解决AI生成图像检测中的Few-Patch偏差问题,提升检测鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16196 2026-03-24 cs.CV cs.LG

Learn from Foundation Model: Fruit Detection Model without Manual Annotation

从基础模型学习:无需人工标注的水果检测模型

Yanan Wang, Zhenghao Fei, Ruichen Li, Yibin Ying

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) Faculty of Science, National University of Singapore(新加坡国立大学科学学院)

AI总结 本文提出SDM-D框架,通过SDM和知识蒸馏技术,在无标注数据下训练高效的小模型,实现水果检测的高精度与速度,超越现有开放集检测方法。

Comments 35 pages, 11figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20310 2026-03-24 cs.CV cs.GR

GraphiContact: Pose-aware Human-Scene Robust Contact Perception for Interactive Systems

GraphiContact: 人体-场景鲁棒接触感知用于交互系统

Xiaojian Lin, Yaomin Shen, Junyuan Ma, Yujie Sun, Chengqing Bu, Wenxin Zhang, Zongzheng Zhang, Hao Fei, Lei Jin, Hao Zhao

机构 * Tsinghua University, China(清华大学, 中国) XR System Application Research Center, Nanchang Research Institute, Zhejiang University, China(浙江大学南昌研究院XR系统应用研究中心, 中国) Beijing University of Posts and Telecommunications, China(北京邮电大学, 中国) University of Chinese Academy of Sciences, China(中国科学院大学, 中国) National University of Singapore, Singapore(新加坡国立大学, 新加坡)

AI总结 本文提出GraphiContact框架,结合单图像3D人体网格重建,利用重建的体几何结构进行接触推理,通过引入SIMU训练策略提升鲁棒性,在五个基准数据集上实现了接触预测和3D人体重建的提升。

Comments 15 pages, 9 figures, Accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20307 2026-03-24 cs.CV cs.AI cs.MM cs.SD

EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control

EARTalking:端到端的GPT风格自回归说话头合成与帧级控制

Yuzhe Weng, Haotian Wang, Yuanhong Yu, Jun Du, Shan He, Xiaoyan Wu, Haoran Xu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Zhejiang University(浙江大学)

AI总结 本文提出EARTalking,一种端到端的GPT风格自回归模型,用于交互式音频驱动说话头生成,通过引入帧级流式生成范式和Sink Frame Window Attention机制,实现高效可控的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20260 2026-03-24 cs.AI

ProMAS: Proactive Error Forecasting for Multi-Agent Systems Using Markov Transition Dynamics

ProMAS:利用马尔可夫转移动态进行多智能体系统的前瞻性错误预测

Xinkui Zhao, Sai Liu, Yifan Zhang, Qingyu Ma, Guanjie Cheng, Naibo Wang, Chang Liu

机构 * Zhejiang University(浙江大学)

AI总结 ProMAS通过马尔可夫转移动态预测多智能体系统中的错误,采用因果delta特征捕捉语义位移,结合前瞻性预测头和跳跃检测,实现低延迟的错误定位,提升自主推理的实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏