arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2931
2308.01042 2025-12-16 cs.CV

WCCNet: Wavelet-context Cooperative Network for Efficient Multispectral Pedestrian Detection

WCCNet:小波-上下文协作网络用于高效多光谱行人检测

Xingjian Wang, Li Chai, Jiming Chen, Zhiguo Shi

机构 * the College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) the College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

AI总结 WCCNet通过低计算成本的多光谱特征提取与跨模态融合,提升自动驾驶中的行人检测效率与精度。

Comments 35 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12219 2025-12-16 cs.CV

Fine-Grained Zero-Shot Learning with Attribute-Centric Representations

细粒度零样本学习与属性导向表示

Zhi Chen, Jingcai Guo, Taotao Cai, Yuxiang Cai

机构 * University of Southern Queensland(昆士兰大学) The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

AI总结 本文提出了一种细粒度零样本学习框架,通过属性导向表示解决属性纠缠问题,采用混合专家机制提升分类性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11395 2025-12-15 cs.CV

FlowDC: Flow-Based Decoupling-Decay for Complex Image Editing

FlowDC: 基于流的解耦-衰减用于复杂图像编辑

Yilei Jiang, Zhen Wang, Yanghao Wang, Jun Yu, Yueting Zhuang, Jun Xiao, Long Chen

机构 * Zhejiang University(浙江大学) HKUST(香港科技大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 FlowDC通过解耦和衰减技术提升复杂图像编辑的源一致性与语义对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11218 2025-12-15 cs.RO cs.CV

Seeing to Act, Prompting to Specify: A Bayesian Factorization of Vision Language Action Policy

视觉与语言动作政策的贝叶斯分解:看见以行动,提示以指定

Kechun Xu, Zhenjie Zhu, Anzhe Chen, Shuqi Zhao, Qing Huang, Yifei Yang, Haojian Lu, Rong Xiong, Masayoshi Tomizuka, Yue Wang

机构 * Zhejiang University(浙江大学) UC Berkeley(伯克利大学)

AI总结 本文提出BayesVLA,通过贝叶斯分解策略,解决VLA模型中因模态不平衡导致的灾难性遗忘问题,提升泛化能力和指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15351 2025-12-15 cs.AI cs.CV

Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration

Octopus: 六种能力协同的代理多模态推理

Yifu Guo, Zishan Xu, Zhiyuan Yao, Yuquan Lu, Jiaye Lin, Sen Hu, Zhenheng Tang, Huacan Wang, Ronghao Chen

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Octopus通过六种能力协同实现多模态代理推理,有效提升复杂任务中的自主探索与动态能力选择能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20560 2025-12-15 stat.ML cs.LG stat.ME

Statistical Inference for Differentially Private Stochastic Gradient Descent

差分隐私随机梯度下降的统计推断

Xintao Xia, Linjun Zhang, Zhanrui Cai

机构 * Center for Data Science, Zhejiang University(浙江大学数据科学中心) Department of Statistics, Rutgers University(罗格斯大学统计系) Faculty of Business and Economics, The University of Hong Kong(香港大学商学院)

AI总结 本文提出了一种在差分隐私随机梯度下降中构建有效置信区间的两种方法,通过分析渐近方差分解,实现了在隐私保护下的统计推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10712 2025-12-15 cs.LG cs.AI

FuncGenFoil: Airfoil Generation and Editing Model in Function Space

FuncGenFoil:函数空间中的机翼生成与编辑模型

Jinouwen Zhang, Junjie Ren, Qianhong Ma, Jianyu Wu, Aobo Yang, Yan Lu, Lu Chen, Hairun Xie, Jing Wang, Miao Zhang, Wanli Ouyang, Shixiang Tang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shanghai Aircraft Design and Research Institute(上海飞机设计与研究院) Innovation Academy for Microsatellites of CAS(中国科学院微卫星创新院) Shanghai Jiao Tong University(上海交通大学)

AI总结 FuncGenFoil通过函数空间建模实现机翼生成与编辑,提升生成精度与多样性,为高保真空气动力学设计提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15371 2025-12-15 cs.CL cs.AI

MiSS: Revisiting the Trade-off in LoRA with an Efficient Shard-Sharing Structure

MiSS: 重新审视LoRA中的权衡问题,提出高效的分片共享结构

Jiale Kang, Qingyu Yin

机构 * Yuanshi Inc(元世公司) Zhejiang University(浙江大学)

AI总结 MiSS通过高效的分片共享结构,在提升LoRA性能的同时,优化了内存和计算效率,实现了性能、内存和效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10863 2025-12-12 cs.CV cs.AI

MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence

MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准

Jingli Lin, Runsen Xu, Shaohao Zhu, Sihan Yang, Peizhou Cao, Yunlong Ran, Miao Hu, Chenming Zhu, Yiman Xie, Yilin Long, Wenbo Hu, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Xi’an Jiaotong University(西安交通大学) University of Hong Kong(香港大学) Fudan University(复旦大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10624 2025-12-12 cs.CL

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence

AgriGPT-Omni: 一种统一的语音-视觉-文本框架用于多语言农业智能

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * Zhejiang University(浙江大学)

AI总结 AgriGPT-Omni提出了一种统一的语音-视觉-文本框架,通过数据合成、多阶段训练和三模态基准,提升多语言农业智能的性能和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10540 2025-12-12 cs.RO

Mr. Virgil: Learning Multi-robot Visual-range Relative Localization

Mr. Virgil:学习多机器人视觉范围相对定位

Si Wang, Zhehan Li, Jiadong Lu, Rong Xiong, Yanjun Cao, Yue Wang

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学控制系统研究所) Huzhou Institute of Zhejiang University(浙江大学湖州研究院)

AI总结 Mr. Virgil通过图神经网络和可微分PGO后端实现多机器人视觉范围相对定位,提升定位精度与鲁棒性。

Comments Accepted by 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10531 2025-12-12 cs.RO

Neural Ranging Inertial Odometry

神经测距惯性里程计

Si Wang, Bingqi Shen, Fei Wang, Yanjun Cao, Rong Xiong, Yue Wang

机构 * Institute of Cyber-Systems and Control, Zhejiang University, China(浙江大学控制系统研究所) Beijing Institute of Electronic System Engineering(北京电子系统工程研究所) Huzhou Institute of Zhejiang University, Huzhou, China(浙江大学湖州研究院)

AI总结 本文提出一种基于神经融合的测距惯性里程计框架,通过图注意力网络和递归神经网络提升定位精度和鲁棒性,适用于复杂环境。

Comments Accepted by 2025 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10450 2025-12-12 cs.CV

Error-Propagation-Free Learned Video Compression With Dual-Domain Progressive Temporal Alignment

无误差传播的学得视频压缩与双域渐进时间对齐

Han Li, Shaohui Li, Wenrui Dai, Chenglin Li, Xinlong Pan, Haipeng Wang, Junni Zou, Hongkai Xiong

机构 * Department of Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子工程系) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Naval Aviation University(海军航空大学)

AI总结 本文提出一种无误差传播的学得视频压缩框架,通过双域渐进时间对齐和质量条件化的专家混合实现高质量的视频压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10375 2025-12-12 cs.SD cs.AI

Neural personal sound zones with flexible bright zone control

具有灵活明亮区控制的神经个人声音区

Wenye Zhu, Jun Tang, Xiaofei Li

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Westlake Institute for Advanced Study(西湖研究学院)

AI总结 本文提出了一种基于3D卷积神经网络的神经个人声音区再现方法,能够灵活控制声音区域并处理不同重建目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08169 2025-12-12 cs.LG

Bidirectional Representations Augmented Autoregressive Biological Sequence Generation

双向表示增强的自回归生物序列生成

Xiang Zhang, Jiaqi Wei, Zijie Qiu, Sheng Xu, Zhi Jin, ZhiQiang Gao, Nanqing Dong, Siqi Sun

机构 * Fudan University(复旦大学) University of British Columbia(不列颠哥伦比亚大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学)

AI总结 本文提出混合框架,通过结合非自回归机制与自回归生成,提升生物序列生成的双向依赖建模能力。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10177 2025-12-12 cs.LG cond-mat.stat-mech cs.CV stat.ML

Geometric Regularity in Deterministic Sampling Dynamics of Diffusion-based Generative Models

扩散生成模型确定性采样动态中的几何正则性

Defang Chen, Zhenyu Zhou, Can Wang, Siwei Lyu

机构 * University at Buffalo, State University of New York(纽约州立大学布法罗分校) Zhejiang University(浙江大学)

AI总结 本文揭示了扩散生成模型采样轨迹的几何正则性,提出动态规划方案提升图像生成性能。

Comments 57 pages. Accepted by Journal of Statistical Mechanics: Theory and Experiment (2025). The short version was published in ICML 2024. arXiv admin note: text overlap with arXiv:2405.11326

Journal ref J. Stat. Mech. (2025) 124002

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09927 2025-12-11 cs.RO

Token Expand-Merge: Training-Free Token Compression for Vision-Language-Action Models

令牌扩展-合并:面向视觉-语言-动作模型的免训练 令牌压缩

Yifan Ye, Jiaqi Ma, Jun Cen, Zhihe Lu

机构 * College of Science and Engineering, Hamad Bin Khalifa University(1 科学与工程学院,哈马德·本·卡西姆大学) Mohamed bin Zayed University of Artificial Intelligence(2 摩萨·本·扎耶德人工智能大学) College of Computer Science and Technology, Zhejiang University(3 计算机科学与技术学院,浙江大学)

AI总结 TEAM-VLA通过动态令牌扩展与合并机制,实现无需训练的视觉-语言-动作模型高效推理,提升速度并保持任务性能。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09524 2025-12-11 q-bio.NC cs.AI cs.LG eess.SP

NeuroSketch: An Effective Framework for Neural Decoding via Systematic Architectural Optimization

NeuroSketch:通过系统性架构优化实现神经解码的有效框架

Gaorui Zhang, Zhizhang Yuan, Jialan Yang, Junru Chen, Li Meng, Yang Yang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai Institute of Microsystem and Information Technology(上海微系统与信息工程研究所)

AI总结 NeuroSketch通过系统性架构优化,实现了在视觉、听觉和语音等多模态下的神经解码性能提升,达到最先进的解码效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09396 2025-12-11 cs.MA cs.AI

GAIR: GUI Automation via Information-Joint Reasoning and Group Reflection

GAIR:通过信息联合推理和群体反思实现GUI自动化

Zishu Wei, Qixiang Ma, Xavier Hu, Yuhang Liu, Hui Zang, Yudong Zhao, Tao Wang, Shengyu Zhang, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Technologies Ltd.(华为技术有限公司)

AI总结 GAIR是一种基于MLLM的GUI自动化代理框架,通过信息联合推理和群体反思整合异质模型能力,提升GUI自动化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09354 2025-12-11 cs.CV

Video-QTR: Query-Driven Temporal Reasoning Framework for Lightweight Video Understanding

Video-QTR: 一种基于查询的轻量级视频理解时序推理框架

Xinkui Zhao, Zuxin Wang, Yifan Zhang, Guanjie Cheng, Yueshen Xu, Shuiguang Deng, Chang Liu, Naibo Wang, Jianwei Yin

机构 * School of Software Technology, Zhejiang University, Hangzhou, China(浙江大学软件技术学院) School of Computer Science, Zhejiang University, Hangzhou, China(浙江大学计算机科学学院) School of Software Engineering, Xidian University, Xi’an, China(西安电子科技大学软件工程学院)

AI总结 Video-QTR通过查询驱动的时序推理框架,实现轻量级视频理解,显著降低计算成本并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24403 2025-12-11 cs.CL cs.DB

Agentar-Scale-SQL: Advancing Text-to-SQL through Orchestrated Test-Time Scaling

Agentar-Scale-SQL: 通过协调的测试时扩展推进文本到SQL

Pengfei Wang, Baolin Sun, Xuemei Dong, Yaxun Dai, Hongwei Yuan, Mengdie Chu, Yingqi Gao, Xiang Qi, Peng Zhang, Ying Yan

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Soochow University(苏州大学) Zhejiang University(浙江大学)

AI总结 Agentar-Scale-SQL通过协调的测试时扩展策略,结合内部扩展、顺序扩展和并行扩展,提升文本到SQL的性能,在BIRD基准上达到81.67%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08987 2025-12-11 cs.CV cs.AI

3DID: Direct 3D Inverse Design for Aerodynamics with Physics-Aware Optimization

3DID: 基于物理感知优化的直接三维逆向设计

Yuze Hao, Linchao Zhu, Yi Yang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能状态关键实验室)

AI总结 3DID提出一种基于物理感知优化的直接三维逆向设计框架,通过连续潜在表示和两阶段优化策略生成高保真的三维几何结构,提升设计质量和灵活性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08960 2025-12-11 cs.LG cs.AI cs.CL

Resolving Conflicts in Lifelong Learning via Aligning Updates in Subspaces

通过在子空间中对齐更新来解决终身学习中的冲突

Yueer Zhou, Yichen Wu, Ying Wei

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学)

AI总结 PS-LoRA通过在优化子空间中对齐更新,解决终身学习中的冲突问题,提升模型在新领域适应时的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08627 2025-12-10 cs.CV

Trajectory Densification and Depth from Perspective-based Blur

轨迹密集化与基于视角的模糊深度估计

Tianchen Qiu, Qirun Zhang, Jiajian He, Zhengyue Zhuge, Jiahui Xu, Yueting Chen

机构 * College of Optical Science and Engineering(光学科学与工程学院) Zhejiang University(浙江大学)

AI总结 本文提出了一种基于视角模糊和密集轨迹的深度估计方法,利用视觉-语言模型和光学设计算法实现大范围深度的高精度重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08529 2025-12-10 cs.CV

MVP: Multiple View Prediction Improves GUI Grounding

MVP: 多视角预测改进 GUI 定位

Yunzhu Zhang, Zeyu Pan, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Linchao Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) Venus Team, Ant Group(蚂蚁集团 Venus 团队)

AI总结 MVP 通过多视角预测方法提升 GUI 定位的稳定性与准确性,显著提高多个模型的性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08186 2025-12-10 cs.RO

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation

放慢脚步,快速移动:一种通用视觉-语言导航的双系统基础模型

Meng Wei, Chenyang Wan, Jiaqi Peng, Xiqian Yu, Yuqiang Yang, Delin Feng, Wenzhe Cai, Chenming Zhu, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 DualVLN通过双系统架构,结合高层推理与低层动作执行,提升视觉-语言导航的泛化能力和动态环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18549 2025-12-10 cs.LG cs.AI

RLCAD: Reinforcement Learning Training Gym for Revolution Involved CAD Command Sequence Generation

RLCAD: 用于革命涉及CAD命令序列生成的强化学习训练环境

Xiaolong Yin, Xingyu Lu, Jiahang Shen, Jingzhe Ni, Hailong Li, Ruofeng Tong, Min Tang, Peng Du

机构 * Zhejiang University, China(浙江大学) Shenzhen Poisson Software Co., Ltd., China(深圳Poisson软件有限公司)

AI总结 本文提出基于CAD几何引擎的RL训练环境,支持生成更复杂的CAD命令序列,实现从B-Rep几何体的高精度生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07628 2025-12-09 cs.CV

MoCA: Mixture-of-Components Attention for Scalable Compositional 3D Generation

MoCA:基于组件的注意力机制用于可扩展的组合3D生成

Zhiqi Li, Wenhuan Li, Tengfei Wang, Zhenwei Wang, Junta Wu, Haoyuan Wang, Yunhan Yang, Zehuan Huang, Yang Li, Peidong Liu, Chunchao Guo

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Tencent Hunyuan(腾讯文恩)

AI总结 MoCA通过重要性路由和组件压缩技术,实现高效可扩展的组合性3D生成,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07464 2025-12-09 cs.RO

Gait-Adaptive Perceptive Humanoid Locomotion with Real-Time Under-Base Terrain Reconstruction

具有实时底层地形重建的感知人体机器人运动

Haolin Song, Hongbo Zhu, Tao Yu, Yan Liu, Mingqi Yuan, Wengang Zhou, Hua Chen, Houqiang Li

机构 * Department of Electronic Engineering and Information Science (EEIS), University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) LimX Dynamics(LimX动力学) Hong Kong University of Science and Technology(香港科技大学) School of Mechanics Engineering, Harbin Institute of Technology (HIT)(机械工程学院,哈尔滨工业大学) Department of Computing, The Hong Kong Polytechnic University(计算学院,香港理工大学) Zhejiang University-University of Illinois Urbana-Champaign Institute (ZJUI)(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所)

AI总结 该研究提出了一种结合地形感知、步态调节和全身控制的强化学习框架,通过实时底层地形重建实现稳健的人形机器人运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07005 2025-12-09 cs.SD cs.AI

Multi-Accent Mandarin Dry-Vocal Singing Dataset: Benchmark for Singing Accent Recognition

多语调普通话干声唱Dataset:歌唱语调识别基准

Zihao Wang, Ruibin Yuan, Ziqi Geng, Hengjia Li, Xingwei Qu, Xinyi Li, Songye Chen, Haoying Fu, Roger B. Dannenberg, Kejun Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Innovation Center of Yangtze River Delta, Zhejiang University(长江三角洲创新中心,浙江大学) Tsinghua University(清华大学) Hong Kong University of Science(香港科学大学)

AI总结 本文提出多语调普通话干声唱语料库,用于评估语音模型在歌唱场景中的表现,并探讨方言和元音对语调变化的影响。

Comments Accepted by ACMMM 2025

Journal ref Proceedings of the 33rd ACM International Conference on Multimedia (ACMMM 2025), Pages 12714-12721, October 27, 2025. Dublin, Ireland

详情

展开后加载摘要…

URL PDF HTML 收藏