arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Zhejiang University(浙江大学)

2026-03-20 至 2026-03-20 共收录 19
2603.19228 2026-03-20 cs.CV

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐

Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan Chen, Hui Zhang, Haocheng Feng, Yu Lu, Hang Zhou, Chun Yuan, Jingdong Wang

机构 * Baidu(百度) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19217 2026-03-20 cs.CV

LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs

LVOmniBench:开创性长音频视频理解评估用于多模态大语言模型

Keda Tao, Yuhua Zheng, Jia Xu, Wenjie Du, Kele Shao, Hesong Wang, Xueyi Chen, Xin Jin, Junhan Zhu, Bohan Yu, Weiqiang Wang, Jian Liu, Can Qin, Yulun Zhang, Ming-Hsuan Yang, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of California Merced(加州大学默塞德分校)

AI总结 LVOmniBench旨在评估多模态大语言模型在长音频视频中的跨模态理解能力,通过275个10至90分钟的高质量视频和1014个问题-答案对,揭示当前模型在处理长形式输入时的挑战。

Comments Project page: https://kd-tao.github.io/LVOmniBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18924 2026-03-20 cs.CV

Unsupervised Contrastive Learning for Efficient and Robust Spectral Shape Matching

无监督对比学习用于高效且鲁棒的光谱形状匹配

Feifan Luo, Hongyang Chen

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Research Center for Data Hub and Security, Zhejiang Lab(浙江实验室数据枢纽与安全研究中心)

AI总结 本文提出一种无监督对比学习方法,通过提升嵌入空间中的特征一致性与判别性,实现高效且鲁棒的3D形状匹配,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18736 2026-03-20 cs.LG cs.AI cs.CL stat.ML

CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks

CausalRM:基于观察性用户反馈的因果理论奖励建模用于RLHF

Hao Wang, Licheng Pan, Zhichao Chen, Chunyuan Zheng, Zhixuan Chu, Xiaoxi Li, Yuan Lu, Xinggao Liu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) Zhejiang University(浙江大学)

AI总结 本文提出CausalRM框架,通过因果理论处理观察性用户反馈中的噪声和偏见问题,提升RLHF任务性能,实验显示在WildGuardMix和HarmBench上分别提升49.2%和32.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18712 2026-03-20 cs.AI

Accurate and Efficient Multi-Channel Time Series Forecasting via Sparse Attention Mechanism

通过稀疏注意力机制实现准确且高效的多通道时间序列预测

Lei Gao, Hengda Bao, Jingfei Fang, Guangzheng Wu, Weihua Zhou, Yun Zhou

机构 * Department of Machine Learning(机器学习系) SF Express(顺丰快递) Department of Management(管理系) Zhejiang University of Technology(浙江工业大学) Zhejiang University(浙江大学)

AI总结 本文提出Li-Net架构,通过稀疏Top-K Softmax注意力机制和多尺度投影框架,有效捕捉多通道时间序列的线性和非线性依赖,提升预测精度与效率。

Comments Accepted by ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16340 2026-03-20 cs.CV

Iris: Bringing Real-World Priors into Diffusion Model for Monocular Depth Estimation

Iris:将现实先验引入扩散模型以进行单目深度估计

Xinhao Cai, Gensheng Pei, Zeren Sun, Yazhou Yao, Fumin Shen, Wenguan Wang

机构 * Nanjing University of Science and Technology(南京理工大学) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学)

AI总结 Iris提出一种确定性框架,整合现实先验到扩散模型中,解决单目深度估计中细节保留和现实场景泛化问题。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11839 2026-03-20 cs.RO cs.CV

TrajBooster: Boosting Humanoid Whole-Body Manipulation via Trajectory-Centric Learning

TrajBooster:通过轨迹中心学习提升双足人形机器人的整体操作

Jiacheng Liu, Pengxiang Ding, Qihang Zhou, Yuxuan Wu, Da Huang, Zimian Peng, Wei Xiao, Weinan Zhang, Lixin Yang, Cewu Lu, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 TrajBooster通过利用轮式人形数据提升双足VLA性能,采用末端执行器轨迹作为通用接口,通过仿真重定向和预训练实现高效任务执行,减少对同构数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02914 2026-03-20 cs.CV

Auto-Annotation with Expert-Crafted Guidelines: A Study through 3D LiDAR Detection Benchmark

基于专家制定指南的自动标注:通过3D激光雷达检测基准的探讨

Yechi Ma, Wei Hua, Shu Kong

机构 * Zhejiang University(浙江大学) University of Macau(澳门大学) Institute of Collaborative Innovation(协同创新研究院)

AI总结 本文提出通过AutoExpert基准研究基于专家指南的自动标注,利用基础模型实现3D激光雷达数据的检测,最终将mAP提升至25.4。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17847 2026-03-20 cs.LG cs.AI cs.SY eess.SY

Time-o1: Time-Series Forecasting Needs Transformed Label Alignment

Time-o1: 时间序列预测需要转换标签对齐

Hao Wang, Licheng Pan, Zhichao Chen, Xu Chen, Qingyang Dai, Lei Wang, Haoxuan Li, Zhouchen Lin

机构 * Xiaohongshu Inc(小红书公司) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) Peking University(北京大学) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室,智能科学与技术学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Department of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Center for Data Science, Peking University(北京大学数据科学中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(广州黄埔实验室(华南))

AI总结 本文提出Time-o1,通过转换标签对齐缓解时间序列预测中的标签自相关和任务过多问题,提升模型性能。

Comments Accepted as poster in NeurIPS 2025

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18488 2026-03-20 cs.CV

TexEditor: Structure-Preserving Text-Driven Texture Editing

TexEditor: 保持结构的文本驱动纹理编辑

Bo Zhao, Yihang Liu, Chenfeng Zhang, Huan Yang, Kun Gai, Wei Ji

机构 * Nanjing University(南京大学) Shan Dong University(山东大学) Zhejiang University(浙江大学)

AI总结 本文提出TexEditor,通过数据和训练视角增强结构保持,利用TexBlender和StructureNFT提升纹理编辑效果,并引入TexBench验证其通用性。

Comments 19pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18237 2026-03-20 cs.LG cs.AI

Gradient-Informed Temporal Sampling Improves Rollout Accuracy in PDE Surrogate Training

梯度引导的时间采样提升PDE代理训练中的回放精度

Wenshuo Wang, Fan Zhang

机构 * School of Future Technology, South China University of Technology, China(未来技术学院,华南理工大学,中国) State Key Laboratory of Ocean Sensing & Ocean College, Zhejiang University, China(海洋感知国家重点实验室及海洋学院,浙江大学,中国) Kavli Institute for Astrophysics and Space Research, Massachusetts Institute of Technology, USA(天体物理与空间研究所,麻省理工学院,美国)

AI总结 本文提出梯度引导的时间采样方法,通过平衡模型特异性和动态信息,提升PDE代理训练中的回放精度,实验显示其在多个PDE系统和模型中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18103 2026-03-20 cs.CR cs.LG cs.SD

STEP: Detecting Audio Backdoor Attacks via Stability-based Trigger Exposure Profiling

STEP:通过基于稳定性的触发暴露分析检测音频后门攻击

Kun Wang, Meng Chen, Junhao Wang, Yuli Wu, Li Lu, Chong Zhang, Peng Cheng, Jiaheng Zhang, Kui Ren

机构 * Zhejiang University(浙江大学) Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出STEP方法,通过分析触发器在语义破坏扰动下的异常稳定性与语义保持扰动下的异常脆弱性,实现无训练的音频后门检测,实验显示其在多个攻击场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18031 2026-03-20 cs.LG cs.AI

InfoMamba: An Attention-Free Hybrid Mamba-Transformer Model

InfoMamba:一种无需注意力的混合Mamba-Transformer模型

Youjin Wang, Jiaqiao Zhao, Rong Fu, Run Zhou, Ruizhe Zhang, Jiani Liang, Suisuai Cao, Feng Zhou

机构 * Renmin University of China(中国人民大学) University of Macau(澳门大学) Central South University(中南大学) Zhejiang University(浙江大学)

AI总结 本文提出InfoMamba,一种无需注意力的混合模型,通过线性滤波层和信息最大化融合策略,在计算约束下实现局部细粒度建模与长程依赖捕捉的平衡,优于Transformer和SSM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18024 2026-03-20 eess.AS cs.AI cs.CL cs.SD

ProKWS: Personalized Keyword Spotting via Collaborative Learning of Phonemes and Prosody

ProKWS:通过音素和语调的协同学习实现个性化关键词定位

Jianan Pan, Yuanming Zhang, Kejie Huang

机构 * College of Information Science and Electronic Engineering, Zhejiang University, Hangzhou, China(信息科学与电子工程学院,浙江大学,杭州,中国)

AI总结 本文提出ProKWS框架,结合细粒度音素学习与个性化语调建模,通过双流编码器和协同融合模块提升关键词识别的适应性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18023 2026-03-20 eess.AS cs.AI cs.CL cs.SD

PCOV-KWS: Multi-task Learning for Personalized Customizable Open Vocabulary Keyword Spotting

PCOV-KWS:面向个性化可定制开放词汇关键词检测的多任务学习

Jianan Pan, Kejie Huang

机构 * Zhejiang University(浙江大学)

AI总结 本文提出PCOV-KWS框架,通过轻量网络同时实现关键词检测和说话人验证,采用非softmax损失和多任务损失加权策略,提升个性化关键词检测性能,减少参数和计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09909 2026-03-20 cs.AI

MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems

MedMASLab:多模态医疗多智能体系统的统一协调框架

Yunhang Qian, Xiaobin Hu, Jiaquan Yu, Siyang Xin, Xiaokun Chen, Jiangning Zhang, Peng-Tao Jiang, Jiawei Liu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学) vivo Stanford University(斯坦福大学)

AI总结 本文提出MedMASLab框架,解决医疗多智能体系统中多模态整合碎片化问题,通过标准化通信协议、自动化评估器和大规模基准测试,揭示领域特定性能差距,为未来自主临床系统建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06134 2026-03-20 cs.LG eess.SP q-bio.NC

DeeperBrain: A Neuro-Grounded EEG Foundation Model Towards Universal BCI

DeeperBrain: 一种面向通用脑机接口的神经 grounded EEG 基础模型

Jiquan Wang, Sha Zhao, Yangxuan Zhou, Yiming Kang, Shijian Li, Gang Pan

机构 * State Key Laboratory of Brain-machine Intelligence, Zhejiang University(浙江大学脑机智能国家重点实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) MOE Frontier Science Center for Brain Science and Brain-machine Integration(教育部脑科学与脑机集成前沿科学中心)

AI总结 DeeperBrain 通过整合生物物理和动态原理,提出神经 grounded 的 EEG 基础模型,实现通用脑机接口的高效和鲁棒性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00053 2026-03-20 cs.LG cs.AI stat.ML

Quadratic Direct Forecast for Training Multi-Step Time-Series Forecast Models

二次直接预报用于训练多步时间序列预测模型

Hao Wang, Licheng Pan, Yuan Lu, Zhichao Chen, Tianqiao Liu, Shuting He, Zhixuan Chu, Qingsong Wen, Haoxuan Li, Zhouchen Lin

机构 * Xiaohongshu Inc.(小红书公司) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,北京大学智能科学与技术学院) College of Engineering, Purdue University(普渡大学工程学院) School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算机与人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Squirrel AI Center for Data Science, Peking University(北京大学数据科学中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(琶洲实验室(黄埔),广州,广东,中国)

AI总结 本文提出二次加权训练目标,解决多步时间序列预测中标签自相关和任务权重不均的问题,通过Quadratic Direct Forecast算法提升模型性能。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16344 2026-03-20 cs.RO cs.AI

Manual2Skill++: Connector-Aware General Robotic Assembly from Instruction Manuals via Vision-Language Models

Manual2Skill++: 通过视觉语言模型实现连接器感知的指令手册驱动机器人装配

Chenrui Tie, Shengxiang Sun, Yudi Lin, Yanbo Wang, Zhongrui Li, Zhouhan Zhong, Jinxuan Zhu, Yiman Pang, Haonan Chen, Junting Chen, Ruihai Wu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) University of Toronto(多伦多大学) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 本文提出Manual2Skill++框架,通过视觉语言模型从指令手册中提取结构化连接信息,构建层次化图表示,实现连接器为核心的装配任务理解与执行。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏