arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Zhejiang University(浙江大学)

2026-04-03 至 2026-04-03 共收录 10
2603.29966 2026-04-03 cs.CV

Scaling Video Pretraining for Surgical Foundation Models

为手术基础模型扩展视频预训练

Sicheng Lu, Zikai Xiao, Jianhui Wei, Danyu Sun, Qi Lu, Keli Hu, Yang Feng, Jian Wu, Zongxin Yang, Zuozhu Liu

机构 * The Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟分校联合学院) Zhejiang Lab(之江实验室) Shaoxing University(绍兴大学) Angelalign(时代天使) Harvard Medical School(哈佛医学院)

AI总结 本文提出SurgRec,通过大规模数据和统一预训练流程提升手术视频理解能力,对比SSL基线和视觉语言模型,展示SurgRec在多个下游任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24458 2026-04-03 cs.CV

OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning

OmniWeaving:迈向统一视频生成的自由组合与推理

Kaihang Pan, Qi Tian, Jianwei Zhang, Weijie Kong, Jiangfeng Xiong, Yanxin Long, Shixue Zhang, Haiyi Qiu, Tan Wang, Zheqi Lv, Yue Wu, Liefeng Bo, Siliang Tang, Zhao Zhong

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元) Nanyang Technological University(南洋理工大学)

AI总结 本文提出OmniWeaving模型,通过大规模预训练数据学习多模态组合与推理能力,引入IntelligentVBench基准测试,展示其在开放源码统一视频生成中的领先性能。

Comments 32 pages, 22 figures. Project Page: https://omniweaving.github.io. Github: https://github.com/Tencent-Hunyuan/OmniWeaving. Model: https://huggingface.co/tencent/HY-OmniWeaving

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13024 2026-04-03 cs.LG math.OC

Fragility-aware Classification for Understanding Risk and Improving Generalization

面向脆弱性的分类:理解风险与提升泛化能力

Chen Yang, Zheng Cui, Daniel Zhuoyu Long, Jin Qi, Ruohan Zhan

机构 * School of Management, Zhejiang University(浙江大学管理学院) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(香港中文大学系统工程与工程管理系) Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系) Department of Marketing and Analytics, University College London(伦敦大学学院市场营销与分析系)

AI总结 本文提出Fragility Index作为新型性能指标,从风险规避角度评估分类器,通过鲁棒满足框架确保在分布不确定性下的鲁棒性,并开发可训练框架以直接优化FI,实验证明其能揭示误差尾部风险并提升决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01749 2026-04-03 cs.CV

Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding

超声-CLIP:面向超声图像-文本理解的语义感知对比预训练

Jiayun Jin, Haolong Chai, Xueying Huang, Xiaoqing Guo, Zengwei Zheng, Zhan Zhou, Junmei Wang, Xinyu Wang, Jie Liu, Binbin Zhou

机构 * Hangzhou City University(杭州城市大学) Hong Kong Baptist University(香港浸会大学) Zhejiang University(浙江大学) The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院) City University of Hong Kong(香港城市大学)

AI总结 本文提出超声-CLIP,通过构建US-365K数据集和UDT知识框架,引入语义软标签和损失函数,提升超声图像与文本的语义对比学习效果,实现分类和检索的SOTA性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01712 2026-04-03 cs.LG cs.AI eess.SP physics.comp-ph

Transformer self-attention encoder-decoder with multimodal deep learning for response time series forecasting and digital twin support in wind structural health monitoring

基于多模态深度学习的Transformer自注意力编码器-解码器:用于响应时间序列预测和风力结构健康监测的数字孪生支持

Feiyu Zhou, Marios Impraimakis

机构 * Department of Mechanical Engineering, University of Bath(巴斯大学机械工程系) Department of Civil Engineering, Zhejiang University(浙江大学土木工程系)

AI总结 本文提出一种基于Transformer的多模态深度学习方法,用于风力结构响应时间序列预测和数字孪生支持,通过捕捉系统时间特性提升结构健康监测的准确性与鲁棒性。

Comments 21 pages, 22 figures, 9 tables. This version corresponds to the published article in Computers & Structures. https://doi.org/10.1016/j.compstruc.2026.108216

Journal ref Computers and Structures 326 (2026) 108216

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01705 2026-04-03 cs.CL cs.AI

Development and multi-center evaluation of domain-adapted speech recognition for human-AI teaming in real-world gastrointestinal endoscopy

开发与多中心评估用于真实世界胃肠道内窥镜中人类-人工智能协作的领域适应语音识别

Ruijie Yang, Yan Zhu, Peiyao Fu, Te Luo, Zhihua Wang, Xian Yang, Quanlin Li, Pinghong Zhou, Shuo Wang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院) Shanghai Key Laboratory of MICCAI(上海市MICCAI重点实验室) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学附属中山医院内镜中心及内镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海市内镜协同创新中心) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院)

AI总结 本文提出EndoASR,通过合成内窥镜报告开发两阶段适应策略,提升内窥镜流程中的语音识别准确率和临床实用性,经多中心验证其在异质真实世界条件下的鲁棒性。

Comments Under review at npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01664 2026-04-03 cs.AI

ContextBudget: Budget-Aware Context Management for Long-Horizon Search Agents

ContextBudget: 长时间 horizon 搜索代理的预算感知上下文管理

Yong Wu, YanZhao Zheng, TianZe Xu, ZhenTao Zhang, YuanQiang Yu, JiHuai Zhu, Chao Ma, BinBin Lin, BaoHua Dong, HangCheng Zhu, RuoHui Huang, Gang Yu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出BACM方法,通过预算约束的序列决策问题管理上下文,结合BACM-RL强化学习方法,在多目标问答和长时间网页浏览任务中优于现有方法,尤其在高复杂度场景下表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01659 2026-04-03 cs.RO

AURA: Multimodal Shared Autonomy for Real-World Urban Navigation

AURA:多模态共享自主控制用于真实世界城市导航

Yukai Ma, Honglin He, Selina Song, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学)

AI总结 AURA通过将城市导航分解为高层人类指令和低层AI控制,减少人工操作负担,提升导航稳定性,并在真实世界中实现44%的接管减少。

Comments 17 pages, 18 figures, 4 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01560 2026-04-03 cs.CL

DeltaMem: Towards Agentic Memory Management via Reinforcement Learning

DeltaMem:通过强化学习实现面向代理的记忆管理

Qi Zhang, Shen Huang, Chu Liu, Shouqing Yang, Junbo Zhao, Haobo Wang, Pengjun Xie

机构 * Alibaba Tongyi Lab, Hangzhou, China(阿里巴巴通义实验室,杭州,中国) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

AI总结 本文提出DeltaMem,通过强化学习实现单代理环境下的人格中心记忆管理,结合用户-助手对话数据集和操作级记忆更新标签,引入基于记忆的Levenshtein距离以提升记忆管理能力。

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01351 2026-04-03 cs.CV

Long-Tailed Distribution-Aware Router For Mixture-of-Experts in Large Vision-Language Model

长尾分布感知的混合专家路由器:用于大规模视觉-语言模型的混合专家架构

Chaoxiang Cai, Longrong Yang, Minghe Weng, Xuewei Li, Zequn Qin, Xi Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Electronic and Information, Shanghai Dianji University(上海电机学院电子信息学院)

AI总结 本文提出LTDR路由器,针对视觉-语言混合专家架构中的长尾分布问题,通过模态特定的分布感知路由和动态专家激活策略,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏