arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2925
2603.18237 2026-03-20 cs.LG cs.AI

Gradient-Informed Temporal Sampling Improves Rollout Accuracy in PDE Surrogate Training

梯度引导的时间采样提升PDE代理训练中的回放精度

Wenshuo Wang, Fan Zhang

机构 * School of Future Technology, South China University of Technology, China(未来技术学院,华南理工大学,中国) State Key Laboratory of Ocean Sensing & Ocean College, Zhejiang University, China(海洋感知国家重点实验室及海洋学院,浙江大学,中国) Kavli Institute for Astrophysics and Space Research, Massachusetts Institute of Technology, USA(天体物理与空间研究所,麻省理工学院,美国)

AI总结 本文提出梯度引导的时间采样方法,通过平衡模型特异性和动态信息,提升PDE代理训练中的回放精度,实验显示其在多个PDE系统和模型中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18103 2026-03-20 cs.CR cs.LG cs.SD

STEP: Detecting Audio Backdoor Attacks via Stability-based Trigger Exposure Profiling

STEP:通过基于稳定性的触发暴露分析检测音频后门攻击

Kun Wang, Meng Chen, Junhao Wang, Yuli Wu, Li Lu, Chong Zhang, Peng Cheng, Jiaheng Zhang, Kui Ren

机构 * Zhejiang University(浙江大学) Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出STEP方法,通过分析触发器在语义破坏扰动下的异常稳定性与语义保持扰动下的异常脆弱性,实现无训练的音频后门检测,实验显示其在多个攻击场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18031 2026-03-20 cs.LG cs.AI

InfoMamba: An Attention-Free Hybrid Mamba-Transformer Model

InfoMamba:一种无需注意力的混合Mamba-Transformer模型

Youjin Wang, Jiaqiao Zhao, Rong Fu, Run Zhou, Ruizhe Zhang, Jiani Liang, Suisuai Cao, Feng Zhou

机构 * Renmin University of China(中国人民大学) University of Macau(澳门大学) Central South University(中南大学) Zhejiang University(浙江大学)

AI总结 本文提出InfoMamba,一种无需注意力的混合模型,通过线性滤波层和信息最大化融合策略,在计算约束下实现局部细粒度建模与长程依赖捕捉的平衡,优于Transformer和SSM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18024 2026-03-20 eess.AS cs.AI cs.CL cs.SD

ProKWS: Personalized Keyword Spotting via Collaborative Learning of Phonemes and Prosody

ProKWS:通过音素和语调的协同学习实现个性化关键词定位

Jianan Pan, Yuanming Zhang, Kejie Huang

机构 * College of Information Science and Electronic Engineering, Zhejiang University, Hangzhou, China(信息科学与电子工程学院,浙江大学,杭州,中国)

AI总结 本文提出ProKWS框架,结合细粒度音素学习与个性化语调建模,通过双流编码器和协同融合模块提升关键词识别的适应性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18023 2026-03-20 eess.AS cs.AI cs.CL cs.SD

PCOV-KWS: Multi-task Learning for Personalized Customizable Open Vocabulary Keyword Spotting

PCOV-KWS:面向个性化可定制开放词汇关键词检测的多任务学习

Jianan Pan, Kejie Huang

机构 * Zhejiang University(浙江大学)

AI总结 本文提出PCOV-KWS框架,通过轻量网络同时实现关键词检测和说话人验证,采用非softmax损失和多任务损失加权策略,提升个性化关键词检测性能,减少参数和计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09909 2026-03-20 cs.AI

MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems

MedMASLab:多模态医疗多智能体系统的统一协调框架

Yunhang Qian, Xiaobin Hu, Jiaquan Yu, Siyang Xin, Xiaokun Chen, Jiangning Zhang, Peng-Tao Jiang, Jiawei Liu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学) vivo Stanford University(斯坦福大学)

AI总结 本文提出MedMASLab框架,解决医疗多智能体系统中多模态整合碎片化问题,通过标准化通信协议、自动化评估器和大规模基准测试,揭示领域特定性能差距,为未来自主临床系统建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06134 2026-03-20 cs.LG eess.SP q-bio.NC

DeeperBrain: A Neuro-Grounded EEG Foundation Model Towards Universal BCI

DeeperBrain: 一种面向通用脑机接口的神经 grounded EEG 基础模型

Jiquan Wang, Sha Zhao, Yangxuan Zhou, Yiming Kang, Shijian Li, Gang Pan

机构 * State Key Laboratory of Brain-machine Intelligence, Zhejiang University(浙江大学脑机智能国家重点实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) MOE Frontier Science Center for Brain Science and Brain-machine Integration(教育部脑科学与脑机集成前沿科学中心)

AI总结 DeeperBrain 通过整合生物物理和动态原理,提出神经 grounded 的 EEG 基础模型,实现通用脑机接口的高效和鲁棒性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00053 2026-03-20 cs.LG cs.AI stat.ML

Quadratic Direct Forecast for Training Multi-Step Time-Series Forecast Models

二次直接预报用于训练多步时间序列预测模型

Hao Wang, Licheng Pan, Yuan Lu, Zhichao Chen, Tianqiao Liu, Shuting He, Zhixuan Chu, Qingsong Wen, Haoxuan Li, Zhouchen Lin

机构 * Xiaohongshu Inc.(小红书公司) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,北京大学智能科学与技术学院) College of Engineering, Purdue University(普渡大学工程学院) School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算机与人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Squirrel AI Center for Data Science, Peking University(北京大学数据科学中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(琶洲实验室(黄埔),广州,广东,中国)

AI总结 本文提出二次加权训练目标,解决多步时间序列预测中标签自相关和任务权重不均的问题,通过Quadratic Direct Forecast算法提升模型性能。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16344 2026-03-20 cs.RO cs.AI

Manual2Skill++: Connector-Aware General Robotic Assembly from Instruction Manuals via Vision-Language Models

Manual2Skill++: 通过视觉语言模型实现连接器感知的指令手册驱动机器人装配

Chenrui Tie, Shengxiang Sun, Yudi Lin, Yanbo Wang, Zhongrui Li, Zhouhan Zhong, Jinxuan Zhu, Yiman Pang, Haonan Chen, Junting Chen, Ruihai Wu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) University of Toronto(多伦多大学) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 本文提出Manual2Skill++框架,通过视觉语言模型从指令手册中提取结构化连接信息,构建层次化图表示,实现连接器为核心的装配任务理解与执行。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17693 2026-03-19 cs.CV

Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos

通过合成视频学习可迁移的时间原语以实现视频推理

Songtao Jiang, Sibo Song, Chenyi Zhou, Yuan Wang, Ruizhe Chen, Tongkun Guan, Ruilin Luo, Yan Zhang, Zhihang Tang, Yuchong Sun, Hang Zhang, Zhibo Yang, Shuai Bai, Junyang Lin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 本文提出SynRL框架,通过合成视频训练模型的时间原语,提升视频推理能力,在15个基准测试中取得显著成效,合成数据在复杂场景中表现优于真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17671 2026-03-19 cs.CV

Few-Step Diffusion Sampling Through Instance-Aware Discretizations

通过实例感知离散化实现少步扩散采样

Liangyu Yuan, Ruoyu Wang, Tong Zhao, Dingwen Fu, Mingkun Lei, Beier Zhu, Chi Zhang

机构 * Westlake University(西湖大学) Tongji University(同济大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出实例感知离散化框架,通过输入依赖先验调整时间步分配,提升生成质量,减少训练和推理开销。

Comments 24 pages, 20 figures. code: https://github.com/851695e35/INDIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17670 2026-03-19 cs.RO

AgentVLN: Towards Agentic Vision-and-Language Navigation

AgentVLN:迈向具有代理能力的视觉-语言导航

Zihao Xin, Wentong Li, Yixuan Jiang, Ziyuan Huang, Bin Wang, Piji Li, Jianke Zhu, Jie Qin, Shengjun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Shandong University(山东大学) Zhejiang University(浙江大学)

AI总结 本文提出AgentVLN框架,通过部分可观测半马尔可夫决策过程建模视觉-语言导航,结合VLM-as-Brain范式和跨空间表示映射,解决多级表示不一致问题,实现高效轻量级导航部署。

Comments 19pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14827 2026-03-19 cs.CV

SemanticFace: Semantic Facial Action Estimation via Semantic Distillation in Interpretable Space

SemanticFace: 通过可解释空间中的语义蒸馏进行语义面部动作估计

Zejian Kang, Kai Zheng, Yuanchen Fei, Wentao Yang, Hongyuan Zou, Xiangru Huang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Hunan University(湖南大学) The University of Hong Kong(香港大学)

AI总结 SemanticFace通过语义蒸馏在可解释空间中估计面部动作,提升系数精度和可解释性,实现跨身份泛化和抗域移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18886 2026-03-19 cs.CV

MagicWorld: Towards Long-Horizon Stability for Interactive Video World Exploration

MagicWorld: 向交互视频世界探索的长时稳定迈进

Guangyuan Li, Bo Li, Jinwei Chen, Xiaobin Hu, Lei Zhao, Peng-Tao Jiang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo蓝影实验室,vivo移动通信有限公司) National University of Singapore(新加坡国立大学)

AI总结 本文提出MagicWorld模型,通过引入流引导运动保留约束和增强交互训练策略,解决复杂环境中运动漂移和长时交互误差累积问题,并构建RealWM120K数据集验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24384 2026-03-19 cs.CL cs.AI

HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment

HarmMetric Eval: 对LLM有害性评估的度量和裁判进行基准测试

Langqi Yang, Tianhang Zheng, Yixuan Chen, Kedong Xiu, Hao Zhou, Wangze Ni, Lei Chen, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Pretraining Team, xAI(预训练团队,xAI) Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

AI总结 本文提出HarmMetric Eval,用于评估有害性度量和裁判的质量,发现传统参考型指标在细粒度评估中表现优于LLM裁判,改进的裁判通过结合细粒度标准和参考型指标提升了效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01821 2026-03-19 cs.DC cs.AI cs.LG

Edge-Cloud Collaborative Computing on Distributed Intelligence and Model Optimization: A Survey

边缘-云协同计算在分布式智能与模型优化中的应用:综述

Jing Liu, Yao Du, Kun Yang, Jiaqi Wu, Yan Wang, Xiping Hu, Zehua Wang, Yang Liu, Peng Sun, Azzedine Boukerche, Victor C. M. Leung

机构 * Division of Natural and Applied Sciences, Duke Kunshan University(杜克-昆山大学自然科学与应用科学系) Department of Electrical and Computer Engineering, The University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系) College of Future Information Technology, Fudan University(复旦大学未来信息科技学院) Ant Group(蚂蚁集团) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

AI总结 本文综述了边缘-云协同计算在分布式智能与模型优化中的应用,探讨了核心架构、技术及挑战,包括模型压缩、适应与神经网络架构搜索,以及AI驱动的资源管理策略,同时分析了隐私保护、安全增强及实际部署案例。

Comments Accepted by IEEE ComST. 45 pages, 13 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17052 2026-03-19 cs.LG cs.AI

Early Quantization Shrinks Codebook: A Simple Fix for Diversity-Preserving Tokenization

早量化缩小代码表:一种维持多样性token化问题的简单修复

Wenhao Zhao, Qiran Zou, Rushi Shah, Yudi Wu, Zhouhan Lin, Dianbo Liu

机构 * National University of Singapore(国立新加坡大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文研究了向量量化中的坍塌问题,发现随机初始化和编码器容量限制导致token和嵌入坍塌,并提出缓解方案,是首次系统探讨该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14331 2026-03-19 cs.CV

AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising

AvatarForcing:通过局部-未来滑动窗口去噪实现一步流式谈话 avatars

Liyuan Cui, Wentao Hu, Wenyuan Zhang, Zesong Yang, Fan Shi, Xiaoqiang Liu

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Tsinghua University(清华大学)

AI总结 本文提出AvatarForcing,一种一步流式扩散框架,通过局部-未来滑动窗口去噪实现高实时性谈话 avatars,实验证明其在34ms/帧下具备高质量视觉和唇同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01525 2026-03-19 eess.IV cs.CV

Towards Clinical Practice in CT-Based Pulmonary Disease Screening: An Efficient and Reliable Framework

迈向基于CT的肺部疾病筛查的临床实践:一种高效且可靠的框架

Qian Shao, Bang Du, Yixuan Wu, Zepeng Li, Qiyuan Chen, Qianqian Tang, Jian Wu, Jintai Chen, Hongxia Xu

机构 * Zhejiang University(浙江大学) Shaoxing Tangtang Technology Co., Ltd.(绍兴唐唐科技有限公司) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出一种高效可靠的框架,通过簇基于采样和模糊性感知不确定性量化方法,在减少计算成本的同时保持诊断性能,实现快速准确的肺部疾病筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17049 2026-03-19 cs.CV cs.AI

From Geometric Mimicry to Comprehensive Generation: A Context-Informed Multimodal Diffusion Model for Urban Morphology Synthesis

从几何模仿到综合生成:一种基于上下文的多模态扩散模型用于城市形态合成

Fangshuo Zhou, Huaxia Li, Liuchang Xu, Rui Hu, Sensen Wu, Liang Xu, Hailin Feng, Zhenhong Du

机构 * Zhejiang Agriculture and Forestry University(浙江农业与林业大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学)

AI总结 本文提出ControlCity模型,通过多模态信息融合实现城市形态综合生成,提升了形态保真度和空间重叠度,实现了跨城市风格迁移和未知城市零样本生成。

Comments Accepted

Journal ref International Journal of Geographical Information Science (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.04264 2026-03-19 cs.LG

HighAir: A Hierarchical Graph Neural Network-Based Air Quality Forecasting Method

HighAir:一种基于分层图神经网络的空气质量预报方法

Ling Chen, Jiahui Xu, Binqing Wu, Mingqi Lv, Chaoqun Zhan, Sanjian Chen, Jian Chang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机科学学院) Alibaba Group(阿里巴巴集团)

AI总结 本文提出HighAir方法,通过分层图神经网络建模城市与监测站间污染物扩散过程,考虑天气和土地利用等复杂因素,提升空气质量预报精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16844 2026-03-18 cs.CV

M^3: Dense Matching Meets Multi-View Foundation Models for Monocular Gaussian Splatting SLAM

M^3:密集匹配与多视角基础模型结合的单目高斯点云SLAM

Kerui Ren, Guanghao Li, Changjian Jiang, Yingxiang Xu, Tao Lu, Linning Xu, Junting Dong, Jiangmiao Pang, Mulin Yu, Bo Dai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 本文提出M^3,结合多视角基础模型与单目高斯点云SLAM,通过引入匹配头提升密集对应关系,增强跟踪稳定性,在多种基准上取得优异的位姿估计和场景重建性能。

Comments Project page: https://city-super.github.io/M3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16781 2026-03-18 cs.CV cs.AI

IOSVLM: A 3D Vision-Language Model for Unified Dental Diagnosis from Intraoral Scans

IOSVLM:一种用于从牙科内窥扫描进行统一牙科诊断的3D视觉-语言模型

Huimin Xiong, Zijie Meng, Tianxiang Hu, Chenyi Zhou, Yang Feng, Zuozhu Liu

机构 * ZJU-UIUC Institute, Zhejiang University, Haining, 314400, China(浙大浙ICU研究所,浙江大学,海宁,314400,中国) Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine, Hangzhou, 310058, China(口腔医院,口腔医学院,浙江大学医学院,杭州,310058,中国) Angelalign Research Institute, Angel Align Inc., Shanghai, 200011, China(天使对齐研究院,天使对齐公司,上海,200011,中国)

AI总结 本文提出IOSVLM,一种端到端的3D视觉-语言模型,利用点云表示内窥扫描,并结合大规模多源数据集,提升牙科诊断和生成式视觉问答的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13856 2026-03-18 cs.LG cs.CV

OrigamiBench: An Interactive Environment to Synthesize Flat-Foldable Origamis

OrigamiBench: 一个用于合成可折叠折纸的交互环境

Naaisha Agarwal, Yihan Wu, Yichang Jian, Yikuan Hu, Nishad Mansoor, Mohan Li, Yifei Peng, Wang-Zhou Dai, Yao-Xiang Ding, Emanuele Sansone

机构 * Independent Researcher(独立研究者) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与计算机图形学国家重点实验室) Computer Science Northeastern University(东北大学计算机科学系) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) CSAIL / ESAT MIT / KU Leuven(MIT / KU Leuven)

AI总结 OrigamiBench通过交互式环境测试模型在折叠策略中的因果推理能力,发现单纯扩大模型规模无法有效生成多步骤折叠策略,表明视觉与语言表征仍需加强整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16341 2026-03-18 cs.CV

PKINet-v2: Towards Powerful and Efficient Poly-Kernel Remote Sensing Object Detection

PKINet-v2: 向强大且高效的多核遥感目标检测迈进

Xinhao Cai, Liulei Li, Gensheng Pei, Zeren Sun, Yazhou Yao, Wenguan Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) State Key Lab. of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室)

AI总结 本文提出PKINet-v2,通过统一的多核卷积框架解决遥感图像中几何与空间复杂性的挑战,提升检测精度与效率,实验表明其在多个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16306 2026-03-18 cs.CV

DriveFix: Spatio-Temporally Coherent Driving Scene Restoration

DriveFix:时空一致的驾驶场景修复

Heyu Si, Brandon James Denis, Muyang Sun, Dragos Datcu, Yaoru Li, Xin Jin, Ruiju Fu, Yuliia Tatarinova, Federico Landi, Jie Song, Mingli Song, Qi Guo

机构 * Zhejiang University(浙江大学) Huawei(华为)

AI总结 DriveFix提出一种多视角修复框架,通过交错扩散变换器架构和几何感知损失,实现驾驶场景时空一致性,提升4D世界建模的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16139 2026-03-18 cs.CV

Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training

重新思考UMM视觉生成:面向高效图像-only预训练的掩码建模

Peng Sun, Jun Xie, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学)

AI总结 本文提出IOMM框架,通过两阶段训练提升UMM视觉生成效率与性能,实验显示其在GenEval和WISE上优于现有基线。

Comments https://github.com/LINs-lab/IOMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06289 2026-03-18 cs.CV

FlowMotion: Training-Free Flow Guidance for Video Motion Transfer

FlowMotion: 无需训练的视频运动迁移流动引导

Zhen Wang, Youcan Xu, Jun Xiao, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) State key lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文提出FlowMotion,一种无需训练的视频运动迁移框架,通过直接利用基于流动的T2V模型预测输出,实现高效灵活的运动迁移。通过提取潜在预测的运动表示,对齐源视频与生成视频的运动模式,并引入速度正则化策略以稳定优化。

Comments CVPR 2026, Code: https://github.com/HKUST-LongGroup/FlowMotion

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01953 2026-03-18 cs.RO cs.AI cs.CV

Closed-Loop Action Chunks with Dynamic Corrections for Training-Free Diffusion Policy

闭环动作块与动态修正的训练无关扩散策略

Pengyuan Wu, Pingrui Zhang, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Institute of Artificial Intelligence, China Telecom Corp Ltd(中国电信人工智能研究院)

AI总结 本文提出DCDP框架,结合动作块生成与实时修正,提升动态场景下的适应性,无需重新训练,计算量仅增加5%,在动态PushT模拟中适应性提升19%。

Comments Accepted by ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26683 2026-03-18 cs.CL cs.AI

Evontree: Ontology Rule-Guided Self-Evolution of Large Language Models

Evontree:基于本体规则的大型语言模型自进化

Mingchen Tu, Zhiqiang Liu, Juan Li, Liangyurui Liu, Junjie Wang, Lei Liang, Wen Zhang

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Ant Group(蚂蚁集团)

AI总结 本文提出Evontree方法,通过提取领域本体知识、检测不一致性和自蒸馏微调,提升低资源专业领域LLM的自进化能力,实验表明其在医疗问答基准上准确率提升达3.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏