arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 251
2605.20183 2026-06-25 cs.CV 版本更新

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

MSAVBench:面向多镜头音频-视频生成的全面可靠评估

Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu, Quanhao Li, Zhiwu Qing, Xiang Wang, Zhen Xing, Ruihang Chu, Lingyi Hong, Yefei He, Junjie Zhou, Junqiu Yu, Yang Shi, Difan Zou, Kai Zhu, Shiwei Zhang, Yingya Zhang, Yu Liu, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 提出首个多镜头音频-视频生成基准MSAVBench,通过自适应混合评估框架在四个维度上系统评估19个模型,发现当前系统在导演级控制和细粒度音视频同步上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19297 2026-06-25 cs.CV 版本更新

VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction

VolSplat: 重新思考基于体素对齐预测的前馈式3D高斯泼溅

Weijie Wang, Yeqing Chen, Zeyu Zhang, Hengyu Liu, Haoxiao Wang, Zhiyuan Feng, Wenkang Qin, Feng Chen, Jia-Wang Bian, Zheng Zhu, Donny Y. Chen, Bohan Zhuang

机构 * Zhejiang University(浙江大学) GigaAI University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) The University of Adelaide(阿德莱德大学) Nanyang Technological University(南洋理工大学) Monash University(莫纳什大学)

AI总结 针对前馈式3D高斯泼溅中像素对齐预测的局限性,提出体素对齐的VolSplat方法,通过从预测的3D体素网格直接预测高斯,实现鲁棒的多视图一致性和更优的几何与渲染质量。

Comments ECCV 2026, Project Page: https://lhmd.top/volsplat, Code: https://github.com/ziplab/VolSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11606 2026-06-25 cs.CV 版本更新

Articulat3D: Reconstructing Articulated Digital Twins From Monocular Videos with Geometric and Motion Constraints

Articulat3D: 从单目视频中利用几何和运动约束重建关节式数字孪生

Lijun Guo, Haoyu Zhao, Xingyue Zhao, Rong Fu, Linghao Zhuang, Siteng Huang, Zhongyu Li, Hua Zou

机构 * Wuhan University(武汉大学) Hong Kong Embodied AI Lab(香港具身AI实验室) The Chinese University of Hong Kong(香港中文大学) Peking Union Medical College(北京协和医学院) University of Macau(澳门大学) Zhejiang University(浙江大学)

AI总结 提出Articulat3D框架,通过运动先验初始化和几何运动约束优化,从单目视频重建高保真关节式数字孪生,在合成和真实数据上达到最优性能。

Comments Accepted to ECCV 2026. 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25691 2026-06-24 cs.RO 版本更新

Learning-Based Dynamics Modeling and Robust Control for Tendon-Driven Continuum Robots

基于学习的动力学建模与鲁棒控制的腱驱动连续机器人

Ziqing Zou, Ke Qiu, Fei Wang, Haojian Lu, Rong Xiong, Yue Wang

机构 * Department of Control Science and Engineering, Zhejiang University(控制科学与工程系,浙江大学)

AI总结 本文提出一种可微学习框架,结合高保真动力学建模与鲁棒神经控制,通过GRU模型抑制长周期自回归预测中的误差,实验证明在腱驱动连续机器人上实现高精度跟踪和强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06021 2026-06-23 cs.LG cs.AI 版本更新

OPRD: On-Policy Representation Distillation

OPRD: 在线策略表示蒸馏

Shenzhi Yang, Guangcheng Zhu, Bowen Song, Haobo Wang, Mingxuan Xia, Xing Zheng, Yingfan Ma, Zhongqi Chen, Weiqiang Wang, Junbo Zhao, Gang Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 针对在线策略蒸馏中输出空间监督的采样方差和忽略中间隐藏状态的问题,提出OPRD方法,通过在隐藏状态空间对齐师生表示,消除采样方差、提供更丰富的逐层结构信息,并在AIME等基准上缩小师生差距,训练速度提升1.44倍,内存减少54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24354 2026-06-23 cs.CV 版本更新

SparseWorld: Enhancing End-to-End Autonomous Driving via World Models with Sparse Scene Representation

SparseWorld: 通过具有稀疏场景表示的世界模型增强端到端自动驾驶

Ruoyu Wang, Jingke Wang, Yukai Ma, Yuehao Huang, Shuangming Lei, Guanglin Xu, Aixue Ye, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学控制系统研究所) Labs, Huawei(华为2012实验室) State Key Laboratory of Industrial Control Technology(国家工业控制技术重点实验室)

AI总结 提出SparseWorld,一种基于稀疏场景表示的轻量级世界模型,通过自回归预测未来地图元素和周围智能体,并利用预测结果优化下游运动预测和轨迹规划,在nuScenes数据集上实现0.05%的碰撞率,达到开放循环规划指标的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08945 2026-06-23 cs.CV 版本更新

MLCR: Multi-Level Cue Refinement for Long-Term Multimodal Action Quality Assessment

PIDNet: 逐步隐式解耦网络用于多模态动作质量评估

Qiqi Li, Pengfei Wang, Hongyu Chen, Nenggan Zheng

机构 * Qiushi Academy for Advanced Studies (QAAS), Zhejiang University(浙江大学启斯特先进研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Lab of Brain-Machine Intelligence(脑机智能国家重点实验室) Collaborative Innovation Center for Artificial Intelligence by MOE and Zhejiang Provincial Government (ZJU)(教育部-浙江省人工智能协同创新中心) Zhejiang Lab(浙江实验室)

AI总结 本文提出PIDNet,通过逐步整合多模态信息与全局质量语义,提升多模态动作质量评估的准确性。采用iMambaWave模块和三阶段融合网络,有效解耦模态特定信息并增强特征表示。

Comments 14 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24198 2026-06-23 cs.CL cs.AI cs.CE cs.LG cs.MA 版本更新

Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis

奖励科学过程:面向代理数据分析的过程级奖励建模

Zhisong Qiu, Shuofei Qiao, Kewei Xu, Yuqi Zhu, Lun Du, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 本文提出DataPRM,一种环境感知的生成过程奖励模型,通过主动验证和反思意识的三元奖励策略,提升动态数据分析任务中代理的性能,实验表明其在多个基准测试中表现优异。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10757 2026-06-23 cs.CV 版本更新

CodePercept: Code-Grounded Visual STEM Perception for MLLMs

CodePercept: 基于代码的MLLM视觉STEM感知

Tongkun Guan, Zhibo Yang, Jianqiang Wan, Mingkun Yang, Zhengtao Guo, Zijian Hu, Ruilin Luo, Ruize Chen, Songtao Jiang, Peng Wang, Wei Shen, Junyang Lin, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) Qwen Team(通义实验室) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09316 2026-06-23 cs.CV cs.AI cs.LG 版本更新

CLoE: Expert Consistency Learning for Robust Missing Modality Segmentation

CLoE: 面向鲁棒缺失模态分割的专家一致性学习

Xinyu Tong, Meihua Zhou, Bowu Fan, Haitao Li

机构 * University of Chinese Academy Sciences(中国科学院大学) School of Medicine, Southeast University(东南大学医学院) Zhejiang University(浙江大学)

AI总结 提出CLoE框架,通过模态专家一致性和区域专家一致性双重目标,结合可靠性感知门控网络,解决多模态分割中模态缺失导致的专家分歧和不稳定融合问题,在BraTS 2020和MSD Prostate上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17385 2026-06-23 cs.LG cs.AI 版本更新

Strengthening LLMs for Tabular Prediction with Structural Priors

利用结构先验增强LLM在表格预测中的能力

Pengxiang Cai, Zihao Gao, Wanchen Lian, Guocong Li, Jintai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学)

AI总结 提出PRPO方法,通过列排列不变性和两级优势估计将表格结构先验融入LLM后训练,使8B模型在139个OpenML数据集上达到与强监督基线竞争的性能,零样本设置下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22126 2026-06-23 cs.RO 版本更新

EasyUUV: An LLM-Enhanced Universal and Lightweight Sim-to-Real Reinforcement Learning Framework for UUV Attitude Control

EasyUUV:一种用于UUV姿态控制的LLM增强通用轻量级仿真到现实强化学习框架

Guanwen Xie, Jingzehua Xu, Jiwei Tang, Yubo Huang, Zixi Wang, Shuai Zhang, Dongfang Ma, Juntian Qu, Xiaofan Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) School of Civil Engineering, Southwest Jiaotong University(西南交通大学土木工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) Ocean College, Zhejiang University(浙江大学海洋学院)

AI总结 提出EasyUUV框架,结合并行强化学习与混合控制架构,并集成多模态大语言模型自适应调整参数,实现UUV姿态控制的鲁棒性和泛化性,经仿真与实船验证。

Comments 12 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20904 2026-06-23 eess.IV cs.LG 版本更新

ECGFlowCMR: Pretraining with ECG-Generated Cine CMR Helps Cardiac Disease Classification and Phenotype Prediction

ECGFlowCMR: 利用心电图生成电影心脏磁共振的预训练助力心脏病分类和表型预测

Xiaocheng Fang, Zhengyao Ding, Guangkun Nie, Jieyi Cai, Yujie Xiao, Bo Liu, Jiarui Jin, Haoyu Wang, Shun Huang, Ting Chen, Hongyan Li, Shenda Hong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Polytechnic Institute of Zhejiang University, Zhejiang University(浙江大学 polytechnic 院) Institute of Computing Technology, University of the Chinese Academy of Sciences(中国科学院计算技术研究所) National Institute of Health Data Science, Peking University(北京大学健康数据科学国家研究院) Institute of Microelectronics, University of the Chinese Academy of Sciences(中国科学院微电子研究所) Department of Cardiology, Zhejiang University(浙江大学心内科部)

AI总结 提出ECGFlowCMR框架,通过相位感知掩码自编码器和解剖运动解耦流解决ECG与CMR的跨模态时序错配和解剖可观测性差距,生成逼真电影CMR序列,提升下游心脏病分类和表型预测性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20209 2026-06-23 cs.LG cs.CL 版本更新

Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning

Spark: 通过动态分支进行战略性策略感知探索以实现长周期智能体学习

Jinyang Wu, Shuo Yang, Changpeng Yang, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 提出Spark框架,通过关键状态动态分支实现资源高效探索,在长周期任务中以更少样本取得更高成功率和泛化能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06676 2026-06-23 cs.CL cs.AI cs.HC 版本更新

One Interaction Is Worth a Thousand Guesses: Benchmarking the Interactive Capabilities of Deep Research Agents

一次交互胜过千次猜测:深度研究代理的交互能力基准测试

Yingchaojie Feng, Qiang Huang, Xiaoya Xie, Zhaorui Yang, Jun Yu, Wei Chen, Anthony K. H. Tung

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Zhejiang University(浙江大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 提出IDRBench基准,通过交互式框架和用户模拟器评估深度研究代理的交互能力,实验表明交互能提升研究质量和鲁棒性。

Comments 17 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05890 2026-06-23 cs.AI 版本更新

StackPlanner: A Centralized Hierarchical Multi-Agent System with Task-Experience Memory Management

StackPlanner: 一种具有任务经验记忆管理的集中式分层多智能体系统

Ruizhe Zhang, Xinke Jiang, Zhibang Yang, Zhixin Zhang, Jiaran Gao, Yuzhen Xiao, Tao Feng, Yue Fang, Yuxuan Liu, Ruiqing Li, Hongbin Lai, Huheng Huang, Xu Chu, Junfeng Zhao, Yasha Wang

机构 * School of Computer Science, Peking University(北京大学计算机学院) National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Public Affaris, Zhejiang University(浙江大学公共管理学院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院) GRG Banking Equipment Co., Ltd.(GRG银行设备有限公司) Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿中心) Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海))

AI总结 提出StackPlanner分层多智能体框架,通过显式记忆控制解耦高层协调与子任务执行,并利用结构化经验记忆和强化学习复用协调经验,解决长期协作中的记忆膨胀和错误累积问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22973 2026-06-23 cs.CV 版本更新

BIFE: Better Interaction, Fewer Errors for Minute-Long Video Generation

BIFE:更好的交互,更少的错误,用于分钟级视频生成

Zeyu Zhang, Jinyuan Mao, Shuning Chang, Yuanyu He, Yizeng Han, Jiasheng Tang, Fan Wang, Bohan Zhuang

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Zhejiang University(浙江大学) Hupan Lab(虎扑实验室)

AI总结 提出BIFE框架,通过语义稀疏KV缓存和块强制训练策略,解决长视频生成中的长程交互保持和误差累积问题,实现稳定连贯的分钟级视频生成,在VDE指标上提升约20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23650 2026-06-23 cs.RO 版本更新

KiVi: Kinesthetic-Visuospatial Integration for Dynamic and Safe Egocentric Legged Locomotion

KiVi: 动觉-视觉空间整合用于动态且安全的自我中心腿部运动

Peizhuo Li, Hongyi Li, Yuxuan Ma, Linnan Chang, Xinrong Yang, Ruiqi Yu, Shuhao Liao, Yifeng Zhang, Yuhong Cao, Qiuguo Zhu, Guillaume Sartoretti

机构 * MARMot Lab, National University of Singapore(新加坡国立大学MARMot实验室) Center of X-Mechanics, Zhejiang University(浙江大学X力学中心) Robot and Robot Intelligence Lab, Zhejiang University(浙江大学机器人与机器人智能实验室)

AI总结 提出KiVi框架,通过分离动觉与视觉空间通路,以本体感觉为稳定主干并选择性整合视觉信息,实现四足机器人在复杂地形和户外环境中的鲁棒运动。

Comments \c{opyright} 20XX IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31158 2026-06-19 cs.CV cs.LG 版本更新

Light Interaction: Training-Free Inference Acceleration for Interactive Video World Models

光交互:交互式视频世界模型的免训练推理加速

Jiacheng Lu, Haoyi Zhu, Sipei Yi, Enze Xie, Yu Li, Cheng Zhuo

机构 * Zhejiang University(浙江大学) NVIDIA

AI总结 针对交互式视频世界模型推理成本高的问题,提出免训练加速框架Light Interaction,通过自适应上下文管理、去噪缓存加速和3D块稀疏注意力实现最高2.59倍加速。

Comments 13 pages, 6 figures, 3 tables. Project page: https://2843721358l-del.github.io/Light-Interaction-Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17006 2026-06-19 cs.CV cs.RO 版本更新

CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning

CoMo: 从互联网视频中学习连续潜在运动以实现可扩展的机器人学习

Jiange Yang, Yansong Shi, Haoyi Zhu, Mingyu Liu, Kaijing Ma, Yating Wang, Gangshan Wu, Tong He, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Lab(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Tongji University(同济大学)

AI总结 提出CoMo方法,通过早期时间差分和时序对比学习从互联网视频中学习连续潜在运动,避免离散化信息损失,实现零样本泛化生成伪动作标签,联合训练策略在仿真和真实实验中表现优异。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17015 2026-06-19 cs.AI cs.MA cs.RO 版本更新

UniMM: A Unified Mixture Model Framework for Multi-Agent Simulation

UniMM:一种用于多智能体仿真的统一混合模型框架

Longzhong Lin, Xuewu Lin, Kechun Xu, Haojian Lu, Lichao Huang, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Horizon Robotics

AI总结 提出UniMM框架统一回归混合模型与离散NTP模型,通过闭环样本生成缓解分布偏移,并在WOSAC基准上取得最优性能。

Comments Accepted author manuscript. The version of record has been published in IEEE Transactions on Pattern Analysis and Machine Intelligence

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, Early Access, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07775 2026-06-19 cs.LG 版本更新

Self-attention-based non-linear basis transformations for compact latent space modelling of dynamic optical fibre transmission matrices

基于自注意力的非线性基变换用于动态光纤传输矩阵的紧凑潜在空间建模

Yijie Zheng, Robert J. Kilpatrick, David B. Phillips, George S. D. Gordon

机构 * Optics and Photonics research group, University of Nottingham, UK(诺丁汉大学光学与光子学研究组,英国) University of Exeter, UK(埃克塞特大学,英国) State Key Laboratory of Extreme Photonics and Instrumentation, College of Optical Science and Engineering International Research Center for Advanced Photonics, Zhejiang University, Hangzhou, China(极端光子学与仪器国家重点实验室,浙江大学光科学与工程学院,国际先进光子学研究中心,中国杭州) Research Center for Humanoid Sensing, Zhejiang Lab, Hangzhou, China(人感知研究中心,浙江实验室,中国杭州)

AI总结 提出使用自注意力层动态变换光纤矩阵的坐标表示到紧凑基,实现低维表示,在多个数据集上验证了基稀疏性(参与比0.01-0.11)和低重建误差(<10%)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09344 2026-06-18 cs.AI stat.ML 版本更新

Robust Regularized Policy Iteration under Transition Uncertainty

鲁棒正则化策略迭代在转移不确定性下

Hongqiang Lin, Zhenghui Fu, Weihao Tang, Pengfei Wang, Yiding Sun, Qixian Huang, Dongxu Zhang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) School of Artificial Intelligence, Optics and Electronics (iOPEN), Northwestern Polytechnical University, Xi'an, China(西北工业大学人工智能、光学与电子学院(iOPEN)) School of Software Technology, Zhejiang University, Hangzhou, China(浙江大学软件技术学院) School of Software Engineering, Xi'an Jiaotong University, Xi'an, China(西安交通大学软件工程学院) School of Systems Science and Engineering, Sun Yat-sen University, Guangzhou, China(中山大学系统科学与工程学院)

AI总结 提出鲁棒正则化策略迭代(RRPI),通过将离线强化学习建模为鲁棒策略优化,使用KL正则化替代难解的双层目标,并基于鲁棒正则化贝尔曼算子实现高效策略迭代,理论保证收敛性,实验在D4RL基准上表现优异。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13196 2026-06-18 cs.LG 版本更新

KEPLA: A Knowledge-Enhanced Deep Learning Framework for Accurate Protein-Ligand Binding Affinity Prediction

KEPLA:一种用于精确预测蛋白质-配体结合亲和力的知识增强深度学习框架

Han Liu, Keyan Ding, Peilin Chen, Yinwei Wei, Liqiang Nie, Dapeng Wu, Shiqi Wang

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科技创新中心) School of Software, Shandong University(山东大学软件学院) College of Informatics, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机学院)

AI总结 提出KEPLA框架,通过整合基因本体和配体属性的先验知识,利用全局表示对齐与局部交叉注意力,提升蛋白质-配体结合亲和力预测的准确性,在多个基准数据集上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07531 2026-06-18 cs.CV cs.AI cs.LG cs.MM 版本更新

VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation

VidCRAFT3: 面向图像到视频生成的相机、物体与光照控制

Sixiao Zheng, Zimian Peng, Yanpeng Zhou, Yi Zhu, Hang Xu, Xiangru Huang, Yanwei Fu

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Westlake University(西湖大学) School of Data Science and MOE Frontiers Center for Brain Science, Fudan University(复旦大学数据科学学院和脑科学前沿中心) Fudan ISTBI–ZJNU Algorithm Centre for Brain-inspired Intelligence, Zhejiang Normal University(复旦大学-浙江师范大学脑启发智能算法中心)

AI总结 提出VidCRAFT3框架,通过显式建模几何、运动与光照的跨因素交互,实现对相机运动、物体运动和光照方向的独立或联合控制,在控制精度和视觉一致性上达到最优。

Comments Accepted to TVCG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14653 2026-06-18 cs.CL 版本更新

UMA-Split: unimodal aggregation for both English and Mandarin non-autoregressive speech recognition

UMA-Split:面向英语和普通话的非自回归语音识别的单峰聚合

Ying Fang, Xiaofei Li

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究学院技术研究所)

AI总结 针对UMA在英语等语言中因token粒度不匹配导致性能下降的问题,提出UMA-Split,通过分割模块使每个聚合帧映射到多个token,提升非自回归语音识别的跨语言性能。

Comments Accepted by ICASSP 2026. Code:https://github.com/FnoY0723/uma_split

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15595 2026-06-18 cs.AI cs.CL cs.LG 版本更新

A Comprehensive Survey of Direct Preference Optimization: Datasets, Theories, Variants, and Applications

直接偏好优化综述:数据集、理论、变体及应用

Wenyi Xiao, Zechuan Wang, Leilei Gan, Shuai Zhao, Zongrui Li, Ruirui Lei, Wanggui He, Luu Anh Tuan, Long Chen, Hao Jiang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团)

AI总结 综述直接偏好优化(DPO)在理论、变体、数据集和应用方面的进展,指出其作为RL-free替代方案的潜力与局限,并提出未来研究方向。

Comments Accepted by TPAMI 2026. Project page: https://github.com/Mr-Loevan/DPO-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20708 2026-06-17 cs.CV cs.AI 版本更新

Rethinking Cross-Layer Information Routing in Diffusion Transformers

重新思考扩散变换器中的跨层信息路由

Chao Xu, Maohua Li, Qirui Li, Yixuan Xu, Yanke Zhou, Yunhe Li, Cuifeng Shen, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

机构 * Nanjing University(南京大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学)

AI总结 本文研究了扩散变换器中跨层信息流动的问题,通过系统性的实证分析,识别了传统残差加法的三个具体症状,并提出了扩散适应性路由(DAR)方法,以实现可学习、时间步适应和非递增的子层输出聚合,从而提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15980 2026-06-17 cs.CV 版本更新

Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization

Flash-GRPO:通过单步策略优化实现视频扩散的高效对齐

Xiaoxuan He, Siming Fu, Zeyue Xue, Weijie Wang, Ruizhe He, Yuming Li, Dacheng Yin, Shuai Dong, Haoyang Huang, Hongfa Wang, Nan Duan, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Joy Future Academy(京东探索研究院) Independent Researcher(独立研究员) Tsinghua University(清华大学)

AI总结 提出Flash-GRPO单步训练框架,通过等时分组和时间梯度校正解决计算瓶颈,在低计算预算下实现优于全轨迹训练的对齐质量和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18492 2026-06-17 cs.LG 版本更新

AIMER: Calibration-Free Task-Agnostic MoE Expert Pruning

AIMER: 免校准任务无关的MoE专家剪枝

Zongfang Liu, Guangyi Chen, Shengkun Tang, Yifan Shen, Huan Wang, Xin Yuan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出AIMER方法,通过专家权重的集中度模式识别独特专家,实现免校准的任务无关MoE专家剪枝,在7B至47B模型上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏