arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-08-18 至 2026-08-18 共收录 15
2608.16745 2026-08-18 cs.CV 新提交

VicEdit: Learning to Edit Videos from Visual In-Context Examples

VicEdit:从视觉上下文示例学习编辑视频

Yuji Wang, Teng Hu, Yuheng Chen, Ran Yi, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学)

AI总结 针对文本指令视频编辑难以传达细粒度视觉信息的问题,提出视觉上下文编辑新范式,构建VicEdit-400K数据集,开发VicEdit框架,在VicEditBench上实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16717 2026-08-18 cs.CV 新提交

PersonaShot: Benchmarking Person-Centric Narrative Continuity in Multi-Shot Video Generation

PersonaShot:多镜头视频生成中以人为中心的叙事连续性基准

Yuji Wang, Yuheng Chen, Teng Hu, Ran Yi, Yijia Hong, Han Feng, Weijian Cao, Chengjie Wang, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学)

AI总结 该研究针对多镜头视频生成中角色叙事连续性评估的不足,推出PersonaShot基准,设计三类特定评估器,发现先进模型感知质量与跨镜头连续性存在差距,评估器与人类专家判断一致性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16647 2026-08-18 cs.CL 新提交

Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models

硬币皆有两面:关于大型语言模型的策略内蒸馏中泛化的双重性质

Zhaoyi Li, Deyang Kong, Yuan Wei, Evan Yang, Ranran Shen, Mahardika Krisna Ihsani, Ming Yang, Wei Zhang, Chuan Hao, Jian Yang, Ran Tao, Bryan Dai, Shikun Zhang, Wei Ye, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) IQuest Research(IQuest研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Zhejiang University(浙江大学)

AI总结 本研究探究大型语言模型策略内蒸馏(OPD)的泛化特性,发现其迁移教师推理行为而非答案,同源配对泛化性强,异源配对适配性有限,多教师组合存在能力跷跷板效应,为诊断多教师OPD提供了视角。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16640 2026-08-18 cs.RO 新提交

DPNet: Efficient Dead-End Prediction and Avoidance for Vision-Based UAV Navigation

DPNet:面向基于视觉的无人机导航的高效死胡同预测与规避

Ruibin Zhang, Lun Pan, Zelong Xia, Jialiang Hou, Fei Gao

机构 * Huzhou Institute of Zhejiang University(浙江大学湖州研究院) University of Electronic Science and Technology of China(电子科技大学) Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院 cyber系统与控制研究所) Differential Robotics Technology Company(差分机器人技术公司)

AI总结 该研究针对基于视觉的无人机导航死胡同问题,提出轻量级神经网络DPNet,利用RGB-D输入预测死胡同并修剪轨迹库,实现50Hz高频重规划,跨场景无需标注微调,仿真与真实实验验证其优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16554 2026-08-18 cs.CL 新提交

Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning

询问、条件化或弃权:针对缺失前提推理的强化学习

Yongqi Tong, Zhenyu Zhang, Zimi Liu, Kewei Fu, Mingli Song, Haofei Zhang, Junshao Zhang, Hong Zhu, Jiang-Ming Yang, Xin Zhang, Jianshe Li

机构 * Ant International(蚂蚁国际) Zhejiang University(浙江大学) Dingtalk, Alibaba Group(阿里巴巴集团钉钉) Ant Group(蚂蚁集团)

AI总结 本研究提出ACA-RL框架,结合MPB基准,训练模型应对缺失前提的推理任务,可询问、条件化或弃权,提升欠定问题处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16513 2026-08-18 cs.CV cs.AI 新提交

MLLM-Guided Semantic Correction for Text-to-Video Generation

基于多模态大语言模型(MLLM)的文本到视频生成语义修正

Junhao Chen, Zheqi Lv, Keting Yin, Shengyu Zhang, Zhou Zhao, Feiyang Chen, Xinyu Duan, Baoxing Huai, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Cloud Computing Technology Co., Ltd.(华为云计算技术有限公司)

AI总结 该研究提出一种无需训练的MLLM引导文本到视频生成语义修正框架,通过两个关键模块在生成中修正语义偏差,提升了生成内容的语义对齐度等性能,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16485 2026-08-18 cs.CV 新提交

HiFi-BRep: High-Fidelity Latent Representation for Robust B-Rep Generation

HiFi-BRep:用于鲁棒边界表示(B-Rep)生成的高保真隐式表示

Junhao Hou, Chenqi Luo, Pufan Wang, Jiaying Lu, Yusheng Liu, Feiwei Qin, Meie Fang, Kun Zhou

机构 * Zhejiang University(浙江大学) Hangzhou Dianzi University(杭州电子科技大学) Guangzhou University(广州大学)

AI总结 HiFi-BRep是一种新型框架,通过拓扑感知编码器与单阶段解码器解决B-Rep生成的脆弱性问题,在结构有效性和几何保真度上优于现有最优方法,提供了鲁棒的B-Rep合成方案。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16465 2026-08-18 cs.AI 新提交

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills

JailbreakSkill:通过可复用且不断演进的技能扩展自动化红队测试

Xiaoyu Wen, Jiajia Li, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 本研究提出以技能为核心的JailbreakSkill框架,将攻击策略打包为可复用技能,通过攻击与学习的闭环演进技能,大幅提升攻击成功率,且技能可泛化至未见过的提示词与目标模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16417 2026-08-18 cs.CL 新提交

D2-ScaleAgent: Dual-Dimensional Scaling for Long Document Understanding

D2-ScaleAgent:面向长文档理解的双维度缩放方法

Hao Zhang, Longrong Yang, Lunhao Duan, Ziyang Wang, Qing-Guo Chen, Shanshan Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学)

AI总结 针对现有多模态RAG长文档理解方法缺乏动态计算缩放能力的问题,提出D2-ScaleAgent双维度缩放智能体框架,在相关基准上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16111 2026-08-18 cs.LG cs.AI 新提交

RetroMPA: A Molecular Property-Aware Auxiliary Framework for Enhancing Retrosynthesis Prediction

RetroMPA:一种用于增强逆合成预测的分子属性感知辅助框架

Mianzhi Liu, Fan Xiao, Zhiliang Yu, Huayang Huang, Yuke Li, Yi Yang, Wenbo Liu, Yu Wu

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全学院) School of Computer Science, Wuhan University(武汉大学计算机学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Chemistry and Molecular Sciences, Wuhan University(武汉大学化学与分子科学学院)

AI总结 RetroMPA是一种与模型无关的即插即用化学过滤器,通过注入化学知识增强逆合成预测,在USPTO-50K和USPTO-Full数据集上提升了多种模型的准确率,湿实验验证了其实际效用。

Comments Accepted for publication in Journal of Chemical Information and Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15924 2026-08-18 cs.RO 新提交

RAPAC-DP: Response-Aligned Pending-Action Compensation for Diffusion Policies under Delayed Execution

RAPAC-DP:延迟执行场景下扩散策略的响应对齐待执行动作补偿

Tao Wang, Wei Wang, Jianhui Wang, Qi Wang, Weidi Huang, Bing Xu

机构 * Zhejiang University(浙江大学) Midea Group(美的集团)

AI总结 本文针对云端部署模仿学习策略的延迟问题,提出RAPAC-DP框架,通过编码待执行动作补偿延迟,在Kinetix和RoboMimic任务中取得良好性能,验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15817 2026-08-18 cs.AI 新提交

RLCascadeRouter: Quality-Estimator-Free Cascade Routing via Reinforcement Learning

RLCascadeRouter:基于强化学习的无质量估计器级联路由

Shihong Huang, Shengjie Wang, Hong Ma, Zhou Xu

机构 * Polytechnic Institute, Zhejiang University(浙江大学理工学院) The Hong Kong Polytechnic University(香港理工大学)

AI总结 该研究针对LLM路由的灵活性问题,提出RLCascadeRouter框架,将级联路由建模为马尔可夫决策过程,无需质量估计器,在LLMRouterBench基准上实现了更优的性能-成本权衡,且可纳入未见模型无需重训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15788 2026-08-18 cs.CV 新提交

ChainSpace: A Chained-Reasoning Paradigm for Spatial Intelligence

ChainSpace:面向空间智能的链式推理范式

Xiaohan Zhang, Feng Gu, Xudong Rao, Xuhao Pan, Tao Wei, Zhou Pan, Kun Zhan

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Li Auto Inc.(理想汽车有限公司)

AI总结 针对现有空间推理方法的缺陷,提出ChainSpace链式推理范式,构建对应基准与训练框架,相关模型在基准上表现最优且可迁移至多类外部基准,为空间智能评估与学习提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15580 2026-08-18 cs.AI cs.CV 新提交

From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM

从通用到专用:基于冻结视觉语言模型(VLM)的内窥镜息肉报告上下文融合框架

Ruijie Yang, Yan Zhu, Peiyao Fu, Siyuan Li, Te Luo, Zhihua Wang, Quanlin Li, Pinghong Zhou, Xian Yang, Shuo Wang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院) Shanghai Key Laboratory of MICCAI(上海市MICCAI重点实验室) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学附属中山医院内镜中心及内镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海市内镜协同创新中心) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院)

AI总结 本研究针对内窥镜息肉报告需求,提出一种不修改预训练权重的上下文融合框架,通过隐式指令与显式转换上下文对冻结通用VLM专用化,在2056张标注图像实验中实现最优性能且参数量仅为冻结VLM的0.006%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14730 2026-08-18 cs.CV cs.CR cs.LG 新提交

IP Protection in the Era of Visual Generative AI: A Survey

视觉生成AI时代的知识产权保护:一项综述

Zhuan Shi, Shunchang Liu, Alireza Dehghanpour Farashah, Qian Yang, Han Yu, Cao Yang, Chaochao Chen, Yuping Yan, Yaochu Jin, Golnoosh Farnadi, Lingjuan Lyu

机构 * Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) EPFL(洛桑联邦理工学院) Université de Montréal(蒙特利尔大学) Nanyang Technological University(南洋理工大学) Science Tokyo(东京理科大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Sony Research(索尼研究院)

AI总结 本综述针对视觉生成AI带来的知识产权风险,提出二维分类体系梳理相关防御方法,对齐评估协议并探讨挑战,为该领域研究者提供系统概述。

Comments 35 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏