arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2909
2605.18160 2026-06-03 cs.CV cs.AI

Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

Vision Inference Former:在多模态大语言模型中维持视觉一致性

Xinpeng Dong, Min Zhang, Kairong Han, Xu Tan, Fei Wu, Kun Kuang

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Zhejiang University of Science and Technology(浙江理工大学)

AI总结 针对多模态大语言模型中视觉信息被弱化的问题,提出Vision Inference Former(VIF)轻量模块,在推理解码阶段持续注入视觉语义,提升生成内容与视觉的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25928 2026-06-03 cs.CL

CogRAG: Tackling Heterogeneous Cognitive Demands in RAG via Stratified Retrieval and Reasoning

CogRAG:通过分层检索与推理应对RAG中的异构认知需求

Xudong Wang, Zilong Wang, Kui Su, Zhaoyan Ming

机构 * School of Computer and Computing Science, Hangzhou City University(杭州城市大学计算机与计算科学学院) Innovation Center of Yangtze River Delta, Zhejiang University(长三角创新中心,浙江大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究院)

AI总结 提出CogRAG框架,基于布鲁姆分类法预测查询的认知负荷,协调认知自适应证据精炼与认知分层结构化推理,解决RAG中不同任务的异构认知需求,在注册营养师资格考试中将Qwen3-8B准确率提升至85.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02779 2026-06-03 cs.LG

Optimal Rates for Generalization of Gradient Descent for Deep ReLU Classification

深度ReLU分类中梯度下降泛化的最优速率

Yuanfan Li, Yunwen Lei, Zheng-Chu Guo, Yiming Ying

机构 * School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院) Department of Mathematics, The University of Hong Kong(香港大学数学系) School of mathematics and statistics, University of Sydney(悉尼大学数学与统计学学院)

AI总结 针对深度ReLU网络,通过权衡优化与泛化误差,在NTK可分离假设下证明了梯度下降的泛化误差率为~O(L^6/(nγ^2)),与SVM最优率仅差深度相关因子,关键技术是控制参考模型附近的激活模式以得到更紧的Rademacher复杂度界。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08173 2026-06-03 cs.AI

The Agent's First Day: Benchmarking Learning, Exploration, and Scheduling in the Workplace Scenarios

Agent 的第一天:在工作场景中基准测试学习、探索和调度

Daocheng Fu, Jianbiao Mei, Rong Wu, Xuemeng Yang, Jia Xu, Ding Wang, Pinlong Cai, Yong Liu, Licheng Wen, Botian Shi

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对多模态大语言模型在动态工作场景中面临的任务调度、主动探索和持续学习三大挑战,提出动态评估环境 EvoEnv,实验表明现有 agent 在这些方面存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
1108.5359 2026-06-03 math.NA cs.CV cs.NA

Solving Principal Component Pursuit in Linear Time via $l_1$ Filtering

通过 $l_1$ 滤波在线性时间内求解主成分追踪

Risheng Liu, Zhouchen Lin, Siming Wei, Zhixun Su

机构 * School of Mathematical Sciences, Dalian University of Technology(大连理工大学数学科学学院) Key Lab. of Machine Perception (MOE), Peking University(北京大学机器感知重点实验室) Microsoft Research Asia(微软亚洲研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 提出一种名为 $l_1$ 滤波的算法,以 $O(r^2(m+n))$ 复杂度精确求解主成分追踪问题,实现线性时间内的核范数最小化,并具有高度可并行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1012.0365 2026-06-03 math.NA cs.AI cs.NA math.OC

A Block Lanczos with Warm Start Technique for Accelerating Nuclear Norm Minimization Algorithms

一种加速核范数最小化算法的块Lanczos热启动技术

Zhouchen Lin, Siming Wei

机构 * Microsoft Research Asia(微软亚洲研究院) Zhejiang University(浙江大学)

AI总结 提出块Lanczos热启动(BLWS)技术,利用前次迭代的主奇异子空间初始化块Lanczos过程以加速核范数最小化算法中的部分SVD计算,实验表明可加速2-3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02441 2026-06-02 cs.CV

Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation

空间-时间解耦参考条件用于身份保持的文本到视频生成

Yuheng Chen, Teng Hu, Yuji Wang, Qingdong He, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学)

AI总结 提出ST-DRC框架,通过空间-时间解耦参考条件、TASS-RoPE机制和身份目标,实现高保真身份保持视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02313 2026-06-02 cs.RO

Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO

迈向精确意图对齐的VLA空中导航:基于专家引导的GRPO

Tianyang Chen, Wenjun Li, Xin zhou, Yuze Wu, Fei Gao

机构 * Zhejiang University Differential Robotics(浙江大学差分机器人实验室)

AI总结 提出EG-GRPO框架,通过专家数据增强在线rollout和异构并行流水线,解决VLA模型在无人机导航中因数据稀缺和探索低效导致的意图对齐问题,成功率提升至SFT基线的2.13倍,意图对齐性能提升60.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02302 2026-06-02 cs.CR cs.AI

SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents

SeClaw: 面向自主代理评估的规范驱动安全任务合成

Hao Cheng, Changtao Miao, Tianle Song, Yin Wu, He Liu, Erjia Xiao, Junchi Chen, Xiaoyu Shi, Yichi Wang, Jing Yang, Taowen Wang, Jinhao Duan, Mengshu Sun, Peiyan Dong, Xuan Shen, Yang Cao, Renjing Xu, Kaidi Xu, Jindong Gu, Bo Zhang, Jize Zhang, Chenhao Lin, Philip Torr, Chao Shen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Xi’an Jiaotong University(西安交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) City University of Hong Kong(香港城市大学) Institute of Science Tokyo(东京科学研究所) Zhejiang University(浙江大学) Massachusetts Institute of Technology(麻省理工学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Beijing University of Technology(北京理工大学)

AI总结 提出SeClaw框架,通过规范驱动的安全任务合成与基于执行的安全评估,实现对自主LLM代理在状态化环境中的安全风险的可扩展、可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02178 2026-06-02 cs.CV cs.AI

Order within Chaos: Capturing Intrinsic Energy Anomalies for AI-Manipulated Image Forgery Localization

混沌中的秩序:捕捉AI操纵图像伪造定位的内在能量异常

Yiming Wang, Baiqi Wu, Qingming Li, Jiahao Chen, Tong Zhang, Shouling Ji

机构 * Zhejiang University(浙江大学)

AI总结 本文提出FLAME框架,利用扩散过程抑制局部高频方差产生的统计能量间隙,结合LAD图和SAM适配器实现像素级伪造定位,并引入EditStream流水线持续合成训练数据,在AI生成伪造数据集上达到最先进性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02170 2026-06-02 cs.CL

CRAFTQA: A Code-Driven Adaptive Framework for Complex Structured Data Reasoning

CRAFTQA: 一种用于复杂结构化数据推理的代码驱动自适应框架

Chengtao Gan, Zhiqiang Liu, Long Jin, Yushan Zhu, Lei Liang, Wen Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) JIUTIAN Research(JIUTIAN研究) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

AI总结 提出CRAFTQA框架,通过CodeSTEP模块生成逐步代码推理序列,并利用CRAFT模块动态生成自定义代码函数,以突破预定义函数集的限制,在复杂结构化数据推理任务中显著优于现有统一方法。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02129 2026-06-02 cs.CV

Equilibrated Diffusion: Frequency-aware Textual Embedding for Equilibrated Image Customization

均衡扩散:面向均衡图像定制的频率感知文本嵌入

Liyuan Ma, Xueji Fang, Guo-Jun Qi

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学)

AI总结 提出均衡扩散方法,通过频率空间分解概念特征并独立优化嵌入,实现风格与主体解耦,提升定制图像的保真度和文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02000 2026-06-02 cs.CV cs.AI eess.IV

Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization

迈向3D感知视频扩散模型:基于网格标记化的无渲染人体运动控制

Jingyun Liang, Min Wei, Shikai Li, Yizeng Han, Hangjie Yuan, Lei Sun, Weihua Chen, Fan Wang

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团大模型实验室) Hupan Lab(虎盘实验室) Zhejiang University(浙江大学) INSAIT

AI总结 提出一种无渲染框架,通过压缩的3D人体网格标记直接条件化视频生成,实现精确的人体运动控制,减少2D引导伪影并提升3D结构建模能力。

Comments Project page: https://jingyunliang.github.io/MeshToken/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01952 2026-06-02 cs.LG

Randomized Least Squares Value Iteration itself is Joint Differentially Private

随机最小二乘值迭代本身是联合差分隐私的

Haiyang Lu, Pratik Gajane, Shaojie Bai, Mohammad Sadegh Talebi

机构 * Laboratoire d’Informatique Fondamentale d’Orléans (LIFO), Université d’Orléans(奥尔良基础信息学实验室(LIFO),奥尔良大学) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

AI总结 研究随机探索算法RLSVI在表格MDP中的隐私保护,证明其内在噪声同时提供联合差分隐私保证。

Comments 12 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01891 2026-06-02 cs.GR cs.LG

MidSurfNet: Learnable Face Pairing and Interference Implicit Fields for Generalized Mid-surface Abstraction

MidSurfNet:面向广义中面抽象的可学习面配对与干涉隐式场

Li Ye, Xinhang Zhou, Xingyu Yang, Ruofeng Tong, Hailong Li, Peng Du, Min Tang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shenzhen Poisson Software Co., Ltd.(深圳波森软件有限公司)

AI总结 提出MidSurfNet框架,通过可学习的面配对模块和干涉隐式场,解决薄壁CAD模型中多壁厚、自匹配及非中心偏移等复杂场景的中面抽象问题,实现87.32%的面配对准确率。

Comments 20 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01813 2026-06-02 cs.CL

Cost-Aware Diffusion Draft Trees for Speculative Decoding

用于推测解码的成本感知扩散草稿树

Shuai Zhang, Huachuan Qiu, Hongliang He, Yong Dai

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

AI总结 提出CaDDTree方法,通过联合优化树结构和节点预算直接最大化令牌吞吐量,并证明在凸验证成本下吞吐量函数是单峰的,从而无需离线预算搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01702 2026-06-02 cs.GR cs.LG

KDH-CAD: Knowledge-data hybrid CAD learning under data scarcity

KDH-CAD:数据稀缺下的知识-数据混合CAD学习

Ziqin Gao, Zhijie Yang, Qiang Zou

机构 * State Key Laboratory of CAD \& CG, Zhejiang University, Hangzhou, 310027, China

AI总结 提出KDH-CAD框架,融合预训练基础模型、结构化领域知识和少量标注CAD数据,在数据稀缺下实现高效机械零件分类,准确率达92.6%(250样本)和95.8%(1000样本)。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01311 2026-06-02 cs.CL cs.AI cs.LG cs.MA

SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories

SkillAdaptor:基于轨迹的LLM智能体自适应技能

Zhuoyun Yu, Xin Xie, Wuguannan Yao, Chenxi Wang, Lei Liang, Xiang Qi, Shumin Deng

机构 * Zhejiang University(浙江大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

AI总结 提出SkillAdaptor,一种无训练的步骤级技能自适应框架,通过显式故障归因和针对性更新,提升LLM智能体在长程交互任务中的表现。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01247 2026-06-02 cs.CV

Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?

看向哪里:基础模型能否通过主动探索达到目标视角?

Liyang Li, Muzhi Zhu, Zhiyue Zhao, Hengyu Zhao, Ke Liu, Linhao Zhong, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学)

AI总结 提出目标视角复现(TVR)任务及TVRBench基准,通过分析现有模型瓶颈并构建统一后训练框架,将9B开源模型成功率提升至50%以上。

Comments Project page: https://github.com/aim-uofa/TVRBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01112 2026-06-02 cs.RO

Tether-Aware Dynamic Collision Avoidance for USV-HROV Systems

USV-HROV系统的系缆感知动态避碰

Yang Gu, Ziyang Hong, Xuanlin Chen, Hao Wei, Cheng Wang, Shujie Yang, Yulin Si

机构 * Zhejiang University(浙江大学)

AI总结 针对USV跟踪HROV时水下系缆与过往船只刮擦及系缆绷紧风险,提出一种系缆感知的动态避碰方法,通过引入系缆安全感知平面域和系缆绷紧感知速度障碍法,实现安全避碰并降低系缆绷紧可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01046 2026-06-02 cs.AI

TravelEval: A Comprehensive Benchmarking Framework for Evaluating LLM-Powered Travel Planning Agents

TravelEval:评估基于LLM的旅行规划代理的综合基准框架

Weiyi Chen, Shuaixiong Wang, Ziyun Gao, Kaichun Hu, Wangze Ni, Shimin Di, Chen Jason Zhang, Lei Chen

机构 * Zhejiang University(浙江大学) Hong Kong Polytechnic University(香港理工大学) Southeast University(东南大学) HKUST (GZ) & HKUST Guangzhou(香港科技大学(广州)& 香港科技大学(广州))

AI总结 针对现有基准过度关注约束合规、缺乏真实性和多维评估的问题,提出TravelEval,通过六维评估框架、真实数据沙盒和模拟全局评估方法,全面评估LLM在旅行规划中的表现。

Comments 31pages, 8 figures, accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01033 2026-06-02 cs.AI

TriLens: Per-Layer Logit-Lens Entropy for White-Box Hallucination Detection

TriLens: 基于逐层Logit-Lens熵的白盒幻觉检测

Bohan Yang, Yijun Gong, Zhi Zhang, Ge Zhang, Wenpeng Xing, Meng Han

机构 * Binjiang Institute of Zhejiang University(浙江大学滨海学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学) Zhejiang University(浙江大学) GenTel.io Great Bay University(Great Bay大学)

AI总结 提出TriLens方法,通过在每个Transformer层读取多头自注意力、前馈网络和残差流的logit-lens输出熵,构建紧凑的3L维轨迹,有效检测大语言模型幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00954 2026-06-02 cs.CV

COLLAR: Cascaded Object-Level Latent Refinement for High-Fidelity Conditional Generation

COLLAR: 级联对象级潜在精化用于高保真条件生成

Xinlong Zhang, Jia Wei, Xiaoyu Zhang, Teng Zhou, Chengyu Lin, Yongchuan Tang

机构 * College of Computer Science, Zhejiang University(浙江大学计算机科学学院)

AI总结 提出COLLAR框架,通过视场扩展和级联对象级潜在精化,在扩散Transformer中实现无训练的高保真对象级控制,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00656 2026-06-02 cs.LG cs.AI

Demystifying the Optimal Fair Classifier in Multi-Class Classification

揭秘多类分类中的最优公平分类器

Li Zhang, Yuyuan Li, XiaoHua Feng, Jiaming Zhang, Fengyuan Yu, Chaochao Chen

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computer Science(计算机科学学院) Technology, Zhejiang University(技术,浙江大学) School of Communication Engineering, Hangzhou Dianzi University(杭州电子科技大学通信工程学院)

AI总结 本文针对多类分类中的公平性问题,提出了一种在公平约束下最优分类器的概率公式,并设计了两种属性盲算法(处理中与处理后)以逼近最优精度-公平帕累托前沿。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00301 2026-06-02 cs.LG

FLaG: Fine-Grained Latent Grouping for Hallucination Detection

FLaG:用于幻觉检测的细粒度潜在分组

Wentao Ye, Liyao Li, Zhiqing Xiao, Muzhi Zhu, Jiaqi Hu, Zhanming Shen, Xiaomeng Hu, Sean Du, Haobo Wang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 提出FLaG框架,通过能量路由机制将实例软关联到多个潜在证据组,并利用对数边际聚合组合组条件可靠性信号,以捕获异构幻觉模式,实现无需修改底层模型的高效幻觉检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00021 2026-06-02 cs.CL cs.AI cs.LG

SENSE: Semantic Embedding Navigation with Soft-gated Evaluation for Retrieval-based Speculative Decoding

SENSE: 基于软门控评估的语义嵌入导航用于检索式推测解码

Shaowen Chen, Zhicheng Liao, Hongwei Wang

机构 * Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

AI总结 提出SENSE方法,通过语义嵌入导航和软门控评估模块替代表面形式匹配,提升检索式推测解码的鲁棒性和加速效果,在LLaMA和Qwen系列上实现最高4.09平均接受长度和3.26倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00015 2026-06-02 cs.HC cs.AI cs.CY cs.ET

SortingHat: Redefining Operating Systems Education with a Tailored Digital Teaching Assistant

SortingHat: 用定制的数字教学助手重新定义操作系统教育

Yifan Zhang, Xinkui Zhao, Zuxin Wang, Zhengyi Zhou, Guanjie Chen, Shuiguang Deng, Jianwei Yin

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

AI总结 针对操作系统课程教学挑战,提出结合检索增强生成和多智能体强化学习的3D数字人教学助手SortingHat,提供个性化指导、自适应内容生成和自动评估。

Journal ref WWW '25: Companion Proceedings of the ACM on Web Conference 2025,Pages 2951 - 2954

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27458 2026-06-02 cs.CV cs.AI cs.CL cs.LG

Generic Interpretation Approach for Transformer Models Incorporating Heterogenous Attention Structures

融合异质注意力结构的Transformer模型通用解释方法

Yongjin Cui, Xiaohui Fan, Huajun Chen

机构 * Zhejiang University(浙江大学)

AI总结 针对Transformer中异质注意力结构(如共注意力)带来的多源信息融合挑战,提出一种通用解释方法,并通过实验分析范式对代表性模型进行语义和逻辑解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26102 2026-06-02 cs.CV

InstructSAM: Segment Any Instance with Any Instructions

InstructSAM: 根据任意指令分割任意实例

Yuqian Yuan, Wentong Li, Zhaocheng Li, Yutong Lin, Juncheng Li, Siliang Tang, Jun Xiao, Yueting Zhuang, Wenqiao Zhang

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 提出InstructSAM框架,通过将指令驱动实例分割建模为集合结构查询预测问题,并设计显式推理到实例查询接口,结合视觉语言模型和SAM3实现单次前向传播中的多实例分割。

Comments 19 pages, 8 figures, code: https://github.com/DCDmllm/InstructSAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26089 2026-06-02 cs.CV cs.AI

Channel-wise Vector Quantization

通道级向量量化

Wei Song, Tianhang Wang, Yitong Chen, Tong Zhang, Zuxuan Wu, Min Li, Jiaqi Wang, Kaicheng Yu

机构 * Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Zhejiang University(浙江大学) Fudan University(复旦大学) JD.COM(京东公司) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 提出通道级向量量化(CVQ)代替补丁级量化,并基于此设计通道级自回归(CAR)模型,通过逐通道预测实现渐进式细节生成,在图像重建和文本到图像生成中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏