arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-05-08 至 2026-05-08 共收录 20
2605.06509 2026-05-08 cs.CV

FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction

FreeSpec: 通过奇异谱重建实现无训练长视频生成

Fangda Chen, Shanshan Zhao, Longrong Yang, Chuanfu Xu, Zhigang Luo, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Alibaba International Digital Commerce(阿里巴巴国际数字商务) Zhejiang University(浙江大学) Xiangjiang Laboratory(湘江实验室)

AI总结 FreeSpec通过奇异谱重建方法解决长视频生成中的内容漂移和时间不一致问题,利用低秩谱引导和高秩重建基,提升空间细节和时间动态的保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06507 2026-05-08 cs.CV cs.LG

MARBLE: Multi-Aspect Reward Balance for Diffusion RL

MARBLE: 多方面奖励平衡用于扩散强化学习

Canyu Zhao, Hao Chen, Yunze Tong, Yu Qiao, Jiacheng Li, Chunhua Shen

机构 * Zhejiang University(浙江大学) HiThink Zhejiang University of Technology(浙江工业大学)

AI总结 本文提出MARBLE框架,通过梯度空间优化解决多奖励平衡问题,实现多维度奖励同时优化,提升训练效率和稳定性。

Comments Homepage and code repo: https://aim-uofa.github.io/MARBLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06469 2026-05-08 math.OC cs.LG cs.SY eess.SY

Dynamic Controlled Variables Based Dynamic Self-Optimizing Control

基于动态可控变量的动态自优化控制

Chenchen Zhou, Shaoqi Wang, Hongxin Su, Xinhui Tang, Yi Cao, Shuang-Hua Yang

机构 * College of Chemical and Biological Engineering, Zhejiang University, Hangzhou, Zhejiang Province, P.R. China(浙江大学化学与生物工程学院) Institute of Zhejiang University-Quzhou, Quzhou, Zhejiang Province, P.R. China(浙江大学Quzhou研究院)

AI总结 本文提出动态自优化控制方法,引入动态可控变量概念,通过数据驱动设计解决动态优化问题,验证了其在多值和不连续函数逼近及非固定时间跨度优化中的有效性。

Journal ref Journal of Process Control, 2024, 138: 103228

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06407 2026-05-08 eess.AS cs.AI cs.CL

WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

WavCube:通过语义-声音联合建模统一语音表示以实现理解和生成

Guanrou Yang, Tian Tan, Qian Chen, Zhikang Niu, Yakun Song, Ziyang Ma, Yushen Chen, Zeyu Xie, Tianrui Wang, Yifan Yang, Wenxi Chen, Qi Chen, Wenrui Liu, Shan Yang, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Tencent(腾讯) Independent Researcher(独立研究员) Peking University(北京大学) Tianjin University(天津大学) Zhejiang University(浙江大学)

AI总结 WavCube通过语义-声音联合建模统一语音表示,解决语音理解和生成的表示兼容问题,实现压缩后的高性能语音任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06326 2026-05-08 cs.CL

Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning

教授思考模型进行工具推理:一种完整的全管道配方用于工具集成推理

Qianjia Cheng, Yuchen Zhang, Zhilin Wang, Yuxin Zuo, Shunkai Zhang, Yuchen Fan, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng, Yun Luo, Ganqu Cui

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种全管道配方,通过注入自然工具使用行为提升强思考模型的工具集成推理能力,同时保持文本推理能力,展示在Qwen3模型上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06183 2026-05-08 cs.AI cs.CL cs.LG

Rethinking Adapter Placement: A Dominant Adaptation Module Perspective

重新思考适配器放置:从主导适配模块视角出发

Suoxin Zhang, Run He, Di Fang, Xiang Tan, Kaixuan Chen, Huiping Zhuang

机构 * South China University of Technology, China(华南理工大学) Zhejiang University, China(浙江大学)

AI总结 本文提出DomLoRA方法,通过在主导适配模块放置单个适配器,以提升模型性能,验证了该模块在不同任务中的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06179 2026-05-08 cs.CV

SuperFace: Preference-Aligned Facial Expression Estimation Beyond Pseudo Supervision

SuperFace:超越伪监督的偏好对齐面部表情估计

Zejian Kang, Xuanyang Xu, Wentao Yang, Kai Zheng, Yuanchen Fei, Hongyuan Zou, Hui Shan, Shuo Yang, Xiangru Huang

机构 * Zhejiang University(浙江大学) Westlake University(西lake大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hunan University(湖南大学) Zhejiang University Shanghai Innovation Institute(浙江大学上海创新研究院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出SuperFace框架,通过人类偏好反馈改进ARKit系数预测,提升面部动画的视觉真实性和表达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06078 2026-05-08 cs.CL cs.AI

Milestone-Guided Policy Learning for Long-Horizon Language Agents

为长周期语言代理设计的里程碑引导策略学习

Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Baidu Inc.(百度公司)

AI总结 本文提出BEACON框架,通过任务的组合结构实现精准信用分配,提升长周期语言代理的训练效果,在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06051 2026-05-08 cs.CV

RealCam: Real-Time Novel-View Video Generation with Interactive Camera Control

RealCam: 通过交互式相机控制实现实时新视角视频生成

Youcan Xu, Jiaxin Shi, Zhen Wang, Wensong Song, Feifei Shao, Chen Liang, Jun Xiao, Long Chen

机构 * Zhejiang University(浙江大学) Xmax.AI Ltd.(Xmax.AI有限公司) Hong Kong University of Science and Technology(香港科技大学)

AI总结 RealCam提出一种自回归框架,实现交互式实时相机控制的视频到视频生成,通过交叉帧上下文学习和循环闭合数据增强提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06036 2026-05-08 cs.LG cs.AI

Optimal Transport for LLM Reward Modeling from Noisy Preference

基于噪声偏好的LLM奖励建模中的最优传输

Licheng Pan, Haochen Yang, Haoxuan Li, Yunsheng Lu, Yongqi Tong, Yinuo Wang, Shijian Wang, Zhixuan Chu, Lei Shen, Yuan Lu, Hao Wang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文提出SelectiveRM框架,利用最优传输对噪声偏好进行去噪,通过联合一致性差异对齐模型预测分布与偏好数据,并引入质量放松机制以排除矛盾样本,提升奖励建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05950 2026-05-08 cs.CL

Lightweight Stylistic Consistency Profiling: Robust Detection of LLM-Generated Textual Content for Multimedia Moderation

轻量级风格一致性剖析:面向多媒体审核的LLM生成文本稳健检测

Siyuan Li, Aodu Wulianghai, Xi Lin, Xibin Yuan, Qinghua Mao, Guangyan Li, Xiang Chen, Jun Wu, Jianhua Li

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文提出LiSCP方法,通过结合离散风格特征与连续语义信号,提升对抗环境下的LLM生成文本检测鲁棒性,实现在多领域中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14148 2026-05-08 cs.RO cs.AI cs.LG

AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models

AsyncVLA: 视觉-语言-动作模型中的异步流匹配

Yuhua Jiang, Shuang Cheng, Yan Ding, Feifei Gao, Biqing Qi

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Lumos Robotics(Lumos机器人)

AI总结 本文提出AsyncVLA,一种引入异步流匹配的视觉-语言-动作模型框架,通过非均匀时间调度和自修正机制提升长周期任务的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05846 2026-05-08 cs.CR cs.AI

LoopTrap: Termination Poisoning Attacks on LLM Agents

LoopTrap: 对 LLM agent 的终止污染攻击

Huiyu Xu, Zhibo Wang, Wenhui Zhang, Ziqi Zhu, Yaopeng Wang, Kui Ren, Chun Chen

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) School of Cyber Science and Engineering(网络安全与工程学院) Southeast University(东南大学)

AI总结 本文研究了LLM agent迭代执行循环中的终止污染风险,提出10种攻击策略并通过实验证明不同agent的行为特征影响攻击效果,设计了自动化框架LoopTrap以提升红队攻击效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05709 2026-05-08 cs.AI

Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs

隐藏、重建、突破:在大规模语言模型中利用重建-隐藏权衡

Md Farhamdur Reza, Richeng Jin, Tianfu Wu, Huaiyu Dai

机构 * NC State University(北卡罗来纳州立大学) Zhejiang University(浙江大学)

AI总结 本文探讨了在多模态大语言模型中利用重建与隐藏的权衡进行意图混淆攻击,提出了一种基于字符移除的变体构造方法,并引入关键词相关的干扰图像以提高攻击效果。

Comments 39 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05664 2026-05-08 cs.CV

Sparse-to-Complete: From Sparse Image Captures to Complete 3D Scenes

稀疏到完整:从稀疏图像捕获到完整3D场景

Yiyang Shen, Yin Yang, Kun Zhou, Tianjia Shao

机构 * State Key Lab of CAD\&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) University of Utah(犹他大学) Hangzhou Research Institute of Holographic and AI Technology(杭州全息与人工智能技术研究院)

AI总结 本文提出S2C-3D框架,通过六到八张图像实现高保真完整场景重建,结合专用扩散模型、视图一致性条件采样和相机轨迹规划,提升3D重建质量与鲁棒性。

Journal ref SIGGRAPH 2026 Conf. Proc

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05271 2026-05-08 cs.CR cs.AI

Shattering the Echo Chamber: Hidden Safeguards in Manuscripts Against the AI Takeover of Peer Review

打破回声室:对抗AI接管同行评审的隐藏保障

Oubo Ma, Ruixiao Lin, Jiahao Chen, Yuan Su, Yong Yang, Shouling Ji

机构 * Zhejiang University(浙江大学)

AI总结 本文提出IntraGuard框架,通过在PDF结构中嵌入异构防御文本对象,有效抵御AI生成的同行评审,实现84%的防御成功率,且不影响人类评审。

Comments 22 pages, 14 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05224 2026-05-08 cs.LG cs.AI cs.CR

Channel-Level Semantic Perturbations: Unlearnable Examples for Diverse Training Paradigms

通道级语义扰动:用于多样化训练范式的不可学习示例

Bo Wang, Jia Ni, Mengnan Zhao, Zhan Qin, Kui Ren

机构 * School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文研究了在不同训练范式下不可学习示例的有效性,发现预训练权重会削弱现有方法效果,并提出Shallow Semantic Camouflage策略以提升数据不可学习性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13310 2026-05-08 cs.CV cs.AI

Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension

视觉并行思考器:用于视觉理解的分而治之推理

Haoran Xu, Hongyu Wang, Jiaze Li, Shunpeng Chen, Zizhao Tong, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) University of Chinese Academy of Sciences(中国科学院大学) Independent Researcher(独立研究者)

AI总结 本文提出视觉并行思考器,通过并行推理框架提升视觉理解能力,结合Pa-Attention和LPRoPE实现高效多模态处理,验证了并行推理在视觉领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21471 2026-05-08 cs.AI

SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition

SpatialBench: 多模态大语言模型空间认知的基准测试

Peiran Xu, Sudong Wang, Yao Zhu, Jianing Li, Gege Qi, Yunjian Zhang

机构 * Sun Yat-Sen University(中山大学) HKUST (GZ)(香港科技大学) Zhejiang University(浙江大学) Peking University(北京大学) CAICT(中国科学院电子技术研究所) UCAS(中国科学技术大学) CUC(中国科学技术大学)

AI总结 本文提出SpatialBench基准,通过五级空间认知框架评估多模态大语言模型的空间能力,揭示模型在感知与符号推理间的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-05-08 cs.CV

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏