arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-08-11 至 2026-08-11 共收录 28
2608.09873 2026-08-11 cs.CV cs.AI 新提交

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

Sci-VBench:面向科学领域知识与推理密集型视频生成的评估

Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao

机构 * Zhejiang University(浙江大学) UCAS(中国科学院大学) Tongji University(同济大学) Yale University(耶鲁大学)

AI总结 该研究推出Sci-VBench基准,评估科学领域视频生成,测试16个模型后发现,视觉真实感提升未转化为科学与因果动态建模能力,且专有模型性能优于开源模型。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09842 2026-08-11 cs.CV 新提交

From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing

从诊断到修正:真实世界表格解析的基准测试与改进

Jutao Xiao, Yuan Qu, Dongsheng Ma, Fan Wu, Tianyao He, Weihong Li, Jie Yang, Yu Qiao, Bin Wang, Conghui He

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

AI总结 本文针对真实世界表格解析的缺陷,构建诊断基准TableParseMap,提出DEC框架,无需重训即可提升冻结解析器性能,在TableParseMap上TEDS获显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09789 2026-08-11 cs.CV 新提交

ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection

ADOPD:面向多模态大语言模型(MLLM)的工业异常检测的参考特权在线策略蒸馏

Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang

机构 * Zhejiang University(浙江大学)

AI总结 本研究针对工业异常检测问题,提出ADOPD参考特权在线策略蒸馏框架,通过参考感知教师监督仅查询的学生模型,在MMAD基准零样本推理下获77.31%平均准确率,优于Qwen3-VL-4B主干及其一样本设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09775 2026-08-11 cs.AI cs.CE cs.LG 新提交

AirFlow: Context Preserving and Multi-Rate State Modeling for Air Quality Forecasting

AirFlow:面向空气质量预测的上下文保留与多速率状态建模

Fan Yang, Nan Chen, Yijie Dong, Yuchen Zhang, Wei Zhang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

AI总结 AirFlow是一种基于站点多元观测的双流空气质量预测框架,通过统计引导归一化路由和分层双流状态模型,在36项指标中获34项最优,参数与计算开销低,性能优于现有方法。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09682 2026-08-11 cs.CV 新提交

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

用工具思考,而非用像素思考:工具调用作为视觉推理的文本支架

Jiahao Shao, Yuanbo Yang, Yiyi Liao, Yujun Shen, Ceyuan Yang, Yinghao Xu

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

AI总结 该研究提出工具调用支架假设,引入TextCall方法验证返回图像冗余,仅用结构化文本支架即可实现视觉推理,降低延迟并消除工具API调用,结论适用于现有相关基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09238 2026-08-11 cs.CV 新提交

RealDenseFace: Real-time Monocular 3D Face Reconstruction from Dense UV-space Priors

RealDenseFace:基于密集UV空间先验的实时单目3D人脸重建

Linzhou Li, Tianjia Shao, Kun Zhou

机构 * Zhejiang University(浙江大学)

AI总结 RealDenseFace是一种基于优化的实时单目3D人脸重建方法,通过定制高斯-牛顿求解器实现快速收敛,在NeRSemble SVFR基准上精度顶尖,在线跟踪帧率超80 FPS,离线序列重建速度较基线快20倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09184 2026-08-11 cs.AI 新提交

Agentic Router: An Execution-Grounded Continual Learning Approach With Memory

智能体路由器:一种基于执行的带记忆的持续学习方法

Yuxuan Chen, Rongpeng Li, Zhifeng Zhao, Yuntao Liu, Xing Xu, Honggang Zhang

机构 * Zhejiang University(浙江大学) Zhejiang Lab(之江实验室) State Grid Hebei Electric Power Co., Ltd.(国网河北省电力有限公司) Macau University of Science and Technology(澳门科技大学)

AI总结 该研究针对CLI-based SONiC操作,提出基于执行的双路径后果感知智能体,通过生成动作、预测后果、重排序选择,提升可行动作覆盖度与执行成功率,两条路径互补增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09112 2026-08-11 cs.RO 新提交

ROEVO: Robust Organized Edge Feature-based Visual Odometry Using RGB-D Cameras

ROEVO:基于RGB-D相机的鲁棒结构化边缘特征视觉里程计

Mingrui Liu, Xingxing Zuo, Renlang Huang, Minglei Zhao, Jiming Chen, Liang Li

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

AI总结 本研究提出基于结构化边缘特征的视觉里程计系统,设计专用跟踪与联合优化方法,在室内环境中实现高精度鲁棒的视觉里程计,性能优于或媲美现有先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08596 2026-08-11 cs.CV 新提交

Goal-oriented Navigation Instruction Generation with Tour Video Priors

基于旅游视频先验的面向目标的导航指令生成

Fangdi Li, Juncheng Liao, Changxu Cheng, Jiazhi Wang, Senda Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi AI(优必爱人工智能) Zhejiang University(浙江大学) Tongji University(同济大学)

AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08569 2026-08-11 cs.AI cs.SD 新提交

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩

Wenxu Jia, Dongjie Fu, Xize Cheng, Fangming Feng, Linjun Li, Wenshi Chen, Yingming Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学) Meituan(美团)

AI总结 针对语音大语言模型长上下文推理的KV缓存内存瓶颈,提出无训练两阶段语义锚定框架VoxZip,在多音频基准上实现高效压缩,维持高性能并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08542 2026-08-11 cs.LG 新提交

When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs

当技能与安全相遇:对技能合并大语言模型的自适应越狱鲁棒性进行基准测试与表征

Yu Ma, Hongli Shi, Jing Li, Xinran Xu, Weiwei Hou

机构 * Google(谷歌公司) University of New South Wales(新南威尔士大学) University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) Australian National University(澳大利亚国立大学)

AI总结 本研究针对技能合并大语言模型,构建SkillSafe-Bench基准,发现静态安全无法预测其自适应越狱鲁棒性,提出SubSafe-Merge方法可在保留能力的同时消除安全侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08541 2026-08-11 cs.CV cs.NE 新提交

Rethinking Attention Locality in Spiking Transformers

重新思考脉冲Transformer中的注意力局部性

Zeqi Zheng, Zizheng Zhu, Yuping Yan, Wenxuan Pan, Zhaofei Yu, Yaochu Jin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Peking University(北京大学)

AI总结 该研究针对脉冲Transformer中注意力局部性的问题,提出带边界连续性通路的空间连续局部注意力(SCLA-BCP)及分层部署策略,在7个静态和神经形态数据集上实现了检测、分割等任务的性能提升。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08531 2026-08-11 cs.CV 新提交

ERF-GS: Reconstructing Fast Motion from Disjoint Event-RGB Viewpoints

ERF-GS:从不相交的事件-RGB视点重建快速运动

Xiaoyang Bai, Zhenyang Li, Weiwei Xu, Edmund Y. Lam, Yifan Peng

机构 * The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

AI总结 ERF-GS框架将事件信息融入高斯溅射流水线,脱离RGB输入实现基于事件的学习,在含模糊帧和不相交视点的数据集上,性能优于4DGS与E-D3DGS,可用于复杂自然视频的快速运动重建。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08021 2026-08-11 cs.CV cs.AI 新提交

Evidence-RL: Towards Evidence-intensive Visual Reasoning

Evidence-RL:面向证据密集型视觉推理

Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong He, Yu Yang, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学) Tencent(腾讯)

AI总结 针对视觉-语言模型依赖语言先验等问题,提出反事实证据解缠方法,结合GRPO框架在9个基准和4种骨干模型上优于现有基于RL的后训练方法。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07932 2026-08-11 cs.CV 新提交

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07931 2026-08-11 cs.AI 新提交

REIN: Bridging the Gap between Reasoning and Reliability via Reflection and Abstention Alignment

REIN:通过反思与弃权对齐缩小推理与可靠性之间的差距

Zhengze Huang, Luyang Yu, Di Hong, Xinzhe Huang, Wanyu Lin, Zhixuan Chu, Zhan Qin, Tianhang Zheng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 REIN是一个对齐框架,通过训练大型推理模型生成结构化推理序列,引入奖励机制鼓励模型在无正确推理链时弃权,在单次前向传播中减少幻觉、提升选择性准确率并保持高覆盖率。

Comments 26 pages and 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07920 2026-08-11 cs.CV 新提交

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05137 2026-08-11 cs.CV 版本更新

SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

SmartMage:面向3D场景理解的动态模态编排

Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan

机构 * Zhejiang University(浙江大学) Stanford University(斯坦福大学)

AI总结 本文针对现有MLLMs采用固定模态组合的缺陷,提出SmartMage模型,通过SMART和MAGE模块动态编排模态,在5个3D场景理解基准上取得最优性能,在RGB视频理解基准上表现具竞争力。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02508 2026-08-11 cs.LG cs.CL 版本更新

RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States

RoMeRL:通过降阶效用状态平衡自进化智能体记忆中的反馈覆盖与记忆-奖励陷阱

Yi Yang, Zhennan Chen, Yihong Zhuang, Tiehan Fan, Yinan Chen, Jian Li, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Xiamen University(厦门大学) Zhejiang University(浙江大学)

AI总结 RoMeRL通过降阶效用状态解决自进化LLM智能体记忆的反馈分散与记忆-奖励陷阱问题,在ALFWorld等基准上显著提升任务性能、降低记忆规模与LLM调用

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04425 2026-08-11 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新

UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

UI-MOPD:用于持续GUI智能体学习的多平台策略蒸馏

Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Xiaomi(小米) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Zhejiang University(浙江大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 针对构建多平台GUI智能体的挑战,构建高质量数据集Uni-GUI,提出UI-MOPD方法,通过多教师策略蒸馏实现持续学习,动态选教师并转移行为先验,实验证明其能平衡跨平台能力保留与新平台适应。

Comments Technical report. 27 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04422 2026-08-11 cs.LG cs.AI 版本更新

Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention

全栈FP4:通过量化投影、优化器和注意力进行稳定的语言模型预训练

Siyu Ding, Mingchuan Ma, Jiabo Tong, Xingrun Xing, Ziming Wang, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Sichuan University(四川大学) Beijing Zhongguancun Academy(北京中关村科学院) Zhejiang University(浙江大学) Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑科学与类脑研究中心通用人工智能大模型北京市重点实验室) Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑机智能技术重点实验室)

AI总结 研究针对4位预训练中优化器状态等未充分探索的问题,提出全栈FP4框架。通过模块精度策略解决稳定性瓶颈,如用LoRA-SVD抑制量化噪声,设计优化器变换,采用混合精度方案,实现稳定高效的端到端预训练。

Comments Fix experiment bugs and some statement, update current developed hardware efficiency result on 5090

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13023 2026-08-11 cs.SD cs.MM 版本更新

SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding

SpotSound: 通过细粒度时间定位增强大音频-语言模型

Luoyi Sun, Xiao Zhou, Zeqian Li, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) SAI, Shanghai Jiao Tong University(上海交通大学人工智能院)

AI总结 SpotSound通过引入新的训练目标和挑战性基准,提升了大音频-语言模型在时间定位任务中的性能,同时保持了通用任务的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07230 2026-08-11 cs.CV 版本更新

PhyEdit: Towards Real-World Object Manipulation via Physically-Grounded Image Editing

PhyEdit: 通过物理基础图像编辑实现真实世界物体操作

Ruihang Xu, Dewei Zhou, Xiaolong Shen, Fan Ma, Yi Yang

机构 * ReLER, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室人工智能研究所ReLER实验室)

AI总结 PhyEdit通过结合显式几何模拟与2D-3D监督,提升图像编辑中物理准确性和操作一致性,引入RealManip-10K数据集和ManipEval基准测试,优于现有方法。

Comments Code: https://github.com/nenhang/PhyEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06343 2026-08-11 cs.CV 版本更新

Uncertainty-Aware 4D Gaussian Splatting for Monocular Occluded Human Rendering

考虑不确定性的4D高斯点散布用于单目遮挡人体渲染

Weiquan Wang, Feifei Shao, Lin Li, Zhen Wang, Fengda Zhang, Jun Xiao, Long Chen

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出U-4DGS框架,通过概率变形网络和联合光栅化流程,在异方差观测噪声下实现最大后验估计,解决单目视频中遮挡导致的高保真动态人体渲染问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19180 2026-08-11 cs.CV cs.AI 版本更新

SNR-Edit: Structure-Aware Noise Rectification for Inversion-Free Flow-Based Editing

SNR-Edit: 基于结构的噪声校正用于无反向的流式编辑

Lifan Jiang, Boxi Wu, Yuhang Pei, Tianrun Wu, Yongyuan Chen, Yan Zhao, Shiyu Yu, Deng Cai

机构 * State Key lab of CAD\&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学) UniTTEC Co. Ltd.(UniTTEC有限公司) Research center, Ningbo Meidong Container Terminal Co.,Ltd.(宁波梅东集装箱码头有限公司研究中心)

AI总结 SNR-Edit通过自适应噪声控制实现无反向的流式编辑,提升潜在轨迹的结构保真度,同时保持高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18121 2026-08-11 cs.CV cs.AI 版本更新

VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging

VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解

Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Sun Yat-sen University(中山大学) CUHK(香港中文大学)

AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03985 2026-08-11 cs.CR cs.AI 版本更新

NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models

NeuroBreak:揭示大语言模型的内部越狱机制

Chuhan Zhang, Ye Zhang, Bowen Shi, Yuyou Gan, Tianyu Du, Shouling Ji, Dazhan Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学)

AI总结 NeuroBreak是一个自上而下的大语言模型越狱分析系统,可分析神经元级安全机制、关键神经元,经评估验证了有效性,为开发下一代防御策略提供机制见解。

Comments 11 pages, 10 figures. Accepted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08811 2026-08-11 cs.LG cs.CE eess.SP 版本更新

Analogical Learning for Cross-Scenario Generalization: Framework and Application to Intelligent Localization

用于跨场景泛化的类比学习:框架及在智能定位中的应用

Zirui Chen, Hongning Ruan, Zhaoyang Zhang, Ziqing Xing, Ridong Li, Zhaohui Yang, Mérouane Debbah

机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院) Zhejiang University(浙江大学) Zhejiang Provincial Key Laboratory of Multi-modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室)

AI总结 提出类比学习框架,结合参考系与相对性概念构建Mateformer架构,应用于智能无线定位,在多场景数据集上实现波长级定位精度,提升跨场景泛化能力。

Comments Code is available at https://github.com/ziruichen-research/ALLoc

详情

展开后加载摘要…

URL PDF HTML 收藏