arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-08-11 至 2026-08-11 共收录 17
2608.09873 2026-08-11 cs.CV cs.AI 新提交

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

Sci-VBench:面向科学领域知识与推理密集型视频生成的评估

Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao

机构 * Zhejiang University(浙江大学) UCAS(中国科学院大学) Tongji University(同济大学) Yale University(耶鲁大学)

AI总结 该研究推出Sci-VBench基准,评估科学领域视频生成,测试16个模型后发现,视觉真实感提升未转化为科学与因果动态建模能力,且专有模型性能优于开源模型。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09842 2026-08-11 cs.CV 新提交

From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing

从诊断到修正:真实世界表格解析的基准测试与改进

Jutao Xiao, Yuan Qu, Dongsheng Ma, Fan Wu, Tianyao He, Weihong Li, Jie Yang, Yu Qiao, Bin Wang, Conghui He

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

AI总结 本文针对真实世界表格解析的缺陷,构建诊断基准TableParseMap,提出DEC框架,无需重训即可提升冻结解析器性能,在TableParseMap上TEDS获显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09789 2026-08-11 cs.CV 新提交

ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection

ADOPD:面向多模态大语言模型(MLLM)的工业异常检测的参考特权在线策略蒸馏

Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang

机构 * Zhejiang University(浙江大学)

AI总结 本研究针对工业异常检测问题,提出ADOPD参考特权在线策略蒸馏框架,通过参考感知教师监督仅查询的学生模型,在MMAD基准零样本推理下获77.31%平均准确率,优于Qwen3-VL-4B主干及其一样本设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09775 2026-08-11 cs.AI cs.CE cs.LG 新提交

AirFlow: Context Preserving and Multi-Rate State Modeling for Air Quality Forecasting

AirFlow:面向空气质量预测的上下文保留与多速率状态建模

Fan Yang, Nan Chen, Yijie Dong, Yuchen Zhang, Wei Zhang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

AI总结 AirFlow是一种基于站点多元观测的双流空气质量预测框架,通过统计引导归一化路由和分层双流状态模型,在36项指标中获34项最优,参数与计算开销低,性能优于现有方法。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09682 2026-08-11 cs.CV 新提交

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

用工具思考,而非用像素思考:工具调用作为视觉推理的文本支架

Jiahao Shao, Yuanbo Yang, Yiyi Liao, Yujun Shen, Ceyuan Yang, Yinghao Xu

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

AI总结 该研究提出工具调用支架假设,引入TextCall方法验证返回图像冗余,仅用结构化文本支架即可实现视觉推理,降低延迟并消除工具API调用,结论适用于现有相关基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09238 2026-08-11 cs.CV 新提交

RealDenseFace: Real-time Monocular 3D Face Reconstruction from Dense UV-space Priors

RealDenseFace:基于密集UV空间先验的实时单目3D人脸重建

Linzhou Li, Tianjia Shao, Kun Zhou

机构 * Zhejiang University(浙江大学)

AI总结 RealDenseFace是一种基于优化的实时单目3D人脸重建方法,通过定制高斯-牛顿求解器实现快速收敛,在NeRSemble SVFR基准上精度顶尖,在线跟踪帧率超80 FPS,离线序列重建速度较基线快20倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09184 2026-08-11 cs.AI 新提交

Agentic Router: An Execution-Grounded Continual Learning Approach With Memory

智能体路由器:一种基于执行的带记忆的持续学习方法

Yuxuan Chen, Rongpeng Li, Zhifeng Zhao, Yuntao Liu, Xing Xu, Honggang Zhang

机构 * Zhejiang University(浙江大学) Zhejiang Lab(之江实验室) State Grid Hebei Electric Power Co., Ltd.(国网河北省电力有限公司) Macau University of Science and Technology(澳门科技大学)

AI总结 该研究针对CLI-based SONiC操作,提出基于执行的双路径后果感知智能体,通过生成动作、预测后果、重排序选择,提升可行动作覆盖度与执行成功率,两条路径互补增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09112 2026-08-11 cs.RO 新提交

ROEVO: Robust Organized Edge Feature-based Visual Odometry Using RGB-D Cameras

ROEVO:基于RGB-D相机的鲁棒结构化边缘特征视觉里程计

Mingrui Liu, Xingxing Zuo, Renlang Huang, Minglei Zhao, Jiming Chen, Liang Li

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

AI总结 本研究提出基于结构化边缘特征的视觉里程计系统,设计专用跟踪与联合优化方法,在室内环境中实现高精度鲁棒的视觉里程计,性能优于或媲美现有先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08596 2026-08-11 cs.CV 新提交

Goal-oriented Navigation Instruction Generation with Tour Video Priors

基于旅游视频先验的面向目标的导航指令生成

Fangdi Li, Juncheng Liao, Changxu Cheng, Jiazhi Wang, Senda Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi AI(优必爱人工智能) Zhejiang University(浙江大学) Tongji University(同济大学)

AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08569 2026-08-11 cs.AI cs.SD 新提交

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩

Wenxu Jia, Dongjie Fu, Xize Cheng, Fangming Feng, Linjun Li, Wenshi Chen, Yingming Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学) Meituan(美团)

AI总结 针对语音大语言模型长上下文推理的KV缓存内存瓶颈,提出无训练两阶段语义锚定框架VoxZip,在多音频基准上实现高效压缩,维持高性能并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08542 2026-08-11 cs.LG 新提交

When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs

当技能与安全相遇:对技能合并大语言模型的自适应越狱鲁棒性进行基准测试与表征

Yu Ma, Hongli Shi, Jing Li, Xinran Xu, Weiwei Hou

机构 * Google(谷歌公司) University of New South Wales(新南威尔士大学) University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) Australian National University(澳大利亚国立大学)

AI总结 本研究针对技能合并大语言模型,构建SkillSafe-Bench基准,发现静态安全无法预测其自适应越狱鲁棒性,提出SubSafe-Merge方法可在保留能力的同时消除安全侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08541 2026-08-11 cs.CV cs.NE 新提交

Rethinking Attention Locality in Spiking Transformers

重新思考脉冲Transformer中的注意力局部性

Zeqi Zheng, Zizheng Zhu, Yuping Yan, Wenxuan Pan, Zhaofei Yu, Yaochu Jin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Peking University(北京大学)

AI总结 该研究针对脉冲Transformer中注意力局部性的问题,提出带边界连续性通路的空间连续局部注意力(SCLA-BCP)及分层部署策略,在7个静态和神经形态数据集上实现了检测、分割等任务的性能提升。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08531 2026-08-11 cs.CV 新提交

ERF-GS: Reconstructing Fast Motion from Disjoint Event-RGB Viewpoints

ERF-GS:从不相交的事件-RGB视点重建快速运动

Xiaoyang Bai, Zhenyang Li, Weiwei Xu, Edmund Y. Lam, Yifan Peng

机构 * The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

AI总结 ERF-GS框架将事件信息融入高斯溅射流水线,脱离RGB输入实现基于事件的学习,在含模糊帧和不相交视点的数据集上,性能优于4DGS与E-D3DGS,可用于复杂自然视频的快速运动重建。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08021 2026-08-11 cs.CV cs.AI 新提交

Evidence-RL: Towards Evidence-intensive Visual Reasoning

Evidence-RL:面向证据密集型视觉推理

Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong He, Yu Yang, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学) Tencent(腾讯)

AI总结 针对视觉-语言模型依赖语言先验等问题,提出反事实证据解缠方法,结合GRPO框架在9个基准和4种骨干模型上优于现有基于RL的后训练方法。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07932 2026-08-11 cs.CV 新提交

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07931 2026-08-11 cs.AI 新提交

REIN: Bridging the Gap between Reasoning and Reliability via Reflection and Abstention Alignment

REIN:通过反思与弃权对齐缩小推理与可靠性之间的差距

Zhengze Huang, Luyang Yu, Di Hong, Xinzhe Huang, Wanyu Lin, Zhixuan Chu, Zhan Qin, Tianhang Zheng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 REIN是一个对齐框架,通过训练大型推理模型生成结构化推理序列,引入奖励机制鼓励模型在无正确推理链时弃权,在单次前向传播中减少幻觉、提升选择性准确率并保持高覆盖率。

Comments 26 pages and 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07920 2026-08-11 cs.CV 新提交

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏