arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-05-13 至 2026-05-13 共收录 16
2605.12297 2026-05-13 cs.CV cs.RO eess.IV

EgoEV-HandPose: Egocentric 3D Hand Pose Estimation and Gesture Recognition with Stereo Event Cameras

EgoEV-HandPose:基于立体事件相机的视角3D手姿估计与手势识别

Luming Wang, Hao Shi, Jiajun Zhai, Kailun Yang, Kaiwei Wang

机构 * National Research Center for Optical Instrumentation, Zhejiang University(浙江大学光学仪器国家研究中心) School of Artificial Intelligence and Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(湖南大学人工智能与机器人学院和机器人视觉感知与控制技术国家工程研究中心) Ant Group Company Ltd.(蚂蚁集团有限公司)

AI总结 本文提出EgoEV-HandPose框架,通过立体事件流实现3D双臂姿态估计和手势识别,引入KeypointBEV模块和EgoEVHands数据集,取得优异性能。

Comments Extended version of SMC 2025 paper arXiv:2503.12419. The established dataset and source code will be publicly released at https://github.com/ZJUWang01/EgoEV-HandPose

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11906 2026-05-13 cs.CL

YFPO: A Preliminary Study of Yoked Feature Preference Optimization with Neuron-Guided Rewards for Mathematical Reasoning

YFPO:一种基于神经引导奖励的数学推理的初步研究

Yifan Le

机构 * Zhejiang University(浙江大学)

AI总结 YFPO通过识别数学相关神经元并构建辅助奖励,提升大语言模型的推理能力,实验表明神经层面信号可增强偏好优化,为更精细的推理后训练提供新方向。

Comments 10 pages, 2figures. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11880 2026-05-13 cs.LG cs.MA

Adaptive TD-Lambda for Cooperative Multi-agent Reinforcement Learning

自适应TD-λ用于合作多智能体强化学习

Yue Deng, Zirui Wang, Yin Zhang

机构 * Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文提出自适应TD(λ)方法,通过参数化无偏密度比估计器和双回放缓冲区解决多智能体强化学习中策略分布计算问题,实验证明其在SMAC和Gfootball场景中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06130 2026-05-13 cs.AI

Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning

技能1:通过强化学习实现技能增强代理的统一进化

Yaorui Shi, Yuxin Chen, Zhengxi Lu, Yuchun Miao, Shugui Liu, Qi GU, Xunliang Cai, Xiang Wang, An Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

AI总结 本文提出Skill1框架,通过单一策略协同进化技能选择、利用与蒸馏,以共享任务目标优化技能库维护,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13420 2026-05-13 cs.CR cs.AI

Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache

通过前缀共享KV缓存加速后缀劫持攻击

Xinhai Wang, Shaopeng Fu, Shu Yang, Liangyu Wang, Tianhang Zheng, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王阿卜杜勒阿齐兹大学) Zhejiang University(浙江大学)

AI总结 本文提出PSKV技术,通过共享前缀KV缓存减少后缀劫持攻击的计算开销,实验表明在五种广泛部署的LLM上,PSKV将推理时间减少40%,峰值内存使用减少50%。

Comments 27 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09587 2026-05-13 cs.CV cs.AI

MieDB-100k: A Comprehensive Dataset for Medical Image Editing

MieDB-100k:用于医学图像编辑的综合数据集

Yongfan Lai, Wen Qian, Bo Liu, Hongyan Li, Hao Luo, Fan Wang, Bohan Zhuang, Shenda Hong

机构 * State Key Laboratory of General Artificial Intelligence, Beijing, China(1 国家一般人工智能重点实验室,北京,中国) School of Intelligence Science and Technology, Peking University, Beijing, China(2 智能科学与技术学院,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(3 国家健康数据科学研究院,北京大学,北京,中国) DAMO Academy, Alibaba Group, Zhejiang, China(4 阿里巴巴集团 DAMO 院,浙江,中国) hupan lab, zhejiang province(5 鹏元实验室,浙江省) Zhejiang University, Zhejiang, China(6 浙江大学,浙江,中国)

AI总结 本文提出MieDB-100k数据集,通过数据筛选流程结合专家模型与规则生成方法,解决医学图像编辑中数据质量、多样性与可扩展性不足的问题,实验表明其在医学图像编辑任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03853 2026-05-13 cs.CV

UGround: Towards Unified Visual Grounding with Unrolled Transformers

UGround: 向统一视觉接地迈进的展开变换

Rui Qian, Xin Yin, Chuanhang Deng, Zhiyuan Peng, Jian Xiong, Wei Zhai, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Zhejiang University(浙江大学)

AI总结 UGround通过引入Policy-Prompted Masking机制,动态选择展开变换层作为掩码提示,解决传统方法依赖固定最后一层和隐式投影的问题,统一了从传统参照表达分割到新提出的推理分割等多种视觉接地任务。

Comments This work has been accepted to ICML 2026, please refer to https://github.com/rui-qian/UGround

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11814 2026-05-13 cs.AI

MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare

MedMemoryBench:个性化医疗中智能体记忆的基准测试

Yihao Wang, Haoran Xu, Renjie Gu, Yixuan Ye, Xinyi Chen, Xinyu Mu, Yuan Gao, Chunxiao Guo, Peng Wei, Jinjie Gu, Huan Li, Ke Chen, Lidan Shou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出MedMemoryBench,通过合成真实医疗场景数据,评估智能体长期记忆能力,并揭示主流架构在复杂医疗推理中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11738 2026-05-13 cs.AI

OptArgus: A Multi-Agent System to Detect Hallucinations in LLM-based Optimization Modeling

OptArgus:一种多智能体系统用于检测基于大语言模型的优化建模中的幻觉

Zhong Li, Zihan Guo, Xiaohan Lu, Juntao Wang, Jie Song, Chao Shen, Jiageng Wu, Mingyang Sun

机构 * Great Bay University(大湾大学) Peking University(北京大学) Jilin University(吉林大学) Zhejiang University(浙江大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出OptArgus多智能体系统,通过细粒度幻觉分类法检测优化建模中的错误,通过三部分基准测试验证其在清洁、控制和自然生成 artifact 上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11697 2026-05-13 cs.RO

Rainbow Deep Q-Learning with Kinematics-Aware Design for Cooperative Delta and 3-RRS Parallel Robot Insertion

彩虹深度Q学习与运动学感知设计用于协作Delta和3-RRS平行机器人插入

Hassen Nigatu, Gaokun Shi, Jituo Li, Wang Jin, Lu Guodong

机构 * Robotics Research Center of Yuyao(余姚机器人研究中心) Robotics Institute of Zhejiang University(浙江大学机器人院) Yuyao Technology Innovation Center(余姚技术创新中心) Department of Electrical and Computer Engineering, University of New Brunswick(新 Brunswick大学电气与计算机工程系)

AI总结 本文提出基于Rainbow深度Q网络的运动学感知深度强化学习框架,用于Delta并联机器人与3-RRS并联机械臂的协作插孔任务。通过几何设计优化阶段提升运动学性能,实现六自由度可控子空间,并结合形状奖励机制和两阶段课程训练,提高插孔任务的稳定性和可靠性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11594 2026-05-13 cs.CV

PointForward: Feedforward Driving Reconstruction through Point-Aligned Representations

PointForward:通过点对齐表示实现馈送驾驶重建

Cheng Chi, Xianqi Wang, Hongcheng Luo, Mingfei Tu, Gangwei Xu, Zehan Zhang, Bing Wang, Guang Chen, Hangjun Ye, Sida Peng, Xin Yang, Haiyang Sun

机构 * Xiaomi EV(小米电动车) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

AI总结 PointForward通过点对齐表示实现驾驶场景重建,采用空间时间融合提升多视角一致性,引入场景图处理动态实例,实现高精度驾驶场景重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11408 2026-05-13 cs.LG cs.AI cs.CL

MaskTab: Scalable Masked Tabular Pretraining with Scaling Laws and Distillation for Industrial Classification

MaskTab: 适用于工业分类的可扩展遮蔽表格预训练与缩放定律及蒸馏

Bo Zheng, Yudong Chen, Zihua Xiong, Shuai Fang, Peidong He, Yang Yang, Sheng Guo

机构 * Zhejiang University(浙江大学) MyBank, Ant Group(蚂蚁集团MyBank)

AI总结 MaskTab通过结合监督预训练和MoE增强损失,提升工业表格数据的分类性能,实现更高的AUC和KS值,并在轻量化模型中保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11392 2026-05-13 cs.AI

Transformer Interpretability from Perspective of Attention and Gradient

从注意力和梯度视角探讨Transformer可解释性

Yongjin Cui, Xiaohui Fan, Huajun Chen

机构 * Zhejiang University(浙江大学)

AI总结 本文从注意力和梯度视角研究Transformer可解释性,提出通过引导梯度方向实现更全面的特征区域解释,帮助理解Transformer机制,并探讨图像分类重写可能带来的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09430 2026-05-13 cs.CV

FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation

FlashAR: 用于自回归图像生成的高效后训练加速

Junkang Zhou, Yefei He, Feng Chen, Weijie Wang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) University of Adelaide(阿德莱德大学)

AI总结 本文提出FlashAR框架,通过双向往前预测将预训练自回归模型转化为高效并行生成器,实现512x512图像生成速度提升22.9倍。

Comments Post-training acceleration for autoregressive image generation, code is available at https://lxazjk.github.io/FlashAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12625 2026-05-13 cs.GR cs.AI

Neural Dynamic GI: Random-Access Neural Compression for Temporal Lightmaps in Dynamic Lighting Environments

神经动态GI:面向动态光照环境的随机访问神经压缩技术

Jianhui Wu, Jian Zhou, Zhi Zhou, Zhangjin Huang, Chao Li

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

AI总结 本文提出Neural Dynamic GI,通过多维特征图和轻量神经网络整合时间信息,实现动态光照环境下的高效光映射压缩,显著降低存储需求并提升实时解压效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11321 2026-05-13 cs.CV

KeyframeFace: Language-Driven Facial Animation via Semantic Keyframes

KeyframeFace: 通过语义关键帧实现语言驱动的面部动画

Jingchao Wu, Zejian Kang, Haibo Liu, Yuanchen Fei, Xiangru Huang

机构 * Westlake University(西湖大学) Nanjing University(南京大学) Zhejiang University(浙江大学) Hunan University(湖南大学)

AI总结 本文提出KeyframeFace框架,通过语义关键帧实现语言驱动的面部动画,提升面部表情的精确控制与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏