arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2925
2605.07931 2026-05-15 cs.CV cs.AI

One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy

每帧一个令牌:重新考虑世界模型中的视觉带宽

Zuojin Tang, Shengchao Yuan, Xiaoxin Bai, Zhiyuan Jing, De Ma, Gang Pan, Bin Liu

机构 * Zhejiang University(浙江大学) Central South University(中南大学) Harbin Institute of Technology(哈尔滨工业大学) Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) E-surfing Digital Life Technology Co., Ltd., China Telecom(亿联数字生活技术有限公司,中国电信)

AI总结 本文提出OneWM-VLA,通过自适应注意力池化将每帧视图压缩为一个语义令牌,以单一流匹配目标生成潜在流和动作轨迹,从而减少每帧视觉带宽而不影响长视界性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13452 2026-05-14 cs.RO cs.AI

CUBic: Coordinated Unified Bimanual Perception and Control Framework

CUBic:协调统一的双臂感知与控制框架

Xingyu Wang, Pengxiang Ding, Jingkai Xu, Donglin Wang, Zhaoxin Fan

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算高级创新中心,人工智能学院,北京航空航天大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 本文提出CUBic框架,通过统一感知模型解决双臂协调问题,采用共享表示学习提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13428 2026-05-14 cs.RO

SID: Sliding into Distribution for Robust Few-Demonstration Manipulation

SID:滑入分布以实现鲁棒的少样本操控

Yicheng Ma, Wei Yu, Zhian Su, Xidan Zhang, Huixu Dong

机构 * Grasp Lab, Zhejiang University(浙江大学抓取实验室) Torch Kernel Co., Ltd.(火炬内核有限公司)

AI总结 SID通过学习对象中心运动场,使系统在少样本下鲁棒地滑向演示 manifold 和轻量执行策略的可靠区域,提升动态扰动下的操控性能。

Comments 20 pages, 14 figures. Project website: https://sliding-into-distribution.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22643 2026-05-14 cs.RO

An Overtaking Trajectory Planning Framework Based on Spatio-temporal Topology and Reachable Set Analysis Ensuring Time Efficiency

基于时空拓扑与可达集分析的超越轨迹规划框架:确保时间效率

Wule Mao, Zhouheng Li, Entao Sun, Lei Xie, Hongye Su

机构 * State Key Laboratory of Industrial Control Technology, Zhejiang University, Hangzhou, 310027, China(工业控制技术国家重点实验室,浙江大学,杭州,310027,中国) Shanghai STEP Electric Corporation, Shanghai, 201802, China(上海STEP电力有限公司,上海,201802,中国)

AI总结 本文提出SROP框架,通过时空拓扑搜索获取多样初始路径并结合可达集分析提升计算效率,实验显示轨迹平滑度提升66.8%且计算时间减少62.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13172 2026-05-14 cs.MA cs.AI

When Does Hierarchy Help? Benchmarking Agent Coordination in Event-Driven Industrial Scheduling

何时层级有助于?事件驱动工业调度中的代理协调基准测试

Ziqi Wang, Yuhao Yang, Zhiwei Ling, Wenzhuo Qian, Hailiang Zhao

机构 * Zhejiang University(浙江大学)

AI总结 本文通过DESBench基准测试,探讨不同协调范式在复杂环境中的表现,揭示层级结构对代理系统行为的影响及设计权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13105 2026-05-14 cs.RO

What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models

忽略什么,反应什么:视觉鲁棒的VLA模型强化学习微调

Yuanfang Peng, Jingjing Fu, Chuheng Zhang, Li Zhao, Jiang Bian, Mingyu Liu, Ling Zhang, Jun Zhang, Rui Wang

机构 * Hong Kong University of Science and Technology(香港理工大学) Microsoft Research Asia(微软亚洲研究院) Zhejiang University(浙江大学)

AI总结 本文提出PAIR-VLA框架,通过在PPO优化中加入两个辅助目标,提升VLA模型在视觉变化下的鲁棒性,实验表明其在不同视觉扰动下均优于标准PPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12957 2026-05-14 cs.CV

GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion

GTA: 通过几何然后外观视频扩散推进图像到3D世界生成

Hanxin Zhu, Cong Wang, Peiyan Tu, Jiayi Luo, Tianyu He, Xin Jin, Zhibo Chen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

AI总结 本文提出GTA方法,通过几何先于外观的两阶段框架提升3D场景生成的结构精度和视觉质量,同时引入随机潜在shuffle策略和测试时缩放方案,实验表明其在保真度、视觉质量和几何准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12952 2026-05-14 cs.CV

Debunking Grad-ECLIP: A Comprehensive Study on Its Incorrectness and Fundamental Principles for Model Interpretation

驳斥Grad-ECLIP:对其实错误性及模型解释基本原理的全面研究

Yongjin Cui, Xiaohui Fan

机构 * Zhejiang University(浙江大学)

AI总结 本文指出Grad-ECLIP并非新方法,其本质等同于注意力机制,并揭示其缺陷及模型解释应遵循的基本原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12899 2026-05-14 stat.ML cs.LG

Robust Sequential Experimental Design for A/B Testing

面向A/B测试的鲁棒序列实验设计

Qianglin Wen, Xiangkun Wu, Chengchun Shi, Ting Li, Niansheng Tang, Yingying Zhang, Hongtu Zhu

机构 * Yunnan Key Laboratory of Statistical Modeling and Data Analysis(云南统计建模与数据分析重点实验室) Yunnan University(云南大学) School of Mathematical Sciences(数学科学学院) Zhejiang University(浙江大学) Department of Statistics(统计系) London School of Economics and Political Science(伦敦政治经济学院) School of Statistics and Data Science(统计与数据科学学院) Shanghai University of Finance and Economics(上海财经大学) East China Normal University(华东师范大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出一种鲁棒序列实验设计框架,适用于模型不准确情况,结合上下文带宽和动态设置,理论证明了其对治疗效应估计的最坏均方误差界,并通过合成和现实数据验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12704 2026-05-14 cs.SC cs.AI cs.LG

FePySR: A Neural Feature Extraction Framework for Efficient and Scalable Symbolic Regression

FePySR:一种用于高效且可扩展的符号回归的神经特征提取框架

Zhiming Yu, Wangtao Lu, Xin Lai

机构 * School of Mathematical Sciences, Zhejiang University, Hangzhou, Zhejiang, China(浙江大学数学科学学院,杭州,浙江,中国) Faculty of Medicine and Health Technology, Tampere University, Tampere, Finland(塔尔库大学医学与健康技术学院,塔尔库,芬兰)

AI总结 FePySR通过神经网络提取有效特征,优化符号回归搜索空间,提升方程恢复率和计算效率,适用于复杂科学领域。

Comments Data and Code Availability: https://github.com/laixn/FePySR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10906 2026-05-14 cs.LG cs.AI

DataMaster: Data-Centric Autonomous AI Research

DataMaster: 以数据为中心的自主AI研究

Yaxin Du, Xiyuan Yang, Zhifan Zhou, Wanxu Liu, Zixing Lei, Zimeng Chen, Fenyi Liu, Haotian Wu, Yuzhu Cai, Zexi Liu, Xinyu Zhu, WenHao Wang, Linfeng Zhang, Chen Qian, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学)

AI总结 DataMaster通过自主数据工程优化数据侧,提升下游性能,无需改变学习算法。其包含数据树、共享数据池和全局记忆三大组件,有效解决开放搜索空间和延迟验证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10819 2026-05-14 cs.RO cs.AI cs.CV

ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models

ALAM:基于代数一致的潜在动作模型用于视觉-语言-动作模型

Zuojin Tang, Haoyun Liu, Xinyuan Chang, Changjie Wu, Dongjie Huo, Yandan Yang, Bin Liu, Zhejia Cai, Feng Xiong, Mu Xu, jiachen Luo, De Ma, Zhiheng Ma, Gang Pan

机构 * Zhejiang University(浙江大学) Amap, Alibaba Group(阿里集团阿地图) Nanjing University(南京大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Beijing University of Chemical Technology(北京化工大学) Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) Tsinghua University(清华大学) Queen Mary University of London(伦敦大学玛丽女王学院)

AI总结 ALAM通过代数一致的潜在动作模型从无标注视频中提取结构化先验,结合流匹配目标提升VLA学习性能,显著提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09025 2026-05-14 cs.CV cs.AI

Skill-Conditioned Visual Geolocation for Vision-Language Models

基于技能的视觉地理定位用于视觉-语言模型

Chenjie Yang, Yutian Jiang, Yutong Deng, Chenyu Wu

机构 * Southwest Jiaotong University(西南交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学)

AI总结 本文提出GeoSkill框架,通过技能图进化提升视觉语言模型的地理定位能力与自我进化能力,实验显示其在GeoRC任务中表现优异,且在外部数据集上具有良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01908 2026-05-14 cs.CV

Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning

基于推理的编辑:基于假设指令的图像编辑与视觉推理

Qingdong He, Xueqin Chen, Chaoyi Wang, Yanjie Pan, Xiaobin Hu, Zhenye Gan, Yabiao Wang, Chengjie Wang, Xiangtai Li, Jiangning Zhang

机构 * Tencent Youtu Lab(腾讯云图实验室) Sichuan University(四川大学) University of the Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Reason50K数据集和ReasonBrain框架,通过多模态大语言模型和扩散模型实现复杂隐含指令的图像编辑,提升视觉推理能力。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12297 2026-05-13 cs.CV cs.RO eess.IV

EgoEV-HandPose: Egocentric 3D Hand Pose Estimation and Gesture Recognition with Stereo Event Cameras

EgoEV-HandPose:基于立体事件相机的视角3D手姿估计与手势识别

Luming Wang, Hao Shi, Jiajun Zhai, Kailun Yang, Kaiwei Wang

机构 * National Research Center for Optical Instrumentation, Zhejiang University(浙江大学光学仪器国家研究中心) School of Artificial Intelligence and Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(湖南大学人工智能与机器人学院和机器人视觉感知与控制技术国家工程研究中心) Ant Group Company Ltd.(蚂蚁集团有限公司)

AI总结 本文提出EgoEV-HandPose框架,通过立体事件流实现3D双臂姿态估计和手势识别,引入KeypointBEV模块和EgoEVHands数据集,取得优异性能。

Comments Extended version of SMC 2025 paper arXiv:2503.12419. The established dataset and source code will be publicly released at https://github.com/ZJUWang01/EgoEV-HandPose

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11906 2026-05-13 cs.CL

YFPO: A Preliminary Study of Yoked Feature Preference Optimization with Neuron-Guided Rewards for Mathematical Reasoning

YFPO:一种基于神经引导奖励的数学推理的初步研究

Yifan Le

机构 * Zhejiang University(浙江大学)

AI总结 YFPO通过识别数学相关神经元并构建辅助奖励,提升大语言模型的推理能力,实验表明神经层面信号可增强偏好优化,为更精细的推理后训练提供新方向。

Comments 10 pages, 2figures. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11880 2026-05-13 cs.LG cs.MA

Adaptive TD-Lambda for Cooperative Multi-agent Reinforcement Learning

自适应TD-λ用于合作多智能体强化学习

Yue Deng, Zirui Wang, Yin Zhang

机构 * Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文提出自适应TD(λ)方法,通过参数化无偏密度比估计器和双回放缓冲区解决多智能体强化学习中策略分布计算问题,实验证明其在SMAC和Gfootball场景中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06130 2026-05-13 cs.AI

Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning

技能1:通过强化学习实现技能增强代理的统一进化

Yaorui Shi, Yuxin Chen, Zhengxi Lu, Yuchun Miao, Shugui Liu, Qi GU, Xunliang Cai, Xiang Wang, An Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

AI总结 本文提出Skill1框架,通过单一策略协同进化技能选择、利用与蒸馏,以共享任务目标优化技能库维护,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13420 2026-05-13 cs.CR cs.AI

Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache

通过前缀共享KV缓存加速后缀劫持攻击

Xinhai Wang, Shaopeng Fu, Shu Yang, Liangyu Wang, Tianhang Zheng, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王阿卜杜勒阿齐兹大学) Zhejiang University(浙江大学)

AI总结 本文提出PSKV技术,通过共享前缀KV缓存减少后缀劫持攻击的计算开销,实验表明在五种广泛部署的LLM上,PSKV将推理时间减少40%,峰值内存使用减少50%。

Comments 27 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09587 2026-05-13 cs.CV cs.AI

MieDB-100k: A Comprehensive Dataset for Medical Image Editing

MieDB-100k:用于医学图像编辑的综合数据集

Yongfan Lai, Wen Qian, Bo Liu, Hongyan Li, Hao Luo, Fan Wang, Bohan Zhuang, Shenda Hong

机构 * State Key Laboratory of General Artificial Intelligence, Beijing, China(1 国家一般人工智能重点实验室,北京,中国) School of Intelligence Science and Technology, Peking University, Beijing, China(2 智能科学与技术学院,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(3 国家健康数据科学研究院,北京大学,北京,中国) DAMO Academy, Alibaba Group, Zhejiang, China(4 阿里巴巴集团 DAMO 院,浙江,中国) hupan lab, zhejiang province(5 鹏元实验室,浙江省) Zhejiang University, Zhejiang, China(6 浙江大学,浙江,中国)

AI总结 本文提出MieDB-100k数据集,通过数据筛选流程结合专家模型与规则生成方法,解决医学图像编辑中数据质量、多样性与可扩展性不足的问题,实验表明其在医学图像编辑任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03853 2026-05-13 cs.CV

UGround: Towards Unified Visual Grounding with Unrolled Transformers

UGround: 向统一视觉接地迈进的展开变换

Rui Qian, Xin Yin, Chuanhang Deng, Zhiyuan Peng, Jian Xiong, Wei Zhai, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Zhejiang University(浙江大学)

AI总结 UGround通过引入Policy-Prompted Masking机制,动态选择展开变换层作为掩码提示,解决传统方法依赖固定最后一层和隐式投影的问题,统一了从传统参照表达分割到新提出的推理分割等多种视觉接地任务。

Comments This work has been accepted to ICML 2026, please refer to https://github.com/rui-qian/UGround

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11814 2026-05-13 cs.AI

MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare

MedMemoryBench:个性化医疗中智能体记忆的基准测试

Yihao Wang, Haoran Xu, Renjie Gu, Yixuan Ye, Xinyi Chen, Xinyu Mu, Yuan Gao, Chunxiao Guo, Peng Wei, Jinjie Gu, Huan Li, Ke Chen, Lidan Shou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出MedMemoryBench,通过合成真实医疗场景数据,评估智能体长期记忆能力,并揭示主流架构在复杂医疗推理中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11738 2026-05-13 cs.AI

OptArgus: A Multi-Agent System to Detect Hallucinations in LLM-based Optimization Modeling

OptArgus:一种多智能体系统用于检测基于大语言模型的优化建模中的幻觉

Zhong Li, Zihan Guo, Xiaohan Lu, Juntao Wang, Jie Song, Chao Shen, Jiageng Wu, Mingyang Sun

机构 * Great Bay University(大湾大学) Peking University(北京大学) Jilin University(吉林大学) Zhejiang University(浙江大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出OptArgus多智能体系统,通过细粒度幻觉分类法检测优化建模中的错误,通过三部分基准测试验证其在清洁、控制和自然生成 artifact 上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11697 2026-05-13 cs.RO

Rainbow Deep Q-Learning with Kinematics-Aware Design for Cooperative Delta and 3-RRS Parallel Robot Insertion

彩虹深度Q学习与运动学感知设计用于协作Delta和3-RRS平行机器人插入

Hassen Nigatu, Gaokun Shi, Jituo Li, Wang Jin, Lu Guodong

机构 * Robotics Research Center of Yuyao(余姚机器人研究中心) Robotics Institute of Zhejiang University(浙江大学机器人院) Yuyao Technology Innovation Center(余姚技术创新中心) Department of Electrical and Computer Engineering, University of New Brunswick(新 Brunswick大学电气与计算机工程系)

AI总结 本文提出基于Rainbow深度Q网络的运动学感知深度强化学习框架,用于Delta并联机器人与3-RRS并联机械臂的协作插孔任务。通过几何设计优化阶段提升运动学性能,实现六自由度可控子空间,并结合形状奖励机制和两阶段课程训练,提高插孔任务的稳定性和可靠性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11594 2026-05-13 cs.CV

PointForward: Feedforward Driving Reconstruction through Point-Aligned Representations

PointForward:通过点对齐表示实现馈送驾驶重建

Cheng Chi, Xianqi Wang, Hongcheng Luo, Mingfei Tu, Gangwei Xu, Zehan Zhang, Bing Wang, Guang Chen, Hangjun Ye, Sida Peng, Xin Yang, Haiyang Sun

机构 * Xiaomi EV(小米电动车) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

AI总结 PointForward通过点对齐表示实现驾驶场景重建,采用空间时间融合提升多视角一致性,引入场景图处理动态实例,实现高精度驾驶场景重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11408 2026-05-13 cs.LG cs.AI cs.CL

MaskTab: Scalable Masked Tabular Pretraining with Scaling Laws and Distillation for Industrial Classification

MaskTab: 适用于工业分类的可扩展遮蔽表格预训练与缩放定律及蒸馏

Bo Zheng, Yudong Chen, Zihua Xiong, Shuai Fang, Peidong He, Yang Yang, Sheng Guo

机构 * Zhejiang University(浙江大学) MyBank, Ant Group(蚂蚁集团MyBank)

AI总结 MaskTab通过结合监督预训练和MoE增强损失,提升工业表格数据的分类性能,实现更高的AUC和KS值,并在轻量化模型中保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11392 2026-05-13 cs.AI

Transformer Interpretability from Perspective of Attention and Gradient

从注意力和梯度视角探讨Transformer可解释性

Yongjin Cui, Xiaohui Fan, Huajun Chen

机构 * Zhejiang University(浙江大学)

AI总结 本文从注意力和梯度视角研究Transformer可解释性,提出通过引导梯度方向实现更全面的特征区域解释,帮助理解Transformer机制,并探讨图像分类重写可能带来的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09430 2026-05-13 cs.CV

FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation

FlashAR: 用于自回归图像生成的高效后训练加速

Junkang Zhou, Yefei He, Feng Chen, Weijie Wang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) University of Adelaide(阿德莱德大学)

AI总结 本文提出FlashAR框架,通过双向往前预测将预训练自回归模型转化为高效并行生成器,实现512x512图像生成速度提升22.9倍。

Comments Post-training acceleration for autoregressive image generation, code is available at https://lxazjk.github.io/FlashAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12625 2026-05-13 cs.GR cs.AI

Neural Dynamic GI: Random-Access Neural Compression for Temporal Lightmaps in Dynamic Lighting Environments

神经动态GI:面向动态光照环境的随机访问神经压缩技术

Jianhui Wu, Jian Zhou, Zhi Zhou, Zhangjin Huang, Chao Li

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

AI总结 本文提出Neural Dynamic GI,通过多维特征图和轻量神经网络整合时间信息,实现动态光照环境下的高效光映射压缩,显著降低存储需求并提升实时解压效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11321 2026-05-13 cs.CV

KeyframeFace: Language-Driven Facial Animation via Semantic Keyframes

KeyframeFace: 通过语义关键帧实现语言驱动的面部动画

Jingchao Wu, Zejian Kang, Haibo Liu, Yuanchen Fei, Xiangru Huang

机构 * Westlake University(西湖大学) Nanjing University(南京大学) Zhejiang University(浙江大学) Hunan University(湖南大学)

AI总结 本文提出KeyframeFace框架,通过语义关键帧实现语言驱动的面部动画,提升面部表情的精确控制与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏