arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-05-08 至 2026-05-08 共收录 32
2605.06664 2026-05-08 cs.CV cs.AI

BAMI: Training-Free Bias Mitigation in GUI Grounding

BAMI:无需训练的GUI定位偏差缓解

Borui Zhang, Bo Zhang, Bo Wang, Wenzhao Zheng, Yuhao Cheng, Liang Tang, Yiqiang Yan, Jie Zhou, Jiwen Lu

机构 * Tsinghua University, China(清华大学,中国) Lenovo Research, China(联想研究院,中国)

AI总结 本文提出BAMI方法,通过粗到细聚焦和候选选择缓解GUI定位中的精度偏差和歧义偏差,提升模型在无训练设置下的准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06658 2026-05-08 cs.CV

Relit-LiVE: Relight Video by Jointly Learning Environment Video

Relit-LiVE: 通过联合学习环境视频实现视频照明

Weiqing Xiao, Hong Li, Xiuyu Yang, Houyuan Chen, Wenyi Li, Tianqi Liu, Shaocong Xu, Chongjie Ye, Hao Zhao, Beibei Wang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Chinese Academy of Sciences(中国科学院大学) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 Relit-LiVE通过引入原始参考图像和环境视频预测方法,实现了无需相机姿态先验知识的物理一致视频照明,提升了真实场景下的照明效果和时间稳定性。

Comments Accepted at SIGGRAPH 2026. Project site: https://github.com/zhuxing0/Relit-LiVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06522 2026-05-08 cs.LG cs.CV

Agentic AIs Are the Missing Paradigm for Out-of-Distribution Generalization in Foundation Models

代理AI是基础模型在分布外泛化中的缺失范式

Xin Wang, Haibo Chen, Wenxuan Liu, Wenwu Zhu

机构 * Tsinghua University(清华大学)

AI总结 本文提出代理系统是解决基础模型分布外泛化问题的必要范式,通过四个步骤论证代理系统在结构上超越了传统模型中心范式,提出了参数覆盖上限的理论,并反驳了七项反论点。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06481 2026-05-08 cs.RO

OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation

OA-WAM:面向鲁棒机器人操作的对象可寻址世界动作模型

Yushan Liu, Peibo Sun, Shoujie Li, Yifan Xie, Lingfeng Zhang, Xintao Chao, Shiyuan Dong, Fang Chen, Xiao-Ping Zhang, Wenbo Ding

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

AI总结 OA-WAM通过分解帧为N+1槽状态,结合文本、图像和动作历史,提升机器人操作的鲁棒性,其可寻址对象状态在场景扰动下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06402 2026-05-08 cs.LG

SparseForge: Efficient Semi-Structured LLM Sparsification via Annealing of Hessian-Guided Soft-Mask

SparseForge:通过Hessian引导的软掩码退火实现高效的半结构化LLM稀疏化

Liu Hanzuo, Chaofan Lin, Weixuan Sun, Yulong Wang, Key, Rayying, Mingyu Gao

机构 * Tsinghua University(清华大学)

AI总结 SparseForge通过优化稀疏掩码而非扩大重训练token数量,实现高效的半结构化LLM稀疏化,提升稀疏恢复效率,实验显示其在准确率与效率的权衡上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06326 2026-05-08 cs.CL

Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning

教授思考模型进行工具推理:一种完整的全管道配方用于工具集成推理

Qianjia Cheng, Yuchen Zhang, Zhilin Wang, Yuxin Zuo, Shunkai Zhang, Yuchen Fan, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng, Yun Luo, Ganqu Cui

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种全管道配方,通过注入自然工具使用行为提升强思考模型的工具集成推理能力,同时保持文本推理能力,展示在Qwen3模型上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06310 2026-05-08 cs.LG

Perceive, Route and Modulate: Dynamic Pattern Recalibration for Time Series Forecasting

感知、路由与调制:时间序列预测中的动态模式再校准

Siru Zhong, Zhao Meng, Haohuan Fu, Haoyang Li, Qingsong Wen, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Squirrel Ai Learning

AI总结 本文提出动态模式再校准(DPR),通过轻量级'感知-路由-调制'流程,实现时间序列预测中动态模式的自适应调整,提升模型对局部动态变化的响应能力。

Comments 22 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06247 2026-05-08 cs.RO

CKT-WAM: Parameter-Efficient Context Knowledge Transfer Between World Action Models

CKT-WAM: 在世界动作模型之间高效传递上下文知识

Yuhua Jiang, Yijun Guo, Hongbing Yang, Guojun Lei, Nuo Chen, Yinuo Zhang, Shaoqiang Yan, Bo Lin, Feifei Gao, Biqing Qi

机构 * Tsinghua University(清华大学) LivsynRobotics Shanghai AI Laboratory(上海人工智能实验室)

AI总结 CKT-WAM通过文本嵌入空间中的紧凑上下文传递教师WAM知识,提升零样本泛化能力,在LIBERO-Plus上达到86.1%的成功率,且在现实任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06083 2026-05-08 cs.CV cs.IR cs.LG cs.MM

Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval

重新审视不确定性:关于部分相关视频检索的证据学习

Jun Li, Peifeng Lai, Xuhang Lou, Jinpeng Wang, Yuting Wang, Ke Chen, Yaowei Wang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

AI总结 本文提出Holmes框架,通过多粒度跨模态证据聚合量化和建模不确定性,解决视频检索中因查询简短与视频内容丰富带来的语义模糊问题。

Comments Accepted by ICML 2026. 16 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05963 2026-05-08 cs.AI cs.CL

TheraAgent: Self-Improving Therapeutic Agent for Precise and Comprehensive Treatment Planning

TheraAgent:自我改进的治疗剂用于精准且全面的治疗计划

Junkai Li, Yunghwei Lai, Tianyi Zhu, Zheng Long Lee, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) School of Computing, National University of Singapore, Singapore(计算学院,新加坡国立大学,新加坡)

AI总结 TheraAgent通过迭代生成-判断-改进流程提升治疗计划的精准度和完整性,实验显示其在HealthBench上表现优异,专家评估中胜率高达86%。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26694 2026-05-08 cs.RO cs.AI cs.CV

Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising

从视频先验构建统一的4D世界动作模型

Jun Guo, Qiwei Li, Peiyan Li, Zilong Chen, Nan Sun, Yifei Su, Heyun Wang, Yuan Zhang, Xinghang Li, Huaping Liu

机构 * Tsinghua University(清华大学) Xiaomi Robotics(小米机器人) Peking University(北京大学) CASIA

AI总结 本文提出X-WAM,统一了实时机器人动作执行与高保真的4D世界合成,在单一框架中解决传统统一世界模型仅建模2D像素空间且无法平衡动作效率与世界建模质量的问题。

Comments Project website: https://sharinka0715.github.io/X-WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05630 2026-05-08 cs.CV cs.LG

Making Reconstruction FID Predictive of Diffusion Generation FID

使重建FID成为扩散生成FID的预测指标

Tongda Xu, Mingwei He, Shady Abu-Hussein, Jose Miguel Hernandez-Lobato, Chunhang Zheng, Kai Zhao, Chao Zhou, Ya-Qin Zhang, Yan Wang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) Peking University(北京大学) Kuaishou Technology(快手科技)

AI总结 本文提出插值FID(iFID),通过在潜在空间中检索最近邻并插值其潜在表示,解码后计算与原数据集的FID,从而与生成FID强相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18473 2026-05-08 cs.LG cs.AI

Decentralized Attention Fails Centralized Signals: Rethinking Transformers for Medical Time Series

去中心化注意力失败于中心化信号:重新思考用于医疗时间序列的Transformer

Guoqi Yu, Juncheng Wang, Chen Yang, Jing Qin, Angelica I. Aviles-Rivero, Shujun Wang

机构 * Department of Biomedical Engineering, PolyU(PolyU 生物医学工程系) School of Nursing, PolyU(PolyU 护理学院) Yau Mathematical Sciences Center, Tsinghua University(清华大学尤太数学科学中心)

AI总结 本文提出CoTAR模块,通过集中化MLP替代去中心化注意力,以更好地捕捉医疗时间序列数据中的中心化依赖关系,提升模型效果与效率。

Comments Accepted by ICLR 2026 (Oral). arXiv admin note: text overlap with arXiv:2405.19363 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14397 2026-05-08 cs.LG physics.flu-dyn

SuperWing: a comprehensive transonic wing dataset for data-driven aerodynamic design

SuperWing:一个综合的跨音速机翼数据集用于数据驱动的空气动力学设计

Yunjia Yang, Weishao Tang, Mengxin Liu, Nils Thuerey, Yufei Zhang, Haixin Chen

机构 * School of Aerospace Engineering, Tsinghua University, Beijing, China(清华大学北京航空航天工程学院) School of Computation, Information and Technology, Technical University of Munich, Germany(慕尼黑技术大学计算、信息与技术学院)

AI总结 SuperWing数据集通过4239种参数化机翼几何和28856个RANS解,为数据驱动的空气动力学设计提供广泛的数据支持,展示了其在预测表面流动和零样本泛化方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14148 2026-05-08 cs.RO cs.AI cs.LG

AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models

AsyncVLA: 视觉-语言-动作模型中的异步流匹配

Yuhua Jiang, Shuang Cheng, Yan Ding, Feifei Gao, Biqing Qi

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Lumos Robotics(Lumos机器人)

AI总结 本文提出AsyncVLA,一种引入异步流匹配的视觉-语言-动作模型框架,通过非均匀时间调度和自修正机制提升长周期任务的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08416 2026-05-08 eess.SP cs.IT cs.LG cs.MM math.IT

Generative AI Meets 6G and Beyond: Diffusion Models for Semantic Communications

生成AI遇见6G与未来:扩散模型在语义通信中的应用

Hai-Long Qin, Jincheng Dai, Guo Lu, Shuo Shao, Sixian Wang, Tongda Xu, Wenjun Zhang, Ping Zhang, Khaled B. Letaief

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文探讨生成AI与6G通信的结合,介绍扩散模型在语义通信中的应用,分析其在可控生成、高效推理和跨域适应中的核心方法及贡献。

Comments Accepted by IEEE COMST, GitHub repository: https://github.com/qin-jingyun/Awesome-DiffComm, project page: https://qin-jingyun.github.io/Awesome-DiffComm

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02481 2026-05-08 cs.LG

NOWS: Neural Operator Warm Starts for Accelerating Iterative Solvers

NOWS: 用于加速迭代求解器的神经算子预热

Mohammad Sadegh Eshaghi, Cosmin Anitescu, Navid Valizadeh, Yizheng Wang, Xiaoying Zhuang, Timon Rabczuk

机构 * Leibniz University Hannover(莱布尼茨汉诺威大学) Institute of Photonics(光子研究所) Department of Mathematics and Physics(数学与物理系) Tsinghua University(清华大学) Institute of Structural Mechanics(结构力学研究所) Bauhaus-Universität Weimar(魏玛建筑学院)

AI总结 NOWS结合神经算子的快速推理与传统求解器的严谨性,通过生成高质量初始猜测加速迭代求解,显著降低计算时间并保持稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05862 2026-05-08 cs.LG

Do Neural Operators Forget Geometry? The Forgetting Hypothesis in Deep Operator Learning

神经算子是否遗忘几何?深度算子学习中的遗忘假设

Yanming Xia, Angelica I. Aviles-Rivero

机构 * Qiuzhen College, Tsinghua University, Beijing, China(清华大学北京校区Quizhen学院) Yau Mathematical Sciences Center, Tsinghua University, Beijing, China(清华大学Yau数学科学中心)

AI总结 本文研究了神经算子在不规则几何上性能下降的原因,提出几何遗忘假设,并引入轻量级几何记忆注入机制以缓解遗忘问题,揭示几何保留是结构需求而非设计选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05819 2026-05-08 cs.LG

HCInfer: An Efficient Inference System via Error Compensation for Resource-Constrained Devices

HCInfer:通过误差补偿实现资源受限设备的高效推理系统

Shen Xu, Xiangwen Zhuge, Zhe Xu, Yingkun Hu, Zheng Yang, Yunhao Liu

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出HCInfer系统,通过将残差补偿任务卸载到CPU,利用GPU执行压缩主干网络,并引入异步补偿管道和敏感性感知的动态秩分配,以提高精度恢复和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05818 2026-05-08 cs.CR cs.AI cs.CL

LeakDojo: Decoding the Leakage Threats of RAG Systems

LeakDojo:解码RAG系统的泄漏威胁

Maosen Zhang, Jianshuo Dong, Boting Lu, Wenyue Li, Xiaoping Zhang, Tianwei Zhang, Han Qiu

机构 * Tsinghua University, China(清华大学, 中国) Ant International, China(蚂蚁集团, 中国) Nanyang Technological University, Singapore(南洋理工大学, 新加坡)

AI总结 LeakDojo通过可控评估揭示RAG系统泄漏风险,发现查询生成和对抗指令独立影响泄漏,且指令能力越强泄漏风险越高,RAG可信度提升可能增加泄漏风险。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05781 2026-05-08 cs.CV cs.AI

Steering Visual Generation in Unified Multimodal Models with Understanding Supervision

通过理解监督引导统一多模态模型的视觉生成

Zeyu Liu, Zanlin Ni, Yang Yue, Cheng Da, Huan Yang, Di Zhang, Kun Gai, Gao Huang

机构 * Tsinghua University(清华大学) Kolors Team, Kuaishou Technology(快手技术团队)

AI总结 本文提出UNO框架,通过将理解作为监督信号引导生成,提升多模态模型在图像生成与编辑中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05741 2026-05-08 cs.AI

HyperLens: Quantifying Cognitive Effort in LLMs with Fine-grained Confidence Trajectory

HyperLens: 通过细粒度置信轨迹量化大语言模型中的认知努力

Chengda Lu, Xiaoyu Fan, Wei Xu

机构 * IIIS, Tsinghua University(清华大学信息学院) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 HyperLens通过分析大语言模型推理过程中的置信轨迹,量化认知努力,揭示复杂任务对更高认知努力的需求,并诊断监督微调对领域任务性能的影响。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05712 2026-05-08 cs.CV

EgoEMG: A Multimodal Egocentric Dataset with Bilateral EMG and Vision for Hand Pose Estimation

EgoEMG:一个用于手姿态估计的多模态自体视角数据集,包含双侧EMG和视觉信息

Ziheng Xi, Jiayi Yu, Yitao Wang, Yanbo Duan, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 EgoEMG数据集融合双侧EMG和视觉信息,用于手姿态估计,包含16通道EMG、IMU、RGB视频和RGB-D视频,涵盖41名参与者60种手势,提供EMG-to-pose、vision-to-pose和融合任务的基准测试。

Comments 34 pages, 13 figures, 15 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05701 2026-05-08 cs.AI

Inference-Time Budget Control for LLM Search Agents

推理时预算控制用于大语言模型搜索代理

Zhengru Fang, Senkang Forest Hu, Zhonghao Chang, Yu Guo, Yihang Tao, Hongyao Liu, Mengzhe Ruan, Jun Huang, Yuguang Fang

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Alibaba Ant Group(阿里巴巴集团)

AI总结 本文研究了多跳问答中推理时双预算控制问题,通过两阶段控制策略,在搜索阶段根据任务级信息价值评分选择检索、分解或回答承诺,在最终阶段根据证据选择性修正答案,实验表明该方法在多个基准上取得积极收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05700 2026-05-08 cs.SE cs.AI

An Empirical Study of Proactive Coding Assistants in Real-World Software Development

对现实软件开发中主动编码助手的实证研究

Lehui Li, Ruixuan Jia, Guo-Ye Yang, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Fitten Tech Co., Ltd.(Fitten科技有限公司)

AI总结 本文通过大规模实证研究,分析了模拟与现实数据在主动意图预测中的差异,提出ProCodeBench基准,并指出模拟数据无法替代真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05636 2026-05-08 cs.CV cs.GR

Learning a Delighting Prior for Facial Appearance Capture in the Wild

为野外面部外观捕捉学习一种愉悦先验

Yuxuan Han, Xin Ming, Tianxiao Li, Zhuofan Shen, Qixuan Zhang, Lan Xu, Feng Xu

机构 * School of Software(软件学院) BNRist, Tsinghua University(清华大学计算机系) ShanghaiTech University(上海科技大学) Deemos Technology Co., Ltd.(德莫斯科技有限公司)

AI总结 本文提出通过训练强大愉悦网络作为先验来约束优化,结合异构数据源实现高质量反射率估计,同时开源模型和数据集推动高精度面部捕捉研究。

Comments ACM Transactions on Graphics (Proc. of SIGGRAPH), 2026. Code: https://github.com/yxuhan/OpenDelight Project Page: https://yxuhan.github.io/OpenDelight/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05241 2026-05-08 cs.RO cs.LG

DexSim2Real: Foundation Model-Guided Sim-to-Real Transfer for Generalizable Dexterous Manipulation

DexSim2Real: 基于基础模型的仿真到现实迁移用于通用的灵巧操作

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li, Yuhao Liao

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学) UCSI University(UCSI大学)

AI总结 本文提出DexSim2Real框架,结合基础模型引导的域随机化、触觉视觉交叉注意力策略和渐进技能课程,提升灵巧操作的仿真到现实迁移性能,实验表明其在现实世界中的成功率达到78.2%。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26799 2026-05-08 cs.CV cs.GR cs.MM

MesonGS++: Post-training Compression of 3D Gaussian Splatting with Hyperparameter Searching

MesonGS++: 3D高斯散射的后训练压缩与超参数搜索

Shuzhao Xie, Junchen Ge, Weixiang Zhang, Jiahang Liu, Chen Tang, Yunpeng Bai, Shijia Ge, Jingyan Jiang, Yuzhi Huang, Fengnian Yang, Cong Zhang, Xiaoyi Fan, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Hong Kong University of Science and Technology(香港科技大学) Harbin Institute of Technology(哈尔滨工业大学) The Chinese University of Hong Kong(香港中文大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Shenzhen Technology University(深圳技术大学) Xiamen University(厦门大学) Simon Fraser University(西蒙弗雷泽大学) Jiangxing Intelligence Inc.(江兴智能有限公司)

AI总结 MesonGS++提出了一种基于超参数搜索的3D高斯散射后训练压缩方法,通过联合重要性剪枝、八叉树几何编码等技术,实现34倍压缩并保持渲染质量,优于现有方法并精准满足目标存储预算。

Comments https://github.com/mmlab-sigs/mesongs_plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26227 2026-05-08 cs.CV

HOI-aware Adaptive Network for Weakly-supervised Action Segmentation

面向HOI的自适应网络用于弱监督动作分割

Runzhong Zhang, Suchen Wang, Yueqi Duan, Yansong Tang, Yue Zhang, Yap-Peng Tan

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学)

AI总结 本文提出AdaAct网络,通过利用视频级的时空局部人-物交互作为先验知识,动态适应HOI序列以区分模糊动作,实验验证了方法的有效性。

Comments Accepted to IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18181 2026-05-08 cs.CV

MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation

MACE-Dance: 基于动作-外观级联专家的音乐驱动舞蹈视频生成

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(阿里集团AMAP) Wuhan University(武汉大学) Tsinghua University(清华大学)

AI总结 本文提出MACE-Dance框架,结合级联混合专家模型,实现音乐驱动的高质量舞蹈视频生成,通过动作和外观专家分别生成3D动作和视频,提升视觉一致性和动作真实感。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏