arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2778
2508.01651 2026-07-07 cs.CV 版本更新

Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning

扩散模型是开放世界的功能学习器:利用生成先验进行3D功能学习

Hanqing Wang, Zhenhao Zhang, Kaiyang Ji, Mingyu Liu, Wenti Yin, yuchao chen, Zhirui Liu, Xiangyu Zeng, Tianxiang Gui, Hangxing Zhang, Jiahao Yuan, Zhiqing Cui, Jiaxin Liu, Zhiyuan Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 研究3D功能基础问题,利用文本到图像扩散模型提取先验知识,提出基于扩散的DAG框架用于3D功能预测,通过实验证明其优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02517 2026-07-03 cs.CV 新提交

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

WorldDirector: 构建具有持久动态记忆的可控世界模拟器

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Qingyan Bai, Ka Leong Cheng, Yue Yu, Yixuan Li, Yihao Meng, Zichen Liu, Yanhong Zeng, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) CUHK(香港中文大学)

AI总结 提出WorldDirector框架,通过LLM协调3D轨迹与相机运动作为视频生成控制信号,解耦语义运动编排与视觉生成,实现持久动态对象记忆和自由视角探索。

Comments Project Page: https://worlddirector.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02508 2026-07-03 cs.CV 新提交

From SRA to Self-Flow: Data Augmentation or Self-Supervision?

从SRA到Self-Flow:数据增强还是自监督?

Dengyang Jiang, Mengmeng Wang, Harry Yang, Jingdong Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学) Baidu Inc.(百度公司)

AI总结 本文通过提出注意力分离方法,发现Self-Flow中双时间调度的性能提升主要源于噪声维度的数据增强,而非token间交互,并验证了该设计在ImageNet上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02322 2026-07-03 cs.RO cs.CV 新提交

The Moving Eye: Enhancing VLA Spatial Generalization via Hybrid Dynamic Data Collection

移动之眼:通过混合动态数据收集增强VLA空间泛化能力

Jincheng Tang, Yilong Zhu, Zhengyuan Xie, Jiang-Jiang Liu, Jiaxing Zhang

机构 * Lion Rock AI Lab, China Merchants Research Institute of Advanced Technology(狮岩人工智能实验室,中国商人先进科技研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) Nankai University(南开大学)

AI总结 针对VLA模型空间泛化脆弱性问题,提出混合动态数据策略,结合连续相机运动与多样静态视角,减少虚假相关性,提升对未见相机位姿和物体配置的泛化能力。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02284 2026-07-03 cs.CV 新提交

FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval

FlowCIR: 通过流匹配实现零样本组合图像检索的语义传输

Zhenqi He, Ziqi Jiang, Yuanpei Liu, Yanghao Wang, Teng Wang, Long Chen

机构 * The Hong Kong University of Science and Technology, Hong Kong SAR(香港科技大学) The University of Hong Kong, Hong Kong SAR(香港大学)

AI总结 提出FlowCIR,利用条件流匹配将参考图像与指令组合成目标对齐查询嵌入,避免文本反转的信息损失,训练效率高,并引入多负向引导策略提升对否定指令的鲁棒性。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01874 2026-07-03 cs.AI cs.CL 新提交

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

SkillCoach: 用于评估和增强智能体技能使用的自演化评分准则

Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue

机构 * HKUST(GZ)(香港科技大学(广州))

AI总结 提出SkillCoach框架,通过自演化过程评分准则从技能选择、遵循、组合和反思四维度评估智能体轨迹,并利用演化准则筛选高质量训练数据,提升技能使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01764 2026-07-03 cs.AI 新提交

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

Mastermind: 基于策略学习的仓库级漏洞复现

Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出Mastermind双循环框架,通过策略学习(SFT+GRPO)提升LLM代理在仓库级漏洞复现中的表现,在260个训练任务和200个测试任务上达到84.5%通过率,并成功迁移至不同执行器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01752 2026-07-03 cs.LG 新提交

Efficient Temporal Point Processes via Monotone Alternating Splines

通过单调交替样条实现高效时间点过程

Cheng Wan, Quyu Kong, Feng Zhou

机构 * Hong Kong University of Science and Technology(香港科技大学) Alibaba Cloud(阿里云) Center for Applied Statistics and School of Statistics, Renmin University of China(中国人民大学应用统计中心与统计学院)

AI总结 针对单调神经网络在建模累积条件强度函数时的结构缺陷,提出单调交替样条框架,通过分离插值与外推组件提升表示能力与计算效率,在合成和真实数据集上取得更优性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01677 2026-07-03 cs.CV 新提交

ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning

ICDepth: 通过上下文条件化驯服视频扩散模型用于视频深度估计

Xuanhua He, Jiaxin Xie, Mingzhe Zheng, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出ICDepth框架,利用上下文条件化(ICC)将预训练文本到视频扩散Transformer适配到视频深度估计,通过SAND-Attention确保时空对齐和SRFM注入语义分辨率先验,仅用0.8M帧训练数据即达到SOTA并展现强零样本泛化。

Comments Accepted to ECCV 2026. Project page: https://xuanhuahe.github.io/ICDepth/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24564 2026-07-03 cs.CV 新提交

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments

PatternGSL: 一种用于无模板且可模拟的3D服装的结构化规范语言

Zhenyang Li, Lutao Jiang, Yizhou Zhao, Ying-Cong Chen, Xin Wang, Weikai Chen, Yifan Peng

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Carnegie Mellon University(卡内基梅隆大学) LIGHTSPEED Shenzhen(LIGHTSPEED深圳) LIGHTSPEED Los Angeles(LIGHTSPEED洛杉矶)

AI总结 提出PatternGSL,一种无模板、可学习的结构化服装表示语言,从单张图像直接预测完整缝纫图案,实现可模拟的3D服装重建。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23041 2026-07-03 cs.CV 新提交

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

SPAR: 语义-像素自对齐与自适应路由的统一多模态模型

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司)

AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25421 2026-07-03 cs.LG cs.AI 版本更新

FED-FSTQ: Fisher-Guided Token Quantization for Communication-Efficient Federated Fine-Tuning of LLMs on Edge Devices

FED-FSTQ:基于Fisher的令牌量化用于边缘设备上通信高效联邦微调大型语言模型

Changyu Li, Shuanghong Huang, Jiashen Liu, Ming Lei, Jidu Xing, Kaishun Wu, Lu Wang, Fei Luo

机构 * School of Computing and Information Technology, Great Bay University(计算与信息学院,大亚湾大学) Beijing Institute of Technology(北京理工大学) University of Warwick(沃里克大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

AI总结 本文提出Fed-FSTQ,一种基于Fisher的令牌量化方法,用于在边缘设备上高效联邦微调大型语言模型,通过非均匀混合精度量化和重要性感知令牌选择,减少通信开销并提升训练效率。

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14198 2026-07-03 cs.LG cs.AI stat.ML 版本更新

Efficient Federated Conformal Prediction with Group-Conditional Guarantee

高效联邦共形预测与组条件保证

Haifeng Wen, Osvaldo Simeone, Hong Xing

机构 * IoT Thrust(物联网 thrust) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute for Intelligent Networked Systems (INSI)(智能网络化系统研究所) Northeastern University London(伦敦东北大学) Department of ECE The Hong Kong University of Science and Technology HK SAR(电子工程系 香港科技大学香港特别行政区)

AI总结 提出GC-FCP方法,通过可合并的原子分层核心集实现联邦共形预测的组条件覆盖保证,在合成和真实数据集上验证了性能。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12770 2026-07-03 cs.CV 版本更新

One-Shot Feed-Forward 360$^{\circ}$ Animatable Avatar via Inpainted UV-Space Gaussian Modeling

通过修补UV空间高斯建模的一次前馈360度可动画化头像

Shuling Zhao, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zeekr Automobile R&D Co., Ltd(Zeekr汽车研发有限公司)

AI总结 提出一种基于UV空间高斯建模的一次前馈框架,利用预训练3D GAN的先验知识修补缺失区域,实现360度全头可动画化头像的高质量重建与实时动画。

Comments Accepted by ECCV 2026. Project page: https://shaelynz.github.io/fhavatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14157 2026-07-03 cs.AI cs.CV 版本更新

Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理

Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))

AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01222 2026-07-02 cs.CV 新提交

Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models

Ink3D: 通过视频生成模型雕刻具有极其复杂纹理的3D资产

Yue Han, Chong Li, Zhening Liu, Cong Huang, Fang Deng, Yong Liu, Fangyun Wei, Yan Lu

机构 * ZGCA & ZGCI(ZGCA 和 ZGCI) Microsoft Research(微软研究院) Zhejiang University(浙江大学) HKUST(香港科技大学)

AI总结 提出Ink3D框架,利用大规模视频生成模型合成复杂纹理,通过OrbitPainter生成密集轨道扫描视频,并用TextureOptimizer进行神经烘焙以生成一致纹理。

Comments Accepted to ECCV 2026. Project page: https://yuehan99.github.io/Ink3D-TextureGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00752 2026-07-02 cs.CV 新提交

GKDT: General Keypoint Detection Transformer

GKDT: 通用关键点检测Transformer

Changsheng Lu, Yuxin Chen, Haokun Gui, Rong Wang, Jie Yang, Harry Yang, Anton van den Hengel, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科技大学) Australian National University(澳大利亚国立大学) Tencent Inc.(腾讯公司) Adelaide University(阿德莱德大学)

AI总结 提出通用关键点检测模型GKDT,基于大规模统一数据集MegaKPT和DINOv3 Transformer,支持视觉/文本提示,在22个测试集上多数类别PCK@0.1超90%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00293 2026-07-02 cs.CV cs.CL cs.LG 新提交

Rosetta: Composable Native Multimodal Pretraining

Rosetta: 可组合的原生多模态预训练

Xiangyue Liu, Zijian Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Ping Tan

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

AI总结 提出Rosetta框架,通过动量锚定正交投影(MAOP)实现无损模态扩展,解决多模态预训练中的灾难性遗忘和梯度冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13695 2026-07-02 physics.geo-ph cs.AI cs.LG 新提交

Korzhinskii-Net: Physics-Informed Neural Network for Sub-Surface Mineral Prospectivity Modelling

Korzhinskii-Net: 用于地下矿产潜力建模的物理信息神经网络

Boris Kriuk

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出Korzhinskii-Net,一种耦合达西流、热输运和反应速率的二维径向物理信息神经网络,在五个矿省四个矿种上平均PR-AUC达0.885,显著优于传统基线。

Comments 14 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16813 2026-07-02 cs.GR cs.CV 版本更新

QuadLink: Autoregressive Quad-Dominant Mesh Generation via Point-Relation Learning

QuadLink: 通过点关系学习的自回归四边形主导网格生成

Yiheng Zhang, Zhe Zhu, Tingrui Shen, Zhuojiang Cai, Tianxiao Li, Zixing Zhao, Qiujie Dong, Zhiyang Dou, Jiepeng Wang, Le Wan, Yuwang Wang, Wenping Wang, Yuan Liu, Cheng Lin

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent VISVISE(腾讯VISVISE) Peking University(北京大学) Technical University of Munich(慕尼黑技术大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院) Texas A&M University(德克萨斯大学) Macau University of Science and Technology(澳门科技大学)

AI总结 提出QuadLink框架,通过将点云链接成结构化面片,以自回归方式生成各向异性的四边形主导网格,实现高几何保真度和拓扑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11752 2026-07-02 cs.LG 版本更新

Federated Client Selection under Partial Visibility: A POMDP Approach with Spatio-Temporal Attention

在部分可见性下联邦客户端选择:一种带有时空注意机制的POMDP方法

Qijun Hou, Yuchen Shi, Pingyi Fan, Khaled B. Letaief

机构 * Dept. of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京理工大学,清华大学) Dept. of Electronic and Computer Engineering, HKUST(电子与计算机工程系,香港科技大学)

AI总结 本文提出一种基于POMDP的强化学习框架,通过整合历史全局模型和客户端身份嵌入,解决部分可见性下的联邦学习客户端选择问题,实验验证其在异构和部分可见场景下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16993 2026-07-02 cs.AI cs.CV cs.RO 版本更新

Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification

规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性

Jiawen Wen, Penglei Sun, Wenjie Zhang, Suixuan Qiu, Weisheng Xu, Xiaofei Yang, Xiaowen Chu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Normal University(北京师范大学) Guangzhou University(广州大学)

AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03118 2026-07-02 cs.CV eess.IV 版本更新

Salt: Self-Consistent Distribution Matching with Cache-Aware Training for Fast Video Generation

Salt:基于缓存感知训练的自一致分布匹配用于快速视频生成

Xingtong Ge, Yi Zhang, Yushi Huang, Dailan He, Xiahong Wang, Bingqi Ma, Guanglu Song, Yu Liu, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Vivix Group Limited(Vivix集团有限公司)

AI总结 本文提出Salt方法,通过自一致分布匹配和缓存感知训练,提升低推理预算下的视频生成质量,兼容多种KV缓存机制。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00654 2026-07-02 cs.CV 版本更新

RC-GeoCP: Geometric Consensus for Radar-Camera Collaborative Perception

RC-GeoCP:雷达-相机协同感知的几何一致性

Xiaokai Bai, Lianqing Zheng, Runwei Guan, Siyuan Cao, Songkai Wang, Huiliang Shen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Automotive Studies, Tongji University(同济大学汽车学院) Thrust of Artificial Intelligence, Hong Kong University of Science and Technology(香港科技大学人工智能研究所)

AI总结 提出首个4D雷达与相机协同感知框架RC-GeoCP,通过雷达锚定几何一致性解决深度模糊和空间分散导致的错位,实现高效通信与全局一致表示。

Comments 11 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18050 2026-07-02 cs.CV cs.AI 交叉投稿

UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to-Image Generation across Diverse Aspect Ratios

UltraFlux:面向多种宽高比的高质量原生4K文本到图像生成的数据-模型协同设计

Tian Ye, Song Fei, Lei Zhu

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

AI总结 针对扩散变压器扩展到原生4K多宽高比时出现的位置编码、VAE压缩和优化耦合失效问题,提出数据-模型协同设计的UltraFlux,通过共振2D RoPE、非对抗VAE后训练、SNR感知Huber小波目标和分阶段美学课程学习,在4K分辨率下实现高保真、细节保留的文本到图像生成。

Comments Project Page: https://w2genai-lab.github.io/UltraFlux/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18224 2026-07-02 cs.DC cs.LG 版本更新

FSA: An Alternative Efficient Implementation of Native Sparse Attention Kernel

FSA:原生稀疏注意力核的一种替代高效实现

Ran Yan, Youhe Jiang, Zhuoming Chen, Haohui Mai, Beidi Chen, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对现有稀疏注意力核在GQA组中查询头数较少时效率低的问题,提出Flash Sparse Attention (FSA)核实现,通过优化循环顺序,在多种流行LLM上实现平均1.6倍核延迟降低和1.09倍端到端训练加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20857 2026-07-02 cs.RO 版本更新

Multi-Embodiment Robotic Retargeting via Guided Diffusion Model

基于引导扩散模型的多体机器人重定向

Zhefeng Cao, Ben Liu, Shunpeng Yang, Sen Li, Wei Zhang, Hua Chen

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟校区联合学院) LimX Dynamics

AI总结 提出统一图条件扩散框架,利用图结构编码不同机器人拓扑几何特征,通过基于能量的引导损失训练,实现跨异构体的运动重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29805 2026-07-01 cs.CV 版本更新

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO AI中心)

AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32009 2026-07-01 cs.RO 新提交

Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments

人类作为人形机器人:通过人类对齐的具身从自我-外部人类视频实现零样本人形机器人学习

Xiaopeng Lin, Ruoqi Yang, Shijie Lian, Zhaolong Shen, Bin Yu, Changti Wu, Haibao Liu, Yuxiang Zhang, Hong Li, Qiyuan Su, Haochen Liu, Xuguo He, Yukun Shi, Cong Huang, Zhirui Zhang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepCybo ZGCA ZGCI Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学) Beihang University(北京航空航天大学)

AI总结 提出Human-as-Humanoid框架,通过对齐机器人本体、感知设置和动作标签接口,将大规模人类演示视频转化为可执行的动作监督,实现高自由度人形机器人的零样本学习。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31981 2026-07-01 cs.CV cs.AI 新提交

LUNA: Learning Universal 3D Human Animation Beyond Skinning

LUNA: 超越蒙皮的学习通用3D人体动画

Peng Li, Rawal Khirodkar, Junxuan Li, Yuan Dong, Chen Cao, Yuan Liu, Wenhan Luo, Yike Guo, Shunsuke Saito

机构 * The Hong Kong University of Science and Technology(香港科技大学) Codec Avatars Lab, Meta(Meta编解码虚拟形象实验室)

AI总结 提出无LBS的通用神经动画模型LUNA,通过Transformer运动回归器将多种2D控制映射为3D高斯变形,结合混合监督实现零样本跨身份泛化。

Comments ECCV 2026, Project page: https://penghtyx.github.io/LUNA/

详情

展开后加载摘要…

URL PDF HTML 收藏