arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1522
2507.20560 2025-12-15 stat.ML cs.LG stat.ME

Statistical Inference for Differentially Private Stochastic Gradient Descent

差分隐私随机梯度下降的统计推断

Xintao Xia, Linjun Zhang, Zhanrui Cai

机构 * Center for Data Science, Zhejiang University(浙江大学数据科学中心) Department of Statistics, Rutgers University(罗格斯大学统计系) Faculty of Business and Economics, The University of Hong Kong(香港大学商学院)

AI总结 本文提出了一种在差分隐私随机梯度下降中构建有效置信区间的两种方法,通过分析渐近方差分解,实现了在隐私保护下的统计推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10863 2025-12-12 cs.CV cs.AI

MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence

MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准

Jingli Lin, Runsen Xu, Shaohao Zhu, Sihan Yang, Peizhou Cao, Yunlong Ran, Miao Hu, Chenming Zhu, Yiman Xie, Yilin Long, Wenbo Hu, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Xi’an Jiaotong University(西安交通大学) University of Hong Kong(香港大学) Fudan University(复旦大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07752 2025-12-12 cs.CV

DEGS: Deformable Event-based 3D Gaussian Splatting from RGB and Event Stream

DEGS: 从RGB和事件流中基于可变形的3D高斯点云重建

Junhao He, Jiaxu Wang, Jia Li, Mingyuan Sun, Qiang Zhang, Jiahang Cao, Ziyi Zhang, Yi Gu, Jingkai Sun, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学) University of Hong Kong(香港大学) Northeastern University(东北大学)

AI总结 本文提出DEGS框架,结合RGB和事件流优化动态3DGS,通过事件运动先验指导变形场优化,提升重建性能。

Comments Accepted by IEEE TVCG

Journal ref 2025 IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16372 2025-12-11 cs.RO

Flow-Aided Flight Through Dynamic Clutters From Point To Motion

通过动态障碍物的飞行:从点到运动的流辅助飞行

Bowen Xu, Zexuan Yan, Minghao Lu, Xiyu Fan, Yi Luo, Youshen Lin, Zhiqiang Chen, Yeke Chen, Qiyuan Qiao, Peng Lu

机构 * Adaptive Robotic Controls Lab (ArcLab), Department of Mechanical Engineering, The University of Hong Kong(机械工程系,香港大学)

AI总结 本文提出了一种基于单LiDAR传感和强化学习的自主飞行系统,通过动态环境感知和动作生成方法,实现从点到运动的高效飞行控制。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L), November, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09995 2025-12-11 cs.CV

PlayerOne: Egocentric World Simulator

PlayerOne:第一人称真实世界模拟器

Yuanpeng Tu, Hao Luo, Xi Chen, Xiang Bai, Fan Wang, Hengshuang Zhao

机构 * HKU(香港大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(华盘实验室) HUST(华中科技大学)

AI总结 PlayerOne通过第一人称真实世界模拟器实现了沉浸式探索,通过粗到细的训练流程和部分解耦运动注入方案,实现了对人类运动的精确控制和多样化场景的一致建模。

Comments Project page: https://playerone-hku.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18309 2025-12-11 stat.ML cs.LG eess.SP

Efficient Transformed Gaussian Process State-Space Models for Non-Stationary High-Dimensional Dynamical Systems

高效变换高斯过程状态空间模型用于非平稳高维动态系统

Zhidi Lin, Ying Li, Feng Yin, Juan Maroñas, Alexandre H. Thiéry

机构 * Department of Statistics and Actuarial Science, University of Hong Kong(统计与精算科学系,香港大学) Department of Statistics and Data Science, National University of Singapore(统计与数据科学系,新加坡国立大学) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳)) Machine Learning Group, Universidad Autónoma de Madrid(马德里自治大学机器学习组)

AI总结 本文提出ETGPSSM,通过整合共享GP与输入依赖的归一化流,实现高效建模高维非平稳动态系统,提升计算效率和预测精度。

Comments IEEE Transactions on Signal Processing (16 pages, 6 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00702 2025-12-11 cs.HC cs.NI cs.SD eess.AS eess.IV

CardioLive: Empowering Video Streaming with Online Cardiac Monitoring

CardioLive: 通过在线心脏监测增强视频流媒体

Sheng Lyu, Ruiming Huang, Sijie Ji, Yasar Abbas Ur Rehman, Lan Ma, Chenshu Wu

机构 * Department of Computer Science, The University of Hong Kong, Hong Kong SAR(香港大学计算机科学系) TCL AI Lab, Hong Kong SAR(TCL人工智能实验室)

AI总结 CardioLive通过在线心脏监测技术,在视频流媒体中实现对生理信息的提取与分析,提升远程医疗和情感计算等应用的性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10631 2025-12-11 cs.LG cs.AI cs.CL

LLM-Barber: Block-Aware Rebuilder for Sparsity Mask in One-Shot for Large Language Models

LLM-Barber:用于大语言模型单次剪枝的块感知重排器

Yupeng Su, Ziyi Guan, Xiaoqun Liu, Tianlai Jin, Dongkuan Wu, Zhengfei Chen, Graziano Chesi, Ngai Wong, Hao Yu

机构 * School of Microelectronics, Southern University of Science and Technology(微电子学院,南方科技大学) Department of Electrical and Electronic Engineering, University of Hong Kong(电气与电子工程系,香港大学)

AI总结 LLM-Barber 是一种新型单次剪枝框架,通过块感知误差优化提升大语言模型剪枝效率,实现高性能与低计算复杂性。

Comments Accepted by ICCAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08765 2025-12-10 cs.CV

Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance

Wan-Move:通过潜在轨迹引导实现可动视频生成

Ruihang Chu, Yefei He, Zhekai Chen, Shiwei Zhang, Xiaogang Xu, Bin Xia, Dingdong Wang, Hongwei Yi, Xihui Liu, Hengshuang Zhao, Yu Liu, Yingya Zhang, Yujiu Yang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Tsinghua University(清华大学) HKU(香港大学) CUHK(香港中文大学)

AI总结 Wan-Move通过潜在轨迹引导实现视频生成的精确运动控制,无需修改架构即可提升运动可控性。

Comments NeurlPS 2025. Code and data available at https://github.com/ali-vilab/Wan-Move

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08763 2025-12-10 cs.LG

Learning and Editing Universal Graph Prompt Tuning via Reinforcement Learning

通过强化学习学习和编辑通用图提示微调

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Hewei Wang, Yijie Li, Edith C. H. Ngai

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出LEAP模型,通过强化学习在保留通用图提示理论基础的同时,优化提示选择与编辑,提升图和节点任务的性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08506 2025-12-10 cs.CV

OCCDiff: Occupancy Diffusion Model for High-Fidelity 3D Building Reconstruction from Noisy Point Clouds

OCCDiff:基于点云的高保真3D建筑重建的占用扩散模型

Jialu Sui, Rui Liu, Hongsheng Zhang

机构 * Department of Geography, Faculty of Social Science, the University of Hong Kong(地理系,社会科学学院,香港大学)

AI总结 OCCDiff通过潜在扩散和函数自动编码器生成高保真3D建筑重建,结合点编码器与多任务训练提升鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08358 2025-12-10 cs.CV

TrackingWorld: World-centric Monocular 3D Tracking of Almost All Pixels

TrackingWorld: 以世界为中心的单目3D像素跟踪

Jiahao Lu, Weitao Xiong, Jiacheng Deng, Peng Li, Tianyu Huang, Zhiyang Dou, Cheng Lin, Sai-Kit Yeung, Yuan Liu

机构 * HKUST(香港科技大学) USTC(中国科学技术大学) CUHK(香港中文大学) HKU(香港大学) XMU(厦门大学) MUST(澳门科技大学)

AI总结 TrackingWorld提出了一种以世界为中心的单目3D像素跟踪方法,通过上采样器和优化框架实现对视频中几乎所有像素的密集3D跟踪。

Comments Accepted by NeurIPS 2025. Project Page: https://igl-hkust.github.io/TrackingWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08186 2025-12-10 cs.RO

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation

放慢脚步,快速移动:一种通用视觉-语言导航的双系统基础模型

Meng Wei, Chenyang Wan, Jiaqi Peng, Xiqian Yu, Yuqiang Yang, Delin Feng, Wenzhe Cai, Chenming Zhu, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 DualVLN通过双系统架构,结合高层推理与低层动作执行,提升视觉-语言导航的泛化能力和动态环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07921 2025-12-10 cs.SE cs.AI

DeepCode: Open Agentic Coding

DeepCode: 开放代理编程

Zongwei Li, Zhonghang Li, Zirui Guo, Xubin Ren, Chao Huang

机构 * The University of Hong Kong(香港大学)

AI总结 DeepCode通过系统信息流管理,实现文档到代码库的高保真合成,超越现有商业代理和人类专家,推动自主科学复现的发展。

Comments for source code, please see https://github.com/HKUDS/DeepCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07884 2025-12-10 cs.LG cs.AI cs.CV

GSPN-2: Efficient Parallel Sequence Modeling

GSPN-2:高效的并行序列建模

Hongjun Wang, Yitong Jiang, Collin McCarthy, David Wehr, Hanrong Ye, Xinhao Li, Ka Chun Cheung, Wonmin Byeon, Jinwei Gu, Ke Chen, Kai Han, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Sifei Liu

机构 * NVIDIA The University of Hong Kong(香港大学) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 GSPN-2通过结构化矩阵变换和GPU优化实现,提升视觉应用中全局空间上下文建模的效率。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07747 2025-12-09 cs.CV

Unison: A Fully Automatic, Task-Universal, and Low-Cost Framework for Unified Understanding and Generation

Unison: 一个完全自动、任务通用且低成本的统一理解和生成框架

Shihao Zhao, Yitong Chen, Zeyinzi Jiang, Bojia Zi, Shaozhe Hao, Yu Liu, Chaojie Mao, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 Unison提出一个低成本、全自动的多模态理解和生成框架,通过两阶段方案实现任务自适应,覆盖多种理解和生成任务,提升生成质量与自动化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07503 2025-12-09 cs.CV

SJD++: Improved Speculative Jacobi Decoding for Training-free Acceleration of Discrete Auto-regressive Text-to-Image Generation

SJD++: 改进的推测雅可比解码用于无训练加速离散自回归文本到图像生成

Yao Teng, Zhihuan Jiang, Han Shi, Xian Liu, Xuefei Ning, Guohao Dai, Yu Wang, Zhenguo Li, Xihui Liu

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Peking University(北京大学) xAI Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 SJD++通过概率并行解码算法提升自回归文本到图像生成的效率,实现2-3倍的推理延迟降低和2-7倍的步骤压缩,同时保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06921 2025-12-09 cs.CV cs.AI cs.CL

NeuroABench: A Multimodal Evaluation Benchmark for Neurosurgical Anatomy Identification

NeuroABench: 一种多模态评估基准,用于神经外科解剖识别

Ziyang Song, Zelin Zang, Xiaofan Ye, Boqiang Xu, Long Bai, Jinlin Wu, Hongliang Ren, Hongbin Liu, Jiebo Luo, Zhen Lei

机构 * Hong Kong Institute of Science and Innovation(香港科学与创新研究院) The University of Hong Kong-Shenzhen Hospital(香港大学深圳医院) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

AI总结 NeuroABench是首个用于评估神经外科领域解剖理解的多模态基准,通过实验揭示了MLLMs在解剖识别任务中的局限性,并展示了人类表现与模型之间的差距。

Comments Accepted by IEEE ICIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00975 2025-12-09 cs.CV cs.LG cs.RO

MM-ACT: Learn from Multimodal Parallel Generation to Act

MM-ACT: 从多模态并行生成中学习以行动

Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06676 2025-12-09 cs.RO cs.LG

FedDSR: Federated Deep Supervision and Regularization Towards Autonomous Driving

FedDSR: 联邦深度监督与正则化以实现自动驾驶

Wei-Bin Kou, Guangxu Zhu, Bingyang Cheng, Chen Zhang, Yik-Chung Wu, Jianping Wang

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Department of Computer Science, City University of Hong Kong(城市大学计算机科学系) Shenzhen International Center For Industrial And Applied Mathematics, Shenzhen Research Institute of Big Data(深圳国际工业与应用数学中心、深圳大数据研究院)

AI总结 FedDSR通过多层监督和正则化提升联邦学习在自动驾驶中的泛化能力与收敛速度,实验显示在语义分割任务中mIoU提升8.93%且训练轮次减少28.57%。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06664 2025-12-09 cs.RO

Statistic-Augmented, Decoupled MoE Routing and Aggregating in Autonomous Driving

统计增强、解耦的MoE路由与聚合在自动驾驶中

Wei-Bin Kou, Guangxu Zhu, Jingreng Lei, Chen Zhang, Yik-Chung Wu, Jianping Wang

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Department of Computer Science, City University of Hong Kong(城市大学计算机科学系) Shenzhen International Center For Industrial And Applied Mathematics, Shenzhen Research Institute of Big Data(深圳国际工业与应用数学中心、深圳大数据研究院)

AI总结 本文提出统计增强、解耦的MoE路由与聚合机制,用于提升自动驾驶中的预测性能。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06649 2025-12-09 cs.LG cs.CV cs.CY cs.ET

Estimating Black Carbon Concentration from Urban Traffic Using Vision-Based Machine Learning

基于视觉机器学习的城市交通中黑碳浓度估计

Camellia Zakaria, Aryan Sadeghi, Weaam Jaafar, Junshi Xu, Alex Mariakakis, Marianne Hatzopoulou

机构 * University of Toronto(多伦多大学) University of Hong Kong(香港大学)

AI总结 本文提出基于视觉机器学习的方法,利用交通视频和天气数据估计街道层面的黑碳浓度,为污染控制和环境正义提供数据支持。

Comments 12 pages, 16 figures, 4 tables, 4 pages Appendix, in submission and under review for ACM MobiSys 2026 as of December 6th, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01946 2025-12-09 cs.CV

3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding

3DRS: MLLMs 需要 3D 意识表示监督以实现场景理解

Xiaohu Huang, Jingjing Wu, Qunyi Xie, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Department of Computer Vision Technology (VIS), Baidu Inc.(百度公司计算机视觉技术部)

AI总结 3DRS 通过引入预训练 3D 基础模型的监督,提升 MLLM 的 3D 表示能力,从而增强场景理解性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18886 2025-12-09 cs.LG cs.AI

A Survey on Diffusion Models for Time Series and Spatio-Temporal Data

时间序列和时空数据扩散模型综述

Yiyuan Yang, Ming Jin, Haomin Wen, Chaoli Zhang, Yuxuan Liang, Lintao Ma, Yi Wang, Chenghao Liu, Bin Yang, Zenglin Xu, Shirui Pan, Qingsong Wen

机构 * University of Oxford(牛津大学) Griffith University(格里菲斯大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) Salesforce Research(Salesforce研究) East China Normal University(东华大学) Fudan University(复旦大学)

AI总结 本文综述了扩散模型在时间序列和时空数据中的应用,系统梳理了模型类别、任务类型及实际应用场景,为后续研究提供基础。

Comments Accepted by ACM Computing Surveys; 37 pages; Github Repo: https://github.com/yyysjz1997/Awesome-TimeSeries-SpatioTemporal-Diffusion-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05941 2025-12-08 cs.CV cs.AI cs.CL

Zoom in, Click out: Unlocking and Evaluating the Potential of Zooming for GUI Grounding

聚焦,点击:解锁和评估缩放在GUI定位中的潜力

Zhiyuan Jiang, Shenghao Xie, Wenyi Li, Wenqiang Zu, Peihang Li, Jiahao Qiu, Siqi Pei, Lei Ma, Tiejun Huang, Mengdi Wang, Shilong Liu

机构 * Xi’an Jiaotong University(西安交通大学) Princeton University(普林斯顿大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) Michigan State University(密歇根州立大学)

AI总结 本文提出ZoomClick方法,通过引入缩放先验知识提升GUI定位性能,实现动态空间聚焦与自适应上下文切换,并在多个基准上取得最佳结果。

Comments Code is available at https://github.com/Princeton-AI2-Lab/ZoomClick

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05682 2025-12-08 cs.RO cs.SY eess.SY

Scenario-aware Uncertainty Quantification for Trajectory Prediction with Statistical Guarantees

面向场景的不确定性量化用于轨迹预测的统计保证

Yiming Shu, Jiahui Xu, Linghuan Kong, Fangni Zhang, Guodong Yin, Chen Sun

机构 * Department of Data and Systems Engineering, the University of Hong Kong(数据与系统工程系,香港大学) Faculty of Science and Technology, University of Macau(科学与技术学院,澳门大学) School of Mechanical Engineering, Southeast University(机械工程学院,东南大学)

AI总结 本文提出了一种面向场景的不确定性量化框架,通过CopulaCPTS生成预测区间并评估轨迹可靠性,以提升自动驾驶系统在复杂环境中的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05481 2025-12-08 cs.CV cs.AI

UniFS: Unified Multi-Contrast MRI Reconstruction via Frequency-Spatial Fusion

UniFS: 通过频率-空间融合实现统一的多对比MRI重建

Jialin Li, Yiwei Ren, Kai Pan, Dong Wei, Pujin Cheng, Xian Wu, Xiaoying Tang

机构 * Department of Electronic and Electrical Engineering, Southern University of Science and Technology, Shenzhen, China(电子与电气工程系,南方科技大学,深圳,中国) Jarvis Research Center, Tencent YouTu Lab, China(Jarvis研究中心,腾讯YouTu实验室,中国) Department of Electrical and Electronic Engineering, University of Hong Kong, Hong Kong, China(电子与电气工程系,香港大学,香港,中国)

AI总结 UniFS通过频率-空间融合模块实现多对比MRI重建的统一处理,提升模型泛化能力,适用于多种k空间欠采样模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08132 2025-12-08 cs.IR cs.LG

SS4Rec: Continuous-Time Sequential Recommendation with State Space Models

SS4Rec: 基于状态空间模型的连续时间序列推荐

Wei Xiao, Huiying Wang, Qifeng Zhou, Qing Wang

机构 * Department of Automation, Xiamen University(厦门大学自动化系) Xiamen Key Laboratory of Big Data Intelligent Analysis and Decision-making, Xiamen University(厦门大学大数据智能分析与决策实验室) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

AI总结 SS4Rec通过结合时间感知和关系感知的状态空间模型,解决连续时间序列推荐中不规则时间间隔和复杂用户-物品转换建模问题,实现更精准的个性化推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04786 2025-12-05 cs.CV

LaFiTe: A Generative Latent Field for 3D Native Texturing

LaFiTe:一种用于3D原生纹理生成的生成性潜在场

Chia-Hao Chen, Zi-Xin Zou, Yan-Pei Cao, Ze Yuan, Guan Luo, Xiaojuan Qi, Ding Liang, Song-Hai Zhang, Yuan-Chen Guo

机构 * Tsinghua University(清华大学) VAST The University of Hong Kong(香港大学)

AI总结 LaFiTe通过生成3D稀疏潜在颜色场,实现了高保真3D原生纹理生成,并支持材料合成与纹理超分辨率等下游应用。

Comments Project page: https://vast-ai-research.github.io/LaFiTe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04711 2025-12-05 cs.SD cs.AI

Large Speech Model Enabled Semantic Communication

基于大语音模型的语义通信

Yun Tian, Zhijin Qin, Guocheng Lv, Ye Jin, Kaibin Huang, Zhu Han

机构 * School of Electronics, Peking University(北京大学电子学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Department of Computer Science and Engineering, Kyung Hee University(庆熙大学计算机科学与工程系)

AI总结 本文提出基于大语音模型的语义通信系统,利用Mimi编解码器和LoRA微调技术,实现适应性压缩与鲁棒传输,支持低带宽下的高质量语音传输。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏