arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-04-02 至 2026-04-02 共收录 9
2604.01155 2026-04-02 cs.SD

FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining

FineLAP: 通过异质监督驯化细粒度语言-音频预训练

Xiquan Li, Xuenan Xu, Ziyang Ma, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎卓越工程师学院) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出FineLAP,一种新型预训练范式,通过异质数据提升CLAP在clip和frame级对齐能力,引入双流sigmoid损失和聚类采样策略,结合大规模合成SED数据集,实现多任务SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01129 2026-04-02 cs.CV

ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation

ReinDriveGen:强化学习后训练用于分布外驾驶场景生成

Hao Zhang, Lue Fan, Weikang Bian, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(MMLab,香港中文大学) CASIA(中国科学院自动化研究所) SenseTime Research(商汤科技研究院)

AI总结 ReinDriveGen通过动态点云场景生成与强化学习后训练,实现对驾驶场景的可控生成,提升安全关键场景的模拟质量。

Comments Project page: https://drive-sim.github.io/ReinDriveGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01082 2026-04-02 cs.CV cs.GR

ReMoGen: Real-time Human Interaction-to-Reaction Generation via Modular Learning from Diverse Data

ReMoGen:通过多样化数据的模块学习实现实时的人际交互生成

Yaoqin Ye, Yiteng Xu, Qin Sun, Xinge Zhu, Yujing Sun, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Guangzhou Institute of Energy Conversion, CAS(中国科学院广州能源研究所) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出ReMoGen框架,通过模块化学习生成实时的人际交互反应,利用大规模单人动作数据集学习通用动作先验,并通过Meta-Interaction模块适应不同交互领域,实现高效且高质量的动作响应。

Comments accepted by CVPR 2026, project page: https://4dvlab.github.io/project_page/remogen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01020 2026-04-02 cs.MA cs.AI

OrgAgent: Organize Your Multi-Agent System like a Company

OrgAgent: 以公司式层级结构组织你的多智能体系统

Yiru Wang, Xinyue Shen, Yaohui Han, Michael Backes, Pin-Yu Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) IBM Research(IBM研究院) CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

AI总结 本文提出OrgAgent框架,通过治理、执行、合规三层结构提升多智能体系统的推理性能,实验显示层级结构在任务稳定性、信息控制和验证方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00969 2026-04-02 cs.CV

DLWM: Dual Latent World Models enable Holistic Gaussian-centric Pre-training in Autonomous Driving

DLWM:双潜在世界模型实现自动驾驶中的整体高斯中心预训练

Yiyao Zhu, Ying Xue, Haiming Zhang, Guangfeng Jiang, Wending Zhou, Xu Yan, Jiantao Gao, Yingjie Cai, Bingbing Liu, Zhen Li, Shaojie Shen

机构 * HKUST(香港科技大学) CUHK-SZ(香港中文大学(深圳)) USTC(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部门)

AI总结 本文提出DLWM,通过双潜在世界模型实现自动驾驶中的整体高斯中心预训练,提升3D占用感知、4D占用预测和运动规划性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00548 2026-04-02 cs.CV

Reliev3R: Relieving Feed-forward Reconstruction from Multi-View Geometric Annotations

Reliev3R: 从多视角几何注释中解脱的前馈重建

Youyu Chen, Junjun Jiang, Yueru Luo, Kui Jiang, Xianming Liu, Xu Yan, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei(华为) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 Reliev3R通过弱监督方法训练前馈重建模型,无需昂贵的多视角几何注释,利用单目相对深度和图像稀疏对应关系进行3D知识学习,提升重建效率与可扩展性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00494 2026-04-02 cs.CV

ARGS: Auto-Regressive Gaussian Splatting via Parallel Progressive Next-Scale Prediction

ARGS:通过并行渐进下一尺度预测实现自动回归高斯点撒

Quanyuan Ruan, Kewei Shi, Jiabao Lei, Xifeng Gao, Xiaoguang Han

机构 * South China University of Technology(华南理工大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Lightspeed

AI总结 本文提出ARGS框架,通过并行生成多尺度高斯表示,实现3D物体生成的高效下一尺度预测,提升结构一致性与视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29620 2026-04-02 cs.CV cs.MM

Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis

Unify-Agent:一种用于世界 grounded 图像合成的统一多模态代理

Shuang Chen, Quanxin Shou, Hangting Chen, Yucheng Zhou, Kaituo Feng, Wenbo Hu, Yi-Fan Zhang, Yunlong Lin, Wenxuan Huang, Mingyang Song, Dasen Dai, Bolin Jiang, Manyuan Zhang, Shi-Xue Zhang, Zhengkai Jiang, Lucas Wang, Zhao Zhong, Yu Cheng, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Unify-Agent,一种统一多模态代理,用于世界 grounded 图像合成,通过代理流程提升图像生成质量,结合事实IP基准测试,展示其在多种任务中的优越表现。

Comments Project Page: https://github.com/shawn0728/Unify-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03753 2026-04-02 cs.CV

HUMOF: Human Motion Forecasting in Interactive Social Scenes

HUMOF:交互社交场景中的人体运动预测

Caiyi Sun, Yujing Sun, Xiao Han, Zemin Yang, Jiawei Liu, Xinge Zhu, Siu Ming Yiu, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) The University of Hong Kong(香港大学) Digital Trust Centre, Nanyang Technological University(南洋理工大学数字信任中心) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出HUMOF方法,通过层次化交互特征表示和粗到细交互推理模块,提升复杂场景中人体运动预测的准确性,实现在四个公开数据集上的最佳性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏