arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The University of Hong Kong(香港大学)

2026-03-16 至 2026-03-16 共收录 5
2603.12829 2026-03-16 cs.CV

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12759 2026-03-16 cs.CV

SAP: Segment Any 4K Panorama

SAP: 4K全景任意分割

Lutao Jiang, Zidong Cao, Weikai Chen, Xu Zheng, Yuanhuiyi Lyu, Zhenyang Li, Zeyu HU, Yingda Yin, Keyang Luo, Runze Zhang, Kai Yan, Shengju Qian, Haidi Fan, Yifan Peng, Xin Wang, Hui Xiong, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LIGHTSPEED The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

AI总结 本文提出SAP模型,通过将全景分割转化为固定轨迹视角视频分割,实现4K高分辨率全景实例分割,合成183440张4K全景图像并提升零样本mIoU性能。

Comments Project Page: https://lutao2021.github.io/SAP_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11647 2026-03-16 cs.MM cs.CV cs.SD

OmniForcing: Unleashing Real-time Joint Audio-Visual Generation

OmniForcing:释放实时联合音频视觉生成

Yaofeng Su, Yuming Li, Zeyue Xue, Jie Huang, Siming Fu, Haoran Li, Ying Li, Zezhong Qian, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索学院) Fudan University(复旦大学) Peking University(北京大学) The University of Hong Kong(香港大学)

AI总结 本文提出OmniForcing框架,通过因果蒸馏将双向扩散模型转化为高保真流式自回归生成器,解决双流架构中的训练不稳定问题,实现25FPS的实时生成性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23790 2026-03-16 cs.CV

Fourier Angle Alignment for Oriented Object Detection in Remote Sensing

基于傅里叶角对齐的遥感定向目标检测

Changyu Gu, Linwei Chen, Lin Gu, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学) University of Hong Kong(香港大学) Tohoku University(东北大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与发展中心)

AI总结 本文提出傅里叶角对齐方法,通过频谱分析角度信息并对其对齐,提升遥感中旋转目标检测的性能,实验显示在DOTA数据集上取得新的SOTA结果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03222 2026-03-16 cs.CV

Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretraining

Mocap-2-to-3:多视角提升用于单目运动恢复的2D预训练

Zhumei Wang, Zechen Hu, Ruoxi Guo, Huaijin Pi, Ziyong Feng, Liang Zhang, Mingtao Pei, Siyuan Huang

机构 * Beijing Institute of Technology(北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI(国家一般人工智能重点实验室,BIGAI) Deep Glint Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Shandong Agricultural University(山东农业大学)

AI总结 本文提出Mocap-2-to-3框架,通过多视角合成过程和分阶段训练提升单目运动恢复的精度与泛化能力,实现更精确的物理空间定位。

Comments Project page: https://wangzhumei.github.io/mocap-2-to-3/

详情

展开后加载摘要…

URL PDF HTML 收藏