arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-07-10 至 2026-07-10 共收录 7
2607.08763 2026-07-10 cs.CV cs.AI 新提交

OpenCoF: Learning to Reason Through Video Generation

OpenCoF:通过视频生成学习推理

Xinyan Chen, Ziyu Guo, Renrui Zhang, Dongzhi Jiang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) CUHK IMIXR(香港中文大学IMIXR)

AI总结 研究针对视频生成中帧链推理缺乏多样监督和专门设计的问题,引入OpenCoF框架,含OpenCoF - 17K数据集和Wan - CoF模型。通过实验探索先进设计,发现视频推理需广泛时间监督和明确机制,还开源相关资源促进研究。

Comments Project Page: https://opencof.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08539 2026-07-10 cs.DB cs.AI 新提交

DocMaster: A Hierarchical Structure-Aware System for Document Analysis

DocMaster:一种用于文档分析的分层结构感知系统

Ziqi Chen, Yingli Zhou, Fangyuan Zhang, Quanqing Xu, Chuanhui Yang, Yixiang Fang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对利用大语言模型分析复杂文档时现有系统丢弃分层结构致性能下降的问题,提出DocMaster系统,它能解析文档为分层树并构建语义索引,通过网页界面展示,可实现文档筛选与问答等功能。

Comments 4 pages, demo paper, under revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08246 2026-07-10 cs.CV 新提交

SkelGen4D: Weakly-Supervised Skeleton-Based 4D Generation for Text-Driven Mesh Animation

SkelGen4D:用于文本驱动网格动画的弱监督基于骨架的4D生成

Hao Feng, Zhi Zuo, Jia-Hui Pan, Ka-Hei Hui, Zhengzhe Liu, Dian Zhang, Haoran Xie, Bin Sheng, Jingyu Hu

机构 * School of Data Science, Lingnan University(岭南大学数据科学学院) Department of Computer Science and Engineering, Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Autodesk Research(Autodesk研究院) Institute of Computer Applications, Shanghai Jiao Tong University(上海交通大学计算机应用研究所)

AI总结 研究文本驱动的4D网格动画生成,提出弱监督前馈框架SkelGen4D,先从动画网格恢复伪骨架,再生成文本条件骨架运动序列并优化,在大规模基准测试中表现良好,能匹配或超越全监督基线,支持运动编辑且符合标准动画管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07967 2026-07-10 stat.ML cs.LG math.OC 新提交

Expressivity and Statistical Trade-offs in Diffusion Policy Learning

扩散策略学习中的表达能力与统计权衡

Viet Vu, Renyuan Xu, Jiacheng Zhang, Yufei Zhang

机构 * Stanford University(斯坦福大学) Chinese University of Hong Kong(香港中文大学) Imperial College London(伦敦帝国理工学院)

AI总结 研究扩散策略学习中表达能力与统计权衡,确定漂移Lipschitz预算K为核心量,通过近似量化表达能力,证明其与统计复杂性的关系,给出有限样本性能差距,数值实验验证,还提出根据样本大小选K及对应神经网络架构的实现原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21256 2026-07-10 cs.RO 版本更新

BiNoMaP: Learning Category-Level Bimanual Non-Prehensile Manipulation Primitives

BiNoMaP: 学习类别级双臂非抓取操作原语

Huayi Zhou, Kui Jia

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

AI总结 BiNoMaP提出了一种无强化学习的双臂非抓取操作原语学习框架,通过几何感知优化和参数化方法实现类别级泛化和跨平台迁移。

Comments Under review. The project link is https://hnuzhy.github.io/projects/BiNoMaP

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12999 2026-07-10 cs.CV cs.AI 版本更新

Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs

概念树:一个可控的合成数据框架助力更强的个性化视觉语言模型

Ruichuan An, Kai Zeng, Ming Lu, Sihan Yang, Renrui Zhang, Huitong Ji, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) CUHK MMLab(香港中文大学MMLab) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security(北京数据智能与安全重点实验室)

AI总结 研究提升VLM个性化能力问题,提出概念树(CaT)框架,以树结构表示概念生成多样正负样本,经数据过滤策略确保质量,实验证明该框架显著增强VLM在个性化基准测试中的能力,是首个可控合成数据管道。

Comments ECCV26 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.13142 2026-07-10 cs.CV 版本更新

Real-World Blind Super-Resolution via Feature Matching with Implicit High-Resolution Priors

通过与隐式高分辨率先验进行特征匹配实现真实世界的盲超分辨率

Chaofeng Chen, Xinyu Shi, Yipeng Qin, Xiaoming Li, Xiaoguang Han, Tao Yang, Shihui Guo

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Computer Science(计算机科学学院) Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) SSE, The Chinese University of Hong Kong(香港中文大学(深圳)SSE)

AI总结 针对现实世界图像超分辨率难题,提出FeMaSR方法,在紧凑特征空间通过匹配LR与HR图像特征及解码来恢复逼真HR图像,利用预训练HR先验、语义正则化及残差连接,实验显示其效果优于以往方法。

Comments Fix training details and some typos

详情

展开后加载摘要…

URL PDF HTML 收藏