arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-08-14 至 2026-08-14 共收录 13
2608.13560 2026-08-14 cs.CV cs.AI cs.CL 新提交

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

AutoDesign:面向长视距智能体设计的元工具优化

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li

机构 * Meituan(美团) MBZUAI(Mohamed bin Zayed University of Artificial Intelligence) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 AutoDesign是符合人类设计先验的元工具优化框架,以论文转海报生成任务为实例,在PosterBench上性能优于Claude Design,集成其学习的DesignHarness可提升代码智能体性能,且获人类最高偏好。

Comments Tech Report. Code at: https://github.com/Yaxin9Luo/AutoDesign

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13552 2026-08-14 cs.CV 新提交

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

PlayWorld:基于智能体玩家的长程目标世界模型基准测试

Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang, Yuxiang Lu, Junyi Li, Shuyang Chen, Yuan Gao, Xin Tao, Pengfei Wan, Hengshuang Zhao

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

AI总结 该研究针对现有世界模型跨模型公平比较的难题,推出含171个场景的PlayWorld基准,通过多模态智能体玩家从多维度评估9种先进世界模型,发现其长程交互式目标表现仍不可靠。

Comments project page: https://kxding.github.io/project/PlayWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13396 2026-08-14 cs.RO 新提交

Capstan-driven Continuum Surgical Robot: Design, Modeling, and Perception

绞盘驱动型连续体手术机器人:设计、建模与感知

Gang Zhang, Yufu Qiu, Junyan Yan, Wenhui Zeng, Wenlong Lu, Shing Shin Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机电工程学院) Huazhong University of Science and Technology(华中科技大学) Shun Hing Institute of Advanced Engineering(信兴高等工程研究院) Multi-Scale Medical Robotics Center(多尺度医疗机器人中心)

AI总结 本文针对绞盘驱动型连续体手术机器人的形状与力感知瓶颈,提出驱动-感知协同设计的集成方法,通过引入柔性元件与多刚体短厚梁模型实现实时感知,经实验验证可完成末端位姿与接触力感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13205 2026-08-14 cs.CV 新提交

HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion Models

HPSD:用于文本-图像转视频扩散模型的混合策略自蒸馏

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Xuanlang Dai, Shengyuan Ding, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Dahua Lin, Xingang Pan

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Adobe Research(奥多比研究院) The Chinese University of Hong Kong(香港中文大学) CPII under InnoHK(InnoHK下属CPII机构)

AI总结 本研究提出HPSD混合策略自蒸馏框架,通过让同一TI2V模型在不同条件下分别充当教师与学生,解决现有自蒸馏方法的缺陷,显著提升T2V及TI2V生成性能,强化模型基础生成能力。

Comments Project Website: https://bujiazi.github.io/hpsd.github.io/ Code: https://github.com/Bujiazi/HPSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13043 2026-08-14 cs.AI cs.CV cs.LG 新提交

From Local Mismatch to Global Impact: Optimizing Cache Reuse Policy for Efficient Diffusion

从局部失配到全局影响:优化缓存重用策略以实现高效扩散模型

Xichen Ye, Yifan Wu, Zhikang Xie, Xiangyu Yue, Cheng Jin, Weizhong Zhang

机构 * Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院) School of Data Science, Fudan University(复旦大学数据科学学院)

AI总结 针对扩散模型缓存策略与生成质量失配问题,提出GCache双层优化框架,在Wan2.1模型上实现2.17倍加速且LPIPS降至0.0316,性能优于现有缓存策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12720 2026-08-14 cs.CL cs.AI 新提交

ERSkill: Evolving for Skill-Guided Adaptive Memory Retrieval

ERSkill:面向技能引导的自适应记忆检索的演化框架

Haolong Chen, Liang Zhang, Zhuo Li, Lei Xue, Guanrxu Zhu

机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 ERSkill是一个以检索为核心的自演化技能引导记忆访问框架,通过协同演化技能集与路由器,在多个智能体记忆基准上大幅超越基线,在两款模型上分别实现31.3%、28.1%的指标提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12416 2026-08-14 cs.RO 新提交

RoboSynChallenge: Mastering Real-World Dexterity via Generalizing Synthesized Manipulation Skills

RoboSynChallenge:通过泛化合成操作技能掌握真实世界灵巧操作

Runyi Zhao, Ruixin Wu, Chengkun Li, Hongrui Zhang, Ang Li, Ruixing Jin, Yueci Deng, Yingying Guo, Lihe Ding, Shaocong Dong, Tianfan Xue, Yanjun Gao, Yudong Luo, Pascal Poupart, Simo Wu, Kui Jia, Wei-shi Zheng, Guiliang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce(德克斯力公司) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学) University of Colorado Anschutz(科罗拉多大学安舒茨医学中心) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Vector Institute(向量研究所) University of Waterloo(滑铁卢大学) Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute (SLAI)(深圳环区研究所)

AI总结 RoboSynChallenge竞赛推出统一基准,结合合成数据与真实评估,提供多类基准策略,旨在推动开发泛化性强、数据高效的机器人操作系统,助力通用机器人智能发展。

Comments NeurIPS 2026 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12276 2026-08-14 cs.CV 版本更新

XYZFlow:Scaling Multi dimensional Shortcut Flows for Efficient Generative Modeling

XYZFlow:用于高效生成建模的多维捷径流缩放方法

Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

机构 * CUHK(香港中文大学) Westlake University(西湖大学) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 XYZFlow框架通过流匹配的多维缩放实现高效图像生成,兼具7.2-8.5倍的教师模型速度提升与竞争力FID,其下一捷径预测可实现更优的质量-延迟权衡。

Comments ICML 2026 (16 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11752 2026-08-14 cs.CV cs.SD 版本更新

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

UniSwap:用于说话视频的流音频-视觉身份交换

Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务集团)

AI总结 UniSwap是首个流音频-视觉身份替换框架,通过多阶段适配技术解决现有方法音视频一致性差等问题,实现高效稳定的说话视频身份替换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11745 2026-08-14 cs.CV 版本更新

LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time

LiveAnimate:稳定的长时长流驱动人体动画实时生成系统

Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务组) Liblib AI

AI总结 LiveAnimate基于14B参数视频DiT,经两阶段训练结合PR-Sink等设计,实现19.63 FPS长时长流人体动画生成,兼顾实时性、质量与稳定性,优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02075 2026-08-14 cs.CV 版本更新

HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control

HandsOnWorld: 无约束的自我中心视频生成,具有相机解耦的手部控制

Yushuo Chen, Xiaoyu Shi, Xiaoshi Wu, Xintao Wang, Pengfei Wan, Yebin Liu

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Chinese University of Hong Kong(香港中文大学)

AI总结 提出HandsOnWorld框架,通过单目重建从无约束视频中学习手部控制,利用Plücker手部映射解耦相机与手部运动,生成高保真自我中心视频。

Comments Project Page: https://shad0wta9.github.io/handsonworld-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17337 2026-08-14 eess.IV cs.AI cs.CV 版本更新

Can Generalist Vision Language Models (VLMs) Rival Specialist Medical VLMs? Benchmarking and Strategic Insights

通用视觉语言模型(VLMs)能否在医疗领域超越专门化模型?基准测试与战略洞察

Yuan Zhong, Ruinan Jin, Qi Dou, Xiaoxiao Li

机构 * The Chinese University of Hong Kong(香港中文大学) The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

AI总结 研究比较了通用与专门化医疗VLMs的性能,发现高效微调的通用模型在多数任务中表现可比或更优,尤其在处理未见医疗模态时。

Comments version 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07426 2026-08-14 cs.RO

Cable-driven Continuum Robotics: Proprioception via Proximal-integrated Force Sensing

基于电缆驱动的连续机器人:通过近端集成力传感实现本体感觉

Gang Zhang, Junyan Yan, Jibiao Chen, Shing Shin Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) T Stone Robotics Institute(T Stone机器人研究所) Department of Mechanical and Automation Engineering(机械与自动化工程系) Shun Hing Institute of Advanced Engineering(顺兴先进工程研究院) Multi-Scale Medical Robotics Center(多尺度医疗机器人中心) Curve Robotics Limited(Curve机器人有限公司)

AI总结 本文提出了一种基于近端集成力传感的新型本体感觉方法,用于提升微尺度连续机器人在三维接触力感知和形状估计方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏