arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-07-28 至 2026-07-28 共收录 10
2607.24591 2026-07-28 cs.CV 新提交

CameraAnything: Refilming Videos with Arbitrary Camera Control

CameraAnything:使用任意相机控制重新拍摄视频

Yixuan Li, Yanhong Zeng, Ka Leong Cheng, Jiayi Zhu, Hanlin Wang, Wen Wang, Yihao Meng, Hao Ouyang, Qiuyu Wang, Yue Yu, ZiDong Wang, Yiyuan Zhang, Yujun Shen, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 CameraAnything是用于相机控制视频编辑的统一框架,采用逐像素普吕克光线注入等方法联合控制相机参数,开发合成管道克服数据稀缺,能在单过程中实现多种视频编辑操作,为视频制作提供实用价值。

Comments Project page: https://yixuanli98.github.io/cameraanything/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24493 2026-07-28 cs.RO 新提交

KAI: A Kinematic-Aware Interface for Data-Efficient Articulated Object Manipulation

KAI:用于数据高效关节物体操纵的运动感知接口

Yaping Li, Zhaxizhuoma, Qiaojun Yu, Jia Zeng, Dahua Lin, Jiangmiao Pang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究关节物体操纵中运动结构难学问题,提出运动感知关节接口KAI,通过嵌入先验提高样本效率,在多模拟任务中表现良好,能推广到复杂场景,视频共训练增强真实世界鲁棒性。

Comments Project page: https://li-yaping.github.io/KAI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24199 2026-07-28 cs.CV 新提交

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24135 2026-07-28 cs.CV 新提交

LoTA-N2N: Local Trace Adaptation for Zero-Shot Self-Supervised Image Denoising

LoTA-N2N:用于零样本自监督图像去噪的局部迹线自适应

Jintong Hu, Bin Xia, Junlin Liu, Jiayue Liu, Wenming Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) University of Southern California(南加州大学) Peking University(北京大学)

AI总结 研究针对单图像自监督去噪问题,提出LoTA-N2N两阶段零样本自适应框架,通过估计局部相互作用和控制空间抵消,在多种噪声下实验效果优于仅基于MSE的方法,为无配对干净目标等情况的自监督去噪提供有效设计原则。

Comments 22pages, 9 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23854 2026-07-28 cs.AI 新提交

Understanding Human-like Solutions in Combinatorial Optimization via Learning and Search

通过学习和搜索理解组合优化中类人解决方案

Haijiang Yan, Jian-Qiao Zhu, Liqiang Huang, Ming Meng

机构 * The University of Warwick(华威大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) South China Normal University(华南师范大学) The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

AI总结 研究欧几里得旅行商问题中人类如何找到接近最优解,通过大规模行为和计算研究,对比人类与基于指针网络的神经策略,发现类人解决方案或源于结构化监督学习、强化学习及测试时搜索的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23731 2026-07-28 cs.LG 新提交

Outcome-Confounded Local Supervision in On-Policy Distillation

策略蒸馏中的结果混淆局部监督

Guoqing Ma

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究策略蒸馏中局部监督受轨迹结果混淆的问题,引入结果解析诊断方法区分不同情况,通过数学推理研究等实验得出相关比例及结果,指出局部化限制,贡献在于诊断而非新训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23694 2026-07-28 cs.CV 新提交

Parameter-Efficient Adaptation of SAM3 for Prompt-Driven Surgical Concept Segmentation

用于提示驱动手术概念分割的 SAM3 的参数高效适配

Changjing Liu, Yiming Huang, Beilei Cui, Liangjing Shao, Long Bai, Yanheng Li, Haoxuan Che, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) XGEN Labs(XGEN实验室)

AI总结 针对手术数据与预训练数据的领域差距及现有方法计算消耗大效率低的问题,提出用低秩适配(LoRA)对 SAM3 进行参数高效适配用于手术概念分割,该方法在单个 GPU 上训练且性能优于主流基线,结果可支持下游手术场景重建和模拟。

Comments Accepted by The 2nd MICCAI Workshop on Efficient Medical AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23537 2026-07-28 cs.AI 新提交

ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness

ObsDriveBench:具有可观测性意识的恶劣天气下多模态理解基准测试

Qiao Yan, Yihan Wang, Zhenghao Xing, Jiaqi Xu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所)

AI总结 研究恶劣天气下视觉语言模型在多模态输入时的表现,引入ObsDriveBench基准测试,通过可观测性元标注等构建含多类问题的测试集,实验发现现有模型性能降,还引入ObsDrive模型提升其在多方面的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23504 2026-07-28 cs.CV 新提交

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

MemVLN:用于视觉与语言导航的情景记忆和程序记忆

Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) LIGHTSPEED(光速) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究连续环境中视觉与语言导航问题,提出MemVLN框架,利用视觉编码器、大语言模型,通过情景记忆管理和程序记忆,实现实时推理,提升导航成功率并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24079 2026-07-28 cs.RO hep-th 新提交

Effective Parameters, Real Behavior: Renormalization for Robotics -- From Infinite Electron Mass to Sim-to-Real Gap

有效参数、真实行为:机器人技术的重整化——从无限电子质量到模拟与现实差距

Youran Sun, Jiaxuan Guo, Xingyu Ren, Chugang Yi, Haizhao Yang

机构 * University of Maryland, College Park(马里兰大学帕克分校) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究机器人技术中弥合模拟与现实差距的问题,提出基于重整化的方法,通过有效参数吸收模拟器遗漏细节以重现真实行为,经分析论证及实例展示该方法,并给出实用程序,为跨越模拟与现实差距提供补充路径。

详情

展开后加载摘要…

URL PDF HTML 收藏