arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-07-28 至 2026-07-28 共收录 15
2607.24591 2026-07-28 cs.CV 新提交

CameraAnything: Refilming Videos with Arbitrary Camera Control

CameraAnything:使用任意相机控制重新拍摄视频

Yixuan Li, Yanhong Zeng, Ka Leong Cheng, Jiayi Zhu, Hanlin Wang, Wen Wang, Yihao Meng, Hao Ouyang, Qiuyu Wang, Yue Yu, ZiDong Wang, Yiyuan Zhang, Yujun Shen, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 CameraAnything是用于相机控制视频编辑的统一框架,采用逐像素普吕克光线注入等方法联合控制相机参数,开发合成管道克服数据稀缺,能在单过程中实现多种视频编辑操作,为视频制作提供实用价值。

Comments Project page: https://yixuanli98.github.io/cameraanything/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24493 2026-07-28 cs.RO 新提交

KAI: A Kinematic-Aware Interface for Data-Efficient Articulated Object Manipulation

KAI:用于数据高效关节物体操纵的运动感知接口

Yaping Li, Zhaxizhuoma, Qiaojun Yu, Jia Zeng, Dahua Lin, Jiangmiao Pang

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究关节物体操纵中运动结构难学问题,提出运动感知关节接口KAI,通过嵌入先验提高样本效率,在多模拟任务中表现良好,能推广到复杂场景,视频共训练增强真实世界鲁棒性。

Comments Project page: https://li-yaping.github.io/KAI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24199 2026-07-28 cs.CV 新提交

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24135 2026-07-28 cs.CV 新提交

LoTA-N2N: Local Trace Adaptation for Zero-Shot Self-Supervised Image Denoising

LoTA-N2N:用于零样本自监督图像去噪的局部迹线自适应

Jintong Hu, Bin Xia, Junlin Liu, Jiayue Liu, Wenming Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) University of Southern California(南加州大学) Peking University(北京大学)

AI总结 研究针对单图像自监督去噪问题,提出LoTA-N2N两阶段零样本自适应框架,通过估计局部相互作用和控制空间抵消,在多种噪声下实验效果优于仅基于MSE的方法,为无配对干净目标等情况的自监督去噪提供有效设计原则。

Comments 22pages, 9 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23854 2026-07-28 cs.AI 新提交

Understanding Human-like Solutions in Combinatorial Optimization via Learning and Search

通过学习和搜索理解组合优化中类人解决方案

Haijiang Yan, Jian-Qiao Zhu, Liqiang Huang, Ming Meng

机构 * The University of Warwick(华威大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) South China Normal University(华南师范大学) The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

AI总结 研究欧几里得旅行商问题中人类如何找到接近最优解,通过大规模行为和计算研究,对比人类与基于指针网络的神经策略,发现类人解决方案或源于结构化监督学习、强化学习及测试时搜索的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23731 2026-07-28 cs.LG 新提交

Outcome-Confounded Local Supervision in On-Policy Distillation

策略蒸馏中的结果混淆局部监督

Guoqing Ma

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究策略蒸馏中局部监督受轨迹结果混淆的问题,引入结果解析诊断方法区分不同情况,通过数学推理研究等实验得出相关比例及结果,指出局部化限制,贡献在于诊断而非新训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23694 2026-07-28 cs.CV 新提交

Parameter-Efficient Adaptation of SAM3 for Prompt-Driven Surgical Concept Segmentation

用于提示驱动手术概念分割的 SAM3 的参数高效适配

Changjing Liu, Yiming Huang, Beilei Cui, Liangjing Shao, Long Bai, Yanheng Li, Haoxuan Che, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) XGEN Labs(XGEN实验室)

AI总结 针对手术数据与预训练数据的领域差距及现有方法计算消耗大效率低的问题,提出用低秩适配(LoRA)对 SAM3 进行参数高效适配用于手术概念分割,该方法在单个 GPU 上训练且性能优于主流基线,结果可支持下游手术场景重建和模拟。

Comments Accepted by The 2nd MICCAI Workshop on Efficient Medical AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23537 2026-07-28 cs.AI 新提交

ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness

ObsDriveBench:具有可观测性意识的恶劣天气下多模态理解基准测试

Qiao Yan, Yihan Wang, Zhenghao Xing, Jiaqi Xu, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所)

AI总结 研究恶劣天气下视觉语言模型在多模态输入时的表现,引入ObsDriveBench基准测试,通过可观测性元标注等构建含多类问题的测试集,实验发现现有模型性能降,还引入ObsDrive模型提升其在多方面的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23504 2026-07-28 cs.CV 新提交

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

MemVLN:用于视觉与语言导航的情景记忆和程序记忆

Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) LIGHTSPEED(光速) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究连续环境中视觉与语言导航问题,提出MemVLN框架,利用视觉编码器、大语言模型,通过情景记忆管理和程序记忆,实现实时推理,提升导航成功率并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24079 2026-07-28 cs.RO hep-th 新提交

Effective Parameters, Real Behavior: Renormalization for Robotics -- From Infinite Electron Mass to Sim-to-Real Gap

有效参数、真实行为:机器人技术的重整化——从无限电子质量到模拟与现实差距

Youran Sun, Jiaxuan Guo, Xingyu Ren, Chugang Yi, Haizhao Yang

机构 * University of Maryland, College Park(马里兰大学帕克分校) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究机器人技术中弥合模拟与现实差距的问题,提出基于重整化的方法,通过有效参数吸收模拟器遗漏细节以重现真实行为,经分析论证及实例展示该方法,并给出实用程序,为跨越模拟与现实差距提供补充路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18955 2026-07-28 cs.LG cs.CL 版本更新

H$^2$SD: Hybrid Hindsight Self-Distillation

H$^2$SD:混合事后自蒸馏

Qiye Cai, Yichuan Ma, Peiji Li, Yongkang Chen, Qipeng Guo, Yicheng Zou, Linyang Li, Xiaocheng Feng, Bing Qin

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究针对强化学习中奖励监督问题,提出 H$^2$SD 混合事后自蒸馏框架。成功轨迹用教师概率调更新幅度,失败轨迹基于参考提示调整教师并最小化反向 KL 散度,实验表明该框架优于基线,能稳定优化且效率良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11976 2026-07-28 cs.LG 版本更新

LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention

LiteTopK:利用维度诅咒设计长上下文稀疏注意力中的融合索引器 - TopK 内核

Ziqi Yin, Jianyang Gao, Peiqi Yin, Jiangneng Li, Gao Cong

机构 * Nanyang Technological University(南洋理工大学) ETH Zurich(苏黎世联邦理工学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究针对现有 GPU 索引器 - TopK 内核效率低的问题,利用维度诅咒设计 LITETOPK 内核,通过采样估计得分范围划分候选结果桶,降低内存开销,在实际部署中加速 GLM 5.2 预填充阶段,提升了效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27660 2026-07-28 cs.AI 版本更新

From Context to Skills: Can Language Models Learn from Context Skillfully?

从上下文到技能:语言模型能否从上下文中熟练学习?

Shuzheng Si, Haozhe Zhao, Yu Lei, Qingyi Wang, Dingwei Chen, Zhitong Wang, Zhenhailong Wang, Kangyang Luo, Zheng Wang, Gang Chen, Fanchao Qi, Minjia Zhang, Maosong Sun

机构 * THU(清华大学) DeepLang AI UIUC(伊利诺伊大学香槟分校) FDU(福建大学) CUHK(香港中文大学)

AI总结 提出Ctx2Skill框架,通过多智能体自博弈和跨时间回放机制,自动从上下文中发现、提炼和选择技能,提升语言模型在复杂上下文中的学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05132 2026-07-28 cs.CL cs.AI 版本更新

PrinciplismQA: A Philosophy-Grounded Approach to Assessing LLM-Human Clinical Medical Ethics Alignment

PrinciplismQA: 一种基于哲学的评估LLM与人类临床医学伦理对齐的方法

Chang Hong, Minghao Wu, Qingying Xiao, Yuchi Wang, Xiang Wan, Guangjun Yu, Benyou Wang, Yan Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National Health Data Institute, Shenzhen(深圳国家健康数据研究院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

AI总结 本文提出PrinciplismQA,一种基于哲学框架的评估方法,用于评估LLM在临床医学伦理上的对齐情况,通过专家验证的问题集揭示模型在伦理推理上的不足。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03570 2026-07-28 cs.LG 版本更新

Asymmetric Hierarchical Anchoring for Robust Audio-Visual Cross-Modal Generalization

非对称层次锚定用于音频-视觉联合表示:解决信息分配模糊性以实现鲁棒跨模态泛化

Bixing Wu, Yuhong Zhao, Zongli Ye, Jiachen Lian, Xiangyu Yue, Gopala Anumanchipalli

机构 * Zhejiang University, China(浙江大学) University of California, Berkeley, USA(加州大学伯克利分校) MMLab, Chinese University of Hong Kong, China(香港中文大学MMLab)

AI总结 本文提出非对称层次锚定框架,通过结构化语义锚点解决跨模态泛化中的信息分配模糊性,提升语义一致性和表示纯度。

详情

展开后加载摘要…

URL PDF HTML 收藏