arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2402
2411.17616 2026-02-10 cs.CV

Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints

通过谱约束的长跳连接实现稳定高效的扩散变换器

Guanjie Chen, Xinyu Zhao, Yucheng Zhou, Xiaoye Qu, Tianlong Chen, Yu Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 通过引入长跳连接和谱约束,Skip-DiT实现了图像和视频生成中的稳定高效扩散变换器,显著提升了训练和推理效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07198 2026-02-10 cs.CV cs.GR

Condition Matters in Full-head 3D GANs

条件在全头3D GANs中至关重要

Heyuan Li, Huimin Zhang, Yuda Qiu, Zhengwentai Sun, Keru Zheng, Lingteng Qiu, Peihao Li, Qi Zuo, Ce Chen, Yujian Zheng, Yuming Gu, Zilong Dong, Xiaoguang Han

机构 * SSE, CUHK-Shenzhen(CUHK-Shenzhen 信息学院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) MBZUAI USC(美国南加州大学) FNii-Shenzhen(深圳未来网络智能省重点实验室) Guangdong Provincial Key Laboratory of Future Networks of Intelligence Internship at Tongyi Lab(广东未来网络智能省重点实验室)

AI总结 本文提出使用视角不变的语义特征作为条件输入,以解决全头3D GANs中视角偏差问题,提升生成质量和一致性。

Comments Accepted by ICLR 2026. Project page: https://lhyfst.github.io/balancehead/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16748 2026-02-10 cs.CV

HyPlaneHead: Rethinking Tri-plane-like Representations in Full-Head Image Synthesis

HyPlaneHead:重新思考全头图像合成中的三平面表示

Heyuan Li, Kenkun Liu, Lingteng Qiu, Qi Zuo, Keru Zheng, Zilong Dong, Xiaoguang Han

机构 * Tongyi Lab, Alibaba Inc.(阿里云实验室) SSE, CUHK (Shenzhen)(城市大学(深圳)信息科学与工程学院) FNii-Shenzhen Guangdong Provincial Key Laboratory of Future Networks of Intelligence(未来网络智能化广东省重点实验室)

AI总结 HyPlaneHead通过引入混合平面表示,解决三平面表示中的特征纠缠和映射不均问题,提升全头图像合成性能。

Comments Accepted by NeurIPS 2025. Project page: https://lhyfst.github.io/hyplanehead/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06810 2026-02-09 cs.LG

Calibrating Tabular Anomaly Detection via Optimal Transport

通过最优传输校准表格异常检测

Hangting Ye, He Zhao. Wei Fan, Xiaozhuang Song, Dandan Guo, Yi Chang, Hongyuan Zha

机构 * University of Auckland(奥克兰大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 CTAD通过最优传输距离校准提升表格异常检测性能,适用于多种数据集和检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06706 2026-02-09 cs.LG cs.AI

SaDiT: Efficient Protein Backbone Design via Latent Structural Tokenization and Diffusion Transformers

SaDiT:通过潜在结构标记化和扩散变换器实现高效的蛋白质骨架设计

Shentong Mo, Lanqing Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Zhejiang Lab(浙江实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 SaDiT通过结合潜在结构标记化和扩散变换器,实现了高效的蛋白质骨架设计,提升了生成速度和结构可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06602 2026-02-09 cs.SD cs.AI cs.LG eess.AS

Scaling Speech Tokenizers with Diffusion Autoencoders

通过扩散自编码器扩展语音标记器

Yuancheng Wang, Zhenyu Tang, Yun Wang, Arthur Hinsvark, Yingru Liu, Yinghao Li, Kainan Peng, Junyi Ao, Mingbo Ma, Mike Seltzer, Qing He, Xubo Liu

机构 * Meta Superintelligence Labs(Meta超智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出SiTok,一种基于扩散自编码器的语音标记器,通过监督学习实现语义丰富的表示,并在低token率和比特率下实现高保真音频重建。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06449 2026-02-09 cs.CL

Evaluating an evidence-guided reinforcement learning framework in aligning light-parameter large language models with decision-making cognition in psychiatric clinical reasoning

评估一种证据引导的强化学习框架在对齐光参数大语言模型与精神科临床推理决策认知中的作用

Xinxin Lin, Guangxin Dai, Yi Zhong, Xiang Li, Xue Xiao, Yixin Zhang, Zhengdong Wu, Yongbo Zheng, Runchuan Zhu, Ming Zhao, Huizi Yu, Shuo Wu, Jun Zhao, Lingming Hu, Yumei Wang, Ping Yin, Joey W. Y. Chan, Ngan Yin Chan, Sijing Chen, Yun Kwok Wing, Lin Lu, Xin Ma, Lizhou Fan

机构 * The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(香港中文大学) Shandong University, Jinan, China(山东大学) Peking University Sixth Hospital, Beijing, China(北京大学第六医院) Inspur Cloud Information Technology Co., Ltd., Jinan, China(Inspur 云技术有限公司) Fudan University, Shanghai, China(复旦大学) Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, China(山东第一医科大学附属山东省人民医院) Jilin University, Changchun, China(吉林大学) Hong Kong ICI Cloud Service Limited, Hong Kong SAR, China(香港ICI云服务有限公司) Shandong First Medical University, Jinan, China(山东第一医科大学)

AI总结 本研究提出ClinMPO框架,通过证据引导的强化学习使轻量LLM在复杂精神病学推理任务中达到超越人类的准确率。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06373 2026-02-09 cs.CL

ReBeCA: Unveiling Interpretable Behavior Hierarchy behind the Iterative Self-Reflection of Language Models with Causal Analysis

ReBeCA: 通过因果分析揭示语言模型迭代自我反思背后的可解释行为层级

Tianqiang Yan, Sihan Shang, Yuheng Li, Song Qiu, Hao Peng, Wenjian Luo, Jue Xie, Lizhen Qu, Yuan Gao

机构 * Monash University(莫纳什大学) Harbin Institute of Technology(哈尔滨工业大学) Hainan University(海南大学) South China University of Technology(华南理工大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 ReBeCA通过因果分析揭示语言模型自我反思中的可解释行为层级,识别因果关系以提升自我反思效果。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05885 2026-02-09 cs.LG cs.AI cs.CL

Dr. Kernel: Reinforcement Learning Done Right for Triton Kernel Generations

Dr. Kernel:为Triton内核生成正确强化学习

Wei Liu, Jiawei Xu, Yingru Li, Longtao Zheng, Tianjian Li, Qian Liu, Junxian He

机构 * HKUST(香港科技大学) TikTok CUHK(SZ)(香港中文大学(深圳)) NTU(国立科技大学)

AI总结 Dr. Kernel通过强化学习方法优化内核生成,其模型在Kernelbench测试中达到与Claude-4.5-Sonnet相当的性能,并在速度提升方面超越其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04009 2026-02-09 cs.LG cs.AI cs.CV

PromptSplit: Revealing Prompt-Level Disagreement in Generative Models

PromptSplit: 暴露生成模型中的提示级分歧

Mehdi Lotfian, Mohammad Jalali, Farzan Farnia

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)

AI总结 PromptSplit通过核方法检测生成模型在提示层面的分歧,提供可解释的分析工具以识别模型行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00169 2026-02-09 cond-mat.mtrl-sci cs.AI

Towards Agentic Intelligence for Materials Science

迈向材料科学的代理智能

Huan Zhang, Yizhan Li, Wenhao Huang, Ziyu Hou, Yu Song, Xuye Liu, Farshid Effaty, Jinya Jiang, Sifan Wu, Qianggang Ding, Izumi Takahara, Leonard R. MacGillivray, Teruyasu Mizoguchi, Tianshu Yu, Lizi Liao, Yuyu Luo, Yu Rong, Jia Li, Ying Diao, Heng Ji, Bang Liu

机构 * DIRO & Institut Courtois, Université de Montréal(蒙特利尔大学DIRO与Courtois研究所) Mila – Quebec AI Institute(魁北克AI研究所) University of Waterloo(滑铁卢大学) Université de Sherbrooke(Sherbrooke大学) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo, Institute of Industrial Science(东京大学工业科学研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Singapore Management University(新加坡管理学院) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州)) Alibaba DAMO Academy(阿里巴巴达摩院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) CIFAR AI Chair(CIFAR人工智能主席)

AI总结 本文提出以流程为中心的代理系统框架,通过整合人工智能与材料科学,推动材料发现的自主化与智能化。

Comments 81 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23087 2026-02-09 cs.LG cs.AI stat.ML

Dynamic Vocabulary Pruning: Stable LLM-RL by Taming the Tail

动态词汇剪枝:通过驯服尾部实现稳定的LLM强化学习

Yingru Li, Jiawei Xu, Jiacai Liu, Yuxuan Tong, Ziniu Li, Tianle Cai, Ge Zhang, Qian Liu, Baoxiang Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Fudan University(复旦大学)

AI总结 动态词汇剪枝通过限制RL目标到安全词汇,减少尾部token的偏置误差,从而实现稳定的大语言模型强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16975 2026-02-09 cs.SE cs.CL

SWE-Dev: Evaluating and Training Autonomous Feature-Driven Software Development

SWE-Dev:评估和训练自主的基于特征驱动的软件开发

Yaxin Du, Yuzhu Cai, Yifan Zhou, Cheng Wang, Yu Qian, Xianghe Pang, Qian Liu, Yue Hu, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) The Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学)

AI总结 SWE-Dev是一个大规模数据集,用于评估和训练自主编码系统在特征驱动软件开发中的能力,通过提供可运行环境和单元测试提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04010 2026-02-09 cs.LG cs.AI cs.CL cs.NE

Hyperbolic Fine-Tuning for Large Language Models

双曲微调用于大语言模型

Menglin Yang, Ram Samarth B B, Aosong Feng, Bo Xiong, Jihong Liu, Irwin King, Rex Ying

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Indian Institute of Science(印度科学研究院) Yale University(耶鲁大学) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 HypLoRA通过在双曲空间中进行低秩适应,提升大语言模型在算术和常识推理任务中的性能。

Comments NeurIPS 2025; https://github.com/marlin-codes/HypLoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06207 2026-02-09 cs.RO

Bioinspired Kirigami Capsule Robot for Minimally Invasive Gastrointestinal Biopsy

仿生折纸胶囊机器人用于微创消化道活检

Ruizhou Zhao, Yichen Chu, Shuwei Zhao, Wenchao Yue, Raymond Shing-Yan Tang, Hongliang Ren

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Sha Tin, Hong Kong, China, and CUHK Shenzhen Research Institute, CUHK-SZRI, Shenzhen, China(电子工程系,香港中文大学(深圳)研究学院,香港中文大学(深圳)研究学院,深圳,中国) Department of Mechanical Engineering and Automation, Northeastern University, Shenyang 110819, China(机械工程与自动化系,东北大学,沈阳110819,中国) Department of Medicine and Therapeutics and Institute of Digestive Disease, The Chinese University of Hong Kong, Hong Kong(医学与治疗系及消化疾病研究所,香港中文大学,香港)

AI总结 Kiri-Capsule是一种受折纸启发的胶囊机器人,通过双凸轮机构驱动可展开PI薄膜褶皱,实现微创、可重复的消化道组织活检,提供可进行组织学分析的活检样本。

Comments 8 pages, 11 figures, accepted to IEEE ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05986 2026-02-06 cs.CV cs.AI

RISE-Video: Can Video Generators Decode Implicit World Rules?

RISE-Video: 视频生成器能否解码隐含的世界规则?

Mingxin Liu, Shuran Ma, Shibei Meng, Xiangyu Zhao, Zicheng Zhang, Shaofeng Zhang, Zhihang Zhong, Peixian Chen, Haoyu Cao, Xing Sun, Haodong Duan, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Xidian University(西安电子科技大学) Beijing Normal University(北京师范大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 RISE-Video通过多维评估框架评估视频生成模型在隐含世界规则推理能力,揭示其在复杂场景模拟中的不足,推动未来生成模型的发展。

Comments 38 pages, 16 figures, 3 tables; Code: https://github.com/VisionXLab/RISE-Video; HuggingFace: https://huggingface.co/datasets/VisionXLab/RISE-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05943 2026-02-06 cs.LG

Orthogonal Model Merging

正交模型融合

Sihan Yang, Kexuan Shi, Weiyang Liu

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

AI总结 正交模型融合通过在正交群流形上进行融合操作,有效保留模型权重的几何结构,减少灾难性遗忘并提升多任务性能。

Comments Technical report (18 pages, 9 figures, project page: https://spherelab.ai/OrthoMerge/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05927 2026-02-06 stat.ML cs.LG

Transformers Are Born Biased: Structural Inductive Biases at Random Initialization and Their Practical Consequences

Transformer 诞生时的偏见:随机初始化下的结构归纳偏见及其实际影响

Siquan Li, Yao Tong, Haonan Wang, Tianyang Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National University of Singapore(新加坡国立大学)

AI总结 研究揭示了随机初始化的 Transformer 存在结构偏见,通过 SeedPrint 方法区分初始化差异的模型,并解释了注意力机制导致的汇现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05832 2026-02-06 cs.CV

UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents

UI-Mem: 为移动GUI代理在线强化学习中的自演化经验记忆

Han Xiao, Guozhi Wang, Hao Wang, Shilong Liu, Yuxiang Chai, Yue Pan, Yufeng Zhou, Xiaoxin Chen, Yafei Wen, Hongsheng Li

机构 * Multimedia Laboratory (MMLab), The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shenzhen Loop Area Institute(深圳河套学院) Shanghai AI Lab(上海人工智能实验室) vivo AI Lab(vivo人工智能实验室) Princeton University(普林斯顿大学)

AI总结 UI-Mem通过自演化经验记忆提升移动GUI代理在线强化学习性能,实现跨任务经验转移与策略优化。

Comments 23 pages, 16 figures. Project page: https://ui-mem.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05633 2026-02-06 cs.CL

CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models

CASTLE:一个评估大语言模型学生定制个性化安全性的综合基准

Rui Jia, Ruiyi Lan, Fengrui Liu, Zhongxiang Dai, Bo Jiang, Jing Shao, Jingyuan Chen, Guandong Xu, Fei Wu, Min Zhang

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Education University of Hong Kong(香港教育大学)

AI总结 CASTLE基准通过评估学生定制个性化安全性,揭示大语言模型在不同学生属性下的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05423 2026-02-06 cs.CV cs.GR

NeVStereo: A NeRF-Driven NVS-Stereo Architecture for High-Fidelity 3D Tasks

NeVStereo: 一种基于NeRF的NVS-立体架构用于高保真3D任务

Pengcheng Chen, Yue Hu, Wenhao Li, Nicole M Gunderson, Andrew Feng, Zhenglong Sun, Peter Beerel, Eric J Seibel

机构 * University of Washington(华盛顿大学) University of Southern California(南加州大学) CUHK-Shenzhen(香港中文大学(深圳)) USC Institute for Creative Technologies(南加州大学创意技术研究所)

AI总结 NeVStereo通过结合NeRF和多视角深度估计,实现了高保真3D重建,显著提升了深度精度和网格质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05273 2026-02-06 cs.RO

Affordance-Aware Interactive Decision-Making and Execution for Ambiguous Instructions

具有包容性的交互决策与执行以应对模糊指令

Hengxuan Xu, Fengbo Lan, Zhixin Zhao, Shengjie Wang, Mengqiao Liu, Jieqian Sun, Yu Cheng, Tao Zhang

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息学院) Computer Science and Engineering Department, Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

AI总结 AIDE通过双流框架整合交互式探索与视觉-语言推理,实现对模糊指令的高效决策与执行,提升机器人在陌生环境中的任务规划能力。

Comments 14 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05207 2026-02-06 eess.AS cs.AI

ARCHI-TTS: A flow-matching-based Text-to-Speech Model with Self-supervised Semantic Aligner and Accelerated Inference

ARCHI-TTS: 一种基于流匹配的文本到语音模型,配备自监督语义对齐器和加速推理

Chunyat Wu, Jiajun Deng, Zhengxi Liu, Zheqi Dai, Haolin He, Qiuqiang Kong

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学)

AI总结 ARCHI-TTS通过自监督语义对齐器和高效推理策略,实现了高效率的文本到语音合成,优于现有最先进系统。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05004 2026-02-06 cs.CL cs.AI

CoWork-X: Experience-Optimized Co-Evolution for Multi-Agent Collaboration System

CoWork-X:面向多智能体协作系统的经验优化共进化

Zexin Lin, Jiachen Yu, Haoyang Zhang, Yuzhao Li, Zhonghang Li, Yujiu Yang, Junjie Wang, Xiaoqiang Ji

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) Tsinghua University(清华大学) AutoGame Research(AutoGame研究) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人研究院)

AI总结 CoWork-X通过主动共进化框架,优化多智能体协作系统的实时协调与多轮适应,实现稳定性能提升和降低延迟与令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04896 2026-02-06 cs.CR cs.AI

Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models

转向外部性:良性激活转向无意中增加大语言模型的劫持风险

Chen Xiong, Zhiyuan He, Pin-Yu Chen, Ching-Yun Ko, Tsung-Yi Ho

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

AI总结 本文研究了大语言模型中良性激活转向对安全性的负面影响,发现其无意中增加劫持风险,并通过实验验证了这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19243 2026-02-06 cs.CV

VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis

VisionDirector: 生成图像合成中的视觉-语言引导闭环细化

Meng Chu, Senqiao Yang, Haoxuan Che, Suiyun Zhang, Xichen Zhang, Shaozuo Yu, Haokun Gui, Zhefan Rao, Dandan Tu, Rui Liu, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港理工大学) The Chinese University of Hong Kong(香港中文大学) Huawei Research(华为研究)

AI总结 VisionDirector通过视觉-语言引导闭环细化方法,提升生成图像合成中多目标任务的完成度和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04496 2026-02-05 cs.AI

ReThinker: Scientific Reasoning by Rethinking with Guided Reflection and Confidence Control

ReThinker:通过引导反思与置信度控制实现科学推理

Zhentao Tang, Yuqi Cui, Shixiong Kai, Wenqian Zhao, Ke Ye, Xing Li, Anxin Tian, Zehua Pei, Hui-Ling Zhen, Shoubo Hu, Xiaoguang Li, Yunhe Wang, Mingxuan Yuan

机构 * Noah's Ark Lab, Huawei, China(诺亚实验室,华为,中国) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学,香港,中国)

AI总结 ReThinker通过引导反思与置信度控制,提升大语言模型在专家级科学推理任务中的性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04441 2026-02-05 cs.CV

SynthVerse: A Large-Scale Diverse Synthetic Dataset for Point Tracking

SynthVerse:一个大规模多样化合成数据集用于点跟踪

Weiguang Zhao, Haoran Xu, Xingyu Miao, Qin Zhao, Rui Zhang, Kaizhu Huang, Ning Gao, Peizhou Cao, Mingze Sun, Mulin Yu, Tao Lu, Linning Xu, Junting Dong, Jiangmiao Pang

机构 * University of Liverpool(利物浦大学) Zhejiang University(浙江大学) Durham University(杜伦大学) Beihang University(北京航空航天大学) Duke Kunshan University(杜克昆山大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 SynthVerse通过提供大规模多样化合成数据集,提升点跟踪任务的泛化能力和评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04220 2026-02-05 cs.CV

Adaptive 1D Video Diffusion Autoencoder

自适应一维视频扩散自编码器

Yao Teng, Minxuan Lin, Xian Liu, Shuai Wang, Xiao Yang, Xihui Liu

机构 * The University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司) CUHK(香港中文大学) Nanjing University(南京大学)

AI总结 本文提出了一种自适应一维视频扩散自编码器,通过改进的编码和解码机制实现更高效的视频压缩与重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04167 2026-02-05 cs.CV

Point2Insert: Video Object Insertion via Sparse Point Guidance

Point2Insert: 通过稀疏点引导的视频物体插入

Yu Zhou, Xiaoyan Yang, Bojia Zi, Lihan Zhang, Ruijie Sun, Weishi Zheng, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院,中国电信(TeleAI)) Sun Yat-sen University(孙中山大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 Point2Insert通过稀疏点引导实现视频中物体的灵活插入,优于现有方法并具备更高的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏