arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-03-23 至 2026-03-23 共收录 7
2603.20194 2026-03-23 cs.CV

MME-CoF-Pro: Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints

MME-CoF-Pro:基于文本和视觉提示评估视频生成模型中的推理一致性

Yu Qi, Xinyi Xu, Ziyu Guo, Siyuan Ma, Renrui Zhang, Xinyan Chen, Ruichuan An, Ruofan Xing, Jiayi Zhang, Haojie Huang, Pheng-Ann Heng, Jonathan Tremblay, Lawson L. S. Wong

机构 * Northeastern University(东北大学) The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) ByteDance Seed(字节跳动种子) Peking University(北京大学) NVIDIA(英伟达)

AI总结 本文提出MME-CoF-Pro视频推理基准,评估视频模型的推理一致性,发现生成模型推理一致性弱,文本提示提升正确性但导致不一致,视觉提示在结构化任务中表现较好但难以处理细粒度感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19659 2026-03-23 cs.CV

CS-MUNet: A Channel-Spatial Dual-Stream Mamba Network for Multi-Organ Segmentation

CS-MUNet:一种用于多器官分割的通道-空间双流Mamba网络

Yuyang Zheng, Mingda Zhang, Jianglong Qin, Qi Mo, Jingdan Pan, Haozhe Hu, Hongyi Huang

机构 * School of Software Engineering(软件工程学院) The Chinese University of Hong Kong(香港中文大学) Yunnan Provincial Key Laboratory of Software Engineering(云南省软件工程重点实验室)

AI总结 本文提出CS-MUNet,通过边界感知状态Mamba模块和通道Mamba状态聚合模块,解决腹腔器官分割中跨通道解剖语义协作和边界感知特征融合的问题,实验表明其在多个指标上优于现有方法。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18389 2026-03-23 physics.chem-ph cs.AI

An SO(3)-equivariant reciprocal-space neural potential for long-range interactions

一种基于SO(3)等价性的反演空间神经势场用于长程相互作用

Lingfeng Zhang, Taoyong Cui, Dongzhan Zhou, Lei Bai, Sufei Zhang, Luca Rossi, Mao Su, Wanli Ouyang, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong Polytechnic University(香港理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 本文提出EquiEwald,一种结合Ewald方法与SO(3)等价框架的神经势场,能有效模拟长程电相互作用,保持物理一致性并提升精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19486 2026-03-23 cs.CV

Exploring Disentangled and Controllable Human Image Synthesis: From End-to-End to Stage-by-Stage

探索解耦和可控的人像图像合成:从端到端到分阶段

Zhengwentai Sun, Chenghong Li, Hongjie Liao, Xihe Yang, Keru Zheng, Heyuan Li, Yihao Zhi, Shuliang Ning, Shuguang Cui, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Future Network of Intelligence Institute, CUHK-Shenzhen(智能网络研究院,CUHK-深圳)

AI总结 本文提出一种解耦可控的人像合成任务,通过分阶段框架提升可控性和泛化能力,优于端到端模型,适用于真实场景。

Comments A new version with additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19290 2026-03-23 cs.NE cs.AI

Neural Dynamics Self-Attention for Spiking Transformers

脉冲神经网络自注意力机制用于脉冲变换器

Dehao Zhang, Fukai Guo, Shuai Wang, Jingya Wang, Jieyuan Zhang, Yimeng Shan, Malu Zhang, Yang Yang, Haizhou Li

机构 * University of Electronic Science and Technology of China(电子科技大学) Shenzhen Loop Area Institute(深圳河套学院) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

AI总结 本文提出LRF-Dyn机制,通过局部感受野和膜电位动态减少内存开销并提升性能,验证了其在视觉任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18048 2026-03-23 cs.AI cs.SD eess.AS

DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models

DEAF:用于音频语言模型声音忠实度诊断评估的基准

Jiaqi Xiong, Yunjia Qi, Qi Cao, Yu Zheng, Yutong Zhang, Ziteng Wang, Ruofan Liao, Weisheng Xu, Sichen Liu

机构 * University of Oxford(牛津大学) XJTLU HNU(湖南大学) CUHK(SZ)(香港中文大学(深圳)) PKU(北京大学) HKUST(GZ)(香港科技大学(广州))

AI总结 DEAF基准通过2700多个冲突刺激,评估音频语言模型对声音信号的真实处理能力,揭示模型在语音基准测试中的表现与真实声音理解间的差距。

Comments 14 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10518 2026-03-23 cs.CV

VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning

VR-Thinker: 通过图像推理提升视频奖励模型

Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

机构 * CUHK MMLab(香港中文大学多模态实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Nanjing University(南京大学)

AI总结 本文提出VR-Thinker框架,通过图像推理操作和可配置视觉记忆窗口提升视频奖励模型的推理精度与可靠性,实现在视频偏好基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏