arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-06-02 至 2026-06-02 共收录 23
2606.02443 2026-06-02 cs.CL cs.AI cs.CV

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

PaSBench-Video: 面向主动安全预警的流式视频基准

Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

AI总结 提出PaSBench-Video基准,包含740个视频,评估多模态大模型在危险发生前及时发出预警的能力,发现现有模型在时序精度和低误报率上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01777 2026-06-02 cs.RO

Trans2Occ: Voxel Occupancy Estimation and Grasp for Transparent Objects from Simulation to Reality

Trans2Occ: 从仿真到现实的透明物体体素占用估计与抓取

Yixuan Yang, Sha Zhang, Rui Li, Zhenfei Yin, Xinzhu Ma, Yiran Qin, Lei Bai, Xudong Xu, Shilin Shan, Wangmeng Zuo, Yanyong Zhang, Wanli Ouyang, Feng Zheng, Shixiang Tang, Dongzhan Zhou

机构 * Shanghai AI Laboratory(上海人工智能实验室) SUSTech(南方科技大学) CUHK(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) University of Oxford(牛津大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出基于单视图RGB输入的体素占用预测框架,结合仿真数据生成与规则抓取策略,实现透明物体的鲁棒3D感知与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01382 2026-06-02 cs.LG cs.AI

Efficient Exploration for Iterative Nash Preference Optimization

迭代纳什偏好优化的高效探索

Tianlong Nan, Xiaopeng Li, Christian Kroer, Tianyi Lin

机构 * Columbia University(哥伦比亚大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 针对通用偏好模型下的迭代NLHF,提出显式探索算法,结合SFT正则化与对抗性策略探索,实现O(√T)遗憾界,避免对KL正则化参数的指数依赖。

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01098 2026-06-02 cs.RO cs.AI

Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry

隐式漂移策略:通过条件专家几何实现单步动作生成

Zemin Yang, Yaoyu He, Yiming Zhong, Yuhao Zhang, Xinge Zhu, Yao Mu, Qingqiu Huang, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Morphi Robot(Morphi机器人)

AI总结 提出隐式漂移策略(IDP),一种单步模仿学习框架,通过条件专家几何隐式引入训练时的漂移校正,无需显式向量场估计,在2D、3D及真实世界操作任务中有效保持有效动作流形,性能优于显式漂移方法并达到强单步基线水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01048 2026-06-02 cs.CV

Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation

解耦残差去噪扩散模型用于统一且数据高效的图像到图像翻译

Ziyue Lin, Jiahe Hou, Hongyu Xia, Xinrui Xie, Feifei Wang, Yuyin Zhou, Wei Wang, Jiawei Liu, Liangqiong Qu

机构 * The University of Hong Kong(香港大学) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) The Chinese University of Hong Kong(香港中文大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

AI总结 提出解耦残差去噪扩散模型(DRDD),通过将扩散过程解耦为随机噪声扩散和确定性残差扩散两个独立阶段,实现统一且数据高效的图像到图像翻译。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00815 2026-06-02 cs.LG

OmniEEG-Bench: A Standardized Evaluation Benchmark for EEG Foundation Models

OmniEEG-Bench: 脑电图基础模型的标准化评估基准

Ziling Lu, Zongsheng Li, Xinke Shen, Kexin Lou, Yingyue Xin, Xiaoqi Chen, Shinan Wang, Xiang Chen, Jiahao Fan, Chenyu Huang, Xin Xu, Zhoujie Hou, Chen Wei, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学生物医学工程系,深圳,中国) School of Computer Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)计算机科学与工程学院,深圳,中国) Omni-Intelligence, Shenzhen, China(奥米智能,深圳,中国) Shenzhen Loop Area Institute, Shenzhen, China(深圳环城研究院,深圳,中国)

AI总结 针对脑电图基础模型评估碎片化问题,提出统一基准OmniEEG-Bench,涵盖六类任务、54个数据集,并揭示预训练数据多样性和模型大小与性能的缩放律关系。

Comments 28 pages, 13 figures, 8 tables; benchmark of EEG foundation models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00808 2026-06-02 cs.LG

Safe-Subspace Pseudo-Label Refinement for Source-Free Graph Domain Adaptation

安全子空间伪标签精炼用于无源图域自适应

Yingxu Wang, Xinwang Liu, Siyang Gao, Nan Yin

机构 * Department of Computer Science and Engineering, Chinese University of Hong Kong(香港中文大学计算机科学与工程系) College of Computer, National University of Defense Technology(国防科技大学计算机学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) The Education University of Hong Kong(香港教育大学)

AI总结 针对无源图域自适应中伪标签不可靠的问题,提出SafeSubspace伪标签精炼方法,通过识别置信度一致的安全子空间并利用语义与结构证据进行伪标签验证,实现鲁棒的图域自适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00746 2026-06-02 cs.CV cs.LG

Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders

将并行序列模型扩展到基础规模的视觉编码器

Yitong Jiang, Hongjun Wang, Collin McCarthy, Hanrong Ye, David Wehr, Xinhao Li, Qi Dou, Tianfan Xue, Ka Chun Cheung, Simon See, Wonmin Byeon, Ke Chen, Kai Han, Jinwei Gu, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Sifei Liu

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 提出C-GSPN,一种基于2D空间传播的基础规模视觉编码器,通过快速CUDA内核、压缩潜在空间传播块和两阶段交叉算子蒸馏,在减少参数的同时提升性能并实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00622 2026-06-02 cs.CV

MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue

MM-Snowball:多模态多轮对话中的幻觉雪崩评估与缓解

Yue Jiang, Xue Jiang, Lihua Zhang, Zhiqiang Wang, Yuhang Lu, Peng Wang, Bo Han, Feng Zheng, Dingkang Yang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Southern University of Science and Technology(南方科技大学) TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) MM Lab, CUHK(CUHK 多模态实验室) RAMS Lab, Huawei Technologies Co., Ltd.(华为技术有限公司 RAMS 实验室)

AI总结 针对多模态大模型在多轮对话中因初始错误累积导致幻觉雪崩的问题,提出首个细粒度诊断基准MM-Snowball,并设计无训练的冲突感知视觉校正方法CAVR,通过表示级刷新视觉锚定和logit级修正输出分布来缓解雪崩效应。

Comments Accepted by The International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24005 2026-06-02 cs.AI cs.CL

LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition

LC-ERD:通过一致性调节奖励分解挖掘潜在逻辑以实现自我进化推理

Yanyu Chen, Jiyue Jiang, Dianzhi Yu, Zheng Wu, Jiahong Liu, Jiaming Han, Xiao Guo, Jinhu Qi, Yu Li, Yifei Zhang, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学)

AI总结 针对大语言模型推理中高质量过程数据稀缺的问题,提出LC-ERD框架,通过潜在逻辑挖掘和一致性调节的奖励分解,实现自我对齐与推理进化。

Comments Accepted in SIGKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12969 2026-06-02 cs.LG cs.AI

Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective

从对比视角重新审视基于可验证奖励的强化学习

Feng Zhang, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang

机构 * Beijing Institute of Technology(北京理工大学) Qwen Business Unit of Alibaba(阿里巴巴Qwen业务部) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出ConSPO方法,通过对比序列级策略优化,解决GRPO在目标函数上的似然错配和信用分配不敏感问题,在推理任务上超越强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09366 2026-06-02 cs.AI

Towards a Virtual Neuroscientist: Autonomous Neuroimaging Analysis via Multi-Agent Collaboration

迈向虚拟神经科学家:基于多智能体协作的自主神经影像分析

Keqi Han, Songlin Zhao, Yao Su, Xiang Li, Yixuan Yuan, Lifang He, Carl Yang

机构 * Emory University(埃默里大学) Lehigh University(莱斯大学) Worcester Polytechnic Institute(沃思堡理工学院) Massachusetts General Hospital(麻省总医院) Harvard University(哈佛大学) Chinese University of Hong Kong(香港中文大学)

AI总结 提出NEXUS多智能体框架,通过代码中心执行和分层验证实现自主神经影像分析,在ADHD-200和ADNI数据集上优于传统工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09692 2026-06-02 cs.AI

Causal state binding predicts action control in language agents

因果状态绑定预测语言智能体中的动作控制

Xiao Jia

机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(人工智能学院,香港中文大学(深圳))

AI总结 提出因果状态绑定框架,通过干预实验测量智能体动作是否随事件特定决定性状态变化,验证了结构化智能体在动作控制上优于随机基线。

Comments 85 pages, 5 main figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12377 2026-06-02 cs.CV

Fast Image Super-Resolution via Consistency Rectified Flow

通过一致性修正流实现快速图像超分辨率

Jiaqi Xu, Wenbo Li, Haoze Sun, Fan Li, Zhixin Wang, Long Peng, Jingjing Ren, Haoran Yang, Xiaowei Hu, Renjing Pei, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室) HKUST (GZ)(香港科技大学(广州)) South China University of Technology(华南理工大学)

AI总结 提出FlowSR方法,将超分辨率问题重构为从低分辨率到高分辨率图像的修正流,利用改进的一致性学习策略实现单步高质量超分辨率。

Comments Accepted by ICCV 2025; Code: https://github.com/jiaqixuac/FlowSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11424 2026-06-02 cs.CL

Bridging What the Model Thinks and How It Speaks: Expressive Speech Generation via Self-Aware Intent-Realization Alignment

弥合模型所想与所言之间的鸿沟:通过自我意识意图-实现对齐的富有表现力的语音生成

Kuang Wang, Lai Wei, Ping Lin, Qibing Bai, Wenkai Fang, Li Zhou, Feng Jiang, Zhongjie Jiang, Jun Huang, Yannan Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tencent Ethereal Audio Lab(腾讯虚实音频实验室) Southeast University(东南大学) Zhejiang University(浙江大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 提出SASLM框架,通过自蒸馏意图和自奖励优化,无需外部标注即可弥合语义理解与声学实现之间的差距,实现富有表现力的语音生成。

Comments Submitted to EMNLP 2026. Project page: https://wangkevin02.github.io/SASLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16720 2026-06-02 cs.DB cs.AI

APEX-SQL: Talking to the data via Agentic Exploration for Text-to-SQL

APEX-SQL: 通过智能体探索与数据对话实现Text-to-SQL

Bowen Cao, Weibin Liao, Yushi Sun, Dong Fang, Haitao Li, Wai Lam

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) LIGHTSPEED

AI总结 提出APEX-SQL框架,通过假设验证循环、逻辑规划、双路径剪枝、并行数据分析和确定性探索机制,解决静态模式表示在复杂企业数据库中的语义模糊和扩展性问题,在BIRD和Spider 2.0-Snow上取得领先性能。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00986 2026-06-02 cs.CL

ADRA-Bank: A Modular Benchmark for Academic Deep Research Agents

ADRA-Bank:面向学术深度研究智能体的模块化基准

Zhihan Guo, Feiyang Xu, Yifan Li, Muzhi Li, Shuai Zou, Jiele Wu, Han Shi, Haoli Bai, Ho-fung Leung, Irwin King

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) National University of Singapore, Singapore, Singapore(新加坡国立大学) Huawei Technologies, Hong Kong SAR, China(华为技术有限公司) Independent(独立)

AI总结 针对现有基准侧重检索而忽视规划与推理、且缺乏学术领域覆盖的问题,提出ADRA-Bank模块化基准,包含10个学术领域的200个人工标注实例,并设计ADRA-Eval评估范式,通过端到端和隔离评估两种模式测试规划、检索和推理能力,揭示智能体在跨源检索和跨领域一致性上的不足,并指出提升高层规划能力是释放基础LLM推理潜力的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10414 2026-06-02 cs.AI

Boosting RL-Based Visual Reasoning with Selective Adversarial Entropy Intervention

基于选择性对抗熵干预提升强化学习视觉推理能力

Yang Yu, Zhuangzhuang Chen, Lanqing Li, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出选择性对抗熵干预(SaEI)方法,通过在强化学习采样阶段利用熵引导的对抗攻击扭曲视觉输入,增强策略探索,提升视觉语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17320 2026-06-02 cs.LG

AdaptiveK: Complexity-Driven Sparse Autoencoders for Interpretable Language Model Representations

AdaptiveK:基于复杂度的稀疏自编码器用于可解释的语言模型表示

Yifei Yao, Hanrong Zhang, Mengnan Du

机构 * Zhejiang University(浙江大学) University of Illinois Chicago(伊利诺伊大学香槟分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出 AdaptiveK SAE,根据输入语义复杂度动态调整稀疏度,利用线性探针引导特征分配,在重构保真度、解释方差、余弦相似度和可解释性指标上优于固定稀疏度方法。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24696 2026-06-02 cs.LG cs.AI

T-POP: Test-Time Personalization with Online Preference Feedback

T-POP:基于在线偏好反馈的测试时个性化

Zikun Qu, Min Zhang, Mingze Kong, Xiang Li, Zhiwei Shang, Zhiyong Wang, Yikun Ban, Shuang Qiu, Yao Shu, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学) Shenzhen Loop Area Institute(深圳河套学院) Tianjin University(天津大学) The Chinese University of Hong Kong(香港中文大学) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

AI总结 针对新用户冷启动问题,提出T-POP算法,通过在线成对偏好反馈和决斗式强盗机制,在不更新模型参数的情况下实时学习用户偏好并引导解码过程,实现快速数据高效的个性化。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01653 2026-06-02 cs.CV

MCPDepth: Omnidirectional Depth Estimation via Stereo Matching from Multi-Cylindrical Panoramas

MCPDepth:基于多圆柱全景图的立体匹配全方位深度估计

Feng Qiao, Zhexiao Xiong, Xinge Zhu, Yuexin Ma, Qiumeng He, Nathan Jacobs

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) The Chinese University of Hong Kong(香港中文大学) ShanghaiTech University(上海科技大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出MCPDepth两阶段框架,通过圆柱全景图的立体匹配和融合,利用循环注意力模块处理垂直畸变,在标准网络组件上实现高效的全方位深度估计,在Deep360和3D60数据集上MAE分别降低18.8%和19.9%。

Comments Accepted at the OmniCV Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16635 2026-06-02 cs.CV

Towards Anytime Retrieval: A Benchmark for Anytime Person Re-Identification

面向任意时间检索:任意时间行人重识别基准

Xulin Li, Yan Lu, Bin Liu, Jiaze Li, Qinhong Yang, Tao Gong, Qi Chu, Mang Ye, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) The Chinese University of Hong Kong(香港中文大学) School of Computer Science, Wuhan University, China(武汉大学计算机科学学院)

AI总结 提出任意时间行人重识别(AT-ReID)任务,构建大规模多场景数据集AT-USTC,并设计统一模型Uni-AT实现全天候多场景有效检索。

Comments Accepted by IJCAI 2025 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06520 2026-06-02 cs.CV cs.MM

Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement

Seg-Zero: 通过认知强化学习的推理链引导分割

Yuqi Liu, Bohao Peng, Zhisheng Zhong, Zihao Yue, Fanbin Lu, Bei Yu, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Renmin University of China(中国人民大学)

AI总结 提出Seg-Zero框架,通过解耦的推理模型和分割模型,结合GRPO强化学习与格式-精度奖励机制,实现零样本推理分割,在ReasonSeg基准上超越LISA-7B 18%。

详情

展开后加载摘要…

URL PDF HTML 收藏