arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-06-26 至 2026-06-26 共收录 8
2606.26794 2026-06-26 cs.CV cs.AI 新提交

ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

ReasonCLIP-58M: CLIP的视觉基础常识推理监督

Sicheng Zhang, Muzammal Naseer, Binzhu Xie, Naufal Suryanto, Shi Qiu, Jamal Bentahar, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(卡利法大学) University of Western Australia(西澳大学) The Chinese University of Hong Kong(香港中文大学) University of Melbourne(墨尔本大学) University of Central Florida(佛罗里达中央大学)

AI总结 提出ReasonCLIP-58M框架,通过两阶段策略将大规模推理监督集成到CLIP模型中,构建ReasonLite-42M和ReasonPro-16M数据集及RCLIP-Bench基准,提升视觉基础常识推理和零样本检索性能。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26790 2026-06-26 cs.CL 新提交

OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning

OPID: 面向智能体强化学习的在策略技能蒸馏

Shuo Yang, Jinyang Wu, Zhengxi Lu, Yuhao Shen, Fan Zhang, Lang Feng, Shuai Zhang, Haoran Luo, Zheng Lian, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

AI总结 提出OPID框架,通过从在策略轨迹中提取层级技能(回合级和步骤级)提供密集标记级监督,结合结果优势进行策略优化,提升智能体性能、样本效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26694 2026-06-26 cs.CV 新提交

PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models

PhysEditWorld: 一个面向物理可编辑世界模型的大规模数据集

Bin Hu, Yanwen Ma, Jiehui Huang, Ziliang Zhang, Haoning Wu, Ruicheng Zhang, Yaokun Li, Zijun Wang, Yuechen Zhang, Chun-Mei Tseng, Hanhui Li, Shengju Qian, Jun Zhou, Kaipeng Zhang, Xiaodan Liang, Jiaya Jia, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beihang University(北京航空航天大学) The Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Tencent(腾讯)

AI总结 提出PhysEditWorld数据集,通过UE5重放渲染管线生成多重力配置下的动作条件视频,支持可控物理编辑,用于改进世界模型的动力学建模和一致性。

Comments Project page: https://yizhiqianbi.github.io/physeditworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26631 2026-06-26 cs.CV 新提交

Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning

位置重绑定缓存复用:交错多模态推理中无重放的视觉重访

Mengzhao Wang, Yanli Ji, Wangmeng Zuo, Peng Ye, Chongjun Tu

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Harbin Institute of Technology (HIT)(哈尔滨工业大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出位置重绑定缓存复用(PRCR)框架,通过重绑历史视觉KV缓存的位置坐标,实现无重放的高效视觉重访,在多个多模态推理基准上平均准确率提升5%,计算量减少数万倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26205 2026-06-26 cs.AI 新提交

Knowledge-augmented Agentic AI for Mental Health Medication Information Seeking

面向心理健康药物信息检索的知识增强型智能体AI

Huizi Yu, Jian Liu, Wenkong Wang, Lingyao Li, Jiayan Zhou, Zhaoqian Xue, Xiang Li, Xinxin Lin, Zhiying Liang, Zhuoru Wu, Siyuan Ma, Xin Ma, Lizhou Fan

机构 * Department of Medicine and Therapeutics, The Chinese University of Hong Kong(香港中文大学内科及药物治疗学系) Department of Psychiatry, The Chinese University of Hong Kong(香港中文大学精神科学系) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) College of Information Science, University of Arizona(亚利桑那大学信息科学学院) Department of Medicine, Stanford University School of Medicine, Stanford University(斯坦福大学医学院医学系) Perelman School of Medicine, The University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院) Department of Biostatistics, Vanderbilt University(范德堡大学生物统计学系) Li Ka Shing Institute of Health Sciences, Faculty of Medicine, The Chinese University of Hong Kong(香港中文大学医学院李嘉诚健康科学研究所)

AI总结 提出一种基于知识图谱的多智能体框架,整合Reddit、WebMD和FDA不良事件报告,通过来源感知集成实现可审计的精神科药物信息检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14397 2026-06-26 cs.LG 新提交

Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments

Running the Gauntlet: 重新评估智能体在陌生环境中的能力

Mykola Vysotskyi, Runqi Lin, Grzegorz Biziel, Michal Zakrzewski, Sebastian Montagna, Damian Rynczak, Shreyansh Padarha, Kumail Alhamoud, Zihao Fu, William Lugoloobi, Kai Rawal, Hanna Yershova, Xander Davies, Taras Rumezhak, Guohao Li, Fazl Barez, Baoyuan Wu, Arkadiusz Drohomirecki, Yarin Gal, Chris Russell, Christopher Summerfield, Adam Mahdi, Volodymyr Karpiv, Philip Torr, Adel Bibi

机构 * University of Oxford(牛津大学) SoftServe Massachusetts Institute of Technology(麻省理工学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) UK AI Security Institute(英国人工智能安全研究所) Ukrainian Catholic University(乌克兰天主教大学)

AI总结 提出GauntletBench基准,通过20个视觉密集型任务评估智能体在时间感知、图形理解和3D推理等未被充分探索的能力,发现最先进智能体成功率仅19.1%,远低于人类80%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11625 2026-06-26 cs.CV cs.AI 版本更新

MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models

MedPruner: 面向高效3D医学图像理解的免训练层次化令牌剪枝框架

Shengyuan Liu, Zanting Ye, Yunrui Lin, Chen Hu, Wanting Geng, Xu Han, Bulat Ibragimov, Yefeng Zheng, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) Southern Medical University(南方医科大学) Jiangnan University(江南大学) Dalian University of Technology(大连理工大学) Shanghai Jiao Tong University(上海交通大学) University of Copenhagen(哥本哈根大学)

AI总结 提出MedPruner,一种免训练、模型无关的层次化令牌剪枝框架,通过帧间锚点过滤和动态信息核选择,在保留不到5%视觉令牌时保持甚至提升模型性能,显著降低计算开销。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13432 2026-06-26 cs.CV 版本更新

Circular Quasiconformal Deturbulence: Geometry-Based Restoration from Multiple Turbulent Frames

圆形拟共形去湍流:基于几何的多湍流帧图像恢复

Chu Chen, Han Zhang, Lok Ming Lui

机构 * Department of Mathematics, City University of Hong Kong(香港城市大学数学系) Hong Kong Centre for Cerebro-Cardiovascular Health Engineering(香港脑心血管健康工程中心) Department of Mathematics, Chinese University of Hong Kong(香港中文大学数学系)

AI总结 提出圆形拟共形去湍流(CQCD)框架,利用圆形架构联合估计前向与后向变换,结合拟共形几何保证双射变形,实现无监督多帧湍流图像恢复,在合成和真实数据集上优于现有方法。

Journal ref Neurocomputing (2026): 134277

详情

展开后加载摘要…

URL PDF HTML 收藏