arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2402
2505.12200 2026-03-27 cs.CV

CompBench: Benchmarking Complex Instruction-guided Image Editing

CompBench:复杂指令引导图像编辑的基准测试

Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Yao Hu, Zihan Wang, Yuan Xie, Shaohui Lin

机构 * East China Normal University(华东师范大学) Xiaohongshu Inc.(小红书) KLATASDS, MOE, China(中国教育部统计与数据科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Fudan University(复旦大学) University of Oxford(牛津大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

AI总结 CompBench旨在解决现有图像编辑基准测试对任务复杂度简化的问题,通过引入复杂指令引导的图像编辑基准,评估模型在精细操控能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24930 2026-03-27 cs.RO

CROSS: A Mixture-of-Experts Reinforcement Learning Framework for Generalizable Large-Scale Traffic Signal Control

CROSS: 一种用于通用大规模交通信号控制的专家混合强化学习框架

Xibei Chen, Yifeng Zhang, Yuxiang Xiao, Mingfeng Fan, Maonan Wang, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出CROSS框架,通过预测对比聚类和场景自适应MoE模块,提升交通信号控制的泛化能力,实验显示其在SUMO模拟器上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13313 2026-03-27 cs.CL

ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization

ReSum:通过上下文摘要解锁长周期搜索智能

Xixi Wu, Kuan Li, Yida Zhao, Liwen Zhang, Litu Ou, Huifeng Yin, Zhongwang Zhang, Xinmiao Yu, Dingchu Zhang, Yong Jiang, Pengjun Xie, Fei Huang, Minhao Cheng, Shuai Wang, Hong Cheng, Jingren Zhou

机构 * The Chinese University of Hong Kong(香港中文大学) Tongyi Lab, Alibaba Group(阿里云实验室) Penn State University(宾夕法尼亚州立大学) The Hong Kong University of Science(香港科学大学)

AI总结 本文提出ReSum方法,通过外部工具定期压缩交互历史以实现无限制探索,结合GRPO算法提升长周期奖励分配,实验证明其在免训练场景下优于ReAct,且用少量样本即可达到领先开源模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15780 2026-03-27 cs.AI cs.CL

TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving

TrustGeoGen: 用于可信多模态几何问题求解的正式验证数据引擎

Daocheng Fu, Jianlong Chen, Renqiu Xia, Zijun Chen, Qi Liu, Yuan Feng, Hongbin Zhou, Renrui Zhang, Shiyang Feng, Peng Gao, Hongyuan Zha, Junchi Yan, Botian Shi, Yu Qiao, Bo Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 本文提出TrustGeoGen,通过正式验证生成多模态几何数据,提升模型深度几何推理能力,在GeoQA等基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24389 2026-03-26 cs.CL cs.AI cs.CY

When AI Meets Early Childhood Education: Large Language Models as Assessment Teammates in Chinese Preschools

当人工智能遇见早期教育:大型语言模型作为中国幼儿园的评估伙伴

Xingming Li, Runke Huang, Yanan Bao, Yuye Jin, Yuru Jiao, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Oxford(牛津大学)

AI总结 本文探讨AI如何通过提取结构化质量指标,提升中国幼儿园教师与儿童互动评估的可扩展性,提出TEPE-TCI-370h数据集和Interaction2Eval框架,实现88%的评估一致性,并验证AI在提升评估效率和促进教育公平中的潜力。

Comments Accepted to AIED 2026, Project page: https://qingyonghu.github.io/Interaction2Eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12764 2026-03-26 cs.LG cs.DM

GraphOmni: A Comprehensive and Extensible Benchmark Framework for Large Language Models on Graph-theoretic Tasks

GraphOmni: 一种全面且可扩展的大型语言模型在图论任务上的基准框架

Hao Xu, Xiangru Jian, Xinjian Zhao, Wei Pang, Chao Zhang, Suyuchen Wang, Qixin Zhang, Zhengyuan Dong, Joao Monteiro, Bang Liu, Qiuzhuang Sun, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Waterloo(滑铁卢大学) Université de Montréal / Mila - Quebec AI Institute(蒙特利尔大学 / 加拿大魁北克人工智能研究所) City University of Hong Kong(香港城市大学) Autodesk(Autodesk公司) Singapore Management University(新加坡国立大学)

AI总结 本文提出GraphOmni基准框架,用于评估大型语言模型在图论任务上的推理能力,通过系统评估发现不同维度对模型性能有显著影响,且先进模型仍有提升空间。

Comments Published at ICLR 2026. Project Page: https://gai-community.github.io/Graph-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24038 2026-03-26 eess.AS cs.SD

ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding

ACAVCaps:实现大规模训练以实现细粒度和多样化的音频理解

Yadong Niu, Tianzi Wang, Heinrich Dinkel, Xingwei Sun, Jiahao Zhou, Gang Li, Jizhong Liu, Junbo Zhang, Jian Luan

机构 * MiLM Plus, Xiaomi Inc, Beijing, China(小米MiLM Plus研究院,北京,中国) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学,香港,中国)

AI总结 本文提出ACAVCaps数据集,通过多专家流程生成细粒度音频描述,提升音频模型在下游任务中的泛化能力。

Comments accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23729 2026-03-26 cs.CV

Bi-CRCL: Bidirectional Conservative-Radical Complementary Learning with Pre-trained Foundation Models for Class-incremental Medical Image Analysis

Bi-CRCL:基于预训练基础模型的双向保守-激进互补学习用于类别增量医疗图像分析

Xinyao Wu, Zhe Xu, Cheng Chen, Jiawei Ma, Yefeng Zheng, Raymond Kai-yu Tong

机构 * Department of Biomedical Engineering, The Chinese University of Hong Kong(生物医学工程系,香港中文大学) Department of Radiation Oncology, Columbia University Irving Medical Center and Data Science Institute, Columbia University(放射肿瘤学系,哥伦比亚大学伊万杰琳医学中心及数据科学研究院,哥伦比亚大学) Department of Electrical and Electronic Engineering and School of Biomedical Engineering, The University of Hong Kong(电气电子工程系和生物医学工程学院,香港大学) Department of Computer Science, City University of Hong Kong(计算机科学系,城市大学) Department of Artificial Intelligence, Westlake University(人工智能系,西湖大学)

AI总结 本文提出Bi-CRCL框架,通过保守和激进学习者结合双向交互机制,解决医疗图像类别增量学习中的异构数据与隐私约束问题,提升模型持续学习能力。

Comments preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23580 2026-03-26 cs.LG

MetaKube: An Experience-Aware LLM Framework for Kubernetes Failure Diagnosis

MetaKube:一种面向Kubernetes故障诊断的经验感知大语言模型框架

Wei Sun, Ting Wang, Xinran Tian, Wanshun Lan, Xuhan Feng, Haoyue Li, Fangxin Wang

机构 * School of Science(科学学院) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Future Network of Intelligence Institute(深圳未来网络智能研究院) China Mobile Communications Group Guangdong Co., Ltd.(中国移动通信集团广东有限公司)

AI总结 MetaKube通过三个创新提出经验感知的大语言模型框架,提升Kubernetes故障诊断效率与准确性,实现从Qwen3-8B到接近GPT-4.1的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23507 2026-03-26 cs.CL cs.AI cs.LG

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

超越掩码:通过删除-插入过程实现高效的、灵活的扩散语言模型

Fangyu Ding, Ding Ding, Sijin Chen, Kaibo Wang, Peng Xu, Zijin Feng, Haoli Bai, Kai Han, Youliang Yan, Binhang Yuan, Jiacheng Sun

机构 * HKUST(香港科技大学) Huawei Foundation Model Dept(华为基础模型部门) CUHK(香港中文大学)

AI总结 本文提出删除-插入扩散语言模型(DID),通过将token删除和插入作为离散扩散过程,提高训练和推理效率,并提供更灵活的生成机制。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23140 2026-03-26 cs.LG

DAK-UCB: Diversity-Aware Prompt Routing for LLMs and Generative Models

DAK-UCB: 为LLMs和生成模型的多样性感知提示路由

Donya Jafari, Farzan Farnia

机构 * Sharif University of Technology(谢赫拉扎德技术大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出DAK-UCB方法,结合保真度与多样性指标,用于在线选择生成模型,以提升生成结果的多样性同时保持保真度。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18370 2026-03-26 cs.CV cs.GR

MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transfer

MimiCAT:基于对应感知级联变换器的无类别3D姿态迁移

Zenghao Chai, Chen Tang, Yongkang Wong, Xulei Yang, Mohan Kankanhalli

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Institute for Infocomm Research, A ∗ STAR(资讯通信研究院(A*STAR))

AI总结 本文提出MimiCAT模型,通过语义关键点标签学习软对应关系,实现无类别3D姿态迁移,提升跨形态姿态转换的鲁棒性和泛化能力。

Comments Accepted to CVPR 2026. Project page: https://mimicat3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23500 2026-03-25 cs.CV

UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation

UniGRPO:用于推理驱动视觉生成的统一策略优化

Jie Liu, Zilyu Ye, Linxiao Yuan, Shenhan Zhu, Yu Gao, Jie Wu, Kunchang Li, Xionghui Wang, Xiaonan Nie, Weilin Huang, Wanli Ouyang

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出UniGRPO框架,通过统一强化学习方法优化文本和图像生成策略,解决多轮交错生成问题,提升生成质量与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23414 2026-03-25 cs.LG cs.AI

SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling

SortedRL: 通过在线长度感知调度加速大语言模型的强化学习训练

Yiqi Zhang, Huiqiang Jiang, Xufang Luo, Zhihe Yang, Chengruidong Zhang, Yifei Shen, Dongsheng Li, Yuqing Yang, Lili Qiu, Yang You

机构 * National University of Singapore(新加坡国立大学) Microsoft Research Asia(微软亚洲研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 SortedRL通过在线长度感知调度策略提升大语言模型强化学习训练效率,减少训练气泡比例并提升性能,实验表明在不同任务中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23390 2026-03-25 cs.CV eess.IV

Harnessing Lightweight Transformer with Contextual Synergic Enhancement for Efficient 3D Medical Image Segmentation

利用轻量级Transformer与上下文协同增强进行高效的3D医学图像分割

Xinyu Liu, Zhen Chen, Wuyang Li, Chenxin Li, Yixuan Yuan

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR(电子工程系,香港中文大学(深圳)Hong Kong SAR) Centre for Artificial Intelligence and Robotics (CAIR), Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong SAR(人工智能与机器人中心(CAIR),香港科学与创新研究院,中国科学院,Hong Kong SAR)

AI总结 本文提出Light-UNETR,通过轻量级维度缩减注意力模块和紧凑门控线性单元提升模型效率,结合上下文协同增强策略提高数据效率,在少量标注数据下实现高效3D医学图像分割。

Comments Accepted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23355 2026-03-25 cs.LG cs.CL

Off-Policy Value-Based Reinforcement Learning for Large Language Models

为大语言模型设计的非策略价值基于强化学习

Peng-Yuan Wang, Ziniu Li, Tian Xu, Bohan Yang, Tian-Shuo Liu, ChenYang Wang, Xiong-Hui Chen, Yi-Chen Li, Tianyun Yang, Congliang Chen, Yang Yu

机构 * National Key Laboratory for Novel Software Technology & School of Artificial Intelligence, Nanjing University(新型软件技术国家重点实验室 & 智能科学与技术学院,南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(大数据研究院(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出ReVal方法,通过结合步级信号和轨迹级信号提升大语言模型的训练效率,实验表明其在数学推理任务中优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17808 2026-03-25 cs.RO cs.AI

EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards

EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作

Ruixiang Wang, Qingming Liu, Yueci Deng, Guiliang Liu, Zhen Liu, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce Technology Co., Ltd.(DexForce技术有限公司)

AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。

Comments Project page: https://eva-project-page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11167 2026-03-25 cs.CV cs.LG

Towards a general-purpose foundation model for fMRI analysis

面向fMRI分析的通用基础模型

Cheng Wang, Yu Jiang, Zhihao Peng, Chenxin Li, Changbae Bang, Lin Zhao, Wanyi Fu, Jinglei Lv, Jorge Sepulcre, Carl Yang, Lifang He, Tianming Liu, Xue-Jun Kong, Quanzheng Li, Daniel S. Barron, Anqi Qiu, Randy Hirschtick, Byung-Hoon Kim, Hongbin Han, Xiang Li, Yixuan Yuan

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) Yonsei University, Seoul, South Korea(延世大学) University of Georgia, Athens, GA(佐治亚大学) Peking University Health Science Center, Beijing, China(北京大学医学部) University of Sydney, Sydney, Australia(悉尼大学) Yale School of Medicine, New Haven, CT(耶鲁医学院) Emory University, Atlanta, GA(埃默里大学) Lehigh University, Bethlehem, PA(莱斯利大学) Boston Children’s Hospital, Boston, MA(波士顿儿童医院) Massachusetts General Hospital, Boston, MA(麻省总医院) Brigham and Women’s Hospital, Boston, MA(布里奇沃特医院) Hong Kong Polytechnic University, Hong Kong(香港理工大学) Kempner Institute for Natural and Artificial Intelligence, Cambridge, MA(Kempner自然与人工智能研究所)

AI总结 本文提出NeuroSTORM模型,通过直接学习4D fMRI数据的通用表示,实现跨任务高效迁移,优于现有方法在五类下游任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22991 2026-03-25 cs.CV

VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models

VLA-IAP: 通过交互对齐实现无训练视觉令牌剪枝用于视觉-语言-动作模型

Jintao Cheng, Haozhe Wang, Weibin Li, Gang Wang, Yipu Zhang, Xiaoyu Tang, Jin Wu, Xieyuanli Chen, Yunhui Liu, Wei Zhang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) South China Normal University(华南师范大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) National University of Defense Technology(国防科技大学)

AI总结 本文提出VLA-IAP方法,通过引入几何先验机制和动态调度策略,实现无训练的视觉令牌剪枝,提升VLA模型在资源受限平台上的推理效率和稳定性,实验显示在LIBERO基准上成功率达97.8%且速度提升1.25倍。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22763 2026-03-25 cs.CV

ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding

ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准

Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 ENC-Bench是首个专注于专业电子航海图理解的基准,包含20490个经过专家验证的样本,评估了10种先进多模态大语言模型在符号识别、空间推理和航海决策中的表现,揭示了模型在符号 grounding、空间计算和多约束推理方面的系统性挑战。

Comments Accepted to CVPR 2026, Project page: https://qingyonghu.github.io/ENC-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20644 2026-03-25 cs.CV

ScaleEdit-12M: Scaling Open-Source Image Editing Data Generation via Multi-Agent Framework

ScaleEdit-12M:通过多智能体框架实现开源图像编辑数据生成的规模化

Guanzhou Chen, Erfei Cui, Changyao Tian, Danni Yang, Ganlin Yang, Yu Qiao, Hongsheng Li, Gen Luo, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多模态实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Xiamen University(厦门大学)

AI总结 本文提出ScaleEditor框架,通过多智能体方法构建大规模高质量图像编辑数据集,生成ScaleEdit-12M,涵盖23类任务,提升多种编辑模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19643 2026-03-25 cs.CV cs.AI

OmniDiT: Extending Diffusion Transformer to Omni-VTON Framework

OmniDiT:将扩散变换器扩展到Omni-VTON框架

Weixuan Zeng, Pengcheng Wei, Huaiqing Wang, Boheng Zhang, Jia Sun, Dewen Fan, Lin HE, Long Chen, Qianqian Gan, Fan Yang, Tingting Gao

机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) Beihang University(北京航空航天大学) KuaiShou(快手)

AI总结 本文提出OmniDiT框架,通过自进化数据采集管道构建大规模VTON数据集,结合多参考条件和Shifted Window Attention提升生成质量,在复杂场景中实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25066 2026-03-25 cs.CV

From Inpainting to Editing: Unlocking Robust Mask-Free Visual Dubbing via Generative Bootstrapping

从修复到编辑:通过生成性自举解锁鲁棒的无掩膜视觉配音

Xu He, Haoxian Zhang, Hejia Chen, Changyuan Zheng, Liyang Chen, Songlin Tang, Jiehui Huang, Xiaoqiang Liu, Pengfei Wan, Zhiyong Wu

机构 * Tsinghua University(清华大学) Hong Kong University of Science(香港科学大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出X-Dub框架,通过生成性自举实现无掩膜视觉配音,解决传统掩膜修复方法在时空上下文破坏和鲁棒性差的问题,提升唇形同步和视觉质量。

Comments Project Page: https://github.com/KlingAIResearch/X-Dub

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20565 2026-03-25 cs.CV

DINO-Tok: Adapting DINO for Visual Tokenizers

DINO-Tok:为视觉分词器适应DINO

Mingkai Jia, Mingxiao Li, Zhijian Shu, Anlin Zheng, Liaoyuan Fan, Jiaxin Guo, Tianxing Shi, Dongyue Lu, Zeming Li, Xiaoyang Guo, Xiaojuan Qi, Xiao-Xiao Long, Qian Zhang, Ping Tan, Wei Yin

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Horizon Robotics(Horizon机器人) Nanjing University(南京大学) Hong Kong University(香港大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出DINO-Tok,一种基于冻结DINO编码器的视觉分词器,结合连续自编码和离散向量量化方法,提升高维潜在空间中的语义一致性和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01415 2026-03-25 cs.RO cs.AI

RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems

RoboMemory:一种脑启发的多记忆代理框架,用于物理具身系统中的交互环境学习

Mingcong Lei, Honghao Cai, Yuyuan Yang, Yimou Wu, Jinke Ren, Zezhou Cui, Liangchen Tan, Junkun Hong, Gehan Hu, Shuangyu Zhu, Shaohan Jiang, Ge Wang, Junyuan Tan, Zhenglin Wan, Zheng Li, Zhen Li, Shuguang Cui, Yiming Zhao, Yatong Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK-Shenzhen(SSE,CUHK-深圳) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Ising AI

AI总结 本文提出RoboMemory框架,通过整合空间、时间、事件和语义记忆,提升机器人在复杂环境中的长期规划与交互学习能力,实验表明其在EmbodiedBench上成功率提升26.5%,超越现有SOTA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01356 2026-03-25 cs.CV

Quasi-Conformal Convolution : A Learnable Convolution for Deep Learning on Simply Connected Open Surfaces

准共形卷积:一种用于深度学习在单连通开放曲面上的可学习卷积

Han Zhang, Tsz Lok Ip, Lok Ming Lui

机构 * Department of Mathematics, City University of Hong Kong(香港城市大学数学系) Department of Mathematics, Chinese University of Hong Kong(香港中文大学数学系)

AI总结 本文提出准共形卷积(QCC),通过准共形理论在单连通开放曲面上定义卷积,结合可训练估计模块实现自适应卷积操作,用于几何数据的分类与医学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22303 2026-03-25 cs.LG cs.AI

Sample Transform Cost-Based Training-Free Hallucination Detector for Large Language Models

基于样本转换成本的无训练hallucination检测器用于大型语言模型

Zeyang Ding, Xinglin Hu, Jicong Fan

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出基于最优传输距离的hallucination检测方法,通过计算token嵌入之间的Wasserstein距离矩阵,得到AvgWD和EigenWD两个指标,用于无训练检测大型语言模型的hallucination问题。

Comments 24 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22248 2026-03-24 cs.LG cs.AI cs.IT math.IT stat.ML

Confidence-Based Decoding is Provably Efficient for Diffusion Language Models

基于置信度的解码在扩散语言模型中具有可证明的效率

Changxiao Cai, Gen Li

机构 * Department of Industrial and Operations Engineering, University of Michigan(工业与运营工程系,密歇根大学) Department of Statistics and Data Science, The Chinese University of Hong Kong(统计与数据科学系,香港中文大学)

AI总结 本文提出了一种基于熵和的解码策略,证明其在KL散度下具有ε精度,并在迭代次数上达到O(H(X0)/ε)的效率,适用于低熵数据分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22125 2026-03-24 cs.CV

DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment

DA-VAE:通过细节对齐实现扩散模型的插件式潜在压缩

Xin Cai, Zhiyuan You, Zhoutong Zhang, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII)

AI总结 本文提出DA-VAE,通过轻量级调整预训练扩散模型,实现潜在空间压缩,使1024×1024图像生成使用32×32 tokens,比原模型减少40%,并支持2048×2048生成,保持图像质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21972 2026-03-24 cs.LG cs.CL

Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe

解析长期任务工具使用强化学习:全面指南

Xixi Wu, Qianguo Sun, Ruiyang Zhang, Chao Song, Junlong Wu, Yiyan Qi, Hong Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) IDEA Research(IDEA研究院) University of Macau(澳门大学)

AI总结 本文通过TravelPlanner测试环境,系统研究了强化学习在复杂多轮任务中的应用,提出7条关键发现,包括奖励设计、模型规模、数据组成等五个维度,最终实现超越领先LLM的性能。

Comments Codes are available at https://github.com/WxxShirley/Agent-STAR

详情

展开后加载摘要…

URL PDF HTML 收藏