arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-06-30 至 2026-06-30 共收录 19
2606.30626 2026-06-30 cs.AI

DOPD: Dual On-policy Distillation

DOPD:双重在线策略蒸馏

Xinlei Yu, Gen Li, Qingyi Si, Guibin Zhang, Yuqi Xu, Congcong Wang, Shuai Dong, Kaiwen Tuo, Xiangyu Zeng, Kaituo Feng, Qunzhong Wang, Yang Shi, Xiaobin Hu, Xiangyu Yue, Jiaqi Wang, Shuicheng Yan

机构 * NUS(新加坡国立大学) MMLab, CUHK(香港中文大学多媒体实验室) PKU(北京大学) Explore Academy, JD(京东探索研究院)

AI总结 提出DOPD方法,通过优势感知的双重蒸馏范式动态分配令牌级监督,缓解特权幻觉,在LLM和VLM上优于传统在线策略蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30562 2026-06-30 cs.CL

Morphing into Hybrid Attention Models

变形为混合注意力模型

Disen Lan, Jianbin Zheng, Yuxi Ren, Xin Xia, Xuanda Wang, Xuefeng Xiao, Xipeng Qiu, Yu Cheng

机构 * Fudan University(复旦大学) ByteDance Seed(字节跳动种子) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出FlashMorph方法,将层选择建模为预算约束子集优化问题,通过可变形模型和门控学习高效选择全注意力层,实现Transformer到混合注意力的转换,在保持性能的同时降低选择成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30395 2026-06-30 cs.CY cs.CL cs.SI

Uncovering Salience-Driven Dynamics in Consumer Confidence with Generative Social Simulation

揭示消费者信心中的显著性驱动动态:基于生成式社会模拟

Yixu Huang, Yunlu Yin, Jiayu Lin, Xinnong Zhang, Jia Wang, Siyuan Wang, Xuanjing Huang, Liyin Jin, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出ConsumerSim框架,通过微观数据校准的合成人口、宏观经济信号和调查响应生成,重建消费者信心指数,在美欧日数据上优于基线模型,并揭示信心变化集中于显著性事件,且不同群体敏感性各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30332 2026-06-30 cs.CV

UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception

UniGP:驯服扩散Transformer以实现先验保留的统一生成与感知

Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zeekr Automobile R&D Co., Ltd.(小鹏汽车研发有限公司)

AI总结 提出UniGP框架,基于MMDiT通过简单联合训练统一可控生成与密集预测,无需复杂任务设计,保留骨干先验,在多个任务上超越先前统一方法并与专用方法持平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30015 2026-06-30 cs.CL

Parametric Skills

参数化技能

Xuan Zhao, Haonan He, Qingyu Yang, Minglei Li, Jingqi Ye, Zelin Tan, Bo Wan, Peng Ye

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) KTH Royal Institute of Technology(皇家理工学院) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出ParametricSkills框架,将文本技能在测试时转换为LoRA参数,解决长上下文下技能指令难以遵循的问题,在软件工程任务中平均提升6.44分。

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29766 2026-06-30 cs.RO cs.CG cs.GR

Trajectory Optimization for Collision-Aware Redundant Robotic Multi-Axis Additive Manufacturing by Constrained Gradient Projection

基于约束梯度投影的碰撞感知冗余机器人多轴增材制造轨迹优化

Zhikai Shen, Jiasheng Qu, Chenyu Xu, Zhuo Huang, Chengkai Dai, Yongzhe Li, Guoxin Fang

机构 * Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) Centre for Perceptual and Interactive Intelligence (CPII)(感知与交互智能中心) Department of Robotics at the School of Mechanical Engineering, Southeast University(东南大学机械工程学院机器人系)

AI总结 提出一种约束梯度投影框架,用于冗余机器人多轴增材制造的碰撞感知轨迹优化,通过相对雅可比和可微SDF碰撞模型实现硬约束,在8-DOF平台上平均位置误差<10μm,关节加加速度降低77.6%,速度提升10.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29577 2026-06-30 cs.CV cs.AI

ReMAP-PET: Beyond Visual Understanding -- Learning Region-Guided Metabolic Alignment Semantics from Brain PET

ReMAP-PET:超越视觉理解——从脑PET学习区域引导的代谢对齐语义

Dasen Dai, Yanteng Zhang, Shuoqi Li, Yuxiang Wei, Hongjie Yu, Qingxin Zhang, Qizhen Lan, Jagath C. Rajapakse, Vince D. Calhoun

机构 * The Chinese University of Hong Kong, HKSAR(香港中文大学) TReNDS Center (Georgia State, Georgia Tech, Emory)(TReNDS中心(佐治亚州立大学、佐治亚理工学院、埃默里大学)) ShanghaiTech University, Shanghai, P.R.China(上海科技大学) University of California, Berkeley, USA(加州大学伯克利分校) University of Texas Health Science Center at Houston, USA(德克萨斯大学健康科学中心(休斯顿)) Nanyang Technological University, Singapore(南洋理工大学)

AI总结 提出ReMAP-PET框架,通过联合回归和对比学习监督3D ResNet-50学习脑PET的区域代谢语义,在SUVR预测和检索上显著优于基线,并实现与临床语言的对齐及报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28978 2026-06-30 cs.CL cs.CY

Can LLMs Hire Fairly? Racial Bias in Resume Screening

LLM能公平招聘吗?简历筛选中的种族偏见

Zhenyu Gao, Wenxi Jiang, Yutong Yan

机构 * Department of Finance, CUHK Business School(财务系,CUHK商学院)

AI总结 使用配对简历方法审计14个主流大语言模型,发现2023年模型重现白人回调差距,而2024年后模型显示无差距或反向偏差,表明算法招聘偏见方向随模型代际反转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28434 2026-06-30 cs.SE cs.AI

SWE-MeM: Learning Adaptive Memory Management for Long-Horizon Coding Agents

SWE-MeM:面向长周期编码代理的自适应内存管理学习

Shuzheng Gao, Wenhao Zeng, Zhaojian Yu, Jianqiao Wangni, Chaozheng Wang, Kai Cai, Shilin He, Michael R. Lyu

机构 * The Chinese University of Hong Kong, China(香港中文大学) Shanghai Jiao Tong University, China(上海交通大学) Tsinghua University, China(清华大学) ByteDance, China(字节跳动)

AI总结 提出SWE-MeM训练框架,通过灵活的内存工具和Memory-aware GRPO优化,让代理在有限上下文预算下自主决定压缩时机、内容和方式,在SWE-Bench Verified上以4B和30B模型分别达到43.4%和60.2%的解决率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28349 2026-06-30 cs.IR cs.AI

HMARS: A Hierarchical Multi-Agent Memory System for Long-Context Reasoning

HMARS:用于长上下文推理的分层多智能体记忆系统

Zeju Li, Ziyang Zheng, Yizhou Zhou, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 提出HMARS分层多智能体记忆系统,通过子智能体、中层智能体和前沿模型的分层结构管理长上下文,在长文档和多轮记忆任务中优于检索、重排序、全上下文、基于图和智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02482 2026-06-30 cs.CV

X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding

X-Stream: 探索多模态大语言模型作为多流理解的多路复用器

Peiwen Sun, Xudong Lu, Huadai Liu, Yang Bo, Dongming Wu, Huankang Guan, Minghong Cai, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Rui Liu, Xiangyu Yue

机构 * MMLab, Chinese University of Hong Kong(中大香港人工智能实验室) Huawei Inc.(华为公司)

AI总结 为解决多流视频理解评估缺失的问题,提出首个基准X-Stream,包含4220个QA对和932个视频,覆盖多窗口、多视角和多设备场景,并基于信号多路复用理论评估MLLM作为多路复用器的性能,发现现有模型在并发流上仅达约50%分数。

Comments Project Page: https://peiwensun2000.github.io/xstream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20211 2026-06-30 cs.SD eess.AS eess.SP

Aliasing-Free Neural Audio Synthesis

无混叠神经音频合成

Yicheng Gu, Junan Zhang, Chaoren Wang, Jerry Li, Zhizheng Wu, Lauri Juvela

机构 * Aalto University School of Science(阿alto大学科学学院) Aalto University(阿alto大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Spellbrush, Akihabara, Tokyo(东京秋叶原Spellbrush)

AI总结 本文提出Pupu-Vocoder和Pupu-Codec,通过可微抗混叠技术提升音乐和歌声合成质量,实验显示其在歌声、音乐和音频上表现更优。

Comments Accepted by TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28049 2026-06-30 cs.CV

Drift-AR: Single-Step Visual Autoregressive Generation via Anti-Symmetric Drifting

Drift-AR:通过反向对称漂移实现单步视觉自回归生成

Zhen Zou, Xiaoxiao Ma, Mingde Yao, Jie Huang, LinJiang Huang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong, MMLAB(香港中文大学多媒体实验室) JD Explore Academy(京东探索研究院) Beihang University(北京航空航天大学)

AI总结 Drift-AR通过利用熵信号加速自回归和视觉解码阶段,实现单步生成,提升了生成速度并保持了高质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02176 2026-06-30 cs.CL

Adam's Law: Textual Frequency Law on Large Language Models

Adam的定律:大型语言模型中的文本频率定律

Hongyuan Adam Lu, Z. L., Victor Wei, Zefan Zhang, Zhao Hong, Qiqi Xiang, Bowen Cao, Wai Lam

机构 * FaceMind Corporation(FaceMind公司) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出文本频率定律,通过优化文本频率提升LLM的提示和微调效果,并通过文本频率蒸馏和课程训练方法验证了其有效性。

Comments ACL 2026 Main Conference; The latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08811 2026-06-30 cs.CV cs.RO

TUGS: Physics-based Compact Representation of Underwater Scenes by Tensorized Gaussian

TUGS: 基于物理的紧凑表示法用于水下场景的张量高斯表示

Shijie Lian, Ziyi Zhang, Hua Li, Laurence Tianruo Yang, Mengyu Ren, Debin Liu, Wenhui Wu

机构 * Huazhong University of Science and Technology(华中科技大学) Zhongguancun Academy(中关村学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhengzhou University(郑州大学) Hainan University(海南大学) Shenzhen University(深圳大学)

AI总结 本文提出TUGS,一种基于物理模型的紧凑水下3D表示法,通过物理建模复杂水下光场,实现高效高质量的水下图像渲染,实验表明其在有限参数下能取得优越的重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22876 2026-06-30 cs.RO cs.AI

Grounding Sim-to-Real Generalization in Robotic Manipulation: An Empirical Study with Vision-Language-Action Models

在机器人操作中建立仿真到现实泛化:基于视觉-语言-动作模型的实证研究

Ruixing Jin, Zicheng Zhu, Ruixiang Ouyang, Sheng Xu, Bo Yue, Zhizheng Wu, Guiliang Liu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文通过四个维度探讨仿真到现实泛化的决定因素,提出评估协议并释放资源以建立标准化基准,提升机器人操作策略的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10310 2026-06-30 cs.CV

Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation

Efficient-VLN: 一种高效且强大的视觉语言导航基线

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI

AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12159 2026-06-30 cs.SE cs.AI

EfficientUICoder: A Bidirectional Token Compression Framework for Efficient MLLM-Based UI Code Generation

EfficientUICoder: 一种用于高效基于多模态大语言模型的UI代码生成的双向标记压缩框架

Jingyu Xiao, Zhongyi Zhang, Yuxuan Wan, Yintong Huo, Yang Liu, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Huazhong University of Science and Technology(华中科技大学) Singapore Management University(新加坡管理大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出EfficientUICoder,通过元素和布局感知标记压缩、区域感知标记精炼和自适应重复标记抑制,有效压缩UI代码生成的标记数量,提升生成效率和代码质量。

Comments Published in the Proceedings of the 2026 ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-06-30 cs.AI

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo

详情

展开后加载摘要…

URL PDF HTML 收藏