arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 2392
2605.28131 2026-05-28 cs.CL

Better heads do not guarantee better binarized constituency parsing

更好的头部并不能保证更好的二值化成分句法分析

Zeyao Qi, Yige Chen, Eitan Klinger, Vivaan Wadhwa, Jungyeul Park

机构 * The Chinese University of Hong Kong, Ma Liu Shui, Hong Kong(香港中文大学,大屿山分校) The University of British Columbia, Vancouver, Canada(不列颠哥伦比亚大学,温哥华,加拿大) Korea Advanced Institute of Science & Technology, Daejeon, South Korea(韩国科学技术院,大田,韩国)

AI总结 本文研究了标点感知的树二值化方法,并探讨了依赖诱导的头部信息是否改善了二值化句法分析器的监督信号,发现尽管学习到的头部在内在头部预测上优于基于规则的头部,但在去二值化后并未带来一致的句法分析提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28101 2026-05-28 cs.SD cs.AI cs.MM

EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction

EigeNet:几何信息引导的多模态学习用于少样本新视角RIR预测

Chong Jing, Zitong Lan, Junan Zhang, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出EIGENET框架,通过跨视角交替注意力Transformer和几何信息调制块,结合多任务学习,实现少样本新视角房间脉冲响应预测,达到最先进性能。

Comments Code available on https://github.com/FEAfeatherTHER/EigeNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28053 2026-05-28 cs.LG

RW-TTT: Batched Serving for Request-Owned Test-Time Training State

RW-TTT:面向请求自有测试时训练状态的批量服务

Jian Yang, Zhizhuo Kou, Yao Tian, Hao Zhang, Han Chen, Sirui Han, Yike Guo

机构 * HKUST(香港科技大学) CUHK(香港大学) NUS(新加坡国立大学)

AI总结 提出RW-TTT框架,通过标记解码步骤的所有者、版本和读写效果,实现请求自有测试时训练状态下的高效批量LLM服务,在单GPU上达到274.61 tok/s聚合吞吐,较顺序服务提升9.31倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28051 2026-05-28 cs.CV

Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models

超越代理梯度:面向视觉-语言模型的完全可微分令牌剪枝

Landi He, Mingde Yao, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院) CUHK MMLab(香港中文大学MMLab) CPII under InnoHK(创新工场CPII)

AI总结 提出DiffPrune方法,通过将剪枝重新表述为令牌信息的连续控制而非离散选择学习,利用信息节流阀调节令牌,实现完全可微分的令牌重要性学习,在保持96.5%全模型精度的同时将LLM预填充加速2.85倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28030 2026-05-28 cs.LG cs.AI cs.CR

SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection

SPARD: 通过安全投影与相关性-多样性数据选择防御有害微调攻击

Shuhao Chen, Weisen Jiang, Yeqi Gong, Shengda Luo, Chengxiang Zhuo, Zang Li, James T. Kwok, Yu Zhang

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Platform and Content Group, Tencent(腾讯平台与内容组) Chinese Medicine Guangdong Laboratory(广东中医实验室)

AI总结 提出SPARD框架,结合安全投影交替优化和相关性-多样性数据选择,防御有害微调攻击,在保持任务精度的同时显著降低攻击成功率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28020 2026-05-28 cs.CL

The Missing Piece in Pre-trained Model Evaluation: Reward-Guided Decoding Unlocks Task-Oriented Behavior Without Parameter Updates

预训练模型评估中缺失的一环:奖励引导解码无需参数更新即可解锁任务导向行为

Shaobo Wang, Guo Chen, Ziyue Wang, Zhengyang Tang, Qingyang Liu, Xingzhang Ren, Dayiheng Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Qwen Team, Alibaba Group(阿里云Qwen团队) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出一种无需训练的奖励引导解码框架EBD,通过外部轻量奖励模型调整输出分布,激活冻结预训练模型的任务导向行为,实现更公平的推理时评估。

Comments 26 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27989 2026-05-28 cs.LG

Law of Neural Interaction: Depth-Width Shape, Interaction Efficiency, and Generalization

神经交互定律:深度-宽度形状、交互效率与泛化

Wenjie Sun, Jinning Yang, Shuai Zhang, Mengnan Du

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院) New Jersey Institute of Technology(新泽西理工学院)

AI总结 通过将叠加原理从参数空间扩展到梯度空间定义为神经交互,发现固定预算下良好泛化伴随高效神经交互,且可通过调整深度-宽度比(R_D/W)使模型处于高效交互区间,该区间随预算扩展保持稳定,为模型形状初始化和泛化机制提供见解。

Comments 30 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27736 2026-05-28 cs.LG cs.CV

Explicit Critic Guidance for Aligning Diffusion Models

显式评论家引导的对齐扩散模型

Zhengyang Liang, Qihang Zhang, Ceyuan Yang

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出一种状态对齐的潜在演员-评论家框架,通过将扩散模型自身作为时间步条件价值函数,实现轨迹级PPO训练和推理时引导,在单/多奖励基准上优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27258 2026-05-28 cs.SD cs.AI

PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis

PilotTTS:一种有纪律的模块化配方用于竞争性语音合成

Bowen Li, Shaotong Guo, Zhen Wang, Yang Xiang, Mingli Jin, Yihang Lin, Jiahui Zhao, Weibo Xiong, Dongrui Zhang, Keming Chen, Yunze Gao, Zeyang Lin, Yuze Zhou, Yue Liu

机构 * Amap, Alibaba Group(阿里巴巴集团爱马仕部门) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出PilotTTS轻量级自回归TTS系统,通过极简架构和严格数据工程(仅用20万小时开源处理数据)实现竞争性能,支持零样本语音克隆、情感/副语言/方言合成,在Seed-TTS Eval基准上取得最低WER和最高说话人相似度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26114 2026-05-28 cs.AI cs.CL

MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent Research

MobileGym: 一个可验证且高度并行的移动GUI智能体研究仿真平台

Dingbang Wu, Rui Hao, Haiyang Wang, Shuzhe Wu, Han Xiao, Zhenghong Li, Bojiang Zhou, Zheng Ju, Zichen Liu, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出MobileGym,一个基于浏览器的轻量级、完全可控的移动环境,通过结构化JSON状态实现可验证结果信号和低成本并行强化学习,并附带包含416个参数化任务模板的基准测试集。

Comments Project page: https://mobilegym.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07999 2026-05-28 cs.IT cs.LG math.IT

Tighter Information-Theoretic Generalization Bounds via a Novel Class of Change of Measure Inequalities

通过一类新的测度变换不等式实现更紧的信息论泛化界

Yanxiao Liu, Yijun Fan, Deniz Gündüz

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院伦敦分校电子与电气工程系) Department of Information Engineering, The Chinese University of Hong Kong(香港中文大学信息工程系)

AI总结 本文提出基于数据处理不等式的一类新测度变换不等式,涵盖f-散度、Rényi散度和α-互信息,并应用于泛化误差、PAC-Bayes、差分隐私和数据记忆化,得到更紧的保证。

Comments Fixed a mistake in the proof of PAC-Bayesian bound

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01745 2026-05-28 cs.LG cs.AI

Probability-Entropy Calibration: An Elastic Indicator for Adaptive Fine-tuning

概率-熵校准:一种用于自适应微调的弹性指标

Wenhao Yu, Shaohang Wei, Jiahong Liu, Yifan Li, Minda Hu, Aiwei Liu, Hao Zhang, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tsinghua University(清华大学) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 提出概率-熵校准信号(相对排名指标)进行token级重加权,以平衡预训练先验与下游对齐,在数学推理、分布外推理和代码生成任务上优于仅基于概率或熵的方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22519 2026-05-28 stat.ML cs.LG

Corrected Samplers for Discrete Flow Models

离散流模型的校正采样器

Zhengyan Wan, Yidong Ouyang, Liyan Xie, Hongyuan Zha, Fang Fang, Guang Cheng

机构 * School of Statistics, East China Normal University(东华大学统计学院) Department of Statistics and Data Science, University of California, Los Angeles(加州大学洛杉矶分校统计与数据科学系) Department of Industrial and Systems Engineering, University of Minnesota(明尼苏达大学工业与系统工程系) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

AI总结 针对离散流模型中现有采样器(如tau-leaping和Euler求解器)离散化误差大、需大量迭代的问题,提出时间校正和位置校正两种采样器,在不增加计算成本下降低误差,并证明位置校正采样器复杂度更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23959 2026-05-28 cs.CL cs.AI cs.LG

HGMEM: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling

HGMem:基于超图的工作记忆以改进长上下文复杂关系建模的多步RAG

Chulun Zhou, Chunkang Zhang, Guoxin Yu, Fandong Meng, Jie Zhou, Wai Lam, Mo Yu

机构 * The Chinese University of Hong Kong.(香港中文大学) Pengcheng Laboratory.(鹏城实验室) WeChat AI, Tencent(微信AI,腾讯) University of Chinese Academy of Sciences.(中国科学院大学)

AI总结 提出HGMem超图工作记忆系统,通过超边表示记忆单元并渐进形成高阶交互,增强多步RAG中的全局理解和复杂推理能力。

Comments ICML 2026; Code released at https://github.com/Encyclomen/HGMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08555 2026-05-28 cs.CV

VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning

VideoCanvas: 通过上下文条件化从任意时空补丁进行统一视频补全

Minghong Cai, Qiulin Wang, Zongli Ye, Wenze Liu, Quande Liu, Weicai Ye, Xintao Wang, Pengfei Wan, Kun Gai, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手技术有限公司Kling团队)

AI总结 提出VideoCanvas框架,通过混合条件化策略(空间上使用零填充全帧画布编码,时间上使用Temporal RoPE插值)实现任意时空视频补全的统一任务,无需修改或重新训练VAE。

Comments Project page: https://onevfall.github.io/project_page/videocanvas

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27336 2026-05-27 cs.CV

PARE: Pruning and Adaptive Routing for Efficient Video Generation

PARE:面向高效视频生成的剪枝与自适应路由

Yutong Wang, Yunke Wang, Tianfan Xue, Yu Qiao, Yaohui Wang, Xinyuan Chen, Chang Xu

机构 * The University of Sydney(悉尼大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出PARE方法,通过结构感知剪枝压缩宽度和输入自适应路由压缩深度,联合减少视频扩散Transformer的计算量,在Wan2.1-14B上实现每步计算大幅降低且质量保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27168 2026-05-27 cs.CL cs.AI cs.CY

Grounding Text Embeddings in Stakeholder Associations

将文本嵌入与利益相关者关联对齐

Jonathan Rystrøm, Sofie Burgos-Thorsen, Zihao Fu, Johan Irving Søltoft, Kenneth C. Enevoldsen, Chris Russell

机构 * University of Oxford(牛津大学) Institute for Wicked Problems(复杂问题研究所) The Chinese University of Hong Kong(香港中文大学) Danish Technical University(丹麦技术大学) Aarhus University(奥胡斯大学)

AI总结 提出利益相关者对齐练习方法,通过评估嵌入模型与人类专家的语义距离一致性,发现神经文本嵌入在丹麦政策案例中可靠性显著低于专家(差距19-26个百分点),且该差距在美国联邦AI用例中复现(16个百分点)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26952 2026-05-27 cs.CL

Efficient Agentic Reinforcement Learning with On-Policy Intrinsic Knowledge Boundary Enhancement

基于策略内在知识边界增强的高效智能体强化学习

Dingwei Chen, Zefang Zong, Zhipeng Ma, Leo Luo, Yang Li, Chengming Li, Peng Chen, Jie Jiang

机构 * Tencent Inc(腾讯公司) The Chinese University of Hong Kong(香港中文大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

AI总结 提出AKBE方法,通过双路径(有工具和无工具)在线策略训练动态探测模型内在知识边界,构建针对性监督信号,在保持准确率的同时减少工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24636 2026-05-27 cs.AI cs.CL

GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration

GlobalDentBench:一个用于评估牙科领域大语言模型临床推理能力并包含专家校准的多国基准

Junjie Zhao, Jingyi Liang, Zhenyang Cai, Jiaming Zhang, Zhenwei Wen, Shuzhi Deng, Wenjing Yi, Chunfeng Luo, Hexian Zhang, Junying Chen, Tianrui Liu, Zhuhui Bai, Zixu Zhang, Pradeep Singh, Xiang Liu, Jianquan Li, Nhan L Tran, Falk Schwendicke, Zuolin Jin, Lijian Jin, Liangyi Chen, Wei-fa Yang, Benyou Wang, Junwen Wang, Shan Jiang

机构 * Division of Applied Oral Sciences and Community Dental Care, Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院应用口腔科学与社区牙科护理系) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) Department of Periodontology, Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)牙周科) Beijing Institute of Collaborative Innovation(北京协同创新研究院) Department of Orthodontics, Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)正畸科) Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)) College of Future Technology, Peking University(北京大学未来技术学院) Freedom AI New Cornerstone Science Laboratory, National Biomedical Imaging Center, State Key Laboratory of Membrane Biology, Institute of Molecular Medicine, Peking-Tsinghua Center for Life Sciences, College of Future Technology, Peking University, Beijing 100871, China(新基石科学实验室、国家生物医学成像中心、膜生物学国家重点实验室、分子医学研究院、北京大学未来技术学院、生命科学中心,北京大学,北京100871,中国) IDG/McGovern Institute for Brain Research, Peking University, Beijing 100871, China(IDG/ McGovern脑科学研究院,北京大学,北京100871,中国) Division of Oral and Maxillofacial Surgery, Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院口腔颌面外科系) Shenzhen Loop Area Institute(深圳河套学院) Department of Cancer Biology, Mayo Clinic Arizona, 5777 E. Mayo Blvd., IERB-3-504A, Phoenix, Arizona, 85054, USA(梅奥诊所亚利桑那分部癌症生物学部门,5777 E. Mayo Blvd., IERB-3-504A, Phoenix, Arizona, 85054, USA) Department of Conservative Dentistry, Periodontology and Digital Dentistry, LMU University Hospital, LMU Munich, Munich, Germany(慕尼黑大学医院保守牙科、牙周病学和数字牙科部门,慕尼黑,德国,慕尼黑大学) Division of Periodontology & Implant Dentistry, Faculty of Dentistry, The University of Hong Kong, Hong Kong, SAR, China(香港大学牙科学院牙周病学与种植牙科系,香港,中国)

AI总结 提出首个跨国牙科基准GlobalDentBench,包含14个专科、88个国家的8978道专家验证题目,评估三种推理层次,揭示当前大语言模型在牙科临床推理中性能随复杂度下降且存在高风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24041 2026-05-27 cs.LG cs.AI

Iterative Refinement Neural Operators are Learned Fixed-Point Solvers: A Principled Approach to Spectral Bias Mitigation

迭代精化神经算子:一种学习型不动点求解器——频谱偏差缓解的原则性方法

Xiaotian Liu, Shuyuan Shang, Xiaopeng Wang, Pu Ren, Yaoqing Yang

机构 * Dartmouth College(达特茅斯学院) CUHK Shenzhen(香港大学深圳分校) Lawrence Berkeley National Lab(伯克利国家实验室)

AI总结 提出迭代精化神经算子(IRNO),通过固定点迭代应用学习精化模块,结合渐进频谱损失,有效缓解神经算子的频谱偏差,在湍流和活性物质等物理系统中显著降低高频误差。

Comments 47 pages; accepted to ICML 2026 as a Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26654 2026-05-27 cs.LG cs.AI math.OC stat.ML

Bilevel Optimization over Saddle Points of Zero-Sum Markov Games

零和马尔可夫博弈鞍点上的双层优化

Zihao Zheng, Irwin King, Songtao Lu

机构 * Shun Hing Institute of Advanced Engineering, The Chinese University of Hong Kong(香港中文大学先进工程学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

AI总结 针对下层为零和马尔可夫博弈的双层优化问题,提出基于惩罚的Nikaido-Isoda下降-上升方法(PANDA),避免计算超梯度且无需二阶信息,在无凸性假设下收敛到平稳点,达到与单策略下层MDP双层RL相当的最优速率。

Comments Accepted to the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26630 2026-05-27 cs.CV

Attenuation-Resilient Alternating Optimization for Laparoscopic Liver Landmark Detection

衰减鲁棒的交替优化用于腹腔镜肝脏地标检测

Lanqing Liu, Ruize Cui, Jialun Pei, Diandian Guo, Tiffany Y. So, Pheng-Ann Heng, Jing Qin

机构 * The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

AI总结 提出A2ONet,通过照明场补偿、频率方向选择性滤波和交替分割-曲线优化解码器,解决腹腔镜肝脏地标检测中的光照衰减和结构不匹配问题。

Comments This paper has been accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26567 2026-05-27 cs.AI

MedGuideX: Internalizing Decision Logic from Executable Guidelines into Large Language Models for Clinical Reasoning

MedGuideX: 将可执行指南中的决策逻辑内化到大型语言模型中以进行临床推理

Yuhao Shen, Lang Cao, Simo Du, Yuqing Wang, Juexiao Zhou, Hao Peng, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Albert Einstein College of Medicine(爱因斯坦医学院)

AI总结 提出一种将临床实践指南转化为可执行决策逻辑并生成事实与反事实问答数据的训练流程,通过微调医学大语言模型得到MedGuideX,在四个临床推理基准上平均准确率相对提升10.28%,且医生评估显示其推理步骤更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26554 2026-05-27 cs.LG cs.AI

Linear and Neural Dueling Bandits with Delayed Feedback

线性与神经延迟反馈的对抗性赌博机

Xiangyi Wang, Pingchen Lu, Jie Mao, Mingze Kong, Zhi Hong, Zhiyong Wang, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对随机延迟反馈下的上下文对抗性赌博机问题,提出线性(LDB-DF)和神经(NDB-DF)两种算法,通过将逆概率加权(IPW)机制直接融入损失函数实现无偏校正,并给出线性设置下O(d*sqrt(T))的遗憾界和神经设置下的次线性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26498 2026-05-27 cs.CL

Verilog-Evolve: Feedback-Driven and Skill-Evolving Verilog Generation

Verilog-Evolve:反馈驱动与技能演进的Verilog生成

Zehua Pei, Hui-Ling Zhen, Yu Zhang, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 提出Verilog-Evolve框架,通过反馈驱动(功能仿真、Yosys综合、ABC时序代理等)迭代优化Verilog代码,并利用跨会话技能演进提升生成质量,实验表明在VerilogEval和混合精度GEMM任务上提高了功能成功率和下游友好性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26496 2026-05-27 cs.LG cs.AI

Dense2MoE: Pushing the Pareto Frontier of On-Device LLMs via Unified Pruning and Upcycling

Dense2MoE:通过统一剪枝和升级推动设备端LLM的帕累托前沿

Fengfa Li, Hongjin Ji, Yifeng Ding, Lei Ren, Chen Wei

机构 * Li Auto The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出Dense2MoE框架,通过层融合升级(LF-UC)统一剪枝和升级,将密集LLM高效转换为设备端MoE模型,在推理延迟与准确性之间取得更优帕累托前沿。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26485 2026-05-27 cs.CV cs.CL

OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants

OmniInteract:面向实时全模态助手的流式交互基准测试

Xudong Lu, Xueying Li, Annan Wang, Yang Bo, Jinpeng Chen, Zengliang Li, Nianzu Yang, Rui Liu, Xue Yang, Jingwen Hou, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) SJTU(上海交通大学) NTU(国立新加坡大学) McMaster(麦马斯特大学) CityUHK(香港城市大学) JUFE(吉林大学)

AI总结 提出OmniInteract基准,通过在线推理音视频流评估全模态大模型的实时交互能力,发现现有模型在流式交互中表现薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26441 2026-05-27 cs.CV cs.AI

Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective

从博弈视角重新思考弱监督视频时间定位

Xiang Fang, Zeyu Xiong, Wanlong Fang, Xiaoye Qu, Chen Chen, Jianfeng Dong, Keke Tang, Pan Zhou, Yu Cheng, Daizong Liu

机构 * Hubei Key Laboratory of Distributed System Security(湖北分布式系统安全重点实验室) Hubei Engineering Research Center on Big Data Security(大数据安全工程研究中心) School of Cyber Science and Engineering(网络安全科学与工程学院) Huazhong University of Science and Technology(华中科技大学) University of Central Florida(佛罗里达中央大学) Zhejiang Gongshang University(浙江工商大学) Guangzhou University(广州大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

AI总结 本文从博弈论视角出发,通过多元合作博弈建模帧与词的不确定对应关系,实现多级跨模态交互,从而在弱监督下提升视频时间定位的准确性。

Comments Published in ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19052 2026-05-27 stat.ML cs.LG

Provably Data-driven Lagrangian Relaxation for Mixed Integer Linear Programming

可证明数据驱动的混合整数线性规划拉格朗日松弛

Tung Quoc Le, Anh Tuan Nguyen, Viet Anh Nguyen

机构 * Université Grenoble Alpes, LJK, CNRS, Grenoble INP(格勒诺布尔阿尔卑斯大学,LJK,CNRS,格勒诺布尔INP) Carnegie Mellon University, Machine Learning Department(卡内基梅隆大学,机器学习系) Chinese University of Hong Kong, Department of Systems Engineering and Engineering Management(香港中文大学,系统工程与工程管理系)

AI总结 针对混合整数线性规划的拉格朗日松弛,通过数据驱动算法设计框架,理论分析了学习乘子的泛化界和极小化最优速率,并证明随机梯度上升和热启动方法达到最优。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18359 2026-05-27 cs.CV

RAVE: Re-Allocating Visual Attention in Large Multimodal Models

RAVE: 重新分配大型多模态模型中的视觉注意力

Xi Leng, Xinhong Ma, Ziqiang Dong, Feng Zhang, Xiaoying Tang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴文勤业务部) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing Institute of Technology(北京理工大学)

AI总结 针对大型多模态模型中标准注意力机制存在的跨模态误分配和视觉内不平衡问题,提出轻量级成对门控机制RAVE,通过学习查询-键偏置重新分配视觉注意力,在多个多模态基准上平均提升3个百分点,尤其对感知密集型任务效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏