POP: Prefill-Only Pruning for Efficient Large Model Inference
POP:仅预填充剪枝用于高效大模型推理
机构 * Wuhan University(武汉大学) ; OPPO Research Institute(OPPO研究院)
AI总结 本文提出POP剪枝方法,通过区分预填充和解码阶段,仅剪枝深度层以提升预填充效率,保留完整模型用于解码,实现1.37倍的预填充延迟提升且性能损失小。
大厂专区
POP:仅预填充剪枝用于高效大模型推理
机构 * Wuhan University(武汉大学) ; OPPO Research Institute(OPPO研究院)
AI总结 本文提出POP剪枝方法,通过区分预填充和解码阶段,仅剪枝深度层以提升预填充效率,保留完整模型用于解码,实现1.37倍的预填充延迟提升且性能损失小。
RSGMamba:面向多模态语义分割的可靠性感知自门控状态空间模型
机构 * Faculty of Engineering and Information Technology, University of Technology Sydney(工程与信息技术学院,悉尼技术大学) ; PCA Lab, Key Laboratory of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, School of Computer Science and Engineering, Nanjing University of Science and Technology(教育部高维信息智能感知与系统重点实验室,南京理工大学计算机科学与工程学院) ; Bionic Vision Systems Laboratory, Shanghai Institute of Microsystem and Information Technology, Chinese Academy of Sciences(中国科学院上海微系统与信息技术研究所生物视觉系统实验室) ; Research Center for Industries of the Future and the School of Engineering, Westlake University(未来产业研究中心和工程学院,西湖大学) ; OPPO Research, Seattle, WA 98101 USA(OPPO研究,美国华盛顿州西雅图98101)
AI总结 本文提出RSGMamba框架,通过可靠性感知自门控机制提升多模态语义分割性能,实验表明其在RGB-D和RGB-T基准上取得最优结果,参数量仅48.6M。
Comments 7tables,9 figures
通过空空间约束将激活转向编译为权重以实现隐蔽后门
机构 * Zhejiang University(浙江大学) ; Palo Alto Networks(帕洛阿尔托网络) ; Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学) ; OPPO Research Institute(OPPO研究院) ; Qilu University of Technology(齐鲁大学)
AI总结 本文通过将后门目标从表面标记转向内部表示,提出一种高效方法,利用空空间约束在触发时激活后门,同时保持隐蔽性和安全性。
Comments ACL 2026 Main Conference
Agent-Dice: 通过几何共识解耦知识更新以实现智能体持续学习
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; OPPO Research Institute(OPPO研究院)
AI总结 本文提出Agent-Dice框架,通过几何共识过滤和曲率重要性加权解耦知识更新,解决智能体持续学习中的稳定性与可塑性矛盾,实验表明其在GUI智能体和工具使用领域表现优异。
我看出你在那儿:大型视觉-语言模型能否理解多模态双关语?
机构 * Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; Palo Alto Networks ; Hangzhou Dianzi University(杭州电子科技大学) ; Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) ; OPPO Research Institute(OPPO研究院) ; Qilu University of Technology(齐鲁工业大学)
AI总结 本文研究了大型视觉-语言模型理解多模态双关语的能力,提出多模态双关语生成流程和MultiPun数据集,通过评估发现模型在区分真实双关语与干扰项上表现不足,并提出提示级和模型级策略提升理解性能。
Comments ACL 2026 Main
VOSR:一种仅基于视觉的生成模型用于图像超分辨率
机构 * The Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院)
AI总结 本文提出VOSR,一种仅基于视觉的生成模型,通过视觉语义指导提取低分辨率输入的语义丰富特征,并采用恢复导向的指导策略,实现高效且高质量的图像超分辨率。
Comments Accepted by CVPR2026
PixelPrune: 通过预测编码实现像素级的视觉令牌减少
机构 * OPPO AI Center(OPPO AI中心)
AI总结 PixelPrune通过预测编码压缩技术,在视觉变换器编码器前消除冗余像素块,提升文档和GUI任务的推理速度和训练效率。
RefReward-SR: 基于低分辨率参考的偏好对齐超分辨率奖励建模
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; OPPO AI Center, OPPO Inc.(OPPO人工智能中心)
AI总结 本文提出RefReward-SR,通过低分辨率参考意识奖励模型实现偏好对齐的超分辨率,利用多模态大语言模型评估语义一致性,构建首个大规模低分辨率条件偏好数据集,实验表明其在人类判断对齐方面表现更优。
需要两人:周期性和方向性双人舞 for 灭火器移除
机构 * Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田)) ; Peng Cheng Laboratory(鹏城实验室) ; College of Computer Science, Nankai University(南开大学计算机科学学院) ; The Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院)
AI总结 本文提出Flickerformer,通过周期性和方向性特性有效去除闪烁噪声,避免鬼影伪影,提升图像质量。
Comments Accepted by CVPR 2026
当模型自我评判:多模态推理的无监督自进化
机构 * OPPO AI Center(OPPO人工智能中心) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; Hefei University of Technology(合肥工业大学)
AI总结 本文提出一种无监督自进化框架,通过自一致性信号和动态调节机制,在无需人工标注或外部奖励模型的情况下提升多模态推理性能。
Comments 21 pages, 7 figures
点击提问:一种带有离线文案生成和在线交互问答的AI直播助手
机构 * East China normal University(东中国正常大学) ; Sun Yat-sen University(孙中山大学) ; OPPO AI Center(OPPO AI中心) ; Shenzhen Institutes of Advanced Technology(深圳先进技术研究所)
AI总结 本文提出Click-to-Ask系统,通过离线处理多模态产品信息生成结构化数据和合规文案,结合在线实时问答模块提升直播电商效率和观众互动性。
Comments 4 pages, 2 figures, Accepted at WWW2026 Demos
GDPO-SR:基于群直接偏好优化的一步生成图像超分辨率
机构 * The Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院)
AI总结 本文提出GDPO-SR,通过整合RL方法提升一步生成图像超分辨率性能,引入噪声感知扩散模型和群相对优势计算策略,优化局部细节。
ShaRP: 用于高效视频大语言模型的浅层层剪枝
机构 * VCIP & TMCC & DISSec, College of Computer Science, Nankai University(VCIP与TMCC与DISSec学院,南开大学计算机科学学院) ; LIX, Ecole Polytechnique, IP Paris(LIX,巴黎高等理工学院,IP巴黎) ; OPPO Research Institute(OPPO研究院) ; Beijing University of Posts and Telecommunications(北京邮电大学)
AI总结 本文提出ShaRP框架,通过改进局部信息聚合、校准位置偏差和减少冗余,解决浅层解码器剪枝中的性能下降问题,实现97.2%的性能保留和86%的TFLOPs减少。
流式视频思考
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; OPPO AI Center, OPPO Inc.(OPPO人工智能中心,OPPO公司)
AI总结 本文提出ThinkStream框架,通过Watch-Think-Speak范式实现流式视频推理,采用RCSM压缩内存和流式强化学习提升效率,实验表明其在多个流式视频基准上性能优越且低延迟。
鲁棒的音频视觉目标说话人提取与情感感知多注册融合
机构 * School of Computer Science, Wuhan University, Wuhan, China(1 武汉大学计算机学院,武汉,中国) ; School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(2 香港中文大学(深圳)人工智能学院,中国) ; School of Artificial Intelligence, Wuhan University, Wuhan, China(3 武汉大学人工智能学院,武汉,中国) ; School of Cyber Science and Engineering, Wuhan University, Wuhan, China(4 武汉大学网络科学与工程学院,武汉,中国) ; Digital Innovation Research Center, Duke Kunshan University, Kunshan, China(5 香港中文大学(深圳)数字创新研究中心,中国) ; AI Center, OPPO, Beijing, China(6 OPPO人工智能中心,北京,中国)
AI总结 本文提出一种鲁棒的音频视觉目标说话人提取方法,通过情感感知的多注册融合技术,在模态缺失情况下提升提取性能和鲁棒性。
Comments submitted to Interspeech 2026
BinaryAttention: 一比特QK-注意力用于视觉和扩散变换器
机构 * The Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院)
AI总结 BinaryAttention通过1比特QK-注意力实现视觉和扩散变换器的高效加速,有效提升计算效率并保持准确性。
Comments Accepted by CVPR 2026
迈向运动图灵测试:评估人形机器人的人性化
机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(福建城市智能感知与计算重点实验室,厦门大学) ; Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Xiamen University(多媒体可信感知与高效计算重点实验室,中华人民共和国教育部,信息学院,厦门大学) ; National Institute for Data Science in Health and Medicine, Xiamen University(医学数据科学国家研究院,厦门大学) ; OPPO Research Institute(OPPO研究院) ; ShanghaiTech University(上海科技大学)
AI总结 本文提出运动图灵测试框架,通过HHMotion数据集评估人形机器人动作的人性化程度,并展示基线模型在预测人性化的有效性。
Comments 13 pages, 10 figures, conference
TSEmbed: 解锁通用多模态嵌入中的任务扩展
机构 * State Key Laboratory of IOTSC, University of Macau(物联网科学与技术国家重点实验室,澳门大学) ; OPPO Research Institute(OPPO研究院)
AI总结 TSEmbed通过融合MoE与LoRA,结合专家感知负采样策略,提升通用多模态嵌入的任务扩展能力,并在基准和工业数据集上取得最佳性能。
鲁棒的基于大语言模型的音频视觉语音识别与稀疏模态对齐和视觉单元引导的细化
机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) ; School of Artificial Intelligence, Wuhan University, China(武汉大学人工智能学院) ; School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) ; AI Center, OPPO, China(OPPO人工智能中心) ; Digital Innovation Research Center, Duke Kunshan University, China(杜克大学昆山数字创新研究中心)
AI总结 本文提出AVUR-LLM,通过稀疏模态对齐和视觉单元引导细化,提升音频视觉语音识别的鲁棒性,在LRS3数据集上取得显著性能提升。
Comments submitted to Interspeech 2026
迈向个性化深度研究:基准与评估
机构 * OPPO ; Zhejiang University(浙江大学)
AI总结 本文提出PDR-Bench,首个用于评估深度研究代理个性化能力的基准,通过结合多样化任务与真实用户档案,评估个性化对齐、内容质量和事实可靠性。
DMTrack: 基于双适配器的时空多模态跟踪
机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; Department of Computer Science and Engineering, University of North Texas(北卡罗来纳州立大学计算机科学与工程系) ; OPPO AI Center(OPPO人工智能中心)
AI总结 DMTrack通过双适配器架构实现时空多模态跟踪,利用STMA和PMCA模块提升跨模态融合效果,达到先进性能。
Comments Accepted by ICRA 2026
当智能体“误忆”时:探索基于大语言模型的多智能体系统中的曼德拉效应
机构 * Zhejiang University(浙江大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Palo Alto Networks(帕洛阿尔托网络公司) ; OPPO Research Institute(OPPO研究院) ; Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)
AI总结 本文研究了基于大语言模型的多智能体系统中的曼德拉效应,提出MANBENCH基准并提出缓解策略,实现74.40%的效应减少。
Comments ICLR 2026
LayerT2V: 一个统一的多层视频生成框架
机构 * Shanghai Jiao Tong University(上海交通大学) ; Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 LayerT2V通过统一的多层视频生成框架,实现了多层输出并提升了视频生成的语义一致性和时间一致性。
Comments Project Page is https://layert2v.github.io/
AHBid: 一种适用于跨渠道广告的可适应分层竞价框架
机构 * OPPO Shenzhen Guangdong China(OPPO深圳广东中国)
AI总结 AHBid通过整合生成规划与实时控制,提升跨渠道广告竞价的适应性和效率,实验显示其投资回报率提升了13.57%。
Comments 11 pages, 6 figures, accepted by WWW'2026
可插拔剪枝与连续层蒸馏用于扩散变换器
机构 * OPPO AI Center(OPPO人工智能中心) ; Sun Yat-sen University(中山大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本研究提出PPCL方法,通过连续层蒸馏和灵活剪枝技术,在保持图像生成质量的同时实现50%的参数压缩,适用于资源受限环境。
Comments Accepted to CVPR 2026
Plan-MCTS:网页导航中的计划探索用于动作利用
机构 * Shanghai Jiao Tong University(上海交通大学) ; OPPO Research Institute(OPPO研究院)
AI总结 Plan-MCTS通过将网页导航探索转移到语义计划空间,提升动作利用效率,实现更高效的导航任务执行。
自适应里程碑奖励用于GUI代理
机构 * Shanghai Jiao Tong University(上海交通大学) ; OPPO Research Institute(OPPO研究院)
AI总结 ADMIRE通过自适应里程碑奖励机制,解决长周期任务中奖励保真度与密度的矛盾,提升GUI代理的成功率和泛化能力。
FraudShield: 基于知识图谱的LLM对抗欺诈攻击防御方案
机构 * Zhejiang University(浙江大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; OPPO Research Institute(OPPO研究院) ; Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)
AI总结 FraudShield通过构建欺诈战术-关键词知识图谱,提升LLM对抗欺诈攻击的能力,实验显示其在多个LLM和欺诈类型上表现优异,且提供可解释的防御线索。
Comments WWW 2026
领域重要性:一种轻量级的LLM增强CTR预测方法
机构 * Zhejiang University(浙江大学) ; OPPO Research Institute(OPPO研究院)
AI总结 LLaCTR通过领域级增强范式,提出一种轻量级LLM增强CTR预测方法,提升CTR预测的有效性和效率。
通过全局优化在大语言模型中归因和利用安全向量
机构 * Southeast University(东南大学) ; Zhejiang University(浙江大学) ; OPPO Research Institute(OPPO研究院)
AI总结 通过全局优化方法识别大语言模型中的安全向量,揭示安全机制的协作交互,并提出新的白盒劫持方法提升攻击效果。