arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

共收录 117
2608.08638 2026-08-11 cs.SD cs.AI cs.CL 新提交

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

CuteTTS:基于连续隐变量自回归建模的高效高保真语音合成

Yuqian Zhang, Yao Shi, Kexin Huang, Botian Jiang, Zhe Xu, Yiwei Zhao, Min Liang, Shuang Chen, Xipeng Qiu

机构 * Shanghai Innovation Institute(上海创新研究院) OPPO AI Center(OPPO人工智能中心) Fudan University(复旦大学)

AI总结 CuteTTS是结合语义对齐因果VAE隐变量等的连续自回归TTS系统,经引导步蒸馏后,在保持相当质量的同时降低了延迟,实现了高保真与低延迟的平衡。

Comments 20 pages, 6 figures, 10 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07959 2026-08-11 cs.AI 新提交

SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

SCOUT:面向超长时长自我中心视频推理的自检查与恢复感知工具思维智能体

Keyang Zhong, Kuo Wang, Peng Liu, Quanlong Zheng, Junlin Xie, Zhijia Liang, Yanhao Zhang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Guangdong OPPO Mobile Telecommunications Corp., Ltd.(广东欧珀移动通信有限公司) OPPO AI Center(OPPO人工智能中心) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本研究提出SCOUT智能体框架,结合自适应策略与UPS-GRPO方法,解决超长自我中心视频推理的错误传播及信用分配问题,在对应基准上达最优性能且短时长场景仍具竞争力。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17850 2026-08-06 cs.CV 版本更新

UniCSG: Unified High-Fidelity Content-Constrained Style-Driven Generation via Staged Semantic and Frequency Disentanglement

UniCSG:通过分阶段语义和频率解耦实现统一的高保真内容约束风格驱动生成

Jingwei Yang, Ruoxi Wu, Wei Shen, Meng Li, Yulong Liu, Huimin She, Lunxi Yuan

机构 * China University of Mining and Technology(中国矿业大学) OPPO Artificial Intelligence Center(OPPO人工智能中心)

AI总结 UniCSG通过分阶段语义和频率解耦,解决风格迁移中内容与风格纠缠问题,提升生成内容的忠实度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02123 2026-08-04 cs.CL 新提交

From Chains to Trees: Parent-Conditioned Drafting for Semi-Autoregressive Speculative Decoding

从链到树:用于半自回归投机解码的父条件生成方案

Zixian Li, Tong Li, Chi Xie, Xiaohui Song, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

AI总结 该研究针对半自回归生成器DSpark的线性生成缺陷,提出父条件生成树(PCTree),通过为每个父节点生成多分支候选序列分配验证预算,在Qwen3系列模型及9个基准上显著提升了投机解码的推理加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00493 2026-08-04 cs.SD 新提交

Hidden-Domain Routing for All-Type Audio Deepfake Detection

用于全类型音频深度伪造检测的隐藏域路由

Yifan Gao, Yao Tian, Hongbin Suo, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

AI总结 针对全类型音频深度伪造检测推理时无音频类型的问题,提出闭域路由系统,先恢复隐藏音频域再分支解释分数,在AT-ADD Track2任务中获96.10%宏F1值且排名第一。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08645 2026-08-04 cs.CL 版本更新

Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents

快速响应:从人类演示中提取隐含意图以构建个性化移动使用代理

Zheng Wu, Heyuan Huang, Yanjia Yang, Yuanyi Song, Xingyu Lou, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

AI总结 本文提出IFRAgent框架,通过分析显式和隐式意图流,提升移动代理对人类意图的对齐率和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16986 2026-07-30 cs.CL cs.AI 版本更新

Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents

Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents

Jingxing Wang, Chenyu Zhou, Zhihui Fu, Jun Wang, Weiwen Liu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

AI总结 本文提出了一种在测试时自适应的技能合成方法SkillTTA,通过检索与当前任务相关的少量训练轨迹并将其合成成为任务特定的文本技能,以提高LLM代理在SpreadsheetBench、ALFWorld和BigCodeBench等任务上的性能。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21271 2026-07-27 cs.CV 版本更新

Flash EQ-Linear: Accelerating Equivariant Linear Layers via Group-wise Discrete Fourier Transform

Flash EQ-Linear:通过分组离散傅里叶变换加速等变线性层

Zhongchen Zhao, Jixin Wang, Qi Xie, Hui Lin, Lei Zhang, Deyu Meng, Zongben Xu

机构 * Xi’an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) OPPO Research(OPPO研究院)

AI总结 研究针对等变网络计算效率低的问题,提出Flash EQ-Linear算法,结合傅里叶卷积定理等降低复杂度,提供CUDA内核,在算子和网络层面均实现加速,使等变网络在多方面首次严格优于非等变网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14121 2026-07-21 cs.CV 版本更新

FADPNet: Frequency-Aware Dual-Path Network for Face Super-Resolution

FADPNet:面向面部超分辨率的频率感知双路径网络

Siyu Xu, Wenjie Li, Guangwei Gao, Jian Yang, Guo-Jun Qi, Chia-Wen Lin

机构 * College of Automation, Nanjing University of Posts and Telecommunications(南京邮电大学自动化学院) State Key Laboratory of Integrated Services Networks, Xidian University(西安电子科技大学信息网络集成服务国家重点实验室) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) PCA Lab, Key Laboratory of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院,教育部智能感知与高维信息处理重点实验室,PCA实验室) OPPO Research, Seattle, WA 98101 USA(OPPO研究,美国华盛顿州西雅图98101)

AI总结 本文提出FADPNet,通过分解面部特征为低频和高频部分,利用Mamba处理低频信息和CNN处理高频细节,实现面部超分辨率的高质量与高效率平衡。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10140 2026-07-14 cs.CV cs.AI 新提交

FlowPainter: Inpainting Optical Flow via Confidence-Guided Completion

FlowPainter:通过置信度引导完成来修复光流

Yuang Meng, Chenyang Wu, Xianshun Liu, Chun-Le Guo, Zichen Liang, Lina Lei, Jie Liang, Hui Zeng, Chongyi Li, Lei Zhang

机构 * Nankai University(南开大学) The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

AI总结 研究光流估计问题,提出FlowPainter框架,结合迭代优化和扩散估计范式,用轻量级置信度感知网络区分区域,通过置信度引导完成光流修复,实验表明其在可比训练下精度高、收敛快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02161 2026-07-14 cs.CV 版本更新

TIIF-Bench: How Does Your T2I Model Follow Your Instructions?

TIIF-Bench:你的文本到图像模型如何遵循指令?

Xinyu Wei, Jinrui Zhang, Zeqing Wang, Hongyang Wei, Zhen Guo, Bairui Li, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) OPPO Research Institute(OPPO研究院)

AI总结 研究旨在评估T2I模型遵循指令能力,提出TIIF-Bench基准,含多维度、多难度提示及新评估指标,利用大语言模型知识开发可重现评估器,通过对主流模型测试分析其优缺点及现有基准局限性。

Comments 35 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18610 2026-07-14 cs.CL 版本更新

PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs

PM-KVQ:用于长思维链语言模型的渐进式混合精度键值缓存量化

Tengxuan Liu, Shiyao Li, Jiayi Yang, Tianchen Zhao, Feng Zhou, Xiaohui Song, Guohao Dai, Shengen Yan, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence-AI Columbia University(哥伦比亚大学) OPPO AI Center(OPPO人工智能中心) Shanghai Jiaotong University(上海交通大学)

AI总结 针对长思维链语言模型因键值缓存内存开销大导致性能下降的问题,提出渐进式混合精度KV缓存量化(PM-KVQ),通过渐进量化策略和逐块内存分配减少累积误差,用带位置插值的校准策略增加校准长度,提升了推理性能和吞吐量。

Comments Accepted by ICLR 2026. Code available at https://github.com/thu-nics/PM-KVQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05089 2026-07-07 cs.CV 新提交

TimeThink: Reasoning with Time for Video LLMs

TimeThink:用于视频语言模型的时间推理

Handong Li, Longteng Guo, Zikang Liu, Dongze Hao, Yepeng Tang, Zijia Zhao, Jie Jiang, Zhiwei Jin, Chen Chen, Haonan Lu, Jing Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) OPPO AI Center, OPPO Inc.(OPPO公司OPPO人工智能中心)

AI总结 研究视频推理中模型发现时间证据的问题,提出TimeThink框架,将时间线索步骤作为优化原语,引入奖励和优化目标,构建数据集,实验表明该框架提升了时间定位和推理性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04151 2026-07-07 cs.CV 新提交

Perceiving Better Moments: Cover Frame Reselection and Enhancement for Live Photos with the Live2K Dataset

感知美好瞬间:利用Live2K数据集进行动态照片的封面帧重新选择与增强

Junyu Lou, Kai Chen, Weiyi You, Hui Zeng, Lei Zhang, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科技大学) OPPO Research Institute(OPPO研究院) The Hong Kong Polytechnic University(香港理工大学)

AI总结 针对动态照片封面与视频帧质量差距问题,定义LPRE任务,利用动态照片内线索,构建Live2K数据集并开发统一基线,为动态照片增强研究建立首个基准。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03110 2026-07-07 cs.CV 新提交

ExpoMotion: A Large-Scale Benchmark and A Householder Projection Network for Multi-Exposure Fusion

ExpoMotion:用于多曝光融合的大规模基准和豪斯霍尔德投影网络

Yao Liu, Lishen Qu, Shihao Zhou, Jie Liang, Hui Zeng, Yabin Peng, Huipeng Lin, Lei Zhang, Jufeng Yang

机构 * Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开大学国际研究院(深圳·福田)) Pengcheng Laboratory(鹏城实验室) College of Computer Science, Nankai University(南开大学计算机科学学院) The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

AI总结 针对多曝光融合中运动重影及高质量动态基准稀缺问题,提出ExpoMotion基准,含多样序列和图像及高保真真值。还提出豪斯霍尔德正交投影网络,通过变换解耦多帧对齐,实验验证了其有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29805 2026-07-01 cs.CV 版本更新

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO AI中心)

AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31982 2026-07-01 cs.CV 新提交

ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

ERA:基于熵引导的视觉令牌剪枝与修正注意力机制的高效多模态大语言模型

Yuhao Wang, Mu Qiao, Haiwen Diao, Yunzhi Zhuge, Pingping Zhang, Xindong Zhang, Lei Zhang, Huchuan Lu

机构 * School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) OPPO Research Institute(OPPO研究院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

AI总结 提出ERA框架,通过熵引导的视觉令牌剪枝和修正注意力机制,解决令牌减少导致的注意力对数坍塌问题,实现高效多模态大语言模型推理加速。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31626 2026-07-01 cs.CV 新提交

PrISM-IQA: Image Quality Assessment Made Practical for Smartphone Photography

PrISM-IQA:面向智能手机摄影的实用图像质量评估

Shuyan Zhai, Jiaqi He, Weixia Zhang, Liang Wang, Zhenjie Lee, Zufeng Zhang, Kede Ma

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Computer Science, Institute of AI, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院人工智能研究院) OPPO Research Institute(OPPO研究院) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

AI总结 提出PrISM-IQA,将智能手机IQA重构为多问题有序诊断,预测每个ISP相关问题的严重等级,支持可操作的ISP调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29812 2026-06-30 cs.CV

Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning

一致性作为归纳偏置:学习跨视角不变性以实现鲁棒多模态推理

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Kening Zheng, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO人工智能中心) UIC(美国国际大学)

AI总结 提出ConsistRoll方法,通过将原始视图与语义不变变换视图置于同一生成组并联合奖励,将跨视角一致性注入强化学习训练,提升多模态推理鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27974 2026-06-29 cs.CV cs.AI 新提交

ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

ProMSA: 渐进式多模态搜索智能体用于基于知识的视觉问答

ZhengXian Wu, Hangrui Xu, Kai Shi, Zhuohong Chen, Yunyao Yu, Chuanrui Zhang, Zirui Liao, Jun Yang, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center, OPPO Inc. China(OPPO AI中心,OPPO公司) The Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Nanyang Technological University, Singapore(新加坡南洋理工大学)

AI总结 提出渐进式多模态搜索智能体ProMSA,通过迭代选择图像搜索、文本搜索或停止,在显式工具调用预算和去重机制下,结合序列级强化学习优化,提升基于知识的视觉问答的检索和端到端准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27905 2026-06-29 cs.CV 新提交

There and Back Again: A Flexible-Frame Transformer for Multi-Exposure Fusion

去而复返:用于多曝光融合的灵活帧数Transformer

Lishen Qu, Yao Liu, Shihao Zhou, Jie Liang, Hui Zeng, Lei Zhang, Jufeng Yang

机构 * Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田)) Peng Cheng Laboratory(鹏城实验室) College of Computer Science, Nankai University(南开大学计算机学院) The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

AI总结 提出FreeMEF,首个灵活帧数多曝光融合Transformer,通过循环状态空间模块和全局特征引导块,无需重训练即可处理任意数量输入帧,在三个基准数据集上取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18846 2026-06-18 cs.CV 新提交

From Bounding Boxes to Visual Reasoning: An On-Policy Data Annotation Tool for Vision-Language Models

从边界框到视觉推理:一种用于视觉语言模型的在线策略数据标注工具

Like Zhang, Runliang Niu, Shiqi Wang, Xiyu Hu, Qianli Xing, Pan Wang, Qingzu He, Qi Wang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science, Jilin University(吉林大学计算机科学与技术学院) OPPO

AI总结 提出ScreenAnnotator,通过统一标注原子模式、在线策略循环与贝叶斯验证器,解决现有工具表达力不足、标注-训练脱节和数据复用性差的问题,实现高效多任务数据生成。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16767 2026-06-16 cs.CV 新提交

Text-Vision Co-Instructed Image Editing

文本-视觉协同指导的图像编辑

Chenxi Xie, Yuhui Wu, Qiaosi Yi, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

AI总结 提出TV-Edit框架,联合文本指令的语义表达与稀疏视觉指令的空间引导,实现精确且忠实于意图的图像编辑,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16082 2026-06-16 cs.CV cs.AI 新提交

Tool-IQA: Augmenting Image Quality Assessment with Simple Tools

Tool-IQA: 利用简单工具增强图像质量评估

Guanyi Qin, Junjie Zhang, Chunming He, Yibing Fu, Jie Liang, Tianhe Wu, Lei Zhang

机构 * National University of Singapore(新加坡国立大学) OPPO Research Institute(OPPO研究院) Nanyang Technical University(南洋理工大学) Duke University(杜克大学) City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 提出Tool-IQA,通过为视觉语言模型配备放大镜和伽马校正器等简单工具,将被动评分转变为工具增强的工作流程,显著提升图像质量评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11543 2026-06-16 cs.CL 版本更新

Pretraining A Large Language Model using Distributed GPUs: A Memory-Efficient Decentralized Paradigm

使用分布式GPU预训练大型语言模型:一种内存高效的分散式范式

Jinrui Zhang, Chaodong Xiao, Aoqi Wu, Xindong Zhang, Lei Zhang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) OPPO Research Institute(OPPO研究院)

AI总结 提出SPES框架,通过分散式训练MoE LLM的子集专家降低内存需求,结合专家合并预热策略,在16个48GB GPU上训练2B参数模型,性能媲美集中式训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14314 2026-06-15 cs.AI 新提交

Communication Policy Evolution for Proactive LLM Agents

主动式LLM智能体的通信策略演化

Xinbei Ma, Jiyang Qiu, Yao Yao, Zheng Wu, Yijie Lu, Xiangmou Qu, Jiaxin Yin, Xingyu Lou, Jun Wang, Weiwen Liu, Weinan Zhang, Zhuosheng Zhang, Hai Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

AI总结 针对用户与智能体间信息不对称问题,形式化通信策略,提出基于文本和UI的策略,并引入自演化框架CPE,通过提示优化提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14302 2026-06-15 cs.CL 新提交

Retrospective Progress-Aware Self-Refinement for LLM Agent Training

回顾性进度感知的LLM智能体训练自我精炼

Xinbei Ma, Congmin Zheng, Jiyang Qiu, Jiale Hong, Yao Yao, Xiangmou Qu, Jiaxin Yin, Xingyu Lou, Jun Wang, Weiwen Liu, Weinan Zhang, Zhuosheng Zhang, Hai Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

AI总结 提出RePro框架,通过前向-反思滚动范式训练智能体自我生成进度信号,无需持续外部监督,在WebShop等任务上提升Qwen系列性能高达12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07436 2026-06-12 cs.CV 新提交

Skill-3D: Evolving Scene-Aware Skills for Agentic 3D Spatial Reasoning

Skill-3D:面向智能体3D空间推理的场景感知技能进化

Haoyuan Li, Zhengdong Hu, Jun Wang, Hehe Fan, Yi Yang

机构 * Zhejiang University(浙江大学) University of Technology Sydney(技术悉尼大学) OPPO Research Institute(OPPO研究院)

AI总结 提出Skill-3D框架,通过场景记忆和技能库的协同进化,使智能体根据场景自适应选择工具,显著提升3D空间推理中工具使用的正确性和充分性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09091 2026-06-09 cs.LG cs.CV 新提交

Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization

稳定基于策略的蒸馏用于多模态大语言模型推理的全局归一化

Dongze Hao, Zhiwei Jin, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO AI中心)

AI总结 针对策略蒸馏中异常状态导致梯度不稳定的问题,提出全局归一化蒸馏策略优化(GNDPO),通过将KL分数转化为批次级相对优势来稳定优化,提升多模态推理任务的训练鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06087 2026-06-05 cs.CL cs.AI

LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents

LatentSkill: 从上下文文本技能到LLM智能体的权重内隐技能

Aofan Yu, Chenyu Zhou, Tianyi Xu, Zihan Guo, Rong Shan, Zhihui Fu, Jun Wang, Weiwen Liu, Yong Yu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Sun Yat-Sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) OPPO Research Institute(OPPO研究院)

AI总结 提出LatentSkill框架,通过预训练超网络将文本技能转换为即插即用的LoRA适配器,将技能知识存储在权重空间而非上下文空间,从而减少预填充令牌并提升性能。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏