arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

共收录 72
2608.09536 2026-08-11 cs.CV 新提交

DocPure: Prompt-Free Unified Document Restoration via Degradation-Aware Structure-Guided Wavelet Modulation

DocPure:基于退化感知结构引导的小波调制的无提示统一文档复原

Lingming Su, Wanglong Lu, Tao Wang, Kaihao Zhang, Nan Zhang, Liyan An, Hanli Zhao

机构 * College of Computer Science and Artificial Intelligence, Wenzhou University(温州大学计算机与人工智能学院) AI Analytics Team, Nasdaq(纳斯达克人工智能分析团队) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司) College of Engineering and Computer Science, The Australian National University(澳大利亚国立大学工程与计算机科学学院)

AI总结 本文提出无提示统一文档复原框架DocPure,通过退化感知结构自编码器与结构引导小波交互机制,在多类文档退化复原任务中实现优于现有方法的性能。

Comments 19 pages, 15 figures. Lingming Su and Wanglong Lu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18469 2026-08-11 cs.CV 版本更新

HonestFace: Towards Honest Face Restoration with One-Step Diffusion Model

HonestFace:基于单步扩散模型的诚实人脸复原方法

Jingkai Wang, Wu Miao, Jue Gong, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

AI总结 本研究提出基于单步扩散模型的HonestFace人脸复原方法,通过身份嵌入器、掩码人脸对齐等组件构建新数据集MultiRefCeleb-Test,其性能优于现有最优方法。

Comments Published at ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00502 2026-08-04 cs.CV 新提交

SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance

SpatialAfford:教紧凑视觉语言模型(VLMs)关注何处与定位何处以实现 affordance

Yufei Zhang, Chenlu Zhan, Donghui Sun, Xiaoxin Chen, Hongwei Wang

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

AI总结 SpatialAfford 是一个两阶段框架,通过空间注意力对齐和空间感知 GRPO,使紧凑 4B VLMs 在多个基准上的 affordance 定位性能优于更强的 7B+ 基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21590 2026-08-04 cs.CV 版本更新

Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance

先恢复文本,后增强图像:基于字形结构引导的两阶段场景文本图像超分辨率

Minxing Luo, Linlong Fan, Wang Qiushi, Ge Wu, Yiyan Luo, Yuhang Yu, Jinwei Chen, Yaxing Wang, Qingnan Fan, Jian Yang

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) vivo Mobile Communication Co. Ltd(vivo移动通信有限公司) SDS, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)信息科学与技术学院)

AI总结 TIGER通过两阶段框架先恢复文本再增强图像,利用字形结构引导实现场景文本图像超分辨率的高保真度与可读性提升。

Comments Project Page: https://tony-lowe.github.io/TIGER_project_page/ GitHub Repo: https://github.com/OpenVeraTeam/TiGeSR Huggingface Dataset: https://huggingface.co/datasets/mxluocv/UZ-ST Huggingface Weights: https://huggingface.co/mxluocv/TiGeSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19450 2026-07-30 cs.LG cs.AI 版本更新

REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning

REGEN:用于从专家到通用模型蒸馏的离线强化学习的重放回收

Yunjie Chen, Xiaoxin Chen, Fang Wang

机构 * vivo AI Lab(vivo人工智能实验室) Department of Computer Science, Sun Yat-Sen University(中山大学计算机科学系)

AI总结 针对大语言模型强化学习扩展的挑战,提出REGEN方法,通过回收重放记忆并运用离线强化学习算法训练通用模型,解耦训练过程,降低成本,在多任务上以低成本达类似准确率,还可能变革在线强化学习及扩展训练阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23472 2026-07-28 cs.CV 新提交

VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation

VIPER:用于物理上合理的视频生成的视觉上下文物理推理

Tianxiao Chen, Hanmo Chen, Huajin Chen, Bo Li, Qi Ye, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20924 2026-07-24 cs.CV 新提交

MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer

MagicMakeup:用于高保真妆容转移的区域可控扩散Transformer

Ziyi Wang, Siming Zheng, Yang Yang, Shusong Xu, Hao Zhang, Bo Li, Changqing Zou, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司) vivo BlueImage Lab(vivo蓝图像实验室)

AI总结 研究妆容转移中区域可控性等难题,提出MagicMakeup框架,基于空间约束和概念解缠结,用令牌对齐区域门控和跨模态感知指导实现精确编辑与概念澄清,设计数据生成管道并建立基准,提升了多方面性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22804 2026-07-16 cs.CV 版本更新

CoVStream: Edge-Cloud Collaboration for Understanding of Long Video Streams

CoVStream: 面向长视频流的边缘-云协作理解

Xu Liu, Guikun Chen, Zihao Yan, Kanzhi Wu, Wenguan Wang

机构 * The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能国家重点实验室) vivo Mobile Communication Co., Ltd., Shenzhen, China(深圳 vivo 通信有限公司)

AI总结 提出边缘-云协作框架CoVStream,边缘节点将视频流压缩为视觉特征和语义描述传输至云端,云服务器构建实体图与全局视觉上下文,仅在用户查询时激活大模型,在LVBench上带宽降低87.6%且准确率保持99.2%。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17434 2026-06-26 cs.CV 版本更新

TinySR: Pruning Diffusion for Real-World Image Super-Resolution

TinySR:剪枝扩散模型用于现实世界图像超分辨率

Linwei Dong, Qingnan Fan, Yuhang Yu, Qi Zhang, Jinwei Chen, Yawei Luo, Changqing Zou

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co. Ltd(沃伊通信有限公司) Zhejiang Lab(浙江实验室)

AI总结 本文提出TinySR,一种针对现实世界图像超分辨率的紧凑高效扩散模型,通过动态块激活和扩展-腐蚀策略实现实时性能与高质量输出,相比教师模型TSD-SR在计算成本和参数量上分别减少5.68倍和83%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19195 2026-06-18 cs.CV 新提交

Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance

Moebius: 0.2B轻量级图像修复框架,性能达10B级别

Kangsheng Duan, Ziyang Xu, Wenyu Liu, Xiaohu Ruan, Xiaoxin Chen, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) VIVO AI Lab(VIVO人工智能实验室)

AI总结 提出Moebius轻量级图像修复框架,通过局部-λ混合交互模块和自适应多粒度蒸馏策略,以0.22B参数实现与10B级模型FLUX.1-Fill-Dev相当甚至更优的生成质量,推理速度提升15倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30039 2026-06-01 cs.AI

Domain-Specific Data Synthesis for LLMs via Minimal Sufficient Representation Learning

基于最小充分表示学习的大语言模型领域特定数据合成

Tong Ye, Hang Yu, Tengfei Ma, Xuhong Zhang, Jianguo Li, Peng Di, Peiyu Liu, Jianwei Yin, Wenhai Wang

机构 * vivo AI Lab(vivo人工智能实验室) Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

AI总结 提出DOMINO框架,通过对比解耦学习最小充分领域表示,指导生成领域对齐的合成数据,在隐式领域定义下提升微调性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25447 2026-05-26 cs.CL

GeoSVG-RL: Geometry-Aware Reinforcement Learning for Layout-Constrained Text-to-SVG Diagram Generation

GeoSVG-RL:面向布局约束的文本到SVG图表生成的几何感知强化学习

Sifan Li, Yujun Cai, Hongkai Chen, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) The University of Queensland(昆士兰大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

AI总结 提出GeoSVG-RL框架,通过强化学习优化策略,利用几何反馈奖励(渲染有效性、画布适配、锚点放置、文本包含、图一致性和代码整洁性)解决文本到SVG图表生成中的结构脆弱性问题,显著提升箭头锚点精度和文本框内率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08155 2026-05-21 cs.LG

C$^2$FG: Control Classifier-Free Guidance via Score Discrepancy Analysis

C$^2$FG: 通过分数差异分析实现控制分类器无关引导

Jiayang Gao, Tianyi Zheng, Jiayang Zou, Fengxiang Yang, Shice Liu, Luyao Fan, Zheyu Zhang, Hao Zhang, Jinwei Chen, Peng-Tao Jiang, Bo Li, Jia Wang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo BlueImage Lab(vivo 蓝影实验室) vivo Mobile Communication Co., Ltd.(vivo 通信有限公司)

AI总结 本文提出C$^2$FG,一种基于分数差异分析的控制分类器无关引导方法,通过严格理论分析建立了条件分布与无条件分布在不同时间步的分数差异上界,从而为时间依赖引导提供了理论基础,并通过实验验证了其在多种生成任务中的有效性。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17470 2026-05-20 cs.CV cs.MM eess.IV

EchoSR: Efficient Context Harnessing for Lightweight Image Super-Resolution

EchoSR: 为轻量图像超分辨率实现高效的上下文利用

Hanli Zhao, Binhao Wang, Shihao Zhao, Tao Wang, Kaihao Zhang, Wanglong Lu

机构 * College of Computer Science and Artificial Intelligence, Wenzhou University, Wenzhou 325000, China(温州大学计算机科学与人工智能学院) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd, Shanghai 200100, China(vivo蓝影实验室,vivo移动通信有限公司,上海200100,中国) College of Engineering and Computer Science, Australian National University, Canberra, Australia(工程与计算机科学学院,澳大利亚国立大学,堪培拉,澳大利亚) The AI/Analytics Team, Nasdaq, St. John’s, Canada(AI/分析团队,纳斯达克,圣约翰,加拿大)

AI总结 本文提出EchoSR框架,通过统一多尺度感受野建模和层次化上下文融合,提升了轻量图像超分辨率的效率和效果,同时在多个基准上优于现有方法,并实现了约两倍的速度提升。

Comments Accepted by Information Fusion; 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15908 2026-05-18 cs.CV cs.AI

RaPD: Resolution-Agnostic Pixel Diffusion via Semantics-Enriched Implicit Representations

RaPD:通过语义增强的隐式表示实现分辨率无关的像素扩散

Yanhao Ge, Shanyan Guan, Weihao Wang, Ying Tai, Mingyu You

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司) Nanjing University(南京大学)

AI总结 RaPD通过语义表示引导和坐标查询注意力渲染器,在连续神经图像场的潜在空间中实现分辨率无关的像素扩散,解决了重建与生成之间的差距,提升了生成质量和分辨率扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14938 2026-05-15 cs.LG cs.CV

Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models

Octopus:无历史梯度正交化用于多模态大语言模型中的持续学习

Yuehao Liu, Shanyan Guan, Weijia Zhang, Xuanming Shang, Yanhao Ge, Wei Li, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室,人工智能研究院,上海交通大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

AI总结 Octopus提出一种基于无历史梯度正交化的方法,通过两阶段微调策略平衡持续学习中的可塑性与稳定性,实验表明其在UCIT数据集上性能优于现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14821 2026-05-15 cs.CV

HDRFace: Rethinking Face Restoration with High-Dimensional Representation

HDRFace: 重新思考高维表示下的面部修复

Zirui Wang, Xianhui Lin, Yi Dong, Bo Wei, Gangjian Zhang, Siteng Ma, Zebiao Zheng, Xing Liu, Hong Gu, Minjing Dong

机构 * City University of Hong Kong(香港城市大学) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd(vivo蓝影实验室,vivo移动通信有限公司)

AI总结 本文提出HDRFace框架,通过注入语义丰富的先验知识提升面部修复效果,采用高维特征编码器提取细粒度面部表示,并引入SDFM机制平衡结构一致性和细节保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11475 2026-05-13 cs.CV

Deep Probabilistic Unfolding for Quantized Compressive Sensing

深度概率展开用于量化压缩感知

Gang Qu, Ping Wang, Siming Zheng, Xin Yuan

机构 * Westlake University, School of Engineering, Hangzhou, Zhejiang, China(西湖大学工程学院,杭州,浙江,中国) Vivo Mobile Communication Co., Ltd., Hangzhou, Zhejiang, China(Vivo移动通信有限公司,杭州,浙江,中国)

AI总结 本文提出深度概率展开模型,通过展开框架提升重建精度和效率,采用闭式概率梯度投影替代传统L2投影,设计双域Mamba模块融合多尺度特征,实验证明其在量化压缩感知中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07429 2026-05-12 cs.CV

Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework

通过扩散框架实现逼真且高效的bokeh渲染

Linxiao Shi, Siming Zheng, Zerong Wang, Hao Zhang, Jinwei Chen, Bo Li, Shifeng Chen, Peng-Tao Jiang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo BlueImage实验室,vivo移动通信有限公司) Shenzhen University of Advanced Technology(深圳大学)

AI总结 本文提出MagicBokeh框架,通过替代训练策略和聚焦感知的掩码注意力机制,联合优化bokeh渲染与超分辨率,提升可控性和视觉保真度,并引入降质感知深度模块以提高低质量输入的深度估计准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07457 2026-05-11 cs.CV

EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement

EditRefiner:一种对齐人类的代理框架用于图像编辑细化

Zitong Xu, Huiyu Duan, Yifei Nie, Mingda Du, Sijing Wu, Xiongkuo Min, Tianyi Zheng, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(Vivo移动通信有限公司) University of Electronic Science and Technology of China(电子科学与技术大学)

AI总结 本文提出EditRefiner,一种对齐人类的代理框架,通过人类反馈数据集改进图像编辑的细粒度问题,通过感知-推理-行动-评估循环提升编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06708 2026-05-11 cs.CV cs.AI

Visual Text Compression as Measure Transport

视觉文本压缩作为度量传输

Lv Tang, Tianyi Zheng, Yang Liu, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Tsinghua University(清华大学)

AI总结 本文通过度量传输理论分析视觉文本压缩,提出无标签路由准则和传输感知聚焦机制,提升压缩效率并优化下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22558 2026-04-27 cs.LG cs.AI

SOLAR-RL: Semi-Online Long-horizon Assignment Reinforcement Learning

SOLAR-RL:半在线长 horizon 分配强化学习

Jichao Wang, Liuyang Bian, Yufeng Zhou, Han Xiao, Yue Pan, Guozhi Wang, Hao Wang, Zhaoxiong Wang, Yafei Wen, Xiaoxin Chen, Shuai Ren, Lingfang Zeng

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang Lab(浙江实验室) CUHK MMLab(香港大学多模态实验室) Hubei University(湖北省大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

AI总结 SOLAR-RL通过整合全局轨迹信息到离线学习中,提升GUI任务的长horizon完成率和鲁棒性,提供高效样本利用的自主导航方案。

Comments 14 pages, 11 figures. Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19587 2026-04-22 cs.CV

SmartPhotoCrafter: Unified Reasoning, Generation and Optimization for Automatic Photographic Image Editing

SmartPhotoCrafter: 统一推理、生成与优化用于自动摄影图像编辑

Ying Zeng, Miaosen Luo, Guangyuan Li, Yang Yang, Ruiyang Fan, Linxiao Shi, Qirui Yang, Jian Zhang, Chengcheng Liu, Siming Zheng, Jinwei Chen, Bo Li, Peng-Tao Jiang

机构 * vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo蓝影实验室,vivo移动通信有限公司)

AI总结 本文提出SmartPhotoCrafter,通过统一推理生成过程实现自动摄影图像编辑,提升图像质量与美观,无需人工指令。

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13054 2026-04-16 cs.CL cs.AI cs.CV

Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling

先caption,后VQA:知识密度而非任务格式驱动多模态扩展

Hongjian Zou, Yue Ge, Qi Ding, Yixuan Liao, Xiaoxin Chen

机构 * vivo AI Lab(vivo人工智能实验室) Wuhan University(武汉大学)

AI总结 研究发现,多模态模型扩展的关键瓶颈在于训练数据的知识密度而非任务格式,通过结构化caption增强和跨模态知识注入可提升模型性能,表明当前多模态模型因训练数据知识覆盖不足而难以扩展。

Comments 23 pages, 4 figures, 10 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06477 2026-04-16 cs.AI

MAS-Bench: A Unified Benchmark for Shortcut-Augmented Hybrid Mobile GUI Agents

MAS-Bench:一种统一的快捷键增强混合移动GUI代理基准测试

Pengxiang Zhao, Guangyi Liu, YaoZhen Liang, Weiqing He, Zhengxi Lu, WenHao Wang, Yuehao Huang, Yuxiang Chai, Zhaolu Kang, Yaxuan Guo, Hao Wang, Kexin Zhang, Liang Liu, Yong Liu

机构 * Zhejiang University(浙江大学) vivo AI Lab(vivo AI实验室) Peking University(北京大学)

AI总结 本文提出MAS-Bench,用于评估结合GUI和快捷键的混合移动自动化代理,包含139个任务和9个评估指标,实验显示混合代理在效率上优于纯GUI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10674 2026-04-14 cs.LG cs.AI cs.CL

Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents

Skill-SD:基于多轮LLM代理的技能条件自蒸馏

Hao Wang, Guozhi Wang, Han Xiao, Yufeng Zhou, Yue Pan, Jichao Wang, Ke Xu, Yafei Wen, Xiaohu Ruan, Xiaoxin Chen, Honggang Qi

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) vivo AI Lab(vivo AI实验室)

AI总结 Skill-SD通过将代理自身轨迹转化为动态训练监督,结合重要加权反KL损失稳定训练,提升多轮LLM代理性能,实验显示优于标准RL和OPD方法。

Comments Project page: https://k1xe.github.io/skill-sd/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17163 2026-04-14 cs.CV

OSDFace: One-Step Diffusion Model for Face Restoration

OSDFace:面向面部修复的一步扩散模型

Jingkai Wang, Jue Gong, Lin Zhang, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

AI总结 OSDFace提出一种一步扩散模型,通过视觉嵌入器和面部身份损失提升面部修复的视觉质量和身份一致性。

Comments Accepted to CVPR 2025. The code and model will be available at https://github.com/jkwang28/OSDFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08048 2026-04-10 cs.CV

Guiding a Diffusion Model by Swapping Its Tokens

通过交换令牌引导扩散模型

Weijia Zhang, Yuehao Liu, Shanyan Guan, Wu Ran, Yanhao Ge, Wei Li, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

AI总结 本文提出一种简单方法,通过交换令牌实现条件和无条件生成的CFG引导,提升图像质量和提示对齐。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07955 2026-04-10 cs.LG

Rethinking Residual Errors in Compensation-based LLM Quantization

重新思考基于补偿的LLM量化中的残差误差

Shuaiting Li, Juncan Deng, Kedong Xu, Rongtao Deng, Hong Gu, Minghan Jiang, Haibin Shen, Kejie Huang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

AI总结 本文重新审视残差误差的定义,指出现有方法的校准目标存在次优问题,并引入补偿感知误差以提升LLM量化性能。

Comments ICLR'26 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07363 2026-04-10 cs.LG

Benchmark Shadows: Data Alignment, Parameter Footprints, and Generalization in Large Language Models

基准阴影:大型语言模型中的数据对齐、参数足迹与泛化

Hongjian Zou, Yidan Wang, Qi Ding, Yixuan Liao, Xiaoxin Chen

机构 * Vivo AI Lab, Shenzhen, China(维沃人工智能实验室,深圳,中国) Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学,香港,中国)

AI总结 本文研究了大型语言模型中基准表现与广度能力之间的差异,通过数据干预发现数据分布影响参数适应与泛化能力,提出参数空间诊断方法揭示不同训练模式的结构特征。

Comments 28 pages, 26 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏