arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-13 至 2026-04-13 共收录 43 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 43 篇

2604.09017 2026-04-13 cs.NI 89%

Multimodal Large Language Model Enabled Robust Beamforming for HAP Downlink Communications

多模态大语言模型赋能的HAP下行链路鲁棒波束成形

Xiaoyu Xing, Peng Yang, Guoquan Tao, Dingyi Lu, Zehui Xiong, Xianbin Cao

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于多模态大语言模型的波束成形框架,通过飞行 telemetry 预测HAP姿态并实现鲁棒下行通信,提升用户服务比和总速率22.1%和12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01400 2026-04-13 cs.CV 89%

Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models

通过局部和全局上下文优化实现高效视频大语言模型的token缩减

Jinlong Li, Liyuan Jiang, Haonan Zhang, Nicu Sebe

机构 * University of Trento(特伦托大学) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出AOT方法,通过局部-全局最优传输优化视频大语言模型中的token,实现高效的token缩减,保持时间与视觉保真度。

Comments CVPR2026, Project webpage: https://tyroneli.github.io/AOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09024 2026-04-13 cs.CV cs.AI cs.CR cs.LG 88%

Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection

别让我看图片:通过视觉提示注入防止多模态大语言模型分析图片

Zedian Shao, Hongbin Liu, Yuepeng Hu, Neil Zhenqiang Gong

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ImageProtector,通过在图像中嵌入精心设计的微小扰动,使多模态大语言模型在分析时产生拒绝响应,同时评估了三种潜在的防御措施,发现它们在降低ImageProtector效果的同时影响模型性能。

Comments Appeared in ACL 2026 main conference

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08964 2026-04-13 cs.CL 88%

Breaking Block Boundaries: Anchor-based History-stable Decoding for Diffusion Large Language Models

打破块边界:基于锚点的历史稳定解码用于扩散大语言模型

Shun Zou, Yong Wang, Zehui Chen, Lin Chen, Chongyang Tao, Feng Zhao, Xiangxiang Chu

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(中国科学技术大学教育部多模态认知与智能系统重点实验室) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出AHD解码策略,通过动态锚点实时监控token稳定性,实现跨块高效解码,提升性能与推理效率。

Comments Accepted for ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09034 2026-04-13 cs.LG 87%

The nextAI Solution to the NeurIPS 2023 LLM Efficiency Challenge

NeurIPS 2023 LLM效率挑战的nextAI解决方案

Gyuwon Park, DongIl Shin, SolGil Oh, SangGi Ryu, Byung-Hak Kim

机构 * UNIST(蔚山科学技术院) CJ Corporation(CJ集团)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出通过QLoRA微调和Flash Attention 2技术优化LLaMa2 70B模型,在单块A100 GPU内实现高效资源利用与高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08826 2026-04-13 cs.LG cs.AI cs.CL 87%

HiFloat4 Format for Language Model Pre-training on Ascend NPUs

HiFloat4格式用于在Ascend NPUs上预训练语言模型

Mehran Taghian, Yunke Peng, Xing Huang, Yao Wang, Yaoyuan Wang, Wei Guo, Yuanyong Luo, Tianchi Hu, Junsong Wang, Xin Wang, Hu Liu, Yu Cheng, Ziwei Yu, Hongliang Li, Mehdi Rahimifar, Lei Yan, Xuefei Wang, Zhuang Ma, Lei Liu, Hui Yu, Anandharaju Durai Raju, Hoang Le, Hei Yi Mak, Tanzila Rahman, Shadan Golestan

机构 * Huawei(华为)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了HiFloat4 4位浮点格式在Ascend NPUs上的应用,比较了其与MXFP4在大规模训练中的性能,展示了FP4在计算效率和内存利用率上的优势,同时探讨了FP4训练中的稳定性技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13450 2026-04-13 cs.CV cs.CL 86%

LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models

LADR:基于局部性的动态救援方法,用于高效文本到图像生成的扩散大语言模型

Chenglin Wang, Yucheng Zhou, Shawn Chen, Tao Wang, Kai Zhang

机构 * East China Normal University(华东师范大学) University of Macau(澳门大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本文提出LADR方法,通过利用图像的空间马尔可夫性质加速推理,实现文本到图像生成的高效生成,同时保持生成质量。

Comments ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18150 2026-04-13 cs.LG cs.CL 86%

FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning

FP8-RL:一种实用且稳定的低精度栈用于大语言模型强化学习

Zhaopeng Qiu, Shuang Yu, Jingqi Zhang, Shuai Zhang, Xue Huang, Jingyi Yang, Junjie Lai

机构 * NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种实用的FP8 rollout栈,用于大语言模型强化学习,通过块状FP8量化实现FP8 W8A8线性层rollout,扩展FP8到KV-cache以消除长上下文内存瓶颈,并通过重要性采样基于rollout修正缓解训练-推理不匹配问题,提升了rollout吞吐量达44%。

Comments Added more FP8 end2end experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04853 2026-04-13 cs.LG cs.AI cs.IT cs.NA math.IT math.NA 86%

Provable Post-Training Quantization: Theoretical Analysis of OPTQ and Qronos

可证明的训练后量化:OPTQ和Qronos的理论分析

Haoyu Zhang, Shihao Zhang, Ian Colbert, Rayan Saab

机构 * UC San Diego(加州大学圣地亚哥分校) AMD

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文首次为OPTQ及Qronos提供了定量误差界,分析了训练后量化的迭代过程对量化误差的影响,并为参数选择和特征排序提供了理论依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09048 2026-04-13 cs.DC cs.AI 85%

Watt Counts: Energy-Aware Benchmark for Sustainable LLM Inference on Heterogeneous GPU Architectures

瓦特计数:面向异构GPU架构的节能LLM推理基准

Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-Martínez

机构 * Zurich University of Applied Sciences(苏黎世应用科技大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Watt Counts基准,通过50个LLM在10种GPU上的5000+实验数据,研究异构GPU架构下LLM推理的能耗优化,证明硬件选择对能效至关重要,展示在服务器场景下可降低能耗70%,在批处理场景下降低20%。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09493 2026-04-13 cs.NI 85%

Policy-Aware Edge LLM-RAG Framework for Internet of Battlefield Things Mission Orchestration

面向战场物联网任务编排的政策感知边缘大语言模型检索增强生成框架

Om Solanki, Lopamudra Praharaj, Deepti Gupta, Maanak Gupta

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种面向战场物联网任务编排的政策感知边缘大语言模型检索增强生成框架,结合轻量检索模块与本地LLM进行任务规划,并通过JudgeLLM验证用户指令以提高可靠性。

Comments 10 pages, 5 figures, Accepted at AIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09332 2026-04-13 eess.AS 85%

Phonemes vs. Projectors: An Investigation of Speech-Language Interfaces for LLM-based ASR

音素与投影器:针对基于LLM的ASR的语音-语言接口研究

Ziwei Li, Lukuang Dong, Saierdaer Yusuyin, Xianyu Zhao, Zhijian Ou

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文比较了基于音素和投影器的接口在英语和塔塔尔语ASR中的性能,提出BPE-音素接口提升生成效果。

Comments Update after INTERSPEECH2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09107 2026-04-13 cs.DC cs.AI 79%

TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training

TensorHub: 用于LLM强化学习训练的可扩展和弹性权重传输

Chenhao Ye, Huaizheng Zhang, Mingcong Han, Baoquan Zhong, Xiang Li, Qixiang Chen, Xinyi Zhang, Weidong Zhang, Kaihua Jiang, Wang Zhang, He Sun, Wencong Xiao, Andrea C. Arpaci-Dusseau, Remzi H. Arpaci-Dusseau

机构 * ByteDance Seed(字节跳动Seed) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 TensorHub通过Reference-Oriented Storage实现高效的权重传输,支持异构计算资源的扩展,减少GPU停滞时间,提升弹性回滚效率,已在生产环境中部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10603 2026-04-13 cs.LG 79%

dnaHNet: A Scalable and Hierarchical Foundation Model for Genomic Sequence Learning

dnaHNet:一种可扩展且分层的基因组序列学习基础模型

Arnav Shah, Junzhe Li, Parsa Idehpour, Adibvafa Fallahpour, Brandon Wang, Sukjun Hwang, Bo Wang, Patrick D. Hsu, Hani Goodarzi, Albert Gu

机构 * University of Toronto(多伦多大学) University of California, San Francisco(加州大学旧金山分校) University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学) Vector Institute(向量研究所) University Health Network(大学健康网络) Arc Institute(Arc研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 dnaHNet提出一种无需分词的自回归模型,通过可微的动态分块机制压缩基因组序列,实现高效且可扩展的基因组学习,优于现有模型并在零样本任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14075 2026-04-13 cs.CV cs.CL 79%

Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models

通过蒸馏和强化学习生长多头Twig以加速大视觉-语言模型

Zhenwei Shao, Mingyang Wang, Weijun Zhang, Zhou Yu, Wenwen Pan, Yan Yang, Tao Wei, Hongyuan Zhang, Jun Yu

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission, School of Computer Science, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,计算机学院,杭州电子科技大学) Li Auto Inc.(理想汽车) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出TwigVLM,通过在基础VLM早期层上生长轻量模块Twig,结合 Twig 引导的 token 剪枝和自推测解码策略,实现更高的准确性和速度。实验表明, TwigVLM 在剪枝88.9%的视觉token后仍保持96%的原始性能,并在生成长响应时达到154%的速度提升。

Comments An extended version of our ICCV paper at ICCV2025/html/Shao_Growing_a_Twig_to_Accelerate_Large_Vision-Language_Models_ICCV_2025_paper.html" target="_blank" rel="noopener">https://openaccess.thecvf.com/content/ICCV2025/html/Shao_Growing_a_Twig_to_Accelerate_Large_Vision-Language_Models_ICCV_2025_paper.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08986 2026-04-13 cs.CL cs.AI 79%

PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment

PerMix-RLVR: 在可验证奖励对齐下保持人物表达性

Jihwan Oh, Soowon Oh, Murad Aghazada, Minchan Jeong, Sungnyun Kim, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能系) Samsung Advanced Institute of Technology(三星高级技术研究院) Seoul National University(首尔国立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PerMix-RLVR方法,通过训练阶段处理人物敏感性,平衡模型在不同人物设定下的鲁棒性和表现真实性,提升任务性能和人物表达 fidelity。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09480 2026-04-13 cs.CV 78%

Online3R: Online Learning for Consistent Sequential Reconstruction Based on Geometry Foundation Model

Online3R: 基于几何基础模型的在线学习一致序列重建

Shunkai Zhou, Zike Yan, Fei Xue, Dong Wu, Yuchen Deng, Hongbin Zha

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) T-Stone Robotics Institute, The Chinese University of Hong Kong(香港中文大学天石机器人研究所) NVIDIA(英伟达) College of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院) School of Artificial Intelligence and Computer Science, Anqing Normal University(安庆师范大学人工智能与计算机科学学院)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 Online3R通过在线学习适应新场景,解决不一致问题,利用可学习的轻量视觉提示和自监督学习策略提升几何预测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09406 2026-04-13 cs.LG 77%

OASIS: Online Activation Subspace Learning for Memory-Efficient Training

OASIS:面向内存高效训练的在线激活子空间学习

Sakshi Choudhary, Utkarsh Saxena, Kaushik Roy

机构 * Purdue University(普渡大学) Advanced Micro Devices, Inc. (AMD)(超威半导体公司(AMD))

专题命中 效率与部署 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 OASIS通过在线学习动态激活子空间,减少内存消耗,无需修改前向计算,实现比全微调低2倍的峰值内存使用,同时保持性能并优于现有低秩方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08851 2026-04-13 cs.CL 77%

Cross-Lingual Attention Distillation with Personality-Informed Generative Augmentation for Multilingual Personality Recognition

跨语言注意力蒸馏与基于个性引导的生成增强用于多语言个性识别

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Noriyuki Kawarazaki, Kosuke Takano

机构 * Universiti Tunku Abdul Rahman(拉曼大学) Kanagawa Institute of Technology(神奈川工科大学) Université Sorbonne Paris Nord(索邦巴黎北大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ADAM方法,通过跨语言注意力蒸馏和基于个性引导的生成增强,提升多语言个性识别性能,实验表明CLAD在多种语言和个性特征上均优于标准BCE模型。

Comments IEEE Transactions on Cognitive and Developmental Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08606 2026-04-13 cs.GT cs.AI econ.TH 77%

Extrapolating Volition with Recursive Information Markets

通过递归信息市场预测意志

Abhimanyu Pallavi Sudhir, Long Tran-Thanh

机构 * University of Warwick(华威大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过递归机制分析信息市场中的信息不对称问题,探讨如何通过LLM买家的遗忘特性激励信息按真实价值定价,为AI对齐研究提供新方法。

Comments Accepted to Games, Agents and Incentives Workshop at AAMAS-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08584 2026-04-13 cs.LG cs.AI 76%

CSAttention: Centroid-Scoring Attention for Accelerating LLM Inference

CSAttention:用于加速大语言模型推理的重心评分注意力

Chuxu Song, Zhencan Peng, Jiuqi Wei, Chuanhui Yang

机构 * Department of Computer Science, Rutgers University(罗格斯大学计算机科学系)

专题命中 效率与部署 :LLM(title);分类 cs.AI、cs.LG

AI总结 本文提出CSAttention,一种无需训练的稀疏注意力方法,通过离线预填和在线解码策略提升大语言模型的推理速度和准确性,在高稀疏度和长上下文设置下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00035 2026-04-13 cs.CL cs.AI cs.LG 75%

Constraining Sequential Model Editing with Editing Anchor Compression

通过编辑锚压缩约束序列模型编辑

Hao-Xiang Xu, Jun-Yu Ma, Zhen-Hua Ling, Ningyu Zhang, Jia-Chen Gu

机构 * National Engineering Research Center of Speech and Language Information Processing, University of Science and Technology of China(中国科学技术大学语音及语言信息处理国家工程研究中心) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Editing Anchor Compression框架,通过选择重要编辑锚点压缩参数矩阵,减少序列编辑中的偏差,保留模型通用能力并提升编辑知识保留度。

Comments Accepted by NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09083 2026-04-13 cs.OS cs.DC 75%

EdgeFlow: Fast Cold Starts for LLMs on Mobile Devices

EdgeFlow: 针对移动设备上LLM的快速冷启动

Yongsheng Yan, Jiacheng Shen, Xuchuan Luo, Yangfan Zhou

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出EdgeFlow框架,通过自适应调整LLM参数精度,减少移动设备上LLM冷启动延迟,实验表明其比现有框架提升4.07倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04072 2026-04-13 cs.CL cs.AI 73%

SkillFactory: Self-Distillation For Learning Cognitive Behaviors

SkillFactory:用于学习认知行为的自我蒸馏

Zayne Sprague, Jack Lu, Manya Wadhwa, Sedrick Keh, Mengye Ren, Greg Durrett

机构 * New York University(纽约大学) Toyota Research Institute(丰田研究所)

专题命中 效率与部署 :language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 SkillFactory通过监督微调阶段学习认知技能,为强化学习奠定基础,提升模型在复杂任务中的泛化能力与鲁棒性。

Comments Published at ICLR 2026; code at https://github.com/Zayne-sprague/SkillFactory

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09512 2026-04-13 cs.LG physics.optics 70%

Integrated electro-optic attention nonlinearities for transformers

集成电光注意力非线性性用于变换器

Luis Mickeler, Kai Lion, Alfonso Nardi, Jost Kellner, Pierre Didier, Bhavin J. Shastri, Niao He, Rachel Grange

机构 * ETH Zurich(苏黎世联邦理工学院) Politecnico di Milano(米兰理工大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出利用电光非线性特性替代传统Softmax,提升变换器在视觉和语言任务中的效率与精度,同时降低计算延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09442 2026-04-13 cs.CL 70%

UIPress: Bringing Optical Token Compression to UI-to-Code Generation

UIPress:将光学令牌压缩引入UI到代码生成

Dasen Dai, Shuoqi Li, Ronghao Chen, Huacan Wang, Biao Wu, Qizhen Lan

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) University of Technology Sydney(悉尼科技大学)

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出UIPress,一种轻量级学习压缩模块,通过结合深度可分离卷积、元素引导的空间重加权和Transformer细化,将UI截图的视觉令牌从约6700压缩到256,结合LoRA实现表示差距桥接,提升效率并优于现有方法。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08706 2026-04-13 cs.LG 70%

Efficient RL Training for LLMs with Experience Replay

为大语言模型高效训练的体验回放

Charles Arnal, Vivien Cabannes, Taco Cohen, Julia Kempe, Remi Munos

机构 * FAIR at Meta(Meta FAIR) NYU Courant Institute and CDS(纽约大学库朗数学科学研究所与数据科学中心)

专题命中 效率与部署 :LLM(abstract);post-training(abstract);分类 cs.LG

AI总结 本文研究了大语言模型训练中体验回放的优化设计,通过平衡陈旧性方差、样本多样性与生成成本,证明了严格策略采样在生成成本高时效果不佳,实验表明合理设计的回放缓冲器能显著降低推理计算成本而不影响模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06832 2026-04-13 cs.CL 70%

Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM

Fast-dVLM: 通过直接转换自回归VLM实现高效的块扩散VLM

Chengyue Wu, Shiyi Lan, Yonggan Fu, Sensen Gao, Jin Wang, Jincheng Yu, Jose M. Alvarez, Pavlo Molchanov, Ping Luo, Song Han, Ligeng Zhu, Enze Xie

机构 * The University of Hong Kong(香港大学) NVIDIA(英伟达) MIT(麻省理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Fast-dVLM,通过直接转换自回归VLM实现高效的块扩散VLM,采用KV-cache兼容并行解码和推测块解码,提升推理效率。实验表明其生成质量与自回归模型相当,且通过SGLang和FP8量化实现6倍以上的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05072 2026-04-13 cs.LG 70%

Hierarchical SVG Tokenization: Learning Compact Visual Programs for Scalable Vector Graphics Modeling

分层SVG标记化:为可扩展矢量图形建模学习紧凑的视觉程序

Ximing Xing, Ziteng Xue, Zhenxi Li, Weicong Liang, Linqing Wang, Zhantao Yang, Tiankai Hang, Zijin Yin, Qinglin Lu, Chunyu Wang, Qian Yu

机构 * Tencent(腾讯) Visual Computing Group, Beijing(北京视觉计算组)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出HiVG框架,通过分层标记化提升矢量图形生成的序列效率与空间一致性,解决传统标记化方法在几何结构表达上的不足。

Comments Homepage: https://hy-hivg.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09213 2026-04-13 cs.CV 67%

SHIFT: Steering Hidden Intermediates in Flow Transformers

SHIFT: 在流变换器中操控隐藏中间量

Nina Konovalova, Andrey Kuznetsov, Aibek Alanov

机构 * FusionBrain Lab(FusionBrain实验室) HSE University(高等经济大学) AXXX

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 SHIFT通过在推理时操控中间激活值,实现对DiT扩散模型中概念的去除,同时保持图像质量,支持风格域转换和目标对象的偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏