arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-03 至 2026-07-03 共收录 347 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 59 篇

2606.03056 2026-07-03 cs.AI 版本更新 87%

SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale

SkillDAG:面向大规模LLM技能选择的自演化类型化技能图

Tong Bai, Zhenglin Wan, Pengfei Zhou, Xingrui Yu, Yang You, Ivor W. Tsang

机构 * Fudan University(复旦大学) National University of Singapore(国立新加坡大学) CFAR A*STAR

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出SkillDAG,通过类型化有向图建模技能间关系,并作为推理时可调用的结构化检索接口,支持在线演化,在ALFWorld和SkillsBench上显著超越基线。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01678 2026-07-03 cs.LG cs.DC 新提交 85%

SCAPE: Accurate and Efficient LLM Training with Extreme Sparse Communication

SCAPE:基于极端稀疏通信的高效准确大语言模型训练

Mingkai Zheng, Junlin Chen, Haotian Xie, Zhao Zhang

机构 * Rutgers University(罗格斯大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出SCAPE分布式优化器,利用AdamS的一阶矩稳定性实现高稀疏度通信,通过基于一阶矩的掩码生成、分片并行和延迟掩码策略,在90%-99%稀疏度下保持模型质量,并减少端到端训练时间达43.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28864 2026-07-03 cs.CV 版本更新 85%

On Test-Time Scaling for Vision-Language Models

关于视觉-语言模型的测试时扩展

Fawaz Sammani, Tzoulio Chamiti, Nikos Deligiannis

机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO部门) imec

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract)

AI总结 本文系统研究了视觉-语言模型(LVLM)的测试时扩展方法,发现小型高性能模型受益最大,性能提升可达30%,并揭示了视觉信息在推理链早期编码后图像令牌贡献显著下降。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07843 2026-07-03 cs.LG cs.AI cs.CL 版本更新 85%

ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models

ThreadWeaver:自适应线程化实现语言模型高效并行推理

Long Lian, Sida Wang, Felix Juefei-Xu, Tsu-Jui Fu, Xiuyu Li, Adam Yala, Trevor Darrell, Alane Suhr, Yuandong Tian, Xi Victoria Lin

机构 * UC Berkeley(伯克利大学) UCSF(旧金山大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ThreadWeaver框架,通过两阶段并行轨迹生成、基于trie的展开设计和并行化感知强化学习,在保持与顺序推理模型相当准确率的同时,显著降低推理延迟。

Comments Accepted as an oral paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02512 2026-07-03 cs.LG cs.AI cs.CL 新提交 83%

Program-as-Weights: A Programming Paradigm for Fuzzy Functions

程序即权重:一种模糊函数的编程范式

Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng

机构 * University of Waterloo(滑铁卢大学) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)

AI总结 提出模糊函数编程范式,通过Program-as-Weights方法将自然语言规范编译为轻量可执行神经工件,在保持性能的同时大幅降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26180 2026-07-03 cs.DB cs.AI cs.CL 版本更新 82%

Evergreen: Efficient Claim Verification for Semantic Aggregates

Evergreen:用于语义聚合的高效声明验证

Alexander W. Lee, Benjamin Han, Shayak Sen, Sam Yeom, Ugur Cetintemel, Anupam Datta

机构 * Brown University(布朗大学) Snowflake Inc.(Snowflake公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 Evergreen将声明验证转化为语义查询处理任务,通过定制优化和溯源捕获,减少LLM调用成本和延迟,提升验证质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25421 2026-07-03 cs.LG cs.AI 版本更新 82%

FED-FSTQ: Fisher-Guided Token Quantization for Communication-Efficient Federated Fine-Tuning of LLMs on Edge Devices

FED-FSTQ:基于Fisher的令牌量化用于边缘设备上通信高效联邦微调大型语言模型

Changyu Li, Shuanghong Huang, Jiashen Liu, Ming Lei, Jidu Xing, Kaishun Wu, Lu Wang, Fei Luo

机构 * School of Computing and Information Technology, Great Bay University(计算与信息学院,大亚湾大学) Beijing Institute of Technology(北京理工大学) University of Warwick(沃里克大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Fed-FSTQ,一种基于Fisher的令牌量化方法,用于在边缘设备上高效联邦微调大型语言模型,通过非均匀混合精度量化和重要性感知令牌选择,减少通信开销并提升训练效率。

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21254 2026-07-03 cs.LG cs.CL 版本更新 82%

Hyperloop Transformers

超环变压器

Abbas Zeitoun, Lucas Torroba-Hennigen, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种改进语言模型参数效率的超环变压器架构,通过循环Transformer和超连接技术,在较少参数下优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01851 2026-07-03 cs.CV 新提交 82%

Geometric Foundation Model Distillation for Efficient Lunar 3D Reconstruction

几何基础模型蒸馏用于高效月球三维重建

Clémentine Grethen, Florient Chouteau, Géraldine Morin, Simone Gasparini

机构 * IRIT, University of Toulouse(图卢兹大学IRIT研究所) Airbus Defence and Space(空中客车防务与航天公司)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 针对硬件受限场景,通过知识蒸馏将MASt3R模型压缩7倍,保留大部分重建精度,提出SVD初始化方法提升训练稳定性,并揭示编码器类型、蒸馏策略等关键因素。

Comments Accepted to ECCV 2026, code can be accessed via https://clementinegrethen.github.io/publications/ECCV.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00224 2026-07-03 math.ST cs.IT cs.LG math.IT stat.ML stat.TH 新提交 81%

Sample Complexities of Estimating Gumbel--Max Watermark Proportions with and without Reduction to Pivotal Statistics

估计Gumbel-Max水印比例(含和不含降为枢轴统计量)的样本复杂度

Shuwen Chai, Qiaosen Wang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究在Gumbel-max水印机制下,估计文档中水印文本比例的问题,比较了完整观测和降为枢轴统计量两种情形,提出了相应估计器并建立了匹配的样本复杂度下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01607 2026-07-03 cs.AR 新提交 80%

MxGLUT: A Reconfigurable LUT-Centric Broadcast Dataflow Accelerator for Mixed-Precision GEMM

MxGLUT:面向混合精度GEMM的可重构LUT中心广播数据流加速器

Weiyu Zhou, Chen Ding, Mingyuan Liu, Liangyu Gan, Yukun Feng, Hao Jia, Haoming Chu, Lirong Zheng, Ning Ma, Yuxiang Huan

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出MxGLUT,一种基于可重构LUT中心广播数据流的混合精度GEMM加速器,通过统一LUT计算机制支持FP8-INT4和FP8-FP8,消除独立FP数据路径,在预填充和解码阶段分别实现2.16倍和1.49倍延迟加速,面积和能效显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01876 2026-07-03 cs.CV cs.AI 新提交 79%

SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models

SAB-LVLM: 面向大型视觉-语言模型的重要性感知二值化

Qi Lyu, Jiahua Dong, Baichen Liu, Xudong Wang, Mingfei Han, Yulun Zhang, Fahad Shahbaz Khan, Salman Khan, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人学国家重点实验室) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出SAB-LVLM方法,通过构建空间重要性图与模态引导整合策略,实现跨层跨模态权重重要性感知的二值化,在约1比特压缩下优于现有二值化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01710 2026-07-03 cs.AI 新提交 79%

Generic Expert Coverage for Pruning SparseMixture-of-Experts Language Models

用于剪枝稀疏混合专家语言模型的通用专家覆盖

Yongqin Zeng, Sicheng Pan, Jiale Wang, Hai-tao Zheng, Hong-Gee Kim, Chunxia Ma, XiuTeng Zhou

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出Generic TB-Coverage方法,利用通用文本语料库对每个专家分别评估效用,通过固定预算覆盖规则保留各语料库的高效用专家,无需下游校准数据即可有效剪枝MoE模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18315 2026-07-03 cs.RO cs.AI cs.CV 版本更新 79%

DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving

DriveVLM-RL:受神经科学启发的强化学习与视觉语言模型用于安全可部署的自动驾驶

Zilin Huang, Zihao Sheng, Zhengyang Wan, Yansong Qu, Junwei You, Sicong Jiang, Sikai Chen

机构 * Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建设工程学院) Department of Civil Engineering, McGill University(麦吉尔大学土木工程系)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出DriveVLM-RL框架,通过双通路架构将VLM集成到RL中,实现安全可部署的自动驾驶,在CARLA中显著优于基线。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01721 2026-07-03 cs.RO 新提交 78%

CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning

CoRe: 结合视觉语言模型反馈的复合奖励用于偏好对齐强化学习

Hexian Ni, Tao Lu, Yinghao Cai

专题命中 效率与部署 :language model(title,abstract)

AI总结 提出CoRe框架,将奖励分解为基于任务知识的正式奖励和从观察中学习的残差奖励,利用视觉语言模型迭代优化奖励,实现无需人工的偏好对齐,在机器人操作任务中优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02509 2026-07-03 cs.CV 版本更新 78%

Rapidly deploying on-device eye tracking by distilling visual foundation models

通过蒸馏视觉基础模型快速部署设备端眼动追踪

Cheng Jiang, Jogendra Kundu, David Colmenares, Fengting Yang, Joseph P Robinson, Ali Behrooz, Yatong An

机构 * Meta Reality Labs(Meta现实实验室) University of Michigan(密歇根大学)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出DistillGaze框架,通过合成数据和真实数据蒸馏视觉基础模型,实现高精度设备端眼动追踪,减少58.62%的中位眼动误差,模型轻量适合实时部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01831 2026-07-03 cs.DC cs.LG 新提交 77%

Lynx: Progressive Speculative Quantization for accelerating KV Transfer in Long-Context Inference

Lynx: 渐进式推测量化加速长上下文推理中的KV传输

Wenchen Han, Gingfung Matthew Yeung, Marco Barletta, William Toner, Amory Hoste, Adam Barker

机构 * University College London(伦敦大学学院) Huawei(华为)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对长上下文推理中KV缓存传输延迟问题,提出Lynx系统,通过将KV缓存分为高优先级Anchor流和低优先级Residual流,实现渐进式传输和推测解码,在降低首令牌延迟的同时保持高精度。

Comments 15 pages, 12 figures. This manuscript was originally submitted to SIGCOMM '26 in February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01480 2026-07-03 cs.AI cs.LG 新提交 76%

Procedural Memory Distillation: Online Reflection for Self-Improving Language Models

程序记忆蒸馏:用于自我改进语言模型的在线反思

Ye Liu, Srijan Bansal, Bo Pang, Yang Li, Zeyu Leo Liu, Yifei Ming, Zixuan Ke, Shafiq Joty, Semih Yavuz

专题命中 效率与部署 :language model(title);分类 cs.AI、cs.LG

AI总结 提出程序记忆蒸馏(PMD),通过在线提取跨回合信号(轨迹、反思策略、行为模式)并蒸馏到策略权重中,使语言模型在推理时无需额外记忆,相比SDPO在SCIKNOWEVAL和LIVECODEBENCH上分别提升3.8-5.5%和7.9-13.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22048 2026-07-03 cs.SE 版本更新 75%

Dynamic analysis enhances issue resolution

动态分析增强问题解决

Mingwei Liu, Zihao Wang, Zhenxi Chen, Zheng Pei, Yanlin Wang, Zibin Zheng

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出DAIRA框架,通过动态分析提升代码缺陷修复效率,实现高准确率和低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02234 2026-07-03 cs.AI cs.LG 新提交 73%

Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

纯化OPSD:在不失去思考能力的情况下进行在线自我蒸馏

Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学) Jilin University(吉林大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对在线自我蒸馏(OPSD)在长链思维推理模型中失效的问题,通过分解教师监督信号,发现参考诱导成分导致死记硬背,提出基于点互信息的参考隔离方法,在保持模型认知行为的同时提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01978 2026-07-03 cs.AI cs.CL cs.CV 新提交 73%

Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing

多模态知识编辑范围泛化用于在线递归MLLM编辑

Siyuan Li, Youyuan Zhang, Ruitong Liu, Junxi Wang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) Fudan University(复旦大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对在线多模态知识编辑中编辑范围难以控制的问题,提出ScopeEdit方法,通过模态局部吸收分支和证据门控共享泛化分支实现范围分离的在线编辑,在保持可靠性的同时提升跨模态泛化与无关输入隔离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01241 2026-07-03 cs.CL cs.AI 新提交 73%

Mapping Text to Multiplex Graph: Prompt Compression as Lévy Walk-Guided Graph Pruning

将文本映射到多重图:基于莱维游走引导的图剪枝的提示压缩

Yaxin Gao, Yao Lu, Jinhong Deng, Jiaqi Nie, Zhe Tang, Jian Zhang, Zhaowei Zhu, Shanqing Yu, Qi Xuan, Joey Tianyi Zhou

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出RAGP方法,将提示压缩建模为多重图上的冗余感知图剪枝,利用莱维游走高效识别非冗余节点,在4倍压缩比下平均得分49.3,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02376 2026-07-03 cs.AI cs.MA 新提交 70%

Hardware-Enforced Semantic Coordination for Safety-Critical Real-Time Autonomous Systems

面向安全关键实时自主系统的硬件强制语义协调

Uwe M. Borghoff, Paolo Bottoni, Remo Pareschi

机构 * Department of Computer Science University of the Bundeswehr Munich Neubiberg, Germany Department of Computer Science Sapienza University of Rome Rome, Italy STAKE Lab University of Molise Campobasso, Italy

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对异构组件并发运行下的协调问题,提出基于FPGA的硬件强制语义协调架构,将TB-CSPN协调机制映射到硬件原语,实现确定性协调和安全保障。

Comments 1 figure, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02371 2026-07-03 cs.CV cs.AI 新提交 70%

VisionAId: An Offline-First Multimodal Android Assistant for People with Visual Impairment, Featuring Personalized Object Retrieval

VisionAId:一款面向视障人士的离线优先多模态安卓助手,具备个性化物品检索功能

Cristian-Gabriel Florea, Stelian Spînu

机构 * The Military Technical Academy ``Ferdinand I'', Bucharest, Romania(费迪南军事技术学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出离线优先多模态安卓助手VisionAId,集成六种端上深度学习模型,通过少样本流水线实现个性化物品检索,结合AR标记、空间音频和距离比例触觉反馈引导用户。

Comments 8 pages, 4 figures. Project repository available at: github.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01609 2026-07-03 cs.LG 新提交 70%

SINA: A Fully Automated Circuit Schematic Image to Netlist Generator Using Artificial Intelligence

SINA: 一种使用人工智能的全自动电路原理图图像到网表生成器

Saoud Aldowaish, Yashwanth Karumanchi, Kai-Chen Chiang, Mohammed Ayman Habib, Finn Murphy, Rishen Cao, Morteza Fayazi

机构 * The Department of Electrical and Computer Engineering, University of Utah(犹他大学电气与计算机工程系) The Department of Electrical, Computer & Energy Engineering, University of Colorado Boulder(科罗拉多大学博尔德分校电气、计算机与能源工程系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出SINA,一种全自动开源流水线,集成深度学习、连通分量标记、OCR和视觉语言模型,实现从电路原理图图像到网表的转换,在IC和PCB级别均达到96.67%的生成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01276 2026-07-03 cs.CR cs.IR cs.LG 新提交 70%

Embedding Inference Attack

嵌入推理攻击

Cedric Fitiavana Raelijohn, Sébastien Gambs, Jean-Francois Rajotte

机构 * Université du Québec à Montréal(魁北克大学蒙特利尔分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究黑盒信息检索系统中,攻击者仅通过观察检索文档集合即可推断嵌入模型类型的方法,并验证其在含重排序器和RAG系统中的有效性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00466 2026-07-03 cs.DC 新提交 67%

ELDR: Expert-Locality-Aware Decode Routing for PD-Disaggregated MoE Serving

ELDR: 面向PD分离MoE服务的专家局部感知解码路由

Sangjin Choi, Sukmin Cho, Yifan Xiong, Ziyue Yang, Youngjin Kwon, Peng Cheng

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对PD分离MoE服务中解码负载不均衡导致延迟差异的问题,提出ELDR路由方法,利用预填充专家签名预测解码专家激活,通过平衡K-means分区和局部性感知路由,在vLLM上实现中位TPOT降低5.9-13.9%。

Comments 15 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09921 2026-07-03 cs.CV 版本更新 67%

WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition

WikiCLIP: 一种高效的开放领域视觉实体识别对比基线

Shan Ning, Longtian Qiu, Jiaxuan Sun, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心) Lingang Laboratory(临港实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出WikiCLIP,通过结合大语言模型嵌入和视觉引导的知识适配器,高效解决开放领域视觉实体识别问题,在OVEN基准测试中显著超越现有基线。

Comments Accepted by CVPR26, codes and weights are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02461 2026-07-03 cs.CV cs.AI cs.LG 新提交 62%

OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers

OrbitQuant: 图像和视频扩散Transformer的数据无关量化

Donghyun Lee, Jitesh Chavan, Duy Nguyen, Sam Huang, Liming Jiang, Priyadarshini Panda, Timo Mertens, Saurabh Shukla

机构 * Cantina Labs(Cantina实验室) University of Southern California(南加州大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出数据无关量化方法OrbitQuant,通过归一化旋转基和Lloyd-Max码本,无需校准数据即可对扩散Transformer的权重和激活进行低比特量化,在多个模型和模态上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02119 2026-07-03 eess.AS cs.AI 新提交 57%

An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation

基于vLLM的高效统一音频理解与生成推理管线

Haoran Wang, Jinchuan Tian, Siddhant Arora, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出基于vLLM的推理管线,通过扩展自回归解码支持多流采样和延迟模式解交织,并利用协同调度实现CFG下80%的非CFG吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏