arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-10 至 2026-08-10 共收录 293 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 56 篇

2608.07193 2026-08-10 cs.LG cs.CV 新提交 86%

An AI4AI Framework for Visual Token Pruning

用于视觉令牌剪枝的AI4AI框架

Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12756 2026-08-10 cs.CV 版本更新 86%

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

VisCo:利用大语言模型作为视觉令牌压缩的内在编码器

Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

专题命中 效率与部署 :language model(title,abstract);large language model(title)

AI总结 研究针对视觉语言模型处理视觉令牌时的高成本问题,提出训练高效的自压缩框架VisCo,将预训练VLM用作内在压缩器,通过参数共享自动编码器压缩视觉信息,实验证明其在压缩率上超先前方法,还能捕获互补表示改进基础模型。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06901 2026-08-10 cs.CV cs.LG 新提交 85%

Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

一次剪枝:面向视觉-语言模型的无需重训练的任务无关剪枝

Minseok Kang, Hyunwoo Kim, Chanyoung Kim, Minwoo Kim, Jaekoo Lee, Dahuin Jung

机构 * Chung-Ang University(中央大学) Soongsil University(崇实大学) Kookmin University(国民大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出名为PORTA的无需重训练的任务无关VLM剪枝框架,通过自适应稀疏分配实现高压缩下的竞争力性能,支持高效VLM压缩。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29678 2026-08-10 cs.CL cs.DC cs.PF 版本更新 85%

TokTier: Exact Stateful CPU+GPU Tokenization for Agentic LLM Serving

TokTier:面向智能体大语言模型服务的精确有状态分词方案

Zhenyu Zhang, Zhichao Cao

机构 * Arizona State University(亚利桑那州立大学)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究提出TokTier,一种面向智能体LLM服务的精确有状态分词方案,通过增量修复、GPU加速分词等技术,将首次令牌生成时间降低16%-34%,饱和请求速率提升至1821次/秒,性能远超现有方案。

Comments 26 pages. Code: https://github.com/asu-idi/toktier

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07076 2026-08-10 cs.SE 新提交 85%

Explanation-Guided Metamorphic Testing of Specialized Language Models: An Empirical Study

面向专用语言模型的解释引导式变异测试:一项实证研究

Xingcheng Chen, Mehmet Besenk, Andrea Stocco

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文通过在三个数据集、四种模型架构下的20种配置开展实证研究,发现解释引导式变异测试生成的经验证故障诱导测试用例是启发式变异策略的2.30倍,可有效评估专用语言模型的鲁棒性。

Comments 20 pages, 4 figures. Accepted at ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06630 2026-08-10 cs.LG 新提交 84%

The Sparsity Whisperer

稀疏低语者

Linghao Kong, Inimai Subramanian, Micah Adler, Dan Alistarh, Dan Gutfreund, Nir Shavit

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文针对大语言模型剪枝忽略输出差异的问题,提出Wisp、Wisp+、Whisper等差异感知剪枝方法,在Llama系列模型上提升了剪枝效果,可与其他技术结合优化性能。

Comments 10 pages, 3 figures. Code available at https://github.com/Shavit-Lab/Whisper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07885 2026-08-10 cs.DC cs.AI cs.CL cs.LG 版本更新 83%

Intelligence per Watt: Measuring Intelligence Efficiency of Local AI

每瓦智能:衡量本地AI的智能效率

Jon Saad-Falcon, Avanika Narayan, Hakki Orhun Akengin, J. Wes Griffin, Herumb Shandilya, Adrian Gamarra Lafuente, Medhya Goel, Rebecca Joseph, Shlok Natarajan, Etash Kumar Guha, Shang Zhu, Ben Athiwaratkun, John Hennessy, Azalia Mirhoseini, Christopher Ré

机构 * Stanford University(斯坦福大学) Together AI

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了本地AI在能源效率和性能上的表现,提出了一种统一的衡量指标IPW,展示了本地推理在重新分配需求方面的能力,并揭示了本地加速器的优化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06763 2026-08-10 cs.LG cs.DC 新提交 83%

CubicQuant: Parametric Non-Uniform Codebooks for High-Throughput LLM Inference with 1-8-Bit Weights

CubicQuant:用于1-8比特权重的高吞吐量大语言模型推理的参数化非均匀码本

Xuetian Gao

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG

AI总结 研究针对LLM推理的权重量化问题,提出CubicQuant参数化非均匀标量格式,其在不同分布下的重构误差优于现有方案,且具备高效GPU执行潜力。

Comments 23 pages, 1 figure. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06628 2026-08-10 cs.LG 新提交 83%

Retrofitting Linear Attention into Diffusion Language Models

将线性注意力改造融入扩散语言模型

Jinha Kim, Younghun Roh, Jaeyeon Kim

机构 * Apple(苹果公司) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出分块混合注意力,将其融入预训练dLLM LLaDA~2.1得到LLaDA-Hybrid,在保持基准性能的同时提升解码吞吐量与并发请求支持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06849 2026-08-10 cs.CL cs.AI 新提交 82%

Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry

头自主性:基于冻结查询-键几何的无数据稀疏注意力

Yehan Yang, Junyuan Shang, Yang Li, Guanqun Zhao, Shuohuan Wang, Dianhai Yu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing University of Posts and Telecommunications(北京邮电大学) Baidu Inc.(百度公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无数据稀疏注意力方法 AoH,通过查询-键投影谱几何识别检索头与流头,在 50% 稀疏度下平均保留全注意力 96.5% 性能,同时显著降低 LLM 的计算延迟与 KV-cache 内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17584 2026-08-10 cs.AR cs.LG 版本更新 81%

CHIME: A Case for Efficient Long-Context Attention-FC Disaggregated Inference with DIMM-PIM

CHIME:基于DIMM-PIM的高效长上下文注意力-全连接分离式推理方案

Qingyuan Liu, Liyan Chen, Haocheng Wang, Yanning Yang, Dong Du, Zhigang Mao, Naifeng Jing, Yubin Xia, Haibo Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 CHIME是首个集成DIMM-PIM的AFD系统,通过无气泡流水线等技术解决同步问题,实现最高5.15倍于HBM-PIM方案的LLM推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06677 2026-08-10 cs.DB 新提交 80%

From Interpretation to Compilation: A Compilation-Based Execution Engine for Semantic Operator Systems

从解释到编译:面向语义算子系统的基于编译的执行引擎

Wenkai Dong, Yifan Wang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出SemBaker编译式执行引擎,通过生成Python函数本地执行替代逐项LLM调用,支持多工具,在200查询的问答工作负载中获4.8-6.3倍加速与5.4-10.7倍成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07066 2026-08-10 cs.AI 新提交 79%

PTQ4SNN: Membrane-Aware Post-Training Quantization for Spiking Neural Networks

PTQ4SNN:面向脉冲神经网络的感知膜后训练量化

Hui Xie, Tong Shi, Haotong Qin, Aishan Liu, Xiaode Liu, Jinyang Guo

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI

AI总结 PTQ4SNN是一种仅用小型校准集联合量化SNN权重与循环膜状态的感知膜后训练量化框架,可在无需重训骨干网络的情况下,于W4量化和约4位膜精度下保持模型准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07033 2026-08-10 cs.AI 新提交 79%

ZIPBrain: Can EEG Foundation Models Be Faster, Locally Deployable, but Accurate?

ZIPBrain:脑电基础模型能否更快、可本地部署且仍保持准确?

Lingwei Li, Yirong Kan, Peng Chen, Xu Cao, Zheng Chen, Yasuhiko Nakashima

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 本研究提出即插即用模块ZIPBrain,利用EEG低SNR特性减少token数量,使EEG基础模型推理速度提升32.7%(最高41.8%)且平均准确率提升1.3%-10.5%,可本地部署。

Comments 7 pages(14 pages including appendix), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06756 2026-08-10 cs.AI 新提交 79%

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence

Capek 0.5:面向具身智能的以执行为中心的视觉语言模型

Ying Chen, Weizhen Li, Zhe Hu, Zhenjiang Li, Rui Jiang, Zhifeng Gu, Lihuang Fang, Jiangping Liu, Lei Yi, Jie Chen

机构 * Xiaopeng(小鹏汽车)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出以执行为中心的具身视觉语言模型Capek 0.5,通过分类法整合四类具身能力,在多维度评估中表现优于初始化模型,可迁移至闭环具身任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06559 2026-08-10 cs.LG 新提交 79%

Bootstrap-Conditioned Action Selection with Tabular Foundation Models

基于 Bootstrap 条件的表格基础模型动作选择

Devansh Gupta, Shiv Tavker, Dmitry Efimov, Suchitra Sathyanarayana, Gitanjali Bhutani, Boris N. Oreshkin

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究提出 BC-ICL 方法,将预训练表格基础模型转化为在线决策随机策略,通过 Bootstrap 重采样与臂-上下文架构优化,在上下文多臂老虎机任务上取得优于基准的遗憾性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06529 2026-08-10 cs.CL 新提交 79%

Lost in Interpolation: Why Predictive Feedback Fails in Diffusion Language Models

迷失在插值中:为什么预测反馈在扩散语言模型中失效

Lavanya Nigam, Ishaan Bansal, Aryan Sood, Vidit Aggarwal, Gaurav Kumar Nayak

机构 * Indian Institute of Technology Roorkee(鲁尔基印度理工学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文针对扩散语言模型中线性插值(LERP)不适用于超球面嵌入空间的问题,提出球形软掩码(S-SM)方法,在1.69亿参数MDLM上实现了MAUVE和困惑度的显著提升。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08390 2026-08-10 cs.LG 版本更新 79%

Inference-Time Scaling of Diffusion Language Models via Trajectory Refinement

通过轨迹细化提升扩散语言模型的推理时间扩展

Meihua Dang, Jiaqi Han, Minkai Xu, Kai Xu, Akash Srivastava, Stefano Ermon

机构 * Stanford University(斯坦福大学) Red Hat AI Innovation(红帽人工智能创新)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本文提出PG-DLM,通过轨迹级细化提升扩散语言模型的推理效率,引入新的缩放轴并实现自适应计算分配,实验显示在奖励引导生成任务中表现更优。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06752 2026-08-10 cs.AI cs.CL 新提交 79%

Mind the Gap: A Dual Knowledge Graph Framework for Unified Multi-task User Intent Inference

弥合差距:用于统一多任务用户意图推理的双知识图谱框架

Tzu-Cheng Peng, Chien Chin Chen, Chih-Hao Ku, Yung-Chun Chang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对在线旅游评论的多任务用户意图推理,提出DKG-MTI双知识图谱框架,结合动态构建的用户特定意图知识图谱与全局酒店知识图谱,经大语言模型处理后,在相关任务上优于现有基线。

Comments Published in the PACIS 2026 Proceedings as a Completed Research Paper. AIS eLibrary: https://aisel.aisnet.org/pacis2026/ai_ml/ai_ml/12/ 17 pages, 5 figures

Journal ref Proceedings of the Pacific Asia Conference on Information Systems (PACIS 2026), Paper 12, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21257 2026-08-10 cs.LG cs.AI 版本更新 79%

An Empirical Study of openPangu Quantization on Ascend NPUs

OpenPangu在昇腾NPU上量化的实证研究

Tong Shi, Jiacheng Wang, Hui Xie, Ying Li, Aishan Liu, Jinyang Guo, Xianglong Liu

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文在昇腾910B1 NPU上系统评估了OpenPangu 1B和7B模型在多种后训练量化方法下的表现,发现8-bit权重量化无损,4-bit对7B模型可行但对1B模型有显著损害,极低比特量化仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11240 2026-08-10 cs.CV 版本更新 78%

Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models

解耦相似性用于大视觉-语言模型中的任务感知token剪枝

Kexin Ma, Jing Xiao, Chaofeng Chen, Geyong Min, Guibo Zhu, Jinqiao Wang, Liang Liao

机构 * Wuhan University(武汉大学) University of Exeter(埃克塞特大学) Chinese Academy of Sciences(中国科学院) Xi'an University of Electronic Science and Technology(西安电子科技大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出DeSAP方法,通过解耦相似性实现精准任务感知token剪枝,提升大视觉-语言模型的效率与性能,实验表明在不同基准和架构上均优于现有方法。

Comments Accepted at ACM Multimedia 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06532 2026-08-10 cs.CL 新提交 74%

Confidence Estimation for Financial Vision-Language Models in Chart and Document Understanding

面向图表与文档理解的金融视觉语言模型的置信度估计

Reza Khanmohammadi, Simerjot Kaur, Charese H. Smiley, Ivan Brugere, Mohammad M. Ghassemi

机构 * Michigan State University(密歇根州立大学) JPMorgan AI Research(摩根大通AI研究院)

专题命中 效率与部署 :language model(title);分类 cs.CL

AI总结 该研究针对金融视觉语言模型,评估7种置信度估计器的分布外迁移效果,发现仅训练得到的探测模型具备校准能力,其中接地感知探测模型可区分模型未使用图表生成的答案与流畅猜测,为金融场景的决策信任提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06713 2026-08-10 cs.AI cs.LG 新提交 73%

MolBioKG: Grounding Out-of-Graph Molecules in Biomedical Knowledge Graphs via Multi-Resolution Structural Anchoring

MolBioKG:通过多分辨率结构锚定将图外分子锚定到生物医学知识图谱中

Yiming Zhang, Hikaru Shindo, Shuan Chen, Kaushalya Madhawa, Jun Jin Choong, Yuna Oikawa, Takashi Fujiwara, Keisuke Ozawa

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 MolBioKG是解决生物医学KG中图外分子冷启动问题的两层系统,通过多分辨率结构锚定实现分子与KG的关联,在多项任务中优于基线并提升关键指标。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28633 2026-08-10 cs.LG cs.AI cs.PF 版本更新 73%

Topology-Aware Data Movement for Disaggregated GPU Inference

面向拆分式GPU推理的拓扑感知数据移动

Sanjeev Rao Ganjihal

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对拆分式GPU推理中现有系统忽略GPU间带宽差异的问题,本文设计拓扑感知传输编排器,通过三项机制实现3至18倍传输延迟降低。

Comments 8 pages, 4 tables, 1 algorithm. v2: corrects MLA compression to 57x (576 dims per DeepSeek); fixes a factor-of-two in GQA sizing rows and all dependent transfer numbers (Llama-70B 4K = 1.3 GB); pipelining band recomputed (76 to 100 percent); PCIe on Gen5; NIXL positioning added; NVLink 5 and 2026 model notes (bandwidth- and bytes-parametric); wording fixes

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07088 2026-08-10 cs.CV cs.AI 新提交 70%

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

RoRA:面向角色的区域分配,用于多模态大语言模型中的视觉令牌剪枝

Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对多模态大语言模型视觉令牌剪枝的高开销问题,提出无训练框架RoRA,通过角色导向的区域分配实现高效剪枝,在多个模型系列上优于基线,大幅降低推理时间且保留高准确率。

Comments 9 pages, 4 figures, 4 tables. Code is available at https://github.com/LukieLuu/RoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06640 2026-08-10 cs.SE cs.AI 新提交 70%

Characterizing the Quality Profile of AI-Generated C++ in Production

刻画生产环境中AI生成C++代码的质量特征

Michael Tran, Fred Lewis, Kun Yang, Saksham Thakur, Aditya Kini, Aditya Patil, Milad Hashemi, Parthasarathy Ranganathan

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过对大型企业2025-2026年352万次代码变更的分析,发现AI生成C++代码质量特征与人类代码不同,针对性反馈可降低其静态分析警告并提升效率。

Comments 21 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06411 2026-08-10 cs.AI cs.CV 新提交 70%

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

学习在多模态大语言模型(MLLMs)中预测中间层注意力以进行视觉token剪枝

Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对MLLMs视觉token剪枝的固定层非最优及计算成本高的问题,提出MAP方法,实现仅保留5.56%视觉token时维持97.5%性能,获3.09倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06876 2026-08-10 cs.CV cs.AI cs.DC cs.LG 新提交 62%

FedVAR: Prototype-Aligned Federated Framework for Video Anomaly Recognition

FedVAR:用于视频异常识别的原型对齐联邦框架

Ghani Haider, Majid Kundroo, Boyun Eom, Dong Hwan Park, Chen Chen, Taehong Kim

机构 * Chungbuk National University(忠北国立大学) Electronics and Telecommunications Research Institute (ETRI)(电子通信研究院) University of Central Florida(中佛罗里达大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对联邦视频异常识别中的语义错位问题,本文提出FedVAR框架,通过视觉语言模型的原型对齐机制缓解错位,实验显示其性能优于现有联邦基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24653 2026-08-10 cs.CL cs.LG 版本更新 62%

Kimi K3: Open Frontier Intelligence

Kimi K3:开放前沿智能

Kimi Team, Tongtong Bai, Yifan Bai, Yiping Bao, M. C., Jianfeng Cai, Xinyuan Cai, Peizhou Cao, Yuxuan Cao, Ziwei Chai, Y. Charles, H. S. Che, Guanduo Chen, Guangyu Chen, Guanzheng Chen, Huarong Chen, Jia Chen, Jianlong Chen, Jun Chen, Kexin Chen, Peng Chen, Ruijue Chen, Wentao Chen, Xin Chen, Yang Chen, Yanru Chen, Yifei Chen, Yingjiang Chen, Yuankun Chen, Yujie Chen, Yutian Chen, Zhirong Chen, Dazhi Cheng, Yean Cheng, Jialei Cui, Jingbing Cui, Anqi Dai, Jiaqi Deng, Hao Ding, Rui Ding, Shaofeng Ding, Mengfan Dong, Mengnan Dong, Yuhao Dong, Yuxin Dong, Angang Du, Chenzhuang Du, Dikang Du, Jusen Du, Yulun Du, Yu Fan, Jing Feng, Qiulin Feng, Yichen Feng, Kelin Fu, Qiang Fu, Fuxuan Gao, Hongcheng Gao, Jingyue Gao, Tong Gao, Weijia Gao, Shangyi Geng, Jie Gong, Linhu Gong, Shengao Gong, Xiaochen Gong, Qizheng Gu, Yicheng Gu, Shuhao Guan, Haiqing Guo, Shiqi Guo, Xiang Guo, Zhengyan Guo, Beixi Hao, Wenxin Hao, Xiaoru Hao, Dailan He, Haotian He, Lehan He, Qi He, Weiran He, Xinran He, Xinyi He, Yibo He, Yunjia He, Chao Hong, Tiange Hong, Hao Hu, Jiaxi Hu, Ruikun Hu, Weiming Hu, Yangyang Hu, Zhenxing Hu, Liang Hua, Jinbin Huang, Ke Huang, Ruiyuan Huang, Siying Huang, Weixiao Huang, Yan Huang, Zhengjie Huang, Zhiqi Huang, Yulong Hui, Chaobo Jia, Yutong Jiang, Zhejun Jiang, Zuoyou Jiang, Wenyi Jin, Xinyi Jin, Yu Jing, Huanjun Kong, Guokun Lai, Aidi Li, Cheng Li, Chengyuan Li, Cong Li, Fang Li, Guanyu Li, Haoyang Li, Jia Li, Junxiong Li, Lei Li, Letian Li, Lincan Li, Weihong Li, Wentao Li, Xintong Li, Yang Li, Yishen Li, Yiwei Li, Yuxiao Li, Zhaowei Li, Zhaoxi Li, Zheming Li, Zhengxiao Li, Zhiyuan Li, Jiawei Lin, Xiaohan Lin, Yibo Lin, Zichao Lin, Ziyan Lin, Bill Liu, Boxiao Liu, Chuan Liu, Liang Liu, Shaowei Liu, Shudong Liu, Shuran Liu, Tianwei Liu, Weizhou Liu, Yangyang Liu, Yanming Liu, Yibo Liu, Yipeng Liu, Zhengying Liu, Zhiheng Liu, Enzhe Lu, Haoyu Lu, Linqiang Lu, Tingzhan Lu, Zhiyuan Lu, Aotian Luo, G. Luo, Junyu Luo, Yifan Luo, B. Lyu, Wenzhou Lyu, Shaoguang Mao, Yuan Mei, Xin Men, Minqing Ni, Yixuan Niu, Siyuan Pan, Shujun Peng, Zhangyang Qi, Ruoyu Qin, ZeChao Qin, Zeyu Qin, Haiquan Qiu, Jianxin Qiu, Jiezhong Qiu, Bowen Qu, Yuhao Qu, Zeyu Shang, Youbo Shao, Han Shen, Jincheng Shi, Juanfeng Shi, Lidong Shi, Shengyuan Shi, Wingchun Siu, Pengwei Song, Xiaoxi Song, Jianlin Su, Yunfeng Su, Zhaochen Su, Lin Sui, Jingsong Sun, Junyao Sun, Shaoning Sun, Shuzhe Sun, Tongyu Sun, Yujun Sun, Yunpeng Tai, Chuning Tang, Heyi Tang, Sirui Tang, Zecheng Tang, Chaoran Tian, Rongpeng Tian, Yu Tian, Wei Tu, Chensi Wang, Chuang Wang, Chunjie Wang, Dinglu Wang, Feng Wang, Hailong Wang, Haiming Wang, Hao Wang, Hao Wang, Huaqing Wang, Hui Wang, Jiayi Wang, Jinglong Wang, Jinhong Wang, Jiuzheng Wang, Linian Wang, Shaobo Wang, Shenzhi Wang, Shuyi Wang, Si Wang, Siyuan Wang, Tianfu Wang, Wenjue Wang, Xingran Wang, Xinmei Wang, Xinyuan Wang, Xusheng Wang, Yalin Wang, Yangkun Wang, Yao Wang, Yaoyu Wang, Yejie Wang, Yiqin Wang, Yucheng Wang, Yuzhi Wang, Zhaoji Wang, Zhaowei Wang, Zhengtao Wang, Zhenhao Wang, Zhongsheng Wang, Zifan Wang, Chu Wei, Ming Wei, Shouxin Wei, Zichen Wen, Fan Wu, Haoning Wu, Rucong Wu, Wenhao Wu, Xiaoxue Wu, Yingcong Wu, Yongqi Wu, Yuxin Wu, Zijian Wu, Xinglang Xian, Chenxuan Xiang, Yuye Xiang, Bocheng Xiao, Chenjun Xiao, Xin Xiao, Jin Xie, Xiaotong Xie, Yifeng Xie, Zhe Xie, Bowei Xing, Yiming Xiong, Baosheng Xu, Boyu Xu, Jiale Xu, Jianfan Xu, Jing Xu, Jinjing Xu, L. H. Xu, Qingtao Xu, Shuyao Xu, Suting Xu, Tiantian Xu, Tianxiang Xu, Weixin Xu, Xinran Xu, Yangchuan Xu, Ye Xu, Yueni Xu, Ziyao Xu, Haonan Xue, Junjie Yan, Yaoyao Yan, Fan Yang, Guangyao Yang, Hao Yang, Junwei Yang, Ruoyu Yang, Wenjie Yang, Xiaofei Yang, Xinyu Yang, Yi Yang, Yiling Yang, Ying Yang, Yuchen Yang, Zhen Yang, Zhilin Yang, Zian Yang, Zuhao Yang, Haotian Yao, Dan Ye, Haoran Ye, Wenjie Ye, Zhanbo Ye, Bohong Yin, Haoxiang Yin, Xietong Yin, Chengzhen Yu, Haozhen Yu, Longhui Yu, Shengnan Yu, Shuying Yu, Tianxiang Yu, Enming Yuan, Mengjie Yuan, Tongtian Yue, Wei Yue, Yang Yue, Dunyuan Zha, Haobing Zhan, B. H. Zhang, Dehao Zhang, Fei Zhang, Hao Zhang, Haoyuan Zhang, Huanyu Zhang, Jiapei Zhang, Jiaxuan Zhang, Jin Zhang, Kaiyi Zhang, Miaozhen Zhang, Puqi Zhang, Qinglei Zhang, Rong Zhang, Rui Zhang, Shaoshuai Zhang, Shiyi Zhang, Xiaobin Zhang, Xiaoyun Zhang, Y. Zhang, Yangkun Zhang, Ye Zhang, Yichi Zhang, Yikun Zhang, Yizhi Zhang, Yongting Zhang, Yu Zhang, Yutao Zhang, Yutong Zhang, Zheng Zhang, Zijing Zhang, Bin Zhao, Chenguang Zhao, Feifan Zhao, Jinglun Zhao, Jinxiang Zhao, Shuai Zhao, Wenshuo Zhao, Xiangyu Zhao, Xuanle Zhao, Yikai Zhao, Zijia Zhao, Haozhi Zheng, Huabin Zheng, Ruihan Zheng, Shaojie Zheng, Tengyang Zheng, Haofeng Zhong, Lei Zhong, Longguang Zhong, M. Zhou, Qiankang Zhou, Runjie Zhou, Ruozhang Zhou, Xinyu Zhou, Yiqiao Zhou, Zaida Zhou, Jinguo Zhu, Liya Zhu, Xinhao Zhu, Yangjunfeng Zhu, Yuxuan Zhu, Zhen Zhu, Chen Zhuang, Weiyu Zhuang, Xinxing Zu

专题命中 效率与部署 :post-training(abstract);分类 cs.CL、cs.LG

AI总结 介绍Kimi K3这一2.8T参数的专家混合模型,基于Kimi Delta Attention等构建,结合多种方法使缩放效率提升约2.5倍。经训练后在多领域强化学习表现出色,虽整体性能略逊最强专有模型,但在多项任务中达前沿水平且优于其他模型,还发布模型权重助力研究。

Comments K3 tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06916 2026-08-10 cs.LG 新提交 57%

MiCoPro: End-to-End Mixed Precision HW/SW Co-design with HW-aware Proxy Model

MiCoPro:面向硬件感知代理模型的端到端混合精度硬件/软件协同设计

Zijun Jiang, Yangdi Lyu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 MiCoPro是面向边缘AI的混合精度硬件/软件协同设计框架,通过硬件感知代理模型实现延迟约束下的最优量化配置,在两类硬件上达成最高40%延迟降低、精度下降不足3%的效果。

Comments 14 pages, 9 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏