arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1921 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1921 篇

2607.01978 2026-07-03 cs.AI cs.CL cs.CV 新提交 73%

Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing

多模态知识编辑范围泛化用于在线递归MLLM编辑

Siyuan Li, Youyuan Zhang, Ruitong Liu, Junxi Wang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) Fudan University(复旦大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对在线多模态知识编辑中编辑范围难以控制的问题,提出ScopeEdit方法,通过模态局部吸收分支和证据门控共享泛化分支实现范围分离的在线编辑,在保持可靠性的同时提升跨模态泛化与无关输入隔离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01241 2026-07-03 cs.CL cs.AI 新提交 73%

Mapping Text to Multiplex Graph: Prompt Compression as Lévy Walk-Guided Graph Pruning

将文本映射到多重图:基于莱维游走引导的图剪枝的提示压缩

Yaxin Gao, Yao Lu, Jinhong Deng, Jiaqi Nie, Zhe Tang, Jian Zhang, Zhaowei Zhu, Shanqing Yu, Qi Xuan, Joey Tianyi Zhou

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出RAGP方法,将提示压缩建模为多重图上的冗余感知图剪枝,利用莱维游走高效识别非冗余节点,在4倍压缩比下平均得分49.3,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01115 2026-07-02 cs.CL cs.AI 新提交 73%

Towards Developing a Multimodal Chat Assistant for University Stakeholders: RAG-based Approach

面向大学利益相关者的多模态聊天助手开发:基于RAG的方法

Md Abu Hanif Shaikh, Abdullah Al Shafi

机构 * Institute of Information and Communication Technology, Khulna University of Engineering & Technology(信息与通信技术研究所,库尔纳工程技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大学利益相关者获取信息困难的问题,提出基于检索增强生成的多模态聊天系统,结合大语言模型与语义检索,支持文本和图像查询,将幻觉率从31.7%降至6.6%。

Comments Accepted at 2025 28th International Conference on Computer and Information Technology (ICCIT)

Journal ref 2025 28th International Conference on Computer and Information Technology (ICCIT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30911 2026-07-02 cs.AI cs.LG cs.MA 新提交 73%

Why Solve It Twice? Hierarchical Accumulation of Skills for Transfer-Efficient ML Engineering

为何解决两次?面向迁移高效机器学习工程的层次化技能积累

Yongbin Kim, Yashar Talebirad, Osmar R. Zaiane

机构 * Department of Computing Science, University of Alberta(阿尔伯塔大学计算机科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出HASTE层次化多智能体系统,通过三级范围(全局、领域、竞赛特定)组织跨竞赛知识,在MLE-Bench Lite基准上实现77.3%奖牌率,冷启动相比热启动减少52%迭代次数。

Comments 19 pages. Accepted to the 5th Workshop on Deep Learning for Code (DL4C), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30923 2026-07-01 cs.LG cs.AI stat.ML 新提交 73%

Behavior Cloning is Not All You Need: The Optimality of On-Policy Distillation for Noisy Expert Feedback

行为克隆并非万能:带噪声专家反馈的在线策略蒸馏的最优性

Ved Sriraman, Peihan Liu, Daniel Hsu, Adam Block

机构 * Columbia University(哥伦比亚大学)

专题命中 效率与部署 :language model(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 针对噪声专家反馈场景,理论证明离线模仿学习样本复杂度指数增长,而在线策略蒸馏可实现多项式依赖,解释了为何在线方法优于离线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30875 2026-07-01 cs.CV cs.AI cs.LG 新提交 73%

The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning

标签模仿游戏:用于零样本伪标签剪枝的图灵测试网络

Brent A. Griffin, Jason J. Corso

专题命中 效率与部署 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出图灵测试网络(TTN)作为任务无关的“裁判”,通过对抗性交互在数据集上下文中评估伪标签,无需监督或重训练即可提升标签准确性,并实现零样本任务迁移。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27791 2026-06-29 cs.CL cs.AI 新提交 73%

NLL-Guided Full-Attention Layer Selection for Training-Free Sliding-Window Adaptation

NLL引导的全注意力层选择用于无训练滑动窗口适配

Qiong Tang, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao

机构 * Analemma

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出NLL引导的无训练层选择方法,通过计算负对数似然退化度量每层重要性,在仅用1/4全注意力层时达到与1/2基线相当的准确率,大幅降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27361 2026-06-26 cs.LG cs.AI 新提交 73%

Autoregressive Boltzmann Generators

自回归玻尔兹曼生成器

Danyal Rehman, Charlie B. Tan, Yoshua Bengio, Avishek Joey Bose, Alexander Tong

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出自回归玻尔兹曼生成器(ArBG),通过自回归建模替代基于流的模型,克服拓扑约束并提升可扩展性,在分子系统采样中显著优于现有方法,并在8残基系统上将零样本能量误差降低60%以上。

Comments ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25152 2026-06-25 cs.CL cs.AI 新提交 73%

Hitting a Moving Target: Test-Time Adaptation for AI Text Detection under Continual Distribution Shift

击中移动目标:持续分布漂移下AI文本检测的测试时适应

Kevin Ren, Manish Raghavan, Nikhil Garg

机构 * Cornell Tech(康奈尔科技) MIT(麻省理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种基于半监督学习的测试时适应方法,利用推理时未标记样本的同质性,应对AI文本检测中持续出现的分布漂移,显著优于现有监督检测器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24957 2026-06-25 cs.CL cs.LG 新提交 73%

Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding

Dustin: 用于高效长上下文推测解码的草稿增强稀疏验证

WenHung Lee, Jian-Jia Chen, Xiaolin Lin, Pei-Shuo Wang, Chi-Chih Chang, Chun-Che Yang, Ning-Chi Huang, Grace Li Zhang, Kai-Chiang Wu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Cornell University(康奈尔大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出Dustin框架,利用草稿模型的前瞻信号和目标模型的历史注意力,在推测解码中实现高效稀疏验证,显著加速长上下文生成。

Comments Accepted to ICML 2026. 9 pages main text, includes references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24915 2026-06-25 cs.CL cs.AI cs.IR 新提交 73%

Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction

错误感知的TF-IDF检索增强生成用于ASR错误纠正

Mohammad Aref Jafari-Raddani

机构 * Department of Computer Engineering, Qom University of Technology(库姆科技大学计算机工程系) Asa Electronic Akhtaran(阿萨电子阿赫塔兰公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种纯词法的错误感知检索增强生成框架,通过对称文本归一化和基于历史错误的稀疏对角惩罚矩阵,将FLEURS波斯语子集的错误感知命中率从53.7%提升至90.9%,最终词错误率从23.06%降至18.83%。

Comments 4 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24623 2026-06-24 cs.CL cs.AI 新提交 73%

Privacy-Preserving RAG via Multi-Agent Semantic Rewriting: Achieving Confidentiality Without Compromising Contextual Fidelity

基于多智能体语义重写的隐私保护检索增强生成:在不损害上下文保真度的情况下实现机密性

Yuanhe Zhao, Tianyu Zhang, Huafei Xing, Derek F. Wong, Jianbin Li, Tao Fang

机构 * School of Control and Computer Engineering, North China Electric Power University(华北电力大学控制与计算机工程学院) Department of Computer & Information Science & Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系) NLP2CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系NLP2CT实验室) Institute of International Language Services Studies, Macau Millennium College(澳门千禧学院国际语言服务研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体框架,通过语义重写净化检索内容,在去除敏感标识的同时保留语义核心,显著降低隐私泄露并保持上下文保真度。

Comments This full manuscript contains 23 pages and has been formally accepted for publication in Information Processing & Management (Elsevier IPM). Tao Fang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24460 2026-06-24 cs.CL cs.AI 新提交 73%

The African Language Tax: Quantifying the Cost, Latency, and Context Penalty of Tokenizing African Languages in Frontier LLMs

非洲语言税:量化前沿大语言模型中标记化非洲语言的成本、延迟和上下文惩罚

Olaoye Anthony Somide

机构 * DataLens Africa Research(DataLens 非洲研究) CipherSense AI Technologies Ltd(CipherSense 人工智能科技有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过平行语料库测量20种非洲语言在11种前沿分词器上的标记化惩罚,发现非洲语言平均标记数比英语高1.88倍(N'Ko语最高达8.92倍),导致推理成本增加8.9倍、有效上下文窗口仅剩11%,并发布开源测量工具和缓解指南。

Comments 40 pages, 5 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11552 2026-06-24 cs.CL cs.LG 新提交 73%

Teaching Diffusion to Speculate Left-to-Right

教导扩散模型从左到右推测

Lexington Whalen, Yuki Ito, Ryo Sakamoto

机构 * Lexington Whalen Yuki Ito Ryo Sakamoto

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对自回归解码的推理瓶颈,提出三种训练时干预方法(位置加权、首次错误焦点损失、链损失)来弥合块扩散草稿模型的双向生成与自回归目标模型从左到右验证之间的不对称性,显著提升接受草稿长度。

Comments 13 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23124 2026-06-23 cs.CL cs.AI 新提交 73%

PRIDE: Privileged Information-enhanced Distillation for Empathetic Dialogue Generation

PRIDE: 特权信息增强的共情对话生成蒸馏方法

Jiaqiang Wu, Zhouan Zhu, Shangfei Wang

机构 * Anhui Robot Technology Standard Innovation Base, School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院安徽机器人技术标准创新基地)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PRIDE方法,利用训练时可用但推理时不可用的特权信息(如心理标注或未来事件摘要),通过共情推理提示、多源注意力机制和双对齐损失,将大模型的共情推理能力蒸馏到小模型,在资源受限场景下保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22716 2026-06-23 cs.AI cs.CL 新提交 73%

Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards

超越惩罚错误:通过自适应仅正确奖励稳定大型推理模型的效率训练

Jungseob Lee, Seungyoon Lee, Seongtae Hong, Minhyuk Kim, Chanjun Park, Heuiseok Lim

机构 * Korea University(高丽大学) Soongsil University(崇实大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对GRPO中长度惩罚导致奖励崩溃的问题,提出ACOER方法,通过仅对正确回答给予简洁奖励并动态调整预算,在数学推理任务中准确率提升且生成token减少超60%。

Comments 13 pages, 3 figures, 7 tables. Code: https://github.com/js-lee-AI/ACOER

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22578 2026-06-23 cs.CL cs.AI 新提交 73%

Context-Aware Distillation and Ablation for Text2DSL

上下文感知的蒸馏与消融方法用于Text2DSL

Alexander V. Kozachok, Alexander M. Nazimov, Shamil G. Magomedov

机构 * MIREA – Russian Technological University(俄罗斯国立研究大学-莫斯科电子技术学院) Academy of the Federal Guard Service of the Russian Federation(俄罗斯联邦警卫局学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过上下文感知蒸馏将PolkitBench语料库扩展到10,073对,并基于新语料库对结构化上下文进行因子消融实验,发现词汇表对语义质量贡献最大,API和BNF对结构有效性贡献显著。

Comments 21 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21973 2026-06-23 cs.LG cs.AI 新提交 73%

SPOTR: Spatio-temporal Pooling One-Token Reconstruction for Universal Physiological Signal Self-supervised Learning

SPOTR: 面向通用生理信号自监督学习的时空池化单令牌重建

Yiyu Gui, Mingzhi Chen, Yuesheng Zhu, Guibo Luo, Yuchao Yang

机构 * New Cornerstone Science Laboratory, Guangdong Provincial Key Laboratory of In-Memory Computing Chips, Shenzhen Graduate School, Peking University(新基石科学实验室,广东省存算一体芯片重点实验室,北京大学深圳研究生院) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸式媒体技术重点实验室,北京大学深圳研究生院)

专题命中 效率与部署 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出SPOTR框架,通过单令牌全局瓶颈压缩-重建预训练,解决生理信号自监督学习在异构数据集上的性能瓶颈,在线性探测下显著提升AUC并降低计算开销。

Comments The paper has been accepted by IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19719 2026-06-23 cs.IR cs.CL cs.LG 新提交 73%

Closing the Calibration Gap in Semantic Caching

缩小语义缓存中的校准差距

Aditeya Baral, Radoslav Ralev, Iliya Sotirov Zhechev, Srijith Rajamohan, Jen Agarwal

机构 * New York University(纽约大学) Redis(Redis公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对语义缓存系统中离线指标与部署性能的差距,提出P-CHR AUC和CRR指标,发现校准差距由训练目标主导,模型选择本质是校准问题。

Comments 23 pages, 2 figures. Source code: https://github.com/aditeyabaral/calibration-gap-semantic-caching ; Models and Datasets: https://huggingface.co/redis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19025 2026-06-23 cs.LG cs.AI cs.DC cs.SY eess.SY 新提交 73%

FoMoE: Breaking the Full-Replica Barrier with a Federation of MoEs

FoMoE: 打破全副本壁垒的专家混合联邦系统

Lorenzo Sani, Zeyu Cao, Meghdad Kurmanji, Alex Iacob, Andrej Jovanovic, Yan Gao, Wanru Zhao, Nicholas D. Lane

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, UK(剑桥大学计算机科学与技术系) Flower Labs, UK(Flower Labs)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出FoMoE系统,通过跨工作节点分区专家层打破全副本范式,结合部分专家复制和跳跃令牌机制,显著降低通信开销并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20005 2026-06-19 cs.LG cs.AI 新提交 73%

StreamKL: Fast and Memory-Efficient KL Divergence for Boosting Attention Distillation

StreamKL: 快速且内存高效的KL散度用于提升注意力蒸馏

Guangda Liu, Yiquan Wang, Chengwei Li, Wenhao Chen, Jing Lin, Yiwu Yao, Danning Ke, Wenchao Ding, Jieru Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为) Fudan University(复旦大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出StreamKL,首个融合GPU原语,通过在线公式和逐块重计算将注意力蒸馏的内存和IO成本从O(N_QN_K)降至O(1),实现高达43倍前向和14倍反向加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19946 2026-06-19 cs.CL cs.LG 新提交 73%

GEMS: Geometric Constraints Enable Multi-Semantic Superposition in LLMs

GEMS: 几何约束使LLM中多语义叠加成为可能

Yu Deng

专题命中 效率与部署 :LLM(title_cn);分类 cs.CL、cs.LG

AI总结 提出GEMS方法,通过范数保持加权叠加、目标注意力路径注入和实时正交化两个几何约束,解决无训练多方向激活干预中的分布偏差和方向干扰问题,在GSM8K上保持98%准确率。

Comments 30 pages, 5 figures, 20 tables. Code and logs are available at: https://github.com/LuLu663939/gems-multi-semantic-steering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19348 2026-06-19 cs.CL cs.AI 新提交 73%

DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence

DeepSeek-V4: 迈向高效百万令牌上下文智能

DeepSeek-AI, Anyi Xu, Bangcai Lin, Bing Xue, Bingxuan Wang, Bingzheng Xu, Bochao Wu, Bowei Zhang, Chaofan Lin, Chen Dong, Chenchen Ling, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chengyu Hou, Chenhao Xu, Chenze Shao, Chong Ruan, Conner Sun, Damai Dai, Daya Guo, Dejian Yang, Deli Chen, Donghao Li, Dongjie Ji, Erhang Li, Fang Wei, Fangyun Lin, Fangzhou Yuan, Feiyu Xia, Fucong Dai, Guangbo Hao, Guanting Chen, Guoai Cao, Guolai Meng, Guowei Li, Han Yu, Han Zhang, Hanwei Xu, Hao Li, Haofen Liang, Haoling Zhang, Haoming Luo, Haoran Wei, Haotian Yuan, Haowei Zhang, Haowen Luo, Haoyu Chen, Haozhe Ji, Hengqing Zhang, Honghui Ding, Hongxuan Tang, Huanqi Cao, Huazuo Gao, Hui Qu, Hui Zeng, J Yang, JQ Zhu, Jia Luo, Jia Song, Jia Yu, Jialiang Huang, Jialu Cai, Jian Liang, Jiangting Zhou, Jiasheng Ye, Jiashi Li, Jiaxin Xu, Jiewen Hu, Jieyu Yang, Jin Chen, Jin Yan, Jingchang Chen, Jingli Zhou, Jingting Xiang, Jingyang Yuan, Jingyuan Cheng, Jingzi Zhou, Jinhua Zhu, Jiping Yu, Joseph Sun, Jun Ran, Junguang Jiang, Junjie Qiu, Junlong Li, Junmin Zheng, Junxiao Song, Kai Dong, Kaige Gao, Kang Guan, Kexing Zhou, Kezhao Huang, Kuai Yu, Lean Wang, Lecong Zhang, Lei Wang, Leyi Xia, Li Zhang, Liang Zhao, Lihua Guo, Lingxiao Luo, Linwang Ma, Linyan Zhu, Litong Wang, Liyu Cai, Liyue Zhang, Longhao Chen, MS Di, MY Xu, Max Mei, Miaojun Wang, Mingchuan Zhang, Minghua Zhang, Minghui Tang, Mingming Li, Mingxu Zhou, Minmin Han, Ning Wang, Panpan Huang, Panpan Wang, Peixin Cong, Peiyi Wang, Peng Zhang, Qiancheng Wang, Qihao Zhu, Qingyang Li, Qinyu Chen, Qiushi Du, Qiwei Jiang, Rui Tian, Ruifan Xu, Ruijie Lu, Ruiling Xu, Ruiqi Ge, Ruisong Zhang, Ruizhe Pan, Runji Wang, Runqian Chen, Runqiu Yin, Runxin Xu, Ruomeng Shen, Ruoyu Zhang, Ruyi Chen, SH Liu, Shanghao Lu, Shangmian Sun, Shangyan Zhou, Shanhuang Chen, Shaofei Cai, Shaoheng Nie, Shaoqing Wu, Shaoyuan Chen, Shengding Hu, Shengyu Liu, Shiqiang Hu, Shirong Ma, Shiyu Wang, Shuiping Yu, Shunfeng Zhou, Shuting Pan, Shuying Yu, Songyang Zhou, Tao Ni, Tao Yun, Tian Jin, Tian Pei, Tian Ye, Tianle Lin, Tianran Ji, Tianyi Cui, Tianyuan Yue, Tingting Yu, Tun Wang, W Zhang, WL Xiao, Wangding Zeng, Wei An, Weilin Zhao, Wen Liu, Wenfeng Liang, Wenjie Pang, Wenjing Luo, Wenjing Yao, Wenjun Gao, Wenkai Yang, Wenlve Huang, Wenqing Hou, Wentao Zhang, Wenting Ma, Xi Gao, Xiang He, Xiangwen Wang, Xianzu Wang, Xiao Bi, Xiaodong Liu, Xiaohan Wang, Xiaokang Chen, Xiaokang Zhang, Xiaotao Nie, Xiaowen Sun, Xiaoxiang Wang, Xin Cheng, Xin Liu, Xin Xie, Xingchao Liu, Xingchen Liu, Xingkai Yu, Xingyou Li, Xinyu Yang, Xinyu Zhang, Xu Chen, Xuanyu Wang, Xuecheng Su, Xueyin Chen, Xuheng Lin, Xuwei Fu, YC Yan, YQ Wang, YW Ma, Yanfeng Luo, Yang Zhang, Yanhong Xu, Yanru Ma, Yanwen Huang, Yao Li, Yao Li, Yao Xu, Yao Zhao, Yaofeng Sun, Yaohui Wang, Yi Qian, Yi Shao, Yi Yu, Yichao Zhang, Yifan Ding, Yifan Shi, Yijia Wu, Yiliang Xiong, Yiling Ma, Ying He, Ying Tang, Ying Zhou, Yingjia Luo, Yinmin Zhong, Yishi Piao, Yisong Wang, Yixiang Zhang, Yixiao Chen, Yixuan Tan, Yixuan Wei, Yiyang Ma, Yiyuan Liu, Yonglun Yang, Yongqiang Guo, Yongtong Wu, Yu Wu, YuKun Li, Yuan Cheng, Yuan Ou, Yuanfan Xu, Yuanhao Li, Yuduan Wang, Yuehan Yang, Yuer Xu, Yuhan Wu, Yuhao Meng, Yuheng Zou, Yukun Zha, Yunfan Xiong, Yupeng Chen, Yuping Lin, Yuqian Cao, Yuqian Wang, Yushun Zhang, Yuting Yan, Yutong Lin, Yuxian Gu, Yuxiang Luo, Yuxiang You, Yuxuan Liu, Yuxuan Zhou, Yuyang Zhou, Yuzhen Huang, ZF Wu, Zehao Wang, Zehua Zhao, Zehui Ren, Zekai Zhang, Zhangli Sha, Zhe Fu, Zhe Ju, Zhean Xu, Zhenda Xie, Zhengyan Zhang, Zheren Gao, Zhewen Hao, Zhibin Gou, Zhicheng Ma, Zhigang Yan, Zhihong Shao, Zhixian Huang, Zhixuan Chen, Zhiyu Wu, Zhizhou Ren, Zhongyu Wu, Zhuoshu Li, Zhuping Zhang, Zian Xu, Zihao Wang, Zihua Qu, Zihui Gu, Zijia Zhu, Zilin Li, Zipeng Zhang, Ziwei Xie, Ziyi Gao, Ziyi Wan, Zizheng Pan, Zongqing Yao

机构 * DeepSeek-AI(深度求索人工智能)

专题命中 效率与部署 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出DeepSeek-V4系列MoE模型,通过混合注意力架构、流形约束超连接和Muon优化器,实现百万令牌上下文的高效推理,在核心任务上超越前代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17199 2026-06-17 cs.LG cs.AI 新提交 73%

PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation

PowerOPD:利用有界幂变换稳定在线策略蒸馏

Anhao Zhao, Junlong Tong, Yingqi Fan, Ping Nie, Wenjie Li, Xiaoyu Shen

机构 * Eastern Institute of Technology, Ningbo(宁波东方理工大学) The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) University of Waterloo(滑铁卢大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对在线策略蒸馏中log-ratio奖励无界导致训练不稳定问题,提出基于Box-Cox幂变换的有界、符号一致奖励族PowerOPD,在数学推理任务上平均提升Avg@8/Pass@8达+6.37/+5.71,并降低59.2%时间与23.1%显存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17118 2026-06-17 cs.LG cs.AI 新提交 73%

MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs

MODE: 面向MoE多模态大语言模型的模态分解专家级混合精度量化

Yuanteng Chen, Peisong Wang, Zhilei Liu, Nanxin Zeng, Yuantian Shao, Shiqiang Lang, Tao Liu, Chuangyi Li, Qinghao Hu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对MoE多模态大语言模型在专家重要性估计中存在的跨模态和视觉内偏差,提出模态分解的专家级混合精度量化框架MODE,通过分解选择频率、过滤冗余视觉令牌并评估模态敏感性,在给定预算下分配比特宽度,在W3A16下平均性能损失控制在2.9%以内。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16112 2026-06-16 cs.LG cs.AI 新提交 73%

Scaling Adaptive Depth with Norm-Agnostic Residual Networks

缩放自适应深度:范数无关残差网络

Tomás Figliolia, Beren Millidge

机构 * Zyphra San Francisco, CA(Zyphra旧金山加州)

专题命中 效率与部署 :pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对残差网络中残差流范数随深度增长导致深层更新被抑制的问题,提出范数无关残差架构NAG,通过分离幅度和方向信息保持各层贡献,并实现可解释的自适应深度跳过机制,在等计算量下匹配全深度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16059 2026-06-16 cs.LG cs.AI 新提交 73%

Mojo: A Promising Tool for Scalable Financial AI Efficiency

Mojo:可扩展金融AI效率的有前景工具

Henry Han

机构 * Data Science and Artificial Intelligence Innovation Laboratory, School of Engineering and Computer Science, Baylor University(贝勒大学工程与计算机科学学院数据科学与人工智能创新实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文介绍Mojo语言,通过MLIR编译和确定性内核设计,解决量化金融中Python到C++的性能差距与数值不一致问题,在金融AI工作负载上实现20-180倍加速。

Comments 15, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12243 2026-06-11 cs.CL cs.AI 新提交 73%

VIA-SD: Verification via Intra-Model Routing for Speculative Decoding

VIA-SD:通过模型内路由进行推测解码的验证

Yuchen Xian, Yang He, Yunqiu Xu, Yi Yang

机构 * ReLER, The State Key Lab of Brain Machine Intelligence, Zhejiang University(脑机智能国家重点实验室,浙江大学) College of Artificial Intelligence, Zhejiang University(人工智能学院,浙江大学) CFAR, Agency for Science, Technology and Research, Singapore(科学与技术研究局,新加坡) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出VIA-SD多级验证框架,利用从完整验证器派生的精简验证器处理中等置信度令牌,减少大模型调用,在多个任务上实现10-20%加速。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11207 2026-06-11 cs.AI cs.CL 新提交 73%

From Explicit Elements to Implicit Intent: A Predefined Library for Auditable Behavioral Inference

从显式元素到隐式意图:用于可审计行为推断的预定义库

Liu hung ming

机构 * PARRAWA AI

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出SemantiClean框架,通过共享元素库从电商会话数据中提取结构化语义信号,驱动可插拔推断目标,优先保证可审计性和可复现性,而非单纯追求精度。

Comments 20 pages, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10935 2026-06-10 cs.LG cs.AI 新提交 73%

CLP: Collocation-Length Prediction for Zero-Loss Adaptive Multi-Token Inference

CLP: 零损失自适应多令牌推理的搭配长度预测

Xuezhen Xie, Zhiqiang Zhou

机构 * Xiamen University(厦门大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出CLP方法,通过轻量级线性层预测可安全接受的额外令牌数,解决多令牌预测中头-主干竞争导致的输出退化问题,在Qwen2.5模型上实现零质量损失的1.14x-1.29x加速。

Comments 13 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏