arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-03 至 2026-07-03 共收录 347 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 93 篇

2607.01709 2026-07-03 cs.AI cs.LG 新提交 62%

COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows

COMFYCLAW:面向图像生成工作流的自进化技能工具包

Zongxia Li, Dawei Liu, Fuxiao Liu, Yuhang Zhou, Xiyang Wu, Jingxi Chen, Jing Xie, Xiaomin Wu, Lichao Sun

机构 * University of Maryland(马里兰大学) University of Pennsylvania(宾夕法尼亚大学) Nvidia(英伟达) Lehigh University(里海大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出COMFYCLAW框架,通过类型化图编辑、区域级VLM验证器和渐进式技能库进化,提升ComfyUI工作流构建的代理可靠性和性能,在多个基准上取得最佳平均评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22227 2026-07-03 cs.CL cs.LG 版本更新 62%

Probing Spectrum-Like Organization of States of Mind in Transformer Representation Spaces

Transformer嵌入空间中认知状态的几何组织

Sophie Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过线性与浅层非线性探针评估句子嵌入是否能解码人类可解释的认知属性,发现嵌入空间存在显著的几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01813 2026-07-03 cs.CV cs.AI 新提交 57%

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

MMBench-Live:一个持续演进的多模态模型基准

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) PRIS-CV

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01751 2026-07-03 cs.CV cs.AI 新提交 57%

MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding

MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准

Yuan Wang, Shujian Gao, Songtao Jiang, Zhengyu Hu, Zuozhu Liu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出MedStreamBench基准,通过时间受限证据窗口和主动监控设置,评估模型在流式与主动式医疗视频理解中的回答时机与正确性,发现离线识别与时间感知决策间存在显著差距。

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01517 2026-07-03 cs.CL 新提交 57%

Parameter Golf: What Really Works?

参数高尔夫:什么真正有效?

Prashanna Mani Paudel, Shivanand Venkanna Sheshappanavar

机构 * Geometric Intelligence Research Lab., Department of Electrical Engineering and Computer Science University of Wyoming(几何智能研究实验室,电气与计算机科学系,怀俄明大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 通过分析社区竞赛中的2037个拉取请求和1430个评分提交,构建84种优化技术分类,测量每种技术对bits-per-byte的贡献,发现大多数技术收益在竞争提交中缩小,仅少数方法能持续提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03042 2026-07-03 cs.CV cs.AI 版本更新 57%

PPTArena: A Benchmark for PowerPoint Editing

PPTArena: 一个用于PowerPoint编辑的基准测试

Michael Ofengenden, Yunze Man, Ziqi Pang, Liang-Yan Gui, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出PPTArena基准,包含2125张幻灯片的1300+人工编辑任务,并设计PPTPilot智能体通过结构感知的规划-编辑-验证循环,在复合、布局敏感和跨幻灯片编辑上超越强基线10个百分点以上。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20441 2026-07-03 cs.SD cs.AI 版本更新 57%

UniSE: A Unified Framework for Decoder-Only Autoregressive LM-Based Speech Enhancement

UniSE:一种基于仅解码器自回归语言模型的统一语音增强框架

Haoyin Yan, Chengwei Liu, Shaofei Xue, Xiaotao Liang, Yinghao Liu, Yuxiang Kong, Zheng Xue

机构 * Qwen Business Unit of Alibaba, China(阿里巴巴Qwen业务单元,中国) Tongyi AI Lab of Alibaba, China(阿里巴巴通义AI实验室,中国)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出UniSE,一种统一的仅解码器LM框架,通过自回归生成离散令牌处理语音恢复、目标说话人提取和语音分离任务,并引入渐进强化学习优化质量,在多个基准上取得竞争性表现。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02096 2026-07-03 cs.CV 新提交 50%

LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension

LongEgoRefer: 长形式自我中心视频指代表达理解基准

Shunya Kato, Taiki Miyanishi, Shuhei Kurita, Mahiro Ukai, Nakamasa Inoue, Chenhui Chu

机构 * Woven by Toyota, Japan(丰田公司,日本) The University of Tokyo, Japan(东京大学,日本) National Institute of Informatics, Japan(日本信息机构国家研究所) Institute of Science Tokyo, Japan(东京科学研究所,日本) NII LLMC, Japan(日本信息机构LLMC) Kyoto University, Japan(京都大学,日本)

专题命中 评测与基准 :language model(abstract)

AI总结 提出LongEgoRefer基准,基于Ego4D长视频构建,解决现有基准仅关注短视频导致目标稀疏和活动复杂的问题,评估现有方法发现性能显著下降,凸显长形式自我中心时空定位的挑战。

Comments ECCV 2026. Dataset and code: https://github.com/shunya-kato/LongEgoRefer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01900 2026-07-03 cs.CV 新提交 50%

FoundDP: Revisiting Weak Disparity Observability in Dual-Pixel Depth Estimation

FoundDP:重新审视双像素深度估计中的弱视差可观测性

Fengchen He, Hao Xu, Dayang Zhao, Tingwei Quan, Shaoqun Zeng

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出FoundDP框架,结合双像素深度与单目深度基础模型的全局结构先验,通过ViT特征对齐缓解散焦模糊导致的表示退化,在弱视差区域提升结构一致性与度量精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01748 2026-07-03 cs.CV 新提交 50%

RTE-FM-Dehazer: Radiative Transfer Equation Inspired Flow Matching for Real-World Image Dehazing

RTE-FM-Dehazer: 辐射传输方程启发的流匹配用于真实图像去雾

Chenfeng Wei, Chun Wang, Boyang Zhao, Si Zuo, Shenhong Wang, Chenguang Yang

机构 * Mashang Consumer Finance Co. Ltd(马上消费金融股份有限公司) Tsinghua University(清华大学) Hunan University(湖南大学) University of Liverpool(利物浦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出基于辐射传输方程(RTE)的流匹配去雾方法RTE-FM-Dehazer,通过扩散-吸收正则化引导去雾轨迹,并构建包含5万对真实雾/清晰图像的P-HAZE数据集,在五个真实基准上取得领先结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24725 2026-07-03 physics.ins-det physics.comp-ph 新提交 50%

A Reproducible Benchmark and Evidence-Retrieval Software Framework for Silicon Detector R&D Literature

硅像素探测器研发的基于证据的检索基准与混合RAG框架

Tianqi Gao, Ruobing Jiang, Dawei Fu, Qiang Li, Matthew Kenzie

专题命中 评测与基准 :language model(abstract)

AI总结 针对硅像素探测器文献检索瓶颈,提出首个基于证据的检索基准和混合检索框架,结合稀疏、密集、混合检索和图探索,实验表明混合稀疏-密集检索在证据恢复上最可靠。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29616 2026-07-03 cs.CV 版本更新 50%

Video-Oasis: Rethinking Evaluation of Video Understanding

Video-Oasis:重新审视视频理解的评估

Geuntaek Lim, Sungjune Park, Jaeyun Lee, Inwoong Lee, Taeoh Kim, Dongyoon Wee, Minho Shim, Yukyung Choi

机构 * Sejong University(世宗大学) NAVER Cloud

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出Video-Oasis,通过系统评估现有评估方法,揭示视频理解中的时空挑战,发现54%的基准样本无需视觉输入即可解决,先进模型表现仅略超随机猜测。

Comments Accepted at ECCV2026; Project page: https://limgeuntaekk.github.io/Video-Oasis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08907 2026-07-03 cs.CV 版本更新 50%

Towards Interactive Global Geolocation Assistant

迈向交互式全球地理定位助手

Zhiyang Dou, Zipeng Wang, Xumeng Han, Guorong Li, Zhipei Huang, Zhenjun Han

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉学科学院) School of Electronic, Electrical and Communication Engineering, UCAS(中国科学院大学电子、电气与通信工程学院) School of Computer Science and Technology, UCAS(中国科学院大学计算机科学与技术学院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出基于大型视觉语言模型的交互式全球地理定位助手GaGA,通过挖掘图像地理线索并结合世界知识进行定位,支持用户交互,在GWS15k数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 59 篇

2607.02460 2026-07-03 cs.LG cs.AI 新提交 92%

Neuron-Aware Data Selection for Annotation-Free LLM Self-Distillation

面向无标注LLM自蒸馏的神经元感知数据选择

Zhuowei Chen, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 效率与部署 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Neuron-OPSD框架,利用神经元激活指导训练数据选择和教师上下文构建,通过在线策略蒸馏实现无标注自蒸馏,提升领域内性能并保持跨领域泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23370 2026-07-03 cs.CR cs.LG cs.OS 新提交 92%

FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

FlexServe: 一种面向移动设备的快速安全LLM服务系统,具有灵活的资源隔离

Yinpeng Wu, Yitong Chen, Lixiang Wang, Jinyu Gu, Zhichao Hua, Yubin Xia

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对移动设备上LLM推理中TrustZone资源隔离不灵活和安全管理低效的问题,提出FlexServe系统,通过解耦安全资源的访问权限与管理权限,实现快速安全的推理,平均TTFT加速比达10.05倍。

Comments Repeated paper uploading due to mistakes. See arXiv:2603.09046

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09046 2026-07-03 cs.CR cs.LG cs.OS 版本更新 92%

FlexServe: A Fast and Secure LLM Serving System for Mobile Devices with Flexible Resource Isolation

FlexServe: 一种适用于移动设备的高效且安全的LLM服务系统,具有灵活的资源隔离

Yinpeng Wu, Yitong Chen, Lixiang Wang, Jinyu Gu, Zhichao Hua, Yubin Xia

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FlexServe,一种适用于移动设备的高效且安全的LLM服务系统,通过灵活的资源隔离机制提升推理速度和安全性,采用多模型调度器优化多模型工作流,实验显示在TTFT和多模型工作流中均取得显著加速效果。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01313 2026-07-03 cs.LG cs.AI cs.CL cs.CR 新提交 91%

Black-Box Inference of LLM Architectural Properties with Restrictive API Access

受限API访问下LLM架构属性的黑盒推断

Christopher Ellis, Shreyas Chaudhari, Mei-Yu Wang, Leighton Barnes, Giulia Fanti, José M. F. Moura

机构 * Carnegie Mellon University(卡内基梅隆大学) Pittsburgh Supercomputing Center(匹兹堡超级计算中心)

专题命中 效率与部署 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对当前商业LLM API仅返回单logit且禁止logit偏置的限制,提出NightVision方法,通过新型公共集提示技术和首令牌时间测量,估计隐藏维度、深度和参数数量,在32个开源模型上验证了可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28749 2026-07-03 cs.CY cs.AI cs.HC 版本更新 91%

Four Types of LLM Reliance and Their Predictors Among Undergraduate Writers: A Mixed-Methods Study at a Minority-Serving R1 University

本科写作者对LLM的四种依赖类型及其预测因素:一项在少数族裔服务R1大学的混合方法研究

Shahin Hossain

机构 * School of Education, University of Maryland, Baltimore County(大学教育学院,马里兰大学巴尔的摩县分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究在少数族裔服务大学通过混合方法识别出本科生的四种LLM依赖类型(策略型、工具型、对话型、依赖型),发现价值与成本信念预测依赖强度,AI素养预测依赖类型,且策略型用户在标准结果测量中得分最低。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01579 2026-07-03 cs.DC 新提交 90%

OmniPilot: An Uncertainty-Aware LLM Inference Advisor for Heterogeneous GPU Clusters

OmniPilot: 面向异构GPU集群的不确定性感知LLM推理顾问

D. Balamurugan, Thomas W. Bush

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出OmniPilot,通过共形校准分位数成本模型和分布外弃权层,为异构GPU集群上的LLM服务选择最优配置,预测吞吐量MAPE为6.2%,top-1准确率95%。

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01394 2026-07-03 cs.AI 新提交 90%

The Wiola Architecture for Efficient Small Language Models

Wiola架构:高效小型语言模型

Aryuemaan Kumar Chowdhury, Afreen Shaik, Yaparla Bhargavi, Brahma Kumar

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Wiola小型语言模型架构,包含五种原创组件,在多个规模上超越GPT-2、LLaMA-2和Mistral。

Comments 7 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15588 2026-07-03 cs.CL 版本更新 90%

YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models

YuFeng-XGuard:一种以推理为中心、可解释且灵活的大语言模型护栏模型

Junyu Lin, Meizhen Liu, Xiufeng Huang, Jinfeng Li, Haiwen Hong, Xiaohan Yuan, Yuefeng Chen, Longtao Huang, Hui Xue, Ranjie Duan, Zhikai Chen, Yuchuan Fu, Defeng Li, Lingyao Gao, Yitong Yang

机构 * Alibaba-AAIG(阿里云-阿里人工智能研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出YuFeng-XGuard护栏模型系列,通过结构化风险预测(含风险类别、置信度分数及自然语言解释)实现可解释的多维风险感知,并采用分层推理范式平衡延迟与解释深度,同时引入动态策略机制解耦风险感知与策略执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02043 2026-07-03 cs.DC cs.AI 新提交 90%

Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving

面向负载感知的预填充偏转用于分离式LLM服务

Shrikara Arun, Anjaly Parayil, Srikant Bharadwaj, Renee St. Amant, Victor Rühle

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对分离式LLM服务中预填充节点过载而解码节点空闲的问题,提出一种主动预填充偏转调度器,通过将预填充作为分块步骤在解码节点上交错执行,消除节点间KV传输,显著降低P95 TTFT并提高SLO达标率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01601 2026-07-03 cs.AI 新提交 90%

SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication

SemHash-LLM:一种用于文档去重的多粒度语义哈希框架

Xinyi Fang, Kejian Tong, Jiabei Liu, Tao Ning, Yuhang He

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出多粒度语义哈希框架SemHash-LLM,融合语义投影哈希、注意力加权MinHash、对比边界学习和选择性LLM裁决,实现高效的大规模文档去重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11357 2026-07-03 cs.DC cs.AI cs.AR cs.PF 新提交 90%

TileFuse: A Fused Mixed-Precision Kernel Library for Efficient Quantized LLM Inference on AMD NPUs

TileFuse:用于AMD NPU上高效量化LLM推理的融合混合精度内核库

Wesley Pang, Gregory Hyegang Jun, Feiyang Liu, Deming Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对边缘NPU上量化LLM部署困难,提出TileFuse库,通过融合解包、反量化与GEMM/GEMV内核,并设计交错预分块布局与数据流,在XDNA2上实现AWQ格式原生支持,性能提升最高281%,能耗降低64.6%。

Comments 13 pages excluding reference, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14331 2026-07-03 cs.LG 版本更新 90%

LLM Priors for ERM over Programs

程序上经验风险最小化的LLM先验

Shivam Singhal, Priyadarsi Mishra, Eran Malach, Tomer Galanti

机构 * LLM Priors for ERM over Programs(LLM 优先级用于程序上的经验风险最小化)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出LLM-PV方法,利用预训练LLM作为先验,通过提议-验证机制实现程序类上的ERM选择,无需穷举枚举,在算法任务上从少量样本恢复规则并泛化到更长序列。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01617 2026-07-03 cs.AR 新提交 89%

3DLS: A 3D Logic-Stacked Architecture for Disaggregated LLM Serving

3DLS:一种用于分离式LLM服务的3D逻辑堆叠架构

Jaehun Lee, In-Jun Jung, Joo-Young Kim

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对预填-解码分离与张量并行中KV缓存传输和TP集合共享互连导致的关键路径争用问题,提出3D逻辑堆叠架构3DLS,通过垂直互连分离流量,提升吞吐量达1.49倍,降低端到端延迟60.2%。

Comments Accepted to IEEE Computer Architecture Letters (CAL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02391 2026-07-03 cs.DC cs.LG 新提交 89%

WattGPU: Predicting Inference Power and Latency on Unseen GPUs and LLMs

WattGPU: 在未见过的GPU和LLM上预测推理功耗和延迟

Mauricio Fadel Argerich, Jonathan Fürst, Marta Patiño-Martínez

机构 * Universidad Politécnica de Madrid(马德里理工大学) Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出WattGPU模型,利用公开的LLM元数据和GPU规格,无需硬件访问即可预测平均GPU功耗和令牌间延迟,在未见过的GPU和LLM上误差低至3.4%,优于基线方法。

Comments Accepted at 1st Workshop on Sustainability and Resource-Efficiency of Artificial Intelligence @ IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28565 2026-07-03 cs.PF cs.AI cs.AR 版本更新 89%

KernelSight-LM: A Kernel-Level LLM Inference Simulator

KernelSight-LM: 一种内核级LLM推理模拟器

Xiteng Yao, Taeho Kim, Hengzhi Pei, Xinle Liu, Kyle Ulrich, Leonard Lausen, Ashish Khetan, Xiang Song, George Karypis, Martin Herbordt

机构 * Amazon Web Services(亚马逊网络服务) Boston University(波士顿大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出KernelSight-LM,一种细粒度推理模拟器,通过分解服务步骤为屋顶线内核模型、通信模型和主机开销模型,并集成前缀缓存和连续批处理,实现跨GPU代际或少量目标数据下的精确延迟预测,支持硬件/软件协同设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10431 2026-07-03 cs.LG 版本更新 88%

QTALE: Quantization-Robust Token-Adaptive Layer Execution for LLMs

QTALE: 面向LLM的量化鲁棒令牌自适应层执行

Kanghyun Noh, Jinheon Choi, Yulhwa Kim

机构 * Department of Semiconductor Systems Engineering, Sungkyunkwan University(成均馆大学半导体系统工程系)

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出QTALE框架,通过多样化训练路径和后训练调整机制,实现令牌自适应层执行与量化的无缝集成,在保持精度的同时降低计算和内存开销。

Comments 22 pages, 10 figures, 20 tables,

Journal ref ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07571 2026-07-03 cs.LG cs.AI 新提交 88%

Enabling KV Caching of Shared Prefix for Diffusion Language Models

为扩散语言模型启用共享前缀的KV缓存

Younghun Go, Jaehoon Han, Changyong Shin, Chuck Yoo, Gyeongsik Yang

机构 * Korea University(高丽大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对扩散语言模型中双向注意力导致共享前缀KV不稳定的问题,提出双向前缀缓存(bicache),通过动态识别安全层深度重用KV,避免精度崩溃,提升吞吐量36.3%-98.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏