arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 260 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 61 篇

2608.17965 2026-08-21 cs.LG cs.AI cs.SE 版本更新 62%

Too Sure to Be Safe: Model Calibration for Reliable Log Anomaly Detection

过于自信难安全:面向可靠日志异常检测的模型校准

Bin Li, Dongdong Wang, Siyang Lu

机构 * Beijing Jiaotong University(北京交通大学) University of Florida(佛罗里达大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对基于语言模型的日志异常检测器置信度校准差的问题,提出轻量级事后校准框架LoRD,经实验验证其可提升置信度可靠性并减少过度自信异常相关错误且不牺牲检测性能。

Comments Accepted at the 2026 IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03259 2026-08-21 cs.LG cs.AI 版本更新 62%

FinVerse: Financial Time-Series Benchmark

FinVerse:金融时间序列基准

Jaehoon Lee, Jun Seo, Seunghan Lee, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, Minjae Kim, Sungdong Yoo, Junhyeok Kang, Sangjun Han, Soonyoung Lee, Wonbin Ahn

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究推出金融时间序列预测基准FinVerse,其针对43个公开时间序列基础模型的分析显示,通用预测标准下的优异表现未必对应实用金融预测,凸显了领域感知基准的必要性。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07303 2026-08-21 cs.LG 版本更新 57%

Bootstrap Theory of Representational Emergence (TBER): Explanatory Insufficiency, Transition Regimes, and the Emergence of New Representational Levels

表征涌现的自举理论:解释不充分性作为表征学习与世界模型的驱动力

Jacques Raynal, Pierre Slangen, Elsa Raynal, Jacques Margerit

机构 * Laboratory of Bioengineering and Nanosciences (LBN), University of Montpellier(生物工程与纳米科学实验室(LBN),蒙彼利埃大学) EuroMov Digital Health in Motion, University of Montpellier, IMT Mines Alès(EuroMov数字健康运动,蒙彼利埃大学,IMT矿山阿尔勒) Certified Sophrologist, Sensorimotor Practice, Montpellier, France(认证Sophrologist,运动觉实践,蒙彼利埃,法国) Emeritus Professor, University of Montpellier(荣誉教授,蒙彼利埃大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出表征涌现自举理论(TBER),将解释不充分性视为新表征涌现的积极信号,通过五阶段递归过程驱动表征创新,应用于表征学习、世界模型和科学发现。

Comments Version 4. Major theoretical revision introducing the distinction between manifestations of explanatory insufficiency and resolution regimes (local-corrective, representationally resolutive, and structurally recurrent), together with regime-sensitive diagnosis and closure assessment. Formal mathematical boundary cases have been clarified. 28 references, no figures or tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20317 2026-08-21 cs.IR 新提交 50%

Projecting BrowseComp-Plus onto ClimbMix: Toward More Realistic Corpora for Agentic Search

将BrowseComp-Plus映射到ClimbMix:构建更符合智能体搜索需求的真实语料库

Sahel Sharifymoghaddam, Lingwei Gu, Yijun Ge, Jimmy Lin

专题命中 评测与基准 :language model(abstract)

AI总结 该研究将BrowseComp-Plus的查询映射到NVIDIA的ClimbMix语料库,构建了与基准无关的映射流水线,生成57个有效查询,使智能体搜索难度向检索环节转移,发布了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20107 2026-08-21 cs.CV 新提交 50%

BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal

BeyondMasks:评估视频对象移除中的因果与物理一致性

Yigit Ekin, Enes Sanli, Aykut Erdem, Erkut Erdem, Aysegul Dundar

机构 * Bilkent University(毕尔肯大学) Koç University(科克大学) Hacettepe University(哈杰泰佩大学) KUIS AI Center(KUIS人工智能中心)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究推出BeyondMasks基准及CORE评估协议,针对现有视频对象移除评估仅关注局部掩码保真度的问题,填补了视觉合理性与因果正确性的差距。

Comments ECCV 2026 Project Page: https://yigitekin.github.io/BeyondMasks/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19380 2026-08-21 cs.CV 新提交 50%

CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios

CAViAR:用于真实场景细粒度事故推理的因果视频数据集

Sparsh Garg, Yi-Wen Chen, Vijay Kumar B G, Abhishek Aich

机构 * NEC Laboratories, America(美国NEC实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究推出人工标注的真实事故视频基准CAViAR,测试发现现有VLMs存在感知-推理差距,无法可靠将驾驶场景主体行为映射到责任类别。

Comments Accepted to ECCV 2026 Workshop DriveX

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19272 2026-08-21 astro-ph.IM astro-ph.CO astro-ph.GA 新提交 50%

The Cross-Survey Decade: A Call to Action

跨巡天十年:行动号召

Gioia Rau, Robert Benjamin, Federica Bianco, Ranga-Ram Chary, Andy Connolly, Cecilia Garraffo, Suvi Gezari, Leanne P. Guy, Željko Ivezić, Stephanie Juneau, Vicky Kalogera, Mansi M. Kasliwal, François Lanusse, Zack Li, Rachel Mandelbaum, Peter Melchior, Stella Offner, Antonella Palmese, Jason Rhodes, Edward Schlafly, Kartik Sheth, Rachel Street, Michael Troxel, Tony Tyson, Beth Willman, Michael Wood-Vasey, Yuanyuan Zhang

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文呼吁构建跨巡天科学基础设施,围绕四大支柱推进,以实现三个旗舰巡天项目联合数据的科学价值,需多方协作且当下是行动的关键时机。

Comments 23 pages, 1 figure. Community perspective on cross-survey science infrastructure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17633 2026-08-21 cs.RO 版本更新 50%

OVIP-SG: Open-Vocabulary Instance-Preserving Scene Graphs for Mapping and Retrieval of Small, Fine-Grained Objects

OVIP-SG:用于小型细粒度物体映射与检索的开放词汇实例保留场景图

Tianjing Hao, Haiyu Lan, Angsong Li, Cheng Chen, Enyu Li, Jiarui Yang, Yuning Su, Peiwen Lin, Wang Chuang

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出OVIP-SG框架,通过VLM等技术实现小型细粒度物体的实例保留映射与语言引导检索,在Replica数据集上的多项指标优于现有方法,且经实际机器人实验验证有效。

Comments 15 pages, 6 figures, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16289 2026-08-21 cs.CV 版本更新 50%

PosterText: Towards Unified Visual Text Generation and Editing for E-commerce Poster

PosterText:面向电商海报的统一视觉文本生成与编辑

Xiaoan Liu, Lichen Ma, Zipeng Guo, Yu He, Xiaoyan Su, Shaojie Guo, Jingling Fu, Xiaolong Fu, Hao Yang, Tongxuan Liu, Yu Guo, Fei Wang, Xinyi Liu, Yongjun Zhang, Junshi Huang

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出PosterText框架,将文本块作为原子单元实现电商海报的统一生成与编辑,构建了带块级标注的数据集与评估基准,经实验验证其性能优于现有相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17097 2026-08-21 cs.CV 版本更新 50%

HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

HarmoHOI:用于多视图手-物体交互合成的外观与3D运动协调

Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min, Yebin Liu, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) Shadow AI(影谱科技)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对多视图手-物体交互合成难题,提出HarmoHOI统一扩散框架,用多视图扩散Transformer混合模型联合建模视频与点轨迹,结合全局运动对齐扩散确保一致性,采用混合数据学习策略,实现多视图HOI高质量合成。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 51 篇

2608.19794 2026-08-21 cs.AI cs.RO 新提交 92%

Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents

迈向通用具身智能:整合大语言模型、知识库与推理能力以构建下一代AI智能体

Fujiang Yuan, Xia Huang, Lusheng Wang, Jun Ding, Zhen Tian, Yuxin Wang, Shaojie Gu, Yuki Funabora, Yanhong Peng, Zebing Mao

机构 * College of Mechanical Engineering, Chongqing University of Technology(重庆理工大学机械工程学院) James Watt School of Engineering, University of Glasgow(格拉斯哥大学詹姆斯·瓦特工程学院) School of Energy and Power, Jiangsu University of Science and Technology(江苏科技大学能源与动力学院) Magnesium Research Center, Kumamoto University(熊本大学镁研究中心) Department of Information and Communication Engineering, Nagoya University(名古屋大学信息与通信工程系) State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文综述以LLM为核心的智能系统演进,提出整合LLMs、KBs、RA与具身性的概念框架,明确高效LLM部署等五大挑战,为开发复杂动态环境下的自适应多模态智能体提供路线图。

Journal ref International Journal of Hydromechatronics 9(2) (2026) 250-316

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19395 2026-08-21 cs.AR cs.AI cs.LG 新提交 92%

HYDRA: A Heterogeneous Chiplet DSE Framework for Serving Dynamic Hybrid LLM Workloads

HYDRA:面向动态混合大语言模型(LLM)工作负载的异构小芯片设计空间探索框架

Jiahao Lin, Alish Kanani, Sangwan Lee, Jaehyun Park, Umit Ogras

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HYDRA框架,针对异构小芯片系统上混合LLM服务的设计空间开展联合探索,实现了吞吐量与首token生成时间的显著提升,凸显架构与运行时策略协同设计的重要性。

Comments Accepted at IEEE/ACM ESWEEK (CASES) 2026; the official version will be available in IEEE TCAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23057 2026-08-21 cs.LG cs.CL cs.PF 版本更新 92%

RequestRouter: Request-Boundary Routing for Efficient Single-GPU LLM Inference

ModeSwitch-LLM:单GPU上跨模式LLM推理的轻量级阶段感知控制器

Aman Sunesh, Ali Alshehhi, Hivansh Dhakne

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校) New York University(纽约大学) United States(美国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种轻量级请求边界控制器ModeSwitch-LLM,通过基于工作负载特征在FP16、量化、推测解码等推理模式间路由请求,在单GPU上实现平均延迟加速2.10倍、每token能耗降低51.7%,且精度几乎无损。

Comments 5 pages, 2 figures. Accepted at the 2nd International Workshop on Low Carbon Computing (LOCO 2026), Lancaster University, United Kingdom, 10-11 September 2026. Part of the LOCO 2026 proceedings, arXiv:2608.02072

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26170 2026-08-21 cs.CL 版本更新 92%

EvoSelect: Data-Efficient LLM Evolution for Targeted Task Adaptation

EvoSelect:面向目标任务的高效LLM进化

Ting-Wei Li, Sirui Chen, Jiaru Zou, Yingbing Huang, Tianxin Wei, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EvoSelect框架,通过迭代生成-选择-训练循环提升LLM在目标任务上的适应能力,通过最优传输和多样性机制优化数据选择,实验表明其在不同基准测试中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09894 2026-08-21 cs.SE cs.MA 91%

Deterministic vs. LLM-Controlled Orchestration for COBOL-to-Python Modernization

确定性与LLM控制的编译流程在COBOL到Python现代化中的对比

Naing Oo Lwin, Rajesh Kumar

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过实验对比确定性和LLM控制的编译流程,发现确定性方法在准确性、鲁棒性和效率上更优,且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20280 2026-08-21 cs.DB cs.LG 新提交 90%

Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities, and Encoders

大语言模型(LLM)缓存应采用哪种驱逐策略?跨工作负载、容量和编码器的系统研究

Yash Kulkarni, Shubham Harkare, Arvind Suresh Yogesh Babu

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本研究使用CLEVER工具在多场景下对比多种LLM缓存驱逐策略,发现LFU性能最优,且当前操作点的答案可替换性低、阈值难跨模型迁移,建议部署时先验证答案有效性再测试次级策略差异。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19998 2026-08-21 cs.IR 新提交 89%

SCoRD: Semantic-Assisted Continual Retriever-Reranker Distillation for LLM-Based Recommendation

SCoRD:用于基于大语言模型(LLM)推荐的语义辅助持续检索-重排序蒸馏

Seunghyun Baek, Gyuseok Lee, Seunghan Lee, Wonbin Kweon, Dong Wang, SeongKu Kang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 SCoRD是面向非平稳数据流的LLM推荐两阶段流程的持续知识蒸馏框架,通过语义推理助手实现检索器与重排序器的高效协同适配,在真实数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19803 2026-08-21 cs.LG cs.AI cs.CL 新提交 89%

MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents

MileGPO:面向长 horizon LLM 智能体的基于图策略优化的里程碑推理

Bo Qian, Yuting Wu, Shuang Zeng, Huaiyu Wan, Dalin Zhang, Jiqiang Liu

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长 horizon LLM 智能体强化学习的信用分配难题,提出 MileGPO 方法,通过里程碑发现、RCS、PCC 三项设计提升性能,在 ALFWorld 和 WebShop 上达 SOTA 且分布差距小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19557 2026-08-21 cs.DC cs.MA 新提交 89%

When Do LLM Agents Help? Deadline-Aware Mixed-Criticality Task Scheduling at the Autonomous-Vehicle Edge

大语言模型智能体何时有用?自动驾驶车辆边缘的感知期限感知混合关键度任务调度

Reza Zakerian

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对自动驾驶车辆边缘MEC的混合关键度任务调度,构建强启发式算法,发现LLM控制平面仅在安全关键任务激增时优于静态启发式算法。

Comments 8 pages, 5 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19670 2026-08-21 cs.CL 新提交 89%

The Asymmetric Harms of LLM Compression

大语言模型压缩的非对称危害

Yuan Wu, Mairui Li, Lesia Semenova, Chudi Zhong

机构 * Rice University(莱斯大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Rutgers University(罗格斯大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过评估3个LLM、11种压缩方法,发现LLM压缩会引发知识保留、置信度及偏见的非对称变化,聚合指标无法捕捉,需对压缩模型开展细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19659 2026-08-21 cs.LG cs.DC 新提交 87%

FleetSieve: Decision-Critical Profiling for SLO-Aware LLM Fleet Configuration

FleetSieve:面向SLO感知的大语言模型集群配置的决策关键型性能分析

Huang Cheng, Scott Zhang, Aubert Li

机构 * Meta

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG

AI总结 FleetSieve是一种面向SLO感知的LLM集群配置的决策关键型性能分析方法,通过联合建模容量与尾部延迟选择测量,可减少GPU资源消耗,避免违反SLO,提升集群决策效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06127 2026-08-21 cs.AR cs.AI 版本更新 87%

PrefixAgent: An LLM-Powered Design Framework for Efficient Prefix Adder Optimization

PrefixAgent:一种基于大语言模型的高效前缀加法器优化设计框架

Dongsheng Zuo, Jiadong Zhu, Yang Luo, Yuzhe Ma

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究针对前缀加法器设计空间随位宽指数增长的优化难题,提出基于LLM的PrefixAgent框架,通过将任务拆分为两个子任务并利用等价图构建训练数据,在几乎所有配置下实现了更小的加法器面积,且在位宽更大时优势更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18764 2026-08-21 cs.IR 版本更新 87%

GateDiffInt: Gate-Mediated Controllable Diffusion and Multi-Intent LLM Distillation for User Behavior Modeling

GateDiffInt:用于用户行为建模的门控介导可控扩散与多意图大语言模型蒸馏

Jialong Duan, Zichen Zhang, Zirui Tu, Zheng Zhang, Zepeng Li, Qingyao Cui, Qinwen Wang, Yudan Liu, Luo Yang, Yao Hu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对现有排序模型难以解耦结构化意图的问题,提出GateDiffInt框架,通过可控扩散与LLM蒸馏实现意图感知表示,在公开及工业数据集和线上测试中均取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20973 2026-08-21 eess.AS cs.AI cs.CL 版本更新 86%

Towards Audio Token Compression in Large Audio Language Models

向大型音频语言模型中的音频标记压缩迈进

Saurabhchand Bhati, Samuel Thomas, Hilde Kuehne, Rogerio Feris, James Glass

机构 * MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出通过无监督分割和低秩适配器技术,压缩音频标记以提升大型音频语言模型在资源受限平台上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19752 2026-08-21 cs.SE 新提交 86%

A Fully Automated, Deployment-Aware Testing Pipeline for IoT-Based Automotive Applications

面向物联网汽车应用的全自动、感知部署的测试流水线

Denesa Zyberaj, Roman Vintonyak, Pascal Hirmer, Marco Aiello

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对物联网汽车应用的测试难题,提出结合LLM、VLM及人在回路机制的感知部署测试流水线,经CPDS案例验证可实现全需求覆盖与高准确率,适配OEM-供应商测试工作流。

Comments Submitted, accepted and presented at IoTBDS26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20169 2026-08-21 cs.CL cs.AI cs.LG 新提交 83%

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

Task-CoEvolve:通过自适应验证任务选择实现高效的智能体框架优化

Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Task-CoEvolve通过自适应验证任务选择,使LLM智能体框架与验证任务协同演化,在保持全集搜索最终性能的同时,减少80%评估次数,实现高效的智能体框架优化。

Comments Github: https://github.com/Agent4Science-UTokyo/Task-CoEvolve

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19889 2026-08-21 cs.AI cs.PL 新提交 83%

Write Once, Run Everywhere: The Axon DSL for Shape-Safe and Framework-Agnostic LLM Architectures

一次编写,随处运行:用于形状安全且框架无关的大语言模型架构的Axon领域特定语言

Jacob Nielsen, Danial Namazifard, Lukas Galke Poech, Peter Schneider-Kamp

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型架构的可移植性与效率瓶颈,提出强类型领域特定语言Axon,可编译为多框架实现,在467项基准测试中实现显著加速,突破部署锁定问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18578 2026-08-21 cs.CL cs.LG 版本更新 82%

Compress and Forget: bitsandbytes Quantization Amplifies Proactive Interference in LLMs

压缩与遗忘:bitsandbytes量化放大了大语言模型中的主动干扰

Shayan Shahrabi-Farahani, Dara Rahmati

机构 * Shahid Beheshti University(沙希德·贝赫什提大学)

专题命中 效率与部署 :post-training(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现bitsandbytes 4位量化会放大大语言模型的主动干扰,降低高干扰场景下的检索准确率,其效应源于量化后的Transformer主干,对依赖长语义密集上下文的应用有额外成本。

Comments 21 pages, 6 figures, 11 tables. Author list formatting simplified. Code and data released at https://github.com/ShayanShahrabi/compress-and-forget

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19628 2026-08-21 cs.AR 新提交 80%

A Thread-Register Decoupled GPU Execution Model for Efficient Tensor Computation

用于高效张量计算的线程-寄存器解耦GPU执行模型

Zihan Liu, Jingwen Leng, Yangjie Zhou, Yitong Ding, Guanlin Zhu, Yilu Huang, Chiheng Jin, Chen Zhang, Shixuan Sun, Yu Feng, Anbang Wu, Minyi Guo, Jian Weng, Jiajin Tu, Junsong Wang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对GPU张量计算流水线的固定并行度与粗粒度调度瓶颈,提出扩展SIMT模型的FIBER架构,通过线程-寄存器解耦实现动态并行缩放与细粒度调度,在LLM服务场景下获显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19662 2026-08-21 cs.CL 新提交 79%

ReCache: Efficient KV Cache Reuse and Compression for Tool-Augmented LLM Agents

ReCache:面向工具增强型大语言模型智能体的高效键值缓存复用与压缩

Yichu Fang, Sitong Wei, Haozhe Hu, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东方理工学院) Xi’an Jiaotong University(西安交通大学)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.CL

AI总结 ReCache是面向工具增强型大语言模型智能体的框架,通过资源级注意力与剪枝实现KV缓存复用压缩,在性能损失极小的情况下大幅降低推理计算与内存开销,已在多工具数据集基准上验证有效。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏