arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-05 至 2026-08-05 共收录 439 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 95 篇

2605.27642 2026-08-05 cs.CL cs.LG 版本更新 81%

Learning to Translate from Soft to Hard LLM Prompts

学习从软提示到硬提示的翻译

Pitipat Kongsomjit, Suryansh Goyal, Jacob Whitehill

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 效率与部署 :LLM(title);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文通过训练一个专用的软提示到自然语言翻译模型,提高了翻译质量,并展示了软提示可以转化为可移植的文本提示,在大型闭源模型上超越原软提示甚至少样本学习。

Comments 8 Pages, 11 tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22167 2026-08-05 cs.LG cs.AI 版本更新 81%

Estimating Tail Risks in Language Model Output Distributions

语言模型输出分布中的尾部风险估计

Rico Angell, Raghav Singhal, Zachary Horvitz, Zhou Yu, Rajesh Ranganath, Kathleen McKeown, He He

机构 * Columbia University(哥伦比亚大学) Department of Computer Science, New York University(纽约大学计算机科学系) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于重要性采样的方法,通过创建不安全版本来高效估计语言模型产生有害输出的尾部概率,在10-20倍更少样本下匹配蒙特卡洛估计,并揭示模型对输入的敏感性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02909 2026-08-05 econ.EM stat.ML 新提交 80%

When Predictions Become Regressors: A Split-Sample Correction for Biases in Downstream Inference

当预测成为回归元:针对下游推断偏差的拆分样本校正方法

Nathan Canen, Ted Enamorado

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文针对预测生成测度用作回归元的偏差问题,提出基于独立拆分样本构建工具变量的校正方法,经模拟及两个实证案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03223 2026-08-05 cs.LG cs.AI cs.CL 新提交 80%

Agentic Reinforcement Learning with Self-Distilled Reward Shaping

具有自提炼奖励塑造的智能体强化学习

Ranxu Zhang, Guinan Chen, Chenshaodong, Jinghao Lin, Xiaozhou Xu, Sunzhe, Yanyong Zhang, Chao Wang

专题命中 效率与部署 :LLM(abstract,abstract_cn);language agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对智能体强化学习中稀疏奖励无法分配中间决策信用的问题,提出ADRS框架,通过校准教师分数等提升多轮语言智能体在长时域任务的性能,且增益稳定。

Comments 17 pages,10 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03065 2026-08-05 cs.SE 新提交 80%

Efficient Grammar-Constrained Decoding via Parser Stack Classification

基于解析器栈分类的高效语法约束解码

Yongmin Li, Yihong Dong, Jia Li, Ge Li

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文提出PSC方法,通过解析器栈分类实现高效语法约束解码,其计算掩码速度远快于基线,可提升LLM的端到端吞吐量。

Comments accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03958 2026-08-05 cs.AI 新提交 79%

A game theory for foundation models shows new paths to rational cooperation through similarity inference

基础模型的博弈论:通过相似性推理实现理性合作的新路径

Alexander Meulemans, Maciej Wołczyk, Marissa A. Weis, Rajai Nasser, Roberta Rocca, Seijin Kobayashi, Guillaume Lajoie, Angelika Steger, Blake Richards, Marcus Hutter, James Manyika, Rif A. Saurous, João Sacramento, Blaise Agüera y Arcas

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出针对基础模型智能体的嵌入贝叶斯智能体理论模型,通过嵌入均衡机制实现相似性推理,破解经典博弈论预测的社会困境中相互背叛问题,达成稳定合作。

Comments 75 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03112 2026-08-05 cs.CV cs.AI 新提交 79%

Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models

用于视频-语言模型高效推理的自适应两阶段视觉令牌剪枝

Paribesh Regmi, Qingshuang Chen, Chi Zhang, Heba Aly, Yelin Kim, Hongda Mao

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 针对视频-语言模型推理延迟高的问题,提出两阶段自适应令牌剪枝策略,先剪去视频冗余帧,再根据视频内容自适应剪去保留帧中的冗余令牌,无需额外训练微调,在10%令牌保留率下提升准确率7%并降低95%计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02942 2026-08-05 cs.CL 新提交 79%

OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models

OPTD:用于少步扩散语言模型的一致性引导自适应压缩的策略内转换蒸馏

Xiaocheng Lu, Hualei Zhang, Shuhan Guo, Jie Zhang, Xiaoyi Pang, Jian Liu, Haoxi Li, Bohai Gu, Haoxuan Che, Jingcai Guo, Song Guo

机构 * HKUST(香港科技大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 针对少步扩散语言模型现有离线策略蒸馏的轨迹不匹配问题,提出 OPTD 策略内转换蒸馏方法,在四个推理基准上改善质量效率权衡并取得最优质量约束 AUP。

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00955 2026-08-05 cs.LG cs.AI cs.IR 版本更新 79%

From Generator to Embedder: Harnessing Innate Abilities of Multimodal LLMs via Building Zero-Shot Discriminative Embedding Model

从生成器到嵌入器:通过构建零样本判别嵌入模型来利用多模态大语言模型的固有能力

Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence(人工智能系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种高效框架,通过构建零样本判别嵌入模型,利用多模态大语言模型的固有能力,提升多模态表示空间的鲁棒性和零样本嵌入能力。

Comments Accepted to IEEE Transactions on Multimedia (T-MM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03080 2026-08-05 cs.NI 新提交 78%

The Frontier LLM Trap in Network Automation

网络自动化中的前沿大语言模型陷阱

Minhao Jin, Sean Wang, Aarti Gupta, Maria Apostolaki

专题命中 效率与部署 :LLM(title,abstract_cn)

AI总结 针对网络自动化中前沿大语言模型成本高、依赖AI提供商等问题,提出用模糊测试与验证构建离线循环生成规则,指导小型模型实现低成本、可审计的自动化,且知识在网络本地积累。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03796 2026-08-05 cs.CL cs.AI cs.LG 新提交 75%

Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss

大语言模型的高效知识蒸馏:离线Top-K对数概率与融合分块KL损失

Bakbergen Ryskulov, Iker García-Ferrero, David Montero, David Jansen, Ali Hashemi, Jezabel R. Garcia, Antonio Tiene, Román Orús

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对大语言模型知识蒸馏成本高的问题,提出离线Top-K对数概率方法与融合分块KL损失,提升训练效率、降低内存占用,相关实现已开源。

Comments Patent Application Pending. EP26382987.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25928 2026-08-05 cs.SE 版本更新 75%

TheBotCompany: Self-Organizing Multi-agent Systems for Continuous Software Development

自主多智能体系统用于连续软件开发

Wenhan Lyu, Yue Xiao, Yixuan Zhang, Yifan Sun

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TheBotCompany框架,通过三阶段状态机、自组织智能体团队和异步人类监督,实现持续软件开发的自动化与长期进展。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11456 2026-08-05 cs.DC 版本更新 75%

AuroraRL: Fast, Fault-Tolerant, and Cost-Efficient Reinforcement Learning over Decentralized Network

在通用网络上进行强化学习:通过无损稀疏delta克服带宽障碍

Chaoyi Ruan, Geng Luo, Xinyi Wan, Long Zhao, Qinghe Wang, Jiaan Zhu, Duling Xu, Guanbin Xu, Dehui Wei, Xiang Liu, Cheng Li, Haifeng Sun, Liang Luo, Congcong Miao, Jialin Li

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract)

AI总结 SparrowRL 通过在通用网络上实现无损稀疏 delta 更新,显著提高了 RL 训练的吞吐量和效率,降低了成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03743 2026-08-05 cs.SE cs.AI cs.LG 新提交 73%

Can LLMs Test Terminal User Interfaces?

大型语言模型(LLMs)能否测试终端用户界面?

Chao Peng, Ruida Hu, Ajitha Rajan, Tegawendé F Bissyandé, Jacques Klein, Cuiyun Gao

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对终端用户界面(TUIs)缺乏专门测试方法的问题,构建多框架基准测试对比前沿LLMs与随机探索,发现自动生成输入可提升测试效果,验证了自动化TUI测试的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02980 2026-08-05 cs.CV 新提交 71%

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Qwen-3D:用于空间理解的通用三维视觉语言模型

Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :language model(title)

AI总结 本研究提出 Qwen-3D 三维视觉语言模型,通过多视角几何线索与三维旋转位置嵌入提升空间推理,在三维任务上超越现有 3D LMM,还保持二维任务性能。

Comments Project Page: https://qwen-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20957 2026-08-05 cs.IR 版本更新 71%

Fast and Efficient Approximate Nearest Neighbor Search for High-Dimensional LLM Embeddings

面向高维语言模型嵌入的快速高效近似最近邻搜索

Nico Hezel, Kai Uwe Barthel, Bruno Schilling, Konstantin Schall, Andre Moelle, Klaus Jung

专题命中 效率与部署 :LLM(title)

AI总结 本文针对2026年SISAP索引挑战赛,介绍在高维语言模型嵌入上的近似最近邻搜索方法。利用EVP量化、重排策略及维度扩充等优化算法,通过FLAS预排序机制减少查询延迟和优化内存访问,提升空间局部性与缓存命中率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03653 2026-08-05 cs.AI 新提交 70%

AutoSND: From Execution Evidence to Structural Policies for Automated Network Dismantling Heuristic Discovery

AutoSND:从执行证据到结构策略的自动网络拆解启发式发现方法

Zhijing Hu, Changjun Fan, Yufan Deng, Zhiguang Cao

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AutoSND是一种三阶段树搜索框架,通过将执行证据转化为结构策略,在真实网络上发现了更优的网络拆解启发式方法,性能与稳定性更佳且结构可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03388 2026-08-05 cs.CL 新提交 70%

Don't Let Me Ask for It: LLMs Show Deficiencies in Active Multi-Turn Information Acquisition for Abductive Inference

别让我主动索要:大语言模型在用于溯因推理的主动多轮信息获取中存在缺陷

Shahrukh Mohiuddin, Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究通过Alien Abduction游戏探究LLMs的主动多轮信息获取能力,发现其在分轮提供证据、自行选择查询时表现欠佳,存在假设验证与停止决策的缺陷。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03276 2026-08-05 cs.AI 新提交 70%

TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning

TaskPress:基于任务引导剪枝的查询无关键值缓存压缩

Wonpyo Park, Seung-won Hwang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TaskPress是一种基于任务引导剪枝的查询无关KV缓存压缩框架,通过任务引导构建可复用缓存,在长上下文任务上实现了紧凑缓存的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03214 2026-08-05 cs.AI 新提交 70%

The Agent Operating System (AOS): A Reference Operating Architecture for Distributed Agentic Systems

智能体操作系统(AOS):分布式智能体系统的参考操作架构

Ankur Sharma, Deep Shah

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出智能体操作系统(AOS),作为分布式智能体系统的参考操作架构,用于管控异构组件以构建可管控、可靠、可观测且互操作的智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03034 2026-08-05 cs.RO cs.AI 新提交 70%

PACE: Adaptive Budget Allocation for Time-Efficient Embodied Planning

PACE:面向时间高效具身规划的自适应预算分配

Yuchen Huang, Xijiang Ying, Zhenhua Ma, Xiaxiang Yuan, Zhijie Gao, Jiayi Huang, Ruichi Mao, Jiazheng Zhang, Hongsheng Ti, Maotao Tian, Rong Shi, Lu Zhao, Shizhuang Zhang, Zhuo Cui, He Wang, Ling Liu, Wei Zhang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PACE框架通过交错式思考-执行架构和动态预算分配器,在Robotouille基准测试中较ReAct+Think基线提升规划成功率,同时大幅减少推理时间,实现具身规划的时间效率与质量同步提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02957 2026-08-05 cs.LG 新提交 70%

Inverted Detection and Control in Steering Vectors

转向向量中的反向检测与控制

Max Torop, Aria Masoomi, Jennifer Dy

机构 * Northeastern University(东北大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究发现大型语言模型的反向转向向量(ISVs)会产生与预期相反的转向效果,提出无需生成即可区分ISVs的方法,通过推理时干预改进转向流程,在多数实验中提升了效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01867 2026-08-05 cs.CL 版本更新 70%

CRISP: Critical Step Perception for Training Efficient Deep Search Agents

CRISP:用于训练高效深度搜索智能体的关键步骤感知

Haosi Mo, Zihao Yan, Ruiqing Zhang, Zhongli Li, Hexuan Deng, Xuebo Liu, Min Zhang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对深度搜索智能体效率低的问题,提出CRISP框架,通过区分关键与冗余交互优化奖励,在保持准确率的同时,使BrowseComp和HLE-Verified上的交互回合分别减少15.1%和33.2%。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01034 2026-08-05 cs.CL 版本更新 70%

Opt.Gear Technical Report

Opt.Gear技术报告

Juneyoung Park, Youngwook Kwon

专题命中 效率与部署 :language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 Opt.Gear系列含多参数规模模型,采用混合架构优化KV缓存,数据效率高,支持多硬件部署,还推出可在MCU运行的Opt.Gear-1M,为边缘应用提供实用基础。

Comments [OptAI] OptGear Model Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29397 2026-08-05 cs.CL cs.PF 版本更新 70%

Studying quantization trade-offs for efficient inference deployment in machine translation

研究高效机器翻译推理部署中的量化权衡

Jim Zhao, Sohir Maskey, Koen Oostermeijer, Douglas Orr, Teryn Jones

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对EuroLLM和Hy-MT2等5款1.7B至22B的翻译模型,结合文档分块与W4A8/W8A8量化,发现量化效率与翻译质量的权衡还受分块策略影响,且Hy-MT2比EuroLLM更耐量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14010 2026-08-05 cs.CV cs.AI 版本更新 70%

A Deployment-Friendly Foundational Framework for Efficient Computational Pathology

一种适用于部署的高效计算病理学基础框架

Yu Cai, Cheng Jin, Zhengyu Zhang, Jiabo Ma, Fengtao Zhou, Yingxue Xu, Zhengrui Guo, Yihui Wang, Zhengyu Zhang, Ling Liang, Yonghao Tan, Pingcheng Dong, Du Cai, On Ki Tang, Chenglong Zhao, Zhijian Cen, Ying Tan, Xi Wang, Can Yang, Yali Xu, Jing Cui, Zhenhui Li, Ronald Cheong Kin Chan, Yueping Liu, Feng Gao, Xiuming Zhang, Li Liang, Hao Chen, Kwang-Ting Cheng

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Pathology, Nanfang Hospital, School of Basic Medical Sciences, Southern Medical University(病理学系,南芳医院,南方医科大学) Guangdong Province Key Laboratory of Molecular Tumor Pathology(广东省分子肿瘤病理学重点实验室) Jinfeng Laboratory, Chongqing, China(锦峰实验室,重庆,中国) Department of General Surgery (Colorectal Surgery), The Sixth Affiliated Hospital, Sun Yat-sen University(普外科(结直肠外科),中山大学第六附属医院)

专题命中 效率与部署 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 LitePath是一种高效计算病理学基础框架,通过压缩模型和自适应碎片选择器,显著降低计算成本,实现快速、节能的病理图像分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03614 2026-08-05 eess.SP 新提交 67%

Test-Time Scalable AI-RAN: Inference Time Allocation for Cell-Free MIMO

测试时可扩展AI-RAN:无小区MIMO的推理时间分配

Seonghoon Yoo, Sangwoo Park, Seok-Hwan Park, Joonhyuk Kang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究针对无小区MIMO系统,提出通用框架以分配测试时可扩展AI-RAN各模块的最优推理时间资源,实验验证其可充分挖掘该系统的性能潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02608 2026-08-05 cs.DC 新提交 67%

Separating Intelligence from Inference: A Standard for Edge-Native AI Computing

将智能与推理分离:边缘原生AI计算的标准

Venkat Vinjam, Krishnaiah Narukulla

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出将AI的训练(智能)与推理分离的原则,设计了两类边缘设备及相关架构栈,可大幅降低大型语言模型推理的能源消耗与碳排放。

Comments 23 pages, preprint, Separating Intelligence from Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01127 2026-08-05 cs.CV 版本更新 67%

MiniWorld: Democratizing the Training of Video World Models from Scratch

MiniWorld:从零开始普及视频世界模型的训练

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

机构 * Peking University(北京大学)

专题命中 效率与部署 :pretraining(abstract);post-training(abstract)

AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00077 2026-08-05 cs.CV 版本更新 67%

Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference

超越准确率:针对OCR关键多模态大语言模型(MLLM)推理的视觉令牌剪枝空间溯源审计

Feixiang Liu, Qiang Qiu, Hao Zhang, Xinyue Wang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究针对OCR关键MLLM推理的视觉令牌剪枝,提出结合空间溯源的审计方法,发现准确率无法反映的质量风险,揭示模型特定前沿并验证压缩与任务通用性的关系,为视觉令牌剪枝评估提供新范式。

Comments 21 pages, including supplementary material. Code and reproducibility artifacts: https://github.com/SouthWinter/spatial-provenance-audit

详情

展开后加载摘要…

URL PDF HTML 收藏