arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1921 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1921 篇

2608.05745 2026-08-07 cs.CV cs.AI 新提交 70%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05734 2026-08-07 cs.AI 新提交 70%

Subliminal Learning is Non-Semantic Distillation

阈下学习(Subliminal Learning, SL)是非语义知识蒸馏

Ethan Hadley, Eren Gultepe

专题命中 效率与部署 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 该研究探究阈下学习(SL)的机制,发现非语义权重结构是关键,引导向量可生成阈下数据,相关梯度或助力数据审计,凸显识别训练数据潜在信号的重要性。

Comments Accepted as spotlight paper for the ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05448 2026-08-07 cs.CL 新提交 70%

DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding

DBLAST:面向随机投机解码的依赖块草稿生成

Amirmohammad Karimi, Chao Gao, Negar Hassanpour

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文针对块扩散草稿模型在高熵投机解码下可接受草稿长度下降的问题,提出DBLast依赖块草稿模型,在多基准测试中相比独立块采样稳定提升可接受长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05245 2026-08-07 cs.AI 新提交 70%

Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learning

Search2Skill:基于 rubric 强化学习的、突破知识边界的技能蒸馏

Muyang Ye, Tian Lan, Feihu Jiang, Yongshi Ye, Wuyunsiqin, Bin Zhu, Qianghuai Jia, Zhao Xu, Weihua Luo, Ye Wang, Jinyang Zhang, Longyue Wang, Lingfeng Bao

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对现有技能构建受限于模型已有知识的问题,提出Search2Skill框架,通过基于rubric的强化学习实现外部证据蒸馏为可复用技能,在多领域实验中优于基线且技能可跨模型规模迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04458 2026-08-06 cs.AI cs.AR cs.OS 新提交 70%

Architectural Implications of Agentic AI Workflows

智能体AI工作流的架构影响

Jirong Yang, Peizhe Liu, Chaojie Zhang, Jovan Stojkovic

机构 * Microsoft Azure(微软Azure)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究通过生产与受控研究分析智能体AI工作流的架构特性,揭示传统服务器的不匹配问题,提出Agora原型优化资源利用与吞吐量,为未来服务器架构指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03653 2026-08-05 cs.AI 新提交 70%

AutoSND: From Execution Evidence to Structural Policies for Automated Network Dismantling Heuristic Discovery

AutoSND:从执行证据到结构策略的自动网络拆解启发式发现方法

Zhijing Hu, Changjun Fan, Yufan Deng, Zhiguang Cao

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AutoSND是一种三阶段树搜索框架,通过将执行证据转化为结构策略,在真实网络上发现了更优的网络拆解启发式方法,性能与稳定性更佳且结构可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03388 2026-08-05 cs.CL 新提交 70%

Don't Let Me Ask for It: LLMs Show Deficiencies in Active Multi-Turn Information Acquisition for Abductive Inference

别让我主动索要:大语言模型在用于溯因推理的主动多轮信息获取中存在缺陷

Shahrukh Mohiuddin, Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究通过Alien Abduction游戏探究LLMs的主动多轮信息获取能力,发现其在分轮提供证据、自行选择查询时表现欠佳,存在假设验证与停止决策的缺陷。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03276 2026-08-05 cs.AI 新提交 70%

TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning

TaskPress:基于任务引导剪枝的查询无关键值缓存压缩

Wonpyo Park, Seung-won Hwang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TaskPress是一种基于任务引导剪枝的查询无关KV缓存压缩框架,通过任务引导构建可复用缓存,在长上下文任务上实现了紧凑缓存的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03214 2026-08-05 cs.AI 新提交 70%

The Agent Operating System (AOS): A Reference Operating Architecture for Distributed Agentic Systems

智能体操作系统(AOS):分布式智能体系统的参考操作架构

Ankur Sharma, Deep Shah

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出智能体操作系统(AOS),作为分布式智能体系统的参考操作架构,用于管控异构组件以构建可管控、可靠、可观测且互操作的智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03034 2026-08-05 cs.RO cs.AI 新提交 70%

PACE: Adaptive Budget Allocation for Time-Efficient Embodied Planning

PACE:面向时间高效具身规划的自适应预算分配

Yuchen Huang, Xijiang Ying, Zhenhua Ma, Xiaxiang Yuan, Zhijie Gao, Jiayi Huang, Ruichi Mao, Jiazheng Zhang, Hongsheng Ti, Maotao Tian, Rong Shi, Lu Zhao, Shizhuang Zhang, Zhuo Cui, He Wang, Ling Liu, Wei Zhang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PACE框架通过交错式思考-执行架构和动态预算分配器,在Robotouille基准测试中较ReAct+Think基线提升规划成功率,同时大幅减少推理时间,实现具身规划的时间效率与质量同步提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02957 2026-08-05 cs.LG 新提交 70%

Inverted Detection and Control in Steering Vectors

转向向量中的反向检测与控制

Max Torop, Aria Masoomi, Jennifer Dy

机构 * Northeastern University(东北大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究发现大型语言模型的反向转向向量(ISVs)会产生与预期相反的转向效果,提出无需生成即可区分ISVs的方法,通过推理时干预改进转向流程,在多数实验中提升了效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00195 2026-08-04 eess.IV cs.CV cs.LG 新提交 70%

MedSAM2-Anatomy: Training-Free Inference-Time Optimization for Musculoskeletal Segmentation

MedSAM2-Anatomy:面向肌肉骨骼分割的无训练推理时优化方法

John Garcia Henao, Nicholas Bünger, Benedikt Herzog, Cindy Guerrero Toro, Benjamin Vella, Matthias Biner, Rico Brütsch, Carmen Castroviejo Fernandez, Felix Öttl, Norman Juchler, Armando Hoch, Bettina Hochreiter, Sven Hirsch, Sebastiano Caprara

专题命中 效率与部署 :foundation model(abstract);prompting(abstract);分类 cs.LG

AI总结 MedSAM2-Anatomy是一种无训练的推理时优化框架,通过融合专家模型生成的自动解剖提示,提升冻结分割模型的髋部、肩部肌肉骨骼分割性能,无需人工提示或模型重训。

Comments Original research manuscript (13 pages, 4 figures, 2 tables). No prior publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02123 2026-08-04 cs.CL 新提交 70%

From Chains to Trees: Parent-Conditioned Drafting for Semi-Autoregressive Speculative Decoding

从链到树:用于半自回归投机解码的父条件生成方案

Zixian Li, Tong Li, Chi Xie, Xiaohui Song, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对半自回归生成器DSpark的线性生成缺陷,提出父条件生成树(PCTree),通过为每个父节点生成多分支候选序列分配验证预算,在Qwen3系列模型及9个基准上显著提升了投机解码的推理加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01979 2026-08-04 cs.CV cs.CL 新提交 70%

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs

ET-Prune:面向文本丰富型多模态大语言模型的视觉 token 剪枝的证据感知动态预算分配

Zizhong Ding, Junxian Li, Kai Liu, Shaoqiu Zhang, Xiao Xiao, Linghe Kong, Yulun Zhang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ET-Prune 是一种无需训练的视觉 token 剪枝框架,通过证据分配实现动态预算,在文本丰富的多模态任务中,于约一半 token 保留量下,在 OCRBench-v2、MMBench v1.1 等基准上取得优于基线的性能,实现了质量与成本的良好平衡。

Comments Code and supplementary material is at https://github.com/Labyrinth0419/ET-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01927 2026-08-04 cs.SE cs.AI 新提交 70%

Effective and Efficient Context Retrieval via Partial Dependency Graph for Repository-Level Code Generation

基于部分依赖图的高效上下文检索用于仓库级代码生成

Zhongxin Liu, Zhonghao Jiang, Zhifan Ye, Haoye Wang, Jiakun Liu, Xiaoxue Ren

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对仓库级代码生成中RAG方法的不足,提出基于部分依赖图的DyRetriever,构建DyCoder并在CoderEval、DevEval上取得显著性能提升且效率更高。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01837 2026-08-04 cs.AI 新提交 70%

PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning

PCSD:智能体强化学习中自蒸馏的持久一致性

Chunji Lv, Yangguang Wei, Junlin Liu, Yang Gao, Ming Liu, Xinming Wang, Jinyang Wu, Guoren Wang, Changsheng Li

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对智能体强化学习中奖励稀疏问题,提出PCSD方法,通过持久一致性推导蒸馏权重,结合GRPO优化,在ALFWorld等基准上取得优于GRPO、SDAR的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01271 2026-08-04 cs.CV cs.AI 新提交 70%

Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

重新思考基于全局码本的视频令牌压缩:一次学习,处处压缩

Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出即插即用框架ONCE,通过离线学习全局码本实现视频令牌的高效压缩,在保持性能的同时降低推理延迟,提升了视频大语言模型的效率与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00909 2026-08-04 cs.CL cs.AR 新提交 70%

FinHardBench: Can LLMs Generate Latency-Aware Hardware for Financial Computing?

FinHardBench:大语言模型能否生成面向金融计算的延迟感知硬件?

Weimin Fu, Hejia Zhang, Minghao Shao, Zeng Wang, Johann Knechtel, Ozgur Sinanoglu, Muhammad Shafique, Ramesh Karri, Xiaolong Guo

机构 * Lehigh University(里海大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) NYU Tandon School of Engineering(纽约大学坦登工程学院) NYU Abu Dhabi(纽约大学阿布扎比分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出面向金融FPGA设计的开源基准FinHardBench,通过三类实验评估6种大语言模型,发现其在功能正确性、系统级配置优化等方面存在差异,策略级规格变更问题仍待解决。

Comments 16 pages (10 pages main text). Published as a conference paper at COLM 2026. Code and benchmark: https://github.com/owenfucell/FinHardBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00881 2026-08-04 cs.LG 新提交 70%

AOSpec: Action and Observation Co-Speculation for Low-Latency Agent Serving

AOSpec:用于低延迟智能体服务的动作与观测协同推测

Hao Mark Chen, Jinnan Guo, Wayne Luk, Hongxiang Fan

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 AOSpec是一种动作与观测协同推测的无损框架,通过EVD和JASV技术降低智能体服务延迟,在Terminal-Bench上较基线实现显著延迟缩减,且观测模型可跨基准迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00531 2026-08-04 cs.AI 新提交 70%

CURE: Local Uncertainty Repair for Block-Parallel Speculative Decoding

CURE:面向块并行推测解码的局部不确定性修复

Aofan Liu, Jingxiang Meng, Fangxin Liu, Yongbiao Chen

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对并行推测解码的长序列精度下降问题,提出预算感知动态修复树CURE,通过定位高不确定性token修复错误,在多个基准上提升平均接受长度并实现2.66-3.49倍端到端速度提升。

Comments 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00027 2026-08-04 cs.AI 新提交 70%

Motif-Mamba: network motif improved mamba for long-range sequence modeling

Motif-Mamba:融合网络基序改进Mamba的长程序列建模模型

Chonghe Hao, Yue Sun, Jian Zhang, Yansong Wang, Wangzi Yao, Yunjie Yao, Tielin Zhang

机构 * Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences(中国科学院脑科学与智能技术卓越创新中心)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出融合网络基序的结构化状态空间模型Motif-Mamba,改进Mamba的对角状态转移限制,在长序列建模任务上性能优于原Mamba,为长程序列建模提供有效结构先验。

Comments 9 pages of main text, 8 pages of appendix, 6 figures. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00008 2026-08-04 cs.AI cs.ET cs.PF 新提交 70%

Energy Efficiency of Locally Deployed LLMs: A Preliminary Quantitative GPU Power Benchmark on Consumer Hardware

本地部署大语言模型(LLMs)的能效:消费级硬件上的初步GPU功耗定量基准测试

Philipp M. Zähl, Anika Hennig

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对9款1B至7B参数的开源LLMs,在RTX 4060Ti 16GB GPU上开展能效基准测试,发现模型架构、量化策略等影响能效,gemma3:1b等模型能效最优,7B-Mistral能效最差,还需区分令牌生成模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29320 2026-08-03 cs.AI 新提交 70%

MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation

MAGA:基于结构化动作蒸馏的GUI智能体多平台自融合

Hang Yan, Zhangxuan GU, Beitong Zhou, Jiaxuan Chen, Runze Li, Yusong Hu, Shuheng Shen, Changhua Meng

机构 * Ant Group(蚂蚁集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对GUI智能体跨平台部署受限问题,提出MAGA方法优化训练信号分配,在8B参数规模下性能优于基准模型,与教师模型表现接近。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29254 2026-08-03 cs.AI 新提交 70%

Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents

工具规格很重要:揭示和缓解AI智能体中的安全风险

Minghui Pan, Jiayuxuan Yang, Yuanyuan Yuan, Yu Jiang, Zhenpeng Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究发现模式格式工具规格是AI智能体安全下降的主因,提出SafeKeep防护措施,可提升有害请求弃权率、降低攻击成功率,性能优于现有防护且保留任务处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27735 2026-07-31 cs.CL 新提交 70%

A Sparse Glimpse of the Whole: Train-Free Self-Speculative Decoding

对整体的稀疏一瞥:无训练的自推测解码

Yuesong Liu, Yuan Zeng, Min Lyu, Ruilin Liu, Yu Guo, Yinlong Xu

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对推测解码加速受限问题,提出无训练的SparseSpec-L框架,通过动态稀疏KV缓存与熵控推测长度,在保留目标模型输出分布的同时实现长上下文推理的端到端加速。

Comments 9 pages, 4 figures, subbmited to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27574 2026-07-31 cs.LG cs.MA 新提交 70%

Policy Gradient Steering: Interventions from Behavioral Objectives

策略梯度引导:来自行为目标的干预

Yoann Poupart, Aurélie Beynier, Nicolas Maudet

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对现有激活引导无法引导双路径网格世界简单策略的问题,提出PGS方法,经网格世界、国际象棋、竞技足球实验验证其校准性、可逆性及行为适配的可组合性与跨域迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27415 2026-07-31 cs.AI 新提交 70%

Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs

基于动作中心图的推理时缩放与情景记忆的衔接

Xu Zheng, Chaohao Lin, Zhuomin Chen, Weijieying Ren, Haifeng Chen, Wei Cheng, Dongsheng Luo

机构 * Florida International University(佛罗里达国际大学) Stanford University(斯坦福大学) NEC Laboratories America(美国NEC实验室) Singapore Management University(新加坡管理大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GAMER框架,通过动作中心图衔接推理缩放与情景记忆,采用双流时间差分学习优化决策,在多基准上较普通基线提升了20.81%的成功率与6.17%的进度率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27269 2026-07-31 cs.LG 新提交 70%

Beyond KV Reconstruction: Functional Reconstruction for MLA Draft Models in Speculative Decoding

超越KV重建:推测解码中MLA草稿模型的功能重建

Weiye Shi, Fanxu Meng, Muhan Zhang

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对推测解码中MHA/GQA转MLA导致草稿令牌接受率降低的问题,提出功能重建方法优化转换后的MLA注意力模块,在多数任务中提升了草稿令牌接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26309 2026-07-30 stat.ME cs.CL stat.AP stat.ML 新提交 70%

The Confounder Trap: Treatment-Encoding Representations in Causal Inference with Text

混淆陷阱:文本因果推断中处理编码表征

Marie Neubrander, Graham Tierney, Alexander Volfovsky

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文针对文本因果推断中因处理状态由文本编码引发的混淆陷阱,提出掩码调整表征方法,经模拟验证可改善重叠诊断、稳定因果效应估计并降低偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26627 2026-07-30 cs.CL 新提交 70%

Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes

重新审视推测解码中的有损验证:机制、权衡与失效模式

Tianyu Wang, Yuxuan Zhou, Wenbin Wang, Heng Li, Zikai Xiao, Junyuan Shang

机构 * Independent Researcher(独立研究者) Baidu Inc.(百度公司) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究分析有损推测解码的机制与失效模式,将其分为两类并构建评估框架,发现基于截断的有损方法会因分布失真致性能下降,协作类需控制概率超调以保障生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏