arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1921 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1921 篇

2607.26228 2026-07-30 cs.CL 新提交 70%

Steering Instruction Hierarchies at Inference Time

推理时的指令层级调控

Siqi Zeng, Sewoong Lee, Han Zhao, Julia Hockenmaier

专题命中 效率与部署 :LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 针对前沿大语言模型常违反指令层级的问题,提出无需训练的V-Steer方法,通过编辑缓存值向量调控指令层级,提升角色冲突基准准确率,性能优于仅提示基线,部分场景达到SoTA训练方法水平。

Comments Published as a conference paper at COLM '26; the first two authors contributed equally to the work. 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25669 2026-07-29 cs.AI 新提交 70%

OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs

OmniDelta:用于OmniLLMs中令牌压缩的技能驱动预算分配

Haoyang Huang, Wenjie Huang, Tianqi Xu, Hongyaoxing Gu, Kang Tan, Yikai Fu, Yuhao Shen, Tianyu Liu, Baolin Zhang, Jun Zhang, Xinyi Hu, Jun Dai, Shuang Ge, Lei Chen, Yue Li, Mingchen Wang, Meng Zhang

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Alibaba(阿里巴巴)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对OmniLLMs长音频-视频令牌序列成本高的问题,提出技能驱动的OmniDelta框架,通过构建技能池、结合意图与内容感知分配预算,能与现有策略结合,实验证明其在多个基准上建立新的准确性-效率前沿,减少内存并加速推理。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23304 2026-07-28 stat.ML cs.LG stat.ME 新提交 70%

Context-Adaptive Inference: A Unified Statistical and Foundation-Model View

上下文自适应推理:统一的统计和基础模型视角

Yue Yao, Caleb N. Ellington, Jingyun Jia, Baiheng Chen, Dong Liu, Rikhil Rao, Jiaqi Wang, Samuel Wales-McGrath, Yixin Yang, Zhiyuan Li, Eric P. Xing, Ben Lengerich

专题命中 效率与部署 :foundation model(abstract);prompting(abstract);分类 cs.LG

AI总结 研究现代预测系统的上下文自适应推理,统一了统计、元学习和基础模型的相关方法,证明特定条件下显式与隐式自适应等价,提出设计原则、评估指标并识别开放问题。

Comments 90 pages, 13 figures. Manuscript source and living version: https://github.com/AdaptInfer/context-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24280 2026-07-28 cs.AI 新提交 70%

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

从专有模型到开源模型:通过智能体搜索中的多智能体协议蒸馏弥合分布差距

Junlin Liu, Jiangwang Chen, Zixin Song, Shuaiyu Zhou, Chunji Lv, Hank Wu, Kailin Jiang, Jinyang Wu, Bohan Yu, Chenxi Zhou

机构 * Beijing Institute of Technology(北京理工大学) East China Normal University(华东师范大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在弥合专有与开源模型分布差距,提出多智能体协议蒸馏(MAPD)框架,利用结构化协议作中间表示,结合蒸馏与强化学习,在问答基准测试中表现出色,有效减轻学生策略问题,优于其他竞争方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23740 2026-07-28 cs.CL 新提交 70%

Zing: Social Mind for LLMs

Zing:大语言模型的社交智能

Zing Team, Ao Xiang, Bi Jingping, Chen Jiahui, Chen Lehan, Chen Yilin, Cheng Xueqi, Fan Yixing, Gan Kairong, Gao Haowen, Gao Jinhua, Gao Shuxuan, Gong Chang, Guo Jiafeng, Guo Ruijie, Han Zhouyu, He Guangfu, He Yichun, Jiang Shuo, Jing Shaoling, Jing Ya, Lei Chenhao, Lei Yan, Li Anqi, Li Chengao, Li Haoyu, Li Shitian, Liang Xinjian, Liu Zhaoge, Lyu Xingyu, Nie Zhuwei, Pang Liang, Quan Zeping, Shan Shiguang, Shen Huawei, Tang Xinran, Tian Feng, Wang Qian, Wang Ruiping, Wang Xiaohong, Xia Zaiyu, Xiao Yi, Xu Jiayuan, Xu Kehan, Xu Qianqian, Xu Tianyu, Xu Yongjun, Yang Haoming, Yang Jun, Yao Di, Yu Xiaoming, Zhang Futong, Zhang Jie, Zhang Shixuan, Zhang Yuxuan, Zhao Xinyu, Zhao Zhuoran, Zhong Yunfei, Zhu Shengyu

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型社交智能,提出Zijing框架,含测量基准SoMBench、训练方法Zing及推理架构Actio,通过实验证明社交智能大语言模型在评估、内化和落地方面需协同发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22716 2026-07-28 cs.CV cs.LG 新提交 70%

Visual Token Compression Enhances Robustness of MLLMs

视觉令牌压缩增强多模态大语言模型的鲁棒性

Shishen Gu, Jiequan Cui, Wenbo Hu, Zenglin Shi, Zhenzhen Hu, Richang Hong

机构 * Hefei University of Technology(合肥工业大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究如何增强多模态大语言模型的鲁棒性,核心方法是通过测量视觉令牌与语言特征空间的距离来识别并剪枝分布外视觉令牌,该方法能有效防御越狱攻击、减轻幻觉,提升模型在通用数据集上的表现。

Comments 20 pages, 16 figures. Accepted at ACM Multimedia 2026. Code: https://github.com/Eurek001/OOD-VTP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22648 2026-07-28 cs.AI cs.DC 新提交 70%

PTStore (Prefix Tensor Store): Distributed Prefix Caching and Replication for High Throughput Inference Serving

PTStore(前缀张量存储):用于高吞吐量推理服务的分布式前缀缓存与复制

Meghana Maghyastha, Robert Underwood, Randal Burns, Bogdan Nicolae

机构 * Johns Hopkins University(约翰霍普金斯大学) Argonne National Laboraotory(阿贡国家实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 PTStore 受 CDN 客户端缓存设计启发,通过分发和复制流行张量形成可重用 KV 缓存前缀来加速推理,减少缓存访问延迟与负载不平衡,能大幅扩大 KV 缓存大小,使长文本问答推理效率比基线高 5 至 6 倍。

Journal ref Euro-Par 2026: 32nd International European Conference on Parallel and Distributed Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22634 2026-07-28 cs.AI 新提交 70%

PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding

PRESTO:用于扩散推测解码的前缀对齐树草稿生成

Zheng Wang, Zhifan Ye, Qi Cheng, Yonggan Fu, Ziyan Wang, Feng Zhu, Haozhe Zhao, Jan Kautz, Pavlo Molchanov, Humphrey Shi, Minjia Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对扩散大语言模型用于推测解码时现有方法的局限,提出PRESTO框架,通过前缀对齐评分和基于优先级的树搜索,解决扩散草稿与前缀验证不匹配问题,在多种基准测试中显著提升了端到端吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22611 2026-07-28 cs.AI cs.CR cs.ET cs.MA 新提交 70%

Decentralized Granular Access Control for Agentic AI Systems in Critical Infrastructure

关键基础设施中智能体人工智能系统的去中心化粒度访问控制

Arun Malik, Deepal Jayasinghe, Bradley Klemick, Prachi Shah, Nitish Talasu, Vineet Tushar Trivedi

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究关键基础设施中智能体人工智能系统的安全挑战,提出去中心化多层访问控制架构,含复合身份模型等四项创新,基于OWASP威胁分类法设计,经云提供商生产验证,能有效实施粒度访问控制并防止特权升级。

Comments 7 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23006 2026-07-28 cs.IR cond-mat.mtrl-sci cs.AI 新提交 70%

VecTree-RAG: An Agentic Retrieval-Augmented Generation Framework Combining Vector and Tree Retrieval for Efficiency and Accuracy

VecTree-RAG:一种结合向量和树检索的智能检索增强生成框架,以提高效率和准确性

Xinyan Zhong, Yuwei Shi, Yuqi Wei, Chen Shen, Tianhang Zhou, Zhenghao Wu

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对科学问答中识别相关论文及找支持证据的问题,提出VecTree-RAG框架,结合向量与树检索机制。经多组问题评估,该框架在多个基准上获高分,证据页面精度高,且完整架构所需推理令牌少,为科学文献问答提供结构感知且可追溯的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22319 2026-07-27 cs.DB cs.AI 新提交 70%

Towards Trustworthy and Cost-Efficient Data Integration: From Naïve RAG to Agentic RAG

迈向可信且经济高效的数据集成:从朴素检索增强生成到智能体检索增强生成

Chuangtao Ma, Arijit Khan

机构 * Aalborg University, Denmark(丹麦奥胡斯大学) Bowling Green State University, USA(美国布恩威尔州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 探讨大语言模型和人工智能智能体在企业数据集成中面临的挑战,介绍从经典RAG到智能体RAG的演变,研究经济高效集成的优化策略,为构建可靠、可解释和可扩展的数据集成系统指明方向。

Comments To Appear in the IEEE Data Engineering Bulletin

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21600 2026-07-27 cs.AI 新提交 70%

Securing Multimodal AI through Internal Information Decomposition

通过内部信息分解保护多模态人工智能

Jehyeok Yeon, Hyeonjeong Ha, Qiusi Zhan, Heng Ji

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型的攻击问题,提出FlowGuard框架,通过监测内部多模态一致性检测有害输入,受部分信息分解启发得出FlowVectors量化相关指标,有效降低攻击成功率且减少效用损失和延迟,为多模态推理提供有效防御。

Comments Accepted as Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21063 2026-07-24 cs.CL cs.CY cs.HC 新提交 70%

QuantiBias: Benchmarking Quantization-Induced Bias in LLMs

QuantiBias:量化大语言模型中量化诱导偏差的基准测试

Emilio Ferrara

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型量化中的偏差问题,提出QuantiBias基准测试,通过结合多种控制和对比有无推理的构建来评估偏差,发现量化器按无偏差预防信号的数据分配精度,推理对部分偏差有减半效果,强调需重新评估量化模型的开放式偏差。

Comments Benchmark protocol on Hugging Face: https://huggingface.co/datasets/emilioferrara/quantibias

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20981 2026-07-24 cs.AI 新提交 70%

Beyond Independent Optimization: Compression, MoE Routing, and Quantization Interactions in Multimodal Edge Intelligence

超越独立优化:多模态边缘智能中的压缩、混合专家路由和量化交互

Jay Gor, Karm Dave, Akshita Abrol, Rajesh Gupta, Sudeep Tanwar, Zhengkui Wang

机构 * Nirma University(尼玛大学) Singapore Institute of Technology(新加坡理工学院) Marwadi University(马尔瓦迪大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态边缘智能中高效推理受多种因素限制,回顾相关模型进展,指出技术间相互影响不能独立优化,介绍关键设计权衡,引入视频MoE模型诊断方法,强调多方面开放研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20451 2026-07-24 cs.CL 新提交 70%

Semantic Field Theory: Historical Origin, Higher-Order Interaction, and Stabilized Semantic Inference

语义场理论:历史起源、高阶交互与稳定语义推理

Dimitris Vartziotis

机构 * NIKI – Digital Engineering(尼基数字工程公司) TWT Science & Innovation(TWT科学与创新公司)

专题命中 效率与部署 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文围绕语义场理论展开,重构其演变并赋予清晰数学核心。核心方法是通过词汇表征等建模语言组织层次,贡献五个形式元素。主要贡献是为计算语言学等提供了可评估的模型及相关理论元素,虽非完整理论,但有重要意义。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19539 2026-07-23 cs.DC cs.AI 新提交 70%

Fine-grained Computation-Communication Overlap via Tile-level Signaling and Scheduling for Mixture-of-Experts

基于瓦片级信号与调度的专家混合模型细粒度计算-通信重叠

Minyu Cui, Anna Wingkvist, Morgan Ericsson

机构 * Linnaeus University(林纳大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对专家混合模型在多GPU系统中通信延迟问题,提出通过瓦片级信号与调度实现细粒度计算-通信重叠的方法,结合生产者-消费者协同设计,在4个A100 GPU平台评估中取得加速效果,提升了不同场景下的性能。

Comments To appear at the 55th International Conference on Parallel Processing (ICPP 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20205 2026-07-23 stat.ML cs.LG math.ST stat.TH 新提交 70%

Statistical Inference for Rank Allocation in Low-Rank Adaptation

低秩适应中秩分配的统计推断

Yihang Gao, Vincent Y. F. Tan

机构 * Department of Mathematics, National University of Singapore(数学系,新加坡国立大学) Department of Mathematics and Department of Electrical and Computer Engineering, National University of Singapore(数学系和电气与计算机工程系,新加坡国立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究低秩适应中在固定参数预算下分配秩资源的问题,提出StatLoRA方法,将其表述为统计假设检验问题,通过检验统计量和p值确定组件取舍,实验表明该方法在匹配秩预算下性能良好,支持了分配规则稳定性及渐近理论。

Comments 77 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18267 2026-07-22 cs.NI cs.AI 新提交 70%

The Economics of Autonomy: Real-Time Risk Indexing for Insurable AI-Driven 6G Systems

自主性经济学:适用于可保险的人工智能驱动的6G系统的实时风险索引

Anthony Kiggundu, Michael Zentarra, Christoph Lipps, Hans D. Schotten

机构 * German Research Center for Artificial Intelligence (DFKI), Germany(德国人工智能研究中心(DFKI)) RPTU University of Kaiserslautern-Landau, Germany(莱茵-威斯伐尔大学科堡分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究6G网络中传统治理框架在风险管理上的不足,提出GIRAF框架,通过机器可读运行时信号得出总风险指数,形式化验证陈旧性权衡,经模拟验证该框架能保持操作完整性并为多利益相关者责任归属等提供精算基线。

Comments Accepted at the IEEE 104th Vehicular Technology Conference - VTC2026-Fall

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17774 2026-07-21 cs.SE cs.AI cs.HC 新提交 70%

Persona-as-Configuration: Generative Stakeholder Reporting for Agricultural Floods

作为配置的角色:农业洪水的生成式利益相关者报告

Oliver Aleksander Larsen, Tiziano Santilli, Francesco Daghero, Mahyar T. Moghaddam

机构 * University of Southern Denmark(南丹麦大学) Maersk Mc-Kinney Moller Institute(马士基麦肯尼·莫勒研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究网络物理系统决策日志解读问题,提出基于单向消费和角色即配置的架构模式,实例化为上下文感知仪表板层,经专家评审在多质量维度获好评,为后续农业利益相关者最终用户评估奠定基础。

Comments Accepted at CASA 2026 (9th Workshop on Context-Aware, Autonomous and Smart Architectures), co-located with ECSA 2026. 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17558 2026-07-21 cs.AI 新提交 70%

Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?

为什么反馈增强的自蒸馏不能改进检索交织搜索智能体?

Fan Yang, Rui Meng, Yuxin Wen

机构 * Chapman University(查普曼大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究反馈增强的自蒸馏在智能体搜索中失效的原因,发现模型存在解码崩溃现象,因监督信号不一致致学习不稳定,将其分解为模型和提示不一致,引入EMA教师减轻不一致,最终提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17166 2026-07-21 cs.LG 新提交 70%

Explaining and Tuning Transformer-based LLMs in Arithmetic Tasks with Human Strategies

用人类策略解释和调整基于Transformer的语言模型在算术任务中的表现

Luyu Qiu, Jianing Li, Hwanhee Kim, Xiaoyong Wei, Yueyuan Zheng, Janet Hsiao, Lei Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究基于Transformer的语言模型在算术任务中的表现,通过分解任务、分析损失收敛等,应用人类策略和方法提升其性能,并经多种验证展示有效性,探索其与人类学习者相似性以增强关键应用中的信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15810 2026-07-20 cs.LG 新提交 70%

QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides

QUADS:通过双边量化误差对齐稳定用于专家混合模型的NVFP4强化学习

Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

机构 * Alibaba Inc(阿里巴巴公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对MoE大语言模型RL中展开生成瓶颈,提出QUADS方法。通过训练 - 推理误差分析确定激活误差是FP4 RL不稳定主因,在训练器和展开侧分别采取措施,实现BF16精度,提升指标并提高展开吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15621 2026-07-20 cs.RO cs.AI 新提交 70%

Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving

以5Hz思考,20Hz行动:用于闭环驾驶的异步快慢视觉-语言-动作推理

Yun Li, Jiachen Gong, Simon Thompson, Ehsan Javanmardi, Qunli Zhang, Zifan Zeng, Shiming Liu, Peng Wang, Zixuan Guo, Manabu Tsukada

机构 * The University of Tokyo(东京大学) TIER IV, Inc.(TIER IV公司) Huawei(华为)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型用于闭环驾驶时推理延迟与车辆控制速率冲突的问题,提出快慢架构,慢系统用冻结主干处理历史,快专家基于缓存和当前帧回归航路点,经训练在CARLA上提升路线完成率,降低误差且可零样本转移。

Comments 13 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15467 2026-07-20 cs.LG cs.CR 新提交 70%

ADS-C: Antidistillation Sampling for Classification

ADS-C:用于分类的反蒸馏采样

Khawaja Abaid Ullah, Mohammad Javad Khojasteh

机构 * Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对知识蒸馏中对手复制专有分类器的问题,提出ADS-C方法,通过在闭式的每个输入边际预算下构成扰动,保留服务的top-1预测,使防御后教师模型准确率不变,且效用成本为零,有效抵御对手蒸馏,降低学生模型性能损失。

Comments 20 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14777 2026-07-17 cs.CL 新提交 70%

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

SEED:用于智能体强化学习的自进化在线策略蒸馏

Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对基于结果的强化学习中间决策指导有限的问题,提出SEED框架。它将在线策略轨迹转化为训练技能并提炼回策略模型,通过微调策略生成技能,重新评分动作转化蒸馏信号,联合优化提升性能与样本效率及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14557 2026-07-17 cs.AI 新提交 70%

Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation

从零步洞察终点:通过MLP稀疏感知截断加速扩散多模态大语言模型

Qicheng Zhao, Qi Sun, Zheyu Yan

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对扩散多模态大语言模型推理效率受固定长度生成约束影响的问题,提出Seer框架,利用MLP激活稀疏性变化检测有效语义边界,进行冗余截断及采用混合执行策略,实验表明其可加速吞吐量并维持性能甚至提升复杂视觉任务准确性。

Comments Accepted to ACM Multimedia (ACM MM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14456 2026-07-17 cs.SE cs.AI 新提交 70%

Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution

超越通用语言模型:用于结构化代码工作流执行的专业代理系统

Harris Borman, Herman Wandabwa, Fusun Yu, Sandeepa Kannangara, Justin Liu, Anna Leontjeva, Ritchie Ng

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在业务流程自动化中,将BPMN图转换为可执行代理工作流时,专业代理是否值得额外开发。引入专业工作流并与通用代理比较,结果显示专业代理在多方面表现更优,通用代理代码生成不一致,不适用于工业环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13770 2026-07-16 cs.AR cs.AI 新提交 70%

Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations

Kaleido:通过利用潜在空间相关性对视频扩散变压器进行算法-硬件协同设计

Wenxuan Miao, Haosong Liu, Weiming Hu, Zihan Liu, Aiyue Chen, Jianlin Yu, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Jiao Tong University, Shanghai Qi Zhi Institute(上海交通大学、上海颀智研究所) Huawei Technologies(华为技术有限公司) ICT, Chinese Academy of Sciences(信息科技研究所、中国科学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对视频扩散变压器计算成本高的问题,提出Kaleido算法-硬件协同设计,利用潜在空间通道级时空相关性加速操作,有轻量级重用算法,设计了加速器,实验表明其相比现有加速器有显著加速和节能效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13088 2026-07-16 cs.CR cs.LG 新提交 70%

Securing LLMs in the Wild: Privacy and Security Challenges at the Edge

保障野外大语言模型安全:边缘环境下的隐私与安全挑战

Ren-Yi Huang, Mingchen Li, Dumindu Samaraweera, Morris Chang

机构 * Department of Electrical and Computer Engineering, University of South Florida(电子与计算机工程系,佛罗里达州立大学) Department of Mathematics, Embry-Riddle Aeronautical University(数学系,埃默里-瑞德航空大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究边缘大语言模型安全隐私挑战,围绕内存墙等架构约束引入分类法,得出统一约束模型,提出安全操作效率得分,给出决策程序和缓解措施,为联合评估安全、隐私和效率提供框架,保障边缘原生智能系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12634 2026-07-15 cs.AI 新提交 70%

Atomic Units of X: The Compression Layer of Intelligence

X的原子单位:智能的压缩层

Sachin Dev Duggal, Pradyumna Swarnalatha Ramanna, Alexandros Vassiliades

机构 * SeKondBrain AI Labs(第二大脑人工智能实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该论文提出将智能视为原子压缩与组合复用过程的理论框架,借助多学科证据阐述原子单位概念,给出压缩演算等核心方法,为设计自进化知识系统奠基,为智能相关多方面提供统一视角。

详情

展开后加载摘要…

URL PDF HTML 收藏