arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-20 至 2026-05-20 共收录 396 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 93 篇

2605.19328 2026-05-20 cs.CR cs.RO 50%

RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents

RoboJailBench: 对具身体验机器人代理中对抗攻击和防御的基准测试

Doguhuan Yeke, Yanming Zhou, Leo Y. Lin, Hongyu Cai, Antonio Bianchi, Z. Berkay Celik

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出RoboJailBench,通过建立安全分类学、引入意图对比数据集管道以及提供一个演进的存储库,为具身体验人工智能中的对抗攻击和防御提供了标准化评估框架,同时构建了一个新的分类平衡数据集并增强了五个现有数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19159 2026-05-20 cs.CR 50%

On the Geometric Limits of Transformer Defenses against Obfuscation Attacks: Latent Embedding Collapse & Performance Robustness Gap

关于变换器对混淆攻击的几何极限:潜在嵌入崩溃与性能鲁棒性差距

Becky Mashaido, Tapadhir Das

专题命中 评测与基准 :language model(abstract)

AI总结 本文研究了变换器在对抗混淆攻击时的几何极限,揭示了高检测性能并不等同于表示鲁棒性,通过实验发现潜在嵌入崩溃现象及性能鲁棒性差距,表明现有评估指标未能捕捉到潜在嵌入崩溃和底层几何脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01905 2026-05-20 cs.CR cs.SE 50%

From Component Manipulation to System Compromise: Understanding and Detecting Malicious MCP Servers

从组件操控到系统妥协:理解并检测恶意MCP服务器

Yiheng Huang, Zhijia Zhao, Bihuan Chen, Susheng Wu, Zhuotong Zhou, Yiheng Cao, Xin Hu, Xin Peng

专题命中 评测与基准 :LLM(abstract_cn)

AI总结 本文提出了一种以组件为中心的方法来理解和检测恶意MCP服务器,构建了首个包含114个恶意MCP服务器的组件中心POC数据集,并提出了 Connor 检测器,实现了94.6%的F1分数,有效识别了恶意服务器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18768 2026-05-20 cs.IR cs.HC cs.MA 50%

ClinQueryAgent: A Conversational Agent for Population Health Management

ClinQueryAgent:一种用于群体健康管理的对话代理

Joseph S. Boyle, Anthony Dranfield, Mike O'Neil, Maria Liakata, Alison Q. Smithard

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出ClinQueryAgent,一种将自然语言群体健康问题转化为可执行数据库查询的对话代理系统,通过本地和外部知识库的结合,实现安全高效的健康信息处理。

Comments 11 pages, 4 figures. Submitted to ACL Systems Demonstrations

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 71 篇

2506.05640 2026-05-20 cs.CR cs.DC 94%

FedShield-LLM: A Secure and Scalable Federated Fine-Tuned Large Language Model

FedShield-LLM: 一种安全且可扩展的联邦微调大语言模型

Md Jueal Mia, M. Hadi Amini

专题命中 效率与部署 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出FedShield-LLM,通过结合剪枝与全同态加密技术,提升联邦学习中大语言模型的安全性和可扩展性,同时减少计算和通信开销,实现高效的任务特定模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20309 2026-05-20 cs.DC cs.AI cs.LG 92%

SuperInfer: SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips

SuperInfer: 面向Superchips的SLO感知旋转调度与内存管理技术

Jiahuan Yu, Mingtao Hu, Zichao Lin, Minjia Zhang

机构 * Supercomputing-System-AI-Lab(超级计算系统人工智能实验室)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对LLM服务中严格延迟SLO与有限GPU内存容量之间的矛盾,SuperInfer提出了一种面向新兴Superchips的高性能LLM推理系统,通过NVLink-C2C实现紧密耦合的GPU-CPU架构,引入SLO感知的旋转调度器RotaSched和优化的旋转引擎DuplexKV,显著提升了TTFT SLO达成率。

Comments Accepted by MLSys '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19604 2026-05-20 cs.AI 92%

Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents

形式技能:用于高效且准确LLM代理的可编程运行时技能

Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

机构 * FairyClaw

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出形式技能,一种用于LLM代理的可编程运行时技能抽象,通过JSON元数据和动作模式、可靠的Python执行器、受钩子控制的控制逻辑、形式技能路由和本地运行时状态,提高代理的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19593 2026-05-20 cs.AI cs.DC 92%

Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

迈向多模型LLM调度器:关于卸载和抢占的实证洞察

Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

机构 * Sapienza University of Rome(罗马大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究探讨了不同LLM在不同硬件平台上的行为,重点分析了层卸载和抢占对性能的影响,揭示了卸载和抢占对解码吞吐量的非线性影响以及其在不同模型和硬件平台上的差异,为设计高效的多模型LLM服务系统提供了指导。

Comments The 2026 Mediterranean Artificial Intelligence and Networking Conference (MAIN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19321 2026-05-20 cs.CR cs.AI 90%

Exploring and Developing a Pre-Model Safeguard with Draft Models

探索和开发预模型安全防护机制

Hongyu Cai, Arjun Arunasalam, Yiming Liang, Antonio Bianchi, Z. Berkay Celik

机构 * Purdue University(普渡大学) Florida International University(佛罗里达国际大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 本文研究了如何通过利用 jailbreak 攻击的可转移性,在目标模型推理前确保提示的安全性,提出了一种新的安全防护设计,减少了预模型防护的误报率,并提供了一种低开销的替代方案。

Journal ref ACM Conference on AI and Agentic Systems (ACM CAIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18818 2026-05-20 cs.AI cs.LG cs.SE 90%

Operationalizing Document AI: A Microservice Architecture for OCR and LLM Pipelines in Production

将文档AI operationalize:一种用于OCR和LLM流水线的微服务架构

Yao Fehlis, Benjamin Bengfort, Zhangzhang Si, Vahid Eyorokon, Prema Roman, Patrick Deziel, Devon Slonaker, Steve Veldman, Ben Johnson, Joyce Rigelo, Michael Wharton, Steve Kramer

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种微服务架构,用于在生产环境中实现文档理解,通过整合多个模型的流水线,包括分类、OCR和LLM结构字段提取,并展示了在每小时处理数千页文档的经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19481 2026-05-20 cs.OS 89%

C2CServe: Leveraging NVLink-C2C for Elastic Serverless LLM Serving on MIG

C2CServe: 利用NVLink-C2C实现弹性无服务器LLM服务的MIG

Shutian Luo, Ali Zafar Sadiq, Rui Yang, Mingye Zhang, Haiying Shen, Wei Wang, Yue Cheng

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出C2CServe,一种基于MIG的无服务器LLM服务系统,利用NVLink-C2C实现模型在请求粒度上的切换,减少冷启动延迟并保持高响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19240 2026-05-20 cs.MA 89%

CASPIAN: Online Detection and Attribution of Cascade Attacks in LLM Multi-Agent Systems via Cross-Channel Causal Monitoring

CASPIAN: 通过跨通道因果监控在线检测和归因LLM多智能体系统中的级联攻击

Kavana Venkatesh, Jafar Isbarov, Saad Amin, Murat Kantarcioglu, Jiaming Cui

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出CASPIAN框架,通过跨通道因果监控在线检测和归因LLM多智能体系统中的级联攻击,其核心方法是利用动态因果影响矩阵和晚交互条件转移熵公式,实现对级联行为的统一分析,并在检测准确性和早期级联识别方面优于现有方法。

Comments https://github.com/caspian-detector/caspian

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05431 2026-05-20 cs.CL 89%

Self-Filtered Distillation with LLMs-generated Trust Indicators for Reliable Patent Classification

基于LLM生成信任指标的自过滤蒸馏用于可靠专利分类

Yongmin Yoo, Xu Zhang, Longbing Cao

机构 * Frontier AI Research Centre, School of Computing, Faculty of Science and Engineering, Macquarie University(前沿人工智能研究中心,计算机学院,科学与工程学院,麦考瑞大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出自过滤蒸馏方法,通过将LLM生成的推理作为信任指标而非真实标签,提升专利分类的可靠性,实验显示在USPTO-2M数据集上宏F1指标提升了38.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19247 2026-05-20 cs.CV 89%

Structuring Open-Ended NAS: Semi-Automated Design Knowledge Structuring with LLMs for Efficient Neural Architecture Search

结构化开放端NAS:利用LLM进行半自动设计知识结构化以实现高效的神经架构搜索

Yuiko Sakuma, Masakazu Yoshimura, Marcel Gröpl, Zitang Sun, Junji Otsuka, Atsushi Irie, Takeshi Ohashi

机构 * Sony Group Corporation(索尼集团公司) ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种半自动方法,利用LLM结构化模型设计知识,以指导神经架构搜索过程,通过定义高层结构模板和引入FairNAD算法,实现了高效的开放端搜索空间探索,提升了在多个数据集上的性能。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15362 2026-05-20 cs.LG cs.AI cs.CL cs.CR 89%

Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models

Faster-GCG: 面向对齐大语言模型的高效离散优化监狱突破攻击

Xiao Li, Wei Zhang, Zhuhong Li, Qiongxiu Li, Shei PernChua, BingZe Lee, Jinghao Cui, Yifan Huang, Xiaolin Hu

机构 * Tsinghua University(清华大学) Sea-Fill Duke University(杜克大学) Aalborg University(奥胡斯大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Faster-GCG,通过改进估计、高效采样和避免重复评估,提高了对齐大语言模型的监狱突破攻击效率,实现了样本效率提升8倍,时间减少7倍,并在多个模型上取得了更高的突破成功率。

Comments 18 pages, new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19101 2026-05-20 cs.SD cs.LG 88%

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

面向异质性的数据集调度以实现高效的音频大语言模型训练

Yanru Wu, Jianning Wang, Chongxin Gan, Yang Li

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Independent Researcher(独立研究者) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出了一种面向异质性的数据集调度方法GST,通过将数据集分组并按渐进调度策略引入,平衡了并行训练的稳定性与序列优化的效率,从而在14个AudioQA数据集上实现了30-40%的更快收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17428 2026-05-20 cs.CL 88%

QWHA: Quantization-Aware Walsh-Hadamard Adaptation for Parameter-Efficient Fine-Tuning on Large Language Models

QWHA: 量化感知的沃尔什-哈达玛适应用于大型语言模型的参数高效微调

Hyesung Jeon, Seojune Lee, Beomseok Kang, Yulhwa Kim, Jae-Joon Kim

机构 * Seoul National University(首尔国立大学) Sungkyunkwan University(全北国立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出QWHA方法,通过将基于傅里叶变换的适配器与沃尔什-哈达玛变换结合,改进量化感知参数高效微调,有效减少量化误差并降低计算成本。

Comments 25 pages, 9 figures, 14 tables

Journal ref ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18869 2026-05-20 cs.LG cs.AI cs.NE 87%

MO-CAPO: Multi-Objective Cost-Aware Prompt Optimization

MO-CAPO:多目标成本感知提示优化

Jan Büssing, Moritz Schlager, Timo Heiß, Tom Zehle, Matthias Feurer

机构 * Technical University of Munich (TUM), Munich Center for Machine Learning (MCML)(慕尼黑工业大学(TUM)、慕尼黑机器学习中心(MCML)) LMU Munich, Munich Center for Machine Learning (MCML)(慕尼黑大学(LMU)、慕尼黑机器学习中心(MCML)) University of Freiburg, ELLIS Institute Tübingen(弗赖堡大学、图宾根ELLIS研究所) TU Dortmund University, Lamarr Institute for Machine Learning(多特蒙德工业大学、拉马尔机器学习与人工智能研究所)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MO-CAPO,一种多目标提示优化算法,同时优化性能和推理成本,并通过预算分配实现高效优化,通过评估四个任务和三个LLM,证明其在噪声R2指标上优于NSGA-II基线,并在较低预算下达到竞争性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25120 2026-05-20 cs.DC 87%

DFLOP: A Data-driven Framework for Multimodal LLM Training Pipeline Optimization

DFLOP: 一种基于数据的多模态大语言模型训练流水线优化框架

Hyeonjun An, Sihyun Kim, Chaerim Lim, Hyunjoon Kim, Rathijit Sen, Sangmin Jung, Hyeonsoo Lee, Dongwook Kim, Takki Yu, Jinkyu Jeong, Youngsok Kim, Kwanghyun Park

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DFLOP框架,通过数据驱动的方法优化多模态大语言模型的训练流水线,提升GPU利用率和训练效率,实验证明其比现有框架快3.6倍。

Comments Accepted to Proceedings of the ACM on Management of Data (SIGMOD 2026)

Journal ref Proc. ACM Manag. Data 4, 3, Article 160 (June 2026), 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19561 2026-05-20 cs.LG cs.AI 85%

TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization

TORQ:MXFP4量化中的两级正交旋转

Zukang Xu, Xing Hu, Dawei Yang

机构 * Open Compute Project(开放计算项目)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出TORQ框架,通过优化坐标变换重塑激活空间的几何属性,解决MXFP4激活量化中的精度下降问题,显著提升量化精度。

Comments 17 pages, 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16445 2026-05-20 cs.LG cs.AI 84%

Membership Inference Attacks on Discrete Diffusion Language Models

对离散扩散语言模型的成员推断攻击

Shailesh Kasivelrajan

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了对微调后的MDLMs的成员推断攻击,发现其比现有灰盒基线更易受攻击,并设计了阴影模型转移攻击以证明其有效性。

Comments Citations and Co Authors need to be verified and updated. Will submit a new version soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20179 2026-05-20 cs.CL 83%

TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload

TIDE: 一种高效且无损的MoE扩散大语言模型推理方法

Zhiben Chen, Youpeng Zhao, Yang Sui, Jun Wang, Yuzhang Shang

机构 * University of Central Florida(中央佛罗里达大学) Rice University(Rice大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TIDE,一种基于扩散过程块内专家激活时间稳定性的新推理系统,通过引入基于区间的专家刷新策略,优化I/O和CPU计算,实现无损加速,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19929 2026-05-20 cs.CV cs.AI 83%

Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models

打破大视觉-语言模型低比特量化中的模态异质性

Yi Zhong, Haotong Qin, Xindong Zhang, Lei Zhang, Guolei Sun

机构 * VCIP, College of Computer Science, Nankai University(南开大学计算机科学学院VCIP) D-ITET, ETH Zürich(苏黎世联邦理工学院D-ITET) OPPO Research Institute(OPPO研究院) Department of Computing, Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出SplitQ框架,通过通道分割和自适应跨模态校准模块,解决大视觉-语言模型在低比特量化中因模态异质性导致的精度下降问题,显著提升了在多种多模态数据集上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17726 2026-05-20 cs.CV cs.AI 83%

Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM

Slot-MLLM: 多模态大语言模型中的面向对象视觉标记化

Donghwan Chi, Hyomin Kim, Yoonjin Oh, Yongjin Kim, Donghoon Lee, Daejin Jo, Jongmin Kim, Junyeob Baek, Sungjin Ahn, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kakao Corp(Kakao公司) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种面向对象的视觉标记化方法Slot-MLLM,通过基于Slot Attention的标记器,有效编码局部视觉细节并保持高层语义,从而提升多模态大语言模型在视觉内容理解和生成中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09329 2026-05-20 cs.CL cs.LG 82%

Test-Time Speculation

测试时推测

Avinash Kumar, Sujay Sanghavi, Poulami Das

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了测试时推测方法,通过在线蒸馏技术提升长响应任务中推测器的接受长度,从而提高LLM推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19259 2026-05-20 eess.SY cs.SY 82%

ERFSL: An Efficient Reward Function Searcher via Language Models for Custom-Environment Multi-Objective Optimization (Student Abstract)

ERFSL: 一种基于语言模型的高效奖励函数搜索器用于定制环境多目标优化(学生摘要)

Guanwen Xie, Jingzehua Xu, Yiyuan Yang, Yimian Ding, Shuai Zhang

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 本文提出ERFSL,一种利用大语言模型(LLMs)的高效奖励函数搜索器,用于定制环境的多目标学习方法。ERFSL根据显式用户需求生成奖励组件,通过奖励批评者进行校正,并根据训练日志分析器生成的文本上下文迭代优化这些组件的权重。在基于模拟的基准任务中,奖励批评者仅需每次需求一个反馈迭代即可校正奖励代码,而奖励权重初始化器能够在帕累托集内获取多样化的奖励函数。即使权重偏差高达500倍,平均仅需5.2次迭代即可满足用户需求。该方法在GPT-4o mini上表现良好,且不需要高级理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19645 2026-05-20 cs.CL 81%

K-Quantization and its Impact on Output Performance

K-量化及其对输出性能的影响

Robin Baki Davidsson, Pierre Nugues

机构 * Lund University(隆德大学)

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了不同量化级别(2-6位)对大型语言模型(LLM)在MMLU-Pro、CRUXEval和MuSR等任务上的性能和准确性的影响,发现高精度量化(如8位Q8_0)能提升性能,但降维量化(如2位Q2_K)会带来性能损失,且不同模型和任务的响应差异显著。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19064 2026-05-20 cs.HC cs.AI 81%

Toward an AI-Powered Computational Testbed for Workforce Policy

迈向由人工智能驱动的劳动力政策计算测试平台

Sumer S. Vaid, Ashley V. Whillans

机构 * Negotiation, Organizations and Markets Unit, Harvard Business School(哈佛商学院谈判、组织与市场单位)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出了一种动态员工代理,结合LLM生成代理、管理科学和组织行为研究,以预测员工在组织变革中的心理和行为反应,同时定义了隐私、准确性和代表性保障措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18597 2026-05-20 cs.AI 81%

Latent Action Reparameterization for Efficient Agent Inference

潜在动作重参数化用于高效智能体推断

Wenhao Huang, Qingwen Zeng, Qiyue Chen, Zijie Guo, Yu Sun, Cheng Yang, Siru Ouyang, Jiri Gesi, Fang Wu, Jiayi Zhang, Huaming Chen, Bang Liu, Xiangru Tang, Chenglin Wu

机构 * Université de Montréal(蒙特利尔大学) The University of Sydney(悉尼大学) Fudan University(复旦大学) Yale University(耶鲁大学) DeepWisdom University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Science(亚马逊科学) Stanford University(斯坦福大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Mila - Quebec AI Institute(蒙特利尔人工智能研究所)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Latent Action Reparameterization (LAR)框架,通过学习紧凑的潜在动作空间来提升大语言模型智能体的推断效率,减少有效动作 horizon 并保持原始动作空间的表达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20035 2026-05-20 cs.CV 80%

Stage-adaptive Token Selection for Efficient Omni-modal LLMs

面向高效多模态大语言模型的阶段自适应令牌选择

Zijie Xin, Jie Yang, Ruixiang Zhao, Tianyi Wang, Fengyun Rao, Jing Lyu, Xirong Li

机构 * Renmin University of China(中国人民大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SEATS方法,通过阶段自适应的令牌选择技术,有效提升多模态大语言模型的推理效率,在保留96.3%原始性能的同时,实现9.3倍的FLOPs减少和4.8倍的prefill加速。

Comments Code Link: https://github.com/xxayt/SEATS

详情

展开后加载摘要…

URL PDF HTML 收藏