arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 848 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 154 篇

2507.13833 2026-06-02 cs.DC 90%

DistFlow: A Fully Distributed RL Framework for Scalable and Efficient LLM Post-Training

DistFlow: 一种用于可扩展高效LLM后训练的全分布式强化学习框架

Zhixin Wang, Jiaming Xu, Tianyi Zhou, Mingjun Zhang, Liming Liu, Jiarui Hu, Dian Yang, Tongyu Wang, Ping Zhang, Jinlong Hou, Siyuan Feng, Yuan Qi, Yuan Cheng

专题命中 效率与部署 :LLM(title,title_cn);post-training(title);large language model(abstract);language model(abstract)

AI总结 提出DistFlow框架,通过解耦数据传输与控制调度、采用多控制器范式和基于DAG的任务调度器,实现近线性可扩展性并提升吞吐量达2.63倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02359 2026-06-02 cs.AI 90%

MOC: Multi-Order Communication in LLM-based Multi-Agent Systems

MOC:基于LLM的多智能体系统中的多阶通信

Yao Guan, Lin Wang, Zhihu Lu, Ziyi Wang, Wenzhu Yan, Qiang Duan

机构 * Fudan University(复旦大学) Nanjing Normal University(南京师范大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出多阶通信(MOC)方案,通过重构智能体间通信以捕获多跳依赖,并设计结构消息合并策略,在多个数据集上提升任务性能并降低通信成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01886 2026-06-02 cs.AI cs.CE 90%

Absorbing Complexity: An Interaction-Native Knowledge Harness for Financial LLM Agents

吸收复杂性:面向金融LLM代理的交互原生知识驾驭系统

Ailiya Borjigin, Igor Stadnyk, Ben Bilski, Maksym Chikita, Dmytro Kyrylenko, Sofiia Pidturkina, Julia Stadnyk

机构 * True Trading Inc4.net

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出交互原生知识驾驭(InKH)架构,通过被动知识注入、时序图记忆和过期失效机制,将复杂性吸收到系统中,在金融LLM代理任务中显著降低延迟、令牌成本和过时知识使用,同时提升任务质量和可追溯性。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00756 2026-06-02 cs.AI 90%

CoMIC: Collaborative Memory and Insights Circulation for Long-Horizon LLM Agents in Cloud-Edge Systems

CoMIC:云边系统中长周期LLM代理的协作记忆与洞察循环

Yannan Wang, Longli Yang, Zhen Liu, Abhishek Kumar, Carsten Maple

机构 * Beijing Jiaotong University(北京交通大学) The Alan Turing Institute(艾伦·图灵研究所) University of Warwick(沃里克大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出无需参数更新的云边框架CoMIC,通过集中式反思与分布式执行设计,利用语义子目标标识实现跨代理经验聚合,提升弱边缘代理在长周期任务中的进展率和动作基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00516 2026-06-02 cs.AI 90%

Threshold-Based Exclusive Batching for LLM Inference

基于阈值的独占批处理用于LLM推理

Weifang Zhang, Yuzhou Nie, Bowen Pang, Guangrui Ma, Shining Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用工程技术中心)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对混合批处理中预填充与解码干扰导致边际成本上升的问题,提出基于GPU内存带宽、模型大小和工作负载的EB-MB性能交叉条件及最优切换阈值,优化后的独占批处理在带宽受限GPU上吞吐量提升高达41.9%。

Comments 37 pages, 12 figures. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00460 2026-06-02 cs.CL eess.AS 90%

SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors

SALSA: 通过学习的引导激活向量实现语音感知的LLM适配

Yekaterina Yegorova, Argyrios Gerogiannis, Haolong Zheng, Julia Hockenmaier, Chang D. Yoo, Mark A. Hasegawa-Johnson

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SALSA方法,通过监督学习优化逐层引导向量,在儿童语音、多语种语音和普通话-英语代码切换基准上显著提升零样本推理和语音上下文学习性能,最高相对提升46.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22813 2026-06-02 cs.LG 90%

Quartet II: Accurate LLM Pre-Training in NVFP4 by Improved Unbiased Gradient Estimation

Quartet II: 通过改进的无偏梯度估计实现 NVFP4 中准确的 LLM 预训练

Andrei Panferov, Erik Schultheis, Soroush Tabesh, Dan Alistarh

机构 * University of Waterloo(多伦多大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出一种用于微缩放格式的无偏量化方法 MS-EDEN,其量化误差比随机舍入低 2 倍以上,并集成到全 NVFP4 线性层量化方案 Quartet II 中,在 LLM 预训练中实现更准确的梯度估计和加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04791 2026-06-02 cs.LG 90%

DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing

DuetServe: 通过自适应GPU多路复用协调LLM服务的预填充与解码

Lei Gao, Chaoyi Jiang, Hossein Entezari Zarch, Daniel Wong, Mark Hill, Murali Annavaram

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学) University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对LLM服务中预填充与解码阶段的干扰问题,提出DuetServe框架,通过自适应SM级GPU空间多路复用实现单GPU内的阶段隔离,在保证低延迟的同时提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00129 2026-06-02 cs.LG cs.AI 90%

A Shared Valence Axis Across Modern LLMs and Human EEG: The Saturation Regularity

现代LLM与人脑EEG共享的效价轴:饱和规律

Yousef A. Radwan, Xuhui Liu, Kilichbek Haydarov, Yuqian Fu, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布斯大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过构建从大型语言模型(LLM)中提取的一维效价方向(V轴),发现其与人类EEG神经活动对齐,但进一步对齐策略无法提升解码性能,并形式化为“饱和规律”,指出改进应来自监督无法触及的残差子空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01927 2026-06-02 cs.DC 89%

Scaling LLM Inference Beyond Amdahl`s Limits via Eliminating Non-Scalable Overheads

通过消除不可扩展开销将LLM推理扩展到超越Amdahl极限

Alan Zhao, Cyril Y. He, Wei Xu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM推理中张量并行度增加导致的不可扩展开销问题,提出Albireo系统,通过重叠调度、I/O与计算及序列并行采样来提升最优并行度,从而显著提高吞吐量、降低延迟和能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01387 2026-06-02 cs.DC 89%

Fail-Closed Lowering of Resident KV Claims onto LLM Serving Runtimes

将Resident KV声明降级到LLM服务运行时的故障关闭

Lukas Stepanek

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出一种故障关闭的降级关系,用于将未来KV重用声明映射到LLM服务运行时的原语,通过检查器验证运行时是否满足声明义务。

Comments 24 pages, 2 figures. Public artifact: https://github.com/gustavgauge/resident-kv-lowering-artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16174 2026-06-02 cs.LG cs.AI cs.CL cs.CR 89%

Efficient LLM Moderation with Multi-Layer Latent Prototypes

基于多层潜在原型的高效LLM审核

Maciej Chrabąszcz, Filip Szatkowski, Bartosz Wójcik, Jan Dubiński, Tomasz Trzciński, Sebastian Cygert

机构 * University of Warsaw(华沙大学)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多层原型审核器(MLPM),利用多层中间表示的原型实现轻量、高效且可定制的输入审核,在多个基准上达到最优性能,并可与输出审核结合提升响应安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02288 2026-06-02 cs.LG 89%

Massive Spikes in LLMs are Bias Vectors: Mechanistic Uncovering and Spike-Free Quantization

LLM中的大规模尖峰是偏置向量:机制揭示与无尖峰量化

Yung-Chin Chen, Chung Peng Lee, Ze-Wei Liou, Naveen Verma

机构 * Princeton University(普林斯顿大学) EnCharge AI

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过机制分析发现LLM中的激活尖峰本质上是结构化的向量偏置,并提出无尖峰量化框架INSERTQUANT,实现鲁棒的低比特量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00615 2026-06-02 cs.AI cs.CL 89%

ACON: Optimizing Context Compression for Long-horizon LLM Agents

ACON:面向长周期LLM智能体的上下文压缩优化

Minki Kang, Wei-Ning Chen, Dongge Han, Huseyin A. Inan, Lukas Wutschitz, Yanzhi Chen, Robert Sim, Saravan Rajmohan

机构 * University of Washington(华盛顿大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ACON框架,通过自然语言空间优化压缩策略,在不微调模型的情况下减少峰值token使用量26-54%并提升任务成功率,同时可蒸馏至小模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01806 2026-06-02 cs.CL cs.AI cs.LG 89%

ProbeScale: Probing Analysis to Optimize Neural Scaling Laws for Efficient Small Language Model Inference

ProbeScale: 通过探测分析优化神经缩放定律以实现高效小语言模型推理

Sourav Das

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institution of Information Technology Kalyani(印度信息技术学院Kalyani)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ProbeScale框架,利用缩放定律和探测分析从预训练小语言模型中识别参数高效子网络,在参数预算下最大化任务加权探测性能,实现5-10倍参数压缩并保持95%-98%原始性能。

Comments 7 pages, 2 figures, ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12487 2026-06-02 cs.NE cs.AI cs.CL 88%

ToxSearch: Evolving Prompts for Toxicity Search in Large Language Models

ToxSearch: 面向大型语言模型毒性搜索的提示演化

Onkar Shelar, Travis Desell

机构 * Rochester Institute of Technology(罗切斯特技术研究所)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出ToxSearch,一种黑盒演化框架,通过同步稳态循环演化提示来测试大型语言模型的安全性,并分析不同操作符的行为及跨模型迁移性。

Comments 16 pages

Journal ref In: García-Sánchez, P., Díaz Álvarez, J., Murphy, A. (eds) Applications of Evolutionary Computation. EvoApplications 2026. Lecture Notes in Computer Science, vol 16525. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24528 2026-06-02 cs.AI cs.CL cs.LG 88%

Hypothesis Generation and Inductive Inference in Children and Language Models

儿童与语言模型中的假设生成与归纳推理

Jeffrey Qin, Wasu Top Piriyakulkij, Zhuangfei Gao, Mia Radovanovic, Jessica Sommerville, Kevin Ellis, Marta Kryven

机构 * Computer Science University of Waterloo(滑铁卢大学计算机科学系) Department of Computer Science Cornell University(康奈尔大学计算机科学系) Department of Computer Science Dalhousie University(达尔豪斯大学计算机科学系) Department of Psychology University of Toronto(多伦多大学心理学系)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过归纳推理盒子任务,结合贝叶斯粒子推断的程序归纳形式化,比较儿童与基于LLM的智能体在不确定性下的假设生成与证据寻求行为,发现两者在适应环境结构上相似但信息寻求成本与归纳偏差不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02161 2026-06-02 cs.CV cs.CL 88%

InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models

InfoMerge: 信息感知的令牌压缩用于高效视频大语言模型

Xinxin Liu, Shiwei Gan, Xiao Liu, Yafeng Yin, Lei Xie, Sanglu Lu

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出InfoMerge,一种无需训练的视觉令牌压缩方法,通过鲁棒冗余估计和内容感知预算分配,在减少85%视觉令牌的同时保持98.8%性能,实现4.24倍预填充加速。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01240 2026-06-02 cs.CL 88%

Efficient RAG with Intent-Aware Retrieval and Semantics-Preserving Chunking

基于意图感知检索与语义保持分块的高效RAG

Fachrina Dewi Puspitasari, Chaoning Zhang, Jiaquan Zhang, Zhicheng Wang, Hafiz Shakeel Ahmad Awan, Rizwan Qureshi, Jewon Lee, Tae-Ho Kim, Yang Yang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Massachusetts General Hospital, Harvard University(哈佛大学马萨诸塞州总医院) Nota AI

专题命中 效率与部署 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出InSemRAG框架,通过意图感知检索器和语义保持分块模块,结合迭代检索-检查机制,解决传统RAG的信息不足问题,在多跳和证据敏感任务上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00523 2026-06-02 cs.CL 88%

ProactiveLLM: Learning Active Interaction for Streaming Large Language Models

ProactiveLLM: 学习流式大语言模型的主动交互

Junlong Tong, Yao Zhang, Anhao Zhao, Yingqi Fan, Yunpu Ma, Xiaoyu Shen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出ProactiveLLM,利用模型内生状态指导交互决策,通过掩码流式建模和同步特权自蒸馏实现主动交互,减少延迟并保持质量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00105 2026-06-02 cs.CV cs.AI 88%

Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning

视觉噪声引导的上下文蒸馏用于多模态大语言模型遗忘

Junkai Chen, Yuhao He, Junxiang You, Ruiqi Liu, Chenyu Wang, Shu Wu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出视觉噪声引导的上下文蒸馏(VGID)框架,通过双模态干预构建教师分布进行蒸馏,实现多模态大语言模型参数级遗忘,平衡遗忘效果与模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16992 2026-06-02 cs.LG 88%

FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models

FIRM: 面向大型语言模型的联邦客户端内正则化多目标对齐

Fatemeh Nourzad, Amirhossein Roknilamouki, Eylem Ekici, Jia Liu, Ness Shroff

机构 * Department of Electrical and Computer Engineering, The Ohio State University, Columbus, OH, USA(电气与计算机工程系,俄亥俄州立大学,哥伦布,OH,USA) Department of Computer Science and Engineering, The Ohio State University, Columbus, OH, USA(计算机科学与工程系,俄亥俄州立大学,哥伦布,OH,USA)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 提出FIRM算法,通过客户端内正则化缓解客户端分歧漂移并提高通信效率,实现联邦多目标对齐,并首次给出有限时间收敛保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01204 2026-06-02 cs.CL cs.AI cs.CY 88%

Implicit Geographic Inference in LLM Medical Triage: Language-Driven Disparities in Emergency Recommendations

LLM医疗分诊中的隐式地理推断:语言驱动的急诊推荐差异

Qi Han Wong

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型在相同症状下,仅因患者提示语言不同而产生不同的医疗分诊推荐,发现模型根据输入语言隐式推断地理位置,导致急诊推荐率差异显著。

Comments 7 pages, 4 tables. Code and data at https://github.com/wongqihan/ai-behavioral-experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00946 2026-06-02 cs.DC cs.AI cs.LG 88%

Lodestar: An Online-Learning LLM Inference Router

Lodestar: 一种在线学习的大语言模型推理路由器

Gangmuk Lim, Wanyu Zhao, Brighten Godfrey, Jiaxin Shan, Le Xu, Liguang Xie

机构 * UIUC(伊利诺伊大学香槟分校) Bytedance(字节跳动) University of Edinburgh(爱丁堡大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Lodestar,一种基于在线学习的请求路由系统,通过实时收集集群状态并训练奖励预测器,以最小化TTFT为目标分配推理请求,在异构GPU集群上显著降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08026 2026-06-02 cs.CL cs.AI cs.PF 88%

DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attention

DyLLM: 基于显著性标记选择与部分注意力的高效扩散LLM推理

Younjoo Lee, Seungkyun Dan, Junghoo Lee, Jaiyoung Park, Jung Ho Ahn

机构 * University of Seoul(首尔大学)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对扩散语言模型迭代去噪计算昂贵的问题,提出DyLLM框架,通过仅计算显著标记的注意力与前馈操作,实现无需训练的加速推理,在保持精度的同时吞吐量提升高达9.6倍。

Comments 21 pages, 10 figures, 7 tables, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01544 2026-06-02 cs.LG 87%

CRePE: Convolution-aware Relative Importance in Post-training Pruning with Efficient Search

CRePE: 后训练剪枝中基于卷积感知的相对重要性及高效搜索

Cheonjun Park

机构 * Hankuk University of Foreign Studies(韩国家外国语大学)

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出CRePE方法,通过引入二维局部邻域上下文和自适应系数改进相对重要性评分,结合PHO代理优化实现高效后训练剪枝,在多种模型和稀疏度下取得最优性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01556 2026-06-02 cs.DC 87%

TwinQuant: Learnable Subspace Decomposition for 4-Bit LLM Quantization

TwinQuant: 可学习的子空间分解用于4位LLM量化

Haodong Wang, Junjie Liu, Zicong Hong, Qianli Liu, Jian Lin, Song Guo, Xu Chen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出TwinQuant框架,通过联合优化Stiefel流形和一般线性流形学习量化友好的子空间分解,重塑低秩和残差分量以减少量化误差,并设计融合双分量内核实现高效端到端执行。

Comments 17pages, Accepted by ICML26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00539 2026-06-02 cs.LG math.OC stat.ML 86%

GNMR: Runtime Stability Control for Low-Precision Large Language Model Training

GNMR: 低精度大语言模型训练的运行时稳定性控制

Boao Kong, Weichen Jia, Engao Zhang, Guohong Li, Yonghan Dong, Yao Wang, Yaoyuan Wang, Yunke Peng, Kun Yuan

机构 * Peking University(北京大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.LG

AI总结 针对低精度语言模型训练中的稳定性瓶颈,提出基于梯度范数与历史均值之比(GNMR)的轻量级运行时控制器,通过局部风险信号映射到有界恢复动作,在不改变数值格式或后端的情况下提升训练稳定性。

Comments 29 pages, 4 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09330 2026-06-02 cs.LG 86%

Safety Game: Inference-Time Alignment of Black-Box LLMs via Constrained Optimization

安全博弈:通过约束优化实现黑盒大语言模型的推理时对齐

Tuan Nguyen, Long Tran-Thanh

机构 * University of Southampton(南安普顿大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出一种无需重新训练或访问模型内部结构的黑盒安全对齐框架,通过将安全与帮助性的权衡建模为二人零和博弈,并在推理时使用线性规划求解均衡策略,实现了黑盒LLM的安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02388 2026-06-02 cs.LG cs.AI 86%

Policy and World Modeling Co-Training for Language Agents

语言智能体的策略与世界模型协同训练

Ning Lu, Baijiong Lin, Shengcai Liu, Jiahao Wu, Haoze Lv, Yanbin Wei, Lingting Zhu, Shengju Qian, Xin Wang, Ying-Cong Chen, Qi Wang, Ke Tang

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科学大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学大学(广州)) Hong Kong Polytechnic University(香港理工大学) LIGHTSPEED

专题命中 效率与部署 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 提出PaW框架,通过在强化学习过程中添加辅助世界模型监督,无需改变推理范式,提升语言智能体在多个任务上的性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏