ExRole: From Team Trajectories to Executable Roles in Multi-Agent Language Models
ExRole:从团队轨迹到多智能体语言模型中的可执行角色
专题命中 指令微调 :language model(title);分类 cs.AI
AI总结 ExRole是一种多智能体语言模型的轨迹转角色框架,可学习可执行角色,在两个问答基准上显著优于单智能体及其他角色设置,能捕捉可迁移的行为专业化能力。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
ExRole:从团队轨迹到多智能体语言模型中的可执行角色
专题命中 指令微调 :language model(title);分类 cs.AI
AI总结 ExRole是一种多智能体语言模型的轨迹转角色框架,可学习可执行角色,在两个问答基准上显著优于单智能体及其他角色设置,能捕捉可迁移的行为专业化能力。
Logit边界几何置信接口与稀疏层束 enclaves 协议:安全网络电子健康记录(EHR)互操作性的自包含底层架构
机构 * Light Imaging Technologies, Inc.(光成像技术公司)
专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究提出Logit边界几何置信接口与稀疏层束 enclaves 协议,构建EHR互操作的自包含底层架构,经GBI BoundaryBench v0.1评估,Qwen3-4B-Instruct-2507在该接口下无符合要求的输出,为接受边界提供实证证据。
Comments 39 pages; executable Julia verification code included as ancillary material; companion public benchmark: https://github.com/AlvinSpivey/GBI-BoundaryBench
CoAdapt-GUI:面向未知GUI应用的工作流上下文与策略联合适配
机构 * Li Gu(李谷(音译))
专题命中 指令微调 :language model(abstract);分类 cs.AI
AI总结 CoAdapt-GUI框架通过联合适配工作流上下文与策略,在有限交互预算无目标演示的未知GUI应用场景下,将AndroidWorld泛化性能提至45.0%、AndroidWorld Plus提至52.9%,优于仅策略TTA基线。
基于技能-工具链进化的自演化具身智能体
机构 * Microsoft Research(微软研究院) ; Northeastern University(东北大学)
专题命中 指令微调 :foundation model(abstract);分类 cs.CL
AI总结 提出免训练的SHAPER框架,通过演化技能与工具链实现冻结模型驱动的自演化具身智能体,在VLABench等数据集上验证其适配优势。
Qwen-MusicAVQA-7B:一种用于音乐音频-视觉问答的多模态模型
机构 * Inference Matter Labs(推理物质实验室)
专题命中 指令微调 :language model(abstract)
AI总结 该研究提出轻量级多模态模型Qwen-MusicAVQA-7B,通过连接冻结的Whisper编码器与Qwen2-VL-7B-Instruct,在MUSIC-AVQA等基准上实现高准确率,训练成本低,且发现音频时间信息保留程度影响下游问答准确率。
Comments 24 pages, 1 figure, 8 tables. Code: https://github.com/MKDehdashti/Qwen2-vl-audio Checkpoints: https://huggingface.co/MayaKD/qwen2-vl-audio
世界令牌:通过训练时世界建模增强具身策略
机构 * JIUTIAN Research(九天研究院) ; Zhongguancun Academy(中关村学院)
专题命中 指令微调 :pretraining(abstract)
AI总结 本文提出World Tokens架构,通过训练时的World Adapter衔接视觉-语言理解、世界动态建模与动作生成,在保持高效部署的同时提升具身策略性能,在多个基准测试中取得优异结果。
面向多语言机器翻译的开源大语言模型无参考后训练
机构 * Xiaomi Inc.(小米公司)
专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(title,abstract)
AI总结 该研究针对多语言机器翻译,以开源大语言模型为对象,采用GRPO算法结合无参考质量评估奖励,通过检查点插值得到MiLMMT-46-v1.0,其翻译质量优于SFT模型及多款开源基线,在无参考评分上领先于谷歌翻译等专有系统,还发布了相关模型与代码。
从数字到判断:专业大语言模型智能体与欧洲上市房地产的强化学习研究
专题命中 后训练与偏好优化 :LLM(title,summary_cn);post-training(abstract);prompting(abstract);分类 cs.AI、cs.LG
AI总结 本研究以欧洲上市房地产分析为对象,提出Larix框架将分析维度映射为专业LLM智能体,结合GRPO微调Qwen3.5-9B,实现数值任务与判断任务的性能提升且可迁移至新企业与监管体系。
DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉
机构 * Korea University(高丽大学) ; KAIST(韩国科学技术院)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。
Comments Accepted at ECCV2026
A-3PO:通过意识滞后的近端策略优化加速异步大语言模型训练
机构 * Huawei Canada(华为加拿大)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 A-3PO通过近似近端策略优化方法,减少大语言模型异步训练中的计算开销,实现1.8倍的加速同时保持性能
智能体安全应成为运行时契约
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。
注意间隙:在偏好学习中的结构感知一致性
机构 * Google Research(谷歌研究) ; Courant Institute of Mathematical Sciences(数学科学学院)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出结构感知H一致性框架,通过引入SA-DPO目标函数,改进偏好学习中的一致性问题,证明重尾 surrogate 在容量受限模型中具有更好的一致性保证。
Comments ICML 2026
训练后使用策略梯度:最优性和基础模型障碍
专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了训练后使用策略梯度方法在序列预测中的最优性和基础模型限制,提出通过过程奖励模型克服支持范围障碍,并展示了自适应学习率的SGD和PG在统计学习和在线学习中的有效性。
Comments 39 pages, 2 figures. Published at the International Conference on Machine Learning (ICML) 2026
用强化学习降低AI数据中心能耗:从单GPU到集群的大语言模型训练实测功率控制
专题命中 后训练与偏好优化 :LLM(title);post-training(abstract);分类 cs.AI
AI总结 该研究针对大语言模型训练的GPU功耗问题,提出PPO元控制器调整生成参数,在单GPU及集群环境下降低功率违规、提升输出与能效,验证了超额订阅的可行性。
GCPO:针对大语言模型的rollout强化学习中子空间几何的诊断与约束
机构 * Shanghai AI Lab(上海人工智能实验室)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 GCPO通过几何约束策略优化方法,诊断rollout强化学习的子空间几何问题,在大语言模型后训练中提升了多任务性能并解决了训练不稳定等问题
Comments 15 pages, 10 figures
强化步骤级推理以实现大语言模型的有效自校正
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; VinUniversity ; Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。
HarmoniDPO:基于偏好优化扩散模型的视频引导音频生成
机构 * Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);preference optimization(abstract)
AI总结 本文提出HarmoniDPO框架,采用双视频表示、online-DPO微调及DDS算法,实现更精准的视频到音频生成,在音视频同步性与主观质量上优于现有最优方法。
Comments 31 pages
用于金融建议生成的GRPO:在CATE评估下优于商用大语言模型
机构 * Intuit(英图易(金融科技公司))
专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究将金融建议生成建模为强化学习问题,用GRPO微调开放权重大语言模型,经独立于评判者的CATE审计,其毛利润提升约为最强商用基线的两倍,表现优于商用大语言模型。
偏好树优化:通过前瞻模拟增强面向目标的对话
机构 * Reichman University(赖希曼大学) ; School of Computer Science(计算机科学学院) ; School of Communications(传播学院)
专题命中 后训练与偏好优化 :preference optimization(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。
Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop
LoongReflect:通过全局视角蒸馏提升搜索智能体的长程反思能力
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 LoongReflect是将反思表述为记忆控制策略的训练框架,通过双信号通道结合全局视角蒸馏与结果导向GRPO优化,在多跳检索增强生成和数学推理任务上提升了搜索智能体的长程反思能力。
Comments 15 pages, 8 figures
超越试错:面向图像到视频一致性的智能体优化
机构 * Google Cloud(谷歌云) ; Google DeepMind(谷歌DeepMind)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对图像到视频模型试错效率低的问题,提出Agentic Self-Improvement框架,通过两阶段优化提升视频与文本一致性,生成视频胜率达69%,为视频生成模型提供实用可控的优化方法。
如何使用你的专家预算:蛋白质结构预测模型的实用指南
机构 * InstaDeep Ltd(InstaDeep公司) ; University of Oxford(牛津大学) ; Lancaster University(兰卡斯特大学)
专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本研究针对蛋白质结构预测模型的专家预算约束,通过基准测试FK-steering、DPO、Best K-of-N采样及O3方法,明确不同预算下的最优方法并给出实用选择建议。
Comments Proceedings of the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM)
简易智能体建模:在笔记本电脑上模拟大型大语言模型(LLM)智能体群体
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出用低成本拟合的低参数模型替代LLM智能体,可在笔记本电脑上模拟任意数量的LLM智能体群体,通过「交互顺序×记忆」分类法验证了该方法在多个LLM模拟上的有效性。
Comments 25 pages, 12 figures. Code and data at github.com/YehudaItkin/poor-mans-agentic-modeling; systematic review and pre-registration archived at Zenodo (doi:10.5281/zenodo.21198322, doi:10.5281/zenodo.21340310)
角色专业化模型(RSM):在智能体软件开发中协调基于大语言模型(LLM)的工具——一项探索性案例研究
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本研究通过探索性案例研究提出角色专业化模型(RSM),协调Antigravity、Gemini CLI等三种LLM工具开发Python气候可视化应用,发现明确角色协调可优化开发质量但需配套策略与人工验证。
Comments 28 pages, 4 figures, 5 tables
通过语言强化学习实现大语言模型个性化的偏好适配学习
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 本研究针对LLM个性化中通用偏好摘要冗余问题,提出无训练元学习框架AlignXada,经语言强化学习优化后在多任务多模型上提升性能且适配效果优于RAG。
Credo:通过信念和策略实现LLM流水线的声明式控制
机构 * Brown University(布朗大学) ; Northwestern University(西北大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出Credo,通过声明式策略和信念管理LLM流水线的决策,实现可适应、可审计和可组合的执行。
Comments VLDB 2026 (Demo)
LazyTrain:面向大语言模型训练零浪费产出优化的有限资源分配方案
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; IDEA Research(IDEA研究院) ; DataArcTech Ltd.(DataArcTech有限公司)
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 LazyTrain是面向大语言模型训练的优化层,将相关问题建模为混合整数调度问题,结合Hybrid 8位算子,在H800、RTX 3090实验中提升算力、批次大小与准确率。
Comments 18 pages, 8 figures
SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统
专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)
AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。
Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness
重试、切换还是弃权?通过受控错误注入学习策略感知的工具使用策略
机构 * Amazon(亚马逊)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 该研究提出BENCH2ROBUST框架,结合BTM与课程强化学习,提升LLM智能体在工具故障下的稳健性,在零售任务中BTM可提稳健性16.8个百分点,二者结合达40.8-45.5%。
LinearKV:混合大语言模型中与位置无关缓存仅需一个缓存状态
机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) ; Shanghai Jiao Tong University(上海交通大学) ; University at Buffalo(纽约州立大学布法罗分校)
专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 LinearKV 是一种无需训练的混合大语言模型与位置无关缓存框架,仅需单个缓存状态初始化,在三类混合模型、三类选择器上均优于或等效于同期的 HYPIC 方案,可大幅提升 LLM 服务效率。