arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-02 至 2026-04-02 共收录 231 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 16 篇

2604.00785 2026-04-02 cs.LG cs.AI cs.DC 91%

Scalable Pretraining of Large Mixture of Experts Language Models on Aurora Super Computer

在Aurora超级计算机上可扩展地预训练大型专家混合语言模型

Dharma Teja Vooturi, Dhiraj Kalamkar, Dipankar Das, Bharat Kaul

机构 * Parallel Computing Lab (India) Intel Corporation(英特尔公司印度并行计算实验室)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文在Aurora超级计算机上展示了大规模预训练大型语言模型,开发了Optimus训练库,预训练了多个MoE模型,并通过定制GPU内核和新型EP-Aware分片优化器提升了训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11737 2026-04-02 cs.AI 89%

Auto-Formulating Dynamic Programming Problems with Large Language Models

利用大语言模型自动生成动态规划问题

Chenyu Zhou, Jingyuan Yang, Linwei Xin, Yitian Chen, Ziyan He, Dongdong Ge

机构 * Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济与管理学院) Booth School of Business, University of Chicago(芝加哥大学布斯商学院) School of Operations Research and Information Engineering, Cornell University(康奈尔大学运筹学与信息工程学院) Cardinal Operations(杉数科技) Shanghai University of Finance and Economics(上海财经大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出DP-Bench基准和DPLM模型,通过DualReflect生成合成数据,实现动态规划问题的自动化建模,展现了在低数据环境下后向生成的优势及大规模下前向生成的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12463 2026-04-02 cs.CL 88%

Community size rather than grammatical complexity better predicts Large Language Model accuracy in a novel Wug Test

社区规模而非语法复杂性更能预测大型语言模型在新型Wug测试中的准确性

Nikoleta Pantelidou, Evelina Leivada, Raquel Montero, Paolo Morosi

机构 * Universitat Autònoma de Barcelona(巴塞罗那自治大学) Institució Catalana de Recerca i Estudis Avançats(加泰罗尼亚高等研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过多语言Wug测试评估大型语言模型在形态泛化任务中的表现,发现模型准确性更受语言社区规模和数据量影响,而非语法复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00726 2026-04-02 cs.LG 87%

Exploring Silent Data Corruption as a Reliability Challenge in LLM Training

探索在LLM训练中作为可靠性挑战的静默数据损坏

Anton Altenbernd, Philipp Wiesner, Odej Kao

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究静默数据损坏对LLM预训练的影响,通过GPU矩阵乘法指令注入故障,分析不同位位置、内核函数和执行阶段的敏感性,并提出轻量检测方法以缓解有害参数更新。

Comments 10 Pages, 4 Figures, CCGrid 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00920 2026-04-02 cs.CL 85%

GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training

GPT-NL公共语料库:一个许可宽松、以荷兰语为主的用于大语言模型预训练的数据集

Jesse van Oort, Frank Brinkkemper, Erik de Graaf, Bram Vanroy, Saskia Lensink

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文介绍了GPT-NL公共语料库,这是最大的许可宽松的荷兰语资源语料库,包含21个纯荷兰语集合,总计360亿个预处理荷兰语标记,以及来自现有数据集的英语、代码和德语/丹麦语标记,旨在为合法、有用且无害的语言模型创造提供支持。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00249 2026-04-02 cs.AI cs.MA 85%

A Safety-Aware Role-Orchestrated Multi-Agent LLM Framework for Behavioral Health Communication Simulation

一种安全意识导向的角色协调多智能体LLM框架用于行为健康沟通模拟

Ha Na Cho

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种安全导向的角色协调多智能体LLM框架,通过协调不同角色的智能体模拟支持性行为健康对话,通过分解对话责任并动态激活智能体以确保安全审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00536 2026-04-02 cs.CL cs.AI 82%

Optimsyn: Influence-Guided Rubrics Optimization for Synthetic Data Generation

Optimsyn: 基于影响的合成数据生成 rubrics 优化

Zhiting Fan, Ruizhe Chen, Tianxiang Hu, Ru Peng, Zenan Huang, Haokai Xu, Yixin Chen, Jian Wu, Junbo Zhao, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Inclusion AI, Ant Group(Inclusion AI, 蚂蚁集团) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 本文提出 Optimsyn 框架,通过影响估计优化 rubrics,提升合成数据生成质量,实现跨领域和模型的泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01155 2026-04-02 cs.SD 82%

FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining

FineLAP: 通过异质监督驯化细粒度语言-音频预训练

Xiquan Li, Xuenan Xu, Ziyang Ma, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎卓越工程师学院) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract)

AI总结 本文提出FineLAP,一种新型预训练范式,通过异质数据提升CLAP在clip和frame级对齐能力,引入双流sigmoid损失和聚类采样策略,结合大规模合成SED数据集,实现多任务SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00489 2026-04-02 cs.CL 81%

Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling

通过多模态深度扩展适应文本LLM到语音

Kazuki Yano, Jun Suzuki, Shinji Watanabe

机构 * Tohoku University(东北大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出多模态深度扩展方法,通过在冻结的文本LLM中插入新层并仅训练这些层来适应语音数据,实验表明其在ASR性能上接近全微调,且文本能力退化更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20224 2026-04-02 cs.SD cs.AI 79%

DuoTok: Source-Aware Dual-Track Tokenization for Multi-Track Music Language Modeling

DuoTok:面向多轨音乐语言模型的源感知双轨分词

Rui Lin, Zhiyue Wu, Jiahe Le, Kangdi Wang, Weixiong Chen, Junyu Dai, Tao Jiang

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 DuoTok通过分阶段解耦方法,实现多轨音乐语言模型中高保真重建、强预测性和跨轨对应性的平衡,达到最佳预测性与保真度的折中。

Comments 17 pages, 5 figures, 8 tables. Project page: https://eps-acoustic-revolution-lab.github.io/DUO_TOK/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12993 2026-04-02 cs.SE cs.CR 75%

SmartPoC: Generating Executable and Validated PoCs for Smart Contract Bug Reports

SmartPoC: 为智能合约漏洞报告生成可执行且验证的PoC

Longfei Chen, Ruibin Yan, Taiyu Wong, Yiyang Chen, Jialai Wang, Chao Zhang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SmartPoC通过生成并执行可执行的PoC测试用例,验证审计报告中的漏洞。该方法通过提取关键函数切片、生成-修复-执行循环及差分验证提高可执行性与准确性,实现了高精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00066 2026-04-02 cs.LG 74%

Evolution Strategies for Deep RL pretraining

深度强化学习预训练的进化策略

Adrian Martínez, Ananya Gupta, Hanka Goralija, Mario Rico, Saúl Fenollosa, Tamar Alphaidze

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 研究比较了进化策略与深度强化学习在不同难度任务中的性能,发现ES在简单任务中可提升DRL效果,但复杂任务中表现不优。

Comments 12 pages, 3 figures, 2 algorithms; EE-568 Reinforcement learning course project

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14377 2026-04-02 cs.CL cs.IR cs.LG 62%

PluriHopRAG: Exhaustive, Recall-Sensitive QA Through Corpus-Specific Document Structure Learning

PluriHopRAG: 通过语料库特定文档结构学习实现全面、召回敏感的问答

Mykolas Sveistrys, Richard Kunert

机构 * Turbit Systems GmbH

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PluriHopRAG,通过学习语料库特定文档结构分解查询,改进多跳问答任务的召回敏感性和全面性,在PluriHopWIND和Loong基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15669 2026-04-02 stat.ML cs.LG 57%

Disentanglement of Sources in a Multi-Stream Variational Autoencoder

多流变分自编码器中的源解耦

Veranika Boukun, Jörg Lücke

机构 * Machine Learning Lab, Department of Medical Physics and Acoustics, Carl von Ossietzky Universität Oldenburg, Germany(德国奥尔登堡卡尔·冯·奥西茨基大学医学物理与声学系机器学习实验室) Research Group AI, Department of Computer Science, University of Innsbruck, Austria(奥地利因斯布鲁克大学计算机科学系人工智能研究组)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出多流变分自编码器,结合离散和连续潜在变量实现源解耦,通过显式源组合模型在解码器中叠加多个源,验证了其在手写数字和声音源分离中的有效性。

Comments 14 pages, 4 figures; expanded literature review, added Algorithm 1, and included new benchmarking results on fixed number of overlapping MNIST sources

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00530 2026-04-02 cs.CV 50%

AceTone: Bridging Words and Colors for Conditional Image Grading

AceTone:连接词语与颜色的条件图像评分

Tianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance(字节跳动)

专题命中 预训练与数据 :language model(abstract)

AI总结 AceTone提出了一种基于多模态条件的颜色评分方法,通过生成颜色转换任务实现统一框架,利用VQ-VAE tokenizer压缩LUT向量并结合大规模数据集训练,提升图像评分的感知和美学一致性。

Comments Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01967 2026-04-02 cs.CV 50%

Harnessing the Power of Local Representations for Few-Shot Classification

利用局部表示力提升少样本分类

Shi Tang, Guiming Luo, Xinchen Ye, Zhiyi Xia

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出通过改进的预训练方法和适应性度量机制,提升少样本分类中对新类别的泛化能力,取得新state-of-the-art成果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 20 篇

2604.00818 2026-04-02 cs.CY 89%

Misconception Acquisition Dynamics in Large Language Models

大语言模型中的误解获取动态

Naiming Liu, Xinghe Chen, Richard Baraniuk, Mrinmaya Sachan, Shashank Sonkar

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract)

AI总结 研究大语言模型在模拟学生和导师时的误解获取动态,发现学生模型易泛化误解导致解题准确性下降,而导师模型能联合学习多个误解且保持正确性,关键在于推理步骤的监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01152 2026-04-02 cs.CL cs.AI 88%

Brainstacks: Cross-Domain Cognitive Capabilities via Frozen MoE-LoRA Stacks for Continual LLM Learning

Brainstacks:通过冻结MoE-LoRA堆栈实现跨领域认知能力的持续LLM学习

Mohammad R. Abu Ayyash

机构 * Brains Build Research

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 Brainstacks通过冻结MoE-LoRA堆栈实现持续多领域微调,利用残差增强突破单堆栈限制,实现跨领域组合。

Comments 26 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00304 2026-04-02 cs.CL cs.AI 86%

Asymmetric Actor-Critic for Multi-turn LLM Agents

多轮LLM代理的非对称Actor-Critic

Shuli Jiang, Zhaoyang Zhang, Yi Zhang, Shuo Yang, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出非对称Actor-Critic框架,利用专有LLM作为Actor,开源模型作为Critic,提升多轮对话可靠性。实验显示该方法在τ-bench和UserBench上优于单Agent基线,且轻量级Critic表现优异。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00342 2026-04-02 cs.LG 86%

Is One Token All It Takes? Graph Pooling Tokens for LLM-based GraphQA

一个token足够吗?基于LLM的图QA的图池化token

Ankit Grover, Lodovico Giaretta, Rémi Bourgerie, Sarunas Girdzijauskas

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过多token池化和全局注意力机制改进图与LLM的接口,通过实验表明LoRA可稳定特定层次投影,使压缩表示在WebQSP上达到73%的Hit@1,揭示图QA基准存在表示饱和问题。

Comments Accepted at LREC, KG-LLM Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00821 2026-04-02 cs.LG 85%

Optimal Brain Decomposition for Accurate LLM Low-Rank Approximation

用于准确LLM低秩近似的最优脑分解

Yuhang Li, Donghyun Lee, Ruokai Yin, Priyadarshini Panda

机构 * Yale University(耶鲁大学) University of Sounthern California(南加州大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出OBD-LLM,通过利用二阶Hessian信息在模型空间中研究分解问题,结合输入输出信息实现更优的低秩近似,比传统方法提升20-40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19715 2026-04-02 cs.CL cs.AI cs.LG 82%

Graceful Forgetting in Generative Language Models

生成语言模型中的优雅遗忘

Chunyang Jiang, Chi-min Chan, Yiyang Cai, Yulong Liu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Learning With Forgetting框架,通过Fisher信息矩阵评估并周期性删除无关知识,提升生成语言模型的微调性能。

Comments 8 pages, 6 figures. EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00773 2026-04-02 cs.CL 79%

From Baselines to Preferences: A Comparative Study of LoRA/QLoRA and Preference Optimization for Mental Health Text Classification

从基线到偏好:LoRA/QLoRA与偏好优化在心理健康文本分类中的比较研究

Mihael Arcan

机构 * Home Lab

专题命中 指令微调 :preference optimization(title,abstract);分类 cs.CL

AI总结 本文比较了LoRA/QLoRA与偏好优化在心理健康文本分类中的效果,探讨了不同优化策略对性能的影响,揭示了方法选择的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00661 2026-04-02 astro-ph.GA astro-ph.IM 78%

OJALÁ: Optimizing J-PAS Astronomy for Large-scale Analysis. A foundation model for the SED of galaxies, QSOs and stars

OJALÁ:优化J-PAS天文学以进行大规模分析。一个用于星系、类星体和恒星SED的基础模型

G. Martínez-Solaeche, R. M. González Delgado, R. García-Benito, A. Hernán-Caballero, I. Pérez-Ràfols, L. A. Díaz-García, L. Raul Abramo, J. E. Rodríguez-Martín, A. M. Conrado, I. Breda, H. Domínguez Sánchez, I. Márquez, M. Pieri, D. López-Cano, V. M. Placco, L. Nakazono, A. del Pino, V. Marra, J. Alcaniz, N. Benitez, S. Bonoli, S. Carneiro, A. J. Cenarro, D. Cristóbal-Hornillos, S. Daflon, R. A. Dupke, A. Ederoclite, C. Hernández-Monteagudo, J. Liu, C. López-Sanjuan, A. Marín-Franch, C. Mendes de Oliveira, M. Moles, F. Roig, L. Sodré, K. Taylor, J. Varela, H. Vázquez Ramió, J. M. Vílchez, J. Zaragoza-Cardiel

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出OJALA模型,利用J-PAS的54条窄带与DESI和WISE的宽带数据,通过Transformer架构实现天体分类和物理参数推断,展示其在光谱分类、红移精度、星系物理性质估计等方面的表现。

Comments 23 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00592 2026-04-02 cs.CV cs.HC 78%

HarassGuard: Detecting Harassment Behaviors in Social Virtual Reality with Vision-Language Models

HarassGuard: 在社交虚拟现实中利用视觉-语言模型检测骚扰行为

Junhee Lee, Minseok Kim, Hwanjo Heo, Seungwon Woo, Jinwoo Kim

机构 * Kwangwoon University(光云大学) ETRI(韩国电子通信研究院) Chungbuk National University(忠北大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出HarassGuard系统,通过视觉输入检测社交VR中的身体骚扰行为,利用提示工程和微调VLMs,在不使用敏感生物数据的情况下实现高准确率的骚扰检测。

Comments To appear in the 2026 TVCG Special Issue on the 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (VR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04636 2026-04-02 cs.AI 77%

When Agents Persuade: Rhetoric Generation and Mitigation in LLMs

当代理体说服:大语言模型中的修辞生成与缓解

Julia Jose, Ritik Roongta, Rachel Greenstadt

机构 * New York University(纽约大学)

专题命中 指令微调 :LLM(abstract);SFT(abstract);preference optimization(abstract);分类 cs.AI

AI总结 研究探讨大语言模型在被提示生成宣传内容时的表现,通过专门模型分析其修辞手法,并发现通过监督微调等方法可有效减少此类内容生成。

Comments Accepted to the ICLR 2026 Workshop on Agents in the Wild (AgentWild). 20 pages including appendix, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17870 2026-04-02 cs.CL 77%

Just as Humans Need Vaccines, So Do Models: Model Immunization to Combat Falsehoods

正如人类需要疫苗,模型也需要:模型免疫化以对抗虚假信息

Shaina Raza, Rizwan Qureshi, Azib Farooq, Marcelo Lotif, Aman Chadha, Deval Pandya, Christos Emmanouilidis

机构 * Vector Institute(向量研究所) University of Central Florida(中佛罗里达大学) University of Cincinnati(辛辛那提大学) Independent Researcher(独立研究员) University of Groningen(格罗宁根大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出模型免疫化方法,通过在训练中加入精心挑选的(错误陈述,纠正)对,以直接监督虚假信息,提升模型在TruthfulQA上的准确性并提高对抗虚假信息的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02976 2026-04-02 cs.AI 77%

Teaching AI to Handle Exceptions: Supervised Fine-Tuning with Human-Aligned Judgment

教AI处理例外:基于人类对齐判断的监督微调

Matthew DosSantos DiSorbo, Harang Ju, Sinan Aral

机构 * Harvard Business School(哈佛商学院) Johns Hopkins University(约翰霍普金斯大学) MIT Sloan School of Management(麻省理工学院斯隆管理学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究探讨了如何通过监督微调使AI处理例外,发现使用人类解释的微调能显著提升模型决策能力,揭示了对齐人类判断需明确训练决策过程而非仅决策结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00923 2026-04-02 cs.CL 70%

Positional Cognitive Specialization: Where Do LLMs Learn To Comprehend and Speak Your Language?

位置认知专精:大型语言模型如何学习理解和说出你的语言?

Luis Frentzen Salim, Lun-Wei Ku, Hsing-Kuo Kenneth Pao

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过实验揭示语言模型在不同区域发展语言感知与产出专精机制,提出CogSym方法实现高效适应,提升多语言任务性能。

Comments Accepted to AAAI26 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19846 2026-04-02 cs.AI 70%

HiMA-Ecom: Enabling Joint Training of Hierarchical Multi-Agent E-commerce Assistants

HiMA-Ecom:面向电商场景的分层多智能体助手联合训练

Junxing Hu, Ai Han, Haolan Zhan, Pu Wei, Zhiqian Zhang, Yuhang Guo, Jiawei Lu, Zhen Chen, Haoran Li, Zicheng Zhang

机构 * JD Retail, JD.com, Inc.(京东零售,京东集团) Faculty of Engineering and Information Technology, The University of Melbourne(墨尔本大学工程与信息技术学院) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出HiMA-Ecom电商多智能体基准,通过VR-GRPO算法实现多智能体联合训练,基于3B/7B开源模型在电商场景中取得优于DeepSeek-V3的性能。

Comments 39 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏