arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 725 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 37 篇

2604.25702 2026-08-04 cs.CL 版本更新 83%

Backtranslation Augmented Direct Preference Optimization for Neural Machine Translation

反向翻译增强的直接偏好优化用于神经机器翻译

Mehrdad Ghassabi, Spehr Rajabi, Hamidreza Baradaran Kashani, Sadra Hakim, Mahshid Keivandarian, Amirhossein Jahani Bahnamiri

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);post-training(abstract);分类 cs.CL

AI总结 提出基于直接偏好优化的强化学习后训练框架,利用通用文本语料和专家反馈纠正神经机器翻译错误,在英德翻译任务上将COMET分数从0.703提升至0.747。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01822 2026-08-04 cs.AI 新提交 81%

SearchMaster: Grounded and Regulated Self-Play for Search Agents

SearchMaster:面向搜索智能体的基于接地与调控的自博弈框架

Wentao Tan, Qiong Cao, Jiaqi Wang, Nan Duan

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出SearchMaster自博弈框架,通过ECG、SDR、OOP三项调控措施优化LLM搜索智能体训练,在六个深度搜索基准上显著提升Qwen3.5-9B模型的平均准确率,无需人工标注数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22186 2026-08-04 cs.AI 版本更新 81%

Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning

解构离策略比率:用于异步强化学习的熵缩放信任区域

Guanqun Zhao, Zijun Xie, Binbin Zheng, Enlei Gong, Jiafeng Lu, Yehan Yang, Aoqi Hu, Zeyu Chen

机构 * Baidu(百度)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究异步强化学习中离策略数据问题,提出熵缩放信任区域(ESTR)方法,通过令牌局部熵缩放离策略偏差,无需辅助前向传递等,在多任务和基准测试中优于现有异步方法,提升训练-推理一致性与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01604 2026-08-04 cs.AI cs.SE 新提交 79%

Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer

在办公工作上进行后训练可提升软件工程能力:跨域迁移的行为视角

Logan Ritchie, Sushant Mehta, Liudas Panavas, Edwin Chen

机构 * Surge AI

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 该研究通过在办公工作流程的长程多工具智能体任务上后训练Qwen3.5-122B-A10B,发现模型在无相关训练的软件工程基准SWE-Bench Pro上性能提升,证实长程后训练可跨域强化目标导向执行行为。

Comments 20 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00562 2026-08-04 cs.CV 新提交 78%

Beyond Token-Level Cross-Entropy: Fréchet Distributional Post-Training for Autoregressive Image Generation

超越 token 级交叉熵:用于自回归图像生成的 Fréchet 分布后训练

Jinhua Zhang, Yisong Lin, Wei Long, Shuhang Gu

机构 * UESTC(电子科技大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 该研究针对自回归图像生成器预训练与评估的目标及上下文不匹配问题,提出 FD-loss 后训练方法,在 ImageNet 256×256 任务上大幅降低 FID 与 FD_r6,提升生成质量且无额外参数或推理步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12784 2026-08-04 cs.DC 版本更新 78%

StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training

通过受滞约束的回放协调实现高效的异步RL后训练

Haoyang Li, Sheng Lin, Fangcheng Fu, Yuming Zhou, Xiaodong Ji, Yanfeng Zhao, Lefeng Wang, Jie Jiang, Bin Cui

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 StaleFlow通过受滞约束的回放协调,解决RL后训练中数据滞留与偏斜问题,提升系统吞吐量。

Comments SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02143 2026-08-04 cs.AI 新提交 77%

Beyond Solution-Centric Search: Adaptive Inquiry and Knowledge Revision for Autonomous ML Engineering

超越以解决方案为中心的搜索:面向自主机器学习工程的自适应查询与知识修正

Shaokang Fu, Yulong Tao, Linbo Jin, Jiarong Zhao, Qiming Shi, Tianjun Pan, Haonan Li, Chengyu Wang, Jia Wu, Chengfu Huo

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 该研究针对自主机器学习工程的长时任务,提出信息范式并实现为Iris智能体,其在MLE-Bench上12小时预算下获64.9%任意奖牌率,还具备跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23310 2026-08-04 stat.ML cs.LG 版本更新 77%

Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards

OBLR-PO:大型语言模型后训练稳定强化学习的理论框架

Zixun Huang, Jiayi Sheng, Zeyu Zheng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 OBLR-PO通过理论框架优化学习率和基线,提升大型语言模型后训练的稳定性与性能。

Comments 28 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01354 2026-08-04 cs.CV 新提交 75%

PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle

PixVL:通过统一掩码-文本一致性循环进行像素级多模态大语言模型的自监督训练

Yicheng Xiao, Haoxuan Ma, Caorui Li, Yucheng Wu, Weijie Wang, Haoxiao Wang, Shuang Chen, Fan Yang, Haiyun Guo, Jinqiao Wang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 PixVL作为自监督后训练框架,通过统一掩码-文本一致性循环及语义验证等策略,解决像素级MLLMs的优化干扰问题,同时提升区域理解与分割任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01556 2026-08-04 cs.LG cs.AI 新提交 73%

Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group-Debiased Federated Learning

基于组去偏联邦学习的偏好异质性下大语言模型个性化奖励建模反思

Seongyoon Kim, Boryeong Cho, Jihwan Oh, Seokhyun Chung, Se-Young Yun

机构 * Institute of Engineering Research, Korea University(韩国大学工程研究所) Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院金在哲人工智能研究生院) Industrial Management Engineering, Korea University(韩国大学产业管理工程学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对大语言模型个性化奖励建模的偏好异质性问题,提出FedGD方法,通过组去偏的客户端采样抵消组不平衡影响,实现无需预先知晓潜在组的有效个性化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00584 2026-08-04 cs.CV cs.AI cs.LG 新提交 73%

Element-Aware Group Learning for E-Commerce Image Generation

面向电商图像生成的元素感知组学习

Jingtong Chen, Jiahui Wang, Xue Zhao, ShaoGuo Liu, Minghao Li

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01055 2026-08-04 cs.CV cs.AI 新提交 70%

Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

为正确的边界框分配信用:结构化视觉感知的边际贡献分配

Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型结构化视觉感知中响应级监督的粒度不匹配问题,提出MCR-GRPO框架,通过边界框级边际贡献分配优化,在多个基准上取得了优于现有GRPO基线的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16169 2026-08-04 cs.LG cs.AI 版本更新 62%

When Does Muon Help Agentic Reinforcement Learning?

μ子何时有助于智能体强化学习?

Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究μ子在稀疏奖励智能体强化学习中的作用,通过与AdamW对比,发现在组内组策略优化下,μ子应用于隐藏权重矩阵能提升成功率,效果与优势估计器、学习率有关,表明其可使智能体RL受益,还需多种子和跨任务验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01593 2026-08-04 cs.AI 新提交 57%

Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning

潜思维信用:面向潜推理的多答案信用分配

Xuyang Zhao, Liting Zhang, Zichen Xu, Yong Chen, Wenjia Zeng, Shiwan Zhao, Qicheng Li

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 该研究针对潜推理的信用分配难题,提出LTC分层框架,结合多答案估计与GRPO在线策略训练,在数学推理等任务上取得最优平均准确率,可降低奖励估计误差并缓解思维级信用问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25498 2026-08-04 cs.SD cs.AI 版本更新 57%

SymphonyGen: 3D Hierarchical Orchestral Generation with Controllable Harmony Skeleton

SymphonyGen:具有可控和声骨架的3D分层交响乐生成

Xuzheng He, Nan Nan, Zhilin Wang, Ziyue Kang, Zhuoru Mo, Ao Li, Yu Pan, Xiaobing Li, Feng Yu, Xiaohong Guan

机构 * Department of AI Music and Music Information Technology, Central Conservatory of Music(中央音乐学院人工智能音乐与音乐信息科技系) Frontier Institute of Science and Technology, and Interdisciplinary Research Center of Frontier Science and Technology, Xi’an Jiaotong University(西安交通大学前沿科学与技术研究院及交叉科学与技术 interdisciplinary research center) University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 SymphonyGen通过3D分层框架实现当代电影交响乐生成,采用分层解码器架构提升效率,引入短谱条件和GRPO优化,增强和声纯净度与音乐表现力。

Comments Accepted at ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02197 2026-08-04 cs.RO 新提交 50%

Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models

关注关键区域:面向视觉-语言-动作模型的自适应视觉细化

Jin Cui, Yanbin Hu, Xinyue Long, Linkai Li, Boran Zhao, Pengju Ren

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对VLA模型视觉表示不可靠的问题,提出AtVLA框架,结合注意力校正与不确定性门控局部细化,在多基准测试中显著提升机器人操作成功率且计算开销可控。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00816 2026-08-04 cs.IR 新提交 50%

Exponential Reward Weighting for Fine-Tuning Generative Recommenders under Sparse and Noisy Feedback

稀疏且含噪反馈下生成式推荐器微调的指数奖励加权方法

Keertana Chidambaram, Sanath Kumar Krishnamurthy, Qiuling Xu, Ko-Jen Hsiao, Moumita Bhattacharya

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对稀疏含噪反馈下生成式推荐器的过优化问题,提出Exp-RSFT方法,通过指数奖励加权和温度λ平衡覆盖与噪声成本,在多数据集上验证其优于PPO、DPO,可提升排序性能且无需额外数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00750 2026-08-04 cs.IR 新提交 50%

Hierarchical Residual Policy Optimization for Generative Recommendations

用于生成式推荐的分层残差策略优化

Kaifeng Guo, Yiming Yang, Jingtong Gao, Guolei Zeng, Fukang Yang, Yukang Liang, Peng Jiang, Qingpeng Cai, Xiangyu Zhao

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对生成式推荐器后训练中标记级信用分配问题,提出HRPO框架,将项目级结果转换为标记对齐学习信号,经实验在会话效用和业务指标上取得提升。

Comments 12 pages, 6 figures, 10 tables. Accepted at KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00502 2026-08-04 cs.CV 新提交 50%

SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance

SpatialAfford:教紧凑视觉语言模型(VLMs)关注何处与定位何处以实现 affordance

Yufei Zhang, Chenlu Zhan, Donghui Sun, Xiaoxin Chen, Hongwei Wang

机构 * Zhejiang University(浙江大学) Vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 SpatialAfford 是一个两阶段框架,通过空间注意力对齐和空间感知 GRPO,使紧凑 4B VLMs 在多个基准上的 affordance 定位性能优于更强的 7B+ 基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18557 2026-08-04 cs.CV cs.GR cs.RO 版本更新 50%

SynAgent: Generalizable Cooperative Humanoid Manipulation via Solo-to-Cooperative Agent Synergy

SynAgent:通过独狼到协作代理协同实现通用化的人形机器人操作

Wei Yao, Haohan Ma, Hongwen Zhang, Liangjun Xing, Zhile Yang, Yuanjun Guo, Yunlian Sun, Yebin Liu

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系) College of Artificial Intelligence, Nanjing Forestry University(南京林业大学人工智能学院)

专题命中 后训练与偏好优化 :pretraining(abstract)

AI总结 本文提出SynAgent框架,通过独狼到协作代理协同转移单agent人-物体交互技能,实现可扩展且物理合理的协作操作,实验显示其在协作模仿和轨迹条件控制方面优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 43 篇

2608.00007 2026-08-04 cs.CL cs.AI cs.LG 新提交 92%

MemoryForge: Synthesize Lifelong Memory for Human-Like LLM Agents

MemoryForge:为类人LLM智能体合成终身记忆

Bohan Tang, Yiwen Guo

机构 * Tencent(腾讯)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MemoryForge是从简短目标画像合成终身记忆的框架,通过记忆条件让冻结LLM动态检索相关记忆,在两类任务实验中使其表现更类人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01657 2026-08-04 cs.DC 新提交 92%

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches

在多租户大语言模型前缀缓存中保留准入责任

Zhiyu Wang, Rajkumar Buyya

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 针对多租户LLM前缀缓存的准入责任缺口,提出PrefixShield方法,在vLLM中实现后可显著提升受害者缓存命中率,恢复良性行为并优化资源利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02113 2026-08-04 cs.AI 新提交 92%

MemArbiter: Decision-Time Memory Arbitration for Long-Horizon LLM Agents

MemArbiter:面向长 horizon LLM 智能体的决策时内存仲裁

Jiajun Dong, Yutao Hu, Fengrui Fan, Shihan Dou, Yueming Wu, Deqing Zou

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长 horizon LLM 智能体的内存-行动差距,提出感知功能的内存仲裁框架 MemArbiter,在 ALFWorld 上大幅提升行动成功率,减少失败行动相关问题。

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10697 2026-08-04 cs.CL cs.LG 版本更新 91%

Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models

注意力汇点作为大语言模型幻觉检测的内部信号

Jakub Binkowski, Kamil Adamczewski, Tomasz Kajdanowicz

机构 * Department of Artificial Intelligence, Wroclaw University of Science and Technology(弗罗茨瓦夫科技大学人工智能系)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出SinkProbe方法,通过分析注意力汇点揭示幻觉检测机制,基于理论提出新的检测方法,在多个数据集和LLM上取得最佳性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10628 2026-08-04 cs.SE 版本更新 90%

On the Diffusion of Test Smells in LLM-Generated Unit Tests

论LLM生成的单元测试中测试异味的扩散

Wendkûuni C. Ouédraogo, Yinghua Li, Xueqi Dang, Xunzhu Tang, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 长上下文与记忆 :LLM(title,title_cn);prompting(abstract)

AI总结 本研究通过多基准大规模分析,对比LLM生成、人类编写及EvoSuite生成的单元测试,发现LLM生成测试存在特定测试异味,受提示策略等影响,凸显基于LLM的测试生成的潜力与风险,呼吁开发相关优化方案。

Comments Accepted at Transactions on Software Engineering and Methodology (TOSEM) journal on 31 July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01719 2026-08-04 cs.CR cs.AI 新提交 90%

MNC: Scope-Bound Semantic Declassification for Private LLM-Agent Communication

MNC:面向私有大语言模型智能体通信的范围受限语义解密

Jinghan Xu, Longze Fan, Zeyuan Wang, Xinjin Li, Hankai Liu

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对多智能体LLM系统的隐私泄露问题,提出范围受限语义解密协议MNC,通过绑定披露范围实现授权信息传递,阻止未授权操作,为私有LLM智能体系统提供实用通信边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00902 2026-08-04 cs.CL 新提交 90%

Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

面向LLM智能体的实用在线KV缓存压缩:一项实证研究

Yujian Liu, Jiabao Ji, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) LinkedIn(领英公司)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究针对LLM智能体的KV缓存瓶颈,实证对比了令牌驱逐与注意力匹配两类在线压缩方法,发现延迟压缩可恢复性能,令牌驱逐在代理不完善时更鲁棒,能大幅压缩KV缓存并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00558 2026-08-04 cs.SE cs.AI 新提交 90%

AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications

AiFlow:面向流式大语言模型应用的带界背压令牌原生反应式编排框架

Qunhui Zhang

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有流式LLM工作流编排的背压等管理缺陷,提出AiFlow令牌原生反应式编排模型,经实验验证可降低应用TTFPT并控制队列深度。

Comments 24 pages, 5 figures, 12 tables, 1 algorithm, and 1 code listing. Public implementation: https://github.com/ModelEngine-Group/fit-framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02560 2026-08-04 cs.LG cs.AI cs.IR 新提交 89%

Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection

边缘语言模型的结构化记忆:通过O(1) SSM状态注入实现持久上下文与语料库检索

Anusha Madan Gopal, Aras Pirbadian, Kristofor D. Carlson, M Anthony Lewis, Jonathan Tapson

机构 * BrainChip Inc.(BrainChip公司)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对边缘语言模型提出PRECOG与SMC机制,将SSM预填充成本压缩至O(1),在1.2B参数的TENNs-LLM上实现约4500倍预填充加速,达到与RAG相当的答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25344 2026-08-04 cs.CL cs.AI cs.LG quant-ph 版本更新 88%

A Hamiltonian-Inspired Local-Operator Ansatz for Slimming Large Language Models

一种用于高效大语言模型的通用张量结构压缩方案

Ying Lu, Peng-Fei Zhou, Qi-Xuan Fang, Pan Zhang, Shi-Ju Ran, Gang Su

机构 * School of Physical Sciences, University of Chinese Academy of Sciences(中国科学院大学物理科学学院) Kavli Institute for Theoretical Sciences, University of Chinese Academy of Sciences(中国科学院大学理论科学研究院) Center for Quantum Physics and Intelligent Sciences, Department of Physics, Capital Normal University(首都师范大学量子物理与智能科学中心) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)

专题命中 长上下文与记忆 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出张量混合(MixT)方案,通过将密集线性层替换为张量算子混合体,在保持MMLU准确率的同时大幅减少参数、FLOPs和内存。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏