arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-03 至 2026-08-03 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 28 篇

2605.00015 2026-08-03 eess.SP cs.AI cs.CV cs.LG 版本更新 82%

TimeRFT: Stimulating Generalizable Time Series Forecasting for TSFMs via Reinforcement Finetuning

TimeRFT:通过强化微调提升TSFMs的时间序列预测通用性

Siyang Li, Yize Chen, Zijie Zhu, Yuxin Pan, Yan Guo, Ming Huang, Hui Xiong

机构 * University of Alberta(阿尔伯塔大学) Alibaba Cloud(阿里云) City University of Hong Kong(香港城市大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 TimeRFT通过强化微调方法解决时间序列基础模型在特定任务适应中的泛化问题,提升预测精度和抗分布偏移能力。

Comments 15 pages, 8 figures, In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28647 2026-08-03 cs.HC cs.AI 新提交 81%

ConnectED: A Curriculum-Aligned AI System for Vietnamese Instructional Lesson Planning and Student Learning

ConnectED:面向越南教学课程规划与学生学习的课程对齐AI系统

Thang Doan Viet, Anh Nguyen Hoang, Tinh Luong Son, Anh Hoang Thi Ngoc, Huyen Giang Thi Thu, Tai Le Quy

专题命中 指令微调 :preference optimization(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出以人为本的AI系统ConnectED,基于VietEduQwen构建,支持越南教育完整教学生命周期,经评估其准确率优于基准模型,可缩短教师备课时间且获师生高满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29071 2026-08-03 cs.LG cs.AI 新提交 81%

Federated Foundation Models Fine-Tuning with Heterogeneous Compressed Clients

采用异构压缩客户端的联邦基础模型微调

Shengkun Zhu, Jinshan Zeng, Zhihua Allen-Zhao, Mayi Xu, Quanqing Xu, Wei Ren, Qiang Yang, Yang Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) OceanBase, Ant Group(蚂蚁集团OceanBase) School of Management, Xi’an Jiaotong University(西安交通大学管理学院) School of Mathematics and Statistics, Xidian University(西安电子科技大学数学与统计学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, China University of Geosciences(中国地质大学计算机学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对基础模型联邦学习的资源不对称问题,提出FedSLM框架,通过SVD分解等技术实现异构压缩客户端的联邦微调,实验显示其在多基准上优于现有基线且客户端内存需求更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09361 2026-08-03 cs.LG cs.AI 版本更新 73%

GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR

GeoRA: 为强化学习可验证奖励设计的几何感知低秩适应

Jiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Meituan(美团) Peking University(北京大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 GeoRA通过利用RLVR更新子空间的各向异性与压缩性结构,采用SVD提取主方向初始化低秩适配器,冻结残差部分作为结构锚点,从而在数学、医学和编程领域优于现有低秩基线,同时在跨领域任务中表现更佳。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13683 2026-08-03 cs.CL cs.AI cs.CY 版本更新 73%

Preconditioned Test-Time Adaptation for Out-of-Distribution Debiasing in Narrative Generation

预条件测试时适应用于叙事生成中的分布外去偏

Hanwen Shen, Ting Ying, Jiajie Lu, Shanshan Wang

机构 * Laboratory for Artificial Intelligence in Mathematics Education, Stevens Institute of Technology(数学教育中的人工智能实验室,史蒂文斯理工学院) Independent Researcher(独立研究者) NLP2CT Lab, Department of Computer and Information Science, University of Macau(NLP2CT实验室,澳门大学计算机与信息科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CAP-TTA框架,通过预条件预计算实现测试时适应,有效减少毒性/偏见评分,降低延迟并防止灾难性遗忘,提升叙事流畅度。

Comments This paper has been accepted to ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29601 2026-08-03 cs.LG 新提交 70%

The Parts Are Greater Than the Sum: Automated Task Sequencing for Efficient Training of Multi-Policy LLMs

部分之和大于整体:用于高效训练多策略大语言模型的自动任务排序

Jiajia Tang, Sizhe Yuen, Francisco Gomez Medina, Yali Du, Adam Sobey

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对多策略大语言模型训练中共享优化空间的干扰问题,提出自动多策略PEFT框架,通过任务分组排序组织独立QLoRA路径,在TRACE基准取得44.78的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29250 2026-08-03 cs.CL 新提交 70%

Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation

Data Turnstile:面向函数调用数据生成的可扩展开源框架

Goutham Ramakrishnan, Megha Sharma

机构 * Amazon AGI(亚马逊AGI)

专题命中 指令微调 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 该研究提出开源框架Data Turnstile,可基于用户定义API规范生成高质量函数调用合成训练数据,经其微调的小型语言模型在BFCL、τ²-bench等基准上性能大幅提升,缩小了与更大规模模型的差距。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29412 2026-08-03 cs.CV 新提交 67%

Role-Break in Attention Heads: Understanding and Detecting Hallucinations in VLMs

注意力头中的角色断裂:理解和检测视觉语言模型中的幻觉

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Nan Duan, Tong Jia, Chaoran Luo, Ying Li

专题命中 指令微调 :language model(abstract,abstract_cn)

AI总结 该研究提出注意力头的角色断裂现象,构建无需微调的轻量级线性检测器,在6个VLMs和4个基准上平均AUROC达93.23,可检测VLM幻觉并支持干预操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29367 2026-08-03 cs.CV 新提交 67%

SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation

SatEdit:基于VLM引导的区域标注的掩码条件卫星图像编辑

Muhammad Talha, Muhammad Ahmed Amer

专题命中 指令微调 :language model(abstract);foundation model(abstract)

AI总结 SatEdit是基于VLM引导区域标注的卫星图像编辑框架,通过未标注图像构建监督信号,经LoRA微调后在对比中实现最高掩码区域语义对齐,为卫星图像编辑提供了数据高效的可行方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28658 2026-08-03 cs.CL cs.AI cs.LG 新提交 67%

Evaluating Federated Pre-Training: On the Reliability of Downstream Fine-Tuning and Intrinsic Evaluation

联邦预训练评估:下游微调与内在评估的可靠性研究

Claudia Grosser, Maike Heuer, Denis Krompass, Thomas A. Runkler

机构 * Technical University Munich(慕尼黑工业大学) Siemens AG(西门子公司)

专题命中 指令微调 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究对比联邦预训练的下游微调(含全量、仅头部等变体)与GLUE文本下一个词预测的评估效果,发现后者与预训练测试困惑度相关性更强,提示仅下游微调易产生误导,需关注更接近预训练目标的评估信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29100 2026-08-03 cs.LG cs.CR cs.CV 新提交 57%

StraightDP: Geometry-Aware Differential Privacy for Rectified-Flow Transformers

StraightDP:面向整流流Transformer的几何感知差分隐私

Xujun Che, Depeng Xu, Xintao Wu

专题命中 指令微调 :pretraining(abstract);分类 cs.LG

AI总结 StraightDP利用整流流的几何异质性,通过释放类条件矩结合DP-SGD,在强差分隐私约束下提升文本条件生成模型的下游准确率与生成质量,且可迁移到SD3-medium。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28967 2026-08-03 cs.CV cs.LG 新提交 57%

Visual Distribution Anchoring for Efficient Prompt Tuning

用于高效提示调优的视觉分布锚定

Pouya Parsa, Raoof Zare Moayedi, Seongjin Choi

机构 * University of Minnesota(明尼苏达大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出无需训练的VDA框架,用未标记目标池的类级视觉原型增强冻结语义分类器,在10次ImageNet到目标域迁移中显著提升多个视觉-语言模型性能,且与各类分类器互补。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28669 2026-08-03 cs.LG 新提交 57%

LARA: Lightweight Adapters in the Residual Stream for Composable Adaptation and Alignment

LARA:用于可组合适配与对齐的残差流中的轻量适配器

Pascal Ekin, Hyosun Choi, Wei Jie

机构 * Royal Holloway, University of London(伦敦大学皇家霍洛威学院) University of West London(西伦敦大学)

专题命中 指令微调 :preference optimization(abstract);分类 cs.LG

AI总结 本研究提出LARA,一种在冻结模型残差流中运行的轻量适配方法,在参数数量相同时性能与LoRA相当,支持多种行为平滑插值与按token路由,可在单个模型上高效托管多种行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28637 2026-08-03 cs.CL 新提交 57%

ZeroR@CHiPSAL 2026: Two-Stage Vision-Language Adaptation with Contrastive Learning for Nepali Meme Classification

ZeroR@CHiPSAL 2026:用于尼泊尔表情包分类的对比学习两阶段视觉-语言适配

Nitiz Khanal

机构 * Pulchowk Campus, Institute of Engineering, Tribhuvan University(特里布万大学工程学院普尔乔克校区)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 该研究针对尼泊尔表情包多模态仇恨言论与情感检测任务,适配RA-HMD框架,采用两阶段视觉-语言对比学习方法,取得两项任务的优异排名,为低资源南亚语言适配大模型提供了见解。

Comments 9 pages, 2 figures, system description paper for the CHiPSAL 2026 shared task at LREC 2026

Journal ref Proceedings of the Second Workshop on Challenges in Processing South Asian Languages (CHiPSAL 2026) @ LREC 2026, pages 275-283, Palma, Mallorca, Spain, 16 May 2026. ELRA Language Resources Association (ELRA). ISBN 978-2-493814-66-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29033 2026-08-03 cs.CV 新提交 50%

SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting

SAM+D:通过深度路由LoRA与深度移位实现SAM系列模型的参数高效维度提升

Yu Song, Hao Sun, Shiyu Teng, Ikuko Nishikawa, Yen-wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院)

专题命中 指令微调 :foundation model(abstract)

AI总结 该研究提出SAM+D框架,通过DRLoRA与DSM两个轻量模块,以仅微调约2.8%(SAM)或3.7%(SAM2)参数的方式,实现2D SAM至3D、SAM2至4D的高效分割,在多个基准上取得具竞争力结果。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28987 2026-08-03 cs.SE 新提交 50%

A Formalism-Aware Reward Loop for Handwritten UML-to-PlantUML Generation

面向手写UML到PlantUML生成的形式化感知奖励循环

Mersedeh Sadeghi, Simon Scholz, Adrian Psoch-Bajraktari

专题命中 指令微调 :language model(abstract)

AI总结 本研究提出形式化感知奖励循环,通过微调视觉-语言模型结合Group Relative Policy Optimisation生成PlantUML,提升了转换质量,为建模评估提供了新方向。

Comments Accepted for publication in the Proceedings of the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026). This is the accepted author manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 12 篇

2607.23802 2026-08-03 cs.AI 版本更新 90%

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励

Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

机构 * Duke University(杜克大学) Adobe Inc.(奥多比公司) Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28862 2026-08-03 cs.CL cs.AI cs.CR cs.LG 新提交 88%

TextCloak: Thwarting Unauthorized LLM Exploitation via RL-Driven Unlearnable Text

TextCloak:基于强化学习的不可学习文本防御未经授权的大语言模型利用

Chengshuai Zhao, Pingchuan Ma, Dawei Li, Bohan Jiang, Zhiyuan Yu, Zhen Tan, Huan Liu

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出TextCloak框架,采用强化学习与GRPO-UE技术生成不可学习文本,可削弱大语言模型的未经授权微调,兼具实用性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22614 2026-08-03 cs.AI 版本更新 88%

DynaResize: Runtime GPU Reallocation for Disaggregated LLM Post-Training

DynaResize:用于分布式语言模型训练后运行时的GPU重新分配

Hanlin Du, Zhiyuan Yan, Yungang Bao, Sa wang

机构 * SKLP, Institute of Computing Technology, CAS(中国科学院计算技术研究所智能处理器研究中心) Bytedance(字节跳动)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.AI

AI总结 研究基于强化学习的语言模型训练后GPU资源分配问题,提出DynaResize运行时GPU重新分配系统,通过动态切换GPU平衡阶段执行时间,分解操作并去除关键路径非关键工作,实验显示可提高吞吐量、减少执行时间并隐藏部分开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29185 2026-08-03 cs.CL 新提交 81%

Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

学习标量奖励模型的端到端潜在推理轨迹

Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang, Kun Liang, Weijie Liu, Yunfang Wu

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28680 2026-08-03 cs.CL cs.LG 新提交 81%

TELLER: Dual-Path Iterative Preference Optimization for Table Entity Linking

TELLER:用于表格实体链接的双路径迭代偏好优化

Yixin Peng, Kehao Li, Stefan Decker

机构 * RWTH Aachen(亚琛工业大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对表格实体链接任务提出TELLER双路径迭代偏好优化方法,通过直接回答与推理两条路径分别优化,在TableInstruct和MammoTab V2数据集上提升了实体链接与推理生成的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29246 2026-08-03 cs.AI 新提交 77%

Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL

不要混合奖励,要混合策略:多奖励强化学习的策略分解与优化

Ruiming Liang, Yi Zhong, Yizhen Yuan, Yinan Zheng, Tianyi Tan, Tianyue Wang, Haiyun Guo, Jinqiao Wang, Xianyuan Zhan

机构 * Fundation Model Research Center, CASIA(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) College of Automotive and Energy Engineering (CAEE), Tongji University(同济大学汽车与能源工程学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本研究针对多奖励RL的对齐税问题,提出PRISM框架,通过策略分解优化正、负策略,在三类任务上优于基线并具备推理可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13319 2026-08-03 cs.LG 版本更新 77%

LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning

LightningRL: 通过强化学习打破块状dLLMs的精度-并行性权衡

Yanzhe Hu, Yijie Jin, Pengfei Liu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出LightningRL框架,通过强化学习优化预训练dLLMs的速度-质量帕累托前沿,提升并行生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28829 2026-08-03 cs.NI cs.LG 新提交 74%

When Unlearning Fails: Reliable Data Deletion under Post-Training in Agent Networks

当遗忘失效时:智能体网络后训练下的可靠数据删除

Zihao Ding, Jun Huang, Liang Dong

专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG

AI总结 针对自改进联邦智能体网络后训练时数据删除易出现影响回声的问题,提出MUTE方法,经实验验证其可在保障任务效用的同时降低行为泄漏且通信开销更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29363 2026-08-03 eess.AS cs.AI cs.LG cs.SD 新提交 73%

Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

基于低帧率高维连续标记的稳定自回归语音生成

Yi Luo, Rongzhi Gu, Jixun Yao

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对自回归语音生成的序列长度、表征容量与长时稳定性平衡难题,本文提出Locodec编解码器与MP-ELD流匹配框架,实现高保真、高可预测性且稳定的长时语音合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17877 2026-08-03 cs.AI 版本更新 70%

PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

PAIR:面向多轮代理优化的前缀感知内部奖励模型

Wonjoong Kim, Yeonjun In, Sangwu Park, Dongha Lee, Chanyoung Park

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出PAIR模型,通过结合冻结的隐藏状态探针和轻量级注意力头部,解决多轮任务中内部正确性探针的可靠性问题,从而在不依赖外部模型调用或地面真实依赖的情况下,为GRPO训练提供密集的步骤级奖励信号。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29613 2026-08-03 cs.RO cs.CL cs.CV 新提交 57%

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

WCM:用于视觉-语言-动作强化学习的世界评论者模型

Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 该研究针对视觉-语言-动作强化学习中评论者与机器人部分可观测性不匹配的问题,提出WCM模型,联合预测未来潜态与值估计,在149个仿真任务和7个真实任务上均实现最优性能与泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26873 2026-08-03 cs.CL 版本更新 57%

SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

SERPO:面向开放式测试时强化学习的自进化规则策略优化

Jianze Wang, Kunwang Zheng, Ying Liu, Yu Cao, Qilong Zhang, Jinlong Chen, Hua Yang, Qianglong Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 SERPO通过协同进化响应证据、查询规则和策略参数的闭环机制,在开放式测试时强化学习任务中显著提升了HealthBench等基准的性能,支持分布外迁移与跨基准进化。

Comments 20 pages, including the appendix. Code is available at https://github.com/chiefovoavicii/SERPO

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 18 篇

2606.05976 2026-08-03 cs.AI cs.CL 版本更新 93%

The Self-Correction Illusion: Role Relabeling Gates Explicit Error Flagging in Large Language Models

自我修正错觉:LLM 纠正他人但不纠正自己

Kuan-Yen Chen, Fang-Yi Su, Shih-Yen Lin, Bao Li, Jung-Hsien Chiang

机构 * National Taiwan University(国立台湾大学)

专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);large language model(title);language model(title);instruction tuning(abstract)

AI总结 本文通过保持错误声明字节一致仅改变角色标签,发现 LLM 无法自我修正并非能力缺陷,而是聊天模板角色标签的人为产物,并提出无需训练或模型修改的提示结构干预方法。

Comments 15 pages, 3 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29032 2026-08-03 cs.MA cs.CL 新提交 92%

TransMem: Transforming Hidden States into Memory for Large Language Models

TransMem:将隐藏状态转换为大语言模型的记忆

Haodong Lei, Junming Liu, Yirong Chen, Pinlong Cai, Botian Shi, Ding Wang, Hongsong Wang

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对长上下文LLM智能体的历史信息未充分利用问题,提出轻量级记忆模块TransMem,结合证据条件自蒸馏,在多基准测试中显著提升性能。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏