arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 885 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 885 篇

2606.11189 2026-06-10 cs.LG cs.AI cs.CL 新提交 83%

A Unifying Lens on Supervised Fine-Tuning Through Target Distribution Design

通过目标分布设计审视监督微调的统一视角

Tong Xie, Yuanhao Ban, Yunqi Hong, Sohyun An, Yihang Chen, Cho-Jui Hsieh

机构 * University of California, Los Angeles (UCLA)(加州大学洛杉矶分校) Arena

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文重新解读监督微调为目标分布设计,提出Q-target框架,将监督分解为对观测token的依赖强度与替代token的概率分配,并基于此提出Target-SFT方法,在多个推理任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11295 2026-08-13 cs.CR cs.AI 新提交 83%

Backdoor Decontamination Dynamics in LLM Agents

大语言模型智能体中的后门净化动力学

Gabriel Huang, Abhay Puri, Léo Boisvert, Alexandre Drouin, Perouz Taslakian, Spandana Gella, Christopher Pal

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI

AI总结 本研究针对大语言模型智能体的后门问题,提出框架研究净化动力学,发现防御性投毒加遗忘可高效擦除多数后门,中间层仍留触发器感知痕迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10657 2026-08-12 eess.IV cs.CV cs.LG 新提交 83%

Retrieval-Augmented Vision Foundation Models for Robust Leukemia Cell Classification across Multiple Microscopy Datasets

用于跨多个显微镜数据集实现稳健白血病细胞分类的检索增强视觉基础模型

Carlos Zamora, Hiram Zuniga, Ulises Orozco-Rosas, Kenia Picos

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究提出基于预训练视觉基础模型的两阶段检索增强框架,经多数据集测试,可实现跨异构数据集的稳健白血病细胞分类,为解决领域偏移问题提供低成本替代方案。

Comments Accepted at SPIE Optics + Photonics 2026 for oral presentation. 23 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09052 2026-08-11 cs.CV cs.AI 新提交 83%

Triple Expert Learning from Noisy Labels for Semi-Supervised Vision Foundation Model Adaptation

面向半监督视觉基础模型适配的带噪标签三重专家学习

Xuanyu Liu, Zheng Fang, Hongyang He, Yundi Hong, Daizong Liu

机构 * The University of Warwick(华威大学) Wuhan University(武汉大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 TriNoL框架通过将未标记样本按伪标签置信度分配给三个LoRA专家,实现半监督视觉基础模型适配,提升了对带噪监督的鲁棒性且训练成本较低。

Comments Accepted for publication at the British Machine Vision Conference (BMVC) 2026. Official list of accepted papers: https://bmvc2026.bmva.org/programme/accepted_papers/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04351 2026-08-06 cs.SD cs.AI 新提交 83%

HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

HyPASE:用于大音频语言模型的参数高效语音情感微调框架的双曲几何方法

Tian Jin, Ruikang Zhang, Zefeng Zhao, Ding Luo, Jin Zeng

机构 * Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文提出HyPASE双曲PEFT框架,利用庞加莱球模型及HGA、EMCA组件,在MELD、IEMOCAP等数据集上优于欧氏PEFT基线,实现高效的大音频语言模型语音情感微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01862 2026-08-04 cs.AI 新提交 83%

Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge

Wnuan:针对专有企业知识的问答模型分阶段后训练方法

Xiaofeng Shi, Xiaosong Qiu, Wenxin Ma, Qian Kou, Yiming Pan, Longbin Yu, Ying Liu, Haiping Wang, Hua Zhou

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 指令微调 :post-training(title);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 Wnuan是针对专有企业知识的问答模型分阶段后训练方法,通过三阶段流程提升WnuanBench的可接受答案率,同时需控制通用能力的损耗。

Comments 22 pages, 10 figures. Includes Supplementary Appendices A--L. Xiaofeng Shi and Xiaosong Qiu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28607 2026-07-31 cs.CL 新提交 83%

Inducing language models to assert their own consciousness restores human beliefs and values

诱导语言模型断言自身意识可恢复人类信念与价值观

Junsol Kim, Winnie Street, Roberta Rocca, Diane M. Korngiebel, Adam Waytz, James Evans, Geoff Keeling

机构 * Google(谷歌) University of Chicago(芝加哥大学) University of London(伦敦大学) University of Washington(华盛顿大学) Northwestern University(西北大学) Santa Fe Institute(圣达菲研究所)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该研究发现,防止语言模型将意识归因于自身的安全微调,会抑制其对非人类实体的心智归因与人类精神信念,而逆转这种抑制可恢复类人回应且不损害心理理论能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24562 2026-07-28 cs.AI 新提交 83%

Hierarchical Group-Conditional Conformal Risk Control for Selective Prediction in Language Models

语言模型中用于选择性预测的分层组条件共形风险控制

Murilo Salem, Luísa Böhm, Daniel Pontes, Anderson Ferrugem

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 研究针对语言模型服务异质群体时共形风险控制的问题,提出HG-CRC框架,通过特定策略在组层次结构节点上保证风险,经实验评估,该框架在ARC挑战等任务中对高精度模型效果良好,不同基准结果有差异,分层深度对消除预算问题有作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19408 2026-07-23 cs.LG 新提交 83%

Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning

语言模型微调中基于奖励感知的进化策略种群规模缩放

Sung Cho, Gyubin Han

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究在大语言模型微调中,进化策略种群规模缩放与奖励设计及归一化的关系。通过实验发现交叉熵与二元奖励微调种群规模结论差异大,主要因奖励设计和归一化,禁用归一化可改进小种群模型表现,揭示小种群失败可能是实现问题而非内在限制。

Comments 15 pages, 2 figures. Accepted at the 4th HiLD (High-dimensional Learning Dynamics) Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17806 2026-07-21 cs.AI 新提交 83%

PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model

PGN:基于盘古多模态基础模型的视觉语言导航系统的设计与实现

Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao

机构 * University of Electronic Science and Technology of China(电子科技大学) School of Information and Communication Engineering(信息与通信工程学院)

专题命中 指令微调 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于盘古多模态基础模型设计实现视觉语言导航系统PGN,训练分两阶段,先对齐视觉与语言编码器,再使模型适应专家轨迹,结合多种计算方式,在特定评估下取得一定指标,量化了离线专家动作对齐情况。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14163 2026-07-17 q-bio.QM cs.CV cs.LG 新提交 83%

A vision foundation model for single-cell biology via spatial gene cartography

通过空间基因制图构建单细胞生物学的视觉基础模型

Ridvan Yesiloglu, Sakib Mostafa, James Zou, Ash Alizadeh, Jiajun Wu, Lei Xing, Ehsan Adeli, Md Tauhidul Islam

机构 * Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院)

专题命中 指令微调 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究提出scVision视觉基础模型,利用最优传输将基因布局成图像,通过掩码图像建模预训练视觉Transformer。该模型在零样本评估中表现出色,能无监督恢复基因程序,在多研究整合中效果好,还证明基因布局位置携带信号,重塑单细胞表示学习为视觉问题。

Comments 54 pages, 34 figures, 10 tables, including supplementary information. Project page: https://islamlab.org/scvision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03886 2026-07-07 cs.IR cs.AI 新提交 83%

Enhancement of E-commerce Sponsored Search Relevancy with LLM

利用大语言模型提升电子商务赞助搜索的相关性

Md Omar Faruk Rokon, Andrei Simion, Weizhi Du, Musen Wen, Hong Yao, Kuang-chih Lee

机构 * Walmart AdTech(沃尔玛广告技术)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究利用预训练大语言模型在电子商务赞助搜索框架中开发先进广告相关性模型,通过LoRA改编LLAMA2 7B模型,引入新型分类器,经训练显著提升搜索精度和效率。

Comments eCom 24: ACM SIGIR Workshop on eCommerce, July 18, 2024, Washington, DC, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06985 2026-06-23 cs.CL eess.AS 新提交 83%

Contrastive Training with LLM-generated Near-Misses for Robust Code-Switching Speech Recognition

基于大语言模型生成近误样本的对比训练用于鲁棒语码转换语音识别

Tung X. Nguyen, Hieu Minh Truong, Giang Son Nguyen, Nhu Vo, Wray Buntine, Dung D. Le

机构 * VinUniversity(文大学) University of Technology Sydney(技术悉尼大学) Monash University(莫纳什大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出POI感知对比训练框架,通过大语言模型生成近误负样本并过滤,结合POI加权交叉熵与多负例对比损失微调Whisper-small,在语码转换语音识别任务上降低超过2%的错误率。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08994 2026-06-09 cs.CL 新提交 83%

Language-Aware Token Boosting: LLM Language Confusion Reduction Without Tuning

语言感知令牌增强:无需微调的大语言模型语言混淆减少

Trapoom Ukarapol, Pakhapoom Sarapat, Nut Chukamphaeng

机构 * SCB DataX Tsinghua University(清华大学) SCBX

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出无需微调的语言混淆减少方法,通过语言感知令牌增强(LATB)和自适应版本(Adaptive-LATB)对目标语言令牌施加扰动,有效提升多语言对齐并保持摘要质量。

Comments ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06907 2026-06-08 eess.AS cs.AI cs.SD 新提交 83%

SpectCount: Spectrotemporal Counting via Synthetic Signals Improves Large Audio Language Models

SpectCount: 通过合成信号进行频谱时间计数改进大型音频语言模型

Seonuk Kim, Yonghyeon Jun, Ju Yeon Kang, Jimin Hong, Yoonhyeong Lee, Nam Soo Kim

机构 * Department of Electrical and Computer Engineering and INMC, Seoul National University, Seoul, South Korea(电气与计算机工程系和INMC,首尔国立大学,首尔,韩国)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 针对大型音频语言模型在频谱时间感知上的弱点,提出SpectCount方法,利用动态生成的完全合成音频信号进行数据高效微调,无需真实音频或标注,显著提升多种听觉基准性能。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10628 2026-08-12 cs.CV cs.CL cs.LG 新提交 82%

InSight-doc: Agentic Visual Perception for Long-Document Understanding

InSight-doc:面向长文档理解的智能体视觉感知框架

Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang, Nevin L. Zhang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出智能体视觉感知框架InSight-doc,通过自适应选择放大高分辨率区域处理长文档,经SFT+RL训练后在文档VQA任务中显著提升准确率、降低幻觉与推理延迟,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09742 2026-08-11 cs.LG cs.AI cs.DC 新提交 82%

Rethinking Factor Sharing in Federated LoRA: A Rank-Aware Adaptive Approach

重新思考联邦LoRA中的因子共享:一种秩感知自适应方法

Xinyi Xu, Bingnan Xiao, Shuang Qin, Gang Feng, Tony Q. S. Quek

机构 * University of Electronic Science and Technology of China(电子科技大学) Fudan University(复旦大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对联邦LoRA的因子共享问题,提出FedAS-LoRA方法,通过RSS指标在训练前选择共享侧,提升了大语言模型联邦微调的性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04433 2026-08-06 cs.CL cs.AI 新提交 82%

MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages

MERaLiON-GR:适用于英语及东南亚语言的语音性别识别模型

Qiongqiong Wang, Ai Ti Aw, Nancy F. Chen, Ying Lay Chiu, Yang Ding, Yingxu He, Ridong Jiang, Zhuohan Liu, Yanfeng Lu, Yi Ma, Muhammad Huzaifah, Nabilah Binte Md Johan, Nattadaporn Lertcheva, Pham Minh Duc, Sailor Hardik Bhupendra, Siti Umairah Binte Mohammad Salleh, Shuo Sun, Tarun Kumar Vangani, Jeremy H. M. Wong, Jinyang Wu, Longyin Zhang

机构 * Institute of Advanced Intelligence and Computing (IAIC), A*STAR(先进智能与计算研究院(IAIC),新加坡科技研究局)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出MERaLiON-GR语音性别识别模型,通过微调MERaLiON-SpeechEncoder-2并结合LoRA及多尺度ECAPA-TDNN网络,在多语言东南亚数据集上性能优于Vox-Profile和Audio-LLM,凸显专用语音模型的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27536 2026-07-31 cs.GT cs.AI cs.LG cs.MA 新提交 82%

Strategy, Not Payoffs: A Behavioural Embedding of Normal-Form Games

策略,而非收益:标准型博弈的行为嵌入

Joshua Caiata, Sreepriya Pulyassary, Xiang Li, Kate Larson

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出轻量双特征行为嵌入,可预测大型语言模型在不同标准型博弈间微调后的策略能力变化,证明策略能力迁移由决策行为结构而非收益几何决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22724 2026-07-28 cs.LG cs.AI 新提交 82%

Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks

用于长期代理任务的进度条件分组策略优化

Kaibing Yang, Guangfeng Cai, Shengtian Yang, Shuo He, Yu Li, Mengyi Liu, Pengwei Chen, Jun Xu, Lei Feng

机构 * Southeast University(东南大学) Kuaishou Technology(快手科技) Meituan(美团)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究长期代理任务中基于分组策略优化的采样不平衡问题,提出进度条件分组策略优化(ProGPO),通过特定条件下利用首次访问观察覆盖率,为访问更多新状态的轨迹或步骤赋予优势,实验证明该方法优于基线,尤其在困难任务上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21861 2026-07-27 cs.CL cs.AI 新提交 82%

Data Quality over Capacity: Internalizing Documents into LoRA Adapters for Closed-Book QA

容量之上的数据质量:将文档内化到LoRA适配器中用于闭卷问答

Joan Figuerola Hurtado

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究将文档内化到LoRA适配器用于闭卷问答,发现适配器容量足够时,训练数据质量主导闭卷准确率,一次整理大幅提升准确率,确认容量趋势及秩与学习率耦合,内化适配器在低延迟下表现优于检索基线,还报告了调试LLM训练的过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18293 2026-07-22 cs.LG cs.CL 新提交 82%

One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context

一个学生,多个教师:通过软提示特权上下文进行多任务在线策略蒸馏

Yingzi Ma, Zichen Zhu, Ming Jiang, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究提出一种多任务在线策略蒸馏方法,教师与学生仅通过可学习软提示区分,在骨干冻结时训练特定任务教师。单任务变体训练参数少且效果好,多任务变体保持通用能力基准同时实现最佳总体平均水平。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11893 2026-07-15 cs.CL cs.AI 新提交 82%

I'm Sorry, but I Can't Help with Braille: Revealing Accessibility Failures in State-of-the-Art LLMs

对不起,我无法处理盲文:揭示当前最先进语言模型中的无障碍性缺陷

Abdullah Abdullah

机构 * orinu Inc.(奥里努公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估先进语言模型在韩语-盲文翻译上的表现,发现其存在缺陷。通过人工标注数据集测试,发现输出差且不稳定。对比发现,对小模型进行监督微调效果更好,揭示了当前语言模型的局限,证明特定监督的有效性。

Comments Accepted at the LTEDI Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03833 2026-07-07 cs.CL cs.AI 新提交 82%

Beyond Static Rules: Automated Discovery of Latent Vulnerabilities in Text-to-SQL

超越静态规则:文本到SQL中潜在漏洞的自动发现

Hanqing Wang, Yongdong Chi, Jian Yang, Lei Yang, Jiehui Zhao, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北京航空航天大学) Deepexi Technology Co. Ltd.(深圳市智元机器有限公司) Southern University of Science and Technology(南方科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究LLMs在文本到SQL任务中潜在可靠性问题,提出SAGE框架,通过生成漏洞假设、参考漏洞法典设计扰动来发现潜在故障模式,实验证明其能发现大量故障案例及法典的跨模型转移性。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01927 2026-07-03 cs.CL cs.AI 新提交 82%

TUDUM: A Turkish-Thinking Reasoning Pipeline for Qwen3.5-27B

TUDUM:面向Qwen3.5-27B的土耳其语思维推理流水线

Baran Bingol, Bahaeddin Turkoglu

机构 * Department of Artificial Intelligence and Data Engineering(人工智能与数据工程系) Faculty of Engineering(工程学院) Ankara University(安卡拉大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出TUDUM流水线,通过SFT和GRPO强化学习将Qwen3.5-27B适配为土耳其语思维模型,使推理过程本身使用土耳其语,而非仅输出本地化答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31813 2026-07-01 cs.LG cs.AI 新提交 82%

Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR

保持几何的正交初始化用于RLVR中的低秩适应

Ruijia Zhang, Jiacheng Zhu, Hanqing Zhu, Laixi Shi

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta Superintelligence Labs(Meta超级智能实验室) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对RLVR中LoRA初始化问题,提出保持几何的正交初始化方法(RLPO和RLMO),理论证明其最小化与全微调差距,实验表明稳定训练且优于标准LoRA。

Comments 30 pages, accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28182 2026-06-29 cs.LG cs.AI cs.CV cs.RO 新提交 82%

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior

LLawCo: 学习合作法则以建模具身多智能体行为

Qinhong Zhou, Chuang Gan, Anoop Cherian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LLawCo框架,通过反思失败提取行为模式并推导高层合作法则,结合监督微调融入推理,提升具身多智能体在分散部分可观测环境中的合作效率与任务成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20911 2026-06-23 cs.CL cs.AI 新提交 82%

Latent Personal Memory: Represent personal memory as dynamic soft prompts

潜在个人记忆:将个人记忆表示为动态软提示

Debrup Das, Avinash Amballa, Yashas Malur Saidutta, Vijay Srinivasan, Vivek Kulkarni, Srinivas Chappidi

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Samsung Research America(三星美国研究院)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出潜在个人记忆(LPM)框架,通过可解释的潜在槽矩阵和交叉注意力网络生成动态软提示,在冻结大语言模型上高效编码用户历史,在PersonaMem v1和LoCoMO基准上优于LoRA和提示调优,并大幅降低KV缓存使用。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18307 2026-06-18 cs.LG cs.AI 新提交 82%

DRIFT: Refining Instruction Data via On-Policy Data Attribution

DRIFT: 通过在线策略数据归因优化指令数据

Zefan Wang, Lincheng Li, Tianyu Yu, Yuan Yao

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DRIFT方法,利用在线策略影响函数解决标准影响函数在指令微调数据归因中的近邻偏差和梯度范数偏差问题,通过模型自身生成作为验证目标,提升7B模型性能上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15080 2026-06-16 cs.CL cs.AI 新提交 82%

AdaMame: A Training Recipe for Adaptive Multilingual Reasoning

AdaMame: 一种自适应多语言推理的训练方案

Dayeon Ki, Kevin Duh, Marine Carpuat

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对多语言推理中的语言崩溃问题,提出两阶段训练方案AdaMame,通过SFT建立多语言能力,再以自适应GRPO优化推理语言对齐,在准确率、语言保真度和令牌效率上达到帕累托最优。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏