arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-21 至 2026-07-21 共收录 493 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 45 篇

2607.16872 2026-07-21 cs.CL cs.AI cs.LG 新提交 88%

Trace-Based On-Policy Distillation for Masked Diffusion Language Models

基于轨迹的策略蒸馏用于掩码扩散语言模型

Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);post-training(abstract);SFT(abstract)

AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16461 2026-07-21 cs.CV 版本更新 88%

GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models

GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知

Jiaxin Zhang, Junjun Jiang, Haijie Li, Youyu Chen, Kui Jiang, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Huawei(华为)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。

Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10848 2026-07-21 cs.CL 版本更新 86%

Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning

Psyche-R1:通过统一的同理心、专业知识和推理实现可靠的心理语言模型

Chongyuan Dai, Jinpeng Hu, Hongchang Shi, Zhuo Li, Dan Guo, Xun Yang, Meng Wang

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究旨在将大语言模型应用于心理领域,提出Psyche-R1模型。通过设计数据合成管道生成大量心理问题及对话,采用混合训练策略,经实验验证该模型在多个心理基准测试中有效,7B的Psyche-R1能取得与671B的DeepSeek-R1相当的结果。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18026 2026-07-21 cs.AI 新提交 85%

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective

重新思考异构语言模型合并:加权模型平均视角

Jiahe Fan, Yinghao Hou, Si Chen, Aiyuan Zhang, Hong Xie, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究异构语言模型合并问题,通过无训练的维度适配和比率控制插值,在联合式与交叉式合并中进行实验,结果表明简单参数平均结合轻量级适配和比率控制是强大基线,揭示直接加权融合的限制及对复杂方法的制约。

Comments 17 pages, 3 figures, 20 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17575 2026-07-21 cs.AI 新提交 85%

A Dual-Hypothesis Reasoning Framework for LLM Guardrails

一种用于大语言模型护栏的双假设推理框架

Md Asiful Islam, Mihai Surdeanu

机构 * University of Arizona(亚利桑那大学)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出ARBITER大语言模型护栏框架,采用双假设推理和多组件监督微调方法,用成本效益高的策略生成推理痕迹及基于LoRA微调,性能超现有方法,还能为不安全决策提供解释,在安全审核基准实验中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17043 2026-07-21 cs.CL 新提交 85%

Learning from Synthetic Data without Model Collapse in Iterative Instruction Tuning

在迭代指令微调中从合成数据学习而不发生模型崩溃

Xiaonan Luo, Yue Huang, Kehan Guo, Ping He, Chuan Zou, Ting Hua, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) Vanderbilt University(范德堡大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究在合成数据用于指令微调时避免模型崩溃的问题,提出KITE两阶段框架,结合失败引导数据生成与边界感知不确定性整理,实验表明该框架比合成数据基线能更稳定地提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18039 2026-07-21 cs.IR 新提交 85%

Evidence-in-the-Loop: Trace-Driven Optimization for Customer-Service LLM Agents

循证优化:面向客户服务语言模型代理的跟踪驱动优化

Chunming Wu, Dafei Qiu, Congde Yuan, Charles Quan, Jun Wu, Suipeng Li, Mo Wu, Gavin Xie, Hope Chen, Max Yao

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究面向客户服务语言模型代理的优化,提出循证客户服务代理工作流程,通过多种技术构建证据,结合政策引导编排。贡献混合RAG证据构建、循证问题/行动决策、跟踪驱动的RAG和重排器改进三种部署模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16643 2026-07-21 cs.AI cs.CV 新提交 84%

Diversity-Oriented Fine-Tuning for Uncertainty-Based Hallucination Detection

基于不确定性的幻觉检测的面向多样性的微调

Qiuyuan Li, Hongliang Dai, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 指令微调 :SFT(summary_cn,abstract);preference optimization(abstract);分类 cs.AI

AI总结 研究基于不确定性的幻觉检测,提出面向多样性的微调策略,包括基于监督微调(SFT)和直接偏好优化(DPO)的方法,经实验验证可提高幻觉检测有效性,结果优于或可比现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07559 2026-07-21 cs.CL cs.AI quant-ph 版本更新 84%

Phantom Transitions in Language Model Fine-Tuning: A Density-Matrix Analysis

语言模型微调中的幻影相变

Vaibhav Prakash, Jayasri Dontabhaktuni

机构 * Mahindra University(马恒达大学)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究语言模型微调时,正确补全被近义词竞争而失败的现象,通过序参量分解信号与背景拖拽,发现两种失败模式,并揭示相变为幻影,源于softmax读出而非几何相变。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17806 2026-07-21 cs.AI 新提交 83%

PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model

PGN:基于盘古多模态基础模型的视觉语言导航系统的设计与实现

Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao

机构 * University of Electronic Science and Technology of China(电子科技大学) School of Information and Communication Engineering(信息与通信工程学院)

专题命中 指令微调 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于盘古多模态基础模型设计实现视觉语言导航系统PGN,训练分两阶段,先对齐视觉与语言编码器,再使模型适应专家轨迹,结合多种计算方式,在特定评估下取得一定指标,量化了离线专家动作对齐情况。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17532 2026-07-21 cs.SE cs.AI 新提交 81%

CommitLLM: A Fine-Tuned Pipeline for Git Commit Message Generation

CommitLLM:用于生成Git提交消息的微调管道

Md Rafid Haque, Poojan Narendrabhai Patel, Meetkumar Vijaybhai Raychura

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 针对开发人员编写的信息不足的Git提交消息问题,提出CommitLLM管道,通过微调小语言模型、约束解码和后处理,从代码差异生成合规消息,经评估效果良好,后处理对质量提升贡献更大。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13314 2026-07-21 cs.LG cs.AI econ.EM 版本更新 81%

Tabular Foundation Models for Discrete Choice Estimation

用于离散选择估计的表格基础模型

Liu Liu, Dan Zhang

机构 * Leeds School of Business, University of Colorado Boulder(科罗拉多大学博尔德分校利兹商学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究离散选择估计中表格基础模型的应用,提出编码选择集依赖性和个体异质性的重新表述方法,在酸奶扫描仪面板数据上评估,该方法在预测准确性和速度上优于分层贝叶斯估计,为基础模型应用于消费者选择问题提供原则性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18006 2026-07-21 cs.LG cs.AI cs.CL cs.MA 新提交 80%

MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

MADA-RL:用于紧凑模型中参数高效推理的多智能体辩论感知强化学习

Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对紧凑模型训练成本高问题,提出MADA-RL框架,将其分为生成器和评论家角色,用辩论感知信号训练,通过LoRA微调少量参数。核心是反事实评论家优势,提高了模型准确率,在数学推理基准测试中有显著效果。

Comments 20 pages, 3 figures, 9 tables, 2 algorithms, under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17599 2026-07-21 cs.CV 新提交 80%

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

ConsiSpace:学习几何一致性对视频空间推理很重要

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang

机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16635 2026-07-21 cs.CV cs.AI 新提交 79%

TellTale: Blending Multi-Instance LoRA Text Encoders and a Zero-Shot LLM Judge for Ambivalence/Hesitancy Recognition in Videos

TellTale:融合多实例LoRA文本编码器和零样本大语言模型判断器用于视频中的矛盾/犹豫识别

Abdel-Karim Al-Tamimi, Ali Rodan

机构 * Sheffield Hallam University(谢菲尔德哈勒姆大学) Yarmouk University(亚尔穆克大学) The University of Jordan(约旦大学)

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI

AI总结 TellTale旨在解决视频中矛盾/犹豫识别问题,它融合多实例LoRA文本编码器和零样本大语言模型判断器,结合三个概率流,在BAH数据集上取得优异成绩,相比官方基于视觉的基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16325 2026-07-21 cs.CV cs.LG 新提交 79%

RegionFM: Interpretable Region-Based Brain MRI Classification Using Foundation Model Embeddings

RegionFM:使用基础模型嵌入进行可解释的基于区域的脑MRI分类

Wei Zhang

机构 * L3S Research Center(L3S研究中心)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对脑MRI基础模型预测难解释问题,提出RegionFM框架,将解剖分割与基础模型嵌入结合,通过划分区域、编码嵌入及构建模型组合,用于认知障碍分类评估,在保持性能同时使解释与临床推理更好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18082 2026-07-21 cs.CL cs.HC 版本更新 79%

Octo-planner: On-device Language Model for Planner-Action Agents

Octo-planner:用于规划-行动智能体的设备端语言模型

Wei Chen, Zhiyuan Li, Zhen Guo, Yikang Shen

机构 * Nexa AI & Stanford(Nexa AI 与 斯坦福大学) MIT EECS(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(麻省理工-IBM Watson AI 实验室)

专题命中 指令微调 :language model(title);LLM(abstract);分类 cs.CL

AI总结 研究如何让人工智能智能体有效规划行动,提出设备端规划-行动框架,分离规划与行动执行组件,用模型微调优化性能,多LoRA训练方法应对多域规划挑战,在域内测试成功率达97%,并开源模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00454 2026-07-21 cs.LG cs.AI 版本更新 79%

Rooted Absorbed Prefix Trajectory Balance with Submodular Replay for GFlowNet Training

基于子模重放的根吸收前缀轨迹平衡用于GFlowNet训练

Xi Wang, Wenbo Lu, Shengjie Wang

机构 * Courant Institute School of Mathematics, Computing, and Data Science, New York University(纽约大学Courant研究所数学、计算与数据科学学院) Courant Institute School of Mathematics, Computing(纽约大学Courant研究所数学、计算与数据科学学院) Data Science, New York University(纽约大学数据科学学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对GFlowNet的模式坍塌问题,提出RapTB目标函数(通过根锚定子轨迹监督和吸收后缀备份提供密集前缀学习信号)和SubM子模重放策略(促进高奖励和多样性),在分子生成等任务中提升优化性能和多样性。

Journal ref Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17052 2026-07-21 cs.CV 新提交 78%

Searching for Task-Specific Vision Paths: Evolutionary Block Pruning Across Vision-Language Models

寻找特定任务的视觉路径:跨视觉语言模型的进化块剪枝

Tarun Tomar

机构 * IIIT(国际信息技术研究所)

专题命中 指令微调 :language model(title,abstract)

AI总结 研究视觉语言模型中能否跳过固定预算视觉块组合,引入源平衡进化搜索并与其他方法比较,实验表明组合搜索可改进路由构建,但能力标签不能定义普遍可转移视觉路径,搜索能跨架构转移,能力专业化稳定性欠佳。

Comments 14 pages, 8 figures. Code and aggregate evidence: https://github.com/TarunTomar122/vision-pathways

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16244 2026-07-21 cs.LG cs.AI cs.CL 新提交 78%

CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents

CIGPO:用于多轮证据阅读语言模型代理的上下文信息增益策略优化

Hao Dou

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 指令微调 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多轮证据阅读语言模型代理训练不稳定问题,提出CIGPO方法,通过方差注入策略,利用冻结参考模型对数似然边际增加作逐轮信号,避免奖励方差崩溃,在HotpotQA实验中取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16808 2026-07-21 cs.CL 新提交 74%

Schema-Constrained Document-Level Event Argument Extraction with Lightweight LLM Fine-Tuning

基于轻量级语言模型微调的模式约束文档级事件论元抽取

Roberto Pietrantuono, Antonio Guerriero, Pouya Sattari

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) University of Salerno(萨勒诺大学)

专题命中 指令微调 :LLM(title);分类 cs.CL

AI总结 研究文档级模式约束事件论元抽取,结合角色集注入、参数高效监督微调及确定性解码后处理方法,使微调后的中型开放模型在MAVEN-ARG评估中优于GPT基线,最好模型在事件共指级别达42.39% F1值。

Comments Accepted at ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16252 2026-07-21 cs.LG cs.AI 新提交 73%

SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling

SOS-LoRA:具有固定多尺度缩放的静态正交子空间低秩自适应

Yupeng Chang, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动的人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型中LoRA方法的不足,提出SOS-LoRA,将秩更新重参数化为多个静态低秩专家之和,通过分解总秩、固定多尺度缩放及正交初始化等,实现性能提升且可完全合并,实验证明其优于基线和变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17620 2026-07-21 cs.LG cs.CL math.OC 新提交 73%

PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer

PoLoRA:一种预处理正交化的LoRA优化器

Nikhil Ghosh, Tetiana Parshakova, Robert M. Gower

机构 * Center for Computational Mathematics, Flatiron Institute(计算数学中心,熨斗研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对LoRA优化问题,提出PoLoRA优化器,由乘积感知谱更新方向、曲率预处理及幅度规则构成。在多模型指令调优数据集上评估,结果显示它步数减少,开销增加少,对学习率不敏感,最优学习率稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16412 2026-07-21 cs.AI 新提交 70%

Interactive Task Alignment as a POMDP

作为部分可观测马尔可夫决策过程的交互式任务对齐

Andy Dai, Zexue He, Zhenyu Zhang, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 研究语言模型在面对模糊用户任务时的任务对齐问题,引入基于部分可观测马尔可夫决策过程的框架,通过用户研究验证,发现模型任务对齐困难,训练能改善但仍落后于人类,揭示其缺乏关键交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17079 2026-07-21 eess.AS 新提交 67%

SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations

SALMONN-2:利用自监督表示提升通用听力能力

Xiaoyu Yang, Xuenan Xu, Wenyi Yu, Siyin Wang, Changli Tang, Terumi Chiba, Siyuan Hou, Ziyang Zhang, Wen Wu, Baoxiang Li, Guangzhi Sun, Chao Zhang, Philip Woodland

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究探索自监督学习音频表示能否为音频大语言模型提供基础,提出基于统一SSL编码器的SALMONN-2,用多层特征融合适配器,还探索多模态上下文学习。实验表明通用SSL编码器性能良好,SALMONN-2达先进水平,且特定训练可获多模态上下文学习能力。

Comments Disclaimer: This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16939 2026-07-21 astro-ph.SR 新提交 67%

Constraining the radial decay timescale of solar surface magnetic field through a comparative study of data-assimilative 2D surface flux transport and 3D dynamo models

通过二维数据同化表面通量传输和三维发电机模型的对比研究约束太阳表面磁场的径向衰减时间尺度

Soumyadeep Chatterjee, Gopal Hazra

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 该研究通过对比二维表面通量传输模型和三维发电机模型,对太阳表面磁场径向衰减时间尺度进行自洽估计,经数据同化模拟及参数选择,得出使两模型表面动力学一致的$\tau$值,并发现其对不同角模式的影响。

Comments 13 pages, 6 figures. Submitted to ApJ. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08015 2026-07-21 cs.RO 版本更新 67%

Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA

Q-VGM: 基于Q引导的值梯度匹配的流匹配VLA策略

Ziqian Wang, Yitian Liu, Xingjian Mao, Minqian Wang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 提出Q-VGM离线强化学习方法,通过将值梯度转化为去噪时间上的值梯度场,避免反向传播去噪链,高效微调流匹配VLA策略,在LIBERO等任务上显著提升成功率。

Comments 13 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17524 2026-07-21 cs.CL cs.LG 新提交 62%

Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift

分布转移下忠实生成的令牌级离策略学习

Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu, Robin Jia

机构 * University of Southern California(南加州大学)

专题命中 指令微调 :post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究分布转移下忠实生成问题,提出令牌级离策略标注(TOPL)方法,通过训练模型区分响应中好坏令牌引导生成,在文档摘要等任务实验中实现强大分布外泛化,能有效转移到机器翻译,且学习信号关键,更新具可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07691 2026-07-21 cs.CL cs.LG 版本更新 62%

Breaking the Block: Preserving Data Continuity to Train Superior SAEs for Instruct Models

打破模块限制:保留数据连续性以训练用于指令模型的卓越稀疏自编码器

Jiaming Li, Haoran Ye, Yukun Chen, Xinyue Li, Lei Zhang, Hamid Alinejad-Rokny, Jimmy Chih-Hsien Peng, Min Yang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, China(中国科学院深圳先进技术研究所) University of Chinese Academy of Sciences, China(中国科学院大学) National University of Singapore, Singapore(新加坡国立大学) The University of New South Wales, Australia(新南威尔士大学) Shenzhen University of Advanced Technology, China(深圳先进技术大学)

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究针对现有SAEs训练方法在指令模型中因注意力泄漏引入梯度噪声问题,提出FAST顺序训练范式,通过与数据分布和激活模式对齐,提升重建保真度和特征可解释性,实验显示该方法效果显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17952 2026-07-21 cs.CL cs.CE 新提交 57%

What Transfers Under Source Shift? Definitions, Examples, and Fine-Tuning for Climate Disclosure Classification

源转移下什么能迁移?气候披露分类的定义、示例和微调

Guosheng Li, Fenghui Ren, Bin Liu, Chuan Yu, Kaiying Ji, Lin Yue, Jun Shen, Sasa Qian

机构 * School of Computing and Information Technology, University of Wollongong(卧龙岗大学计算与信息技术学院) School of Business, University of Wollongong(卧龙岗大学商学院) Business School, University of Sydney(悉尼大学商学院) Business School, Macquarie University(麦考瑞大学商学院)

专题命中 指令微调 :LLM(abstract);分类 cs.CL

AI总结 研究将气候披露分类视为跨源适应问题,在11个大语言模型上研究定义、示例和微调三种策略,发现最强源内策略非最强跨源策略,随机示例跨源优势更可靠,定义转移最一致,源变化时简单策略更安全。

Comments 15 pages, 12 figures. Code: https://github.com/Leoccino/TCFD-SourceShift

详情

展开后加载摘要…

URL PDF HTML 收藏