arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-23 至 2026-03-23 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 9 篇

2603.20100 2026-03-23 cs.CL cs.AI 92%

An Empirical Study of SFT-DPO Interaction and Parameterization in Small Language Models

小语言模型中SFT-DPO交互与参数化的实证研究

Yuming Feng, Christy Yang

机构 * Department of Computer Science(计算机科学系) Stanford University(斯坦福大学)

专题命中 指令微调 :language model(title,abstract);SFT(title,abstract);small language model(title);preference optimization(abstract)

AI总结 本文通过对比SFT、DPO及分阶段训练方法,发现全参数微调在小模型中表现更优,而偏好优化和低秩适应带来的边际收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19255 2026-03-23 cs.CL cs.AI 88%

LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models

LARFT:为大语言模型的长度指令跟随缩小认知-行动差距

Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 LARFT通过结合强化学习与 hindsight 长度意识,提升大语言模型对输出长度的控制能力,在多个基准测试中取得显著提升。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19649 2026-03-23 cs.SI cs.AI 85%

PolicySim: An LLM-Based Agent Social Simulation Sandbox for Proactive Policy Optimization

PolicySim:一种基于LLM的代理社会模拟沙盒,用于主动政策优化

Renhong Huang, Ning Tang, Jiarong Xu, Yuxuan Cao, Qingqian Tu, Sheng Guo, Bo Zheng, Huiyuan Liu, Yang Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) University of Nottingham(诺丁汉大学) PowerChina Huadong Engineering Corporation Limited(国家电网华东工程公司)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出PolicySim,通过用户代理模块和自适应干预模块,模拟用户行为与平台干预的双向动态,实现对干预政策的主动评估与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15164 2026-03-23 cs.CV 85%

Multimodal Continual Instruction Tuning with Dynamic Gradient Guidance

多模态持续指令微调与动态梯度指导

Songze Li, Mingyu Gao, Tonghua Su, Xu-Yao Zhang, Zhongjie Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济发展实验室) Chongqing Research Institute of HIT(重庆哈工大研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出通过几何参数空间方向向量近似缺失梯度,结合有限回放缓冲区和伯努利采样策略,有效缓解多模态持续指令微调中的灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19265 2026-03-23 cs.CL cs.AI cs.HC 84%

When the Pure Reasoner Meets the Impossible Object: Analytic vs. Synthetic Fine-Tuning and the Suppression of Genesis in Language Models

当纯粹推理者遇见不可能之物:分析性与合成性微调及语言模型中生成的抑制

Amin Amouhadi

机构 * Institute for Artificial Intelligence, University of Georgia(人工智能研究所,佐治亚大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在'不可能之物'上微调大语言模型的本体论后果,通过分析与合成微调对比,揭示了逻辑矛盾对语言模型生成能力的抑制作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19931 2026-03-23 cs.CL 70%

SAGE: Sustainable Agent-Guided Expert-tuning for Culturally Attuned Translation in Low-Resource Southeast Asia

SAGE:面向文化适应翻译的可持续代理引导专家调优

Zhixiang Lu, Chong Zhang, Yulong Li, Angelos Stefanidis, Anh Nguyen, Imran Razzak, Jionglong Su, Zhengyong Jiang

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SAGE通过能量感知方法优化低资源东南亚地区翻译任务,利用强化学习代理筛选高质量数据,显著降低能耗和数据使用量,提升模型性能与环保性。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07451 2026-03-23 cs.CL 70%

DLLM Agent: See Farther, Run Faster

DLLM Agent: 看得更远,跑得更快

Huiling Zhen, Weizhe Lin, Renxi Liu, Kai Han, Yiming Li, Yuchuan Tian, Hanting Chen, Xiaoguang Li, Xiaosong Li, Chen Chen, Xianzhi Yu, Mingxuan Yuan, Youliang Yan, Peifeng Qin, Jun Wang, Yu Wang, Dacheng Tao, Yunhe Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) UCL(伦敦大学学院) Tsinghua University(清华大学) NTU(国立新加坡大学) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了扩散大语言模型(DLLM)在代理多步决策中的表现,发现其在准确率相当的情况下,整体效率比自回归模型(AR)高30%以上,并提出部署扩散骨架的两个实用考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18282 2026-03-23 cs.CV 67%

CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning

CycleCap: 通过自监督循环一致性微调提升VLMs的描述性能

Marios Krestenitis, Christos Tzelepis, Konstantinos Ioannidis, Stefanos Vrochidis, Ioannis Kompatsiaris, Georgios Tzimiropoulos, Shaogang Gong, Ioannis Patras

机构 * Queen Mary, University of London(伦敦大学玛丽女王学院) Centre for Research and Technology Hellas(希腊研究中心) City St George’s, University of London(伦敦大学圣乔治学院)

专题命中 指令微调 :language model(abstract);instruction tuning(abstract)

AI总结 本文提出CycleCap,通过自监督循环一致性训练提升VLMs的图像描述性能,利用GRPO优化策略,基于重建图像与原始图像相似性作为奖励信号,无需标注数据即可提高描述准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08934 2026-03-23 cs.LG cs.AI cs.CR 62%

StealthRL: Reinforcement Learning Paraphrase Attacks for Multi-Detector Evasion of AI-Text Detectors

StealthRL:面向多检测器规避的强化学习对抗攻击

Suraj Ranganath, Atharv Ramesh

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 指令微调 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 StealthRL通过强化学习框架在真实对抗条件下测试AI文本检测器的鲁棒性,通过GRPO和LoRA适配器训练句法替换策略,平衡检测规避与语义保持,成功在多个检测器上实现高逃逸率。

Comments Expanded version of a workshop submission. Code available

详情

展开后加载摘要…

URL PDF HTML 收藏