arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-20 至 2026-03-20 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 14 篇

2603.18272 2026-03-20 cs.AI cs.CL 88%

Retrieval-Augmented LLM Agents: Learning to Learn from Experience

基于检索的LLM代理:学习从经验中学习

Thomas Palmeira Ferraz, Romain Deffayet, Vassilina Nikoulina, Hervé Déjean, Stéphane Clinchant

机构 * NAVER LABS Europe(NAVER实验室欧洲)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出结合微调与经验检索的方法,通过LoRA优化SFT流程,分析经验检索关键设计,提出整合经验检索的训练流程,提升代理对新任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19011 2026-03-20 cs.CR cs.AI 83%

Security awareness in LLM agents: the NDAI zone case

LLM代理中的安全意识:NDAI区域案例

Enrico Bottazzi, Pia Park

机构 * Leku

专题命中 指令微调 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨LLM代理在安全环境识别中的能力差异,发现失败的证明会抑制披露,而成功的证明导致不同模型反应不一,揭示LLM在检测危险信号方面可靠但无法验证安全,需进一步改进以支持隐私保护代理协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18656 2026-03-20 cs.AI 83%

Balanced Thinking: Improving Chain of Thought Training in Vision Language Models

平衡思考:改进视觉语言模型中的推理链训练

Shaked Perek, Ben Wiesel, Avihu Dekel, Nimrod Shabtay, Eli Schwartz

机构 * IBM Research(IBM研究院)

专题命中 指令微调 :language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出SCALe方法,通过动态权重平衡推理和答案段,提升视觉语言模型的推理效率和准确性,且训练时间仅为传统方法的七分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17558 2026-03-20 cs.CL cs.SD 83%

Zipper-LoRA: Dynamic Parameter Decoupling for Speech-LLM based Multilingual Speech Recognition

Zipper-LoRA: 语音-大语言模型基于多语言语音识别的动态参数解耦

Yuxiang Mei, Delai Qiu, Shengping Liu, Jiaen Liang, Yanhua Long

机构 * Shanghai Engineering Research Center of Intelligent Education and Bigdata, Shanghai Normal University(智能教育与大数据上海工程研究中心,上海师范大学) SHNU-Unisound Natural Human-Computer Interaction Lab, Shanghai Normal University(上海师范大学Unisound自然人机交互实验室) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Zipper-LoRA框架,通过动态解耦共享与语言特定子空间,解决多语言语音识别中参数高效微调的稳定性与可塑性矛盾,实验表明其在低资源场景下性能优越。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18507 2026-03-20 cs.AI 83%

Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM

专家人设提升LLM对齐但损害准确性:基于PRISM的意图驱动人设路由 Bootstrapping

Zizhao Hu, Mohammad Rostami, Jesse Thomason

机构 * University of Southern California(南加州大学)

专题命中 指令微调 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文研究了专家人设在不同任务类型和提示长度下的有效性,提出PRISM框架通过自蒸馏实现意图条件的人设路由,提升生成任务的人类偏好对齐,同时保持判别任务的准确性,且计算开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13590 2026-03-20 cs.CL cs.AI 82%

Vulnerability of LLMs' Stated Beliefs? LLMs Belief Resistance Check Through Strategic Persuasive Conversation Interventions

LLMs所声明信念的脆弱性?通过战略性说服对话干预检查LLMs信念抵抗性

Fan Huang, Haewoon Kwak, Jisun An

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过战略性说服对话干预评估LLMs在不同领域中的信念稳定性,发现小模型易受说服影响,而自信提示反而加剧了脆弱性,揭示了模型依赖性的鲁棒性限制。

Comments Updated new models and minor revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19098 2026-03-20 cs.CV 82%

TAU-R1: Visual Language Model for Traffic Anomaly Understanding

TAU-R1:用于交通异常理解的视觉语言模型

Yuqiang Lin, Kehua Chen, Sam Lockyer, Arjun Yadav, Mingxuan Sui, Shucheng Zhang, Yan Shi, Bingzhang Wang, Yuang Zhang, Markus Zarbock, Florain Stanek, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang

机构 * University of Bath(巴斯大学) University of Washington(华盛顿大学) City of Carmel, Indiana(印第安纳州卡迈尔市) Starwit GmbH

专题命中 指令微调 :language model(title,abstract);post-training(abstract)

AI总结 本文提出TAU-R1模型,通过两层框架提升交通异常识别与推理能力,结合定制化训练策略与数据集,实现高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18325 2026-03-20 cs.LG stat.ML 77%

Learning to Reason with Curriculum I: Provable Benefits of Autocurriculum

学习与课程学习:自课程学习的可证明收益

Nived Rajaraman, Audrey Huang, Miro Dudik, Robert Schapire, Dylan J. Foster, Akshay Krishnamurthy

机构 * Microsoft Research(微软研究院)

专题命中 指令微调 :language model(abstract);post-training(abstract);SFT(abstract);分类 cs.LG

AI总结 本文研究了自课程学习在提升语言模型推理能力方面的有效性,通过自适应数据选择技术,在监督微调和强化学习中分别减少了训练数据和计算成本。

Comments 39 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18991 2026-03-20 cs.CV cs.LG 70%

CRAFT: Aligning Diffusion Models with Fine-Tuning Is Easier Than You Think

CRAFT:将扩散模型对齐与微调比你想象的更容易

Zening Sun, Zhengpeng Xie, Lichen Bai, Shitong Shao, Shuo Yang, Zeke Xie

机构 * HKUST (GZ)(香港科技大学(广州)) HIT (SZ)(哈尔滨工业大学(深圳))

专题命中 指令微调 :SFT(abstract);preference optimization(abstract);分类 cs.LG

AI总结 本文提出CRAFT方法,通过复合奖励过滤技术构建高质量训练数据集,结合改进的SFT实现高效微调,证明其优化了群体强化学习下界,实验表明其在少量样本下优于传统方法。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11239 2026-03-20 cs.AI 70%

Reversible Lifelong Model Editing via Semantic Routing-Based LoRA

基于语义路由的LoRA的可逆终身模型编辑

Haihua Luo, Xuming Ran, Tommi Kärkkäinen, Zhonghua Chen, Jiangrong Shen, Qi Xu, Fengyu Cong

机构 * Faculty of Information Technology, University of Jyväskylä, Jyväskylä, Finland(于韦斯屈埃lys大学信息科技学院) National University of Singapore, Singapore(新加坡国立大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SoLA框架,通过语义路由实现可逆的终身模型编辑,解决持续更新导致的语义漂移和知识遗忘问题,支持精确撤销特定编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18641 2026-03-20 cs.CL 57%

A Comparative Empirical Study of Catastrophic Forgetting Mitigation in Sequential Task Adaptation for Continual Natural Language Processing Systems

连续自然语言处理系统中序列任务适应中灾难性遗忘缓解的比较实证研究

Aram Abrahamyan, Sachin Kumar

机构 * Zaven P. and Sonia Akian College of Science and Engineering(泽文·皮和索尼亚·阿基安科学与工程学院) American University of Armenia(亚美尼亚美国大学) Yerevan(亚美尼亚共和国首都耶莱范) Armenia(亚美尼亚)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 本文通过CLINC150数据集,比较了三种连续学习策略在连续意图分类中的表现,发现MIR是最可靠的策略,组合策略在不同架构上表现各异,揭示了连续学习机制与架构联合选择的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18544 2026-03-20 eess.IV cs.AI cs.CV 57%

SCISSR: Scribble-Conditioned Interactive Surgical Segmentation and Refinement

SCISSR:基于涂鸦的交互式手术分割与细化

Haonan Ping, Jian Jiang, Cheng Yuan, Qizhen Sun, Lv Wu, Yutong Ban

机构 * Global College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学全球学院,上海,中国)

专题命中 指令微调 :prompting(abstract);分类 cs.AI

AI总结 SCISSR通过轻量级涂鸦编码器将自由手绘涂鸦转换为密集提示嵌入,实现手术场景分割的交互式迭代细化,优于点提示方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13032 2026-03-20 cs.CV 50%

Multimodal OCR: Parse Anything from Documents

多模态OCR:从文档中解析一切

Handong Zheng, Yumeng Li, Kaile Zhang, Liang Xin, Guangwei Zhao, Hao Liu, Jiayu Chen, Jie Lou, Qi Fu, Rui Yang, Shuo Jiang, Weijian Luo, Weijie Su, Weijun Zhang, Xingyu Zhu, Yabin Li, Yiwei ma, Yu Chen, Yuqiu Ji, Zhaohui Yu, Guang Yang, Colin Zhang, Lei Zhang, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) hi lab, Xiaohongshu Inc(小红书实验室,小红书公司)

专题命中 指令微调 :pretraining(abstract)

AI总结 本文提出多模态OCR(MOCR),通过联合解析文本和图形,生成统一的文本表示。方法将图表、表格等视觉元素作为解析目标,提升文档重建的准确性,并通过端到端训练实现跨模态监督,最终在文档和结构化图形解析任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09658 2026-03-20 cs.CV 50%

Image2Garment: Simulation-ready Garment Generation from a Single Image

Image2Garment: 从单张图像生成可模拟的服装

Selim Emir Can, Jan Ackermann, Kiyohiro Nakayama, Ruofan Liu, Tong Wu, Yang Zheng, Hugo Bertiche, Menglei Chai, Thabo Beeler, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Google(谷歌) Institute of Science Tokyo(东京科学研究所)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出一种框架,通过微调视觉语言模型获取材料属性,再训练轻量预测模型生成物理参数,实现从单张图像生成可模拟的服装。

Comments Project Page: https://image2garment.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏