arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-25 至 2026-06-25 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 18 篇

2606.25436 2026-06-25 eess.AS cs.CL cs.SD 交叉投稿 94%

Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models

评估日语方言在基于语音和文本的大型语言模型中的鲁棒性

Tomoya Mizumoto, Yusuke Fujita, Hao Shi, Lianbo Liu, Atsushi Kojima, Yui Sudo

机构 * SB Intuitions

专题命中 指令微调 :LLM(summary_cn,abstract);SLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 研究通过日语方言测试,发现语音语言模型(SLM)的方言鲁棒性与文本基座LLM相关,方言数据训练和语音编码器微调可提升鲁棒性。

Comments Accepted to ASRU2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26027 2026-06-25 cs.CL cs.LG 新提交 91%

Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It

为什么多步工具使用强化学习会崩溃以及监督信号如何修复它

Yupu Hao, Zhuoran Jin, Huanxuan Liao, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究发现RL训练LLM工具使用时会出现控制token概率尖峰导致性能崩溃,而交错SFT与RL可提升稳定性,但OOD评估下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05933 2026-06-25 cs.CL cs.AI 版本更新 90%

Reinforcement Learning Improves Traversal of Parametric Knowledge in LLMs

强化学习改善LLM中参数化知识的遍历

Renfei Zhang, Manasa Kaniselvan, Rylan Schaeffer abd Niloofar Mireshghallah

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院) Stanford University(斯坦福大学)

专题命中 指令微调 :LLM(title_cn,summary_cn);language model(abstract);post-training(abstract);prompting(abstract)

AI总结 本文发现强化学习提升LLM知识回忆能力,原因在于改进了模型对参数化知识层次结构的遍历技能,而非获取新知识。

Comments `

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25987 2026-06-25 cs.CL cs.AI cs.LG 新提交 86%

Weave of Formal Thought

形式思维之织

Alexandre Bouayad

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出WoFT框架,结合完整语法约束解码与潜在变量微调,使语言模型生成语法有效代码并学习结构表示,在Python上降低14.3%交叉熵。

Comments Code is available at https://github.com/alexbouayad/formal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25865 2026-06-25 q-bio.BM 新提交 85%

Molexar: A Unified Multimodal Molecular Foundation Model for Drug Design

Molexar:用于药物设计的统一多模态分子基础模型

Haoyu Lin, Yiyan Liao, Jinmei Pan, Xinliao Ling, Luhua Lai, Jianfeng Pei

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract,abstract_cn)

AI总结 提出Molexar,一种基于Fragment-SELFIES的统一多模态分子基础模型,通过自回归解码和条件注入实现高效分子生成,在多个任务上达到或超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24196 2026-06-25 cs.AI 新提交 84%

Navigating User Behavior toward Personalized Multimodal Generation

导航用户行为以实现个性化多模态生成

Hengji Zhou, Yufeng Liu, Ye Liu, Yong Xu, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 指令微调 :SFT(summary_cn,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出NaviGen,通过双标识符编码用户行为并采用两阶段SFT+RL训练,将交互历史转化为可执行指令,提升个性化图像和视频生成质量。

Comments 16 pages, 15 figures, 5 tables. Code is available at https://github.com/iLearn-Lab/NaviGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25331 2026-06-25 cs.CL cs.AI cs.LG 新提交 83%

Improved Large Language Diffusion Models

改进的大规模语言扩散模型

Shen Nie, Qiyang Min, Shaoxuan Xu, Zihao Huang, Yuxuan Song, Yong Shan, Yankai Lin, Wayne Xin Zhao, Chongxuan Li, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京市大模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部新一代智能搜索与推荐工程研究中心) ByteDance Seed(字节跳动Seed)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出iLLaDA,一种8B参数的全双向注意力掩码扩散语言模型,从零训练至12T tokens,在通用、数学和代码基准上显著优于LLaDA,并可与Qwen2.5 7B竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24993 2026-06-25 cs.LG 新提交 81%

The Geometry of Sequential Learning: Lie-Bracket Prediction of Transfer Order

序列学习的几何:李括号预测迁移顺序

John Sweeney

机构 * Sideplane AI

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 提出李括号对偶性分数预测序列学习中的源域顺序,通过李括号锦标赛实现O(N log N)排序,在指令微调和DPO中达到高准确率。

Comments Accepted to ICML 2026. 20 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24985 2026-06-25 cs.LG cs.AI 新提交 81%

Retrieval-Augmented Personalization with Foundation Models for Wearable Stress Detection

基于检索增强个性化与基础模型的可穿戴压力检测

Louis Simon, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique(智能系统与机器人研究所) Sorbonne University(索邦大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对可穿戴压力检测中个体差异大的问题,提出基于检索增强的轻量级个性化方法,利用冻结的基础模型从用户历史中检索相似模式生成紧凑嵌入,在WESAD数据集上准确率提升3.92%,宏F1提升4.76%,接近监督微调性能且无需标签数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17423 2026-06-25 cs.CV cs.CL 版本更新 79%

Privacy-Aware Visual Language Models

隐私感知的视觉语言模型

Laurens Samson, Nimrod Barazani, Sennay Ghebreab, Yuki M. Asano

机构 * Socially-Intelligent Artificial Systems Group, University of Amsterdam(智能社会人工智能系统组,阿姆斯特丹大学) University of Amsterdam(阿姆斯特丹大学) Fundamental AI Lab, University of Technology Nuremberg(基础人工智能实验室,纽伦堡技术大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 针对视觉语言模型隐私理解不足的问题,构建高质量基准数据集PrivBench和指令微调数据集PrivTune,通过少量样本微调显著提升隐私敏感性,性能超越GPT-4。

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25821 2026-06-25 cs.CL cs.AI 新提交 73%

SARA: Unlocking Multilingual Knowledge in Mixture-of-Experts via Semantically Anchored Routing Alignment

SARA: 通过语义锚定路由对齐解锁混合专家模型中的多语言知识

Tianyu Dong, Yangyang Liu, Jiang Zhou, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Shaolin Zhu, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室) Alibaba Group, China(阿里巴巴集团)

专题命中 指令微调 :LLM(abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 针对低资源语言在稀疏MoE架构中路由不一致的问题,提出SARA框架,利用对称JS散度约束对齐多语言输入与高资源语义锚点的路由分布,提升低资源语言性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25700 2026-06-25 cs.LG cs.RO 新提交 70%

Memory-Efficient Policy Libraries with Low-Rank Adaptation in Reinforcement Learning

基于低秩适配的强化学习内存高效策略库

Samuel Valland Lyngset, Tor Viljen Raanaas, Gard Sveipe, Eirik Møller Nilsen, Jim Torresen, Kai Olav Ellefsen, Tobias Lømo

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究将参数高效微调方法(如LoRA)迁移至机器人强化学习,通过PPO算法微调基线模型构建多任务策略库,实现内存占用降低20-160倍,存储节省90-95%,且成功率无显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24963 2026-06-25 cs.CV cs.LG 新提交 70%

Curvature-Guided Mixing for MLLM Adaptation

曲率引导混合用于MLLM适配

Jinglong Yang, Jiaxuan He, Wenjian Huang, Zhan Zhuang, Jianguo Zhang

机构 * Research Institute of Trustworthy Autonomous Systems and Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学可信自主系统研究院与计算机科学与工程系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出曲率引导混合(CGM)框架,通过二阶Hessian近似推导最优软混合比,以及硬混合变体CGM†,在LLaVA-1.5和Qwen2.5VL上改善任务专化与通用知识保持的权衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24947 2026-06-25 cs.LG cs.SY eess.SY 新提交 70%

Supervised Reinforcement Learning for the Coordination of Distributed Energy Resources

分布式能源协调的监督强化学习

Haoyuan Deng, Yihong Zhou, Thomas Morstyn, Yi Wang

机构 * National Natural Science Foundation of China(国家自然科学基金) Research Grants Council of the Hong Kong SAR(香港研究资助局) Advanced Research + Invention Agency (ARIA)(高级研究与发明机构) Engineering and Physical Sciences Research Council (EPSRC)(工程与物理科学研究理事会)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出监督强化学习框架,先通过监督学习预训练策略,再经离线与在线微调,实现分布式能源高效协调,显著提升成本效益。

Comments Presented at PSCC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22193 2026-06-25 cs.CL 版本更新 70%

Scale or Reason? A Compute-Equivalent Analysis of Reasoning Distillation

规模还是推理?推理蒸馏的计算等价分析

Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Kevin El Haddad, Céline Hudelot, Pierre Colombo

机构 * Diabolocom Artefact Research Center Equall ISIA Lab, University of Mons(ISIA实验室,蒙斯大学) MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎萨克雷大学)

专题命中 指令微调 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 通过控制实验,在相同计算预算下比较推理蒸馏与标准指令微调,发现指令微调在多数配置下处于帕累托前沿,而推理蒸馏仅在7B以上开放任务中有效,混合25-50%推理数据可低成本获得大部分收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25475 2026-06-25 math.DS 新提交 67%

A Krieger Embedding Theorem for Near Markov Sofic Shifts

近马尔可夫索菲克平移的克里格嵌入定理

Brian Marcus, Tom Meyerovitch, Chengyu Wu

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文推广了Krieger嵌入定理,给出了将子平移嵌入到混合(不可约)近马尔可夫索菲克平移的充要条件,并证明了当被嵌入子平移为不可约索菲克时,条件可有限判定。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25195 2026-06-25 cs.CR cs.AI 新提交 57%

SoK: AI Secure Code Generation: Progress, Pitfalls, and Paths Forward

SoK:AI安全代码生成:进展、陷阱与前进之路

Rupam Patir, Keyan Guo, Haipeng Cai, Hongxin Hu

专题命中 指令微调 :prompting(abstract);分类 cs.AI

AI总结 本文系统化分析AI安全代码生成的进展、陷阱与前进方向,提出三层次框架衡量模型对安全编码原则的理解、代码级执行及两者间的知识-执行差距,发现原则理解是代码安全性的强预测因子,但存在显著知识-执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02205 2026-06-25 cs.LG 版本更新 57%

From Uncertain to Safe: Conformal Adaptation of Diffusion Models for Safe PDE Control

从不确定到安全:扩散模型的安全自适应用于PDE控制

Peiyan Hu, Xiaowei Qian, Wenhao Deng, Rui Wang, Haodong Feng, Ruiqi Feng, Tao Zhang, Long Wei, Yue Wang, Zhi-Ming Ma, Tailin Wu

机构 * intern(实习生) Westlake University(西湖大学) School of Engineering, Westlake University(西湖大学工程学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Fudan University(复旦大学) Zhongguancun Academy(中关村学院)

专题命中 指令微调 :post-training(abstract);分类 cs.LG

AI总结 提出SafeDiffCon方法,通过共形预测估计不确定性分位数,结合后训练和推理阶段调整扩散模型,在满足安全约束下实现最优PDE控制。

Comments ICML 2025. 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏