arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-29 至 2026-07-29 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 26 篇

2607.25063 2026-07-29 cs.AI 新提交 94%

Similar Models Learn Differently: Final-Window Pretraining Shapes Post-Training Beyond SFT

相似模型学习方式不同:最终窗口预训练对训练后行为的塑造超越监督微调

Cen Lu, Yung-Chen Tang, Andrea Cavallaro

专题命中 指令微调 :SFT(title,summary_cn);pretraining(title,abstract);post-training(title,abstract);instruction tuning(abstract)

AI总结 研究探讨模型预训练最后窗口对训练后行为的影响,通过控制实验发现不同预训练最后窗口数据的分支,SFT后表现相近,但后续训练走向不同,安全文本分支有保护效果,表明不能仅依SFT后行为评估模型,还应考虑预训练最后内容。

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25956 2026-07-29 cs.AI math.OC 新提交 93%

Large Language Model for Operations Research Formulation Selection in Multi-Warehouse Inventory Allocation

用于多仓库库存分配中运筹学公式选择的大语言模型

Jintao Xu, Yingzheng Ma, Jiong Dong, Yongzhi Qi, Jianshen Zhang

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究多仓库库存分配中运筹学公式选择问题,提出求解器引导的大语言模型框架,通过构建SFT记录、转换质量差距为偏好等进行训练,实验表明GRPO能显著提高选择准确性和分配质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24824 2026-07-29 cs.IR 新提交 90%

Retrieval-based and Fine-tuned LLM Approaches for Industrial Asset Health Monitoring and Decision Support

基于检索和微调的大语言模型方法用于工业资产健康监测和决策支持

Seshu Kumar Damarla, Xiuli Zhu

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究基于检索和微调的大语言模型方法在工业资产健康监测中的故障传感器诊断推理表现,通过FailureSensorIQ基准测试,发现语义搜索和混合搜索效果好,基于LLM的微调模型性能最佳,且各方法对一些干扰因素敏感。

Comments 6 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25091 2026-07-29 cs.AI cs.CL cs.LG math.OC stat.CO 新提交 90%

Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

迈向用于小规模语言模型智能体的稳健强化学习

Md Rezwanul Haque, Md. Milon Islam, Fakhri Karray

机构 * University of Waterloo(滑铁卢大学) Khulna University of Engineering & Technology(库尔纳工程技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 指令微调 :language model(title,abstract);SLM(abstract,abstract_cn);SFT(abstract,abstract_cn);small language model(abstract)

AI总结 研究小规模语言模型强化学习不稳定问题,识别出三种失败模式,提出容量余量假设,采用合并并重新初始化适配器技术等方法,所提系统稳定收敛,提升偏好胜率,优于指令调整基线且减少训练数据。

Comments Proceedings of the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Bellevue, WA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25069 2026-07-29 cs.CL cs.AI 新提交 90%

DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification

DS@GT ARC在CheckThat! 2026中的应用:基于大语言模型的多语言数值声明验证的推理轨迹排序和分组奖励建模

Sagnik Sinha, Shreyas Shrestha

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多语言数值声明验证,探索基于大语言模型(LLM)的推理轨迹排序和分组奖励建模两种方法。LLM方法用LoRA微调验证器评分,还尝试子声明分解;奖励模型用TF-IDF及特征评分。结果显示LLM方法多数指标更优,阿拉伯语中AraBERT表现更佳且子声明分解未提升性能。

Comments 10 pages, 2 figures. Accepted at CLEF 2026 CheckThat!. To appear in CEUR Workshop Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21498 2026-07-29 cs.CL cs.AI 版本更新 90%

Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it

人工矫正:为什么大语言模型过度使用一种古典修辞格,以及如何缓解这一问题

Federico Boggia

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型过度使用矫正格修辞格的问题,基于模型与人类修辞风格差异及相关分类,提出用矫正格指数评分,通过测量发现校准错误,给出以LoRA适配器为中心的缓解技术、指令及适配器效果,强调校准到人类比率而非消除的重要性。

Comments 18 pages, 7 tables. v2: corrections to the classical sources (Quintilian, Cicero) and to several cited figures, and Appendix B corpus statistics aligned to the delivered dataset; measurements, results and conclusions unchanged. Data, code, and the trained LoRA adapter: https://federicoboggia.binatomy.com/pubblicazioni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26023 2026-07-29 cs.AI 新提交 89%

CHARM: A Multimodal Graph Foundation Model with Hierarchical Context Modeling for Zero-Shot Transfer

CHARM:一种用于零样本迁移的具有分层上下文建模的多模态图基础模型

Ankang Yang, Jitao Zhao, Di Jin, Yuxiao Huang, Dongxiao He

机构 * School of Computer Science and Technology, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部计算机科学与技术学院) Data Science Program, Columbian College of Arts and Sciences, The George Washington University(乔治华盛顿大学文理学院哥伦比亚艺术与科学学院数据科学项目)

专题命中 指令微调 :foundation model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究多模态图零样本迁移问题,提出CHARM模型,通过分层上下文建模,用图上下文替换原始节点,减少对目标域监督或适配的依赖,经实验验证该模型在零样本多模态图任务上有改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22205 2026-07-29 cs.CV cs.AI 版本更新 89%

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

推进前填充:能力差距驱动的场景专用遥感多模态大语言模型的训练后处理

Yuheng Zong, Minghua Wang, Xin Zhao, Zhi-Hui Zhan, Antonio Plaza, Jon Atli Benediktsson

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对地球观测应用中遥感多模态大语言模型因高质量数据稀缺和能力覆盖不完整难以实现细粒度场景专业化的问题,提出能力差距驱动的推进前填充(FBA)方法,经实验验证其效果优于其他方法,提升了模型在相关基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24764 2026-07-29 cs.AI 新提交 88%

GrocLM: Grocery Category Recommendation in E-Commerce with Large Language Models

GrocLM:使用大语言模型进行电子商务中的杂货类别推荐

Yuan Zhong, Chuanwei Ruan, Moein Hasani, Tejaswi Tenneti, Haixun Wang, Fenglong Ma

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Instacart(因斯塔卡特公司) Evenup(伊文纳普公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对在线杂货购物推荐系统面临的挑战,提出GROCLM模型。采用基于LoRA的两阶段训练策略及基于前缀树的约束解码机制,在实验中表现出色,在实时生产补货任务中提升了购物车添加量,凸显将大语言模型集成到结构化推荐系统的有效性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07829 2026-07-29 cs.CL cs.AI cs.LG 版本更新 86%

Building Large-Scale English-Romanian Literary Translation Resources with Open Models

构建大规模英语-罗马尼亚文学翻译资源的开放模型

Mihai Nadas, Laura Diosan, Andreea Tomescu, Andrei Piscoran

机构 * Babeș-Bolyai University(巴克斯-波耶_ai大学) KlusAI Labs(KlusAI实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出TF2框架,通过开放模型和大规模合成语料库构建英语-罗马尼亚文学翻译资源,实现高效、低成本的高质量翻译。

Comments 21 pages. Published version: Front. Artif. Intell. 9:1807431 (2026). Datasets and models released on Hugging Face

Journal ref Front. Artif. Intell. 9:1807431 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25292 2026-07-29 cs.AI 新提交 85%

Instruction-Tuned Language Models Cannot Sample from Distributions They Can Describe

指令微调语言模型无法从它们能描述的分布中进行采样

Chaemin Jang, Dongman Lee, Jihee Kim

机构 * School of Computing, KAIST(韩国科学技术院计算学院) School of Business and Technology Management, KAIST(韩国科学技术院商业与技术管理学院)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);post-training(abstract);分类 cs.AI

AI总结 研究发现指令微调语言模型无法从其能描述的分布中采样,存在“知道/做”分裂,通过让模型描述分布可减半误差,还提出PPA在无额外成本下降低21%误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18553 2026-07-29 cs.LG cs.AI 版本更新 81%

Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary

循环语言模型中的操作原语内省:过程质量挖掘、可执行分支和读出控制边界

Jan Kirin

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型能否读取计算质量及外部干预能否改善结果,通过在Ouro-RLTT中实验,利用隐藏状态等预测成功,构建相关机制,虽有可读属性但干预未提升能力,此为操作原语内省。

Comments 73 pages, 13 figures. Version 3 adds a powered and independently replicated Horizon Logic study; within-family and out-of-family recurrent-depth replication; a powered Thinking replication attempt; validated selective-prediction and all-well-formed content-selection conversions; exact-compute loop-allocation and minimal LoRA binding tests; and an expanded evaluation-integrity account

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25763 2026-07-29 cs.NI cs.LG 新提交 79%

WALoMA: A Multitask Wireless Foundation Model via Adaptive Low-Rank Masked Autoencoders

WALoMA:一种通过自适应低秩掩码自动编码器实现的多任务无线基础模型

Madi Makin, Asmaa Abdallah, Abdulkadir Celik, Ahmed M. Eltawil

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对6G无线物理层架构中特定任务模型局限和标记数据稀缺问题,提出WALoMA模型,利用自适应低秩掩码自动编码器,通过自监督学习从无标签数据中学习可转移表示,在五个下游任务中表现出色,显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26015 2026-07-29 cs.CL 新提交 77%

Instruction-Tuned Models Locally Reuse Human Syntax More Than Humans Do

指令微调模型在局部比人类更多地复用人类句法

Zandi Eberstadt

机构 * University of Oxford(牛津大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 研究大语言模型是否像人类一样句法趋同,通过替换范式数据在多个模型测量CFG规则复用。发现各模型与前一轮人类话语规则重叠多,指令微调模型有特点,还在词汇和语义相似度上有表现,揭示了模型在句法复用方面与人类的异同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24783 2026-07-29 cs.AI 新提交 77%

Unified Semantic Modeling Framework for Large-Scale Job Understanding at LinkedIn

领英大规模职位理解的统一语义建模框架

Dan Xu, Baofen Zheng, Jianqiang Shen, Qi Xiao, Benjamin Hoan Le, Wen Pu, Saurabh Gupta, Ran Zhou, Neha Saraf, Alice Leung, Qianqi Shen, Liangjie Hong, Jingwei Wu, Wenjing Zhang

机构 * LinkedIn Corporation(领英公司)

专题命中 指令微调 :language model(abstract);small language model(abstract);SLM(abstract);分类 cs.AI

AI总结 领英为应对职位理解系统构建挑战,提出统一语义建模框架。先微调小型语言模型,再引入多适配器架构。经离线评估和在线A/B测试,该框架提升了性能、降低了复杂性,为构建行业规模文本理解系统提供实用见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14405 2026-07-29 cs.CL 77%

Adding LLMs to the psycholinguistic norming toolbox: A practical guide to getting the most out of human ratings

Javier Conde, María Grandury, Tairan Fu, Carlos Arriaga, Gonzalo Martínez, Thomas Clark, Sean Trott, Clarence Gerald Green, Pedro Reviriego, Marc Brysbaert

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02271 2026-07-29 cs.AI 版本更新 77%

Real-time Spatial Retrieval Augmented Generation for Urban Environments

城市环境的实时空间检索增强生成

David Nazareno Campo, Javier Conde, Álvaro Alonso, Gabriel Huecas, Joaquín Salvachúa, Pedro Reviriego

机构 * ETSI de Telecomunicación, Universidad Politécnica de Madrid(电信工程学院,马德里理工大学) FIWARE Foundation(FIWARE基金会)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 针对城市环境中基础模型更新难及传统RAG架构不适用问题,提出实时空间RAG架构,利用链接数据的时空过滤能力,借助FIWARE实现,通过马德里旅游助手用例验证了该架构能正确集成基础模型。

Journal ref ACM Transactions on Intelligent Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24803 2026-07-29 cs.IR cs.CL 新提交 74%

SciClaimSeekers at CheckThat! 2026: Retrieving Scientific Sources for Social Media Claims with LLM Reranking

SciClaimSeekers参加CheckThat! 2026:使用大语言模型重排检索社交媒体声明的科学来源

Mohotarema Rashid, Nansu Baniya, Anirban Saha Anik, Xiaoying Song, Lingzi Hong

专题命中 指令微调 :LLM(title);分类 cs.CL

AI总结 针对社交媒体科学声明难核实且少链接原始学术来源的问题,提出SciClaimSeekers系统,结合BM25、E5检索及倒数排名融合,经Qwen2.5-14B-Instruct重排,在相关评估中表现良好,证明大型预训练模型组合在该任务中可与微调方法竞争。

Comments CLEF 2026 Working Notes / CheckThat! Lab at CLEF 2026, Jena, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25299 2026-07-29 cs.LG cs.AI 新提交 73%

Retraction-Free Optimization over the Stiefel Manifold for the LoRA Fine-Tuning

用于LoRA微调的Stiefel流形上无回缩优化

Yuan Zhang, Jiang Hu, Zhijian Lai, Lin Lin, Zaiwen Wen

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Department of Mathematics, University of California, Berkeley(美国加州大学伯克利分校数学系) Center for Machine Learning Research and Changsha Institute for Computing and Digital Economy, Peking University(北京大学机器学习研究中心和长沙计算与数字经济研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对Stiefel流形优化中现有方法的问题,提出无回缩且无惩罚参数算法,利用相关特性建立收敛保证。将LoRA微调问题转为流形优化问题,引入Manifold-LoRA,经实验验证其在加速训练及下游性能方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24814 2026-07-29 cs.AI cs.LG q-bio.OT 新提交 73%

Aletheia: An Offline-First Clinical Decision Support System for Differential Diagnosis in Low-Resource Healthcare Settings

Aletheia:用于低资源医疗环境中鉴别诊断的离线优先临床决策支持系统

Joseph Walusimbi, Ann Move Oguti, Abubakhari Sserwadda, Precious Boss Kasasira, Charles Brian Okoboi

机构 * Soroti University(索罗蒂大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对撒哈拉以南非洲低资源医疗环境,提出基于Qwen2.5 - 3B - Instruct并经QLoRA微调的Aletheia临床决策支持系统,评估显示其在诊断准确率等指标上表现良好,证明在无云设施的资源受限环境初级保健层部署大语言模型临床推理的可行性。

Comments 8 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23541 2026-07-29 cs.CL 版本更新 70%

Med-R$^3$: Enhancing Medical Retrieval-Augmented Reasoning of LLMs via Progressive Reinforcement Learning

Med-R$^3$:通过渐进强化学习增强LLMs的医学检索增强推理

Keer Lu, Zheng Liang, Youquan Li, Jiejun Tan, Da Pan, Shusen Zhang, Guosheng Dong, Bin Cui, Yunhuai Liu, Wentao Zhang

机构 * Peking University(北京大学) Baichuan Inc.(北川科技公司)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 Med-R$^3$ 通过渐进强化学习提升医疗场景下LLMs的检索增强推理能力,实现检索与推理的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25583 2026-07-29 cs.AI 新提交 57%

How Small Can You Go? A Controlled Study of LoRA Rank, Target Modules, and Quantization Trade-offs for Text-to-SQL on a 60M-Parameter Model

你能做多小?关于60M参数模型上文本到SQL的LoRA秩、目标模块和量化权衡的对照研究

Mahendra Singh Rathor, Anagheem Azzam

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 研究在60M参数模型上文本到SQL时,LoRA秩、目标模块和量化的权衡。通过对照单变量研究,发现r = 16的LoRA在训练参数少、内存消耗低时接近全量微调准确性,QLoRA的INT8和NF4量化以低内存成本实现可比准确性,为内存受限部署提供方案。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24900 2026-07-29 cs.LG 新提交 57%

Inverse RL Helps Align AI by Imitating Humans

逆强化学习通过模仿人类帮助对齐人工智能

Michał Wiliński, Liu Leqi, Chirag Nagpal

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 研究语言模型对齐问题,受逆强化学习启发提出PARED方法,通过恢复示范的隐式奖励来改进基础策略,无需特定任务偏好注释,经实验验证其有效性及可用于上下文对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24898 2026-07-29 cs.CV cs.AI 新提交 57%

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

危害并非普遍存在:迫切需要针对特定社区的毒性检测

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison

机构 * Microsoft Research Cambridge, UK(英国剑桥微软研究院) Microsoft Paris, France(法国巴黎微软)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 研究指出文本到图像生成的通用毒性检测方法不能保护边缘化社区,主张特定社区毒性检测(CTD)。通过与专家合作制定指南,利用图像数据集实验表明现有模型表现不佳,基于提示的方法和参数高效微调可提升性能,但CTD性能仍远低于通用检测,需持续研究。

Comments 18 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15021 2026-07-29 astro-ph.SR astro-ph.GA cs.LG 版本更新 57%

Generalization from Low- to Moderate-Resolution Spectra with Neural Networks for Stellar Parameter Estimation: A Case Study with DESI

利用神经网络从低分辨率到中等分辨率光谱进行泛化:恒星参数估计的案例研究

Xiaosheng Zhao, Yuan-Sen Ting, Rosemary F. G. Wyse, Alexander S. Szalay, Yang Huang, László Dobos, Tamás Budavári, Viska Wei

机构 * Department of Physics \& Astronomy, The Johns Hopkins University, Baltimore, MD 21218, USA Department of Astronomy, The Ohio State University, 140 West 18th Avenue, Columbus, OH 43210, USA Center for Cosmology AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH 43210, USA Department of Computer Science, The Johns Hopkins University, Baltimore, MD 21218, USA School of Astronomy Space Science, University of Chinese Academy of Sciences, Beijing 100049, People's Republic of China National Astronomical Observatories, Chinese Academy of Sciences, Beijing 100012, People's Republic of China Department of Information Systems, E\"otv\"os Lor\' University, Budapest 1117, Hungary Department of Applied Mathematics \& Statistics, Johns Hopkins University, Baltimore, MD 21218, USA

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 本研究利用神经网络从低分辨率到中等分辨率光谱进行泛化,通过预训练和微调策略提升恒星参数估计的准确性。

Comments 22 pages, 13 figures, 4 tables. Accepted for publication in ApJ. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25355 2026-07-29 cs.SD 新提交 50%

From Semantics to Readout: Mechanistic Understanding of Audio Tokens after Fine-Tuning for Temporal Audio Grounding

从语义到读出:时间音频接地微调后音频令牌的机制理解

Yujian Ma, Jinqiu Sang, Ruizhe Li, Jiaao Yu, Ang Li

专题命中 指令微调 :language model(abstract)

AI总结 研究大型音频语言模型中音频令牌在微调后的机制,通过四种分析研究其分层语义等,发现微调前已有潜在证据,微调后解码器更易访问事件信息,支持从语义到读出的解释,有助于解码器连接时间输出。

详情

展开后加载摘要…

URL PDF HTML 收藏