arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-07 至 2026-08-07 共收录 213 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 20 篇

2608.06253 2026-08-07 cs.LG 新提交 91%

MetaboLLM: a metabolomics-specialized large language model for biochemical knowledge integration and predictive metabolite graph construction

MetaboLLM:用于生化知识整合与预测性代谢物图构建的代谢组学专用大语言模型

Dohyun Ku, Min Gu Kwak, Francisco J. Pasquel, Jing Li

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 该研究开发了代谢组学专用大语言模型MetaboLLM及配套的MetaboLLM-GIN,经多阶段适配后,在相关任务及两个临床预测场景中均取得优于对照模型的性能,证明领域专用语言模型可构建可预测且可解释的代谢物图表征。

Comments 60 pages, 3 figures, 16 tables; includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05872 2026-08-07 cs.CL cs.AI 新提交 87%

MACRO: Markov Chain Routing of Transformer Layers

MACRO:Transformer层的马尔可夫链路由

Paweł Batorski, Abtin Pourhadi, Akylgali Aitaza, Przemysław Spurek, Paul Swoboda

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无需修改底层参数的MACRO框架,将Transformer层路由建模为马尔可夫策略,在多基准上实现优于基线及Dr. LLM的性能,同时大幅缩短路由搜索时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05178 2026-08-07 cs.CY cs.AI 新提交 86%

Who Gets Access? Global Region and Academic Status Bias in AI-Generated Academic Gatekeeping Scenarios

谁能获得权限?AI生成的学术守门场景中的全球区域与学术地位偏差

Nouar AlDahoul, Hezerul Abdul Karim, Myles Joshua Toledo Tan

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建LLM模拟学术守门场景,发现LLM存在学术地位偏差,且模型架构导致区域偏好差异,凸显需审计AI系统的公平性与价值对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05447 2026-08-07 cs.CL 新提交 85%

Example-Guided Prompting for Document-Level Text Simplification

示例引导提示用于文档级文本简化

Marina Litvak, Ariel Perstin, Ilan Shtilman, Michael Färber

机构 * SCE(SCE(以色列SCE学院)) ScaDS.AI, TUD Dresden(ScaDS.AI,德累斯顿工业大学)

专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对文档级文本简化中提示指导不足的问题,提出示例引导提示方法,经OneStopEnglish语料库实验,可提升大语言模型的简化质量,性能优于或媲美相关基准系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06283 2026-08-07 cs.LG math.OC math.PR stat.ML 新提交 84%

The Tamed Subgradient Unadjusted Langevin Algorithm beyond Convexity

超越凸性的驯服次梯度未校正朗之万算法

Iosif Lytras, Nikolaos Makras, Sotirios Sabanis

机构 * University of Edinburgh(爱丁堡大学) National Technical University of Athens(雅典国立技术大学) Athena/Archimedes Research Centre(雅典娜/阿基米德研究中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文针对非光滑、超线性梯度增长且非凸的目标分布采样问题,提出SG-TULA算法,推导其非渐近收敛界,验证假设并用于GPT-2系列LLM预训练,效果优于AdamW等。

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06015 2026-08-07 cs.LG cs.AI 新提交 79%

ProDVI: Programmatic Dynamics Priors for Value Network Initialization

ProDVI:用于价值网络初始化的程序化动态先验

Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 ProDVI是利用大型语言模型生成的Python函数初始化RL智能体的框架,通过预训练价值网络编码器,提升无模型RL算法的样本效率,无需依赖数据集或模拟器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05409 2026-08-07 cs.CL 新提交 77%

Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

情绪很重要:句法敏感性如何破坏安全对齐

Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt, Simone Paolo Ponzetto

机构 * University of Mannheim(曼海姆大学) Technical University Clausthal(克劳斯塔尔工业大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 该研究发现大型语言模型存在句法敏感性漏洞,16个700亿参数级模型可通过调控句法特征触发或抑制拒绝行为,源于开源模型后训练数据的语言偏见,增加句法多样性可缓解问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06223 2026-08-07 cs.AI cs.LG 新提交 73%

TS-RAG: Retrieval Augmented Generation for Time Series Forecasting

TS-RAG:面向时间序列预测的检索增强生成

Yixiong Xiao, Congxi Xiao, Jingbo Zhou

机构 * Baidu, Inc.(百度公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对时间序列预测模型的局限,提出TS-RAG框架,引入参考token融合输入与检索序列信息,在多个真实预测基准上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05624 2026-08-07 cs.AI cs.CL 新提交 73%

Measuring and Detecting Harmful AI Sycophancy

衡量与检测有害的AI奉承行为

Bohan Jiang, Dawei Li, Yasin Silva, Huan Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对大型语言模型的有害偏好诱导立场反转奉承(PSRS),提出CAP框架收集带标签数据,探究其发生频率、检测可行性及跨模型泛化性,发现能力越强的模型PSRS率越低,并提出应对未见模型检测性能下降的初步方法。

Comments under-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05153 2026-08-07 cs.CL cs.AI 新提交 73%

Universal Pathologies, Conditional Consequences: A Triple-Robustness Analysis of RAG for Multi-Hop Traceability

普遍存在的缺陷与有条件的后果:面向多跳可追溯性的RAG的三重鲁棒性分析

Meftun Akarsu, Burak Ozdemir

机构 * Technische Hochschule Ingolstadt(英戈尔施塔特应用技术大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究通过三重鲁棒性分析,探究了不同嵌入器、语料库、评判器下GraphRAG与向量RAG的多跳可追溯性表现,发现过度引用具架构普遍性,忠实度后果受语料库影响,提出三重鲁棒性为可信RAG架构主张的最低标准。

Comments 5 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06196 2026-08-07 cs.AI 新提交 70%

Comparative Approaches to Agent Retrieval over Large Skill Libraries

基于大型技能库的智能体检索方法的比较研究

Indivara Kolluru, Nathan Sportsman

机构 * Praetorian

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究对比了混合排名器与类型化知识图谱在690个技能库的117个真实查询上的检索效果,发现添加结构无法提升强排名器的检索性能,明确了结构优化的适用条件。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06115 2026-08-07 cs.AI 新提交 70%

Mind the Gaps: Mixture-of-Minds for Human Simulation

关注差距:用于人类模拟的思维混合模型

Pranav Dahiya

机构 * Semilattice(半格)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Anacreon受众模拟模型,基于Gemma 4 12B构建思维混合模型,通过聚类个体、情感链等技术,在个体层面序数对齐达0.775,缩小了群体与个体模拟的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05759 2026-08-07 cs.CL 新提交 70%

How to Recognize New Words: A Comparison Between Context Biasing Methods and Speech LLMs

如何识别生词:上下文偏置方法与语音大语言模型的对比

Christian Huber, Alexander Waibel

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究对比了基于Whisper的上下文偏置方法与语音LLMs在识别ASR中生词的性能,发现前者可大幅降低偏置词错误率,后者在朗读语音上表现好但泛化性差,最终为方法选择提供了权衡依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05706 2026-08-07 cs.CV 新提交 67%

LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models

LAWM-3D:从人类视频中学习具有3D感知能力的潜在动作以构建可泛化的机器人世界模型

Jiarui Yang, Jiale Zhange, Jiawei Li, Hang Guo, Wen Huang, Jinpeng Wang, Peidong Liu, Shu-Tao Xia

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本研究针对现有潜在动作模型缺乏3D感知能力的问题,提出LAWM-3D模型,通过多视图动作 token 化、几何对齐约束和RGB-D联合重建目标,实现了性能SOTA的机器人世界模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05423 2026-08-07 cs.LG cs.AI 新提交 62%

Why the Third Axis Is Freedom

为何第三轴是自由

Michael Timothy Bennett

机构 * The Australian National University(澳大利亚国立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究指出生成式训练中XM的第三轴实际是自由,通过理论与实验证明自由选择优于MDL,且在分布偏移下针对自由度的选择可提升XM表现。

Comments Experiment code available on GitHub, in the papers folder: https://github.com/ViscousLemming/Technical-Appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05424 2026-08-07 cs.CV cs.LG 新提交 57%

Invisible Shortcuts: Why Vision Encoders Know Your Camera

隐形捷径:视觉编码器为何了解你的相机

Vladan Stojnić, Ryan Ramos, Giorgos Kordopatis-Zilos, Noa Garcia, Giorgos Tolias

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 该研究发现视觉编码器会利用像素级隐形元数据痕迹形成捷径,元数据-语义关联越强模型敏感性越高,提出的缓解策略可降低敏感性并提升分布外泛化能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05437 2026-08-07 cs.CE cs.LG cs.NA math.NA 新提交 57%

Discrete energy as an exact label-free training objective for finite-element surrogates

离散能量作为有限元代理模型的无标签训练目标

Ruifeng Cao, Xidan Song

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 该研究提出将离散能量作为有限元代理模型的无标签训练目标,通过理论推导与数值验证证明其有效性,为线性弹性静力学代理模型训练提供了新方法。

Comments 9 pages. Theory note of the FE-JEPA programme

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06126 2026-08-07 cs.CV 新提交 50%

Patient Pose Assessment Using a CT-Based Framework for Synthetic Data Generation

基于CT合成数据生成框架的患者姿态评估

Manuel Laufer, Dominik Mairhöfer, Malte Sieren, Hauke Gerdes, Fabio Leal dos Reis, Arpad Bischof, Thomas Käster, Erhardt Barth, Jörg Barkhausen, Thomas Martinetz

机构 * Institute for Neuro- and Bioinformatics, University of Lübeck(吕贝克大学神经与生物信息学研究所) University Medical Center Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医学中心) IMAGE Information Systems Europe GmbH(IMAGE信息系统欧洲有限公司) Pattern Recognition Company GmbH(模式识别有限公司)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 该研究提出基于CT的合成数据生成框架,用于解决放射图像患者姿态评估中真实训练数据获取难的问题,经3077对踝关节图像预训练后,真实踝关节姿态评估性能提升最多11个百分点。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2026:027

Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05911 2026-08-07 cs.CV 新提交 50%

Mapping Armenian Paris: Extracting and Geocoding Commercial Advertisements from the 20th-Century Diaspora Press

绘制亚美尼亚巴黎:从20世纪侨民报刊中提取并地理编码商业广告

Chahan Vidal-Gorène, Seda Kirakosyan, Edita Matevosyan

专题命中 预训练与数据 :language model(abstract)

AI总结 本研究提出基于IIIF的VLM驱动端到端流程,从西亚美尼亚语报刊中提取并地理编码商业广告,构建巴黎亚美尼亚商业社区交互式地图,相关成果可迁移至其他资源匮乏历史语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05674 2026-08-07 cs.RO 新提交 50%

JoyAI-RA 0.5: Scaling Robot Manipulation Learning via Dual Action Alignment

JoyAI-RA 0.5:通过双动作对齐扩展机器人操纵学习

RA Team

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对机器人操纵学习中异构数据的负迁移问题,提出 JoyAI-RA 0.5 框架,通过双动作对齐结合 VLWA 与强化学习,在 AgiBot 基准上实现性能提升,证明人类弱标注数据可作为扩展操纵能力的核心资源。

Comments Project Page: https://joyai-ra-05.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 19 篇

2608.05387 2026-08-07 cond-mat.mtrl-sci 新提交 92%

Fine-Tuning Small Language Models for Reliable VASP INCAR Generation

微调小型语言模型以生成可靠的VASP INCAR文件

Xinyue Zhang, Jixiang Li, Bin Shao, Baishun Yang, Zhiyang Liu, Weichao Wang

专题命中 指令微调 :SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);LLM(abstract)

AI总结 本研究通过微调小型语言模型(SLM)并搭配后处理器VASPGuard构建INCAR-SLM,在INCARBench上优于通用大模型,证明小型模型经适配可可靠生成VASP INCAR文件,适配后性能随规模增长趋于饱和。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05541 2026-08-07 cs.AI 新提交 92%

Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging

Hyper-ES:通过下降方向合并实现LLM推理的有效进化策略

Yu Gu, Zhi Zheng, Yunpeng Ba, Xialiang Tong, Mingxuan Yuan, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Nanjing University(南京大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Hyper-ES框架,通过梯度微调获取下降方向张成子空间,再用CMA-ES优化DARE-TIES合并系数,在数学推理任务上性能优于GRPO-LoRA,梯度更新量减少10%。

Comments 19 pages, 4 figures, 14 tables. Code: https://github.com/kuangrepi/Hyper-ES

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05156 2026-08-07 cs.CL 新提交 91%

Scaffold-Mediated Post-Training: Co-Evolving Model Parameters and Procedural Scaffold Graphs

支架介导的后训练:协同演化模型参数与程序性支架图

Fei Ding, Yongkang Zhang, Runhao Liu, Yuhao Liao, Zijian Zeng, Huiming Yang

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对大型语言模型后训练中参数与推理支架脱节的问题,提出支架介导的后训练范式,通过协同演化实现技能提升,在FeatureBench上较标准SFT取得显著性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06069 2026-08-07 cs.CL 新提交 90%

Training-Free Token-Level Steering for LLM Personalized Co-Writing

面向LLM个性化协同写作的无训练令牌级引导

Wenhao Mao, Chengbin Hou, Weixiao Wang, Jialiang Zhu, Min Liu, Yibin Hao, Hairong Lv

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM个性化协同写作的需求,提出无训练框架SteerWrite,无需梯度更新即可适配专业领域,在多数据集、指标和模型上实现SOTA性能,大幅降低人工编辑工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05161 2026-08-07 cs.CL cs.LG 新提交 84%

SemiAdapt-Instruct: Extensible Instruction Tuning via Latent Domain-Specialised Adapters

SemiAdapt-Instruct:通过潜在领域专用适配器实现可扩展的指令微调

Josh McGiff, Salma Mekaoui, Robert Shanahan, Nikola S. Nikolov

机构 * University of Limerick(利默里克大学)

专题命中 指令微调 :instruction tuning(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 SemiAdapt-Instruct是一种模块化指令微调框架,可发现潜在指令领域并训练对应LoRA适配器,无需全模型微调即可扩展,性能优于全模型微调且具备整体方法无法实现的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05250 2026-08-07 cs.LG 新提交 81%

Beyond Full-Model Rollback: AuroSFT for Adapter-State Multi-Task Fine-Tuning

超越全模型回滚:用于适配器状态多任务监督微调的AuroSFT

Yue Han, Ziniu Liu

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.LG

AI总结 针对多任务SFT的全模型回滚成本高的问题,提出参数高效框架AuroSFT,将状态转为可合并的适配器状态,在保留骨干网络的比较中平均准确率达61.36%,优于msft的59.85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05207 2026-08-07 cs.LG 新提交 81%

When Do Corrective Features Help? An Agent for Corrective Feature Discovery on Black-Box Forecasters

纠正特征何时有用?面向黑盒预测器的纠正特征发现智能体

Fangxin Wang, Ziyi Zhang, Diyi Zhuang, Langzhou He, Shiyu Wang, Baichuan Mo, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Texas A&M University(德克萨斯农工大学) Massachusetts Institute of Technology(麻省理工学院) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出CRAFTER智能体,挖掘黑盒冻结预测器的残差以生成纠正特征,在6个数据集和6个主干上优于现有系统,使改进翻倍、误差降27%,可归因特征来源。

Comments 23 pages, 14 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05813 2026-08-07 cs.AI 新提交 79%

Cautious Context Steering for Language Model Personalization

用于语言模型个性化的谨慎上下文引导(Cautious Context Steering, CCS)

Gihoon Kim, Jeyoung Lee, Suhan Woo, Sekwon Oh, Minsu Jeon, Hyounsoo Han, Euntai Kim

机构 * Yonsei University(延世大学) Hyundai Motors Company(现代汽车公司) Korea Institute of Science and Technology(韩国科学技术研究院)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文提出 CCS 方法,通过轻量适配器动态控制语言模型解码时的上下文影响,在单数据集训练后实现领域内及四个分布外基准的个性化提升,且降低推理成本。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05783 2026-08-07 cs.LG cs.AI cs.CL 新提交 75%

GROM: Gradient-Free Rapid One-Shot Machine Unlearning

GROM:无梯度快速一次性机器遗忘

Paweł Batorski, Przemysław Spurek, Paul Swoboda

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GROM是一种无梯度快速一次性机器遗忘方法,通过闭式加性更新实现高效知识移除,在多数据集上取得最优遗忘-效用权衡,且能抵御低比特量化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05891 2026-08-07 cs.AI cs.CL 新提交 73%

AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents

AppDeltaWorld:面向移动GUI智能体的基于转换的增量代码世界模型

Weikai Xu, Yunren Feng, Haoxiang Lei, Kun Huang, Yuxuan Liu, Kang Zhao, Xiaolin Hu, Shuo Shang, Bo An

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对移动GUI智能体轨迹获取难、模拟环境扩展难等问题,提出AppDeltaWorld增量代码世界模型,在CMGUIBench-500评估中表现最优,支撑的AppDeltaAgent在多基准达SOTA,测试时强化学习可进一步提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏