arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-07 至 2026-08-07 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 27 篇

2608.06253 2026-08-07 cs.LG 新提交 91%

MetaboLLM: a metabolomics-specialized large language model for biochemical knowledge integration and predictive metabolite graph construction

MetaboLLM:用于生化知识整合与预测性代谢物图构建的代谢组学专用大语言模型

Dohyun Ku, Min Gu Kwak, Francisco J. Pasquel, Jing Li

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 该研究开发了代谢组学专用大语言模型MetaboLLM及配套的MetaboLLM-GIN,经多阶段适配后,在相关任务及两个临床预测场景中均取得优于对照模型的性能,证明领域专用语言模型可构建可预测且可解释的代谢物图表征。

Comments 60 pages, 3 figures, 16 tables; includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05872 2026-08-07 cs.CL cs.AI 新提交 87%

MACRO: Markov Chain Routing of Transformer Layers

MACRO:Transformer层的马尔可夫链路由

Paweł Batorski, Abtin Pourhadi, Akylgali Aitaza, Przemysław Spurek, Paul Swoboda

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无需修改底层参数的MACRO框架,将Transformer层路由建模为马尔可夫策略,在多基准上实现优于基线及Dr. LLM的性能,同时大幅缩短路由搜索时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05178 2026-08-07 cs.CY cs.AI 新提交 86%

Who Gets Access? Global Region and Academic Status Bias in AI-Generated Academic Gatekeeping Scenarios

谁能获得权限?AI生成的学术守门场景中的全球区域与学术地位偏差

Nouar AlDahoul, Hezerul Abdul Karim, Myles Joshua Toledo Tan

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建LLM模拟学术守门场景,发现LLM存在学术地位偏差,且模型架构导致区域偏好差异,凸显需审计AI系统的公平性与价值对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05447 2026-08-07 cs.CL 新提交 85%

Example-Guided Prompting for Document-Level Text Simplification

示例引导提示用于文档级文本简化

Marina Litvak, Ariel Perstin, Ilan Shtilman, Michael Färber

机构 * SCE(SCE(以色列SCE学院)) ScaDS.AI, TUD Dresden(ScaDS.AI,德累斯顿工业大学)

专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对文档级文本简化中提示指导不足的问题,提出示例引导提示方法,经OneStopEnglish语料库实验,可提升大语言模型的简化质量,性能优于或媲美相关基准系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06283 2026-08-07 cs.LG math.OC math.PR stat.ML 新提交 84%

The Tamed Subgradient Unadjusted Langevin Algorithm beyond Convexity

超越凸性的驯服次梯度未校正朗之万算法

Iosif Lytras, Nikolaos Makras, Sotirios Sabanis

机构 * University of Edinburgh(爱丁堡大学) National Technical University of Athens(雅典国立技术大学) Athena/Archimedes Research Centre(雅典娜/阿基米德研究中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文针对非光滑、超线性梯度增长且非凸的目标分布采样问题,提出SG-TULA算法,推导其非渐近收敛界,验证假设并用于GPT-2系列LLM预训练,效果优于AdamW等。

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05000 2026-08-07 cs.CV cs.LG cs.MM 版本更新 83%

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

迈向多模态预训练的物理学:知识流、模态协同、早期统一与方法指南

Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis

机构 * FAIR, Meta(Meta FAIR研究院) Reality Labs, Meta(Meta Reality Labs) University of Oxford(牛津大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 该研究探索多模态预训练的机制,得出知识流、模态协同等四个关键见解,推导高效预训练方法,为多模态预训练的理解与扩展提供基础。

Comments Project page: https://junlinhan.github.io/projects/physics_of_mm_pretrain/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03949 2026-08-07 cs.CV cs.LG 版本更新 83%

TESSERA v2: Scaling Pixel-wise Earth Foundation Models

TESSERA v2:扩展逐像素地球基础模型

Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, James Ball, Pedro Sousa, Mark Elvers, Madeline Lisaius, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, David Coomes, Anil Madhavapeddy, Srinivasan Keshav

机构 * University of Cambridge(剑桥大学) NVIDIA(英伟达) dClimate Labs(dClimate实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究逐像素地球观测基础模型的扩展及预训练预算分配,通过大规模实验发现预训练损失难预测下游性能,给出计算分配规则,训练并蒸馏模型,其成果优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04884 2026-08-07 cs.CL 版本更新 81%

Building Open-Retrieval Conversational Question Answering Systems by Generating Synthetic Data and Decontextualizing User Questions

通过生成合成数据和去语境化用户问题构建开放检索式对话问答系统

Christos Vlachos, Nikolaos Stylianou, Alexandra Fiotaki, Spiros Methenitis, Elisavet Palogiannidi, Themos Stafylakis, Ion Androutsopoulos

机构 * Department of Informatics, Athens University of Economics and Business(雅典经济与商业大学信息学院) Omilia - Conversational Intelligence(Omilia-对话智能) Archimedes, Athena Research Center(雅典研究中心Archimedes) NCSR Demokritos(德摩斯蒂斯国家研究中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对开放检索式对话问答数据集获取困难的问题,提出基于组织纯文本文档生成合成带标注对话的流程,训练问题重写器去语境化用户问题,结合LLM构建OR-CONVQA系统。

Comments Accepted at SIGDIAL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15557 2026-08-07 cs.CL 版本更新 79%

SkillCorpus: Consolidating and Evaluating the Open Skill Ecosystem for Real-World LLM Agents

SkillCorpus:整合与评估面向现实世界大语言模型智能体的开放技能生态系统

Yanze Wang, Pengfei Yao, Tianyi Sun, Chuanrui Hu, Yan Xiao, Xiaotian Luo, Yunyun Han, Yifan Chen, Jun Sun, Yafeng Deng

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对大语言模型智能体技能文件碎片化等问题,提出SkillCorpus框架,通过多阶段管道过滤技能并与检索选择堆栈配对,经多基准端到端评估,整合该框架能带来一致收益,明确了其对实际智能体任务的作用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06015 2026-08-07 cs.LG cs.AI 新提交 79%

ProDVI: Programmatic Dynamics Priors for Value Network Initialization

ProDVI:用于价值网络初始化的程序化动态先验

Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 ProDVI是利用大型语言模型生成的Python函数初始化RL智能体的框架,通过预训练价值网络编码器,提升无模型RL算法的样本效率,无需依赖数据集或模拟器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05409 2026-08-07 cs.CL 新提交 77%

Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

情绪很重要:句法敏感性如何破坏安全对齐

Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt, Simone Paolo Ponzetto

机构 * University of Mannheim(曼海姆大学) Technical University Clausthal(克劳斯塔尔工业大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 该研究发现大型语言模型存在句法敏感性漏洞,16个700亿参数级模型可通过调控句法特征触发或抑制拒绝行为,源于开源模型后训练数据的语言偏见,增加句法多样性可缓解问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06223 2026-08-07 cs.AI cs.LG 新提交 73%

TS-RAG: Retrieval Augmented Generation for Time Series Forecasting

TS-RAG:面向时间序列预测的检索增强生成

Yixiong Xiao, Congxi Xiao, Jingbo Zhou

机构 * Baidu, Inc.(百度公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对时间序列预测模型的局限,提出TS-RAG框架,引入参考token融合输入与检索序列信息,在多个真实预测基准上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05624 2026-08-07 cs.AI cs.CL 新提交 73%

Measuring and Detecting Harmful AI Sycophancy

衡量与检测有害的AI奉承行为

Bohan Jiang, Dawei Li, Yasin Silva, Huan Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对大型语言模型的有害偏好诱导立场反转奉承(PSRS),提出CAP框架收集带标签数据,探究其发生频率、检测可行性及跨模型泛化性,发现能力越强的模型PSRS率越低,并提出应对未见模型检测性能下降的初步方法。

Comments under-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05153 2026-08-07 cs.CL cs.AI 新提交 73%

Universal Pathologies, Conditional Consequences: A Triple-Robustness Analysis of RAG for Multi-Hop Traceability

普遍存在的缺陷与有条件的后果:面向多跳可追溯性的RAG的三重鲁棒性分析

Meftun Akarsu, Burak Ozdemir

机构 * Technische Hochschule Ingolstadt(英戈尔施塔特应用技术大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究通过三重鲁棒性分析,探究了不同嵌入器、语料库、评判器下GraphRAG与向量RAG的多跳可追溯性表现,发现过度引用具架构普遍性,忠实度后果受语料库影响,提出三重鲁棒性为可信RAG架构主张的最低标准。

Comments 5 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06196 2026-08-07 cs.AI 新提交 70%

Comparative Approaches to Agent Retrieval over Large Skill Libraries

基于大型技能库的智能体检索方法的比较研究

Indivara Kolluru, Nathan Sportsman

机构 * Praetorian

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究对比了混合排名器与类型化知识图谱在690个技能库的117个真实查询上的检索效果,发现添加结构无法提升强排名器的检索性能,明确了结构优化的适用条件。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06115 2026-08-07 cs.AI 新提交 70%

Mind the Gaps: Mixture-of-Minds for Human Simulation

关注差距:用于人类模拟的思维混合模型

Pranav Dahiya

机构 * Semilattice(半格)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Anacreon受众模拟模型,基于Gemma 4 12B构建思维混合模型,通过聚类个体、情感链等技术,在个体层面序数对齐达0.775,缩小了群体与个体模拟的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05759 2026-08-07 cs.CL 新提交 70%

How to Recognize New Words: A Comparison Between Context Biasing Methods and Speech LLMs

如何识别生词:上下文偏置方法与语音大语言模型的对比

Christian Huber, Alexander Waibel

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究对比了基于Whisper的上下文偏置方法与语音LLMs在识别ASR中生词的性能,发现前者可大幅降低偏置词错误率,后者在朗读语音上表现好但泛化性差,最终为方法选择提供了权衡依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16278 2026-08-07 cs.CV cs.AI 版本更新 70%

RealityBridge: Bridging Editable 3D Gaussian Splatting Driving Simulations and Real-World Videos

RealityBridge: 连接可编辑3D高斯泼溅驾驶模拟与现实世界视频

Zhenhua Wu, Yun Pang, Mingkun Chang, Yuwei Ning, Liangzhi Wang, Yi Xiao, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)

专题命中 预训练与数据 :foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出RealityBridge框架,利用多模态控制和轻量级GateNet,结合自回归长视频训练与奖励引导后训练,缩小编辑后3DGS驾驶视频的Sim-to-Real差距,提升视觉真实感和时间一致性。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05706 2026-08-07 cs.CV 新提交 67%

LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models

LAWM-3D:从人类视频中学习具有3D感知能力的潜在动作以构建可泛化的机器人世界模型

Jiarui Yang, Jiale Zhange, Jiawei Li, Hang Guo, Wen Huang, Jinpeng Wang, Peidong Liu, Shu-Tao Xia

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本研究针对现有潜在动作模型缺乏3D感知能力的问题,提出LAWM-3D模型,通过多视图动作 token 化、几何对齐约束和RGB-D联合重建目标,实现了性能SOTA的机器人世界模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05423 2026-08-07 cs.LG cs.AI 新提交 62%

Why the Third Axis Is Freedom

为何第三轴是自由

Michael Timothy Bennett

机构 * The Australian National University(澳大利亚国立大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究指出生成式训练中XM的第三轴实际是自由,通过理论与实验证明自由选择优于MDL,且在分布偏移下针对自由度的选择可提升XM表现。

Comments Experiment code available on GitHub, in the papers folder: https://github.com/ViscousLemming/Technical-Appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05424 2026-08-07 cs.CV cs.LG 新提交 57%

Invisible Shortcuts: Why Vision Encoders Know Your Camera

隐形捷径:视觉编码器为何了解你的相机

Vladan Stojnić, Ryan Ramos, Giorgos Kordopatis-Zilos, Noa Garcia, Giorgos Tolias

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 该研究发现视觉编码器会利用像素级隐形元数据痕迹形成捷径,元数据-语义关联越强模型敏感性越高,提出的缓解策略可降低敏感性并提升分布外泛化能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05437 2026-08-07 cs.CE cs.LG cs.NA math.NA 新提交 57%

Discrete energy as an exact label-free training objective for finite-element surrogates

离散能量作为有限元代理模型的无标签训练目标

Ruifeng Cao, Xidan Song

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 该研究提出将离散能量作为有限元代理模型的无标签训练目标,通过理论推导与数值验证证明其有效性,为线性弹性静力学代理模型训练提供了新方法。

Comments 9 pages. Theory note of the FE-JEPA programme

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03105 2026-08-07 cs.CL 版本更新 57%

HomoEnsNER: Does Language Alignment Outperform Architectural Complexity in Gujarati Named Entity Recognition?

HomoEnsNER:古吉拉特语命名实体识别中语言对齐是否优于架构复杂度?

Chandrakant K. Bhogayata

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 该研究针对古吉拉特语NER,提出同构集成模型HomoEnsNER,经实验证实其F1值优于基线及异构模型,表明语言对齐比架构复杂度更适合低资源印度语言NER。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06126 2026-08-07 cs.CV 新提交 50%

Patient Pose Assessment Using a CT-Based Framework for Synthetic Data Generation

基于CT合成数据生成框架的患者姿态评估

Manuel Laufer, Dominik Mairhöfer, Malte Sieren, Hauke Gerdes, Fabio Leal dos Reis, Arpad Bischof, Thomas Käster, Erhardt Barth, Jörg Barkhausen, Thomas Martinetz

机构 * Institute for Neuro- and Bioinformatics, University of Lübeck(吕贝克大学神经与生物信息学研究所) University Medical Center Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医学中心) IMAGE Information Systems Europe GmbH(IMAGE信息系统欧洲有限公司) Pattern Recognition Company GmbH(模式识别有限公司)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 该研究提出基于CT的合成数据生成框架,用于解决放射图像患者姿态评估中真实训练数据获取难的问题,经3077对踝关节图像预训练后,真实踝关节姿态评估性能提升最多11个百分点。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2026:027

Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05911 2026-08-07 cs.CV 新提交 50%

Mapping Armenian Paris: Extracting and Geocoding Commercial Advertisements from the 20th-Century Diaspora Press

绘制亚美尼亚巴黎:从20世纪侨民报刊中提取并地理编码商业广告

Chahan Vidal-Gorène, Seda Kirakosyan, Edita Matevosyan

专题命中 预训练与数据 :language model(abstract)

AI总结 本研究提出基于IIIF的VLM驱动端到端流程,从西亚美尼亚语报刊中提取并地理编码商业广告,构建巴黎亚美尼亚商业社区交互式地图,相关成果可迁移至其他资源匮乏历史语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05674 2026-08-07 cs.RO 新提交 50%

JoyAI-RA 0.5: Scaling Robot Manipulation Learning via Dual Action Alignment

JoyAI-RA 0.5:通过双动作对齐扩展机器人操纵学习

RA Team

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对机器人操纵学习中异构数据的负迁移问题,提出 JoyAI-RA 0.5 框架,通过双动作对齐结合 VLWA 与强化学习,在 AgiBot 基准上实现性能提升,证明人类弱标注数据可作为扩展操纵能力的核心资源。

Comments Project Page: https://joyai-ra-05.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19880 2026-08-07 cs.RO cs.CV 版本更新 50%

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness

EA-Nav:通过具身感知学习安全的视觉导航策略

Jialu Zhang, Yong Du, Xianda Guo, Shunwang Sun, Xinqi Liu, Yue Sun, Guodong Lu, Wei Sui, Jituo Li

机构 * Zhejiang University(浙江大学) Wuhan University(武汉大学) Hunan University(湖南大学) D-Robotics(D机器人公司)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对跨具身导航挑战,提出基于模仿学习的具身感知导航框架,通过模块化多阶段设计,预训练构建数据集并引入具身几何,微调设计多模态信息注入机制,有效提高不同具身设置下的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏