arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-31 至 2026-07-31 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 24 篇

2606.11018 2026-07-31 cs.CL 版本更新 91%

Measuring Human Value Expression in Social Media Texts: Calibrated LLM Annotation and Encoder Transfer

测量社交媒体文本中的人类价值表达:校准的LLM标注与编码器迁移

Maria Milkova, Maksim Rudnev

机构 * Independent researcher, Lisbon, Portugal(独立研究者,里斯本,葡萄牙) University of Waterloo, ON, Canada(滑铁卢大学,安大略省,加拿大)

专题命中 预训练与数据 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 本研究使用校准的LLM标注和软标签训练,将基于Schwartz人类基本价值理论的社交媒体文本价值表达迁移到编码器模型,实现可扩展预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27290 2026-07-31 cs.LG 新提交 90%

EvoCause: LLM-Guided Evolution of Causal Graphs for Root Cause Analysis

EvoCause:基于大语言模型引导的因果图进化的根本原因分析

Lei Zan, Keli Zhang, Shifeng Xie, Jiale Zheng, Zehao Xiao, Zhiwei Dong, Ke Zhang, Ruichu Cai, Malik Tiomoko, Lujia Pan

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 EvoCause 用 LLM 优化因果图以提升电信等系统的根本原因分析性能,发布了 TeleRCA 基准,在合成数据和真实网络数据上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16651 2026-07-31 cs.CL 版本更新 90%

Select or Project? Evaluating Lower-dimensional Vectors for LLM Training Data Explanations

选择还是投影?评估用于LLM训练数据解释的低维向量

Lukas Hinterleitner, Loris Schoenegger, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna(维也纳大学文学与文化研究系)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过对比选择和投影方法,发现有针对性的组件选择在LLM训练数据解释中更有效且计算更高效。

Comments KONVENS 2026. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28529 2026-07-31 cs.SE 新提交 88%

CoGate: Confidence-Gated Co-Decoding for Secure Code Generation

CoGate:用于安全代码生成的置信门控协同解码

Minghao Hu, Lannan Luo, Allen Roush, Phillip Howard

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 针对现有协同解码未考虑专家模型置信度的问题,提出CoGate方法,在多LLM后端和代码生成基准上优于CoSec+,在CWEval的Func-Sec@10指标最高提升12.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13977 2026-07-31 cs.CL cs.AI cs.LG 版本更新 87%

How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data

如何合成高质量的预训练数据?提示设计、生成模型和源数据的系统研究

Joel Niklaus, Atsuki Yamaguchi, Michal Štefánik, Guilherme Penedo, Hynek Kydlíček, Elie Bakouch, Lewis Tunstall, Edward Emanuel Beeching, Thibaud Frere, Colin Raffel, Leandro von Werra, Thomas Wolf

机构 * Hugging Face University of Sheffield(谢菲尔德大学) National Institute of Informatics(日本信息处理研究所)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过大规模实验探讨提示设计、生成模型和源数据对合成预训练数据质量的影响,发现结构化输出格式优于现有方法,且生成模型参数超过1B无额外收益,提出开源数据集FinePhrase。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05539 2026-07-31 cs.AI 版本更新 86%

From Large Language Model Predicates to Logic Tensor Networks: Neurosymbolic Offer Validation in Regulated Procurement

从大型语言模型谓词到逻辑张量网络:神经符号学在受规制采购中的投标验证

Cedric Haufe, Frieder Stolzenburg

机构 * Harz University of Applied Sciences(哈尔茨应用科学大学) Merseburg University of Applied Sciences(梅泽堡应用科学大学) University of New South Wales (UNSW)(新南威尔士大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 本文提出一种结合符号与子符号人工智能的神经符号方法,用于验证受规制公共机构的投标文件,通过语言模型提取信息并结合逻辑张量网络(LTN)进行可审计决策,提升决策的可解释性和合规性。

Comments 17 pages, 2 figures, 4 tables, extended version, with appendix

Journal ref In Diedrich Wolter and Gesina Schwalbe, editors, KI 2026: Advances in Artificial Intelligence -- 49th German Conference on AI, LNAI 16830, pages 236--243, Bremen, Germany, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28135 2026-07-31 cs.LG 新提交 83%

LM-GRASP: Instance-Specific Language Models for Combinatorial Construction via Online Imitation Learning

LM-GRASP:基于在线模仿学习的组合构造的实例特定语言模型

Mohand Mezmaz, Grégoire Danoy

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究提出LM-GRASP框架,将GRASP随机构造阶段转为在线模仿学习任务,用仅解码器Transformer作构造策略,在Taillard PFSP基准上平均比GPU-GRASP提升28.4个制造跨度单位,是手工构造器的实用替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27372 2026-07-31 cs.LG cs.AI cs.CL cs.CV 新提交 82%

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

探索式建模:解锁第三大预训练轴与端到端生成

Alexi Gladstone, Heng Ji, Yilun Du

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出探索式建模(XMs),为生成式模型增添第三预训练轴,可提升多域性能与效率,还能实现端到端重构生成建模,推理步骤大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15011 2026-07-31 cs.LG cs.AI cs.CY cs.MA 版本更新 81%

Epistemic diversity across language models mitigates knowledge collapse

语言模型中的知识崩溃与认知多样性

Damian Hodel, Jevin D. West

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过增加语言模型多样性缓解知识崩溃,发现单一模型短期表现好但长期崩溃加剧,多样性水平随训练迭代增加而提升,实验显示生态多样性对缓解崩溃至关重要。

Comments 30 pages, 21 figures. v3 changelog: updated introduction. v2 changelog: added experimental variations, updated theory, writing revisions, updated metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27731 2026-07-31 cs.LG cs.AI math.OC 新提交 73%

Towards joint scaling laws with optimal batch size schedules

面向最优批量大小调度的联合缩放律研究

Jiaxiang Li, Zhiqi Bu, Shiyun Xu

机构 * Meta

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究从凸优化视角推导了适用于通用优化器和模型架构的损失联合表征,得到闭式最优批量大小调度与联合缩放律,其性能优于固定批量大小基线,凸显动态批量大小调度在大语言模型训练中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28528 2026-07-31 cs.CL 新提交 70%

AI systems and the reproduction of (standard) language ideologies in World Englishes

AI系统与世界英语中(标准)语言意识形态的再生产

Kingsley Ugwuanyi

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨AI系统如何再生产世界英语领域的(标准)语言意识形态,以“标准化悖论”为例分析争议,主张采用更具包容性的AI设计方法。

Comments 13 pages, 0 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27928 2026-07-31 cs.LG 新提交 70%

Harnessing the Potential of Optimizing Data Mixtures via Bayesian Domain Reweighting

利用贝叶斯域重加权优化数据混合的潜力

Xiang Yuan, Kaiqing Lei, Zhenyu Jin, Jun Shu, Deyu Meng, Zongben Xu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出贝叶斯域加权方法,引入Gamma先验从狄利克雷分布推断权重,实现稳定高效的域权重学习,以更少数据识别最优数据混合,适用于大规模应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22078 2026-07-31 cs.RO 版本更新 67%

Do World Action Models Generalize Better than VLAs? A Robustness Study

世界动作模型是否比视觉语言动作模型表现更好?一项鲁棒性研究

Zhanguang Zhang, Zhiyuan Li, Behnam Rahmati, Rui Heng Yang, Yintao Ma, Amir Rasouli, Sajjad Pakdamansavoji, Yangzheng Wu, Lingfeng Zhang, Tongtong Cao, Feng Wen, Xinyu Wang, Xingyue Quan, Yingxue Zhang

机构 * Huawei Technologies(华为技术有限公司) University of Toronto(多伦多大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 本文比较了最新状态的VLA策略和最近发布的WAMs,在不同视觉和语言扰动下评估其性能,发现WAMs在鲁棒性上表现更强,而VLA需要大量训练数据和多样化学习目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27656 2026-07-31 cs.LG cs.CL 新提交 62%

Looped Transformers with Source-Centered State Evolution

以源为中心的状态演化循环Transformer

Bum Jun Kim, Kohei Hayashi, Shunsuke Kamiya, Masanori Koyama, Yusuke Iwasawa, Yutaka Matsuo

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出以源为中心的状态演化(SCSE)循环Transformer,解决输入条件与共享循环参考的协调问题,在多个文本任务中提升了可控循环质量,验证了其设计的有效性。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28525 2026-07-31 cs.LG cs.SI 新提交 57%

Same Graph Cross-Task Transfer in GNNs: Protocols and Predictors

GNN中的同图跨任务迁移:协议与预测器

Neelam Akula, Surbhi Kumar, Murat Kantarcioglu, Baris Coskunuzer

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 该研究针对GNN同图跨任务迁移的评估缺陷,提出无泄漏协议,发现迁移方向性规律,引入CTS指标,表明数据集同质性可指导机制选择以避免负迁移。

Comments 17 pages, 2 figures

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28109 2026-07-31 cs.AI 新提交 57%

Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training

超越改写:书籍级组织提升训练中合成教科书数据的质量

Jiawen Tao, Miao Peng, Yaoming Li, Xiaokun Yuan, Mengzhou Wu, Wenhan Yu, Guoan Wang, Nuo Chen, Tong Yang, Maxm Pan

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 本研究提出可扩展的合成教科书数据流程,发现书籍级组织可提升语言模型训练中期的下游性能,在Llama3-8B上也验证了该设计维度的有效性。

Comments 31 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27761 2026-07-31 cs.LG cs.CV 新提交 57%

DAS-PMVC: A Framework for Partial Multi-View Clustering via Dual Alignment and Structure Enhancement

DAS-PMVC:一种通过双对齐与结构增强实现的部分多视图聚类框架

Shubin Ma, Liang Zhao, Chuanye He, Zhenjiao Liu, Liang Zou, Lin Yuanbo Wu, Yu Shao

机构 * Dalian University of Technology(大连理工大学) Inspur Group Co., Ltd.(浪潮集团有限公司) China University of Mining and Technology(中国矿业大学) The University of Warwick(华威大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 该研究针对多视图聚类中的部分视图对齐问题,提出DAS-PMVC框架,通过锚点图结构对齐、结构增强特征学习与双对齐策略提升性能,在多数据集上优于现有最先进方法。

Comments 8 pages, 4 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27565 2026-07-31 cs.LG cs.HC 新提交 57%

A Montage-Agnostic Encoder for Calibration-Light Cross-User Gesture Recognition from Surface Electromyography

适用于任意电极 montage 的编码器:基于表面肌电信号的校准无关跨用户手势识别

Jethro Odeyemi, W. J. Zhang

机构 * Division of Biomedical Engineering, University of Saskatchewan(萨斯喀彻温大学生物医学工程系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出适用于任意电极 montage 的编码器,实现跨用户表面肌电手势识别,在 DB1、DB2 上性能优于 per-user Hudgins 线性判别分类器,训练池达一定规模后性能趋稳,自监督预训练无额外增益。

Comments 22 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27235 2026-07-31 cs.AI cs.CV 新提交 57%

RadHarmony: Radiological Data Handling in the Era of Agentic AI

RadHarmony:智能体AI时代的放射数据处理方案

Frank Li, Bardia Khosravi, Mohammadreza Chavoshi, Theo Dapamede, YoungSeok Jeon, Janice Newsome, Hari Trivedi, Judy Gichoya

机构 * Emory University(埃默里大学) Yale University(耶鲁大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 RadHarmony是一款开源Python库,用于统一处理异构放射数据集,引入AI智能体技能简化数据集整合,可预训练视觉Transformer基线并提供相关代码与模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28611 2026-07-31 cs.CV 新提交 50%

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

Chimera:设计与遵循Chinchilla缩放规律的混合视觉扩散Transformer

Chongjian Ge, Hanwen Jiang, Tianyu Wang, Jiuxiang Gu, Yiran Xu, Ziwen Chen, Shaoteng Liu, Jing Shi, Yicong Hong, Zefan Cai, Hailin Jin, Hao Tan

机构 * Adobe Research(奥多比研究院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 Chimera是一款混合视觉扩散骨干网络,结合KDA、MLA等模块与HeteroP缩放方案,训练出11B参数(2B激活)的模型,在计算效率、视频泛化等方面优于基线,为长上下文扩散架构设计提供基础。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28581 2026-07-31 cs.CV 新提交 50%

ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation

ROAD:用于3D形状生成的判别式语义的互目标对齐

Xiao Luo, Mingyang Du, Xin Zhou, Tianrui Feng, Xiwu Chen, Xiaofan Li, Jiangning Zhang, Dingkang Liang

机构 * Huazhong University of Science and Technology(华中科技大学) Megvii(旷视科技) Zhejiang University(浙江大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 ROAD框架通过迁移判别式3D基础模型的先验,采用互目标对齐策略,仅用1.5%训练数据就实现了高保真3D生成,大幅降低了计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28251 2026-07-31 eess.SY cs.SY 新提交 50%

Self-Evolving Learning for Embodied AI with Criticality Model

基于临界模型的具身智能自进化学习

Linxuan He, Yuying Tian, Lingxiang Fan, Jiaqi Pi, Yinqiao Lu, Shang Su, Mengkai Shi, Shuo Feng

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出基于临界模型的具身智能自进化学习方法,通过状态级临界模型引导采样易失败场景,在多类具身任务中显著降低失败率,性能优于基线及同类先进模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27841 2026-07-31 quant-ph 新提交 50%

Quantum machine learning interatomic potential: Application of variational quantum algorithm

量子机器学习原子间势:变分量子算法的应用

Kohei Numata, Wataru Mizukami, Kosuke Mitarai, Keisuke Fujii, Yutaka Imamura

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本研究将量子电路学习应用于MLIP,采用量子迁移学习架构再训练ANI模型,发现结合量子电路的MLIP在预训练模型精度有提升空间时,精度略高于全经典神经网络,可推进量子机器学习在MLIP中的应用。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07861 2026-07-31 cs.CV 版本更新 50%

From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data

从合成到真实:迈向身份一致的化妆转移的合成与真实数据

Yue Yu, Jiayu Wang, Jiajia Shi, Zhiyu Tan, Hao Li, Jingjing Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 预训练与数据 :post-training(abstract)

AI总结 本文提出ConsistentBeauty和RealBeauty方法,通过合成数据筛选和强化学习提升化妆转移的逼真度与身份一致性,并建立多样化基准测试以评估模型在复杂真实场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏