arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-03 至 2026-08-03 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 18 篇

2603.09161 2026-08-03 cs.LG cs.AI cs.AR 版本更新 92%

Wrong Code, Right Structure: Learning Netlist Representations from Imperfect LLM-Generated RTL

错误代码,正确结构:从不完美的LLM生成RTL学习网表表示

Siyang Cai, Cangyuan Li, Haoyu Gao, Kun Wang, Yinhe Han, Ying Wang

机构 * CICS, Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用不完美的LLM生成RTL进行网表表示学习,通过数据增强和端到端流程,提升电路分析任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10917 2026-08-03 cs.AI 版本更新 92%

Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution

Role-Agent: 通过双角色演化引导LLM智能体

Xucong Wang, Ziyu Ma, Shidong Yang, Tongwen Huang, Pengkun Wang, Yong Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Role-Agent框架,让单个LLM同时作为智能体和环境,通过世界在智能体(WIA)和智能体在世界(AIW)两个组件实现自举协同演化,在多个基准上平均提升超过4%。

Comments 20 pages, including 12 pages of main text and 8 pages of appendix; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01049 2026-08-03 cs.CL 版本更新 90%

Beyond Captions: Context-Grounded Reconstruction for Biomedical Multimodal Continued Pretraining

PMC-InterCPT:重新思考用于多模态持续预训练的医学交错数据

Guanghao Zhu, Zeyu Liu, Zhitian Hou, Pengkai Wang, Zhijie Sang, Yang Yu, Minheng Ni, Wenjun Wang, Yanggan Gu, Shuo Cai, Congkai Xie, Jianmin Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) Sun Yat-sen University(中山大学) InfiX.ai PolyU-Daya Bay Technology and Innovation Research Institute(PolyU-大亚湾技术与创新研究院)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 针对医学多模态持续预训练中图像-文本对数据存在的上下文缺失、结构噪声等问题,提出PMC-InterCPT交错语料库,通过恢复缺失标题、清洗文本、重建交错样本及LLM监督过滤,结合模态感知重采样,有效提升医学与通用多模态性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29129 2026-08-03 cs.LG 新提交 84%

PluRel-to-RDB-PFN: Schema-Guided Synthetic Relational Pretraining

PluRel-to-RDB-PFN:模式引导的合成关系预训练

Mohammad Sadeq Abolhasani, Viswanath Ganapathy

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract,comments);分类 cs.LG

AI总结 该研究将合成关系数据库生成器PluRel作为RDB-PFN的外部预训练数据源,通过三种课程策略对比,发现模式优先引导策略仅用少量数据即可恢复RDB-PFN近94%的性能,证实早期接触真实模式的有效性。

Comments Proceedings of the 2nd ICML on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29484 2026-08-03 cs.CL cs.LG 新提交 81%

Evidence-Type Competition: When Can Interventional Data Teach Language Models Causal Direction?

证据类型竞争:干预数据何时能教会语言模型因果方向?

Xining Xun

机构 * Tsingjiao Information Science (Beijing) Co., Ltd(北京清教信息科技有限公司)

专题命中 预训练与数据 :language model(title);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现干预数据训练语言模型因果推理的金标准假设存在局限,观测上下文会抑制模型的因果方向判断能力,提出证据平均方案可降低符号错误率。

Comments 13 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28994 2026-08-03 cs.NI cs.AI cs.CV cs.LG 新提交 81%

Point2Radio: A Foundation Model for Cross-Scene Radio Fields from Material-Aware Point Clouds

Point2Radio:面向材料感知点云的跨场景无线电场基础模型

Chaozheng Wen, Chenghong Bian, Hongze Chen, Jun Zhang

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 Point2Radio是从多环境学习可迁移传播先验的基础模型,基于材料感知点云实现跨场景无线电场预测,在路径增益预测上较UNet基线误差降76.7%,轻量微调可提升环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29120 2026-08-03 cs.LG cs.DB 新提交 79%

Curriculum Matters: Data-Efficient Relational PFN Pretraining with Synthetic Data

课程很重要:基于合成数据的数据高效关系型PFN预训练

Mohammad Sadeq Abolhasani, Viswanath Ganapathy

机构 * SAP Labs, LLC.(思爱普实验室有限责任公司)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 该研究针对关系型PFN预训练,发现采用PluRel作为合成数据源,渐进式课程设计可大幅减少所需合成数据量,且其性能接近专用关系型管线,凸显课程设计与合成数据多样性的关键作用。

Comments Accepted to the International Conference on Very Large Databases (VLDB 2026), Tabular Data Analysis (TaDA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22146 2026-08-03 cs.CL cs.LG 版本更新 79%

FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale

精细指令:将合成指令扩展到预训练规模

Ajay Patel, Colin Raffel, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型监督训练数据有限的问题,提出将互联网规模预训练文档知识转化为合成指令和答案训练对的程序,生成FineInstructions数据集,经实验验证该方法在预训练中表现优于其他技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13187 2026-08-03 cs.CY cs.AI cs.CL 版本更新 79%

"Not in My Backyard": LLMs Uncover Online and Offline Social Biases Against Homelessness

"Not in My Backyard":LLMs揭示针对无家可归者的在线和线下社会偏见

Jonathan A. Karr, Benjamin F. Herbst, Matthew L. Sisk, Xueyun Li, Ting Hua, Matthew Hauenstein, Georgina Curto, Nitesh V. Chawla

机构 * University of Notre Dame(诺丁汉大学) United Nations University Institute in Macau(联合国大学澳门研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文通过大规模数据集和LLM训练揭示了针对无家可归者的在线和线下社会偏见,展示了数据量对模型性能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19683 2026-08-03 cs.RO 版本更新 78%

GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning

GPA-RAM:用于空间任务学习的抓取预训练增强型机器人注意力Mamba

Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家一般人工智能重点实验室,北京大学深圳研究生院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) State Key Laboratory of Internet of Things for Smart City, University of Macau(智慧城市物联网重点实验室,澳门大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 该研究提出GPA-RAM框架,通过GPA增强模仿策略并开发RAM实现高效计算,在多机器人平台的空间操纵任务中显著提升成功率,兼顾精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29283 2026-08-03 cs.AR cs.LG 新提交 77%

RTLCurator: Label-Efficient Data Curation for RTL Generation

RTLCurator:用于RTL生成的标签高效数据整理

Siyang Cai, Cangyuan Li, Wenjing Chang, Kun Wang, Haoyu Gao, Yinhe Han, Ying Wang

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 RTLCurator通过对比规范与模拟失败的实现学习兼容性先验,用少量验证配对校准后,平衡对齐度、覆盖度与结构丰富度保留80%语料,在CodeV和RTLCoder上提升RTL生成模型性能,仅需验证10%语料池。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29188 2026-08-03 cs.CL 新提交 77%

Detecting Experiential Intertextuality Across Migration Routes: Beyond Surface Similarity in French Narratives

检测移民路线间的经验互文性:法语叙事中超越表面相似性

Sakayo Toadoum Sari, Nelly Robin, Michelle Auzanneau, Lakhdar Sais, Veronique Petit, Marie Veniard, Said Jabbour, Fabien Delorme

机构 * CRIL, CNRS – Université d’Artois(CRIL,法国国家科学研究中心——阿图瓦大学) CEPED, Université Paris Cité(CEPED,巴黎西岱大学) EDA, Université Paris Cité(EDA,巴黎西岱大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 本文提出无需标注训练数据的经验互文性检测任务,采用多种方法分析法语移民叙事,发现Qwen2.5-7B零-shot及监督混合方法表现最优,且叙事位置显著影响互文性。

Comments 11 pages, 3 figures, 5 tables. Accepted at SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)

Journal ref Proceedings of the 27th Annual Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL 2026), Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29065 2026-08-03 cs.CL 新提交 70%

Tokenizer-Agnostic Engram Module

与分词器无关的恩格拉姆模块(Tokenizer-Agnostic Engram Module)

Jia Peng Lim, Hai Leong Chieu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对Deepseek Engram模块与分词器耦合的问题,通过替换哈希方式构建联合嵌入空间,实现了分词器无关性,同时保持了相当的性能。

Comments Preprint, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29019 2026-08-03 cs.CR cs.CL cs.IR 新提交 70%

GoldenRetriever: Non-Interactive Homomorphic Encrypted Retrieval for Privacy-Preserving RAG

GoldenRetriever:用于隐私保护RAG的非交互式同态加密检索

Yang Gao, Gang Quan, Scott Piersall, Qian Lou, Dongdong Wang, Liqiang Wang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有隐私保护RAG检索方案延迟高、易泄露的问题,提出基于阈值选择的非交互式同态加密检索框架,通过CKKS同态计算与掩码极化方法实现高效安全的检索,性能优于排名式加密方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25464 2026-08-03 cs.LG cs.AI 版本更新 62%

Maximum Entropy Behavior Exploration for Sim2Real Zero-Shot Reinforcement Learning

为实机零样本强化学习的最大熵行为探索

Jiajun Hu, Nuria Armengol Urpi, Jin Cheng, Stelian Coros

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FB-MEBE算法,通过最大熵行为探索策略和正则化批评者,提升实机四足机器人控制的零样本强化学习性能,实现自然可部署的政策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15475 2026-08-03 cs.CL cs.LG 62%

Influence-driven Curriculum Learning for Pre-training on Limited Data

Loris Schoenegger, Lukas Thoma, Terra Blevins, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学UniVie计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna(维也纳大学文学与文化研究系) Khoury College of Computer Sciences, Northeastern University(东北大学Khoury计算机科学学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

Comments Added acknowledgments section. 9 pages, Accepted to the BabyLM Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26924 2026-08-03 cs.LG cs.RO 版本更新 57%

Temporally Centered SIGReg Improves Multi-Task LeWorldModel Learning: From Analysis to Method

时间中心SIGReg改进多任务LeWorldModel学习:从分析到方法

Chang Liu, Fei Suo, Yanzhou Jin, Yusuke Iwasawa, Yutaka Matsuo, Yaonan Zhu

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工程学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 该研究针对SIGReg在多任务LeWM中导致表示混叠的问题,提出将其应用于时间中心残差的改进方法,在LIBERO基准上显著提升了多任务世界模型的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28796 2026-08-03 cs.CV 新提交 50%

Can Synthetic Data Overcome the Generalization Limits of AI-Based Flower and Pod Detection Across Cowpea Breeding Genotypes and Environments?

合成数据能否克服基于AI的豇豆花与荚果检测在不同育种基因型及环境下的泛化极限?

Hamid Kamangir, Jonathan Berlingeri, Earl Ranario, Isaac Kazuo Uyehara, Lars Lundqvist, Heesup Yun, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * University of California Davis(加州大学戴维斯分校)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本研究针对AI豇豆花荚检测在不同基因型环境下泛化差的问题,发现优化的HDR合成数据仅需少量真实图像即可达到真实数据基线性能,证实合成数据可克服该检测的泛化极限。

详情

展开后加载摘要…

URL PDF HTML 收藏