arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-06 至 2026-08-06 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 21 篇

2509.08604 2026-08-06 cs.CL cs.AI 版本更新 90%

Memorization in Large Language Models in Medicine: Prevalence, Characteristics, and Implications

医学领域大型语言模型中的记忆现象:普遍性、特征与影响

Anran Li, Lingfei Qian, Mengmeng Du, Yu Yin, Yan Hu, Zihao Sun, Yihang Fu, Hyunjae Kim, Erica Stutz, Xuguang Ai, Qianqian Xie, Rui Zhu, Jimin Huang, Yifan Yang, Siru Liu, Yih-Chung Tham, Lucila Ohno-Machado, Hyunghoon Cho, Zhiyong Lu, Hua Xu, Qingyu Chen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨医学领域大型语言模型的记忆现象,分析其普遍性、特征及对医疗应用的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25465 2026-08-06 cs.SE 版本更新 89%

BloomAPR: A Bloom's Taxonomy-based Framework for Assessing the Capabilities of LLM-Powered APR Solutions

BloomAPR:基于布鲁姆教育目标分类学的框架,用于评估大语言模型驱动的自动程序修复(APR)方案的能力

Yinghang Ma, Jiho Shin, Leuson Da Silva, Zhen Ming, Jiang, Song Wang, Foutse Khomh, Shin Hwei Tan

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 BloomAPR是基于布鲁姆教育目标分类学的动态评估框架,评估了ChatRepair、CigaR等APR方案在不同LLM及布鲁姆分类层级下的漏洞修复能力,发现其存在性能差异并指出基准演进的必要性。

Comments 22 pages, 7 figures, Manuscript submitted to ACM Transactions on Software Engineering and Methodology

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05050 2026-08-06 cs.CY cs.AI cs.CL 新提交 87%

The Effect of Perceived Race and Gender on Police Language Use: Experimental Evidence from VR Simulations

感知到的种族与性别对警察语言使用的影响:来自VR模拟的实验证据

Sandra C. Sandoval, Navita Goyal, Rashawn Ray, Long Doan, Rachel Rudinger, Hal Daumé

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过VR模拟实验发现,警察对黑人男性虚拟角色的说话恭敬程度更低,还探讨了LLM在ATE估计中的应用,推荐混合效应模型结合iptw方法,认为LLM相关技术需进一步完善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05076 2026-08-06 cs.LG cs.AI eess.SP 新提交 84%

MultiPathFormer: Towards a Foundation Model for Multipath Wireless Propagation

MultiPathFormer:迈向多径无线传播的基础模型

Blessed Guda, Kayley Sze, Carlee Joe-Wong

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出MultiPathFormer,以多径传播为预训练对象,结合Environmental RAG机制,在27种环境预训练后,在多项无线通信下游任务中超越SOTA模型,验证了路径级预训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05028 2026-08-06 cs.CL 新提交 83%

Language Models Generalize to Human-like Word Order Preferences

语言模型可泛化出类人的词序偏好

Amanda Popadich, Shane Steinert-Threlkeld

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本研究发现不同规模的语言模型可从贫乏输入中泛化出类人的范围同态名词短语修饰语顺序偏好,且该偏好无法用点互信息解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04268 2026-08-06 cs.CL 新提交 83%

The Fairness Collapse Phenomenon: Bias Amplification in Language Models Trained on Synthetic Data

公平性崩溃现象:在合成数据上训练的语言模型中的偏差放大

Irina Proskurina, Antoine Gourru, Julien Velcin

机构 * Laboratoire Hubert Curien(于贝尔·屈里安实验室) CNRS(法国国家科学研究中心) Université Claude Bernard Lyon 1(里昂第一大学) Université Lumière Lyon 2(里昂第二大学) École Centrale de Lyon(里昂中央理工学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 该研究发现,在合成数据上反复训练语言模型会出现公平性崩溃,即偏差在标准指标未明显下降时悄然放大,揭示了合成数据污染的关键风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20254 2026-08-06 cs.CV 82%

MIRepNet: A Pipeline and Foundation Model for EEG-Based Motor Imagery Classification

Dingkun Liu, Zhu Chen, Jingwei Luo, Shijie Lian, Dongrui Wu

机构 * Ministry of Education Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(教育部长图像处理与智能控制重点实验室,人工智能与自动化学院,华中科技大学) School of Computer Science and Technology, Huazhong University of Science and Technology(计算机科学与技术学院,华中科技大学) Zhongguancun Academy(中关村学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

Journal ref Knowledge-Based Systems (15 June 2026, vol. 343)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06835 2026-08-06 cs.CL 版本更新 81%

Translate-R1: Cost-Aware Translation Tool Use via Reinforcement Learning

Translate-R1:通过强化学习实现成本感知的翻译工具使用

Pratik Jayarao, Chaitanya Dwivedi, Himanshu Gupta, Neeraj Varshney, Adithya M Devraj, Meet Vadera, Priyanka Nigam, Bing Yin

机构 * Amazon Stores Foundation AI(亚马逊商店基金会人工智能)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 提出一种基于强化学习的门控策略,让LLM自主评估理解能力,仅在必要时调用翻译工具,在22种语言上提升奖励并降低翻译成本。

Comments 14 pages main text plus appendix, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05108 2026-08-06 cs.CR 新提交 80%

Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

智能体对抗智能体:一种用于自动提示注入红队测试的智能体系统

Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本研究提出PIMiner智能体系统,用于自动提示注入红队测试,该系统构建可迁移策略库,仅需少量查询即可在IPIArena、AgentDojo基准上对多款LLM实现高攻击成功率,解决现有方法泛化性差的问题。

Comments Our code is available at https://github.com/wang-yanting/PIMiner

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04213 2026-08-06 cs.LG 新提交 74%

Attention-Only White-Box Transformer via LeJEPA-Based Self-Supervised Pretraining

基于LeJEPA自监督预训练的仅注意力白盒Transformer

Yang Bai, Linyuan Wang, Haoyang Jiang, Nuolin Sun, Libin Hou, Bin Yan

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本研究提出基于LeJEPA自监督预训练的仅注意力白盒Transformer,减少约31%参数,在CIFAR-10、CIFAR-100上实现与原模型相当的准确率,还发现标准ViT中MLP模块存在冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04678 2026-08-06 cs.CL cs.LG 新提交 73%

Kathleen Writes: Autoregressive Generation and Data Scaling Without Attention

Kathleen Writes:无注意力的自回归生成与数据缩放

George Fountzoulas

机构 * Frederick University(弗雷德里克大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出无注意力的混响模型,在字节级语言建模上优于参数匹配的Transformer,引入FORM DISTANCE衡量文本真实性,发现解码策略对生成性能的影响大于架构,且增益依赖训练语料库内的短语。

Comments Paper 3 of the Kathleen series. 11 pages, 3 figures. All experiments reproducible on a free Kaggle T4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05088 2026-08-06 cs.LG 新提交 70%

MALT: Lightweight Curvature-Aware Muon via Diagonal Preconditioning

MALT:通过对角预条件化实现的轻量曲率感知Muon

Tongle Wu, Huanyu Dong, Ying Sun, Ziye Ma

机构 * School of Electrical Engineering and Computer Science, The Pennsylvania State University(宾夕法尼亚州立大学电气工程与计算机科学学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 针对Muon未考虑损失景观曲率几何的问题,提出轻量曲率感知优化方法MALT及MALTER,在GPT-2系列预训练上性能优于Muon且开销相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04377 2026-08-06 cs.LG cs.AI 新提交 62%

Towards Trustworthy Hypergraph Neural Networks under Label Noise

面向标签噪声下可信赖的超图神经网络

Mengyao Zhou, Zhiheng Zhou, Xiao Han, Guiying Yan

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Mathematics and Statistics, Shandong University(山东大学数学与统计学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文针对标签噪声下超图节点分类问题,提出超图鲁棒框架HyperTrust,通过估计超边可信赖性及两个协同模块优化超图结构,在多数据集多噪声设置下验证了其有效性。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05451 2026-08-06 cs.LG cs.CL 版本更新 62%

RingSQL: Schema-Independent Synthetic Data Generation for Text-to-SQL Reinforcement Learning

RingSQL: 通过不依赖模式的模板生成合成数据以用于文本到SQL推理模型

Marko Sterbentz, Kevin Cushing, Cameron Barrie, Kristian J. Hammond

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 RingSQL通过结合不依赖模式的模板和大语言模型生成,提升文本到SQL模型的准确性和多样性

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04808 2026-08-06 cs.CL 新提交 57%

A Modular Part-of-Speech Tagger for Scottish Gaelic using spaCy

使用spaCy构建的苏格兰盖尔语模块化词性标注器

Peter Stefan, Peter J Barclay, Alistair Lawson

机构 * School of Computing, Engineering, & the Built Environment, Edinburgh Napier University(爱丁堡龙比亚大学计算、工程与建成环境学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本文基于spaCy框架,用苏格兰盖尔语标注参考语料库训练出两个形态标注模型,在低资源形态复杂的盖尔语上取得与现有模型相当的准确率,证明现成NLP流水线可用于该类语言处理。

Comments A revised version of this paper has been accepted for presentation at UKCI 2026 (https://ukci2026.coventry.ac.uk/home/) and will be published by Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04706 2026-08-06 cs.LG 新提交 57%

Benchmarking Deep Learning Models for Dense Event Classification of Offshore Wind Infrastructure in Sentinel-1 Time Series

对Sentinel-1时间序列中海上海上风电基础设施密集事件分类的深度学习模型进行基准测试

Thorsten Hoeser, Felix Bachofer, Claudia Kuenzer

机构 * German Aerospace Center (DLR)(德国航空航天中心) University of Wuerzburg(维尔茨堡大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 该研究对比10种深度学习模型,发现监督式BiLSTM在Sentinel-1海上风电时间序列分类中表现最优,结合集成方法提升性能后,分析得出中、欧盟、英的风机中位部署时长。

Comments 27 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04389 2026-08-06 cs.LG 新提交 57%

NeuroPB: Scaling Neural Decoding with Pretrained Behavioral Representations

NeuroPB:利用预训练行为表示扩展神经解码

Luyao Jin, Yonghao Song, Huan Zhao, Vincent C. K. Cheung, Wei-Hsin Liao

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出NeuroPB框架,通过预训练大规模行为表示并对齐有限配对神经-行为数据,提升神经解码性能,在猕猴数据集上R²提升11%与8%,且泛化能力强,为高效BCI提供可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19840 2026-08-06 cs.CR cs.LG 版本更新 57%

One Surrogate to Fool Them All: Universal, Transferable, and Targeted Adversarial Attacks with CLIP

用一个替代模型欺骗所有:基于CLIP的通用、可迁移且有针对性的对抗攻击

Binyan Xu, Xilin Dai, Di Tang, Kehuan Zhang

机构 * The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Sun Yat-sen University(中山大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文提出基于CLIP的UnivIntruder攻击框架,仅用公开模型和数据集生成对抗扰动,在ImageNet、CIFAR-10及图像搜索引擎、视觉语言模型上实现高攻击成功率,凸显AI安全需重新评估。

Comments 22 pages, 15 figures, 18 tables. To appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05100 2026-08-06 cs.CV 新提交 50%

Lesion Detection in CT with Frozen Self-Distilled Features: SALT, a Spatially Adaptive Label-Guided Temperature

基于冻结自蒸馏特征的CT病灶检测:SALT——空间自适应标签引导温度

Mahmut S. Gokmen, Evan W. Damron, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner

机构 * University of Kentucky(肯塔基大学) University of Louisville(路易斯维尔大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 该研究提出SALT方法,通过空间自适应标签引导温度优化自监督预训练,冻结编码器后训练轻量级CenterNet头部,在四个CT队列中实现病灶检测,效果优于无目标条件化的对照模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04833 2026-08-06 cs.CV 新提交 50%

RegisterBridgeMM: A Register-Centric Framework for RGB-Infrared Object Detection

RegisterBridgeMM:一种以寄存器为核心的RGB-红外目标检测框架

Zian Wang, Hangchuan Liang, Yuehua Chen, Changchun Li, Chaoyi Guo, Mingzhe Liu, Fangming Gu

机构 * Jilin University(吉林大学) Taiyuan University of Technology(太原理工大学) Shenzhen University(深圳大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对RGB-红外目标检测的跨模态融合难题,提出以寄存器为核心的RegisterBridgeMM框架,通过三阶段寄存器生命周期实现高效融合,在四个基准数据集上取得最高mAP50-95性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01410 2026-08-06 cs.RO cs.CV 版本更新 50%

GenTrack: Physical Alignment for Robot-Native Motion Generation and Zero-Shot Humanoid Tracking

GenTrack:面向机器人原生运动生成与零样本人形机器人跟踪的物理对齐框架

Zeyu Ling, Xinyao Yu, Renye Yan, Jikang Cheng, Zhanke Wang, Qing Shuai, Changqing Zou

专题命中 预训练与数据 :post-training(abstract)

AI总结 GenTrack是一种在线生成器-跟踪器框架,通过协同训练缩小重定向参考与机器人原生运动的可执行性差距,在Unitree G1机器人上实现了零样本人形机器人跟踪性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏