arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-16 至 2026-04-16 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 18 篇

2503.22760 2026-04-16 cs.CR cs.LG cs.PL 92%

Malicious and Unintentional Disclosure Risks in Large Language Models for Code Generation

大型语言模型在代码生成中的恶意与非故意披露风险

Rafiqul Rabin, Sean McGregor, Nick Judd

机构 * Digital Safety Research Institute(数字安全研究研究院) UL Research Institutes(UL研究机构)

专题命中 预训练与数据 :language model(title,summary_cn);large language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究了大型语言模型在代码生成训练中可能泄露训练数据中的敏感信息的风险,分析了非故意和恶意披露两种风险,并通过Open Language Model模型评估了不同数据集和模型版本的风险变化。

Comments The 3rd International Workshop on Mining Software Repositories Applications for Privacy and Security (MSR4P&S), co-located with SANER 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13777 2026-04-16 cs.CL cs.AI 91%

From Anchors to Supervision: Memory-Graph Guided Corpus-Free Unlearning for Large Language Models

从锚点到监督:基于记忆图的无语料去学习框架

Wenxuan Li, Zhenfei Zhang, Mi Zhang, Geng Hong, Mi Wen, Xiaoyu You, Min Yang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai University of Electric Power(上海电力大学) School of Information Science and Engineering, East China University of Science and Technology(东华大学信息科学与工程学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出MAGE框架,通过用户提供的轻量锚点识别目标实体,利用记忆图恢复相关记忆并生成监督,实现无语料的去学习,有效提升隐私保护和审计能力。

Comments 15 pages, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03826 2026-04-16 cs.SE 86%

Context Matters: Evaluating Context Strategies for Automated ADR Generation Using LLMs

上下文至关重要:使用LLM评估自动化ADR生成的上下文策略

Aviral Gupta, Rudra Dhar, Daniel Feitosa, Karthik Vaidhyanathan

专题命中 预训练与数据 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了不同上下文策略对自动化ADR生成质量的影响,发现上下文提示显著提升生成准确性,小范围历史记录在质量和效率间取得最佳平衡。

Comments 11 pages, 5 diagrams, Accepted at EASE Conference 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01738 2026-04-16 cs.CV 85%

Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models

简单即正义:视觉基础模型中通用可推广AIGI检测的出现

Yue Zhou, Xinan He, Kaiqing Lin, Bing Fan, Feng Ding, Bin Li

机构 * Shenzhen University(深圳大学) Nanchang University(南昌大学) University of North Texas(北得克萨斯大学)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出通过简单线性分类器在现代视觉基础模型冻结特征上训练,实现超越专门检测器的AIGI检测性能,尤其在真实世界数据集上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14142 2026-04-16 cs.LG cs.AI cs.CL 83%

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space

从P(y|x)到P(y):在预训练空间中研究强化学习

Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tencent AI Lab(腾讯AI实验室)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PreRL和DSRL方法,通过优化预训练空间中的边际分布P(y),提升LLM推理能力,并通过NSR机制增强推理效果,实验表明DSRL在推理任务中表现优异。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13103 2026-04-16 cs.SE cs.MA 83%

Fairness in Multi-Agent Systems for Software Engineering: An SDLC-Oriented Rapid Review

多代理系统在软件工程中的公平性:面向软件开发生命周期的快速综述

Corey Yang-Smith, Ronnie de Souza Santos, Ahmad Abdellatif

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了多代理系统在软件工程中的公平性研究,分析了LLM赋能环境下的公平性框架,指出当前研究在评估实践、泛化能力及缓解机制方面存在三大不足。

Comments 8 pages, 4 figures. Accepted to the LLMTrust workshop at FSE Companion 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13489 2026-04-16 astro-ph.GA astro-ph.IM 80%

A Unified HI Rotation Curve Corpus for Computational Astrophysics: 438 Galaxies from SPARC, THINGS, LITTLE THINGS, and WALLABY DR2

为计算天文学构建统一的HI旋转曲线数据集:来自SPARC、THINGS、LITTLE THINGS和WALLABY DR2的438个星系

David C. Flynn

专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一个统一的HI旋转曲线数据集,包含423个星系的8963个空间分辨测量,用于传统分析和LLM检索增强生成。

Comments 18 pages, 3 figures, 3 tables. Data available at https://zenodo.org/records/19563417. Submitted to Astronomy and Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15170 2026-04-16 cs.CV 80%

Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval

多维知识谱系:基于大规模文献数据库与分层检索

Zhucun Xue, Jiangning Zhang, Juntao Jiang, Jinzhuo Liu, Haoyang He, Teng Hu, Xiaobin Hu, Yong Liu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) APRIL Lab(APRIL实验室) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文通过整合22个顶级会议2020-2025年的10万+论文,构建多维知识谱系分析框架,结合主题聚类、LLM解析与结构检索,揭示研究主题生命周期、方法迁移、数据集与模型使用模式及机构研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13620 2026-04-16 cs.CL cs.AI 73%

Syn-TurnTurk: A Synthetic Dataset for Turn-Taking Prediction in Turkish Dialogues

Syn-TurnTurk:一种用于土耳其对话中轮询预测的合成数据集

Ahmet Tuğrul Bayrak, Mustafa Sertaç Türkel, Fatma Nur Korkmaz

机构 * Qwen(通义实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Syn-TurnTurk数据集,通过Qwen大语言模型生成土耳其对话数据,用于提升轮询预测的准确性与AUC分数,促进自然的人机交互。

Comments Accepted for publication in IEEE ICASI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13054 2026-04-16 cs.CL cs.AI cs.CV 73%

Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling

先caption,后VQA:知识密度而非任务格式驱动多模态扩展

Hongjian Zou, Yue Ge, Qi Ding, Yixuan Liao, Xiaoxin Chen

机构 * vivo AI Lab(vivo人工智能实验室) Wuhan University(武汉大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,多模态模型扩展的关键瓶颈在于训练数据的知识密度而非任务格式,通过结构化caption增强和跨模态知识注入可提升模型性能,表明当前多模态模型因训练数据知识覆盖不足而难以扩展。

Comments 23 pages, 4 figures, 10 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13313 2026-04-16 cs.LG 70%

Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding

具体丛林:迈向由具体性铺就的对比负样本挖掘以实现组合理解

Eun Woo Im, Dhruv Madhwal, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出ConcretePlant,通过增强具体性术语的修改来提升对比学习信号,解决负样本生成中的梯度失衡问题,提出Cement损失函数以动态校准惩罚,实现更有效的组合理解。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08639 2026-04-16 cs.CV cs.AI 70%

UNBOX: Unveiling Black-box visual models with Natural-language

UNBOX:通过自然语言揭示黑盒视觉模型

Simone Carnemolla, Chiara Russo, Simone Palazzo, Quentin Bouniot, Daniela Giordano, Zeynep Akata, Matteo Pennisi, Concetto Spampinato

机构 * University of Catania(卡塔尼亚大学) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(海德堡-慕尼黑马克斯·普朗克研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 UNBOX在无数据、无梯度、无反向传播约束下,利用大语言模型和扩散模型生成可解释文本描述,揭示模型隐含概念与潜在偏见,通过实验验证其在ImageNet-1K等数据集上的有效性。

Comments Under review at IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11329 2026-04-16 cs.CL 70%

F-Actor: Controllable Conversational Behaviour in Full-Duplex Models

F-Actor:全双工模型中的可控对话行为

Maike Züfle, Ondrej Klejch, Nicholas Sanders, Jan Niehues, Alexandra Birch, Tsz Kin Lam

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University of Edinburgh(爱丁堡大学) NatWest(国立西敏银行)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出首个可训练的全双工对话语音模型,通过冻结音频编码器仅微调语言模型,在有限资源下实现高效训练,支持通过指令控制说话声音、话题和对话行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13275 2026-04-16 cs.CL cs.LG 62%

Better and Worse with Scale: How Contextual Entrainment Diverges with Model Size

更大与更小:如何在模型规模下语境同步发生分歧

Dikshant Kukreja, Kshitij Sah, Gautam Gupta, Avinash Anand, Rajiv Ratn Shah, Zhengkui Wang, Aik Beng Ng, Erik Cambria

机构 * IIIT Delhi, India(德里印度理工学院) Nanyang Technological University(南洋理工大学) NVIDIA(NVIDIA公司) Singapore Institute of Technology(新加坡理工学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了模型规模对语境同步的影响,发现大模型在忽略虚假信息方面更有效,但对无关token的忽略能力下降,揭示了语义过滤与机械复制的对立行为。

Comments 16 pages, 11 figures, 6 tables. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13438 2026-04-16 cs.LG 57%

WIN-U: Woodbury-Informed Newton-Unlearning as a retain-free Machine Unlearning Framework

WIN-U:基于Woodbury的牛顿反向学习作为无保留数据的机器反向学习框架

Xingjian Zhao, Mohammad Mohammadi Amiri, Malik Magdon-Ismail

机构 * Department of Computer Science(计算机科学系) Rensselaer Polytechnic Institute(拉特克利夫理工学院)

专题命中 预训练与数据 :LLM(abstract_cn);分类 cs.LG

AI总结 WIN-U提出了一种无需保留数据的机器反向学习框架,通过单次牛顿步骤和Woodbury矩阵恒等式实现高效反向学习,提升去噪效果和鲁棒性。

Comments 21 pages, 3 figures, under review at COLM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13307 2026-04-16 cs.CV cs.LG 57%

Deep Spatially-Regularized and Superpixel-Based Diffusion Learning for Unsupervised Hyperspectral Image Clustering

深度空间正则化与超像素基于扩散学习的无监督超光谱图像聚类

Vutichart Buranasiri, James M. Murphy

机构 * Tufts University(塔夫茨大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出一种结合掩码深度表征学习与扩散聚类的无监督超光谱图像聚类框架,通过改进的空间正则化超像素扩散学习算法,提升聚类质量。

Comments To appear in IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10877 2026-04-16 cs.LG 57%

Guided Transfer Learning for Discrete Diffusion Models

指导式迁移学习用于离散扩散模型

Julian Kleutgens, Claudio Battiloro, Lingkai Kong, Benjamin Grewe, Francesca Dominici, Mauricio Tec

机构 * Harvard University(哈佛大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文提出GTL方法,通过比率引导实现离散扩散模型的迁移学习,解决小数据下模型性能问题,展示在序列数据中效果显著,但存在源分布与目标分布重叠不足时的失效模式。

Comments Accepted at ICLR 2026 ReALM-GEN Workshop 9 pages (main text) + appendix

Journal ref ICLR 2026 ReALM-GEN Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01773 2026-04-16 cs.RO 50%

IGen: Scalable Data Generation for Robot Learning from Open-World Images

IGen: 为机器人学习从开放世界图像中实现可扩展的数据生成

Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) Beijing University of Chemical Technology(北京化工大学) Shanghai Jiao Tong University(上海交通大学) Shenzhen University of Infomation Technology(深圳信息大学)

专题命中 预训练与数据 :language model(abstract)

AI总结 本文提出IGen框架,通过开放世界图像生成高质量的视觉-运动数据,验证了其在机器人学习中的有效性。

Comments 8 pages, 8 figures; Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏