arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-13 至 2026-04-13 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 18 篇

2602.04674 2026-04-13 cs.SI cs.AI cs.CL 86%

Overstating Attitudes, Ignoring Networks: LLM Biases in Simulating Misinformation Susceptibility

夸大态度,忽视网络:LLM在模拟虚假信息易感性中的偏见

Eun Cheol Choi, Lindsay E. Young, Emilio Ferrara

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨LLM在模拟虚假信息易感性中的偏见,发现其夸大信念与分享的关联,忽视网络特征,建议LLM模拟更适用于诊断而非替代人类判断。

Comments Accepted to ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06499 2026-04-13 cs.CL cs.AI 86%

Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels

Webscale-RL: 用于将强化学习数据扩展到预训练水平的自动化数据管道

Zhepeng Cen, Haolin Chen, Shiyu Wang, Zuxin Liu, Zhiwei Liu, Jielin Qiu, Ding Zhao, Silvio Savarese, Caiming Xiong, Huan Wang, Weiran Yao

机构 * Salesforce AI Research(赛富时人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Webscale-RL数据管道,通过系统性地将大规模预训练文档转换为数百万个多样化的可验证问题-答案对,解决RL数据瓶颈问题,并展示基于该数据集的模型在多个基准测试中表现优于传统预训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09377 2026-04-13 cs.CL 85%

Task-Aware LLM Routing with Multi-Level Task-Profile-Guided Data Synthesis for Cold-Start Scenarios

具有多级任务-特征引导的数据合成的任务感知LLM路由用于冷启动场景

Hui Liu, Bin Zou, Kecheng Chen, Jie Liu, Wenya Wang, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TRouter,通过多级任务-特征引导的数据合成框架解决冷启动问题,提升LLM路由在冷启动和领域内设置下的性能。

Comments 30 pages, Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08649 2026-04-13 cs.LG cs.CE cs.CL cs.IR q-fin.CP 81%

PRAGMA: Revolut Foundation Model

PRAGMA:Revolut 基础模型

Maxim Ostroukhov, Ruslan Mikhailov, Vladimir Iashin, Artem Sokolov, Andrei Akshonov, Vitaly Protasov, Dmitrii Beloborodov, Vince Mullin, Roman Yokunda Enzmann, Georgios Kolovos, Jason Renders, Pavel Nesterov, Anton Repushko

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 PRAGMA是一种多源银行事件序列的基础模型,通过预训练Transformer架构实现金融记录的自监督学习,适用于信用评分、欺诈检测等任务,提供通用金融应用的表示层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08698 2026-04-13 cs.LG q-bio.GN 79%

EvoLen: Evolution-Guided Tokenization for DNA Language Model

EvoLen:基于进化的标记化方法用于DNA语言模型

Nan Huang, Xiaoxiao Zhou, Junxia Cui, Mario Tapia-Pacheco, Tiffany Amariuta, Yang Li, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 EvoLen通过整合进化信息优化DNA标记化,优先保留功能序列模式,提升基因组上下文区分和进化约束对齐,优于标准BPE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04676 2026-04-13 cs.CV cs.AI cs.LG cs.MA 79%

Gen-n-Val: Agentic Image Data Generation and Validation

Gen-n-Val:代理图像数据生成与验证

Jing-En Huang, I-Sheng Fang, Tzuhsuan Huang, Yu-Lun Liu, Chih-Yu Wang, Jun-Cheng Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Research Center for Information Technology Innovation, Academia Sinica(中央研究院资讯科技创新研究中心)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对计算机视觉任务中数据稀缺、标签噪声和长尾类别不平衡问题,Gen-n-Val引入基于Layer Diffusion和大语言模型的代理生成框架,有效提升实例分割和目标检测的合成数据质量与性能。

Comments Accepted to the CVPR 2026 Findings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08709 2026-04-13 eess.AS 78%

Enhancing Conversational TTS with Cascaded Prompting and ICL-Based Online Reinforcement Learning

通过级联提示和基于ICL的在线强化学习增强对话式TTS

Zhicheng Ouyang, Seong-Gyun Leem, Bach Viet Do, Haibin Wu, Ariya Rastrow, Yuzong Liu, Florian Metze

专题命中 预训练与数据 :prompting(title,abstract)

AI总结 本文提出一种级联框架,结合文本风格标记和高质量音频提示,实现单次适应细粒度语音风格和角色声音,并引入基于ICL的在线强化学习策略提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08554 2026-04-13 cs.CL cs.AI 76%

Drift and selection in LLM text ecosystems

大语言模型文本生态系统中的漂移与选择

Søren Riis

机构 * Queen Mary University of London(伦敦玛丽女王大学)

专题命中 预训练与数据 :LLM(title);分类 cs.CL、cs.AI

AI总结 本文提出一个可解的数学框架,分析递归过程中的漂移与选择作用,揭示文本生态系统的稳定分布与选择过滤对结构的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09531 2026-04-13 cs.CV cs.AI cs.CL 73%

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

VisionFoundry: 通过合成图像教授VLMs的视觉感知

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VisionFoundry,通过任务关键词生成合成数据,提升VLMs在空间理解和视角识别等视觉感知任务上的性能,构建了包含10k图像-问题-答案三元组的VQA数据集,并在多个基准测试中取得显著提升。

Comments Project Page: https://zlab-princeton.github.io/VisionFoundry/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08578 2026-04-13 cs.LG cs.AI 73%

Structured Exploration and Exploitation of Label Functions for Automated Data Annotation

结构化探索与利用标签函数以实现自动化数据标注

Phong Lam, Ha-Linh Nguyen, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(越南国立大学工程与技术学院信息技术系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EXPONA框架,通过多级标签函数探索与可靠性机制提升自动化标注质量,实现更一致的标签质量和下游性能。

Comments Accepted by KBS Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09089 2026-04-13 cs.SE cs.AI cs.CR 70%

DeepGuard: Secure Code Generation via Multi-Layer Semantic Aggregation

DeepGuard:通过多层语义聚合实现安全代码生成

Li Huang, Zhongxin Liu, Yifan Wu, Tao Yin, Dong Li, Jichao Bi, Nankun Mu, Hongyu Zhang, Meng Yan

机构 * Chongqing University(重庆大学) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全全国重点实验室,浙江大学) Peking University(北京大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DeepGuard通过多层语义聚合提升代码生成的安全性,实验表明其在安全性和功能性上均优于基线模型,有效检测并减少不安全模式。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08762 2026-04-13 cs.CV cs.AI 70%

InstrAct: Towards Action-Centric Understanding in Instructional Videos

InstrAct:迈向指令视频中的动作中心理解

Zhuoyi Yang, Jiapeng Yu, Reuben Tan, Boyang Li, Huijuan Xu

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出InstrAction框架,通过数据驱动策略和辅助目标提升指令视频中动作识别与建模,建立InstrAct基准测试集,优于现有视频基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12686 2026-04-13 cs.CL 70%

Exploring Cross-lingual Latent Transplantation: Mutual Opportunities and Open Challenges

探索跨语言潜在移植:相互机会与开放挑战

Yangfan Ye, Xiaocheng Feng, Xiachong Feng, Libo Qin, Yichong Huang, Lei Huang, Weitao Ma, Qichen Hong, Zhirui Zhang, Yunfei Lu, Xiaohui Yan, Duyu Tang, Dandan Tu, Bing Qin

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出跨语言潜在移植框架,探讨其对多语言能力和文化适应性的双向影响,揭示注意力模块与前馈模块在多语言理解中的作用,发现当前LLM多语言潜力的严重未利用问题。

Comments IEEE Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09330 2026-04-13 cs.RO cs.CV 67%

VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis

VAG:用于具身数据合成的双流视频-动作生成

Xiaolei Lang, Yang Wang, Yukun Zhou, Chaojun Ni, Kerui Li, Jiagang Zhu, Tianze Liu, Jiajun Lv, Xingxing Zuo, Yun Ye, Guan Huang, Xiaofeng Wang, Zheng Zhu

机构 * GigaAI Zhejiang University(浙江大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08664 2026-04-13 cs.RO 67%

Generative Simulation for Policy Learning in Physical Human-Robot Interaction

生成仿真在物理人机交互中政策学习中的应用

Junxiang Wang, Xinwen Xu, Tiancheng Wu, Julian Millan, Nir Pechuk, Zackory Erickson

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出零样本生成仿真框架,通过自然语言提示生成多样化的物理人机交互场景,用于自主收集合成数据并训练基于视觉的模仿学习策略,实现从仿真到现实的零样本迁移。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09389 2026-04-13 cs.LG cs.CL 62%

Is More Data Worth the Cost? Dataset Scaling Laws in a Tiny Attention-Only Decoder

更多数据值得付出成本吗?在极小注意力解码器中的数据集扩展定律

Götz-Henrik Wiegand, Lorena Raichle, Rico Städeli, Tomas Hrycej, Bernhard Bermeitinger, Siegfried Handschuh

机构 * Institute of Computer Science, University of St. Gallen(圣加仑大学计算机科学研究所) Institute of Computer Science in Vorarlberg, University of St. Gallen(圣加仑大学福拉尔贝格计算机科学研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过极小注意力解码器研究数据集规模扩展定律,发现数据量增加带来性能提升但存在边际效益递减,为数据与计算成本平衡提供指导。

Comments Presented as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil. Published at 13th IEEE Swiss Conference on Data Science and AI (SDS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08628 2026-04-13 cs.CR cs.AI cs.IR 57%

Retrieval Augmented Classification for Confidential Documents

检索增强分类用于保密文件

Yeseul E. Chang, Rahul Kailasa, Simon Shim, Byunghoon Oh, Jaewoo Lee

机构 * Chung-Ang University(中央大学) San Jose State University(圣何塞州立大学)

专题命中 预训练与数据 :prompting(abstract);分类 cs.AI

AI总结 本文提出基于检索增强分类(RAC)的方法,用于在真实环境中持续更新保密文件分类,通过对比RAC与监督微调(FT)在WikiLeaks数据集上的表现,证明RAC在数据不平衡时更稳定且具有更高的准确性和F1分数,同时提供保密部署的指导。

Comments Appears in: KSII The 17th International Conference on Internet (ICONI) 2025, Dec 2025. 7 pages (48-54)

Journal ref In Proceedings of KSII ICONI 2025, Dec 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09472 2026-04-13 eess.AS 50%

Data Selection Effects on Self-Supervised Learning of Audio Representations for French Audiovisual Broadcasts

数据选择对法语音频视频广播音频表示自监督学习的影响

Valentin Pelloin, Lina Bekkali, Reda Dehak, David Doukhan

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文研究了自监督学习模型在不同预训练数据集上的表现,通过构建多样化广播音频语料库,评估了其在语音识别、语音活动检测等任务中的效果,发现多样化音频预训练能提升模型性能,并强调数据去重的重要性。

Comments To be published in the Fifteenth International Conference on Language Resources and Evaluation (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏