arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-09 至 2026-04-09 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 19 篇

2603.06276 2026-04-09 cs.SE 89%

Story Point Estimation Using Large Language Models

利用大语言模型进行故事点估计

Pranam Prakash Shetty, Adarsh Balakrishnan, Mengqiao Xu, Xiaoyin Xi, Zhe Yu

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 研究探讨了大语言模型在无训练数据或少量训练数据下对故事点的预测能力,并比较了比较判断与直接标注对模型性能的影响。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06767 2026-04-09 cs.LG cs.CL 87%

Geometric Properties of the Voronoi Tessellation in Latent Semantic Manifolds of Large Language Models

大型语言模型潜在语义流形中Voronoi分割的几何特性

Marshall Brett

机构 * MARS Labs(MARS实验室)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

AI总结 研究大型语言模型在潜在语义流形中的Voronoi分割,通过浮点32精度重新计算消除bfloat16量化伪影,验证表达性差距的线性缩放定律,并展示通过边距优化程序重塑Voronoi分割的可行性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06197 2026-04-09 cs.CL cs.AI 87%

Temporally Phenotyping GLP-1RA Case Reports with Large Language Models: A Textual Time Series Corpus and Risk Modeling

利用大语言模型进行GLP-1RA病例报告的时间表表征:一个文本时间序列语料库和风险建模

Sayantan Kumar, Jeremy C. Weiss

机构 * National Library of Medicine(美国国家医学图书馆)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文利用大语言模型处理GLP-1RA病例报告的时间线,构建了包含136个病例的文本时间序列语料库,并通过时间序列分析评估了模型在提取临床事件及其时间点上的性能,发现GPT5在事件覆盖和时间顺序上表现优异,并展示了糖尿病患者使用GLP-1RA降低呼吸并发症风险的证据。

Comments AMIA Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06571 2026-04-09 cs.CL cs.AI cs.IR cs.LG 87%

LLM-based Schema-Guided Extraction and Validation of Missing-Person Intelligence from Heterogeneous Data Sources

基于大型语言模型的异构数据源中缺失人员情报提取与验证方案

Joshua Castillo, Ravi Mukkamala

机构 * Old Dominion University(欧道明大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Guardian Parser Pack,通过AI驱动的解析与规范化流程,将多源调查文档统一为符合模式的表示,提升缺失人员情报的提取与验证效率,同时展示系统架构及性能评估结果。

Comments 9 pages, 6 figures. Accepted at International Conference on Intelligent Digitization of Systems and Services (IDSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06894 2026-04-09 stat.AP 85%

How Does LLM Help Regional CPI Forecast: An LLM-powered Deep Panel Modeling Framework

大型语言模型如何帮助区域CPI预测:一种基于大型语言模型的深度面板建模框架

Tianchen Gao, Ao Sun, Yurou Wang, Jingyuan Liu, Cheng Hsiao

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种结合大型语言模型分析和社会媒体叙述的深度面板建模框架,通过构建大规模叙述语料库和微调BERT模型生成高频LLM诱导替代品,提升区域CPI预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06903 2026-04-09 cs.CL 83%

Is Biomedical Specialization Still Worth It? Insights from Domain-Adaptive Language Modelling with a New French Health Corpus

生物医学专业化仍然值得吗?基于新法语健康语料库的领域自适应语言建模洞察

Aidan Mannion, Cécile Macaire, Armand Violle, Stéphane Ohayon, Xavier Tannier, Didier Schwab, Lorraine Goeuriot, François Portet

机构 * Université Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,格勒诺布尔国立理工学院,格勒诺布尔信息学实验室) Sorbonne Université, LIMICS(索邦大学,医学信息学与知识工程实验室)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文探讨了在法语生物医学领域通过持续预训练对小型至中型LLM进行专业化的方法,发现DAPT在资源受限情况下有效,但需通过模型合并缓解泛化权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02627 2026-04-09 cs.CL cs.AI 82%

Improved Evidence Extraction and Metrics for Document Inconsistency Detection with LLMs

改进的证据提取与文档不一致性检测的度量标准与LLMs

Nelvin Tan, Yaowen Zhang, James Asikin Cheung, Fusheng Liu, Yu-Ching Shih, Dong Yang

机构 * American Express(美国运通)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出新的证据提取度量标准和红acted-重试框架,提升LLMs在文档不一致性检测中的证据提取性能,并释放新的半合成数据集进行评估。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07147 2026-04-09 cs.CL cs.AI cs.LG 80%

Dynamic Context Evolution for Scalable Synthetic Data Generation

动态上下文演化用于可扩展的合成数据生成

Ryan Lingo, Rajeev Chhajer

机构 * Honda Research Institute, USA, Inc.(本田研究所美国公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出动态上下文演化(DCE)框架,通过尾部采样、语义记忆和自适应提示演化机制,有效缓解跨批次模式崩溃问题,提升生成多样性与概念结构 richness。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11090 2026-04-09 cs.LG stat.ME 79%

Interventional Time Series Priors for Causal Foundation Models

干预时间序列先验用于因果基础模型

Dennis Thumm, Ying Chen

机构 * National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出CausalTimePrior框架,生成合成时间结构因果模型,支持可配置因果图、非线性自回归机制和多干预类型,推动时间序列因果推断的基础模型发展。

Comments ICLR 2026 1st Workshop on Time Series in the Age of Large Models (TSALM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06203 2026-04-09 cs.CY cs.AI 77%

Front-End Ethics for Sensor-Fused Health Conversational Agents: An Ethical Design Space for Biometrics

传感器融合健康对话代理的前端伦理:生物特征的伦理设计空间

Hansoo Lee, Rafael A. Calvo

机构 * Imperial College London(伦敦帝国理工学院) Korea Institute of Science and Technology(韩国科学技术研究院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了生物特征翻译的伦理设计,提出五个维度分析前端伦理风险,提出适应性披露作为安全机制,确保健康代理支持用户自主性。

Comments Accepted at the Proceedings of the CHI 2026 Workshop: Ethics at the Front-End

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07189 2026-04-09 cs.CL 77%

Agent-Driven Corpus Linguistics: A Framework for Autonomous Linguistic Discovery

基于代理的语料库语言学:一种自主语言发现的框架

Jia Yu, Weiwei Yu, Pengfei Xiao, Fukun Xing

机构 * Zhejiang International Studies University(浙江外国语学院) Tianjin University(天津大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于代理的语料库语言学框架,通过大语言模型与语料库查询引擎的交互,实现自动化的语言研究,提升研究效率并降低技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07320 2026-04-09 cs.CL cs.AI 73%

Evaluating In-Context Translation with Synchronous Context-Free Grammar Transduction

基于上下文的翻译评估:同步上下文无关文法转换

Jackson Petty, Jaulie Goe, Tal Linzen

机构 * New York University(纽约大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLM在低资源语言翻译中的挑战,通过构建形式文法模型评估翻译性能,发现语法规模、句子长度及语言差异显著影响翻译准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07015 2026-04-09 cs.CL 70%

Corpora deduplication or duplication in Natural Language Processing of few resourced languages ? A case of study: The Mexico's Nahuatl

语料去重或重复在自然语言处理中少数资源语言的应用?一个案例研究:墨西哥的纳瓦特尔语

Juan-José Guzman-Landa, Juan-Manuel Torres-Moreno, Graham Ranger, Miguel Figueroa-Saavedra, Martha-Lorena Avendaño-Garrido, Elvys Linhares-Pontes, Luis-Gil Moreno-Jiménez

机构 * LIFAT, Université de Tours(图尔大学计算机科学、人工智能与图像处理实验室) Instituto de Investigaciones en Educación, Universidad Veracruzana(韦拉克鲁斯大学教育研究所) Trading Central(Trading Central公司) Independent Researcher(独立研究员)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨在计算资源有限的语言中,语料重复是否有助于自然语言处理。通过纳瓦特尔语语料扩展实验,发现可控重复可提升嵌入学习效果。

Comments 8 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06376 2026-04-09 cs.CV 67%

MTA-Agent: An Open Recipe for Multimodal Deep Search Agents

MTA-Agent:多模态深度搜索代理的开放配方

Xiangyu Peng, Can Qin, An Yan, Xinyi Yang, Zeyuan Chen, Ran Xu, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce 人工智能研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出MTA-Agent,通过构建高质量多跳视觉-语言训练数据,实现多模态深度搜索代理,其在六个基准测试中达到54.63%的平均准确率,优于其他模型,同时降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06236 2026-04-09 cs.DL 67%

LLMs Have Made Failure Worth Publishing

大语言模型让失败变得值得发表

Sungmin Lee

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 大语言模型继承训练数据的正向偏差,面临高质量训练数据短缺,作为研究工具和同行评审的双重角色,其失败数据缺失影响其效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06583 2026-04-09 cs.CV 50%

VAMAE: Vessel-Aware Masked Autoencoders for OCT Angiography

VAMAE:用于OCT血管造影的血管感知掩码自编码器

Ilerioluwakiiye Abolade, Prince Mireku, Kelechi Chibundu, Peace Ododo, Emmanuel Idoko, Promise Omoigui, Solomon Odelola

机构 * Federal University of Agriculture Abeokuta(阿贝奥库塔联邦农业大学) ML Collective Ashesi University(阿什西大学) University of Lagos(拉各斯大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 VAMAE通过血管感知掩码和多目标重建提升OCTA图像的自监督预训练效果,尤其在低标注条件下表现更优。

Comments 8 pages, 5 figures. Accepted at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29660 2026-04-09 astro-ph.IM cs.CV 50%

STRADAViT: Towards a Foundational Model for Radio Astronomy through Self-Supervised Transfer

STRADAViT:通过自监督迁移实现射电天文的通用模型

Andrea DeMarco, Ian Fenech Conti, Hayley Camilleri, Ardiana Bushi, Simone Riggi

机构 * organization= Institute of Space Sciences Astronomy , addressline= University of Malta , city= Msida , postcode= MSD2080 , country= Malta organization= School of Physics Astronomy, Royal Observatory , addressline= University of Edinburgh , city= Edinburgh , country= United Kingdom

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出STRADAViT框架,通过自监督迁移学习提升射电天文图像的形态分析能力,实验表明其在多个基准测试中优于ViT-MAE和DINOv2。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07335 2026-04-09 cs.RO 50%

TAMEn: Tactile-Aware Manipulation Engine for Closed-Loop Data Collection in Contact-Rich Tasks

TAMEn:用于接触密集任务闭环数据收集的触觉感知操作引擎

Longyan Wu, Jieji Ren, Chenghang Jiang, Junxi Zhou, Shijia Peng, Ran Huang, Guoying Gu, Li Chen, Hongyang Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(华东理工大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出TAMEn,通过双模采集管道和触觉-视觉学习框架,提升机器人双臂操作任务的闭环策略优化效果,实验表明任务成功率从34%提升至75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05764 2026-04-09 cs.IR 50%

Generative Retrieval Overcomes Limitations of Dense Retrieval but Struggles with Identifier Ambiguity

生成检索克服了密集检索的局限性,但难以处理标识符歧义

Adrian Bracher, Svitlana Vakulenko

专题命中 预训练与数据 :language model(abstract)

AI总结 本文通过合成数据集LIMIT研究生成检索的优劣,发现其在无额外训练时表现最佳,但添加难样本后性能下降,揭示解码机制失效问题。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏