arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-28 至 2026-04-28 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 18 篇

2604.23148 2026-04-28 cs.AI 92%

PhySE: A Psychological Framework for Real-Time AR-LLM Social Engineering Attacks

PhySE: 一种用于实时AR-LLM社会工程攻击的心理学框架

Tianlong Yu, Yang Yang, Ziyi Zhou, Jiaying Xu, Siwei Li, Tong Guan, Kailong Wang, Ting Bi

机构 * Hubei University(湖北大学) Apple Inc(苹果公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PhySE通过视觉语言模型的社会上下文训练和自适应心理代理,解决AR-LLM社会工程攻击中的冷启动个性化和静态攻击策略问题,提升实时交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19089 2026-04-28 cs.CL cs.AI 91%

Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting

语言模型可能并不理解你:通过故事提示评估理论自我意识

Nathaniel Getachew, Abulhair Saparov

专题命中 预训练与数据 :language model(title,abstract);prompting(title);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 通过故事提示框架评估大语言模型的理论自我意识和世界建模能力,发现模型在世界建模任务中表现优于理论自我意识任务,且对人物推理更准确。

Comments 21 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22989 2026-04-28 cs.CV cs.AI 90%

CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging

CheXmix:用于医学影像的统一生成预训练

Ashwin Kumar, Robbie Holland, Corey Barrett, Jangwon Kim, Maya Varma, Zhihong Chen, Yunhe Gao, Greg Zaharchuk, Tara Taghavi, Krishnaram Kenthapadi, Akshay Chaudhari

机构 * Stanford AIMI, Stanford University(斯坦福大学AIMI研究所,斯坦福大学) Oracle Health AI(Oracle健康AI) Department of Radiology, Stanford University(斯坦福大学放射科)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 CheXmix通过统一早融合生成方法,在医学影像中实现更精确的联合表征学习,优于现有生成模型,在多个任务上表现突出。

Comments CVPR Findings (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23475 2026-04-28 cs.LG cs.CL 89%

Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers

超节点和光环:LLM前馈层中的损失关键枢纽

Audrey Cherilyn, Houman Safaai

机构 * Kempner Institute at Harvard University(哈佛大学凯普纳研究所)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究Transformer前馈网络中通道级重要性的组织方式,发现损失敏感性集中于少量通道,通过损失代理展示超节点和光环结构,验证保护核心对结构化剪枝的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01595 2026-04-28 cs.CL cs.AI cs.LG 86%

Always Tell Me The Odds: Fine-grained Conditional Probability Estimation

始终告诉我概率:细粒度条件概率估计

Liaoyaqi Wang, Zhengping Jiang, Anqi Liu, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种最先进的模型,用于在上下文条件下对命题进行细粒度概率估计。通过结合人类和合成数据创建与评估、扩大模型规模和改进监督,提出了一系列强而精确的概率估计模型,在依赖条件概率估计的任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24416 2026-04-28 cs.CL cs.AI cs.LG 85%

Scaling Properties of Continuous Diffusion Spoken Language Models

连续扩散口语语言模型的可扩展性特性

Jason Ramapuram, Eeshan Gunesh Dhekane, Amitis Shidani, Dan Busbridge, Bogdan Mazoure, Zijin Gu, Russ Webb, Tatiana Likhomanenko, Navdeep Jaitly

机构 * Apple(苹果公司)

专题命中 预训练与数据 :language model(title,abstract);SLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究连续扩散口语语言模型在性能上的可扩展性,提出基于音素Jensen-Shannon散度的评估指标,发现其在参数规模增加时生成质量提升,但长文本连贯性仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22771 2026-04-28 cs.CL cs.AI cs.LG 82%

The Randomness Floor: Measuring Intrinsic Non-Randomness in Language Model Token Distributions

随机底限:在语言模型令牌分布中测量固有非随机性

Jarosław Hryszko

机构 * Institute of Computer Science(计算机科学研究所) Faculty of Mathematics and Computer Science(数学与计算机科学学院) Jagiellonian University(雅盖隆大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过系统分析31200次生成数据,引入熵偏差(ED)衡量语言模型令牌分布与均匀分布的KL散度,发现即使在中性提示下,Transformer仍表现出约0.30的ED,表明非随机性主要源于模型权重而非上下文。

Comments 13 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24479 2026-04-28 cs.CV 80%

Zero-to-CAD: Agentic Synthesis of Interpretable CAD Programs at Million-Scale Without Real Data

从零到CAD:在百万级规模上无需真实数据合成可解释的CAD程序

Mohammadmehdi Ataei, Farzaneh Askari, Kamal Rahimi Malekshan, Pradeep Kumar Jayaraman

机构 * Autodesk Research(Autodesk研究院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Zero-to-CAD框架,通过代理搜索方法生成可执行的CAD构造序列,实现百万级可解释CAD程序的合成,并展示了其在多视图图像重建中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22854 2026-04-28 cs.CV cs.AI 79%

MAE-Based Self-Supervised Pretraining for Data-Efficient Medical Image Segmentation Using nnFormer

基于MAE的自监督预训练用于数据高效医学图像分割的nnFormer

R. M. Krishna Sureddi, T. Satyanarayana Murthy, Nomula Varsha Reddy, Adi Kanishka, Nalla Manvika Reddy

机构 * Chaitanya Bharathi Institute of Technology(恰蒂斯赫尔学院技术学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 本文提出基于MAE的自监督预训练方法,提升nnFormer在医学图像分割中的数据效率,实现更高的Dice得分、更快的收敛速度和更好的小样本泛化能力。

Comments 4 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24044 2026-04-28 cs.CV 78%

CLLAP: Contrastive Learning-based LiDAR-Augmented Pretraining for Enhanced Radar-Camera Fusion

CLLAP:基于对比学习的激光雷达增强预训练用于增强雷达-相机融合

Bingyi Liu, Chuanhui Zhu, Hongfei Xue, Jian Teng, Jipeng Liu, Enshu Wang, Penglin Dai, Pu Wang

机构 * Wuhan University of Technology(武汉理工大学) University of North Carolina at Charlotte(北卡罗来纳州立大学) Wuhan University(武汉大学) Southwest Jiaotong University(西南交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 CLLAP通过利用丰富的激光雷达数据生成伪雷达数据,结合双阶段双模态对比学习策略,提升雷达-相机融合模型的特征提取能力,实验证明在NuScenes和Lyft Level 5数据集上显著提升3D目标检测性能。

Comments accepted by 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23676 2026-04-28 cs.HC 78%

Directional Alignment and Narrative Agency in Human-LLM Co-Writing

方向对齐与人类-大语言模型共写中的叙事自主性

Halfdan Nordahl Fundal, Yuri Bizzoni

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 研究人类-大语言模型共写中的叙事自主性,探讨谁主导故事发展。通过87个共写故事分析,发现人类引入更多语义新颖性,而大语言模型则扩展人类元素,情感层面也呈现双向互动。

Comments 11 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23824 2026-04-28 cs.CL 70%

Resource-Lean Lexicon Induction for German Dialects

低资源方言词典诱导

Robert Litschko, Barbara Plank, Diego Frassinelli

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich, Germany(MaiNLP,信息与语言处理中心,慕尼黑大学,德国) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用统计模型诱导德语方言词典,优于大语言模型,实现跨方言迁移,提供轻量数据驱动方案,实验显示在双语词典诱导和方言信息检索中表现优异。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23602 2026-04-28 cs.AR cs.LG 70%

TimingLLM: A Two-Stage Retrieval-Augmented Framework for Pre-Synthesis Timing Prediction from Verilog

TimingLLM: 一种两阶段检索增强框架,用于从Verilog预合成时间预测

Armin Abdollahi, Negin Ashrafi, Mehdi Kamal, Massoud Pedram

机构 * University of Southern California(美国南加州大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 TimingLLM通过两阶段检索增强框架,利用Verilog直接预测最坏负松弛和总负松弛,提升预合成时间预测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23627 2026-04-28 cs.CL cs.LG 62%

Neural Grammatical Error Correction for Romanian

神经语法错误纠正用于罗马尼亚语

Teodor-Mihai Cotet, Stefan Ruseti, Mihai Dascalu

机构 * Computer Science Department University Politehnica of Bucharest(布加勒斯特大学工业大学计算机科学系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文首次为罗马尼亚语构建了语法错误纠正语料库,并提出基于预训练的Transformer模型,在低资源环境下有效提升了纠错性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23589 2026-04-28 cs.CL 57%

XITE: Cross-lingual Interpolation for Transfer using Embeddings

XITE: 用于嵌入转移的跨语言插值

Barah Fazili, Preethi Jyothi

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本文提出XITE方法,通过嵌入插值提升多语言模型的跨语言迁移能力,在情感分析和自然语言推理任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22828 2026-04-28 cs.CV cs.AI 57%

MetaEarth3D: Unlocking World-scale 3D Generation with Spatially Scalable Generative Modeling

MetaEarth3D: 解锁世界尺度的3D生成与空间可扩展生成模型

Jinqi Cao, Zhiping Yu, Baihong Lin, Chenyang Liu, Zhenwei Shi, Zhengxia Zou

机构 * School of Astronautics, Beihang University(北航航天学院)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI

AI总结 MetaEarth3D通过空间可扩展生成模型实现世界尺度3D生成,解决传统生成模型在空间尺度上的局限,提升地球观测与模拟的超大空间智能能力。

Comments Project Page: https://jinqicao.github.io/metaearth3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17355 2026-04-28 cs.CL 57%

All Entities are Not Created Equal: Examining the Long Tail for Ultra-Fine Entity Typing

并非所有实体都平等:考察超细实体类型化中的长尾

Advait Deshmukh, Ashwin Umadi, Dananjay Srinivas, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本文研究了预训练语言模型在超细实体类型化任务中处理长尾实体的局限性,提出新的启发法近似预训练分布,并发现依赖参数知识的方法在长尾实体上表现不佳,而融合知识的方法能部分弥补不足。

Journal ref StarSEM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23620 2026-04-28 cs.IR 50%

Synthetic Data Powers Product Retrieval for Long-tail Knowledge-Intensive Queries in E-commerce Search

合成数据助力电商搜索中长尾知识密集型查询的产品检索

Gui Ling, Weiyuan Li, Yue Jiang, Wenjun Peng, Xingxian Liu, Dongshuai Li, Fuyu Lv, Dan Ou, Haihong Tang

专题命中 预训练与数据 :LLM(abstract_cn)

AI总结 本文提出一种高效的数据合成框架,用于处理电商搜索中长尾知识密集型查询,通过隐式提炼强大离线查询重写模型的能力,提升检索效果。

Comments Accepted to SIGIR2026

详情

展开后加载摘要…

URL PDF HTML 收藏