arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-01 至 2026-05-01 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 20 篇

2509.05291 2026-05-01 cs.CL cs.AI cs.LG 93%

Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining

时间交叉编码:在LLM预训练过程中追踪语言表示的出现与巩固

Deniz Bayazit, Aaron Mueller, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院) Boston University(波士顿大学)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 通过稀疏交叉编码器追踪LLM预训练中语言表示的演变,引入RelIE指标分析特征对任务性能的因果影响,实现对表示学习的可解释性分析。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27410 2026-05-01 cs.IR cs.CL 92%

From Unstructured to Structured: LLM-Guided Attribute Graphs for Entity Search and Ranking

从无序到有序:LLM引导的属性图用于实体搜索与排序

Yilun Zhu, Nikhita Vedula, Shervin Malmasi

机构 * Amazon.com, Inc.(亚马逊公司)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出结合LLM驱动的属性图构建与图感知LLM排序的两阶段方法,通过结构化属性提取和图构建提升电商中实体搜索的精度与效率,实验显示在零样本场景下平均精度提升超5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27945 2026-05-01 eess.SP 91%

CRS-LLM: Cooperative Beam Prediction with a GPT-Style Backbone and Switch-Gated Fusion

CRS-LLM:基于GPT风格主干和切换门融合的协作波束预测

Fangzhi Li, Cunhua Pan, Hong Ren, Dongming Wang, Jiangzhou Wang

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CRS-LLM框架,通过将波束跟踪建模为联合BS-波束空间的单分类问题,结合双视角CSI分词器和截断GPT风格主干,实现更准确的波束预测,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27661 2026-05-01 cs.CL 91%

Language Ideologies in a Multilingual Society: An LLM-based Analysis of Luxembourgish News Comments

多语言社会中的语言意识形态:基于LLM的卢森堡语新闻评论分析

Emilia Milano, Alistair Plum, Yves Scherrer, Christoph Purschke

机构 * University of Luxembourg(卢森堡大学) University of Oslo(奥斯陆大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了利用大语言模型检测语言意识形态的潜力,通过手动标注卢森堡语评论并评估不同提示条件下的模型表现,发现尽管LLM在多类意识形态标注上尚未完全优化,但仍能有效识别语言意识形态内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27415 2026-05-01 cs.LG 89%

ChipLingo: A Systematic Training Framework for Large Language Models in EDA

ChipLingo: 一种面向电子设计自动化的大语言模型系统化训练框架

Lei Li, Xingwen Yu, Jianguo Ni, Junxuan Zhu, Jieqiong Zhang, Jian Zhao, Zhi Liu

机构 * Ickylin AI Team(Ickylin AI团队)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出ChipLingo系统化训练框架,通过多源数据构建、预训练优化和指令对齐,提升大语言模型在EDA领域的性能,实验表明其在EDA-Bench上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27715 2026-05-01 cs.CV 89%

Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining

通过数据无关的平坦性感知提示预训练提升视觉语言模型测试时提示调优的校准

Hyeonseo Jang, Jaebyeong Jeon, Joong-Won Hwang, Kibok Lee

机构 * Yonsei University(延世大学) ETRI(韩国电子技术研究院)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title,abstract)

AI总结 本文提出FPP框架,通过在提示初始化时选择平坦区域,提升测试时提示调优的校准和性能,无需额外标注数据和计算成本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20122 2026-05-01 cs.CL cs.AI cs.IR cs.LG 87%

NanoKnow: How to Know What Your Language Model Knows

NanoKnow: 如何了解你的语言模型知道什么

Lingwei Gu, Nour Jedidi, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过NanoKnow基准数据集分析语言模型知识来源,发现预训练数据频率影响准确性,外部证据可缓解频率依赖,参数与外部知识互补,无关信息损害表现。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27643 2026-05-01 cs.AR cs.AI 86%

HAVEN: Hybrid Automated Verification ENgine for UVM Testbench Synthesis with LLMs

HAVEN:基于LLMs的混合自动验证引擎用于UVM测试平台综合

Chang-Chih Meng, Yu-Ren Lu, Guan-Yu Lin, Tsung Tai Yeh, Kai-Chiang Wu, I-Chen Wu

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HAVEN通过结合LLM与协议特定模板生成UVM测试平台,实现100%编译成功和高覆盖率。

Comments 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27624 2026-05-01 cs.CL cs.AI cs.CY cs.HC cs.LG 86%

Mapping how LLMs debate societal issues when shadowing human personality traits, sociodemographics and social media behavior

映射LLMs在模仿人类性格特征、社会人口统计数据和社会媒体行为时如何辩论社会问题

Ali Aghazadeh Ardebili, Massimo Stella

机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过CDS数据集研究LLMs在不同社会和情境提示下生成的辩论内容变化,分析其社会议题立场和情感表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15564 2026-05-01 cs.SE cs.AI cs.LG 84%

OpenClassGen: A Large-Scale Corpus of Real-World Python Classes for LLM Research

OpenClassGen: 一个大规模的真实世界Python类语料库用于大语言模型研究

Musfiqur Rahman, SayedHassan Khatoonabadi, Emad Shihab

机构 * Concordia University(康科德大学)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 OpenClassGen提供324,843个Python类的语料库,用于评估大语言模型的代码生成能力,通过类骨架和静态代码度量指标,支持多种应用场景。

Comments This paper has been accepted for publication at the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026) AI models/data track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26960 2026-05-01 cs.CY cs.AI 83%

LLM Biases

LLM偏见

Jinhui Han, Ming Hu, Xilin Zhang

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了基于Transformer的生成推荐系统中四种系统性偏见机制,指出其可能影响长期多样性和用户选择,强调需关注运营风险而非仅依赖性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00937 2026-05-01 cs.RO cs.AI cs.CV cs.LG 81%

CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining

CLAMP: 基于对比学习的3D多视角动作条件机器人操控预训练

I-Chun Arthur Liu, Krzysztof Choromanski, Sandy Huang, Connor Schenck

机构 * Google DeepMind(谷歌DeepMind) University of Southern California(南加州大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 CLAMP通过3D点云和机器人动作进行预训练,利用对比学习提升机器人操控精度与效率,优于现有基线方法。

Comments Accepted to the Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27448 2026-05-01 cs.CV 78%

LA-Pose: Latent Action Pretraining Meets Pose Estimation

LA-Pose:潜在动作预训练与姿态估计

Zhengqing Wang, Saurabh Nair, Prajwal Chidananda, Pujith Kachana, Samuel Li, Matthew Brown, Yasutaka Furukawa

机构 * Wayve Simon Fraser University(西蒙弗雷泽大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文通过自监督预训练视角重新审视相机姿态估计,提出逆动力学预训练作为替代全监督训练的方法。通过逆向和正向动力学模型学习潜在动作表示,将潜在动作特征用于相机姿态估计,实现高精度且可推广的姿态预测。

Comments Project page: https://la-pose.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27550 2026-05-01 cs.CL cs.AI 73%

APPSI-139: A Parallel Corpus of English Application Privacy Policy Summarization and Interpretation

APPSI-139: 一个平行语料库,用于英语应用隐私政策的摘要与解释

Pengyun Zhu, Qiheng Sun, Long Wen, Yanbo Wang, Yang Cao, Junxu Liu, Deyi Xiong, Jinfei Liu, Zhibo Wang, Kui Ren

机构 * Tianjin University(天津大学) Zhejiang University(浙江大学) North University of China(北方工业大学) Institute of Science Tokyo(东京科学研究所) The Hong Kong Polytechnic University(香港理工大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出APPSI-139平行语料库,包含139个隐私政策及15,692个改写语料,结合TCSI-pp-V2框架提升摘要与解释的可读性与可靠性,优于GPT-4o等大模型。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27300 2026-05-01 cs.AI 70%

METASYMBO: Multi-Agent Language-Guided Metamaterial Discovery via Symbolic Latent Evolution

METASYMBO: 多智能体语言引导的超材料发现 via 符号驱动的潜在进化

Jianpeng Chen, Wangzhi Zhan, Dongqi Fu, Junkai Zhang, Zian Jia, Ling Li, Wei Wang, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) Meta AI University of California Los Angeles(加州大学洛杉矶分校) Princeton University(普林斯顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MetaSymbO框架,通过符号驱动的潜在进化实现语言引导的超材料发现,提升结构有效性和语言指导得分,验证其在实际应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22500 2026-05-01 cs.CV cs.AI 70%

OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment

OR-VSKC:通过合成数据引导对齐解决手术室中的视觉-语义知识冲突

Weiyi Zhao, Xiaoyu Tan, Liang Liu, Sijia Li, Youwei Song, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) Tencent YouTu Lab(腾讯优图实验室) Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出OR-VSKC基准,通过合成数据引导对齐解决手术室中的视觉-语义知识冲突,评估多模态大语言模型的可靠性,并展示微调后的模型在未见视角上的鲁棒性。

Comments 13 pages, 5 figures. The dataset and appendix are available at https://github.com/zgg2577/VS-KC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27356 2026-05-01 cs.LG cs.AI 62%

TypeBandit: Type-Level Context Allocation and Reweighting for Effective Attribute Completion in Heterogeneous Graph Neural Networks

TypeBandit:基于类型级上下文分配与重加权的异构图神经网络中有效属性补全

Ta-Yang Wang, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM Army Research Office(陆军研究办公室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TypeBandit方法,通过类型级上下文分配与重加权提升异构图神经网络中属性补全效果,结合拓扑感知初始化、类型级老虎机采样和联合表征学习,实现高效且灵活的属性补全策略。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.11158 2026-05-01 cs.CL 57%

Cross-Lingual Transfer for Distantly Supervised and Low-resources Indonesian NER

跨语言迁移用于远监督和低资源印度尼西亚命名实体识别

Fariz Ikhwantri

机构 * Kata Research Team, Kata.ai(Kata研究团队,Kata.ai)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本文提出通过预训练语言模型进行跨语言迁移,提升小规模标注和大但远监督数据集的命名实体识别性能,实验显示在无平行标注情况下效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27918 2026-05-01 cs.CV 50%

Generate Your Talking Avatar from Video Reference

从视频参考生成您的对话人像

Zujin Guo, Zhenhui Ye, Yi Ren, Yuanming Li, Ce Chen, Zhibin Hong, Chen Change Loy

机构 * Nanyang Technological University(南洋理工大学) University of Melbourne(墨尔本大学) HeyGen Research(HeyGen研究院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出TAVR框架,通过跨场景视频输入生成高保真的对话人像,采用三阶段训练方案提升跨场景适应性,并构建新基准测试集验证鲁棒性。

Comments Project Page: https://gseancdat.github.io/projects/TAVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27704 2026-05-01 cs.CV 50%

A generalised pre-training strategy for deep learning networks in semantic segmentation of remotely sensed images

一种用于遥感图像语义分割的深度学习网络通用预训练策略

Yuan Fang, Yuanzhi Cai, Jagannath Aryal, Qinfeng Zhu, Hong Huang, Cheng Zhang, Lei Fan

机构 * Department of Civil Engineering, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学土木工程系) CSIRO Mineral Resources(澳大利亚联邦科学与工业研究组织矿物资源部门) Department of Infrastructure Engineering, The University of Melbourne(墨尔本大学基础设施工程系)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文提出一种简单有效的预训练策略,通过引导模型避免学习领域特定特征,提升模型泛化能力,在四个不同场景和模态的语义分割数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏