arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-26 至 2026-06-26 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 21 篇

2605.24417 2026-06-26 cs.LG 版本更新 90%

LLMTabBench: Evaluating LLMs on Binary Tabular Classification From Zero to Few Shots

LLMTabBench:从零样本到少样本的二元表格分类中评估LLM

Daria Grushina, Kseniia Kuvshinova, Alina Kostromina, Aziz Temirkhanov, Mile Mitrovic, Dmitry Simakov

机构 * Sb AI Lab, HSE, NES(Sb AI Lab,HSE,NES) Sb AI Lab, HSE(Sb AI Lab,HSE) Sb AI Lab, HSE University(Sb AI Lab,HSE大学) Sb AI Lab

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出LLMTabBench基准,系统评估LLM在数据稀缺条件下进行表格分类时,先验知识与上下文信息(任务描述和少样本示例)的交互作用,以及性能随数据复杂度的扩展规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16702 2026-06-26 cs.CY cs.AI cs.CL cs.HC 90%

Large Language Models as Psychological Simulators: A Methodological Guide

大语言模型作为心理模拟器:一种方法指南

Zhicheng Lin

机构 * Department of Psychology, Yonsei University(延世大学心理学系) Department of Psychology, University of Science and Technology of China(中国科学技术大学心理学系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨利用大语言模型进行心理模拟的两种主要应用:角色与人设模拟及认知过程建模,并提出方法框架与验证策略,强调透明性与伦理考量。

Journal ref Advances in Methods and Practices in Psychological Science, 9(1), 1-21 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17621 2026-06-26 cs.CV 版本更新 87%

PathFLIP: Fine-grained Language-Image Pretraining for Versatile Computational Pathology

PathFLIP:面向多功能计算病理学的细粒度语言-图像预训练

Fengchun Liu, Songhan Jiang, Linghan Cai, Ziyue Wang, Yongbing Zhang

机构 * Harbin Institute of Technology, Shenzhen, School of Computer Science and Technology(哈尔滨工业大学(深圳)计算机科学与技术学院) National University of Singapore, Department of Electronic and Computer Engineering(新加坡国立大学电子与计算机工程系)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出PathFLIP框架,通过将幻灯片级描述分解为区域级子描述并生成文本条件区域嵌入,实现细粒度视觉-语言对齐,在多个基准上优于现有模型且训练数据更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26127 2026-06-26 cs.SI cs.CR 新提交 86%

Account-History Features for Social Bot Detection in the Era of Large Language Models

大语言模型时代社交机器人检测中的账户历史特征

Gaurang Katyal

专题命中 预训练与数据 :language model(title,abstract);large language model(title)

AI总结 针对大语言模型可生成类人文本导致内容特征失效的问题,提出利用攻击者难以低成本操纵的账户历史特征(如账户年龄、粉丝数等),在随机森林模型上实现ROC-AUC 0.977,显著优于纯内容基线,且对对抗性文本改写具有鲁棒性。

Comments Code and result tables: https://github.com/gaurangkatyal/behavioral-bot-detection (Zenodo DOI: 10.5281/zenodo.20358445)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27275 2026-06-26 cs.CL cs.DL 新提交 85%

How Surprising Is Historical Italian to Language Models? Tokenization Tax, Comprehension Tax, and a Simple Mitigation

历史意大利语对语言模型有多令人惊讶?分词税、理解税以及一种简单的缓解方法

Maria Levchenko

机构 * University of Bologna(博洛尼亚大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出一个诊断框架,将历史语言难度分解为分词成本、预测不确定性、语义鲁棒性和上下文敏感性四个维度,通过17世纪意大利语等数据集评估,发现历史文本存在分词税但语义表示鲁棒,并证明简单的时间上下文提示可将历史意外性降低约60%。

Comments The 22nd Conference on Information and Research Science Connecting to Digital and Library Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27242 2026-06-26 cs.LG cs.CL stat.ML 新提交 82%

The Geometry of Updates: Fisher Alignment at Vocabulary Scale

更新的几何:词汇规模下的Fisher对齐

John Sweeney

机构 * Sideplane AI

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 针对共享词汇的LLM家族,提出FisherSketch方法,通过核均值嵌入的余弦相似度估计Fisher对齐,实现词汇规模下的高效源选择,并揭示激活、误差及耦合因素。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), PMLR 306. 64 pages total (main paper plus appendix), 4 figures, 29 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27100 2026-06-26 q-fin.MF 新提交 82%

Pretrained Time-Series Foundation Models for Financial Return Forecasting

用于金融收益预测的预训练时间序列基础模型

Miquel Noguer I Alonso, Rodolfo Pereira Franklin

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文在保守的金融设置下,基准测试预训练时间序列基础模型(TSFMs)与从头训练的神经基线,发现TSFMs在排名上占优,但相对于随机游走基准的预测提升微弱且稀疏,表明TSFMs作为实用先验可降低模型开发成本,但并非统计可靠的alpha生成引擎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26467 2026-06-26 cs.LG 新提交 80%

A Causal Foundation Model for Structure and Outcome Prediction

用于结构与结果预测的因果基础模型

Max Zhu, Martino Mansoldo, Ching-Hao Wang, Stefan Groha

机构 * University of Cambridge, United Kingdom(英国剑桥大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 提出TabPFN-CFM,一种能处理多种因果问题的因果基础模型,从观测数据预测因果结构和结果,支持Pearl因果层次所有三层查询,在合成数据上训练并泛化到真实数据,优于结构和结果预测基线。

Comments 20 pages, 7 figures, 17 tables, 43rd ICML Workshop on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27080 2026-06-26 cs.SE 新提交 80%

ATGBuilder: Feature-Assisted Graph Learning for Activity Transition Graph Construction with Seed Supervision

ATGBuilder: 基于特征辅助图学习的活动转换图构建与种子监督

Chenhui Cui, Zixiang Xian, Danyu Li, Tao Li, Rubing Huang, Dave Towey, Shikai Guo, Jiakun Liu

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出ATGBuilder,利用大语言模型总结UI布局元数据,并将控件触发信息建模为边属性,通过辅助重构目标进行图学习,在种子监督下构建高质量活动转换图,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14961 2026-06-26 q-bio.NC 版本更新 80%

Power-Law Scaling in the Classification Performance of Small-Scale Spiking Neural Networks

小规模脉冲神经网络分类性能的幂律标度

Zhengdi Zhang, Cong Han, Wenjun Xia

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究基于LIF神经元模型的小规模脉冲神经网络分类性能,发现准确率主要随类别数呈幂律标度,并使用大语言模型辅助发现函数关系。

Comments We need to improve the academic writing and the model in this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14122 2026-06-26 cs.CL 新提交 79%

Beyond Perplexity: UTF-8 Validity in Byte-aware Language Models

超越困惑度:字节感知语言模型中的 UTF-8 有效性

Sangwhan Moon, Daisuke Oba, Youmi Ma, Tatsuya Hiraoka, Naoaki Okazaki

机构 * University of Tokyo(东京大学) National Institute of Information and Communications Technology(信息通信技术国家研究所)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 研究字节级分词语言模型生成无效UTF-8序列的问题,通过多语言训练实验发现UTF-8有效性收敛比困惑度慢约一倍,且罕见字符结构有效性更高,表明可靠UTF-8生成是需要单独评估的能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26122 2026-06-26 cs.CV 新提交 75%

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

DocArena:将原始文档转化为可控的训练环境用于文档搜索代理

Jiamian Wang, Ruiyi Zhang, Tong Yu, Jing Shi, Samyadeep Basu, Rajiv Jain, Zhiqiang Tao, Tong Sun

机构 * Rochester Institute of Technology(罗切斯特理工学院) Adobe Research(Adobe研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn)

AI总结 提出DocArena自动化流程,通过多模态文档结构化、推理型QA对构建和质量控制,生成可控训练环境,使基于文本LLM的搜索代理在多模态文档检索和问答中取得最佳性能。

Comments search agent for documents

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14717 2026-06-26 cs.LG 版本更新 70%

Training-Free Generation of Protein Sequences from Small Family Alignments via Stochastic Attention

基于随机注意力的小家族比对无训练蛋白质序列生成

Jeffrey D. Varner

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出随机注意力(SA)方法,利用现代Hopfield能量和Langevin动力学从少量序列中无训练生成蛋白质序列,在8个Pfam家族上实现低组成差异、新颖性和结构合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10244 2026-06-26 cs.CV cs.LG 版本更新 70%

Solving Semi-Supervised Few-Shot Learning from an Auto-Annotation Perspective

从自动标注视角解决半监督少样本学习

Tian Liu, Anwesha Basu, James Caverlee, Shu Kong

机构 * Texas A\&M University(德克萨斯A&M大学) University of Macau(澳门大学) Institute of Collaborative Innovation(协同创新研究院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出SWIFT方法,通过温度锐化softmax输出和分阶段训练,利用视觉语言模型和开放数据,在半监督少样本学习中显著提升性能,接近监督学习水平。

Comments Accepted to ECCV 2026. Website and code: https://tian1327.github.io/SWIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27304 2026-06-26 cs.LG 新提交 57%

A Multi-Fidelity Convolutional Autoencoder-Transfer Learning Framework for Guided-Wave-Based Damage Diagnosis Using Large Simulated and Limited Experimental Datasets

基于多保真卷积自编码器-迁移学习框架的导波损伤诊断:利用大规模仿真与有限实验数据

Santosh Kapuria, Abhishek

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出多保真迁移学习框架,结合轻量物理仿真、卷积自编码器深度特征学习和少量实验数据,实现板结构损伤定位与尺寸估计,R²分别超0.93和0.99。

Comments 19 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27014 2026-06-26 cs.LG 新提交 57%

A Generalization Theory for JEPA-Based World Models

基于JEPA的世界模型的泛化理论

Jingyi Cui, Qi Zhang, Hongwei Wen, Yisen Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) University of Sydney(悉尼大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文首次为JEPA世界模型建立泛化理论,将其预训练表述为条件谱图学习问题,并证明JEPA目标等价于动作条件共现矩阵的低秩分解,进而推导出有限样本泛化界,揭示了潜在维度在近似误差与样本误差之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26734 2026-06-26 cs.CV cs.AI 新提交 57%

Robust Onion: Peeling Open Vocab Object Detectors Under Noise

鲁棒洋葱:在噪声下剖析开放词汇目标检测器

Priyank Pathak, Mukilan Karuppasamy, Aaditya Baranwal, Shruti Vyas, Yogesh S Rawat

机构 * UCF Institute of Artificial Intelligence, University of Central Florida (UCF)(中佛罗里达大学人工智能研究所)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 通过受控合成视觉退化逐层分析开放词汇目标检测器,发现视觉骨干相似时鲁棒性主要由图像域决定,并提出轻量级方法提升真实场景鲁棒性。

Comments Accepted at The 19th European Conference on Computer Vision (ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11225 2026-06-26 cs.CV cs.CL 57%

Sign Language Recognition in the Age of LLMs

在大语言模型时代的手语识别

Vaclav Javorek, Jakub Honzik, Ivan Gruber, Tomas Zelezny, Marek Hruz

机构 * University of West Bohemia(西波西米亚大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 研究探讨现代VLMs在零样本条件下进行孤立手语识别的能力,发现开源模型表现欠佳,而大模型在精度上表现突出,强调模型规模和训练数据多样性的重要性。

Comments Accepted at the CVPR 2026 Workshop on Multimodal Sign Language Research (MSLR), 8 pages, 3 figures

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 10511-10519

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09237 2026-06-26 cs.CL 版本更新 57%

ScheMatiQ: From Research Question to Structured Data through Interactive Schema Discovery

ScheMatiQ: 从研究问题到结构化数据——通过交互式模式发现

Shahar Levy, Eliya Habba, Reshef Mintz, Barak Raveh, Renana Keydar, Gabriel Stanovsky

机构 * School of Computer Science and Engineering, The Hebrew University of Jerusalem(希伯来大学耶路撒冷分校计算机科学与工程学院) Faculty of Law, The Hebrew University of Jerusalem(希伯来大学耶路撒冷分校法学院) Allen Institute for AI(人工智能艾伦研究所)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 提出ScheMatiQ系统,利用大语言模型从研究问题和语料库自动生成标注模式与结构化数据库,支持用户交互修正,在法律和计算生物学领域验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27084 2026-06-26 cs.CV eess.IV 新提交 50%

Pseudo-Text-Conditioned 3D Grounding DINO for Organ Localization in Abdominal CT

伪文本条件3D Grounding DINO用于腹部CT器官定位

Siqi Chen, Han Gong, Keyi Hou, Jingxuan Yang, Sheethal Bhat, Andreas Maier

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出CT-3GDINO,一种轻量级3D检测器,通过冻结伪文本类令牌替代真实文本编码器,实现腹部CT中五个器官的定位,在193个体积上达到0.5830 mAP。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26800 2026-06-26 cs.RO 新提交 50%

SSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic Manipulation

SSI-Policy: 学习用于视觉语言机器人操作的结构化场景接口

Kaijun Wang, Zikai Ouyang, Xuping Wu, Jinyi Hong, Wei Pan, Haibo Lu, Jia Pan, Wei Zhang, Linfang Zheng

机构 * Southern University of Science and Technology(南方科技大学) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学) LimX Dynamics

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出SSI-Policy框架,通过统一的结构化场景接口(SSI)联合编码单目深度、语言锚定的物体布局和指令条件化的2D运动轨迹,实现从少量演示中学习机器人操作,在LIBERO基准上仅用10个演示即提升15%性能。

Comments Accepted by 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏