arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-17 至 2026-06-17 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 20 篇

2412.10139 2026-06-17 cs.CL 版本更新 93%

TACOMORE: Exploring a replicable prompting protocol for LLM-assisted corpus analysis

TACOMORE: 探索一种可复现的提示协议用于LLM辅助语料库分析

Bingru Li, Han Wang, Nicholas Groom

机构 * Department of Linguistics and Communication, University of Birmingham(伯明翰大学语言学与传播系) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Institute of Foreign Languages and Cultures, University of Tartu(塔尔图大学外国语言与文化研究所)

专题命中 预训练与数据 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出TACOMORE框架,通过结构化提示将LLM从通用概率预测转向基于语料共现模式的推理,提升关键词、搭配和索引行分析的准确性与可复现性,但幻觉问题仍需人工验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17542 2026-06-17 cs.CL 新提交 92%

Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings

评估大型语言模型在会议中的收话人、话轮转换和下一说话人预测能力

Ryo Fukuda, Takatomo Kano, Siddhant Arora, Marc Delcroix, Naohiro Tawara, Atsunori Ogawa, Yuya Chiba, Atsushi Ando, William Chen, Shinji Watanabe

机构 * NTT, Inc., Japan(日本电信电话公司) Language Technologies Institute, Carnegie Mellon University, USA(卡内基梅隆大学语言技术研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 利用大型语言模型(LLMs)研究多模态多人对话中的话轮转换,构建了收话人检测、话轮转换预测和下一说话人预测三个任务的评估框架,实验表明LLMs在下一说话人预测上优于监督模型和人类,但多模态LLM在收话人检测和话轮转换预测上仍低于人类水平。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01904 2026-06-17 cs.CR cs.AI 版本更新 92%

Combating Data Laundering in LLM Training

对抗LLM训练中的数据清洗

Muxing Li, Zesheng Ye, Sharon Li, Feng Liu

机构 * University of Melbourne(墨尔本大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对数据清洗(通过变换风格隐藏数据来源)导致传统检测失效的问题,提出基于辅助LLM推断变换目标并合成查询的SDR方法,显著增强数据滥用检测能力。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16591 2026-06-17 cs.CL 新提交 90%

SING: Synthetic Intention Graph for Scalable Active Tool Discovery in LLM Agents

SING: 用于LLM代理中可扩展主动工具发现的合成意图图

Qiao Xiao, Haochen Shi, Yisen Gao, Wenbin Hu, Huihao Jing, Tianshi Zheng, Baixuan Xu, Ziheng Zhang, Weiqi Wang, Haoran Li, Jiaxin Bai, Yangqiu Song

机构 * Cornell University(康奈尔大学) The Hong Kong University of Science and Technology(香港科技大学) The Ohio State University(俄亥俄州立大学) Hong Kong Baptist University(香港浸会大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SING框架,通过构建意图-工具图并动态检索工具,在长周期任务中提升工具发现准确率,Global Recall@5提高59.8%,下游成功率提高28.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17581 2026-06-17 cs.PL cs.AI 新提交 89%

Visored: A Controlled-Natural-Language Prover for LLM-Generated Mathematics

Visored: 一种面向LLM生成数学的受控自然语言证明器

Xiyu Zhai, Xinyi Chen, Yiping Wang, Runlong Zhou, Liao Zhang, Simon S. Du

机构 * University of Washington(华盛顿大学) University of Innsbruck(因斯布鲁克大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于依赖类型的证明器,其表面模仿数学自然语言,并通过规则驱动的自动化层填补常规步骤,使LLM无需专用训练数据即可在miniF2F基准上有效使用,并输出可检查的Lean文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01973 2026-06-17 cs.CL cs.LG 版本更新 86%

Learn-To-Learn on Arbitrary Textual Conditioning: A Hypernetwork-Driven Meta-Gated LLM

在任意文本条件下学习:一种超网络驱动的元门控大语言模型

Luo Ji, Qi Qin, Ningyuan Xi, Teng Chen, Qingqing Gu, Hongyan Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 提出一种超网络驱动的元门控机制,通过动态调整SwiGLU块中的β参数,使LLM适应不同文本条件,优于微调和元学习基线。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03300 2026-06-17 cs.LG cs.AI cs.CL cs.CV 版本更新 86%

R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?

R1-SyntheticVL:生成模型的合成数据是否已为多模态大语言模型做好准备?

Jingyi Zhang, Tianyi Lin, Huanjin Yao, Xiang Lan, Shunyu Liu, Jiaxing Huang

机构 * Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出集体对抗数据合成(CADS)方法,通过集体智能和对抗学习自动生成高质量、多样且具有挑战性的多模态数据,用于增强多模态大语言模型(MLLM)在复杂现实任务中的性能。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17526 2026-06-17 cs.LG 新提交 84%

MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization

MGUP:一种用于随机优化的动量-梯度对齐更新策略

Da Chang, Ganzhao Yuan

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shenzhen University of Advanced Technology(深圳理工大学) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出MGUP机制,通过按固定比例选择参数施加大步长、其余参数用小步长,增强动量优化器,理论保证收敛,实验表明提升训练效率与稳定性。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17340 2026-06-17 cs.CV cs.AI 新提交 79%

Geometry-Consistent Endoscopic Representations for Image-Guided Navigation via Structured Foundation Model Adaptation

几何一致的内窥镜表示用于图像引导导航:基于结构化基础模型适配

Hongchao Shu, Roger D. Soberanis-Mukul, Hao Ding, Morgan Ringel, Mali Shen, Saif Iftekar Sayed, Hedyeh Rafii-Tari, Mathias Unberath

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Semaphor Surgical Johnson & Johnson MedTech(强生医疗科技)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 提出统一框架,结合合成数据管道与层级感知几何语义适配,学习几何一致且领域鲁棒的图像表示,提升单目内窥镜中的位姿估计与深度预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12867 2026-06-17 cs.LG 新提交 79%

SMGFM: Spectral Multimodal Graph Pretraining for Multimodal-Attributed Graphs

SMGFM: 面向多模态属性图的谱多模态图预训练

Zhengyu Wu, Xu Wang, Hongchao Qin, Xunkai Li, Guang Zeng, Rong-Hua Li, Guoren Wang

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出SMGFM框架,利用图频谱分解区分结构诱导语义与模态特有语义,通过频带路由实现跨模态融合,在图级和模态级任务上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17200 2026-06-17 cs.RO 新提交 78%

ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining

ACE-Ego-0:统一第一人称人类与机器人数据用于VLA预训练

Hao Li, Ganlong Zhao, Yufei Liu, Haotian Hou, Guoquan Ye, Tongyan Fang, Chunxiao Liu, Siyuan Huang, Jianbo Liu, Xiaogang Wang, Hongsheng Li

机构 * ACE Robotics CUHK MMLab(香港中文大学多媒体实验室) CUHK, Shenzhen(香港中文大学(深圳)) SJTU(上海交通大学) THU(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出ACE-EGO-0框架,通过可扩展的第一人称视频到动作管道和可靠性感知训练目标,统一人类与机器人数据用于VLA预训练,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17160 2026-06-17 cs.SD 新提交 78%

Transductive Zero-Shot Audio Classification with Audio-Language Models

基于音频-语言模型的直推式零样本音频分类

Jingwen Zhou, Mingzhe Wang

机构 * Xidian University, Xi'an, China(西安电子科技大学)

专题命中 预训练与数据 :language model(title);pretraining(abstract)

AI总结 提出一种文本锚定的球面高斯混合EM算法,利用测试批次音频嵌入统计信息改进零样本后验,无需标签和梯度,在三个数据集上提升4.6-9.2个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18237 2026-06-17 cs.CL cs.AI cs.LG 新提交 75%

ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

ReproRepo: 利用 GitHub 仓库问题扩展可重复性审计

Shanda Li, Qiuhong Anna Wei, Jingwu Tang, Valerie Chen, Nihar B Shah, Tim Dettmers, Yiming Yang, Ameet Talwalkar

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Datadog

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 ReproRepo 框架,利用 GitHub issues 作为监督信号,对 1149 篇论文进行可重复性评估,发现 Codex with GPT-5.5 能识别约 90% 论文的语义相关复现问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17445 2026-06-17 cs.LG cond-mat.mtrl-sci physics.chem-ph 新提交 74%

Toward Controllable Catalyst Inverse Design via Large-Scale Autoregressive Pretraining

面向可控催化剂逆向设计的大规模自回归预训练

Dong Hyeon Mok, Jonggeol Na, Seoin Back

机构 * Department of Chemical and Biomolecular Engineering, Institute of Emergent Materials, Sogang University(化学与生物分子工程系,新兴材料研究所,首尔大学) Department of Chemical Engineering and Materials Science, Ewha Womans University(化学工程与材料科学系,成实女子大学) Department of Chemical Engineering, Graduate Program in System Health Science and Engineering, Ewha Womans University(化学工程系,系统健康科学与工程研究生院,成实女子大学) Institute for Multiscale Matter and Systems (IMMS), Ewha Womans University(多尺度物质与系统研究所(IMMS),成实女子大学) KU-KIST Graduate School of Converging Science and Technology, Korea University(KU-KIST融合科学与技术研究生院,韩国大学) Department of Integrated Energy Engineering, Korea University(整合能源工程系,韩国大学) Center for Hydrogen and Fuel Cells, Korea Institute of Science and Technology(KIST)(氢气与燃料电池中心,韩国科学技术院(KIST))

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 提出基于生成式预训练Transformer的条件催化剂生成模型,通过大规模预训练和微调实现高结构有效性和条件匹配率,显著提升筛选效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18222 2026-06-17 cs.CL cs.DL 新提交 70%

Darshana Graph: A Parallel Commentary Corpus for Comparative Indian Philosophy, with Stylometric and Exploratory Graph Analyses

Darshana Graph:用于比较印度哲学的平行注释语料库,附文体计量与探索性图分析

Joy Bose

机构 * Independent Researcher(独立研究者) Bangalore, India(印度班加罗尔)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 构建包含超12.5万条记录的印度哲学平行注释语料库,其中约8500条记录实现跨18位注释者的根颂对齐,通过文体计量和约束大语言模型管道分析论证风格与概念关系,揭示学派间分歧模式。

Comments 12 pages, 1 figure. Open Source Code available at https://github.com/joyboseroy/darshana-graph and dataset at https://huggingface.co/datasets/joyboseroy/darshana-graph

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11616 2026-06-17 cs.LG cs.IR 新提交 70%

DeMix: Debugging Training Data with Mixed Data Error Types by Investigating Influence Vectors

DeMix: 通过影响向量调试包含混合错误类型的训练数据

Jiale Deng, Yanyan Shen, Xiaogang Shi, Junjun Chai

机构 * Shanghai Jiao Tong University(上海交通大学) ByteDance Inc.(字节跳动) Tiktok

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出DeMix框架,利用影响向量捕捉不同错误类型对模型行为的独特模式,将数据调试转化为多标签分类问题,并引入基于干预的学习策略,在11个任务上显著提升调试F1分数和修复后模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15817 2026-06-17 cs.PL cs.SE 新提交 67%

ScratchLens: Lens-Parametric Behavioral Equivalence for Scratch Programs

ScratchLens: 用于 Scratch 程序的透镜参数化行为等价性

Yuan Si, Jialu Zhang

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 针对块编程语言中程序等价性判定问题,提出透镜参数化等价框架SPECTRA,通过因果IR、规范化和Mazurkiewicz迹商等技术,实现高精度行为等价判定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17667 2026-06-17 cs.LG cs.AI 新提交 62%

Handling Feature Heterogeneity with Learnable Graph Patches

处理特征异质性:可学习图块方法

Yifei Sun, Yang Yang, Xiao Feng, Zijun Wang, Haoyang Zhong, Chunping Wang, Lei Chen

机构 * Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学) Finvolution Group(信也科技集团)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出可学习图块概念,将图分解为语义单元,通过补丁编码器和聚合器实现跨域图数据的可迁移预训练,提升下游任务性能。

Comments Accepted at KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14771 2026-06-17 cs.CV cs.AI cs.LG cs.MM cs.NE 版本更新 62%

GOT-JEPA: Generic Object Tracking with Model Adaptation and Occlusion Handling using Joint-Embedding Predictive Architecture

GOT-JEPA:基于联合嵌入预测架构的通用目标跟踪与模型自适应及遮挡处理

Shih-Fang Chen, Jun-Cheng Chen, I-Hong Jhuo, Yen-Yu Lin

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国家阳明交通大学计算机科学系) Research Center for Information Technology Innovation, Academia Sinica(中华学术院信息技术创新研究中心) Microsoft AI(微软人工智能)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出GOT-JEPA框架,通过预测跟踪模型而非图像特征来提升泛化能力,并设计OccuSolver增强遮挡感知,在七个基准上验证了有效性。

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). This research focuses on learning model adaptation for adverse and dynamic environments, as well as fine-grained occlusion perception for tracking

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02803 2026-06-17 cs.CV 版本更新 50%

Structure-Aware Text Recognition for Ancient Greek Critical Editions

面向古希腊校勘本的结构感知文本识别

Nicolas Angleraud, Antonia Karamolegkou, Benoît Sagot, Thibault Clérice

机构 * Inria(法国国家信息与自动化技术研究所)

专题命中 预训练与数据 :language model(abstract)

AI总结 本文通过构建大规模合成语料库和真实扫描基准,评估了视觉语言模型在结构感知文本识别上的性能,发现Qwen3VL-8B模型在真实扫描上达到1.0%的中位字符错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏