arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-01 至 2026-07-01 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 23 篇

2606.30661 2026-07-01 cs.CY 新提交 92%

Understanding Censorship in Large Language Models: From Mechanisms to Governance

理解大型语言模型中的审查:从机制到治理

Quanyan Zhu

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文从社会技术视角审视LLM审查,涵盖数据、对齐、政策、推理时审核及法规,分析其表现形式、测量挑战与治理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31247 2026-07-01 cs.SD eess.AS 新提交 87%

FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model

FlexiSLM:一种动态可控帧率的语音语言模型

Jiaqi Li, Chaoren Wang, Xiaohai Tian, Mingjie Chen, Xinyu Liang, Xu Li, Yufan Lin, Junwen Qiu, Jun Zhang, Lu Lu, Haizhou Li, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 预训练与数据 :language model(title,abstract);SLM(abstract,abstract_cn);LLM(abstract_cn)

AI总结 提出FlexiSLM,首个支持动态可控帧率的语音语言模型,利用动态帧率表示在高质量点超越固定帧率7B模型,并在6.25 Hz时推理速度减半且保持高质量。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30944 2026-07-01 eess.AS cs.SD 新提交 85%

Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation

保留语音到文本LLM能力的语音到语音生成

Yuxuan Hu, Heng Lu, Ruchao Fan, Yao Qian, Xiaofei Wang, Jian Xue, Heming Wang, Shuohang Wang, Young Jin Kim, Yelong Shen, Jinyu Li

机构 * Microsoft(微软)

专题命中 预训练与数据 :LLM(title,title_cn)

AI总结 提出PRIME-Speech框架,通过冻结骨干网络并仅训练语音生成模块,在保持语音到文本性能的同时实现高质量语音到语音转换,支持多轮对话。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10406 2026-07-01 cs.LG 版本更新 83%

Multipole Semantic Attention: A Fast Approximation of Softmax Attention for Pretraining

多极语义注意力:一种用于预训练的Softmax注意力快速近似方法

Rupert Mitchell, Kristian Kersting

机构 * TU Darmstadt(达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 提出多极语义注意力(MuSe),通过对查询和键分别聚类实现查询特定的摘要,在64k上下文预训练中加速36%且保持损失不变,无需架构修改,兼容现有预训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16757 2026-07-01 eess.AS cs.AI 版本更新 83%

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

重新审视音频-语言预训练以学习通用音频表示

Wei-Cheng Tseng, Xuanru Zhou, Mingyue Huo, Yiwen Shao, Hao Zhang, Dong Yu

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tencent AI Lab Seattle(腾讯AI实验室西雅图)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文通过构建大规模数据集CaptionStew并系统对比对比学习和字幕生成目标,揭示了音频-语言预训练在数据效率和可扩展性上的权衡,为通用音频表示学习提供了实证指导。

Comments ACL 2026 Main. Code available at https://github.com/AudenAI/Auden

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30813 2026-07-01 cs.LG cs.AI 新提交 82%

Gradient Smoothing: Coupling Layer-wise Updates for Improved Optimization

梯度平滑:耦合逐层更新以改进优化

Haoming Meng, Anton Sugolov, Vardan Papyan

机构 * Vector Institute(向量研究所)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 提出深度梯度增强框架,通过窗口平滑算子沿深度方向变换优化器更新,在不改变模型架构或训练目标下提升多种架构和任务的优化与泛化性能。

Comments Published in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15637 2026-07-01 cs.LG cs.AI stat.ML 版本更新 81%

Mantis: Lightweight Foundation Model for Time Series Classification

Mantis: 用于时间序列分类的轻量级基础模型

Vasilii Feofanov, Songkang Wen, Shifeng Xie, Simon Roschmann, Marius Alonso, Hongbo Guo, Romain Ilbert, Malik Tiomoko, Quentin Bouniot, Zeynep Akata, Lujia Pan, Jianfeng Zhang, Ievgen Redko

机构 * com(42.com) Helmholtz Munich(亥姆霍兹慕尼黑中心) Technical University of Munich(慕尼黑工业大学) Criteo Meta Telecom Paris(巴黎电信学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出基于Transformer的轻量级基础模型Mantis,通过自监督对比学习在合成数据上预训练,并引入新颖的令牌生成单元和增强测试方法,在多个数据集上超越现有基础模型。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30429 2026-07-01 cs.LG 版本更新 79%

Arko-T: A Foundation Model for Text-to-Structured 3D Generation

Arko-T: 面向文本到结构化3D生成的基础模型

Liang Wang, Zhaoyang Xi, Zekai Xiang, Heng Meng, Qishan Zhang, Pingyi Zhou, Jin Liu, Litao Chen

机构 * Spatial Design Intelligence Lab, BitInf Ltd.(BitInf有限公司空间设计智能实验室) School of Computer Science, Wuhan University(武汉大学计算机学院) College of Computer and Information Engineering, Nanjing Tech University(南京工业大学计算机与信息工程学院)

专题命中 预训练与数据 :foundation model(title);LLM(abstract_cn);分类 cs.LG

AI总结 提出4B参数文本到设计模型Arko-T,通过设计状态对齐实现从自然语言到可编辑参数化CAD程序的生成,在12项指标中8项最优,成本仅为前沿模型的十分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11554 2026-07-01 cs.LG 版本更新 79%

A Controlled Counterexample to Strong Proxy-Based Explanations of OOD Performance: in a Fixed Pretraining-and-Probing Setup

对强代理基于解释的OOD性能的受控反例:在固定预训练和探测设置中

Hongmin Li

机构 * School of Life Science and Technology, Institute of Science Tokyo(生命科学与技术学院,科学东京研究所) Department of Computational Biology and Medical Sciences, Graduate School of Frontier Sciences(计算生物学与医学科学系,前沿科学研究生院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 研究探讨了代理是否必须与OOD探测准确性排名一致,发现代理可能无法追踪任务相关结构,揭示了强代理解释的边界。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20062 2026-07-01 cs.LG stat.ML 版本更新 79%

A Theory of How Pretraining Shapes Inductive Bias in Fine-Tuning

预训练如何塑造微调中的归纳偏置的理论

Nicolas Anguita, Francesco Locatello, Andrew M. Saxe, Marco Mondelli, Flavia Mancini, Samuel Lippl, Clementine Domine

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 通过分析对角线性网络中的预训练-微调流程,发现不同初始化尺度导致四种微调模式,其中较小的早期层初始化有助于特征重用和精炼,提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30700 2026-07-01 cs.SD cs.AI cs.LG eess.AS eess.SP 新提交 79%

BEST-RQ-2: Contextualize-Then-Predict, a Two-Step Approach for Self-Supervised Audio Representations

BEST-RQ-2:先上下文化再预测——自监督音频表示的两步方法

Ludovic K. Tuncay, Etienne Labbé, Thomas Pellegrini

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出BEST-RQ-2,通过两步式上下文化-预测预训练方案,使用ViT编码器和轻量预测器,在保持推理计算不变下提升跨域迁移性能。

Journal ref Interspeech 2026, Sep 2026, Sydney, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30749 2026-07-01 cs.RO 新提交 78%

From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation

从抓取到灵巧:大规模抓取预训练用于灵巧操作

Ying Yuan, Xinyu Liu, Sriram Krishna, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出一种层次化模仿学习框架,利用大规模灵巧抓取数据集预训练低级控制器,再微调于下游工具使用任务,在仿真和真实实验中显著提升成功率。

Comments Project page: https://yingyuan0414.github.io/grasp2dexterity/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30922 2026-07-01 cond-mat.other 新提交 78%

An Interaction Language Model: Mechanism Discovery from Statistical Patterns of Physical Interactions

交互语言模型:从物理交互的统计模式中发现机制

Triparna Ganguly, Hanqi Jiang, Xinliang Li, Yi Pan, Junhao Chen, Miyuki Karunathilaka, Tianming Liu, Yohannes Abate

专题命中 预训练与数据 :language model(title,abstract)

AI总结 提出交互语言模型(ILM),通过统计学习物理交互的依赖关系,推断交互路径、识别缺失步骤并预测下一步交互,在分子扩散任务中实现可审计的机制发现。

Comments Corresponding authors: Tianming Liu, Yohannes Abate

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30460 2026-07-01 cs.LG cs.DC 版本更新 77%

HSAP: A Hierarchical Sequence-aware Parallelism for Hybrid-Context Generative Models

HSAP: 一种面向混合上下文生成模型的分层序列感知并行方法

Songxin Zhang, Zejian Xie, Zhuoyang Song, Cong lin, Junyu Lu, Jiaxing Zhang, Bingyi Jing

机构 * Southern University of Science and Technology(南方科技大学) International Digital Economy Academy(国际数字经济学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出一种分层序列感知并行框架,通过JIT编译优化通信策略,解决混合上下文打包序列中的因果注意力计算问题,在多个指标上优于现有方法。

Comments 10 pages, ACL preprint style

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21876 2026-07-01 cs.LG cs.AI 新提交 73%

Protein contacts are already in the attention: a single-forward-pass alternative to the Categorical Jacobian

蛋白质接触已经存在于注意力中:分类雅可比矩阵的单次前向替代方案

Rome Thorstenson

机构 * Independent Researcher(独立研究员)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出通过选择少量注意力头(仅需10个标记蛋白质)平均即可在一次前向传播中恢复蛋白质接触,在无泄漏数据上优于分类雅可比矩阵,并发现该信号依赖于双向预训练。

Comments 28 pages, 9 figures. Code and data: https://github.com/Rome-1/plm-contact-fusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31325 2026-07-01 cs.AI 新提交 70%

HistoriQA-ThirdRepublic: Multi-Hop Question Answering Corpus for Historical Research, Parliamentary Debates from the French Third Republic (1870-1940)

HistoriQA-ThirdRepublic: 面向历史研究的多跳问答语料库——来自法兰西第三共和国(1870-1940)的议会辩论

Aurélien Pellet, Julien Perez, Marie Puren

机构 * LRE EPITA EPITECH Bpifrance CJM

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个法语多跳历史问答数据集,基于第三共和国议会辩论和报纸,由历史学家协作构建,涵盖跨源综合、时间推理等复杂推理模式,共1782个问题,用于评估检索增强和大型语言模型在特定领域的效果。

Journal ref LREC 2026: Language Resources and Evaluation Conference, ELRA Language Resources Association, May 2026, Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30905 2026-07-01 cs.CY cs.AI 新提交 70%

How Human Feedback Shapes AI-generated Community Notes

人类反馈如何塑造AI生成的社区笔记

Soham De, Isaac Slaughter, Jiawei Guo, Qiao-Yun Cheng, Jiayuan Yan, Sruti Banerjee, Martin Saveski

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究分析X平台协作笔记中人类反馈对AI生成草稿的影响,发现事实修正和补充背景的建议最易被采纳,人类反馈提升笔记有用性,但协作笔记达到有用状态的比例低于纯人类或纯AI笔记,且主要补充而非替代它们。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30777 2026-07-01 cs.CV 新提交 67%

Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings

通过潜在场景嵌入揭示轨迹预测中的可迁移性

Theodor Westny, David Axelsson, Björn Olofsson, Erik Frisk

机构 * Linköping University(林雪平大学) Lund University(隆德大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 提出一个学习数据集潜在表示并用量化分布指标衡量相似性的框架,在24个数据集上验证迁移分数与跨数据集模型性能强相关,为数据集选择、预训练和基础模型提供指导。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31991 2026-07-01 cs.LG cs.AI 新提交 62%

Amplifying Membership Signal Through Chained Regeneration

通过链式再生放大成员信号

Wojciech Łapacz, Stanisław Pawlak

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MADreMIA框架,利用链式再生迭代轨迹增强生成模型的成员推断和数据集推理攻击,在低误报率下提升信号强度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31135 2026-07-01 cs.CV cs.LG 新提交 57%

MSNN-LINet: Cross-Modal Learning via Continuous Linear Integration

MSNN-LINet:通过连续线性集成进行跨模态学习

Gabriel Clinger

机构 * The George Washington University(乔治华盛顿大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出线性集成网络LINet,通过连续线性集成卷积操作实现RGB-D场景分类中的逐层跨模态学习,解决多模态融合的结构性妥协问题,并在SUN RGB-D数据集上取得领先结果。

Comments 14 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31204 2026-07-01 cs.CV 新提交 50%

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

AC3S: 面向3D感知合成数据生成的自适应条件控制

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)

专题命中 预训练与数据 :language model(abstract)

AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。

Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23683 2026-07-01 cs.CV 版本更新 50%

Learning to Decipher from Pixels: A Case Study of Copiale

从像素中学习 decipher —— Copiale 的案例研究

Lei Kang, Giuseppe De Gregorio, Raphaela Heil, Alicia Fornés, Beáta Megyesi

机构 * Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心) Department of Linguistics, Stockholm University(斯德哥尔摩大学语言系)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出一种端到端的 transcription-free 方法,直接将手写密码图像映射到明文。通过 Copiale 密码案例研究,首次引入文本行级数据集,结合密码图像与德文明文,展示预训练和特定密码微调提升 deciphering 准确性。

Comments The 9th International Conference on Historical Cryptology (HistoCrypt 2026), Amiens, France, June 22-24, 2026 URN: urn:nbn:se:su:diva-257058 ISBN: 9789908539997 (print) OAI: oai:DiVA.org:su-257058 DiVA, id: diva2:2075848

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09100 2026-07-01 cs.CV cs.RO 版本更新 50%

Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch

基于本体感知和多接触触觉的物理 grounded 的 3D 生成重建在手部遮挡下

Gabriele Mario Caddeo, Pasquale Marra, Lorenzo Natale

机构 * Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出了一种多模态、物理 grounded 的方法,用于在严重手部遮挡下进行度量尺度的无遮挡物体重建和姿态估计,通过本体感知和多接触触觉信号提升重建精度和物理一致性。

Comments 29 pages, 10 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏