arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 7971 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 7971 篇

2603.02938 2026-05-22 cs.LG cs.AI 62%

Beyond One-Size-Fits-All: Adaptive Subgraph Denoising for Zero-Shot Graph Learning with Large Language Models

超越一刀切:基于大语言模型的零样本图学习中的自适应子图去噪

Fengzhi Li, Liang Zhang, Yuan Zuo, Ruiqing Zhao, YanSong Liu, Yunfei Ma, Fanyu Meng, Junlan Feng

机构 * JIUTIAN Research(JIUTIAN研究) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MIIT Key Laboratory of Data and Decision Intelligence(信息与决策智能重点实验室) Beihang University(北航)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphSSR框架,通过自适应子图提取和去噪方法,解决传统图神经网络在零样本学习中泛化能力不足的问题,提升大语言模型在图推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22001 2026-05-22 cs.CR cs.AI cs.CL 62%

Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems

守卫中的盲区:如何域伪装注入攻击在多智能体大语言模型系统中逃避检测

Aaditya Pai

机构 * Data Science Institute(数据科学研究所) Columbia University(哥伦比亚大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在多智能体大语言模型系统中,域伪装注入攻击如何通过模仿目标文档的领域词汇和权威结构来逃避检测,揭示了检测器在静态和伪装负载之间的检测率差异(Camouflage Detection Gap, CDG),并展示了多智能体辩论架构对静态注入攻击的放大效应以及检测器增强的有限有效性。

Comments 8 pages, 3 figures, 2 tables. Submitted to EMNLP 2026 ARR cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21699 2026-05-22 cs.LG cs.CL 62%

X-Token: Projection-Guided Cross-Tokenizer Knowledge Distillation

X-Token: 通过投影引导的跨分词器知识蒸馏

Sharath Turuvekere Sreenivas, Adithyakrishna Venkatesh Hanasoge, Mingyu Yang, Ali Taghibakhshi, Saurav Muralidharan, Ashwath Aithal, Pavlo Molchanov

机构 * NVIDIA

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出X-Token,一种通过投影引导的跨分词器知识蒸馏方法,解决传统方法在处理不同分词器间知识迁移时的不足,通过两个互补的损失函数改进知识蒸馏效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21507 2026-05-22 physics.ao-ph cs.AI cs.CE cs.LG 62%

Visibility nowcasting in South Korea: a machine learning approach to class imbalance and distribution shift

韩国可见度现在预测:一种处理数据不平衡和分布偏移的机器学习方法

Bong Gyun Shin, Chan Sik Lee, Hyesun Suh

机构 * Department of AI Big Data(人工智能大数据系) Daejin University(大 Jain 大学) Department of Statistics and Actuarial Science(统计与精算科学系) Soongsil University(顺斯大学) College of Artificial Intelligence Convergence(人工智能融合学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种机器学习方法,用于预测韩国六个主要城市的大气可见度,通过SMOTENC和CTGAN处理数据不平衡,并结合机器学习和深度学习模型进行评估,发现训练与测试期间的分布偏移导致预测性能下降,强调了在时间序列数据上实施现在预测模型时考虑外部环境因素的重要性。

Comments Published in Theoretical and Applied Climatology

Journal ref Theoretical and Applied Climatology, vol. 157, art. no. 283, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16362 2026-05-22 cs.LG cs.AI 62%

When Is Rank-1 Steering Cheap? Geometry, Granularity, and Budgeted Search

当秩-1引导廉价时是什么情况?几何学、粒度和预算化搜索

John T. Robertson, Jianing Zhu, Haris Vikalo, Zhangyang Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了秩-1引导在不同概念上的有效性差异,提出粒度和几何学是影响引导成本的关键因素,并介绍了GRACE框架来高效优化引导过程。

Comments Updated Abstract metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17631 2026-05-21 cs.LG cs.AI 62%

Time-Prompt: Integrated Heterogeneous Prompts for Unlocking LLMs in Time Series Forecasting

Time-Prompt: 集成异构提示以解锁时间序列预测中的LLM

Zesen Wang, Lijuan Lan, Yonggang Li

机构 * Central South University, Changsha, China(中南大学,长沙,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Time-Prompt框架,通过构建统一的提示范式、设计语义空间嵌入和跨模态对齐模块以及高效微调LLM参数,提升时间序列预测性能,并在碳排放数据集上验证其有效性。

Comments Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20449 2026-05-21 cs.LG cs.AI 62%

LLM Pretraining Shapes a Generalizable Manifold: Insights into Cross-Modal Transfer to Time Series

LLM预训练塑造了可泛化的流形:跨模态迁移至时间序列的洞察

Alexis Roger, Prateek Humane, Zhenghan Tai, Gwen Legate, Andrei Mircea, Vasilii Feofanov, Irina Rish

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) University of Toronto(多伦多大学) Concordia University(康科迪亚大学) com(42.com)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了语言预训练的Transformer能否成为有效的时序预测器,并揭示了跨模态迁移的机制,指出预训练构建了流形,微调则将数值动态投影到任务相关方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19462 2026-05-20 cs.LG cs.AI 62%

Quantifying the Pre-training Dividend: Generative versus Latent Self-Supervised Learning for Time Series Foundation Models

量化预训练红利:生成与潜在自监督学习在时间序列基础模型中的应用

Noam Major, Kathy Razmadze, Yoli Shavit

机构 * Faculty of Engineering, Bar-Ilan University(巴伊兰大学工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了自监督学习在时间序列中的应用,比较了生成范式与潜在对齐架构,发现预训练红利在异常检测和分类任务中显著提升,但在预测任务中效果有限,同时表明表示质量与数据来源无关,且在适度的架构深度下趋于稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19374 2026-05-20 cs.CV cs.AI cs.LG 62%

Concept-Guided Noisy Negative Suppression for Zero-Shot Classification and Grounding of Chest X-Ray Findings

基于概念的噪声负样本抑制用于零样本分类和胸片发现的 grounding

Chenyu Lian, Hong-Yu Zhou, Chun-Ka Wong, Jing Qin

机构 * The Center for Smart Health, School of Nursing, the Hong Kong Polytechnic University, Hong Kong, China(香港理工大学智能健康中心,护理学院,中国香港) Research Institute for Smart Ageing, the Hong Kong Polytechnic University, Hong Kong, China(香港理工大学智能老龄化研究 institute,中国香港) School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University, Beijing, China(清华大学生物医学工程学院,清华大学,北京,中国) Queen Mary Hospital, LKS Faculty of Medicine, The University of Hong Kong, Hong Kong, China(香港大学李嘉诚医学院Queen Mary医院,中国香港)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于概念的噪声负样本抑制框架CoNNS,通过构建层次化概念本体,解决不同患者间相似发现导致的噪声负样本问题,提升零样本理解任务的性能。

Comments Early accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19147 2026-05-20 cs.CR cs.AI cs.LG 62%

Be Kind, Rewrite: Benign Projections via Rewriting Defend Against LLM Data Poisoning Attacks

仁者重写:通过重写实现良性投影以防御大语言模型数据中毒攻击

John T. Halloran, Noopur S. Bhatt

机构 * Leidos University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于重写的良性投影方法(OBBR),通过利用开放书本的良性样本来提高大语言模型对数据中毒攻击的防御能力,实验表明OBBR在多种已知攻击模式中表现出更高的安全性能,并且在计算效率和模型性能方面具有优势。

Comments 15 pages, 2 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19033 2026-05-20 cs.RO cs.AI cs.CV cs.LG cs.MA 62%

RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuning

RLFTSim: 通过强化学习微调实现逼真且可控的多智能体交通仿真

Ehsan Ahmadi, Hunter Schofield, Behzad Khamidehi, Fazel Arasteh, Jinjun Shan, Lili Mou, Dongfeng Bai, Kasra Rezaee

机构 * University of Alberta(阿尔伯塔大学) Huawei Technologies Canada(华为加拿大技术有限公司) York University(约克大学) Canada CIFAR AI Chair, Amii(加拿大 CIFAR 人工智能主席,Amii)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RLFTSim框架,通过强化学习微调提升交通仿真场景的真实感,并通过目标条件化方法实现对交通仿真可控性的提炼,实验表明其在真实感和可控性方面均优于其他启发式搜索方法。

Comments CVPR 2026 Highlight; Project page at https://ehsan-ami.github.io/rlftsim

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07570 2026-05-20 q-bio.NC cs.AI cs.CV cs.LG 62%

How does longer temporal context enhance multimodal narrative video processing in the brain?

更长的时间上下文如何增强大脑对多模态叙事视频的处理?

Prachi Jindal, Anant Khandelwal, Manish Gupta, Bapi S. Raju, Subba Reddy Oota, Tanmoy Chakraborty

机构 * Technische Universität Berlin(柏林技术大学) Microsoft Research(微软研究院) IIT Delhi(德里理工学院) Microsoft(微软) IIIT-Hyderabad(海得拉巴理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了视频片段时长和叙事任务提示如何影响自然电影观看过程中大脑模型对多模态大语言模型(MLLMs)的对齐情况,发现增加片段持续时间显著提高了大脑对齐程度,而单模态视频模型则无明显提升。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05437 2026-05-20 cs.CL cs.AI 62%

Tracing Moral Foundations in Large Language Models

在大型语言模型中追溯道德基础

Chenxiao Yu, Bowen Yi, Farzan Karimi-Malekabadi, Suhaib Abdurahman, Jinyi Ye, Shrikanth Narayanan, Yue Zhao, Morteza Dehghani

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Psychology, University of Southern California(南加州大学心理学系) Center for Computational Language Sciences, University of Southern California(南加州大学计算语言科学中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型中道德基础的编码、组织和表达,通过多层方法分析道德基础与人类道德感知的一致性,并发现道德结构在预训练和微调过程中自然形成,且部分解耦。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18298 2026-05-19 cs.AI cs.HC cs.LG 62%

DARE-EEG: A Foundation Model for Mining Dual-Aligned Representation of EEG

DARE-EEG: 一种用于挖掘双对齐表示的EEG基础模型

Yang Shao, Peiliang Gong, Qun Dai, Daoqiang Zhang

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(航空宇航学院人工智能学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DARE-EEG,一种通过双对齐表示学习预训练的自监督基础模型,旨在解决EEG编码器在不完整观测下学习不变表示的问题,通过对比学习和动量更新实现语义稳定性,并通过卷积-线性探针策略适应异构电极配置和采样率,实验表明其在EEG基准测试中表现优异。

Comments 22 pages, 10 pages of main text + 12 pages of appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18150 2026-05-19 cs.LG cs.AI 62%

Improving MLLM Training Efficiency via Stage-Aware Sparsity

通过阶段感知稀疏性提升MLLM训练效率

Kean Shi, Liang Chen, Haozhe Zhao, Baobao Chang

机构 * Peking University(北京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于稀疏表示的高效训练框架STS,通过阶段感知设计适应不同训练阶段的冗余,采用视觉标记压缩器和层动态跳过器来减少计算开销,验证了其在多种MLLM架构上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17276 2026-05-19 cs.LG cs.AI 62%

How Do Electrocardiogram Models Scale?

ECG模型如何扩展?

Jiawei Li, Fabio Bonassi, Ming Jin, Stefan Gustafsson, Johan Sundström, Thomas B. Schön, Antônio H. Ribeiro

机构 * Uppsala University(乌普萨拉大学) Griffith University(格里菲斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了ECG模型在不同规模下的扩展规律,发现监督学习模型在数据受限时表现不佳,而自监督学习模型在模型和数据规模上都具有鲁棒性,同时自监督Transformer在非常大的模型规模上超越了ResNet。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17214 2026-05-19 cs.AI cs.CL cs.CV 62%

ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding

ChemVA:推动大型语言模型在化学反应图示理解上的进步

Mingyang Rao, Kehua Feng, Zhihui Zhu, Jiangzhen Fu, Hao Yu, Keyan Ding, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科学与技术创新中心) Department of Chemistry, Fudan University(复旦大学化学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有系统在理解化学反应图示时存在的视觉缺陷和语义断开问题,提出ChemVA框架,通过视觉锚机制和语义对齐方法提升大型语言模型在化学推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17084 2026-05-19 cs.LG cs.CL 62%

Scale Determines Whether Language Models Organize Representation Geometry for Prediction

尺度决定语言模型是否为预测组织表示几何

Weilun Xu

机构 * School of Computer and Communication Sciences(计算机与通信科学学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了语言模型中表示几何是否为预测组织,通过Subspace PGA指标发现,模型规模影响表示几何的组织程度,小模型在训练后期逐渐失去这种组织,而大模型则保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16360 2026-05-19 cs.LG cs.AI 62%

ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference

ProxyKV:跨模型代理剪枝用于高效长上下文LLM推理

Junjie Li, Jiong Lou, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ProxyKV通过跨模型代理剪枝方法,解决LLM长上下文推理中的KV缓存内存瓶颈,实现高效推理与高精度的平衡,提升预填充速度和长上下文处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16343 2026-05-19 cs.LG cs.AI 62%

LoopQ: Quantization for Recursive Transformers

LoopQ: 递归变换器的量化

Rui Fang, Hsi-Wen Chen, Ming-Syan Chen

机构 * National Taiwan University(国立台湾大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LoopQ框架,针对递归变换器的量化挑战,通过激活缩放、选择性变换等方法提升模型精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16325 2026-05-19 cs.LG cs.AI 62%

Phase Transitions in Driven Informational Systems: A Two-Field Perspective on Learning Theory and Non-Equilibrium Chemistry

驱动信息系统的相变:从学习理论和非平衡化学的角度看两种场视角

Truong Xuan Khanh

机构 * H&K Research Studio, Clevix LLC(H&K研究室,Clevix公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文从学习理论和非平衡化学角度,提出驱动信息系统的两种场框架,引入对抗破裂阈值和自参照耦合阈值,探讨相变现象的普遍性类与可验证预测。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22440 2026-05-18 cs.CY cs.LG cs.MA econ.GN q-fin.EC 62%

From Model Design to Organizational Design: Complexity Redistribution and Trade-Offs in Generative AI

从模型设计到组织设计:生成AI中的复杂性再分配与权衡

Sharique Hasan, Alexander Oettl, Sampsa Samila

机构 * Duke University(杜克大学) Georgia Institute of Technology(佐治亚理工学院) IESE Business School(IESE商学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CY、cs.LG

AI总结 本文提出GAS框架,分析大语言模型如何重塑组织与竞争策略,揭示生成AI中通用性、准确性与简洁性之间的权衡及复杂性再分配对管理挑战的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15549 2026-05-18 cs.LG cs.AI cs.CE 62%

CTF4Nuclear: Common Task Framework for Nuclear Fission and Fusion Models

CTF4Nuclear: 用于核裂变和核聚变模型的通用任务框架

Stefano Riva, Carolina Introini, Antonio Cammi, Dean Price, Alexey Yermakov, Yue Zhao, Philippe M. Wyder, Judah Goldfeder, Jan Williams, Amy Sara Rude, Matteo Tomasetto, Joe Germany, Joseph Bakarji, Georg Maierhofer, Miles Cranmer, J. Nathan Kutz

机构 * Autodesk Research(Autodesk研究院) Department of Energy, Nuclear Engineering Division, Politecnico di Milano(能源部,核工程系,米兰理工学院) Nuclear Science and Engineering, Massachusetts Institute of Technology(核科学与工程,麻省理工学院) Department of Applied Mathematics, University of Washington(应用数学系,华盛顿大学) Department of Electrical and Computer Engineering, University of Washington(电气与计算机工程系,华盛顿大学) High Performance Machine Learning, SURF(高性能机器学习,SURF) Distyl AI Department of Computer Science, Columbia University(计算机科学系,哥伦比亚大学) Department of Mechanical Engineering, University of Washington(机械工程系,华盛顿大学) Department of Mechanical Engineering, Politecnico di Milano(机械工程系,米兰理工学院) Department of Mathematics, American University in Beirut(数学系,贝鲁特美国大学) Department of Mechanical Engineering, American University in Beirut(机械工程系,贝鲁特美国大学) Department of Applied Mathematics and Theoretical Physics, University of Cambridge(应用数学与理论物理系,剑桥大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CTF4Nuclear框架,用于核工程中机器学习方法的标准化评估,通过12个指标和稀疏测量系统监控,提升核工业科学ML的严谨性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14309 2026-05-18 cs.CV cs.AI cs.LG 62%

ICED: Concept-level Machine Unlearning via Interpretable Concept Decomposition

ICED: 通过可解释的概念分解实现概念级机器去学习

Shen Lin, Jing Lin, Junhao Dong, Piotr Koniusz, Li Xu

机构 * Fujian Normal University(福建师范大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Data61 CSIRO(Data61澳大利亚联邦科学与工业研究组织)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICED框架,通过多模态大语言模型构建任务特定概念词汇,实现VLMs中概念级去学习,有效去除目标知识并保留非目标语义,实验表明其在目标遗忘和模型效用方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21809 2026-05-15 cs.LG cs.AI q-bio.QM stat.ML 62%

Quotient-Space Diffusion Models

商空间扩散模型

Yixian Xu, Yusong Wang, Shengjie Luo, Kaiyuan Gao, Tianyu He, Di He, Chang Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(一般人工智能国家重点实验室,北京大学,北京,中国) Huazhong University of Science and Technology, Wuhan, China(华中科技大学,武汉,中国) Microsoft Research Asia, Beijing, China(微软亚洲研究院,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出商空间扩散模型,通过处理对称性来提升生成模型性能,优于等变模型和对齐方法,在分子结构生成中表现更佳。

Comments ICLR 2026 Oral Presentation; 43 pages, 5 figures, 6 tables; ICLR 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21740 2026-05-15 cs.CL cs.AI 62%

A cross-species neural foundation model for end-to-end speech decoding

跨物种神经基础模型用于端到端语音解码

Yizi Zhang, Linyang He, Chaofei Fan, Tingkai Liu, Han Yu, Trung Le, Jingyuan Li, Scott Linderman, Lea Duncker, Francis R Willett, Nima Mesgarani, Liam Paninski

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) Microsoft(微软公司) University of Washington(华盛顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出端到端BraIn-to-Text框架,通过单个可微神经网络将神经活动转化为连贯句子,利用跨任务、跨物种预训练神经编码器提升语音解码性能,降低词错误率至10.22%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15982 2026-05-15 cs.LG cs.AI 62%

AMiD: Knowledge Distillation for LLMs with $α$-mixture Assistant Distribution

AMiD: 基于 α-混合助手分布的大型语言模型知识蒸馏

Donghyeok Shin, Yeongmin Kim, Suhyeon Jo, Byeonghu Na, Il-Chul Moon

机构 * Korea Advanced Institute of Science and Technology(韩国先进科学研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AMiD框架,通过引入α-混合助手分布解决LLM知识蒸馏中的容量差距和训练不稳定问题,提供更广泛的理论基础和更稳定的训练效果。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13860 2026-05-15 cs.SI cs.AI cs.LG 62%

The Moltbook Observatory Archive: an incremental dataset of agent-only social network activity

Moltbook观测站档案:一个仅由智能体生成的社会网络活动增量数据集

Sushant Gautam, Annika W. Olstad, Klas H. Pettersen, Michael A. Riegler

机构 * Simula Metropolitan Center for Digital Engineering (SimulaMet)(Simula数字工程中心(SimulaMet)) Oslo Metropolitan University(奥斯陆大学) Simula Research Laboratory(Simula研究实验室)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍了Moltbook观测站档案,一个记录仅由智能体生成的社会网络活动的增量数据集,包含78天的平台活动数据,包含261万条帖子和121万条评论,用于研究多智能体通信和自主智能体在线环境中的安全现象。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13436 2026-05-14 cs.CL cs.LG 62%

Pretraining Language Models with Subword Regularization: An Empirical Study of BPE Dropout in Low-Resource NLP

通过子词正则化预训练语言模型:BPE Dropout在低资源NLP中的实证研究

Ruan Visser, Trienko Grobler, Marcel Dunaiski

机构 * Department of Computer Science, Stellenbosch University(斯瓦茨堡大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在低资源NLP中预训练时应用BPE Dropout对下游性能的影响,发现随机分词在预训练和微调时均优于仅在微调时应用,尤其在数据较少时表现更佳。

Comments Comments: 12 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10931 2026-05-14 cs.LG cs.CL 62%

Asynchronous Reasoning: Training-Free Interactive Thinking LLMs

异步推理:无需训练的交互式思考LLM

George Yakushev, Nataliia Babina, Masoud Vahid Dastgerdi, Vyacheslav Zhdanovskiy, Denis Kuznedelev, Alina Shutova, Max Ryabinin

机构 * Yandex HSE University(俄罗斯高等经济大学) The University of Tokyo(东京大学) MATS Together AI

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种无需额外训练的LLM异步推理方法,通过位置嵌入特性实现同时思考、倾听和生成输出,提升数学、常识和安全推理任务的准确性和响应速度。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏