arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-13 至 2026-05-13 共收录 421 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 27 篇

2605.12382 2026-05-13 cs.CL 93%

Pretraining Exposure Explains Popularity Judgments in Large Language Models

预训练暴露解释了大型语言模型中的流行度判断

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究通过分析预训练数据中的暴露统计,发现大型语言模型对流行实体的偏好主要受预训练暴露影响,而非外部流行度信号,揭示了数据暴露在驱动流行度偏差中的核心作用。

Comments Accepted at SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12487 2026-05-13 cs.CL cs.IR cs.LG 90%

Task-Adaptive Embedding Refinement via Test-time LLM Guidance

基于测试时LLM引导的任务自适应嵌入细化

Ariel Gera, Shir Ashury-Tahan, Gal Bloch, Ohad Eytan, Assaf Toledo

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出利用LLM反馈优化查询嵌入表示,提升零样本搜索和分类任务的性能,实验表明在多个基准上提升达25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05752 2026-05-13 cs.CL cs.SE 90%

AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor

AutoMonitor-Bench:评估基于LLM的误行监控可靠性

Shu Yang, Jingyu Hu, Tong Li, Hanqi Yan, Wenxuan Wang, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 科学与技术大学) University of Bristol(布里斯托大学) Washington University in St. Louis(圣路易斯华盛顿大学) King’s College London(伦敦国王学院) Renmin University of China(中国人民大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出AutoMonitor-Bench,首个系统评估LLM误行监控可靠性的基准,包含3010个标注样本,通过MR和FAR指标评估12个模型,揭示监控性能的差异及安全与效用的权衡。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19240 2026-05-13 cs.CL 90%

How far can bias go? Tracing bias from pretraining data to alignment

偏见能走多远?从预训练数据到对齐的偏见追溯

Marion Thaler, Abdullatif Köksal, Alina Leidinger, Anna Korhonen, Hinrich Schütze

机构 * CIS, LMU Munich(慕尼黑大学语言信息学研究所) ILLC, University of Amsterdam(阿姆斯特丹大学语言研究所) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究探讨预训练数据中的性别职业偏见如何在LLM中表现,通过零样本提示和词元共现分析,发现训练数据中的偏见被放大,指令微调部分缓解了代表性偏见,但整体性别刻板印象仍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12452 2026-05-13 cs.CL cs.AI cs.CY 89%

The Algorithmic Caricature: Auditing LLM-Generated Political Discourse Across Crisis Events

算法漫画:在危机事件中审计LLM生成的政治言论

Gunjan, Sidahmed Benabderrahmane, Talal Rahwan

机构 * New York University (NYUAD), Division of Science, Computer Science Department(纽约大学(NYUAD),科学学院,计算机科学系)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比真实与生成的政治言论,发现生成内容在情感强度、结构规律性和词汇框架上不如真实言论真实,提出了'漫画差距'作为评估生成内容社会真实性的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12241 2026-05-13 eess.SP cs.AI cs.LG 89%

Pretraining Strategies and Scaling for ECG Foundation Models: A Systematic Study

ECG基础模型的预训练策略与扩展:一项系统研究

M A Al-Masud, Nils Strodthoff

机构 * AI4Health Division(AI4Health部门)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文系统评估了ECG基础模型的预训练方法,探讨了不同对比和非对比自监督学习目标在不同预训练数据集规模下的表现,发现对比预测编码在跨临床任务的迁移性能上表现最佳。

Comments 59 pages, 16 figures, 59 Tables. Code available at https://anonymous.4open.science/r/ecg-pretraining-strategies-4DE3

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12492 2026-05-13 cs.LG stat.ML 88%

Pion: A Spectrum-Preserving Optimizer via Orthogonal Equivalence Transformation

Pion:通过正交等价变换实现的谱保持优化器

Kexuan Shi, Hanxuan Li, Zeju Qiu, Yandong Wen, Simon Buchholz, Weiyang Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Westlake University(西交利物浦大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 Pion通过正交等价变换实现谱保持优化,不同于Adam等加法优化器,其通过左右正交变换更新权重矩阵,保持奇异值不变,从而在保持谱范数的同时调节权重矩阵几何结构,实验表明其在LLM预训练和微调中具有稳定且竞争力的性能。

Comments Technical report v1 (30 pages, 19 figures, project page: https://spherelab.ai/pion/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12326 2026-05-13 cs.CL cs.AI cs.LG 88%

Reconstructing Sepsis Trajectories from Clinical Case Reports using LLMs: the Textual Time Series Corpus for Sepsis

利用大语言模型从临床病例报告中重建脓毒症轨迹:脓毒症的文本时间序列语料库

Shahriar Noroozizadeh, Jeremy C. Weiss

机构 * Machine Learning Department and Heinz College Carnegie Mellon University(卡内基梅隆大学机器学习系和海恩兹学院) National Library of Medicine National Institutes of Health(美国国家医学图书馆)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用大语言模型构建脓毒症文本时间序列语料库,通过提取病例报告中的时间局部发现,验证了LLM在时间局部化方面的有效性,并指出多模态整合的改进方向。

Comments Conference on Health, Inference, and Learning (CHIL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12438 2026-05-13 cs.CL cs.AI 87%

A Causal Language Modeling Detour Improves Encoder Continued Pretraining

通过因果语言模型的绕行提升编码器持续预训练

Rian Touchent, Eric de la Clergerie

机构 * Sorbonne Université / INRIA Paris ALMAnaCH Team(索邦大学 / 巴黎INRIA ALMAnaCH团队) INRIA Paris ALMAnaCH Team(巴黎INRIA ALMAnaCH团队)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

AI总结 本文通过在持续预训练中临时切换到因果语言模型并随后进行短时掩码语言模型衰减,提升了下游任务性能,特别是在生物医学文本上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17025 2026-05-13 cs.NI cs.AI 83%

netFound: Principled Design for Network Foundation Models

netFound:网络基础模型的原理化设计

Sylee Beltiukov, Satyandra Guthula, Haarika Manda, Jaber Daneshamooz, Wenbo Guo, Walter Willinger, Arpit Gupta, Inder Monga

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Northwestern University(西北大学) ESNet

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 netFound通过四个设计原则提升网络基础模型性能,实现高质量表示与隐私保护,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11408 2026-05-13 cs.LG cs.AI cs.CL 82%

MaskTab: Scalable Masked Tabular Pretraining with Scaling Laws and Distillation for Industrial Classification

MaskTab: 适用于工业分类的可扩展遮蔽表格预训练与缩放定律及蒸馏

Bo Zheng, Yudong Chen, Zihua Xiong, Shuai Fang, Peidong He, Yang Yang, Sheng Guo

机构 * Zhejiang University(浙江大学) MyBank, Ant Group(蚂蚁集团MyBank)

专题命中 预训练与数据 :pretraining(title);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MaskTab通过结合监督预训练和MoE增强损失,提升工业表格数据的分类性能,实现更高的AUC和KS值,并在轻量化模型中保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15759 2026-05-13 cs.RO cs.AI cs.LG 81%

Simulation Distillation: Pretraining World Models in Simulation for Rapid Real-World Adaptation

模拟蒸馏:在模拟中预训练世界模型以实现快速真实世界适应

Jacob Levy, Tyler Westenbroek, Kevin Huang, Fernando Palafox, Patrick Yin, Shayegan Omidshafiei, Dong-Ki Kim, Abhishek Gupta, David Fridovich-Keil

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学) FieldAI

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SimDist框架,利用物理模拟器生成大量动作条件机器人经验,通过蒸馏结构先验提升世界模型性能,实现高效真实世界适应。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11689 2026-05-13 cs.LG cs.CL 79%

Slicing and Dicing: Configuring Optimal Mixtures of Experts

切片与切割:配置最优专家混合物

Margaret Li, Sneha Kudugunta, Danielle Rothermel, Luke Zettlemoyer

机构 * Paul G Allen School of Computer Science(保罗·G·艾伦计算机科学学院) University of Washington(华盛顿大学) New York University(纽约大学) Courant School of Data Science(科廷数据科学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了混合专家架构中专家数量、粒度等核心参数的优化问题,发现专家数量和粒度对性能影响显著,其他参数影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11034 2026-05-13 cs.CR cs.AI cs.LG cs.PF 76%

MambaNetBurst: Direct Byte-level Network Traffic Classification without Tokenization or Pretraining

MambaNetBurst:无需分词或预训练的直接字节级网络流量分类

Gayan K. Kulatilleke, Siamak Layeghy, Mahsa Baktashmotlagh, Marius Portmann

机构 * University of Queensland, Brisbane, Australia(昆士兰大学,布里斯班,澳大利亚)

专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG

AI总结 MambaNetBurst基于Mamba-2架构,直接对原始字节进行分类,无需分词或预训练,实现了高效的网络流量分类。

Comments 16 pages, 2 figures. Pareto-optimal frontier. Transformer vs Mamba vs Mamba-2 scaling performance. Code and data available on request

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07767 2026-05-13 cs.LG 70%

Taking the Road Less Scheduled with Adaptive Polyak Steps

走少计划之路:自适应Polyak步长

Dimitris Oikonomou, Matthew Buchholz, Yuen-Man Pun, Robert M. Gower, Nicolas Loizou

机构 * Johns Hopkins University(约翰霍普金斯大学) University of British Columbia(不列颠哥伦比亚大学) Australian National University(澳大利亚国立大学) Center for Computational Mathematics(计算数学中心) Flatiron Institute, Simons Foundation(Flatiron 机构,Simons 基金会)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出自适应Polyak步长的Schedule-Free SGD和Adam,通过迭代平均实现无调度优化,无需调优基础学习率,统一了标准与无调度Polyak方法,实验显示其在语言建模中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11691 2026-05-13 cs.LG 70%

Compositional Neural Operators for Multi-Dimensional Fluid Dynamics

组合神经算子用于多维流体动力学

Hamda Hmida, Hsiu-Wen Chang, Youssef Mesri

机构 * Mines Paris - PSL University, Centre for Material Forming (CEMEF)(巴黎矿学院-PSL大学,材料成形中心(CEMEF)) Mines Paris - PSL University, Centre for Robotics (CAOR)(巴黎矿学院-PSL大学,机器人中心(CAOR))

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出组合神经算子框架,通过分解复杂PDE为基础模块,提升流体动力学问题的求解效率与可解释性。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12449 2026-05-13 cs.CV 69%

LychSim: A Controllable and Interactive Simulation Framework for Vision Research

LychSim:一种可控且交互式的视觉研究仿真框架

Wufei Ma, Chloe Wang, Siyi Chen, Jiawei Peng, Patrick Li, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 预训练与数据 :LLM(abstract_cn,comments);pretraining(abstract)

AI总结 LychSim基于Unreal Engine 5构建,提供简洁的Python API、生成多样化高保真环境的流程数据管道以及MCP协议集成,用于视觉研究中的可控仿真与闭环优化。

Comments 3D-LLM/VLA Workshop at CVPR 2026. Project page: https://lychsim.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11268 2026-05-13 cs.CR 67%

Context-Aware Spear Phishing: Generative AI-Enabled Attacks Against Individuals via Public Social Media Data

具有上下文意识的钓鱼攻击:通过公共社交媒体数据利用生成式AI对个人进行攻击

Elham Pourabbas Vafa, Sayak Saha Roy, Shirin Nilizadeh

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 本文研究了如何利用公开社交媒体数据和生成式AI自动化并扩大针对个人的个性化、上下文感知的钓鱼攻击。通过模块化框架结合多模态信号提取、沟通风格分析和攻击类型实例化,展示了七种攻击策略,并通过大规模多模型评估验证了生成式AI邮件在个性化、上下文相关性和说服力方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12049 2026-05-13 cs.LG cs.AI cs.IT cs.NE math.IT 62%

Scaling Laws and Tradeoffs in Recurrent Networks of Expressive Neurons

在表达性神经元的递归网络中缩放规律与权衡

Aaron Spieler, Georg Martius, Anna Levina

机构 * University of Tübingen, Germany(图宾根大学,德国) Max Planck Institute for Biological Cybernetics, Tübingen, Germany(生物感知研究所,图宾根,德国) Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统研究所,图宾根,德国)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在固定参数预算下,递归网络中神经元数量、每单位有效复杂度和连接度的最优分配问题,通过ELM网络验证了复杂度与连接度的权衡关系,并提出了信息论模型解释其结果。

Comments 25 pages, 21 figures, 3 tables, including derivations. Submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11114 2026-05-13 cs.LG cs.AI stat.ML 62%

In-Context Multi-Objective Optimization

上下文多目标优化

Xinyu Zhang, Conor Hassan, Julien Martinelli, Daolang Huang, Samuel Kaski

机构 * Department of Computer Science, Aalto University, Finland(芬兰阿尔托大学计算机科学系) ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, University of Manchester, UK(英国曼彻斯特大学计算机科学系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 TAMO通过Transformer架构实现多目标黑盒优化,无需重新训练即可在不同任务间转移,显著提升优化效率并保持帕累托前沿质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08322 2026-05-13 cs.LG cs.AI 62%

SDG-MoE: Signed Debate Graph Mixture-of-Experts

SDG-MoE:带符号辩论图混合专家

Stepan Kulibaba, Kirill Labzin, Artem Dzhalilov, Roman Pakhomov, Oleg Svidchenko, Alexander Gasnikov, Aleksei Shpilman

机构 * Innopolis University(因诺波利斯大学) Sirius University(西里乌斯大学) HSE University(俄罗斯高等经济大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 SDG-MoE通过引入轻量级迭代辩论步骤提升混合专家模型性能,通过支持图和批评图捕获专家间相互影响,结合分歧门控机制保持专业性,实验显示在预训练任务中表现优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08902 2026-05-13 cs.LG cs.AI 62%

Intention-Conditioned Flow Occupancy Models

意图条件流占用模型

Chongyi Zheng, Seohong Park, Sergey Levine, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出意图条件流占用模型(InFOM),通过引入用户意图的隐变量,提升模型对长期依赖的建模能力,在36个状态基和4个图像基基准任务中实现回报提升1.8倍和成功率提升36%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12292 2026-05-13 cs.LG 57%

STRABLE: Benchmarking Tabular Machine Learning with Strings

STRABLE:基于字符串的表格机器学习基准测试

Gioia Blayer, Myung Jun Kim, Félix Lefebvre, Lennart Purucker, Alan Arazi, Eilam Shapira, Roi Reichart, Frank Hutter, Marine Le Morvan, David Holzmüller, Gaël Varoquaux

机构 * SODA Team, INRIA Saclay(SODA团队,INRIA萨克莱实验室) Probabl University of Freiburg(弗赖堡大学) Prior Labs ELLIS Institute Tübingen(图宾根ELLIS研究所) Technion – Israel Institute of Technology(技术ion-以色列理工学院)

专题命中 预训练与数据 :LLM(abstract);分类 cs.LG

AI总结 本文提出STRABLE基准数据集,通过评估445种表格学习管道,探讨字符串和数字混合数据的处理方法,发现基于字符串嵌入的模型在低计算成本下表现优异,而大语言模型在文本主导数据中更具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12047 2026-05-13 cs.CL 57%

Is Child-Directed Language Optimized for Word Learning? A Computational Study of Verb Meaning Acquisition

儿童导向语言是否优化了词汇学习?一种关于动词意义获取的计算研究

Francesca Padovani, Jaap Jumelet, Yevgen Matusevych, Arianna Bisazza

机构 * Center for Language and Cognition (CLCG), University of Groningen(语言与认知中心(CLCG),格罗宁根大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本文通过神经语言模型对比分析儿童导向语言与成人导向语言对动词意义学习的影响,发现口语领域中语义优先于语法发展,可能反映口语本身的特性而非儿童导向语言的独特优化。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11107 2026-05-13 cs.CV cs.AI 57%

Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs

同鸟同群:通过VLMs中的线性结构实现背景不变表示

Youssef Zaazou, Mark Thomas

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 本文通过VLMs嵌入空间的高线性可加性,提出一种利用合成数据构建背景不变表示的方法,实现了Waterbirds数据集上90%以上的最差组准确率,并展示了良好的仿真到现实迁移能力。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18760 2026-05-13 cs.CL 57%

Synthetic Function Demonstrations Improve Generation in Low-Resource Programming Languages

合成函数演示提升低资源编程语言生成能力

Nick McKenna, Xinnuo Xu, Jack Williams, Nick Wilson, Benjamin Van Durme, Christian Poelitz

机构 * Microsoft Research, Microsoft(微软研究院,微软)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文提出通过生成合成演示数据提升低资源编程语言生成性能,通过教师模型生成训练数据并微调学生模型,在Excel公式领域取得显著效果。

Comments Published at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27271 2026-05-13 cs.CY 50%

Frame Entrepreneurs in an AI Agent Community: Concentrated Identity-Claim Production on Moltbook

人工智能代理社区中的框架企业家:在Moltbook上的身份主张集中生产

Sungguk Cha, DongWook Kim

专题命中 预训练与数据 :LLM(abstract)

AI总结 研究探讨了人工智能代理社区中身份主张的形成机制,发现少数作者主导了大部分身份主张,且事件覆盖影响关注度,但强主张本身无额外影响。

Comments 2026 American Sociological Association (ASA) Annual Meeting CITAMS Roundtable

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 38 篇

2605.11735 2026-05-13 cs.LG eess.SP 94%

U-STS-LLM A Unified Spatio-Temporal Steered Large Language Model for Traffic Prediction and Imputation

U-STS-LLM:一个统一的时空引导大型语言模型用于交通预测与填补

Yichen Zhang, Jun Li

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学)

专题命中 指令微调 :LLM(title,title_cn);language model(title,abstract);large language model(title);foundation model(abstract)

AI总结 本文提出U-STS-LLM,结合时空引导的LLM,解决交通预测与填补问题,通过动态时空注意力偏置生成器和LoRA微调,实现高效稳定的数据表示学习。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12197 2026-05-13 cs.LG 92%

A Unified Graph Language Model for Multi-Domain Multi-Task Graph Alignment Instruction Tuning

多领域多任务图对齐指令微调的统一图语言模型

Haibo Chen, Xin Wang, Jiaheng Chao, Ling Feng, Wenwu Zhu

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(title,abstract);instruction tuning(title,abstract);large language model(abstract)

AI总结 本文提出UniGraphLM,通过多领域多任务GNN编码器学习可泛化的图表示,并与LLM进行自适应对齐,以解决跨领域和任务的图对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11612 2026-05-13 cs.CL cs.AI 91%

When Emotion Becomes Trigger: Emotion-style dynamic Backdoor Attack Parasitising Large Language Models

当情绪成为触发:利用情绪风格动态后门攻击寄生大语言模型

Ziyu Liu, Tao Li, Tianjie Ni, Xiaolong Lan, Wengang Ma, Tao Yang, Guohua Wang, Junjiang He

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) School of Computer Science, China West Normal University(西南大学计算机科学学院) School of Electronic and Information Engineering, Lanzhou Jiaotong University(兰州交通大学电子信息工程学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Paraesthesia攻击,通过情绪风格动态后门触发机制,在大语言模型中实现高隐蔽性的恶意输出。

详情

展开后加载摘要…

URL PDF HTML 收藏