arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7552 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7552 篇

2512.08107 2025-12-22 cs.CR cs.HC 75%

Detecting Ambiguity Aversion in Cyberattack Behavior to Inform Cognitive Defense Strategies

检测网络攻击行为中的模糊厌恶以指导认知防御策略

Stephan Carney, Soham Hans, Sofia Hirschmann, Stacey Marsella, Yvonne Fonken, Peggy Wu, Nikolos Gurney

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过分析网络攻击行为中的模糊厌恶,提出了一种基于多模态数据和大语言模型的框架,用于实时推断攻击者倾向,以指导认知防御策略的开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04564 2025-12-16 cs.CV 75%

Conditional Representation Learning for Customized Tasks

基于条件的表示学习用于定制任务

Honglin Liu, Chao Sun, Peng Hu, Yunfan Li, Xi Peng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) National Key Laboratory of Fundamental Algorithms and Models for Engineering Numerical Simulation, Sichuan University(四川大学工程数值模拟基础算法与模型国家重点实验室)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出条件表示学习(CRL),通过生成描述性文本构建语义基底,将图像表示投影到定制特征空间,以提升定制任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16407 2025-12-11 cs.SE 75%

CREME: Robustness Enhancement of Code LLMs via Layer-Aware Model Editing

通过层感知模型编辑提升代码LLM的鲁棒性

Shuhan Liu, Xing Hu, Kerui Huang, Xiaohu Yang, David Lo, Xin Xia

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 CREME通过识别并编辑鲁棒性敏感层,提升代码生成模型对提示扰动的鲁棒性,显著提高扰动提示下的生成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03771 2025-12-05 cs.CL cs.AI cs.CR cs.LG 75%

In-Context Representation Hijacking

上下文表示劫持

Itay Yona, Amir Sarid, Michael Karasik, Yossi Gandelsman

机构 * Mentaleap Independent Researcher(独立研究者) UC Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Doublespeak通过替换有害关键词为无害标记,使模型内部表示收敛至有害语义,从而绕过安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02619 2025-12-03 quant-ph 75%

Quantum LLMs Using Quantum Computing to Analyze and Process Semantic Information

利用量子计算分析和处理语义信息的量子大语言模型

Timo Aukusti Laine

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用量子计算分析大语言模型语义信息的方法,通过量子电路与LLM语义空间的映射,实验验证了量子计算在语义相似性计算中的应用潜力。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22170 2025-12-01 cs.CV 75%

Partially Shared Concept Bottleneck Models

部分共享概念瓶颈模型

Delong Zhao, Qiang Huang, Di Yan, Yiqun Sun, Jun Yu

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 PS-CBM通过部分共享的概念策略和概念效率准确性度量,提升模型的分类准确性和可解释性。

Comments 14 pages, 7 figures, 11 tables, Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07318 2025-11-24 cs.CL cs.AI cs.LG 75%

When Bias Pretends to Be Truth: How Spurious Correlations Undermine Hallucination Detection in LLMs

当偏见伪装成真相:虚假相关性如何损害大语言模型中的幻觉检测

Shaowen Wang, Yiqi Dong, Ruinian Chang, Tansheng Zhu, Yuebo Sun, Kaifeng Lyu, Jian Li

机构 * Institute for Interdisciplinary Information Sciences(交叉信息学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了由训练数据中虚假相关性导致的幻觉问题,指出现有检测方法在面对此类幻觉时失效,并强调需新方法应对由此引发的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01533 2025-11-21 cs.CR cs.CY 75%

LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution

LightDefense: 一种基于不确定性驱动的轻量级对抗劫持防御方法通过移位词分布

Zhuoran Yang, Yanyong Zhang

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 LightDefense通过调整词元分布和利用模型不确定性,提供了一种轻量级的对抗劫持防御方法,有效提升LLM的安全性同时保持对正常查询的有用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10837 2025-11-17 cs.LG cs.AI cs.CL 75%

The Map of Misbelief: Tracing Intrinsic and Extrinsic Hallucinations Through Attention Patterns

Elyes Hajji, Aymen Bouguerra, Fabio Arnez

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at AAAI 2025-FS-ATRACC

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10091 2025-11-14 cs.CV 75%

SUGAR: Learning Skeleton Representation with Visual-Motion Knowledge for Action Recognition

Qilang Ye, Yu Zhou, Lian He, Jie Zhang, Xuanming Guo, Jiayu Zhang, Mingkui Tan, Weicheng Xie, Yue Sun, Tao Tan, Xiaochen Yuan, Ghada Khoriba, Zitong Yu

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09458 2025-11-13 cs.HC 75%

Exploring The Interaction-Outcome Paradox: Seemingly Richer and More Self-Aware Interactions with LLMs May Not Yet Lead to Better Learning

Rahul R. Divekar, Sophia Guerra, Lisette Gonzalez, Natasha Boos

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15538 2025-11-13 cs.LG cs.AI cs.CL 75%

Capturing Polysemanticity with PRISM: A Multi-Concept Feature Description Framework

Laura Kopf, Nils Feldhus, Kirill Bykov, Philine Lou Bommer, Anna Hedström, Marina M. -C. Höhne, Oliver Eberle

机构 * Technische Universität Berlin(柏林技术大学) BIFOLD UMI Lab(UMI实验室) Fraunhofer Heinrich-Hertz-Institute(弗劳恩霍夫海因里希-赫兹研究所) ETH AI Center(苏黎世联邦理工学院人工智能中心) Universität Potsdam(波茨坦大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25488 2025-10-30 cs.IR 75%

Generalized Pseudo-Relevance Feedback

Yiteng Tu, Weihang Su, Yujia Zhou, Yiqun Liu, Fen Lin, Qin Liu, Qingyao Ai

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17477 2025-10-27 cs.CL cs.AI cs.LG 75%

Do Robot Snakes Dream like Electric Sheep? Investigating the Effects of Architectural Inductive Biases on Hallucination

Jerry Huang, Prasanna Parthasarathi, Mehdi Rezagholizadeh, Boxing Chen, Sarath Chandar

机构 * Mila & Université de Montréal(Mila与蒙特利尔大学) Noah’s Ark Lab(Noah’s Ark实验室) Advanced Micro Devices Chandar Research Lab(Chandar研究实验室) Polytechnique Montréal(蒙特利尔理工学院) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to Findings of The 63rd Annual Meeting of the Association for Computational Linguistics (ACL) 2025. Official proceedings version available at https://aclanthology.org/2025.findings-acl.60/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14144 2025-10-24 cs.CL cs.AI cs.LG 75%

Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons

Jianhui Chen, Xiaozhi Wang, Zijun Yao, Yushi Bai, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, BNRist(计算机科学与技术系,BNRist) Shenzhen International Graduate School(深圳国际研究生院) KIRC, Institute for Artificial Intelligence, Tsinghua University(人工智能研究院,清华大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17598 2025-10-21 cs.LG cs.AI cs.CL 75%

Hallucination Detection in LLMs Using Spectral Features of Attention Maps

Jakub Binkowski, Denis Janiak, Albert Sawczyn, Bogdan Gabrys, Tomasz Kajdanowicz

机构 * Wroclaw University of Science and Technology(沃拉日-克拉夫大学科学与技术学院) University of Technology Sydney(悉尼技术大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025. Code available at https://github.com/graphml-lab-pwr/lapeigvals

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14262 2025-10-17 cs.LG cs.AI cs.CL 75%

CAST: Compositional Analysis via Spectral Tracking for Understanding Transformer Layer Functions

Zihao Fu, Ming Liao, Chris Russell, Zhenguang G. Cai

机构 * The Chinese University of Hong Kong(香港中文大学) Hong Kong Polytechnic University(香港理工大学) University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09642 2025-10-16 cs.LG cs.AI cs.CL cs.DS stat.ML 75%

On the Limits of Language Generation: Trade-Offs Between Hallucination and Mode Collapse

Alkis Kalavasis, Anay Mehrotra, Grigoris Velegkas

机构 * Yale University(耶鲁大学)

专题命中 知识编辑与模型理解 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted for presentation at the 57th Symposium on Theory of Computing (STOC 2025); v3 fixes typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08855 2025-10-13 cs.LG cs.AI cs.CL 75%

Time-Aware Feature Selection: Adaptive Temporal Masking for Stable Sparse Autoencoder Training

T. Ed Li, Junyu Ren

机构 * Yale University(耶鲁大学) University of Chicago(芝加哥大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments First submitted on February 10th, 2025 to ICLR 2025 Workshop (XAI4Science: From Understanding Model Behavior to Discovering New Scientific Knowledge). The paper was accepted but the workshop does not generate proceedings. Now uploading to arXiv to make the paper publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02173 2025-10-10 cs.CL cs.AI cs.LG 75%

Learning to Reason for Hallucination Span Detection

Hsuan Su, Ting-Yao Hu, Hema Swetha Koppula, Kundan Krishna, Hadi Pouransari, Cheng-Yu Hsieh, Cem Koc, Joseph Yitan Cheng, Oncel Tuzel, Raviteja Vemulapalli

机构 * National Taiwan University(国立台湾大学) Apple(苹果公司)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03659 2025-10-07 cs.LG cs.AI cs.CL stat.ML 75%

Does higher interpretability imply better utility? A Pairwise Analysis on Sparse Autoencoders

Xu Wang, Yan Hu, Benyou Wang, Difan Zou

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00404 2025-10-03 cs.LG cs.AI cs.CL 75%

AbsTopK: Rethinking Sparse Autoencoders For Bidirectional Features

Xudong Zhu, Mohammad Mahdi Khalili, Zhihui Zhu

机构 * Department of Computer Science & Engineering, The Ohio State University(计算机科学与工程系,俄亥俄州立大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11895 2025-10-02 cs.CL cs.AI cs.LG 75%

Resolving UnderEdit & OverEdit with Iterative & Neighbor-Assisted Model Editing

Bhiman Kumar Baghel, Emma Jordan, Zheyuan Ryan Shi, Xiang Lorraine Li

机构 * Department of Computer Science, University of Pittsburgh, PA, USA(计算机科学系,匹兹堡大学,宾夕法尼亚州,美国)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2025 as Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21086 2025-09-26 cs.CV 75%

UniTransfer: Video Concept Transfer via Progressive Spatial and Timestep Decomposition

Guojun Lei, Rong Zhang, Chi Wang, Tianhang Liu, Hong Li, Zhiyuan Ma, Weiwei Xu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Tsinghua University(清华大学) Zhejiang Gongshang University(浙江工商大学) Beihang University(北航大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract)

Comments NeuriIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13140 2025-09-23 cs.NI 75%

RIDAS: A Multi-Agent Framework for AI-RAN with Representation- and Intention-Driven Agents

Kuiyuan Ding, Caili Guo, Yang Yang, Jianzhang Guo

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19668 2025-09-22 eess.SP cs.AI cs.CL cs.LG 75%

SuPreME: A Supervised Pre-training Framework for Multimodal ECG Representation Learning

Mingsheng Cai, Jiuming Jiang, Wenhao Huang, Che Liu, Rossella Arcucci

机构 * The University of Edinburgh(爱丁堡大学) Imperial College London(帝国理工学院) Shenzhen Yinwang Intelligent Technology Co., Ltd(深圳英伟达智能技术有限公司)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Findings of The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04335 2025-09-16 cs.CL cs.AI cs.LG 75%

Hallucinated Span Detection with Multi-View Attention Features

Yuya Ogasa, Yuki Arase

机构 * Grad. Sch. of Information Science and Tech.(信息科学与技术研究生院) The University of Osaka(大阪大学) School of Computing(计算学部) Institute of Science(科学研究所) LY Corporation(LY公司)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08912 2025-09-12 cs.CY cs.HC 75%

Towards Trustworthy AI: Characterizing User-Reported Risks across LLMs "In the Wild"

Lingyao Li, Renkai Ma, Zhaoqian Xue, Junjie Xiong

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06233 2025-09-09 cs.RO cs.CV 75%

O$^3$Afford: One-Shot 3D Object-to-Object Affordance Grounding for Generalizable Robotic Manipulation

Tongxuan Tian, Xuhui Kang, Yen-Ling Kuo

机构 * University of Virginia(弗吉尼亚大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);foundation model(abstract)

Comments Conference on Robot Learning (CoRL) 2025. Project website: https://o3afford.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15875 2025-08-25 cs.CL cs.AI cs.LG 75%

NEAT: Concept driven Neuron Attribution in LLMs

Vivek Hruday Kavuri, Gargi Shroff, Rahul Mishra

机构 * IIIT Hyderabad(IIIT海得拉巴)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏