arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 43 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 43 篇

2506.07406 2026-07-07 cs.LG cs.AI 版本更新 91%

InverseScope: Scalable Activation Inversion for Interpreting Large Language Models

InverseScope:用于解释大语言模型的可扩展激活反演

Yifan Luo, Zhennan Zhou, Bin Dong

机构 * School of Mathematical Science, Peking University(北京大学数学科学学院) School of Science, Westlake University(西湖大学理学院) Beijing International Center for Mathematical Research(北京国际数学研究中心) New Cornerstone Science Laboratory, Peking University(北京大学新基石科学实验室)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究大语言模型内部表征解释难题,提出InverseScope框架,通过输入反演解释神经激活,用新颖架构提高采样效率,揭示模型表征空间结构,可扩展到14B参数模型并推广到分布外输入。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02923 2026-07-07 cs.CL cs.AI 版本更新 90%

Council Mode: A Heterogeneous Multi-Agent Consensus Framework for Reducing LLM Hallucination and Bias

理事会模式:一种异质多智能体共识框架,用于减少大语言模型的幻觉和偏见

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究员) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出理事会模式,通过多智能体共识框架减少LLM的幻觉和偏见,实验显示在HaluEval和TruthfulQA上 hallucination率降低35.9%,质量得分提升10.2个百分点,且在偏见方面表现更优。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03350 2026-07-07 cs.CR cs.AI cs.SE 新提交 90%

LLM-Enhanced Hierarchical Heterogeneous Graph Representation Learning for Malicious Python Package Detection

用于恶意Python包检测的基于大语言模型增强的分层异构图表示学习

Hang Gao, Xiaoyu Chen, Baoquan Cui, Zhen Tang, Peng Qiao, Fengge Wu, Jian Zhang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出用于恶意Python包检测的LLM增强分层异构图表示学习框架,构建分层异构代码图,利用LLMs推理功能语义角色,开发分层异构图神经网络并结合功能级归因机制,实验表明该框架性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18895 2026-07-07 q-fin.RM cs.LG 89%

Could Large Language Models work as Post-hoc Explainability Tools in Credit Risk Models?

大语言模型能否在信用风险模型中作为事后可解释性工具?

Wenxi Geng, Dingyuan Liu, Liya Li, Yiqing Wang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) Southern Methodist University(南方 Methodist 大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文研究大语言模型是否能作为信用风险模型的事后可解释性接口,评估其在保持特征重要性排名和生成自主解释方面的能力。

Comments 39 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04430 2026-07-07 cs.CL 新提交 88%

Uncertainty-Aware Abstention in Large Language Models with Provable Alignment Guarantees

具有可证明对齐保证的大语言模型中的不确定性感知弃权

Sijin Dong, Hiroyuki Shinnou

机构 * Ibaraki University(茨城大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大语言模型在问答系统中无可靠置信估计的问题,提出基于置信区间的校准框架CIC,将任意不确定性分数转化为风险可控的选择性回答规则,保证所选阈值控制错误率,兼具风险控制和回答效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02686 2026-07-07 cs.AI cs.LG 新提交 88%

ASK in the Dark: Uncertainty-Gated LLM Assistance under Partial Observability

黑暗中的询问:部分可观测性下的不确定性门控语言模型辅助

Juarez Monteiro, Nathan Gavenski, Guilherme Lima, Francisco Galuppo, Odinaldo Rodrigues, Adriano Veloso

机构 * Kunumi Institute(库努米研究所) King’s College London(伦敦国王学院)

专题命中 知识编辑与模型理解 :LLM(title);SLM(abstract,abstract_cn);language model(abstract);small language model(abstract)

AI总结 研究部分可观测性下强化学习智能体,指出普通不确定性门控方法失败原因是上下文问题。提出ASK+,为语言模型提供轨迹感知上下文和结构化推理,证明预测熵信号可行,在多环境中取得更好效果,强调提示设计重要性。

Comments Accepted at the IJCAI-ECAI Joint Workshop on Planning for Complex Real-World Applications and Bridging the Gap Between AI Planning and (Reinforcement) Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15334 2026-07-07 cs.CL cs.AI 版本更新 87%

No Reliable Evidence of Self-Reported Sentience in Small Large Language Models

小语言模型中自我报告的感知能力缺乏可靠证据

Caspar Kaiser, Sean Enderby

机构 * University of Warwick, Warwick Business School(沃里克大学,沃里克商学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 通过询问多个开源语言模型关于其自身意识的问题,并利用基于内部激活训练的分类器验证回答,对语言模型是否认为自己有感知能力进行测试,发现模型否认有感知,分类器也无反例,且Qwen模型中越大越确定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28823 2026-07-07 cs.CL 版本更新 86%

What are They Thinking? Delineation, Probing, and Tracking of Concepts in LLMs

他们在想什么?LLM中概念的界定、探测与追踪

Mohamed Abdelwahab, Michelle Yu Collins, Sihan Chen, Yi Cheng Zhao, Zafarullah Mahmood, Jiading Zhu, Soliman Ali, Jonathan Rose

机构 * The Edward S. Rogers Sr. Department of Electrical and Computer Engineering(埃德华·S·罗杰斯 Sr. 部门电子与计算机工程系)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文提出通过线性探针低成本地检测LLM嵌入中的概念,并展示了概念界定、探针训练与跨上下文追踪的方法,为大规模模型监控奠定基础。

Comments Accepted to the 6th Workshop on Trustworthy Natural Language Processing (TrustNLP 2026)

Journal ref Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15903 2026-07-07 cs.LG cs.AI 版本更新 86%

Towards Mitigation of Hallucination for LLM-empowered Agents: Progressive Generalization Bound Exploration and Watchdog Monitor

迈向减轻基于大语言模型的智能体幻觉:渐进泛化边界探索与看门狗监测

Siyuan Liu, Wenjing Liu, Zhiwei Xu, Xin Wang, Bo Chen, Tao Li

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Haihe Lab of ITAI College of intelligent Science and Technology, Inner Mongolia University of Technology(内蒙古工业大学智能科学与技术学院海河实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Electrical and Computer Engineering, Stony Brook University(石溪大学电气与计算机工程系) Department of Computer Science, Michigan Technological University(密歇根技术大学计算机科学系)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型赋能智能体的幻觉问题,提出HalMit黑箱框架,用概率分形采样技术并行生成查询触发异常响应,以识别泛化边界来检测幻觉,提升智能体可靠性。

Journal ref Proceedings of the 28th European Conference on Artificial Intelligence (ECAI 2025), IOS Press, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04963 2026-07-07 cs.AI 新提交 85%

STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training

STAPO:用于大语言模型智能体训练的选择性轨迹感知策略优化

Qiuyi Qi, Tian Liang, Mutian Bao, Jinjian Zhang, Dongnan Liu, Wei Zhou, Linjian Mo, Ming Kong, Jie Liu, Feng Zhang, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学) College of Artificial Intelligence, Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院人工智能学院) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对强化学习训练大语言模型智能体时轨迹忽视问题,提出归一化熵,引入STAPO框架,利用其定位异常步骤,通过联合机制优化,提升轨迹感知并保持训练稳定性,实验验证其有效性和鲁棒性。

Comments ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06269 2026-07-07 cs.LG cs.AI 版本更新 85%

Using Mechanistic Interpretability to Craft Adversarial Attacks against Large Language Models

利用机制可解释性对大语言模型进行对抗攻击

Thomas Winninger, Boussad Addad, Katarzyna Kapusta

机构 * Thales(泰勒斯)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 研究利用机制可解释性对大语言模型进行对抗攻击,通过识别接受子空间,用梯度优化使嵌入重新路由,降低计算成本,在多种模型上快速实现高成功率攻击,为攻防研究开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04525 2026-07-07 cs.CL cs.AI 新提交 84%

Language Models Represent and Transform Concepts with Shared Geometry

语言模型通过共享几何表示和转换概念

Zhimin Hu, Lanhao Niu, Sashank Varma

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究神经网络中概念表示问题,将概念表示形式化为点云流形、上下文转换为向量场,在大语言模型中实例化该框架,发现模型共享概念表示及上下文转换的通用几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03657 2026-07-07 cs.CV cs.AI 新提交 83%

ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation

ViPo-MLLM:用于无注释手语翻译的视觉-姿势多模态大语言模型

Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain, Leonid Sigal, Hamzah Luqman

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 研究尝试无注释手语翻译,提出ViPo-MLLM框架结合时空RGB和人体姿势特征,用专用编码器与交叉模态注意力,经结构化提示和训练后由大语言模型处理。该模型在数据集取得新成果,验证了机制有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03870 2026-07-07 cs.AI cs.CL cs.LG 新提交 82%

Evaluating LLM Uncertainty in Long-Form Generation Using Deterministic Ground Truth

使用确定性真实数据评估长文本生成中语言模型的不确定性

Ido Amit, Ido Galil, Ran El-Yaniv

机构 * Technion(技术学院) Nvidia(英伟达)

专题命中 知识编辑与模型理解 :LLM(title);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对长文本生成中语言模型不确定性评估难题,引入含单一确定性长文本真值的SALT基准,通过对50多个模型分析揭示关键见解,如置信函数作用、错误驱动因素及推理影响等,为风险关键应用提供参考。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Code available at https://github.com/IdoAmit198/SALT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24967 2026-07-07 cs.AI 版本更新 81%

The Anatomy of Uncertainty in LLMs

大语言模型中不确定性的解剖结构

Aditya Taparia, Ransalu Senanayake, Kowshik Thopalli, Vivek Narayanaswamy

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种将大语言模型不确定性分解为输入模糊性、知识缺口和解码随机性的框架,通过实验展示不同模型规模和任务中各组件的重要性,以提升模型可靠性与可信度。

Comments Accepted at the ICBINB Workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03358 2026-07-07 cs.CV cs.CL cs.LG 新提交 81%

Pathways of Visual Information Flow in Vision-Language Models

视觉语言模型中的视觉信息流路径

Israfel Salazar, Stella Frank, Dan Oneata, Desmond Elliott, Constanza Fierro

机构 * University of Copenhagen(哥本哈根大学) Technical University of Denmark(丹麦技术大学) POLITEHNICA Bucharest(布加勒斯特理工大学) Bitdefender, Romania(罗马尼亚比特梵德公司)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究视觉语言模型中视觉信息的路由,用因果补丁法发现其依赖直接和文本介导两条路径,路径选择与任务、数据分布和提示设计有关,且路径具灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04593 2026-07-07 cs.CV cs.AI 新提交 79%

TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models

TORINO:通过视觉语言模型中可解释的概念重叠进行令牌减少

Riccardo Renzulli, Gabriele Spadaro, Shruthi Gowda, Alaa Eddine Mazouz, Van-Tam Nguyen

机构 * University of Turin, Italy(意大利都灵大学) Eindhoven University of Technology, The Netherlands(荷兰埃因霍温理工大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型计算成本高问题,提出TORINO框架,利用稀疏自动编码器将视觉令牌投影到可解释潜在空间,通过概念重叠分组并减少令牌,兼顾效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04163 2026-07-07 cs.CV cs.AI 新提交 79%

SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering

SeeMe:通过有效的视觉令牌工程减轻大型视觉语言模型中的幻觉

Kai Tang, Jinhao You, Bohua Zhang, Yichen Guo, Yiding Sun, Dongxu Zhang, Chenxi Li, Xiande Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室) University of Pennsylvania(宾夕法尼亚大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) De Artificial Intelligence Lab(德人工智能实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究大型视觉语言模型易产生幻觉问题,提出无训练框架SeeMe,引入传统机器学习特征工程概念,经三阶段令牌工程重组视觉令牌抑制幻觉源,实验证明其能减轻幻觉并提高输出一致性。

Comments 12 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03325 2026-07-07 cs.CL cs.AI cs.IR 新提交 79%

From Judgments to Issues: Structured Extraction of Legal Reasoning with Citation-Hallucination Control

从判决到问题:具有引用幻觉控制的法律推理结构化提取

Giovanni Piccioli, Alessia Fidelangeli, Piera Santin, Pierpaolo Vivo

机构 * Quantitative and Digital Law Laboratory(量化与数字法律实验室) CIRSFID - Alma AI, Faculty of Law University of Bologna(CIRSFID - 阿尔玛AI,博洛尼亚大学法学院) Robert Schuman Centre European University Institute(罗伯特·施曼中心欧洲大学研究所)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出自动化流程,将意大利税务法庭判决分解为法律问题,基于IRAC框架和法律三段论提取结构化XML表示,用通用模型并结合幻觉检测过滤器处理大量判决,经专家验证,为下游应用提供起点。

Comments 33 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28543 2026-07-07 cs.AI cs.CL cs.LG 版本更新 78%

Cultural Binding Heads in Language Models

语言模型中的文化绑定头

Avrile Floro, Luca Benedetto

机构 * Mistral-7B Mistral-Nemo-12B Llama-3.1-8B Gemma-2-9B

专题命中 知识编辑与模型理解 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过机制可解释性和析因设计,识别出8个语言模型中2-3个中间层注意力头对文化绑定有因果贡献,且绑定主要在预训练阶段形成,知识探测表明模型知道的知识远多于其行为表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23115 2026-07-07 cs.CV 版本更新 78%

AgentFoX: LLM Agent-Guided Fusion with eXplainability for AI-Generated Image Detection

AgentFoX: 基于可解释性的大语言模型引导融合的AI生成图像检测

Yangxin Yu, Yue Zhou, Bin Li, Kaiqing Lin, Haodong Li, Jiangqun Ni, Bo Cao

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU-AFS Joint Innovation Center for AI Technology(深圳大学-AFS人工智能技术联合创新中心) Shenzhen University(深圳大学) School of Cyber Science and Technology(网络安全科学与技术学院) The Smart City Research Institute of China Electronics Technology Group Corporation(中国电子科技集团有限公司智慧城市研究院)

专题命中 知识编辑与模型理解 :LLM(title,abstract)

AI总结 AgentFoX通过多阶段分析流程提升AI生成图像检测的可靠性,结合专家和上下文聚类资料,生成可读性强的报告以增强可解释性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05316 2026-07-07 cs.CL cs.LG 新提交 73%

How Much is Left? LLMs Linearly Encode Their Remaining Output Length

还剩多少?大语言模型对其剩余输出长度进行线性编码

Mohamed Amine Merzouk, Dmitri Carpov, Mirko Bronzi, Damiano Fornasiere, Adam Oberman

机构 * Mila, Quebec AI Institute(米拉,魁北克人工智能研究所) McGill University(麦吉尔大学) LawZero(法律零)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究探究大语言模型是否保有剩余输出长度的内部估计,通过在冻结隐藏状态上训练线性探针,证实LLMs可线性编码剩余输出长度,存在类计划的输出长度内部表征。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05207 2026-07-07 cs.CV cs.LG 新提交 70%

Probing Geospatial SSL Representations with Environmental Signals

利用环境信号探测地理空间自监督学习表示

Rohita Mocharla, Vishal M. Patel

机构 * Johns Hopkins Applied Physics Laboratory(约翰·霍普金斯大学应用物理实验室) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 针对地理空间自监督学习表示内在信息分析不足问题,用匹配的ERA5环境变量探测其对环境信号的编码能力,发现相关指标可区分下游性能相近模型,还开源了配套标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04222 2026-07-07 cs.AI 新提交 70%

Unsupervised Features Mining via Activation Geometry

通过激活几何进行无监督特征挖掘

Amit LeVi, Elad David, Max Fomin

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 介绍通过激活几何挖掘(MAG)的无监督框架,在输入前加指令Q,用m(Q∣p)-m(p)衡量其对模型内部表征的影响,探索多种MAG,所提取特征可预测模型理解与判断,还用于选择最佳训练数据集。

Journal ref ICML 2026, workshop on Failure Modes in Agentic AI (FAGEN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03738 2026-07-07 cs.CV cs.AI 新提交 70%

Attending to Multimodal Generation One Token at a Time

一次关注一个令牌的多模态生成

Varun Gupta, Vineet Gandhi, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad(海得拉巴国际信息技术研究所计算机视觉与信息处理中心)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型生成时令牌级动态,按语义角色跟踪注意力转移。引入多模态任务,通过因果注意力阻断干预等方法,发现一致模式并据此提出测试时干预,提升多模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02909 2026-07-07 cs.CV cs.AI 新提交 70%

Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models

使用层次表示正则化学习大型多模态模型的分类树

Hulingxiao He, Zhi Tan, Yuxin Peng

机构 * PKU-ICST-MIPL(北京大学信息科学技术学院多媒体信息处理实验室)

专题命中 知识编辑与模型理解 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型多模态模型缺乏分类知识致层次视觉识别一致性低的问题,提出层次表示正则化方法,含语义感知视觉树构建框架,结合两个互补目标,有效捕捉分类结构。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03598 2026-07-07 cs.CL cs.AI cs.LG 新提交 67%

They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It

他们推断你的意图:模型对交际意图的表征比其实际行动更可靠

Alex Kwon

机构 * Independent Researcher(独立研究者)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型常按信息表面而非发送者意图回复的问题,用线性探针从模型隐藏状态解码意图,表明表征可靠但读出存在问题,还找到因果处理方向可恢复预期行为。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02964 2026-07-07 cs.LG cs.AI cs.CL 新提交 67%

Individual Parameters in Weight-Sparse Transformers Appear Interpretable

权重稀疏变压器中的单个参数似乎具有可解释性

Arnau Marin-Llobet, Stefan Heimersheim

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究单个权重能否在整个训练分布中全局理解,引入自动语言模型管道描述权重何时重要并验证,发现稀疏变压器中可解释权重比例更高。

Comments 20 pages, 19 figures, 3 tables. Project website: https://weightpedia.org/individual-parameters-in-sparse-transformers/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05013 2026-07-07 cs.CL cs.LG 新提交 62%

Knowledge Knows, Verbalization Tells: Disentangling Latent Directions for Mathematical Solvability in LLMs

知识所知,语言所表:解开大语言模型中数学可解性的潜在方向

Nikolaos Xiros, Maria-Eleni Zoumpoulidi, Georgios Paraskevopoulos

机构 * Institute for Language and Speech Processing, Athena Research Center(语言与语音处理研究所,雅典娜研究中心)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型数学推理中数学问题可解性判定难题,通过分别探究可解性知识与语言表达的表征,揭示二者在模型隐藏状态中可分离,还表明提示不可解线索等可减少编造,操纵表征能改善模型弃权。

Comments 14 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03574 2026-07-07 cs.LG cs.AI cs.PL 新提交 62%

Differentiate the Evaluator, Not the Program: An Efficient Runtime Representation for Neuro-Symbolic Learning

区分评估器,而非程序:神经符号学习的高效运行时表示

Lucas Sheneman

机构 * Institute for Interdisciplinary Data Sciences(交叉学科数据科学研究所) University of Idaho(爱达荷大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究神经符号学习中程序与参数协同搜索瓶颈,提出原生可微虚拟机(NDVM),将符号结构与可微数值状态分离,实现运行时差异化,提升搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏