arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 266 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 266 篇

2602.04718 2026-08-13 cs.LG cs.AI cs.CL 版本更新 83%

Superposition Without Interference? Towards Isolated Interventions via Almost Orthogonal Features in Language Models

通过语言模型中几乎正交的特征实现孤立干预

Moritz Miller, Florent Draye, Bernhard Schölkopf

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究基于机械可解释性前提,针对语言模型特征纠缠问题,受“独立因果机制”启发,提出将内部特征约束为几乎正交,通过形式化问题、界定干扰传播并关联正则化,实现对数学推理概念更孤立的干预且保留模型性能。

Comments Published as a conference paper at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14080 2026-06-23 cs.CL cs.AI 版本更新 82%

Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality

空货架还是丢钥匙?回忆是参数化事实性的瓶颈

Nitay Calderon, Eyal Ben-David, Zorik Gekhman, Eran Ofek, Gal Yona

机构 * Google Research(Google研究) Technion – Israel Institute of Technology(以色列技术学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出行为框架区分LLM事实错误源于知识缺失或访问失败,通过WikiProfile基准测试发现前沿模型编码饱和但回忆是主要瓶颈,思考可恢复大量失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04935 2026-08-10 cs.CV 版本更新 82%

Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection

释放视觉-语言模型在通用人工智能生成图像检测中的潜力

Weihan Cai, Hao Tan, Zichang Tan, Jun Wan, Xinping Gao

专题命中 知识编辑与模型理解 :language model(title,abstract);foundation model(abstract)

AI总结 该研究针对AI生成图像检测,发现视觉-语言模型PE比DINOv3更具潜力,提出语义原型校准(SPC)方法得到PE-SPC,在多基准测试中达到新的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18673 2026-08-05 cs.CV 版本更新 82%

MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts

MissingBench-Verified:探究视觉语言模型检测缺失物体部分的无能

Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou, Guoping Luo, Shan Du

机构 * University of British Columbia(英属哥伦比亚大学) Weathon Software(威盛软件)

专题命中 知识编辑与模型理解 :language model(title,abstract);prompting(abstract)

AI总结 研究视觉语言模型检测缺失物体部分的能力,提出MissingBench-Verified基准,发现十个领先模型在此场景存在高失败率,现有缓解策略效果不佳,揭示当前VLM在检查监测任务中的根本局限,强调架构或训练干预的必要。

Comments Submitted to the ECCV 2026 Workshop on Explainable Computer Vision (eXCV). 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08159 2026-07-31 cs.LG cs.AI cs.CL 版本更新 82%

The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models

自信流形:语言模型中正确性表示的几何结构

Seonglae Cho, Zekun Wu, Kleyton Da Costa, Adriano Koshiyama

机构 * University College London(伦敦大学学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示语言模型正确性表示的几何结构,发现低维子空间中的质心距离与探测器性能一致,表明检测是几何而非学习过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18292 2026-07-29 cs.LG cs.AI cs.CL 版本更新 82%

Reliability Scales Inversely: Hallucinations Snowball Faster in Bigger Language Models

可靠性呈反比:更大的模型通过隐藏的自回归风险机制更快地加剧错误

Kushal Chakrabarti

机构 * Obviously Wrong, LLC(明显错误有限责任公司)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现随着语言模型规模扩大,答案虽更接近真实但退化更快。通过逐位置分歧追踪自回归风险残余,揭示了知识差距下降、知识退化增长等四个发现,指出更大模型会通过特定风险机制更快加剧错误,该机制因果且模型自身难以察觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15893 2026-07-21 cs.CL cs.AI cs.LG 版本更新 82%

Induction in Both Directions: A Mechanistic Analysis of In-Context Learning in Masked Diffusion Language Models

双向归纳:掩码扩散语言模型中上下文学习的机制分析

Andy Catruna, Emilian Radoi

机构 * National University of Science and Technology POLITEHNICA Bucharest(布加勒斯特理工大学国家科技大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究扩散语言模型(DLM)中归纳机制,对比仅注意力AR模型和吸收掩码DLM。发现DLM学习双向归纳电路,方向对称,掩码两侧可见时归纳更强,还证明其能计算掩码令牌比例作隐式时间步长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23300 2026-08-13 q-fin.PM cs.AI cs.MA q-fin.ST 版本更新 81%

Designing Agentic AI-Based Screening for Portfolio Investment

基于代理AI的资产组合投资筛选设计

Mehmet Caner, Agostino Capponi, Nathan Sun, Jonathan Y. Tan

机构 * North Carolina State University, Nelson Hall, Department of Economics(北卡罗来纳州立大学,Nelson Hall,经济学系) Columbia University. Department of Industrial Engineering and Operations Research and Columbia Business School(哥伦比亚大学,工业工程与运筹学系及哥伦比亚商学院) Columbia University. Department of Industrial Engineering and Operations Research(哥伦比亚大学,工业工程与运筹学系)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于代理AI的资产组合投资筛选框架,通过两个专用代理筛选优质公司并生成买卖信号,结合高维精度矩阵估计确定最优权重,实验证明其在S&P 500数据上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09248 2026-08-12 cs.AI 版本更新 81%

Emotion2Skill: Model-Internal Emotion Signals for Adaptive Skill Selection and Evolution

Emotion2Skill:用于自适应技能选择与演化的模型内部情绪信号

Bohan Lin, Hejia Geng, Xinyi Xie, Heng Zhou, Qinghua Xing, Bo Liu, Chen Zhang, Yudong Zhang

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 Emotion2Skill框架提取LLM内部情绪向量,将其融入技能选择与演化,在WebShop、ALFWorld上用Qwen3模型实现显著性能提升,验证了情绪表征作为智能体决策信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00422 2026-08-12 cs.AI 版本更新 81%

TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs

TrAC:用于大语言模型高效不确定性量化的轨迹条件答案一致性

Dahai Yu, Lin Jiang, Rongchao Xu, Guang Wang

机构 * Florida State University(佛罗里达州立大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型推理轨迹与答案不一致的问题,提出TrAC框架,结合主动与被动信号实现高效不确定性量化,在数学推理基准上提升了AUROC并降低了AURC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00143 2026-08-11 cs.CR cs.AI 版本更新 81%

Symbolic Attack Chain Generation from Atomic Red Team Techniques: An Empirical Study of Predicate Representation Granularity

基于Atomic Red Team技术的符号化攻击链生成:谓词表示粒度的实证研究

Ramya Varunsegar

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究对比九类与五类谓词粒度的AALM,发现粒度对攻击链有效性影响小,81.3%结果一致,高粒度仅提升规划论证的内部结构分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08992 2026-07-28 cs.AI 版本更新 81%

Rethinking Prospect Theory for LLMs: Revealing the Instability of Decision-Making under Epistemic Uncertainty

重新思考用于大语言模型的前景理论:在认知不确定性下决策的不稳定性

Rui Wang, Qihan Lin, Jiayu Liu, Qing Zong, Tianshi Zheng, Dadi Guo, Haochen Shi, Peixuan Han, Weiqi Wang, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文重新审视前景理论在大语言模型中的应用,发现其在认知不确定性下的决策稳定性存在问题,指出前景理论可能无法可靠地处理此类不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08583 2026-07-16 cs.CL 版本更新 81%

Source or It Didn't Happen: A Multi-Agent Framework for Citation Hallucination Detection

来源或未发生:一种用于引用伪造检测的多智能体框架

Mingzhe Li, Zhiqiang Lin, Shiqing Ma

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) The Ohio State University(俄亥俄州立大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CiteTracer多智能体框架,通过12种分类体系检测引用伪造,利用PDF和BibTeX提取结构化引用,结合缓存查找、URL获取等方法验证,实现97.1%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24967 2026-07-07 cs.AI 版本更新 81%

The Anatomy of Uncertainty in LLMs

大语言模型中不确定性的解剖结构

Aditya Taparia, Ransalu Senanayake, Kowshik Thopalli, Vivek Narayanaswamy

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种将大语言模型不确定性分解为输入模糊性、知识缺口和解码随机性的框架,通过实验展示不同模型规模和任务中各组件的重要性,以提升模型可靠性与可信度。

Comments Accepted at the ICBINB Workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22645 2026-06-23 cs.CV cs.AI 版本更新 81%

HERMAN: Hierarchical Representation Matching for CLIP-based Class-Incremental Learning

HERMAN: 基于CLIP的类增量学习中的层次表示匹配

Zhen-Hao Xie, Yan Wang, Lan Li, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

机构 * School of Artificial Intelligence and the State Key Laboratory for Novel Software Technology, Nanjing University(人工智能学院和新型软件技术国家重点实验室,南京大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出HERMAN方法,利用LLM递归生成判别性文本描述,匹配不同语义层次并自适应路由,解决CLIP在类增量学习中的灾难性遗忘问题,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19072 2026-06-12 cs.SE cs.AI 版本更新 81%

HalluJudge: A Reference-Free Hallucination Detection for Context Misalignment in Code Review Automation

HalluJudge: 代码审查自动化中上下文错位的无参考幻觉检测

Kla Tantithamthavorn, Hong Yi Lin, Patanamon Thongtanunam, Wachiraphan Charoenwet, Minwoo Jeong, Ming Wu

机构 * Monash University Australia(墨尔本大学澳大利亚) The University of Melbourne Australia(墨尔本大学澳大利亚) Atlassian USA(Atlassian美国)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出无参考幻觉检测方法HalluJudge,通过上下文对齐评估生成评论的根基性,采用多分支推理策略,在F1=0.85且成本$0.009下与开发者偏好67%一致。

Comments Accepted at FSE'26: Industry Track, Full-Length, Peer-Reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21543 2026-06-10 cs.CL 版本更新 81%

inversedMixup: Data Augmentation via Inverting Mixed Embeddings

inversedMixup:通过反转混合嵌入进行数据增强

Fanshuang Kong, Richong Zhang, Qiyu Sun, Zhijie Nie, Ting Deng, Chunming Hu

机构 * Beihang University(北京航空航天大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出 inversedMixup 框架,结合 Mixup 的可控性与 LLM 的可解释性,通过对齐嵌入空间将混合嵌入重构为可读句子,首次实证文本 Mixup 中的流形入侵现象,并扩展为三阶段数据增强方法,在少样本和全监督场景下有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09445 2026-08-05 cs.CL cs.AI 版本更新 81%

Where Knowledge Collides: A Mechanistic Study of Intra-Memory Knowledge Conflict in Language Models

知识碰撞之处:语言模型中内存知识冲突的机理研究

Minh Vu Pham, Hsuvas Borkakoty, Yufang Hou

机构 * IT:U Austria(因特大学奥地利分校) IBM Research(IBM研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过机理可解释性方法揭示语言模型中预训练数据冲突知识的编码位置,探讨冲突知识在模型内部的存储机制及干预方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01774 2026-07-22 cs.AI cs.CL 版本更新 81%

Subliminal Clocks: Latent Time Modelling in Diffusion Language Models

潜意识时钟:扩散语言模型中的潜在时间建模

Maximo Eduardo Rulli, Thomas Vaitses Fontanari, Simone Petruzzi, Federico Alvetreti, Giorgio Strano, Donato Crisostomi, Giorgos Nikolaou, Tommaso Mencattini, Andrea Santilli, Emanuele Rodolà, Simone Scardapane, Alessio Devoto

机构 * Sapienza University of Rome(罗马大学) EPFL(洛桑联邦理工学院) Independent researcher(独立研究者)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文发现扩散语言模型在残差流中编码了与扩散时间步相关的潜在表示,可通过探针提取,并通过沿推断时间步的低维子空间引导来调节去噪进度,影响模型置信度和熵。

Comments Equal contribution: Thomas Vaitses Fontanari and Simone Petruzzi

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29980 2026-07-01 cs.AI cs.LG 版本更新 81%

Exploration and Online Transfer with Behavioral Foundation Models

基于行为基础模型的探索与在线迁移

Louis Bagot, Mathieu Lefort, Laëtitia Matignon

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对零样本强化学习中在线迁移的探索问题,提出利用行为基础模型生成探索策略,将在线学习建模为类似多臂赌博机的探索-利用问题,并通过不确定性矩阵特征值最小化实现探索。

Comments Retirer la mention ''European Workshop on Reinforcement Learning'' (qui correspond {à} la template de la version {é}tendue, mais le papier n'y est pas encore accept{é})

Journal ref Conf{é}rence sur l'Apprentissage automatique, Universit{é} de Montpellier, Jul 2026, Montpellier, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07984 2026-06-15 cs.LG cs.AI 版本更新 81%

Where's the Plan? Locating Latent Planning in Language Models with Lightweight Mechanistic Interventions

计划在哪里?通过轻量级机制干预定位语言模型中的潜在规划

Nicole Ma, Nick Rui

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 通过押韵对句补全任务,使用线性探针和激活修补方法,研究语言模型在生成过程中是否形成并因果依赖未来约束的潜在规划,发现仅Gemma-3-27B模型存在因果依赖,并定位到五个注意力头。

Comments 13 pages, 20 figures, 3 tables. Accepted to Workshop on Mechanistic Interpretability @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08044 2026-08-05 cs.LG cs.AI cs.CL 版本更新 80%

When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

当行为安全评估失败时:表征层面的视角

Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Technical University of Denmark(丹麦技术大学)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出行为安全与干预鲁棒性之间的“审计差距”,通过构建解离模型和引入潜在脆弱性评分(LVS),证明行为安全指标不足以衡量表征层面的鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29341 2026-07-03 cs.IR 版本更新 80%

Monosemanticity in Recommender Systems

推荐系统中的单语义性

Yagel Alfasi, Eden Rzezak, Eadan Schechter

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract)

AI总结 研究矩阵分解嵌入的层次稀疏表示,用Matryoshka稀疏自编码器提取可解释特征,通过元数据对齐和LLM标注验证语义一致性,并干预性别相关神经元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10010 2026-08-13 cs.LG 版本更新 79%

CurveFP: Co-Designing Numerical Representation and Product Arithmetic for Language Models

CurveFP:用于语言模型的带闭包乘积的有理基数对数数据类型

Ye Qiao

机构 * University of California, Irvine(加州大学欧文分校)

专题命中 知识编辑与模型理解 :language model(title);pretraining(abstract);分类 cs.LG

AI总结 本文提出CurveFP数据类型,通过闭包乘积算术协同设计,在少1位元素位数下提升语言模型性能,降低运算误差,优于FP8且更适合紧凑部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03115 2026-08-11 cs.CL eess.AS 版本更新 79%

Discovering and Causally Validating Emotion-Sensitive Neurons in Large Audio-Language Models

在大型音频-语言模型中发现并因果验证情绪敏感神经元

Xiutian Zhao, Björn Schuller, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP)(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学) Group on Language, Audio & Music (GLAM)(语言、音频与音乐小组) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过神经元层面的干预验证了大型音频-语言模型中情绪敏感神经元的存在,并揭示了情绪识别的因果机制。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06054 2026-08-10 cs.CV cs.AI 版本更新 79%

Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving

探测轻量视觉语言模型中视觉概念以用于自动驾驶

Nikos Theodoridis, Reenu Mohandas, Ganesh Sistu, Anthony Scanlan, Ciarán Eising, Tim Brophy

机构 * University of Limerick(利默里克大学) Valeo Vision Systems, Ireland(爱尔兰瓦莱欧视觉系统) Department of Electronic and Computer Engineering(电子与计算机工程系)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本研究探讨了轻量视觉语言模型在自动驾驶中的视觉概念编码问题,发现某些概念显式编码而其他隐式编码,并识别出感知和认知两种失败模式。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00807 2026-07-30 cs.AI 版本更新 79%

BioPro: Towards Difference-Aware Gender Fairness for Vision-Language Models

BioPro: 关于差分意识的性别公平性在视觉-语言模型中

Yujie Lin, Jiayao Ma, Qingguo Hu, Wenbo Li, Genji Li, Derek Wong, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 BioPro通过差分意识的性别公平性方法,在视觉-语言模型中实现选择性去偏,减少中性情境中的性别偏见同时保持显性情境中的性别忠实性。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22712 2026-07-29 cs.CV cs.AI physics.optics 版本更新 79%

scMIR: a vision-language foundation model for single-cell light microscopy image representation

scMIR:用于单细胞光学显微镜图像表示的视觉语言基础模型

Yifan Shang, Jiahui Tan, Xiangxiang Zeng, Renjie Zhou

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对单细胞光学显微镜图像分析难题,提出scMIR模型,通过自监督图像重建与文本引导跨模态对齐,在多图像文本对上预训练,在多种复杂任务中表现出色,优于现有方法,具备强泛化能力,能推动高通量表型分析工作流程标准化和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07407 2026-07-28 cs.LG 版本更新 79%

Emergent Symbolic Structure in Health Foundation Models: Extraction, Alignment, and Cross-Modal Transfer

健康基础模型中的涌现符号结构:提取、对齐与跨模态迁移

Gajendra Katuwal, Advait Koparkar, Salar Abbaspourazad, Anshuman Mishra, Sarvesh Kirthivasan

机构 * Apple(苹果公司)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出一种训练后框架,通过分解冻结嵌入以提取可解释的符号,用于对齐嵌入空间。在PPG和加速度计数据上验证,发现符号能选择性关联健康状况和生理属性,并支持跨模态迁移。

Comments 8 pages, Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, 4 main figures

Journal ref Mechanistic Interpretability Workshop at the 43 rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22864 2026-07-23 cs.LG 版本更新 79%

Reading Calibrated Uncertainty from Language Model Trajectories

从语言模型轨迹中读取校准的不确定性

Aliai Eusebi, Alexander Herzog, Xiaoyu Liang, Marie Vasek, Enrico Mariconti, Lorenzo Cavallaro

机构 * University College London, London, United Kingdom(伦敦大学学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 本文通过提取层间MLP更新的尺度不变几何特征,使用稀疏线性探针从语言模型内部激活轨迹中校准不确定性,在选择性弃权任务中优于最大softmax概率,最高提升21 AURC点。

详情

展开后加载摘要…

URL PDF HTML 收藏