arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 582 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 582 篇

2606.14728 2026-06-16 cs.CV 新提交 78%

FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty

FUSE: 通过贝叶斯融合认知不确定性和偶然不确定性来量化视觉语言模型中的不确定性

Harry Zhang, Luca Carlone

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 提出FUSE概率框架,通过贝叶斯融合视觉语言模型中的偶然不确定性和认知不确定性,生成标量不确定性度量,用于可靠预测输出正确性,实现SOTA不确定性校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13072 2026-08-14 cs.AI 新提交 77%

EEG-PRIME: Prototype-Aligned Representation Learning with Multi-Level Conditioning for EEG Decoding

EEG-PRIME:面向脑电信号解码的多层级条件原型对齐表示学习

Shuailei Zhang, Muyun Jiang, Wei Zhang, Jinbo Chen, Zhiwei Guo, Yong Li, Yi Ding, Cuntai Guan

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Centre for AI in Medicine, Nanyang Technological University(南洋理工大学医学人工智能中心) Southeast University(东南大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出EEG-PRIME脑电基础模型,结合掩码预训练与原型对齐指令调优,在16个多类型数据集上实现跨被试解码性能提升,且具备零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09095 2026-08-11 cs.AI 新提交 77%

Who Bridges Safety? Identifying and Targeting Cross-Lingual Shared Safety Pathways

谁搭建安全桥梁?识别并靶向跨语言共享安全路径

Shuyi Miao, Wangjie Qiu, Pengyang Shao, Canran Xiao, Fei Shen, Zhiming Zheng, Tat-Seng Chua

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究识别出跨语言共享安全路径,提出基于该路径的靶向对齐方法,仅更新少量参数即可提升非高资源语言安全性并保留模型通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04378 2026-08-06 cs.SD cs.LG eess.AS 新提交 77%

Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

助力音乐协同创作智能体“良好聆听”:用于理解与生成的分层自监督世界模型

Scott H. Hawley

机构 * Belmont University(贝尔蒙特大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 本研究提出分层自监督世界模型,通过Swin V2编码器与条件流匹配模型构建协同音乐创作智能体,提升了和弦与调式检测准确率,可快速生成音乐建议并支持交互演示。

Comments 20 pages, 14 figures. A 6-page version was submitted to the NeurIPS 2026 Creative AI Track. Supplemental website with listening examples: https://drscotthawley.github.io/midi-rae-jepa-son/. Live demo: https://drscotthawley-midi-rae-jepa-son.hf.space/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00147 2026-08-04 cs.CV cs.LG 新提交 77%

RadPRISM: Schema-stratified radiology-report supervision for concept-disentangled image representations and visual grounding

RadPRISM:用于概念解耦图像表示与视觉定位的模式分层放射学报告监督方法

Fabian Drexel, Marlene Fritzsche, Era Stambollxhiu, Miriam Kumpf, Lena Schmitzer, Lea Schumann, Jannik Kahmann, Friedrich Puttkammer, Johannes Moll, Jannik Lübberstedt, Zeineb Ben Chaaben, Anirudh Narayanan, Cosmin I. Bercea, Sebastian Ziegelmayer, Marcus R. Makowski, Daniel Rueckert, Lisa C. Adams, Keno K. Bressem

机构 * Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Technical University of Munich, School of Medicine and Health(慕尼黑工业大学医学与健康学院) Klinikum rechts der Isar(右伊萨尔医院) Charité – Universitätsmedizin Berlin(柏林夏里特医学院) Freie Universität Berlin(柏林自由大学) Humboldt Universität zu Berlin(柏林洪堡大学) Imperial College London(伦敦帝国理工学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) University Hospital Essen (AöR)(埃森大学医院(AöR)) Institute for Artificial Intelligence in Medicine (IKIM)(医学人工智能研究所(IKIM)) Institute of Interventional and Diagnostic Radiology and Neuroradiology(介入与诊断放射学及神经放射学研究所) National Center for Tumor Diseases West(西部肿瘤疾病国家中心)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 RadPRISM将放射学模式作为分层轴,通过专用视觉子空间对齐临床概念,提升零样本分类与视觉定位性能,实现可透明检查的概念解耦医学图像表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24750 2026-07-29 cs.CL cs.HC 新提交 77%

TimeCapsule: Generative Hallucination as a Method for Historical Sensemaking

时间胶囊:将生成性幻觉作为历史意义建构的一种方法

Hayk Grigorian, Hamed Yaghoobian

机构 * Muhlenberg College(Muhlenberg学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 研究针对大语言模型在叙述过去时不可靠的问题,提出在维多利亚时代文本上训练的TimeCapsule模型,通过定量评估和定性探究展示其性能及问题,认为对未来的无知使幻觉成为对19世纪本体论的解释性探索。

Comments 10 pages, 4 figures. Accepted to Creativity and Cognition (C&C '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22572 2026-07-28 cs.AI 新提交 77%

Schema-Aware Localisation (SAL): Live Schema Grounding and Hallucination Validation for Oracle NL2SQL

模式感知本地化(SAL):用于Oracle NL2SQL的实时模式基础与幻觉验证

Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik

机构 * Torrens University Australia(澳大利亚托伦斯大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型在Oracle数据库执行SQL失败的问题,提出模式感知本地化(SAL)轻量级中间件,通过构建实时模式映射、注入上下文及幻觉索引验证等方法,提升执行基础真值,减少执行失败率。

Comments 18 pages , 3 figures , 14 tables ,1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15218 2026-07-17 cs.AI cs.CR 新提交 77%

When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space

当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险

Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13395 2026-07-16 cs.LG 新提交 77%

Self-Improving is Often Sudden: Enlightenment-style Finetuning for Large-Scale Models

自我提升往往是突然的:大规模模型的顿悟式微调

Jing-Xiao Liao, Tianwei Zhang, Yu-Hao Jiang, Feifei Zhang, Hang-Cheng Dong, Feng-Lei Fan

机构 * School of Computer Science and Artificial Intelligence, Guangdong University of Education(广东第二师范学院计算机科学与人工智能学院) School of Instrumentation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学仪器科学与工程学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 研究大规模模型自主提升,提出顿悟式无训练后微调范式,通过修改关键模块捷径且不更新权重,针对大语言和视觉语言模型有不同实例化,实验证明有效解锁预训练网络潜力,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32008 2026-07-01 cs.LG 新提交 77%

Surrogate Fidelity: When Can Open LLMs Explain Closed Ones?

替代保真度:开放LLM何时能解释封闭LLM?

Philippe Chlenski, Zachariah Carmichael, Ayush Warikoo, Chia-Tse Shao, Yingxiao Ye, Aobo Yang, Vivek Miglani, Nehal Bandi

机构 * Meta

专题命中 知识编辑与模型理解 :LLM(title_cn);language model(abstract);分类 cs.LG

AI总结 研究开放模型能否替代解释封闭模型,发现预测保真度显著高估归因保真度,模型虽答案一致但理由不同,机械解释不能自动迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31036 2026-07-01 cs.LG 新提交 77%

Teaching LLMs to Recommend and Defer in Underrepresented Epilepsy Care

在资源不足的癫痫护理中教授LLMs推荐与转诊

Shreyas Rajesh, Kartik Sharma, Tonmoy Monsoor, Mehmet Yigit Turali, Richard Idro, Juliana Kayaga, Robert Sebunya, Tracy Tushabe Namata, Jessica Nichole Pasqua, Vwani Roychowdhury, Rajarshi Mazumder

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Makerere University(马凯雷雷大学) St. Francis Hospital Nsambya(圣弗朗西斯医院恩桑比亚分院)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 针对资源匮乏环境下专科癫痫专家稀缺的问题,提出MANANA框架,通过非参数提示学习从少量患者数据中学习本地处方指南,结合贝叶斯提示平均实现不确定性驱动的选择性预测,在乌干达儿科癫痫队列中提升处方准确率并支持转诊。

Comments 34 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25402 2026-06-25 cs.SE cs.AI 新提交 77%

LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

LibEvoBench:探测代码生成模型中的时间知识分层

Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen

机构 * Faculty of EEMCS, Delft University of Technology, Delft, Netherlands(代尔夫特理工大学电子工程与信息科学学院) JetBrains Research, Amsterdam, Netherlands(JetBrains研究)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 针对LLM在代码生成中因训练数据时间混合导致API版本混淆的问题,提出多版本基准LibEvoBench和新指标SEUS,揭示模型对版本不敏感且仅靠文档可提升准确性。

Comments Accepted at the DL4Code workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22633 2026-06-23 cs.AI 新提交 77%

Confident but Conflicted: Internal Uncertainty and Cognitive Dissonance Resolution in LLMs

自信但矛盾:大语言模型中的内部不确定性与认知失调解决

Weihong Qi, Kristina Lerman

机构 * Indiana University Bloomington(印第安纳大学伯明顿分校)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型面对矛盾输入时的认知失调解决机制,提出信任弹性(TE)度量模型被说服的倾向,并发现内部不确定性指标(如置信度校准和内部不确定性变化)与行为变异相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15893 2026-06-23 cs.CL 新提交 77%

BALTO: Balanced Token-Level Policy Optimization for Hallucination Mitigation

BALTO: 用于幻觉缓解的平衡令牌级策略优化

Ning Li, Zixuan Guo, Yan Xu, Wenbo Fei, Yifan Niu, Chang Luo, Yasheng Wang, Weiwen Liu, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 针对大语言模型幻觉问题,提出BALTO框架,通过提取可验证事实声明并投影为令牌级标签,引入平衡信用分配机制,在六个模型-基准设置中实现最高忠实度,优于现有后训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14215 2026-06-15 cs.LG 新提交 77%

LapidaryEngine: Fully Conversational Crystal Generation

LapidaryEngine: 全对话式晶体生成

Yusei Ito, Yuta Suzuki, Tomoya Murata, Masaki Adachi

机构 * Lattice Lab, Toyota Motor Corporation(丰田汽车公司Lattice实验室) The University of Osaka(大阪大学)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出LapidaryEngine,首个支持全对话式晶体生成的模型,通过枢轴表示实现文本与晶体结构的双向翻译,支持自由形式自然语言请求和迭代优化。

Comments 11 main pages, 5 main figures, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11512 2026-06-11 cs.CL 新提交 77%

SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment

SAGE: 面向言语不确定性对齐的答案条件不确定性目标

Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

机构 * University of Notre Dame(圣母大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 提出SAGE目标,通过答案条件不确定性几何从模型采样响应中构建群组级不确定性目标,结合GUPO训练框架优化言语不确定性表达,在多项推理任务中提升不确定性排序、降低校准误差和过度自信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08238 2026-06-09 cs.LG 新提交 77%

GPT-Micro: A large language paradigm for accelerated, inexpensive, and thermodynamics-consistent discovery of constitutive models in manufacturing

GPT-Micro: 一种用于制造业中加速、低成本且热力学一致的本构模型发现的大语言范式

Soumik Dutta, Kiarash Naghavi Khanghah, Sania Shree, Logan McNeil, Thomas Feldhausen, Hongyi Xu, Rajiv Malhotra

机构 * Department of Mechanical and Aerospace Engineering, Rutgers University(罗格斯大学机械与航空航天工程系) Department of Mechanical, Aerospace & Manufacturing Engineering, University of Connecticut(康涅狄格大学机械、航空航天与制造工程系) Edison Welding Institute(埃迪森焊接研究所) Manufacturing Science Division, Oak Ridge National Laboratory(橡树岭国家实验室制造科学分会) Department of Aerospace and Mechanical Engineering, University of Texas at El Paso(德克萨斯州埃尔帕索大学航空航天与机械工程系)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出GPT-Micro范式,结合大语言模型、热力学约束和稀疏数据,实现自主发现本构模型,在印刷电子测试中数据量减少70%、发现时间缩短400倍。

Comments 23 pages, 4 tables, 11 equations, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06893 2026-06-08 cs.AI 新提交 77%

Workflow-to-Skill: Skill Creation via Routing-Workflow-Semantics-Attachments Decomposition

工作流到技能:通过路由-工作流-语义-附件分解创建技能

Yuyang Zhang, Xinyuan Han, Xudong Jiang, Run Wang

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门与可信计算重点实验室,教育部,网络安全科学与工程学院,武汉大学) Nanchang University(南昌大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出RWSA中间表示和W2S框架,从异构交互证据中自动构建技能,通过分解工作流结构、执行语义和运行时附件,提升行为重放一致性10.5%。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16259 2026-07-21 cs.LG cs.CL stat.ML 新提交 76%

Quantifying Ranking Uncertainty in LLM Benchmarks

量化语言模型基准测试中的排名不确定性

Bitya Neuhof, Yuval Benjamini

专题命中 知识编辑与模型理解 :LLM(title);分类 cs.CL、cs.LG

AI总结 研究量化语言模型基准测试中排名不确定性问题,通过汇总成对假设检验来实现,分析了知识评估基准MMLU的不确定性来源并展示如何修改假设检验,指出MMLU各主题排名变异性大,比较模型时应考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26783 2026-07-08 cs.LG cs.CL 新提交 76%

Reproducibility Study of "AlphaEdit: Null-Space Constrained Knowledge Editing for Language Models"

可重复性研究:"AlphaEdit: 面向语言模型的零空间约束知识编辑"

Ananth K Suresh, Arya Hariharan

机构 * Independent(独立研究者)

专题命中 知识编辑与模型理解 :language model(title);分类 cs.CL、cs.LG

AI总结 本研究复现了AlphaEdit知识编辑方法,发现其在原始设置下结果可复现,但扩展到新架构和大量顺序编辑时性能下降,表明其理论保证有边界。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09928 2026-08-11 cs.CV cs.AI cs.CL cs.LG 新提交 75%

Multimodal Model Diffing for Feature Discovery and Control

用于特征发现与控制的多模态模型差异分析

Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Clark

机构 * University of Oxford(牛津大学) Microsoft(微软公司)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。

Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24475 2026-07-28 cs.IR cs.DL 新提交 75%

Robust Interpretation of Historical Documents in Knowledge Graphs Through Query Inference and Execution

通过查询推理和执行对知识图谱中的历史文档进行鲁棒解释

Sebastià Nicolau, Adrià Molina, Oriol Ramos Terrades, Josep Lladós

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究如何在利用大语言模型泛化能力时保证可靠性,提出智能检索系统,比较传统RAG与智能GraphRAG架构,引入半符号框架,通过单词识别与代码生成协作构建鲁棒检索查询,提升历史文档分析准确性与可验证性。

Comments Accepted at ICDAR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08196 2026-07-10 cs.AI cs.CL cs.LG 新提交 75%

A First-Principles Theory of Slow Thinking and Active Perception

慢思考与主动感知的第一性原理理论

Hongkang Yang, Zhi-Qin John Xu, Feiyu Xiong, Weinan E

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文旨在为思维和感知提供数学公式,提出“主动提升”理论,推导慢思考相关内容,涵盖其设计、训练和推理,得出大设计空间及相关层次,还包括推理过程、训练目标等,有诸多技术副产品。

Comments Published on 2026/05/11 in Journal of Machine Learning

Journal ref Journal of Machine Learning 5 (2026) 197-352

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17482 2026-07-10 cs.CV 新提交 75%

SPHINX: First Explain, Then Explore

SPHINX: 先解释,再探索

Nguyen Do, Tue M. Cao, Tien Van Do, András Hajdu, Tamás Bérczes, My T. Thai

机构 * University of Florida(佛罗里达大学) University of Debrecen(德布勒恩大学)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出SPHINX闭环框架,通过可解释AI分析驾驶策略的失败模式,并利用视觉语言模型生成针对性对抗场景,提升自动驾驶策略鲁棒性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00578 2026-07-02 cs.CV 新提交 75%

Caption Bottleneck Models

标题瓶颈模型

Seref Baris Cagliyan, Umut Ozdemir, Merve Tapli, Emre Akbas

机构 * Dept. of Computer Eng., Middle East Technical University (METU)(中东技术大学计算机工程系) Robotics & AI Center (ROMER), METU(中东技术大学机器人与人工智能中心)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);post-training(abstract)

AI总结 提出标题瓶颈模型(CaBM),用自由形式自然语言替代固定概念集,通过LMM生成标题并严格基于文本训练分类器,实现无信息泄露的架构并自主发现高质量概念。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17057 2026-06-17 cs.LG cs.AI cs.CL 新提交 75%

Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMs

配对时正确,分离时错误:多模态大语言模型中模态特定神经元的解耦与编辑

Tingchao Fu, Wenkai Wang, Fanxiao Li, Huadong Zhang, Jinhong Zhang, Dayang Li, Yunyun Dong, Renyang Liu, Wei Zhou

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Software, Yunnan University(云南大学软件学院) National University of Singapore(新加坡国立大学) School of Engineering, Yunnan University(云南大学工程学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对多模态大语言模型知识编辑中存在的解耦失败问题,提出DECODE方法,通过显式解耦和定位模态特定神经元组,实现跨模态触发下的有效知识更新。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00158 2026-07-02 cs.CL 新提交 74%

Readable but Not Controllable: Neuron-Level Evidence for Medical LLM Hallucination

可读但不可控:医学大语言模型幻觉的神经元级证据

Vijay Vankadaru, Asha Matthews, Tanya Roosta, Peyman Passban

专题命中 知识编辑与模型理解 :LLM(title);分类 cs.CL

AI总结 本研究通过探测医学大语言模型内部表示,发现幻觉可被高精度检测(AUROC 0.77-0.86),但该表示分布冗余且因果不可控,揭示了解码性与可控性之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14014 2026-08-17 cs.AI cs.LG q-fin.ST 新提交 73%

Buy the Rumor, Sell the News: When Is News Priced In?

买入传闻,卖出新闻:新闻何时被定价?

Alireza Kargarzadeh, Nariman Khaledian, Navid Parvini, Sid Ghatak, Arman Khaledian

机构 * Tailstate Intelligence Ltd(Tailstate Intelligence有限公司) Zanista AI Ltd(Zanista AI有限公司) Increase Alpha, LLC(Increase Alpha有限责任公司)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究以457万篇金融新闻为样本,发现新闻相关价格变动集中于发布前后,市场对数字类新闻反应不足、对故事类新闻反应过度,且生成的漂移表可用于新闻条件预测模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07430 2026-08-10 cs.LG cs.AI 新提交 73%

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

扩散大语言模型作为目标与对抗者:机制性安全漏洞利用

Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究揭示扩散大语言模型(DLLMs)的安全机制漏洞,提出SN-Guided Diffusion黑盒越狱框架,实现高迁移攻击成功率且生成成本远低于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05158 2026-08-07 cs.CL cs.LG cs.NE 新提交 73%

Safe Evolution with Circuit Anchors

基于回路锚点的安全进化

Yan Liu, Jie Fu, Tsung-Yi Ho

机构 * Chinese University of Hong Kong(香港中文大学) IQuest Research(艾奎斯特研究院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 受生物发育约束启发,提出回路锚定进化(CAE)方法,通过锚定占比不足2%的安全回路,在极小能力损失下实现更优的安全保留,性能优于显式奖励约束。

详情

展开后加载摘要…

URL PDF HTML 收藏