arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7550 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7550 篇

2606.24808 2026-06-24 quant-ph cs.AI 新提交 81%

Large-Language-Model Discovery of Quantum LDPC Codes through Structured Concept Evolution

通过结构化概念演化的大语言模型发现量子LDPC码

Zidu Liu, Florian Marquardt

机构 * Max Planck Institute for the Science of Light(光科学Max Planck研究所) Department of Physics, Friedrich-Alexander University Erlangen-Nürnberg(埃尔兰根-纽伦堡弗里德里希-亚历山大大学物理系)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出结构化概念演化(SCE)框架,利用大语言模型和结构化代数变异语法搜索提升积码族,发现多种竞争性码族,包括非阿贝尔群上的新构造。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23313 2026-06-23 cs.CY cs.CL 新提交 81%

Uncertainty-based Debiasing and Unlearning for Decontamination

基于不确定性的去偏与遗忘用于去污染

Guangzhi Sun, Xiao Zhan, Mark Gales

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) VRAIN, Universitat Politècnica de València(瓦伦西亚理工大学VRAIN)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于不确定性的去污染方法(UBD),利用深度集成估计每个样本的记忆程度,通过去偏或遗忘修正输出分布,无需无污染模型或污染样本先验知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23060 2026-06-23 cs.SD cs.AI eess.AS 新提交 81%

From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection

从文本度量到模型内部:Whisper ASR幻觉检测研究

Jan Jasiński, Mateusz Barański, Julitta Bartolewska, Marcin Witkowski, Konrad Kowalczyk

机构 * Signal Processing Group, Institute of Electronics, AGH University of Krakow, Poland(信号处理组,电子学研究所,AGH克拉科夫大学,波兰)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究Whisper大模型在真实语音数据上的幻觉检测,通过文本、LLM和内部解码器状态三种方法,发现无参考文本时探测解码器表示性能最强,融合文本与内部状态的元分类器效果最佳。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22673 2026-06-23 cs.AI cs.SE 新提交 81%

AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent

AgentLens: 通过机制子空间实现多轮编码代理的可解释安全引导

Weidi Luo, Qiming Zhang, Yihao Quan, Mingyu Jin, Jie Cai, Chaowei Xiao, Jingcheng Niu, Zhen Xiang

机构 * University of Georgia(佐治亚大学) University of South Florida(南佛罗里达大学) Rutgers University(罗格斯大学) University of Southern California(南加州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AgentLens框架,从内部表示层检测和缓解多轮编码代理的安全风险,通过单层10维子空间干预实现运行时安全控制,并在MAS基准上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22645 2026-06-23 cs.CV cs.AI 版本更新 81%

HERMAN: Hierarchical Representation Matching for CLIP-based Class-Incremental Learning

HERMAN: 基于CLIP的类增量学习中的层次表示匹配

Zhen-Hao Xie, Yan Wang, Lan Li, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

机构 * School of Artificial Intelligence and the State Key Laboratory for Novel Software Technology, Nanjing University(人工智能学院和新型软件技术国家重点实验室,南京大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出HERMAN方法,利用LLM递归生成判别性文本描述,匹配不同语义层次并自适应路由,解决CLIP在类增量学习中的灾难性遗忘问题,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19152 2026-06-18 cond-mat.mtrl-sci cs.AI 新提交 81%

AdsMind: A Physics-Grounded Multi-Agent System for Self-Correcting Discovery of Adsorption Configurations on Heterogeneous Catalyst Surfaces

AdsMind: 一种基于物理的多智能体系统,用于异质催化剂表面吸附构型的自校正发现

Zongmin Zhang, Yuyang Lou, Bowen Zhang, Junwu Chen, Ryo Kuroki, Xuan Vu Nguyen, Edvin Fako, Lixue Cheng, Philippe Schwaller

机构 * Department of Computer Science Engineering, Hong Kong University of Science Department of Chemistry, Hong Kong University of Science Laboratory of Artificial Chemical Intelligence (LIAC), EPFL, Lausanne, Switzerland Platform Laboratory for Science \& Technology, Asahi Kasei Corporation, Tokyo, Japan IAS Center for AI for Scientific Discoveries, Hong Kong University of Science

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AdsMind闭环多智能体框架,利用机器学习力场弛豫反馈实现吸附构型搜索的自主纠错,在基准测试中成功率高达100%和98.8%,且仅需少量弛豫步骤,显著优于启发式枚举和单次方法。

Comments 37 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13934 2026-06-15 cs.AI 新提交 81%

Adversarial Concept Search: Predicting Compositional Errors From Feature Geometry

对抗性概念搜索:从特征几何预测组合错误

Jennifer Meng Lu, Ruochen Zhang, Isabelle Lee, David Alvarez-Melis, Ellie Pavlick, Naomi Saphra

机构 * Brown University(布朗大学) University of Southern California(南加州大学) Harvard University(哈佛大学) Boston University(波士顿大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 利用LLM的表征几何预测其组合失败模式,发现概念编码近正交时可靠组合,编码接近时因干扰导致失败,无需评估具体输入即可预测错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12897 2026-06-12 cs.CL 新提交 81%

SafeLLM: Extraction as a Hallucination-Resistant Alternative to Rewriting in Safety-Critical Settings

SafeLLM: 在安全关键场景中,提取作为重写的抗幻觉替代方案

Julia Ive, Felix Jozsa, Evridiki Georgaki, Nabeel Sheikh, Emma Cattell, Nick Jackson, Paulina Bondaronek, Ciaran Scott Hill, Richard Dobson

机构 * Institute of Health Informatics, University College London(伦敦大学学院健康信息学研究所) National Hospital for Neurology and Neurosurgery(国家神经内科与神经外科医院) Somerset NHS Foundation Trust(萨默塞特NHS基金会信托) King's College Hospital(国王学院医院) King's College London(伦敦国王学院)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出将提取作为重写型RAG的抗幻觉替代方案,通过行号选择策略在安全关键文档中实现高召回(95%)和低幻觉,优于直接复制和安全导向方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19072 2026-06-12 cs.SE cs.AI 版本更新 81%

HalluJudge: A Reference-Free Hallucination Detection for Context Misalignment in Code Review Automation

HalluJudge: 代码审查自动化中上下文错位的无参考幻觉检测

Kla Tantithamthavorn, Hong Yi Lin, Patanamon Thongtanunam, Wachiraphan Charoenwet, Minwoo Jeong, Ming Wu

机构 * Monash University Australia(墨尔本大学澳大利亚) The University of Melbourne Australia(墨尔本大学澳大利亚) Atlassian USA(Atlassian美国)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出无参考幻觉检测方法HalluJudge,通过上下文对齐评估生成评论的根基性,采用多分支推理策略,在F1=0.85且成本$0.009下与开发者偏好67%一致。

Comments Accepted at FSE'26: Industry Track, Full-Length, Peer-Reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21543 2026-06-10 cs.CL 版本更新 81%

inversedMixup: Data Augmentation via Inverting Mixed Embeddings

inversedMixup:通过反转混合嵌入进行数据增强

Fanshuang Kong, Richong Zhang, Qiyu Sun, Zhijie Nie, Ting Deng, Chunming Hu

机构 * Beihang University(北京航空航天大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出 inversedMixup 框架,结合 Mixup 的可控性与 LLM 的可解释性,通过对齐嵌入空间将混合嵌入重构为可读句子,首次实证文本 Mixup 中的流形入侵现象,并扩展为三阶段数据增强方法,在少样本和全监督场景下有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08477 2026-06-09 cs.AI 新提交 81%

A Variability-Based Framework for Interpretable Naming in Formal and Relational Concept Analysis

基于可变性的框架:形式概念分析与关系概念分析中的可解释命名

Alain Gutierrez, Marianne Huchard, Pierre Martin, André Miralles, Violaine Prince

机构 * LIRMM, Univ. Montpellier, CNRS(法国国家科学研究中心蒙彼利埃大学计算机科学、机器人及微电子实验室) CIRAD, UPR AIDA(法国农业国际合作研究发展中心AIDA研究单元) AIDA, CIRAD, Univ. Montpellier(法国农业国际合作研究发展中心AIDA研究单元,蒙彼利埃大学) INRAE - UMR TETIS - Territoires, Environnement(法国国家农业、食品与环境研究院TETIS联合研究单元)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对形式概念分析和关系概念分析中概念命名缺乏可解释性的问题,提出一种基于可变性的LLM辅助命名框架,通过控制信息源生成可读名称,并在披萨店数据集上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07818 2026-06-09 cs.CL cs.NE 新提交 81%

Representational Similarity and Model Behavior in Multi-Agent Interaction

多智能体交互中的表征相似性与模型行为

Yujin Potter, Seun Eisape, Shiyang Lai, Alexander Huth, James Evans, Been Kim, Jacob Eisenstein, Dawn Song, Alane Suhr

机构 * University of Washington(华盛顿大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究LLM对间的表征相似性对合作与创新的影响,发现高相似性促进合作但降低新颖性,且早期层相似性关联最强。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06976 2026-06-08 cs.AI 新提交 81%

Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning

通过不确定性对齐强化学习探索智能体工具调用决策

Yijin Zhou, Linqian Zeng, Xiaoya Lu, Wenyuan Xie, Dongrui Liu, Junchi Yan, Jing Shao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对智能体工具调用中错误累积问题,提出TRUST方法,将不确定性量化作为排斥力融入奖励设计,并标注轻量关键轮次用于多轮轨迹统一后训练,显著提升决策质量与智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04223 2026-06-04 cs.AI 81%

Consensus is Strategically Insufficient: Reasoning-Trace Disagreement as a Knowledge-Representation Signal

共识在策略上是不充分的:推理轨迹分歧作为知识表示信号

Michał Wawer, Jarosław A. Chudziak

机构 * Laboratory of The New Ethos(新伦理实验室) Warsaw University of Technology(华沙理工大学) Institute of Computer Science(计算机科学研究所) Faculty of Electronics and Information Technology(电子与信息技术学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出在价值负载任务中,分歧可能反映规范不确定性而非错误,通过将推理轨迹和决策抽象为符号分歧状态,构建知识表示层以支持可废止策略路由,连接亚符号LLM审议与符号知识表示。

Comments Accepted to LAMAS&SR workshop at FLoC 2026 (KR + ICPL + LICS + CP + FSCD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02158 2026-06-02 cs.CL 81%

On the Salience of Low-Probability Tokens for AI-Generated Text Detection: A Multiscale Uncertainty Perspective

低概率标记对AI生成文本检测的显著性:多尺度不确定性视角

Yikai Guo, Bin Wang, Xilai Fan, Wenjun Ke, Haoran Luo

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对AI生成文本检测中模板标记主导和点估计脆弱的问题,提出基于低概率标记的多尺度不确定性估计器Uncertainty及其改进版Uncertainty++,在多个数据集和LLM上验证了有效性、泛化性和鲁棒性。

Comments Accepted by ICML 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00301 2026-06-02 cs.LG 81%

FLaG: Fine-Grained Latent Grouping for Hallucination Detection

FLaG:用于幻觉检测的细粒度潜在分组

Wentao Ye, Liyao Li, Zhiqing Xiao, Muzhi Zhu, Jiaqi Hu, Zhanming Shen, Xiaomeng Hu, Sean Du, Haobo Wang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出FLaG框架,通过能量路由机制将实例软关联到多个潜在证据组,并利用对数边际聚合组合组条件可靠性信号,以捕获异构幻觉模式,实现无需修改底层模型的高效幻觉检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30042 2026-05-29 cs.AI 81%

Learning to Choose: An Empowerment-Guided Multi-Agent System with semantic communication for Adaptive Method Selection

学会选择:一种基于赋权与语义通信的自适应方法选择多智能体系统

Geremy Loachamín-Suntaxi, Robert Lazar, Dimitrios G. Giovanis, Ioannis G. Kevrekidis, Eleni D. Koronaki

机构 * Faculty of Science, Technology and Medicine(科学、技术与医学学院) University of Luxembourg(卢森堡大学) Johns Hopkins University(约翰霍普金斯大学) Luxembourg Institute of Science and Technology(卢森堡科学与技术研究院)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种结合上下文赌博机、结构化智能体间通信和语义检查点的多智能体框架,通过保持动作-结果因果一致性来提升科学计算工作流中自适应决策的收敛性、鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29737 2026-05-29 cs.CR cs.CL cs.SE 81%

Minimal Prompt Perturbations Lead to Code Vulnerabilities: Prompt Fragility and Hidden-State Signals in Coding LLMs

最小提示扰动导致代码漏洞:编码大语言模型中的提示脆弱性和隐藏状态信号

Alexander Sternfeld, Andrei Kucharavy, Ljiljana Dolamic

机构 * IEM, HES-SO, Le Foyer, Techno-Pôle 1, Sierre, Switzerland(瑞士苏黎世联邦理工学院(HES-SO)技术园区1号,西尔尔) Cyber-Defence Campus, armasuisse Science and Technology, Thun, Switzerland(瑞士图恩 Cyber-Defence 营地,armasuisse 科学与技术)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文通过token级突变实验,发现微小提示扰动(如单字符变化)即可使LLM生成代码从安全变为脆弱,并利用隐藏状态分析揭示输入处理漏洞比安全默认值漏洞更可预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28745 2026-05-28 cs.CL 81%

Stance Detection in Prediction Markets: Addressing Imbalanced Trader Commentary via Counterfactual Augmentation and Market Context

预测市场中的立场检测:通过反事实增强和市场上下文解决交易者评论不平衡问题

Thomas Mbrice

机构 * Department of Computer Science(计算机科学系) Stony Brook University(石溪大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对预测市场评论中极端不平衡的立场检测问题,提出结合市场上下文和LLM驱动的反事实增强方法,显著提升了少数类(反对立场)的召回率和F1值。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23933 2026-05-28 cs.CY cs.AI 81%

KT4EQG: Personalized Exercise Question Generation via Knowledge Tracing

KT4EQG: 通过知识追踪实现个性化习题生成

Xinyi Gao, Qiucheng Wu, Lu Ding, Q. Vera Liao, Kaizhi Qian, Ying Xu, Shiyu Chang, Yang Zhang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) University of South Alabama(南方大学) University of Michigan(密歇根大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Harvard University(哈佛大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出KT4EQG框架,利用知识追踪模型选择最合适的概念,并训练基于LLM的题目生成器,以生成个性化习题,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04042 2026-05-21 cs.CL 81%

Causal Path Alignment: Anchoring the Optimization Trajectory for Controllable In-Parameter Knowledge Editing

因果路径对齐:为可控的参数知识编辑锚定优化轨迹

Xiyu Liu, Zhengxiao Liu, Naibin Gu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Causal Path Alignment框架,通过锚定优化轨迹来解决参数知识编辑中的主体主导记忆干扰问题,提升关系特异性并减少副作用。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20191 2026-05-21 cs.CL 81%

Shiny Stories, Hidden Struggles: Investigating the Representation of Disability Through the Lens of LLMs

闪耀的故事,隐藏的挣扎:通过LLM的视角调查残疾人的表现

Marco Bombieri, Simone Paolo Ponzetto, Marco Rospocher

机构 * Department of Foreign Languages and Literature, University of Verona(外国语言文学系,威尼斯大学) Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) Data and Web Science Group, University of Mannheim(数据与网络科学小组,曼海姆大学)

专题命中 知识编辑与模型理解 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型(LLMs)如何表现残疾人群体,通过模拟残疾人视角生成社交媒体帖子,并与真实残疾人的帖子进行比较,揭示LLMs对残疾人的理想化倾向和潜在的偏见。

Comments Accepted for publication in ACM Transactions on Intelligent Systems and Technology

Journal ref ACM Trans. Intell. Syst. Technol. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12276 2026-05-13 cs.CL 81%

Modeling Narrative Structure in Latin Epic Poetry with Automatically Generated Story Grammars

用自动生成的故事语法建模拉丁史诗诗歌的叙事结构

Abigail Swenor, John James, Neil Coffee, Walter Scheirer

机构 * Department of Computer Science and Engineering, University of Notre Dame(诺特兰大学计算机科学与工程系) Department of Classics, University at Buffalo(布法罗大学古典学系)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种利用大语言模型和少样本学习自动标注拉丁史诗诗歌故事元素,以提升文学文本分析的可解释性和实用性。

Comments Submitted to Journal of Computational Literary Studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10018 2026-05-12 cs.LG 81%

The Value of Mechanistic Priors in Sequential Decision Making

在序列决策中机制先验的价值

Itai Shufaro, Gal Benor, Shie Mannor

机构 * Technion(技术学院) NVIDIA Research(NVIDIA研究)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文研究了机制先验在序列决策中的价值,通过渐近和预热阶段的分析,提出机制信息度量并展示其在5-FU给药模拟中的高效性,对比LLM先验发现其在机械信息上存在严重损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08516 2026-05-12 cs.AI 81%

OracleTSC: Oracle-Informed Reward Hurdle and Uncertainty Regularization for Traffic Signal Control

OracleTSC: 通过Oracle信息的奖励障碍和不确定性正则化用于交通信号控制

Darryl Jacob, Xinyu Liu, Muchao Ye, Xiaoyong Yuan, Pan He

机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系) Auburn University(亚伯拉罕大学) Department of Computer Science(计算机科学系) University of Iowa(爱荷华大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Clemson University(克莱姆森大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OracleTSC通过奖励障碍和不确定性正则化机制提升交通信号控制的稳定性与效果,实验表明其在交通效率提升和跨路口泛化能力方面表现突出。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08045 2026-05-11 cs.CL 81%

Uncertainty-Aware Structured Data Extraction from Full CMR Reports via Distilled LLMs

基于蒸馏LLM的全CMR报告不确定性感知结构化数据提取

Yi Yu, Parker Martin, Zhenyu Bu, Yixuan Liu, Yi-Yu Zheng, Orlando Simonetti, Yuchi Han, Yuan Xue

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文提出CMR-EXTR框架,通过蒸馏LLM将自由文本CMR报告转为结构化数据并提供字段置信度,实现无监督推理和不确定性整合,达到99.65%的变量级准确率。

Comments Accepted to ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07935 2026-05-11 cs.AI cs.MA 81%

TraceFix: Repairing Agent Coordination Protocols with TLA+ Counterexamples

TraceFix:基于TLA+反例的智能体协调协议修复

Shuren Xia, Qiwei Li, Taqiya Ehsan, Jorge Ortiz

机构 * Rutgers University(新泽西州普林斯顿大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TraceFix通过TLA+反例迭代修复智能体协调协议,实现高效验证与执行,提升任务完成率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27275 2026-05-01 cs.HC cs.AI cs.CY 81%

Evaluating Epistemic Guardrails in AI Reading Assistants: A Behavioral Audit of a Minimal Prototype

评估人工智能阅读助手中的认知护栏:一个最小原型的行为审计

Matthew Christian Agustin

机构 * Responsible Innovation Lab(负责任创新实验室)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过TextWalk原型评估认知护栏在AI阅读助手中的行为特性,探讨在压力下其动态表现及对读者解读劳动的影响。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25931 2026-04-30 cs.CL 81%

Anchored Confabulation: Partial Evidence Non-Monotonically Amplifies Confident Hallucination in LLMs

锚定编造:部分证据非单调放大LLM中的自信幻觉

Ashish Balkishan Lathkar

机构 * Florida State University(佛罗里达州立大学)

专题命中 知识编辑与模型理解 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型中一种新校准特性:提供一个确认的中间事实可非单调放大自信错误答案率。通过六个证据线证明了参数幻觉信心(PHC)概念,并在RAG路由中应用,显著提升性能。

Comments 62 pages, 5 figures. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02989 2026-04-23 cs.CL 81%

Mechanistic Interpretability of Large-Scale Counting in LLMs through a System-2 Strategy

通过系统2策略解析大语言模型中大规模计数的机制

Hosein Hasani, Mohammadali Banayeeanzade, Ali Nafisi, Sadegh Mohammadian, Fatemeh Askari, Mobin Bagherian, Amirmohammad Izadi, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种系统2策略,通过分解大计数任务为小问题来提升LLM计数精度,揭示了计数机制并验证了其有效性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏