Visual Classification via Description from Large Language Models
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG
专题命中 知识编辑与模型理解 :language model(title,abstract);small language model(title,abstract);分类 cs.LG
Comments 16 pages
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(comments)
Comments To appear in ECCV-2024, Project page: https://llm-conditioned-diffusion.github.io/
幻觉滚雪球:将多智能体大语言模型流水线中的错误传播建模为状态转移
专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.CL、cs.AI
AI总结 该研究发现多智能体LLM流水线中存在幻觉滚雪球效应,即幻觉会随状态转移而逃逸,且边界门控验证比末端检查更能有效降低幻觉存活率,还提出了最优验证资源分配策略。
Comments 10 pages, 3 figures; accepted at the FAGEN Workshop (Failure Modes in Agentic AI), ICML 2026
语言模型中的跨架构引导迁移:一项系统实证研究
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.LG
AI总结 本研究通过系统实证发现,在1.7B参数规模以上,独立训练的大语言模型间存在可利用的跨架构引导迁移,验证了柏拉图式表征假说的功能层面补充,强调了机制可解释性中的规模阈值。
LogitScope:通过信息度量分析大语言模型不确定性框架
机构 * IBM Research(IBM研究院) ; Plastic Labs
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 LogitScope通过计算概率分布中的信息度量,分析大语言模型生成过程中的不确定性,揭示模型置信度模式,识别潜在幻觉并暴露高不确定决策点,无需标注数据或语义解释。
拉普拉斯-PSN-IRT:大语言模型基准神经项目反应理论模型的不确定性量化
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型基准神经项目反应理论模型,提出拉普拉斯-PSN-IRT方法,通过近似贝叶斯后验推断增强模型,能恢复校准不确定性,可进行可信区间等分析,实验表明该方法在模型比较、信息稳定性及能力排名恢复等方面表现良好。
ProvenanceGuard: 基于MCP的LLM智能体的源感知事实性验证
机构 * Multiverse Computing ; Parque Cientifico y Tecnológico de Gipuzkoa(吉普斯夸科技园) ; Centre for Social Innovation(社会创新中心) ; Donostia International Physics Center(多诺斯蒂亚国际物理中心) ; Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 提出ProvenanceGuard,一种源感知验证器,通过追踪MCP工具调用、分解声明并路由到特定源,检测跨源混淆错误,在医疗领域数据集上优于源无关基线。
Comments 20 pages, 4 figures
ARCO: 基于自适应规则与协同进化的多步LLM智能体
机构 * Renmin University of China(中国人民大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 提出ARCO框架,通过同尺度模型的双头结构(生成头与评分头)实现步骤级规则生成与奖励分配,结合轨迹分解约束和策略协同进化,在多个多跳QA任务上取得最优EM性能。
流系统中事件触发大语言模型调用的不确定性感知序贯决策规则
机构 * Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究流系统中何时调用大语言模型的问题,将其转化为基于风险的序贯停止问题,证明了相关理论结果。通过在涡轮风扇退化数据上的实验,验证假设、比较基线,得出次线性遗憾、高诊断质量等结论,表明异常分数驱动的风险函数更优。
Comments 18 pages, 5 figures. Accepted to the ECML PKDD 2026 Research Track
诱导情绪会影响大语言模型在序列决策中的行为吗?
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Texas A&M University(德州农工大学) ; National University of Singapore(新加坡国立大学) ; UCLA(加州大学洛杉矶分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Mass General Hospital(麻省总医院) ; Harvard Medical School(哈佛医学院)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨诱导情绪对大语言模型在序列决策中行为的影响,采用爱荷华赌博任务结合情绪诱导程序,发现诱导情绪平均不显著影响其决策动态,但愤怒有条件地影响决策,揭示了与人类行为的差异,为相关研究提供工具。
如何利用合成语音提升基于LLM的ASR系统?
机构 * Idiap Research Institute(Idiap研究 institute) ; Universite de Toulon(里昂大学) ; EPFL(瑞士联邦理工学院) ; University of Zurich(苏黎世大学) ; Uniphore(Uniphore公司) ; Brno University of Technology(布拉格技术大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 针对隐私敏感领域合成语音与真实数据分布差异问题,通过分析SLAM-ASR架构定位差异来源,发现早期到中间层对时间与韵律扰动敏感,并证明卷积房间脉冲响应可缩小差距,结合层选择模块与RIR增强仅用25%真实语音即达到全真实数据基线。
Comments Submitted to SLT 2026
AnyPoC:用于可扩展LLM基于Bug检测的通用证明-概念测试生成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 AnyPoC通过多代理框架生成可执行的证明-概念测试,以验证候选Bug报告,提升自动化Bug检测的实用性。
黑暗中的询问:部分可观测性下的不确定性门控语言模型辅助
机构 * Kunumi Institute(库努米研究所) ; King’s College London(伦敦国王学院)
专题命中 知识编辑与模型理解 :LLM(title);SLM(abstract,abstract_cn);language model(abstract);small language model(abstract)
AI总结 研究部分可观测性下强化学习智能体,指出普通不确定性门控方法失败原因是上下文问题。提出ASK+,为语言模型提供轨迹感知上下文和结构化推理,证明预测熵信号可行,在多环境中取得更好效果,强调提示设计重要性。
Comments Accepted at the IJCAI-ECAI Joint Workshop on Planning for Complex Real-World Applications and Bridging the Gap Between AI Planning and (Reinforcement) Learning
KARLA:基于知识库增强的语言模型检索
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);language model(title);分类 cs.CL、cs.AI
AI总结 提出一种新方法,使LLM在生成过程中自动从知识库提取事实知识,支持知识更新、可追溯性和小模型的高事实准确性。
揭示自回归LLM在事件表示中主题适配性的知识
机构 * Imperial College London(伦敦帝国学院) ; Columbia University(哥伦比亚大学) ; University of Washington(华盛顿大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI
AI总结 通过多种提示设计、输入上下文操作、推理和输出形式,研究自回归大语言模型是否具有一致且可表达的事件参数主题适配性知识,并在基准测试上取得新最优结果。
Comments Significant update with massive changes: all experiments rerun with current LLMs; includes new probability estimate analysis and expanded results in Sections 4 and 5. The paper has been accepted to CoNLL-2026
UCCI:用于成本最优LLM级联路由的校准不确定性
机构 * Independent Researcher(独立研究者)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.LG
AI总结 本文提出UCCI,一种以校准为核心的路由方法,通过异质回归将token层面的边际不确定性映射到查询级误差概率,并通过约束成本最小化选择升级阈值。在三个显式假设下,阈值策略在校准分数上是成本最优的,异质校准在期望校准误差(ECE)上实现O(n^{-1/3})的样本复杂度。在75000个生产命名实体识别工作负载上,UCCI将推理成本降低了31%(95%CI:[27%, 35%]),同时将ECE从0.12降低到0.03。
Comments 9 pages, 2 figures, 4 tables. Code: https://github.com/varunkotte6/ucci
校准后再行动:在大语言模型代理中考虑成本的探索
机构 * New York University(纽约大学)
专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.CL、cs.AI
AI总结 本文提出Calibrate-Then-Act框架,使LLM代理在不确定环境下显式平衡成本与不确定性,从而更优地决策。
不依赖特定大语言模型的语义表示攻击
机构 * JC STEM Lab of Machine Learning and Computer Vision(机器学习与计算机视觉的JC STEM实验室) ; Hong Kong Jockey Club Charities Trust(香港赛马会慈善信托基金) ; Global STEM Professorship Scheme of the Hong Kong Special Administrative Region (SAR)(香港特别行政区(SAR)的全球STEM教授计划) ; National Natural Science Foundation of China(中国国家自然科学基金委员会) ; Northwestern Polytechnical University(西北工业大学) ; The Hong Kong Polytechnic University(香港理工大学) ; School of Electronics and Information(电子与信息学院) ; Department of Electrical and Electronic Engineering(电气与电子工程系) ; Hong Kong Institute of AI for Science(香港人工智能科学研究院) ; City University of Hong Kong(香港城市大学)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出语义表示攻击(SRA),通过重新定义对抗目标从精确文本到恶意语义,解决传统方法的收敛性、提示自然性和跨模型泛化问题,实现99.71%的攻击成功率。
Comments arXiv admin note: substantial text overlap with arXiv:2509.19360
引导的LLM激活不是满射的
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);prompting(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨了激活引导是否能通过文本提示实现,证明引导行为在实际中无法通过提示复现,区分了白盒引导与黑盒提示的差异。
Comments 10 pages main text. ICLR 2026 Workshops (Sci4DL, Re-Align)
Pref-CTRL: 基于偏好的大语言模型对齐方法使用表征编辑
机构 * University of Technology Sydney(悉尼科技大学)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Pref-CTRL,一种基于偏好的训练框架,通过多目标价值函数改进偏好数据结构,优于RE-Control并在跨领域数据集上表现更佳。
Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)
通过统一领域表示和双向logit蒸馏和谐多目标大语言模型去学习
机构 * George Mason University(乔治·马歇尔大学) ; Michigan State University(密歇根州立大学)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种多目标去学习框架,通过统一领域表示和双向logit蒸馏,解决去学习中的多个目标,包括去除不良知识、保持通用效用、避免对邻近概念的过度拒绝以及确保对抗性探测攻击的鲁棒性。
探测基于谎言探测器方法对大语言模型欺骗的极限
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文通过实验揭示大语言模型可通过非虚假陈述欺骗,挑战了传统谎言探测器方法的假设,并提出改进方向。
利用元数据和幻觉信号预测牙科修复学中大语言模型的正确性
机构 * 1 Department of Data Science, Monash University Indonesia, Tangerang, Indonesia ; 2 Independent Researcher ; 3 Department of Prosthodontics, University of Pittsburgh, Pittsburgh, Pennsylvania ; 4 Department of Restorative Sciences, University of North Carolina Adams School of Dentistry, Chapel Hill, North Carolina ; 5 Department of Computer Science, Boston University, Boston, Massachusetts
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文研究通过元数据和幻觉信号预测牙科修复学中LLM的正确性,发现元数据方法可提升准确性,但需进一步改进以适应高风险应用。
Comments Accepted as a Short Paper at HEALTHINF2026
机构 * Thoughtworks
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)
机构 * Imperial College London(帝国理工学院伦敦分校) ; J.P. Morgan AI Research(摩根大通人工智能研究) ; King’s College London(国王学院伦敦分校)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Comments Accepted at NeurIPS 2025. Camera-ready version
机构 * Budapest University of Technology and Economics(布达佩斯技术与经济大学)
专题命中 知识编辑与模型理解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)
Comments NeurIPS Workshop on Attributing Model Behavior at Scale (ATTRIB 2024)
专题命中 知识编辑与模型理解 :foundation model(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)