arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 27 篇

2608.16002 2026-08-18 cs.CL cs.AI 新提交 90%

From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

从序列到结构:面向大语言模型智能体的关系型不确定性传播

Zhengzhao Ma. Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15400 2026-08-18 cs.AI cs.MA 新提交 89%

Implementation of a Metacognition Framework for Self-Awareness and Self-Regulation in Ensembles of LLMs

面向大语言模型(LLM)集合的自我意识与自我调节元认知框架的实现

Charles Courchaine, Ricky J. Sethi, Hefei Qiu

机构 * Fitchburg State University(菲奇堡州立大学) National University(美国国立大学) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次实现面向LLM集合的元认知框架,通过MSV量化自我意识,基于查询复杂度切换系统1/2处理,分配专门角色,经PoC演示证明其可行性。

Comments 5 pages, 5 figures. Charles Courchaine and Ricky J. Sethi contributed equally. Demo and code: this https URL (https://research.sethi.org/metacognition/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14896 2026-08-18 cs.CL cs.LG 新提交 88%

Interpretable Cross-Lingual Alignment in Small Language Models: Probing Cultural and Pragmatic Reasoning in Japanese-English Bilingual LLMs

小语言模型中的可解释跨语言对齐:探究日英双语大语言模型的文化与语用推理

Florian Braun

机构 * Sakaguchi–Inui Laboratory (Tohoku University)(东北大学坂口–乾实验室) Natural Language Understanding Team at RIKEN AIP(理化学研究所先进智能项目中心自然语言理解团队) Swallow Project at the Institute of Science Tokyo(东京科学大学Swallow项目) Sakana AI Tohoku University(东北大学) RIKEN AIP(理化学研究所先进智能项目中心) Institute of Science Tokyo(东京科学大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);small language model(title);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究构建J-PragEval-v0基准,结合线性探针与教师强制评估探究TinySwallow-1.5B的日英语用表征,提出语用表征引导方法,下一步将扩展至Llama-3.1-Swallow-8B。

Comments 15 pages, no figures. Introduces the J-PragEval-v0 minimal-pair benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14588 2026-08-18 cs.AI cs.CL cs.MA 新提交 88%

The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines

幻觉滚雪球:将多智能体大语言模型流水线中的错误传播建模为状态转移

Prabhjot Singh, Bhushan Pawar

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 该研究发现多智能体LLM流水线中存在幻觉滚雪球效应,即幻觉会随状态转移而逃逸,且边界门控验证比末端检查更能有效降低幻觉存活率,还提出了最优验证资源分配策略。

Comments 10 pages, 3 figures; accepted at the FAGEN Workshop (Failure Modes in Agentic AI), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14653 2026-08-18 cs.LG cs.AI 新提交 87%

Do Uncertainty Signals Help? A Systematic Study of Uncertainty-Aware Decoding with Rollback Mechanisms

不确定信号是否有用?对带有回滚机制的不确定感知解码的系统研究

Xianzong Wu, Xiaohong Li, Yuejun Guo, Xinyang Liu, Tianlin Li, Junjie Wang, Qiang Hu

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过系统研究带有回滚机制的不确定感知解码,发现其可提升代码LLM的生成性能,其中token熵等信息论不确定信号效果最优,反馈引导的回滚是主要改进来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07195 2026-08-18 cs.CL cs.AI 版本更新 87%

Adapting LLMs to Time Series Forecasting via Temporal Heterogeneity Modeling and Representation Alignment

通过时间异质性建模与表示对齐将大语言模型(LLMs)适配到时间序列预测任务

Yanru Sun, Emadeldeen Eldele, Zongxia Xie, Yucheng Wang, Wenzhe Niu, Qinghua Hu, Chee Keong Kwoh, Min Wu

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出TALON框架,通过异构时间编码器建模时间异质性、表示对齐模块弥合模态差距,在7个真实世界基准上较SOTA方法平均MSE提升最高11%,实现高效且高性能的LLM时间序列预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14632 2026-08-18 cs.CL cs.AI 新提交 86%

DeMTS: Denoising Trajectories as Multivariate Time Series for Hallucination Detection in Diffusion Language Models

DeMTS:将去噪轨迹作为多元时间序列用于扩散语言模型的幻觉检测

Xin Zhang, Yili Wang, Yue Tan, Xin He, Yanyu Qian, Yixin Liu, Yi Chang, Shirui Pan, Xin Wang

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有D-LLMs幻觉检测方法压缩轨迹丢失关键信息的问题,提出DeMTS框架,将去噪轨迹作为多元时间序列,实验显示其性能优于现有方法且兼具鲁棒性、效率与迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16657 2026-08-18 cs.CY 新提交 86%

The ultimate carbon cost of a ChatGPT query

一次ChatGPT查询的最终碳成本

Paul Kron

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究结合多领域成果,估算ChatGPT类LLM单次查询最终碳成本约0.4美元、对应10gCO₂eq,引入QCC概念以凸显AI对地球健康的影响,为相关研究提供方向。

Comments 5 pages,0 figures. Accepted at the 2nd International Workshop on Low Carbon Computing (LOCO 2026), Lancaster University, United Kingdom, 10-11 September 2026. Part of the LOCO 2026 proceedings, arXiv:LOCO2026/P15

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14707 2026-08-18 cs.AI 新提交 81%

Semantic Uncertainty-Guided Orchestration in Hierarchical Multi-Agent Systems

分层多智能体系统中基于语义不确定性的协调策略

John Knowlton, Aritra Guha, Risto Miikkulainen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AT&T Chief Data Office(AT&T首席数据办公室) Cognizant AI Lab(高知特人工智能实验室)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出HASSUM框架,利用语义熵和密度估计不确定性实现多智能体自适应协调,在StrategyQA等基准上验证其可提升复杂推理任务的可靠性。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14819 2026-08-18 cs.SD cs.LG eess.AS 新提交 79%

What Makes a Good Layer? Assessing the Layer-Wise Intrinsic Properties of Music Foundation Models

什么构成了好的层?评估音乐基础模型的逐层固有属性

Angelos-Nikolaos Kanatas, Yuexuan Kong, Pablo Alonso-Jiménez, Xavier Serra, Dmitry Bogdanov

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究分析12个音乐基础模型的逐层固有属性,发现现有指标无法通用追踪所有音乐任务的层质量,提出音高转置等变度指标,该指标可有效用于层选择,性能优于可训练多层融合方法,尤其在数据有限场景

Comments 11 pages, 2 figures, 2 tables. Accepted at ISMIR 2026. Project page: this https URL (https://angeloskanatas.github.io/music-fms-layer-eval/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03982 2026-08-18 cs.CL 版本更新 79%

Language Models Compare Quantities Using Number-specific and Unit-specific Heuristics

语言模型使用数字特定和单位特定启发式比较数量

Mutsumi Sasaki, Go kamoda, Ryosuke Takahashi, Kosuke Sato, Kentaro Inui, Keisuke Sakaguchi, Benjamin Heinzerling

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过控制实验发现,语言模型在比较带单位的数量时,并非进行精确的尺度转换,而是依赖数字差异和单位尺度差异的启发式策略,导致在比较边界附近系统性错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16353 2026-08-18 cs.CL cs.AI 新提交 73%

HalluTracer: Hallucination Detection via Depth-Averaging Truth Signals

HalluTracer:基于深度平均真值信号的幻觉检测方法

Zhihao Guo, Zonghan Wu, Huan Huo, DaYong Ye, Junwei Zhang, Weiran Yao, Zhiwei Liu, Qingsong Wen, Yilei Shao

机构 * University of Technology Sydney(悉尼科技大学) City University of Macau(澳门城市大学) Meta actAVA AI(actAVA人工智能公司) Microsoft AI(微软人工智能) Squirrel Ai Learning(松鼠人工智能学习公司) East China Normal University(华东师范大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HalluTracer是一种在模型生成答案前聚合各层真值证据的幻觉检测框架,在六个开源语言模型和五个基准上优于白盒基线,将幻觉检测转化为深度聚合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14659 2026-08-18 cs.AI cs.LG cs.SE 新提交 73%

When Uncertainty Isn't Enough: An Empirical Study of Self-Correction in Code Generation

当不确定性还不够时:代码生成中自校正的实证研究

Pranav Rakasi, Maanas Lalwani, Arnav Srivastava, Arya Palanivel, Tinuade Adeleke, Ruizhe Li, Sean Wu

机构 * University of Michigan(密歇根大学) New York University(纽约大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Algoverse AI University of Aberdeen(阿伯丁大学) University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过实证发现,针对代码生成的不确定性估计方法难以可靠提升生成准确率,仅基于验证的自校正策略可显著提升Pass@1指标,廉价不确定性估计器仅适合作为校正循环的门控信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15804 2026-08-18 cs.CL 新提交 70%

Hallucination Span Detection with Input-Side Evidence Alignment

结合输入侧证据对齐的幻觉跨度检测

Miyu Yamada, Yuki Arase

机构 * Institute of Science Tokyo(东京科学大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大型语言模型生成文本的幻觉问题,提出结合输入侧证据对齐的幻觉跨度检测任务,训练编码器模型通过预测置信度检测幻觉并对齐输入证据,实验验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15339 2026-08-18 econ.EM 新提交 67%

Learning Sequential Mobility Choice: A Review of Route and Activity Choice through Inverse Reinforcement and Imitation Learning

学习序列出行选择:基于逆强化学习与模仿学习的路径与活动选择综述

Tien Mai

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本综述构建了将交通选择建模与IRL、IL结合的统一框架,综述多种相关学习方法,提出嵌入行为约束的混合模型可提升出行选择预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15404 2026-08-18 cs.CV 新提交 67%

CBX-Bench: A Human-Aligned MLLM Council for Benchmarking Concept Bottleneck Model Explanations

CBX-Bench:用于评估概念瓶颈模型解释的人类对齐多模态大语言模型委员会

Yusuf Meric Karadag, Gulay Oklan, Seref Baris Cagliyan, Umut Ozdemir, Emre Akbas

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 该研究开发了人类对齐的多模态大语言模型(MLLM)委员会,构建了CBX-Bench基准,实现了概念瓶颈模型(CBM)解释的可扩展定量评估,其在人类偏好排名上的恢复率达70%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14617 2026-08-18 cs.LG cs.AI cs.CL 新提交 67%

Calibrated Trust, Not Sharper Prediction: An Empirical Test of Uncertainty Fusion

校准的信任,而非更精确的预测:不确定性融合的实证检验

Surya Saka

机构 * JudicialMind(司法智能公司)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对1000个欧洲人权法院案件,在Claude Opus 4.8和GPT-5.5上测试含多种不确定性工具的融合流程,发现其未提升预测准确率但可通过共形选择性预测实现案件的自动化处理与升级,核心贡献是校准的信任而非更精确的预测。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14662 2026-08-18 eess.SP cs.AI cs.LG 新提交 62%

Does the Heart Show Your Pain? Tackling the X-ITE Pain Challenge with Self-Supervised ECG Representation Learning

心脏能反映你的疼痛吗?用自监督心电表示学习应对X-ITE疼痛挑战赛

Dominika Kunc, Przemysław Kazienko, Stanisław Saganowski

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对X-ITE疼痛挑战赛,结合自监督心电表示学习与多模态预训练,分析疼痛识别中的心电信号特性,为可穿戴疼痛监测提供了基础。

Comments 5 pages, 3 Figures, 1 Table, appear in the Proceedings of the 13th International Conference on Affective Computing and Intelligent Interaction Workshops and Demos (ACIIW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15022 2026-08-18 cs.AI cs.CL 新提交 62%

Gathered, Not Admitted: How Attention Brings a Latent Variable into Verbalizable Form

聚集而非准入:注意力如何将隐变量转化为可表述形式

Parsa Mazaheri

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过实验发现语言模型不存在词工作空间理论预测的准入门,揭示了隐变量的可读形式由中层窗口内注意力介导的需求特异性聚集产生,而非门控机制。

Comments 26 pages, 9 figures, 6 tables. Code and data: this https URL (https://github.com/parsa-mz/innerj)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15239 2026-08-18 cs.LG stat.ML 新提交 57%

Learning reshapes power-law anisotropy in internal representations

学习重塑内部表征中的幂律各向异性

Asahi Nakamuta, Jun-nosuke Teramae

机构 * Graduate School of Informatics(情报学研究科) Kyoto University(京都大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 该研究通过求解线性神经网络学习动力学,揭示输入统计与任务结构的动态相互作用是幂律内部表征的形成机制,且非线性网络中存在类似指数演化规律。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15082 2026-08-18 cs.AI 新提交 57%

Beyond Thresholds: A Quality-Aware Decision Intelligence Framework for Cold Chain IoT Systems

Aashna Sofat, Balwinder Sodhi

机构 * IIT Ropar(印度理工学院罗帕尔分校)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22771 2026-08-18 cs.CV cs.AI 版本更新 57%

When Do Cheap Probes Predict Expensive Training? Probing 3D-CT Encoders for Text Generation

廉价探针预测3D-CT视觉语言模型中的昂贵训练

Renjie Liang, Zijian Xu

机构 * University of Florida(佛罗里达大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究为3D-CT视觉语言模型选编码器及压缩方案时,候选组合多难比较。提出用廉价探针替代,构建含验证门限的探测基准,比较读出头并配对探针与下游任务,早期结果显示廉价探针排序与昂贵微调一致,有望快速筛选方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10204 2026-08-18 cs.LG math.OC 版本更新 57%

Adaptive Optimization via Momentum on Variance-Normalized Gradients

通过动量优化变分归一化梯度

Francisco Patitucci, Aryan Mokhtari

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 MVN-Grad通过动量优化变分归一化梯度,在稳定性和性能上优于Adam等优化器,适用于图像分类和语言模型任务。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16669 2026-08-18 cs.CV 新提交 50%

Concept-based explanation of gene expression prediction from H&E images

基于概念的H&E图像基因表达预测解释

Amos Muench, Jonathan Thielmann, Reduan Achtibat, Maximilian Dreyer, Philip Bischoff, Caroline Forsythe, Hamidreza Parand, Thomas Walter, David Horst, Sebastian Lapuschkin, Wojciech Samek, Teresa Gabriela Krieger

机构 * Institute of Pathology – Charité Universitätsmedizin(夏里特医学院病理学研究所) Fraunhofer Heinrich-Hertz-Institute(弗劳恩霍夫海因里希·赫兹研究所) Center for Computational Biology (CBIO), Mines Paris, PSL University(巴黎矿业学院计算生物学中心(巴黎文理研究大学)) Institut Curie, PSL University(居里研究所(巴黎文理研究大学)) German Cancer Research Center (DKFZ)(德国癌症研究中心) Technological University Dublin(都柏林理工大学) Technische Universität Berlin(柏林工业大学) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本研究提出结合相关性传播与概念发现的可解释ViT框架,用于从H&E图像预测空间转录组学,可关联分子表型与组织形态,能准确预测结直肠癌相关ST特征并分层患者结局。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16110 2026-08-18 cs.CV 新提交 50%

SUGFW+: An Uncertainty-guided Feature Weighting Framework for Cold Start Active Adaptation of SAM in Medical Image Segmentation

SUGFW+: 一种用于医学图像分割中SAM的冷启动主动适应的不确定性引导特征加权框架

Xiaochuan Ma, Ning Zhu, Jia Fu, Lanfeng Zhong, Hanyu Jiang, Bin Song, Kang Li, Guotai Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Glassgow College, University of Electronic Science and Technology of China(电子科技大学格拉斯哥学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 针对医学图像分割中SAM冷启动主动适应的样本选择问题,提出SUGFW+框架,集成SAM的PFUC、PGDR模块与GSCU策略及UPFT过程,在四个公共数据集上取得CSAL任务的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15698 2026-08-18 cs.CV cs.IR 新提交 50%

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Peng Chunyi, Xu Zhipeng, Yan Yukun, Liu Zhenghao, Yu Shi, Mei Sen, Sun Yubo, Zhang Yongheng, Zhou Jie, Gu Yu, Yu Ge, Sun Maosong

机构 * Northeastern University(东北大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08590 2026-08-18 cs.CV 版本更新 50%

PRISM: Streaming Human Motion Generation with Per-Joint Latent Decomposition

PRISM:基于关节潜在分解的流式人类动作生成

Zeyu Ling, Qing Shuai, Teng Zhang, Shiyang Li, Bo Han, Changqing Zou

机构 * State Key Laboratory of CAD & CG(CAD与计算机图形学国家重点实验室) Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室) Computer Animation & Perception Group(计算机动画与感知小组)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 PRISM通过关节潜在分解和无噪声条件注入,实现了流式人类动作生成,统一了文本到动作、姿态条件生成等多种任务,达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏