arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-20 至 2026-08-20 共收录 298 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 20 篇

2608.18116 2026-08-20 cs.CL cs.LG 新提交 81%

You Are What You Prompt: Prompt Quality, Domain Shift, and Uncertainty in Agrifood Vision-Language Models

你即你所提示的:农业食品视觉语言模型中的提示质量、领域偏移与不确定性

Andrea Morales-Garzón, Salvador López-Joya, Miguel López-Pérez, Maria J. Martin-Bautista

机构 * University of Granada(格拉纳达大学)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对农业食品领域,评估了零样本提示集成(ZPE)在分布内与分布外场景的表现,提出PID方法提升严重领域偏移下的故障检测能力,验证了领域特定提示池的优势。

Comments Accepted in the journal Procesamiento del Lenguaje Natural (SEPLN2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18086 2026-08-20 cs.AI cs.LG 新提交 81%

Position: Current Model Cards Are Insufficient for Downstream Governance of Open-Weight Foundation Models

立场:当前模型卡片不足以支持开放权重基础模型的下游治理

Sungwon Chae, Keonwoo Kim, Hoki Kim, Jaeyeon Ju, Sangchul Park

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文分析Hugging Face的500份模型卡片,指出现有模型卡片无法支持开放权重基础模型下游治理,提出需整合模型卡片、可接受使用政策、许可证的多层治理框架。

Comments Accepted as a position paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14870 2026-08-20 hep-ph cs.LG 版本更新 79%

Pre-Training for Simulation-Based Science: A Study on Jet Foundation Model Training Objectives

基于模拟的科学预训练:喷注基础模型训练目标研究

Ibrahim Elsharkawy, Joschka Birk, Vinicius Mikuni, Wahid Bhimji, Gregor Kasieczka, Benjamin Nachman

机构 * Department of Physics, University of Toronto and Vector Institute(物理系,多伦多大学和向量研究所) NERSC, Lawrence Berkeley National Laboratory(NERSC,伯克利国家实验室) Institut für Experimentalphysik, Universität Hamburg(实验物理研究所,汉堡大学) Nagoya University, Kobayashi-Maskawa Institute(名古屋大学,小林昭夫研究所) Department of Particle Physics and Astrophysics, Stanford University(粒子物理与天体物理系,斯坦福大学) Fundamental Physics Directorate, SLAC National Accelerator Laboratory(基础物理局,SLAC国家加速器实验室)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 本文系统比较了高能物理中基础模型的预训练方法,发现纯分类预训练在标签充足时最优,结合自监督掩码粒子建模在低标签场景下表现突出,而流匹配生成预训练对下游分类无益,但必须包含在预训练目标中才能提升生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19078 2026-08-20 cs.CV 新提交 78%

Subgroup performance analysis of adaptation strategies for chest X-ray foundation models

胸部X射线基础模型适配策略的子组性能分析

Dhruv Gupta, Emma A. M. Stanley, Fabio De Sousa Ribeiro, Sujal Desai, Ben Glocker

机构 * Imperial College London(帝国理工学院) Royal Brompton Hospital(皇家布朗普顿医院) Causality in Healthcare AI Hub(医疗保健AI因果关系中心) National Heart & Lung Institute(国家心肺研究所)

专题命中 领域大模型 :foundation model(title,abstract)

AI总结 该研究针对胸部X射线基础模型,探究三种参数高效适配技术对病理分类性能与子组公平性的影响,发现整体性能提升未必减少子组差异,公平性影响需直接按任务评估

Comments Accepted at MICCAI Workshop on Fairness of AI in Medical Imaging (FAIMI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12036 2026-08-20 cs.AI cs.CL cs.HC cs.LG cs.MA 版本更新 75%

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mechanist:作为科学仪器的AI,用于发现智能的机制

Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Heriot-Watt University(赫瑞瓦特大学) Southern University of Science and Technology(南方科技大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) Northeastern University(东北大学)

专题命中 领域大模型 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18937 2026-08-20 cs.CL cs.AI 新提交 73%

MedUAG: Unified Understanding and Generation for Medical Multimodal Models

MedUAG:面向医学多模态模型的统一理解与生成框架

Zijie Meng, Yuncheng Zhang, Hualiang Wang, Yitian Tang, Xiaotang Gai, Chen Shen, Songtao Jiang, Shaosheng Cao, Jian Wu, Xian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Tencent Jarvis Lab(腾讯Jarvis实验室)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对医学多模态领域缺乏统一理解生成框架的问题,本文构建了MedUAGCorpus数据集与MedUAGBench基准,开发了MedUAG模型,其在医学理解与生成任务中表现出色,为下一代医学多模态系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18565 2026-08-20 cs.SE 新提交 67%

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation

SemaPLC:一种基于项目、经验证门控的PLC代码生成智能体框架

Yanlun Tu, Huacan Wang, Ziyue Zhou, Jie Zhou, Ningyan Zhu, Ge Chen, Wangyi Chen, Tengfei Zhou, Yifan Zhou, Dasheng Yang, Xiaofeng Mou, Hui Zhang, Yi Xu

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 SemaPLC是基于项目、经验证门控的PLC代码生成智能体框架,通过外部检查确认任务完成,在多模型的POU任务及项目上下文任务中均表现最优,动态行为测试得分显著高于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24834 2026-08-20 q-bio.NC cs.AI cs.ET cs.LG 版本更新 62%

Cross-Cohort Spectral-Temporal Dissociation in Frozen EEG Foundation-Model Representations

脑电图基础模型对长程时间相关性视而不见:其跨群体脆弱性背后的频谱-时间解离

Marzieh Zare

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨脑电图基础模型对长程时间相关性的表征及跨群体转移情况。通过探测五种模型,发现它们均未按时间顺序表示LRTC,频谱输入模型能恢复1/f但非DFA,跨群体转移方面各模型表现不一,揭示了模型在这方面的局限性。

Comments I found a computational error in one of the tables that needs to be fixed; and it may take 2-3 weeks

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18099 2026-08-20 cs.AI q-fin.PM 新提交 57%

FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management

FinSkillBench:评估用于投资管理的智能体AI与领域技能

Jermyn Zhen Yong Bek, Zhuang Qiang Bok, Zhongtian Sun

机构 * Deep Insight Labs(深洞察实验室) University of Kent(肯特大学) University of Cambridge(剑桥大学)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 FinSkillBench是评估投资管理领域AI智能体金融技能的基准,经9个模型的大规模评估发现,精选技能可显著提升性能,而自生成技能益处有限,其成果为该领域研究提供了支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07985 2026-08-20 cs.CL cs.IR 版本更新 57%

Predicting the Benefit of Retrieval Augmentation in Open-Domain Question Answering

基于问答的RAG性能预测

Or Dado, David Carmel, Oren Kurland

机构 * Technion(技术学院) Technology Innovation Institute (TII)(技术创新研究所)

专题命中 领域大模型 :LLM(abstract);分类 cs.CL

AI总结 本文研究了RAG在问答中的性能预测,提出了一种新的监督预测器,通过建模问题、检索段落和生成答案之间的语义关系,提升了预测效果。

Comments 17 pages. 4 figures. 3 tables

Journal ref Proceedings of the 35th ACM International Conference on Information and Knowledge Management 2026, (CIKM 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14473 2026-08-20 cs.CL 版本更新 57%

AI Can Learn Scientific Taste

AI 可以学习科学品味

Jingqi Tong, Mingzhe Li, Hangcheng Li, Yongzhuo Yang, Yurong Mou, Weijie Ma, Hongji Chen, Xiaoran Liu, Qinyuan Cheng, Ming Zhang, Qiguang Chen, Weifeng Ge, Qipeng Guo, Tianlei Ying, Tianxiang Sun, Yining Zheng, Zhiheng Xi, Xinchi Chen, Jun Zhao, Ning Ding, Xuanjing Huang, Yu-Gang Jiang, Xipeng Qiu

专题命中 领域大模型 :LLM(abstract);分类 cs.CL

AI总结 本文提出RLCF框架,通过社区反馈学习科学品味,使AI能提出高潜力研究想法,实验显示其优于现有模型并具备泛化能力。

Comments 47 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18166 2026-08-20 eess.IV cs.CV 新提交 50%

TractoGraphVLM: A Unified Vision-Language Framework for White Matter Tractography

TractoGraphVLM:用于白质纤维束成像的统一视觉-语言框架

Gurucharan Marthi Krishna Kumar, Janine Dale Mendola, Amir Shmuel

专题命中 领域大模型 :language model(abstract)

AI总结 TractoGraphVLM是统一视觉-语言框架,可完成白质纤维束的分类、检索、描述、问答四项任务,在HCP数据集上表现良好,具跨年龄迁移鲁棒性,仅从语言学习神经解剖学知识。

Comments Accepted as a Spotlight at the ECCV 2026 Workshop on Artificial Intelligence for Medical 3D Vision (AI4M3D). Our codebase, including all training and evaluation pipelines, is publicly available at https://github.com/AS-Lab/Marthi-et-al-2026-TractoGraphVLM-Unified-Vision-Language-White-Matter-Tractography

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18637 2026-08-20 cs.IR 新提交 50%

PILOT Technical Report

PILOT技术报告

Jiuning Lin, Ruiquan Lan, Xiaodong Zhu, Bin Zhang, Chengyu Lai, Chuxin Chen, Dimin Wang, Hongtao Cheng, Jialin Zhu, Lingqing Zhang, Shuai Zhong, Tao Wang, Weipeng Huang, Yinjiang Cai, Yinnan Song, Yuan Liu, Zhibo Xiao, Zhixin Ma, Zihong Huang

专题命中 领域大模型 :LLM(abstract)

AI总结 该研究针对现有推荐系统优化智能体方法的反应式缺陷,提出PILOT框架,通过三类角色构建控制循环,在淘宝平台对比ROAM验证,实现多项指标提升且搜索效率显著提高,无需人工干预。

Comments Technical Report, 42 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18479 2026-08-20 cs.CV 新提交 50%

COSTA: A Cluster-Centric Paradigm for Annotation-Free Open-Set Semantic Segmentation of Aerial Point Clouds with Domain Shifts

COSTA:面向存在域偏移的航拍点云无标注开放集语义分割的以聚类为中心范式

Yanghong Lin, Li Fang, Tianyu Li, Shudong Zhou, Wei Yao

机构 * Fujian Institute of Research on the Structure of Matter, Chinese Academy of Sciences(中国科学院福建物质结构研究所) Institute of Urban Environment, Chinese Academy of Sciences(中国科学院城市环境研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Resource and Environmental Sciences, Wuhan University(武汉大学资源与环境科学学院)

专题命中 领域大模型 :language model(abstract)

AI总结 COSTA提出以聚类为中心的范式,无需额外训练即可在推理阶段将预训练航拍点云分割模型适配到偏移目标域,在三个基准上实现按需分割,mIoU达70.09%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 21 篇

2606.00919 2026-08-20 cs.CL cs.LG 版本更新 91%

Towards Lightweight Reliability: Using Soft Prompts for Hallucination Mitigation in Large Language Models

迈向轻量级可靠性:使用软提示缓解大型语言模型中的幻觉

S M Tahmid Siddiqui, Akib Jawad Ononto, Anoop Singhal, Latifur Khan

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) National Institute of Standards and Technology(国家标准与技术研究院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 提出一种参数高效的软提示方法RCSP,通过对比学习、课程学习和KL正则化平衡事实回忆、幻觉抑制和弃权,在多个QA数据集上优于基线。

Comments 20 pages, 5 tables, 2 figures. Accepted for publication in DBSec 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16002 2026-08-20 cs.CL cs.AI 版本更新 90%

From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents

从序列到结构:面向大语言模型智能体的关系型不确定性传播

Zhengzhao Ma, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10476 2026-08-20 cs.CL cs.LG 版本更新 90%

Hallucination Detection in Large Language Models Using Diversion Decoding

使用转移解码检测大语言模型中的幻觉

Basel Abdeen, S M Tahmid Siddiqui, Meah Tahmeed Ahmed, Anoop Singhal, Latifur Khan, Punya Parag Modi, Ehab Al-Shaer

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) National Institute of Standards and Technology(美国国家标准与技术研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型中的幻觉检测问题,提出转移解码新方法,通过在解码阶段挑战模型响应提取特征,训练机器学习模型度量不确定性,该方法计算复杂度低,优于现有方法。

Journal ref Data and Applications Security and Privacy XXXIX. DBSec 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19124 2026-08-20 cs.CL cs.AI 新提交 88%

Intercepting the Kangaroo: Experimental Astrolinguistics with Constructed Lexicons, Active Probing, and Large Language Models as Informants and Hypothesis Proposers

拦截“袋鼠”:基于人工词汇、主动探测及大型语言模型作为信息提供者与假设提出者的实验天体语言学

Francesco Cordella, Mauro Cappelli

机构 * ENEA(意大利国家新技术、能源与经济可持续发展局)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 该研究将天体语言学从推测变为实验,通过含不兼容人工词汇的语言模型、脚本协调器及结合多策略的协议,成功拦截翻译不确定性的“袋鼠效应”,提升覆盖度与正确性,还能恢复假设空间外的词语。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07625 2026-08-20 cs.AR cs.MA 版本更新 88%

HINT: Toward an Executable Hardware-Intent Representation Layer for LLM-Driven RTL Generation

HINT:面向大语言模型驱动的RTL生成的可执行硬件意图表示层

Tairan Cheng, Yi Liu, Dongsheng Zuo, Zhengyuan Shi, Hongji Zhang, Xiangfei Hu, Maoshuo He, Hao Yan, Qiang Xu

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HINT可执行硬件意图表示层,用于LLM驱动的RTL生成,在7个算子案例中全量生成合规可综合RTL,面积较人工实现及直接C2RTL结果显著降低,还验证了其在各类复杂设计中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07941 2026-08-20 cs.CR 版本更新 86%

Collective Hallucination in Multi-Agent LLMs:Modeling and Defense

多智能体大语言模型中的集体幻觉:建模与防御

Saeid Jamshidi

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种系统级模型描述多智能体LLM中幻觉的传播与放大,并设计交互感知控制方法,通过置信加权聚合、自适应影响调节、外部验证和隔离不可靠智能体来抑制错误传播,在TruthfulQA和TriviaQA上使幻觉降低39%,事实准确率提升至0.87。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17574 2026-08-20 cs.AI cs.SY eess.SY 交叉投稿 81%

Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making

演化不确定性下的风险量化:面向安全序贯决策的信念依赖鲁棒性

Deep Kumar Ganguly, Jan Kretinsky

机构 * Technical University of Munich(慕尼黑工业大学) Masaryk University(马萨里克大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出RATTL算法,将智能体谨慎程度与认知不确定性绑定,证明其规划问题适定且满足安全三明治性质,可保障LLM等智能体在不确定性下的运行时安全。

Comments Accepted for presentation at the IJCAI-ECAI 2026 RobustifAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01367 2026-08-20 cs.CL stat.ML 版本更新 81%

MMD-Flagger: Leveraging Maximum Mean Discrepancy to Detect Hallucinations

MMD-Flagger:利用最大均值差异检测幻觉

Kensuke Mitsuzawa, Damien Garreau

机构 * Université Côte d’Azur, CNRS, LJAD, France(法国埃克塞特大学、法国国家科学研究中心、LJAD研究所) Center for Artificial Intelligence and Data Science (CAIDAS)(人工智能与数据科学中心) Julius-Maximilans-Universität Würzburg, Germany(德国维尔茨堡约利乌斯-马克斯米利安大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对智能体AI系统中大型语言模型的幻觉问题,提出基于最大均值差异(MMD)的MMD-Flagger方法,通过监控不同解码温度下的输出轨迹检测幻觉,在MUCH基准上用Llama-3、Gemma-3模型完成评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18709 2026-08-20 cs.CV cs.AI cs.LG 新提交 81%

A Critical Synthesis of Uncertainty Quantification and Foundation Models for Semantic Segmentation

语义分割中不确定性量化与基础模型的批判性综合研究

Steven Landgraf, Joceline Hinz, Markus Ulrich

机构 * Institute of Photogrammetry and Remote Sensing (IPF), Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院摄影测量与遥感研究所)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统评估四类不确定性量化方法在语义分割基础模型上的表现,揭示预测性能、可靠性与计算成本间的权衡,为现实应用需联合优化相关指标指明方向。

Comments Accepted for publication in the ISPRS Annals (ISPRS Congress 2026, Toronto, Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10882 2026-08-20 cs.SE 版本更新 80%

From Quality Properties to Practice: A Guideline and Workflow for Explainability Requirements

从质量属性到实践:可解释性需求的指南与工作流

Martin Obaidi, Jakob Droste, Hannah Deters, Marc Herrmann, Michel Krahl, Kurt Schneider

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一个基于指南的迭代工作流,通过结构化文献综述、开发者访谈和从业者调查提炼出十个核心质量属性,并开发工具支持,实验表明工具辅助可减少23.5%的制定时间且需求质量与手动编写相当。

Comments This paper has been accepted at the research track of the 34th IEEE International Requirements Engineering Conference (RE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18984 2026-08-20 cs.CV 新提交 78%

Uncertainty-Aware Art-Historical Dating with Vision-Language Models

基于视觉语言模型的不确定性感知艺术史年代测定

Stefanie Schneider, Peter Bell

机构 * Marburg University(马尔堡大学)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 该研究针对艺术品年代测定中的时间纠缠问题,将其转化为不确定性感知回归任务,通过在Wikidata艺术品语料库上实验发现视觉语言模型(VLMs)在该任务上优于纯视觉自监督基线,但存在偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18419 2026-08-20 cs.LG cs.AI 新提交 73%

Mechanistic Interpretability of Structure-Aware Numerical Reasoning in LLaMA 3.1 8B

LLaMA 3.1 8B中结构感知数值推理的机制可解释性

Rahul Chowdhury, Timothy A Rupprecht, Senhao Cao, Jiahao Liu, Octavia Camps, David Bau, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc.(EmbodyX公司)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究从机制可解释性视角探究LLaMA 3.1 8B,通过构建需捕捉结构的数值序列任务,发现其可无监督计算存储一阶差分,还揭示其通过类诱导回路机制完成数值推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18106 2026-08-20 cs.CL cs.AI 新提交 73%

Different Facets of Verbalised Overconfidence: an Interpretability Study

言语化过度自信的不同方面:一项可解释性研究

Davide Mazzaccara, Leonardo Bertolazzi, Raffaella Bernardi

机构 * CIMeC, University of Trento(特伦托大学认知科学与技术跨学科研究中心) DISI, University of Trento(特伦托大学信息工程与计算机科学系) Free University of Bozen-Bolzano(波尔扎诺自由大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究以Qwen3-4B为对象,探究大型语言模型的过度自信现象,通过识别转码器特征揭示其默认机制偏向确定性生成,干预不确定性特征可缓解过度自信错误,且相关特征具有跨场景泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18265 2026-08-20 econ.TH cs.AI 新提交 70%

How AI Prompts Can Teach Us About the Structure of Human Behavior

AI提示词如何能帮助我们理解人类行为的结构

Matthew O. Jackson, Benjamin S. Manning, Yutong Xie, Walter Yuan, Qiaozhu Mei

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种基于大语言模型的AI方法,通过调整类型向量匹配人类选择,发现人类行为可由风险厌恶、策略复杂度、信任三个维度近似,能预测不同游戏行为,为行为科学提供简约理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18115 2026-08-20 cs.CL cs.AI cs.LG 新提交 67%

Temporal Multi-Signal Fusion for Token-Level Hallucination Detection

面向 token 级幻觉检测的多信号时序融合

Igor Itkin

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种融合多信号的时序方法,通过 BiGRU 序列标注检测 token 级幻觉,在 RAGTruth 上较基线提升 11 个百分点,适用于闭源模型且泛化性良好。

Comments 17 pages, 14 figures, 23 tables. Code: https://github.com/YehudaItkin/temporal-hallucination-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11290 2026-08-20 math.CO 版本更新 67%

Solutions to Five Challenge Problems in Enumerative and Algorithmic Combinatorics, with an Account of the Human-Machine Methodology Employed

形状为$[[n,n],[n,1]]$的立体标准杨表的Zeilberger递推关系的一个证明

Jaideep Sai Padhi

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文证明了Zeilberger提出的形状为$[[n,n],[n,1]]$的立体标准杨表数量满足的二阶线性递推关系,通过双射结合代数核方法完成证明并得到多项独立计数结果。

Comments 42 pages. Code, data and verification scripts at https://github.com/jaideepsaipadhi/zeilberger-challenges

详情

展开后加载摘要…

URL PDF HTML 收藏