arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-14 至 2026-08-14 共收录 345 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 58 篇

2608.12684 2026-08-14 cs.AR 新提交 67%

Spec-Driven Hardware Evolution via Executable Contract Refinement and Proof-Guided RTL Update

基于规约驱动的硬件演化:通过可执行契约精化与证明引导的RTL更新

Shibo Zhao, Yang Zhang, Mengxia Tao, Baoqi Zhang, Kezhi Li, Qiang Xu, Binwu Zhu, Hao Yan, Min Li

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 该研究提出以契约为核心的规约驱动硬件演化方法,将硬件演化分为四阶段,经评估可推动遗留RTL向新版本功能收敛,为硬件版本迭代提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12816 2026-08-14 math.HO cs.CY 新提交 67%

Fundamental Mathematics in the Age of AI -- The Residue, the Journey, and the Ecology

AI时代的基础数学——残基、旅程与生态

Benjamin Collas

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 该文探讨AI时代数学的残基(可计数的定理等)与产物(人类理解的旅程)的区别,指出AI暴露了残基与产物的混淆,提出需关注核查AI主张、资助滋养共享理解的旅程等制度问题。

Comments 17 pages, 2 figures, 2 tables. Companion paper to Parmy Olson's "Math's AI Crisis Has a Lesson For the Rest of Us" (Bloomberg, Aug. 13, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11644 2026-08-14 cs.DB 版本更新 67%

Guided Table Retrieval for Structured Data Search

面向结构化数据搜索的引导式表格检索

Alekh Jindal, Jyoti Pandey, Christina Pavlopoulou, Ronith PR, Sharath Prakash, Shi Qiao, Shivani Tripathi, Wangda Zhang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 该研究针对结构化数据库自然语言问答任务,提出四阶段引导式表格检索流程,在BIRD-DEV和BEAVER基准上取得优于基线的准确率与F1值,生成的精确连接树可直接供下游查询编译器使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11393 2026-08-14 cs.CV 版本更新 67%

The N-Body Problem: Parallel Execution from Single-Person Egocentric Video

N体问题:从单人物体中心视频进行并行执行

Zhifan Zhu, Yifei Huang, Yoichi Sato, Dima Damen

机构 * University of Bristol(布里斯托尔大学) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract)

AI总结 提出N体问题,从单人物体中心视频预测N人并行执行任务,通过结构化提示策略引导视觉语言模型推理3D环境、物体使用和时间依赖,在EPIC-Kitchens和HD-EPIC数据集上显著提升动作覆盖率并降低冲突。

Comments accepted at ECCV Workshop, project webpage: https://zhifanzhu.github.io/ego-nbody

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13558 2026-08-14 cs.AI cs.CL 新提交 62%

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

OmniScientist:一种全模态全学科的AI科学家

Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出全模态AI科学家OmniScientist,通过端到端全模态流水线处理多学科异构原始证据,在36个真实案例中完成从原始数据到手稿的全流程,性能优于仅用预计算特征的系统,为通用AI科学家提供可行方案。

Comments 30 pages, 13 figures, 19 tables. Project page: https://omni-scientist.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13200 2026-08-14 cs.CL cs.AI cs.IR 新提交 62%

GEM: A Generative Embedding Model Bridging Reasoning and Retrieval

GEM:一种连接推理与检索的生成式嵌入模型

Zhili Shen, Craig Macdonald

机构 * University of Glasgow(格拉斯哥大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对传统检索器表层匹配导致的需求解读差距问题,提出生成式嵌入模型GEM,将推理与检索统一,在相关任务上性能优于基线,还可通过提示扩展测试时计算提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12331 2026-08-14 cs.CL cs.AI 新提交 62%

Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching

基于自适应注意力匹配的思维感知KV缓存压缩方法用于推理

Yang Liu, Bin Chong, Chongyang Zhang, Hao Zheng, Jiayu Liang, Xu Kefu

机构 * Tsinghua University(清华大学) Peking University(北京大学) Soochow University(苏州大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对推理语言模型 KV 缓存的内存瓶颈问题,提出思维感知注意力匹配(TAM)方法,通过三种机制实现高效压缩,在降低内存占用的同时保持了推理准确率。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16504 2026-08-14 cs.CL cs.AI 62%

LOGICAL-COMMONSENSEQA: A Benchmark for Logical Commonsense Reasoning

逻辑常识问答:逻辑常识推理的基准测试

Obed Junias, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LOGICAL-COMMONSENSEQA基准,通过逻辑运算符评估常识推理,发现模型在否定类问题上表现下降,揭示了推理局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12898 2026-08-14 cs.CV cs.AI 新提交 57%

NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航

Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang, Meng Tong, Zhongjiang He, Hao Sun

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12344 2026-08-14 cs.CL cs.CY stat.AP 新提交 57%

Predicting consumer-technology ownership without a diffusion history

基于扩散历史预测消费技术拥有情况

Irina Vartanova, Niels Selling, Jennifer Viberg Johansson, Pontus Strimling

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 该研究利用人类及Anthropic Claude Opus 4.7、OpenAI GPT-5.5两款语言模型对消费技术的属性评分,通过符号约束惩罚回归预测技术拥有率,其效果优于上市年限基准模型,还对2025-2026年新品做了2027年拥有率预测。

Comments 31 pages, 4 figures, supplementary material included (Tables S1-S6, Figure S1), data and code at https://osf.io/dr5ct

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08567 2026-08-14 cs.LG 版本更新 57%

Neural Message Passing on Structural Interaction Graphs for Fully-Inductive Graph Neural Networks

面向全归纳图神经网络的结构交互图上的神经消息传递

Omer Yom-Tov, Avigdor Gal

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 该研究提出SIGIL框架,通过结构交互图和关系消息传递网络实现图特征的统一表示,可用于全归纳链接预测,还能统一多种图基础模型设计范式。

Comments 7 pages, 1 figure in the main body. 12 pages, 5 figures in appendix. Submitted to AAAI 2027 (main track) and currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20017 2026-08-14 cs.CL 版本更新 57%

QUIETT: Query-Independent Table Transformation for Robust Reasoning

QUIETT:查询无关的表格转换以实现稳健的推理

Gaurav Najpande, Tampu Ravi Kumar, Manan Roy Choudhury, Neha Valeti, Yanjie Fu, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL

AI总结 QuIeTT通过查询无关的表格转换框架,提升表格推理的可靠性和效率,实验显示在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17905 2026-08-14 cs.CL 版本更新 57%

Pandora: Leveraging Code-driven Knowledge Transfer for Unified Structured Knowledge Reasoning

Pandora:利用代码驱动的知识迁移实现统一结构化知识推理

Yongrui Chen, Junhao He, Linbo Fu, Shenyu Zhang, Rihui Jin, Xinbang Dai, Jiaqi Li, Dehai Min, Nan Hu, Yuxin Zhang, Guilin Qi, Yi Huang, Tongtong Wu

机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及交叉应用重点实验室(东南大学)) China Mobile Research(中国移动研究院) Monash University(莫纳什大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL

AI总结 本文提出Pandora框架,采用Python的Pandas API构建统一知识表示,结合代码驱动的知识迁移,在六个基准测试中优于现有统一推理框架。

Comments Accepted in IEEE TKDE (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18550 2026-08-14 cs.SE 版本更新 50%

Semantic Drift in Bug Resolution: How Behavioral Signals Propagate from Reports to Tests and Patches

错误修复中的语义漂移:行为信号如何从报告传播到测试和补丁

Wendkûuni C. Ouédraogo, Yinghua Li, Xueqi Dang, Paweł Borsukiewicz, Liang Xiao, Lingfeng Bao, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究错误修复中行为信号跨工件传播的量化问题,核心方法是引入Desc2Fix框架,通过结构化行为锚等实现语义对齐,主要贡献是证明行为对齐可测且非相似性可比,能为测试和补丁相关工作提供可重现信号,助力多项错误修复任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21186 2026-08-14 cs.CV 版本更新 50%

Spa3R: Predictive Spatial Field Modeling for 3D Visual Reasoning

Spa3R:用于3D视觉推理的预测空间场建模

Haoyi Jiang, Liu Liu, Xinjie Wang, Yonghao He, Wei Sui, Zhizhong Su, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics D-Robotics Intern at D-Robotics(D-Robotics 实习生)

专题命中 推理与问题求解 :language model(abstract)

AI总结 Spa3R通过自监督学习从多视角图像中提取统一的空间表示,提升3D视觉推理能力,实现与VLMs的结合,达到3D VQA任务的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 86 篇

2608.12391 2026-08-14 cs.CL cs.AI cs.LG 新提交 92%

Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models

面向大语言模型复杂图推理的统一多维度基准

Fali Wang, Ali Al-Lawati, Iliyas Bektas, Jinxuan Fang, Alek Melenski, Tianxiang Zhao, Yao Ma, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有图推理基准的局限,提出半自动框架构建含202个任务的统一多维度基准,评估LLM在不同推理模式下的表现,揭示模型局限并提供实证指导。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12368 2026-08-14 cs.AI 新提交 92%

Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments

一致性并非对齐:人类与大语言模型(LLM)伦理判断中的道德依据分歧

Octavian M. Machidon, Alina L. Machidon, Vojko Strahovnik, Mateja Centa Strahovnik, Jonas Miklavčič, Marko Robnik Šikonja

机构 * University of Ljubljana(卢布尔雅那大学) Faculty of Computer and Information Science(计算机与信息科学学院) Faculty of Theology(神学院) Faculty of Arts(艺术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究以ETHICS基准的500项道德判断条目为对象,发现LLM与人类的最终伦理判断常一致,但道德依据存在系统性分歧,表明一致性不等同于对齐性,仅靠标签评估易产生误导。

Comments 9 pages, 4 figures, 3 tables. Accepted and presented at the AI Transparency Conference (AITC 2026), Nuremberg, Germany, June 5-6, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12324 2026-08-14 cs.CY cs.AI cs.CL 新提交 91%

When AI Is Your Pastor: A Benchmark for Theological Triage and Pastoral Guidance in Large Language Models

当AI成为你的牧师:大型语言模型的神学分诊与牧灵指导基准测试

Alex Chao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究推出FMG-Bench基准测试,评估LLM在基督教神学分诊与牧灵指导场景的表现,发现结构化框架可提升模型表现与鲁棒性,且该基准仅为测量工具。

Comments Full paper. Code and dataset are available at https://github.com/FideAI/fmg-bench and https://huggingface.co/datasets/FideAI/fmg-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13168 2026-08-14 cs.CL 新提交 91%

Which LLM Is Your Ideal Companion? Evaluating Emotional Companion Capabilities of LLMs Based on Adult Attachment Theory

哪种大语言模型是你理想的陪伴者?基于成人依恋理论评估大语言模型的情感陪伴能力

Junkai Zhou, Shiting Guan, Zhaoyi Zhang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究基于成人依恋理论构建情感陪伴基准ECBench,评估32个LLM的依恋倾向,探究其在多轮交互中的表现及可调整性,为情感陪伴类LLM的选择提供理论与工具支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13129 2026-08-14 cs.AI 新提交 90%

Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement

大型语言模型中的数字能力:基本局限与改进路径

Aoxin Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);pretraining(abstract)

AI总结 本研究针对LLMs在基础数值任务中的不可靠性,提出数值基础框架(NGF)并结合三大基准评估前沿模型,给出改进数值能力的部署建议与研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12343 2026-08-14 cs.CL 新提交 90%

Large Language Models Pass the History Exam But Miss the <<History>>: A Polish High School Exit Exam Matura Benchmark

大语言模型通过了历史考试却遗漏了《历史》:波兰高中毕业考试Matura基准测试

Adrian Trzoss, Kacper Dudzic, Wiktor Werner, Marcin Moskalewicz

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学) IDEAS Research Institute(IDEAS研究院) AMU Center for Artificial Intelligence(亚当·密茨凯维奇大学人工智能中心) Poznań University of Medical Sciences(波兹南医科大学) Maria Curie-Skłodowska University(玛丽·居里-斯克洛多夫斯卡大学) WSB Merito University(WSB梅里托大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 该研究针对波兰Matura历史考试评估8款LLM,发现其总分远超人类考生,但存在波兰历史得分惩罚、源内容混淆等缺陷,推出了首个基于波兰国家课程的LLM历史基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00048 2026-08-14 cs.CY cs.AI 版本更新 90%

MOSAIC: Unveiling the Moral, Social and Individual Dimensions of Large Language Models

MOSAIC:揭示大型语言模型的道德、社会和个体维度

Erica Coppolillo, Emilio Ferrara

机构 * University of Southern California(南加州大学) University of Calabria and ICAR-CNR(卡利亚里大学和ICAR-CNR) Thomas Lord Department of Computer Science(托马斯·劳德计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 MOSAIC首次提出评估大型语言模型道德、社会和个体维度的综合基准测试,通过九个问卷和四个游戏全面考察伦理推理能力,揭示MFT的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13136 2026-08-14 cs.CL cs.AI cs.DB cs.MA 新提交 90%

LigBench: A Unified and Human-Aligned Benchmark for LLM-based Research Idea Generation

LigBench:面向基于大语言模型的研究创意生成的统一且符合人类偏好的基准

Chenrun Wang, Mingxuan Zhu, Tiancheng Huang, Wenjie Li, Yujie Zhang, Zichen Zhu, Zhiying Zou, Kai Yu, Lu Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新研究院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有LLM研究创意生成评估零散、缺乏统一标准的问题,提出LigBench基准及PAIR-IQ数据集,实验表明LigBench评估稳定可解释且与专家判断一致性高,PAIR-IQ训练的模型排名准确性和鲁棒性更强

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04463 2026-08-14 cs.CL 版本更新 90%

The Evaluator Is Part of the Experiment: Measuring Open-Ended LLM Conformity

评估者是实验的一部分:测量开放式大语言模型(LLM)的一致性

Alicia Guerra, Yibo Hu

机构 * Illinois Institute of Technology(伊利诺伊理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究提出实验方案测量开放式LLM一致性,发现错误同行输入会降低修订质量,评估者非中立,锚定校准必要,指出翻转率不足以完整衡量开放式一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12426 2026-08-14 cs.AI cs.CL 新提交 90%

Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction

大语言模型能遵循指令,但无法同时遵循太多:组合约束满足中的相变

Mariya I. Vasileva

机构 * Meta Superintelligence Labs(元超级智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出约束饱和评估基准,发现大语言模型在同时遵循5-6个以上指令约束时可靠性崩溃,不同类型约束的性能下降幅度存在差异,失败呈近独立的乘法累积效应。

Comments 35 pages, 7 figures, 13 tables. Reviewed in the ARR May 2026 cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12342 2026-08-14 cs.CL cs.LG 新提交 88%

Are Large Language Models Reliable Reviewers? A Benchmark for Error Detection in Financial Documents

大语言模型是可靠的评审者吗?面向金融文档错误检测的基准测试

Ying He, Zhouhong Gu, Zhecheng Hu, Yubo Zhou, Hao Shen, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao, Zhixu Li

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院) Ant Group(蚂蚁集团) School of Information and School of Smart Governance, Renmin University of China(中国人民大学信息学院与智慧治理学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文构建首个金融错误检测基准FinED-Bench,评估发现当前LLMs难胜任高复杂度金融文档错误检测任务,监督微调可提升弱模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12341 2026-08-14 cs.CL 新提交 88%

The "Knowledge-Behavior Gap" in Cultural Taboo Safety of Large Language Models

大语言模型在文化禁忌安全方面的“知识-行为差距”

Ying He, Sihang Jiang, Xingzhou Chen, Zhouhong Gu, Yiwei Gu, Minggui He, Shimin Tao, Hongxia Ma, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机与人工智能学院) Huawei(华为)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对大语言模型文化禁忌安全评估的现有基准存在不足,本文推出首个公开基准CulShield,发现先进LLMs存在“知识-行为差距”,且语言语境变化会影响其文化禁忌安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18733 2026-08-14 cs.LG 版本更新 88%

A Prior-Aware Metric for Efficiently Distinguishing Memorization from Generalization in Large Language Models

先验意识记忆:一种区分记忆与泛化在大语言模型中的高效度量标准

Trishita Tiwari, Ari Trachtenberg, G. Edward Suh

机构 * Cornell University(康奈尔大学) Boston University(波士顿大学) NVIDIA(英伟达)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出Prior-Aware Memorization,一种基于模型先验的轻量级度量标准,用于区分大语言模型中的真实记忆与统计上常见序列,揭示低频率不足以证明记忆,强调需考虑模型先验以评估数据泄露风险。

Comments COLM 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10008 2026-08-14 cs.IR cs.CL cs.LG 版本更新 88%

Do LLM Recommenders Know When They're Hallucinating? Auditing Confidence Calibration in Catalog Faithfulness

大语言模型推荐系统是否知道自己在产生幻觉?针对目录保真度的置信度校准审计

Srijith Ravikumar

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 该研究审计了四个零样本LLM推荐系统的幻觉率与置信度校准,发现其系统性置信不足,提出conformal弃权阈值效果有限,建议审计需同时报告校准与OOD率并采用锚定目录的提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18852 2026-08-14 cs.LG cs.AI cs.CL 版本更新 88%

Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择

Qinwu Xu, Zhuoheng Li, Jessie Salas

机构 * Meta AI

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏