arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2707 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2707 篇

2607.02407 2026-07-03 cs.AI cs.CV 新提交 77%

Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments

非曼哈顿环境下的文本驱动3D室内场景合成

Xianhui Meng, Zirui Song, Yuchen Zhang, Li Zhang, Yongxuan Lv, Xiuying Chen, Kun Wang, Yan Luo, Kai Chen, Hangjun Ye, Long Chen, Jun Liu, Xiaoshuai Hao

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对非曼哈顿环境中现有方法难以建模非正交空间关系导致几何违规和物理保真度低的问题,提出SPG-Layout框架,利用物体分布统计先验和层次化布局策略,实现语义真实感与物理合理性的平衡优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00052 2026-07-02 cs.IR cs.AI 新提交 77%

AGE: Adaptive-masking for Graph Embedding in Graph Retrieval-Augmented Generation

AGE:面向图检索增强生成的图嵌入自适应掩码

Bao Long Nguyen Huu, Atsushi Hashimoto

机构 * OMRON Corporation(欧姆龙公司) OMRON SINIC X Corporation(欧姆龙SINIC X公司)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出自适应掩码图嵌入方法AGE,通过类似文本编码器的Transformer结构和可学习节点采样器解决图与文本特征对齐问题,在GraphQA任务中显著提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31273 2026-07-01 cs.LG 新提交 77%

The Calibration Turn in AI-Assisted Research: A Conceptual and Methodological Framework for Evidence-Licensed Claims

AI辅助研究中的校准转向:证据许可主张的概念与方法论框架

Hongmin Li

机构 * School of Life Science and Technology, Institute of Science Tokyo(东京科学大学生命科学与技术学院) Department of Computational Biology and Medical Sciences, Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究生院计算生物学与医学科学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.LG

AI总结 提出AI辅助研究中证据许可主张的概念与方法论框架,通过五个算子描述研究过程,强调校准作为管理科学断言权的机制,并区分不同语义类型。

Comments 42 pages, 4 figures. Companion code and synthetic simulation artifacts: https://github.com/Li-Hongmin/calibration-turn-ai-assisted-research

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31209 2026-07-01 cs.AI cs.RO 新提交 77%

Long-term Traffic Simulation via Structured Autoregressive Modeling

基于结构化自回归建模的长期交通仿真

Lingyu Xiao, Zexin Feng, Xintao Yan

机构 * The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27981 2026-06-29 cs.CL 新提交 77%

ToxiREX: A Dataset on Toxic REasoning in ConteXt

ToxiREX: 上下文中的有毒推理数据集

Stefan F. Schouten, Ilia Markov, Piek Vossen

机构 * Vrije Universiteit Amsterdam(瓦赫宁海姆自由大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出ToxiREX多语言数据集,基于有毒推理模式标注Reddit评论的隐式上下文毒性,并建立基线模型评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27369 2026-06-26 cs.LG 新提交 77%

Reinforcement Learning without Ground-Truth Solutions can Improve LLMs

无需真实解即可改进大语言模型的强化学习

Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang, Xunpeng Huang, Kun Zhou, Tongtong Liang, Zhewei Yao, Yi-An Ma, Yuxiong He

机构 * University of California, San Diego(加州大学圣地亚哥分校) Snowflake AI Research

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 提出RiVER框架,通过校准的连续奖励信号,在无真实解的任务上训练LLM,在AtCoder和精确解基准上均取得提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26246 2026-06-26 cs.DL cs.AI cs.IR 新提交 77%

Lacuna: A Research Map for Machine Learning

Lacuna:机器学习研究地图

Martin Weiss, Miles Q. Li, Alejandro H. Artiles, Yacine Mkhinini, Chris Pal, Hugo Larochelle, Nasim Rahaman

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出Lacuna研究地图,利用LLM将论文转化为摘要、概念、方向和建议,在多项基准上超越OpenScholar,并评估了多阶段报告代理Lacuna Deep Research的性能。

Comments 14 pages, 3 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25622 2026-06-25 cs.CR cs.AI 新提交 77%

Probabilistic Agents in Deterministic Audits: Evaluating Multi-Agent Systems for Automated Audits Based on the German IT-Grundschutz

确定性审计中的概率性智能体:基于德国IT-Grundschutz的自动化审计多智能体系统评估

Lea Roxanne Muth, Marian Margraf

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) Freie Universität Berlin(柏林自由大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出结合混合检索增强生成的多智能体系统架构,通过假设验证循环和解耦推理流水线部分自动化IT-Grundschutz认证,实验表明在语义任务上高效但在逻辑推理阶段受限于LLM的概率性。

Comments Accepted for publication at the 2026 IEEE International Systems Conference (SysCon), Halifax, NS, Canada, April 6-9, 2026. 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22793 2026-06-23 cs.AI 新提交 77%

A Formula-Driven Survey and Research Agenda for On-Policy Distillation

基于公式驱动的在线策略蒸馏综述与研究议程

Bowen Zhang

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文提出一种公式驱动的分类法,将在线策略蒸馏(OPD)视为反馈到更新的问题,区分直接分布损失和策略梯度式对数比更新,并揭示状态兼容性、支持构建、时间信用、词汇路由等关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22442 2026-06-23 cs.AI 新提交 77%

Efficient Multimodal Clinical Question Answering for Pulmonary Embolism Risk Assessment

用于肺栓塞风险评估的高效多模态临床问答

Xiangyuan Xue, Yang Yu, Yan Gao, Junyan Wang, Bin Chen, Lingyan Ruan, Ting Dang, Hong Jia

机构 * University of Auckland(奥克兰大学) University of Cambridge(剑桥大学) University of Adelaide(阿德莱德大学) University of Melbourne(墨尔本大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本研究构建了基于INSPECT数据集的肺栓塞多模态基准,通过结构化问答任务评估高效多模态大模型在CTPA和EHR输入下的诊断与预后性能,发现Gemma4模型在结合CTPA+EHR时表现更优,且诊断任务优于预后任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20072 2026-06-19 cs.CL 新提交 77%

Source-Grounded Data Generation for Text-to-JSON Learning

基于源数据的文本到JSON学习数据生成

Sunghee Ahn, Guijin Son, Youngjae Yu

机构 * Seoul National University(首尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 提出STAGE方法,利用电子表格作为源数据,通过LLM生成报告和JSON模式,并验证真实值,显著提升文本到JSON任务的训练数据质量。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17609 2026-06-17 cs.CL 新提交 77%

The Benchmark Illusion: Pruned LLMs Can Pass Multiple Choice but Fail to Answer

基准测试幻觉:剪枝后的大语言模型能通过多项选择但无法回答问题

Rui Wen, Lu Sun, Jiayang Liu, Zesheng Xu, Tianshuo Cong, Zheng Li

机构 * Institute of Science Tokyo(东京科学大学) Tohoku University(东北大学) Nanyang Technological University(南洋理工大学) KTH Royal Institute of Technology(瑞典皇家理工学院) Shandong University(山东大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现,高稀疏度剪枝后的大语言模型在多项选择评估中表现良好,但在开放生成中无法正确回答相同问题,揭示了基准测试的盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15932 2026-06-17 cs.CL 新提交 77%

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Work completed in January 2026. Updating now

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13756 2026-06-15 cs.CL 新提交 77%

QIAS 2026: Overview of the Shared Task on Islamic Inheritance Reasoning

QIAS 2026:伊斯兰继承推理共享任务综述

Abdessalam Bouchekif, Somaya Eltanbouly, Samer Rashwani, Shahd Gaben, Mutaz Al-Khatib, Heba Sbahi, Emad Mohamed, Mohammed Ghaly

机构 * Hamad bin Khalifa University(哈马德·本·哈利法大学) Nazarbayev University(纳扎尔巴耶夫大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文介绍 QIAS 2026 共享任务,评估大语言模型在伊斯兰继承领域的复杂推理能力,基于 MAWARITH 数据集,使用 MIR-E 多步指标评估,16 支队伍参与,结果显示该任务对当前模型极具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13192 2026-06-12 cs.AI 新提交 77%

Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach

基于多模态大语言模型的移动用户体验推理:任务、基准与方法

Ruichao Mao, Zhou Fang, Teng Guo, Hao Yang, Yaping Li, Shaohua Peng, Maji Huang, Xiaoyu Lin, Shuoyang Liu, Xuepeng Li, Yuyu Zhang, Hai Rao

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。

Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12922 2026-06-12 cs.CL cs.CY 新提交 77%

Polar: A Benchmark for Evaluating Political Bias in LLMs

Polar: 评估大语言模型中政治偏见的基准

Sangho Kim, Heejin Kim, Yoonhee Park, Hyunggeun Jeon, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院) Dept. of Computer Science and Engineering, Seoul National University(首尔大学计算机科学与工程系)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Polar基准,通过选项级似然度测量大语言模型的政治偏见,覆盖美国和韩国政治语境,发现偏见随语境、议题、模型组和语言变化。

Comments Submitted to ARR 2026 May cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12620 2026-06-12 cs.SE cs.AI 新提交 77%

HybridCodeAuthorship: A Benchmark Dataset for Line-Level Code Authorship Detection

HybridCodeAuthorship:一个用于行级代码作者归属检测的基准数据集

Luke Patterson, Li Wang, Adam Faulkner

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有基准无法反映真实AI代码助手使用场景的问题,提出HybridCodeAuthorship数据集,包含交错的人类和AI编写代码行,并评估两种检测算法性能。

Comments Accepted to LREC 2026

Journal ref LREC 2026 proceedings (pp. 1520-1532)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12160 2026-06-12 cs.CL 新提交 77%

A Controlled Study of Decoding-Time Truthfulness Methods on Instruction-Tuned LLMs

指令调优大语言模型解码时真实性方法的受控研究

Ao Sun

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究通过分析每层令牌logits特征,提出CHAIR框架检测幻觉,在TruthfulQA和MMLU上显著提升零样本检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10738 2026-06-10 eess.AS cs.AI 新提交 77%

Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding

Spatial-Omni:通过FOA编码在多模态大语言模型中实现空间音频理解

Zhiyuan Zhu, Yixuan Chen, Yiwen Shao, Wenxiang Guo, Changhao Pan, Yu Zhang, Yuxiang Wang, Wei Liu, Houhua Zhang, Chengkuan Zeng, Wenbo Cheng, Yunxi Liu, Rui Yang, Steve Yves, Liefeng Bo, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Spatial-Omni,通过SO-Encoder将一阶Ambisonics空间音频注入现有全模态大语言模型,以轻量方式实现空间音频理解,并在构建的SO-Bench基准上超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10061 2026-06-10 cs.CL 新提交 77%

BenSyc: Benchmarking Conversational Sycophancy and Human Alignment in LLMs for Bengali Contexts

BenSyc: 孟加拉语上下文中大语言模型对话谄媚与人类对齐的基准测试

Kazi Noshin, Sajib Acharjee Dip, Ranat Das Prangon, Fardin Hassan Tamim, Syed Ishtiaque Ahmed, Liqing Zhang, Sharifa Sultana

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virginia Tech(弗吉尼亚理工大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) BRAC University(BRAC大学) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出BenSyc基准,基于孟加拉语社交数据构建五级标注集,评估15+模型在对话对齐分类与生成任务上的表现,发现前沿模型在区分共情与强化性认可上仍存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09826 2026-06-09 cs.CV cs.AI 新提交 77%

OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics

OmniGameArena: 一个统一的UE5基准测试,用于具有改进动态的VLM游戏智能体

Mingxian Lin, Shengju Qian, Yuqi Liu, Yi-Hua Huang, Yiyu Wang, Wei Huang, Yitang Li, Fan Zhang, Zeyu Hu, Lingting Zhu, Xin Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) LIGHTSPEED The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出OmniGameArena,一个包含12个UE5游戏的统一基准,以及改进动态曲线(IDC),通过反思机制评估VLM智能体的冷启动分数、改进动态和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08840 2026-06-09 cs.AI cs.SE 新提交 77%

Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs

超越通过率:开放代码大语言模型的多语言、执行基础评估

Sayed Erfan Arefin

机构 * Sayed Erfan Arefin

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 针对12种编程语言的2707道LeetCode问题,评估9个开放代码LLM,发现最佳模型Yi-Coder-9B-Chat的正确率仅23.64%,远低于人类57.2%的基准,且排名因问题难度和语言而异,编译错误占失败原因的63.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11694 2026-08-13 cs.CL cs.AI 新提交 76%

The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance

措辞效应:量化大语言模型基准测试性能中的双向漂移

Shailja Thakur, Sungeun An, Chad DeLuca, Hima Patel

机构 * IBM Research India(IBM印度研究院) IBM Research Almaden(IBM阿尔马登研究院)

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI

AI总结 该研究提出BenchDrift方法,通过生成基准问题的保义变体,发现大语言模型性能存在双向漂移,且漂移与重新措辞相关,模型性能提升未消除措辞敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02157 2026-08-04 cs.LG cs.AI 新提交 76%

RamanPFN: learning from Raman spectral structure with a tabular foundation model

RamanPFN:基于表格基础模型学习拉曼光谱结构

Xingyu Pan, Huan Wang, Jinjia Guo, Zhenlin Zhao, Siming Dong, Jixi Lu

机构 * Beihang University(北京航空航天大学) Cleer Science(Cleer科技公司)

专题命中 评测与基准 :foundation model(title);分类 cs.AI、cs.LG

AI总结 RamanPFN在TabPFN推理前编码拉曼光谱依赖关系,经74个公开拉曼数据集的150项任务评估,可降低回归与分类误差,是高维拉曼测量与可复用表格推理的有效接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23175 2026-07-28 cs.CL cs.AI 新提交 76%

Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining

超越全局规范:无需重新训练即可在语言模型中实现毒性敏感性个性化

Rares A. C. Diaconescu, Iulia Slanina, Alina Florea, Andrei B. Trache, Miruna E. Coroi, Anne Arzberger, Jie Yang, Enrico Liscio

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI

AI总结 研究如何在语言模型中实现毒性敏感性个性化,通过对免训练方法在三个推理阶段进行比较评估,与PRISM数据集目标对比,各方法降低对齐误差28 - 47%,揭示了多目标间权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22553 2026-07-28 cs.CL cs.AI 新提交 76%

Evaluating the Impact of Reviewer Guideline Design on LLM-Based Automated Peer Review

评估审稿人指南设计对基于大语言模型的自动同行评审的影响

Haowen Li, Yoichi Ishibashi, Masafumi Oyamada

机构 * Keio University(庆应义塾大学) NEC Corporation(日本电气公司)

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI

AI总结 研究分析不同类型审稿人指南对基于大语言模型的自动同行评审的影响,通过实验发现官方会议指南效果最佳,模仿审稿人指南较差,且严格评分标准会降低性能,强调主观和整体评分的重要性。

Comments 18 pages, 2 figures, ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22548 2026-07-28 cs.AI cs.LG cs.PF 新提交 76%

SeT-Diff: Towards Semantic Foundation Models for HPC Telemetry and Time-Series

SeT-Diff:面向高性能计算遥测和时间序列的语义基础模型

Giovanni B. Esposito, Francesco Antici, Daniele Cesarini, Andrea Bartolini

机构 * University of Bologna(博洛尼亚大学) CINECA(意大利国家科研计算中心)

专题命中 评测与基准 :foundation model(title);分类 cs.AI、cs.LG

AI总结 针对数据中心计算节点建模需求,提出SeT-Diff基础模型,采用基于扩散的方法,在真实超级计算机数据集实验中,其重建任务平均绝对误差为0.0470,有零样本排列稳定性,单个模型可有效执行多种任务,是高性能计算系统有效的数据驱动数字孪生。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20436 2026-07-24 cs.CL cs.AI cs.SE 新提交 76%

Routing Subspaces: Auditing Evaluation-to-Deployment Mismatch in Fine-Tuned Language Models

路由子空间:审计微调语言模型中评估到部署的不匹配

Phongsakon Mark Konrad, Toygar Tanyel, Serkan Ayvaz

机构 * Centre for Industrial Software, University of Southern Denmark(南丹麦大学工业软件中心) ProMake(宝迈可)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI

AI总结 研究微调语言模型评估到部署的不匹配问题,提出在路径修补告知的中深度窗口拟合配对激活对比并修改结果坐标的方法,在多个模型实例中缩小了差距,还指出单坐标审计的局限性,此审计用于诊断微调检查点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16122 2026-07-20 cs.AI cs.LG 新提交 76%

CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data

CRAFT:聚类评分标准以诊断大型语言模型的能力短板并生成针对性的微调数据

Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong He

机构 * Scale AI(Scale人工智能公司)

专题命中 评测与基准 :LLM(title);分类 cs.AI、cs.LG

AI总结 研究针对评估应指导模型改进及提供训练数据的问题,提出CRAFT方法,将评分标准评估数据集转化为模型能力短板诊断,通过聚类能力描述、评估模型节点等生成微调数据,实验表明该方法能更精准诊断模型弱点并提升性能。

Comments 18 pages, 3 Tables, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26437 2026-06-26 cs.CL cs.AI 新提交 76%

ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence

ConflictScore: 识别和衡量语言模型如何处理冲突证据

Siyi Liu, Aaron Halfaker, Dan Roth, Patrick Xia

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI

AI总结 提出ConflictScore指标,通过将回答分解为原子声明并与证据文档对比,量化模型对冲突证据的识别程度,实验表明该指标能有效检测过度自信声明并提升真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏