arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 247 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 33 篇

2608.20161 2026-08-21 cs.AI 新提交 57%

DARS: Dual-Level Credit Assignment RL with Structured Reasoning for Instruction-Based Image Editing

DARS:用于基于指令的图像编辑的带结构化推理的双层级信用分配强化学习

Haoxiang Cao, Jiajiong Cao, Xuanpu Zhang, Changqian Yu, Chaoqun Wang

机构 * South China Normal University(华南师范大学) KlingAI Research(可灵AI研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出DARS框架,解决基于指令的图像编辑系统仅用最终奖励训练效率低的问题,通过双层级信用分配实现更好性能,在推理密集型编辑上增益显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19807 2026-08-21 cs.LG 新提交 57%

Answer-Level Trust Selection for Physical Vision-Language Reasoning

面向物理视觉-语言推理的答案级信任选择

Rongyu Yu, Ke Niu, Fengxiang He

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 针对VLM部署中预测信任问题,提出模型无关的ATS框架,聚合8种诊断分数评估答案可靠性,可识别稳定错判等失效模式,补充模型级能力评估。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11907 2026-08-21 cs.CV cs.AI 版本更新 57%

A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems

你能看到你所绘制的内容吗?面向统一多模态模型整体评估的语义闭环框架

Hao Zhang, Jiaxin Qi, Zhijiang Tang, Jianqiang Huang

机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) University of Chinese Academy of Sciences(中国科学院大学) Computer Network Information Center(计算机网络信息中心) Chinese Academy of Sciences(中国科学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究针对统一多模态模型的系统级评估缺口,提出无标注的SGU语义闭环框架,通过感知-生成-推理流程评估模型综合能力,发现高性能模型存在自生成上下文推理局限,为下一代模型开发提供基准基础。

Comments 21 pages, 8 figures, 12 tables. Title updated; author contribution and corresponding-author notes added. Hao Zhang and Jiaxin Qi contributed equally; Jianqiang Huang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17417 2026-08-21 cs.LG physics.chem-ph physics.comp-ph quant-ph 版本更新 57%

Grounded verification of chemical and materials reasoning: detection is the bottleneck

化学与材料推理的有根据验证:检测是瓶颈

Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07932 2026-08-21 cs.CV 版本更新 50%

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 推理与问题求解 :preference optimization(abstract)

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 56 篇

2608.19299 2026-08-21 cs.AI 新提交 92%

Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation

使用大语言模型的空中交通管制:提示工程、架构与评估

Mahyar Ghazanfari, Matthias Casanova, Jordan Kam, Alex Zongo, Peng Wei, Torsten Darrell, Alexandre Bayen

机构 * The George Washington University(乔治华盛顿大学) California Institute of Technology(加州理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对ATC仍以人工为主的问题,设计5种提示结构并在9种LLMs上实验,发现简洁提示表现最佳,注入正确历史可修复脚本严格提示的错误,明确了LLM辅助ATC的路径与局限。

Comments 39 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19347 2026-08-21 cs.SE 新提交 92%

Hype Meets Reality: Large Language Models as Mutators in Search-based Automated Program Repair of Simulink-Stateflow Models

炒作与现实的碰撞:大型语言模型作为基于搜索的Simulink-Stateflow模型自动化程序修复中的变异器

Ayesha Irshad, Pablo Valle, Jon Ayerdi, Aitor Arrieta

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文以Simulink/Stateflow建模的CPS为研究对象,扩展FlowRepair方法用LLM生成的变异替换部分算子,受控实验发现该方法大幅降低修复性能,分析指出盲目集成LLM到基于搜索的APR存在根本局限,需发展混合方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20106 2026-08-21 cs.CL 新提交 91%

OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models

OenoBench:用于大型语言模型知识基础评估的葡萄酒领域基准

Nikita Khudov

机构 * DipWSET(葡萄酒与烈酒教育基金会文凭) StrategAI

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本研究推出葡萄酒领域基准OenoBench,构建含3266道题的语料库,评估16种LLM配置,发现不同模型准确率差异及推理模式提升等规律并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19323 2026-08-21 cs.LG cs.AI stat.ML 新提交 91%

Improved Confidence Estimates for Black-Box Large Language Models

黑盒大型语言模型的改进置信度估计

Sokhna Diarra Mbacke, Mouloud Belbahri, Gabriel Loaiza-Ganem

机构 * Layer 6 AI TD Insurance(TD保险)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究针对黑盒大型语言模型的不确定性量化问题,利用目标数据集构建基于现有分数和相似查询正确性的简单分类器,以改进置信度估计,且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19208 2026-08-21 cs.CL cs.CV 新提交 90%

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

当无关文本起作用时:多模态大语言模型中的仿射间隔偏移

Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究多模态大语言模型(MLLMs)中任务无关文本对视觉判断任务的影响,发现其会使模型决策间隔发生可预测的仿射变换,为提升模型对噪声上下文的鲁棒性提供了诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19802 2026-08-21 cs.CL 新提交 90%

Stopping and Routing LLM Judge Panels

停止与路由大语言模型(LLM)评审小组

Bin Zhu, Yi Xie, Yanghui Rao

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究将LLM评审小组设计建模为角色条件分配问题,提出策略优化评审调用,经多类审计对比,生成可复用的评审调用计划。

Comments 21 pages, 2 figures, 20 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19689 2026-08-21 cs.AI 新提交 90%

Rethinking the Evaluation and Optimization of LLM-Based Social Simulation

重新思考基于大语言模型(LLM)的社会模拟的评估与优化

Pei Wang, Xu Chen, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM社会模拟中基于准确率的评估与硬标签训练的缺陷,提出主观性自适应软标签训练(SALT),构建SUBJSIM基准并验证其在现实场景下的可行性与优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01034 2026-08-21 cs.CL stat.ME 版本更新 90%

A Finite-Calibration Regime Map for LLM Judge Panels

有限校准机制图:LLM评审团面板

Bin Zhu, Yi Xie, Yanghui Rao

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 研究在有限人工标注预算下,低维堆叠器与联合输出表对LLM评审团面板的校准权衡,提出有限校准面板选择方法,实验表明多数评审输出可加或冗余。

Comments 33 pages, 11 figures, 40 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19437 2026-08-21 cs.CL cs.AI cs.CY 新提交 90%

Are LLMs becoming similarly creative? Evidence from three years of models

大型语言模型(LLM)正变得同样具有创造力吗?来自三年模型的证据

Nirav Patel, Josiah Crossman, Eva Aggarwal, Emily Wenger

机构 * Duke University(杜克大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析三年间的LLM在Infinity-Chat100和替代用途任务上的表现,发现LLM创造性输出多样性随时间显著下降,存在同质化趋势,需关注其对人机协同创作中人类能动性的影响。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20304 2026-08-21 q-fin.RM 新提交 89%

Calibration-Induced Degeneracy in LLM Financial Forecasting: An Audit-Trailed Case Study on Next-Day Market Risk

LLM金融预测中校准诱导的退化:关于次日市场风险的审计跟踪案例研究

Arin Mohanty

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究以次日市场风险为对象,发现LLM金融预测中存在校准诱导的退化问题,提出校准可行性检查点,验证低成本基准的关键作用并终止了无效的全历史推理阶段。

Comments 13 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19235 2026-08-21 cs.DL 新提交 89%

Beyond Document Retrieval: Architectural Challenges When LLM Agents Query Structured Enterprise Data

超越文档检索:LLM智能体查询结构化企业数据时的架构挑战

Sheikh Nazib Ahmed

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对企业智能体查询结构化数据的架构挑战,划分七个维度提出设计框架,经实验验证其可消除授权违规,还给出评估协议与开放问题。

Comments 9 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06635 2026-08-21 cs.IR 版本更新 89%

Can LLM Annotations Replace User Clicks for Learning to Rank?

大语言模型标注能否替代用户点击用于学习排序?

Lulu Yu, Keping Bi, Jiafeng Guo, Shihao Liu, Shuaiqiang Wang, Dawei Yin, Xueqi Cheng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文探究LLM标注能否替代点击数据用于学习排序,经多维度对比实验发现二者各有优劣,提出两种整合二者监督信号的训练策略可提升排序性能。

Comments 12 pages, 7 figures, accepted as a Full Research Paper at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20320 2026-08-21 cs.AI cs.CL 新提交 88%

An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

一种用于主动数据收集、出行行为建模及天气敏感需求预测的智能体方法

Narges Ahmadi (1), Yubo Jiao (1), Jônatas Augusto Manzolli (1), Jiangbo Yu (1), Luis Miranda-Moreno (1) ((1) McGill University)

机构 * McGill University(麦吉尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出三智能体工作流,结合对话式调查、传统建模与多模态LLM预测,基于学生通勤数据实现天气敏感出行需求预测,视觉配置模型准确率达71.5%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19760 2026-08-21 cs.LG cs.AI cs.CL 新提交 88%

Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay

无真实值的信用:针对执行重放的大语言模型智能体的步骤级信用分配审计

Haiyue Zhang

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对LLM智能体,在ALFWorld环境中审计步骤级信用分配,发现现有信用信号无法识别关键步骤,提出需匹配有效样本量比较信用规则。

Comments 49 pages, 7 figures. Pre-registered; frozen analysis plans and prompts included in the appendices. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20338 2026-08-21 cs.CL 新提交 88%

ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Language Models

ConceptGuard:评估大语言模型中上下文敏感的遗忘能力

Sahil Kale, Ian Harris

机构 * Pune Institute of Computer Technology(浦那计算机技术学院) University of California, Irvine(加州大学欧文分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究针对大语言模型遗忘能力评估的缺陷,提出ConceptGuard基准,聚焦两用概念,发现现有遗忘技术存在性能缺陷,为实用安全的遗忘方法提供思路。

Comments Submitted to NeurIPS E&D Track 2026; 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20116 2026-08-21 cs.CL 新提交 88%

When Text and Numbers Disagree: Evidence Arbitration in Large Language Models

当文本与数字不一致时:大型语言模型中的证据仲裁

Mattia Carletti, Edward Phillips, Fredrik K. Gustafsson, Patitapaban Palo, Lei Clifton, Danielle Belgrave, Xiao Gu, David A. Clifton

机构 * University of Oxford(牛津大学) GlaxoSmithKline(葛兰素史克) Oxford Suzhou Centre for Advanced Research(牛津大学苏州高等研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究构建合成基准探究LLMs在文本与数字证据冲突时的仲裁行为,发现其存在系统性偏好,常依赖启发式策略,凸显工具增强决策系统的失效模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19981 2026-08-21 cs.CL 新提交 88%

HealMed: Multilingual Evaluation of Large Language Models in Medicine

HealMed:面向医学领域的大语言模型多语言评估

Yingjian Chen, Fan Gao, Sherry T. Tong, Haoyu Zhang, Aosong Feng, Kevin W. Jin, Xing Wu, Jinghui Lu, Abdul Samad, Akbar Faruqi, Cesar Caraballo, Cibele Brandão, Dhruva (Drew) Gupta, Eunji Jeon, Gabriel Madera-Santiago, Geon Lee, Hugo Toshio Itikawa, Insook Cho, Isabelli Martins, Isarar Siddique, Israr Ahmed, Jihyo Kwak, Kanyakorn Veerakanjana, Luis Guilherme Cardoso, Minjin Kim, Piyalitt Ittichaiwong, Renee Dua, Santiago Gudiño-Rosales, Xiujie Chen, Zeo Lapalus, Zixin Xu, Michihiro Yasunaga, Rex Ying, Heuiseok Lim, Jaewoo Kang, Chanjun Park, Hang Jiang, Ethan Goh, Hyunjae Kim, Edison Marrese-Taylor, Yusuke Iwasawa, Yutaka Matsuo, Qingyu Chen, Irene Li

机构 * HealMed Research Team(HealMed研究团队)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究推出医学领域大语言模型多语言评估基准HealMed,经多国专家历时两年开发,实验发现低资源语言性能下降明显,专有模型更稳定,医学专业知识不保证多语言鲁棒性,翻译质量影响评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19974 2026-08-21 cs.AI 新提交 87%

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance

ReguSim:评估大语言模型智能体在金融合规中的规则落地

Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song

机构 * HKUST(香港科技大学) HKBU(香港浸会大学) NTU(新加坡南洋理工大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19746 2026-08-21 cs.CL 新提交 87%

PersonalBench: Measuring the Authorship Gap in LLM Personalization

PersonalBench:测量大语言模型个性化中的作者差距

Yash Ganpat Sawant

机构 * Independent AI Researcher(独立人工智能研究员)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究推出PersonalBench基准,通过LUAR、LLM评判者、自动风格计量学评估LLM个性化方法,发现其可区分作者但未达人类水平,发布该基准为LLM个性化提供校准工具。

Comments 17 pages. Extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23522 2026-08-21 cs.CL cs.AI 版本更新 87%

Qworld: Question-Specific Evaluation Criteria for LLMs

Qworld: 为LLMs设计的问题特定评估标准

Shanghua Gao, Yuchang Su, Pengwei Sui, Curtis Ginder, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Medicine, Brigham and Women’s Hospital(布里洛妇产科医院医学部) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究 institute) Broad Institute of MIT and Harvard(MIT 和哈佛大学Broad研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Qworld通过递归扩展树生成问题特定评估标准,覆盖89%专家标准并产生79%新标准,揭示LLM在长期影响、公平性等维度的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19893 2026-08-21 cs.CL cs.AI 新提交 86%

Interrupting the Loop: Periodic Subject Changes Raise Judged Surprise and Connection in Base Language Models

打断循环:周期性主体变化提升基础语言模型的惊讶度与关联度

Roberto I. Ono Filho

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究探究基础语言模型的长文本生成特性,发现周期性注入新主体的打断操作可提升模型生成文本的惊讶度与关联度,还提出了长文本生成的评估方案。

Comments 48 pages including appendix; code, data pipeline and lab notebook at this https URL (https://github.com/RobertoOno/interrupting-the-loop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08866 2026-08-21 cs.SE 版本更新 86%

ArkEval: Benchmarking and Evaluating Automated CodeRepair for ArkTS

ArkEval: 对ArkTS自动代码修复的基准测试与评估

Bang Xie, Senjian Zhang, Zhiyuan Peng, Wei Chen, Chenhao Ying, Yuan Luo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 ArkEval为ArkTS自动代码修复提供首个全面基准,通过挖掘官方仓库问题并采用LLM测试机制,评估了四种先进模型的修复能力,揭示了LLM在该领域的现状与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17379 2026-08-21 cs.CL cs.AI 版本更新 85%

PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTX

PTXBench:用于结合架构特定PTX优化GPU内核的大型语言模型基准测试与适配

Genghan Zhang, Yixin Dong, Chengze Fan, Zhichen Zeng, Yueming Yuan, Shaowei Zhu, Kunle Olukotun

机构 * Carnegie Mellon University(卡内基梅隆大学) RadixArk Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究提出PTXBench基准测试,评估LLM结合架构特定PTX优化GPU内核的能力,发现现有模型能力不均衡,经微调Qwen3.6-27B可改善部分任务但泛化仍不均,该基准为相关研究提供可审计测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06108 2026-08-21 cs.AI 版本更新 84%

Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents

评估大语言模型的投资逻辑:面向个性化金融智能体的真实世界基准

Yuanhong Jiang, Jingjie Zou, Rui Jiang, Zhenghong Lin, Xusheng Yu, Qiqi Huang, Shuai Jia, Shijie Dai

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

AI总结 该研究推出原生过程基准InvestLogicBench,含151位真实投资者的201247项决策,评估发现金融LLMs逻辑合理性高但事件接地性低,指出需以P→E→R→D→O轨迹评估个性化决策智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19475 2026-08-21 cs.SE cs.AI cs.CL cs.LO 新提交 82%

Measuring What a Specification Determines: A Formal Semantic-Block Model and an Execution-Judged Benchmark

测量规范决定的内容:一种形式化语义块模型与基于执行判断的基准

Oleg Grynets, Dmytro Kostetskyi, Vasyl Lyashkevych

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出形式化语义块模型与基于执行判断的基准,验证其在Oracle-PostgreSQL迁移规范中的有效性,支持确定性为形式化概念但非LLM实现者的独立经验质量指标。

Comments 11 pages, 1 figure, 7 tables, 37 references

详情

展开后加载摘要…

URL PDF HTML 收藏