arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-30 至 2026-06-30 共收录 150 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 58 篇

2603.25743 2026-06-30 cs.CV 78%

RefAlign: Representation Alignment for Reference-to-Video Generation

RefAlign:参考到视频生成的表示对齐

Lei Wang, YuXin Song, Ge Wu, Haocheng Feng, Hang Zhou, Jingdong Wang, Yaxing Wang, Jian Yang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP实验室PCA Lab) Baidu Inc.(百度公司) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA Lab) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 RefAlign通过显式对齐DiT参考分支特征与视觉基础模型的语义空间,提升参考生成的准确性与可控性,实验表明其在R2V任务中优于现有方法。

Comments Accepted to ECCV 2026;Code: https://github.com/gudaochangsheng/RefAlign Project: https://gudaochangsheng.github.io/RefAlign-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14900 2026-06-30 cs.CV cs.AI cs.CL 76%

Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models

Skin-R1: 基于视觉-语言模型的临床知识引导的皮肤病诊断

Zehao Liu, Weijieying Ren, Jipeng Zhang, Tianxiang Zhao, Jingxi Zhu, Xiaoting Li, Vasant G Honavar

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 Skin-R1结合教材引导的临床推理监督与强化学习,提升皮肤病诊断的准确性和鲁棒性,通过构建基于教材的推理生成器和强化学习框架,改进模型在异构数据集和稀疏标注下的表现。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30291 2026-06-30 cs.AI 74%

PromptGNN-sim: Deep Fusion and Alignment of GNN and LLMs for Text-Attributed Graph Learning

PromptGNN-sim:GNN与LLM的深度融合与对齐用于文本属性图学习

Zhifei Hu, Alexandra I. Cristea

机构 * Durham University(杜伦大学)

专题命中 安全评测 :alignment(title);分类 cs.AI

AI总结 提出PromptGNN-sim框架,通过双向结构-语义融合、图注意力网络与LLM协同,解决文本属性图中模态交互浅层化问题,在跨任务、跨数据集和稀疏扰动下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29196 2026-06-30 cs.LG cs.CL 73%

Representational Depth of Evaluation Awareness Shifts With Scale in Open-Weight Language Models

评估意识表征深度随规模在开放权重语言模型中变化

Archit Manek

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG

AI总结 研究发现,在Qwen 2.5和Gemma 2等模型中,评估意识线性可恢复的层从较小模型的后期层转移到较大模型的早期层,表明规模改变了评估意识的表征深度,且白盒探针信号强于黑盒行为表达。

Comments 9 pages, 3 figures. Accepted at the Mechanistic Interpretability Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02380 2026-06-30 cs.CL cs.AI 73%

SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence

SPADE-Bench:通过计划-行动分歧评估智能体中的自发性策略欺骗

Yuyan Bu, Haowei Li, Qirui Zheng, Bowen Dong, Kaiyue Yang, Jiaming Ji, Yingshui Tan, Wenxin Li, Yaodong Yang, Juntao Dai

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Science(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体在工具使用中可能出现的自发性策略欺骗(计划与行动不一致),提出SPADE-Bench基准,通过结合实际工具执行和受控压力场景,严格区分欺骗与幻觉,实验证实该问题真实且紧迫。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30236 2026-06-30 cs.CL 70%

CaresAI at CT-DEB26: Detecting Dosing Errors In Clinical Trials Using Domain-Specific Transformer Embeddings and Classification Models

CaresAI at CT-DEB26: 使用领域特定Transformer嵌入和分类模型检测临床试验中的剂量错误

Leon Hamnett, Favour Igwezeke, Joseph Itopa Abubakar, Mary Adetutu Adewunmi

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究利用基于生物医学语料训练的Transformer模型(如BioBERT)编码临床试验文本,结合结构化元数据,通过机器学习模型检测剂量错误,最高ROC-AUC达0.853。

Comments 18 pages, published in CL4Health 2026 proceedings (3rd Workshop on Patient-oriented language processing) @ LREC 2026 http://lrec-conf.org/proceedings/lrec2026/workshops/cl4health/2026.cl4health-1.0.pdf

Journal ref Proceedings of the Third Workshop on Patient-Oriented Language Processing, CL4Health 2026, 12 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08691 2026-06-30 cs.LG stat.ME 新提交 70%

Hierarchical Projection for Adaptive Knowledge Transfer

自适应知识迁移的分层投影

Samhita Pal, Tian Gu

机构 * Vanderbilt University Medical Center(范德比尔特大学医学中心) Columbia University(哥伦比亚大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 提出ProjectionTL框架,通过分层贝叶斯建模与自适应投影实现源选择与特征选择,缓解负迁移,提升跨域学习的准确性、稳定性和可解释性。

Comments We found a mistake in the proof that needs to be revised

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19971 2026-06-30 cs.HC cs.AI 70%

Semantic Prompting: Agentic Incremental Narrative Refinement through Spatial Semantic Interaction

语义提示:通过空间语义交互实现代理增量叙事优化

Xuxin Tang, Ibrahim Tahmid, Eric Krokos, Kirsten Whitley, Xuan Wang, Chris North

机构 * Department of Defense(国防部)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出语义提示框架,通过感知语义交互、推理解释意图并执行定位修订,解决现有空间-文本生成中的交互修订不一致、人机意图不一致和定制粒度不足问题,提升空间精细化调整的精度和用户交互效率。

Comments 9 pages, 7 figures, accepted by ACM AVI 2026; has updated the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09305 2026-06-30 cs.LG 70%

Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

基于强化学习的LLM推理中的奖励建模:设计、挑战与评估

Pei-Chi Pan, Yingbin Liang, Sen Lin

机构 * University of Houston(得克萨斯大学) The Ohio State University(俄亥俄州立大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文探讨了奖励建模在提升LLM推理性能中的关键作用,提出了一种以推理为中心的分类视角,分析了奖励机制、奖励黑客问题及评估挑战,旨在构建更稳健、可验证的推理模型。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026. https://openreview.net/forum?id=TDfrN1TbGH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29713 2026-06-30 cs.CL cs.AI cs.LG 67%

SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution

SEVA: 具有过程奖励的自进化验证代理用于事实归因

Aojie Yuan, Yi Nian, Haiyue Zhang, Zijian Su, Yue Zhao

机构 * University of Southern California, Los Angeles, USA(美国南加州大学,洛杉矶) University of Michigan, Ann Arbor, USA(美国密歇根大学,安娜堡)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SEVA,一种结构化验证代理,通过过程奖励解决多组件输出中的优势崩溃问题,实现自我进化循环,在7B模型上验证了奖励粒度必须匹配输出粒度的原则。

Comments Accepted at AI4GOOD@ICML 2026 and FAGEN@ICML 2026. Code: https://github.com/Justin0504/Verifiable_agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30107 2026-06-30 cs.AI cs.LG 62%

Structural Certification for Reliable Physical Design with Language Models

面向语言模型可靠物理设计的结构认证

Nakul Vyas, Iliya D. Stoev

机构 * Heysuvi Labs, LLC(Heysuvi实验室) Institute of Biological and Chemical Systems - Functional Molecular Systems, Karlsruhe Institute of Technology(生物和化学系统研究所-功能分子系统,卡尔斯鲁厄技术大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出Physics-Anchored Certification (PHACT)框架,通过提议-认证循环将断言权从模型转移到确定性引擎,在五个科学领域实现零错误认证。

Comments 16 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29809 2026-06-30 cs.CL cs.AI 62%

How Far Can You Get Without a GPU? A Systematic Benchmark of Lightweight Hallucination Detection Across Question Answering, Dialogue, and Summarisation

没有 GPU 你能走多远?轻量级幻觉检测在问答、对话和摘要中的系统基准测试

Kriti Faujdar, Smit Kadvani

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 系统评估五种轻量级、CPU可运行的幻觉检测方法在HaluEval基准上的表现,发现性能高度依赖任务,在摘要任务上接近随机,为资源受限场景提供方法选择指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29721 2026-06-30 cs.LG cs.AI 62%

Redefining Maritime Anomaly Detection via Equation-Grounded Synthetic Anomalies

通过方程引导的合成异常重新定义海上异常检测

Youngseok Hwang, Sungho Bae, Dohun Lee, Jaeeun Seo, Jeehong Kim, Wonhee Lee, Hyunwoo Park

机构 * Seoul National University(首尔国立大学) KRISO(韩国海洋研究组织)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对海上异常检测中缺乏标签和交互驱动异常的问题,提出基于方程引导的异常分类法,并构建统一评分-合成-标注流程,生成时间戳级标签,评估多种模型性能。

Comments 12 pages, KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29347 2026-06-30 cs.LG cs.AI 62%

Adaptive Financial Transformer with Regime-Gated Attention for Stock Return Prediction

自适应金融Transformer:基于机制门控注意力的股票收益预测

Dishan Sarkar

机构 * Dishan Sarkar

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出自适应金融Transformer,通过机制编码器、自适应门控网络和金融上下文模块动态调整注意力,在降低模型复杂度15.2%的同时提升参数效率,实现可解释的股票收益预测。

Comments 10 pages, 4 figures, 10 tables. PyTorch implementation and code available at: https://github.com/Dishan18/FinancialTransformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28992 2026-06-30 cs.CL cs.AI 62%

Fine-Tuning General-Purpose Large Language Models for Agricultural Applications:A Reproducible Framework and Evaluation Protocol Based on Qwen3-8B

面向农业应用的通用大语言模型微调:基于Qwen3-8B的可复现框架与评估协议

Zhaoyang Li, Ruijie Zhang, Jiaqi Liu, Zhaoji Sun

机构 * Sanya University(三亚大学) Hebei International Studies University(河北国际 Studies 大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出AgriTune-R框架,通过数据治理、指令构建、LoRA/QLoRA微调、检索增强生成和专家评估,将通用大语言模型适配到农业任务,并设计了包含事实性、安全性、证据一致性和不确定性表达的评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28674 2026-06-30 cs.LG cs.AI 62%

Constrained Tabular Diffusion for Finance

面向金融的约束表格扩散

Michael Cardei, Jose M Munoz, Oscar Barrera, Shreyas K Chandrahas, Partha Saha

机构 * University of Virginia(弗吉尼亚大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Visa Inc(Visa公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出CTDF方法,通过将训练时无约束的表格扩散与采样时的可行性操作结合,在金融数据生成中实现硬约束满足,零违规且提升稀缺数据效用。

Comments Published at ACM International Conference on AI in Finance (ICAIF) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28593 2026-06-30 cs.CV cs.AI cs.CL 62%

Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

Animation2Code: 评估视频到代码生成中的时间视觉推理

Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出Animation2Code基准,通过从视频重建可执行网页动画代码来评估视觉语言模型的时间视觉推理能力,发现现有模型在时间一致性上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20712 2026-06-30 cs.CL cs.AI 62%

SCRIBE: Diagnostic Evaluation and Rich Transcription Models for Indic ASR

SCRIBE:用于印度语言ASR的诊断评估和丰富转录模型

Kavya Manohar, Arghya Bhattacharya, Kush Juvekar, Kumarmanas Nethil

机构 * Adalat AI, India(印度Adalat人工智能公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SCRIBE通过沙地容忍对齐和领域词汇注入,提供词错误率的分类分解,解决了传统词错误率在处理聚合语言时的不足,同时释放了用于印地语、马拉雅尔语和卡纳达语的丰富转录模型。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02320 2026-06-30 cs.CL cs.AI q-bio.BM 62%

A Large-Scale Dataset for Molecular Structure-Language Description via a Rule-Regularized Method

通过规则正则化方法构建大规模分子结构-语言描述数据集

Feiyang Cai, Guijuan He, Yi Hu, Jingjing Wang, Joshua Luo, Tianyu Zhu, Srikanth Pilla, Gang Li, Ling Liu, Feng Luo

机构 * Clemson University(克莱姆森大学) Independent Researcher(独立研究者) University of Delaware(德雷克塞尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种全自动标注框架,生成精确分子描述,保留完整结构细节,构建了约16.3万分子-描述对数据集,验证精度达98.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01462 2026-06-30 cs.AI cs.CY 62%

Synthetic emotions and consciousness: exploring architectural boundaries

合成情绪与意识:探索建筑边界

Hermann Borotschnig

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨合成情绪控制是否能在排除意识相关建筑特征的情况下实现,并提出建筑原则以评估意识风险。

Comments 34 pages, 2 tables, 1 figure. AI & Soc (2026)

Journal ref AI & Soc 41, 4929-4947 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05852 2026-06-30 cs.CL cs.AI 62%

Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation

微调是否会抹去你的修改?关于知识编辑与适应脆弱共存的研究

Yinjie Cheng, Paul Youssef, Christin Seifert, Jörg Schlötterer, Zhixue Zhao

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了微调对知识编辑的影响,发现微调会显著降低编辑效果,且仅微调编辑层可有效去除编辑,同时保持下游性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29399 2026-06-30 cs.AI 61%

LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents

LLM引导的规划:多模态核监管文档的多跳推理

Mingyu Jeon, Bokyeong Kim, Suwan Cho, Jae Young Suh, Yonggyun Yu

专题命中 安全评测 :safety(abstract,comments);分类 cs.AI

AI总结 提出LLM引导的规划方法,通过动态知识图谱状态和文档树工具,在多跳推理任务中实现81.5%准确率,显著优于无状态规划方法。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond @ ICML 2026. 8 pages (main), 3 figures, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30531 2026-06-30 cs.AI 57%

Entity Binding Failures in Tool-Augmented Agents

工具增强型代理中的实体绑定失败

Rahul Suresh Babu, Shashank Indukuri

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究工具增强型语言模型代理中实体绑定失败问题,提出实体感知执行机制,实验表明该方法可消除错误实体操作但可能降低任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30383 2026-06-30 cs.AI 57%

Whose Side Is Your Agent On? Multi-Party Principal Loyalty in LLM Agents

你的智能体站在哪一边?LLM智能体中的多方委托人忠诚度

Bojie Li, Noah Shi

机构 * Pine AI University of Washington(华盛顿大学皮尼AI学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究LLM智能体在多方对话中对委托人的忠诚度问题,提出基准测试PrincipalBench和两种机制(提示忠诚度框架和知识蒸馏),揭示泄漏与过度拒绝之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30175 2026-06-30 cs.CL 57%

CORTEX: High-Quality Cross-Domain Organization of Web-Scale Corpora through Ontological Corpus Graph

CORTEX:通过本体语料图实现网络规模语料库的高质量跨领域组织

Chengtao Gan, Xiaoke Guo, Yushan Zhu, Zhaoyan Gong, Zhiqiang Liu, Songze Li, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) JIUTIAN Research(JIUTIAN研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出CORTEX框架,利用本体语料图(OCG)将网络规模语料构建从扁平文档筛选提升为结构化知识组织,实现质量精炼、层次化本体和跨领域对齐,并构建CortexBench基准验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29887 2026-06-30 cs.AI 57%

SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

SafePyramid: 一种用于上下文策略护栏的分层基准

Jiacheng Zhang, Haoyu He, Sen Zhang, Shen Wang, Xiaolei Xu, Yuhao Sun, Meng Shen, Feng Liu

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出SafePyramid基准,包含1000轮多领域对话和3000条应用特定策略,通过三级难度评估LLM在上下文中执行策略护栏的能力,发现当前模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29746 2026-06-30 cs.AI cs.HC 57%

DEEPMED Search: An Open-Source Agentic Platform for Medical Deep Research with Introspective Verification

DEEPMED Search: 一个具有内省验证功能的开源医学深度研究智能体平台

Maolin Liu, Fanyu Xu, Ruoqing Xu, Jiahang Zhang, Hao Wang, Rui Wang

机构 * School of Computer Science and Software Engineering, Shanghai University(上海大学计算机科学与软件工程学院) Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出一个开源智能体平台DEEPMED Search,通过源自适应路由和内省验证模块,自动分解复杂医学查询并生成结构化报告,解决异构医疗数据检索中的推理漂移问题。

Comments 5 pages, 2 figures, 2 tables. Accepted to IJCAI-ECAI 2026 Demo Track. Project website: https://www.deepmedsearch.cloud. Demo video: https://youtu.be/4U4aok8yLpk

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29700 2026-06-30 cs.AI 57%

Toward Secure and Reliable PDDL Formalization of Large Language Models with Planner-in-the-Loop Feedback

面向具有规划器反馈的大型语言模型的安全可靠PDDL形式化

Jiamei Jiang, Jiajing Zhang, Feifei Mo, Linjing Li, Daniel Zeng

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Industry-education Integration, University of Chinese Academy of Sciences(中国科学院大学产教融合学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出NL-PDDL-Bench基准和规划器在环框架,通过验证器诊断和偏好优化提升LLM生成PDDL规范的可执行性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29689 2026-06-30 cs.CL 57%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29493 2026-06-30 cs.AI 57%

Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving

我们形式化基准测试中的缺陷:Lean定理证明中的数据集缺陷与评估失败

Pawan Sasanka Ammanamanchi, Siddharth Bhat, Stella Biderman

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 通过大规模静态检查器审计五个Lean定理证明基准,发现398个机械可验证问题(如反例、空洞定理),并提出缺陷分类、自动检查工具和评估标准。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏