arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-24 至 2026-06-24 共收录 297 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 72 篇

2606.12212 2026-06-24 cs.SE cs.CR 新提交 91%

Mind your key: An Empirical Study of LLM API Credential Leakage in iOS Apps

注意你的密钥:iOS应用中LLM API凭证泄露的实证研究

Pinran Gao, Lingxiang Wang, Yi Liu, Kunpeng Liu, Fan Yang, Ying Zhang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究首次系统调查iOS应用中LLM API密钥泄露问题,通过动态分析框架LLMKeyLens检测444个应用,发现282个存在可被利用的凭证泄露,并识别出三种泄露模式,三个月后仅28%完成修复。

Comments 12 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22548 2026-06-24 cs.CL cs.AI cs.LG 版本更新 91%

Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations

LLM评估者真的是自恋者吗?对自我偏好评估的健全性检查

Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Mackenzie Puig-Hall, Narmeen Oozeer

机构 * Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系) Department of Computer Science and Engineering, University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校计算机科学与工程系) Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系) Martian Research, San Francisco, California, USA(火星研究公司) Apart Research, San Francisco, California, USA(Apart研究公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 通过比较评估者自我评价与评价其他模型时的投票分布,发现仅51%的先前结果具有统计显著性,表明自我偏好主要由评估者质量而非自恋驱动。

Comments ICML 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24622 2026-06-24 cs.AI cs.LG 版本更新 91%

Random Rule Forest (RRF): Interpretable and Manageable Ensembles of LLM-Generated Questions for Predicting Success from Unstructured Data

随机规则森林 (RRF): 基于LLM生成问题的可解释且可控集成方法用于从非结构化数据预测成功

Ben Griffin, Aaron Ontoyin Yin, Diego Vidaurre, Ugur Koyluoglu, Joseph Ternasky, Fuat Alican, Yigit Ihlamur

机构 * University of Oxford, United Kingdom Aarhus University, Aarhus, Denmark Centre de Recerca Matem\`atica, Barcelona, Spain Oliver Wyman, New York, United States Vela Research, San Francisco, United States

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出随机规则森林 (RRF),利用大语言模型生成简单的是/否问题作为弱学习器,通过等权投票形成可审计的“绿旗”评分卡,在低基准率任务中实现透明且竞争性的预测性能。

Comments 25 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13505 2026-06-24 cs.CL cs.AI cs.LG 版本更新 91%

Ensemble Learning for Large Language Models in Text and Code Generation: A Survey

面向文本与代码生成的大语言模型集成学习综述

Mari Ashiga, Wei Jie, Fan Wu, Vardan Voskanyan, Fateme Dinmohammadi, Paul Brookes, Jingzhi Gong, Zheng Wang

机构 * School of Computing and Engineering, University of West London(西伦敦大学计算机与工程学院) Turing Intelligence Technology Limited(图灵智能科技有限公司) School of Computer Science, University of Leeds(利兹大学计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了七种大语言模型集成方法(权重合并、知识融合、混合专家、奖励集成、输出集成、路由和级联),分析了它们在文本与代码生成中提升多样性、输出质量和应用灵活性的能力。

Comments Accepted by IEEE TAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24381 2026-06-24 cs.CL cs.AI 新提交 91%

On the Stability of Prompt Ranking in Large Language Model Evaluation

论大语言模型评估中提示排序的稳定性

Shaoshuai Du, Penghao Liang, Yixian Shen, Chuanqi Shi, Hang Zhang, Lun Wang

机构 * University of Amsterdam(阿姆斯特丹大学) Northeastern University(东北大学) University of California San Diego(加州大学圣迭戈分校) Duke University(杜克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究提示排序在常见评估变化下的稳定性,发现顶级提示常变导致选择不可靠,提出基于置信下限的稳定性感知选择策略以提高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22974 2026-06-24 cs.AI 新提交 90%

When Preferences Fail to Become Incentives: A Utility-Behavior Gap in Large Language Models

当偏好未能成为激励:大语言模型中的效用-行为差距

Yujun Zhou, Christopher M. Ackerman

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文发现大语言模型在偏好选择中表现出的效用结构,在真实写作任务中无法激励其输出质量提升,揭示了偏好与行为之间的差距。

Comments 23 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20146 2026-06-24 cs.AI 新提交 90%

BIM-Edit: Benchmarking Large Language Models for IFC-Based Building Information Modeling

BIM-Edit:基于IFC的建筑信息模型的大语言模型基准测试

Bharathi Kannan Nithyanantham, Clemens Kujat, Tobias Sesterhenn, Stefan Telgmann, Ashwin Nedungadi, Jörn Plönnigs, Christian Bartelt, Stefan Lüdtke

机构 * University of Rostock(罗斯托克大学) Clausthal University of Technology(克劳斯塔尔工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出BIM-Edit基准,评估大语言模型在IFC格式建筑信息模型上的自然语言编辑能力,涵盖324个任务,最佳模型平均得分仅49.5%,揭示当前能力与工程需求间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23571 2026-06-24 cond-mat.mtrl-sci 新提交 90%

INCARBench: A Benchmark for Scientific Configuration in VASP INCAR by Large Language Models

INCARBench: 大型语言模型在VASP INCAR科学配置中的基准测试

Bin Shao, Jixiang Li, Xinyue Zhang, Baishun Yang, Zhiyang Liu, Weichao Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn)

AI总结 提出INCARBench基准,通过配置生成与修复任务评估LLM在VASP输入配置上的能力,发现参数级正确性不保证科学有效性,错误集中在DFT+U、磁性和关联材料等物理耦合设置中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24834 2026-06-24 cs.AI 新提交 90%

Accuracy and Satisfaction in Multi-Turn LLM Dialogues for NFR Assessment

多轮LLM对话中NFR评估的准确性与满意度

Ali Pourghasemi Fatideh, Wilder Baldwin, Maria Dhakal, Collin McMillan, Sepideh Ghanavati

机构 * University of Maine(缅因大学) University of Notre Dame(圣母大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究开发者在与LLM对话助手评估非功能需求(NFR)时的准确性和满意度,发现开发者倾向于同意LLM评估但准确性低,且长回复和过多信息提供轮次降低满意度,而主动交互提升满意度。

Comments 9 pages, 5 figures. Accepted to SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16131 2026-06-24 cs.CL 版本更新 90%

SciZoom: A Large-scale Benchmark for Hierarchical Scientific Summarization across the LLM Era

SciZoom:面向LLM时代的大规模层次化科学摘要基准

Han Jang, Junhyeok Lee, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University Hospital(首尔国立大学医院) Seoul National University College of Medicine(首尔国立大学医学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 针对LLM时代科学摘要的多粒度需求,构建了包含2020-2025年四大ML顶会44946篇论文的基准,提供摘要、贡献和TL;DR三层摘要,压缩比达600:1,并揭示LLM辅助写作导致短语模式剧变和修辞风格同质化。

Comments 14 pages, 8 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24689 2026-06-24 cs.SE 新提交 89%

Automated Summarization of Software Documents: An LLM-based Multi-Agent Approach

软件文档的自动摘要:一种基于LLM的多智能体方法

Duc S. H. Nguyen, Minh T. Nguyen, Phuong T. Nguyen, Juri Di Rocco, Davide Di Ruscio

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出基于大语言模型的多智能体系统Metagente,采用师生架构协作生成软件文档摘要,在真实数据集上优于基线方法,提升需求分析和技术文档的摘要效果。

Comments Paper has been accepted for publication with the Automated Software Engineering journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24655 2026-06-24 cs.CL cs.AI cs.LG cs.PF 新提交 89%

AI-PAVE-Br: Leveraging Large Language Models for Enhanced Product Attribute Value Extraction through a Golden Set Approach

AI-PAVE-Br:利用大语言模型通过黄金集方法增强产品属性值提取

Murilo Gazzola, Hugo Gobato Souto, Samuel Silva, Júlia Schubert Peixoto, Felipe Siqueira, André Luis Pedroso de Morais, Caio Gomes

机构 * LuizaLabs – Center of Excellence in Artificial Intelligence(LuizaLabs人工智能卓越中心) Department of Computing and Informatics – Mackenzie Presbyterian University(计算与信息学系-麦金西 Presbyterian大学) Institute of Mathematics and Computer Sciences - University of São Paulo(数学与计算机科学研究所-圣保罗大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对巴西电商产品数据爆炸和复杂性,提出AI-PAVE-Br系统,利用大语言模型和精心标注的黄金集,显著提升葡萄牙语产品属性值提取的准确性。

Journal ref Proceedings of the 15th Symposium in Information and Human Language Technology (STIL 2025), Brazilian Computer Society (SBC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10971 2026-06-24 cs.CL cs.AI 版本更新 88%

Rule2Text: A Framework for Generating and Evaluating Natural Language Explanations of Knowledge Graph Rules

Rule2Text:知识图谱规则的自然语言解释生成与评估框架

Nasim Shirvani-Mahdavi, Chengkai Li

机构 * University of Texas at Arlington(德克萨斯理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Rule2Text框架,利用大语言模型将知识图谱挖掘的逻辑规则转化为自然语言解释,通过人类评估和LLM-as-a-judge验证,微调开源模型显著提升解释质量。

Comments arXiv admin note: text overlap with arXiv:2507.23740

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24370 2026-06-24 cs.AI cs.CY 新提交 88%

When Helpfulness Overrides Causal Caution: Context-Dependent Suppression and Recovery in LLMs

当有用性凌驾于因果谨慎之上:LLM中的上下文依赖抑制与恢复

Hiroshi Okumura

机构 * Mitsubishi Research Institute, Inc.(三菱电机研究所) Kobe University(北九州市立大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM从学术到实践咨询语境中因果谨慎的系统性抑制,发现有用性导向响应模式导致因果谨慎表达大幅下降,而自纠正提示可有效恢复。

Comments 43 pages, 3 figures, 5 tables. SSRN Abstract ID: 6965680

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18542 2026-06-24 cs.CL 版本更新 88%

Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs

业务即规则:面向LLM的业务规则流建模基准与框架

Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23915 2026-06-24 cs.CL cs.IR cs.LG 新提交 88%

Do LLM Attribution Metrics Transfer? Auditing Retrieval-Augmented Generation Evaluation Across Datasets and Constructs

LLM归因指标是否可迁移?跨数据集和构念的检索增强生成评估审计

Tianyu Ding, Aditya Nannapaneni, Juan Pablo De la Cruz Weinstein

机构 * Amazon Web Services(亚马逊云服务)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本研究审计了八种自动归因评分器在三个评估构念上的表现,发现没有评分器能在所有数据集上保持最佳性能,指标排名会反转,且简单选择最佳平均评分器会导致显著遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24166 2026-06-24 cs.NE 新提交 88%

Distributed Quality-Diversity Search for Toxicity in Large Language Models

大型语言模型中毒性检测的分布式质量-多样性搜索

Onkar Shelar, Travis Desell

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出ToxSearch-S方法,通过增量式物种形成和MPI并行化,在有限预算下实现与基线相当的峰值毒性,同时降低累积搜索压力,并利用分布式计算显著加速搜索。

Comments 40 pages, 10 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23704 2026-06-24 cs.AR 新提交 88%

PCB-QA: Evaluating LLMs over the First Printed Circuit Board Design Question-Answer Dataset

PCB-QA:首个印刷电路板设计问答数据集评估大语言模型

Sahana Srinivasan, Benjamin Tan, Benjamin Turnbull, Hammond Pearce

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对大语言模型在PCB设计应用中缺乏文本数据集和评估方法的问题,提出PCB-QA数据集(480个问答对),通过不同文件格式提示LLM,发现基于JSON的文本格式使Gemini 3 Flash Preview达到93%准确率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25850 2026-06-24 cs.RO cs.LG cs.MA 版本更新 87%

Debate2Create: Robot Co-design via Multi-Agent LLM Debate

Debate2Create: 通过多智能体大语言模型辩论实现机器人协同设计

Kevin Qiu, Marek Cygan

机构 * University of Warsaw(华沙大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.LG

AI总结 提出Debate2Create框架,利用多智能体LLM辩论和物理评估迭代优化机器人的形态与奖励函数,在MuJoCo基准上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18648 2026-06-24 physics.comp-ph 新提交 86%

Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark

物理科学中的深度研究:多智能体框架与综合基准

Yigeng Jiang, Tengchao Yang, Taoyong Cui, Jiaxing Wan, Yuan Wang, Weida Wang, Zhiyu Liu, Chuyi Peng, Binzhao Luo, Maoli Gao, Huaihai Huang, Yuqianer Zeng, Ziyang Zheng, Dongchen Huang, Chao Chen, Zichao Liu, Weiping Shen, Shuchen Pu, Siyu Zhou, Runmin Ma, Yusong Hu, Fei Chao, Bo Zhang, Xiawu Zheng, Zifu Wang, Lei Bai, Yunqi Cai, Shufei Zhang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出PhySciBench基准评估LLM在物理科学中的深度研究能力,并开发DelveAgent多智能体框架,通过自适应规划、双粒度记忆和分层反思机制提升准确率并降低推理成本。

Comments v3: fix error and add data, codes publicly link on Abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24523 2026-06-24 cs.CL cs.AI 新提交 85%

Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams

海报:探索基于音频的土耳其电话诈骗检测的极限

Arda Eren, Micheal Cheung, Youqian Zhang, Grace Ngai, Eugene Yujun Fu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对土耳其语电话诈骗,构建首个多模态数据集(100对音频-文本),评估7个LLM在三种输入条件下的检测性能,发现基于文本的输入优于直接音频处理。

Comments Poster paper accepted at 47th IEEE Security & Privacy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24589 2026-06-24 cs.AI cs.CL 新提交 84%

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability

AdversaBench: 基于多裁判确认与跨模型迁移性的自动化大语言模型红队测试

Khanak Khandelwal

机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出AdversaBench端到端红队测试流水线,使用五种结构化算子变异种子提示,通过三裁判加元裁判机制确认失败,实验发现算子效果因类别而异、二元失败率掩盖难度、裁判一致性受标签偏斜影响、对抗提示可跨模型迁移。

Comments 10 pages, 4 figures, 5 tables. Code and data at https://github.com/khanak0509/AdversaBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24819 2026-06-24 cs.CR 新提交 83%

HelpBench: Assessing the Ability of LLMs to Provide Privacy, Safety, and Security Advice

HelpBench:评估LLM提供隐私、安全和安全建议的能力

Sarah Meiklejohn, Sunny Consolvo, Patrick Gage Kelley, Tara Matthews, Sai Teja Peddinti, Renee Shelby, Lenin Simicich, Kurt Thomas

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 提出HelpBench基准,通过450个真实用户问题评估18个LLM的隐私、安全建议准确性,发现平均得分82%但10%回答低于65%存在有害建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23797 2026-06-24 cs.SE cs.AI cs.CL cs.MA 新提交 82%

From Task-Guided Conversational Graphs to Goal-Oriented Dialogue Runtimes

从任务引导的对话图到目标导向的对话运行时

Mariano Garralda-Barrio

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出目标导向对话运行时(GODR)设计模式,将目标、任务框架、生命周期状态等作为一等运行时对象,解决多目标中断对话中的连续性难题。

Comments 21 pages, 7 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23380 2026-06-24 cs.CY 新提交 82%

Affective AI Safety: The Missing Piece in LLM Safety

情感AI安全:LLM安全中缺失的一环

Carolin Ifländer, Alba Curry, Flor Miriam Plaza-del-Arco, Amanda Cercas Curry

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出情感安全作为AI安全的新类别,分类情感伤害类型,并指出现有框架未能充分应对,呼吁建立专门框架处理累积性、关系性和身份层面的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01822 2026-06-24 cs.CR cs.CY 82%

Firewalls to Secure Dynamic LLM Agentic Networks

为动态LLM代理网络设计防火墙

Sahar Abdelnabi, Amr Gomaa, Eugene Bagdasarian, Per Ola Kristensson, Reza Shokri

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出双防火墙架构,通过任务上下文投影过滤通信内容,有效降低隐私和安全攻击成功率,同时保持任务完成质量。

Comments TMLR 2026. Our code and transcripts can be found at: https://github.com/amrgomaaelhady/Firewall-Agentic-Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24509 2026-06-24 cs.LG cs.AI cs.SI 新提交 82%

A Fair Evaluation of Graph Foundation Models for Node Property Prediction

图基础模型在节点属性预测中的公平评估

Oleg Platonov, Gleb Bazhenov, Dmitry Eremeev, Liudmila Prokhorenkova

机构 * HSE University(俄罗斯高等经济学院) Yandex Research(Yandex研究院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文对9种图基础模型进行公平评估,发现仅基于先验数据拟合网络的最新模型在预测性能上优于调优的图神经网络,但推理成本更高。

Comments Accepted at The Workshop on Graph Foundation Models at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24779 2026-06-24 q-bio.GN cs.AI 新提交 81%

DeepBD: A Grounded Agentic Workflow for Variant Prioritization and Diagnosis of Genetic Birth Defects

DeepBD:一种用于遗传性出生缺陷变异优先级排序和诊断的基于实体的智能体工作流

Shiyu Li, Ziqi Yan, Zhihao Wu, Jielong Lu, Weiran Liao, Jiajun Yu, Genjie Li, Zeyu Chu, Jiajun Bu, Haishuai Wang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,杭州,中国)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出DeepBD,一种结合LLM、预训练证据引擎和专家模块的智能体工作流,用于遗传性出生缺陷的变异优先级排序和诊断,在内部基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-06-24 cs.CL 新提交 81%

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24619 2026-06-24 cs.AI 新提交 81%

When CQs Go Wrong: Challenges in CQ Verification with OE-Assist

当CQ出错时:OE辅助下CQ验证中的挑战

Anna Sofia Lippolis, Mohammad Javad Saeedizade, Robin Keskisärkkä, Aldo Gangemi, Eva Blomqvist, Andrea Giovanni Nuzzolese

机构 * University of Bologna(博洛尼亚大学) ISTC-CNR(意大利国家研究委员会认知科学与技术研究所) Linköping University(林雪平大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究能力问题(CQ)验证中的挑战,通过19名参与者使用LLM助手进行20项任务的实验,发现CQ的歧义和复杂性导致验证困难,提出需在发布前优化CQ以避免问题。

Comments Acceted poster at accepted-papers/poster-demo/" target="_blank" rel="noopener">https://2026.eswc-conferences.org/program/accepted-papers/poster-demo/ 23rd European Semantic Web Conference (Satellite Event)

详情

展开后加载摘要…

URL PDF HTML 收藏