arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 712 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 164 篇

2510.15476 2026-07-07 cs.CR cs.AI 版本更新 85%

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

知识梳理:系统化大语言模型提示安全:分类法、数据集以及攻击与防御的统一评估

Hanbin Hong, Shuang Wu, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Ali Arastehfard, Heqing Huang, Yuan Hong

机构 * University of Connecticut(康涅狄格大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Independent(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型提示安全问题,提出相关分类法,形式化评估元数据,发布模块化平台,通过匹配评估揭示多种因素对安全结论有重大影响,支持可重复、成本感知且基于分类法的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04374 2026-07-07 eess.SY cs.SY 新提交 85%

An End-to-End Explainable AI Framework with Automated LLM-Based Natural Language Explanation Generation for Energy Systems

一种用于能源系统的基于大语言模型自动生成自然语言解释的端到端可解释人工智能框架

Venkata Sesha Sai Raj Nanduri, Akthar Hussain, Van-Hai Bui

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出端到端可解释人工智能框架,结合预测、解释生成、评估并转化为自然语言文本。用XAI算法生成局部和全局解释,经评估后转化为结构化输入给大语言模型,在能源系统数据集测试,提升黑箱模型可解释性。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04092 2026-07-07 cs.SE 新提交 85%

SEDCoT: Enhancing LLM-Based COBOL Code Translation via Symbolic Execution and Delta Debugging

SEDCoT:通过符号执行和增量调试增强基于大语言模型的COBOL代码翻译

Phillip Entin, Wenchao Gu, Alexander Knapp, Chunyang Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对COBOL代码翻译难题,提出SEDCoT框架。先利用大语言模型初译,再结合符号执行与大语言模型指导生成测试套件修复语义差异,最后用增量调试最小化失败测试,提升翻译性能与可读性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04058 2026-07-07 cs.SE cs.PL 新提交 85%

Kaizen: Metamorphic Fuzzing and Differential Testing for LLM-Translated HPC Applications

Kaizen:用于大语言模型翻译的高性能计算应用的变质模糊测试和差分测试

Oscar Ludwig, Ninad Anklesaria, Zheming Jin, Swaroop Pophale, Kausar Moshood, Christian J. DeVore, Brandon Gill, Cassius Villareal, Keita Teranishi, Manish Motwani

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型驱动的高性能计算应用代码翻译的正确性评估,提出用变质模糊测试和差分测试框架Kaizen,经源码变异、语法输入模糊等生成等价程序,暴露语义差异,评估揭示了编译成功与正确性的关系。

Comments Manuscript under-review at the ACM Transactions on Software Engineering and Methodology (TOSEM) journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03014 2026-07-07 cs.SE 新提交 85%

Detection of LLM-assisted Code Plagiarism Using k-gram Software Birthmarks

使用k-gram软件特征检测大语言模型辅助的代码抄袭

Nikolay Fedorov, Akito Monden, Hiroki Inayoshi, Haruaki Tamada, Masateru Tsunoda

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型辅助下代码抄袭问题,用基于Java操作码唯一k-gram的软件特征,结合三个当代大语言模型及五个相似度度量进行检测,证明其对检测此类抄袭有效。

Comments 11 pages, 4 figures, submitted to the 8th World Symposium on Software Engineering (WSSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10002 2026-07-07 cs.CL cs.AI cs.LG 版本更新 85%

SpreadsheetArena: Decomposing Preference in LLM Generation of Spreadsheet Workbooks

电子表格竞技场:在大型语言模型生成电子表格工作簿中分解偏好

Srivatsa Kundurthy, Clara Na, Michael Handley, Zach Kirshner, Chen Bo Calvin Zhang, Manasi Sharma, Emma Strubell, John Ling

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究端到端电子表格生成任务,介绍SpreadsheetArena平台通过大型语言模型生成的工作簿的盲选成对偏好投票评估模型,指出该任务挑战机遇,发布数据集以助进一步研究。

Comments 35 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03463 2026-07-07 cs.SE 版本更新 85%

The Impact of Critique on LLM-Based Model Generation from Natural Language: The Case of Activity Diagrams

批判对基于大语言模型的自然语言模型生成的影响:以活动图为例

Parham Khamsepour, Mark Cole, Ish Ashraf, DaYuan Tan, Sandeep Puri, Mehrdad Sabetzadeh, Shiva Nejati

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型从自然语言描述自动化生成模型,提出LADEX流程,经批判-改进循环,设计变体研究其影响,用两种匹配器评估,实验表明循环可提升结构有效性等,算法结构检查更能实现结构一致性。

Comments Accepted in the Empirical Software Engineering (EMSE) Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20878 2026-07-07 cs.CR 版本更新 85%

Supporting Students in Navigating LLM-Generated Insecure Code

支持学生应对大语言模型生成的不安全代码

Jaehwan Park, Seonhye Park, Kyungchan Lim, Hyoungshick Kim, Doowon Kim

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型生成不安全代码的问题,提出Bifröst框架,通过对抗配置的代码生成模型、VS Code扩展和自动化漏洞报告,为教师提供反馈,助于引导讨论,经学生实验观察到该框架能改变学生对不安全代码的态度。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01827 2026-07-07 cs.SE 版本更新 85%

PSearch: Search-based Patch Generation in the Era of LLM-based Automated Program Repair

PSearch:基于大语言模型的自动程序修复时代中基于搜索的补丁生成

Haichuan Hu, Ye Shang, Weifeng Sun, Quanjun Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有基于大语言模型的自动程序修复方法靠试错生成补丁、难以有效评估搜索方向潜力和分配预算的问题,提出Psearch框架,以迭代补丁评估和优化为核心,能集成不同搜索算法,实验证明其有效性。

Comments accepted to ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06622 2026-07-07 cs.CL 版本更新 84%

UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs

UnpredictaBench:评估大语言模型分布随机性的基准

Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Liang Luo, Ellie Dingqiao Wen, Lele Wang, Giuseppe Carenini, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学) Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出UnpredictaBench基准,通过KS@N指标评估LLM从目标分布(统计分布、随机程序、自然语言场景)采样的能力,发现模型表现差异大且无模型超过40%准确率,表明分布采样能力仍有显著提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16559 2026-07-07 cs.AI 84%

BuildArena: A Physics-Aligned Interactive Benchmark of LLMs for Engineering Construction

BuildArena: 一个对齐物理的LLM交互基准,用于工程建造

Tian Xia, Tianrun Gao, Wenhao Deng, Long Wei, Xiaowei Qian, Chenglei Yu, Tailin Wu

机构 * Tian Xia(夏天) Tianrun Gao(高天run) Wenhao Deng(邓文浩) Long Wei(韦龙) Xiaowei Qian(钱小伟) Chenglei Yu(于成磊) Tailin Wu(吴太林)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本研究提出BuildArena,一个首个对齐物理的LLM交互基准,用于语言驱动的工程建造,通过可扩展的任务设计策略和3D空间几何计算库,评估九个前沿LLM在语言驱动和物理基础的自动化建造中的能力。

Comments ICML 2026, 36 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00392 2026-07-07 cs.SE cs.AI 版本更新 84%

Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents

EvolveTool-Bench:评估LLM生成的工具库作为软件 artifact 的质量

Alibek Kaliyev, Artem Maryanskyy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Uber Technologies(优步科技公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文提出EvolveTool-Bench,通过评估LLM生成的工具库在软件工程流程中的质量,揭示任务完成率之外的软件质量风险,强调需将工具库视为首要软件 artifact。

Comments 11 pages, 4 figures; accepted at KDD 2026 Workshop on Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04686 2026-07-07 cs.CL cs.AI cs.SE 新提交 84%

ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents

ToolFailBench:诊断大语言模型智能体中的工具使用失败

Harsh Soni

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 介绍ToolFailBench诊断基准,用于衡量金融、医学等领域1000个任务中的工具使用失败情况。通过规则分类器和大语言模型裁判标注失败类型,发现模型工具使用存在差异,强调评估应考量多方面。

Comments 18 pages, 3 figures. Published at the Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) and the Workshop on Failure Modes of Agentic AI (FAGEN) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04558 2026-07-07 cs.CL cs.AI cs.LG 新提交 83%

EEG-SpikeAgent: Agentic Closed-Loop Program Synthesis for Automated EEG Spike Detection

EEG-SpikeAgent:用于自动脑电图尖峰检测的智能闭环程序合成

Sonali Santhosh, Kelly Shuhong Yu, Eugene Chang, Jonathan Kim, Kie Shidara, Danilo Bernardo

机构 * Dept. of Brain and Cognitive Sciences, Massachusetts Institute of Technology(脑科学与认知科学系,麻省理工学院) Dept. of Neuroscience, University of California, Berkeley(神经科学系,加州大学伯克利分校) Dept. of Neurology and Neurologic Sciences, Stanford University(神经病学与神经科学系,斯坦福大学) Weill Institute of Neurology and Neurosciences, University of California, San Francisco(Weill神经医学研究所,加州大学旧金山分校) University of California, San Francisco(加州大学旧金山分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究利用大语言模型智能系统,为头皮脑电图尖峰检测生成信号处理特征。核心方法是迭代提出特征模块并执行代码生成表格特征,评估性能后反馈优化。贡献是实现可审核的脑电图特征工程自动化。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02642 2026-07-07 cs.RO 新提交 83%

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

GigaWorld-1:构建用于机器人策略评估的世界模型路线图

GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(巨元人工智能) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 研究机器人策略评估中世界模型,介绍WMBench基准,通过分析多种模型、方案及大量模拟策略展开,得出评估器质量受长期动作忠实性影响等核心见解,推导出设计路线图并实现GigaWorld-1。

Comments Project page: https://open-gigaai.github.io/giga-world-1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22005 2026-07-07 cs.SD 新提交 83%

InstructFX2FX: A Multi-Turn Text-to-Effect System for Sequential Audio Effect Refinement

InstructFX2FX: 用于迭代音频效果优化的多轮文本到预设演示

Song-Ze Yu, Milan Liessens Dujardin, Yuxuan Cai, Wantong Zhang, Brian Cruz, Jeremy Wagner, Carmine-Emanuele Cella

机构 * Center for New Music and Audio Technologies (CNMAT)(新音乐与音频技术中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract)

AI总结 提出InstructFX2FX,一种多轮文本引导的音频效果优化演示,结合语言模型和CLAP引导优化,实现迭代效果调整,相比纯LLM重提示基线将平均MMD降低约24%。

Comments Accepted to DAFx26. Audio demos and source code: https://instructfx2fx.vaclis.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13378 2026-07-07 cs.AI cs.CL cs.IR cs.LG q-bio.QM 版本更新 83%

DrugAgent: Reliable Multi-Agent Integration of Conflicting Biomedical Evidence for Drug-Target Interaction Assessment

DrugAgent:用于药物-靶点相互作用评估的冲突生物医学证据的可靠多智能体整合

Yoshitaka Inoue, Tianci Song, Xinling Wang, Rui Kuang, Tianfan Fu, Augustin Luna

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Computational Biology Branch, National Library of Medicine(国家医学图书馆计算生物学分支) Khoury College of Computer Sciences, Northeastern University(东北大学计算机科学学院) State Key Laboratory for Novel Software Technology at Nanjing University, School of Computer Science, Nanjing University(南京大学新型软件技术国家重点实验室,南京大学计算机科学学院) Developmental Therapeutics Branch, National Cancer Institute(国家癌症研究所发育治疗分支)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究药物-靶点相互作用评估中整合异构数据问题,核心方法是基于大语言模型的多智能体系统DrugAgent,贡献是能进行异构证据支持的DTI评估,补充独立DTI预测,还提供相关策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03644 2026-07-07 cs.CV cs.AI 新提交 83%

Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing

月光石:用于月球遥感的多模态基础模型及基准

Ayush Prasad, Swarnalee Mazumder

机构 * Space and Earth Observation Centre, Finnish Meteorological Institute(芬兰气象研究所空间与地球观测中心) German Climate Computing Centre(德国气候计算中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 针对月球多模态遥感数据分散且无评估机器学习基准的问题,引入月光石基准。贡献包括构建全球月球预训练数据集,提出MG-MAE模型,创建涵盖多任务的基准,其预训练特征在各任务中表现出色。

Comments Accepted for publication in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03585 2026-07-07 cs.LG 新提交 83%

Modular Foundation Models for Time-Series Perception in Digital Twins

数字孪生中用于时间序列感知的模块化基础模型

Quang Hung Pham, Ryad Zemouri, Martin Gagnon, Luc Vouligny

机构 * Hydro-Québec(魁北克水电公司)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 针对数字孪生和PHM系统中时间序列感知挑战,提出基于预训练表示编码器集合的模块化基础模型,利用自监督学习,引入选通机制,支持多下游任务,消融研究验证各部分作用,实验有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20172 2026-07-07 cs.SE cs.LG 83%

Benchmarking Web API Integration Code Generation

Web API集成代码生成的基准测试

Daniel Maninger, Leon Chemnitz, Amir Molzam Sharifloo, Jannis Brugger, Mira Mezini

机构 * Hessian Center for Artificial Intelligence(黑森人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究研究中心ATHENE) Pariton AI

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出WAPIIBench数据集和评估流程,评估LLM生成Web API调用代码的能力,发现现有开源模型在生成API调用时存在显著挑战,如错误端点和参数使用问题。

Comments 17 pages, 3 figures; restored conference version

Journal ref AIware (2025) 240-248

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25533 2026-07-07 cs.CV cs.AI 版本更新 83%

VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models

VISOR++:基于通用视觉输入的大型视觉语言模型转向

Ravikumar Balakrishnan, Mansi Phute

机构 * HiddenLayer, USA(HiddenLayer美国分校) Georgia Institute of Technology, USA(佐治亚理工学院)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究视觉语言模型行为控制,针对现有方法局限,提出VISOR++,通过优化视觉输入实现行为控制,无需运行时访问模型内部,在多模型上验证有效性且能保持无关任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03447 2026-07-07 cs.IR cs.AI cs.CL 新提交 82%

TRIAGE: Trustworthy Retrieval Instrumentation And Graph Evaluation

TRIAGE:可信检索工具与图评估

Axel TahmasebiMoradi, Lucas Schott, Martin Royer

机构 * IRT-SystemX(SystemX研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究基于LLM驱动自动构建的知识图谱评估问题,引入TRIAGE框架,通过特定阶段指标对知识图谱构建与使用各阶段评估,可定位失败环节并给出改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23669 2026-07-07 cs.CV cs.AI cs.LG 版本更新 82%

Estimating Individual Tree Height and Species from UAV Imagery

利用无人机影像估计单株树木高度和树种

Jannik Endres, Etienne Laliberté, David Rolnick, Arthur Ouaknine

机构 * Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学)

专题命中 评测与基准 :foundation model(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出BIRCH-Trees基准,结合三种森林类型数据,引入DINOvTree模型,通过Vision Foundation Model实现高度和树种同时预测,实验表明其在参数效率和预测精度上表现优异。

Comments Accepted to ECCV 2026. Project page: https://RolnickLab.github.io/DINOvTree

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02684 2026-07-07 cs.SE 新提交 82%

Can Coding Agents Implement Missed Compiler Optimizations? Evaluating LLM Agents on LLVM Peephole Optimizations

编码代理能否实现错过的编译器优化?在LLVM窥孔优化上评估大语言模型代理

Hongxu Xu, Chunhao Liao, Xintong Zhou, Chengnian Sun

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究编码代理能否开发编译器优化,引入PeepholeBench框架,其任务来自LLVM的实际窥孔优化问题,通过对比衡量编码代理与人工修复,发现正确性和收益性间存在矛盾及主要失败模式,为编码代理提供了现实且具挑战性的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07155 2026-07-07 cs.CV 82%

CHIMERA: Adaptive Cache Injection and Semantic Anchor Prompting for Zero-shot Image Morphing with Morphing-oriented Metrics

CHIMERA:适应性缓存注入与语义锚点提示的零样本图像变形方法:基于变形导向的度量

Dahyeon Kye, Jeahun Sung, Minkyu Jeon, Jihyong Oh

机构 * Chung-Ang University(Chung-Ang 大学) Princeton University(普林斯顿大学)

专题命中 评测与基准 :prompting(title,abstract);language model(abstract)

AI总结 CHIMERA通过逆向引导去噪和互补特征重用,解决传统图像变形方法中特征重用不充分和文本条件不兼容的问题,提出语义锚点提示和变形导向度量,提升变形效果的平滑性和语义一致性。

Comments ECCV 2026 (camera ready ver.). Please visit our project page at https://cmlab-korea.github.io/CHIMERA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03202 2026-07-07 cs.AI 版本更新 81%

Stop Automating Peer Review Without Rigorous Evaluation

停止在未经严格评估的情况下自动化同行评审

Joachim Baumann, Jiaxin Pei, Sanmi Koyejo, Dirk Hovy

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该立场文通过对比人类与AI生成的ICLR 2026评审结果,指出当前AI评审存在视角趋同、分数易被论文改写操控的问题,主张需建立同行评审自动化科学,而非直接部署未严格评估的通用大模型。

Comments Accepted at ICML 2026 (Oral). Forty-third International Conference on Machine Learning Position Paper Track (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03233 2026-07-07 cs.CR cs.AI cs.IR cs.SI 新提交 81%

Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions

用于开源情报和网络调查的智能与生成式人工智能:分类法、评估、挑战及未来方向

Eduardo Almeida Palmieri, Mohamed Chahine Ghanem, Dipo Dunsin, Zubair Baig, Ed de Quincey, Kim-Kwang Raymond Choo

机构 * School of Computer Science and Mathematics, Keele University(基尔大学计算机科学与数学学院) Cybersecurity Institute, University of Liverpool(利物浦大学网络安全研究所) Department of Applied Computing IICL, University of Wales Trinity Saint David(威尔士特里尼达大学应用计算系) Deakin Cyber Research and Innovation Hub, Deakin University(德金大学网络安全研究与创新中心) Department of Information Systems and Cyber Security, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系与网络安全系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究指出公开数字信息增长使人工开源情报分析不足,大语言模型等成解决方案但评估框架滞后。通过综述74项研究,明确智能人工智能类别,找出幻觉验证差距,映射研究到情报生命周期并给出研究议程。

Comments 36 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30133 2026-07-07 cs.CL 版本更新 81%

CorPipe at CRAC 2026: Empty Nodes and Cross-Lingual Transfer in Multilingual Coreference Resolution

CorPipe at CRAC 2026: 多语言共指消解中的空节点与跨语言迁移

Milan Straka

机构 * Charles University, Faculty of Mathematics and Physics Institute of Formal and Applied Linguistics(查理大学数学与物理系形式与应用语言学研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出CorPipe 26系统,通过单一模型联合预测空节点、提及和共指链接,在CRAC 2026多语言共指消解共享任务中超越所有其他系统,并在LLM赛道和不受限赛道分别领先2.8和9.5个百分点。

Comments Accepted to CODI-CRAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05365 2026-07-07 cs.CL cs.AI eess.AS 新提交 81%

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

SPEARBench:面向流式语音转语音语言模型的自然度评估基准

Thomas Thebaud, Yuzhe Wang, Hao Zhang, Sathvik Manikantan Napa Ugandhar, Ashish Hallur, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velazquez

机构 * Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系) Amazon Inc.(亚马逊公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有基准无法评估流式语音转语音模型对话自然度的问题,构建多维度评估基准SPEARBench,可从多维度评测模型,发现当前模型在多类对话行为维度仍与人类存在差距。

Comments Corresponding Website: https://thomasthebaud.github.io/SPEAR-benchmark-website/#welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04429 2026-07-07 cs.CL cs.AI 新提交 81%

evalci: A Python Library for Statistically Rigorous Comparison of Language Model Evaluations

Evalci:用于语言模型评估统计严格比较的Python库

Shreyas K Chandrahas

机构 * Shreyaskc(Shreyas K Chandrahas)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型评估中仅依单一准确率数字判断优劣的问题,用evalci库通过统计方法处理结果表,给出严谨结论,如置信区间等,还通过案例分析发现部分排行榜差距无统计学意义。

Comments 7 pages, 1 figure. Software: https://pypi.org/project/evalci/ (source: https://github.com/Shreyaskc/evalci, Zenodo DOI: 10.5281/zenodo.21201815)

详情

展开后加载摘要…

URL PDF HTML 收藏