arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 202 篇

2606.01317 2026-06-02 cs.SE cs.CR 89%

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00467 2026-06-02 cs.CL cs.AI cs.LG stat.ML 89%

On the Limits of LLM Adaptability: Impact of Model-Internalized Priors on Annotation Task Performance

论大语言模型适应性的局限:模型内化先验对标注任务性能的影响

Etienne Casanova, Rafal Kocielnik, R. Michael Alvarez

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过毒性检测实验,研究大语言模型内化先验与指令交互的三个维度,发现近三分之二的零样本错误难以通过提示纠正,并引入定义特定熟悉度(DSF)指标,证明其与性能正相关,而文本记忆指标则无此关联。

Comments Accepted at ICML 2026 (Oral & Spotlight); PMLR vol. 306. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00003 2026-06-02 cs.CY cs.CR cs.HC 89%

Learning from Mistakes: Can LLM Self-Recover after Misalignment?

从错误中学习:LLM 在错位后能否自我恢复?

Olga E. Sorokoletova, Francesco Giarrusso, Vincenzo Suriani, Daniele Nardi

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究大语言模型在遭受恶意攻击后,是否具有内在的自我对齐恢复能力,并提出一种建模用户-助手交互安全轨迹并检测恢复趋势的方法。

Comments AAAI'26 Workshop (WS37), Machine Ethics: from formal methods to emergent machine ethics, January 20--27, 2026, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13557 2026-06-02 cs.AR 89%

MACO: A Multi-Agent LLM Framework for Automated CGRA Hardware/Software Co-Design

MACO: 一种用于自动化CGRA硬件/软件协同设计的基于多智能体LLM的框架

Zesong Jiang, Yuqi Sun, Qing Zhong, Mahathi Krishna, Deepak Patil, Cheng Tan, Jeff Zhang

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出MACO框架,通过多智能体LLM协作和指数衰减探索策略,自动化CGRA硬件/软件协同设计,在功耗、性能和搜索效率上分别提升25.9%、20.0%和5倍。

Comments new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17898 2026-06-02 cs.CL 89%

Assessment of Generative Named Entity Recognition in the Era of Large Language Models

大语言模型时代生成式命名实体识别的评估

Qi Zhan, Yile Wang, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL

AI总结 本文系统评估了开源大语言模型在平面和嵌套命名实体识别任务上的性能,发现参数高效微调结合结构化格式可达到与传统模型竞争的性能,且NER能力源于指令遵循和生成能力而非记忆,微调对通用能力影响很小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01252 2026-06-02 cs.CL cs.AI 89%

Understanding LLM Behavior in Multi-Target Cross-Lingual Summarization

理解多目标跨语言摘要中的LLM行为

Sangwon Ryu, Yihong Liu, Mingyang Wang, Yunsu Kim, Jungseul Ok, Gary Geunbae Lee, Hinrich Schuetze

机构 * GSAI, POSTECH(POSTECH认知科学研究院) CSE, POSTECH(POSTECH计算机科学与工程学院) LMU Munich(慕尼黑大学) MCML LILT(语言信息实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对多目标跨语言摘要任务,提出MEA基准并分析LLM内部机制,发现翻译和摘要行为在后期层联合出现,并引入推理时激活引导方法提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05913 2026-06-02 cs.CL cs.AI 89%

NILC: Discovering New Intents with LLM-assisted Clustering

NILC:利用LLM辅助聚类发现新意图

Hongtao Wang, Renchi Yang, Wenqing Lin

机构 * Hong Kong Baptist University(香港 Baptist 大学) JD.com(京东公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出NILC框架,通过迭代聚类结合大语言模型优化质心和文本嵌入,实现无监督和半监督新意图发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00462 2026-06-02 cs.CL cs.AI cs.LG 89%

Short-form Text Rewriting with Phi Silica

短文本改写与 Phi Silica

Divya Tadimeti, Shawn Pan, Sameera Lanka, Chenghui Zhou, Sadid Hasan

机构 * IEEE ICAD

专题命中 评测与基准 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过数据集整理、提示蒸馏、参数高效微调和评估,将小语言模型 Phi Silica 适配于短文本改写任务,结果表明微调提高了语义保真度、减少了幻觉并提升了与 GPT-5-chat 改写的偏好胜率。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20638 2026-06-02 cs.CL cs.AI cs.LG 89%

Uncovering Competency Gaps in Large Language Models and Their Benchmarks

揭示大型语言模型及其基准测试中的能力差距

Maty Bohacek, Nino Scherrer, Nicholas Dufour, Thomas Leung, Christoph Bregler, Stephanie C. Y. Chan

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于稀疏自编码器概念激活的新方法,自动发现模型在细粒度概念上的弱点(模型差距)和基准测试覆盖不平衡(基准差距),并通过内部表示评估和跨基准比较进行验证。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02215 2026-06-02 cs.CL cs.SI 89%

Better with Experience: Self-Evolving LLM Agents for Evidence-Grounded Health Community Notes

经验更优:用于证据基础健康社区笔记的自进化LLM智能体

Zihang Fu, Fanxiao Li, Jianyang Gu, Haonan Wang, Preslav Nakov, Bryan Hooi, Min-Yen Kan, Jiaying Wu

机构 * National University of Singapore(国立新加坡大学) Yunnan University(云南大学) The Ohio State University(俄亥俄州立大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出EvoNote框架,通过自进化经验记忆和细粒度信用分配,在健康社区笔记生成中实现证据获取、分析与撰写,显著提升笔记质量并缩短生成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10234 2026-06-02 cs.HC cs.AI 89%

InFerActive: Interactive Tree-Based Exploration of LLM Sampling for Safety Evaluation

InFerActive: 基于交互式树的安全评估中LLM采样探索

Junhyeong Hwangbo, Soohyun Lee, Hyeon Jeon, Kyochul Jang, Minsoo Cheong, Youngjae Yu, Jinwook Seo

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出InFerActive系统,通过广度优先采样构建可导航短语树,提升LLM安全评估中低概率有害输出的覆盖率和效率,相比随机采样减少5倍样本量。

Comments v2: Revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02111 2026-06-02 cs.CV cs.AI cs.CL 88%

Jailbreaking Multimodal Large Language Models using Multi-Clip Video

使用多片段视频破解多模态大语言模型

Choongwon Kang, Seungjong Sun, Hyunmin Jun, Jang Hyun Kim

机构 * Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) Department of Human-Artificial Intelligence Interaction, Sungkyunkwan University(人机交互系,成均馆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MCV SafetyBench数据集,通过多片段视频评估多模态大语言模型的安全漏洞,发现视频模态比图像更脆弱,动态和多样化上下文增加攻击成功率,并基于图像模态的鲁棒性提出防御策略。

Comments 27 pages, 20 figures, Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01845 2026-06-02 cs.CL cs.AI 88%

Unveiling the Limits of Large Language Models in Inferring Pragmatic Meaning from Non-Verbal Responses

揭示大型语言模型在推断非语言回应中的语用意义的局限性

Sugyeong Eo, Heuiseok Lim

机构 * Department of Software, Yonsei University Mirae Campus(燕山大学软件系) Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究首次系统评估大型语言模型(LLMs)从纯非语言回应对话中推断语用意义的能力,发现其准确率相比语言回应下降高达60%,并表明上下文学习有助于语用推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24069 2026-06-02 cs.LG cs.AI 88%

Can LLMs Reason Structurally? Benchmarking via the Lens of Data Structures

LLM 能否进行结构性推理?通过数据结构视角进行基准测试

Yu He, Yingxi Li, Colin White, Ellen Vitercik

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 DSR-Bench 基准,通过 20 种数据结构、35 种操作和 4140 个问题实例评估 LLM 的结构性推理能力,发现顶级模型在挑战性实例上仅得 0.46/1,且在空间数据、上下文丰富场景及自身代码推理上表现不佳。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01210 2026-06-02 cs.DB 88%

Can we trust LLM Self-Explanations for Entity Resolution?

我们能信任大语言模型在实体解析中的自解释吗?

Tommaso Teofili, Donatella Firmani, Nick Koudas, Paolo Merialdo, Divesh Srivastava

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究系统评估了大语言模型在实体解析任务中自解释的可靠性,发现其不稳定且不忠实,并提出混合解释框架Uncerta以平衡解释质量与计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01703 2026-06-02 cs.SD cs.AI cs.CV 88%

JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions

JenBridge: 跨场景转换的自适应长视频配乐

Jiashuo Yu, Yao Yao, Boyu Chen, Alex Wang

机构 * Jen Music AI

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出JenBridge框架,通过基于Transformer的生成模型、双文本-视觉条件对齐和LLM代理驱动的自适应过渡机制,实现长视频配乐的高保真生成与场景转换自然连贯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07356 2026-06-02 cs.LG 88%

Controllable Value Alignment in Large Language Models through Neuron-Level Editing

大语言模型中通过神经元级编辑的可控价值对齐

Yonghui Yang, Yihui Wang, Junwei Li, Jilong Liu, Fengbin Zhu, Weibiao Huang, Le Wu, Richang Hong, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Hefei University of Technology(合肥工业大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ST Engineering Ltd.(ST工程有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 提出NeVA框架,通过识别稀疏价值相关神经元并进行推理时激活编辑,实现细粒度可控价值对齐,减少价值泄漏并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02423 2026-06-02 cs.CL cs.LG 88%

Investigating and Alleviating Harm Amplification in LLM Interactions

调查和缓解大语言模型交互中的危害放大

Ruohao Guo, Wei Xu, Alan Ritter

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出HarmAmp基准和TrajSafe监控器,用于评估和缓解多轮对话中大语言模型对危害的放大效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00334 2026-06-02 cs.CL cs.AI 88%

Isolating LLM Lexical Bias: A Curation-Free Triangulated Metric for Preference-Stage Learning

隔离LLM词汇偏差:一种无人工标注的三角化偏好学习阶段度量

Xiaoyang Ming, Jose Hernandez, Thomas Stephan Juzek

机构 * Florida State University(佛罗里达州立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需人工标注的三角化偏好偏移分数(Triangulated Preference Shift score),通过对比人类标准、基础模型和指令变体,量化偏好学习阶段引入的词汇偏差。

Comments 7 pages, 2 figures, 1 table

Journal ref The International FLAIRS Conference Proceedings, 39(1) (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11283 2026-06-02 cs.CV 88%

Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey

多模态大语言模型驱动的视频翻译:面向角色的综述

Bingzheng Qu, Kehai Chen, Xuefeng Bai, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文通过面向角色的分类法,系统综述了多模态大语言模型在视频翻译中的应用,将其分为语义推理器、表达执行器和视觉合成器三个功能角色,并总结了数据集、基准和评估指标,指出了端到端视频翻译的挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18008 2026-06-02 cs.LG cs.AI cs.CL 88%

Are LLMs Ready for Neural-integrated Mechanistic Modeling? A Benchmark and Agentic Framework

LLM 是否准备好进行神经集成机制建模?一个基准测试与智能体框架

Zihan Guan, Rituparna Datta, Mengxuan Hu, Shunshun Liu, Aiying Zhang, Prasanna Balachandran, Sheng Li, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出神经集成机制建模(NIMM)基准测试,评估大语言模型在三个科学领域构建神经集成机制模型的能力,并设计树引导的智能体框架 NIMMGen,通过分支级搜索和原子模型细化显著提升搜索稳定性和解质量。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30848 2026-06-02 cs.CR cs.CL 87%

LLM Anonymization Against Agentic Re-Identification

LLM匿名化对抗智能体重识别

Ziwen Li, Jianing Wen, Tianshi Li

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院) Northeastern University(东北大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出AURA框架,通过掩码-重构方法解耦隐私定位与效用保留,并利用对抗性隐私和效用检查,以抵抗基于网络搜索的智能体重识别攻击,同时保留文本的上下文效用。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14782 2026-06-02 cs.CL 87%

Lessons from the Trenches on Reproducible Evaluation of Language Models

关于语言模型可重复评估的前线经验教训

Stella Biderman, Hailey Schoelkopf, Lintang Sutawika, Leo Gao, Jonathan Tow, Baber Abbasi, Alham Fikri Aji, Pawan Sasanka Ammanamanchi, Sidney Black, Jordan Clive, Anthony DiPofi, Julen Etxaniz, Benjamin Fattori, Jessica Zosa Forde, Charles Foster, Jeffrey Hsu, Mimansa Jaiswal, Wilson Y. Lee, Haonan Li, Charles Lovering, Niklas Muennighoff, Ellie Pavlick, Jason Phang, Aviya Skowron, Samson Tan, Xiangru Tang, Kevin A. Wang, Genta Indra Winata, François Yvon, Andy Zou

机构 * MBZUAI IIIT Hyderabad EleutherAI HiTZ Center - Ixa, UPV/EHU Ivy Natal University of Michigan HubSpot LibrAI Kensho Contextual AI Brown University New York University Amazon Yale University HKUST Sorbonne University CMU

专题命中 评测与基准 :language model(title,summary_cn);分类 cs.CL

AI总结 本文基于开发Language Model Evaluation Harness框架的三年经验,总结了语言模型评估中面临的方法论挑战、缺乏可重复性和透明度等问题,并提供了改进评估严谨性和信心的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01584 2026-06-02 cs.CL cs.AI 87%

Identifying High-Confidence Social Biases in LLMs for Trustworthy Conversational Tutoring Agents

识别LLM中高置信度的社会偏见以构建可信的对话辅导代理

Aitor Arronte Alvarez, Naiyi Xie Fincham

机构 * University of Hawaii at Manoa(夏威夷大学马诺亚分校)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过生成对话数据集,评估大型语言模型在辅导场景中检测社会偏见的能力,发现模型在对话上下文中比基准测试更难检测偏见,且对错误判断过度自信,影响推理和反馈。

Comments Accepted for AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01498 2026-06-02 cs.CL cs.AI 87%

TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning

TimeSage-MT:用于评估智能时间序列推理的多轮基准测试

Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao, Stefan Zohren, Anna Vettoruzzo, Joaquin Vanschoren, Ming Jin, Qingsong Wen

机构 * University of Oxford(牛津大学) VulpiVox Intelligence Eindhoven University of Technology(埃因霍温理工大学) Griffith University(格里菲斯大学) Squirrel Ai Learning East China Normal University(华东师范大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TimeSage-MT多轮基准测试,包含240个任务和2680轮对话,覆盖8个真实领域,用于评估LLM智能体在时间序列推理中的表现,揭示其在决策导向任务中的性能下降及记忆、不确定性处理等缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01260 2026-06-02 cs.CL cs.AI 87%

IndoBias: A Dual Track Culturally Grounded Benchmark for LLMs Bias Evaluation in Indonesian Languages

IndoBias:印尼语言中大语言模型偏见评估的双轨文化基准

Ikhlasul Akmal Hanif, Muhammad Falensi Azmi, Filbert Aurelian Tjiaranata, Eryawan Presma Yulianrifat, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能大学) Universitas Indonesia(印度尼西亚大学) Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出IndoBias基准,通过深度和广度双轨评估,发现现有LLM在印尼语和三种地方语言中表现出显著偏见,且预训练数据来源和语言多样性影响偏见程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02282 2026-06-02 cs.AI 86%

POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems

POIROT: 在多智能体系统中审讯智能体以进行故障检测

Iñaki Dellibarda Varela, R. Sendra-Arranz, Pablo Romero-Sorozabal, J. M. Valverde-García, Annemarie F. Laudanski, Álvaro Gutiérrez, Eduardo Rocon, Manuel Cebrian

机构 * Center for Automation and Robotics, Spanish National Research Council (CSIC-UPM)(自动化研究中心,西班牙国家科研 council (CSIC-UPM))

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出POIROT协议,利用多智能体系统自身的智能体作为诊断层进行故障检测,在复杂问题、多智能体和复合故障条件下优于单LLM评估基线。

Comments 44 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00815 2026-06-02 cs.LG 86%

OmniEEG-Bench: A Standardized Evaluation Benchmark for EEG Foundation Models

OmniEEG-Bench: 脑电图基础模型的标准化评估基准

Ziling Lu, Zongsheng Li, Xinke Shen, Kexin Lou, Yingyue Xin, Xiaoqi Chen, Shinan Wang, Xiang Chen, Jiahao Fan, Chenyu Huang, Xin Xu, Zhoujie Hou, Chen Wei, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学生物医学工程系,深圳,中国) School of Computer Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)计算机科学与工程学院,深圳,中国) Omni-Intelligence, Shenzhen, China(奥米智能,深圳,中国) Shenzhen Loop Area Institute, Shenzhen, China(深圳环城研究院,深圳,中国)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.LG

AI总结 针对脑电图基础模型评估碎片化问题,提出统一基准OmniEEG-Bench,涵盖六类任务、54个数据集,并揭示预训练数据多样性和模型大小与性能的缩放律关系。

Comments 28 pages, 13 figures, 8 tables; benchmark of EEG foundation models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00873 2026-06-02 cs.CY 86%

Prompts for Public-Sector LLMs Should Be Governed as Commons

公共部门LLM的提示应作为公共资源进行治理

Rashid Mushkani

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出公共部门部署大型语言模型时使用的提示应作为受治理的制品,而非私有临时输入,并设计了带版本控制、社区维护的提示模板仓库及协商集成方法。

Comments To appear in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26169 2026-06-02 cs.SE cs.LO 86%

ESBMC: A Survey of Its Evolution, Integration, and Future Directions in Formal Software Verification

ESBMC:形式化软件验证的演化、集成与未来方向综述

Pierre Dantas, Lucas Cordeiro, Waldir Junior

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了ESBMC从研究原型发展为工业级形式化验证平台的过程,涵盖其技术演进、语言支持扩展、与LLM及AI代理的集成,并总结了其获奖、经济影响及未来挑战。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏