arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-20 至 2026-08-20 共收录 283 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 72 篇

2508.20468 2026-08-20 cs.CL 版本更新 88%

ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety

ConspirED:一个用于研究阴谋论认知特质与大语言模型安全性的数据集

Luke Bates, Max Glockner, Preslav Nakov, Iryna Gurevych

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究推出首个标注阴谋内容通用认知特质的CONSPIRED数据集,利用其开发识别阴谋特质的计算模型,并发现大语言模型易被阴谋框架误导而复制其修辞模式。

Comments Accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18091 2026-08-20 cs.CL cs.AI 新提交 88%

Self- and Other-Labels Induce Bidirectional Bias in LLM Judges

自标签与他标签诱导大语言模型评判器产生双向偏差

Songeun Chae, Min Kim, Donghoon Jung, Seojin Choi, Seohyon Jung

机构 * School of Digital Humanities and Computational Social Sciences, KAIST(韩国科学技术院数字人文与计算社会科学学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 该研究针对LLM评判器的自偏好混杂问题,通过评估带模型特征的叙事约束选择,发现控制质量后自偏好消失,而自/他标签会双向影响评分,明确了作者归属是评估偏差的独立驱动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18554 2026-08-20 cs.CY cs.AI cs.MA econ.GN 新提交 87%

CentaurBench: Benchmarking LLM Capabilities on Augmenting vs. Automating Real-World Work Tasks

CentaurBench:评估大型语言模型在增强与自动化现实工作任务方面的能力

Pattaraphon Kenny Wongchamcharoen, Kris Gulati, Min Min Fong, Abhishek Nagaraj

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 CentaurBench基准测试显示LLM的自动化能力与辅助能力仅适度相关,多数自动化优胜者在增强任务中表现不佳,辅助效果并非始终为正,表明需按模型在多智能体系统中的角色评估模型。

Comments 46 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18289 2026-08-20 cs.AI cs.CR cs.IR cs.LG 新提交 87%

Evaluating Structured Information Extraction with Open Models in a High Risk Public Sector Application

在高风险公共部门应用中使用开源模型评估结构化信息提取

Elias Schubert, Felix Bießmann

机构 * Berlin University of Applied Sciences(柏林应用科学大学) Einstein Center Digital Future(爱因斯坦数字未来中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对欧盟AI法案高风险公共部门应用场景,构建基准评估开源OCR、LLM、VLM在学生申请处理任务的性能,发现零样本下多数模型表现差,输入结构保留是关键因素。

Comments Accepted at Workshop on Systems Over Models: What Actually Works in Industry (SOMI-2026) at ECML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26643 2026-08-20 cs.AI cs.LG 版本更新 87%

Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting

重新思考自进化:缓解技能过拟合的约束探索-利用过程

Hongqiang Lin, Chao Liu, Xiaofan Bai, Xuan Jin, Yuhong Li, Nenggan Zheng, Xipeng Cao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体技能过拟合问题,提出SkillBoost三阶段框架,在23种模型-基准配置上达SOTA性能,优化后技能可跨智能体复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18671 2026-08-20 cs.CV 新提交 85%

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能

Mohammad Zamani, Fatemeh Ziaeetabar

机构 * University of Tehran(德黑兰大学)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);prompting(abstract)

AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18423 2026-08-20 cs.AI 新提交 84%

FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents

FM-Bench:用于多智能体竞争的长周期管理基准

Tianyou Wang, Chongyang Gao, Kezhen Chen, Chen Dong, Yinghao He, Donghan Li, Wangcheng Xu, Hongjiu Zhang, Chi Li

机构 * AnalogyAI

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出FM-Bench基准,通过足球管理任务评估15个前沿LLM智能体的长周期决策能力,发现模型管理行为而非计算能力决定得分,排名与模型规模、价格或供应商无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18433 2026-08-20 cs.RO cs.LG 新提交 83%

The Embodiment Gap in Robot Foundation Models

机器人基础模型中的具身差距

Yukiyasu Domae, Keisuke Shirai, Hanbit Oh, Ryoichi Nakajo, Tomohiro Motoda, Koshi Makihara, Masaki Murooka, Takuma Yagi, Yoshiaki Bando, Ryo Hanai

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(日本国立先进工业科学技术研究院(AIST))

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本综述定义机器人基础模型的具身差距,通过双轴图分类方法,从三个研究方向考察近期工作,提出报告框架以助力跨具身学习的评估与未来研究。

Comments 32 pages, 4 figures. Published in Transactions on Machine Learning Research (TMLR), August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18911 2026-08-20 cs.LG cs.CE 新提交 81%

Converting Expert Deliberation into Financial Signals Through A Context-Aware NLP Pipeline

通过上下文感知的NLP流水线将专家审议转化为金融信号

Vivek Batra, Kristin Chen, Sanjiv Das, Samuel Judge, Harshad Khadilkar, Sukrit Mittal, Amir Nasrollahzadeh, Daniel Ostrov, Jacob Sisk

机构 * Franklin Templeton Investments(富兰克林邓普顿投资公司) Blend360(Blend360公司) Santa Clara University(圣克拉拉大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出CDSP流水线将投资委员会会议记录转化为金融特征,经实验其结合句子嵌入与CDSP特征的模型预测准确率达73%,证实专家审议含前瞻性金融信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18888 2026-08-20 cs.CL 新提交 81%

Assessing Quality of Experience in Natural Language Generation of German Text

评估德语文本自然语言生成中的体验质量

Dinh Nam Pham, Shushen Manakhimova, Vivien Macketanz, Sebastian Möller

机构 * Technische Universität Berlin(柏林工业大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对德语NLG,构建了含人工评分的TextQ-German数据集,开发出混合等自动QoE预测模型,为NLG评估提供了公开资源与基线,助力贴合人类感知的NLG系统开发。

Comments Dataset available at this https URL (https://github.com/DFKI-NLP/TextQ/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18836 2026-08-20 cs.AI 新提交 81%

Verifiable abstention makes AI leak diagnosis accountable in water distribution networks

可验证弃权使AI在供水管网泄漏诊断中具备可问责性

Tianwei Mu, Yue Wang, Mingzhe Yuan, Manhong Huang, Wenhong Wang, Xuerui Yin, Qing Luo, Min Xiao, Hui Yang, Jun Li, Dan Xue

机构 * School of Municipal Engineering and Environment, Shenyang Jianzhu University(沈阳建筑大学市政工程与环境学院) Guangzhou Institute of Industrial Intelligence(广州工业智能研究院) College of Environment, Shenyang University(沈阳大学环境学院) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) College of Environmental Science and Engineering, State Environmental Protection Engineering Center for Pollution Treatment and Control in Textile Industry, Donghua University(东华大学环境科学与工程学院(国家环境保护纺织污染防治工程技术中心)) School of Information Science and Engineering, Shenyang University of Technology(沈阳工业大学信息科学与工程学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对供水管网泄漏诊断中AI缺乏问责性的问题,提出结合执行器智能体、监督智能体与LLM审计员的可验证弃权决策方法,提升了决策精度与挖掘正确性,为自主水基础设施运营提供可行路径。

Comments 42 pages, 5 main figures, 1 main table, 2 extended data figures, 3 supplementary figures, 15 supplementary tables. Code and data availability described in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18660 2026-08-20 cs.LG 新提交 81%

Computational Measurement of Team-Process Phase Dynamics in Collaborative Virtual Reality

协作虚拟现实中团队过程阶段动态的计算测量

Qing Huang, Jianing Zhang, Pooja Pol

机构 * School of Business, Technical University of Applied Sciences Augsburg(奥格斯堡应用技术大学商学院) Data Science und Autonome Systeme Technologietransferzentrum (TTZ)(数据科学与自主系统技术转移中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出计算框架,从协作VR游戏带时间戳对话检测团队过程阶段,经评估其可识别连贯阶段结构,为分析协作活动提供透明可迁移方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18104 2026-08-20 cs.AI 新提交 81%

Self-Evolving Agents as Dynamic Graph Transformation: A Survey and New Perspective

自进化智能体作为动态图变换:一项综述与新视角

Yuanyuan Xu, Wenjie Zhang, Yin Chen, Xuemin Lin, Ying Zhang

机构 * School of Computer Science and Engineering, The University of New South Wales(新南威尔士大学计算机科学与工程学院) Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼科技大学工程与信息技术学院) School of Data Science, The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)数据科学学院) Zhejiang Gongshang University(浙江工商大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本综述将自进化智能体建模为动态图变换,梳理相关动态图方法分类,提出动态图学习作为智能体可复用基础设施,探讨图感知评估协议,为自进化智能体设计治理提供结构性视角。

Comments Project: this https URL (https://github.com/LuckyGirl-XU/Awesome-Agent-Dynamic-Graphs.git)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18097 2026-08-20 cs.CL 新提交 81%

FrenchNews-7: Benchmarking Cross-Publisher French News Editorial Desk Classification

FrenchNews-7:跨出版商法国新闻编辑部分类基准

Amr Sobhy

机构 * Le French News Lab(法国新闻实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究构建了跨出版商法语新闻编辑部分类基准FrenchNews-7,采用微调CamemBERT分类器,实验显示其在召回率上优于零样本LLM基线,为新闻分类研究提供了可靠基准。

Comments 15 pages, 5 figures, includes appendices. Model and dataset available on HuggingFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17756 2026-08-20 cs.AI 版本更新 81%

D$^2$ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory

D²ACCI:一种用于保留证据的智能体记忆的双循环诊断协议

Xule Liu, Yijun Liu, Chao Li, Shao Kun

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对LLM智能体持久记忆流程故障难以定位的问题,提出双循环诊断协议D²ACCI,引入DCR指标与D²ACCI-Eval人工制品,在三个公开基准上取得明确性能增益,填补了记忆系统迭代缺乏可追踪证据的空白。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00735 2026-08-20 cs.CR cs.AI cs.SE 版本更新 81%

`From Prompt to Perturbation': An Adaptive Framework for Voice-Based Jailbreaks on Audio LLMs

从提示到扰动:针对音频大语言模型的自适应语音越狱框架

Linghan Huang, Bo Li, Huaming Chen, Kim-Kwang Raymond Choo

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) University of Chicago(芝加哥大学) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有音频越狱攻击研究仅聚焦单一范式的不足,提出自适应越狱框架,可在统一设置下评估级联流水线和LALM,实验显示其攻击成功率优于现有方法。

Comments Accepted at the IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18303 2026-08-20 cs.AI cs.LG 新提交 81%

SESSE: Sketch, Expand, Sort, Summarize, Evaluate -- LLM-as-Judge Evaluation via Structured Decomposition

SESSE:草图、扩展、排序、总结、评估——通过结构化分解的大模型作为评判者的评估

Dae Lee, Mihai Delgeanu, Adel Youssef

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对大模型作为评判者评估无法分离质量维度等问题,提出无需训练的SESSE框架,在RewardBench上实现与基线近乎相当的性能,且可提供可解释的审计跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19816 2026-08-20 cs.SD cs.AI cs.LG 版本更新 81%

Whole-Piece Training for Symbolic Music Language Models via Full-Horizon Compressed Recurrence

深度结构音乐递归:预算递归注意机制用于完整乐谱符号建模

Yungang Yi, Weihua Li, Matthew Kuo, Catherine Shi, Quan Bai

机构 * Auckland University of Technology, Auckland, New Zealand(奥克兰理工大学) University of Tasmania, Tasmania, Australia(塔斯马尼亚大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出双尺度DSMR模型,通过递归注意机制和预算约束实现高效完整乐谱符号建模,实现更低内存占用和更高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15565 2026-08-20 cs.AI 版本更新 79%

Admission Without Answers: Label-Free Certification and Experience Learning for LLM-Based Optimization Modeling

无答案准入:基于大语言模型的优化建模的无标注认证与经验学习

Junbo Jacob Lian, Huiling Chen, Hanzhang Qin, Chung-Piaw Teo

机构 * Institute of Operations Research and Analytics(运营研究与分析研究所) National University of Singapore(新加坡国立大学) Wenzhou Buyi Pharmacy(温州布衣药房) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Wenzhou University(温州大学)

专题命中 评测与基准 :LLM(title);prompting(abstract);分类 cs.AI

AI总结 本文提出AdmitOR这一无标注准入机制,通过跨家族团校准阈值实现模型接纳,在优化建模任务中显著提升接纳精度并减少污染接纳,为无标注场景下的模型准入提供了新方案。

Comments Code and data are available at this https URL (https://github.com/junbolian/AdmitOR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18595 2026-08-20 cs.SE 新提交 78%

OdinEval: A Reproducible Benchmark for LLM-Based Program Repair in the Odin Programming Language

OdinEval:用于基于大语言模型的Odin编程语言程序修复的可复现基准测试

Bang Xie, Hao Liu, Zhiyuan Peng, Xin Yin, Senjian Zhang, Yuan Luo, Chenhao Ying, Haiming Jin, Wei Chen, Shaocong Long, Zhenyu Shi

专题命中 评测与基准 :LLM(title);language model(abstract)

AI总结 针对Odin语言程序修复的空白,本文构建可复现基准OdinEval,评估6个语言模型,Kimi-K3解决率66.7%、Qwen3.8-Max复现率96.4%,发布配套多类资源。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18588 2026-08-20 cs.SE 新提交 78%

AppEval: A Unified Benchmark for LLM-Based Mobile Application Repair in ArkTS, Swift, and Kotlin

AppEval:面向基于大语言模型的ArkTS、Swift及Kotlin移动应用修复的统一基准

Bang Xie, Hao Liu, Zhenyu Shi, Yonghao Zhang, Senjian Zhang, Zhiyuan Peng, Xin Yin, Chenhao Ying, Yuan Luo, Wei Chen, Haiming Jin, Shaocong Long, Xu Liu, Zhe Peng

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本研究提出AppEval基准框架,评估基于大语言模型的移动应用修复智能体在ArkTS、Swift、Kotlin平台的表现,发现其性能因智能体而异,且运行时感知的接受标准对有意义的比较至关重要。

Comments 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18184 2026-08-20 cs.CV 新提交 78%

Human-Centric Intelligence in the Era of Foundation Models: A Survey

基础模型时代的以人为中心的智能:一项综述

Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Peking University(北京大学) University of Southern Queensland(南昆士兰大学) Tongji University(同济大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Beijing Institute of Technology(北京理工大学) The University of Sydney(悉尼大学) University of Trento(特伦托大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文针对基础模型时代以人为中心的智能进展碎片化问题,提出全谱人类上下文分类法,梳理其方法基础、相关方法与资源,探讨挑战方向,为该领域推进提供参考。

Comments GitHub Repo: this https URL (https://github.com/cseeyangchen/Human-Centric-AI;) Project Page: this https URL (https://cseeyangchen.github.io/Human-Centric-AI/homepage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17809 2026-08-20 cs.CV 版本更新 78%

Million-scale multimodal pollen microscopy with expert-guided foundation models

百万级多模态花粉显微镜图像与专家引导的基础模型

András Biricz, Björn Gedda, Donát Magyar, Antonio Spanu, János Fillinger, Péter Pollner, István Csabai

机构 * Department of Physics of Complex Systems, ELTE Eötvös Loránd University(ELTE罗兰大学复杂物理系) The Palynological Laboratory at the Swedish Museum of Natural History(瑞典自然历史博物馆孢粉学实验室) National Centre for Public Health and Pharmacy(国家公共卫生与药品中心) INRAE, UR 546 BioSP, Site Agroparc(法国国家农业、食品与环境研究院,UR 546 BioSP,阿格罗帕克园区) National Korányi Institute for Pulmonology(国家科拉尼肺病研究所) Health Data Science and AI Knowledge Centre, Health Services Management Training Centre, Faculty of Health and Public Administration, Semmelweis University(塞梅维什大学健康与公共管理学院卫生服务管理培训中心健康数据科学与人工智能知识中心) Department of Biological Physics, ELTE Eötvös Loránd University(ELTE罗兰大学生物物理系)

专题命中 评测与基准 :foundation model(title);language model(abstract)

AI总结 提出百万级多模态花粉显微镜数据集Pollen AI Atlas,结合专家引导的视觉-语言模型生成形态描述,实现跨区域、跨设置的高精度花粉识别与检索。

Comments 31 pages, 5 main figures, supplementary information included. Submitted to Scientific Reports. v2: clarified reporting of taxonomic scope, captioning settings, backbone configuration, and evaluation details; no changes to numerical results or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19011 2026-08-20 cs.CR cs.AI 新提交 77%

From Threat Intelligence to Detection: Knowledge-driven Enrichment and Template-based Rule Grounding for Automated Sigma Rule Generation

从威胁情报到检测:知识驱动的丰富化与基于模板的规则落地用于自动化Sigma规则生成

Sepehr Ghaffarzadegan, Boubakr Nour, Makan Pourzandi, Mourad Debbabi, Chadi Assi

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本研究设计了AUTOSIGMA,结合知识驱动丰富化等技术,将非结构化CTI报告自动生成Sigma规则,其在多项指标上优于其他方案。

Comments Submitted for publication and currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18296 2026-08-20 cs.CY cs.AI 新提交 77%

FairGlucose: A CGM Fairness Benchmark Reveals Subgroup Disparities Hidden in Population-Level Validation

FairGlucose:揭示人群水平验证中隐藏亚组差异的CGM公平性基准

Junjie Luo, Xuzhe Zhi, Rui Han, Abhimanyu Kumbara, Anand K. Iyer, Mansur E. Shomali, Ritu Agarwal, Guodong Gordon Gao

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 研究构建FairGlucose基准,发现CGM预测模型人群水平验证掩盖亚组差异,T1D患者误差更高,前沿LLM表现逊于专业神经模型,推动数字健康AI采用亚组分层公平评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18744 2026-08-20 cs.AI cs.CL cs.SE 新提交 73%

Metrics That Write Themselves: Evolving an Evaluator from Its Own Blind Spots

自动生成的评估指标:从自身盲点进化评估器

Xing Zhang, Yanwei Cui, Guanghui Wang, Zhihao Lin, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出EvalCEGAR方法,借鉴程序验证的反例引导抽象精化进化自动评估指标,在MBPP+等基准上缩小评分差距,效果优于人工算子且无需模型调用费用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18164 2026-08-20 cs.CL cs.AI cs.CR 新提交 73%

Are LLMs Safe Beyond Text: Do Emojis Expose Gaps in Safety Evaluation

M P V S Gopinadh

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 3 pages. Accepted at ACL 2026 Workshop on Evaluation in Practice: Methodological Rigor, Sociotechnical Perspectives, & Community Collaboration (EvalEval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18131 2026-08-20 cs.AI cs.CL cs.CY 新提交 73%

Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs

安全对齐错觉:大语言模型中的跨语言安全差距

Namya Bhatnagar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对 LLMs 安全对齐以英语为中心导致的跨语言偏见问题,提出多语言评估基准 INCLUDE,评估十款 LLMs 后发现孟加拉语在开源模型中偏见最高、英语在开源与闭源模型中偏见表现反转的现象。

Comments 7 pages, 8 figures, submitted to IEEE SLT (Spoken Language Technology) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18102 2026-08-20 cs.CL cs.LG stat.ML 新提交 73%

Stability-Aware Feature Design for Robust Watermark Detection in Machine-Generated Text

面向机器生成文本鲁棒水印检测的感知稳定性特征设计

Sina Mansouri, Mohit Marvania, Abolfazl Safikhani

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对机器生成文本水印检测在多次释义及短文本场景下性能骤降的问题,提出PSS检测框架,结合多类特征与稳定性得分,在多基准数据集和多模型测试中显著提升检测AUC,且通用分类器跨域泛化性强。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16645 2026-08-20 cs.AI cs.CL cs.MA 版本更新 73%

Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies

重构:从预发表参考文献中恢复研究思路的盲基准

Shaolong Chen, Yanlin Fei, Nazhou Liu, Xinmiao Yu, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Stanford University(斯坦福大学) Titan Holdings(泰坦控股公司) Prentis AI(普伦蒂斯人工智能公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Reconstruction盲基准,测试语言模型从预发表参考文献恢复论文思路的能力,发现多智能体流水线可将匹配率提升约2.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏