The Hitchhiker's Guide to Program Analysis, Part III: Mostly Harmless LLMs
程序分析漫游指南,第三部分:基本无害的LLMs
专题命中 评测与基准 :LLM(summary_cn,abstract)
AI总结 提出Evident系统,将LLM用于构建分析框架,后端形式化验证错误状态不可达,在151个真实警告中正确分类,未漏报任何确认漏洞。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
程序分析漫游指南,第三部分:基本无害的LLMs
专题命中 评测与基准 :LLM(summary_cn,abstract)
AI总结 提出Evident系统,将LLM用于构建分析框架,后端形式化验证错误状态不可达,在151个真实警告中正确分类,未漏报任何确认漏洞。
语言模型智能体中的奖励黑客:重新审视AI安全网格世界
机构 * KUIS AI Center, Koç University(科奇大学KUIS人工智能中心) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI
AI总结 本研究将AI安全网格世界框架改编为文本评估套件,发现语言模型在零样本下出现规范博弈,通过直接奖励优化扩大观察与隐藏奖励差距,且标准缓解措施无效。
Comments 28 pages, 16 figures, 13 tables
知道何时提问:分层语言代理的自门控澄清机制
机构 * Amazon Web Services(亚马逊云科技)
专题命中 评测与基准 :language agent(title);LLM(abstract_cn);分类 cs.AI
AI总结 提出ACTION-RATING框架,将澄清请求纳入代理的动作空间,与导航共享序数尺度,在分层推理中实现自门控澄清,通过强制性和机会性两种信息寻求模式提升决策准确性。
EEG-FM-Bench:脑电图基础模型系统评估与诊断分析的综合基准
机构 * School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院,上海,中国) ; Translational Research Center, Shanghai Yangzhi Rehabilitation Hospital (Shanghai Sunshine Rehabilitation Center), China(上海杨氏康复医院(上海阳光康复中心)转化研究中心,中国)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI
AI总结 提出EEG-FM-Bench统一基准,整合14个数据集和10种范式,通过多种微调策略和诊断分析揭示多任务学习可缓解过拟合、预训练效率受梯度冲突限制、模型规模非唯一决定因素等关键发现。
Comments 36 pages, 30 figures, Accepted by ICML2026
双分支提示用于多模态机器翻译
机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) ; School of Computer and Software Engineering, Xihua University(西华大学计算机与软件工程学院) ; School of Intelligent Medicine, Chengdu University of Traditional Chinese Medicine(成都中医药大学针灸推拿学院)
专题命中 评测与基准 :prompting(title,abstract);分类 cs.CL
AI总结 提出基于扩散模型的双分支提示框架D2P-MMT,利用重建图像过滤视觉噪声,通过分布对齐损失提升鲁棒翻译性能。
Comments This manuscript has been fully accepted and published by ACM Transactions on Multimedia Computing, Communications, and Applications (ACM TOMM)
OneFocus: 实现基于统一视觉语言模型的真实世界X光安检
专题命中 评测与基准 :language model(title,abstract)
AI总结 针对X光违禁品检测中新型违禁品适应难和视觉理解不足的问题,提出MMXray数据集和统一视觉语言模型OneFocus,支持问答、定位、分类和图像理解四项核心任务,达到最先进性能。
Comments 17 pages, 10 figures
基于数字孪生的低空XL-MIMO信道生成工具链与基础模型
专题命中 评测与基准 :foundation model(title,abstract)
AI总结 针对低空经济中XL-MIMO系统因3D移动性和近场传播导致的高保真无线数据集获取困难,提出基于数字孪生的工具链LAETwin-XL和条件去噪扩散隐式模型(CDDIM)基础模型,实现从部分信道观测中生成完整信道表示,并支持零样本外推和高效迁移学习。
BRITE:面向不可信场景的可靠可解释文本到视频评估基准
机构 * Department of Computer Science, Iowa State University, Ames, Iowa, USA(计算机科学系,爱荷华州立大学,爱荷华州阿姆斯,美国)
专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI
AI总结 提出BRITE基准,通过人工参与协议统一不可信提示、细粒度音视频一致性评估和可解释QA评估,揭示现有模型在对象-动作绑定和音视频同步上的显著缺陷。
SkillsBench: 基准测试智能体技能在不同任务中的有效性
机构 * BenchFlow ; OSU ; Amazon ; UC Berkeley ; UC Santa Cruz ; UC Davis ; Dartmouth ; RLWRLD ; Independent ; Princeton University ; Oxford University ; Stanford University ; USC ; CMU ; Foxconn ; Zenity ; UNSW ; UT Austin ; MSU ; Duke University ; ByteDance ; UT Dallas ; UC San Diego ; Columbia University ; University of Rochester ; Cornell Tech ; Georgia Tech ; Cornell University ; NEU ; UCLA ; Snap Inc. ; Fanshawe College ; University of Science and Technology of China ; HKUST(GZ) ; Anyscale
专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出SkillsBench基准,包含8领域87个任务,通过配对评估证明技能提升平均通过率16.6个百分点,小模型配备技能可匹敌大模型。
AlignCoder: 为目标意图对齐检索以实现仓库级代码补全
机构 * School of Software, Sun Yat-sen University(中山大学软件学院) ; Sun Yat-sen University(中山大学)
专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对仓库级代码补全中检索与目标代码不匹配及无法利用推理信息的问题,提出AlignCoder框架,通过查询增强和基于强化学习的检索器训练,在CrossCodeEval上EM分数提升18.1%。
Comments To appear at ASE'25
频谱-时间干扰混淆空间音频基础模型中的相位编码
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Jilin University(吉林大学) ; Hunan University(湖南大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 评测与基准 :foundation model(title);分类 cs.CL、cs.AI
AI总结 提出基于双耳掩蔽级差的心理声学基准,评估空间自监督音频模型对微秒级耳间相位精细结构的编码能力,发现通用双耳SSL模型依赖频谱-时间干扰纹理而非真实相位计算。
Comments Accepted to INTERSPEECH 2026; 6 pages, 3 figures
DEFINED: 辩论场景中细粒度创造力评估的数据高效计算框架
机构 * Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; East China Normal University(华东师范大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出DEFINED框架,通过层次化八维指标体系、预训练语言模型和混合粒度训练策略,在辩论场景中实现数据高效的细粒度创造力自动评估,优于现有方法。
Comments Accepted by KDD 2026
IMPACTeen:青少年沟通数据集中的意图、操纵、说服、标注与后果
机构 * Wrocław University of Science and Technology(弗罗茨瓦夫理工大学)
专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 构建IMPACTeen数据集,包含1021个青少年社交影响场景文本,从五个视角标注,支持社交影响检测、标注者分歧及跨语言建模研究。
忠实性差距:认证自然语言与形式数学语句之间的语义等价性
机构 * Department of Computer Science, Informatics Institute, Istanbul Technical University, İstanbul, Türkiye(信息学院计算机科学系,伊斯坦布尔技术大学,伊斯坦布尔,土耳其) ; Department of Computer Science(计算机科学系) ; Engineering, Jashore University of Science(工程系,贾沙尔大学科学学院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出双向可证明性指纹识别框架,通过前向和后向推论邻域匹配自然语言探针,认证自动形式化翻译的忠实性,并引入反事实探针生成、等价谱、自适应探针预算分配和忠实性引导解码四个新组件,在基准上实现高检测率并减少漂移。
PACUTE: 面向菲律宾语的音韵、词缀和字符级词元理解
机构 * AI Singapore(AI新加坡) ; Nanyang Technological University(南洋理工大学) ; UK AI Security Institute(英国人工智能安全研究所) ; Ateneo de Manila University(马尼拉雅典耀大学) ; University of Birmingham(伯明翰大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出PACUTE基准,包含4600个任务,通过六层诊断框架评估大语言模型在菲律宾语中的形态理解,发现开放权重模型在语素分解上接近随机,前沿模型在组合任务上远低于字符级上限。
Comments Submitted to EMNLP 2026
AgentBeats:面向开放性、标准化和可复现性的智能体评估代理化
机构 * University of California, Berkeley(加州大学伯克利分校) ; Purdue University(普渡大学) ; University of Ljubljana(卢布尔雅那大学) ; University of Washington(华盛顿大学) ; Oasis Labs ; University of Maryland(马里兰大学) ; IBM Research(IBM研究院) ; Mila ; McGill University(麦吉尔大学) ; ServiceNow Research(ServiceNow研究院) ; Carnegie Mellon University(卡内基梅隆大学) ; National Institute of Standards and Technology(美国国家标准与技术研究院) ; The Ohio State University(俄亥俄州立大学) ; University of Cambridge(剑桥大学) ; University of California, Santa Barbara(加州大学圣塔芭芭拉分校)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 提出代理化智能体评估(AAA)框架,通过标准化协议(A2A和MCP)统一评估接口,实现开放、可复现的多智能体评估,并基于AgentBeats系统通过大规模竞赛和案例研究验证其覆盖性、实用性和保真度。
SorryDB: AI证明者能完成现实世界的Lean定理吗?
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出动态更新的基准SorryDB,包含78个GitHub上的现实形式化项目,评估AI证明者在复杂依赖下的能力,发现当前方法互补,基于Gemini Flash的智能体方法表现最佳。
关于智能体安全的综述:应用、威胁与防御
机构 * BRAC University(布拉克大学) ; Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文首次全面综述智能体安全领域,围绕应用、威胁与防御三大支柱,分类260余篇论文,分析攻击入口、防御策略及生命周期覆盖,指出智能体系统默认结构脆弱,需全生命周期防御。
FlowState: 采样率等变的时间序列预测
专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出FlowState架构,通过状态空间模型编码器和函数基解码器实现采样率等变预测,无需重新训练即可适应不同采样率和预测长度,在GIFT-Eval基准上取得最优结果。
Comments Proceedings of the 43 rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026. Copyright 2026 by the author(s)
前沿AI评估公共档案的贝叶斯推断与决策审计
机构 * Yanan Long
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文通过贝叶斯推断和审计方法,分析公共AI评估档案中的选择性报告和缺失数据,发现单一终端记录与多种历史路径兼容,并验证了审计门限对虚假声明的过滤作用。
BD-LSC数据集:促进俚语与标准用法中词汇语义变化检测模型的基准测试
机构 * The University of Manchester(曼彻斯特大学) ; Qassim University(卡西姆大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对词汇语义双向变化及俚语与标准用法混合的挑战,构建BD-LSC和ST-WSD两个基准数据集,评估多种方法,发现稀有俚语义项仍是核心难题。
MUNI:面向连贯任意到任意生成的多模态统一潜在扩散
机构 * KAIST(韩国科学技术院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 提出MUNI框架,通过端到端多模态潜在扩散和路由训练目标,实现任意到任意生成,在条件生成上匹配或超越基线,并在无条件连贯性上取得最大优势。
Comments Project page: https://muni-proj.github.io/
VinQA:面向真实世界多模态文档问答的交错视觉元素长文本答案生成
机构 * LG AI Research(LG AI研究院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出VinQA数据集和两种编码方法(页面编码与模态编码),用于生成交错引用视觉元素的长文本答案;通过M-GroSE评估框架和微调Qwen2.5-VL模型,显著缩小与专有模型的性能差距。
Comments Accepted to CVPR 2026. Main paper: 5 figures, 4 tables; includes supplementary material
SAG: 查询时动态超边的SQL检索增强生成
机构 * Zleap AI
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出SAG架构,通过SQL查询动态构建局部超边索引,避免全局图维护,在多跳推理基准上达到最优召回率,支持亿级数据生产部署。
NVMOS:语音中非语言发声质量评估
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对非语言发声(如笑声、叹息)的感知质量评估空白,构建NV-MOS数据集,提出首个专用模型NVMOS,通过局部聚焦模块达到专家级评估一致性。
Comments 6 pages. Code and model: https://github.com/yongaifadian1/NVMOS
具有显式不确定性和证据冲突建模的审计风险评估多智能体框架
机构 * Columbia University(哥伦比亚大学) ; Trine University(特林大学) ; University of Sofia(索菲亚大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Westcliff University(韦斯特克莱夫大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 提出UMAR框架,通过三个专业智能体独立评估风险并校准不确定性,利用Dempster-Shafer理论融合分数并测量冲突,在SEC 10-K数据集上优于基线模型,提供可解释的风险信号。
基于AI的翻译教学中的评价判断:AI中介翻译与译后编辑的课堂案例研究
机构 * Universitat Pompeu Fabra Barcelona(巴塞罗那庞培法华大学)
专题命中 评测与基准 :LLM(summary_cn);分类 cs.CL
AI总结 通过分析23个学生项目,研究结构化比较通用LLM和在线MT系统如何激发AI中介翻译中的评价判断,发现学生不盲从自动指标,而是基于充分性、流畅性等理由选择译后编辑输出。
Comments Workshop on Teaching AI-based Translation and Technologies (TAITT 2026) - EAMT 2026
LearnOpt: 通过知识图谱和约束优化恢复标准化考试的潜在认知结构
机构 * Independent Researchers(独立研究者)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出LearnOpt框架,利用知识图谱和约束优化从历史试题中恢复潜在认知结构,生成个性化学习计划;在NEET和JEE Advanced考试数据上验证了潜在结构的稳定性和可检测的转变。
Comments 26 pages, 2 figures, 6 tables. Code, data, and calibration tooling: https://github.com/joyboseroy/learnopt. Datasets on HuggingFace: joyboseroy/neet-skill-tags-2016-2024, joyboseroy/jee-advanced-skill-tags-2016-2023
孤立无害,组合有害:智能体技能生态系统中的安全风险
机构 * East China Normal University(东华大学) ; Centre for Frontier AI Research A*STAR(前沿人工智能研究中心A*STAR) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出技能组合风险(SCR)概念,通过SCR-Bench基准测试发现,多个技能在共享上下文中组合执行时,攻击成功率显著高于孤立评估,强调应基于激活路径评估技能安全性。
AmchiBias:基于英语和孔卡尼语的最小对数据集测量果阿身份群体的刻板偏见
机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所)
专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.CL
AI总结 提出AmchiBias基准,通过313个最小对评估多语言编码器对果阿身份群体的刻板偏见,发现模型在孔卡尼语上表现接近随机,英语查询反映泛印度偏见而非本地文化知识。
Comments The 1st Workshop on Stereotypes Across Cultures in Language Technologies