arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-20 至 2026-08-20 共收录 72 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 72 篇

2608.18300 2026-08-20 cs.AI 新提交 92%

The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

用于大规模推荐解释的LLM评判模型的生命周期

Emma Yanyang Kong, JJ Tan, Ishan Gupta, Lars Olds, Claire Campbell, David Fagnan, Veli Balin, Rohan Gosain, Louis Garcia, Minsu Jang

机构 * Netflix(网飞公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15232 2026-08-20 cs.SE 版本更新 91%

When Agents Fail: A Comprehensive Study of Bugs in LLM Agents with Automated Labeling

当代理失效:对LLM代理中bug的全面研究与自动化标记

Niful Islam, Ragib Shahriar Ayon, Deepak George Thomas, Shibbir Ahmed, Mohammad Wardat

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过分析1187个bug相关帖子和代码片段,研究LLM代理中的bug类型、根本原因及影响,并构建BugReAct代理自动标记bug。

Comments Accepted at ISSRE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02592 2026-08-20 cs.CY 版本更新 91%

AI Fact-Checking in the Wild: A Field Evaluation of LLM-Written Community Notes on X

在野中的AI事实核查:在X平台上的LLM生成社区笔记现场评估

Haiwen Li, Michiel A. Bakker

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文首次在X平台现场评估LLM生成的社区笔记,通过三个月的测试发现LLM笔记在不同政治立场的评价者中获得更高正面评分,证明其在事实核查中的广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04156 2026-08-20 cs.AI cs.LG 版本更新 91%

BrainBench: Benchmarking Large Language Models for Comprehensive EEG Understanding

BrainBench:面向全面脑电理解的大语言模型基准测试

Yangxuan Zhou, Yuning Chen, Chen Wu, Jiquan Wang, Shijian Li, Gang Pan, Sha Zhao

机构 * Zhejiang University(浙江大学) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究推出BrainBench基准测试,涵盖4个子集共17个数据集等,评估大语言模型在两种范式下的脑电理解能力,为相关研究提供可复现测试平台。

Comments 51 pages,28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18940 2026-08-20 cs.LG cs.AI cs.CE cs.CL 新提交 90%

Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis

面向单步逆合成的化学合理性感知大语言模型训练

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Maksim Kuznetsov, Mathieu Reymond, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine AI Limited(英矽智能人工智能有限公司) Insilico Medicine Canada Inc.(英矽智能加拿大公司) Insilico Medicine Hong Kong Ltd.(英矽智能香港有限公司)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);prompting(abstract)

AI总结 该研究针对单步逆合成的一对多特性,提出Top-K提示范式,构建超大规模反应数据集训练C3LM,结合特定奖励机制在基准上达最优性能,为逆合成系统提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18768 2026-08-20 cs.CL 新提交 90%

Readable, Faithful, Used: Three Dissociable Properties of Demographic Identity in a Language Model

可读、忠实、可用:语言模型中人口统计身份的三个可分离属性

Fathin Difa Robbani

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该研究探究LLM中人口统计身份的三个可分离属性,通过对Mistral-7B等模型的分析,发现可读、忠实、可用三者分离,为LLM模拟人群的相关辩论提供了新视角。

Comments 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18490 2026-08-20 cs.MA 新提交 89%

Bayesian Partner Modelling enables Adaptive Replanning for LLM Coordination

贝叶斯伙伴建模支持大语言模型协同的自适应重规划

Harsh Goel, Aditya Sai Ellendula, Vaishnav Tadiparthi, Ehsan Moradi Pari, Hossein Nourkhiz Mahjoub, Sandeep P. Chinchali

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对LLM多智能体协作中伙伴策略变化导致的重规划问题,提出BayesBeliefAgent方法,在Overcooked环境中显著缩小信念-行动差距并减少重规划次数。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17326 2026-08-20 cs.HC 版本更新 89%

Procedural Collapse: A Structural Account of Disengagement in LLM-Assisted Writing

程序崩溃:大语言模型辅助写作中脱离的结构解释

JaeWon Kim, Katelyn X. Mei

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文针对学生使用LLM写作时脱离的问题,提出结构层面解释,指出当前界面引发程序崩溃,给出分解式交互等设计方向以支持AI辅助写作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00020 2026-08-20 cs.AR cs.AI 版本更新 89%

Large Language Model for Verilog Code Generation: Literature Review and the Road Ahead

用于Verilog代码生成的大型语言模型:文献综述与未来方向

Guang Yang, Wei Zheng, Xiang Chen, Dong Liang, Peng Hu, Yukui Yang, Shaohang Peng, Zhenghan Li, Jiahui Feng, Xiao Wei, Kexin Sun, Deyuan Ma, Haotian Cheng, Yiheng Shen, Xing Hu, Terry Yue Zhuo, David Lo

机构 * Zhejiang University \& Northwestern Polytechnical University China Northwestern Polytechnical University China Nantong University China Zhejiang University China Monash University Australia Singapore Management University Singapore Zhejiang University \& Northwestern Polytechnical University Northwestern Polytechnical University Nantong University Zhejiang University Monash University Singapore Management University

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了LLMs在Verilog代码生成中的应用,分析了现有方法的有效性、局限性及未来研究方向。

Comments Accept in ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18158 2026-08-20 cs.CL cs.AI 新提交 88%

When Do LLMs Actually Help? Evaluating LLMs as Data Quality Annotators

大语言模型(LLM)何时真正有用?评估LLM作为数据质量标注者的表现

Praphulla Lal Shrestha

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究对比测试LLM与基于规则方法在两项电商数据质量任务中的表现,发现LLM在需背景知识的任务中更具优势,且判断高度一致,小型样本提示评估可能存在误导。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18107 2026-08-20 cs.CL cs.AI 新提交 88%

Institutional Prestige as Geographic Bias in Large Language Models: Evidence from Three Factorial Experiments with Bootstrap Confidence Intervals

大型语言模型中作为地理偏见的机构声望:来自三项带自助法置信区间的析因实验的证据

Maikel Leyva-Vazquez, Florentin Smarandache

机构 * Universidad Bolivariana del Ecuador(厄瓜多尔玻利瓦尔大学) Universidad de Guayaquil(瓜亚基尔大学) University of New Mexico(新墨西哥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究通过三项带自助法置信区间的析因实验,发现大型语言模型在候选人评估中存在机构声望、期刊声望及国籍相关的偏见,期刊声望影响远大于机构声望,还证实了发表于《自然》的救助效应。

Comments 11 pages, 3 figures. Extended English version of an earlier two-study Spanish-language paper published in Neutrosophic Computing and Machine Learning (2026); this version adds Study 3 (journal x institution prestige) and bootstrap confidence intervals throughout

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25681 2026-08-20 cs.CL 版本更新 88%

Self-Improvement of Large Language Models: A Technical Overview and Future Outlook

大语言模型的自我提升:技术概述与未来展望

Haoyan Yang, Mario Xerri, Solha Park, Huajian Zhang, Yiyang Feng, Sai Akhil Kogilathota, Jiawei Zhou

机构 * Zesearch NLP Lab, Stony Brook University(石溪大学 Zesearch NLP 实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(comments)

AI总结 本文探讨大语言模型的自我提升技术,提出闭环生命周期框架,分析各组件方法并讨论未来研究方向。

Comments Accepted by TMLR and awarded the Survey Certification; 128 pages, 12 figures, and 14 tables. Github Repo: this https URL (https://github.com/Zesearch/self-improvement-llm)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20468 2026-08-20 cs.CL 版本更新 88%

ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety

ConspirED:一个用于研究阴谋论认知特质与大语言模型安全性的数据集

Luke Bates, Max Glockner, Preslav Nakov, Iryna Gurevych

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究推出首个标注阴谋内容通用认知特质的CONSPIRED数据集,利用其开发识别阴谋特质的计算模型,并发现大语言模型易被阴谋框架误导而复制其修辞模式。

Comments Accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18091 2026-08-20 cs.CL cs.AI 新提交 88%

Self- and Other-Labels Induce Bidirectional Bias in LLM Judges

自标签与他标签诱导大语言模型评判器产生双向偏差

Songeun Chae, Min Kim, Donghoon Jung, Seojin Choi, Seohyon Jung

机构 * School of Digital Humanities and Computational Social Sciences, KAIST(韩国科学技术院数字人文与计算社会科学学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 该研究针对LLM评判器的自偏好混杂问题,通过评估带模型特征的叙事约束选择,发现控制质量后自偏好消失,而自/他标签会双向影响评分,明确了作者归属是评估偏差的独立驱动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18554 2026-08-20 cs.CY cs.AI cs.MA econ.GN 新提交 87%

CentaurBench: Benchmarking LLM Capabilities on Augmenting vs. Automating Real-World Work Tasks

CentaurBench:评估大型语言模型在增强与自动化现实工作任务方面的能力

Pattaraphon Kenny Wongchamcharoen, Kris Gulati, Min Min Fong, Abhishek Nagaraj

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 CentaurBench基准测试显示LLM的自动化能力与辅助能力仅适度相关,多数自动化优胜者在增强任务中表现不佳,辅助效果并非始终为正,表明需按模型在多智能体系统中的角色评估模型。

Comments 46 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18289 2026-08-20 cs.AI cs.CR cs.IR cs.LG 新提交 87%

Evaluating Structured Information Extraction with Open Models in a High Risk Public Sector Application

在高风险公共部门应用中使用开源模型评估结构化信息提取

Elias Schubert, Felix Bießmann

机构 * Berlin University of Applied Sciences(柏林应用科学大学) Einstein Center Digital Future(爱因斯坦数字未来中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对欧盟AI法案高风险公共部门应用场景,构建基准评估开源OCR、LLM、VLM在学生申请处理任务的性能,发现零样本下多数模型表现差,输入结构保留是关键因素。

Comments Accepted at Workshop on Systems Over Models: What Actually Works in Industry (SOMI-2026) at ECML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26643 2026-08-20 cs.AI cs.LG 版本更新 87%

Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting

重新思考自进化:缓解技能过拟合的约束探索-利用过程

Hongqiang Lin, Chao Liu, Xiaofan Bai, Xuan Jin, Yuhong Li, Nenggan Zheng, Xipeng Cao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体技能过拟合问题,提出SkillBoost三阶段框架,在23种模型-基准配置上达SOTA性能,优化后技能可跨智能体复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18671 2026-08-20 cs.CV 新提交 85%

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能

Mohammad Zamani, Fatemeh Ziaeetabar

机构 * University of Tehran(德黑兰大学)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);prompting(abstract)

AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18423 2026-08-20 cs.AI 新提交 84%

FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents

FM-Bench:用于多智能体竞争的长周期管理基准

Tianyou Wang, Chongyang Gao, Kezhen Chen, Chen Dong, Yinghao He, Donghan Li, Wangcheng Xu, Hongjiu Zhang, Chi Li

机构 * AnalogyAI

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出FM-Bench基准,通过足球管理任务评估15个前沿LLM智能体的长周期决策能力,发现模型管理行为而非计算能力决定得分,排名与模型规模、价格或供应商无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18433 2026-08-20 cs.RO cs.LG 新提交 83%

The Embodiment Gap in Robot Foundation Models

机器人基础模型中的具身差距

Yukiyasu Domae, Keisuke Shirai, Hanbit Oh, Ryoichi Nakajo, Tomohiro Motoda, Koshi Makihara, Masaki Murooka, Takuma Yagi, Yoshiaki Bando, Ryo Hanai

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(日本国立先进工业科学技术研究院(AIST))

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本综述定义机器人基础模型的具身差距,通过双轴图分类方法,从三个研究方向考察近期工作,提出报告框架以助力跨具身学习的评估与未来研究。

Comments 32 pages, 4 figures. Published in Transactions on Machine Learning Research (TMLR), August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18911 2026-08-20 cs.LG cs.CE 新提交 81%

Converting Expert Deliberation into Financial Signals Through A Context-Aware NLP Pipeline

通过上下文感知的NLP流水线将专家审议转化为金融信号

Vivek Batra, Kristin Chen, Sanjiv Das, Samuel Judge, Harshad Khadilkar, Sukrit Mittal, Amir Nasrollahzadeh, Daniel Ostrov, Jacob Sisk

机构 * Franklin Templeton Investments(富兰克林邓普顿投资公司) Blend360(Blend360公司) Santa Clara University(圣克拉拉大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出CDSP流水线将投资委员会会议记录转化为金融特征,经实验其结合句子嵌入与CDSP特征的模型预测准确率达73%,证实专家审议含前瞻性金融信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18888 2026-08-20 cs.CL 新提交 81%

Assessing Quality of Experience in Natural Language Generation of German Text

评估德语文本自然语言生成中的体验质量

Dinh Nam Pham, Shushen Manakhimova, Vivien Macketanz, Sebastian Möller

机构 * Technische Universität Berlin(柏林工业大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对德语NLG,构建了含人工评分的TextQ-German数据集,开发出混合等自动QoE预测模型,为NLG评估提供了公开资源与基线,助力贴合人类感知的NLG系统开发。

Comments Dataset available at this https URL (https://github.com/DFKI-NLP/TextQ/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18836 2026-08-20 cs.AI 新提交 81%

Verifiable abstention makes AI leak diagnosis accountable in water distribution networks

可验证弃权使AI在供水管网泄漏诊断中具备可问责性

Tianwei Mu, Yue Wang, Mingzhe Yuan, Manhong Huang, Wenhong Wang, Xuerui Yin, Qing Luo, Min Xiao, Hui Yang, Jun Li, Dan Xue

机构 * School of Municipal Engineering and Environment, Shenyang Jianzhu University(沈阳建筑大学市政工程与环境学院) Guangzhou Institute of Industrial Intelligence(广州工业智能研究院) College of Environment, Shenyang University(沈阳大学环境学院) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) College of Environmental Science and Engineering, State Environmental Protection Engineering Center for Pollution Treatment and Control in Textile Industry, Donghua University(东华大学环境科学与工程学院(国家环境保护纺织污染防治工程技术中心)) School of Information Science and Engineering, Shenyang University of Technology(沈阳工业大学信息科学与工程学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对供水管网泄漏诊断中AI缺乏问责性的问题,提出结合执行器智能体、监督智能体与LLM审计员的可验证弃权决策方法,提升了决策精度与挖掘正确性,为自主水基础设施运营提供可行路径。

Comments 42 pages, 5 main figures, 1 main table, 2 extended data figures, 3 supplementary figures, 15 supplementary tables. Code and data availability described in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18660 2026-08-20 cs.LG 新提交 81%

Computational Measurement of Team-Process Phase Dynamics in Collaborative Virtual Reality

协作虚拟现实中团队过程阶段动态的计算测量

Qing Huang, Jianing Zhang, Pooja Pol

机构 * School of Business, Technical University of Applied Sciences Augsburg(奥格斯堡应用技术大学商学院) Data Science und Autonome Systeme Technologietransferzentrum (TTZ)(数据科学与自主系统技术转移中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出计算框架,从协作VR游戏带时间戳对话检测团队过程阶段,经评估其可识别连贯阶段结构,为分析协作活动提供透明可迁移方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18104 2026-08-20 cs.AI 新提交 81%

Self-Evolving Agents as Dynamic Graph Transformation: A Survey and New Perspective

自进化智能体作为动态图变换:一项综述与新视角

Yuanyuan Xu, Wenjie Zhang, Yin Chen, Xuemin Lin, Ying Zhang

机构 * School of Computer Science and Engineering, The University of New South Wales(新南威尔士大学计算机科学与工程学院) Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼科技大学工程与信息技术学院) School of Data Science, The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)数据科学学院) Zhejiang Gongshang University(浙江工商大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本综述将自进化智能体建模为动态图变换,梳理相关动态图方法分类,提出动态图学习作为智能体可复用基础设施,探讨图感知评估协议,为自进化智能体设计治理提供结构性视角。

Comments Project: this https URL (https://github.com/LuckyGirl-XU/Awesome-Agent-Dynamic-Graphs.git)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18097 2026-08-20 cs.CL 新提交 81%

FrenchNews-7: Benchmarking Cross-Publisher French News Editorial Desk Classification

FrenchNews-7:跨出版商法国新闻编辑部分类基准

Amr Sobhy

机构 * Le French News Lab(法国新闻实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究构建了跨出版商法语新闻编辑部分类基准FrenchNews-7,采用微调CamemBERT分类器,实验显示其在召回率上优于零样本LLM基线,为新闻分类研究提供了可靠基准。

Comments 15 pages, 5 figures, includes appendices. Model and dataset available on HuggingFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17756 2026-08-20 cs.AI 版本更新 81%

D$^2$ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory

D²ACCI:一种用于保留证据的智能体记忆的双循环诊断协议

Xule Liu, Yijun Liu, Chao Li, Shao Kun

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对LLM智能体持久记忆流程故障难以定位的问题,提出双循环诊断协议D²ACCI,引入DCR指标与D²ACCI-Eval人工制品,在三个公开基准上取得明确性能增益,填补了记忆系统迭代缺乏可追踪证据的空白。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00735 2026-08-20 cs.CR cs.AI cs.SE 版本更新 81%

`From Prompt to Perturbation': An Adaptive Framework for Voice-Based Jailbreaks on Audio LLMs

从提示到扰动:针对音频大语言模型的自适应语音越狱框架

Linghan Huang, Bo Li, Huaming Chen, Kim-Kwang Raymond Choo

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) University of Chicago(芝加哥大学) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有音频越狱攻击研究仅聚焦单一范式的不足,提出自适应越狱框架,可在统一设置下评估级联流水线和LALM,实验显示其攻击成功率优于现有方法。

Comments Accepted at the IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18303 2026-08-20 cs.AI cs.LG 新提交 81%

SESSE: Sketch, Expand, Sort, Summarize, Evaluate -- LLM-as-Judge Evaluation via Structured Decomposition

SESSE:草图、扩展、排序、总结、评估——通过结构化分解的大模型作为评判者的评估

Dae Lee, Mihai Delgeanu, Adel Youssef

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对大模型作为评判者评估无法分离质量维度等问题,提出无需训练的SESSE框架,在RewardBench上实现与基线近乎相当的性能,且可提供可解释的审计跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19816 2026-08-20 cs.SD cs.AI cs.LG 版本更新 81%

Whole-Piece Training for Symbolic Music Language Models via Full-Horizon Compressed Recurrence

深度结构音乐递归:预算递归注意机制用于完整乐谱符号建模

Yungang Yi, Weihua Li, Matthew Kuo, Catherine Shi, Quan Bai

机构 * Auckland University of Technology, Auckland, New Zealand(奥克兰理工大学) University of Tasmania, Tasmania, Australia(塔斯马尼亚大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出双尺度DSMR模型,通过递归注意机制和预算约束实现高效完整乐谱符号建模,实现更低内存占用和更高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏