Calibrating the Instrument: Controllability of an LLM-Driven Synthetic Population
校准仪器:LLM驱动的合成人群的可控性
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出SIVE实验,通过七项预注册标准评估LLM驱动合成人群对已知效价刺激的响应可控性,发现弱阳性消息被识别为阴性,经重新设计后恢复预期排序,并揭示噪声特性与微观动力学。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
校准仪器:LLM驱动的合成人群的可控性
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出SIVE实验,通过七项预注册标准评估LLM驱动合成人群对已知效价刺激的响应可控性,发现弱阳性消息被识别为阴性,经重新设计后恢复预期排序,并揭示噪声特性与微观动力学。
从灰烬中崛起:基于LLM的深度学习框架缺陷静态分析
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出首个基于LLM的静态分析技术Phoenix,通过结构化语义桥接中间表示建模跨语言张量流,结合多智能体工作流检测深度学习框架缺陷,已在PyTorch中发现31个新bug。
基于LLM的差异代码损坏用于大规模错误修复基准测试
机构 * Eötvös Loránd University(罗兰大学) ; Faculty of Informatics(信息学学院)
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出MegaBugFix,一个包含12,629个由LLM通过差异生成的有缺陷Python程序的大规模基准,用于评估模型错误修复能力,发现现有模型在此基准上表现更差。
理解扩散大语言模型中的评估幻觉
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 发现扩散大语言模型的解码方法排名对提示模板高度敏感,单模板评估会产生性能无损失的幻觉,实际并行解码方法无法突破速度-质量权衡。
利用基于LLM的代理系统生成量子应用以优化测试
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出QPipe,一种基于大语言模型的多代理架构,自动将自然语言需求转化为可执行的量子应用工作流,在测试优化问题上实现高编译率和执行率。
SWE-Perf:语言模型能否优化真实仓库中的代码性能?
专题命中 评测与基准 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract)
AI总结 提出SWE-Perf基准,用于系统评估LLM在真实仓库中的代码性能优化能力,通过140个实例评估发现现有模型与专家水平存在显著差距。
Comments Accepted by ICML 2026
基于LLM的意图驱动网络拓扑设计框架
机构 * CERI-LIA, University of Avignon(阿维尼翁大学CERI-LIA实验室)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出一个结合分层建模和系统验证的约束驱动流水线,利用大语言模型从自然语言需求生成结构有效且符合约束的网络拓扑,并通过多模型对比评估其正确性和弹性。
Comments submitted to IEEE CNSM 2026
利用多模态大语言模型推荐可用性改进
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 本文提出一种利用多模态大语言模型自动识别和推荐用户界面可用性改进的方法,通过分析有限的应用上下文和用户交互屏幕记录,基于尼尔森可用性启发式方法生成优先级排序的改进建议,验证了其在软件工程中的实用性。
Comments Accepted for publication at the ACM International Conference on the Foundations of Software Engineering (FSE 2026)
“别说出来!”:语言模型玩禁忌游戏时的约束、合规与沟通
机构 * Center for Language and Cognition (CLCG), University of Groningen(格罗宁根大学) ; University of Milano - Bicocca(米兰比可卡大学)
专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL
AI总结 研究语言模型在禁忌游戏中如何在严格词汇约束下生成有效描述,通过提示、生成时约束和内部表示操纵干预,评估合规性与沟通效果,发现模型在约束下表现弱于人类。
从整体评估到结构化标准:大语言模型演变中的评分准则
机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) ; Department of Computer Science and Technology, Institute for AI(计算机科学与技术系,人工智能研究院)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出评分准则作为统一框架,通过分解整体判断为可验证维度、提供过程级反馈和动态涌现自模型行为三个层次,连接人类意图与机器行为。
AGI Maze:作为世界建模智能体的基准框架
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出AGI Maze框架,通过部分可观测网格迷宫任务评估LLM构建世界状态表示的能力,发现标准LLM在推理时无法内部表示迷宫,即使借助工作记忆也难以可靠求解。
基于语义引导的LLM历史亚美尼亚报纸阅读顺序重建
机构 * École nationale des chartes-PSL(法国国立文献学院-巴黎文理研究大学) ; Inalco(法国国立东方语言文化学院) ; Calfa
专题命中 评测与基准 :LLM(title_cn,summary_cn)
AI总结 针对历史亚美尼亚报纸复杂版面和低资源问题,提出混合方法结合语义区域检测与生成式LLM,排序错误率较几何基线降低76%。
Comments International Conference on Pattern Recognition, 2026, Lyon, France
一种通过语言模型驱动文本可操控的草图式程序化声景乐器
机构 * Rama Labs(Rama实验室)
专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL
AI总结 提出一种实时音乐界面,将自然语言场景描述转化为可演化的程序化声景,通过直接参数调整实现细粒度控制,并采用三种可互换后端生成连贯音频流。
Comments 10 pages, 7 figures, 2 tables. Accepted to the International Conference on New Interfaces for Musical Expression (NIME 2026), London, UK. Supplementary material included as an appendix. Code and demo: https://github.com/prabal-rje/latentscore
从角色到情节:基于角色的多智能体长篇小说生成
机构 * Pocket FM ; Princeton University(普林斯顿大学) ; University of Michigan(密歇根大学) ; University of Maryland(马里兰大学) ; Universitat Pompeu Fabra(庞培法布拉大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出MAGNET多智能体叙事引擎和ATLAS幻觉检测管线,通过角色代理和世界状态追踪,在100页故事中减少41%注释和50%幻觉,实现连贯长篇小说生成。
FinPersona-Bench: 自主金融代理纵向心理测量稳定性的基准
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; The University of Tokyo(东京大学) ; McGill University(麦吉尔大学) ; The Fin AI(Fin AI公司) ; Kyoto University(京都大学)
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出FinPersona-Bench基准,通过合成市场分离价格与价值,评估LLM金融代理在长期部署中指令显著性衰减现象,发现指令重固化的效果因代理类型和市场环境而异。
Comments 29 pages, includes figures and tables; formalizes Mandate Salience Decay and introduces FinPersona-Bench
映射评估前沿:跨11种评估器-智能体条件的偏差-可靠性权衡的实证调查
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过扩展至11种评估条件,实证验证了LLM评估系统中评估器耦合、策略多样性与小样本测量可靠性之间的权衡,并发布了标准化基准数据集。
Comments 5 pages, 1 figure, 1 table
可控叙事渲染以增强辅助写作
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) ; HiThink Research(海天瑞声)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型在创意写作中安全编辑与无控制情节扩展的二元失败问题,提出基于叙事学故事/话语区分的Loom框架,通过三层流水线和意图中心符号链实现叙事意图与渲染密度的精确控制,在保持事实完整性的同时提升描述强度。
SOCO: 视觉基础模型中语义对象对应关系的基准测试
机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) ; Saarland Informatics Campus(萨尔州信息学校园) ; CISPA Helmholtz Center for Information Security(信息安全霍夫曼中心) ; University of Freiburg(弗赖堡大学)
专题命中 评测与基准 :foundation model(title,abstract);language model(abstract)
AI总结 提出SOCO基准,通过引入对应类型分类法和100个类别上超过100万对功能上有意义的关键点注释,系统评估视觉基础模型中的语义对应能力,并揭示模型在跨类别迁移、语言引导定位与视觉对应之间的差距。
Comments Project page: https://genintel.github.io/SOCO/
技能并非孤岛:衡量智能体技能供应链中的依赖性与风险
机构 * Peking University(北京大学) ; Zhongguancun Laboratory(中关村实验室)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出智能体技能供应链(ASSC)概念,设计SkillDepAnalyzer工具从自然语言中提取依赖关系,在超143万技能上揭示四种结构模式和安全风险,建议类型化依赖清单和风险预警审计。
SWE-Doctor: 通过多面缺陷复现测试的运行时诊断引导软件工程智能体
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出SWE-Doctor,通过生成多面缺陷复现测试并执行调试,构建运行时诊断记录,结合定位信息指导补丁生成,在SWE-bench Verified和Pro上平均解决率分别达75.7%和59.4%。
SWE-Router:多轮智能体软件工程任务中的路由
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出SWE-Router,一种基于价值的时间路由方法,通过让廉价模型探索几轮后根据部分轨迹决定是否升级到昂贵模型,在保持强模型大部分性能的同时大幅提升成本效率。
Comments The 5th Deep Learning for Code Workshop, ICML 2026
ATM:基于CID的预写准入机制用于多智能体代码协同合成
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 提出ATM框架,通过CID代理和适配器引导的原子化,解决多智能体LLM系统中并发写意图的准入、组合与序列化问题,支持可审计性和有限恢复能力。
Comments 40 pages, 8 figures. Source code and supplementary artifact links are described in the manuscript appendix
量化情感差距:大型语言模型在细粒度情感分类上的零样本评估
机构 * Old Dominion University(欧道明大学)
专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究对Claude、ChatGPT和Gemini三种商业LLM进行零样本细粒度13类情感分类评估,发现最高准确率仅39.9%,模型在爱情、困惑等情感上表现差,且无显著差异,揭示当前前沿AI在零样本情感分类中的局限性。
Comments in Proc. 27th IEEE Int. Conf. (IRI'2026)
YOMI-Bench:评估日语大语言模型汉字读音与音韵理解的基准
机构 * Kobe University(神户大学) ; National Institute of Advanced Industrial Science and Technology (AIST)(国立研究开发法人产业技术综合研究所(AIST)) ; The University of Tokyo(东京大学) ; RIKEN(理化学研究所) ; Tohoku University(东北大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出YOMI-Bench基准,通过四个任务评估大语言模型在日语汉字读音上的表现,发现专用模型和商业模型均表现不佳。
前沿大语言模型在阿拉伯文化与社会语言学知识上的基准测试:基于人类专家真实标注的交叉评估框架
机构 * Perle AI
专题命中 评测与基准 :LLM(summary_cn,abstract_cn);language model(abstract);分类 cs.CL
AI总结 提出一个交叉评估框架,通过人类专家标注的103个提示-评分标准对,评估前沿LLM在埃及和伊拉克阿拉伯语文化与社会语言学知识上的表现,发现GPT-5.4是最可靠的自动评判者,文化任务比语言任务更难评分,且模型在埃及提示上表现优于伊拉克提示。
拖拽、推断、重投影:通过空间交互为图像聚类的LLM基础
专题命中 评测与基准 :LLM(title_cn);large language model(abstract);language model(abstract)
AI总结 提出CriterionSI方法,利用大语言模型从用户拖拽交互中推断聚类标准,并引导重投影,实现渐进式标准对齐的图像聚类布局。
LongVQUBench:评估视觉语言模型的长期视频质量理解能力
机构 * Nanyang Technological University(南洋理工大学)
专题命中 评测与基准 :language model(title,abstract);分类 cs.AI
AI总结 提出LongVQUBench基准,包含1200+长视频和1500个问题,通过三级评估(局部、跨事件、全局)和针孔失真问答范式,揭示现有LVLMs在长视频质量理解上的局限性。
Comments Accepted at European Conference on Computer Vision 2026
基础模型与放射组学在肺部计算机断层扫描中的比较:特征提取器、分类头和分割选择的基准测试
机构 * Division AI4Health, Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西茨基大学AI4Health部门) ; University Institute for Diagnostic and Interventional Radiology, Klinikum Oldenburg AöR(奥尔登堡医院大学诊断与介入放射学研究所)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG
AI总结 本研究通过基准测试五种特征提取器、七种分类头和三种分割策略,评估基础模型与放射组学在CT肺癌表型分析中的性能,发现最优设计取决于任务,推荐Curia结合肿瘤分割和CatBoost分类头作为安全默认方案。
Comments 17 pages, 8 figures, 2 tables, Code is available at https://github.com/AI4HealthUOL/lung-ct-benchmarking
时间序列基础模型基准是否隐藏了依赖于状态的失败?来自交通速度预测的证据
机构 * University of California, Berkeley(加州大学伯克利分校) ; Duke University(杜克大学) ; National University of Singapore(新加坡国立大学) ; Northeastern University(东北大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Southern Methodist University(南卫理公会大学)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG
AI总结 本文提出状态分层评估方法,发现时间序列基础模型在交通状态转换时准确率和预测区间覆盖率显著下降,并提出了双峰混合增强方法以改善转换状态覆盖。
Comments 5 pages, 2 figures. Accepted at the Workshop on Forecasting as a New Frontier of Intelligence, ICML 2026
重新审视元特征以解释表格数据上的模型差异
机构 * Clausthal University of Technology, Clausthal-Zellerfeld, Germany(Clausthal技术大学,Clausthal-Zellerfeld,德国) ; University of Mannheim, Mannheim, Germany(曼海姆大学,曼海姆,德国)
专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG
AI总结 研究通过严格统计检验和留一法分析,发现数据集元特征无法稳健解释表格数据上不同模型族(如神经网络与树模型、非基础模型与基础模型)之间的性能差异。