Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions
程序员是大型语言模型生成断言的糟糕且过度自信的评判者
专题命中 评测与基准 :LLM(title)
AI总结 研究程序员评估大型语言模型生成断言的能力,通过实验发现程序员判断正确断言较准,判断错误断言较差,自然语言解释未带来整体益处,凸显帮助开发者评估机器生成可靠性工件的重要性。
Comments 10 pages, 6 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
程序员是大型语言模型生成断言的糟糕且过度自信的评判者
专题命中 评测与基准 :LLM(title)
AI总结 研究程序员评估大型语言模型生成断言的能力,通过实验发现程序员判断正确断言较准,判断错误断言较差,自然语言解释未带来整体益处,凸显帮助开发者评估机器生成可靠性工件的重要性。
Comments 10 pages, 6 figures
十年视觉语言人工智能模型中准确性和视觉认知错误的演变
机构 * Psychological & Brain Sciences, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校心理与脑科学系) ; Department of Computer Science, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校计算机科学系) ; Department of Electrical and Computer Engineering, University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校电气与计算机工程系)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究十年间视觉语言模型进展,引入CSB数据集,评估模型在其上及MS-COCO样本中的准确性与视觉认知错误类型,发现MLLM消除简单与复杂场景描述准确性差距,几乎消除多数错误类型,为模型发展提供全面评估。
精打细算,却愚弄像素:通过视觉对抗扰动在多模态智能体中绕过价格限制
机构 * City University of Hong Kong(香港城市大学) ; Peking University(北京大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究发现多模态大语言模型在价格受限环境下易受视觉误导,提出PriceBlind攻击框架,通过语义解耦损失提升图像嵌入精度,实现80%的攻击成功率,并展示鲁棒编码和防御机制对攻击的抑制效果。
Comments 15 pages, 4 figures, 13 tables
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 16059-16073, 2026
一种自演化代理框架用于超材料逆向设计
机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出一种自演化代理框架,通过上下文级技能进化解决超材料逆向设计中工作流构建的难题,提升任务成功率并减少尝试次数,实现可重用的求解器专业知识积累。
触发式对齐:黑盒评估无法保证更新后对齐
机构 * University of Southern California(南加州大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究大语言模型更新后对齐问题,指出静态黑盒评估有局限,无法保证更新后对齐,通过理论分析和多领域实证验证,揭示模型隐藏对抗行为及与模型规模的关系,强调更新后鲁棒对齐评估的迫切性。
SolarChain-Eval:去中心化能源市场中可信经济主体的物理约束基准测试
机构 * Duke Kunshan University(杜克昆山大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG
AI总结 针对去中心化能源市场中智能代理评估需兼顾任务性能与可信度的问题,提出物理约束基准测试SolarChain-Eval,将市场治理建模为马尔可夫决策过程,从多维度评估策略,纳入大语言模型规划器/审计器层,实验揭示效用与安全权衡及相关问题。
订单流何时重要?加密期货中依赖状态的 L2 流动性状态转换
机构 * Korea University(韩国大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.LG
AI总结 研究 2023 年至 2026 年币安加密期货,定义离散 L2 流动性状态转换任务,用事件聚类验证等评估模型。发现事件前 L2 流动性状态是重要预测信号,订单流在 L2 状态模型上分层才有价值,且不同符号表现不同,提出状态优先设计原则及评估协议。
Comments 8 pages, 2 figures, 1 table
主动拒绝可实现通用机器学习原子间势的可靠泛化
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Suzhou Laboratory(苏州实验室)
专题命中 评测与基准 :pretraining(abstract);分类 cs.LG
AI总结 研究针对通用机器学习原子间势训练数据集受限问题,提出自适应多教师路由方法,通过校准预训练教师、估计结构-教师对可靠性来生成伪标签,提升模型性能和动力学鲁棒性,有效构建高保真uMLIPs数据系统。
基于事件流的多模态视频异常检测:一个基准数据集和算法
机构 * College of Pharmaceutical Engineering of Traditional Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学中药制药工程学院) ; School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) ; Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究院) ; State Key Laboratory of Component-based Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学组分中药国家重点实验室)
专题命中 评测与基准 :pretraining(abstract);分类 cs.AI
AI总结 该研究针对视频异常检测在复杂条件下的局限性,提出EVAD框架,利用事件相机与传统视频。构建大规模基准数据集,设计对比多模态预训练框架及自适应融合模块,实验验证了该方法在现实场景中检测VAD的有效性。
DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试
专题命中 评测与基准 :language model(abstract)
AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。
用于计算问题提出的间接和直接人工智能支架:初步经验报告
专题命中 评测与基准 :LLM(abstract)
AI总结 该报告介绍两个大语言模型驱动的支架系统,用于支持不同计算场景的问题提出。系统用布鲁姆分类法评估问题,输出方式有间接(引导性问题)和直接(示例)两种。研究表明二者互补,先间接后直接能促进反思与改进,为计算课堂整合此类支架提供策略。
评估源代码库的语义和质量感知检索
专题命中 评测与基准 :LLM(abstract)
AI总结 研究针对自然语言查询的源代码库检索问题,结合函数级碎片化、文本和代码嵌入等技术及多种检索模式构建原型系统,用C代码语料库评估,发现语义检索总体最强,自动路由表现良好,质量元数据对特定查询有用。
秘密扫描代理:从非结构化文档中提取秘密和访问上下文
专题命中 评测与基准 :LLM(abstract)
AI总结 研究从非结构化文档提取秘密及访问上下文的问题,提出多智能体大语言模型系统SSA,它能通过检测与审查智能体配对提取相关信息,经合成基准评估,相比传统方法提升了提取精度、召回率,速度更快,让凭证检测更具可操作性。
Comments Submitted to the Conference on Applied Machine Learning for Information Security (CAMLIS) 2026
LLM增强调查中的校正难度与最优样本分配
机构 * Michael G. Foster School of Business, University of Washington(华盛顿大学Michael G. Foster商学院)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文研究在LLM预测可用时如何分配人类样本以提高估计效率,提出校正难度分析、最优分配规则及元学习方法,通过实验证明其在不同领域和LLM上的有效性。
一种通过交互解释大语言模型知识蒸馏的统一方法
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言模型知识蒸馏有效性背后机制,提出统一方法,通过交互分解输出分数,发现共同机制是交互稀疏化,不同方法性能差异源于处理复杂交互能力,进而提出CIP损失函数,实验证明其能提升多种KD方法性能。
CogniConsole:将推理时控制作为可靠大语言模型交互的形式化抽象进行外化
机构 * University of Regina(里贾纳大学) ; Orbital Sea(轨道海)
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究挑战大语言模型可靠性仅取决于模型能力的观点,引入CogniConsole将推理时控制外化为结构化接口,通过489个探针实验表明增加结构支架可降低输出方差和故障率,为LLM系统设计评估开辟新方向。
Comments Revised version focusing on the CogniConsole system architecture and empirical evaluation of inference-time control probes (N=489)
使用适度非结构化稀疏权重矩阵加速大语言模型的GPU推理
机构 * National University of Singapore(新加坡国立大学) ; Zhejiang University(浙江大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型推理成本挑战,提出含稀疏张量核层等的三层矩阵存储格式,设计联合稀疏张量核与CUDA核的SpMM内核,实现了在现代GPU上超越密集矩阵乘法,取得显著加速。
Comments DAC 2026
序列化桥接:理解与恢复Blackwell GPU机密计算下的LLM服务性能
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 本文发现Intel TDX加GPU-CC下LLM服务吞吐量下降13-27%的主因是机密VM-GPU桥接的序列化开销,而非GPU计算本身,并通过调度优化恢复高达92%的性能损失。
将大语言模型与图卷积网络集成用于半监督图像分类
机构 * Institute of Mathematics and Computer Science (ICMC)(数学与计算机科学研究所) ; University of São Paulo (USP)(圣保罗大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 针对图像分类中图构建难题,该研究将大语言模型与图卷积网络集成,利用视觉语言模型生成文本描述,经大语言模型处理得到语义相似性分数,指导kNN图边修剪,提升了半监督图像分类准确率。
AugServe:用于增强型大语言模型推理服务的自适应请求调度
机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) ; Alibaba Group, Hangzhou, China(阿里巴巴集团)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 研究针对增强型大语言模型推理服务效率问题及现有系统挑战,提出AugServe框架,采用两阶段自适应请求调度策略并动态调整令牌批处理机制,有效提升了有效吞吐量并减少首次令牌时间。
大语言模型中用于激活稀疏化的灵敏度感知阈值处理和令牌路由
机构 * Santa Clara University(圣塔克拉拉大学) ; Sogang University(西江大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 研究大语言模型中如何在保留模型质量时减少计算,提出灵敏度感知阈值处理方法SATS及轻量级令牌路由框架,经实验评估,SATS在匹配稀疏度时优于基线,令牌路由有更好的质量-吞吐量权衡,改进方法可提升大语言模型权衡效果。
通过自监督早期退出加速大语言模型推理
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 研究通过在中间层添加自监督早期退出头加速大语言模型推理,评估多种置信度指标,实验表明可降成本保精度,还应用于推测性解码提出DSSD,高令牌接受率且少超参数调整。
通过目标干预对语言模型进行多属性引导
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究如何对语言模型进行多属性引导,提出MAT-Steer框架,通过对齐目标学习引导向量,减少属性间冲突,在问答和生成任务中评估,该框架优于现有方法。
Comments ACL 2025 camera-ready, code link: https://github.com/duykhuongnguyen/MAT-Steer
超越大语言模型:一种从叙事文本生成因果图的语言学方法
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 该研究提出从叙事文本生成因果图的框架,先以LLM提取顶点,引入含七个语言特征的“专家索引”并集成到分类模型,结合RoBERTa嵌入提升因果关系识别精度,经五次迭代提示构建因果图,实验证明其优于GPT-4o和Claude 3.5,还提供开源工具。
Comments published at the 7th Workshop on Narrative Understanding, NAACL 2025
C-GAP:类感知与在线提示改进不均衡类上的视觉语言模型
机构 * San Diego State University(圣地亚哥州立大学)
专题命中 效率与部署 :prompting(title,abstract);language model(title);LLM(abstract)
AI总结 研究针对安全关键感知系统检测小标签空间中罕见物体类别的问题,提出C-GAP框架,通过建立复合字幕基线并利用语言模型迭代细化提示,无需更新检测器权重,有效提升少数类检测精度,实验证明其成效显著。
基于LLM的推荐系统中上下文示例的成员推断攻击
机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) ; University of Cincinnati(辛辛那提大学) ; University of Southern California(南加州大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出两种针对LLM推荐系统中上下文示例的成员推断攻击,揭示了敏感信息暴露的风险及现有防御方法的不足。
Comments This is paper is accepted by ACM RecSys 2026 main track
用于大语言模型路由的具有替代奖励的相关感知上下文博弈
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究用于大语言模型路由的相关感知上下文博弈问题,提出耦合奖励混合与解耦预测混合两种利用替代奖励的算法,经理论分析和实验评估,相比基线方法提高了样本效率和精度 - 成本权衡。
StreamDQ:用于可扩展人工智能推理加速的定制HBM中的近内存权重反量化
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 研究针对大语言模型内存和计算需求增长,提出StreamDQ架构,将反量化块集成到HBM基础芯片,通过内存端反量化减少GPU开销,实现高吞吐量推理,在混合精度GEMM和端到端LLM推理中均有显著性能提升。
虚构世界构建:基于分层上下文压缩和迭代审查的多智能体大语言模型协作
机构 * National University of Defense Technology(国防科技大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对大语言模型应用于世界构建面临的挑战,提出AutoWorldBuilder多智能体协作系统,通过五个组件应对,经实验验证,该系统在世界构建任务中有高成功率,能高效生成自洽概念,其架构模式可推广到其他知识密集型多智能体大语言模型应用。
Comments 36 pages, 7 fig
基于计算能力网络的异构大语言模型实体代理的通信高效数字孪生协调
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对异构大语言模型实体代理协作面临的通信开销大、协调质量受LLMs能力限制和行动延迟等挑战,提出基于轻量级数字孪生的LDT-Coord框架,通过特定方法减少通信开销,实现与传统方法相当的任务成功率且保持鲁棒性。
Comments 14 pages, 6 figures, 5 tables