MINCE: Shrinking LLM Evaluation Datasets via Few-Model Monte Carlo Calibration
MINCE:通过少模型蒙特卡洛校准缩小LLM评估数据集
机构 * Advanced Micro Devices (AMD)(超威半导体(AMD))
AI总结 提出MINCE方法,利用少量校准模型的蒙特卡洛模拟确定最小子集大小,无需预测层,显著减少评估数据集规模,在保持精度漂移极小的同时实现数倍加速。
大厂专区
MINCE:通过少模型蒙特卡洛校准缩小LLM评估数据集
机构 * Advanced Micro Devices (AMD)(超威半导体(AMD))
AI总结 提出MINCE方法,利用少量校准模型的蒙特卡洛模拟确定最小子集大小,无需预测层,显著减少评估数据集规模,在保持精度漂移极小的同时实现数倍加速。
HPP:通过解耦感知与推理的分层程序化探测用于长视频理解
机构 * Queen’s University Belfast(贝尔法斯特女王大学) ; AMD(AMD公司) ; Queen Mary University of London(伦敦玛丽女王大学)
AI总结 提出HPP框架,通过将长视频理解重构为分层视频的迭代程序化探索,解耦语义感知与高阶时序推理,在LongVideoBench等基准上取得显著提升。
Comments Project page: https://awaisrauf.com/HPP
UltraQuant: 面向上下文密集型智能体的4位KV缓存
机构 * Advanced Micro Devices(超威半导体) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Purdue University(普渡大学)
AI总结 针对上下文密集型智能体场景,提出UltraQuant方法,通过4位KV缓存压缩、旋转量化和代码本量化,结合AMD GPU优化,在长上下文多轮任务中延迟降低3.47倍,吞吐量提升1.63倍。
Comments 11 pages, 9 figures
面向OpenSIL固件中大语言模型生成的单元测试的库感知双打与迭代修复
机构 * School of Software Design and Data Science(软件设计与数据科学学院) ; Seneca Polytechnic(森纳学院) ; Advanced Micro Devices Canada(加拿大先进微器件公司)
AI总结 针对OpenSIL固件单元测试因构建约束易失败的问题,提出LLM引导的多智能体自动化测试生成与迭代修复流程,在76个函数中73个生成可编译测试,行覆盖率达98.8%。
Comments 20 pages, 10 figures, 1 Table. This work has been submitted to the IEEE for possible publication