Mapping Overlaps in Benchmarks through Perplexity in the Wild
通过在野 perplexity 映射重叠关系
机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)
专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI
AI总结 通过分析LLM基准测试的perplexity,揭示了不同任务间的重叠结构及LLM能力差异。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
通过在野 perplexity 映射重叠关系
机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)
专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI
AI总结 通过分析LLM基准测试的perplexity,揭示了不同任务间的重叠结构及LLM能力差异。
Evo:具有进化平衡的自回归-扩散大语言模型
机构 * University of Oxford(牛津大学) ; National University of Singapore(新加坡国立大学) ; Technical University of Munich(慕尼黑技术大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 Evo通过进化平衡机制,结合自回归和扩散模型,实现高效且高质量的语言生成。
SPOT:一个标注的法语语料库和基准,用于检测在线对话中的关键干预
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 SPOT通过标注法语语料库和基准,检测在线对话中的关键干预,验证了监督学习在非英语社交媒体任务中的重要性。
超越端点:面向向量化的非公路网络提取的路径中心推理
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 本文提出MaGRoad,一种基于路径中心的非公路道路网络提取方法,通过构建大规模数据集和改进模型结构,在野外环境中实现了更鲁棒的道路提取。
Comments This revision improves clarity and consistency throughout the paper. We refine terminology to more precisely describe the vertex extraction optimization, add motivational context to the edge feature encoding section, and clarify the overall inference pipeline. We also add an Acknowledgments section
基于推理的图像风格化代理规划 via 离线强化学习
机构 * Adobe Research(Adobe研究)
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 本文提出基于推理的代理规划框架,通过结构化规划和工具链提升图像风格化效果,采用合成数据生成和离线强化学习方法,验证在视觉质量和指令遵循上的优越性。
Comments 85 pages
探索小型语言模型在软件架构中的推理深度:一项面向软件工程2.0的多维评估框架
专题命中 代码评测 :code generation(abstract);分类 cs.SE
AI总结 本研究通过多维评估框架评估小型语言模型在软件架构中的推理深度,发现参数阈值影响推理能力,揭示了中等大小模型在短上下文下的校准机制及语义多样性与幻觉的相关性。
Comments Accepted at ICSA 2026
扩展的基于同意的访问控制框架:预提交验证与紧急访问
专题命中 代码评测 :repository(abstract)
AI总结 本文提出一种扩展的基于同意的访问控制框架,通过预提交验证和紧急访问机制,提升医疗系统中患者自主权的保障与冲突解决效率。