Loong: Synthesize Long Chain-of-Thoughts at Scale through Verifiers
Loong:通过验证器大规模合成长思维链
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究针对将LLMs推理能力扩展到其他领域的挑战,提出Loong项目这一开源框架,由LoongBench和LoongEnv组成,通过它们形成强化学习的智能体-环境循环,经实验评估及对合成数据的分析,推动推理密集型领域发展。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
Loong:通过验证器大规模合成长思维链
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究针对将LLMs推理能力扩展到其他领域的挑战,提出Loong项目这一开源框架,由LoongBench和LoongEnv组成,通过它们形成强化学习的智能体-环境循环,经实验评估及对合成数据的分析,推动推理密集型领域发展。
在启发式自我改进智能体中自我编写的验证不可靠
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。
Comments 9 pages, 6 figures
用于心理健康的金融数字表型分析的计算伦理框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对人工智能驱动数字表型系统伦理治理难题,提出计算伦理框架,将伦理要求形式化为道义时态逻辑约束,通过金融数据和心理健康案例研究,用Z3求解器建模验证关键伦理属性,实现持续机器可验证伦理检查,支持相关系统发展。
Comments Accepted at the CIBB 2026 conference (https://cibb2026.teralab.ai/)
INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准
机构 * Fudan University(复旦大学)
专题命中 Agent评测 :tool use(abstract);分类 cs.CL
AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。
Comments 18 pages, including appendices; 11 figures and 12 tables
SeekJudge:计算机使用智能体强化学习的实用奖励框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对计算机使用智能体强化学习中轨迹指令判断问题,提出SeekJudge框架,通过四个智能体循环裁决,用种子校准蒸馏管道训练共享主干模型,该框架在在线RL中匹配或超原生规则监督,还有诸多优势并改进奖励服务器,使模型奖励成实用替代品。
少即是多:用于DeepGlobe卫星土地覆盖分割的轻量级卷积神经网络的受控基准测试
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 研究在DeepGlobe数据集上比较VGG16等五种架构用于卫星土地覆盖分割,经三个迭代分离相关因素,采用相同预处理等协议。结果显示MobileNetV2_v1表现优,轻量级迁移学习模型在资源受限遥感环境中可匹配或超越更深模型,利于土地覆盖映射。
Comments 18 Figures, 8 Tables & 33 Pages
用于工业4.0智能体评估的合成场景生成
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究针对工业智能体基准测试场景有限问题,扩展AssetOpsBench并引入ScenarioGeneratorAgent管道,通过多种优化方式提高可扩展性,实现智能电网变压器场景生成的高效优化,有效扩展工业智能体基准测试且保证场景质量。
Comments 19 pages, 3 appendices
PhononBench-MP40:用于声子稳定性的光谱分辨基准数据集
机构 * School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China(中国人民大学物理学院及量子态构建与调控教育部重点实验室)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI
AI总结 研究针对计算材料筛选中虚声子模式瓶颈,提出PhononBench-MP40数据集,源于47969个MP40任务,含4类记录。通过科学数据银行公开,配套GitHub仓库提供代码等,为相关研究提供可审计参考。
Comments 18 pages, 3 figures, includes Supplementary Information
JETO-Bench: Java执行时间改进补丁的可复现基准测试
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 提出JETO-Mine工具,通过静态分析、动态分析和评估框架自动构建可复现的Java执行时间改进补丁基准,并构建包含660个补丁的JETO-Bench,验证了其有效性。
无需基础的协调,协调的无需成功:可观测性与认知失败
机构 * Institut Català de Nanociència i Nanotecnologia (ICN2)(加泰罗尼亚纳米科学与纳米技术研究所(ICN2)) ; Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究所(IIIA-CSIC))
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文探讨了大型语言模型在低可观测性和高可观测性领域中协调与基础的分离现象,提出认知三角模型以评估人工智能代理的认知能力。
Comments Error found in some results. I need to correct it before re-uploading
OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现
机构 * OpenAI
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。
Comments 13 pages, two graphs
ReCon:用于跨摄取和检索管道的基于大语言模型的网络安全合规性的资源受限基准测试
专题命中 Agent评测 :agentic(abstract)
AI总结 研究政府、企业和机构网络安全合规问题,利用无需GPU和高内存的大语言模型进行合规检查任务基准测试,实验证明低资源大语言模型在政策文件合规检查中可提供良好一致性/准确性。
Comments 22 pages, 5 figures
UAV-ON:用于空中智能体的开放世界目标导航基准测试
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 Agent评测 :agent(abstract)
AI总结 介绍用于空中智能体开放世界目标导航的UAV-ON基准测试,含14个环境及1270个目标对象,通过实例级指令编码。实现多种基线方法评估,结果凸显空中导航和语义目标基础的复合挑战,推动复杂环境下无人机可扩展自主性研究。
Comments Accepted to ACM MM 2025
使用智能重模拟进行智能重塑
专题命中 其他Agent :agentic(title,abstract)
AI总结 研究如何利用智能系统结合物理学家更新LHC的全局SFitter分析,核心方法是基于MadAgents.v3构建智能接口,主要贡献是使先进方法能被更广泛受众使用且相关研究可推广至SFitter之外。
Comments 35 pages, 10 figures, 8 tables
HALLELUAI:一个用于大规模超逼真图像到视频生成的幻觉感知人工智能系统
机构 * Expedia Group(亿客行集团)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 针对AI生成视频时质量控制难的问题,HALLELUAI系统集成视频调节与智能再生模块,能评估风险并迭代修复。经人工参与评估,该系统可输出超逼真视频,推动了可信AI视频内容发展,实现大规模图像到视频生成。
Comments 10 pages, 4 figures, 3 tables
最大内积相似度单向量嵌入的近最优维度下界
专题命中 其他Agent :agentic(abstract)
AI总结 研究针对最大内积相似度单向量嵌入的维度下界问题。此前上下界在m指数上有差距,本文几乎弥合。证明结合方法得出,对固定δ及足够小ε、m≥(1/ε)^A_δ,单向量近似维度D≥m^(c_δ/ε^(2 - 2δ)),此结论对多种情况适用,指数接近上界。
WiFo-M$^2$:通过基础模型利用插件式环境感知增强无线通信
专题命中 其他Agent :agentic(abstract)
AI总结 WiFo-M$^2$通过基础模型实现环境感知与无线通信的无缝集成,提升物理层行为的性能和泛化能力。
Comments 16 pages, 11 figures, 9 tables