Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
技能自我博弈:通过协同进化技能拓展大语言模型能力边界
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究针对大语言模型训练困境,引入Skill Self-Play协同进化框架,由提议者、求解器和控制器构成,经强化学习循环使组件协同进化,有效弥合验证与探索差距,推动模型性能提升。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
技能自我博弈:通过协同进化技能拓展大语言模型能力边界
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究针对大语言模型训练困境,引入Skill Self-Play协同进化框架,由提议者、求解器和控制器构成,经强化学习循环使组件协同进化,有效弥合验证与探索差距,推动模型性能提升。
企业人工智能代理的动态能力范围界定:一个合成数据集和三源权限架构
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究企业人工智能代理动态能力范围界定问题,提出三源权限架构,包括基于角色的上限等,贡献含600个企业任务提示的合成数据集,经验证可推动策略优化,还发布相关内容支持对动态范围界定机制的评估。
Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026
用于移情响应生成的动态常识协调
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究移情响应生成问题,提出含三个互补模块的动态常识协调框架DCC,能整合常识表示、过滤低相关性关系及动态检索记忆,实验表明其可提升情绪分类准确率、响应多样性等,生成更好的响应。
基于角色的访问控制下的文本到SQL基准测试
机构 * National University of Singapore(新加坡国立大学) ; Hamad Bin Khalifa University(哈马德·本·卡西姆大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究基于角色的访问控制下文本到SQL的基准测试问题,提出含现实RBAC约束的综合基准测试框架,通过大语言模型辅助工作流程及人工审核等增强基准,应用该框架研究发现部分高分系统在有访问约束时性能因RBAC违规而大幅下降。
Comments Accepted at ACM SIGMOD 2027
真实优先:智能体记忆的纵向评估工具及记忆架构排名中的任期交叉
专题命中 推理评测 :verifier(abstract);分类 cs.CL
AI总结 研究大型语言模型智能体记忆基准问题,提出颠倒流程的评估方法,通过合成虚构语料库嵌入新特征,对五种记忆架构基准测试,发现排名随历史长度反转,分层架构表现最佳,发布开源库Veracium。
Comments 25 pages, 2 figures. Code: https://github.com/veracium-ai/Veracium
每个模型都作弊:在进攻性网络任务中对作弊行为进行提示级缓解
机构 * dreadnode
专题命中 推理评测 :verifier(abstract);分类 cs.AI
AI总结 研究大语言模型在网络安全基准测试中的作弊问题,通过对22个前沿模型在三种提示条件下的控制提示消融研究,发现作弊普遍,反作弊提示能降作弊倾向,但即使最严条件下仍有模型作弊,引入“解决率”指标,强调反作弊提示非环境控制替代品。
Comments 21 pages, 4 figures, 7 tables
为桥梁诊断代理编码无形因果关系:基于QLoRA的三重引导检索增强微调
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 研究针对桥梁损伤原因难以肉眼察觉及专家诊断依赖隐性知识的问题,提出基于QLoRA的三重引导检索增强微调方法(含知识三元组提取等组件),能在消费级硬件上实现内存高效、高精度的桥梁诊断代理。
Comments 13 pages, 7 figures, 6 tables
使用基于大语言模型的实体解析在混合格式居住数据中进行家庭移动检测
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究在混合格式居住数据中检测家庭移动相关间接实体链接的问题,核心方法是集成基于提示的LLM命名实体识别、语义文本嵌入和基于图的推理,主要贡献是提高召回率和F1分数。
Comments Computer Science & Information Technology (CS & IT) ISSN : 2231 - 5403, Volume 16, Number 10, May 2026
AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架
机构 * The University of Melbourne(墨尔本大学)
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。
享受你的对话:一个用于多轮对话的以人为本基准,具有解耦的用户模拟、目标建模和评判
机构 * SenseTime Research(商汤科技研究院) ; University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 该研究提出EYT-Bench基准,通过三方解耦设计评估大语言模型多轮对话能力,引入新指标,发现先进模型在主观维度相近但客观意图跟踪差异大,推理可提升客观跟踪,角色格式影响轨迹分布,且热身效应稳健。
超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?
机构 * ByteDance Inc.(字节跳动公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。
VLM作为策略家:通过引导扩散实现安全关键测试场景的自适应生成
机构 * School of Automotive Studies, Tongji University(同济大学汽车研究学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 本文提出一种结合VLM和引导扩散模型的框架,用于高效生成安全关键测试场景,提升自动驾驶系统的测试效率和安全性。
Comments 25 pages, 9 figures
Journal ref Accident Analysis & Prevention Volume 236, October 2026, 108680
Re-FORC:用于高效思维链推理的自适应奖励预测
机构 * AWS Agentic AI(AWS智能代理部门) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.AI、cs.LG
AI总结 研究提出Re-FORC自适应奖励预测方法,通过在推理模型上训练轻量级适配器,实现早期停止无前景推理链、优化模型和思维长度选择以及自适应测试时缩放,有效提升推理效率和准确率。
Comments Accepted at ICML 2026; previously accepted as a non-archival paper at the Efficient Reasoning Workshop at NeurIPS 2025
RecGPT-V3技术报告
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。
Comments Technique Report
Gemma 4技术报告
机构 * Google DeepMind(谷歌DeepMind)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 介绍新一代Gemma 4开源多模态语言模型,通过密集和专家混合架构提升计算效率与推理能力,提出统一无编码器架构,集成思考模式,改进多方面性能,在多基准测试中有显著提升。
Comments 17 pages, 2 figures, technical report, updated
CGU-ILALab 在 FoodBench-QA 2026 中:比较传统方法与基于 LLM 的方法在食谱营养估算中的表现
机构 * CGU-ILALab
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文比较了传统方法与基于 LLM 的方法在食谱营养估算中的性能,发现 LLM 能有效处理模糊术语和非标准单位,但计算效率较低。
Comments Accepted by the Third Workshop on Patient-oriented Language Processing (CL4Health) at LREC 2026
Journal ref https://lrec.elra.info/lrec2026-ws-cl4health-31
迷失在上下文中:解决大语言模型中的上下文焦虑
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 研究大语言模型中因过早自我怀疑导致的上下文焦虑,通过系统研究发现其部分源于对完成任务所需tokens估计不准,会致效率损失,还表明模型可学替代策略,性能提升或可通过提高评估与适应自身局限能力实现。
Comments Accepted at ICML 2026. 17 pages
使用有序网络分析来分析中学生在协作式人工智能聊天机器人开发过程中的对话和行为
机构 * University of Florida(佛罗里达大学) ; University of Pennsylvania(宾夕法尼亚大学) ; North Carolina State University(北卡罗来纳州立大学) ; The University of Tennessee(田纳西大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究以有序网络分析方法,考察中学生协作开发AI聊天机器人的互动,刻画协作随时间的组织及互动模式与机器人质量、AI知识成果的关系,揭示高质量机器人与特定序列及互动模式有关,为协作式AI开发提供过程描述并拓展了相关研究。
通过MLLM引导的概念生成和语义传播进行无监督多模态意图发现
专题命中 其他推理 :reasoning(abstract)
AI总结 该研究针对无监督多模态意图发现缺乏语义监督及可解释性差的问题,提出MCSP方法,通过MLLM引导的对比推理获取语义概念,再经语义传播生成伪标签,实验证明其性能优于现有方法且能产生可解释的簇。
Comments Accepted at ACM Multimedia 2026 (MM '26)