Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
技能自我博弈:通过协同进化技能拓展大语言模型能力边界
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL
AI总结 研究针对大语言模型训练困境,引入Skill Self-Play协同进化框架,由提议者、求解器和控制器构成,经强化学习循环使组件协同进化,有效弥合验证与探索差距,推动模型性能提升。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
技能自我博弈:通过协同进化技能拓展大语言模型能力边界
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL
AI总结 研究针对大语言模型训练困境,引入Skill Self-Play协同进化框架,由提议者、求解器和控制器构成,经强化学习循环使组件协同进化,有效弥合验证与探索差距,推动模型性能提升。
数学教育数字影子:促进与LLMs学习的工具:数学表现、焦虑与自信在模拟学生和AI中的表现
机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MEDS数据集,通过28000个模拟角色评估LLMs在数学教育中的表现,结合心理和社会人口数据及数学任务,探讨自我效能、数学焦虑和认知网络科学。
PixDLM:一种用于无人机推理分割的双路径多模态语言模型
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
专题命中 推理与问题求解 :language model(title,abstract)
AI总结 本文提出PixDLM,一种用于无人机推理分割的多模态语言模型,通过构建DRSeg基准数据集,验证了该模型在处理高分辨率无人机图像中的有效性。
Comments Accepted to CVPR 2026 (highlight)
当伦理与收益相悖时:道德两难情境下的大语言模型智能体
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Zurich(苏黎世大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan(密歇根大学) ; Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI
AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。
通过基于证据的推理进行智能根本原因分析
机构 * EPFL - IMOS Laboratory(洛桑联邦理工学院 - IMOS实验室)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 研究针对工业异常根本原因诊断依赖人工且现有数据驱动方法有局限的问题,提出AgentRCA框架,结合数字孪生和大语言模型进行推理,在实际设施上评估,性能与监督基线相当且能产生透明推理轨迹,为工业根本原因分析提供实用基础。
Comments 21 pages, 9 figures
统计早停法用于推理模型
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。
用于多模态思维链推理的视觉显著性引导蒸馏
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对多模态思维链推理在小模型中存在的问题,提出视觉显著性引导蒸馏方法,利用多模态大语言模型注意力图生成扰动图像,经奇异值分解提取引导向量指导层间蒸馏,实验证明该方法能改进推理生成和答案推理。
用于SeePhys Pro的多智能体辩论与视觉信息提取:ICML 2026 AI4Math赛道3挑战赛的第一名技术报告
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 针对回答含图像的大学物理问题的SeePhys Pro任务,提出两阶段框架,包括视觉信息提取和多智能体辩论推理阶段,提高了准确率,在挑战赛中获第一名,分析得出编排收益及图形辅助价值与问题图像占比相关的结论。
ToolGuardian:人工智能代理与工具交互的声明式安全
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 研究人工智能代理与工具交互安全问题,提出ToolGuardian框架,通过预准入审查和任务感知运行时授权保障安全,利用渐进式特征化和基于ASP的声明式策略层,实验表明该框架在审查和授权方面性能良好。
用于智能工作流合成的拓扑与执行耦合分层搜索
机构 * Baylor University(贝勒大学) ; NEC Laboratories America(美国NEC实验室) ; University of Arkansas(阿肯色大学) ; Southern Illinois University(南伊利诺伊大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对大语言模型结构化工作流创建自动化难题,提出拓扑与执行耦合的搜索范式,引入HierFlow架构,通过反馈引导拓扑调整与树搜索优化子工作流,经多基准测试验证其性能优于基线,平衡了质量与效率且无需额外训练。
FlowEvo:通过工作流和可执行技能的协同进化实现自我进化的智能体
机构 * Southeast University(东南大学) ; Rensselaer Polytechnic Institute(伦斯勒理工学院) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究旨在让大型语言模型智能体通过工作流解决复杂任务。提出FlowEvo框架,通过工作流到技能编译、技能到工作流反馈、技能管理三个机制,使智能体无需更新模型参数积累完善能力,实验显示其在基准测试中精度-成本权衡优,各机制有贡献。
通过错误定位进行测试时缩放
机构 * Google DeepMind(谷歌DeepMind)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究针对大型语言模型复杂任务性能提升问题,提出通过错误定位进行测试时缩放(TTEL)算法,利用反馈定位错误步骤,截断轨迹并分支新一代,重用有效前缀,在多个基准测试中优于竞争基线。
Comments 10 pages, 8 figures (With appendix: 27 pages, 11 figures)
从心智到机器:Manus AI作为完全自主数字代理的崛起
机构 * Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工学院电气与计算机工程系) ; Department of Computer Science, Brown University(布朗大学计算机科学系) ; Department of Computer Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) ; Khoury College of Computer Sciences, Northeastern University(东北大学科里尔计算机科学学院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Manus AI是一款通用人工智能代理,结合大语言模型的推理与规划能力,执行复杂任务并产生实际成果,本文全面介绍了其技术架构、跨行业应用及未来潜力。
三体对齐:通过重新排序的理由将国际象棋智能体与人类推理对齐
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 研究如何通过国际象棋中的“三体对齐”,分析人类专家、引擎辅助评论员和大语言模型产生的理由间语义差异,构建多源理由数据集,进行实证分析与实验,开发数据集结构并开源,以改善智能体与人类对齐及决策的可解释性。
LeAct:从专家行动中学习推理
机构 * Princeton University(普林斯顿大学)
专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究如何从专家行动中恢复思维链,提出LeAct方法,通过优化潜在变量,让学生为专家行动采样候选思维链并保留有效链。该方法在多个博弈和机器人基准测试中表现出色,使专家系统成为基础模型推理教师的新来源。
Comments 27 pages, 3 figures, 11 tables
J-CoT:J空间中的思维链
机构 * University of Oxford(牛津大学) ; Stanford University(斯坦福大学)
专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究针对语言模型推理中仅依赖自然语言受限的问题,提出基于J空间的J-CoT循环推理框架,通过词汇索引系数传递中间状态,在多任务中表现出色,J-CoT-Zero匹配或超基线,J-CoT-Train获高分。
Comments work in progress
基于因子图的进化感知多序列比对抽样推理
机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.LG
AI总结 研究针对MSA抽样在有限预算下难以控制进化信号的问题,提出将其作为优化问题,引入基于亲和传播的因子图方法AP-REASONER,通过特定因子和控制旋钮进行推理,实验表明该方法在下游任务中表现优异,能可控恢复蛋白质构象。
EVL-MCoT:用于有害模因检测的增强视觉语言多思维链
机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 针对有害模因检测,提出增强视觉语言多CoT(EVL-MCoT)方法,通过促进多CoT及设计解码框架,解决现有方法局限,在相关数据集上获良好结果,且公开了源代码。
学习随推理展开:用于高效强化学习的渐进式展开分配
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI
AI总结 研究针对强化学习中GRPO方法计算昂贵且不稳定的问题,提出VIGOR方法,通过方差引导在线分配展开,理论上推导其加速比,实验表明该方法在数学推理和编码任务中能减少展开次数并提升通过率。
使用GPT-5.5 Pro对实数上的和积猜想进行自主反证
专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI
AI总结 本文借助GPT-5.5 Pro构建智能体,通过三阶段提示管道,对实数上的和积猜想进行自主反证,8次试验中7次成功生成正确证明,每次试验平均用132.4k推理令牌,还发布相关内容供重现研究。
VLM作为策略家:通过引导扩散实现安全关键测试场景的自适应生成
机构 * School of Automotive Studies, Tongji University(同济大学汽车研究学院)
专题命中 推理与问题求解 :language model(abstract);分类 cs.LG
AI总结 本文提出一种结合VLM和引导扩散模型的框架,用于高效生成安全关键测试场景,提升自动驾驶系统的测试效率和安全性。
Comments 25 pages, 9 figures
Journal ref Accident Analysis & Prevention Volume 236, October 2026, 108680
PoCEvolve:通过漏洞感知提示进化从安全补丁生成概念验证漏洞利用程序
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究修复提交与详细漏洞报告可用性的延迟问题,提出PoCEvolve框架,可从漏洞修复提交直接生成概念验证漏洞利用程序,通过评估相关上下文指导提示进化,在不同模型上有不同成功率提升。
SoundscapeAgent:用于可控合成和可扩展音频-语言监督的智能音景构建
机构 * Tencent(腾讯)
专题命中 推理与问题求解 :LLM(abstract)
AI总结 提出智能音景构建框架SoundscapeAgent,基于大语言模型的智能体将用户意图转化为场景计划,经多步骤实现可控音频合成与可扩展音频-语言数据构建,在生成性能及下游音频推理方面表现出色。
Comments Submitted to SLT 2026
通过物理智能解决通用机器人中的编排差距
机构 * Princeton University(普林斯顿大学) ; Together AI(联合人工智能)
专题命中 推理与问题求解 :post-training(abstract)
AI总结 研究通用机器人行动推理问题,提出将相关能力分解为语言条件策略/控制智能体与高级智能体管理器/编排器,构建物理智能体编排器Pigey,经评估其在模拟和实际任务中性能显著提升,缩小了编排差距。
一种用于无训练城市医疗保健 OD 预测的知识驱动行为推理框架
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究城市医疗保健 OD 预测问题,提出基于知识驱动行为推理的无训练框架,将异构城市信息组织成知识图谱,通过多智能体推理实现预测。实验表明该框架性能优于传统深度学习基线,凸显城市智能在医疗保健出行建模上从数据拟合到知识驱动推理的潜力。
Comments 16 pages, 9 figures. Submitted to the 4th International Conference on Urban Science and Intelligence
为什么大语言模型与人类在评估创造力时会趋同和背离
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究探讨大语言模型与人类评估创造力时趋同和背离的原因,通过三项研究和六个模型,识别其评估标准及影响,发现一致性取决于判断证据和模型标准,强调内在品质时趋同,需上下文信息时背离,选评估模型很关键。
无需云端的智能编码:在纵向数据准备任务中评估开放权重的大语言模型
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究在纵向数据准备任务中评估开放权重的大语言模型,介绍开源框架,含真实数据集、任务定义和评估程序,通过基准测试发现当前先进模型表现良好,为治理受限研究中的AI辅助数据准备提供可行路径。
Comments Presented at SLLS 2026; accepted at CLS 2026 and RSS 2026
使用基于大语言模型的实体解析在混合格式居住数据中进行家庭移动检测
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究在混合格式居住数据中检测家庭移动相关间接实体链接的问题,核心方法是集成基于提示的LLM命名实体识别、语义文本嵌入和基于图的推理,主要贡献是提高召回率和F1分数。
Comments Computer Science & Information Technology (CS & IT) ISSN : 2231 - 5403, Volume 16, Number 10, May 2026
使用基于大语言模型的嵌入从社交媒体文本中进行可解释的抑郁症检测
机构 * Earlham College(埃尔哈姆学院)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究利用大语言模型和传统机器学习分类器,针对社交媒体文本进行三项心理健康预测任务。通过多数据集五折交叉验证实验发现,零样本LLMs在二元抑郁分类表现好,细粒度严重程度预测差;基于LLM摘要嵌入的监督模型性能更优,为构建有效可解释评估系统提供方向。
Comments This version of the contribution has been accepted for publication at ICAI 2026, after peer review but is not the Version of Record and does not reflect post-acceptance improvements, or any corrections
基于LLM的视觉解释评估框架:用于评估面部皮肤病分类模型的可解释性
机构 * AI and Business Analytics, Ewha Womans University(人工智能与商业分析,成均馆大学)
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出基于LLM的视觉解释评估框架,通过渐进式提示工程评估Grad-CAM在面部皮肤病诊断模型中的解释质量,聚焦病变定位和可信度。