Inductive general game playing
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments Accepted for the Machine Learning journal
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments Accepted for the Machine Learning journal
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments Full version of RLDM abstract
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments 6 pages, 5 figures
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
Comments In ICML 2017. Website at https://pathak22.github.io/noreward-rl/
SkCC:面向跨框架LLM代理的可移植且安全的技能编译
机构 * Sun Yat-sen University(中山大学)
专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI
AI总结 针对LLM代理技能在不同框架间缺乏可移植性和安全性的问题,提出SkCC编译器,通过强类型中间表示SkIR解耦语义与格式,实现跨框架部署,并内置静态优化器强制执行安全约束,显著提升性能并降低适配复杂度。
Comments Accepted by the Agent Skills Workshop at ACM CAIS 2026. 20 pages, 6 figures. Project Homepage: https://skcc.nexa-lang.com/ Code Repo: https://github.com/Nexa-Language/Skill-Compiler/
机构 * Tel Aviv University(特拉维夫大学) ; NYU Tandon School of Engineering(纽约大学工程学院) ; New York University Abu Dhabi(纽约大学阿布扎克分校) ; Princeton Language and Intelligence(普林斯顿语言与智能) ; Stanford University(斯坦福大学)
专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI
Comments ICML 2025; Project website https://enigma-agent.com
专题命中 软件智能体 :agent(abstract,comments);分类 cs.AI
Comments Accepted to 2024 International Conference on Human-Agent Interaction (HAI)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI;AI agent(comments)
Comments 6 pages, 5 figures, Proceedings of the ICML 2024 Workshop on Trustworthy Multimodal Foundation Models and AI Agents
语言具有两个参数:叙事诱导的语义可塑性与相位敏感的解读
机构 * University of Utah(犹他大学)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 该研究提出语言解读需第二个带符号、持久且以个体与二元组为索引的相位参数,指出标准Transformer无相位显式表征,需构建承载相位语义状态的语言模型。
Comments 23 pages; 0 figuresCC
LEGO-RL:利用原生强化学习实现编码智能体
机构 * Huawei Technologies Co., Ltd(华为技术有限公司) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。
Comments Webpage: https://lego-rl.pages.dev
ORCA:基于可观测性的微服务故障程序修复
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。
风力涡轮机维护日志标注框架:基于LLM驱动的数据校正与语义提取的可靠性智能增强
机构 * Institute for Energy Systems, School of Engineering, The University of Edinburgh(能源系统研究所,工程学院,爱丁堡大学) ; Nadara, Lisbon, Portugal(纳达拉,里斯本,葡萄牙)
专题命中 软件智能体 :workflow(abstract);分类 cs.CL
AI总结 提出一种利用大语言模型自动标准化和结构化风力涡轮机维护日志的方法,通过纠正系统代码、提取故障模式与维护动作分类,将非结构化文本转化为定量可靠性指标。
Comments An adjustable template containing the Python script architecture, applied dynamic prompts, and data schemas is hosted in an open-source GitHub repository: https://github.com/mvmalyi/llm-driven-wind-turbine-maintenance-log-labelling
JailbreakSkill:通过可复用且不断演进的技能扩展自动化红队测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本研究提出以技能为核心的JailbreakSkill框架,将攻击策略打包为可复用技能,通过攻击与学习的闭环演进技能,大幅提升攻击成功率,且技能可泛化至未见过的提示词与目标模型。
可执行代码知识:作为AI编码智能体原生、带验证的知识表示的代码
机构 * Alibaba Cloud(阿里云)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 该研究提出可执行代码知识(ECK)及其单元ECKU,构建Python原型验证其在编码智能体任务中的效果,支持源绑定、验证等功能,为AI编码智能体提供了混合架构方案。
Comments 11 pages. Submitted to AgenticDev 2026, co-located with ASE 2026
OpenHarmony Bench:评估LLM与编码智能体在OpenHarmony应用开发中的表现
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 该研究推出OPENHARMONY BENCH应用级编码基准,评估8个LLM驱动的DevEco Code在三类OpenHarmony ArkTS应用任务中的表现,发现新一代模型任务完成率更高、构建性接近饱和但行为正确性不足、spec驱动任务完成率最低。
AutoSQL:从大规模代码仓库中的命令式ORM代码提取SQL模板
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 AutoSQL是从大规模Go仓库的命令式ORM代码提取SQL模板的系统,采用代码索引、混合上下文检索策略,在基准测试中召回率优于现有方法。
Comments Accepted to ASE '26
对软件工程任务中投机解码的实证研究
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文通过实证研究评估了投机解码在软件工程任务中的有效性,发现其在代码生成、修复和编辑任务中表现各异,模型基于方法适合生成,模型无关方法更适合仓库级任务,且任务重复性提升模型无关方法性能。
Comments Accepted by ISSTA 2026
Twin:利用测试时数字孪生玩未知游戏
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 该研究提出Twin系统,通过测试时数字孪生构建可执行世界模型,在ARC-AGI-3等未知游戏中通关率达97.8%,效率优于人类,核心是通过模拟交互和反例修复推断游戏规则与目标。
Comments Project website with action-by-action replays of all 25 runs: https://arc-agi-3-twin.vercel.app/ Code: AGI-3" target="_blank" rel="noopener">https://github.com/Alexyskoutnev/TWIN-ARC-AGI-3
用Wolfram语言实现计算法以用于人工智能治理
机构 * Wolfram Institute for Computational Foundations of Science(沃尔夫勒姆计算基础科学研究所)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文在Wolfram语言中实现Reified Input/Output Logic,测试GPT-4转换英文法律陈述的情况,通过AI看门狗案例展示计算法可作为AI治理工具,理想目标是形式化可编程执行的法律。
Comments 25 pages, 1 figure, 2 tables, 12 code listings. Wolfram Language implementation and verification script (31 assertions) available at https://github.com/Zaffer/research-computational-law
CoSA:基于大语言模型的上下文分析实现上下文感知的漏洞严重程度评估
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 CoSA是一种基于大语言模型的上下文感知漏洞严重程度评估方法,通过两阶段仓库剪枝策略与Transformer预测器,在6816个CVSS标注实例上较最优基线提升了14.4%准确率与15.3% Macro-F1
AI辅助发现与构造以单位矩阵作为第三个约束块的三块ADMM收敛性反例
专题命中 软件智能体 :workflow(abstract);分类 cs.AI
AI总结 该研究借助AI工具构造出以单位矩阵为第三约束块的三块ADMM的收敛反例,还分析了乘子松弛对收敛性的影响,对比了不同AI工具在数学研究中的表现。
Comments 34 pages
IntrinTrans: 基于大语言模型的RISC-V向量内在函数翻译器
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文提出IntrinTrans,利用大语言模型和编译反馈自动翻译跨架构内在函数,并通过寄存器使用信息优化生成代码,实验证明其性能接近原生实现。
Comments 6 pages
生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。
令牌减少并非成本降低
机构 * PointFive
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 研究基于 API 的编码代理上下文减少层,通过对 2848 次 Claude Code 运行分析,发现提示缓存流量主导成本,工具输出减少不能可靠预测计费成本降低,压缩可能损害任务完成,进而提出以成功调整计费成本为核心的分层证据标准。
Harness-IF:评估编码智能体在不同指令层面的指令遵循能力
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本研究推出Harness-IF评估框架,引入AP-Acc指标区分编码智能体的指令合规与巧合,发现12个前沿模型在对抗先验规则上表现更差,且合并优先级不随提示深度变化。
Comments 26 pages, 7 figures, 8 tables
主特质分析:面向人机协作中“技能”的推导
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。
来自外部的身份:AI人格克隆的概念框架与研究计划
机构 * R&D Mediation(调解研发部)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 该研究针对AI人格克隆问题,提出含六项分解的身份概念框架,定义不可区分性,通过类比阐明线性性,区分代理类型,提出实验计划,主张以环境保真度为长期标准,核心为条件猜想。