Causal Agent based on Large Language Model
基于大语言模型的因果智能体
专题命中 软件智能体 :agent(title,summary_cn);分类 cs.AI、cs.CL
AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于大语言模型的因果智能体
专题命中 软件智能体 :agent(title,summary_cn);分类 cs.AI、cs.CL
AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。
角色专业化模型(RSM):在智能体软件开发中协调基于大语言模型(LLM)的工具——一项探索性案例研究
专题命中 软件智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);workflow(abstract)
AI总结 本研究通过探索性案例研究提出角色专业化模型(RSM),协调Antigravity、Gemini CLI等三种LLM工具开发Python气候可视化应用,发现明确角色协调可优化开发质量但需配套策略与人工验证。
Comments 28 pages, 4 figures, 5 tables
智能体安全应成为运行时契约
专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI
AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。
关键在于接口:评估工具架构如何影响编码智能体行为
专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.SE
AI总结 该研究通过编码智能体的对照实验,发现工具架构会显著影响智能体行为,不同工具架构在一致性、文件访问量、步骤数等方面表现出不同效果,其中Python CodeAct风格接口性能优异。
RecSys Factory:限制LLM智能体在工业推荐生命周期内的自主决策点
机构 * Tencent(腾讯) ; FiT(腾讯FiT)
专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI
AI总结 RecSys Factory 是限制 LLM 智能体自主到决策点的平台,解决工业推荐系统运营的三角困境,在腾讯三业务线部署 78 天,CLI 调度成功率达 78.6%。
Comments 21 pages, 6 figures, 9 tables. Reports a 78-day deployment across three heterogeneous industrial recommender business lines (1,624 CLI-tool dispatches). Companion paper: AutoResearch (P3b), which instantiates the same substrate for autonomous research
更好、更快、更强:程序化技能学习最能降低智能体成本
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.LG
AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。
就绪队列:在LLM智能体控制中限定GPU机会并避免主机往返
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI
AI总结 该研究针对LLM智能体控制,提出就绪队列边界的形式化方法,通过实验验证设备驻留路由决策路径可提升效率,为GPU智能体控制确立了两个可测量门限。
Comments 14 pages, 4 figures. Includes formal proofs, trace provenance, and a reproducibility appendix. Code and artifacts: https://github.com/josefchen/ready-cohorts ; processed evidence: https://huggingface.co/datasets/josefchen/ready-
持久递归世界支持自主软件演化
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 该研究提出 Genesis 框架,以持久递归世界替代持久智能体,成功构建 C 编译器、重实现 MESA 模块,实现长周期软件开发并获显著性能提升。
Mechanist:作为科学仪器的AI,用于发现智能的机制
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Heriot-Watt University(赫瑞瓦特大学) ; Southern University of Science and Technology(南方科技大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校) ; Northeastern University(东北大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。
Comments Work in progress
用于改进心肌灌注MRI定量的物理信息隐式神经表示
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究将物理信息神经网络(PINN)框架扩展加入时空隐式神经表示(INRs),在真实模拟CMR数据集上提升了心肌灌注参数估计的鲁棒性与准确性。
Comments Accepted at the STACOM workshop at MICCAI, Strasbourg 2026
Backtrader-Bench:基于自生成多项选择题的算法交易大语言模型智能体基准测试
机构 * University of California, Riverside(加利福尼亚大学河滨分校)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL
AI总结 Backtrader-Bench是用于算法交易LLM智能体的基准框架,通过自生成MCQ解决评估难题,实验显示带工具智能体准确率显著高于无工具模型,还可生成强化学习训练语料以构建专用量化交易智能体。
Comments Accepted to the FinLLM Workshop at IJCAI 2026. Code and data: https://github.com/rzhao999/Backtrader-Bench
语言模型迭代自馈探测的测量对象,以及一种区分构造与模型的测试方法
专题命中 软件智能体 :agentic(abstract);分类 cs.CL、cs.LG
AI总结 本研究探究语言模型迭代自馈探测的测量对象,提出区分探测构造与模型的测试方法,揭示两类测量量的差异,复现验证工具并纠正错误判断。
Comments 16 pages, 4 figures. Code, per-run results, and the findings ledger: https://github.com/nicoveraz/token-lattice-ca (archived: https://doi.org/10.5281/zenodo.21880472)
REVERE:面向科学工作流的反思性进化研究工程师
机构 * TCS Research(TCS研究) ; Yale University(耶鲁大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 REVERE通过全局训练上下文学习和反思优化框架,提升科研编码任务性能,实现4.50%、3.51%和4.89%的提升。
Comments Published as a conference paper at COLM 2026
基于大语言模型的程序语义不等价博弈
机构 * University of Edinburgh(爱丁堡大学) ; Cisco Systems(思科系统)
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出基于语义不等价博弈(SInQ)的方法,通过生成器与评估器智能体半对抗训练合成代码推理数据,在跨语言漏洞检测等基准上显著提升LLMs的代码语义理解能力。
Harness-IF:评估编码智能体在不同指令层面的指令遵循能力
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本研究推出Harness-IF评估框架,引入AP-Acc指标区分编码智能体的指令合规与巧合,发现12个前沿模型在对抗先验规则上表现更差,且合并优先级不随提示深度变化。
Comments 26 pages, 7 figures, 8 tables
主特质分析:面向人机协作中“技能”的推导
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。
来自外部的身份:AI人格克隆的概念框架与研究计划
机构 * R&D Mediation(调解研发部)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 该研究针对AI人格克隆问题,提出含六项分解的身份概念框架,定义不可区分性,通过类比阐明线性性,区分代理类型,提出实验计划,主张以环境保真度为长期标准,核心为条件猜想。
IF:CARGO:面向AI原生规则编程游戏的基于大语言模型的语义编译
专题命中 软件智能体 :agent(abstract)
AI总结 本研究通过实验性益智游戏IF:CARGO,将大语言模型用作语义编译器而非游戏代理,开展24人混合方法游戏测试,提出AI原生游戏需约束自然语言输入、保留玩家创作权并确保确定性执行的模式。
Comments Accepted to 2026 AAAI Conference on Artificial Intelligence and Digital Interactive Entertainment (AIIDE)
未知动力学下有限时域连续时间逆LQR的联合可识别性与条件约束
专题命中 软件智能体 :agent(abstract)
AI总结 本文针对未知动力学的有限时域连续时间逆LQR问题,利用时变最优增益的内生激励建立联合可识别性条件,开发感知条件的采样数据重构方法,通过数值实验验证了理论与条件指数的诊断价值。