Three-Phase Evaluation of AI-Assisted Software Development Life Cycle
AI辅助软件开发生命周期的三阶段评估
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 该研究探究AI自主水平对软件开发的影响,通过三阶段对照实验对比不同AI工具辅助模式,发现更高AI自主度可降开发成本、提合规性、减认知负荷,专用架构工具表现更优。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
AI辅助软件开发生命周期的三阶段评估
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.SE
AI总结 该研究探究AI自主水平对软件开发的影响,通过三阶段对照实验对比不同AI工具辅助模式,发现更高AI自主度可降开发成本、提合规性、减认知负荷,专用架构工具表现更优。
Flow-A11y:基于流程感知的无障碍性测试
机构 * University of Luxembourg(卢森堡大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究现代网页应用因交互流程产生的无障碍性问题,提出Flow-A11y系统,通过在真实浏览器执行流程、记录运行时跟踪等方法,贡献为提高测试准确性及实现动态WCAG标准自动化评估。
使用Incognita评估基于社会分布式任务环境中行动的生成智能体
机构 * RedMind Research(RedMind研究)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究结合现有基准和社会模拟环境要求的评估设置,定义社会分布式任务环境,介绍Incognita框架,以之评估三个生成智能体模型,发现其在奖励和行为上有进展但可靠性仍低。
SMOCS:用于在生产中简化机器学习系统部署、监控和优化的流框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 研究针对机器学习模型在运行环境部署维护的挑战,提出基于Kafka的SMOCS框架,通过分层抽象、三线程代理架构和配置驱动部署模型应对,可简化流程,且平台无关、容错、可扩展。
AgentLTL:一种用于测量、执行和训练使用工具的语言模型代理程序合规性的跟踪验证框架
机构 * EPITA ; Bpifrance
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 介绍基于一阶线性时态逻辑的AgentLTL语言,用于表达代理跟踪的程序规则,产生确定性无评判的合规分数,此框架可用于约束和微调,提升模型合规性与准确性。
在物理基础环境中自专业化的视觉语言跨导芯片校准
机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究视觉语言智能体能否在无权重更新下校准超导跨导芯片。通过设计物理模拟环境、视觉语言智能体及无梯度在线自适应方法,在预算压力下提升芯片保真度,诊断硬件故障。
强化学习中分布偏移的统一因果起源分类法
机构 * IMT Atlantique(IMT大西洋) ; Flinders University(弗林德斯大学) ; IRL Crossing ; Priori Analytica ; CNRS(法国国家科学研究中心)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出一种统一因果起源分类法,将强化学习中的分布偏移按因果来源(内部/外部)和时间边界(显式/隐式/混合)分类,统一了分布内/外泛化与非平稳性分析。
Comments The paper is currently under review
接地优化:一种减少自动个人文档重写中LLM幻觉的分层工程框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出五层接地优化框架,通过时间验证、污染检测、结构不变性、提示接地和评估器,将简历重写中的幻觉率降至0.04-0.24。
Comments 13 pages, 1 figure. Equal contribution by both authors. Code and data: https://github.com/shashank-indukuri/grounded-optimization
人类与机器在生成式元学习中的协作:模型与算法
机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) ; Centre for Machine intelligence, University of Sheffield(谢菲尔德大学机器智能中心) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; Department of Computer Science, Aalto University(阿尔托大学计算机科学系)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出生成式元学习与人类反馈框架,通过专家直觉引导数据合成,利用条件神经ODE和强化学习迭代优化生成轨迹,理论证明分布对齐降低泛化误差,实验验证在分布偏移下提升鲁棒性。
LLM引导的ODE发现与小群体聚合数据的参数推断
机构 * Institute of Medical Biometry and Statistics, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院医学统计与生物统计研究所) ; Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院皮肤科) ; Prior Labs, University of Freiburg(弗莱堡大学Prior实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出AgentODE框架,利用LLM提出候选ODE结构,并通过工具增强的推理代理仅基于群体级汇总统计量迭代优化参数分布,实现从稀疏、噪声数据中发现可解释的ODE结构。
行为自适应对话代理:迈向流动人格框架
机构 * Northeastern University(东北大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出流动人格框架,根据任务上下文、用户目标和情境紧迫性,动态调整代理的隐喻角色和人格表达强度,以提升用户信任和体验。
Comments Presented at Bridging AI and Behavior Change, a Bridge Program organized at the AAAI Conference on Artificial Intelligence 2026 (AAAI-2026)
FinPersona-Bench: 自主金融代理纵向心理测量稳定性的基准
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; The University of Tokyo(东京大学) ; McGill University(麦吉尔大学) ; The Fin AI(Fin AI公司) ; Kyoto University(京都大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出FinPersona-Bench基准,通过合成市场分离价格与价值,评估LLM金融代理在长期部署中指令显著性衰减现象,发现指令重固化的效果因代理类型和市场环境而异。
Comments 29 pages, includes figures and tables; formalizes Mandate Salience Decay and introduces FinPersona-Bench
WorkBench 再探:两年后的工作场所智能体
机构 * Independent researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文重新评估2024至2026年间WorkBench基准上智能体的进展,发现前沿模型在能力和安全性上均有显著提升,但开放权重模型降低了高性能门槛。
Comments 8 pages, 3 figures. Follow-up to arXiv:2405.00823
超越编译:评估从自然语言到Lean的忠实语句形式化
机构 * University of California, Riverside(加州大学河滨分校) ; University of Arizona(亚利桑那大学) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出忠实语句形式化评估方法,结合Lean编译、跨模型语义判断和人类专家校准,发现编译通过但语义不忠实的29.0%差距,并分解形式化流程中的关键干预因素。
Comments 25 pages, 5 figures
面向编码大语言模型中隐式软件世界模型的评估
机构 * JetBrains Research(JetBrains研究)
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.SE
AI总结 本文通过预测执行资源(峰值内存、墙钟时间、分析器输出)扩展软件世界模型评估,发现前沿模型表现有限,表明对软件执行理解不足。
Comments Accepted to DL4Code workshop at ICML 2026
OpenFinGym: 一个可验证的多任务Gym环境,用于评估量化智能体
机构 * University of Edinburgh(爱丁堡大学) ; University College London(伦敦大学学院) ; Alan Turing Institute(艾伦·图灵研究所) ; University of Oxford(牛津大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出OpenFinGym统一环境,覆盖预测、市场生成、实时交易和欺诈检测等量化金融任务,支持自动化任务构建、容器化验证和延迟解析,以全面评估LLM智能体。
超越前馈网络:作为下一代通用人工智能主体性与内在安全基础的再入神经系统
机构 * Saint Petersburg State University(圣彼得堡国立大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出基于闭环再入循环(D<->I循环)的安全AGI架构蓝图,通过结构循环和自持放大数学保证自我模型、自我保存和未编程目标导向行为的涌现,并引入多项式时间可计算的S度量。
学习触发:大型强子对撞机的强化学习
机构 * University of Chicago(芝加哥大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; Fermi National Accelerator Laboratory(费米国家加速器实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 针对大型强子对撞机实时触发系统在带宽、延迟和存储约束下的阈值调优问题,提出基于强化学习的在线阈值控制方法,在模拟和真实数据上分别提升48%和56%的容忍时间比例。
论大语言模型评估中提示排序的稳定性
机构 * University of Amsterdam(阿姆斯特丹大学) ; Northeastern University(东北大学) ; University of California San Diego(加州大学圣迭戈分校) ; Duke University(杜克大学)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究提示排序在常见评估变化下的稳定性,发现顶级提示常变导致选择不可靠,提出基于置信下限的稳定性感知选择策略以提高鲁棒性。
EnterpriseClawBench: 从真实工作会话中基准测试智能体
机构 * Horizon Research, Frontis.AI(地平线研究,Frontis.AI)
专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.SE
AI总结 提出EnterpriseClawBench,从真实企业工作会话构建852个可复现任务,评估智能体在文件读取、工具调用和工件交付方面的能力,最佳配置得分仅0.663。
MuPPET:多轮对话中LLM助手上下文隐私的基准测试
机构 * Parameter Lab(参数实验室) ; University of Rome Tor Vergata(罗马第二大学) ; University of Oxford(牛津大学) ; NAVER AI Lab(NAVER AI实验室) ; KAIST AI(韩国科学技术院人工智能研究所)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出MuPPET基准,评估多用户对话中LLM代理的隐私泄露风险,发现模型在多用户场景下泄露更严重,现有防御措施效果有限。
StatABench:评估大语言模型统计分析能力的数据集与框架
机构 * Southern University of Science and Technology(南方科技大学) ; Alibaba Group(阿里巴巴集团) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The University of Hong Kong(香港大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出StatABench基准,包含404道封闭题和30道开放建模任务,评估LLM在统计分析上的能力,实验显示最佳模型仅达68.6%准确率,揭示工具推理和建模决策等挑战。
从片段到路径:大型工业代码库的任务级上下文恢复
机构 * AMAP, Alibaba Group(阿里集团AMAP) ; Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学) ; University of Cambridge(剑桥大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 提出DeepDiscovery方法,通过两阶段定位-推理框架在预算约束下恢复任务级上下文,显著提升大型工业代码库的文件检索和下游软件工程任务性能。
Comments 12 pages, 3figures
噪声即信号:基于密度的异常值作为劳动力市场文本中职业涌现的领先指标
机构 * Independent Researcher(独立研究员)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出涌现-密度反转假设,证明低密度异常值预示新职业涌现,通过时序分析验证并改进涌现职业评分,预测准确率从F1=0.61提升至0.74。
词汇共识:人工智能体中的具身词汇学习与共享意义
机构 * Neurocreaciones
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出词汇共识框架,利用冻结的DINOv2视觉嵌入和卡罗尔式无意义词,研究智能体如何从结构化感知中获取、稳定和使用新词汇意义,发现感知距离主导词汇习得梯度。
Comments 41 pages, 12 figures, 9 tables. Code and experiment artifacts available at https://github.com/patriciomvera/lexical-consensus
使用调查增强的大语言模型生成公共卫生响应
机构 * Hawk.illinoistech.edu(伊利诺伊理工学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究利用大语言模型生成合成调查数据,以模拟真实人群在流行病中的健康决策行为,发现合成数据能复现人口统计和信念分布,但难以捕捉因素间的协变关系,不能替代真实调查。
Comments 24 pages, 6 figures
模拟客户永不离开:LLM用户模拟器与实际购买结果的决策保真度
机构 * Chinese relationship-matchmaking service(中国婚恋服务平台)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出决策保真度概念,通过对比LLM模拟器与真实客户在销售对话中的决策状态,发现模拟器高估非购买者的参与度,低估其拒绝意愿,导致系统偏差。
CRAX:快速安全强化学习基准测试
机构 * Eindhoven University of Technology(埃因霍温理工大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出基于JAX加速的安全RL基准CRAX,利用MJX物理引擎实现高达100倍加速,包含6个环境套件和3个智能体任务,评估6种方法揭示性能与安全权衡。
OnDeFog:帧丢失下的在线决策变压器
机构 * Yokohama National University(横滨国立大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 针对帧丢失导致性能下降的问题,提出OnDeFog,将DeFog机制与在线决策变压器结合,通过直接环境交互学习策略,在高丢帧率环境下优于ODT,在低奖励数据集上优于DeFog。
Comments Accepted to PRICAI 2025
RedactionBench:基于上下文完整性的隐私保护基准测试
机构 * A10 Networks, Inc.(A10网络公司)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 RedactionBench通过200个跨11个领域的文档,评估红actions的上下文隐私问题,提出R-Score指标,揭示红actions的主观性,推动隐私保护系统的发展。