Diagon: A Programmable Testbed for AI-Agent Cognitive Labor Markets
当智能体市场到来时
专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)
AI总结 本文提出可编程市场系统diagon,作为智能体认知劳动市场的制度设计实验平台,研究发现市场交换能带来生产力提升,但效果强烈依赖于制度结构。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
当智能体市场到来时
专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)
AI总结 本文提出可编程市场系统diagon,作为智能体认知劳动市场的制度设计实验平台,研究发现市场交换能带来生产力提升,但效果强烈依赖于制度结构。
SpecFirst:将行为规范提取作为从零开始的基于智能体的程序合成中的一等步骤
专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE
AI总结 SpecFirst是将行为规范提取设为独立前置阶段的两阶段框架,在ProgramBench上显著提升了从零开始的程序合成的测试通过率与二进制探索覆盖率。
跨模型跨语言AI编程智能体性能:并行CLRS算法的准确率与速度
专题命中 软件智能体 :agent(title,abstract);分类 cs.SE
AI总结 本文评估Cursor's Composer 2.0等三款AI编程智能体在三种语言三类算法上的并行代码生成性能,发现其并行能力弱于串行,性能提升高度依赖算法与语言,需将运行时效率纳入大语言模型核心指标。
基于智能体的人工智能助力大规模睡眠生理学研究
专题命中 软件智能体 :agentic(title,abstract)
AI总结 研究利用人工智能睡眠联合科学家环境,在约124,000份PSG记录上进行五个案例研究,揭示睡眠与疾病风险、临床分类及自身调节的联系,展示智能体人工智能助力大规模、多模态睡眠生理学发现。
ClinLens:面向纵向多模态临床数据科学的长周期编码智能体
机构 * Shandong University(山东大学)
专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI
AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。
MindForge:通过无源码程序合成教小型语言模型全生命周期软件工程
专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG、cs.SE
AI总结 研究针对小型语言模型从零构建程序的挑战,提出MindForge构建全生命周期无源码训练环境,微调Qwen3.6-27B后在ProgramBench及7个软件工程基准上性能显著提升。
初探编码智能体在开源社区中对AI贡献规则的合规性
专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE
AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。
ExplainBench:评估智能体生成的代码解释
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 该研究针对智能体代码解释缺乏评估基准的问题,提出ExplainBench基准,实验发现其对智能体的排名与SWE-bench Verified不同,还实现了解释审核智能体,可提升智能体解释的可信度。
Comments ASE 2026
(非)配对编程:编码智能体提升生产力但损害理解能力
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 该研究通过54名学生的对照实验,发现编码智能体虽提升生产力但损害用户代码理解,低投入交互加剧该问题,用户仍偏好智能体,同时为开发者提出了优化方向。
Comments In-progress Preprint
再试一次,不要回头:小型代码模型中盲重采样优于自我修复
专题命中 软件智能体 :分类 cs.AI、cs.LG、cs.SE;agent(comments)
AI总结 该研究针对MBPP+数据集在三种规模代码模型上发现,盲重采样在7B以下表现最优,成本远低于其他重试方法,而基于自身失败尝试的自我修复存在锚定效应导致的性能损失。
Comments Code, pre-registrations and run traces: https://github.com/vermayuvraj/self-improving-agent
HeteroPROPMT:一种实时且隐私保护的异构协同感知框架
机构 * Michigan State University(密歇根州立大学)
专题命中 软件智能体 :agent(abstract)
AI总结 HeteroPROPMT是一种实时隐私保护异构协同感知框架,通过模块化提示与轻量调优对齐异构智能体特征,在OPV2V-H等数据集上性能优于现有方法,且参数效率高、隐私性好。
Comments Accepted to 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 9 pages, 4 figures, 5 tables
一种更精确的有理非交换算法用于使用48次乘法的4x4矩阵乘法
专题命中 软件智能体 :agent(abstract)
AI总结 本文提出一种更精确的4x4矩阵乘法算法,使用48次非交换乘法,改进了误差界指数并提升了实际精度。
交互式奖励智能体:通过环境状态验证进行图形用户界面任务评估
专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI
AI总结 研究图形用户界面任务评估难题,提出交互式奖励智能体IRA,基于提议验证框架,结合可见界面与环境状态证据。IRA在GUI-RewardBench基准测试中准确率达86.9%,应用于强化学习时实现34.0%的OSWorld成功率,能为训练图形用户界面智能体提供有效奖励信号。
RAG-HAR+: 面向边缘部署的成本高效型基于大语言模型(LLM)的人类活动识别
机构 * University of Sydney(悉尼大学) ; Curtin University(科廷大学) ; Colorado State University(科罗拉多州立大学)
专题命中 GUI与网页智能体 :agent(abstract,abstract_cn);分类 cs.LG
AI总结 RAG-HAR+是面向边缘部署的成本高效型LLM辅助HAR方案,通过检索设计智能体优化特征、对确定样本用多数投票、仅不确定样本用LLM,在六基准上性能相当或更优且降低了LLM相关开销。
Comments Submitted to IEEE Transactions on Mobile Computing. Extended version of the IEEE PerCom 2026 paper "RAG-HAR: Retrieval Augmented Generation-based Human Activity Recognition." (https://doi.org/10.1109/PerCom67906.2026.11524560)
具有竞争性边际的合谋:价格水平审计天生具有盲目性
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 该研究指出价格水平审计天生对特定算法合谋盲目,通过理论分析、语言模型智能体实验及以太坊拍卖数据验证,提出监管应转向竞价身份计数而非检测。
Comments 11 pages, 4 figures, includes technical appendix
PUDA:面向自动驾驶实验室的AI原生硬件控制框架
专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI
AI总结 该研究提出面向自动驾驶实验室的AI原生硬件控制框架PUDA,通过命令行环境实现智能体与硬件的确定性交互,分离科学编排与物理操作,为智能体自动驾驶实验室提供实用执行与数据环境。
RLMM-Flow:一种基于流的隐空间强化学习移动操作框架
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 该研究提出RLMM-Flow框架,结合流策略预训练与隐空间强化学习,在移动操作基准上提升任务成功率等指标,同时保留流的快速推理能力。
行为-环境信息回路驱动感官导航
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 该研究提出基于传递熵的信息论框架,量化感官与行为的双向信息流,可预测生物与人工系统的导航效率,揭示了驱动导航的通用行为-环境反馈回路。
Comments 14 pages, 6 figures; supplementary information included
VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA
机构 * University of Maryland, College Park(马里兰大学帕克分校)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。
通过关系归纳偏差重新思考具身导航
机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) ; School of Information Science and Engineering, Hohai University(河海大学信息科学与工程学院)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 提出DB-Nav框架,利用激活偏置和抑制偏置双关系偏置重塑搜索空间,通过关系激活-抑制探索图调节前沿探索,显著提升目标导航成功率和路径效率。
穿越绘画:来自互联网先验的自我中心世界模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Toyota Research Institute(丰田研究机构)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。
智能体网络的保障范围型可靠性:捕获关键状态
专题命中 记忆与上下文管理 :agentic(title,abstract);tool use(abstract);planning(abstract)
AI总结 针对智能体网络的传统可靠性措施无法覆盖的失效模式,提出Reliability Assurance Intelligence架构,通过服务可靠性配置文件和上下文胶囊保障服务可靠性与问责性,以确定性网络服务为例验证该架构。
Comments 7 pages, 4 figures, 2 tables, 15 references
MemAgent:基于多轮对话强化学习的记忆智能体重构长上下文大语言模型
机构 * ByteDance Seed(字节跳动种子期) ; Institute for AI Industry Research (AIR)(人工智能产业研究院) ; Tsinghua University(清华大学)
专题命中 记忆与上下文管理 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 该研究提出MemAgent智能体工作流,结合扩展的DAPO算法优化长文本任务,实现从8K到3.5M上下文的高效外推,在RULER测试中表现优异。
Comments Accepted to ICLR 2026 as an Oral presentation. OpenReview: https://openreview.net/forum?id=k5nIOvYGCL Project page: https://memagent-sialab.github.io/
Journal ref International Conference on Learning Representations (ICLR), 2026
面向对话式AI智能体的原生图双时态内存存储
专题命中 记忆与上下文管理 :AI agent(title,abstract);agent(abstract);分类 cs.AI
AI总结 该研究针对对话式AI智能体跨会话持久内存缺失的问题,提出原生图双时态内存存储方案,经LongMemEval基准测试,在知识更新等任务上取得良好效果,为纯检索的局限性提供了改进方向。
面向智能体语音识别的语音记忆
机构 * NVIDIA(英伟达)
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 该研究提出仅推理方案Voice Memory,通过听者-思考者架构克制过度校正,在10个HyPoradise域上将加权词错误率降至7.52%,可跨校正器迁移且不增加推理参数。
Comments Preprint. Technical report and open source: https://huggingface.co/huckiyang/voice-memory
MemSecBench:追踪智能体内存中毒从持久性到后果及修复的全生命周期
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI
AI总结 本研究提出MemSecBench基准测试,通过24种配置的实验发现不同内存系统栈在智能体内存中毒的持久性、后果及选择性修复上存在显著差异,为智能体内存安全评估提供了工具。
IFCMemoryBench:评估基于大语言模型(LLM)的智能体在建筑信息模型(BIM)信息检索中的长期记忆能力
专题命中 记忆与上下文管理 :agent(abstract);workflow(abstract);分类 cs.AI;agentic(comments)
AI总结 本文推出IFCMemoryBench基准,评估基于LLM的智能体在BIM信息检索中的长期记忆,发现现有通用记忆系统在该场景下表现差,存在领域迁移差距。
Comments KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI
DualDecoder:通过预测预取加速长上下文大语言模型推理
专题命中 记忆与上下文管理 :agentic(abstract,abstract_cn)
AI总结 该研究针对长上下文LLM推理的内存墙瓶颈,提出轻量级服务系统DualDecoder,通过双token解码流水线预测预取关键KV条目,消除辅助状态开销,使解码吞吐量最高提升2.62倍且保留延迟与模型质量。
面向LLM智能体的基于文件系统的内存:组织、演化与可持续性
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, San Diego(加利福尼亚大学圣迭戈分校) ; University of California, Merced(加利福尼亚大学默塞德分校) ; Adobe Research(奥多比研究院) ; Texas A&M University(德克萨斯农工大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究首次系统探索面向LLM智能体的基于文件系统的内存,定义三个智能体角色开展实验,发现有组织存储可减半检索成本,但多数智能体组织会退化,工具集对存储形态的影响与更换模型相当,将文件系统设为智能体内存的设计空间。
Comments 59 pages, 12 figures, 18 tables
Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents
机构 * Shanghai Jiao Tong University(上海交通大学) ; OPPO Research Institute(OPPO研究院)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出了一种在测试时自适应的技能合成方法SkillTTA,通过检索与当前任务相关的少量训练轨迹并将其合成成为任务特定的文本技能,以提高LLM代理在SpreadsheetBench、ALFWorld和BigCodeBench等任务上的性能。
Comments 15 pages, 6 figures