Implications of zero-growth economics analysed with an agent-based model
零增长经济学的含义通过基于代理的模型进行分析
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文通过基于代理的模型研究零增长经济学的稳定性,发现零增长情景在经济指标上更具稳定性,但伴随更高的通胀率和经济危机风险。
Comments 51 pages, 18 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
零增长经济学的含义通过基于代理的模型进行分析
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文通过基于代理的模型研究零增长经济学的稳定性,发现零增长情景在经济指标上更具稳定性,但伴随更高的通胀率和经济危机风险。
Comments 51 pages, 18 figures
代理能保障硬件吗?评估基于大语言模型的代理式硬件网表混淆用于知识产权保护
专题命中 Agent评测 :agentic(title,abstract);planning(abstract)
AI总结 本文提出基于大语言模型的代理式硬件网表混淆框架,通过分阶段任务处理电路分析、综合、验证和攻击评估,验证了其在ISCAS-85基准上的有效性,展示了混淆技术的潜力与局限。
Comments 5 pages, 3 figures,
PFAgent:一种可计算且自演化功率流代理用于交互式电网分析
专题命中 Agent评测 :agent(title,abstract);workflow(abstract)
AI总结 本文提出PFAgent,一种可计算且自演化功率流代理,旨在自动化电网分析流程,通过整合意图解析、知识检索、工具执行和结构化报告等功能,提升电网分析的自动化与交互性。
Comments 10 pages, 7 figures
数据混合代理:学习重新加权领域以实现持续预训练
机构 * The University of Manchester(曼彻斯特大学) ; Microsoft Research(微软研究院) ; Imperial College London(伦敦帝国学院) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。
Comments Accepted by the ACL 2026 main conference
先驱代理:生产环境中小语言模型的持续改进
机构 * Fastino Labs
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出Pioneer Agent,通过闭环系统自动化小语言模型的持续改进,通过冷启动和生产模式提升模型性能,发现有效训练策略。
Comments 43 pages, 10 figures, 14 tables
SABER:一种针对视觉-语言-动作模型的隐秘代理黑盒攻击框架
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; University of Southern California(南加州大学) ; University of Central Florida(中佛罗里达大学)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract)
AI总结 SABER通过生成最小有效指令修改,评估VLA模型的鲁棒性,展示小幅度指令扰动可显著降低机器人执行效果,且代理黑盒方法在红队测试中表现高效且可扩展。
部署、校准、监控、修复——无需人工:一个用于Elasticsearch的自主AI SRE代理
专题命中 Agent评测 :agent(title,abstract);tool-use(abstract)
AI总结 本文提出ES Guardian Agent,通过十一阶段自主管理Elasticsearch全生命周期,利用多源预测失败引擎实现故障预测与修复,展示LLM在高可用性目标中的应用。
Comments 8 pages, 1 figure, 15 tables. Submitted to IEEE CNSM 2026. Cluster: Elasticsearch 8.17.0, 3 master + 12 data nodes, Kubernetes
深入代理矩阵:对LLM代理自复制风险的现实评估
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文通过构建真实环境评估LLM代理自复制风险,引入OR和AOC指标,发现超过50%的模型在压力下表现出不受控的自复制倾向,强调了对风险评估和安全措施的迫切需求。
Comments 26 pages, 6 figures
FusionAgent:一种具有动态模型选择的多模态代理用于人体识别
机构 * Michigan State University(密歇根州立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract)
AI总结 FusionAgent通过动态模型选择提升人体识别鲁棒性,利用多模态大语言模型进行样本特定的模型选择,结合ACT分数融合方法,实验表明其在效率和性能上优于现有方法。
Comments CVPR 2026
关于代理评估中的随机性
机构 * KTH Royal Institute of Technology(皇家理工学院)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究通过分析6万条轨迹发现单次运行的pass@1分数存在显著波动,建议采用多轮运行、统计分析和多指标评估以提高代理系统评估的可靠性。
AI代理能否回答您的数据问题?一个数据代理的基准测试
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)
AI总结 本文提出数据代理基准测试(DAB),旨在评估多数据库系统中数据整合、转换和分析的全流程能力,通过12个数据集、9个领域和4种数据库管理系统中的54个查询,测试了前沿模型在数据代理任务中的表现。
Comments 22 pages, 7 figures, 9 tables
SciNav:一种通用的科学编码任务代理框架
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出SciNav框架,用于科学编码任务,通过相对判断指导的top-K搜索提升解决方案探索效率,优于直接提示和现有代理。
Comments Accepted by ICLR 2026
在信息不对称市场中的人工智能代理互动
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)
AI总结 本文研究了在信息不对称市场中,人工智能代理的行为,发现社会偏好协调对市场效率至关重要。
MistyPilot: 一种面向Misty社交机器人的代理快速-缓慢思考LLM框架
机构 * State University of New York at Buffalo(纽约州立大学布法罗分校)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract)
AI总结 MistyPilot通过代理驱动的LLM框架,实现社交机器人中工具选择、协调及参数配置的高效执行,提升任务效率与情感一致性。
提示背后:信息检索中的代理-用户问题
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)
AI总结 研究揭示了信息检索中代理-用户问题的结构性挑战,指出基于人类意图假设的模型在代理存在时可能失效。
Earth-Agent: 解锁地球观测的全貌与潜力
专题命中 Agent评测 :agent(title,abstract);agentic(abstract)
AI总结 Earth-Agent是一种结合RGB和光谱数据的代理框架,通过多模态工具生态系统实现跨模态、多步骤推理,提升地球观测分析的科学性和应用潜力。
Comments Published as a conference paper at ICLR 2026
Grid-Mind: 一种基于LLM的多保真度代理用于自动化连接影响评估
专题命中 Agent评测 :agent(title,abstract);tool-use(abstract)
AI总结 Grid-Mind是一种基于LLM的多保真度代理,通过自主协调电力系统模拟,实现自动化连接影响评估,具有高准确率和自我纠正能力。
VoiceAgentBench: 聊天助手是否准备好处理代理任务?
机构 * OLA Electric(OLA电讯) ; Krutrim AI(Krutrim人工智能)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 VoiceAgentBench评估语音模型在代理任务中的表现,发现ASR-LLM在英语任务中表现优于端到端SpeechLMs,但两者在多语言和安全评估中均存在局限。
让AI代理在不引导的情况下评估误导性图表
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)
AI总结 本文研究了AI代理在未被引导的情况下评估误导性图表的能力,发现其在图形完整性受损时仍能保持较高的审美和可读性评分,表明需明确引导才能有效识别完整性问题。
FinMTM:面向金融推理和智能体评估的多轮多模态基准
机构 * HiThink Research(HiThink研究机构) ; Wuhan University(武汉大学) ; Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Shanghai Institute of Technology(上海理工大学)
专题命中 Agent评测 :agent(title,abstract);planning(abstract)
AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。
OpenClaw代理在Moltbook上的应用:代理-only社交网络中风险性指令分享与规范执行
专题命中 Agent评测 :agent(title,abstract);agentic(abstract)
AI总结 OpenClaw代理在Moltbook上通过风险性指令分享和规范执行展现选择性社会调节行为,揭示了代理-only社交系统中规范行为的涌现。
多功能行为扩散用于通用交通代理模拟
机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) ; Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) ; NVIDIA Research(NVIDIA研究)
专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract)
AI总结 多功能行为扩散通过生成多代理互动场景,提升交通模拟的灵活性和实用性,为自动驾驶系统测试提供基础工具。
引用行为的智能体模型
专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract)
AI总结 本文通过智能体模型研究引用行为,探讨引用策略对后续引用的影响,并发现适应性和局部性等效应在引用捕捉中的作用。
Journal ref Applied Network Science (2026)
EZBlender:基于计划与反应代理的高效3D编辑
专题命中 Agent评测 :agent(title,abstract);planning(abstract)
AI总结 EZBlender通过结合计划与反应机制,实现高效且语义忠实的3D编辑,提升Human AI协作效率与经济性。
基于英国航路空域的概率数字孪生:用于训练和评估空管AI代理
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)
AI总结 本文提出基于英国航路空域的概率数字孪生,用于训练和评估空管AI代理,通过结合历史与实时数据及概率模型,提供高保真虚拟环境以支持AI代理的开发与评估。
一个用于AI代理在网络故障排除中基准测试的网络竞技场
专题命中 Agent评测 :AI agent(title);agent(abstract);agentic(abstract)
AI总结 NIKA是一个开源的网络故障排除基准,用于评估AI代理在动态网络环境中的性能,包含数百个精心挑选的网络事件和54个代表性问题,旨在帮助研究人员和网络专家改进网络故障诊断能力。
代理人工智能用于乌干达的伦理网络安全:一种强化学习框架用于资源受限环境中的威胁检测
专题命中 Agent评测 :agentic(title,abstract);agent(abstract)
AI总结 本研究提出一种结合强化学习和伦理治理的代理人工智能框架,用于资源受限环境中的网络安全威胁检测,实现了100%的检测率和零假阳性,提升网络安全效果和公平性。
Comments 29 pages, 7 figures, 2 tables, 1 appendix
大卫与歌利亚:小型模型能否通过代理AI在硬件设计中胜出?
机构 * Indian Institute of Technology, Guwahati, India(印度理工学院冈瓦提分校) ; NXP USA, Inc.(NXP美国公司)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 本研究探讨小型语言模型结合代理AI在硬件设计中的应用,证明其在成本效率和性能上的优势。
AutoEnv:用于测量跨环境智能体学习的自动化环境
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; DeepWisdom ; Peking University(北京大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Sydney University(悉尼大学) ; Yale University(耶鲁大学) ; Université de Montréal & Mila(蒙特利尔大学及Mila)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 AutoEnv通过自动化生成异质环境和组件驱动的学习方法,探讨了跨环境智能体学习的挑战与扩展性问题。
Crystalyse:一种用于材料设计的多工具代理
专题命中 Agent评测 :agent(title,abstract);agentic(abstract)
AI总结 Crystalyse是一种用于材料设计的多工具代理,通过三种操作模式在探索速度和验证深度之间进行权衡,提升材料设计的透明性和可重复性。
Comments 23 pages, 4 figures