Discovering Agents for Discovery: The Case for DNS
发现智能体:DNS 的案例
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 本文提出利用 DNS 作为 AI 智能体发现的基础设施,通过评估导航完整性、查找复杂性和事务性能,证明 DNS 能够以低延迟和低数据量支持大规模智能体发现。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
发现智能体:DNS 的案例
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 本文提出利用 DNS 作为 AI 智能体发现的基础设施,通过评估导航完整性、查找复杂性和事务性能,证明 DNS 能够以低延迟和低数据量支持大规模智能体发现。
SkillAdaptor:基于轨迹的LLM智能体自适应技能
机构 * Zhejiang University(浙江大学) ; Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) ; Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出SkillAdaptor,一种无训练的步骤级技能自适应框架,通过显式故障归因和针对性更新,提升LLM智能体在长程交互任务中的表现。
Comments Work in progress
BAGEN:LLM 智能体是否具有预算意识?
机构 * Northwestern University(西北大学) ; O2 Lab(O2实验室) ; Independent(独立) ; University of Michigan(密歇根大学) ; Cornell(康奈尔大学) ; All Hands AI ; Stanford(斯坦福大学) ; UT Austin(德克萨斯大学奥斯汀分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出预算感知智能体(BAGEN)概念,将预算作为主动控制信号而非被动成本指标,通过渐进区间估计方法预测剩余预算上下界,并在四个环境和五个前沿模型上发现强模型不一定具有强预算意识、模型过度乐观等失败模式,早期停止可节省 28-64% 令牌,但精确区间校准仍具挑战。
当单一答案不够时:重新思考面向大语言模型的单步逆合成基准
机构 * DeepMind, London, UK(伦敦英国深度思维公司)
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 针对现有逆合成基准依赖单一真实答案的局限,提出基于化学合理性度量ChemCensor的新评估框架,并构建数据集CREED训练模型以提升性能。
CityTrajBench: 城市尺度车辆轨迹生成的统一基准
机构 * Department of Building Environment and Energy Engineering, The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学建筑环境与能源工程系) ; Eastern Institute for Advanced Study, Eastern Institute of Technology, Ningbo, China(宁波东部先进研究所) ; International Centre of Urban Energy Nexus, The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学城市能源 nexus 中心) ; Department of Computer and Systems Sciences, Stockholm University, Sweden(斯德哥尔摩大学计算机与系统科学系) ; Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin, Eastern Institute of Technology, Ningbo, China(浙江工业智能与数字孪生重点实验室) ; Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo, China(宁波数字孪生研究所) ; LocationMind Inc., Tokyo 101-0042, Japan(LocationMind公司)
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 为解决轨迹生成方法因数据集、预处理、表示和评估指标不一致导致的比较困难,提出CityTrajBench统一基准框架,标准化数据处理、模型适配与多级评估,并在三个真实数据集上对比统计、VAE、GAN、扩散和流匹配模型,揭示不同模型在全局真实性、轨迹几何保真度等指标上的权衡。
STABLEVAL: 面向AI系统的分歧感知与稳定评估
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 针对多数投票法在标注者分歧下导致排名不稳定的问题,提出STABLEVAL框架,通过建模潜在正确性和标注者混淆模式,实现稳定且不确定性感知的系统评估。
超越视觉保真度:通过下游任务集成评估大规模遥感影像的超分辨率模型
机构 * University of Maryland(马里兰大学) ; University of Pittsburgh(匹兹堡大学) ; Worcester Polytechnic Institute(沃思利技术学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 针对现有超分辨率评估依赖PSNR/SSIM等保真度指标而忽略下游任务效用的问题,提出GeoSR-Bench基准数据集,集成土地覆盖分割、基础设施映射等下游任务,评估GAN、Transformer等9种SR模型在270种设置下的性能,发现保真度指标与任务性能弱相关甚至负相关。
Comments Under review at IEEE TPAMI
学习测量:上下文主动特征获取
机构 * University of Tokyo(东京大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出 Learning-to-Measure (L2M) 方法,通过不确定性量化与条件互信息引导的贪婪特征获取,在上下文学习中解决元主动特征获取问题,无需针对每个任务重新训练。
StreamingVLM:无限视频流的实时理解
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.CL
AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。
Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work
追踪自适应智能体的行为轨迹
机构 * University of Birmingham(伯明翰大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出一种通过文本嵌入空间中的方向定义智能体特质的方法,训练线性模型对技能文件差异进行评分,实现高准确率的行为特质分类与排序。
Comments 5 pages, 1 figure. To appear at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026
评估算法选择模型的现实世界泛化能力
机构 * Computer Systems Department, Jožef Stefan Institute(计算机系统部门,约泽夫·斯蒂芬研究所) ; Brno University of Technology(布拉格技术大学)
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 通过跨基准测试系统评估算法选择模型在合成与现实优化问题上的泛化能力,分析其迁移性能并指出在特定领域应用中的挑战。
Comments 10 pages, 12 figures
CRAB-Bench:在复杂任务依赖和人类对齐用户模拟下评估LLM智能体
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 提出CRAB-Bench和RUSE框架,通过约束图生成复杂任务依赖和基于人类行为研究的用户模拟,评估LLM智能体在真实服务场景中的表现,发现最佳模型仅达61%通过率,用户模拟导致性能下降高达57%。
JenBridge: 跨场景转换的自适应长视频配乐
机构 * Jen Music AI
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出JenBridge框架,通过基于Transformer的生成模型、双文本-视觉条件对齐和LLM代理驱动的自适应过渡机制,实现长视频配乐的高保真生成与场景转换自然连贯。
所有模型都是错的,知道哪里有用:强化学习中的模型不确定性
机构 * German Federal Ministry of Research, Technology and Space (BMFTR)(德国联邦研究、技术和空间部) ; Robotics Institute Germany (RIG)(德国机器人研究所) ; Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程数据科学研究所,亚琛工业大学) ; NHR Center NHR4CES at RWTH Aachen University(亚琛工业大学NHR4CES中心)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 提出通过针对性处理概率模型的不确定性来减轻模型利用的框架,并展示在硬件直接学习和安全探索方面的成功。
算法在绿色建筑节能设计平台中的应用
机构 * First Highway Engineering Co., Ltd.(第一公路工程有限公司)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出一种结合BIM、传感器数据和进化多目标优化的算法平台,通过动态能耗仿真降低建筑能耗29.3%,并验证了其可扩展性和技术可行性。
Comments 9 pages, 4 figures.2026 International Conference on Big Data Applications in Education and Engineering (ICBDAEE 2026)
机电系统参数辨识中最优实验设计的强化学习方法
机构 * Josef Ressel Centre for Intelligent and Secure Industrial Automation, Salzburg University of Applied Sciences, Salzburg, Austria(约瑟夫·雷斯尔智能与安全工业自动化中心,萨尔茨堡应用技术大学,萨尔茨堡,奥地利) ; Paris Lodron University of Salzburg, Salzburg, Austria(萨尔茨堡巴黎洛登伦大学,萨尔茨堡,奥地利)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 提出一种强化学习智能体,通过奖励塑形自主满足安全约束,为Quanser Aero 2测试平台学习最优激励信号,在三个辨识参数上均达到竞争性估计精度,且安全违规率仅0.75%。
Comments Accepted at DEXA AI4IP 2026
大型语言模型作为探索性数据分析代理的商业实用性
机构 * deepsense.ai ; SGH Warsaw School of Economics(SGH沃兹尼亚克经济学院) ; Bydgoszcz University of Science and Technology(比得戈茨茨理工大学) ; Google(谷歌)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 通过基于代理的供应链模拟基准,评估LLM作为EDA代理在商业环境中的平均性能与可重复性,提出风险调整指标Business utility,发现多数配置不可靠,GPT-5.4表现最佳。
全面的人工智能治理需要解决非模型增益问题
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Open Philanthropy(开放哲学基金会)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出非模型增益的概念,包括推理增益、系统增益和资产增益,并论证这些增益会削弱以模型为中心的治理有效性,进而提出超越模型层面的治理方法。
Comments This paper has been accepted to ICML 2026 (Position paper track): https://openreview.net/forum?id=V3O1sHpKxX
Cookie-Bench: 面向网页生成的连续屏幕按键交互评估
机构 * Baidu Inc.(百度公司) ; Beijing, China(中国北京)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出一种无参考、自主驱动且整体推理的网页生成评估框架Cookie-Bench,通过元认知监控分阶段收集证据并评分,与专家评分高度一致。
OpenHospital: 一个用于进化和基准测试基于LLM的集体智能的物自体竞技场
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, Zhejiang Gongshang University(浙江工商大学共同富裕统计监测与智能治理实验室) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室) ; Alibaba Cloud(阿里云)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出OpenHospital交互式竞技场,通过医生代理与患者代理的互动进化集体智能,采用数据在代理自身范式快速提升能力并提供医学熟练度和系统效率的基准测试。
ADRA-Bank:面向学术深度研究智能体的模块化基准
机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) ; Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) ; National University of Singapore, Singapore, Singapore(新加坡国立大学) ; Huawei Technologies, Hong Kong SAR, China(华为技术有限公司) ; Independent(独立)
专题命中 Agent评测 :planning(abstract);分类 cs.CL
AI总结 针对现有基准侧重检索而忽视规划与推理、且缺乏学术领域覆盖的问题,提出ADRA-Bank模块化基准,包含10个学术领域的200个人工标注实例,并设计ADRA-Eval评估范式,通过端到端和隔离评估两种模式测试规划、检索和推理能力,揭示智能体在跨源检索和跨领域一致性上的不足,并指出提升高层规划能力是释放基础LLM推理潜力的关键。
用LLM进行视频通话:对六个主流应用的测量活动
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI
AI总结 本文通过自定义测试平台和在线平台,从质量、延迟、内部机制和系统开销四个维度对六个主流AI视频聊天应用进行基准测试,发现AI视频通话的网络延迟影响小于人类视频通话,AI代理能力对用户体验影响最大。
优化嫉妒循环消除算法
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究通过启发式策略优化嫉妒循环消除算法,以在保持EF1公平性的同时提高社会福利。
无需反事实的决策者测试
专题命中 Agent评测 :agent(abstract)
AI总结 研究在bandit环境下,外部观察者如何仅基于观测到的决策、建议和臂实现来识别更知情的主体,并探讨了评分测试的存在性及其与福利最大化之间的权衡。
看向哪里:基础模型能否通过主动探索达到目标视角?
机构 * Zhejiang University(浙江大学)
专题命中 Agent评测 :agent(abstract)
AI总结 提出目标视角复现(TVR)任务及TVRBench基准,通过分析现有模型瓶颈并构建统一后训练框架,将9B开源模型成功率提升至50%以上。
Comments Project page: https://github.com/aim-uofa/TVRBench
重复下降:在线预算可行拍卖的框架
专题命中 Agent评测 :agent(abstract)
AI总结 提出基于自适应线性定价的确定性框架Repeated Descent,用于在线预算可行拍卖,在秘书到达和子模估值下实现1046-竞争比,并首次对非单调子模估值获得常数竞争比。
基于EuroCrops驱动的Sentinel-2作物分割的建模与评估框架
机构 * Transilvania University of Braşov(布拉索夫瓦拉米亚大学)
专题命中 Agent评测 :workflow(abstract)
AI总结 提出一个可配置的流水线,利用EuroCrops标注和Sentinel-2影像生成语义分割数据集,并训练U-Net模型评估其在域内和域外数据集上的性能。
邀请陷阱:通过对话诱导实现LLMs的主动可用性后门
专题命中 Agent评测 :agent(abstract)
AI总结 提出主动可用性后门(PAB)范式,利用LLMs的助人性通过主动社会工程诱导用户执行触发植入查询,实现高攻击性、精确性和隐蔽性。
Comments 29 pages
脑肿瘤手术中术中超声到MR合成的系统基准测试
机构 * Department of Neurosurgery, Neurovascular Unit Río Hortega University Hospital(里奥霍尔特ega大学医院神经外科部门,神经血管单元) ; Specialized Group in Biomedical Imaging and Computational Analysis (GEIBAC)(生物医学成像与计算分析专项组(GEIBAC)) ; Instituto de Investigación Biosanitaria de Valladolid (IBioVALL)(瓦尔拉多利德生物医学研究 institute(IBioVALL))
专题命中 Agent评测 :planning(abstract)
AI总结 针对脑肿瘤手术中术中超声(ioUS)到MR图像合成问题,本研究在公共ReMIND数据集上系统比较了6种生成器、4种推理模式和2种目标,结合图像保真度指标和下游分割评估,发现感知质量(LPIPS)与下游效用最相关,而SSIM与效用负相关,SynDiff-2.5D在下游分割中表现最佳。
SF-LIFE:旧金山湾区大规模模拟移动数据集
专题命中 Agent评测 :agent(abstract)
AI总结 为加速交通、移动性和机器学习研究,我们构建了SF-LIFE数据集,包含50万模拟智能体在旧金山湾区70天内以1Hz频率记录的完整、无噪声、多模态轨迹,并提供交通模式标签、降采样版本、活动信息、人口统计数据和OSM路网建筑数据。