arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-30 至 2026-06-30 共收录 46 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 46 篇

2507.07445 2026-06-30 cs.AI 83%

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

专题命中 Agent评测 :agentic(title);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28690 2026-06-30 cs.CR 82%

Formal Security Analysis of Agent Protocol Composition

智能体协议组合的形式化安全分析

Shenghan Zheng, Qifan Zhang, Zheng Zhang, Haonan Li, Christophe Hauser

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)

AI总结 提出AgentThread框架,通过分层安全范围、TLA+形式化检查和两阶段验证器,对智能体协议进行安全分析,发现35个规范级问题及30个组合缺陷,揭示协议间责任缺失。

Comments Preprint. 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14207 2026-06-30 cs.AI 81%

Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks

人类恶意的回声在智能体中:为多轮在线骚扰攻击评估LLMs

Trilok Padhi, Pinxian Lu, Abdulkadir Erol, Tanmay Sutar, Gauri Sharma, Mina Sonmez, Munmun De Choudhury, Ugur Kursuncu

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出一个多轮在线骚扰攻击基准测试,通过合成数据集、多智能体模拟和三种 jailbreak 方法评估LLMs在多轮交互中的安全性,发现jailbreak调优显著提高攻击成功率,揭示了智能体在多轮对话中模仿人类攻击模式的弱点。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29914 2026-06-30 cs.CL cs.LG 81%

MemDelta: Controlled Baselines and Hidden Confounds in Agent Memory Evaluation

MemDelta:智能体记忆评估中的受控基线和隐藏混杂因素

Kuan Wang

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 提出MemDelta控制评估协议,通过逐一改变组件发现RAG与全上下文基线排名因模型而异,嵌入模型切换可翻转结论,智能体自记忆不如基本检索,建议固定嵌入模型并分层报告。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29776 2026-06-30 cs.LG cs.AI 81%

Towards Generalizable and Evidential Nuclear Magnetic Resonance-Based Molecular Structure Elucidation via Large Language Model Agent

面向可泛化与可证据的核磁共振分子结构解析:基于大语言模型智能体的方法

Zheng Fang, Chen Yang, Yusen Tan, Yunpeng Zhao, Fanjie Xu, Hongxin Xiang, Hanyu Sun, Hanyu Gao, Xiaojian Wang, Wenjie Du, Yuqiang Li, Jun Xia

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) State Key Laboratory of Precision and Intelligent Chemistry, University of Science and Technology of China(中国科学技术大学精密与智能化学国家重点实验室) State Key Laboratory of Physical Chemistry of Solid Surface, College of Chemistry and Chemical Engineering, Xiamen University(厦门大学化学系固态表面物理化学国家重点实验室) The University of Hong Kong(香港大学) Peking Union Medical College and Chinese Academy of Medical Sciences(北京协和医学院中国医学科学院) The Hong Kong University of Science and Technology(香港科技大学) Hunan University(湖南大学) AI for Science Center, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室人工智能科学中心)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 提出NMRAgent智能体,结合大语言模型、光谱分析工具和化学知识图谱,通过证据推理实现高精度、可解释的分子结构解析,在新型骨架测试集上Top-1准确率提升46.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28715 2026-06-30 cs.CL cs.AI 81%

SEATauBench: Adapting Tool-Agent-User Evaluation Into Low-Resource Southeast Asian Languages

SEATauBench:将工具-代理-用户评估适配到低资源东南亚语言

My Chiffon Nguyen, Aulia Adila, Saksorn Ruangtanusak, Kittiphat Leesombatwathana, Vissuta Gunawan Lim, Patomporn Payoungkhamdee, Samuel Cahyawijaya

机构 * SEACrowd SCB DataX SCBX Group Chulalongkorn University(朱拉隆功大学) VISTEC Cohere

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出SEATauBench,首个针对东南亚语言的智能体评估框架,通过渐进式本地化设置评估模型,发现英文能力在对话语言变化时迁移良好,但任务上下文本地化后质量与鲁棒性显著下降。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30383 2026-06-30 cs.AI 79%

Whose Side Is Your Agent On? Multi-Party Principal Loyalty in LLM Agents

你的智能体站在哪一边?LLM智能体中的多方委托人忠诚度

Bojie Li, Noah Shi

机构 * Pine AI University of Washington(华盛顿大学皮尼AI学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究LLM智能体在多方对话中对委托人的忠诚度问题,提出基准测试PrincipalBench和两种机制(提示忠诚度框架和知识蒸馏),揭示泄漏与过度拒绝之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29920 2026-06-30 cs.CL 79%

Can LLM-as-a-Judge Reliably Verify Rubrics in Agentic Scenarios?

LLM-as-a-Judge 能否可靠地验证智能体场景中的评分标准?

Yangda Peng, Yunjia Qi, Hao Peng, Haotian Xia, Guanzhong He, Xintong Shi, Richeng Xuan, Songyuanyi Lu, Yixian Liu, Zhichao Hu, Yuhong Liu, Lei Hou, Bin Xu, Juanzi Li

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 针对 LLM 作为裁判在智能体场景中验证评分标准的可靠性问题,构建首个基准 RuVerBench,评估多种前沿模型,发现即使最强模型也存在显著噪声,并分析了提示设计、批处理和多数投票等策略的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28739 2026-06-30 cs.AI 79%

Agent Safety Is Action Alignment

智能体安全即行动对齐

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文指出将内容安全方法(如拒绝训练)直接应用于智能体场景存在根本性错误,提出智能体安全应通过最小权限原则在行动边界外部强制执行,并作为行动对齐(关系性、部署条件属性)来评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28365 2026-06-30 cs.IR cs.AI 79%

CAMI: Cost-Aware Agent-Guided Multi-Indexing for Semantic Retrieval

CAMI:成本感知的智能体引导多索引语义检索

Adnan Qidwai, Anand Eswaran, Sonam Mishra, Jaydeep Sen, Sachindra Joshi

机构 * IBM Software Innovation Lab India(IBM软件创新实验室印度)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 提出CAMI框架,将多索引构建形式化为预算约束的多目标组合选择问题,通过智能体发现、原子单元搜索和置信度感知调度,在严格预算下系统性地识别高召回率索引组合,相比标准基线召回率提升9.4%,预算减少5倍。

Comments Accepted to ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28326 2026-06-30 cs.IR cs.AI 79%

ADEPT: An Entropy-Driven Dual-Strategy Agent for Interactive Video Retrieval

ADEPT: 一种熵驱动的双策略交互式视频检索智能体

Ke Chen, Shengyuan Han, Yongfeng Huang, Yujin Zhu, Jingwei Xiong, Liang Xu, Jundong Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出ADEPT框架,通过熵驱动的决策引擎动态选择ASK或REFINE策略,解决用户意图与查询之间的鸿沟,在交互式视频检索中显著超越现有基线。

Comments 5 pages, 3 figures. Published in IEEE ICASSP 2026

Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 9442-9446, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29850 2026-06-30 cs.CV 78%

Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction

面向具身AI的高效视觉指代:智能体驱动数据合成、跨块注意力与迭代校正

Zijian Hong, Qi Lv, Yuxiang Xie, Jianming Xing, Xiang Deng, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出PointArena 2026解决方案,通过智能体驱动数据合成、确定性可操控数据流水线、跨块注意力与迭代校正模块,实现77.2%总体准确率,排名第二。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28779 2026-06-30 cs.HC 78%

Telephony Voice Agent for Banking Services

银行服务的电话语音代理

Nitya Dhagat, Vipul K. Dabhi, Harshadkumar B. Prajapati, Zankhana J. Barad

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出基于Google Dialogflow CX的语音AI银行系统,支持余额查询、交易记录、卡激活等核心功能,并通过高并发和噪声测试验证其可扩展性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28374 2026-06-30 cs.AI 77%

Recursive Self-Evolving Agents via Held-Out Selection

通过保留集选择的递归自演化智能体

Michael Nguyen, Quoc Nguyen, Paul Vuong

专题命中 Agent评测 :agent(abstract);tool-use(abstract);workflow(abstract);分类 cs.AI

AI总结 提出RSEA递归自演化智能体,通过三层自然语言状态(策略、技能、规程)和严格保留集选择机制实现安全自演化,在四个基准上表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29193 2026-06-30 cs.SE cs.AI 73%

A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis

用于评估微服务故障诊断中LLM智能体的多数据集基准

Yuanhong Cai, Xiaohui Nie, Kanglin Yin, Changhua Pei, Yongqian Sun, Shenglin Zhang, Haibin Liu, Guiyang Liu, Xidao Wen, Fang Situ, Dan Pei

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出基于推理过程评估的基准,包含两个大规模数据集(AIOps2025和RCA100),从定位、识别和原因三个维度评估智能体诊断能力,覆盖500多个专家标注的故障案例。

Comments 10 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02380 2026-06-30 cs.CL cs.AI 73%

SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence

SPADE-Bench:通过计划-行动分歧评估智能体中的自发性策略欺骗

Yuyan Bu, Haowei Li, Qirui Zheng, Bowen Dong, Kaiyue Yang, Jiaming Ji, Yingshui Tan, Wenxin Li, Yaodong Yang, Juntao Dai

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Science(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 针对LLM智能体在工具使用中可能出现的自发性策略欺骗(计划与行动不一致),提出SPADE-Bench基准,通过结合实际工具执行和受控压力场景,严格区分欺骗与幻觉,实验证实该问题真实且紧迫。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29592 2026-06-30 cs.LG cond-mat.mtrl-sci physics.atom-ph physics.optics quant-ph 70%

STEMGym: Benchmarking Sequential Decision-Making under Dose Budgets in Autonomous Electron Microscopy

STEMGym: 自主电子显微镜中剂量预算下的序列决策基准测试

Can Polat, Erchin Serpedin, Mustafa Kurban, Hasan Kurban

机构 * Dept. of Electrical & Computer Eng.(电气与计算机工程系) Texas A&M Univ.(德克萨斯A&M大学) Dept. of Prosthetics & Orthotics(假肢与矫形学系) College of Science & Eng.(科学与工程学院) Ankara Univ.(安卡拉大学) Hamad Bin Khalifa Univ. and Texas A&M Univ. at Qatar(哈马德·本·卡西姆大学和德克萨斯A&M大学(卡塔尔))

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 通过15个物理模拟的STEM环境基准,发现感知管道(CNN分析师)是剂量效率的主要决定因素,而非导航策略,为自主电子显微镜的机器学习投入方向提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28450 2026-06-30 cs.CR cs.AI 70%

LLM agents security duality: a comprehensive survey of self-security and empowered cybersecurity

LLM代理安全二元性:自我安全与赋能网络安全的综合调查

Yiwei Xu, Yong Zhuang, Xuanming Liu, Tian Zhang, Bowen Xiao, Xiaoyang Xu, Delong Jiang, Juan Wang, Hongxin Hu

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) Department of Computer Science and Engineering, University at Buffalo(布法罗大学计算机科学与工程系)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 综述LLM代理的自我安全威胁与防御,以及其在网络攻防中的赋能作用,首次揭示两者间的正反馈协同效应。

Comments 73 pages,12 figures, 9 tables, Artificial Intelligence Review

Journal ref Artif Intell Rev (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29894 2026-06-30 cs.IR cs.AI cs.CL cs.LG 67%

SABER-Math: Automated Benchmark for Information Retrieval Evaluation in Mathematics

SABER-Math:数学信息检索评估的自动化基准

Nikolay Georgiev, Maria Drencheva, Kseniia Ibragimova, Ivo Petrov, Dimitar I. Dimitrov, Martin Vechev

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出首个无需专家标注的数学信息检索自动化基准SABER-Math,通过三步构建重排序任务,评估检索器在数学领域的效果,发现通用基准无法可靠预测数学检索性能。

Comments Accepted in the 3rd AI for Math Workshop at the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30266 2026-06-30 cs.LG cs.AI 62%

Towards Continual Motion-Language Agents: LoRA Variants for Incremental Motion Understanding and Generation

迈向连续运动-语言智能体:用于增量运动理解与生成的LoRA变体

Bertram Taetz, Hugo Albuquerque Cosme da Silva, Gabriele Bleser-Taetz

机构 * IT & Engineering International University of Applied Sciences(IT与工程国际应用科学大学)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 针对运动-语言智能体在连续任务中学习新运动概念时灾难性遗忘的问题,提出基于LoRA的混合专家架构,通过自编码器路由器选择任务特定专家,无需任务标签,在HumanML3D基准上实现双向任务近零遗忘并保持高质量。

Comments 16 pages, 1 figure, Accepted at the Conference on Lifelong Learning Agents (CoLLAs) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29646 2026-06-30 cs.LG cs.AI 62%

Fuzzing Large Language Models to Elicit Hidden Behaviours

模糊测试大型语言模型以揭示隐藏行为

Mohammed Abu Baker, Lakshmi Babu-Saheer

机构 * School of Computing and Information Science(计算与信息科学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究通过向模型权重或残差流注入高斯噪声的模糊测试方法,揭示后门模型中的隐藏行为,并提出基于代理任务的超参数选择策略,显著提升触发率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28992 2026-06-30 cs.CL cs.AI 62%

Fine-Tuning General-Purpose Large Language Models for Agricultural Applications:A Reproducible Framework and Evaluation Protocol Based on Qwen3-8B

面向农业应用的通用大语言模型微调:基于Qwen3-8B的可复现框架与评估协议

Zhaoyang Li, Ruijie Zhang, Jiaqi Liu, Zhaoji Sun

机构 * Sanya University(三亚大学) Hebei International Studies University(河北国际 Studies 大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出AgriTune-R框架,通过数据治理、指令构建、LoRA/QLoRA微调、检索增强生成和专家评估,将通用大语言模型适配到农业任务,并设计了包含事实性、安全性、证据一致性和不确定性表达的评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28747 2026-06-30 cs.AI cs.LG 62%

Self-Supervised Theorem Discovery in a Formal Axiomatic System

形式化公理系统中的自监督定理发现

Kazuki Ota, Takayuki Osa, Tatsuya Harada

机构 * The University of Tokyo, Japan(东京大学,日本) RIKEN AIP, Japan(日本RIKEN AIP)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一种自监督定理发现算法,通过交替进行证明搜索和有用定理提取,从公理和推理规则出发逐步构建定理库,实验表明发现的定理具有人类数学意义且能提升大语言模型证明性能。

Comments AI for Math Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28514 2026-06-30 cs.AI cs.CL 62%

GPTNT: Benchmarking Real-Time Collaboration Between Multimodal Agents on Keep Talking And Nobody Explodes

GPTNT:在《保持通话,无人爆炸》中基准测试多模态智能体之间的实时协作

Amit Parekh, Sabrina McCallum, Kareem Al-Hasan, Malvina Nikandrou, Alessandro Suglia, Ioannis Konstas

机构 * Heriot-Watt University(赫瑞-沃德大学) University of Edinburgh(爱丁堡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出GPTNT基准,基于合作游戏《保持通话,无人爆炸》测试多模态智能体在实时、信息不对称条件下的协作能力,发现当前最先进系统无法在实时中拆除任何炸弹。

Comments Project website and code at https://gptnt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28480 2026-06-30 cs.SE cs.AI 62%

TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents

TUA-Bench:通用终端使用代理的基准测试

Shoufa Chen, Luyuan Wang, Xuan Yang, Zhiheng Liu, Yuren Cong, Yuanfeng Ji, Feiyan Zhou, Xiaohui Zhang, Fanny Yang, Belinda Zeng

机构 * Meta AI Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出TUA-Bench,包含120个跨五类任务的终端代理基准,涵盖日常数字活动与科学工程工作流,通过执行评分评估,发现最强模型Claude Opus 4.8仅达65.8%,揭示通用终端代理的显著差距。

Comments Website: https://www.tuabench.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09708 2026-06-30 cs.LG cs.AI cs.DC 62%

Metal-Sci: A Scientific Compute Benchmark for Evolutionary LLM Kernel Search on Apple Silicon

Metal-Sci: 一个用于苹果硅芯片上进化式LLM内核搜索的科学计算基准

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Metal-Sci基准通过10个科学任务和六个优化领域,评估LLM在自动内核搜索中的性能,展示了不同模型在不同任务上的加速效果及结构化评估方法的可靠性。

Comments Published at the Fifth Workshop on Deep Learning for Code (DL4C) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10109 2026-06-30 cs.AI cs.HC cs.LG 62%

LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals

基于自我报告的LLM代理能够实现通用个体模拟

Joon Sung Park, Carolyn Q. Zou, Jonne Kamphorst, Niles Egan, Aaron Shaw, Benjamin Mako Hill, Carrie Cai, Meredith Ringel Morris, Percy Liang, Robb Willer, Michael S. Bernstein

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) Department of Communication Studies, Northwestern University(西北大学传播学系) Department of Communication, University of Washington(华盛顿大学传播学系) Google DeepMind(谷歌DeepMind) Department of Sociology, Stanford University(斯坦福大学社会学系) Sciences Po(巴黎政治学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基于自我报告数据的LLM代理在模拟个体行为方面的有效性,通过不同数据源构建代理并验证其在多种任务中的准确性和跨群体公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03915 2026-06-30 cs.CL cs.AI 62%

Rethinking Role-Playing Evaluation: Anonymous Benchmarking and a Systematic Study of Personality Effects

重新思考角色扮演评估:匿名基准测试与对性格效应的系统研究

Ji-Lun Peng, Yun-Nung Chen

机构 * National Taiwan University(国立台湾大学) Academia Sinica(中央研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出匿名基准测试方法,揭示角色扮演能力与角色识别的关联,通过性格增强方法提升匿名场景下的角色扮演性能。

Comments SIGdial 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30561 2026-06-30 cs.AI cs.CV cs.HC 57%

The Human Creativity Benchmark

人类创造力基准

Aspen Hopkins, Allison Nulty, Alexandria Minetti, Anoop Pakki, Angad Singh

机构 * Massachusetts Institute of Technology(麻省理工学院) Contra

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 提出人类创造力基准(HCB),通过收集领域专家的成对偏好、标量评分和定性理由,分离收敛(共享最佳实践)和发散(个体品味差异)信号,评估创意AI。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30185 2026-06-30 cs.AI 57%

Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents

Dynamo: 视觉-语言代理的动态技能-工具演化

Yutao Sun, Yanting Miao, Hao-Xuan Ma, Mengyu Zhou, Mingshuai Chen, Tiancheng Zhao, Dexin Wang, Lei Lv, Li Xu, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Alibaba Zhejiang University(阿里巴巴浙江大学) University of Waterloo(多伦多大学) Vector Institute(向量研究所) Nanjing University(南京大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Dynamo,一种无需训练、无需权重更新的框架,通过让冻结的VLM在少量标注数据上自我检查并演化可复用的推理技能和可执行的视觉工具,提升视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏