arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5059 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5059 篇

2607.16900 2026-07-23 cs.AI 版本更新 57%

Environment-free Synthetic Data Generation for API-Calling Agents

用于 API 调用智能体的无环境合成数据生成

Seanie Lee, Sanjoy Chowdhury, Chao Jiang, Cheng-Yu Hsieh, Ting-Yao Hu, Alexander T Toshev, Oncel Tuzel, Raviteja Vemulapalli

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 研究针对训练 API 调用 LLM 智能体数据收集瓶颈问题,提出无环境合成数据生成方法,利用 LLMs 生成任务、响应等,经评判器过滤轨迹,在相关基准上评估,结果表明此方法可有效训练智能体,是实用可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07473 2026-07-22 cs.CR cs.AI 版本更新 57%

Give Them an Inch and They Will Take a Mile:Understanding and Measuring Caller Identity Confusion in MCP-Based AI Systems

给予一寸,他们将索取一英里:理解和测量基于MCP的AI系统中的调用者身份混淆

Yuhang Huang, Boyang Ma, Biwei Yan, Xuelong Dai, Yechao Zhang, Minghui Xu, Kaidi Xu, Yue Zhang

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗克Quantin 研究院) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Shandong University(山东省大学) City University of Hong Kong(香港城市大学)

专题命中 工具调用 :AI agent(abstract);分类 cs.AI

AI总结 研究发现基于MCP的AI系统因缺乏调用者身份验证和细粒度授权而存在安全风险,需改进认证机制以减少攻击面。

Comments Withdrawal due to some flaws in experimental methodology and unresolved ethical issues in data collection. We need to redesign the experiments and obtain proper ethical clearance before resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18045 2026-07-21 cs.AI cs.GT cs.MA 新提交 57%

The Shared Discovery Paradox: How a One-Answer Rule Turns Better Information into Worse Search

共享发现悖论:单答案规则如何将更好的信息转化为更差的搜索

Yohei Nakajima

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 研究共享信息时单答案规则导致的发现悖论,通过可精确求解的十六盒模型对比不同情况,指出这是协议失败。还探讨了自利搜索者博弈及共同线索模型,贡献是分离信息等因素为精确可复用量的紧凑基准。

Comments 29 pages, 4 figures. Code, data, and an interactive guide: https://github.com/yoheinakajima/shared-discovery-paradox

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17558 2026-07-21 cs.AI 新提交 57%

Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?

为什么反馈增强的自蒸馏不能改进检索交织搜索智能体?

Fan Yang, Rui Meng, Yuxin Wen

机构 * Chapman University(查普曼大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 研究反馈增强的自蒸馏在智能体搜索中失效的原因,发现模型存在解码崩溃现象,因监督信号不一致致学习不稳定,将其分解为模型和提示不一致,引入EMA教师减轻不一致,最终提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16851 2026-07-21 cs.AI 新提交 57%

AgentBrew: Lifelong Knowledge Brewing from Strong Teachers to Weak LLM Agents

AgentBrew:从强大教师到弱小语言模型智能体的终身知识酿造

Yangqin Jiang, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 研究语言模型智能体知识酿造问题,提出AgentBrew方法,含失败触发教师和学生感知合成两个组件,无需训练,能将教师交互经验提炼到学生外部记忆,经实验验证可产生强大且可部署的智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02528 2026-07-21 q-fin.GN cs.CY cs.LG 版本更新 57%

Auditing Asset-Specific Preferences in Financial Large Language Models: Evidence from Bitcoin Representations and Portfolio Allocation

审计金融大语言模型中的资产特定偏好:来自比特币表征与投资组合配置的证据

Wenbin Wu

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 本研究通过三级审计协议,发现大型语言模型对比特币存在框架依赖的偏好,并识别出模型内部一个可因果干预的比特币选择性特征,该特征能显著影响下游投资组合配置。

Comments 31 pages, 6 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30664 2026-07-21 cs.AI 版本更新 57%

Structure-Induced Information for Rerooting Levin Tree Search

结构信息用于重定根莱文树搜索

Jake Tuero, Michael Buro, Laurent Orseau, Levi H. S. Lelis

机构 * Department of Computing Science, University of Alberta, Edmonton, Canada. Alberta Machine Intelligence Institute (Amii), Edmonton, Canada. Google DeepMind, London, United Kingdom.

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出三种重定根器设计,利用结构信息隐式分解子目标,提升策略树搜索的可扩展性和效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16842 2026-07-21 cs.LG cond-mat.dis-nn cond-mat.stat-mech cs.SY eess.SY physics.bio-ph 版本更新 57%

Stochastic Resetting Accelerates Reinforcement Learning Beyond Random Search

随机重置加速强化学习中的策略收敛

Jello Zhou, David J. Schwab, Vudtiwat Ngampruetikorn

机构 * Biophysics Program, Stanford University(斯坦福大学生物物理项目) School of Physics, University of Sydney(悉尼大学物理学院) National Institute for Theory and Mathematics in Biology, Northwestern University(生物理论与数学国家研究所,西北大学) The University of Chicago(芝加哥大学) Princeton-CUNY Center for the Physics of Biological Function, The Graduate Center, CUNY(普林斯顿-纽约大学生物物理功能中心,纽约大学研究生中心)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 研究探讨随机重置与强化学习的交互,发现其能加速策略收敛,通过截断长轨迹提升价值传播,为强化学习提供新的优化机制。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22759 2026-07-20 cs.AI 版本更新 57%

Towards a General Intelligence and Interface for Wearable Health Data

迈向可穿戴健康数据的通用智能与接口

Girish Narayanswamy, Maxwell A. Xu, A. Ali Heydari, Samy Abdel-Ghaffar, Marius Guerard, Kara Vaillancourt, Zhihan Zhang, Jake Garrison, Levi Albuquerque, Dimitris Spathis, Hong Yu, Hamid Palangi, Xuhai "Orson" Xu, David G. T. Barrett, Joseph Breda, Jed McGiffin, Yubin Kim, Yuwei Zhang, Naghmeh Rezaei, Samuel Solomon, Karan Ahuja, Tim Althoff, Jake Sunshine, Ming-Zher Poh, Benjamin Yetton, Ari Winbush, Nicholas B. Allen, James M. Rehg, Isaac Galatzer-Levy, Yun Liu, John Hernandez, Anupam Pathak, Conor Heneghan, Yuzhe Yang, Ahmed A. Metwally, Pushmeet Kohli, Mark Malhotra, Shwetak Patel, Xin Liu, Daniel McDuff

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学) University of Oregon(俄勒冈大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出一个基于超过一万亿分钟无标签传感器数据预训练的可穿戴健康基础模型,通过联合扩展模型容量和预训练数据量,在35项健康预测任务上实现系统性性能提升,并利用LLM代理自动搜索下游预测头,集成到个人健康代理中以提高相关性和安全性。

Comments Narayanswamy and Xu are co-first authors. McDuff and Liu are co-last authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00100 2026-07-20 cs.CY cs.AI cs.ET 版本更新 57%

A Scaffolded GenAI Lab in Early Undergraduate CS: A Mixed-Methods, Multi-Course Evaluation

本科早期计算机科学中的一个支架式生成式人工智能实验室:混合方法、多课程评估

Ethan Dickey, Andres Bejarano, Rhianna Kuperus, Bárbara Fagundes

机构 * Purdue University(普渡大学)

专题命中 工具调用 :tool use(abstract);分类 cs.AI

AI总结 研究在本科早期计算机科学课程中评估 “AI实验室” 这一支架式GenAI素养干预。通过多课程混合方法收集数据,发现其能改变学生对GenAI的态度及使用策略,且不增加评分作业中GenAI的使用量,推动相关三角测量研究。

Comments 18 pages, 3 figures, 18 tables; v2 substantially refined qualitative analysis and discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14093 2026-07-17 cs.AI 新提交 57%

Intelligent Three Level Learning Architecture for Autonomous UAV Swarms in Search and Rescue

用于自主无人机群搜索和救援的智能三级学习架构

Oleksii Bychkov

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 本文针对无人机群搜索和救援提出智能三级学习架构,集成三种学习机制,通过架构契约形式化,引入群体元认知,有进展函数和主整合定理,解决了现有分层强化学习方法的五个基本限制。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09727 2026-07-17 cs.AI 版本更新 57%

Gaussian Process Aggregation for Root-Parallel Monte Carlo Tree Search with Continuous Actions

用于具有连续动作的根并行蒙特卡罗树搜索的高斯过程聚合

Junlin Xiao, Victor-Alexandru Darvariu, Bruno Lacerda, Nick Hawes

机构 * Oxford Robotics Institute, Department of Engineering Science, University of Oxford(牛津机器人研究所、工程科学系、牛津大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 研究连续动作空间环境中根并行蒙特卡罗树搜索的聚合问题,核心方法是用高斯过程回归获取动作值估计,经6个领域系统评估,该方法优于现有策略且推理时间增加适度。

Comments To appear in the Reinforcement Learning Journal (RLJ) and to be presented at the Third Reinforcement Learning Conference (RLC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11913 2026-07-15 cs.NE cs.AI 新提交 57%

Towards Self-Evolving Agents: A Human-Inspired Adaptive Exploration-Exploitation Framework for Genetic Network Programming

迈向自我进化智能体:一种受人类启发的遗传网络编程自适应探索-利用框架

Ali Kohan, Mohamad Roshanzamir, Roohallah Alizadehsani, Seyedali Mirjalili

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 该研究受人类发育模式启发,提出人类启发的遗传网络编程(HGNP)框架,通过新型自适应交叉、变异算子及循环消除机制,动态调节遗传网络编程中探索与利用的平衡,提升了智能体策略性能,且可应用于多种GNP变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14539 2026-07-15 cs.CR cs.HC cs.SE 57%

When Security Meets Usability: An Empirical Investigation of Post-Quantum Cryptography APIs

当安全性遇见可用性:后量子密码学API的实证研究

Marthin Toruan, R. D. N. Shakya, Samuel Tseitkin, Raymond K. Zhao, Nalin Arachchilage

专题命中 工具调用 :workflow(abstract);分类 cs.SE

AI总结 通过实证评估开发者与后量子密码学API的交互,识别影响可用性的认知因素,并提出改进建议以促进PQC的采用。

Comments Accepted at the NDSS Symposium on Usable Security and Privacy (USEC) 2026

Journal ref Symposium on Usable Security and Privacy (USEC) 2026, San Diego, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11818 2026-07-14 cs.CV cs.AI 新提交 57%

MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents

MM-ToolSandBox:一个用于评估视觉工具调用智能体的统一框架

Kaixin Ma, Di Feng, Alexander Metz, Jiarui Lu, Eshan Verma, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 介绍MM-ToolSandBox框架,它能支持多图像、多轮任务,通过自动化管道生成场景。评估12个先进模型发现当前模型视觉工具调用能力不足,视觉精度是瓶颈,不同规模模型失败原因不同,该框架和基准已公开。

Comments Benchmark link: https://github.com/apple/ml-mmtoolsandbox

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10198 2026-07-14 cs.CL 新提交 57%

Equal Accuracy, Unequal Evidence: Search APIs as Decision Surfaces for Tool-Using Agents

同等准确性,不同证据:作为工具使用代理决策表面的搜索 API

Sriram Selvam, Anneswa Ghosh

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 研究以搜索 API 为决策表面,用冻结的 GPT - 5.4 代理、两个工具及 100 个问题测试不同搜索提供商。发现虽答案准确性相近,但证据经济性不同,还引入新比率,指出提供商选择是检索预算和策略决策,非单纯召回决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00972 2026-07-14 physics.data-an cs.AI cs.CV cs.IR 版本更新 57%

Toward a Scientific Discovery Engine for Weather and Climate Data: A Visual Analytics Workbench for Embedding-Based Exploration

迈向面向天气和气候数据的科学发现引擎:一种用于基于嵌入探索的可视化分析工作台

Nihanth W. Cherukuru, Matt Rehme, Kirsten J. Mayer, David John Gagne, John Schreck, John Clyne, Charlie Becker

机构 * NSF National Center for Atmospheric Research(国家大气研究中心)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 本文提出了一种开源可视化分析工作台,用于探索基于嵌入的天气和气候数据,通过链接嵌入实验与源数据、元数据、空间上下文和模型配置,使潜在空间结果可追溯到物理过程,支持科学发现流程。

Comments 7 pages, 5 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09428 2026-07-13 cs.CV cs.LG 新提交 57%

Multimodal Scenario Similarity Search for Autonomous Driving

用于自动驾驶的多模态场景相似性搜索

Tamás Matuszka, András Tamásy, Balázs Szolár

机构 * aiMotive(爱莫提夫)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 研究自动驾驶场景相似性搜索,提出多模态框架结合视觉与轨迹表示,对比两种基于轨迹的方法与视觉基线,实验表明轨迹表示在运动事件中性能强,视觉嵌入在外观线索丰富时出色,结合二者可提升检索质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09632 2026-07-13 quant-ph cs.AI 新提交 57%

Lean-QIT: Towards a Formal Infrastructure for Quantum Information Theory

Lean-QIT:迈向量子信息理论的形式化基础设施

Chengkai Zhu, Ziao Tang, Guocheng Zhen, Yimeng Cao, Yusheng Zhao, Ranyiliu Chen, Xuanqiang Zhao, Lei Zhang, Xin Wang

机构 * QudeLeap Research(QudeLeap研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) The University of Hong Kong(香港大学)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 研究旨在为量子信息理论构建形式化基础设施,通过Lean 4库LeanQIT提供相关接口,将多个重要定理形式化,分离操作定义与解析表征,为形式化QIT及相关推理提供基础和知识底物。

Comments 24+5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08274 2026-07-10 cs.HC cs.SE 新提交 57%

How Analysts Use AI in High-Stakes Crime Linkage: An Industrial Study

分析师如何在高风险犯罪关联中使用人工智能:一项行业研究

Jessica Woodhams, Amy Burrell, Wanyin Li, Fahim Ahmed, Matthew Tonkin, Jan Lemeire, Arkady Konovalov, Steven Frisson, Mark Webb, Sarah Galambos, Vesna Nowack, Dalal Alrajeh

专题命中 工具调用 :workflow(abstract);分类 cs.SE

AI总结 研究探讨分析师在高风险犯罪关联中如何用AI,通过与英国执法机构合作开发工具并进行混合方法可用性研究,发现分析师有选择地用AI预测且常验证,还关注模型特征,强调AI决策支持工具要整合解释与传统方法及现场评估的重要性。

Comments 12 pages, 6 figures, FSE Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21414 2026-07-10 cs.CV cs.LG 版本更新 57%

A Tool Bottleneck Framework for Clinically-Informed and Interpretable Medical Image Understanding

用于临床信息丰富且可解释的医学图像理解的工具瓶颈框架

Christina Liu, Alan Q. Wang, Joy Hsu, Jiajun Wu, Ehsan Adeli

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.LG

AI总结 针对医学图像理解中工具组合难的问题,提出工具瓶颈框架(TBF),利用工具瓶颈模型(TBM)组合VLM选择的工具,通过神经网络计算融合工具输出,在组织病理学和皮肤病学任务中表现出色,提升医学图像理解且使预测更具可解释性。

Journal ref Proceedings of the 9th International Conference on Medical Imaging with Deep Learning, Proceedings of Machine Learning Research 315 (2026) 2958-2986

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07461 2026-07-09 cs.CR cs.SE 新提交 57%

Mitigating Taint-Style Vulnerabilities in MCP Servers via Security-Aware Tool Descriptions

通过安全感知工具描述减轻MCP服务器中的污点式漏洞

Yang Shi, Jiaheng Fu, Yihe Huang, Ruixiang Wu, Chengyao Sun, Kaifeng Huang

专题命中 工具调用 :autonomous agent(abstract);分类 cs.SE

AI总结 研究MCP服务器污点式漏洞,提出SPELLSMITH,通过分析服务器高风险能力,结合工具描述等识别潜在风险,利用协议属性和大语言模型自我反思能力迭代优化输出,有效减轻污点式漏洞利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00086 2026-07-09 cs.CL 版本更新 57%

RIMRULE: Improving Tool-Using Language Agents via MDL-Guided Rule Learning

RIMRULE:通过MDL引导的规则学习改进使用工具的语言智能体

Xiang Gao, Yuguang Yao, Qi Zhang, Kaiwen Dong, Avinash Baidya, Ruocheng Guo, Hilaf Hasson, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 工具调用 :tool-use(abstract);分类 cs.CL

AI总结 研究针对大型语言模型在特定领域使用工具的难题,提出RIMRULE神经符号方法,通过从失败轨迹提炼规则并用MDL目标巩固,以动态注入规则提升性能,实验证明该方法能提高工具使用准确性,且规则具有跨架构可移植性。

Comments Published as a long paper in the main conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06066 2026-07-08 cs.AI 新提交 57%

Reward-Density Heuristic for Dynamic Multi-Vehicle Routing: Performance and Computational Efficiency

动态多车辆路径规划的奖励密度启发式算法:性能与计算效率

Manish Kolachalam, Rani Malhotra

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 研究动态多车辆路径规划问题,提出奖励密度启发式算法(效率启发式算法),在自主无人机任务分配和城市出租车调度等领域评估,该算法与多种经典和元启发式算法比较,在奖励与计算前沿占优,解质量相当但规划时间少,为实时分配调度系统提供实用原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05970 2026-07-08 cs.IR cs.AI 新提交 57%

Faithful or Findable? Evaluating LLM-Generated Metadata for RDF Dataset Search

忠实还是可查找?评估用于RDF数据集搜索的大语言模型生成的元数据

Riccardo Terrenzi, Serkan Ayvaz

机构 * University of Southern Denmark(南部丹麦大学)

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 研究RDF数据集六种元数据生成设置,评估其检索有效性与忠实性。发现无约束重写检索增益强但忠实性低,更有根据的设置提高了忠实性,基于配置文件的重写权衡最佳,将合成元数据定位为需综合评估多方面的系统级信息检索问题。

Comments 5 pages, 1 figure, accepted at SynthIR @ SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05708 2026-07-08 cs.AI 新提交 57%

Akashic: A Low-Overhead LLM Inference Service with MemAttention

Akashic:一种基于内存注意力机制的低开销大语言模型推理服务

Yang Liu, Zhaokai Luo, Huayi Jin, Ruozhou He, Chenchen Hong, Zhiyong Wang, Yifei Liu, Yunfei Gu, Chentao Wu, Junhao Hu

机构 * Xiaohongshu Inc.(小红书公司) ShangHai JiaoTong University(上海交通大学) Peking University(北京大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对大语言模型推理中重放完整历史记录不切实际的问题,提出基于内存注意力机制的低开销内存系统Akashic,通过组织上下文成有界块、建模块间语义关系及应用软硬件协同设计内存放置,提升了任务准确率、吞吐量和可持续请求率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04024 2026-07-08 cs.CV cs.AI 版本更新 57%

Volumetric Directional Diffusion: Anchoring Uncertainty Quantification in Anatomical Consensus for Ambiguous Medical Image Segmentation

体积方向扩散:在模糊医学图像分割的解剖学共识中锚定不确定性量化

Chao Wu, Mahesh Bhosale, Kangxian Xie, Pouya Karimian, David Doermann, Mingchen Gao

机构 * Department of Computer Science and Engineering University at Buffalo, SUNY Buffalo, NY, USA(计算机科学与工程系,布法罗大学,纽约州,布法罗,美国)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 针对模糊医学图像分割中不同专家边界描绘有差异的问题,提出体积方向扩散(VDD)框架,以粗略共识预测为锚点,学习方向扩散过程生成边界变化,实验表明该方法能在保持精度和结构一致性时改善不确定性分布对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04439 2026-07-07 cs.AI 新提交 57%

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

研究工作室-创意:基于机器学习会议成果的有证据支持的研究创意技能套件

Qihao Zhao, Yangyu Huang, Yalun Dai, Lingao Xiao, Jianjun Gao, Xin Zhang, Wenshan Wu, Scarlett Li, Yang He, Yan Lu, Yap Kim Hui

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) CFAR, A*STAR(计算机辅助放射治疗中心,新加坡科技研究局)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 研究问题是提升研究创意,核心方法是构建包含多种技能的套件,主要贡献是揭示31个反复出现的创意子模式并整合为15个可复用模式,能将其转化为可追溯研究提案,经评估效果优于基线。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02959 2026-07-07 cs.CV cs.LG 新提交 57%

Incentivizing Vision Language Models to Search for Long Video Question Answering

激励视觉语言模型进行长视频问答搜索

Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 工具调用 :agentic(abstract);分类 cs.LG

AI总结 研究将长视频问答从被动单流程感知任务转变为多轮检索过程,核心方法是自然语言驱动搜索及强化学习后训练,贡献是提升长视频理解基准测试分数。

Comments To appear at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02577 2026-07-07 cs.SE 新提交 57%

Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation

对基准进行基准测试:工具调用评估的有效性审计

Vishvesh Bhat, Jay Vaghasiya, Muhammad Ahmed Mohsin, Asad Aali

专题命中 工具调用 :agent(abstract);分类 cs.SE

AI总结 对四个主要工具调用基准家族进行系统有效性和可重复性审计,发现诸多评估者与人类意见分歧,指出当前分数可能反映评估者问题而非智能体能力,还介绍相关分类、审计工件等及新基准和系统。

详情

展开后加载摘要…

URL PDF HTML 收藏