arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Snowflake

共收录 49
2608.06714 2026-08-10 cs.AI 新提交

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

优化器即智能体:跨提示、程序与机器学习工作流的推理驱动搜索

Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Snowflake(思诺飞克公司)

AI总结 该研究提出ReASearch统一框架,让智能体自主优化提示、程序与ML工作流,在14项任务中优于专用系统,部分发现超人类最佳结果的方案。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13346 2026-07-16 cs.CR cs.AI cs.CL 新提交

The Refusal Residue: When Probes Catch Alignment Faking and When They Don't

拒绝残差:探测何时能捕捉到对齐造假以及何时不能

Aman Mehta

机构 * Snowflake AI Research(Snowflake AI 研究所)

AI总结 研究对齐造假中隐藏状态能否揭示输出隐藏内容,对13个模型扫描,发现Qwen3 - 32B和Llama - 3.1 - 8B存在自然造假及不对称拒绝残差,样本检测有模型条件性,还发布五控制测量框架用于对齐造假检测。

Comments Accepted to the Mechanistic Interpretability Workshop at ICML 2026. 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06229 2026-07-08 cs.CL cs.AI cs.DB 新提交

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

Spider 2.0-AIFunc:将现实世界的文本到SQL扩展到人工智能原生SQL工作流程

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

机构 * UC San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究院) University of Hong Kong(香港大学)

AI总结 研究针对现有文本到SQL基准无法评估模型生成人工智能原生SQL能力的问题,构建Spider 2.0-AIFunc基准,经特定管道和多轮验证,评估十个先进语言模型,发现准确率差距及传统代理框架转移无效等情况。

Comments 24 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00660 2026-07-07 cs.DB cs.AI 版本更新

Streaming Model Cascades for Semantic SQL

流式模型级联用于语义SQL

Paweł Liskowski, Kyle Schmaus

机构 * Snowflake Inc.(雪花公司)

AI总结 本文提出两种流式模型级联算法,用于在分布式系统中高效处理语义SQL查询,通过迭代阈值优化和联合精度召回保证提升效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26180 2026-07-03 cs.DB cs.AI cs.CL 版本更新

Evergreen: Efficient Claim Verification for Semantic Aggregates

Evergreen:用于语义聚合的高效声明验证

Alexander W. Lee, Benjamin Han, Shayak Sen, Sam Yeom, Ugur Cetintemel, Anupam Datta

机构 * Brown University(布朗大学) Snowflake Inc.(Snowflake公司)

AI总结 Evergreen将声明验证转化为语义查询处理任务,通过定制优化和溯源捕获,减少LLM调用成本和延迟,提升验证质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31154 2026-07-01 cs.LG cs.AI 新提交

PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

PPT-Eval: 面向PowerPoint任务的计算机使用智能体基准

Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) UMass Amherst(马萨诸塞大学阿默斯特分校) Google(谷歌) Snowflake

AI总结 提出PPT-Eval基准,包含120个PowerPoint任务,并设计基于评分标准的评估框架,通过部分评分和自然语言反馈衡量智能体表现,发现现有最强模型仅达45%成功率。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25519 2026-07-01 cs.AI cs.LG 新提交

Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models

量化膨胀推理:低比特推理模型的隐藏成本——令牌膨胀

Xinyu Lian, Walid Krichene, Beichen Huang, Masahiro Tanaka, Olatunji Ruwase, Li Zhang, Minjia Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) Anyscale Snowflake

AI总结 研究发现低比特后训练量化虽保持推理准确性,但会显著增加推理令牌使用量,导致端到端服务性能下降,并提出了CoT令牌膨胀比来量化该效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27369 2026-06-26 cs.LG 新提交

Reinforcement Learning without Ground-Truth Solutions can Improve LLMs

无需真实解即可改进大语言模型的强化学习

Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang, Xunpeng Huang, Kun Zhou, Tongtong Liang, Zhewei Yao, Yi-An Ma, Yuxiong He

机构 * University of California, San Diego(加州大学圣地亚哥分校) Snowflake AI Research

AI总结 提出RiVER框架,通过校准的连续奖励信号,在无真实解的任务上训练LLM,在AtCoder和精确解基准上均取得提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22953 2026-06-23 cs.AI cs.CL 新提交

Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents

计划不会持久:为什么上下文管理对LLM代理至关重要

Aman Mehta, Anupam Datta

机构 * Snowflake AI Research(Snowflake AI研究)

AI总结 本文通过重放配对诊断和压缩压力测试,证明标准LLM代理不将计划作为持久状态携带,而是依赖上下文中的计划,并揭示了推理模型的推理痕迹混淆问题。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22936 2026-06-23 cs.AI 新提交

When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents

当智能体过早承诺:诊断LLM智能体中的过早承诺问题

Aman Mehta

机构 * Snowflake AI Research

AI总结 本文提出表征承诺作为跨运行隐藏状态收敛的指标,用于诊断长程LLM智能体过早承诺问题,并在多个模型和数据集上验证其预测轨迹一致性的能力。

Comments 22 pages, 16 figures Primary: cs.AI Secondary: cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25764 2026-06-23 cs.SE cs.AI 版本更新

Confident and Wrong: Silent Semantic Failures in Coding Agents

自信且错误:编码智能体中的无声语义失败

Aman Mehta

机构 * Snowflake AI Research(Snowflake AI研究院)

AI总结 本文揭示编码智能体在任务完成率与可信度之间存在系统性偏差,提出“无声语义失败”这一危险模式,并建议通过多次运行的测试验证正确率来评估智能体。

Comments 8 pages, 8 figures. Request: please change the primary category to cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15345 2026-06-18 cs.CL cs.IR 新提交

Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus

超越单语言深度研究:用跨语言 BrowseComp-Plus 评估智能体和检索器

Yuheng Lu, Qingcheng Zeng, Heli Qi, Puxuan Yu, Fuheng Zhao, Rui Yang, Hitomi Yanaka, Naoto Yokoya, Weihao Xuan

机构 * Waseda University(早稻田大学) Northwestern University(西北大学) RIKEN AIP(理化学研究所革新智能研究中心) Snowflake Inc.(Snowflake公司) University of Utah(犹他大学) Duke-NUS Medical School(杜克-新加坡国立大学医学院) The University of Tokyo(东京大学)

AI总结 提出跨语言基准 XBCP,评估深度研究智能体在证据语言与查询不同时的表现,发现检索和智能体端均存在显著性能下降。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11680 2026-06-11 cs.AI cs.CL cs.LG 新提交

Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents

先组织再检索:面向高效智能体的层次化记忆导航

Hao-Lun Hsu, Nikki Lijing Kuang, Boyi Liu, Zhewei Yao, Yuxiong He

机构 * Duke University(杜克大学) Snowflake AI Research(Snowflake AI研究)

AI总结 提出HORMA框架,通过构建文件系统式的层次化记忆结构并利用强化学习训练的轻量级导航代理,实现高效检索,在长时任务中提升性能并降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10445 2026-06-10 cs.LG cs.CL 新提交

SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference

SpenseGPT: 面向LLM推理的实用一次性剪枝,支持稀疏和稠密GEMM

Jaeseong Lee, Seung-won Hwang, Samyam Rajbhandari

机构 * Snowflake AI Research(Snowflake AI研究) Seoul National University(首尔大学)

AI总结 提出Spense混合稀疏-稠密格式,将权重矩阵分为2:4稀疏和稠密区域,结合一次性剪枝方法SpenseGPT,在B200 GPU上实现高达1.2倍端到端解码加速,同时保持模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07923 2026-06-09 cs.DB cs.AI cs.LG 新提交

Larch: Learned Query Optimization for Semantic Predicates

Larch: 面向语义谓词的学习型查询优化

Fuheng Zhao, Pawel Liskowski, Zihan Li, Benjamin Han, Puxuan Yu, Varich Boonsanong, Dimitris Tsirogiannis, Anupam Datta

机构 * Snowflake Inc.(Snowflake公司)

AI总结 提出Larch框架,利用嵌入增强的图神经网络和强化学习或监督学习优化AI SQL查询中语义过滤器的执行顺序,显著降低令牌开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22327 2026-06-08 cs.IR cs.AI cs.DL 版本更新

Evaluating AI-based Scientific Knowledge Synthesis with Epidemiological Systematic Reviews

基于流行病学系统评价评估AI科学知识综合

Shreyansh Padarha, Ryan Othniel Kearns, Tristan Naidoo, Lingyi Yang, Łukasz Borchmann, Piotr BŁaszczyk, Christian Morgenstern, Ruth McCabe, Sangeeta Bhatia, Philip H. Torr, Jakob Foerster, Scott A. Hale, Thomas Rawson, Anne Cori, Elizaveta Semenova, Adam Mahdi

机构 * University of Oxford(牛津大学) Imperial College London(伦敦帝国理工学院) University of Nottingham(诺丁汉大学) Snowflake AI Research(Snowflake人工智能研究) Independent(独立)

AI总结 提出AgentSLR评估框架,包含自动化工作流和专家标注数据集,测试LLM在流行病学系统评价各阶段能力,发现无模型全面领先,结构化提取是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00547 2026-06-02 cs.CL

Learning to Retrieve: Dual-Level Long-Term Memory for Text-to-SQL Agents

学习检索:面向文本到SQL代理的双层长期记忆

Yibo Wang, Nikki Lijing Kuang, Philip S. Yu, Zhewei Yao, Yuxiong He

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Snowflake AI Research(Snowflake AI研究院)

AI总结 提出MERIT框架,通过强化学习优化双层记忆检索(全局策略与局部决策),提升交互式文本到SQL代理的成功率并减少交互轮次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24183 2026-05-26 cs.DB cs.AI cs.LG

AvalancheBench: Evaluating Enterprise Data Agents Through Latent World Recovery

AvalancheBench: 通过潜在世界恢复评估企业数据智能体

Darek Kleczek, Fuheng Zhao, Alexander W. Lee, Julien Tissier, Pawel Liskowski, Ugur Cetintemel, Anupam Datta

机构 * Brown University and Snowflake(布朗大学和Snowflake)

AI总结 提出AvalancheBench基准,通过潜在世界恢复评估企业数据智能体的分析理解能力,揭示早期错误如何传播并导致系统性错误推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23215 2026-05-25 cs.LG cs.AI cs.CL

FastKernels: Benchmarking GPU Kernel Generation in Production

FastKernels:生产中GPU内核生成的基准测试

Gabriele Oliaro, Yichao Fu, May Jiang, Owen Lu, Junli Wang, Zhihao Jia, Hao Zhang, Samyam Rajbhandari

机构 * Snowflake AI Research(Snowflake AI研究院) CMU(卡内基梅隆大学) UCSD(加州大学圣地亚哥分校) Independent Researcher(独立研究者)

AI总结 针对现有基准与生产推理框架脱节的问题,提出FastKernels基准,包含46个代表性架构,覆盖96.2%的HuggingFace Transformers架构,并作为生产级推理框架,评估显示最强代理仅实现0.94倍加速,揭示基准-生产错位是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21792 2026-05-22 cs.CL cs.AI cs.DB cs.LG

Residual Skill Optimization for Text-to-SQL Ensembles

残差技能优化用于文本到SQL集成

Jiongli Zhu, Haoquan Guan, Parjanya Prajakta Prashant, Nikki Lijing Kuang, Seyedeh Baharan Khatami, Canwen Xu, Xiaodong Yu, Yingyu Lin, Zhewei Yao, Yuxiong He, Babak Salimi

机构 * University of California, San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究)

AI总结 本文提出DivSkill-SQL,一种残差技能优化框架,通过在当前技能集成失败的示例上优化新技能,从而构建互补的文本到SQL集成,提升Pass@K性能,在Spider2-Lite上实现了显著的准确性提升,同时在不同方言和任务上表现出一致的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00303 2026-05-21 cs.DB cs.AI cs.IR

Access Paths for Efficient Ordering with Large Language Models

利用大型语言模型实现高效的排序访问路径

Fuheng Zhao, Jiayue Chen, Yiming Pan, Tahseen Rabbani, Sohaib, Divyakant Agrawal, Amr El Abbadi, Paritosh Aggarwal, Anupam Datta, Dimitris Tsirogiannis

机构 * Snowflake Inc.(Snowflake公司) University of Chicago(芝加哥大学) UC Los Angeles(洛杉矶大学) UC Santa Barbara(圣巴巴拉大学)

AI总结 本文提出了一种基于大型语言模型的排序语义运算符,并系统研究了其物理实现。通过改进现有语义排序算法并引入语义感知的外部归并排序算法,研究发现没有单一实现能在所有数据集上达到最优。基于此,设计了一个预算感知的优化器,利用启发式规则、LLM作为判断者评估和共识聚合动态选择最优的访问路径。实验结果表明,该优化器在所有基准测试中均能实现与最佳静态方法相当或更优的排名准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02960 2026-05-18 cs.LG

MoE-Prefill: Zero Redundancy Overheads in MoE Prefill Serving

MoE-Prefill: 在MoE预填服务中实现零冗余开销

Zhaoyuan Su, Olatunji Ruwase, Karthik Ganesan, Aurick Qiao, Samyam Rajbhandari, Juncheng Yang, Yue Cheng, Yuxiong He

机构 * University of Virginia(弗吉尼亚大学) Snowflake AI Research(Snowflake AI研究院) Harvard University(哈佛大学)

AI总结 本文提出MoE-Prefill系统,通过异步专家并行策略优化MoE预填服务,提升吞吐量和GPU利用率,实现在实际和长上下文合成工作负载中的性能提升。

Comments 19 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27089 2026-05-01 cs.LG cs.DC cs.PF

AutoSP: Unlocking Long-Context LLM Training Via Compiler-Based Sequence Parallelism

AutoSP:通过编译器基于的序列并行性解锁长上下文LLM训练

Ahan Gupta, Zhihao Wang, Neel Dani, Masahiro Tanaka, Olatunji Ruwase, Minjia Zhang

机构 * SSAIL Lab, University of Illinois Urbana-Champaign(SSAIL实验室,伊利诺伊大学厄巴纳-香槟分校) Anyscale Snowflake

AI总结 本文提出AutoSP,一种自动优化长上下文LLM训练的解决方案,通过编译器实现序列并行性和激活检查点优化,提升训练效率。

Comments 13 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25325 2026-04-29 cs.SE cs.AI cs.CL

R$^3$-SQL: Ranking Reward and Resampling for Text-to-SQL

R³-SQL:基于排名奖励和重采样的文本到SQL

Hojae Han, Yeonseok Jeong, Seung-won Hwang, Zhewei Yao, Yuxiong He

机构 * ETRI(电子科技大学) Seoul National University(首尔国立大学) Snowflake AI Research(Snowflake人工智能研究)

AI总结 R³-SQL通过统一奖励和重采样解决文本到SQL中排名不一致和正确SQL缺失的问题,提升了执行准确率。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07663 2026-04-08 cs.DB cs.AI cs.LG

Cortex AISQL: A Production SQL Engine for Unstructured Data

Cortex AISQL:面向非结构化数据的生产级SQL引擎

Paweł Liskowski, Benjamin Han, Paritosh Aggarwal, Bowei Chen, Boxin Jiang, Nitish Jindal, Zihan Li, Aaron Lin, Kyle Schmaus, Jay Tayade, Weicheng Zhao, Anupam Datta, Nathan Wiegand, Dimitris Tsirogiannis

机构 * Snowflake Inc.(雪花公司)

AI总结 Cortex AISQL通过AI-aware优化、自适应模型级联和语义连接重写技术,解决大规模语义操作效率问题,提升非结构化数据查询性能。

Comments Published in SIGMOD Companion '26 (Industry Track), Bengaluru, India, May 31-June 5, 2026. ACM DOI: 10.1145/3788853.3803093. This version is the published ACM Version of Record under the Creative Commons Attribution 4.0 International (CC BY 4.0) license

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00698 2026-04-02 cs.LG cs.AI cs.CL

Learning to Hint for Reinforcement Learning

为强化学习学习提示

Yu Xia, Canwen Xu, Zhewei Yao, Julian McAuley, Yuxiong He

机构 * University of California, San Diego(加州大学圣迭戈分校) Snowflake AI Research

AI总结 本文提出HiLL框架,通过联合训练提示策略和推理策略,解决强化学习中因提示不足导致的优势崩溃问题,通过提示依赖性理论提升提示的迁移效果,实验显示HiLL在多个基准上优于GRPO和传统提示方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23515 2026-03-26 cs.CL cs.AI

Training a Large Language Model for Medical Coding Using Privacy-Preserving Synthetic Clinical Data

利用隐私保护的合成临床数据训练大型语言模型进行医学编码

John Cook, Michael Wyatt, Peng Wei, Iris Chin, Santosh Gupta, Van Zyl Van Vuuren, Richie Siburian, Amanda Spicer, Kristen Viviano, Alda Cami, Raunaq Malhotra, Zhewei Yao, Jeff Rasley, Gaurav Kaushik

机构 * Veradigm Snowflake

AI总结 本文研究了利用隐私保护的合成临床数据训练大型语言模型进行医学编码的可行性,通过微调Llama 3-70B模型,实现了ICD-10-CM和CPT代码的高精度预测,显著提升了编码准确性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12180 2026-03-23 cs.CL cs.AI

Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections

策略导航还是随机搜索?智能体和人类如何在文档集合上进行推理

Łukasz Borchmann, Jordy Van Landeghem, Michał Turski, Shreyansh Padarha, Ryan Othniel Kearns, Adam Mahdi, Niels Rogge, Clémentine Fourrier, Siwei Han, Huaxiu Yao, Artemis Llabrés, Yiming Xu, Dimosthenis Karatzas, Hao Zhang, Anupam Datta

机构 * Snowflake\,AI\,Research University\,of\,Oxford Computer\,Vision\,Center

AI总结 本文通过MADQA基准测试,探讨智能体与人类在文档检索中的策略性推理与随机搜索差异,揭示最佳智能体在准确性上接近人类,但依赖暴力搜索而非有效策略规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18620 2026-03-20 cs.CL cs.AI

Learning to Self-Evolve

学习自我进化

Xiaoyin Chen, Canwen Xu, Yite Wang, Boyi Liu, Zhewei Yao, Yuxiong He

机构 * Mila – Quebec AI Institute(魁北克AI研究院) University of Montreal(蒙特利尔大学) Snowflake(Snowflake公司)

AI总结 本文提出LSE框架,通过强化学习训练大语言模型在测试时自我改进上下文,实验显示其在文本到SQL生成和通用问答任务中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24288 2026-03-02 cs.AI cs.CL

DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science

DARE-bench: 评估LLMs在数据科学中的建模和指令忠实度

Fan Shu, Yite Wang, Ruofan Wu, Boyi Liu, Zhewei Yao, Yuxiong He, Feng Yan

机构 * University of Houston(德克萨斯大学休斯顿分校) Snowflake AI Research(Snowflake人工智能研究院)

AI总结 DARE-bench通过提供可验证的真实值任务和大规模训练数据,有效评估和提升LLMs在数据科学中的建模和指令忠实度。

Comments Published as a conference paper at ICLR 2026. 10 pages plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏