arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Snowflake

共收录 12
2608.06714 2026-08-10 cs.AI 新提交

The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows

优化器即智能体:跨提示、程序与机器学习工作流的推理驱动搜索

Junbo Li, Boyi Liu, Canwen Xu, Yite Wang, Yuxiong He, Zhangyang Wang, Qiang Liu, Zhewei Yao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Snowflake(思诺飞克公司)

AI总结 该研究提出ReASearch统一框架,让智能体自主优化提示、程序与ML工作流,在14项任务中优于专用系统,部分发现超人类最佳结果的方案。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13346 2026-07-16 cs.CR cs.AI cs.CL 新提交

The Refusal Residue: When Probes Catch Alignment Faking and When They Don't

拒绝残差:探测何时能捕捉到对齐造假以及何时不能

Aman Mehta

机构 * Snowflake AI Research(Snowflake AI 研究所)

AI总结 研究对齐造假中隐藏状态能否揭示输出隐藏内容,对13个模型扫描,发现Qwen3 - 32B和Llama - 3.1 - 8B存在自然造假及不对称拒绝残差,样本检测有模型条件性,还发布五控制测量框架用于对齐造假检测。

Comments Accepted to the Mechanistic Interpretability Workshop at ICML 2026. 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06229 2026-07-08 cs.CL cs.AI cs.DB 新提交

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

Spider 2.0-AIFunc:将现实世界的文本到SQL扩展到人工智能原生SQL工作流程

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

机构 * UC San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究院) University of Hong Kong(香港大学)

AI总结 研究针对现有文本到SQL基准无法评估模型生成人工智能原生SQL能力的问题,构建Spider 2.0-AIFunc基准,经特定管道和多轮验证,评估十个先进语言模型,发现准确率差距及传统代理框架转移无效等情况。

Comments 24 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31154 2026-07-01 cs.LG cs.AI 新提交

PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

PPT-Eval: 面向PowerPoint任务的计算机使用智能体基准

Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) UMass Amherst(马萨诸塞大学阿默斯特分校) Google(谷歌) Snowflake

AI总结 提出PPT-Eval基准,包含120个PowerPoint任务,并设计基于评分标准的评估框架,通过部分评分和自然语言反馈衡量智能体表现,发现现有最强模型仅达45%成功率。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25519 2026-07-01 cs.AI cs.LG 新提交

Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models

量化膨胀推理:低比特推理模型的隐藏成本——令牌膨胀

Xinyu Lian, Walid Krichene, Beichen Huang, Masahiro Tanaka, Olatunji Ruwase, Li Zhang, Minjia Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) Anyscale Snowflake

AI总结 研究发现低比特后训练量化虽保持推理准确性,但会显著增加推理令牌使用量,导致端到端服务性能下降,并提出了CoT令牌膨胀比来量化该效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27369 2026-06-26 cs.LG 新提交

Reinforcement Learning without Ground-Truth Solutions can Improve LLMs

无需真实解即可改进大语言模型的强化学习

Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang, Xunpeng Huang, Kun Zhou, Tongtong Liang, Zhewei Yao, Yi-An Ma, Yuxiong He

机构 * University of California, San Diego(加州大学圣地亚哥分校) Snowflake AI Research

AI总结 提出RiVER框架,通过校准的连续奖励信号,在无真实解的任务上训练LLM,在AtCoder和精确解基准上均取得提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22953 2026-06-23 cs.AI cs.CL 新提交

Plans Don't Persist: Why Context Management Is Load Bearing for LLM Agents

计划不会持久:为什么上下文管理对LLM代理至关重要

Aman Mehta, Anupam Datta

机构 * Snowflake AI Research(Snowflake AI研究)

AI总结 本文通过重放配对诊断和压缩压力测试,证明标准LLM代理不将计划作为持久状态携带,而是依赖上下文中的计划,并揭示了推理模型的推理痕迹混淆问题。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22936 2026-06-23 cs.AI 新提交

When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents

当智能体过早承诺:诊断LLM智能体中的过早承诺问题

Aman Mehta

机构 * Snowflake AI Research

AI总结 本文提出表征承诺作为跨运行隐藏状态收敛的指标,用于诊断长程LLM智能体过早承诺问题,并在多个模型和数据集上验证其预测轨迹一致性的能力。

Comments 22 pages, 16 figures Primary: cs.AI Secondary: cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15345 2026-06-18 cs.CL cs.IR 新提交

Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus

超越单语言深度研究:用跨语言 BrowseComp-Plus 评估智能体和检索器

Yuheng Lu, Qingcheng Zeng, Heli Qi, Puxuan Yu, Fuheng Zhao, Rui Yang, Hitomi Yanaka, Naoto Yokoya, Weihao Xuan

机构 * Waseda University(早稻田大学) Northwestern University(西北大学) RIKEN AIP(理化学研究所革新智能研究中心) Snowflake Inc.(Snowflake公司) University of Utah(犹他大学) Duke-NUS Medical School(杜克-新加坡国立大学医学院) The University of Tokyo(东京大学)

AI总结 提出跨语言基准 XBCP,评估深度研究智能体在证据语言与查询不同时的表现,发现检索和智能体端均存在显著性能下降。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11680 2026-06-11 cs.AI cs.CL cs.LG 新提交

Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents

先组织再检索:面向高效智能体的层次化记忆导航

Hao-Lun Hsu, Nikki Lijing Kuang, Boyi Liu, Zhewei Yao, Yuxiong He

机构 * Duke University(杜克大学) Snowflake AI Research(Snowflake AI研究)

AI总结 提出HORMA框架,通过构建文件系统式的层次化记忆结构并利用强化学习训练的轻量级导航代理,实现高效检索,在长时任务中提升性能并降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10445 2026-06-10 cs.LG cs.CL 新提交

SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference

SpenseGPT: 面向LLM推理的实用一次性剪枝,支持稀疏和稠密GEMM

Jaeseong Lee, Seung-won Hwang, Samyam Rajbhandari

机构 * Snowflake AI Research(Snowflake AI研究) Seoul National University(首尔大学)

AI总结 提出Spense混合稀疏-稠密格式,将权重矩阵分为2:4稀疏和稠密区域,结合一次性剪枝方法SpenseGPT,在B200 GPU上实现高达1.2倍端到端解码加速,同时保持模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07923 2026-06-09 cs.DB cs.AI cs.LG 新提交

Larch: Learned Query Optimization for Semantic Predicates

Larch: 面向语义谓词的学习型查询优化

Fuheng Zhao, Pawel Liskowski, Zihan Li, Benjamin Han, Puxuan Yu, Varich Boonsanong, Dimitris Tsirogiannis, Anupam Datta

机构 * Snowflake Inc.(Snowflake公司)

AI总结 提出Larch框架,利用嵌入增强的图神经网络和强化学习或监督学习优化AI SQL查询中语义过滤器的执行顺序,显著降低令牌开销。

详情

展开后加载摘要…

URL PDF HTML 收藏