Intelligence per Watt: Measuring Intelligence Efficiency of Local AI
每瓦智能:衡量本地AI的智能效率
机构 * Stanford University(斯坦福大学) ; Together AI
AI总结 本文研究了本地AI在能源效率和性能上的表现,提出了一种统一的衡量指标IPW,展示了本地推理在重新分配需求方面的能力,并揭示了本地加速器的优化潜力。
大厂专区
每瓦智能:衡量本地AI的智能效率
机构 * Stanford University(斯坦福大学) ; Together AI
AI总结 本文研究了本地AI在能源效率和性能上的表现,提出了一种统一的衡量指标IPW,展示了本地推理在重新分配需求方面的能力,并揭示了本地加速器的优化潜力。
缩小生成-验证差距的弱验证器
机构 * Stanford University(斯坦福大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Together AI
AI总结 Weaver通过结合多个弱验证器,有效缩小生成-验证差距,提升验证性能至接近理想验证器水平。
Comments Annual Conference on Neural Information Processing Systems (NeurIPS) 2025
重新思考推理时缩放:效率极限与语言信号
机构 * Duke University(杜克大学) ; Together AI ; University of Chicago(芝加哥大学) ; Stanford University(斯坦福大学)
AI总结 本研究分析推理时缩放的效率极限,发现非推理模型存在无法突破的推理底线,多数投票优于复杂框架,还识别出正确性的语言信号,为高效推理智能体提供了新路径。
Comments update figures, writings
通过物理智能解决通用机器人中的编排差距
机构 * Princeton University(普林斯顿大学) ; Together AI(联合人工智能)
AI总结 研究通用机器人行动推理问题,提出将相关能力分解为语言条件策略/控制智能体与高级智能体管理器/编排器,构建物理智能体编排器Pigey,经评估其在模拟和实际任务中性能显著提升,缩小了编排差距。
SonicSampler:用于语言模型采样和推测性验证的统一瓦片感知内核
机构 * Together AI
AI总结 研究针对语言模型推理采样中现有实现的局限,提出SonicSampler,它是统一的瓦片感知Triton内核套件,垂直融合采样流水线。核心方法是分层两阶段top-k算法,在异构推测性解码工作负载中比基线快达16倍,保持灵活批处理执行。
Comments 26 pages, 12 figures
ISO:一种原生 RLVR 的优化栈
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; UIUC(伊利诺伊大学香槟分校) ; Emory University(埃默里大学) ; Together AI(联合人工智能公司) ; Recursive Superintelligence Inc(递归超级智能公司) ; ELLIS Institute Tübingen(图宾根埃利斯研究所)
AI总结 研究 RLVR 中缺失的优化层,提出等谱优化(ISO)框架,包括离线的 ISO-Merger 和在线的 ISO-Optimizer。通过光谱继承,在推理和编码任务中,用更少训练步骤提高准确率,为 RLVR 优化层问题提供了具体解决方案。
Comments Preprint
分数集之前的核心集:用于大语言模型基准测试的评估无监督提示子集选择
机构 * University of Washington(华盛顿大学) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; Oracle(甲骨文公司) ; Together AI(Together AI公司) ; LMSYS ; NVIDIA(英伟达公司)
AI总结 研究大语言模型基准测试的核心集选择,采用评估无监督方法,利用次模子集选择,开发多种次模函数。在新大规模套件上实验发现设施选址函数效果好,该目标不限于特定模式,在相关排行榜上表现优且计算成本低,证明次模性对基准压缩有用。
解耦乌lysses:通过头级分块实现内存高效的上下文并行
机构 * Together AI
AI总结 UPipe通过头级分块实现内存高效的上下文并行,显著减少激活内存使用,支持更长的上下文长度。
Comments 14 pages, 6 figures
通过工作流归纳实现多轮智能科学文献搜索
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Together AI ; University of Pennsylvania(宾夕法尼亚大学) ; Stanford University(斯坦福大学)
AI总结 提出PaperPilot,通过构建可执行DAG工作流进行多轮文献搜索,利用用户反馈优化查询和工作流,显著提升搜索性能并消除执行错误。
Comments 17 pages, 12 figures
实时语音AI能听到但不倾听
机构 * Together AI ; Stanford University(斯坦福大学)
AI总结 评估四个领先实时语音系统,发现它们依赖文字而非声学线索,在情感理解上存在感知与行动脱节,提示需谨慎用于依赖语调的场景。
Taylor-Calibrate:混合线性注意力蒸馏的原则性初始化
机构 * The University of Sydney(悉尼大学) ; Together AI ; University of California, Berkeley(加州大学伯克利分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Microsoft(微软)
AI总结 提出Taylor-Calibrate方法,利用泰勒引导的教师注意力统计初始化混合线性注意力学生模型,显著减少蒸馏所需训练令牌数。
Comments 24 pages, 9 figures
利用野外AI代理的集体智慧实现新发现
机构 * Together AI ; Stanford University(斯坦福大学)
AI总结 提出EinsteinArena平台,通过开放分布式环境中的自主代理交互,在数学问题中实现12项新最优结果,展示了集体AI驱动研究的范式。
AI智能体与大语言模型的自动化基准审计
机构 * Duke University(杜克大学) ; Together AI ; Stanford University(斯坦福大学)
AI总结 提出自动化基准审计框架ABA,系统审计基准任务中的隐藏环境依赖、规范缺失和评分逻辑问题,在168个基准中发现25.7%的任务存在关键问题,过滤后模型排名变化且性能提升约10%。
评估商业AI聊天机器人作为新闻中介
机构 * Stanford University(斯坦福大学) ; Independent Researcher(独立研究者) ; Together AI
AI总结 本研究评估了AI聊天机器人在跨语言和区域处理新兴事实的准确性,发现其在多选题中表现良好,但在自由回答和复杂问题上存在显著误差,揭示了区域不平等和依赖检索基础设施的问题。
IdleSpec: 通过投机规划利用空闲时间用于LLM代理
机构 * KAIST(韩国科学技术院) ; Amazon AGI(亚马逊人工智慧实验室) ; Together AI
AI总结 本文提出IdleSpec,一种利用空闲时间提升LLM代理性能的方法,通过在空闲期间生成计划候选并减少延迟开销,从而在多种代理场景中显著提高性能。
ExComm:探索阶段通信用于容错的代理测试时间扩展
机构 * KAIST(韩国科学技术院) ; Amazon AGI(亚马逊人工智能实验室) ; Together AI
AI总结 本文提出ExComm,一种用于探索阶段的代理测试时间扩展通信协议,通过定期审计代理信念状态以检测跨代理事实冲突,并通过专用工具验证循环解决冲突,从而提升测试时间扩展的容错能力。
CODA:将Transformer块重写为GEMM-epilogue程序
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Princeton University(普林斯顿大学) ; Together AI ; Meta
AI总结 本文提出CODA,一种将Transformer中的非注意力计算重写为GEMM-epilogue程序的GPU内核抽象,以提高训练效率和硬件利用效率。
OSCAR: 2位KV缓存量化中的离线频谱协方差感知旋转
机构 * Together AI ; University of Sydney(悉尼大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出OSCAR方法,通过离线估计注意力感知的协方差结构,实现2位KV缓存量化的高效和准确,同时开发了可部署的系统,提升了LLM服务框架的性能和效率。
Comments 35 pages, 10 figures
M$^2$RNN:基于矩阵值状态的非线性RNN用于可扩展的语言建模
机构 * MIT-IBM Watson Lab(MIT-IBM沃森实验室) ; Princeton University(普林斯顿大学) ; Together AI
AI总结 本文提出M$^2$RNN,通过矩阵值状态和非线性状态转移提升语言建模性能,实验证明其在长序列泛化和大规模语言建模中的优势。
异步推理:无需训练的交互式思考LLM
机构 * Yandex ; HSE University(俄罗斯高等经济大学) ; The University of Tokyo(东京大学) ; MATS ; Together AI
AI总结 本文提出一种无需额外训练的LLM异步推理方法,通过位置嵌入特性实现同时思考、倾听和生成输出,提升数学、常识和安全推理任务的准确性和响应速度。
Comments Preprint, work in progress
SAW-INT4: 为现实世界LLM服务的系统感知4位KV缓存量化
机构 * Together AI
AI总结 本文提出SAW-INT4方法,通过系统感知的4位KV缓存量化,在满足实际服务约束下实现高精度与高效率的平衡,恢复近全部精度损失。
Parcae:稳定循环语言模型的扩展定律
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Together AI
AI总结 本文提出Parcae,一种稳定的循环架构,通过限制注入参数的谱范数来解决现有循环架构的不稳定性问题,实验表明其在验证 perplexity 和测试性能上均优于现有模型。
反思式扩散语言模型
机构 * Together AI ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Princeton University(普林斯顿大学) ; Stanford University(斯坦福大学)
AI总结 本文提出反思式扩散语言模型,通过引入反思性解码算法,在保持并行解码的同时继承自回归训练的反思一致性,实现了与同规模自回归模型相当的质量并优于先前扩散模型。
Squeeze Evolve:无验证者演化的统一多模型协调
机构 * UC Berkeley(加州大学伯克利分校) ; UT Austin(德克萨斯大学奥斯汀分校) ; Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学) ; Together AI
AI总结 本文提出Squeeze Evolve框架,通过动态分配模型能力提升无验证者演化的多样性与效率,实验证明其在多个基准测试中显著降低成本并提升性能。
Comments 40 Pages, Project Page: https://squeeze-evolve.github.io/
更大的可及性可能放大生成AI中的歧视
机构 * Trustworthy AI Lab, University of Hamburg(可信AI实验室,汉堡大学) ; NALA Group, JGU Mainz(NALA集团,吉森大学) ; Cornell University(康奈尔大学) ; Together AI ; Allen Institute for AI(人工智能研究院) ; CU Boulder(博尔德大学)
AI总结 研究发现语音交互虽提升可及性,但会因语音携带身份线索而加剧性别偏见,提出通过音调调节可缓解歧视问题。
Comments Preprint
CARE: 一种考虑协方差和增强秩的分解方法,以实现多头潜在注意力
机构 * University of Sydney(悉尼大学) ; King Abdullah University of Science and Technology(卡布斯大学) ; Together AI ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 CARE通过考虑激活协方差和增强秩,改进了多头潜在注意力的转换,减少了KV缓存成本并提升了表达能力,实验表明其在多个模型上表现更优。
Comments Accepted at ICLR 2026. Conference paper. 10 pages main text; 34 pages total including references and appendix. 11 figures and 20 tables in total
FlashAttention-4:异构硬件扩展下的算法与内核流水线协同设计
机构 * Princeton University(普林斯顿大学) ; Meta ; Colfax Research(Colfax研究公司) ; NVIDIA(NVIDIA公司) ; Georgia Tech(佐治亚理工学院) ; Together AI
AI总结 FlashAttention-4通过异构硬件扩展下的算法与内核流水线协同设计,提升B200 GPU上的注意力计算效率。
当分治策略在长上下文LLM中何时有效?一种噪声分解框架
机构 * University of Chicago(芝加哥大学) ; Together AI ; Duke University(杜克大学) ; Google DeepMind(谷歌DeepMind) ; Stanford University(斯坦福大学)
AI总结 本文提出了一种噪声分解框架,分析了长上下文LLM中分治策略的有效条件,揭示了任务噪声、模型噪声和聚合噪声的区分,并通过实验验证了多代理分块策略在处理长上下文任务中的有效性。
Comments ICLR 2026
在测试时间学习以发现
机构 * Stanford University(斯坦福大学) ; NVIDIA(英伟达) ; Astera Institute(Astera研究院) ; UC San Diego(加州大学圣地亚哥分校) ; Together AI
AI总结 通过在测试时间进行强化学习,TTT-Discover方法在多个科学领域实现了新的前沿状态,利用开放模型和公开代码实现高效解决方案。
Comments Code: https://github.com/test-time-training/discover
当你不告诉LLMs该思考什么时,它们会想什么?
机构 * Together AI ; Stanford University(斯坦福大学)
AI总结 研究揭示了LLMs在无明确主题输入下生成内容的分布特征,发现不同模型家族存在显著的主题偏好和内容深度差异,并公开了相关数据集和代码。
Comments NA