arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Together AI

共收录 50
2602.01007 2026-02-03 cs.CL

Distilling Token-Trained Models into Byte-Level Models

将令牌训练模型蒸馏为字节级模型

Zishuo Bao, Jiaqi Leng, Junxiong Wang, Bowen Peng, Yucheng Lu

机构 * Fuzhou University(福州大学) Fudan University(复旦大学) Together AI Nous Research

AI总结 本文提出了一种将令牌训练模型高效蒸馏为字节级模型的方法,通过两阶段课程实现端到端生成,验证了在有限数据下保持模型性能的可行性。

Comments 17 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16344 2026-01-26 cs.AI

DSGym: A Holistic Framework for Evaluating and Training Data Science Agents

DSGym: 一个全面的框架用于评估和训练数据科学代理

Fan Nie, Junlin Wang, Harper Hua, Federico Bianchi, Yongchan Kwon, Zhenting Qi, Owen Queen, Shang Zhu, James Zou

机构 * Stanford University(斯坦福大学) Together AI Duke University(杜克大学) Harvard University(哈佛大学)

AI总结 DSGym通过标准化框架提升数据科学代理的评估与训练,解决现有基准测试的碎片化和数据不足问题,提供可扩展的任务套件和数据合成管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24574 2026-01-21 cs.CL cs.AI cs.LG

Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time

在测试时理解并引导推理模型的认知行为

Zhenyu Zhang, Xiaoxia Wu, Zhongzhu Zhou, Qingyang Wu, Yineng Zhang, Pragaash Ponnusamy, Harikaran Subbaraj, Jue Wang, Shuaiwen Leon Song, Ben Athiwaratkun

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Together AI University of Sydney(悉尼大学)

AI总结 CREST通过引导推理模型的认知行为,提高推理准确性和效率,减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05925 2025-12-08 cs.AI cs.CL

To Err Is Human: Systematic Quantification of Errors in Published AI Papers via LLM Analysis

出错是人之常情:通过LLM分析系统性量化已发表AI论文中的错误

Federico Bianchi, Yongchan Kwon, Zachary Izzo, Linjun Zhang, James Zou

机构 * Together AI NEC Labs America(NEC美国实验室) Rutgers University(罗格斯大学) Stanford University(斯坦福大学)

AI总结 通过LLM分析发现已发表AI论文中存在大量客观错误,错误数量随时间增加,AI检查器能有效识别并纠正大部分错误,提升文献的准确性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20039 2025-11-21 cs.CL cs.LG

AutoJudge: Judge Decoding Without Manual Annotation

AutoJudge: 无需人工标注的判断解码

Roman Garipov, Fedor Velikonivtsev, Ivan Ermakov, Ruslan Svirschevski, Vage Egiazarian, Max Ryabinin

机构 * HSE University(俄罗斯高等经济学院) Yandex IST Austria(国际应用数学研究所) Together AI

AI总结 AutoJudge通过任务特定的损失性推测解码加速LLM推理,无需人工标注,实现显著速度提升并牺牲少量准确性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15951 2025-10-21 cs.CY cs.CL cs.HC cs.LG

Attention to Non-Adopters

Kaitlyn Zhou, Kristina Gligorić, Myra Cheng, Michelle S. Lam, Vyoma Raman, Boluwatife Aminu, Caeley Woo, Michael Brockman, Hannah Cha, Dan Jurafsky

机构 * Stanford University(斯坦福大学) Together AI Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15211 2025-10-20 cs.LG cs.AI

ReasonIF: Large Reasoning Models Fail to Follow Instructions During Reasoning

Yongchan Kwon, Shang Zhu, Federico Bianchi, Kaitlyn Zhou, James Zou

机构 * Together AI Stanford University(斯坦福大学)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17967 2025-10-09 cs.LG cs.AI

FFT-based Dynamic Subspace Selection for Low-Rank Adaptive Optimization of Large Language Models

Ionut-Vlad Modoranu, Mher Safaryan, Erik Schultheis, Max Ryabinin, Artem Chumachenko, Dan Alistarh

机构 * ISTA(因斯托克科学与技术研究院) Together AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05059 2025-10-07 cs.AI

Staircase Streaming for Low-Latency Multi-Agent Inference

Junlin Wang, Jue Wang, Zhen, Xu, Ben Athiwaratkun, Bhuwan Dhingra, Ce Zhang, James Zou

机构 * Duke University(杜克大学) Together AI University of Chicago(芝加哥大学) Stanford University(斯坦福大学)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02737 2025-09-04 cs.LG

Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient

Zhongzhu Zhou, Yibo Yang, Ziyan Chen, Fengxiang Bie, Haojun Xia, Xiaoxia Wu, Robert Wu, Ben Athiwaratkun, Bernard Ghanem, Shuaiwen Leon Song

机构 * University of Sydney(悉尼大学) King Abdullah University of Science and Technology(卡普兰·阿卜杜勒·阿齐兹科学与技术大学) Together AI

Comments 18 pages, 4 figures, 2 tables; includes supplementary material; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12374 2025-07-08 cs.CL

Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding

Zhuoming Chen, Avner May, Ruslan Svirschevski, Yuhsun Huang, Max Ryabinin, Zhihao Jia, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Together AI Yandex National Research University Higher School of Economics(俄罗斯国家研究大学高等经济学院) FAIR, Meta(FAIR,Meta)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02173 2025-07-04 cs.AI

Data Diversification Methods In Alignment Enhance Math Performance In LLMs

Berkan Dokmeci, Qingyang Wu, Ben Athiwaratkun, Ce Zhang, Shuaiwen Leon Song, James Zou

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Together AI University of Chicago(芝加哥大学) Stanford University(斯坦福大学)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15237 2025-06-30 cs.LG cs.AI

The Mamba in the Llama: Distilling and Accelerating Hybrid Models

Junxiong Wang, Daniele Paliotta, Avner May, Alexander M. Rush, Tri Dao

机构 * Cornell University(康奈尔大学) University of Geneva(日内瓦大学) Together AI Princeton University(普林斯顿大学)

Comments NeurIPS 2024. v4 updates: mention concurrent work of speculative decoding for SSM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11462 2025-06-25 cs.CL cs.AI

Disentangling Reasoning and Knowledge in Medical Large Language Models

Rahul Thapa, Qingyang Wu, Kevin Wu, Harrison Zhang, Angela Zhang, Eric Wu, Haotian Ye, Suhana Bedi, Nevin Aresh, Joseph Boen, Shriya Reddy, Ben Athiwaratkun, Shuaiwen Leon Song, James Zou

机构 * Stanford University(斯坦福大学) Together AI University of California, San Francisco(加州大学旧金山分校)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06589 2025-06-23 cs.LG cs.CL cs.DC

Ladder-residual: parallelism-aware architecture for accelerating large model inference with communication overlapping

Muru Zhang, Mayank Mishra, Zhongzhu Zhou, William Brandon, Jue Wang, Yoon Kim, Jonathan Ragan-Kelley, Shuaiwen Leon Song, Ben Athiwaratkun, Tri Dao

机构 * Together AI University of Southern California MIT-IBM Watson Lab University of Sydney Massachusetts Institute of Technology Princeton University

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05340 2025-06-09 cs.LG cs.AI

Exploring Diffusion Transformer Designs via Grafting

Keshigeyan Chandrasegaran, Michael Poli, Daniel Y. Fu, Dongjun Kim, Lea M. Hadzic, Manling Li, Agrim Gupta, Stefano Massaroli, Azalia Mirhoseini, Juan Carlos Niebles, Stefano Ermon, Li Fei-Fei

机构 * Stanford University(斯坦福大学) Liquid AI Together AI UC San Diego(加州大学圣地亚哥分校) Northwestern University(西北大学) Google DeepMind(谷歌DeepMind) Salesforce Research(Salesforce研究)

Comments 22 pages; Project website: https://grafting.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04421 2025-06-06 cs.CV cs.AI cs.LG

HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation

Hermann Kumbong, Xian Liu, Tsung-Yi Lin, Ming-Yu Liu, Xihui Liu, Ziwei Liu, Daniel Y. Fu, Christopher Ré, David W. Romero

机构 * Stanford University(斯坦福大学) NVIDIA CUHK(中国香港大学) HKU(香港大学) NTU(国立新加坡大学) UCSD(加州大学圣地亚哥分校) Together AI

Comments Accepted to CVPR 2025. Project Page: https://research.nvidia.com/labs/dir/hmar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03275 2025-06-05 cs.CV cs.AI

Chipmunk: Training-Free Acceleration of Diffusion Transformers with Dynamic Column-Sparse Deltas

Austin Silveria, Soham V. Govande, Daniel Y. Fu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Together AI Stanford University(斯坦福大学)

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14391 2025-05-23 cs.CV

How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?

Rahul Thapa, Andrew Li, Qingyang Wu, Bryan He, Yuki Sahashi, Christina Binder, Angela Zhang, Ben Athiwaratkun, Shuaiwen Leon Song, David Ouyang, James Zou

机构 * Stanford University(斯坦福大学) Together AI University of California, Berkeley(加州大学伯克利分校) Cedars-Sinai Medical Center(西德斯-西奈医学中心) University of California, San Francisco(加州大学旧金山分校)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03059 2025-05-07 cs.CL

Improving Model Alignment Through Collective Intelligence of Open-Source LLMS

Junlin Wang, Roy Xie, Shang Zhu, Jue Wang, Ben Athiwaratkun, Bhuwan Dhingra, Shuaiwen Leon Song, Ce Zhang, James Zou

机构 * Duke University(杜克大学) Together AI University of Chicago(芝加哥大学) Stanford University(斯坦福大学)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏