arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-08-10 至 2026-08-10 共收录 5
2608.07437 2026-08-10 cs.AI 新提交

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

Fisher-R1:训练用于可靠假设检验的大语言模型智能体

Jiacheng Miao, Jin Mu, Guanhua Chen, James Zou

机构 * Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 该研究构建了含425项多领域假设检验任务的P-Bench基准,训练出Fisher-R1智能体,其在P-Bench上较DeepSeek-V4-Pro单试验成功率平均提升21%,证明强化学习可提升LLM的统计推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07436 2026-08-10 cs.AI cs.LG 新提交

Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers

Muon训练的Transformer中表示-读出接口的后顿悟崩溃

Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi

机构 * Data Science Institute, Columbia University(哥伦比亚大学数据科学研究所) Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) CentraleSupélec(中央高等电力学院)

AI总结 该研究发现Muon训练的Transformer在模块化加法等任务中,顿悟后会因表示-读出接口故障丧失泛化性,冻结嵌入/读出可避免,傅里叶滤波能分离故障与掩码,任务对齐族可恢复性能。

Comments 34 pages, 6 figures, 20 tables. Full technical version; a condensed 9-page version is currently under review. Code: https://github.com/Na00s/muon-grokking

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07147 2026-08-10 cs.AI 新提交

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

DiDPO:用于编码智能体训练的差异内差异策略优化

Xucong Wang, Zhe Zhao, Liheng Yu, Di Wu, Xiaofeng Cao, Pengkun Wang

机构 * University of Science and Technology of China (USTC)(中国科学技术大学) Stanford University(斯坦福大学) Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) Tongji University(同济大学)

AI总结 针对编码智能体训练的细粒度信用分配难题,提出DiDPO方法,在Qwen2.5-7B-Coder上性能超可比方法10%以上,开源了支持多种RL方法的verl-code代码库。

Comments 16 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06794 2026-08-10 cs.CV 新提交

PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model

PAST:用于高效扩散模型的提示自适应采样终止

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

AI总结 PAST是一种提示自适应采样终止方法,通过双自适应协调机制提升扩散模型RL微调的计算效率与偏好优化质量,效率最高提升66.7%,质量最高提升29.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06768 2026-08-10 cs.CV 新提交

Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

探索还是收敛?面向扩散模型的阶段引导式逐步优化方法

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

AI总结 针对扩散模型RL偏好对齐的奖励不匹配问题,提出SGPO方法,通过分阶段分配目标,使生成质量提升26.7%、收敛速度提高36.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏