arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-08-10 至 2026-08-10 共收录 10
2608.07437 2026-08-10 cs.AI 新提交

Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

Fisher-R1:训练用于可靠假设检验的大语言模型智能体

Jiacheng Miao, Jin Mu, Guanhua Chen, James Zou

机构 * Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 该研究构建了含425项多领域假设检验任务的P-Bench基准,训练出Fisher-R1智能体,其在P-Bench上较DeepSeek-V4-Pro单试验成功率平均提升21%,证明强化学习可提升LLM的统计推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07436 2026-08-10 cs.AI cs.LG 新提交

Post-Grokking Collapse at the Representation-Readout Interface in Muon-Trained Transformers

Muon训练的Transformer中表示-读出接口的后顿悟崩溃

Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi

机构 * Data Science Institute, Columbia University(哥伦比亚大学数据科学研究所) Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) CentraleSupélec(中央高等电力学院)

AI总结 该研究发现Muon训练的Transformer在模块化加法等任务中,顿悟后会因表示-读出接口故障丧失泛化性,冻结嵌入/读出可避免,傅里叶滤波能分离故障与掩码,任务对齐族可恢复性能。

Comments 34 pages, 6 figures, 20 tables. Full technical version; a condensed 9-page version is currently under review. Code: https://github.com/Na00s/muon-grokking

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07147 2026-08-10 cs.AI 新提交

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

DiDPO:用于编码智能体训练的差异内差异策略优化

Xucong Wang, Zhe Zhao, Liheng Yu, Di Wu, Xiaofeng Cao, Pengkun Wang

机构 * University of Science and Technology of China (USTC)(中国科学技术大学) Stanford University(斯坦福大学) Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) Tongji University(同济大学)

AI总结 针对编码智能体训练的细粒度信用分配难题,提出DiDPO方法,在Qwen2.5-7B-Coder上性能超可比方法10%以上,开源了支持多种RL方法的verl-code代码库。

Comments 16 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06794 2026-08-10 cs.CV 新提交

PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model

PAST:用于高效扩散模型的提示自适应采样终止

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

AI总结 PAST是一种提示自适应采样终止方法,通过双自适应协调机制提升扩散模型RL微调的计算效率与偏好优化质量,效率最高提升66.7%,质量最高提升29.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06768 2026-08-10 cs.CV 新提交

Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

探索还是收敛?面向扩散模型的阶段引导式逐步优化方法

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

AI总结 针对扩散模型RL偏好对齐的奖励不匹配问题,提出SGPO方法,通过分阶段分配目标,使生成质量提升26.7%、收敛速度提高36.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07885 2026-08-10 cs.DC cs.AI cs.CL cs.LG 版本更新

Intelligence per Watt: Measuring Intelligence Efficiency of Local AI

每瓦智能:衡量本地AI的智能效率

Jon Saad-Falcon, Avanika Narayan, Hakki Orhun Akengin, J. Wes Griffin, Herumb Shandilya, Adrian Gamarra Lafuente, Medhya Goel, Rebecca Joseph, Shlok Natarajan, Etash Kumar Guha, Shang Zhu, Ben Athiwaratkun, John Hennessy, Azalia Mirhoseini, Christopher Ré

机构 * Stanford University(斯坦福大学) Together AI

AI总结 本文研究了本地AI在能源效率和性能上的表现,提出了一种统一的衡量指标IPW,展示了本地推理在重新分配需求方面的能力,并揭示了本地加速器的优化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19035 2026-08-10 cs.AI 版本更新

Trustworthy Agent Network: Trust in Agent Networks Must Be Baked In, Not Bolted On

可信代理网络:在代理网络中,信任必须被内置,而非事后添加

Yixiang Yao, Yuhang Yao, Xinyi Fan, Jiechao Gao, Jie Wang, Minjia Zhang, Srivatsan Ravi, Carlee Joe-Wong

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

AI总结 本文探讨了在代理网络中信任必须被内置而非事后添加的问题,提出了一个综合的概念框架,通过四个设计支柱来建立代理网络中的信任。

Comments Accepted at SIGKDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08390 2026-08-10 cs.LG 版本更新

Inference-Time Scaling of Diffusion Language Models via Trajectory Refinement

通过轨迹细化提升扩散语言模型的推理时间扩展

Meihua Dang, Jiaqi Han, Minkai Xu, Kai Xu, Akash Srivastava, Stefano Ermon

机构 * Stanford University(斯坦福大学) Red Hat AI Innovation(红帽人工智能创新)

AI总结 本文提出PG-DLM,通过轨迹级细化提升扩散语言模型的推理效率,引入新的缩放轴并实现自适应计算分配,实验显示在奖励引导生成任务中表现更优。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12236 2026-08-10 eess.IV cs.CV 版本更新

Resolution-Agnostic Neural Operators for Multi-Rate Sparse-View CT

分辨率无关的神经算子用于多速率稀疏视角CT

Aujasvit Datta, Jiayun Wang, Asad Aali, Anima Anandkumar

机构 * Caltech(加州理工学院) IIT Kanpur(印度理工学院坎普尔分校) Stanford University(斯坦福大学)

AI总结 CTO提出一种分辨率无关的神经算子框架,通过连续函数空间实现多速率稀疏视角CT重建的泛化,提升重建质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08029 2026-08-10 cs.CL cs.CY 版本更新

Better Together: Quantifying the Benefits of AI-Assisted Recruitment

携手共进:量化AI辅助招聘的益处

Ada Aka, Emil Palikot, Ali Ansari, Nima Yazdani

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

AI总结 该研究通过两项实地实验发现,AI辅助招聘可提升候选人最终面试通过率,在简历信息不足的初级候选人中效果更显著,但存在75%的候选人未完成面试的问题,其将筛选成本从企业转移至申请人。

详情

展开后加载摘要…

URL PDF HTML 收藏