arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-04-22 至 2026-04-22 共收录 4
2604.16529 2026-04-22 cs.SE cs.AI cs.CL cs.LG

Scaling Test-Time Compute for Agentic Coding

为代理编程扩展测试时计算

Joongwon Kim, Wannan Yang, Kelvin Niu, Hongming Zhang, Yun Zhu, Eryk Helenowski, Ruan Silva, Zhengxing Chen, Srinivasan Iyer, Manzil Zaheer, Daniel Fried, Hannaneh Hajishirzi, Sanjeev Arora, Gabriel Synnaeve, Ruslan Salakhutdinov, Anirudh Goyal

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of Washington(华盛顿大学) New York University(纽约大学) Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学)

AI总结 本文提出基于轨迹紧凑表示的代理编程测试时扩展框架,通过递归竞赛投票和并行-蒸馏-细化方法提升长周期代理性能,实验证明在SWE-Bench和Terminal-Bench上显著提升效果。

Comments 70 pages, 26 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02779 2026-04-22 cs.CV cs.AI

3D Foundation Model for Generalizable Disease Detection in Head Computed Tomography

用于头部CT图像通用疾病检测的3D基础模型

Weicheng Zhu, Haoxu Huang, Huanze Tang, Rushabh Musthyala, Boyang Yu, Long Chen, Emilio Vega, Thomas O'Donnell, Seena Dehkharghani, Jennifer A. Frontera, Arjun V. Masurkar, Kara Melmed, Narges Razavian

机构 * New York University, Center for Data Science(纽约大学数据科学中心) New York University, Courant Institute of Mathematical Sciences(纽约大学Courant数学科学研究所) NYU Grossman School of Medicine, Department of Radiology(纽约大学 Grossman 医学院放射科) Siemens Healthineers(西门子医疗科技) NYU Grossman School of Medicine, Department of Neurology(纽约大学 Grossman 医学院神经病学部) NYU Grossman School of Medicine, Department of Neuroscience and Physiology(纽约大学 Grossman 医学院神经科学与生理学部) NYU Grossman School of Medicine, Neuroscience Institute(纽约大学 Grossman 医学院神经科学研究所)

AI总结 本文提出FM-CT模型,通过自监督学习在无需人工标注的情况下训练,提升头部CT图像中疾病检测的泛化能力,验证了自监督学习在医学影像中的有效性。

Comments Nature Biomedical Engineering (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18797 2026-04-22 cs.CV

CrossPan: A Comprehensive Benchmark for Cross-Sequence Pancreas MRI Segmentation and Generalization

CrossPan:跨序列胰腺MRI分割与泛化的综合性基准

Linkai Peng, Cuiling Sun, Zheyuan Zhang, Wanying Dou, Halil Ertugrul Aktas, Andrea M Bejar, Elif Keles, Tamas Gonda, Michael B Wallace, Zongwei Zhou, Gorkem Durak, Rajesh N Keswani, Ulas Bagci

机构 * Department of Radiology, Northwestern University(西北大学放射科) Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系) Department of Computer Science, Northwestern University(西北大学计算机科学系) Department of Gastroenterology, New York University(纽约大学消化内科部) Division of Gastroenterology and Hepatology, Mayo Clinic in Florida(佛罗里达梅奥诊所消化内科与肝病学部) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Departments of Gastroenterology and Hepatology, Northwestern University(西北大学消化内科与肝病学部)

AI总结 研究揭示跨序列泛化是胰腺MRI分割临床应用的主要障碍,指出跨序列域偏移比跨中心差异更严重,且现有方法在物理驱动对比反转下效果有限,半监督学习在稳定强度分布下有提升但不稳定。

Comments Accepted to MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02304 2026-04-22 cs.CL

When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers

验证何时有效?对LLM作为解决方案验证器的深入探讨

Jack Lu, Ryan Teehan, Jinran Jin, Mengye Ren

机构 * Agentic Learning AI Lab, New York University(代理学习人工智能实验室,纽约大学)

AI总结 研究探讨了在何种条件下验证有效,通过分析37个模型在9个基准测试中的表现,发现跨模型家族验证效果优于自验证,且验证收益随模型相似性增加而降低。

Comments Accepted at ICLR 2026 AI with Recursive Self-Improvement workshop

详情

展开后加载摘要…

URL PDF HTML 收藏