arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-08-18 至 2026-08-18 共收录 10
2608.14659 2026-08-18 cs.AI cs.LG cs.SE 新提交

When Uncertainty Isn't Enough: An Empirical Study of Self-Correction in Code Generation

当不确定性还不够时:代码生成中自校正的实证研究

Pranav Rakasi, Maanas Lalwani, Arnav Srivastava, Arya Palanivel, Tinuade Adeleke, Ruizhe Li, Sean Wu

机构 * University of Michigan(密歇根大学) New York University(纽约大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Algoverse AI University of Aberdeen(阿伯丁大学) University of Oxford(牛津大学)

AI总结 本研究通过实证发现,针对代码生成的不确定性估计方法难以可靠提升生成准确率,仅基于验证的自校正策略可显著提升Pass@1指标,廉价不确定性估计器仅适合作为校正循环的门控信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12253 2026-08-18 cs.CL cs.AI cs.LG 版本更新

One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL

单个冻结模拟器不够:多智能体强化学习中的模拟器崩溃问题

Simon Yu, Nicholas Tomlin, Marwa Abdulhai, Ximing Lu, Derek Chong, Abe Hou, Dilara Soylu, Sergey Levine, Christopher D. Manning, Weiyan Shi

机构 * Northeastern University(东北大学) New York University(纽约大学) UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 针对人机交互多智能体强化学习中单个LLM模拟器导致的策略泛化缺陷,提出Verbalized Sampling和Co-Training两种方案,在多轮基准测试和真实用户研究中显著提升了性能,发布了开源框架SCOPE。

Comments 42 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09025 2026-08-18 cs.AI cs.CR stat.ML 版本更新

Context Is Not Authority: Structured Runtime Governance for Financial Market Agents

上下文并非权威:面向金融市场智能体的结构化运行时治理

Rui Tang, Qiangqiang Liu, Yichi Zhang, Youwei Yang, Xi Chen, Chen Dong

机构 * OpenAsk Binance(币安) New York University(纽约大学) Xiamen University(厦门大学) Bank of Hebei(河北银行)

AI总结 针对金融智能体可能将正确上下文转化为未经授权影响的问题,提出SAGE-Fin金融领域权限交接合约,通过运行时控制影响保障合规,经测试和实际部署验证了其有效性。

Comments 15 pages, 1 figure, 9 tables. Qiangqiang Liu and Yichi Zhang are corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13039 2026-08-18 cs.CY cs.AI 版本更新

Safeguard-Conditioned Uplift: Measuring Utility-Risk Frontiers for Dual-Use Biology Assistants

保障条件提升:衡量两用生物助手的效用-风险前沿

Dipesh Tharu Mahato

机构 * New York University(纽约大学)

AI总结 研究两用生物助手访问条件对效用和风险的影响,提出保障条件提升协议,通过人工判断效用-风险前沿比较访问条件,评估了Claude Sonnet 4.6和Gemini 3.5 Flash,给出部署级评估目标和校准程序,衡量其对效用-风险前沿的作用。

Comments 27 pages, 3 figures, 31 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19888 2026-08-18 cs.LG cs.AI 版本更新

SL-S4Wave: Self-Supervised Learning of Physiological Waveforms with Structured State Space Models

SL-S4Wave:基于结构化状态空间模型的生理波形自监督学习

Feng Wu, Harsh Deep, Eric Lehman, Sanyam Kapoor, Guoshuai Zhao, Rahul G. Krishnan, Gari Clifford, Li-wei H Lehman

机构 * Massachusetts Institute of Technology(麻省理工学院) OpenEvidence, USA(OpenEvidence(美国)) New York University(纽约大学) Xi’an Jiaotong University(西安交通大学) University of Toronto(多伦多大学) Emory University(埃默里大学)

AI总结 提出SL-S4Wave框架,结合对比学习与基于结构化状态空间模型的编码器,通过多尺度子核全局卷积捕获多通道生理波形的局部和长程依赖,在心律失常检测等任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09448 2026-08-18 cs.LG 版本更新

Learning to Bid with Unknown Private Values in Budget-Constrained First-Price Auctions

在有预算限制的首价拍卖中学习投标:未知私人价值

Zihao Hu, Yuxiao Wen, Yuan Yao, Jiheng Zhang, Zhengyuan Zhou

机构 * Department of Mathematics, The Hong Kong University of Science and Technology(香港科技大学数学系) Stern School of Business, New York University(纽约大学斯特恩商学院)

AI总结 本文提出统一的对偶框架,解决有预算约束的首价拍卖中学习隐含价值和对手投标分布的问题,通过强Slater条件和自适应预热程序稳定对偶变量,实现近最优的后悔保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10496 2026-08-18 cs.LG 版本更新

CodeQuant: Unified Clustering and Quantization for Enhanced Outlier Smoothing in Low-Precision Mixture-of-Experts

CodeQuant: 一种统一的聚类和量化方法以提升低精度混合专家模型中的异常值平滑

Xiangyang Yin, Xingyu Liu, Tianhua Xia, Bo Bao, Vithursan Thangarasa, Valavan Manohararajah, Eric Sather, Sai Qian Zhang

机构 * Courant Institute of Mathematical Sciences, New York University(纽约大学库朗数学科学研究所) Tandon School of Engineering, New York University(纽约大学坦登工程学院) Cerebras Systems Inc.(Cerebras系统公司)

AI总结 本文提出CodeQuant,通过可学习旋转平滑激活异常值并吸收权重异常值到细调的聚类中心,提升低精度混合专家模型的准确性与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17006 2026-08-18 cs.AI 版本更新

Budget-Aware Tool Use Enables Effective Agent Scaling

预算感知的工具使用实现有效的代理扩展

Tengxiao Liu, Zifeng Wang, Jin Miao, I-Hung Hsu, Jun Yan, Jiefeng Chen, Rujun Han, Fangyuan Xu, Yanfei Chen, Ke Jiang, Samira Daruki, Yi Liang, William Yang Wang, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind) New York University(纽约大学) UC Santa Barbara(加州大学圣塔芭芭拉分校)

AI总结 本研究提出BATS框架,通过预算感知机制提升工具增强代理的扩展效率,实现更优的成本-性能平衡。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01584 2026-08-18 cs.LG cs.AI cs.CY 版本更新

VirnyFlow: Optimizing ML Pipelines for Accuracy, Fairness, and Stability at Scale

VirnyFlow:面向大规模场景下兼顾准确率、公平性与稳定性的机器学习流水线优化

Denys Herasymuk, Anastasiia Mozghova, Nazar Protsiv, Vladyslav Sydorak, Julia Stoyanovich

机构 * Ukrainian Catholic University(乌克兰天主教大学) New York University(纽约大学)

AI总结 VirnyFlow是兼顾准确率、公平性与稳定性的大规模ML流水线优化系统,可扩展至多节点,在真实数据集上性能优于主流AutoML系统,支持人类在环迭代调整优化目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04171 2026-08-18 cs.CY cs.CL 版本更新

The Political Ideology of Large Language Models: Measurement, Inconsistency, and Persuasive Influence

大语言模型的政治意识形态:测量、不一致性与说服影响

Nouar Aldahoul, Hazem Ibrahim, Aaron R. Kaufman, Talal Rahwan, Yasir Zaki

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校)

AI总结 该研究挑战LLMs政治偏差较小的主流观点,发现43个LLMs的意识形态定位类似温和选民,且在引导下能产生至少与专业竞选广告相当的说服效果,或成为政治影响载体。

Comments 94 pages, 36 figures (12 main text, 24 supplementary), 20 tables. Includes Supplementary Materials

详情

展开后加载摘要…

URL PDF HTML 收藏