arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

2026-07-07 至 2026-07-07 共收录 9
2607.04574 2026-07-07 cs.LG cs.AI 新提交

A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training

教师的少量步骤作用显著:智能体训练后基于策略的数据增强的成本效益

Junze Ye, Jiayi Cheng, Miao Lu, Michal Mankowski, Jose Blanchet, Mohsen Bayati

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

AI总结 研究针对大语言模型智能体,将基于策略的数据构建视为预算分配问题,通过特定方式形式化设计空间,在多个任务中实验表明少量教师步骤在学习者诱导情境下更具成本效益。

Comments Accepted by ICML 2026 Workshop: RLxF: Reinforcement Learning from World Feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04293 2026-07-07 cs.CL cs.AI cs.LG stat.ML 新提交

CausalGame: Benchmarking Causal Thinking of LLM Agents in Games

因果游戏:在游戏中对大语言模型智能体的因果思维进行基准测试

Zhenhao Chen, Yongqiang Chen, Chenxi Liu, Junchi Yu, Xiangchen Song, Zijian Li, Jialin Li, Philip Torr, Bo Han, Kun Zhang

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong Baptist University(香港浸会大学) University of Oxford(牛津大学) New York University, Abu Dhabi(纽约大学阿布扎比分校)

AI总结 研究旨在通过因果游戏基准测试大语言模型智能体的因果思维能力,让智能体设计实验、收集数据并给出解决方案。设计含多种挑战的场景,发现当前智能体因果思维能力欠佳,为评估提供了测试平台。

Comments Zhenhao, Yongqiang, and Chenxi contributed equally to the project. A short version is accepted at the Forty-Third International Conference on Machine Learning (ICML) 2026 as an Oral presentation. Project website https://causalgame.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04011 2026-07-07 cs.CL cs.AI 新提交

Separating Representation from Reconstruction Enables Scalable Text Encoders

将表示与重建分离可实现可扩展的文本编码器

Megi Dervishi, Mathurin Videau, Yann LeCun

机构 * FAIR Meta New York University(纽约大学)

AI总结 研究发现自BERT以来编码器变化小,通过冻结主干评估揭示问题源于其扁平设计。提出CrossBERT架构分离高质量编码表示学习与令牌重建,能提高掩码率和梯度收集效率,在相关基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03210 2026-07-07 cs.LG cs.AI cs.CL 新提交

Transition Information Density: Morphological Trajectories, Synesthetic Perception, and Structured Interpolation in Neural Training (or: The Synesthetic AI)

过渡信息密度:神经训练中的形态轨迹、联觉感知和结构化插值(或:联觉人工智能)

Sam Mao

机构 * New York University(纽约大学) Interactive Media Arts(互动媒体艺术)

AI总结 介绍过渡信息密度及位置标识,基于联觉等实证背景研究。通过结构化插值训练的探针在语音/语言和语义描述媒介中维度更低,贡献相关定义、框架及实验设计,区分轨迹结构等因素。

Comments 38 pages, 9 figures, 4 tables. Empirical results from structured interpolation training across four representational mediums. Pipeline scripts, experimental data, and the Synesthesia Grid algorithm available upon reasonable request

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02891 2026-07-07 cs.LG stat.ML 新提交

Dynamic Regret for Non-Stationary Linear Bandits via Misspecification Reductions

通过错误设定减少实现非平稳线性带型问题的动态遗憾

Zihao Hu, Yuan Yao, Jiheng Zhang, Zhengyuan Zhou

机构 * Department of Mathematics, The Hong Kong University of Science and Technology(香港科技大学数学系) Stern School of Business, New York University(纽约大学斯特恩商学院) Department of IEDA, The Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

AI总结 研究含特定轮次可行决策集的非平稳线性带型问题,针对现有方法局限,从统一错误设定减少视角,分块关联动态遗憾与固定参数线性带型基准,得出最优动态遗憾依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02869 2026-07-07 cs.LG 新提交

Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models

强化学习中的奖励粒度:比较用于小语言模型数学推理的过程奖励和结果奖励结构

Anagha Radhakrishna Palandye, Rebecca Glick, Osheen Kaul

机构 * New York University(纽约大学)

AI总结 研究在小语言模型中通过强化学习提升数学推理能力,系统比较五种奖励条件,发现过程奖励能显著提高准确率和推理痕迹保真度,奖励粒度是重要设计决策。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02668 2026-07-07 cs.CL 新提交

Improving LLMs via Validator-to-Generator Alignment

通过验证器与生成器对齐改进大语言模型

Juan Diego Rodriguez, Jocelyn Zhang, Katrin Erk, Greg Durrett

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Departments of Linguistics and Computer Science, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校语言学与计算机科学系) Department of Computer Science & Center for Data Science, New York University(纽约大学计算机科学系及数据科学中心)

AI总结 研究大语言模型不一致问题,提出基于话语频率的生成器-验证器一致性新公式,介绍\FCPA方法,实验表明该方法能提升生成器性能及两者一致性,且保持验证器质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03671 2026-07-07 q-bio.QM cs.LG nlin.CD q-bio.NC 新提交

Diffusion learning reveals viable parameter manifolds and compensation geometry in biological dynamical systems

扩散学习揭示生物动力系统中可行参数流形和补偿几何

Ruilin Zhang, Louis Tao, Zhuo-Cheng Xiao

机构 * Peking University–Tsinghua University–National Institute of Biological Sciences Joint Graduate Program(北京大学-清华大学-中国生物科学研究院联合研究生项目) Academy for Advanced Interdisciplinary Studies(先进跨学科研究院) Center for Bioinformatics(生物信息中心) School of Life Sciences(生命科学学院) National Laboratory of Protein Engineering and Plant Genetic Engineering(蛋白质工程与植物基因工程国家实验室) Center for Quantitative Biology(定量生物学中心) NYU-ECNU Institute of Mathematical Sciences(纽约大学-复旦大学数学科学研究院) New York University Shanghai(纽约大学上海分校) NYU-ECNU Institute of Brain and Cognitive Science(纽约大学-复旦大学脑与认知科学研究院)

AI总结 研究复杂系统参数与可观测量关系,将兼容参数集形式化为可行参数流形,用条件分数扩散模型训练并采样,以Lorenz等模型为例揭示系统补偿几何等,为研究提供工具。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02196 2026-07-07 cs.LG 新提交

Online Resource Allocation with Continuous Random Consumption: Regret under Degeneracy

连续随机消耗的在线资源分配:退化下的遗憾

Jiawei Zhang

机构 * Stern School of Business(斯特恩商学院) New York University(纽约大学)

AI总结 研究奖励和消耗量连续分布的在线资源分配问题,提出基于样本路径的边际策略,在退化情况下实现次线性遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏