arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

New York University(纽约大学)

共收录 1612
2608.13297 2026-08-14 cs.LG 新提交

The Time Value of Evolution

进化的时间价值

Matthew Siper, Ahmed Khalifa, Julian Togelius

机构 * New York University(纽约大学) University of Malta(马耳他大学)

AI总结 该研究提出LVPG框架,将进化的时间价值形式化,通过长视野信用分配加速有限预算搜索,提升了自动交易策略发现的性能。

Comments Submitted to AAAI 2026, 8 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12831 2026-08-14 cs.LG cs.AI 新提交

Fast A/B/n Testing: Exact Multi-Policy Comparison via Tree-Coupled Feedback Sharing

快速A/B/n测试:通过树耦合反馈共享实现精确多策略比较

Yuxiao Wen

机构 * Courant Institute of Mathematical Sciences, New York University(纽约大学柯朗数学科学研究所)

AI总结 该研究提出树耦合A/B测试(TCAB)方法,通过树耦合反馈共享实现多策略精确比较,将奖励查询数从JT降至T+o(T),实验显示其在成本-精度上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01692 2026-08-14 cs.LG 版本更新

Beckmann Transport Models: From Autonomous Flows to One-Step Maps

贝克曼运输模型:从自主流到一步映射

Lee Cheuk-Kit, Florentin Coeurdoux, Yuyuan Chen, Sophia Tang, Peter Potaptchik, Yilun Du, Michael Samuel Albergo, Eric Vanden-Eijnden

机构 * Harvard University(哈佛大学) Capital Fund Management (CFM)(凯鹏华盈资产管理公司) University of Oxford(牛津大学) New York University(纽约大学)

AI总结 该研究提出基于自主流的流匹配实例,构建统一框架实现分布间精确映射,修正现有方法不一致性,在ImageNet 256×256上验证了自主流与一步映射的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29699 2026-08-14 cs.CV cs.AI cs.RO 版本更新

Early Warning Signals for OpenVLA Failure under Visual Distribution Shift

视觉分布偏移下OpenVLA故障的早期预警信号

Dipesh Tharu Mahato, Rachel Ren

机构 * New York University(纽约大学)

AI总结 研究在视觉分布偏移下,OpenVLA内部激活是否包含可线性解码的近期任务失败信息,通过LIBERO操作实验发现第16层逻辑探针在遮挡条件下预测失败AUROC达0.972。

Comments 16 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09670 2026-08-14 cs.LG cs.AI 版本更新

In-context superposition: human-like working memory interference in large language models

类人工作记忆干扰在大语言模型中

Hua-Dong Xiong, Li Ji-An, Jiaqi Huang, Robert C. Wilson, Kwonjoon Lee, Xue-Xin Wei

机构 * School of Psychological and Brain Sciences, Georgia Tech(佐治亚理工学院心理与脑科学学院) Department of Psychology, New York University(纽约大学心理学系) Department of Cognitive Science, Indiana University Bloomington(印第安纳大学布卢明顿分校认知科学系) Honda Research Institute(本田研究所) Center of Excellence for Computational Cognition, Georgia Tech(佐治亚理工学院计算认知卓越中心) Departments of Neuroscience and Psychology, The University of Texas at Austin(德克萨斯大学奥斯汀分校神经科学和心理学系)

AI总结 研究发现大语言模型在工作记忆任务中存在干扰限制,其表现与人类相似,且通过抑制无关信息实现有效记忆检索。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12253 2026-08-13 cs.CL cs.AI cs.LG 新提交

One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL

单个冻结模拟器不够:多智能体强化学习中的模拟器崩溃问题

Simon Yu, Nicholas Tomlin, Marwa Abdulhai, Ximing Lu, Derek Chong, Abe Hou, Dilara Soylu, Sergey Levine, Christopher D. Manning, Weiyan Shi

机构 * Northeastern University(东北大学) New York University(纽约大学) UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 针对人机交互多智能体强化学习中单个LLM模拟器导致的策略泛化缺陷,提出Verbalized Sampling和Co-Training两种方案,在多轮基准测试和真实用户研究中显著提升了性能,发布了开源框架SCOPE。

Comments 41 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11859 2026-08-13 cs.LG 新提交

Small-Scale Experiments: Are We There Yet?

小规模实验:我们达到目标了吗?

Nicholas Lourie, Kyunghyun Cho, Karen Ullrich, Sanae Lotfi

机构 * FAIR at MSL Meta New York University(纽约大学)

AI总结 该研究指出小规模模型对超参数的敏感性是缩放定律在小规模实验中失效的关键,开发了以模型为中心的研究方法论,通过小规模实验证实Transformer中预归一化随模型规模增大效果更好,表明小规模实验可兑现缩放定律的承诺。

Comments 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11746 2026-08-13 cs.LG cs.CL 新提交

Epiplexity Guided Data Selection and Generation for Out-of-Distribution Generalization

面向分布外泛化的、受Epiplexity引导的数据选择与生成

Ellen Su, Andres Potapczynski, Shikai Qiu, Edward Hughes, Andrew Gordon Wilson

机构 * New York University(纽约大学)

AI总结 该研究提出以Epiplexity为引导,通过数据选择与合成数据生成提升模型分布外泛化能力,实验显示更高Epiplexity可改善零样本及微调任务的下游性能。

Comments Code available for EpiSelect (https://github.com/eysu35/EpiSelect) and EpiGen (https://github.com/eysu35/EpiGen)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11612 2026-08-13 cs.LG cs.AI 新提交

Dion3: Full-Stack Orthogonal Updates

Dion3:全栈正交更新

Noah Amsel, Jack Zhang, Kwangjun Ahn, Ali Naeimi, Austin Feng, Berlin Chen, Tri Dao, John Langford

机构 * Microsoft Research(微软研究院) New York University(纽约大学) Princeton University(普林斯顿大学) NVIDIA(英伟达) Yale University(耶鲁大学)

AI总结 Dion3是针对Muon优化器开销的改进版本,通过全栈优化降低了正交化、通信等开销,步长时间最多降6倍,可作为Muon的即插即用替代方案。

Comments 37 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14616 2026-08-13 cs.AI cs.CV 版本更新

SportD: How do VLMs physically strategize?

SportD:视觉语言模型能进行物理策略制定吗?

Jasin Cekinmez, Addison J. Wu, Haotian Xia, Kyumin Andrew Shim, Anay Putty, Jinglin Xiao, Zhuohan Liu, Leo Liu, Weining Shen

机构 * Princeton University(普林斯顿大学) Rice University(莱斯大学) UC Irvine(加州大学欧文分校) POSTECH(浦项科技大学) NYU Shanghai(纽约大学上海分校) UC Santa Barbara(加州大学圣塔芭芭拉分校) Zhejiang University(浙江大学)

AI总结 研究视觉语言模型在足球场景中能否进行物理策略制定,引入SportD基准,通过控球价值模型评估模型决策,发现模型表现低于职业球员,有偏好低方差低回报动作等问题,为衡量模型物理策略推理提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28854 2026-08-13 cs.CL cs.LG q-bio.NC 版本更新

Large language models reorganize representational geometry during in-context learning

大型语言模型在上下文学习中重组表征几何结构

Hua-Dong Xiong, Li Ji-An, Robert C. Wilson, Kwonjoon Lee, Xue-Xin Wei

机构 * School of Psychological and Brain Sciences, Georgia Tech(佐治亚理工学院心理与脑科学学院) Department of Psychology, New York University(纽约大学心理学系) Center of Excellence for Computational Cognition, Georgia Tech(佐治亚理工学院计算认知卓越中心) Honda Research Institute(本田研究院) Departments of Neuroscience and Psychology, The University of Texas at Austin(德克萨斯大学奥斯汀分校神经科学与心理学系)

AI总结 研究大型语言模型在上下文学习中的表征几何重组,发现其性能与任务表征结构相关,并通过原型算法动态调整表征以提高可分性。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10791 2026-08-12 cs.RO 新提交

Dual Stress: Runtime Safety Monitoring for Safety-Constrained MPC Navigation

双重应力:安全约束模型预测控制导航的运行时安全监测

Jamil Chahine, Wenqi Cai, John Abanes, Anthony Tzes

机构 * American University of Beirut (AUB)(贝鲁特美国大学) New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校) New York University(纽约大学)

AI总结 本文提出基于MPC约束优化的Karush-Kuhn-Tucker乘子的双重应力信号,将其与15个几何检测器对比,发现其漏检碰撞的补充预警能力显著,结合后可提升制动可行碰撞的预警占比。

Comments 6 pages, 4 figures, 2 tables, submitted to the 13th International Conference on Automation, Robotics and Applications (ICARA 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10196 2026-08-12 cs.LG cs.AI 新提交

ELMER: Evolutionary Language Model that Explores and Refines

ELMER:探索与优化的进化语言模型

Matthew Siper, Ahmed Khalifa, Julian Togelius

机构 * New York University(纽约大学) University of Malta(马耳他大学)

AI总结 本研究提出进化语言模型 ELMER,通过微调 Qwen3-8B 并结合 oDPO 优化,实现自然语言策略搜索与编译,提升进化搜索效率,证明语言可作为可执行程序空间的可引导搜索表示。

Comments Submitted to AAAI Conference 2026, 8 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07581 2026-08-12 cs.CV 版本更新

Cardiac MRI Through-Plane Super-Resolution Guided by Reference and Memory

基于参考和记忆引导的心脏MRI平面内超分辨率

Shaoming Pan, Chenchuhui Hu, Leon Axel, Meng Ye

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) New York University Grossman School of Medicine(纽约大学格罗斯曼医学院)

AI总结 研究针对临床心脏MRI平面间分辨率粗糙的问题,提出STRMSR框架,利用参考视图和中间结果重建高分辨率心脏容积,通过粗到细匹配、动态特征聚合等方法,在WHS数据集实验中,相比基线在不同上采样因子下有一致改进。

Comments 8 pages, 3 figures 2 tables (accepted In International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI) Workshop STACOM, 2026 (oral))

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02319 2026-08-12 cs.CL 版本更新

No Single Best Model for Diversity: Learning a Router for Sample Diversity

没有单一最佳模型用于多样性:学习一个路由器以实现样本多样性

Yuhan Liu, Fangyuan Xu, Vishakh Padmakumar, Daphne Ippolito, Eunsol Choi

机构 * New York University(纽约大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究了如何通过路由器选择最佳模型以生成多样化的响应,发现无单一模型在广泛提示下表现最佳,且在不同数据集上具有泛化能力。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12231 2026-08-12 cs.LG 版本更新

Temporal Straightening for Latent Planning

时间拉直用于隐式规划

Ying Wang, Oumayma Bounou, Gaoyue Zhou, Randall Balestriero, Tim G. J. Rudner, Yann LeCun, Mengye Ren

机构 * New York University(纽约大学) Brown University(布朗大学) University of Toronto(多伦多大学)

AI总结 受人类视觉处理中感知拉直假说启发,提出时间拉直方法,通过曲率正则化联合学习JEPA世界模型的编码器和预测器,改善隐式规划中的表示学习,使梯度规划更稳定并提高目标到达任务成功率。

Comments ICML2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09025 2026-08-11 cs.AI cs.CR stat.ML 新提交

Context Is Not Authority: Structured Runtime Governance for Financial Market Agents

上下文并非权威:面向金融市场智能体的结构化运行时治理

Rui Tang, Qiangqiang Liu, Yichi Zhang, Youwei Wang, Xi Chen, Chen Dong

机构 * OpenAsk Binance(币安) New York University(纽约大学) Xiamen University(厦门大学) Bank of Hebei(河北银行)

AI总结 针对金融智能体可能将正确上下文转化为未经授权影响的问题,提出SAGE-Fin金融领域权限交接合约,通过运行时控制影响保障合规,经测试和实际部署验证了其有效性。

Comments 15 pages, 1 figure, 9 tables. Qiangqiang Liu and Yichi Zhang are corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08904 2026-08-11 cs.CV cs.AI cs.LG 新提交

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

从恢复到骤降:动作后训练如何降低视觉语言模型的深层解码能力

Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou

机构 * New York University(纽约大学) Reflex Université de Montréal(蒙特利尔大学) Maastricht University(马斯特里赫特大学)

AI总结 该研究探究动作后训练对VLM空间理解的影响,发现VLA存在深层解码能力的“基底”差距与“悬崖”骤降,定位其源于深层MLP干扰,消融该模块可恢复多数解码性能。

Comments Accepted to the archival proceedings track of the Embodied Multimodal Reasoning (EMR) Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07742 2026-08-11 cs.CV 新提交

BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试

Saim Rehman, Muhammad Shafique

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22877 2026-08-11 cs.AI cs.HC cs.RO 版本更新

Physical AI Governance: From Theory to Practice Across Life Cycle

物理人工智能治理:跨越生命周期从理论到实践

Wang Yang, Shaobo Wang, Hongxuan Liu, Xiaoran Cai, Yunyu He, Jingzong Zhou, Mengzhong Ma, Yi Yu, Rohit Sharma, Jingjing Fu, Peng Qi

机构 * Case Western Reserve University(凯斯西储大学) Shanghai Jiao Tong University(上海交通大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学) University of California, Riverside(加州大学河滨分校) Nanyang Technological University(南洋理工大学) New York University(纽约大学) Salesforce(Salesforce公司) Harvard University(哈佛大学) Stanford University(斯坦福大学)

AI总结 本文对物理人工智能治理进行全面综述,综合现有原则形成统一框架,提出五阶段生命周期,通过具体实践展示各阶段治理操作,为构建安全可信且符合社会价值的物理人工智能系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16097 2026-08-11 cs.LG cs.AI cs.CL 版本更新

Understanding Reasoning from Pretraining to Post-Training

理解从预训练到训练后阶段的推理

Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov

机构 * New York University(纽约大学) Modal Labs(模态实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学)

AI总结 研究强化学习在大语言模型从预训练到训练后阶段对推理的作用,以国际象棋为测试平台,按标准流程训练模型,发现预训练损失可预测RL后性能,RL奖励曲线斜率与预训练令牌有关,还揭示RL对SFT策略的影响,且在数学领域也有相同模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04273 2026-08-11 cs.AI 版本更新

Human agency in initial human-AI proof formalization workflows

表征初始人机交互的证明形式化工作流

Katherine M. Collins, Simon Frieder, Jonas Bayer, Jacob Loader, Jeck Lim, Peiyang Song, Fabian Zaiser, Lexin Zhou, Shanda Li, Sam Looi, Joshua B. Tenenbaum, Umang Bhatt, Adrian Weller, Jose Hernandez-Orallo, Cameron E. Freer, Valerie Chen, Ilia Sucholutsky

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Cambridge(剑桥大学) Princeton University(普林斯顿大学) University of Oxford(牛津大学) Caltech(加州理工学院) Carnegie Mellon University(卡内基梅隆大学) Universitat Politècnica de València(瓦伦西亚理工大学) New York University(纽约大学)

AI总结 通过混合方法分析,研究人们在形式化证明过程中对AI工具的需求、障碍及实际使用模式,发现AI辅助能提高形式化准确率且用户偏好多样但普遍希望保持人类对证明发现过程的高层控制。

Comments Updated working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31163 2026-08-11 stat.ML cs.LG 版本更新

Memory by Design: Probabilistic Sequence Layers

记忆设计:概率序列层

Matthew Dowling, Hyungju Jeon, Cristina Savin, Il Memming Park

机构 * Champalimaud Research, Champalimaud Foundation, Portugal(恰帕拉马德研究、恰帕拉马德基金会、葡萄牙) Center for Neural Science, New York University, USA(神经科学中心、纽约大学、美国) Center for Data Science, New York University, USA(数据科学中心、纽约大学、美国) RyvivyR Inc., NY, USA(RyvivyR公司、纽约、美国)

AI总结 提出设计-模型框架,通过精确贝叶斯滤波推导高效循环序列映射,线性高斯实例中的贝叶斯层传播均值和协方差以跟踪不确定性,统一多种次二次递归,并提升鲁棒性和长上下文检索。

Comments Preprint, in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00884 2026-08-11 cs.LG 版本更新

Test-time Generalization for Physics through Neural Operator Splitting

通过神经算子分裂实现物理中的测试时泛化

Louis Serrano, Jiequn Han, Edouard Oyallon, Shirley Ho, Rudy Morel

机构 * Flatiron Institute, New York(Flatiron 机构,纽约) New York University(纽约大学) Princeton University(普林斯顿大学) Sorbonne Université, CNRS, ISIR, Paris(索邦大学,CNRS,ISIR,巴黎)

AI总结 本文提出通过神经算子分裂在测试时增强泛化能力,实现零样本泛化并恢复底层PDE参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00367 2026-08-11 cs.CR cs.AI

PatchBlock: A Lightweight Defense Against Adversarial Patches for Embedded EdgeAI Devices

PatchBlock: 一种轻量级对抗性补丁防御方法用于边缘边缘AI设备

Nandish Chattopadhyay, Abdul Basit, Amira Guesmi, Muhammad Abdullah Hanif, Bassem Ouni, Muhammad Shafique

机构 * eBRAIN Lab, Division of Engineering, New York University (NYU) Abu Dhabi, UAE(eBRAIN实验室,工程系,纽约大学(NYU)阿布扎赫德分校) DakAI, Dubai, UAE(DakAI,迪拜,阿联酋)

AI总结 PatchBlock是一种轻量级防御方法,通过异常检测和降维技术有效检测并中和对抗性补丁,提升边缘AI设备的鲁棒性与效率。

Comments 7 pages, 5 figures, 5 tables, Accepted to DATE 2026

Journal ref 2026 Design, Automation & Test in Europe Conference (DATE), Verona, Italy, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21891 2026-08-11 cs.CL cs.AI cs.LG stat.ME stat.ML 版本更新

Embedding Trust: Semantic Isotropy Predicts Nonfactuality in Long-Form Text Generation

嵌入信任:语义各向同性预测长文本生成中的非事实性

Dhrupad Bhardwaj, Julia Kempe, Tim G. J. Rudner

机构 * New York University(纽约大学) University of Toronto(多伦多大学)

AI总结 该研究提出通过语义各向同性(单位球面上归一化文本嵌入的均匀程度)评估LLMs生成长文本的可信度,其方法无需标注数据等,在多领域仅用少量样本预测非事实性的表现优于现有信号。

Comments Published in Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19990 2026-08-11 cs.LG 版本更新

Rethinking Reasoning with MDLMs: Early Exits, Post-hoc Reasoning, and Beyond

重新思考MDLM的推理:早期退出、事后推理及其他

Zachary Horvitz, Raghav Singhal, Hao Zou, Carles Domingo-Enrich, Zhou Yu, Rajesh Ranganath, Kathleen McKeown

机构 * Columbia University(哥伦比亚大学) Department of Computer Science, New York University(纽约大学计算机科学系) Microsoft Research(微软研究院) Center for Data Science, New York University(纽约大学数据科学中心)

AI总结 本文提出“推理即填充”技术,基于掩码扩散语言模型(MDLMs)实现早期退出、事后推理等能力,在GSM8k数据集上微调LLaDA-8B-Base提升准确率14.9%,证明MDLM训练目标对推理有显著优势。

Comments COLM 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06769 2026-08-10 cs.CV 新提交

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

GraphVerse:面向多模态大语言模型的综合性视觉图推理基准

Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

机构 * New York University(纽约大学) Sensetime Research(商汤科技研究院) Tsinghua University(清华大学) New York University Shanghai(上海纽约大学) University of Georgia(佐治亚大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24769 2026-08-10 math.NA cs.LG cs.NA 版本更新

Dirac-Frenkel dynamics with inertia for nonlinearly parametrized solutions of evolution problems

带惯性的Dirac-Frenkel动力学用于演化问题的非线性参数化解

Matteo Raviola, Benjamin Peherstorfer

机构 * Scientific Computing and Uncertainty Quantification - CADMOS Chair, EPFL(科学计算与不确定性量化——CADMOS Chair,EPFL) Courant Institute of Mathematical Sciences, New York University(数学科学学院,纽约大学)

AI总结 针对冗余非线性参数化(如神经网络或混合模型)导致的参数动力学非唯一或病态问题,提出在Dirac-Frenkel动力学中加入惯性,使弱信息方向保留历史速度,强信息方向保持原动力学,证明良定性并给出后验误差界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06793 2026-08-10 cs.LG cs.AI 版本更新

Minimal Ingredients for Reward Assignment from Expert Demonstrations

从专家演示中进行奖励分配的最小要素

Zixuan Dong, Yumi Omori, Keith Ross

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎赫尔分校) Shanghai Frontiers Science Center of Artificial Intelligence and Deep Learning, NYU Shanghai(上海前沿科学中心(人工智能与深度学习))

AI总结 该研究探究从专家演示分配奖励的最小结构,通过32个基准测试和三种下游RL算法,发现离线场景仅需接近度,在线或多演示时需轻量级时间对应,倡导奖励设计的算法极简主义。

Comments Accepted by Reinforcement Learning Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏