arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Pennsylvania(宾夕法尼亚大学)

共收录 961
2605.28111 2026-05-28 cs.LG

Chreode: A Cell World Model for One-Step Temporal Dynamics and Perturbation Prediction

Chreode: 用于一步时间动态和扰动预测的细胞世界模型

Mufan Qiu, Genhui Zheng, Yinuo Xu, Ruichen Zhang, Ying Ding, Qi Long, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出Chreode,一种基于结构化残差转移算子的单步细胞世界模型,通过预训练和微调实现发育轨迹与扰动预测的统一,在多个基准上取得性能提升。

Comments 25 pages, 3 figures, 14 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28101 2026-05-28 cs.SD cs.AI cs.MM

EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction

EigeNet:几何信息引导的多模态学习用于少样本新视角RIR预测

Chong Jing, Zitong Lan, Junan Zhang, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出EIGENET框架,通过跨视角交替注意力Transformer和几何信息调制块,结合多任务学习,实现少样本新视角房间脉冲响应预测,达到最先进性能。

Comments Code available on https://github.com/FEAfeatherTHER/EigeNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27919 2026-05-28 cs.RO cs.LG

Frequency-Guided Action Diffusion via Sub-Frequency Manifold Traversal

通过子频率流形遍历的频率引导动作扩散

Junlin Wang

机构 * School of Engineering and Applied Science University of Pennsylvania(工程与应用科学学院 费城大学)

AI总结 提出频率引导算子(FGO),通过子频率流形逐步引导扩散策略生成平滑动作,在15个机器人操作任务上提升了动作平滑性和时间一致性。

Comments A preprint version of FGO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27794 2026-05-28 stat.ML cs.LG stat.ME

Learning to target with network interference

在网络干扰下学习目标定位

Xiaomeng Wang, Hamsa Bastani, Osbert Bastani, Zhimei Ren

机构 * Department of Statistics and Data Science, University of Pennsylvania(统计与数据科学系,宾夕法尼亚大学) Operations, Information and Decisions Department, University of Pennsylvania(运营、信息与决策系,宾夕法尼亚大学) Department of Computer and Information Science, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学)

AI总结 研究在bandit设置下网络干扰中的自适应目标定位,通过线性模型和稀疏假设,针对不同干扰结构知识水平提出近最优遗憾算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27649 2026-05-28 cs.CL cs.LG

Disentangling Language Roles in Multilingual LLM Task Execution

多语言大模型任务执行中的语言角色解耦

Qishi Zhan, Minxuan Hu, Seoyeon Jang, Lei Zhao, Ziheng Chen, Man Liang, Xinyue Xiang, Jiaxin Liu, Guansu Wang, Liang He

机构 * Marquette(马凯特大学) Cornell(康奈尔大学) UC San Diego(南加州大学圣地亚哥分校) UPenn(普林斯顿大学) UT Austin(德克萨斯大学奥斯汀分校) Maryland(马里兰大学) Michigan(密歇根大学) UIUC(伊利诺伊大学香槟分校) Melbourne(墨尔本大学) Stanford(斯坦福大学)

AI总结 提出MTM-Bench基准,通过完全交叉设计解耦指令、内容和响应三种语言角色,评估多语言LLM的任务执行能力,发现响应语言角色是性能下降的主要因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05333 2026-05-28 cs.AI

Graph-of-Skills: Dependency-Aware Structural Retrieval for Massive Agent Skills

技能图谱:面向大规模智能体技能的依赖感知结构检索

Dawei Liu, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Maryland(马里兰大学) Brown University(布朗大学) Carnegie Mellon University(卡内基梅隆大学) Lehigh University(莱斯大学)

AI总结 提出技能图谱(GoS),一种推理时的结构检索层,通过构建可执行技能图并利用混合语义-词汇种子、反向感知个性化PageRank和上下文预算水合,实现依赖感知的技能束检索,在SkillsBench和ALFWorld上显著提升奖励并节省令牌。

Comments 11 pages of main text, 12 pages of appendix. Core contribution by Dawei Liu and Zongxia Li. Project page: https://github.com/davidliuk/graph-of-skills

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03799 2026-05-28 cs.CV

Next-Scale Autoregressive Models for Text-to-Motion Generation

Next-Scale 自回归模型用于文本到运动生成

Zhiwei Zheng, Shibo Jin, Lingjie Liu, Mingmin Zhao

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出 MoScale 框架,通过从粗到细的时间分辨率分层生成运动,结合跨尺度和尺度内细化,实现高效、可扩展的文本到运动生成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03534 2026-05-28 cs.MA cs.LG cs.SY eess.SY stat.ML

Long-Term Mapping of the Douro River Plume with Multi-Agent Reinforcement Learning

基于多智能体强化学习的杜罗河羽流长期映射

Nicolò Dal Fabbro, Milad Mesbahi, Renato Mendes, João Borges de Sousa, George J. Pappas

机构 * University of Pennsylvania(宾夕法尼亚大学) Faculdade de Engenharia da Universidade do Porto(波尔图大学工程学院) Laboratório de Sistemas e Tecnologia Subaquática (LSTS)(水下系统与技术实验室) Laboratório Associado de Energia, Transportes e Aeronáutica (LAETA)(能源、运输与航空联合实验室)

AI总结 提出一种能量与通信高效的多智能体强化学习方法,结合时空高斯过程回归与多头Q网络控制器,实现多艘自主水下航行器对杜罗河羽流的长期(多天)映射,在Delft3D模拟中优于基准方法,且增加智能体数量可提升精度与续航。

Comments Accepted at the 2026 IEEE International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04382 2026-05-28 stat.ML cs.LG

Structure of Classifier Boundaries: Case Study for a Naive Bayes Classifier

分类器边界的结构:朴素贝叶斯分类器的案例研究

Alan F. Karr, Zac Bowen, Adam A. Porter, Regina Ruane

机构 * Temple University, Department of Statistics, Operations, and Data Science(特拉华大学统计学、运营与数据科学系) Fraunhofer USA Center Mid-Atlantic(弗劳恩霍夫美国中大西洋中心) University of Maryland, Department of Computer Science(马里兰大学计算机科学系) University of Pennsylvania, Computational Social Science Laboratory(宾夕法尼亚大学计算社会科学实验室)

AI总结 研究贝叶斯分类器在输入空间为图时的边界结构,通过邻域相似性度量分类不确定性,并应用于DNA读段分配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27190 2026-05-27 cs.CL cs.AI cs.LG cs.SD

Learning When to Think While Listening in Large Audio-Language Models

在大音频语言模型中学习何时在聆听时思考

Zhiyuan Song, Weici Zhao, Yang Xiao, Suhao Yu, Cheng Zhu, Jiatao Gu

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出一种可学习的等待-思考-回答控制机制,通过多奖励强化学习优化大音频语言模型在流式语音交互中的推理时机,在提升准确率的同时减少响应延迟。

Comments 19 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26636 2026-05-27 cs.CV cs.AI

JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search

JetViT: 高效高分辨率视觉Transformer与训练后注意力搜索

Dongyun Zou, Zhuoyang Zhang, Junyu Chen, Wenkun He, Qinhe Peng, Hanrong Ye, Yao Lu, Hongxu Yin, Yu Wang, Song Han, Han Cai

机构 * MIT(麻省理工学院) University of Pennsylvania(宾夕法尼亚大学) NVIDIA(NVIDIA公司) Physical Intelligence(物理智能)

AI总结 提出JetViT混合架构视觉Transformer,通过训练后注意力搜索将预训练全注意力ViT转换为高效混合注意力变体,在高分辨率图像上实现更高推理效率且不损失精度。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08600 2026-05-27 cs.CL

NSF-SciFy: Mining the NSF Awards Database for Scientific Claims

NSF-SciFy:从NSF资助数据库中挖掘科学主张

Delip Rao, Weiqiu You, Eric Wong, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出NSF-SciFy数据集,从40万篇NSF摘要中提取280万条科学主张,通过零样本提示联合提取主张和研究提案,并在三个下游任务中微调语言模型取得显著提升。

Comments ACL 2026. 19 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25949 2026-05-26 cs.LG cs.AI physics.comp-ph

Small Models, Strong Priors: Architectural Inductive Bias for Parameter-Efficient Neural PDE Solvers

小模型,强先验:参数高效神经PDE求解器的架构归纳偏置

Shyam Sankaran, Hanwen Wang, Paris Perdikaris

机构 * Department of Mechanical Engineering and Applied Mechanics, University of Pennsylvania(宾夕法尼亚大学机械工程与应用力学系)

AI总结 提出WaveLiT架构,通过小模型(1-10M参数)利用小波多尺度先验实现参数高效,在多个PDE基准上媲美大100-1000倍的基础模型,并揭示先验失败模式可提供有用信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22894 2026-05-26 cs.GR cs.LG cs.RO

SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control

SCRIPT: 面向语言驱动的物理仿真人体控制的可扩展扩散策略与多阶段训练

Jingyan Zhang, Han Liang, Ruichi Zhang, Bin Li, Juze Zhang, Xin Chen, Jingya Wang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学)

AI总结 提出SCRIPT框架,通过联合动作-状态-文本扩散Transformer和多阶段训练(监督模仿预训练+混合奖励强化学习后训练),实现语言指令驱动的物理仿真人体控制,在文本对齐、运动质量和物理真实性上超越现有方法。

Comments Project page: https://zhanglele12138.github.io/SCRIPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25172 2026-05-26 stat.AP cs.DL cs.LG

Rejoinder: The ICML 2023 Ranking Experiment: Examining Author Self-Assessment in ML/AI Peer Review

回复:ICML 2023 排名实验:审视机器学习/人工智能同行评审中的作者自我评估

Buxin Su, Jiayao Zhang, Natalie Collina, Yuling Yan, Didong Li, Kyunghyun Cho, Jianqing Fan, Aaron Roth, Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) New York University(纽约大学) Princeton University(普林斯顿大学) Associate Chair of ICML 2023(ICML 2023 associate chair) Program Chair of ICML 2023(ICML 2023 program chair)

AI总结 本文回应了关于ICML 2023排名实验的讨论,将同行评审视为统计估计问题,探讨了等渗机制的公平性与策略问题,并提出了结合审稿人排名和生成式AI时代以人为中心的评审框架。

Comments Rejoinder to the JASA Discussion of "The ICML 2023 Ranking Experiment: Examining Author Self-Assessment in ML/AI Peer Review" (arXiv:2408.13430)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24364 2026-05-26 stat.ML cs.LG

Multicalibration Boosting: Theory, Convergence, and Transferability

多校准提升:理论、收敛性和可迁移性

Hanxuan Ye, Hongzhe Li

机构 * Department of Biostatistics and Epidemiology(生物统计学与流行病学系) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文统一了多校准提升(MCBoost)的理论框架,揭示了校准-风险权衡,并建立了在弱假设下的收敛率、有限样本保证和协变量偏移下的迁移性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24331 2026-05-26 cs.LG stat.ML

CurveRL: Principled Distribution-Aware Context Reweighting for LLM Reasoning

CurveRL: 用于LLM推理的基于分布感知的上下文重加权原则

Ke Sun, Yizhou Zhao, Jiayi Xin, Qi Long, Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出CurveRL方法,通过分位数坐标变换实现分布感知的提示重加权,在RLVR框架下统一优化理论并显著提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24159 2026-05-26 cs.CV

EchoVQA: Enabling Conversational Assistance for Point-of-Care Cardiac Ultrasound

EchoVQA:为床旁心脏超声提供对话式辅助

Filippos Bellos, Yutong Li, Jessie N Dong, Zaiyang Guo, Emily Mackay, Yayuan Li, Yannis Avrithis, Alison Pouch, Jason J. Corso

机构 * University of Michigan(密歇根大学) University of Pennsylvania(宾夕法尼亚大学) Independent Scientist(独立科学家)

AI总结 针对床旁心脏超声图像获取与解读依赖专业知识的问题,提出首个大规模超声心动图VQA数据集EchoVQA(含14,299张图像和74,819个问答对),并开发基于多模态可学习提示的参数高效方法,在多数基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20192 2026-05-25 cs.CL cs.CE cs.CR cs.CY q-fin.CP

Leveraging Large Language Models for Sentiment Analysis: Multi-Modal Analysis of Decentraland's MANA Token

利用大语言模型进行情感分析:Decentraland的MANA代币多模态分析

Xintong Wu, Peiting Tsai, Jing Yuan, Michael Yu, Greg Sun, Luyao Zhang

机构 * University of Pennsylvania(宾夕法尼亚大学) Microsoft(微软) Duke Kunshan University(杜克昆山大学)

AI总结 本研究利用基于BERT的大语言模型对Decentraland的Discord社区进行情感分析,并结合多模态金融数据(历史价格、情感分数、交易量和市值)构建LSTM模型,发现多模态模型在MANA代币回报预测中显著优于仅基于价格的基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17767 2026-05-25 stat.ML cs.LG

Feature Learning in Linear-Width Two-Layer Networks: Two vs. One Step of Gradient Descent

线性宽度双层网络中的特征学习:梯度下降的两步 vs 一步

Behrad Moniri, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文研究线性宽度双层网络中梯度下降两步更新的特征学习,通过谱分析刻画权重更新为多离群点的尖峰随机矩阵,并揭示批重用相对于独立批在捕获高信息指数方向上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22722 2026-05-22 cs.RO cs.SY eess.SY

N3P: Accelerated Automated Parking via a Learning-Based Naturalistic Three-Stage Scheme

N3P:通过基于学习的自然三阶段方案实现加速的自动泊车

Yifan Xue, Toktam Mohammadnejad, Faizan M Tariq, Sangjae Bae, David Isele, Yosuke Sakamoto, Nadia Figueroa, Jovin D'sa

机构 * Honda Research Institute (HRI)(本田研究院) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出N3P,一种基于学习的三阶段框架,用于自动泊车,通过引入中间预备姿态和学习模块预测该姿态,将泊车操作分解为更简单的子问题,从而降低计算复杂度并加速路径生成,实验表明其在垂直和平行泊车场景中显著提升了规划速度,并在成功率和轨迹质量上优于强化学习基线。

Comments Accepted at IEEE Intelligent Transportation Systems Conference (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21214 2026-05-22 cs.LG cs.AI

Behavior-Consistent Deep Reinforcement Learning

行为一致的深度强化学习

Marcel Hussing, Liv G. d'Aliberti, Claas Voelcker, Benjamin Eysenbach, Eric Eaton

机构 * University of Pennsylvania(宾夕法尼亚大学) Princeton University(普林斯顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出了一种行为一致的深度强化学习方法,通过控制策略的分布相似性来减少跨训练运行的策略分歧,从而提高稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13822 2026-05-22 stat.ML cs.LG

Uncertainty quantification for Markov chain induced martingales with application to temporal difference learning

马尔可夫链诱导的martingales的不确定性量化及其在时间差学习中的应用

Weichen Wu, Yuting Wei, Alessandro Rinaldo

机构 * The Voleon Group(Voleon集团) Department of Statistics and Data Science, The Wharton School, University of Pennsylvania(统计与数据科学系,沃顿商学院,宾夕法尼亚大学) Department of Statistics and Data Sciences, University of Texas(统计与数据科学系,德克萨斯大学)

AI总结 本文提出了一种新的高维集中不等式和Berry-Esseen界,用于分析由马尔可夫链诱导的向量martingales,并将其应用于时间差学习算法的性能分析,得到了与渐近方差相符的高概率一致性保证,并建立了Gaussian近似的时间差估计器的分布收敛速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08872 2026-05-22 cs.LG cond-mat.dis-nn cond-mat.stat-mech

How does Chain of Thought decompose complex tasks?

链式思维如何分解复杂任务?

Amrut Nadgir, Vijay Balasubramanian, Pratik Chaudhari

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文研究了链式思维在复杂任务分解中的作用,发现通过将任务分解为多个小分类问题可以显著降低预测误差,并确定了分解深度的最优阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22508 2026-05-22 cs.RO cs.SY eess.SY

Parallel OctoMapping: A Scalable Framework for Enhanced Path Planning in Autonomous Navigation

并行八叉树映射:一种用于自主导航中路径规划增强的可扩展框架

Yihui Mao, Tian Tan, Xuehui Shen, Warren E. Dixon, Rushikesh Kamalapurkar

机构 * Department of Mechanical and Aerospace Engineering, University of Florida(佛罗里达大学机械与航空航天工程系) Department of Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系)

AI总结 本文提出并行八叉树映射(POMP),一种高效的基于八叉树的映射技术,通过在固定占用网格分辨率下优化自由空间表示,提升路径规划效率和成功率,特别是在复杂环境中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20625 2026-05-21 eess.SY cs.MA cs.RO cs.SY

Time-To-Reach Separation and Safety Filtering for Safe, Fair, and Efficient Multi-Agent Coordination

时间到达分离与安全过滤用于安全、公平和高效的多智能体协调

Matthew Low, Jasmine Jerry Aloor, Victoria Marie Tuck, Pierluigi Nuzzo, Jason J. Choi

机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(麻省理工学院航空与航天系) GRASP Laboratory, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) Department of Electrical and Computer Engineering, University of California, Los Angeles(加州大学洛杉矶分校电子与计算机工程系)

AI总结 本文提出了一种多智能体协调框架,利用最小时间到达(TTR)作为统一指标用于优先级分配、时间分离和安全过滤,以协调多个空中车辆进入空中走廊并保持车辆间安全分离。

Comments 9 pages, 3 figures. Extended version (including appendix) of a paper submitted to the 65th IEEE Conf. on Decision and Control (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15305 2026-05-21 cs.GR cs.LG

WorldParticle: Unified World Simulation of Lagrangian Particle Dynamics via Transformer

WorldParticle:通过Transformer实现拉格朗日粒子动力学的统一世界模拟

Caoliwen Wang, Minghao Guo, Siyuan Chen, Heng Zhang, Mengdi Wang, Xingyu Ni, Hanson Sun, Kunyi Wang, Zherong Pan, Kui Wu, Lingjie Liu, Yin Yang, Chenfanfu Jiang, Taku Komura, Wojciech Matusik, Peter Yichen Chen

机构 * University of British Columbia(不列颠哥伦比亚大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Georgia Institute of Technology(佐治亚理工学院) Inria(法国国家信息与自动化技术研究院) Meta Independent Researcher(独立研究者) University of Pennsylvania(宾夕法尼亚大学) University of Utah(犹他大学) University of California Los Angeles(加州大学洛杉矶分校) University of Hong Kong(香港大学)

AI总结 本文提出基于Transformer架构的粒子模拟器,能够统一模拟布料、弹性固体、牛顿流体、非牛顿流体、颗粒材料和分子动力学等不同物理现象,通过预测-校正设计和粒子表示,实现高效的模拟与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06862 2026-05-21 cs.CV

Parameters as Experts: Adapting Vision Models with Dynamic Parameter Routing

参数作为专家:通过动态参数路由适应视觉模型

Meng Lou, Stanley Yu, Yizhou Yu

机构 * The University of Hong Kong(香港大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出ParaX方法,通过动态参数路由机制实现视觉模型的高效微调,以生成更定制化和强大的特征表示,从而在多种视觉识别任务中取得优越性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26627 2026-05-21 cs.AI cs.LG cs.RO

TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance

TimeRewarder: 通过帧间时间距离从被动视频中学习密集奖励

Yuyang Liu, Chuan Wen, Yihang Hu, Dinesh Jayaraman, Yang Gao

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Jiao Tong University(上海交通大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出TimeRewarder方法,通过帧间时间距离从被动视频中学习密集奖励,以提升强化学习在稀疏奖励任务中的性能,实验表明其在多个任务中显著提高了成功率和样本效率。

Comments ICML 2026 spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20314 2026-05-21 cs.LG cs.AI

Less Data, Faster Training: repeating smaller datasets speeds up learning via sampling biases

数据更少,训练更快:重复较小的数据集通过采样偏差加速学习

Jingwen Liu, Ezra Edelman, Surbhi Goel, Bingbin Liu

机构 * Columbia University(哥伦比亚大学) University of Pennsylvania(宾夕法尼亚大学) Harvard University(哈佛大学)

AI总结 研究探讨了'小数据与大数据差距'现象,即使用更少样本重复训练比使用更大数据集更节省计算资源,通过层间增长和采样偏差机制实现加速,为优化提供了新的归纳偏差。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏