Near-Optimal Sample Complexity for Online Constrained MDPs
在线约束马尔可夫决策过程的近最优样本复杂度
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 本文提出了一种基于模型的对偶算法,解决了在线约束马尔可夫决策过程的安全性问题,证明了在允许小规模违规的情况下,算法能以近最优样本复杂度生成安全策略。
Journal ref NeurIPS 2025
高校专区
在线约束马尔可夫决策过程的近最优样本复杂度
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 本文提出了一种基于模型的对偶算法,解决了在线约束马尔可夫决策过程的安全性问题,证明了在允许小规模违规的情况下,算法能以近最优样本复杂度生成安全策略。
Journal ref NeurIPS 2025
SIGMUS:多模态城市空间中知识图谱的语义整合
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 SIGMUS通过大型语言模型实现多模态城市数据的自动语义整合,构建知识图谱以连接不同数据源与事件关系。
Comments 9 pages, accepted at UrbComp 2025 KDD 2025
语言模型中推理的算法原语与组合几何
机构 * Microsoft Research NYC(微软研究院纽约分部) ; Center for Theoretical Neuroscience(理论神经科学中心) ; Department of Psychology(心理学系) ; University of California Los Angeles(加州大学洛杉矶分校) ; Institute for Pure and Applied Mathematics(纯粹与应用数学研究所) ; Emory University(埃默里大学) ; Rice University(里士满大学) ; Mount Holyoke College(马里兰霍克学院) ; Technische Universität Berlin(柏林技术大学) ; BIFOLD-Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)
AI总结 研究通过分析语言模型中的算法原语,揭示其推理过程的组合几何结构,并展示原语在跨任务和跨模型中的可迁移性。
稀疏MeZO:在零阶LLM微调中更少的参数带来更好的性能
机构 * National University of Singapore(新加坡国立大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 稀疏MeZO通过仅对部分参数应用零阶优化,提升LLM微调的性能和收敛速度。
Comments Accepted by NeurIPS 2025
LACONIC:面向LLM的长度感知约束强化学习
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Salesforce AI Research(Salesforce AI研究院) ; National University of Singapore(新加坡国立大学) ; University of Alberta(阿尔伯塔大学)
AI总结 LACONIC通过长度感知约束强化学习,在保持任务性能的同时有效控制输出长度,减少50%以上。
少训练,多学习:基于群体的强化学习中的自适应高效回滚优化
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Amazon Web Services(亚马逊网络服务)
AI总结 AERO通过自适应回滚策略和选择性拒绝提升群体强化学习的计算效率,减少48%的训练计算并缩短45%的训练时间,同时保持或提升性能。
选择如何记忆:面向LLM代理的自适应记忆结构
机构 * University of Technology Sydney(悉尼大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; The University of Melbourne(墨尔本大学)
AI总结 本文提出FluxMem框架,通过自适应记忆结构选择和三级记忆层次结构,提升LLM代理在长时间交互中的表现,实验显示平均提升9.18%和6.14%。
启发式方法是提炼MLP用于图链接预测的良好教师
机构 * University of California Los Angeles(加州大学洛杉矶分校) ; Harvard University(哈佛大学) ; Snap Inc.(Snap公司)
AI总结 本文提出EHDM方法,通过启发式方法提炼MLP,有效提升图链接预测性能并降低训练成本。
基于场景图的LLM定位再规划集成探索与顺序操作
机构 * Beihang University(北航大学) ; State Key Laboratory of General Artificial Intelligence(一般人工智能国家重点实验室) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
AI总结 EPoG通过结合基于图的全局规划器与LLM的定位局部规划器,实现探索与顺序操作规划的无缝结合,有效提升机器人在部分已知环境中的任务执行效率。
Comments 8 pages, 7 figures; accepted by ICRA 2026
多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答
机构 * UCLA Computer Science(UCLA计算机科学系) ; UCSF Radiology(UCSF放射学) ; UCLA Medicine(UCLA医学)
AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。
Comments 17 pages, 3 figures
人工智能时代创意所有权
机构 * Department of Economics, Northwestern(西北大学经济系) ; Department of Economics, UCLA(加州大学洛杉矶分校经济系)
AI总结 本文提出基于生成式AI创作过程分布特性,定义侵权判定标准,并揭示轻尾与重尾分布对AI生成监管的影响差异。
通过专家(去)激活引导MoE LLMs
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Adobe Research(Adobe研究) ; CIS, LMU Munich(慕尼黑大学计算机学院) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
AI总结 SteerMoE通过激活或去激活特定专家,在不微调的情况下提升LLM的安全性和忠实性,同时揭示了MoE模型的潜在漏洞。
Comments ICLR 2026
MapVerse:一个用于在多样化真实世界地图上进行地理问答的基准测试
机构 * University of Southern California(南加州大学) ; University of California Los Angeles(加州大学洛杉矶分校) ; University of Utah(犹他大学) ; Arizona State University(亚利桑那州立大学)
AI总结 MapVerse是一个基于真实世界地图的大规模基准测试,用于评估地理问答任务中的多模态推理能力,揭示了当前VLMs在复杂空间推理任务上的不足。
从偏好到偏见:对齐调谐在视频扩散模型中塑造社会偏见的作用
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, San Diego(加州大学圣地亚哥分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Microsoft(微软公司)
AI总结 本文研究了对齐调谐在视频扩散模型中如何塑造社会偏见,提出VideoBiasEval框架以评估和缓解偏见,揭示了对齐调谐使偏见更稳定且刻板化的现象。
Comments TMLR
MME-Emotion:多模态大语言模型情感智能的综合评估基准
机构 * The Chinese University of Hong Kong(香港中文大学) ; Tongyi Lab(通义实验室) ; SZTU(深圳技术大学) ; Peking University(北京大学) ; Tongji University(同济大学) ; CASIA(中国科学院自动化所) ; Tencent(腾讯) ; UCLA(加州大学洛杉矶分校) ; Westlake University(西湖大学) ; NTU(国立大学)
AI总结 MME-Emotion是首个评估多模态大语言模型情感智能的综合基准,揭示当前模型在情感识别和推理上的不足,并通过多智能体框架提供混合指标分析。
利用通用边界条件求解偏微分方程的深度神经网络
机构 * Department of Electrical and Computer Engineering, University of California, Los Angeles(电气与计算机工程系,加州大学洛杉矶分校)
AI总结 本文提出了一种扩展的TENG框架,通过整合自然梯度优化与数值时间推进方案,精确解决狄利克雷边界条件的PDEs问题,并展示了其在热方程中的高精度与高效性。
Comments 7 pages, 2 figures
学习可 tractable 的语言模型延续分布
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of California, San Diego(加州大学圣地亚哥分校) ; National University of Singapore(新加坡国立大学)
AI总结 LTLA通过结合神经网络和隐马尔可夫模型,提高语言模型延续的可 tractable 性,实现更高效的解码和更强的约束控制。
为何策略梯度算法适用于未折扣总奖励MDP
机构 * Seoul National University, Department of Mathematical Sciences(首尔国立大学数学科学系) ; UCLA, Department of Mathematics(加州大学洛杉矶分校数学系)
AI总结 本文探讨了为何策略梯度算法在未折扣总奖励MDP中有效,通过状态分类和暂态访问度量的分析,解决了γ=1时的收敛问题。
MILR:通过测试时潜在推理改进多模态图像生成
机构 * University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 MILR通过测试时潜在推理提升多模态图像生成性能,实现跨模态推理和统一潜在空间优化。
Comments 21 pages,14 figures,9 tables
通过掩码增强数据学习因果概率
机构 * Florida State University(佛罗里达州立大学) ; University of California Los Angeles(加州大学洛杉矶分校)
AI总结 本文提出Exact-MLP和Mask-MLP模型,通过掩码增强数据学习因果概率,显著提升PNS界估计的准确性。
Comments arXiv admin note: text overlap with arXiv:2502.08858
接触锚定策略:接触条件创造强大的机器人效用模型
机构 * New York University(纽约大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Hello Robot Inc.(Hello Robot公司) ; Ai2 ; University of Waterloo(滑铁卢大学)
AI总结 接触锚定策略通过接触条件实现强大的机器人效用模型,仅用23小时演示数据即在三种基本操作技能上实现跨环境泛化,并在零样本评估中超越现有最先进方法56%。
用恒星进行推理:一个用于代理科学推理的太阳物理数据集和基准
机构 * Frontier Development Lab(前沿发展实验室) ; Department of Mechanical and Aerospace Engineering, UCLA(机械与航空航天工程系,加州大学洛杉矶分校) ; Trillium Technologies Inc.(Trillium技术公司) ; Department of Engineering, University of Cambridge(工程系,剑桥大学)
AI总结 本研究提出一个太阳物理数据集和基准,用于评估代理在科学推理中的表现,发现系统工程原则在演绎推理任务中优于直接提示方法。
Comments Accepted at NeurIPS 2025 Machine Learning and the Physical Sciences (ML4PS) Workshop. Dataset: https://huggingface.co/datasets/SpaceML/ReasoningWithAStar
梯度下降与大步长:混沌与分形收敛区域
机构 * UCLA(加州大学洛杉矶分校) ; MPI MiS(马克斯·普朗克研究所(MiS))
AI总结 研究揭示了大步长梯度下降在矩阵分解中导致混沌行为,临界步长下训练结果不可预测且无传统隐含偏置。
密度感知最远点采样
机构 * Institute for Numerical Simulation, University of Bonn, Germany(波恩大学数值模拟研究所) ; Department of Mathematics, University of California, Los Angeles, USA(加州大学洛杉矶分校数学系) ; Fraunhofer SCAI, Sankt Augustin, Germany(弗劳恩霍夫SCAI研究所) ; University of Bonn(波恩大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 本文提出了一种基于密度感知的最远点采样方法,通过优化加权填充距离来减少回归模型的预测误差。
Comments 14 pages, 2 figures
单索引老虎机:具有未知奖励函数的广义线性上下文老虎机
机构 * Microsoft(微软公司) ; University of California, Davis(加州大学戴维斯分校) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出单索引老虎机问题,针对未知奖励函数设计STOR和ESTOR算法,实现近最优遗憾界,并在高维稀疏环境下验证算法有效性。
Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)
通过上下文操作符网络解决最优执行问题
机构 * University of California Los Angeles(加州大学洛杉矶分校) ; Heinrich Heine University Düsseldorf(杜伊斯堡-埃森大学)
AI总结 本文提出ICON-OCnet架构,通过上下文学习解决未知价格影响下的最优订单执行问题,结合预训练与少量示例推断,实现高效策略学习。
Comments 27 pages, 11 figures
通过RoadSafe365基准理解现实世界交通安全
机构 * Auburn University(阿伯拉罕大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Harvard Medical School(哈佛医学院) ; The University of Iowa(爱荷华大学)
AI总结 RoadSafe365通过细粒度分析和多模态数据集提升现实交通安全研究的可重复性与有效性。
基于潜在思维向量的推理时间重新思考用于数学推理
机构 * Department of Statistics and Data Science, UCLA(统计与数据科学系, UCLA) ; Lambda Inc(Lambda公司) ; Tsinghua University(清华大学) ; Salesforce Research(Salesforce研究)
AI总结 本文提出基于潜在思维向量的推理时间重新思考框架,通过迭代自我纠正提升数学推理能力,实验证明其在GSM8K数据集上优于基线模型。
数据集蒸馏作为推前最优量化
机构 * UCLA University of Cambridge(加州大学洛杉矶分校剑桥大学) ; Tangram Therapeutics
AI总结 本文提出基于最优量化的数据集蒸馏方法,通过潜在空间聚类提升ImageNet-1K数据集的蒸馏性能,优于现有SOTA方法。
Comments ICLR 2026, https://openreview.net/forum?id=FMSp8AUF3m
矩阵和张量估计中的最优偏差-方差权衡
机构 * Booth School of Business, University of Chicago(芝加哥大学商学院) ; Department of ACMS, University of Notre Dame(诺特难大学ACMS系) ; Department of Mathematics and Statistics, Auburn University(阿伯茨伦大学数学与统计学系) ; Department of Statistics and Data Science, Washington University in Saint Louis(圣路易斯华盛顿大学统计学与数据科学系) ; Department of Statistics, University of California, Los Angeles(加州大学洛杉矶分校统计学系) ; Department of Mathematics, University of California, San Diego(加州大学圣地亚哥分校数学系)
AI总结 本文提出了一种改进的高阶SVD估计器,研究了矩阵和张量估计中的最优偏差-方差权衡,证明了其在不同秩下的性能表现,并展示了结果的最优性。