arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Transactions on Machine Learning Research · 期刊 · Machine Learning

2026-03-24 至 2026-03-24 共收录 8
2512.00021 2026-03-24 cs.RO cs.CV

Foundation Models for Trajectory Planning in Autonomous Driving: A Review of Progress and Open Challenges

自动驾驶轨迹规划中的基础模型:进展与开放挑战综述

Kemal Oksuz, Alexandru Buburuzan, Anthony Knittel, Yuhan Yao, Puneet K. Dokania

机构 * Five AI Ltd.(Five AI有限公司) Robert Bosch GmbH(罗伯特·博世有限公司) United Kingdom(英国)

AI总结 本文综述了自动驾驶中基于基础模型的轨迹规划方法,分析了其架构设计、方法优势及局限性,并评估了37种最新方法的代码和数据集开放性。

Comments Accepted to TMLR (Survey Certification)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04058 2026-03-24 cs.LG

Unlearning in Diffusion models under Data Constraints: A Variational Inference Approach

在数据约束下扩散模型的卸载:一种变分推断方法

Subhodip Panda, Varun M S, Shreyans Jain, Sarthak Kumar Maharana, Prathosh A. P

机构 * Department of ECE, Indian Institute of Science(印度科学研究院电子工程系)

AI总结 本文提出变分扩散卸载方法,用于在数据受限条件下防止预训练扩散模型生成不良内容,通过优化损失函数中的可塑性诱导器和稳定性正则化器来提高效率。

Journal ref Transaction on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09686 2026-03-24 cs.LG

The Cost of Replicability in Active Learning

主动学习中可重复性的成本

Rupkatha Hira, Dominik Kau, Jessica Sorrell

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学) Penn Institute for Computational Science(宾夕法尼亚大学计算科学研究所)

AI总结 本文研究了主动学习中可重复性带来的样本复杂性增加,提出两种可重复的主动学习算法,在保证一致性的同时实现标签节省。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20642 2026-03-24 cs.CL cs.AI

Weber's Law in Transformer Magnitude Representations: Efficient Coding, Representational Geometry, and Psychophysical Laws in Language Models

Transformer幅度表示中的韦伯定律:高效编码、表示几何与语言模型中的心理物理定律

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究员)

AI总结 研究探讨了Transformer语言模型如何表示幅度,发现其表示几何具有对数压缩特性,但该几何与行为表现无关,且因果干预揭示了不同层的处理差异。

Comments 18 pages, 7 figures, 5 tables. Pre-registered on OSF. Submitted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23049 2026-03-24 cs.LG cs.AI

Advantage Shaping as Surrogate Reward Maximization: Unifying Pass@K Policy Gradients

优势塑造作为替代奖励最大化:统一Pass@K策略梯度

Christos Thrampoulidis, Sadegh Mahdavi, Wenlong Deng

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

AI总结 本文通过揭示优势塑造技术与直接策略梯度方法的本质关联,提出基于替代奖励的统一优化框架,为Pass@K目标下的强化学习策略梯度优化提供新视角。

Comments v3: Camera-ready version (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18983 2026-03-24 cs.LG

KASPER: Kolmogorov Arnold Networks for Stock Prediction and Explainable Regimes

KASPER:用于股票预测和可解释性市场的 Kolmogorov-Arnold 网络

Vidhi Oad, Param Pathak, Nouhaila Innan, Shalini D, Muhammad Shafique

机构 * Vishwakarma Government Engineering College(维斯瓦卡罗马工程学院) QuantumAI Lab, Fractal Analytics(量子AI实验室,Fractal Analytics) eBRAIN Lab, Division of Engineering, New York University Abu Dhabi (NYUAD)(eBRAIN实验室,工程系,纽约大学阿布扎比分校(NYUAD)) Center for Quantum and Topological Systems (CQTS), NYUAD Research Institute(量子与拓扑系统中心(CQTS),NYUAD研究机构)

AI总结 KASPER 结合了市场状态检测、稀疏样条函数建模和符号规则提取,通过 Gumbel-Softmax 机制识别隐藏市场条件,实现可解释的股票预测,实测结果显示其在 R²、夏普比率和均方误差上均优于现有方法。

Comments 11 pages, 7 figures, 3 tables

Journal ref Transactions on Machine Learning Research, 2026, https://openreview.net/forum?id=PD4jGJQtL8

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11026 2026-03-24 cs.LG cs.AI cs.CL

RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment

通过SFT方式实现RLHF:从最优解到奖励加权对齐

Yuhao Du, Zhuo Li, Pengyu Cheng, Zhihong Chen, Yuejiao Xie, Xiang Wan, Anningzhe Gao

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Qwen LLM Application Team, Alibaba(阿里巴巴Qwen大模型应用团队) Stanford University(斯坦福大学)

AI总结 本文提出VAR方法,通过变分推断视角简化RLHF,将对齐目标转化为离线奖励驱动的加权监督微调形式,提升训练稳定性和效果,实验证明其在帮助性和无害性指标上优于DPO,且在计算效率和收敛速度上优于在线采样方法。

Comments Published in TMLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20572 2026-03-24 cs.LG

LJ-Bench: Ontology-Based Benchmark for U.S. Crime

LJ-Bench:基于本体的美国犯罪评估基准

Hung Yun Tseng, Wuzhen Li, Blerina Gkotse, Grigorios Chrysos

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 LJ-Bench是首个基于本体的全面基准,用于评估LLM对多种非法活动的鲁棒性,揭示LLM在不同犯罪类别中的脆弱性。

Comments Accepted at Transactions on Machine Learning Research in March, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏