arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Transactions on Machine Learning Research · 期刊 · Machine Learning

2026-07-21 至 2026-07-21 共收录 5
2607.18006 2026-07-21 cs.LG cs.AI cs.CL cs.MA 新提交

MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

MADA-RL:用于紧凑模型中参数高效推理的多智能体辩论感知强化学习

Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma

AI总结 研究针对紧凑模型训练成本高问题,提出MADA-RL框架,将其分为生成器和评论家角色,用辩论感知信号训练,通过LoRA微调少量参数。核心是反事实评论家优势,提高了模型准确率,在数学推理基准测试中有显著效果。

Comments 20 pages, 3 figures, 9 tables, 2 algorithms, under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16243 2026-07-21 cs.LG cs.AI 新提交

RobustMAD: Evaluating Real-World Robustness of Multimodal Small Language Models for Deployable Anomaly Detection Assistants

RobustMAD:评估用于可部署异常检测助手的多模态小语言模型的现实世界鲁棒性

Anushiya Arunan, Xin Li, Yan Qin, U-Xuan Tan, Nhu Khue Vuong, Xiaoli Li, Chau Yuen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Nanyang Technological University(南洋理工大学) Chongqing University(重庆大学)

AI总结 研究针对多模态小语言模型现场部署的鲁棒性评估问题,开发RobustMAD基准测试,通过多种开放式查询评估模型,发现最佳模型虽有潜力但仍存差距及三种失败模式,为下一代多模态工业检测助手设计提供指导。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026 at https://openreview.net/forum?id=skrA9UYNIZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15802 2026-07-21 cs.LG 版本更新

Time-Aware Prior Fitted Networks for Zero-Shot Forecasting with Exogenous Variables

考虑时间因素的先验拟合网络用于外生变量的零样本预测

Andres Potapczynski, Ravi Kiran Selvam, Tatiana Konstantinova, Malcolm Wolff, Kin G. Olivares, Ruijun Ma, Michael W. Mahoney, Andrew Gordon Wilson, Boris N. Oreshkin, Dmitry Efimov

机构 * Amazon(亚马逊) New York University(纽约大学)

AI总结 本文提出ApolloPFN,一种时间感知的先验拟合网络,能够原生整合外生变量,通过合成数据生成和时间感知架构改进,实现更准确的预测。

Comments Accepted and published in Transactions on Machine Learning Research (TMLR), 2026

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14355 2026-07-21 cs.CL 版本更新

Exposing Long-Tail Safety Failures in Large Language Models through Efficient Diverse Response Sampling

通过高效多样响应采样暴露大语言模型中的长尾安全故障

Suvadeep Hajra, Palash Nandi, Tanmoy Chakraborty

AI总结 本文通过多样响应生成方法系统暴露大语言模型的安全故障,提出PDPS算法在降低计算成本的同时提高攻击成功率,并生成更多多样化的不安全输出。

Comments Accepted by Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09171 2026-07-21 cs.CV 版本更新

Instance-Level Generation for Representation Learning

用于表示学习的实例级生成

Yankun Wu, Zakaria Laskar, Giorgos Kordopatis-Zilos, Noa Garcia, Giorgos Tolias

AI总结 研究针对实例级识别创建大规模标注数据集难的问题,提出从多领域合成多样对象实例形成训练集的新方法,不依赖真实图像,微调视觉模型提高检索性能,为数据收集管理提供新替代,开启新ILR范式。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏