arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Toronto(多伦多大学)

2026-05-12 至 2026-05-12 共收录 12
2605.10716 2026-05-12 cs.LG stat.ML

What should post-training optimize? A test-time scaling law perspective

在测试时间视角下,后训练应优化什么?

Muheng Li, Jian Qian, Wenlong Mou

机构 * Department of Statistical Sciences, University of Toronto(多伦多大学统计科学系) Department of AI and Data Science, The University of Hong Kong(香港大学人工智能与数据科学系)

AI总结 本文研究了测试时间预算不匹配场景下,基于奖励尾部统计的后训练优化方法,提出TEA和Prefix-TEA估计器提升最佳N性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09305 2026-05-12 stat.ME cs.HC cs.LG stat.CO stat.ML

Reinforcement Learning Measurement Model

强化学习测量模型

Wenqian Xu, Feng Ji

机构 * Department of Applied Psychology and Human Development, University of Toronto(应用心理学与人类发展系,多伦多大学)

AI总结 本文提出RLMM模型,通过参数化动作价值函数解耦个体选择敏感性与任务价值表示,提升大规模过程数据估计效率,实验显示其在复杂任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09292 2026-05-12 cs.AI cs.CY

Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning

超越准确性:评估大语言模型数学推理中的策略多样性

Xia Yang, Xuanyi Zhang, Hao Hu, Feng Ji

机构 * University of Toronto(多伦多大学) Upper Canada College(上加拿大学院) East China Normal University(华东师范大学)

AI总结 研究探讨了大语言模型在数学推理中策略多样性与准确性之间的关系,发现策略多样性是评估数学推理的重要补充维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09291 2026-05-12 cs.LG stat.AP

dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models

dFlowGRPO:面向离散流模型的速率感知策略优化

Zhengyan Wan, Yidong Ouyang, Panwen Hu, Qiang Sun

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) East China Normal University(东华大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Toronto(多伦多大学)

AI总结 本文提出dFlowGRPO框架,用于离散流模型的强化学习,支持多种概率路径和非掩码源分布,通过轨迹概率推导和去噪马尔可夫决策过程,提升文本到图像生成和多模态理解任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12027 2026-05-12 cs.RO

3DRO: Lidar-level SE(3) Direct Radar Odometry Using a 2D Imaging Radar and a Gyroscope

3DRO:基于2D成像雷达和陀螺仪的激光雷达级SE(3)直接雷达里程计

Cedric Le Gentil, Daniil Lisus, Timothy D. Barfoot

机构 * Robotics Institute, University of Toronto(多伦多大学机器人研究所) Mobile Robotics Lab, ETH Zurich(苏黎世联邦理工学院移动机器人实验室)

AI总结 本文提出3DRO,扩展SE(2)直接雷达里程计框架以实现SE(3)状态估计,通过2D速度估计保持数据平面性并结合3D陀螺仪测量,实现激光雷达级精度。

Comments Accepted for presentation at the ICRA 2026 Workshop on Radar in Robotics (poster: https://drive.google.com/file/d/1P_iBrGxPiZL644B-dHxbvdY-UJUzd4Kp/view )

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09154 2026-05-12 cs.LG

Predicting Large Model Test Losses with a Noisy Quadratic System

通过噪声二次系统预测大模型测试损失

Chuning Li, Chris J. Maddison

机构 * Vector Institute(向量研究所) University of Toronto(多伦多大学)

AI总结 本文提出一种预测大模型预训练损失的模型,基于模型大小、批量大小和权重更新次数。该模型在处理变化的批量大小方面具有优势,并在预测扩展计算预算下的损失时优于Chinchilla模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09106 2026-05-12 cs.CL

Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain

Fin-Bias:金融领域下LLM决策制定的综合评估:在存在人类偏见的背景下

Xiaoyu Hu, Jinman Zhao

机构 * Rutgers University(罗格斯大学) Department of Computer Science, University of Toronto(多伦多大学计算机科学系)

AI总结 本文提出Fin-Bias基准,评估LLM在金融不确定性和潜在人类偏见意见下的投资决策能力,通过分析8868份分析师报告揭示LLM易受显性偏见影响,并开发方法检测人类意见以促进LLM独立思考。

Comments ACL 2026 Findings

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09073 2026-05-12 cs.RO

Smoothing Out the Edges: Continuous-Time Estimation with Gaussian Process Motion Priors on Factor Graphs

平滑边缘:基于因子图的高斯过程运动先验的连续时间估计

Connor Holmes, Sven Lilge, Zi Cong Guo, Frank Dellaert, Timothy D. Barfoot

机构 * University of Toronto(多伦多大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出基于因子图的高斯过程连续时间估计方法,通过简化解释和三个GTSAM示例,提升非参数方法在机器人中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08866 2026-05-12 stat.ML cs.LG math.OC

Tight Generalization Bounds for Noiseless Inverse Optimization

无噪声逆优化的紧泛化界限

Pouria Fatemi, Hoomaan Maskan, Suvrit Sra, Peyman Mohajerin Esfahani

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) Uppsala University, Sweden(乌普萨拉大学,瑞典) University of Toronto, Canada(多伦多大学,加拿大)

AI总结 本文研究无噪声逆优化问题,提出一个高概率的泛化界,证明在额外条件下,所提出的逆优化保证与最佳臂识别结果一致,并展示了该界在所有一致估计器中的紧性,同时扩展到即时和累积遗憾。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08564 2026-05-12 cs.AI cs.CV cs.LG

Biological Plausibility and Representational Alignment of Feedback Alignment in Convolutional Networks

反馈对齐在卷积网络中的生物合理性与表征对齐

Jake Lance, Larry Kieu

机构 * University of Toronto(多伦多大学)

AI总结 本文比较了反馈对齐与反向传播在卷积网络中的生物合理性、可解释性和计算复杂性,发现修改后的反馈对齐能产生与反向传播相似的内部表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08109 2026-05-12 cs.LG cond-mat.mtrl-sci physics.flu-dyn

Geometry-free prediction of inertial lift forces in microfluidic devices using deep learning

无需几何参数的微流体装置惯性升力预测

Jesse Ward-Bond, Ali Mashadian, Timothy C. Y. Chan, Edmond W. K. Young

机构 * Department of Mechanical & Industrial Engineering, University of Toronto(机械与工业工程系,多伦多大学) Mechanical Engineering, Purdue University(机械工程,普渡大学) Department of Materials Science & Engineering, University of Toronto(材料科学与工程系,多伦多大学) Institute of Biomedical Engineering, University of Toronto(生物医学工程研究所,多伦多大学)

AI总结 本文提出一种无需几何参数的深度学习模型,能有效预测微流体装置中粒子升力,适用于多种通道几何形状。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07209 2026-05-12 cs.RO

Continuum Robot Localization using Distributed Time-of-Flight Sensors

基于分布式飞行时间传感器的连续机器人定位

Spencer Teetaert, Giammarco Caroleo, Marco Pontin, Sven Lilge, Jessica Burgner-Kahrs, Timothy D. Barfoot, Perla Maiolino

机构 * University of Toronto Robotics Institute, Canada(多伦多大学机器人研究所,加拿大) Oxford Robotics Institute, University of Oxford, UK(牛津大学机器人研究所,英国) Toronto Metropolitan University, Canada(多伦多 Metropolitan 大学,加拿大)

AI总结 本文提出了一种利用小型低分辨率飞行时间传感器进行连续机器人定位的方法,通过融合传感器数据与机器人形状先验信息,实现了在复杂环境中高精度的定位与建图。

Comments Print version, to be published at Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏