arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Toronto(多伦多大学)

共收录 1022
2602.21204 2026-05-14 cs.LG cs.AI cs.CV

Test-Time Training with KV Binding Is Secretly Linear Attention

测试时训练与KV绑定实际上是秘密的线性注意力

Junchen Liu, Sven Elflein, Or Litany, Zan Gojcic, Ruilong Li

机构 * NVIDIA, Toronto, Ontario, Canada(NVIDIA,多伦多,安大略省,加拿大) University of Toronto, Toronto, Ontario, Canada(多伦多大学,多伦多,安大略省,加拿大) Vector Institute, Toronto, Ontario, Canada(向量研究所,多伦多,安大略省,加拿大) Technion -- Israel Institute of Technology, Haifa, Israel(技术ion -- 以色列理工学院,海法,以色列)

AI总结 本文揭示测试时训练与KV绑定实际上是学习的线性注意力,而非记忆,提出简化架构、并行计算和统一模型形式的改进方法。

Comments ICML 2026, Webpage: https://research.nvidia.com/labs/sil/projects/tttla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00072 2026-05-14 cs.AI

Test of Time: Rethinking Temporal Signal of Benchmark Contamination

时间检验:重新思考基准污染的时序信号

Terry Jingchen Zhang, Gopal Dev, Ning Wang, Max Obreiter, Punya Syon Pandey, Keenan Samway, Wenyuan Jiang, Yinya Huang, Bernhard Schölkopf, Mrinmaya Sachan, Zhijing Jin

机构 * Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室、多伦多大学及向量研究所) ETH Zürich & ETH AI Center(苏黎世联邦理工学院及ETH人工智能中心) Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统马克斯·普朗克研究所,图宾根,德国) ELLIS Institute Tübingen(图宾根ELLIS研究所)

AI总结 本文质疑LLM后截止性能衰减作为基准污染时序信号的假设,发现该信号对问题构造方式敏感,通过LLM转换问题可改变时序模式,验证了其对评估可靠性的启示。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12421 2026-05-13 cs.AI

Formalize, Don't Optimize: The Heuristic Trap in LLM-Generated Combinatorial Solvers

形式化,而非优化:LLM生成组合求解器中的启发式陷阱

Haoyu Wang, Yuliang Song, Tao Li, Zhiwei Deng, Yaqing Wang, Deepak Ramachandran, Eldan Cohen, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Toronto(多伦多大学) Google DeepMind(谷歌DeepMind) Oracle AI(Oracle人工智能)

AI总结 本文研究LLM生成组合求解器时形式化与优化的矛盾,通过CP-SynC-XL基准测试,发现Python+OR-Tools在正确性上最优,而MiniZinc+OR-Tools虽使用相同后端但覆盖度较低,启发式优化导致部分问题速度下降和正确性降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11618 2026-05-13 cs.RO

Sampling-Based Follow-the-Leader Motion Planning for Manipulator-Mounted Continuum Robots

基于采样的跟随者-领导者运动规划用于机械臂搭载的连续机器人

Chengnan Shentu, Nicholas Baldassini, Oluwagbotemi D. Iseoluwa, Radian Gondokaryono, Jessica Burgner-Kahrs

机构 * University of Toronto(多伦多大学)

AI总结 本文提出了一种基于采样的跟随者-领导者运动规划方法,用于机械臂搭载的连续机器人,通过分离全局形状搜索与基座姿态确定,实现高效规划与高精度路径跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11239 2026-05-13 cs.LG stat.ML

Extending Kernel Trick to Influence Functions

将核技巧扩展到影响函数

Zhenhuan Sun, Shahrokh Valaee

机构 * University of Toronto(多伦多大学)

AI总结 本文提出影响函数的双表示形式,其计算复杂度随数据集规模而非模型规模增长。在模型规模远大于数据集规模或原影响函数在参数空间评估不可行时,该方法能高效估计数据点移除对参数、模型输出和损失的影响。但该方法仅适用于可线性化模型,需生成一个随模型输出维度和数据集规模乘积增长的矩阵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15664 2026-05-13 cs.LG cs.AI

Stargazer: A Scalable Model-Fitting Benchmark Environment for AI Agents under Astrophysical Constraints

Stargazer:一种可扩展的AI代理在天体物理约束下的模型拟合基准环境

Xinge Liu, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin, Kristen Menou

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所)

AI总结 Stargazer通过120个任务评估AI代理在动态物理约束下的模型拟合能力,揭示了数值优化与物理约束间的差距,并提供了可扩展的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04352 2026-05-13 cs.RO cond-mat.mtrl-sci

A Soft Robotic Demonstration in the Stratosphere

平流层中的软机器人演示

Codrin Tugui, Tirth Thakar, Anatol Gogoj, Alexander White, Ang Leo Li, Alexander Yin, Edward Pomianek, Mihai Duduta

机构 * University of Connecticut, School of Mechanical, Aerospace, and Manufacturing Engineering(康奈尔大学机械、航空航天与制造工程学院) Institute of Macromolecular Chemistry Petru Poni(彼得·波尼宏观分子化学研究所) University of Toronto, Department of Mechanical and Industrial Engineering(多伦多大学机械与工业工程系)

AI总结 本文提出一种新型硅基弹性体,通过紫外光交联机制提升其在极端环境下的适应性和机械性能,用于平流层高海拔气球实验中展示软机器人技术的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25609 2026-05-13 cs.LG cs.AI eess.SP

Revisiting GAN with Bayes-Optimal Discrimination

重新审视GAN与贝叶斯最优判别

Mohammadreza Tavasoli Naeini, Ali Bereyhi, Morteza Noshad, Ben Liang, Alfred O. Hero

机构 * University of Toronto(多伦多大学) Stanford University(斯坦福大学) University of Michigan(密歇根大学)

AI总结 本文提出通过贝叶斯最优判别误差率(BER)优化GAN训练,引入BOLT损失函数,改进生成器性能,提升样本质量和覆盖范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09051 2026-05-13 cs.LG cs.AI

Model-Level GNN Explanations via Rule-to-Graph Readout for Logit Reconstruction

通过规则到图读取实现模型级GNN解释用于logit重建

Shengyao Lu, Jiuding Yang, Aedan J. DeFrates, Keith G. Mills, Baochun Li, Di Niu

机构 * University of Victoria(维多利亚大学) University of Alberta(阿尔伯塔大学) LSU ATHENA Lab(路易斯安那州立大学ATHENA实验室) University of Toronto(多伦多大学)

AI总结 本文提出基于规则的图神经网络解释框架,通过规则级读取重建logit,实现全局解释与子图接地,提升预测一致性并加快速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10716 2026-05-12 cs.LG stat.ML

What should post-training optimize? A test-time scaling law perspective

在测试时间视角下,后训练应优化什么?

Muheng Li, Jian Qian, Wenlong Mou

机构 * Department of Statistical Sciences, University of Toronto(多伦多大学统计科学系) Department of AI and Data Science, The University of Hong Kong(香港大学人工智能与数据科学系)

AI总结 本文研究了测试时间预算不匹配场景下,基于奖励尾部统计的后训练优化方法,提出TEA和Prefix-TEA估计器提升最佳N性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09305 2026-05-12 stat.ME cs.HC cs.LG stat.CO stat.ML

Reinforcement Learning Measurement Model

强化学习测量模型

Wenqian Xu, Feng Ji

机构 * Department of Applied Psychology and Human Development, University of Toronto(应用心理学与人类发展系,多伦多大学)

AI总结 本文提出RLMM模型,通过参数化动作价值函数解耦个体选择敏感性与任务价值表示,提升大规模过程数据估计效率,实验显示其在复杂任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09292 2026-05-12 cs.AI cs.CY

Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning

超越准确性:评估大语言模型数学推理中的策略多样性

Xia Yang, Xuanyi Zhang, Hao Hu, Feng Ji

机构 * University of Toronto(多伦多大学) Upper Canada College(上加拿大学院) East China Normal University(华东师范大学)

AI总结 研究探讨了大语言模型在数学推理中策略多样性与准确性之间的关系,发现策略多样性是评估数学推理的重要补充维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09291 2026-05-12 cs.LG stat.AP

dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models

dFlowGRPO:面向离散流模型的速率感知策略优化

Zhengyan Wan, Yidong Ouyang, Panwen Hu, Qiang Sun

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) East China Normal University(东华大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Toronto(多伦多大学)

AI总结 本文提出dFlowGRPO框架,用于离散流模型的强化学习,支持多种概率路径和非掩码源分布,通过轨迹概率推导和去噪马尔可夫决策过程,提升文本到图像生成和多模态理解任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12027 2026-05-12 cs.RO

3DRO: Lidar-level SE(3) Direct Radar Odometry Using a 2D Imaging Radar and a Gyroscope

3DRO:基于2D成像雷达和陀螺仪的激光雷达级SE(3)直接雷达里程计

Cedric Le Gentil, Daniil Lisus, Timothy D. Barfoot

机构 * Robotics Institute, University of Toronto(多伦多大学机器人研究所) Mobile Robotics Lab, ETH Zurich(苏黎世联邦理工学院移动机器人实验室)

AI总结 本文提出3DRO,扩展SE(2)直接雷达里程计框架以实现SE(3)状态估计,通过2D速度估计保持数据平面性并结合3D陀螺仪测量,实现激光雷达级精度。

Comments Accepted for presentation at the ICRA 2026 Workshop on Radar in Robotics (poster: https://drive.google.com/file/d/1P_iBrGxPiZL644B-dHxbvdY-UJUzd4Kp/view )

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09154 2026-05-12 cs.LG

Predicting Large Model Test Losses with a Noisy Quadratic System

通过噪声二次系统预测大模型测试损失

Chuning Li, Chris J. Maddison

机构 * Vector Institute(向量研究所) University of Toronto(多伦多大学)

AI总结 本文提出一种预测大模型预训练损失的模型,基于模型大小、批量大小和权重更新次数。该模型在处理变化的批量大小方面具有优势,并在预测扩展计算预算下的损失时优于Chinchilla模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09106 2026-05-12 cs.CL

Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain

Fin-Bias:金融领域下LLM决策制定的综合评估:在存在人类偏见的背景下

Xiaoyu Hu, Jinman Zhao

机构 * Rutgers University(罗格斯大学) Department of Computer Science, University of Toronto(多伦多大学计算机科学系)

AI总结 本文提出Fin-Bias基准,评估LLM在金融不确定性和潜在人类偏见意见下的投资决策能力,通过分析8868份分析师报告揭示LLM易受显性偏见影响,并开发方法检测人类意见以促进LLM独立思考。

Comments ACL 2026 Findings

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09073 2026-05-12 cs.RO

Smoothing Out the Edges: Continuous-Time Estimation with Gaussian Process Motion Priors on Factor Graphs

平滑边缘:基于因子图的高斯过程运动先验的连续时间估计

Connor Holmes, Sven Lilge, Zi Cong Guo, Frank Dellaert, Timothy D. Barfoot

机构 * University of Toronto(多伦多大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出基于因子图的高斯过程连续时间估计方法,通过简化解释和三个GTSAM示例,提升非参数方法在机器人中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08866 2026-05-12 stat.ML cs.LG math.OC

Tight Generalization Bounds for Noiseless Inverse Optimization

无噪声逆优化的紧泛化界限

Pouria Fatemi, Hoomaan Maskan, Suvrit Sra, Peyman Mohajerin Esfahani

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) Uppsala University, Sweden(乌普萨拉大学,瑞典) University of Toronto, Canada(多伦多大学,加拿大)

AI总结 本文研究无噪声逆优化问题,提出一个高概率的泛化界,证明在额外条件下,所提出的逆优化保证与最佳臂识别结果一致,并展示了该界在所有一致估计器中的紧性,同时扩展到即时和累积遗憾。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08564 2026-05-12 cs.AI cs.CV cs.LG

Biological Plausibility and Representational Alignment of Feedback Alignment in Convolutional Networks

反馈对齐在卷积网络中的生物合理性与表征对齐

Jake Lance, Larry Kieu

机构 * University of Toronto(多伦多大学)

AI总结 本文比较了反馈对齐与反向传播在卷积网络中的生物合理性、可解释性和计算复杂性,发现修改后的反馈对齐能产生与反向传播相似的内部表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08109 2026-05-12 cs.LG cond-mat.mtrl-sci physics.flu-dyn

Geometry-free prediction of inertial lift forces in microfluidic devices using deep learning

无需几何参数的微流体装置惯性升力预测

Jesse Ward-Bond, Ali Mashadian, Timothy C. Y. Chan, Edmond W. K. Young

机构 * Department of Mechanical & Industrial Engineering, University of Toronto(机械与工业工程系,多伦多大学) Mechanical Engineering, Purdue University(机械工程,普渡大学) Department of Materials Science & Engineering, University of Toronto(材料科学与工程系,多伦多大学) Institute of Biomedical Engineering, University of Toronto(生物医学工程研究所,多伦多大学)

AI总结 本文提出一种无需几何参数的深度学习模型,能有效预测微流体装置中粒子升力,适用于多种通道几何形状。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07209 2026-05-12 cs.RO

Continuum Robot Localization using Distributed Time-of-Flight Sensors

基于分布式飞行时间传感器的连续机器人定位

Spencer Teetaert, Giammarco Caroleo, Marco Pontin, Sven Lilge, Jessica Burgner-Kahrs, Timothy D. Barfoot, Perla Maiolino

机构 * University of Toronto Robotics Institute, Canada(多伦多大学机器人研究所,加拿大) Oxford Robotics Institute, University of Oxford, UK(牛津大学机器人研究所,英国) Toronto Metropolitan University, Canada(多伦多 Metropolitan 大学,加拿大)

AI总结 本文提出了一种利用小型低分辨率飞行时间传感器进行连续机器人定位的方法,通过融合传感器数据与机器人形状先验信息,实现了在复杂环境中高精度的定位与建图。

Comments Print version, to be published at Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07993 2026-05-11 cs.LG stat.ME

Bayesian Sensitivity of Causal Inference Estimators under Evidence-Based Priors

基于证据先验的因果推断估计的贝叶斯敏感性

Nikita Dhawan, Daniel Shen, Leonardo Cotta, Chris J. Maddison

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Waterloo(滑铁卢大学)

AI总结 本文提出贝叶斯敏感性值(BSV)框架,用于评估因果推断估计在假设违反下的稳健性,通过实证研究展示其在糖尿病治疗与体重损失关系中的应用。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07062 2026-05-11 cs.SE cs.AI

From Assistance to Agency: Rethinking Autonomy and Control in CI/CD Pipelines

从协助到自主:重新思考CI/CD流水线中的自主性与控制

Marcus Emmanuel Barnes, Taher A. Ghaleb, Safwat Hassan

机构 * Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) Department of Computer Science Trent University Peterborough Ontario Canada(计算机科学系特伦特大学彼得伯格安大略加拿大) University of Toronto(多伦多大学) Trent University(特伦特大学)

AI总结 本文探讨CI/CD流水线中自主性与控制的重新定义,提出授权转移的设计挑战,分析当前系统在数据平面的操作限制,并提出控制平面安全与治理机制的研究方向。

Comments Accepted to the 3rd ACM International Conference on AI-Powered Software (AIware 2026), Main Track, Montreal, Canada, July 6-7, 2026. 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07041 2026-05-11 cs.RO cs.CV

Dr-BA: Separable Optimization for Direct Radar Bundle Adjustment & Localization

Dr-BA:直接雷达束调整与定位的可分离优化

Daniil Lisus, Cedric Le Gentil, Timothy D. Barfoot

机构 * Robotics Institute, University of Toronto(多伦多大学机器人研究所)

AI总结 本文提出Dr-BA框架,通过直接处理2D旋转雷达强度图像实现雷达束调整与定位,利用雷达抗雨优势,解决稠密地图与传感器姿态联合估计问题,实现最先进的雷达束调整与跨会话定位性能。

Comments Accepted for presentation at RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06966 2026-05-11 cs.RO cs.SE

Traffic Scenario Orchestration from Language via Constraint Satisfaction

通过约束满足实现基于语言的交通场景编排

Frieda Rong, Chris Zhang, Kelvin Wong, Raquel Urtasun

机构 * University of Toronto(多伦多大学) Waabi

AI总结 本文提出一种基于约束满足的交通场景编排方法,通过自然语言生成约束条件,利用现成求解器实现闭环测试中的精确场景控制,显著提高了场景编排成功率。

Comments 19 pages, 10 figures; full version of paper accepted for poster presentation at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06835 2026-05-11 cs.LG cs.AI

On Privacy Leakage in Tabular Diffusion Models: Influential Factors, Attacker Knowledge, and Metrics

关于表格扩散模型中的隐私泄露:影响因素、攻击者知识和度量标准

Masoumeh Shafieinejad, D. B. Emerson, Behnoosh Zamanlooy, Elaheh Bassak, Fatemeh Tavakoli, Sara Kodeiri, Marcelo Lotif, Xi He

机构 * Vector Institute(向量研究所) McMaster University(麦 master 大学) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学)

AI总结 研究探讨了表格扩散模型中隐私泄露的影响因素,通过黑盒和白盒设置中的最新成员推断攻击,量化了训练设置、合成选择和攻击者知识对隐私泄露的影响,并揭示了启发式隐私度量的缺陷。

Comments 23 pages, 11 Figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15567 2026-05-11 cs.AI cond-mat.mtrl-sci cs.LG physics.chem-ph

Evaluating Large Language Models in Scientific Discovery

评估大型语言模型在科学发现中的表现

Zhangde Song, Jieyu Lu, Yuanqi Du, Botao Yu, Thomas M. Pruyn, Yue Huang, Kehan Guo, Xiuzhe Luo, Yuanhao Qu, Yi Qu, Yinkai Wang, Haorui Wang, Jeff Guo, Jingru Gan, Parshin Shojaee, Di Luo, Andres M Bran, Gen Li, Qiyuan Zhao, Shao-Xiong Lennon Luo, Yuxuan Zhang, Xiang Zou, Wanru Zhao, Yifan F. Zhang, Wucheng Zhang, Shunan Zheng, Saiyang Zhang, Sartaaj Takrim Khan, Mahyar Rajabi-Kochi, Samantha Paradi-Maropakis, Tony Baltoiu, Fengyu Xie, Tianyang Chen, Kexin Huang, Weiliang Luo, Meijing Fang, Xin Yang, Lixue Cheng, Jiajun He, Soha Hassoun, Xiangliang Zhang, Wei Wang, Chandan K. Reddy, Chao Zhang, Zhiling Zheng, Mengdi Wang, Le Cong, Carla P. Gomes, Chang-Yu Hsieh, Aditya Nandy, Philippe Schwaller, Heather J. Kulik, Haojun Jia, Huan Sun, Seyed Mohamad Moosavi, Chenru Duan

机构 * Deep Principle(深原则) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学) Department of Computer Science and Engineering, The Ohio State University(计算机科学与工程系,俄亥俄州立大学) Department of Chemical Engineering & Applied Chemistry, University of Toronto(化学工程与应用化学系,多伦多大学) Department of Computer Science and Engineering, University of Notre Dame(计算机科学与工程系,圣母大学) QuEra Computing Inc.(QuEra计算公司) Department of Pathology, Department of Genetics, Cancer Biology Program, Stanford University School of Medicine(病理学系、遗传学系、癌症生物学项目,斯坦福大学医学院) Harvard Law School(哈佛法学院) Department of Computer Science, Tufts University(计算机科学系,塔夫茨大学) School of Computational Science and Engineering, Georgia Institute of Technology(计算科学与工程学院,佐治亚理工学院) Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校) Department of Computer Science, Virginia Tech(计算机科学系,弗吉尼亚理工大学) Department of Physics, Tsinghua University(物理系,清华大学) Institute for Advanced Study, Tsinghua University(清华大学高级研究所) Laboratory of Artificial Chemical Intelligence, Ecole Polytechnique Federale de Lausanne(人工化学智能实验室,瑞士联邦理工学院)

AI总结 本文提出一个基于场景的基准测试,评估LLM在生物学、化学、材料科学和物理学中的科学发现能力,揭示了模型在科学发现任务中的性能差距和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02107 2026-05-11 cs.RO

Balancing Act: Trading Off Odometry and Map Registration for Efficient Lidar Localization

平衡艺术:在里程计与地图注册之间进行权衡以实现高效的激光雷达定位

Katya M. Papais, Daniil Lisus, Cedric Le Gentil, David J. Yoon, Timothy D. Barfoot

机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究所)

AI总结 本文研究了如何通过整合轻量级里程计与优化更新频率,提高激光雷达定位效率,同时保持高性能表现。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06460 2026-05-08 cs.LG

MINER: Mining Multimodal Internal Representation for Efficient Retrieval

MINER:挖掘多模态内部表示以实现高效检索

Weien Li, Rui Song, Zeyu Li, Haochen Liu, Gonghao Zhang, Difan Jiao, Zhenwei Tang, Bowei He, Haolun Wu, Xue Liu, Ye Yuan

机构 * McGill University(麦吉尔大学) MIT - Massachusetts Institute of Technology(麻省理工学院) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩洛哥 bin Zayed 大学人工智能学院) Mila - Quebec AI Institute(Mila - 加拿大魁北克人工智能研究所)

AI总结 本文提出MINER,通过挖掘Transformer各层内部表示,融合多模态信号生成紧凑嵌入,提升检索性能,优于现有单向量检索器并在部分设置中缩小与晚交互基线的差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05544 2026-05-08 cs.LG cs.RO

Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning

自适应Q分块用于离线到在线强化学习

Nandiraju Gireesh, Yuanliang Ju, He Wang

机构 * Peking University(北京大学) Galbot University of Toronto(多伦多大学)

AI总结 本文提出自适应Q分块方法,通过动态选择不同分块大小的 critic 来解决离线到在线强化学习中的偏置问题,提升在 OGBench 和 Robomimic 上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏