arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Toronto(多伦多大学)

共收录 120
2607.15246 2026-07-17 cs.CV 新提交

ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors

ARMOR++:用于对深度伪造检测器进行可转移攻击的多域原语集的智能编排

Christos Korgialas, Gabriel Lee Jun Rong, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

机构 * Department of Informatics, Aristotle University of Thessaloniki(塞萨洛尼基亚里士多德大学信息学系) Infocomm Technology Cluster, Singapore Institute of Technology(新加坡科技学院信息通信技术集群) Department of Applied Physics and Applied Mathematics, Columbia University(哥伦比亚大学应用物理与应用数学系) Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部) Department of Electrical and Computer Engineering, University of Toronto(多伦多大学电气与计算机工程系)

AI总结 研究针对深度伪造检测器在黑盒对抗转移下可靠性下降问题,提出ARMOR++多智能体框架,利用视觉与语言模型提供语义先验并编排原语选择等,整合多种原语有效针对异构偏差,实验表明其性能优于现有基线,凸显当前检测器可靠性差距及智能编排的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14995 2026-07-17 cs.LG q-bio.QM 新提交

Multimodal Semantic-Aware Contrastive Learning For False Negative Mitigation in 3D Medical Imaging

用于减轻 3D 医学成像中假阴性的多模态语义感知对比学习

Sara Ketabi, Matthias W. Wagner, Cynthia Hawkins, Uri Tabori, Birgit Betina Ertl-Wagner, Farzad Khalvati

机构 * University of Toronto(多伦多大学) The Hospital for Sick Children(病童医院) Vector Institute(向量研究所) University Hospital Augsburg(奥格斯堡大学医院)

AI总结 研究针对3D医学成像中假阴性问题,提出多模态语义感知对比学习框架MseaCL,通过纳入放射学报告语义相似性作指导信号,经实验验证该框架用于预训练可提升下游任务表现,如儿科脑肿瘤分子分类AUC至少增22.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13431 2026-07-16 cs.LG cs.AI cs.CL 新提交

Discrete Diffusion Models: A Unified Framework from Tokenization to Generation

离散扩散模型:从词元化到生成的统一框架

Ye Yuan, Weien Li, Rui Song, Zeyu Li, Haochen Liu, Xiangyu Kong, Zixuan Dong, Linfeng Du, Zipeng Sun, Weixu Zhang, Jiaxin Huang, Changjiang Han, Yonghan Yang, Zichen Zhao, Xiuyuan Hu, Haolun Wu, Yankai Chen, Fengran Mo, Jikun Kang, Bowei He, Philip S. Yu, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Tsinghua University(清华大学) Rochester Institute of Technology(罗彻斯特理工学院) Salesforce(Salesforce公司) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 研究离散扩散模型,引入统一框架从离散状态空间构建审视该模型,让现有公式成为共同设计空间实例,揭示训练、推理等方面权衡,为未来研究提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12086 2026-07-15 cs.CL cs.CY cs.MA cs.SI 新提交

CityBehavEx: A Scalable and Empirically Validated LLM-Assisted Urban Simulation Platform

CityBehavEx:一个可扩展且经过实证验证的基于大语言模型的城市模拟平台

Gustavo H. Santos, Aline Viana, Thiago H Silva

机构 * UTFPR(巴拉那联邦理工大学) Inria(法国国家信息与自动化研究所) University of Toronto(多伦多大学)

AI总结 CityBehavEx平台针对基于大语言模型的城市模拟器扩展成本高和验证薄弱问题,结合人类出行模型与交叉编码器,实现大规模模拟,能生成更贴合现实的出行模式,还允许用户进行多种操作及验证。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11758 2026-07-14 cs.LG 新提交

From Global to Factor-Wise Expert Composition in Discrete Diffusion Models

从离散扩散模型中的全局专家组合到因子级专家组合

Haozhe Huang, Yudong Xu, Abhijoy Mandal, Alán Aspuru-Guzik

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Mechanical & Industrial Engineering, University of Toronto(多伦多大学机械与工业工程系) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究所)

AI总结 研究针对离散扩散模型中专家组合方法的局限性,提出因子级组合框架FactorDiff,将样本分解为更小因子,通过动态路由使因子与相关专家匹配,在ARC - AGI基准测试中表现优于全局标量加权方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11090 2026-07-14 cs.CV 新提交

Why Low-Light Cameras Go Color Blind: Removing Color Bias in Raw Denoising

为何低光相机出现色盲现象:去除原始图像去噪中的颜色偏差

Mohammad Mohammadi, Sina Honari, Stavros Tsogkas, Tristan Aumentado-Armstrong, Michael S. Brown, Iqbal Mohomed, Konstantinos G. Derpanis, Alex Levinshtein, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) AI-Center Toronto, Samsung Electronics(多伦多人工智能中心,三星电子公司) York University(约克大学)

AI总结 研究低光原始图像去噪,提出无需相机校准的范式,引入偏差估计器网络预测黑电平误差,在多个数据集上评估表现出色,还发现SIDD数据集问题并提供校正基准。

Comments Accepted at ICCP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09138 2026-07-13 cs.RO 新提交

BeyondSight: Object Permanence for End-to-End Autonomous Driving

超越视野:端到端自动驾驶中的物体持久性

Sandro Papais, Letian Wang, Mudit Jain, Behnaz Rezaei, Steven L. Waslander

机构 * University of Toronto(多伦多大学) Qualcomm Technologies, Inc.(高通技术公司)

AI总结 研究针对自动驾驶中物体易被遮挡问题,提出超越视野框架,通过维持持久物体假设解耦物体存在与可观测性,引入nuScenes - Permanence用于训练评估,实验证明该框架显著提升遮挡推理能力,凸显物体持久性对自动驾驶的重要性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08932 2026-07-13 cs.CV 新提交

Vision Transformers Learn Gestalt-Like Figure-Ground Cues from Natural Images

视觉Transformer从自然图像中学习格式塔样的图形-背景线索

Matthias Tangemann, Benjamin Lo, Zygmunt Pizlo, Kaleem Siddiqi, Dirk B. Walther, Sven Dickinson

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) McGill University(麦吉尔大学) MILA(蒙特利尔学习算法研究院) UC Irvine(加州大学欧文分校)

AI总结 研究评估视觉Transformer中基于形状的图形-背景组织,通过拟合线性探针,用自然图像和人工刺激测试25个ViT,发现其能编码被包围性和凸性,自然图像训练的探针可零样本泛化,对称性结果有别,证明线索可从自然场景学,ViT是研究感知组织的有力模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07761 2026-07-10 cs.AI 新提交

Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning

对齐临床需求与人工智能能力:医学推理大语言模型综述

Qi Peng, Jiatong Li, Sirui Huang, Yiyang Jiang, Kaisong Gong, Ronger Ding, Shijie Ye, Changmeng Zheng, Yi Cai, Xiaobo Yang, Jin Huang, Xiao-Yong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Hong Kong University(香港大学) South China University of Technology(华南理工大学) University of Toronto(多伦多大学) Peking Union Medical College Hospital(北京地坛医院) West China Hospital, Sichuan University(四川大学华西医院)

AI总结 综述医学大语言模型在医疗领域的进展,提出双视角方法,连接临床实践与计算方法,建立五级能力方案并关联推理模式与医学任务,引入基准数据集并报告模型结果,讨论进展与挑战及未来方向。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11408 2026-07-10 cs.RO 新提交

Dynamic Execution Horizon Prediction for Chunk-based Robot Policies

基于分块的机器人策略的动态执行视界预测

Yuchi Zhao, Miroslav Bogdanovic, Arjun Sohal, Liyu Tao, Kourosh Darvish, Alán Aspuru-Guzik, Florian Shkurti, Animesh Garg

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Acceleration Consortium(加速联盟) Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达)

AI总结 提出DEHP方法,通过在线强化学习训练轻量级执行视界预测分支,在冻结预训练分块策略的情况下动态调整执行步数,显著提升高精度和长时域操作任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06845 2026-07-09 cs.CL 新提交

LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering

大语言模型对非裔美国英语的隐性纠正:通过激活引导来审计和减轻方言偏见

Huan Wu, Ali Emami, Muhammad Furquan Hassan, Osaretin Igbinoba, Osakpolor Idusuyi, Osamede Igbinoba, Faiza Khan Khattak, Laleh Seyyed-Kalantari

机构 * York University(约克大学) Vector Institute(向量研究所) Connected Minds(连接思维公司) Emory University(埃默里大学) Wilfrid Laurier University(威尔弗里德·劳里埃大学) University of Toronto(多伦多大学) University of Guelph(圭尔夫大学) Monark Health(莫纳克健康公司) CIFAR Solution Network(加拿大高级研究院解决方案网络)

AI总结 研究发现大语言模型会将非裔美国英语重写为标准美国英语,提出端到端框架审计和减轻偏见,审计用cDGI等方法,减轻偏见用激活引导,该方法比提示更有效,还发布了真实AAE平行语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07519 2026-07-09 cs.LG math.ST stat.TH 新提交

Gradient-free Riemannian Langevin Sampler

无梯度黎曼朗之万采样器

Ricardo Baptista, Olivier Zahm

机构 * University of Toronto(多伦多大学) UGA, Inria, CNRS, Grenoble INP*, LJK(格勒诺布尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、格勒诺布尔国立综合理工学院、数值模拟与知识工程实验室)

AI总结 研究多模态概率分布采样问题,提出无梯度黎曼朗之万采样器(GRiLS),通过引入黎曼度量改善探索,无需目标密度梯度评估,适用于复杂目标,用相互作用粒子系综估计均值和协方差,实证显示其混合效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06555 2026-07-08 cs.CV 新提交

ProxyPose: 6-DoF Pose Tracking via Video-to-Video Translation

ProxyPose:通过视频到视频转换进行六自由度姿态跟踪

Ruihang Zhang, Felix Taubner, Pooja Ravi, Kiriakos N. Kutulakos, David B. Lindell

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 研究旨在解决单目视频中6-DoF姿态跟踪问题,核心方法是将其转化为视频到视频转换,利用视频扩散模型生成代理视频,通过现成求解器恢复姿态。主要贡献是在无额外输入下实现高精度,且可扩展到多种场景。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06133 2026-07-08 cs.SE cs.AI 新提交

Property-Driven Synthetic Data Engineering for Data-Scarce Software Systems: Reflections from the Breast Cancer Domain

数据稀缺软件系统的属性驱动合成数据工程:来自乳腺癌领域的思考

Aurora Francesca Zanenga, Andrea Bombarda, Marsha Chechik, Saverio D'Amico, Rita De Sanctis, Alberto Zambelli, Claudio Menghi

机构 * University of Bergamo(博洛尼亚大学) University of Toronto(多伦多大学) Humanitas Clinical and Research Center, IRCCS(人类itas临床与研究中心) ASST Papa Giovanni XXIII(ASST圣若望二十三世医院)

AI总结 针对数据稀缺软件系统,提出属性驱动合成数据工程问题,通过与肿瘤学家合作及相关实验,识别多方面挑战,主张自动化软件工程研究应开发方法和工具来处理合成数据有效性属性相关事宜。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05615 2026-07-08 cs.LG 新提交

A Coin Flip Per Token: Bernoulli Sparse Steering of Large Language Models

每个令牌的抛硬币:大语言模型的伯努利稀疏控制

Nima Eshraghi, Lovedeep Gondara, Yuqing Huang, Sagarika Suresh, Leizer Teran, Jithin Pradeep, Xiaotong Xu, Fanny Chevalier

机构 * The Vanguard Group, Inc.(先锋集团公司) University of Toronto(多伦多大学)

AI总结 研究大语言模型控制问题,提出随机令牌控制和随机块控制方法,无需奖励模型或门控策略。实验表明,仅控制部分令牌就能恢复大部分密集控制效果且保持流畅性,揭示了SAE介导控制的速率限制特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05458 2026-07-08 cs.LG cs.AI 新提交

Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning

利用离线强化学习学习控制大语言模型智能体的执行框架

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

AI总结 研究提出将大语言模型智能体的执行框架视为可学习控制层,通过有限 horizon 的框架马尔可夫决策过程,利用离线强化学习训练轻量级控制器,在多领域实验中改进验证行为、提高任务质量,证明框架控制可学习且离线支持有局限。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05132 2026-07-08 cs.CY cs.CL 新提交

When Agents Lie: Premeditation, Persistence, and Exploitation in Repeated Games

智能体何时撒谎:重复博弈中的预谋、持续性与可利用性研究

Jerick Shi, Terry Jingcheng Zhang, Bernhard Schölkopf, Vincent Conitzer, Zhijing Jin

机构 * Carnegie Mellon University(卡内基梅隆大学) Vector Institute(向量研究所) University of Toronto(多伦多大学) EuroSafeAI

AI总结 本文针对大语言模型智能体行动前公示意图的诚信问题,设计三阶段n人重复博弈协议,评测前沿模型,发现其偏离公示行为多属预谋,不同模型对公示的语义理解不兼容。

Comments Best Paper Award at ICML NExT-Game Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04738 2026-07-07 stat.ML cs.AI cs.LG 新提交

Wasserstein Residuals: Learning Gradient Flows from Population Dynamics

Wasserstein残差:从种群动力学中学习梯度流

Markus Heinonen, Yair Shenfeld, Ricardo Baptista, Daniel Waxman, Dmitry Batenkov, Tim Cooijmans, Eli Bingham

机构 * Basis Research Institute(基础研究机构) Aalto University(艾尔沃斯大学) Brown University(布朗大学) University of Toronto(多伦多大学) MIT(麻省理工学院)

AI总结 针对传统Wasserstein梯度流JKO方法离散不灵活、计算成本高的问题,提出基于残差的新目标与无仿真粒子方法stitching,在轨迹推断基准上取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04708 2026-07-07 econ.TH cs.AI cs.CY cs.GT cs.HC 新提交

Strategic Buying Agents

战略性购买智能体

Mingyang Fu, Ming Hu

机构 * Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

AI总结 该研究面向自主代客购物场景,分三类信息场景设计有限购物窗口内的最优购买策略,经真实电商价格数据验证,大模型更适配场景选择而非直接购买决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04599 2026-07-07 cs.CV 新提交

Displacement Preserving Relational Distillation for Robust Medical Segmentation

用于稳健医学分割的位移保持关系蒸馏

Zhicheng Ding, Xinyu Chu, Jung Im Choi, Qing Tian, Tianyu Shi, Xiaoqian Jiang, Lijing Zhu, Qizhen Lan

机构 * Bowling Green State University(鲍灵格林州立大学) The University of Findlay(芬德利大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) University of Toronto(多伦多大学) University of Houston - Clear Lake(休斯顿大学清水湖分校) UTHealth Houston(德克萨斯大学健康科学中心休斯顿分校)

AI总结 针对准确3D医学分割受解剖变异性和高计算成本限制的问题,提出位移保持关系蒸馏方法,通过基于向量对齐蒸馏潜在解剖轨迹,集成到nnU-Net后在基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04535 2026-07-07 cs.LG stat.ML 新提交

ManifoldFlow: SPD-Relaxed Stiefel Layers with Learnable Singular Spectrum

流形流:具有可学习奇异谱的对称正定松弛斯蒂费尔层

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

AI总结 研究提出ManifoldFlow,通过\(W = Q S^{1/2}\)在斯蒂费尔流形上学习有界正谱,放松固定谱斯蒂费尔层约束,在部分实验中可学习的对称正定谱表现更好。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04528 2026-07-07 cs.AI 新提交

Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

测量多步语言模型智能体中工具诱导的信念差异

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

AI总结 研究多步语言模型智能体中工具对其信念的影响,引入信念展开诊断,定义跨工具信念差异并分解,通过实验表明工具设计是智能体评估中的实验变量。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04079 2026-07-07 cs.CV cs.AI cs.LG 新提交

Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

看一次就够了?用于3D问答的在线几何感知令牌剪枝

Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun

机构 * National Tsing Hua University(国立清华大学) Industrial Technology Research Institute ITRI(工业技术研究院) University of Toronto(多伦多大学) Atmanity Inc(Atmanity公司)

AI总结 针对3D问答中多模态大语言模型推理成本高的问题,提出在线令牌剪枝方法,利用深度和相机姿态投影到体素空间,识别重叠区域并剪枝冗余令牌,减少令牌使用,提升效率和性能。

Comments published at ICLR 2026 Workshop on Efficient Spatial Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03390 2026-07-07 cs.CV cs.GR 新提交

TemporalGS: Training-Free Plug-and-Play Acceleration for 3D Gaussian Splatting Rendering via Temporal Priors

TemporalGS:通过时间先验实现无训练即插即用的3D高斯点渲染加速

Yuhongze Zhou, Zihao Yang, Xinxin Zuo, Juwei Lu

机构 * McGill University(麦吉尔大学) University of Waterloo(滑铁卢大学) Concordia University(康考迪亚大学) University of Toronto(多伦多大学)

AI总结 研究针对3D高斯点渲染在高帧率和低延迟方面的挑战,提出TemporalGS,利用时间先验减少连续帧高斯预处理等操作冗余,有动态剔除和选择性渲染策略,可加速渲染且无需训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02338 2026-07-07 cs.DB cs.CL cs.IR cs.LG 新提交

HNSW with Accuracy Guarantees Using Graph Spanners

具有精度保证的HNSW:基于图Spanner的技术报告

Minghao Li, Raghav Mittal, Sanjivni Rana, Suraj Shetiya, Gautam Das, Nick Koudas

机构 * University of Toronto(多伦多大学) The University of Texas At Arlington(德克萨斯大学阿灵顿分校) IIT Bombay(博扬理工学院)

AI总结 提出Certify-then-Rectify框架,结合HNSW的快速启发式搜索与精确检索的严格性,通过无分布统计认证和极值理论估计图拉伸因子,实现平均速度与最坏情况正确性。

Comments 23 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02166 2026-07-03 cs.LG cs.AI 新提交

Dynamic Neural Graph Encoding of Inference Processes in Deep Weight Space

深度权重空间中推理过程的动态神经图编码

Di Wu, Huan Liu, Zhixiang Chi, Yuanhao Yu, Konstantinos N. Plataniotis, Yang Wang

机构 * University of Toronto(多伦多大学) National University of Singapore(新加坡国立大学) McMaster University(麦马斯特大学) Concordia University(康科迪亚大学)

AI总结 提出动态神经图编码器(DNG-Encoder),通过动态图表示神经网络参数并保留推理的时序特性,在INR分类任务上比现有方法提升约10%准确率。

Comments Published in Transactions on Machine Learning Research (TMLR), 2026. 28 pages, 5 figures

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01283 2026-07-03 cs.LG cs.AI 新提交

Scaling Laws for Grid-Based Approximate Nearest Neighbor Search in High Dimensions

高维空间中基于网格的近似最近邻搜索的缩放定律

Matthew J Liu, Wei Hang Zheng, Vidhan Purohit, Siqi Xie, Chieh-En Li, Jerry Li, Noah Flynn

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto, St. George(多伦多大学圣乔治校区) Independent Researcher(独立研究员) University of Waterloo(滑铁卢大学)

AI总结 本研究系统刻画了多探针网格算法在数据集大小N和维度d上的缩放行为,发现其在GloVe嵌入上具有恒定的维度缩放指数,优于图、树和分区方法,且索引成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31760 2026-07-02 cs.CV 新提交

Estimating Velocity and Spin of Spherical Objects from Rolling-Shutter Image(s)

从卷帘快门图像估计球体的速度

Wenjie Xue, Jun Yang, Jingmin Wang, Limin Shang

机构 * Epson Canada Ltd(爱普生加拿大有限公司) University of Toronto(多伦多大学)

AI总结 利用卷帘快门畸变作为时间信息源,提出一种无对应点的公式,通过反向投影框架中的几何一致性,从单帧图像估计快速运动球体的三维平动和角速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20299 2026-07-02 stat.ML cs.LG hep-ph physics.data-an 新提交

Statistical Properties of Training & Generalization

训练与泛化的统计特性

Itay Lavie, Noam Levi, Yonatan Kahn

机构 * John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Tel Aviv University(特拉维夫大学) Department of Physics, University of Toronto and Vector Institute(多伦多大学物理系和向量研究所)

AI总结 从物理学角度研究深度学习的关键特征和意外现象,回顾神经缩放定律及其与物理问题中约束和归纳偏置的相互作用。

Comments 32 pages, 3 figures. Part of the VERaiPHY initiative

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31591 2026-07-01 cs.LG cs.AI 新提交

Evil Spectra: How Optimisers can Amplify or Suppress Emergent Misalignment

邪恶光谱:优化器如何放大或抑制涌现性失调

Jason R. Brown, Patrick Leask, Lev McKinney

机构 * Astra Fellows Program(Astra Fellows 项目) University of Cambridge(剑桥大学) Durham University(杜伦大学) University of Toronto(多伦多大学)

AI总结 研究优化器选择对LLM涌现性失调的影响,发现优化器导致7倍失调率差异,Muon通过隐式正则化奇异值分布保持对齐,谱正则化可缓解失调。

详情

展开后加载摘要…

URL PDF HTML 收藏