arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

共收录 210
2505.09603 2026-06-23 cs.RO cs.LG 版本更新

DataMIL: Selecting Data for Robot Imitation Learning with Datamodels

DataMIL: 使用数据模型为机器人模仿学习选择数据

Shivin Dass, Alaa Khaddaj, Logan Engstrom, Aleksander Madry, Andrew Ilyas, Roberto Martín-Martín

机构 * UT Austin(得克萨斯大学) MIT(麻省理工学院) Stanford University(斯坦福大学)

AI总结 提出DataMIL框架,基于数据模型端到端选择对任务性能提升最大的数据点,避免基于人类质量标准的过滤,通过替代损失函数避免环境交互,在60+模拟和真实操作任务中验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07397 2026-06-23 cs.LG 版本更新

Aligning AI-driven discovery with human intuition

使AI驱动的发现与人类直觉对齐

Kevin Zhang, Judah Goldfeder, Hod Lipson

机构 * Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学)

AI总结 针对AI发现的状态变量缺乏物理意义的问题,提出一种无需先验知识即可提取更符合人类直觉表示的新原则,并在多个系统上验证其与人类选择的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10873 2026-06-19 cs.CV cs.AI 版本更新

CADBench: A Multimodal Benchmark for AI-Assisted CAD Program Generation

CADBench:一个用于AI辅助CAD程序生成的多模态基准

Anna C. Doris, Jacob Thomas Sony, Ghadi Nehme, Era Syla, Amin Heyrani Nobari, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出CADBench,一个统一的多模态CAD程序生成基准,包含18000个样本和六类基准,评估11种视觉语言模型,揭示了CAD程序生成中的三种常见失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25702 2026-06-19 cs.CL 版本更新

S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation

S2D2:通过免训练自我推测实现扩散LLM的快速解码

Ligong Han, Hao Wang, Han Gao, Kai Xu, Akash Srivastava

机构 * Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Iowa State University(爱荷华州立大学) Core AI, IBM(IBM核心AI)

AI总结 提出S2D2,一种免训练的自我推测解码框架,通过将块扩散模型在块大小为1时变为自回归模型,实现草稿与验证角色复用,在不增加训练或测试计算下提升解码速度与准确性。

Comments Code is available at https://github.com/phymhan/S2D2

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15819 2026-06-19 cs.CV 版本更新

VideoSketcher: Sequential Sketch Generation Using Video Model Priors

VideoSketcher:利用视频模型先验的序列草图生成

Hui Ren, Yuval Alaluf, Omer Bar Tal, Alexander Schwing, Antonio Torralba, Yael Vinker

机构 * MIT(麻省理工学院)

AI总结 提出VideoSketcher方法,结合LLM的语义规划与视频扩散模型的时序渲染,通过两阶段微调从少量样本学习笔画顺序与风格,生成高质量序列草图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14696 2026-06-19 cs.LG 版本更新

A Critical Look at Targeted Instruction Selection: Disentangling What Matters (and What Doesn't)

对目标指令选择的批判性审视:厘清什么重要(以及什么不重要)

Nihal V. Nayak, Paula Rodriguez-Diaz, Neha Hulkund, Sara Beery, David Alvarez-Melis

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) Kempner Institute(凯门研究所)

AI总结 本文系统解构指令微调中目标指令选择的两大核心要素——数据表示与选择算法,发现基于梯度的表示结合贪心轮询选择在低预算下表现最佳,但收益随预算增加而减弱,并统一了多种算法为近似距离最小化。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19893 2026-06-19 cs.LG 版本更新

EQPO: Equitable Group Relative Policy Optimization for Clinical Reasoning

EQPO: 面向临床推理的公平群体相对策略优化

Shiqi Dai, Wei Dai, Jiaee Cheong, Paul Pu Liang

机构 * MIT(麻省理工学院) Harvard University(哈佛大学)

AI总结 提出EQPO分层强化学习方法,通过自适应重加权样本促进异质临床人群的均衡学习,在7个诊断基准上降低F1标准差43.9%,缩小预测公平差距27.2%。

Comments Accepted as Oral on NeurIPS 2025 GenAI4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12850 2026-06-18 cs.AR cs.LG cs.SY eess.SY hep-ex 版本更新

KANELÉ: Kolmogorov-Arnold Networks for Efficient LUT-based Evaluation

KANELÉ:基于Kolmogorov-Arnold网络的高效LUT评估

Duc Hoang, Aarush Gupta, Philip Harris

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出KANELÉ框架,利用Kolmogorov-Arnold网络(KAN)的独特性质,通过量化与剪枝协同优化,首次系统实现FPGA上的高效LUT映射,相比先前方法加速高达2700倍并节省大量资源。

Comments International Symposium on Field-Programmable Gate Arrays 2026 (ISFPGA'2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03734 2026-06-18 cs.DS cs.LG 版本更新

How fast can you find a good hypothesis?

你能多快找到一个好的假设?

Anders Aamand, Maryam Aliakbarpour, Justin Y. Chen, Sandeep Silwal

机构 * BARC, University of Copenhagen(巴尔的效力研究所,哥本哈根大学) Rice University(里士满大学) MIT University of Wisconsin-Madison(麻省理工学院,威斯康星大学麦迪逊分校)

AI总结 研究假设选择问题,提出一种运行时间为poly(n)的混合输出算法,达到C=3-2/n的近似保证,并将正确算法的运行时间改进为Õ(n/(δε²))。

Comments Abstract abridged to meet arxiv requirements. This is the full version of a paper appearing at COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23851 2026-06-18 cs.CL cs.AI cs.SC 版本更新

ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark

ASyMOB:代数符号数学运算基准

Michael Shalyt, Rotem Elimelech, Ido Kaminer

机构 * MIT(麻省理工学院) Technion - Israel Institute of Technology(技术学院-以色列理工学院)

AI总结 提出ASyMOB基准,包含35,368个符号数学问题,通过扰动测试揭示大模型在符号数学推理中的鲁棒性不足,并发现LLM与CAS的互补潜力。

Comments Published in ICML2026: https://icml.cc/virtual/2026/poster/63549 Code repository: https://github.com/RamanujanMachine/ASyMOB Complete benchmark dataset: https://huggingface.co/datasets/Shalyt/ASyMOB-Algebraic_Symbolic_Mathematical_Operations_Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21258 2026-06-18 quant-ph cs.CC cs.LG 版本更新

Provable quantum speedups for computing persistence in topological data analysis

可证明的量子加速用于拓扑数据分析中的持久性计算

Casper Gyurik, Alexander Schmidhuber, Robbie King, Vedran Dunjko, Ryu Hayakawa

机构 * applied Quantum algorithms (aQa), Leiden University, 2300 RA Leiden, The Netherlands Center for Theoretical Physics, Massachusetts Institute of Technology, Cambridge, USA Department of Computing Yukawa Institute for Theoretical Physics \& The Hakubi Center, Kyoto University, Japan

AI总结 提出一种高效量子算法,用于判断拓扑数据分析中洞的持久性,并证明该问题为BQP_1-hard,暗示在标准复杂性假设下存在指数级量子加速。

Comments 17 pages

Journal ref PRX Quantum 7, 020361 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10635 2026-06-17 cs.AI cs.LG 版本更新

OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization

OmniSapiens: 一种通过异质性感知相对策略优化进行社会行为处理的基础模型

Keane Ong, Sabri Boughorbel, Luwei Xiao, Chanakya Ekbote, Wei Dai, Ao Qu, Jingyao Wu, Rui Mao, Ehsan Hoque, Erik Cambria, Gianmarco Mengaldo, Paul Pu Liang

机构 * Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Prince Sattam bin Abdulaziz University(普森·萨塔姆·本·阿卜杜勒阿齐兹大学) University of Rochester(罗切斯特大学)

AI总结 针对行为数据异质性导致的训练不平衡问题,提出Omnisapiens-7B 2.0基础模型,采用异质性感知相对策略优化(HARPO)方法,在10个行为任务和5个零样本泛化基准上取得最佳性能。

Comments Accepted to ICML 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04704 2026-06-17 q-bio.QM cs.AI cs.CV 版本更新

SPATIA: Multimodal Generation and Prediction of Spatial Cell Phenotypes

SPATIA: 空间细胞表型的多模态生成与预测

Zhenglun Kong, Mufan Qiu, John Boesen, Xiang Lin, Sukwon Yun, Tianlong Chen, Manolis Kellis, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学学校生物医学信息学系) Department of Computer Science, University of North Carolina(北卡罗来纳大学计算机科学系) Department of Computer Science, Massachusetts Institute of Technology(麻省理工学院计算机科学系)

AI总结 提出SPATIA模型,融合细胞形态、基因表达和空间上下文,通过置信感知流匹配和形态-谱对齐实现多尺度生成与预测,在12项任务中优于18个基线模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05790 2026-06-17 cs.IT cs.LG math.IT stat.ML 版本更新

Price of metric universality in vector quantization is at most 0.11 bit

向量量化中度量普适性的代价至多为0.11比特

Alina Harbuzova, Or Ordentlich, Yury Polyanskiy

机构 * Massachusetts Institute of Technology(麻省理工学院) Hebrew University of Jerusalem(耶路撒冷希伯来大学) University of California, San Diego(加州大学圣地亚哥分校)

AI总结 本文证明存在一个通用码本,对于所有可能的X统计量,在W为高斯时,其性能至少与速率每维度降低0.11比特的X自适应水填充码本相当。

Comments 41 page, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26633 2026-06-17 cs.RO cs.AI cs.LG cs.SY eess.SY 版本更新

OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction

OmniRetarget:面向人形全身运动操控与场景交互的交互保持数据生成

Lujie Yang, Xiaoyu Huang, Zhen Wu, Angjoo Kanazawa, Pieter Abbeel, Carmelo Sferrazza, C. Karen Liu, Rocky Duan, Guanya Shi

机构 * Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室) MIT(麻省理工学院) UC Berkeley(伯克利大学) Stanford University(斯坦福大学) CMU(卡内基梅隆大学)

AI总结 提出OmniRetarget引擎,通过交互网格显式建模并保持智能体、地形和物体间的空间与接触关系,将人类运动重定向为机器人运动,生成高质量轨迹以训练强化学习策略,实现长时间跑酷和操控技能。

Comments Project website: https://omniretarget.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05963 2026-06-16 cs.LG 版本更新

Next-Latent Prediction Transformers Learn Compact World Models

下一潜在预测变换器学习紧凑世界模型

Jayden Teoh, Manan Tomar, Kwangjun Ahn, Edward S. Hu, Tim Pearce, Pratyusha Sharma, Akshay Krishnamurthy, Riashat Islam, Alex Lamb, John Langford

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院)

AI总结 提出NextLat方法,通过潜在空间中的自监督预测训练变换器学习紧凑世界模型,提升泛化能力和推理效率。

Comments Microsoft Research Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11320 2026-06-16 cs.LG cs.AI cs.DC math.OC stat.ML 版本更新

Optimizing LLM Inference: Fluid-Guided Online Scheduling with Memory Constraints

优化大语言模型推理:带有内存约束的流引导在线调度

Ruicheng Ao, Gan Luo, David Simchi-Levi, Xinshang Wang

机构 * Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Alibaba Group(阿里巴巴集团)

AI总结 本文提出流引导在线调度方法,通过等待阈值算法和嵌套等待算法,在内存约束下优化大语言模型推理的延迟和容量,减少过载时的延迟。

Comments 79 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23952 2026-06-16 stat.ML cs.LG nlin.CD 版本更新

Conditional Score-Based Modeling of Effective Langevin Dynamics

基于条件分数的有效朗之万动力学建模

Ludovico T. Giorgini

机构 * Department of Mathematics, Massachusetts Institute of Technology(数学系,麻省理工学院)

AI总结 提出一种基于有限时间转移密度条件分数的随机降阶模型校准方法,通过最小二乘拟合从数据中推断漂移和扩散系数,避免轨迹微分或状态空间划分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08029 2026-06-16 gr-qc astro-ph.IM cs.CV 版本更新

Dynamic Black-hole Emission Tomography with Physics-informed Neural Fields

基于物理信息神经场的动态黑洞发射断层成像

Berthy T. Feng, Andrew A. Chael, David Bromley, Aviad Levis, William T. Freeman, Katherine L. Bouman

机构 * Caltech(加州理工学院) MIT(麻省理工学院) NSF IAIFI(国家科学基金会IAIFI) Princeton University(普林斯顿大学) Niels Bohr International Academy(尼尔斯·玻尔国际学院) University of Toronto(多伦多大学)

AI总结 提出PI-DEF方法,利用可微神经渲染从EHT测量数据中联合重建4D发射率场和3D速度场,以软约束方式引入物理信息,在模拟数据上显著优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16273 2026-06-16 cs.RO 版本更新

GenZ-LIO: Generalizable LiDAR-Inertial Odometry Beyond Confined--Open Boundaries

GenZ-LIO: 超越受限与开放边界的可泛化激光雷达-惯性里程计

Daehan Lee, Hyungtae Lim, Seongjun Kim, Soonbin Rho, Changhyeon Lee, Sanghyun Park, Junwoo Hong, Eunseon Choi, Hyunyoung Jo, Soohee Han

机构 * Computational Control Engineering Laboratory (CoCEL), Department of Convergence IT Engineering and Electrical Engineering, Pohang University of Science and Technology (POSTECH), Pohang 37673, South Korea(convergence 信息技术工程与电气工程系 计算控制工程实验室,POSTECH 首尔大学(Pohang University of Science and Technology), Pohang 37673, South Korea) Laboratory for Information & Decision Systems (LIDS), Massachusetts Institute of Technology, Cambridge, MA 02139, USA(信息与决策系统实验室,麻省理工学院(Massachusetts Institute of Technology), Cambridge, MA 02139, USA)

AI总结 提出GenZ-LIO框架,通过尺度自适应体素化、混合度量状态更新和体素剪枝对应搜索,解决受限与开放空间过渡导致的鲁棒性和效率下降问题,在42个序列上保持稳定估计。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19172 2026-06-16 cs.LG 版本更新

Online Realizable Regression and Applications for ReLU Networks

在线可实现回归及其在ReLU网络中的应用

Ilan Doron-Arad, Idan Mehalel, Elchanan Mossel

机构 * Massachusetts Institute of Technology(麻省理工学院) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

AI总结 研究对抗模型下满足近似三角不等式的损失函数的可实现在线回归,提出熵势方法通过覆盖数上界化缩放Littlestone维数,并应用于Lipschitz回归和ReLU网络,揭示回归与分类的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10031 2026-06-16 cs.LG 版本更新

Graph Learning Should Move Beyond Restrictive Views of Spectral and Message-Passing GNNs

图学习应超越对谱图神经网络和消息传递图神经网络的狭隘观点

Antonis Vasileiou, Juan Cervino, Pascal Frossard, Charilaos I. Kanatsoulis, Christopher Morris, Michael T. Schaub, Pierre Vandergheynst, Zhiyang Wang, Guy Wolf, Ron Levie

机构 * RWTH Aachen University(亚琛工业大学) Massachusetts Institute of Technology(麻省理工学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Stanford University(斯坦福大学) University of California San Diego(加州大学圣地亚哥分校) Univ. de Montréal(蒙特利尔大学) Mila(Mila人工智能研究所) Technion – Israel Institute of Technology(技术学院–以色列理工学院)

AI总结 本文澄清了谱图神经网络与消息传递图神经网络的异同,提出基于特征基对称性的谱GNN精确定义,并倡导统一理论框架以推动图学习发展。

Comments 44 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18227 2026-06-16 cs.LG cs.AI 版本更新

Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality

Token缩减应超越生成模型中的效率——从视觉、语言到多模态

Zhenglun Kong, Yize Li, Fanhu Zeng, Lei Xin, Shvat Messica, Xue Lin, Pu Zhao, Manolis Kellis, Hao Tang, Marinka Zitnik

机构 * Harvard University(哈佛大学) Northeastern University(东北大学) CAS(中国科学院) Wuhan University(武汉大学) MIT(麻省理工学院) Peking University(北京大学)

AI总结 本文提出Token缩减应超越传统效率优化,成为生成模型的基础原则,通过减少冗余token来促进多模态融合、缓解幻觉、维持长输入连贯性并提升训练稳定性。

Comments Project page: https://github.com/ZLKong/Awesome-Collection-Token-Reduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04061 2026-06-16 cs.RO cs.CV 版本更新

CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos

CLAP: 从人类视频中学习视觉-语言-动作模型的对比潜在动作预训练

Chubin Zhang, Jianan Wang, Zifeng Gao, Yue Su, Tianru Dai, Cai Zhou, Jiwen Lu, Yansong Tang

机构 * Tsinghua University(清华大学) Astribot University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出CLAP框架,通过对比学习将人类视频与机器人动作词汇对齐,利用伪标签训练VLA模型,实现从人类视频到机器人执行的有效技能迁移。

Comments The code is available at: https://github.com/LinShan-Bin/OpenCLAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18714 2026-06-16 cs.RO cs.AI cs.LG 版本更新

Explainable deep learning improves human mental models of self-driving cars

可解释深度学习提升人类对自动驾驶汽车的心理模型

Eoin M. Kenny, Akshay Dharmavaram, Sang Uk Lee, Tung Phan-Minh, Shreyas Rajesh, Yunqing Hu, Laura Major, Momchil S. Tomov, Julie A. Shah

机构 * Computer Science & Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL),麻省理工学院) Motional AD Inc.(Motional AD公司) Department of Psychology and Center for Brain Science, Harvard University(心理学系和大脑科学中心,哈佛大学) Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(航空与宇航系,麻省理工学院)

AI总结 提出概念包装网络(CW-Net),在真实自动驾驶车上实现可解释规划,通过因果性概念解释提升驾驶员对车辆行为的预测能力,尤其在意外场景中。

Comments MST & JAS contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10966 2026-06-15 cs.LG cs.AI cs.CV eess.IV 版本更新

Interpretable Alzheimer's Diagnosis via Multimodal Fusion of Regional Brain Experts

可解释的阿尔茨海默病诊断:基于区域脑专家的多模态融合

Farica Zhuang, Shu Yang, Dinara Aliyeva, Zixuan Wen, Duy Duong-Tran, Christos Davatzikos, Tianlong Chen, Song Wang, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出MREF-AD多模态区域专家融合模型,采用混合专家框架将各模态脑区域视为独立专家,通过门控网络学习个性化融合权重,实现可解释的AD诊断。

Comments Published at IEEE ICHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07530 2026-06-15 cs.DL cs.AI cs.CY cs.SI 版本更新

The Shrinking Lifespan of LLMs in Science

科学领域中LLM的生命周期缩短

Ana Trišović

机构 * Computer Science & Artificial Intelligence Laboratory(计算机科学与人工智能实验室) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本研究通过分析62个LLM在超过10万篇引用论文中的科学采纳轨迹,发现模型的生命周期主要由发布年份决定,且每个后续发布年份的峰值时间和寿命分别缩短27%和23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14033 2026-06-15 cs.LG cs.CR 版本更新

Private Prediction via PAC Privacy

通过PAC隐私实现私有预测

Xiaochen Zhu, Mayuri Sridhar, Srinivas Devadas

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 针对API场景下的私有预测,提出基于PAC隐私的实例级噪声校准方法,实现自适应查询下互信息线性累积,在CIFAR-10上以极低预算达到高精度,并支持通过蒸馏发布可公开查询的模型。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18307 2026-06-12 cs.CL 版本更新

Reasoning Models Know What's Important, and Encode It in Their Activations

推理模型知道什么重要,并在其激活中编码

Yaniv Nikankin, Martin Tutek, Tomer Ashuach, Jonathan Rosenfeld, Yonatan Belinkov

机构 * Technion(技术离子大学) University of Zagreb, FER(扎格雷布大学,FER) MIT(麻省理工学院) Kempner Institute, Harvard(哈佛大学凯普纳研究所)

AI总结 通过分析模型激活而非仅依赖推理链文本,发现激活能更有效识别关键推理步骤,且模型在生成后续步骤前已内部编码步骤重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02524 2026-06-12 cs.CL cs.FL cs.LG 版本更新

Unraveling Syntax: Language Modeling and the Substructure of Grammars

解析句法:语言建模与语法的子结构

Laura Ying Schulz, Daniel Mitropolsky, Tomaso Poggio

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文研究语言模型在上下文无关语法子结构上的学习行为,证明损失函数在顶层子语法上线性递归,并发现参数化模型并行学习子语法,子语法预训练能提升小模型性能并改善内部表征。

Comments Equal contribution by LYS and DM. Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏