Contextual Linear Activation Steering of Language Models
上下文线性激活引导的语言模型
机构 * UC San Diego(加州大学圣地亚哥分校) ; MIT(麻省理工学院) ; Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学Broad研究所)
AI总结 本文提出CLAS方法,通过动态调整线性激活引导强度,在有限标注数据下提升语言模型的专精能力,优于传统方法和ReFT、LoRA。
高校专区
上下文线性激活引导的语言模型
机构 * UC San Diego(加州大学圣地亚哥分校) ; MIT(麻省理工学院) ; Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学Broad研究所)
AI总结 本文提出CLAS方法,通过动态调整线性激活引导强度,在有限标注数据下提升语言模型的专精能力,优于传统方法和ReFT、LoRA。
光激活PARP1抑制剂的计算设计与实验验证
机构 * Department of Chemistry and Chemical Biology, Harvard University, Cambridge, MA, 02138(哈佛大学化学与生物化学系) ; Institute of Organic Chemistry and Biochemistry of the Czech Academy of Sciences, Flemingovo nám. 2, 160 00 Prague 6, Czech Republic(捷克科学院有机化学与生物化学研究所) ; Department of Materials Science and Engineering, Massachusetts Institute of Technology, Cambridge, MA, 02139(麻省理工学院材料科学与工程系)
AI总结 本文通过计算方法筛选出具有红移吸收光谱的PARP1光抑制剂候选物,并通过实验验证其光响应特性,展示了计算指导的筛选策略及当前研究的局限性。
量子核在医疗基础模型嵌入中的优势超过经典崩溃
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT Critical Data ; Fundación Valle del Lili(Valle del Lili基金会) ; Quantum Innovation Centre (Q.InC)(量子创新中心) ; Agency for Science, Technology and Research (A*STAR)(科技研究局) ; Institute of High Performance Computing (IHPC)(高性能计算研究所) ; Science, Mathematics and Technology Cluster(科学、数学和技术集群) ; Singapore University of Technology and Design(新加坡科技与设计大学) ; Université de Bordeaux(波尔多大学) ; Inserm U1219 ; Politecnico di Milano(米兰理工学院) ; Universidad del Cauca(卡利大学) ; Singapore Management University(新加坡管理大学) ; National Taiwan University Hospital(台湾大学医院)
AI总结 本文通过量子支持向量机在无噪声模拟中证明了量子核在二元保险分类中的优势,展示了量子核在保持非平凡召回率方面的有效性,同时揭示了量子核有效秩远超线性核。
多目标强化学习的无奖励视角
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文提出利用无奖励强化学习(RFRL)视角解决多目标强化学习(MORL)问题,通过引入RFRL的训练目标作为辅助任务,提升知识共享效率,实验表明其在多目标Gymnasium任务中表现更优。
Comments ICLR 2026
代理辅助的动态CAD模型设计
机构 * Independent Researcher(独立研究者) ; MIT(麻省理工学院)
AI总结 本文提出AADvark代理系统,能生成具有运动部件的复杂3D装配体,通过整合外部约束求解器和视觉反馈机制解决空间推理问题。
Comments 5 pages, 3 figures, published in CAIS'26
学习半空间交集的改进难度结果
机构 * Massachusetts Institute of Technology(麻省理工学院) ; ETH Zürich(苏黎世联邦理工学院)
AI总结 本文研究了在不恰当设置下学习半空间交集的下界,证明了学习ω(log log N)个半空间需要超多项式时间,并在统计查询框架下给出了无条件的难度结果。
Journal ref TheoretiCS, Volume 5 (2026), Article 8, 1-26
表征曲率调节大型语言模型中的行为不确定性
机构 * Brain and Cognitive Sciences(脑与认知科学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 研究通过分析表征曲率与token级熵的关系,揭示了大型语言模型中行为不确定性的调节机制,发现曲率变化可影响预测熵。
MarketBench:评估AI代理作为市场参与者
机构 * Boston University and the MIT Initiative on the Digital Economy(波士顿大学和MIT数字经济倡议)
AI总结 本文提出MarketBench基准,评估AI代理在市场中的自我评估能力与成本感知,通过软件工程基准和LLM实验发现自我校准不足,但补充信息后有所改善。
一个尺寸无法适配:在LLM投资建议中的启发式崩溃
机构 * Computer Science and Artificial Intelligence Laboratory(计算机科学与人工智能实验室) ; Massachusetts Institute of Technology(麻省理工学院) ; Sloan School of Management(斯隆管理学院)
AI总结 研究发现前沿LLM在投资建议中存在启发式崩溃,决策主要依赖自我报告的风险承受能力而非全面考虑,网络搜索部分缓解但未解决此问题。
用于可微图像表示的软各向异性图
机构 * Independent Researcher(独立研究者) ; MIT(麻省理工学院)
AI总结 本文提出软各向异性图(SAD),通过图像平面中的自适应站点参数化,实现高效可微图像表示。SAD通过softmax混合计算像素颜色,结合可学习温度参数,实现信息梯度保留与内容对齐边界。SAD在保持清晰边界的同时,提升了渲染效率和训练速度。
通过神经网络学习遗传回路模块:完整版本
机构 * Department of Mechanical Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程系) ; Department of Electrical and Computer Engineering and Department of Bioengineering, Northeastern University(东北大学电气与计算机工程系和生物工程系) ; Department of Mechanical Engineering and Biological Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程与生物工程系)
AI总结 本文提出一种模块化学习框架,利用系统组成结构知识,通过减少数据量识别模块输入输出函数,提升合成生物回路设计效率。
UMAP中吸引形状的探索:在降维中的嵌入力分析
机构 * Media Lab, MIT(MIT媒体实验室) ; Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)
AI总结 本文分析UMAP中吸引与排斥力对聚类形成和可视化的影响,比较UMAP与其他方法,揭示学习率退火的必要性及不同处理方式。
Comments 13 page + appendix
Journal ref Transactions on Machine Learning Research, 2026
MAGELLAN:元认知预测学习进度指导自主LLM代理在大规模目标空间中学习
机构 * Department of XXX, University of YYY, Location, Country(XXX部门,YYYY大学,地点,国家) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) ; Inria (Flowers), University of Bordeaux, France(Inria(Flowers),波尔多大学,法国) ; MIT, Computational Cognitive Science Lab, Cambridge, MA, USA(麻省理工学院,计算认知科学实验室,马萨诸塞州剑桥,美国)
AI总结 MAGELLAN通过元认知预测学习进度,使LLM代理在大规模目标空间中高效优先目标,提升学习效率和适应能力。
公平路由——重新思考多旅行商问题
机构 * Amazon(亚马逊公司) ; MIT Energy Initiative(麻省理工学院能源计划) ; Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)
AI总结 本文提出两种新的公平驱动多旅行商问题变体,通过均衡路线长度分配并控制总体成本,为min-max MTSP提供实用且灵活的替代方案。
Comments 30 pages
动态学习观测站揭示孟加拉国Satkhira地区的快速盐碱化
机构 * Department of Urban and Regional Planning, Khulna University of Engineering and Technology(工程与技术大学城市与区域规划系) ; Earth, Atmospheric and Planetary Sciences, Massachusetts Institute of Technology(麻省理工学院地球、大气与行星科学系)
AI总结 本文提出基于机器学习的框架,利用实地观测与Landsat数据预测和映射土壤盐碱化,揭示Satkhira地区土壤盐碱化空间变异性和时间变化特征。
情报安全成本:人工智能能力、网络风险与部署悖论
机构 * Massry School of Business, University at Albany, SUNY(阿尔巴尼大学马斯里商学院) ; MIT FutureTech(麻省理工学院未来科技)
AI总结 本文研究了企业在部署高能力AI系统时面临的治理与能力脱节问题,揭示了在高损失环境下,更强的AI能力可能导致部署减少,且治理成熟度不仅限制AI采纳,还影响能力提升转化为生产力部署的条件。
在混合专家调谐中保持长尾专家信息
机构 * Carnegie Mellon University(卡内基梅隆大学) ; MIT(麻省理工学院) ; UCSD(加州大学圣地亚哥分校) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 本文提出一种无需辅助损失的MoE SFT框架,通过偏置驱动稀疏化与始终活跃的门控凝结专家,有效保留长尾专家信息,实验显示在数学推理和常识问答基准上优于现有方法。
Comments 36 pages
应用增强型人工智能的射频干扰抑制
机构 * MIT Lincoln Laboratory(麻省理工学院林肯实验室)
AI总结 本文研究了利用深度学习提升射频传输中的干扰抑制性能,提出基于自回归变换器解码器模型的方法,展示了其在战术场景中的有效性及在轻量级GPU上的高效应用。
Comments 8 pages, 8 figures, Accepted to the 2nd IEEE International Conference on AI and Data Analytics (ICAD 2026)
参数效率不等于内存效率:重新思考设备端LLM适应的微调
机构 * MIT CSAIL(MIT计算机科学与人工智能实验室) ; Harvard SEAS(哈佛大学科学、工程与应用数学系)
AI总结 本文挑战参数效率等同于内存效率的假设,提出LARS框架通过约束激活子空间降低内存消耗,实验证明在不同设备上均能提升内存效率和性能。
训练-推断输入对齐在纵向视网膜图像预测中优于框架选择
机构 * Department of Ophthalmology, Massachusetts Eye and Ear, Harvard Medical School(眼科部门,麻省眼耳医院,哈佛医学院) ; Harvard Ophthalmology AI Lab, Schepens Eye Research Institute, Harvard Medical School(哈佛眼科人工智能实验室,斯科普斯眼研究所,哈佛医学院) ; Ocular Genomics Institute, Massachusetts Eye and Ear, Harvard Medical School(眼科基因组研究所,麻省眼耳医院,哈佛医学院) ; Broad Institute of MIT and Harvard, Cambridge, MA, USA(麻省理工学院与哈佛大学 Broad 实验室,剑桥,马萨诸塞州,美国)
AI总结 本文研究了在纵向视网膜图像预测中,训练-推断输入对齐比框架选择更重要,通过分析任务熵和后验集中度,提出生成复杂度应与任务条件后验的熵匹配,实验表明对齐输入能显著提升性能,而框架选择无临床意义差异。
HardFlow: 通过轨迹优化实现流匹配模型的硬约束采样
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文提出HardFlow框架,通过轨迹优化解决流匹配模型中硬约束采样问题,利用数值最优控制确保终端时间满足约束,并在统一框架下提升样本质量。
超越跨模态对齐:测量和利用模态差距在视觉-语言模型中
机构 * King’s College London(伦敦国王学院) ; University of Surrey(萨里大学) ; University of Oxford(牛津大学) ; MIT CSAIL(麻省理工学院CSAIL实验室) ; The Alan Turing Institute(阿兰·图灵研究院)
AI总结 本文提出通过测量和利用模态差距改进视觉-语言模型的下游任务,引入模态主导分数和自动可解释性度量,实现轻量级编辑和系统分析。
Comments accepted by ACL26-findings
NVILA:高效的前沿视觉语言模型
机构 * NVIDIA ; MIT(麻省理工学院) ; UC Berkeley(加州大学伯克利分校) ; UC San Diego(加州大学圣地亚哥分校) ; University of Washington(华盛顿大学) ; Tsinghua University(清华大学)
AI总结 NVILA通过'缩放后再压缩'方法提升效率与准确性,降低训练和推理成本,适用于高分辨率图像和长视频处理。
Comments CVPR 2025. Project page: https://z-lab.ai/projects/nvila/
本地非网格天气预报与多模态地球观测数据
机构 * Massachusetts Institute of Technology(麻省理工学院) ; IBM Research(IBM研究院) ; Shell Information Technology International Inc.(壳牌信息技术国际公司)
AI总结 本文提出一种多模态Transformer模型,通过端到端训练将网格化预报降尺度至非网格位置,提升局部天气预测精度,实验显示其优于多种非数据驱动和数据驱动的非网格预报方法。
AWQ:基于激活的权重量化用于LLM压缩与加速
机构 * MIT(麻省理工学院) ; Shanghai Jiao Tong University(上海交通大学) ; NVIDIA(英伟达) ; Tsinghua University(清华大学) ; UMass Amherst(马萨诸塞大学阿姆赫斯特分校)
AI总结 本文提出AWQ方法,通过识别重要权重通道减少量化误差,实现低比特权重量化,提升LLM的压缩与加速性能,并在多个基准测试中表现优异。
Comments MLSys 2024 Best Paper Award. Code available at: https://github.com/mit-han-lab/llm-awq
伙伴建模在循环智能体中出现(但只有在重要时)
机构 * University of Edinburgh(爱丁堡大学) ; Princeton University(普林斯顿大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 研究探讨了智能体在开放合作中自发形成伙伴建模的能力,发现其在任务分配能影响伙伴行为时自发产生结构化表示。
Journal ref Advances in Neural Information Processing Systems 39 (NeurIPS 2025)
在机器学习竞赛中基准黑客现象:建模、洞察与设计
机构 * Department of Economics, Dartmouth College(达特茅斯学院经济系) ; Sloan & CSAIL, Massachusetts Institute of Technology(麻省理工学院斯隆管理学院与计算机科学与人工智能实验室) ; Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)
AI总结 本文研究了机器学习竞赛中基准黑客现象,通过建模揭示其战略均衡,并通过实证支持理论预测,指出奖励结构对竞赛结果的影响。
SANDO:动态未知环境中的安全自主轨迹规划
机构 * Departments of Aeronautics and Astronautics, and Mechanical Engineering, Massachusetts Institute of Technology(航空工程与机械工程系,麻省理工学院) ; Department of Electronics, Automation, and Communications, Comillas ICAI(电子、自动化与通讯系,Comillas ICAI)
AI总结 SANDO通过热图A*全局规划器、混合整数二次规划和形式安全分析,在动态未知环境中实现安全轨迹规划,提升计算效率和安全性。
Comments 20 pages, 17 figures
AromaGen:基于多模态语言模型的交互式丰富嗅觉体验生成
机构 * MIT Media Lab(MIT媒体实验室) ; Harvard Graduate School of Design(哈佛设计研究生院) ; MIT CSAIL(MIT计算机科学与人工智能实验室)
AI总结 AromaGen利用多模态语言模型实现基于文本和视觉输入的实时嗅觉生成,通过迭代优化提升嗅觉混合物的自然度,达到与真实食物香气相似的水平。
教代理分步绘制一部分
机构 * TTI-Chicago(芝加哥大学技术研究所) ; University of Chicago(芝加哥大学) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
AI总结 本文提出一种分步生成矢量草图的方法,通过多轮过程-奖励强化学习训练多模态语言模型代理,利用新数据集ControlSketch-Part实现可解释、可控且局部可编辑的文本到矢量草图生成。