arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

2026-05-08 至 2026-05-08 共收录 13
2605.06656 2026-05-08 cs.LG cs.DM cs.ET math.OC

Why Global LLM Leaderboards Are Misleading: Small Portfolios for Heterogeneous Supervised ML

为何全球大语言模型排行榜具有误导性:异质监督学习的小微投资组合

Jai Moondra, Ayela Chughtai, Bhargavi Lanka, Swati Gupta

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT Sloan School of Management(麻省理工学院斯隆管理学院)

AI总结 本文分析了全球大语言模型排行榜的误导性,指出语言异质性导致传统排名方法失效,并提出(λ,ν)投资组合框架以解决异质性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06614 2026-05-08 cs.AI cs.CL

SkillOS: Learning Skill Curation for Self-Evolving Agents

SkillOS: 为自演化代理学习技能编目

Siru Ouyang, Jun Yan, Yanfei Chen, Rujun Han, Zifeng Wang, Bhavana Dalvi Mishra, Rui Meng, Chun-Liang Li, Yizhu Jiao, Kaiwen Zha, Maohao Shen, Vishy Tirumalashetty, George Lee, Jiawei Han, Tomas Pfister, Chen-Yu Lee

机构 * Google Cloud AI Research(谷歌云人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 SkillOS通过经验驱动的强化学习方法,解决自演化代理中复杂长期技能编目的学习问题,优于记忆-free和强记忆基线,在效果和效率上均表现优异,技能库逐步演变成更丰富的Markdown文件。

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06460 2026-05-08 cs.LG

MINER: Mining Multimodal Internal Representation for Efficient Retrieval

MINER:挖掘多模态内部表示以实现高效检索

Weien Li, Rui Song, Zeyu Li, Haochen Liu, Gonghao Zhang, Difan Jiao, Zhenwei Tang, Bowei He, Haolun Wu, Xue Liu, Ye Yuan

机构 * McGill University(麦吉尔大学) MIT - Massachusetts Institute of Technology(麻省理工学院) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩洛哥 bin Zayed 大学人工智能学院) Mila - Quebec AI Institute(Mila - 加拿大魁北克人工智能研究所)

AI总结 本文提出MINER,通过挖掘Transformer各层内部表示,融合多模态信号生成紧凑嵌入,提升检索性能,优于现有单向量检索器并在部分设置中缩小与晚交互基线的差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06320 2026-05-08 cs.MA cs.AI cs.CL

Improving the Efficiency of Language Agent Teams with Adaptive Task Graphs

通过自适应任务图提高语言代理团队的效率

Elizabeth Mieczkowski, Alexander Ku, Tiwalayo Eisape, Dilip Arumugam, John Matters, Katherine M. Collins, Ilia Sucholutsky, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) University of Cambridge(剑桥大学) MIT(麻省理工学院) New York University(纽约大学)

AI总结 本文提出LATTE框架,通过自适应任务图提升语言代理团队效率,减少资源消耗并提高协作准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06274 2026-05-08 cs.LG cs.CV

When Labels Have Structure: Improving Image Classification with Hierarchy-Aware Cross-Entropy

当标签具有结构时:通过层次感知交叉熵改进图像分类

April Chan, Davide D'Ascenzo, Sebastiano Cultrera di Montesano

机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) Department of Computer Science, University of Milan(米兰大学计算机科学系) Department of Control and Computer Engineering, Politecnico di Torino(都灵理工大学控制与计算机工程系) Eric and Wendy Schmidt Center, Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所埃里克和wendy Schmidt中心)

AI总结 本文提出层次感知交叉熵(HACE),通过整合已知的类别层次结构来改进图像分类,实验表明在多种架构和数据集上HACE在端到端训练和线性探测任务中均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06258 2026-05-08 cs.LG cs.AI

The Weight Gram Matrix Captures Sequential Feature Linearization in Deep Networks

权重格雷矩阵捕捉深度网络中的序列特征线性化

Taehun Cha, Daniel Beaglehole, Adityanarayanan Radhakrishnan, Donghun Lee

机构 * MIT Mathematics Broad Institute of MIT and Harvard(麻省理工学院数学Broad研究所)

AI总结 本文提出基于特征的框架,通过将权重更新与特征演变关联,揭示深度网络训练中权重格雷矩阵捕捉特征动态,并引入目标线性度量,展示深度网络如何逐步将表示转换为目标线性结构。

Comments 29 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15119 2026-05-08 cs.AI cs.CL cs.LG cs.RO

Flexible Agent Alignment with Goal Inference from Open-Ended Dialog

基于开放对话的目标推断的灵活代理对齐

Rachel Ma, Jingyi Qu, Andreea Bobu, Dylan Hadfield-Menell

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

AI总结 本文提出OU-AGs框架,通过开放对话中目标推断提升代理对齐能力,采用GOOD方法实现动态目标分布,提高多领域任务中的意图对齐效果。

Comments Previous version of the paper was titled: Open-Universe Assistance Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03725 2026-05-08 cs.LG

Optimal Control of Fluid Restless Multi-armed Bandits: A Machine Learning Approach

流体 restless 多臂老虎机的最优控制:一种机器学习方法

Dimitris Bertsimas, Cheol Woo Kim, José Niño-Mora

机构 * Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院斯隆管理学院) Operations Research Center, Massachusetts Institute of Technology(麻省理工学院运筹学中心) Departamento de Estadı́stica, Universidad Carlos III de Madrid(马德里卡斯蒂利亚-拉曼查大学统计系)

AI总结 本文提出了一种机器学习框架,用于解决具有状态方程的流体 restless 多臂老虎机问题,通过非线性变换和最优分类树学习高效的状态反馈策略,展示了在设备维护、传染病控制和渔业管理中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05678 2026-05-08 cs.AI

Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering

风险链:大型推理模型中的安全故障及通过自适应多原则引导的缓解

Xiaomin Li, Jianheng Hou, Zheyuan Deng, Zhiwei Zhang, Taoran Li, Binghang Lu, Bing Hu, Yunhan Zhao, Yuexing Hao

机构 * Harvard University(哈佛大学) University of Southern California(南加州大学) Brown University(布朗大学) Pennsylvania State University(宾夕法尼亚州立大学) Texas A&M University(德克萨斯阿姆大学) Purdue University(普渡大学) University of California, Irvine(加州大学 Irvine 分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 研究发现大型推理模型在推理轨迹中存在额外安全风险,提出自适应多原则引导方法降低不安全内容出现率,提升整体安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05573 2026-05-08 astro-ph.IM cs.AI

AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification

AstroAlertBench: 评估多模态大语言模型在天文学分类中的准确性、推理和诚实性

Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu, Facundo Perez Paolino, Luke Handley, Theophile Jegou du Laz, Ricky Nilsson, Alice Zou, Matthew Graham, Ashish Mahabal

机构 * California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院) Purdue University(普渡大学)

AI总结 本文提出AstroAlertBench,通过多阶段逻辑链评估多模态大语言模型在天文学事件分类中的性能,揭示高精度与模型诚实性之间的矛盾,并引入人机协同评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01120 2026-05-08 cs.AI math.CO

New Bounds for Zarankiewicz Numbers via Reinforced LLM Evolutionary Search

通过强化LLM进化搜索获得Zarankiewicz数的新界

Jay Bhan, Nicole Nobili, Patrick Langer

机构 * Massachusetts Institute of Technology(麻省理工学院) ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

AI总结 本文首次确定三个Zarankiewicz数的精确值,并通过强化LLM进化搜索方法为41个数建立下界,展示了LLM引导的进化搜索在数学研究中的潜力。

Comments *Jay Bhan and Nicole Nobili contributed equally to this work as first authors, and their order was determined via coin flip

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11229 2026-05-08 cs.AI cs.LG

Latent Generative Solvers for Generalizable Long-Term Physics Simulation

潜在生成求解器用于通用的长期物理模拟

Zituo Chen, Sili Deng

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出潜在生成求解器(LGS),通过物理变分自编码器、分层流强迫变换器和训练中的输入噪声,实现了对异构PDE家族的泛化和长序列稳定性,有效提升了物理模拟的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18875 2026-05-08 cs.CV

Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation

稀疏视频生成2:通过语义感知排列加速视频生成

Shuo Yang, Haocheng Xi, Yilong Zhao, Muyang Li, Jintao Zhang, Han Cai, Yujun Lin, Xiuyu Li, Chenfeng Xu, Jianfei Chen, Song Han, Kurt Keutzer, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) MIT(麻省理工学院) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 本文提出SVG2框架,通过语义感知排列提升视频生成的准确性和效率,实现生成质量与效率的帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏