arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

共收录 2206
2605.07098 2026-05-19 cs.LG physics.comp-ph

CarCrashNet: A Large-Scale Dataset and Hierarchical Neural Solver for Data-Driven Structural Crash Simulation

CarCrashNet:一个大规模数据集和分层神经求解器用于数据驱动的结构碰撞仿真

Mohamed Elrefaie, Dule Shu, Matthew Klenk, Faez Ahmed

机构 * MIT(麻省理工学院) Toyota Research Institute(丰田研究院) Future Product Innovation(未来产品创新)

AI总结 本文提出CarCrashNet数据集和分层神经求解器,用于数据驱动的结构碰撞仿真,包含14000多个碰撞模拟和825辆整车碰撞模拟,通过开源求解器验证并评估了基于机器学习的求解器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02667 2026-05-19 cs.CV cs.LG

Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation

统一对比学习与生成目标以实现视觉理解和文本到图像生成

Chao Li, Tianhong Li, Sai Vidyaranya Nuthalapati, Hong-You Chen, Satya Narayan Shukla, Jianpeng Cheng, Yonghuan Yang, Jun Xiao, Xiangjun Fan, Aashu Singh, Dina Katabi, Shlok Kumar Mishra

机构 * MIT Computer Science \& Artificial Intelligence Laboratory(Meta AI) Meta AI

AI总结 本文提出DREAM框架,通过Masking Warmup解决对比学习与文本到图像生成的矛盾,提升模型在多个任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05993 2026-05-19 cs.LG cs.AI

Diamond Maps: Efficient Reward Alignment via Stochastic Flow Maps

钻石映射:通过随机流映射实现高效的奖励对齐

Peter Holderrieth, Douglas Chen, Luca Eyring, Ishin Shah, Giri Anantharaman, Yutong He, Zeynep Akata, Tommi Jaakkola, Nicholas Matthew Boffi, Max Simchowitz

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出钻石映射,一种通过随机流映射实现高效奖励对齐的生成模型,能够在推理时对任意奖励进行准确对齐,提升模型适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02236 2026-05-19 cs.RO cs.LG cs.NE cs.SY eess.SY

Adaptive Control in Autonomous Driving via Real-Time Recurrent RL

通过实时递归强化学习实现自动驾驶中的自适应控制

Julian Lemmel, Felix Resch, Mónika Farsang, Ramin Hasani, Daniela Rus, Radu Grosu

机构 * TU Wien(维也纳技术大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Liquid AI

AI总结 本文研究了通过实时递归强化学习(RTRRL)对自动驾驶预训练控制策略进行在线微调,结合离线行为克隆与在线RTRRL微调,以适应部署时的分布偏移。在CarRacing模拟和1:10比例的RoboRacer平台上的实验验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16287 2026-05-19 physics.optics cond-mat.mtrl-sci cs.LG physics.app-ph

Active learning for photonic crystals

光子晶体的主动学习

Ryan Lopez, Charlotte Loh, Rumen Dangovski, Marin Soljačić

机构 * Department of Physics, Massachusetts Institute of Technology, Cambridge, Massachusetts, USA(麻省理工学院物理系) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology, Cambridge, Massachusetts, USA(麻省理工学院电气工程与计算机科学系)

AI总结 本文提出基于分析的LL-BNN与不确定性驱动采样结合的方法,用于加速光子带隙预测,通过聚焦高不确定性区域减少训练数据需求,提升光子晶体拓扑优化效率。

Comments 8 pages, 7 figures, accepted to Optics Express; updated version after reviewer comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23978 2026-05-19 cs.LG math.OC stat.ML

Assured autonomy: How operations research powers and orchestrates generative AI systems

保障自主性:如何用运筹学赋能和协调生成式AI系统

Tinglong Dai, David Simchi-Levi, Michelle Xiao Wu, Yao Xie

机构 * Carey Business School, Johns Hopkins University(约翰霍普金斯大学卡里商学院) Data Science and AI Institute, Johns Hopkins University(约翰霍普金斯大学数据科学与人工智能研究院) Institute for Data, Systems and Society, Operations Research Center, Department of Civil and Environmental Engineering, Massachusetts Institute of Technology(麻省理工学院数据、系统与社会研究所,运筹学中心,土木与环境工程系) Purdue University(普渡大学) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H.米尔顿·斯图尔特工业与系统工程学院)

AI总结 本文探讨生成式AI在向自主决策系统转变过程中,如何通过运筹学方法提升系统的可行性、鲁棒性和风险控制能力。

Comments Authors are listed alphabetically; Production and Operations Management (POM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16416 2026-05-19 cs.CV cs.AI

SSL4RL: Revisiting Self-supervised Learning as Intrinsic Reward for Visual-Language Reasoning

SSL4RL:重新审视自监督学习作为视觉语言推理的内在奖励

Xiaojun Guo, Runyu Zhou, Yifei Wang, Qi Zhang, Chenheng Zhang, Stefanie Jegelka, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Yisen Wang

机构 * Peking University(北京大学) MIT(麻省理工学院) TUM(技术大学(TUM)) Meituan(美团) Peking University School of CIT, MCML, MDSIEECS and CSAIL(北京大学计算机学院、MCML、MDSIEECS以及CSAIL)

AI总结 本文提出SSL4RL框架,利用自监督学习任务作为强化学习的可验证奖励,提升视觉语言推理性能,并通过实验验证其在多模态模型对齐中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19590 2026-05-19 cs.AI cs.CY cs.LG

Position: AI Evaluations Should be Grounded on a Theory of Capability

位置:AI评估应基于能力理论

Nathanael Jo, Ashia Wilson

机构 * MIT EECS, Cambridge, USA(麻省理工学院电子工程与计算机科学系,剑桥,美国)

AI总结 本文提出AI评估应基于明确的能力理论,通过实验证明评估结果受建模假设影响显著,提出Evaluation Card促进透明化评估实践。

Comments ICML 2026 Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16623 2026-05-19 cs.CY cs.AI

To Trust or Not to Trust: Authors' Response to AI-based Reviews

信任还是不信任:作者对基于AI的评论的回应

César Leblanc, Lukas Picek

机构 * École Normale Supérieure(巴黎高等师范学院) Sorbonne University(索邦大学) University of West Bohemia(西波什埃大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文通过两项研究探讨作者对AI辅助评审的使用和看法,发现大多数作者认为AI反馈有用,但不将其等同于人类评审,且更倾向于在提交前使用AI作为内部工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16622 2026-05-19 cs.LG math.OC stat.ML

Does Weight Decay Enhance Training Stability?

权重衰减是否增强训练稳定性?

Marius Saether, Amir Kolic, Tomaso Poggio, Pierfrancesco Beneventano

机构 * NTNU(挪威技术大学) MIT(麻省理工学院)

AI总结 本文研究权重衰减对训练动态稳定性的影响机制,发现其通过参数空间动态和损失尖锐度的变化影响训练稳定性,并揭示了架构依赖的相变现象。

Comments 24 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16571 2026-05-19 stat.ML cs.AI cs.LG

Isotonic Survival Regression: Calibrated Survival Distributions from Deep Cox Models

非递减生存回归:从深度Cox模型中校准生存分布

Anchit Jain, Kevin Zhang, Stephen Bates

机构 * EECS, MIT(MIT电子工程与计算机科学系)

AI总结 本文提出一种非递减回归方法,用于校准深度Cox模型的生存概率,通过理论保证和实验验证提升模型实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16361 2026-05-19 cs.LG cs.AI stat.ML

TailedTS: Benchmark Dataset for Heavy-Tailed Time Series Prediction and Periodicity Quantification

TailedTS:用于重尾时间序列预测和周期性量化的大规模基准数据集

Xinyu Chen, HanQin Cai, Lijun Ding, Jinhua Zhao

机构 * University of Central Florida(中央佛罗里达大学) University of California, San Diego(加州大学圣地亚哥分校) Massachusetts Institute of Technology(麻省理工学院)

AI总结 TailedTS数据集用于测试在重尾、零膨胀和非高斯条件下时间序列预测模型的鲁棒性,通过稀疏自回归框架揭示高频页面的周期性较弱,同时提供非高斯损失函数的标准化预测基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12572 2026-05-19 cs.LG stat.ML

On the Accuracy of Newton Step and Influence Function Data Attributions

关于牛顿步和影响函数数据归因的准确性

Ittai Rubinstein, Samuel B. Hopkins

机构 * EECS, MIT, Cambridge, MA(麻省理工学院电子工程与计算机科学系,剑桥,马萨诸塞州)

AI总结 本文研究了牛顿步和影响函数数据归因方法的准确性,推导出误差缩放规律,揭示了NS方法在特定条件下更准确的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03280 2026-05-19 cs.LG cs.AI

BlendedNet++: A dataset and benchmark for field-resolved aerodynamics and inverse design of blended wing body aircraft

BlendedNet++:一种用于混合翼身融合飞机场解气动学和逆设计的数据集和基准

Nicholas Sung, Steven Spreizer, Mohamed Elrefaie, Matthew C. Jones, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT Lincoln Laboratory(麻省理工学院林肯实验室)

AI总结 本文提出BlendedNet++数据集,包含12492种独特的BWB几何体,通过RANS模拟提供集成力和密集表面场,利用几何深度学习模型实现实时气动预测和生成性逆设计,验证了Transolver在场预测中的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21523 2026-05-19 cs.LG stat.ML

Interpretable epistemic uncertainty decomposition in sequential generative models via polynomial chaos surrogates

通过多项式混沌代理实现序列生成模型中可解释的epistemic不确定性分解

Ramón Nartallo-Kaluarachchi, Shashanka Ubaru, Małgorzata J Zimoń, Dongsung Huh, Robert Manson-Sawko, Lior Horesh, Yoshua Bengio

机构 * Mathematical Institute, University of Oxford, United Kingdom(牛津大学数学研究所,英国) IBM Research, Thomas J. Watson Research Center, USA(IBM研究院,托马斯·J·沃森研究中心,美国) IBM Research Europe, Daresbury, United Kingdom(IBM欧洲研究院,达尔斯伯里,英国) MIT–IBM Watson AI Lab, Massachusetts, USA(麻省理工–IBM沃森人工智能实验室,马萨诸塞州,美国) Université de Montréal, Mila–Quebec AI Institute, Montreal, Quebec, Canada(蒙特利尔大学,魁北克人工智能研究所,蒙特利尔,魁北克,加拿大)

AI总结 本文提出通过多项式混沌展开分析序列生成模型中epistemic不确定性的来源,揭示奖励组件对生成决策的影响,优于深度集合、贝叶斯神经网络等方法,且在多个真实任务中展现高效性和鲁棒性。

Comments 37 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12282 2026-05-19 cs.DS cs.LG math.OC

Online Resource Allocation with Convex-set Machine-Learned Advice

在线资源分配与凸集机器学习建议

Negin Golrezaei, Patrick Jaillet, Zijie Zhou

机构 * Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院斯隆管理学院) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电气工程与计算机科学系) Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology(香港科学与技术大学工业工程与决策分析系)

AI总结 本文提出一种在线资源分配框架,结合凸集机器学习建议,平衡一致性与鲁棒性,通过动态保护水平提升在不确定环境下的性能。

Comments 77 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03427 2026-05-19 cs.CL cs.AI cs.CY cs.LG

Cleansing Jewel: A Neural Spelling Correction Model Built On Google OCR-ed Tibetan Manuscripts

清除珠宝:基于谷歌OCR的藏文手稿的神经拼写纠正模型

Queenie Luo, Yung-Sung Chuang

机构 * Harvard University(哈佛大学) Massachusetts Institute of Technology (MIT)(麻省理工学院(MIT))

AI总结 本文提出基于谷歌OCR的藏文手稿的神经拼写纠正模型,通过改进的Transformer架构实现自动纠正OCR噪声输出,实验表明其优于其他序列模型。

Journal ref Association for Computing Machinery 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16230 2026-05-18 cond-mat.mtrl-sci cs.LG

Universal Magnetic Structure Prediction from Atomic Coordinates with Near-Experimental Accuracy

从原子坐标预测通用磁结构并实现接近实验精度

Abhijatmedhi Chotrattanapituk, Ryotaro Okabe, Eunbi Rha, Mariya Al-Hinai, Eugene Jiang, Daniel Pajerowski, Yongqiang Cheng, Joshua J. Turner, Mingda Li

机构 * Quantum Measurement Group, MIT, Cambridge, MA 02139, USA(麻省理工学院量子测量组) Department of Electrical Engineering and Computer Science, MIT, Cambridge, MA 02139, USA(麻省理工学院电气工程与计算机科学系) Department of Chemistry, MIT, Cambridge, MA 02139, USA(麻省理工学院化学系) Department of Nuclear Science and Engineering, MIT, Cambridge, MA 02139, USA(麻省理工学院核科学与工程系) Department of Physics, MIT, Cambridge, MA 02139, USA(麻省理工学院物理系) Neutron Scattering Division, Oak Ridge National Laboratory, Oak Ridge, TN 37831, USA(橡树岭国家实验室中子散射组) SLAC National Accelerator Laboratory, Menlo Park, CA 94025, USA(斯坦福直线加速器实验室)

AI总结 本文提出磁结构网络(MSN),通过原子晶体结构直接预测磁结构,利用原始调制结构表示(PMSR)统一编码调制结构,实现高精度磁结构预测,为磁性材料发现提供新方法。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16048 2026-05-18 cs.LG cs.AI

Looped SSMs: Depth-Recurrence and Input Reshaping for Time Series Classification

循环SSM:用于时间序列分类的深度递归与输入重塑

Mónika Farsang, Ramin Hasani, Daniela Rus, Radu Grosu

机构 * TU Wien(维也纳技术大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Liquid AI

AI总结 本文探讨了循环SSM在时间序列分类中的应用,展示了深度递归和输入重塑对模型性能的提升作用,通过实验验证了这两种方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25404 2026-05-18 cs.LG cs.AI

SemanticOpt: Towards LLM-Based Semantic Black-Box Optimization

SemanticOpt: 向基于LLM的语义黑盒优化迈进

Jamison Meindl, Yunsheng Tian, Tony Cui, Veronika Thost, Zhang-Wei Hong, Jie Chen, Wojciech Matusik, Mina Konaković Luković

机构 * MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

AI总结 SemanticOpt利用LLM处理语义信息,通过微调结构化贝叶斯优化轨迹与自然语言上下文,提升黑盒优化性能,在多个实际问题中优于传统方法和现有LLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15630 2026-05-18 physics.chem-ph cond-mat.stat-mech cs.LG

Reweighting free energy profiles between universal machine learning interatomic potentials for fast consensus building

在通用机器学习原子势能函数之间重新加权自由能轮廓以实现快速共识构建

Sauradeep Majumdar, Miguel Steiner, Johannes C. B. Dietschreit, Swagata Roy, Daniel Willimetz, Lukaš Grajciar, Rafael Gómez-Bombarelli

机构 * Department of Material Science and Engineering, Massachusetts Institute of Technology(材料科学与工程系,麻省理工学院) Institute of Theoretical Chemistry, University of Vienna(理论化学研究所,维也纳大学) Department of Physical and Macromolecular Chemistry, Charles University(物理与大分子化学系,查尔斯大学)

AI总结 本文提出一种系统且可扩展的框架,通过重新加权潜在平均力,实现不同机器学习势能函数之间的自由能轮廓匹配,从而在低计算成本下获得高精度的热力学性质。

Comments 19 pages, 4 figures, 1 table, SI appended

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15549 2026-05-18 cs.LG cs.AI cs.CE

CTF4Nuclear: Common Task Framework for Nuclear Fission and Fusion Models

CTF4Nuclear: 用于核裂变和核聚变模型的通用任务框架

Stefano Riva, Carolina Introini, Antonio Cammi, Dean Price, Alexey Yermakov, Yue Zhao, Philippe M. Wyder, Judah Goldfeder, Jan Williams, Amy Sara Rude, Matteo Tomasetto, Joe Germany, Joseph Bakarji, Georg Maierhofer, Miles Cranmer, J. Nathan Kutz

机构 * Autodesk Research(Autodesk研究院) Department of Energy, Nuclear Engineering Division, Politecnico di Milano(能源部,核工程系,米兰理工学院) Nuclear Science and Engineering, Massachusetts Institute of Technology(核科学与工程,麻省理工学院) Department of Applied Mathematics, University of Washington(应用数学系,华盛顿大学) Department of Electrical and Computer Engineering, University of Washington(电气与计算机工程系,华盛顿大学) High Performance Machine Learning, SURF(高性能机器学习,SURF) Distyl AI Department of Computer Science, Columbia University(计算机科学系,哥伦比亚大学) Department of Mechanical Engineering, University of Washington(机械工程系,华盛顿大学) Department of Mechanical Engineering, Politecnico di Milano(机械工程系,米兰理工学院) Department of Mathematics, American University in Beirut(数学系,贝鲁特美国大学) Department of Mechanical Engineering, American University in Beirut(机械工程系,贝鲁特美国大学) Department of Applied Mathematics and Theoretical Physics, University of Cambridge(应用数学与理论物理系,剑桥大学)

AI总结 本文提出CTF4Nuclear框架,用于核工程中机器学习方法的标准化评估,通过12个指标和稀疏测量系统监控,提升核工业科学ML的严谨性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15548 2026-05-18 cs.RO

KaRMA: A Kinematic Metric for Fine Manipulation Ability in Robotic Hands

KaRMA:一种用于机器人手精细操作能力的运动学指标

Martin Peticco, Pulkit Agrawal

机构 * Improbable AI Lab, Massachusetts Institute of Technology(Improbable AI实验室,麻省理工学院)

AI总结 KaRMA是一种基于运动学的指标,用于衡量机器人手在保持接触的情况下连续改变物体姿态的能力,通过球形测试物体的可达平移和重新定向来评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15461 2026-05-18 cs.LG cs.AI

DrugSAGE:Self-evolving Agent Experience for Efficient State-of-the-Art Drug Discovery

DrugSAGE: 自演化代理经验用于高效前沿药物发现

Yikun Zhang, Xiwei Cheng, Tianyu Liu, Yuanqi Du, Wengong Jin

机构 * Northeastern University(东北大学) Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所) Yale University(耶鲁大学) Microsoft Research New England(微软研究院新英格兰分部)

AI总结 DrugSAGE通过自演化代理经验框架,高效构建前沿药物发现模型,跨任务记忆提升模型性能,实现零次搜索下的显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15365 2026-05-18 cs.CL

Greedy or not, here I come: Language production under vocabulary constraints in humans and resource-rational models

贪心还是不贪心,这里我来:在词汇限制下的人类语言生成与资源理性模型

Thomas Hikaru Clark, Sihan Chen, Laura Nicolae

机构 * Department of Brain and Cognitive Sciences, MIT(麻省理工学院脑科学与认知科学系) Department of Economics, Harvard University(哈佛大学经济系)

AI总结 研究人类在词汇限制下如何生成语言,发现人类更倾向于贪心采样,但更熟练者会回溯修正,非贪心行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15343 2026-05-18 cs.AI cs.LG cs.MA

Belief Engine: Configurable and Inspectable Stance Dynamics in Multi-Agent LLM Deliberation

信念引擎:多智能体大语言模型协商中的可配置和可检查立场动态

Joshua C. Yang, Maurice Flechtner, Damian Dailisan, Michiel A. Bakker

机构 * ETH Zurich(苏黎世联邦理工学院) Centre for Democracy Studies Aarau, University of Zurich(苏黎世大学民主研究中心) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出Belief Engine,通过可配置的信念更新机制,研究多智能体协商中的立场动态,揭示立场变化背后的证据吸收与锚定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08949 2026-05-18 cs.LG

Muon-OGD: Muon-based Spectral Orthogonal Gradient Projection for LLM Continual Learning

Muon-OGD: 基于muon的谱范数正交梯度投影用于大语言模型持续学习

Binghang Lu, Zheyuan Deng, Runyu Zhang, Bing Hu, Yunhan Zhao, Yuan Tian, Changhong Mou, Guang Lin, Xiaomin Li

机构 * Purdue University(普渡大学) Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院) University of California, Irvine(加州大学 Irvine 分校) Utah State University(犹他州立大学) Harvard University(哈佛大学)

AI总结 本文提出Muon-OGD框架,通过谱范数约束优化和正交投影约束,改进LLM持续学习的稳定性-可塑性平衡,实验证明其在持续学习基准上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14342 2026-05-18 math.ST cs.DS cs.LG math.PR stat.TH

High-accuracy log-concave sampling with stochastic queries

高精度对数凹采样与随机查询

Fan Chen, Sinho Chewi, Constantinos Daskalakis, Alexander Rakhlin

机构 * MIT(麻省理工学院) Yale University(耶鲁大学)

AI总结 本文提出利用具有亚指数尾部的随机梯度实现高精度对数凹采样,展示其在迭代和查询复杂度上与凸优化问题的分离,并提供信息论论证证明轻尾随机梯度对高精度的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19399 2026-05-18 cs.CL cs.AI cs.LG

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

DR Tulu:基于演进标准的深度研究强化学习

Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Seattle Children's Hospital(西雅图儿童医院) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出RLER方法,通过演进标准与策略模型共进化,开发出首个开源深度研究模型DR Tulu,其在多个长文深度研究基准上表现优异,且成本显著低于现有模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16806 2026-05-18 cs.LG cs.AI cs.CL

Beyond Binary Rewards: Training LMs to Reason About Their Uncertainty

超越二元奖励:训练语言模型以对其不确定性进行推理

Mehul Damani, Isha Puri, Stewart Slocum, Idan Shenfeld, Leshem Choshen, Yoon Kim, Jacob Andreas

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出RLCR方法,通过联合提升准确性和校准置信度,改进语言模型的推理能力,实验显示其在不同数据集上提升校准效果而不影响准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏