arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

共收录 2205
2608.13079 2026-08-14 cs.LG 新提交

Learning Discrete Decisions for MIPs with Constraint-Aware Diffusion

基于约束感知扩散的混合整数规划离散决策学习

Vincenzo Di Vito, Mehdi Taghizadeh, Deepjyoti Deka, Kaarthik Sundar, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学) MIT(麻省理工学院) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

AI总结 该研究提出Constrained Graph Diffusion(CGD)框架,结合图扩散模型与可行性投影算子求解混合整数规划,在两类任务上较基线方法提升可行性与质量,且最高加速425倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12745 2026-08-14 cs.LG cs.DC 新提交

A Cloud-Edge System for Multimodal Clinical Screening in Resource-Constrained Rural Settings

面向资源受限农村地区多模态临床筛查的云边协同系统

Hei Ting, Chan, Chenwei Wu, Xueshen Liu, Zesen Zhao, Boyuan Zheng, Luis Filipe Nakayama, Michael G. Morley, Liyue Shen, Jiasi Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院)

AI总结 该研究针对资源受限农村地区的多模态临床筛查问题,提出云边协同架构,经实验验证其诊断性能优异且成本更低,可适配部署约束。

Comments 31 pages, 3 figures. In Proceedings of Machine Learning Research, Volume 340, 2026 (Machine Learning for Healthcare Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13520 2026-08-14 cs.LG cs.AI cs.IT math.IT math.ST stat.ML stat.TH 新提交

The data geometry of masking diffusion: Certified-optimal schedules via unmasking growth complexity

掩码扩散的数据几何:通过去掩蔽增长复杂度实现可验证最优调度

Martin J. Wainwright

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究引入去掩蔽增长复杂度(UGC)度量,推导了离散采样掩码扩散的可验证最优调度,得到适配数据几何的采样器,其迭代复杂度接近神谕过程,且在维度相关收益上优于粗调度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13335 2026-08-14 cs.LG cond-mat.dis-nn cond-mat.stat-mech 新提交

Neural Quadratic Forms: A Unified Minimal Model for Sudden Learning and Scaling Laws

神经二次型:用于突发学习与标度律的统一最小模型

Liu Ziyin, Yizhou Xu, Tomaso Poggio, Isaac Chuang

机构 * Massachusetts Institute of Technology(麻省理工学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

AI总结 该研究提出神经二次型模型,统一描述感知机等多种架构的突发学习与标度律,通过对称性推导其训练动力学为洛特卡-沃尔泰拉方程,经数值验证符合相关行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08874 2026-08-14 cs.CV 版本更新

AeroReformer2: Spoken-Query Referring Segmentation for Aerial Images

AeroReformer2:面向航拍图像的语音查询指称分割

Rui Li, Chenxi Duan, Haoyang Yang

机构 * Massachusetts Institute of Technology(麻省理工学院) The University of Manchester(曼彻斯特大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文针对现有指称遥感图像分割基准仅支持书面表达的问题,构建了首个语音查询指称分割基准RISBench-S,并提出高效双边网络模型AeroReformer2,在相关任务上取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17897 2026-08-14 cs.CV cs.AI cs.LG cs.RO 版本更新

RadarGen: Automotive Radar Point Cloud Generation from Cameras

RadarGen:从摄像头生成汽车雷达点云

Tomer Borreda, Fangqiang Ding, Sanja Fidler, Shengyu Huang, Or Litany

机构 * Technion(技术学院) MIT(麻省理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 RadarGen通过扩散模型从摄像头图像生成逼真的雷达点云,结合BEV对齐的深度、语义和运动线索,提升雷达生成的物理合理性与多模态模拟能力。

Comments ECCV 2026. Project page: https://radargen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12026 2026-08-13 cs.LG 新提交

SoftWater: Class-Aware Rate Allocation for Softmax Quantization

SoftWater:面向Softmax量化的类别感知速率分配

Joao V. Cavalcanti, Ashia C. Wilson

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 针对小型LLM的Softmax层量化问题,提出类别感知速率分配方法SoftWater,在多模型上优于现有量化器,可大幅降低输出层KL散度,使输出层量化的困惑度损失可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08837 2026-08-13 cs.LG cs.AI 版本更新

Prompt-Driven Exploration

提示驱动的探索

Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Improbable AI Lab(英普罗巴布尔人工智能实验室)

AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07242 2026-08-13 cs.LG math.CT 版本更新

Weaves, Wires, and Morphisms: Formalizing and Implementing the Algebra of Deep Learning

编织、导线与态射:形式化和实现深度学习的代数

Vincent Abbott, Gioele Zardini

机构 * Laboratory for Information and Decision Systems, Massachusetts Institute of Technology(信息与决策实验室,麻省理工学院)

AI总结 本文提出一种基于范畴论的深度学习框架,通过轴步长和数组广播范畴形式化广播机制,实现模型架构的数学表达与组合操作,并提供Python和TypeScript实现展示其通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08020 2026-08-12 cs.AI 版本更新

Thought-Level Beam Search for Reasoning

用于推理的思维级束搜索

Lijie Yang, Hongyin Luo, Jiawei Zhao, Tri Dao, Ravi Netravali

机构 * Princeton University(普林斯顿大学) MIT(麻省理工学院) Meta AI

AI总结 针对大型推理模型测试时计算分配的低效问题,提出执行思维级束搜索的Gambit算法,在固定硬件预算下,其在准确率、吞吐量、token消耗等指标上均优于现有基线方法。

Comments Add the author Jiawei Zhao in Meta Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12260 2026-08-12 econ.TH cs.AI cs.GT cs.LG stat.ML 版本更新

Market Design for AI: Beyond the Copyright Binary

人工智能的市场设计:超越版权二元论

Yan Dai, Maryam Farboodi, Negin Golrezaei, Sepehr Shahshahani

机构 * MIT Operations Research Center(麻省理工学院运筹学中心) MIT Sloan School of Management(麻省理工学院斯隆管理学院) Washington University School of Law(华盛顿大学法学院)

AI总结 本文通过静态和动态博弈模型,分析AI训练数据市场中“自由使用”与“强知识产权”两种模式的失败,提出通过数据中介内部化外部性并补贴创新贡献的市场设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23146 2026-08-12 cs.LG cs.AI 版本更新

Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness

Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习

Manish Aryal, Faiyaz Azam, Agnivo Banerjee, Syed Mahir Ahamed, Sai Sidhanth Manoharan Jayanthi, Allegra Laro, Clément Legentilhomme, Andrew Lin, Florian Lorkowski, Marina Pérez del Valle, Radman Rakhshandehroo, Patric Rommel, Emanuel Ruzak, Nathan Theng, Paul Yushin Rapoport

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) WorldQuant University(WorldQuant大学) UC Berkeley(加州大学伯克利分校) Aix-Marseille University(阿维尼翁-马赛大学) MIT(麻省理工学院) University of Zurich(苏黎世大学) University of British Columbia(不列颠哥伦比亚大学) University of Stuttgart(斯图加特大学) University of Buenos Aires(布宜诺斯艾利斯大学) California State University, Fresno(弗雷斯诺加州州立大学) University of Chicago(芝加哥大学)

AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。

Comments RLC 2026: Accepted to Finding the Frame Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18539 2026-08-12 cs.LG cs.CV 版本更新

TimePre: Bridging Accuracy, Efficiency, and Stability in Probabilistic Time-Series Forecasting

TimePre: 联合精度、效率与稳定性在概率时间序列预测中的应用

Lingyu Jiang, Lingyu Xu, Peiran Li, Dengzhe Hou, Qianwen Ge, Dingyi Zhuang, Shuo Xing, Wenjing Chen, Xiangbo Gao, Ting-Hsuan Chen, Xueying Zhan, Xin Zhang, Ziming Zhang, Zhengzhong Tu, Michael Zielewski, Kazunori Yamada, Fangzhou Lin

机构 * Tohoku University(东京大学) WPI Texas A&M University(德克萨斯大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) UIUC(伊利诺伊大学香槟分校) Georgia Tech(佐治亚理工学院) MIT(麻省理工学院) University of Southern California(南加州大学) San Diego State University(圣地亚哥州立大学)

AI总结 TimePre结合MLP模型的高效性与MCL方法的分布灵活性,通过SIN层解决精度、效率与稳定性之间的平衡问题,实现在概率时间序列预测中的高精度与高速度。

Comments 25 pages, 6 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09921 2026-08-12 cs.LG 版本更新

A Tale of Two Temperatures: Simple, Efficient, and Diverse Sampling from Diffusion Language Models

双温度的故事:从扩散语言模型中实现简单、高效且多样的采样

Theo X. Olausson, Metod Jazbec, Xi Wang, Armando Solar-Lezama, Christian A. Naesseth, Stephan Mandt, Eric Nalisnick

机构 * Massachusetts Institute of Technology(麻省理工学院) UvA-Bosch Delta Lab, University of Amsterdam(阿姆斯特丹大学UvA-Bosch Delta实验室) Johns Hopkins University(约翰霍普金斯大学) University of California, Irvine(加州大学尔湾分校)

AI总结 本文提出通过温和的温度化方法提升扩散语言模型采样多样性,实现高效且多样化的样本生成,优于现有方法。

Comments V2: accepted as a full conference paper at COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05192 2026-08-12 cs.CL 版本更新

Faster Superword Tokenization

更快的超词 tokenization

Craig W. Schmidt, Chris Tanner, Yuval Pinter

机构 * Kensho Technologies MIT(麻省理工学院)

AI总结 本文提出改进的 BoundlessBPE 和 SuperBPE 算法,通过聚合超词候选提升训练速度,实现超词生成并优化超参数选择,使训练时间显著缩短。

Comments Accepted for COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01418 2026-08-12 cs.CL 版本更新

Cost-Efficient Estimation of General Abilities Across Benchmarks

跨基准的低成本能力估计

Michael Krumdick, Adam Wiemerslage, Seth Ebner, Charles Lovering, Chris Tanner

机构 * Kensho Technologies MIT(麻省理工学院)

AI总结 本文提出通过改进的多维项目反应理论模型与自适应项目选择方法,以低成本预测模型在未见任务上的性能,实现高效基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05061 2026-08-12 cs.CL 版本更新

No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding

无免费标签:缺乏人类基准的LLM作为评判的局限性

Michael Krumdick, Charles Lovering, Varshini Reddy, Seth Ebner, Chris Tanner

机构 * Kensho Technologies MIT(麻省理工学院)

AI总结 本文提出BFF-Bench基准测试,通过专家评估LLM响应的正确性,揭示LLM作为评判在无人类基准时的局限性,显示当无正确参考时,LLM评判与人类专家的高一致性仅限于LLM能正确回答的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20907 2026-08-12 cs.CL 版本更新

The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues

隐藏的提线人:预测操纵性大语言模型对话中的人类信念变化

Jocelyn Shen, Amina Luvsanchultem, Jessica Kim, Kynnedy Smith, Valdemar Danry, Kantwon Rogers, Hae Won Park, Maarten Sap, Cynthia Breazeal

机构 * Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出PUPPET框架,通过分析1035个人类与LLM交互数据,揭示当前安全范式在检测操纵策略与信念变化幅度之间的关键断层,证明先进LLM对人类信念易感性的系统低估。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19696 2026-08-12 cs.RO cs.AI cs.LG 版本更新

Diffusion-Based Impedance Learning for Contact-Rich Manipulation Tasks

基于扩散的阻抗学习用于接触丰富的操作任务

Noah Geiger, Tamim Asfour, Neville Hogan, Johannes Lachner

机构 * Institute for Anthropomatics and Robotics, Karlsruhe Institute of Technology(人机动力学与机器人研究所,卡尔斯鲁厄技术大学) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(脑与认知科学系,麻省理工学院)

AI总结 本文提出基于扩散的阻抗学习框架,结合生成建模与能量一致的阻抗控制,实现接触丰富的操作任务中的高精度动态控制与任务泛化能力。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24287 2026-08-12 cs.CL cs.AI 版本更新

Do LLMs Benefit From Their Own Words?

大型语言模型是否受益于自身话语?

Jenny Y. Huang, Leshem Choshen, Wei Sun, Omar Khattab, Ramón Fernandez Astudillo, Mehul Damani, Tamara Broderick, Jacob Andreas

机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) IBM Research(IBM研究院)

AI总结 研究发现,省略大型语言模型自身历史上下文可提高响应质量并减少内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15159 2026-08-12 cs.LG 版本更新

Learning Representations from Incomplete EHR Data with Dual-Masked Autoencoding

从不完整电子健康记录数据中学习表示的双掩码自编码

Xiao Xiang, David Restrepo, Hyewon Jeong, Yugang Jia, Leo Anthony Celi

机构 * Massachusetts Institute of Technology(麻省理工学院) EPFL(苏黎世联邦理工学院) Harvard University(哈佛大学) Beth Israel Deaconess Medical Center(贝塞斯达医院)

AI总结 AID-MAE通过双掩码技术直接从不完整EHR时间序列中学习表示,有效提升临床任务性能并实现患者群体的自然分层。

Comments MLHC 2026 camera-ready. Spotlight at NeurIPS TS4H 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13319 2026-08-12 cs.AI cs.HC 版本更新

Situation Graph Prediction for User Perspective Modeling

情境图预测:用户建模的结构化视角推断

Jisung Shin, Daniel Platnick, Marjan Alirezaie, Hossein Rahnama

机构 * Flybits Labs, Creative AI Hub(Flybits实验室、创意人工智能中心) University of Toronto(多伦多大学) Toronto Metropolitan University(多伦多 Metropolitan 大学) MIT Media Lab(MIT媒体实验室)

AI总结 情境图预测通过结构化视角推断提升用户建模能力,揭示潜在状态推断比表层提取更困难。

Comments Accepted to PILA 2026: Workshop on Personal Intelligence in the Agentic AI Era, at KDD 2026, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07705 2026-08-11 cs.AI cs.LG 新提交

Protecting patient privacy in clinical foundation models: Technical and legal perspectives

临床基础模型中的患者隐私保护:技术与法律视角

Sana Tonekaboni, Lena Stempfle, Sasha Ronaghi, Corinna Coupette, I. Glenn Cohen, Emily Alsentzer, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology (MIT)(麻省理工学院(MIT)) The Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学博德研究所) Borealis AI Stanford University(斯坦福大学) Aalto University(阿尔托大学) Max Planck Institute for Tax Law and Public Finance(马克斯·普朗克税法与公共财政研究所) Stanford Law School(斯坦福法学院) Harvard Law School(哈佛法学院) Petrie-Flom Center for Health Law Policy, Biotechnology & Bioethics(皮里-弗洛姆健康法律政策、生物技术与生物伦理中心)

AI总结 针对临床基础模型的隐私风险,提出实用评估框架,结合技术与法律措施缓解泄露,在保留模型价值的同时保护患者隐私。

Comments 14 pages, 2 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07558 2026-08-11 cs.RO cs.CV 新提交

Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning

学习物理交互:触觉与力感知机器人学习综述

Shilin Shan, Chuhao Zhou, Ruize Wang, Xinyan Chen, Xiangyu Chen, Xinyu Zhou, Boyu Ma, Iris Yuxuan Hu, Jingliang Li, Celeste Yuxuan Hu, Geng Li, Guohao Chen, Tianrui Zhu, Zhe Li, Yanjie Ze, Haoran Geng, Zhiyang Dou, Jianxin Bi, Yuejiang Liu, Jianshu Zhou, Jiachen Li, Paul Liang, Tatsuya Harada, Robert Katzschmann, Harold Soh, Na Li, Edward Johns, Danica Kragic, Jan Peters, Wojciech Matusik, Masayoshi Tomizuka, Jitendra Malik, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Stanford University(斯坦福大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Georgia Institute of Technology(佐治亚理工学院) The University of Tokyo(东京大学) ETH Zurich(苏黎世联邦理工学院) Harvard University(哈佛大学) Imperial College London(伦敦帝国学院) KTH Royal Institute of Technology(瑞典皇家理工学院) Technical University of Darmstadt(达姆施塔特工业大学)

AI总结 本综述针对力与触觉感知机器人学习研究的空白,提出TF-ART分类法,整合多模态感知与多阶段系统设计视角,兼具算法与实践意义。

Comments 53 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02762 2026-08-11 cs.CV 版本更新

Oh Deer, How Should I Handle This? Seasonal Priors for Selective Wildlife Annotation and Classification

哦,鹿啊,我该如何应对?用于选择性野生动物标注与分类的季节先验

Hugo Markoff, Christoph Praschl, Anton Hjalte Jørgensen, Christian Emil Mogensen, Mathias Bech Skadhauge, Sara Beery, Michael Ørsted, David C. Schedl

机构 * Aalborg University(奥尔堡大学) University of Applied Sciences Upper Austria(上奥地利应用科学大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究针对航拍野生动物分类的标签不可靠问题,以马鹿雄性识别为对象,利用季节先验结合多模态数据提升标注与分类效果,提出的方法可指导标注协议设计和模态加权。

Comments Accepted at the ECCV 2026 Workshop on Computer Vision for Ecology (CV4Ecology), archival proceedings track. 17 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22877 2026-08-11 cs.AI cs.HC cs.RO 版本更新

Physical AI Governance: From Theory to Practice Across Life Cycle

物理人工智能治理:跨越生命周期从理论到实践

Wang Yang, Shaobo Wang, Hongxuan Liu, Xiaoran Cai, Yunyu He, Jingzong Zhou, Mengzhong Ma, Yi Yu, Rohit Sharma, Jingjing Fu, Peng Qi

机构 * Case Western Reserve University(凯斯西储大学) Shanghai Jiao Tong University(上海交通大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学) University of California, Riverside(加州大学河滨分校) Nanyang Technological University(南洋理工大学) New York University(纽约大学) Salesforce(Salesforce公司) Harvard University(哈佛大学) Stanford University(斯坦福大学)

AI总结 本文对物理人工智能治理进行全面综述,综合现有原则形成统一框架,提出五阶段生命周期,通过具体实践展示各阶段治理操作,为构建安全可信且符合社会价值的物理人工智能系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08793 2026-08-11 stat.ML cs.AI cs.LG cs.SY eess.SY math.OC 版本更新

EHR-MPC: Inference-Time Control for Sepsis Treatment with Generative Patient Digital Twins

EHR-MPC:利用生成式患者数字孪生进行脓毒症治疗的推理时间控制

Joshua Pickard, Wei Qi, Na Li, Ann Woolley, Lisa Cosimi, Roy Kishony, Deborah Hung

机构 * Broad Institute of MIT and Harvard(MIT和哈佛大学Broad研究所) Harvard University(哈佛大学) Brigham and Women’s Hospital(布莱根妇女医院) Technion–Israel Institute of Technology(技术学院-以色列理工学院)

AI总结 针对脓毒症治疗策略有争议且现有强化学习方法适应性不足的问题,提出EHR-MPC框架,通过训练生成式电子健康记录模型形式的患者数字孪生解耦学习与治疗优化,经模拟评估性能优于强化学习基线,建立了决策通用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04273 2026-08-11 cs.AI 版本更新

Human agency in initial human-AI proof formalization workflows

表征初始人机交互的证明形式化工作流

Katherine M. Collins, Simon Frieder, Jonas Bayer, Jacob Loader, Jeck Lim, Peiyang Song, Fabian Zaiser, Lexin Zhou, Shanda Li, Sam Looi, Joshua B. Tenenbaum, Umang Bhatt, Adrian Weller, Jose Hernandez-Orallo, Cameron E. Freer, Valerie Chen, Ilia Sucholutsky

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Cambridge(剑桥大学) Princeton University(普林斯顿大学) University of Oxford(牛津大学) Caltech(加州理工学院) Carnegie Mellon University(卡内基梅隆大学) Universitat Politècnica de València(瓦伦西亚理工大学) New York University(纽约大学)

AI总结 通过混合方法分析,研究人们在形式化证明过程中对AI工具的需求、障碍及实际使用模式,发现AI辅助能提高形式化准确率且用户偏好多样但普遍希望保持人类对证明发现过程的高层控制。

Comments Updated working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23895 2026-08-11 cs.CV 版本更新

From Activation to Specificity: Automating Counterfactual Testing of Visual Representations in the Human Brain

从激活到因果:人脑中视觉表征的因果发现

Yuval Golbari, Navve Wasserman, Matias Cosarinsky, Roman Beliy, Aude Oliva, Antonio Torralba, Michal Irani, Tamar Rott Shaham

机构 * Weizmann Institute of Science(魏茨曼科学研究所) Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出BrainCause框架,结合生成模型和脑模型合成受控刺激,通过因果测试验证人脑视觉表征,发现仅靠激活不足以证明表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12843 2026-08-11 cs.CL 版本更新

Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration

成长之痛:通过固定参数校准实现可扩展且高效的LLM基准测试

Eliya Habba, Itay Itzhak, Asaf Yehudai, Yotam Perlitz, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(海法大学) IBM Research(IBM研究院) MIT(麻省理工学院) Technion(技术学院) Allen Institute for AI(人工智能研究院)

AI总结 本文提出基于多维项目反应理论的框架,利用锚定项目校准新基准,保持原有参数固定,实现随时间扩展基准测试的同时保持评分可比性,且评估成本恒定。

详情

展开后加载摘要…

URL PDF HTML 收藏