PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models
PluRel: 合成数据解锁关系基础模型的扩展定律
机构 * Stanford University(斯坦福大学) ; SAP Labs LLC(SAP实验室)
AI总结 PluRel通过合成多表关系数据库,实现了关系基础模型在扩展定律上的突破,展示了合成数据在提升模型泛化能力方面的潜力。
Comments ICML 2026
高校专区
PluRel: 合成数据解锁关系基础模型的扩展定律
机构 * Stanford University(斯坦福大学) ; SAP Labs LLC(SAP实验室)
AI总结 PluRel通过合成多表关系数据库,实现了关系基础模型在扩展定律上的突破,展示了合成数据在提升模型泛化能力方面的潜力。
Comments ICML 2026
首先,不伤害:迈向临床安全的大语言模型
机构 * Harvard Combined Dermatology Program(哈佛联合皮肤科项目) ; Department of Dermatology, Mass General Brigham(麻省总医院皮肤科) ; Harvard Medical School(哈佛医学院) ; Stanford Center for Biomedical Informatics Research(斯坦福生物医学信息学研究中心) ; Stanford University(斯坦福大学) ; Division of Hospital Medicine, Department of Medicine, Stanford University School of Medicine(斯坦福大学医学院医院医学科) ; Department of Medicine, Cambridge Health Alliance(剑桥健康联盟医学科) ; Beth Israel Deaconess Hospital–Plymouth(贝塞斯达德acons医院-普利茅斯) ; Department of Medicine, University of California, San Francisco(加州大学旧金山分校医学科) ; Department of Neurology, Stanford University School of Medicine(斯坦福大学医学院神经科) ; Department of Medicine, Beth Israel Deaconess Medical Center(贝塞斯达德acons医学中心医学科) ; Division of Cardiology, Department of Medicine, Cambridge Health Alliance(剑桥健康联盟心脏病科) ; Department of Cardiovascular Medicine, Summa Health System(Summa健康系统心血管医学科) ; Division of Allergy, Pulmonary, and Critical Care Medicine, Department of Medicine, University of Wisconsin-Madison(威斯康星大学麦迪逊分校医学科过敏、呼吸科和危重医学科) ; Division of Pulmonary and Critical Care Medicine, Department of Medicine, Massachusetts General Hospital(麻省总医院呼吸科和危重医学科) ; Center for Immunology and Inflammatory Diseases, Department of Medicine, Massachusetts General Hospital(麻省总医院免疫和炎症疾病中心) ; Broad Institute of MIT and Harvard(MIT和哈佛Broad研究所) ; Division of Pulmonary, Critical Care, and Sleep Medicine, Cambridge Health Alliance(剑桥健康联盟呼吸科、危重医学科和睡眠医学科)
AI总结 提出NOHARM基准,包含1100个初级到专科咨询案例,评估28个LLM的医疗建议安全性,发现高达22.6%的案例存在严重危害风险,其中遗漏错误占80%以上。
在一起,然后分开:平衡多模态生存分析中的对齐与独特性
机构 * Stony Brook University(石溪大学) ; Stanford University(斯坦福大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Brookhaven National Laboratory(布鲁赫林国家实验室)
AI总结 针对多模态生存分析,提出TTA框架,先基于原型对齐捕获跨模态共享结构,再通过锚定引导对比目标鼓励模态特定独特性,用不平衡最优传输处理模态不平衡和噪声对应,在多个癌症队列上评估,提升了生存预测并揭示可解释模式。
帧混合策略:用于双手机器人移动操作的多帧动作去噪
机构 * Stanford University(斯坦福大学)
AI总结 研究双手机器人移动操作中多帧动作去噪问题,提出帧混合策略(MoF),通过在多坐标框架同步去噪,维护规范扩散状态并融合噪声预测,在模拟和实际任务中均优于单帧基线。
用于语言识别的全局一致着色方案
机构 * Stanford University(斯坦福大学) ; Cornell University(康奈尔大学)
AI总结 研究对抗性语言学习所需额外信息,探讨终端着色能否替代整个颜色序列用于语言识别,证明每个字符串只需一个终端位,全局构造用超限递归,还表明有限颜色的博雷尔映射终端着色不能识别所有可数子集合。
Comments Abstract shortened to fit arxiv limit
Pix2Act:具有等变增强的图像空间操纵策略
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Brown University(布朗大学) ; Texas A&M University(德州农工大学)
AI总结 研究针对将操纵动作表示为相机平面二维轨迹带来的挑战,提出Pix2Act模仿学习方法,通过生成图像空间关键点轨迹及三角测量恢复末端执行器姿态,将三维控制转为二维预测问题,提升泛化能力与性能,优于现有基线且抗相机扰动。
Comments Project Website: https://haojhuang.github.io/pix2act_page/
VIA:用于机器人控制的视觉接口代理
机构 * Stanford University(斯坦福大学)
AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。
SETA:终端智能体的扩展环境
机构 * Imperial College London(帝国理工学院) ; University College London(伦敦大学学院) ; SambaNova(桑巴诺瓦公司) ; KAUST(阿卜杜拉国王科技大学) ; Stanford University(斯坦福大学) ; University of Oxford(牛津大学) ; University of Waterloo(滑铁卢大学) ; RadixArk(基数方舟公司)
AI总结 研究针对终端智能体训练扩展难的问题,提出SETA框架,含SETA - Synth和SETA - Evol两个管道及统一验证机制,构建了SETA - Env数据集。实验显示该数据集能为终端智能体提供优质训练环境,推动相关研究发展。
3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究
机构 * Roblox Corporation(罗布乐思公司) ; Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) ; Computer Science Department, Stanford University(斯坦福大学计算机科学系) ; Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)
AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。
动作映射策略:通过像素分类学习3D闭环操作
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学) ; Brown University(布朗大学)
AI总结 研究针对机器人学习中动作空间的挑战,提出动作映射策略(AMP),将3D闭环操作策略学习转为图像空间分类问题,通过投影动作到图像平面,以像素为类别控制维度,实现高精度、快速推理,实验证明其优于基线。
Comments Project Website: https://haojhuang.github.io/amp_page/
多层感知器是赫布型的:为Transformer构建高效的事实存储多层感知器
机构 * Institute for Computational & Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系) ; Department of Computer Science and Engineering, University at Buffalo(布法罗大学计算机科学与工程系)
AI总结 研究大语言模型中MLP层以最优速率存储事实知识的现象,开发首个与Transformer兼容的事实存储MLP闭式构造,具有最优存储缩放等特性,所需参数更少,还能用于事实召回任务及实现模块化事实编辑。
UniPose9D:通用的类别无关物体姿态估计
机构 * Stanford University(斯坦福大学) ; Amazon(亚马逊)
AI总结 研究针对物体姿态估计中现有方法泛化性不足的问题,提出UniPose9D模型,通过采样点对、利用特定特征预测NOCS坐标,引入改进算法及流匹配,构建训练集,实验证明该模型能匹配或超越专业方法,泛化能力强。
Detangled:一个用于创建、编辑和推理具有丰富特征的发丝的框架
机构 * Stanford University(斯坦福大学)
AI总结 该研究提出用于理解和生成丰富特征发丝的框架,构建五维参数空间,用新方法分离发丝纹理与整体方向,通过生成式AI创建符合纹理描述的新发丝,可用于造型编辑并展示了多种发型结果。
Comments 18 pages, 18 figures
FARS:一个大规模部署的全自动研究系统
机构 * Analemma ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; University College Dublin(都柏林大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; ByteDance(字节跳动) ; ShanghaiTech University(上海科技大学) ; University of Warwick(华威大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; East China Normal University(华东师范大学) ; Stanford University(斯坦福大学) ; Tencent(腾讯) ; The University of Hong Kong(香港大学) ; Shanghai Innovation Institute(上海创新研究院) ; Nex-AGI Team(Nex-AGI团队)
AI总结 提出FARS系统,通过分阶段智能体协作自动生成研究项目,在67个AI/ML主题上产出166篇论文,经282份评审验证其可产出有价值成果,同时暴露实验范围窄、方法局限和诚信问题。
PerspectiveGap: 多智能体编排提示的基准测试
机构 * University of Maryland(马里兰大学) ; The Chinese University of Hong Kong(香港中文大学) ; Stanford University(斯坦福大学)
AI总结 提出PerspectiveGap基准,评估LLM为多智能体系统编写编排提示的能力,实验显示模型平均通过率仅14.9%,表明该能力独特且未被充分评估。
层次化和整体化的开放词汇功能3D场景图用于室内空间
机构 * Tsinghua University(清华大学) ; ETH Zürich(苏黎世联邦理工学院) ; MPI for Informatics(信息研究所) ; Dalian University of Technology(大连理工大学) ; Microsoft(微软) ; Stanford University(斯坦福大学) ; University of Lugano(卢加诺大学)
AI总结 本文提出一种开放词汇管道,结合2D视觉定位和3D图优化,解决小规模密集相似实例的场景图推理问题,通过时间图优化和全局层次塑造提升室内空间的功能3D场景图生成能力。
递归多智能体系统
机构 * UIUC(伊利诺伊大学香槟分校) ; Stanford University(斯坦福大学) ; NVIDIA(英伟达) ; MIT(麻省理工学院)
AI总结 本文提出递归多智能体框架RecursiveMAS,通过递归计算提升多智能体协作效率,实验证明其在多个基准测试中准确率提升8.3%,推理速度提升1.2-2.4倍,token使用减少34.6%-75.6%。
Comments Project Website: https://recursivemas.github.io
Tool-MCoT:用于内容安全审核的工具增强多模态链式思维
机构 * Stanford University(斯坦福大学) ; Google(谷歌) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出Tool-MCoT,一种基于工具增强的多模态链式思维模型,用于提升内容安全审核的效率与准确性,通过训练小语言模型以有效利用外部工具进行推理和决策。
人们使用快速且扁平的模拟来对新游戏进行推理
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Princeton University(普林斯顿大学) ; University of Cambridge(剑桥大学) ; Stanford University(斯坦福大学) ; New York University(纽约大学) ; The Alan Turing Institute(艾伦·图灵研究所)
AI总结 研究人们对新游戏的推理,通过超千名参与者和121种新棋盘游戏的研究,发现人们玩新游戏或评估时具系统性和适应性理性,用“直观玩家”模型解释,为新问题应对及类人AI系统设计提供见解。
通过模仿学习实现自主软机器人血管内导航
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Stanford University(斯坦福大学) ; McGill University(麦吉尔大学) ; University of Maryland(马里兰大学) ; Swiss Federal Institute of Technology in Lausanne (EPFL)(日内瓦联邦理工学院(EPFL)) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 研究旨在实现自主软机器人血管内导航,开发基于变压器的模仿学习框架,通过目标条件等实现通用导航,在多种几何结构上训练并评估,策略成功率高,还进行了相关研究及扩展,提升了在未见几何结构上的成功率。
阿格斯能评判一切吗?跨领域比较视觉语言模型
机构 * Bharati Vidyapeeth(巴哈提大学) ; Macquarie University(麦考瑞大学) ; DSEU-Okhla ; Vivekananda Institute of Professional Studies(维维kananda专业研究学院) ; IIIT-Delhi(德里印度理工学院) ; Center for SDGC(SDGC中心) ; Stanford University(斯坦福大学)
AI总结 研究跨领域视觉语言模型,提出ARGUS-EVAL评估框架,通过多种指标刻画模型行为,评估多个模型在下游任务表现,发现能力与可靠性导向排名有显著差异,如Qwen-2.5VL-3B-Instruct能力强,CLIP延迟和内存占用低。
具有交互式数据收集的分布鲁棒强化学习:基本难度与近最优算法
机构 * Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) ; Center for Data Science, Peking University(北京大学数据科学中心) ; Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系)
AI总结 针对强化学习中模拟与现实的差距,提出分布鲁棒强化学习,通过交互式数据收集应对挑战。因支持转移难题,引入消失最小值假设,给出近最优算法,扩展到新公式和博弈,应用于库存控制。
OpenLongTail:长尾驾驶数据的生成式扩展
机构 * Texas A&M University(德克萨斯农工大学) ; NVIDIA(英伟达) ; UW–Madison(威斯康星大学麦迪逊分校) ; UT Austin(德克萨斯大学奥斯汀分校) ; Yale University(耶鲁大学) ; Adobe(奥多比公司) ; Meta ; University of Delaware(特拉华大学) ; Stanford University(斯坦福大学)
AI总结 研究针对长尾驾驶数据稀缺影响策略扩展的问题,提出开源生成数据引擎OpenLongTail,通过姿态外推视图合成管道及普吕克射线几何增强,合成异构数据提升闭环驾驶稳健性,验证了其多方面有效性。
Comments Project page: https://openlongtail.github.io/
多样化以进行验证:当任务等效程序在可验证性上存在差异时
机构 * Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究任务等效程序的可验证性差异,提出基于大型语言模型的Diversify2Verify管道,通过推断契约、生成测试不同实现并修复注释来验证,构建基准测试,结果表明实现多样性有助于验证,提高了验证成功率。
从更少中学习更多:事后诸葛亮式强化学习
机构 * Massachusetts Institute of Technology(麻省理工学院) ; MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) ; Stanford University(斯坦福大学) ; University of California, San Diego(加利福尼亚大学圣地亚哥分校)
AI总结 研究针对强化学习用于视觉-语言-动作模型后期训练时样本效率低的问题,提出事后诸葛亮式学习方法,通过对失败轨迹重标记,让策略联合原始与重标记轨迹训练,在分布外任务上显著提升样本效率并优于基线。
WARP-RM: 一种用于数据筛选的扭曲增强相对进度奖励模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; XDOF
AI总结 提出WARP-RM,通过时间扭曲增强从成功演示中自监督学习密集相对进度信号,用于行为克隆中加权高优势动作块,在机器人叠衣任务中显著提升数据效率。
上下文从不够长:用于长文档集可扩展问答的结构化推理
机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)
AI总结 本文提出SLIDERS框架,通过结构化推理解决长文档集问答问题,利用关系数据库和SQL实现可扩展推理,优于现有基准。
Comments 53 pages (10 main), preprint
APIVOT:具有交错视觉语言思维的自适应规划
机构 * Stanford University(斯坦福大学)
AI总结 研究长期机器人规划问题,提出基于VLM的APIVOT规划器,通过自适应交错语言和视觉思维,利用语言语义推理、视觉思维验证几何可行性,在长期厨房任务中表现出色,提升了规划成功率和推理效率。
Comments Project Page: https://emilyzjin.github.io/projects/apivot.html
扩散策略学习中的表达能力与统计权衡
机构 * Stanford University(斯坦福大学) ; Chinese University of Hong Kong(香港中文大学) ; Imperial College London(伦敦帝国理工学院)
AI总结 研究扩散策略学习中表达能力与统计权衡,确定漂移Lipschitz预算K为核心量,通过近似量化表达能力,证明其与统计复杂性的关系,给出有限样本性能差距,数值实验验证,还提出根据样本大小选K及对应神经网络架构的实现原则。
贝叶斯扩散模型中泛化相变的精确信息理论
机构 * Stanford University(斯坦福大学)
AI总结 研究扩散模型如何从有限训练集学习复杂分布,引入BIRD模型,通过贝叶斯后验推断实现时间反转扩散,确定记忆与泛化的信息理论相变边界,实验证实理论预测,揭示信息受限在生成式AI中规避维度灾难的作用。