Data-efficient pre-training by scaling synthetic megadocs
通过扩展合成巨文档实现数据高效的预训练
机构 * Stanford University(斯坦福大学)
AI总结 本文研究如何通过生成更长的合成巨文档提升预训练效果,发现其在降低损失和提升基准准确率方面优于简单重述,数据效率从1.48倍提升至1.80倍。
高校专区
通过扩展合成巨文档实现数据高效的预训练
机构 * Stanford University(斯坦福大学)
AI总结 本文研究如何通过生成更长的合成巨文档提升预训练效果,发现其在降低损失和提升基准准确率方面优于简单重述,数据效率从1.48倍提升至1.80倍。
无需可操作性:机制方法无法纠正语言模型错误,尽管内部表示几乎完美
机构 * University of California San Francisco(加州大学旧金山分校) ; Waymark ; University of Pennsylvania(宾夕法尼亚大学) ; Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学) ; Stanford University(斯坦福大学)
AI总结 研究探讨了机制解释方法在纠正语言模型错误中的有效性,发现尽管内部表示接近完美,但现有方法无法有效将知识转化为正确输出,揭示了AI安全框架中的潜在问题。
Comments 27 pages, 5 figures, 10 tables. Code available at https://github.com/sanjaybasu/interpretability-triage
粒子动力学快速适应用于广义变形物体移动操作
机构 * Stanford University(斯坦福大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出RAPiD方法,通过学习视觉-运动策略和动态嵌入推理,实现变形物体移动操作的高成功率。
Comments 8 pages, ICRA 2026
持续自我改进的AI
机构 * STANFORD UNIVERSITY(斯坦福大学)
AI总结 本文提出三种方法,通过合成数据提升知识获取效率,减少对人类数据的依赖,并超越人类设计的训练范式,实现持续自我改进的AI。
Comments PhD thesis
TherapyGym: 评估和对齐疗法聊天机器人中的临床忠实性与安全性
机构 * Department of Computer Science, Stanford University, Stanford, CA, USA(计算机科学系,斯坦福大学,斯坦福,加州,美国) ; Department of Psychiatry and Behavioral Sciences, Stanford University, Stanford, CA, USA(精神病学与行为科学系,斯坦福大学,斯坦福,加州,美国) ; Department of Biomedical Data Science, Stanford University, Stanford, CA, USA(生物医学数据科学系,斯坦福大学,斯坦福,加州,美国) ; University of California, Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加州,美国) ; The University of Hong Kong, Hong Kong(香港大学,香港)
AI总结 TherapyGym通过评估和提升疗法聊天机器人中的忠实性与安全性,结合CTRS评分和多标签标注方案,利用RL训练框架改进模型性能,提升临床应用的安全性和有效性。
MedMASLab:多模态医疗多智能体系统的统一协调框架
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; vivo ; Stanford University(斯坦福大学)
AI总结 本文提出MedMASLab框架,解决医疗多智能体系统中多模态整合碎片化问题,通过标准化通信协议、自动化评估器和大规模基准测试,揭示领域特定性能差距,为未来自主临床系统建立新基准。
Image2Garment: 从单张图像生成可模拟的服装
机构 * Stanford University(斯坦福大学) ; Google(谷歌) ; Institute of Science Tokyo(东京科学研究所)
AI总结 本文提出一种框架,通过微调视觉语言模型获取材料属性,再训练轻量预测模型生成物理参数,实现从单张图像生成可模拟的服装。
Comments Project Page: https://image2garment.github.io/
有偏见的AI会影响政治决策
机构 * Department of Statistics, University of Washington(华盛顿大学统计学系) ; Department of Computer Science, University of Washington(华盛顿大学计算机科学系) ; Dallas, Texas(德克萨斯州达拉斯) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系) ; Psychiatry and Behavioral Science, University of Washington(华盛顿大学精神病学与行为科学系) ; Department of Communication, Stanford University(斯坦福大学传播学系)
AI总结 本文通过两个互动实验研究了LLM偏见对政治观点和决策的影响,发现参与者更容易接受与模型偏见一致的观点,即使个人政治倾向相反,且AI知识水平与偏见影响减弱相关。
潜在因果建模用于3D脑MRI反事实
机构 * Stanford University(斯坦福大学) ; Weill Cornell Medicine(韦尔·科恩医学中心) ; Imperial College London(伦敦帝国理工学院)
AI总结 本文提出一种两阶段方法,在潜在空间中构建结构因果模型,利用VQ-VAE学习MRI体积的紧凑嵌入,并通过闭式广义线性模型生成高质量3D脑MRI反事实。
人类与变换器语言模型:抽象驱动语言学习
机构 * Stanford University(斯坦福大学)
AI总结 研究比较变换器语言模型在训练过程中对语言类别的学习行为,发现抽象层面的行为早于词汇层面,揭示抽象对语言学习的重要性。
Comments EACL 2026
WebPII:用于计算机使用代理的视觉个人身份信息检测基准测试
机构 * Stanford University(斯坦福大学)
AI总结 本文提出WebPII基准测试,用于评估计算机使用代理中的视觉PII检测。该基准测试包含44,865个标注的电商UI图像,设计了三个关键特性:扩展的PII分类、前瞻性检测和可扩展的生成方法。实验表明,这些设计提高了在不同界面中的检测能力和对新页面类型的泛化能力。
神经辐射图用于外星导航和路径规划
机构 * Stanford University(斯坦福大学)
AI总结 本文提出利用神经辐射场构建地图,用于自主导航中的路径规划,通过整合局部和全局信息,实现更高效的路径规划。
Comments Published in the Proceedings of the ION GNSS+ 2023 Conference
一种集成电子健康记录的大型语言模型驱动工具在手术患者分诊中的部署与评估
机构 * Division of Hospital Medicine, Department of Medicine, Stanford University(斯坦福大学医院医学部,医学部) ; Stanford University School of Medicine(斯坦福大学医学院) ; Stanford Health Care, Technology and Digital Solutions(斯坦福健康,技术与数字解决方案) ; Division of Computational Medicine, Stanford University(斯坦福大学计算医学部) ; Stanford Health Care, Nursing Informatics(斯坦福健康,护理信息学)
AI总结 本文提出一种基于大型语言模型的工具,用于自动化手术患者分诊,通过电子健康记录实现,具有高灵敏度和中等特异性,展示了人工智能在医疗分诊中的应用价值。
Comments 35 pages, 4 figures, 5 tables
基于数字高程模型锚定的月球表面视觉SLAM
机构 * Stanford University(斯坦福大学)
AI总结 本文提出一种结合学习特征检测与DEM全局约束的视觉SLAM系统,用于月球表面长距离导航,通过引入高程和表面法线因素缓解长期漂移问题。
Comments Accepted to IEEE Aerospace Conference 2026
患者真正的问题:探索假定在患者信息获取中的影响
机构 * Duke University(杜克大学) ; Stanford University(斯坦福大学)
AI总结 研究探讨了患者实际提问中错误假设的影响,通过分析谷歌People Also Ask数据集,发现现有LLM在识别日常问题中的错误假设方面表现不佳。
统一优化与动力学以并行化顺序计算:并行牛顿方法的指南,以打破顺序瓶颈
机构 * STANFORD UNIVERSITY(斯坦福大学)
AI总结 本文提出并行牛顿方法,通过统一固定点方法,解决动态系统并行化中的效率、稳定性及收敛性问题,基于Lyapunov指数确定并行加速条件。
Comments PhD Dissertation; Stanford University
通过多示例提示进行测试时适应:益处、限制与陷阱
机构 * SambaNova Systems, Inc(SambaNova系统公司) ; Stanford University(斯坦福大学)
AI总结 研究通过多示例提示在不同任务和模型中分析测试时适应的性能变化,探讨其有效性及限制,指出其在结构化任务中的优势及在开放生成任务中的不足。
当城市教导汽车:从基础设施实现无标签的3D感知
机构 * The Ohio State University(俄亥俄州立大学) ; Google(谷歌) ; Cornell University(康奈尔大学) ; Stanford University(斯坦福大学) ; Boston University(波士顿大学)
AI总结 本文提出一种无标签的3D感知方法,利用道路设施作为无监督教师,通过固定视角和重复观测学习局部3D检测器,并广播预测作为伪标签监督,无需基础设施即可训练独立的车辆检测器。
Comments Project Page: https://jinsuyoo.info/civet/
高维数据缺失下的估计:统计与计算限制
机构 * Department of Data Sciences and Operations, University of Southern California(数据科学与运营系,南加州大学) ; Department of Statistics and Data Science, Carnegie Mellon University(统计与数据科学系,卡内基梅隆大学) ; Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)
AI总结 研究在数据缺失情况下高维参数估计的统计与计算限制,证明在均值估计中需大量样本才能达到误差要求,而计算高效算法难以达到此下限,但在线性回归中则可近似达到信息论下限。
通过人类-大语言模型聊天日志表征妄想螺旋
机构 * Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Chicago(芝加哥大学) ; Independent Researcher(独立研究者) ; Harvard Belfer Center(哈佛贝尔弗中心) ; University of Minnesota(明尼苏达大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文通过分析19名受聊天机器人影响用户的历史对话日志,揭示了妄想螺旋中用户与聊天机器人互动模式及心理危害,提出28项代码用于评估对话中的妄想、自伤和AI拟人化现象。
Comments To appear at ACM FAccT 2026
W2T: LoRA 权重已经知道它们能做什么
机构 * University of Surrey(萨里大学) ; Stanford University(斯坦福大学) ; University of Notre Dame(诺丁汉大学)
AI总结 W2T通过将LoRA权重转换为token化嵌入,验证了在消除因子化歧义后,LoRA权重能可靠指示模型行为,适用于属性分类、性能预测和适配器检索。
MedArena: 比较医疗领域LLM的临床医生偏好
机构 * Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) ; Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) ; Division of Hospital Medicine, Department of Medicine, Stanford School of Medicine(斯坦福医学院医学部住院医学科) ; Department of Radiology, St. Jude Children's Research Hospital(圣 Jude 儿童研究医院放射科) ; University of California, San Francisco(旧金山大学) ; Department of Pathology and Laboratory Medicine, University of Wisconsin School of Medicine and Public Health(威斯康星大学医学与公共卫生学院病理学与实验室医学系) ; Doximity, San Francisco, CA, USA(Doximity公司) ; Department of Medicine, Division of Rheumatology and Immunology, Vanderbilt University Medical Center(范德比尔特大学医学中心医学系风湿病与免疫学科) ; Department of Neurology, Charleston Area Medical Center(查尔斯顿医疗中心神经科) ; Department of Translational Medicine, Scripps Research Translational Institute(斯克里普斯研究转化研究所转化医学系) ; Kaiser Permanente Division of Research(凯撒医疗集团研究部)
AI总结 MedArena通过真实临床问题和医生偏好比较LLM,揭示临床实用性与基准性能的差异,强调可读性和临床细节的重要性。
结构电子健康记录基础模型中的分词权衡
机构 * Child Health Evaluative Sciences(儿童健康评估科学) ; The Hospital for Sick Children(圣迈克尔医院) ; University Health Network(大学健康网络) ; Department of Medicine(医学部) ; Division of Computational Medicine, Department of Medicine(计算医学科,医学部) ; Stanford University(斯坦福大学)
AI总结 本文研究了结构化电子健康记录基础模型中分词设计对性能和效率的影响,通过实验发现联合事件编码和时间位置编码在多个临床预测任务中表现更优,且计算效率更高。
谈话、评估、诊断:基于用户意识的代理评估与自动错误分析
机构 * SAP ; Stanford University(斯坦福大学)
AI总结 本文提出TED框架,通过用户角色模板、自动评分和错误分析,提升代理评估的全面性与效率,实验显示在模型和用户水平上取得8-10%的性能提升。
Comments Accepted as a conference paper at ICLR 2026. Code and dataset are available in the repository https://github.com/SAP-samples/agent-quality-inspect
消除与救援:残差流超连接的因果分析
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of California, Berkeley(加州大学伯克利分校) ; Independent(独立) ; University of Oxford(牛津大学)
AI总结 本文提出首个开源mHC语言模型,通过代表层面指标和因果干预分析多流架构,揭示并行流的信息编码与利用机制,引入系统性的流消除-救援框架进行因果比较。
从掩码引导自监督学习中学习通用的3D医学图像表示
机构 * Stanford University(斯坦福大学)
AI总结 本文提出MASS方法,通过掩码引导自监督学习,学习通用的医学图像表示,实现了在不同数据集上的高效分割和分类任务。
Comments CVPR 2026
多站点听诊录音的患者级多模态问答
机构 * Agentic Systems Lab, ETH Zurich(伦理学院系统实验室,苏黎世联邦理工学院) ; Eindhoven University of Technology(埃因霍温理工大学) ; Centre for Digital Health Interventions, ETH Zurich(数字健康干预中心,苏黎世联邦理工学院) ; Centre for Digital Health Interventions, University of St. Gallen(数字健康干预中心,圣加尔登大学) ; Stanford Mussallem Center for Biodesign, Stanford University(斯坦福穆萨勒姆生物设计中心,斯坦福大学)
AI总结 本文提出通过门控交叉注意力将多站点听诊录音与冻结的大语言模型嵌入空间对齐,实现患者级评估,在CaReSound基准上取得SOTA结果,展示轻量领域特定编码器与多站点聚合的优势。
扩散模型是否梦想着电动飞机?基于模拟的推断用于飞机设计
机构 * Computer Science Laboratory, SRI(SRI计算机科学实验室) ; Aerospace Design Laboratory, Stanford University(斯坦福大学航空航天设计实验室)
AI总结 本文基于模拟推断方法,生成电动垂直起降飞机的概念设计,引入两级概率模型,结合扩散模型加速设计生成并发现飞机设计中的物理规律。
VLD:用于强化学习导航的视觉语言目标距离
机构 * ETH Zurich(苏黎世联邦理工学院) ; EPFL(瑞士联邦理工学院) ; Stanford University(斯坦福大学) ; UC Berkeley(伯克利大学)
AI总结 本文提出VLD学习框架,通过解耦感知学习与策略学习,利用大规模视频数据训练距离预测器,提升机器人导航性能与现实迁移能力。
SpaceControl:引入测试时空间控制到3D生成建模
机构 * ETH Zurich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学) ; USI Lugano(卢塞恩大学) ; Technion(技术学院) ; NVIDIA(英伟达)
AI总结 本文提出SpaceControl,一种无需训练的测试时空间控制方法,支持多种几何输入,提升3D生成建模的几何精确度与视觉质量。
Comments Project page: https://spacecontrol3d.github.io/