Perceptual 3D Simulation With Physical World Modeling
基于物理世界建模的感知3D仿真
机构 * Stanford University(斯坦福大学)
AI总结 提出P3Sim系统,结合学习型物理世界模型、几何条件模块和持久场景记忆,在部分观测和不完整3D变换信号下模拟未来场景状态,实现多任务泛化。
Comments Published as a conference paper at CVPR 2026
高校专区
基于物理世界建模的感知3D仿真
机构 * Stanford University(斯坦福大学)
AI总结 提出P3Sim系统,结合学习型物理世界模型、几何条件模块和持久场景记忆,在部分观测和不完整3D变换信号下模拟未来场景状态,实现多任务泛化。
Comments Published as a conference paper at CVPR 2026
微调多模态大语言模型用于从短视频中对自闭症行为进行临床级评分
机构 * Stanford University(斯坦福大学) ; University of Hawaii at Manoa(夏威夷大学马诺阿分校) ; University of California San Francisco(加利福尼亚大学旧金山分校)
AI总结 微调Gemini 2.5 Pro模型,从400个临床评分的家庭视频中提取30个行为特征,在99名儿童上实现与临床医生评分的一致性提升40%,并零样本达到53%的自闭症诊断F1提升。
纯正样本学习中的意外
机构 * University of Waterloo and Vector Institute(滑铁卢大学和向量研究所) ; Stanford University(斯坦福大学) ; Yale University(耶鲁大学)
AI总结 本文研究了纯正样本二分类问题,提出了“均匀外部可分离性”这一新组合条件,并证明概念类可被恰当学习当且仅当VC维有限且满足该条件,揭示了与标准PAC学习截然不同的丰富图景。
拓扑信息神经网络用于光学和合成孔径雷达影像的洪水检测
机构 * US Naval Research Laboratory(美国海军研究实验室) ; Stanford University(斯坦福大学)
AI总结 针对云遮挡导致光学卫星图像难以检测洪水的问题,提出将拓扑数据分析(TDA)提取的拓扑特征融入神经网络,在SEN12-FLOOD数据集上实现更鲁棒和可解释的洪水检测。
SC3-Eval: 通过自洽视频生成评估机器人基础模型
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; NVIDIA(英伟达) ; Physical Intelligence ; Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Allen Institute for AI(艾伦人工智能研究所)
AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。
不要停留在众数!通过特征自引导缓解预训练流模型中的多样性坍塌
机构 * Indian Institute of Science(印度科学研究所) ; Stanford University(斯坦福大学)
AI总结 提出一种无需训练的自引导机制,通过分散批次生成中的内部特征并施加流形正则化,在几乎不增加推理成本的前提下缓解预训练流模型的多样性坍塌问题。
Comments Accepted by ECCV 2026. Project page: https://dont-settle-at-the-mode.github.io/
具有动力学的模拟硬件上的生成模型
机构 * Stanford University(斯坦福大学)
AI总结 提出模拟交互系统框架,通过时变分段参数和隐藏物理状态缩小模拟硬件与生成模型间的差距,结合WGAN训练,在MNIST上实现FID 27.6,能耗比数字方法低两个数量级。
RSPC:使用精神科医生标注对数字媒介关系中的压力和精神病状况进行建模的基准
机构 * Indian Institute of Information Technology Dharwad(印度信息技术学院达尔瓦德分校) ; Keshav Memorial College of Engineering(克沙夫纪念工程学院) ; National University of Singapore(新加坡国立大学) ; University of Birmingham(伯明翰大学) ; NVIDIA, Singapore(英伟达(新加坡)) ; Stanford University(斯坦福大学) ; INSEAD(欧洲工商管理学院)
AI总结 提出RSPC基准,包含精神科医生标注的Reddit帖子,用于多标签障碍分类、关系触发检测和阶段预测,发现模型能力差异及焦虑与关系不确定性的关联。
auto-psych: 使用智能体驱动的理论发现与实验自动化心智科学
机构 * Stanford University(斯坦福大学)
AI总结 提出auto-psych系统,通过嵌套智能体循环自动生成认知模型、设计并在线执行实验、收集数据,在抛硬币随机性判断任务中恢复真实理论并优于文献理论。
Comments 30 pages, 5 figures
重新思考预测中的训练与推理:将赢家通吃带回高斯混合模型
机构 * Cornell University(康奈尔大学) ; Stanford University(斯坦福大学) ; Boston University(波士顿大学)
AI总结 针对轨迹预测中赢家通吃训练导致模式后验不可靠的问题,提出测试时后验加权合并和一步EM更新两种轻量级后处理方法,无需重训练即可提升模式排序和预测精度。
Comments Accepted by ECCV 2026
面向心理健康药物信息检索的知识增强型智能体AI
机构 * Department of Medicine and Therapeutics, The Chinese University of Hong Kong(香港中文大学内科及药物治疗学系) ; Department of Psychiatry, The Chinese University of Hong Kong(香港中文大学精神科学系) ; School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) ; College of Information Science, University of Arizona(亚利桑那大学信息科学学院) ; Department of Medicine, Stanford University School of Medicine, Stanford University(斯坦福大学医学院医学系) ; Perelman School of Medicine, The University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院) ; Department of Biostatistics, Vanderbilt University(范德堡大学生物统计学系) ; Li Ka Shing Institute of Health Sciences, Faculty of Medicine, The Chinese University of Hong Kong(香港中文大学医学院李嘉诚健康科学研究所)
AI总结 提出一种基于知识图谱的多智能体框架,整合Reddit、WebMD和FDA不良事件报告,通过来源感知集成实现可审计的精神科药物信息检索。
基于图灵奖励的学习用户模拟器
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Stanford University(斯坦福大学) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
AI总结 提出Turing-RL方法,利用基于图灵测试的强化学习训练用户模拟器,通过判别性图灵奖励使生成响应与真实用户不可区分,在对话和论坛讨论中优于基线方法。
MetaboNet-Bench:1型糖尿病血糖预测的多模态基准
机构 * Department of Genetics, Stanford University School of Medicine(斯坦福大学医学院遗传学系) ; Replica Health ; Boston Children’s Hospital, Harvard Medical School(哈佛医学院波士顿儿童医院) ; Diabetes Research Institute, Mills-Peninsula Medical Center(米尔斯半岛医学中心糖尿病研究所)
AI总结 针对1型糖尿病血糖预测算法缺乏标准化评估基准的问题,提出MetaboNet-Bench多模态基准,集成血糖、胰岛素和碳水化合物数据,通过多个模型对比验证多模态数据对模型性能的影响。
Comments main content in 10 pages with 5 figures; supplementary section with 11 more pages and 5 more figures. v2: fix figure 4 and 5's misordering
CheXanatomy: 面向胸部X光片的解剖感知视觉-语言建模
机构 * Stanford Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学医学与影像人工智能中心) ; Department of Radiology, Stanford University(斯坦福大学放射学系)
AI总结 提出CheXanatomy框架,通过自回归令牌空间监督将解剖知识融入预训练视觉-语言模型,实现解剖分割,在合成和真实X光片上性能媲美U-Net,并提升域迁移鲁棒性和样本效率。
实时语音AI能听到但不倾听
机构 * Together AI ; Stanford University(斯坦福大学)
AI总结 评估四个领先实时语音系统,发现它们依赖文字而非声学线索,在情感理解上存在感知与行动脱节,提示需谨慎用于依赖语调的场景。
相同证据,不同答案:多模态大语言模型中的顺序敏感性审计
机构 * Stanford University(斯坦福大学)
AI总结 提出Facet-Probe审计框架,评估18个多模态大语言模型在五种顺序扰动下的答案翻转率,发现所有模型均非顺序不变,最佳模型仍有13.4%翻转率,提示仅靠提示级缓解难以实现通用顺序鲁棒性。
Comments 22 pages, 4 figures, 5 tables
极限空间高效语言生成
机构 * EPFL(苏黎世联邦理工学院) ; Stanford University(斯坦福大学)
AI总结 针对空间效率约束下的极限语言生成问题,提出基于DFA假设类的流式算法,在多项式空间内实现生成差距O(k^{2s-2}),并证明近乎匹配的下界。
Comments Accepted at COLT 2026
BiPACE:基于双模拟引导与动作反事实估计的LLM智能体策略优化
机构 * University of Chicago(芝加哥大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Stanford University(斯坦福大学) ; University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
AI总结 针对分组强化学习中状态-动作信用分配不匹配问题,提出BiPACE优势估计器,通过双模拟引导的状态聚类和动作反事实基线,在无需批评网络或额外采样的前提下提升LLM智能体训练效果。
结构化稀疏:块稀疏特征化器捕获视觉概念流形
机构 * Goodfire ; Harvard University(哈佛大学) ; Stanford University(斯坦福大学) ; Brown University(布朗大学)
AI总结 提出块稀疏特征化器(BSF)来建模视觉概念流形,通过最小描述长度分析证明其比方向基特征化器更紧凑,并应用于解释曲线检测、发现新流形及控制图像生成。
面向LLM服务的几何感知在线调度:从理论界到系统实践
机构 * Gaoling School of Artificial Intelligence(人工智能学院) ; Renmin University of China(中国人民大学) ; Department of Management Science and Engineering(管理科学与工程系) ; Stanford University(斯坦福大学) ; Department of Industrial Engineering and Decision Analytics(工业工程与决策分析系) ; HKUST(香港科技大学)
AI总结 针对LLM推理中KV缓存动态内存占用问题,提出Smallest Volume First (SVF)算法,通过几何感知调度优化性能,理论证明将竞争比从48降至5,并在vLLM中实现即插即用,显著降低平均和尾部延迟。
InSight: 通过可引导的VLA实现自主技能获取
机构 * Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学)
AI总结 提出InSight框架,通过将VLA模型在基本动作层面变得可引导,实现自主技能获取,包括自动分割演示为基本动作和VLM引导的数据飞轮,无需人类演示即可学习新技能。
Comments Project website: https://insight-vla.github.io
BenchX: 基于人口统计和协议偏差的癌症检测与定位AI模型基准测试
机构 * Johns Hopkins University(约翰霍普金斯大学) ; German Cancer Research Center(德国癌症研究中心) ; University Hospital Basel(巴塞尔大学医院) ; University of Zurich(苏黎世大学) ; ETH AI Center(苏黎世联邦理工学院AI中心) ; Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) ; Stanford University(斯坦福大学) ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Nanyang Technological University(南洋理工大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校) ; University of California, San Francisco(加州大学旧金山分校) ; Johns Hopkins Medicine(约翰霍普金斯医学)
AI总结 提出BenchX基准,通过85,355次CT扫描系统评估12个肿瘤检测AI模型在肿瘤大小、位置、患者亚组和成像协议上的表现,揭示模型在罕见亚组中性能不佳。
OpenThoughts-Agent: 智能体模型的数据配方
机构 * UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; JSC(于利希超级计算中心) ; LAION ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Bespoke Labs ; Laude Institute ; UCLA(加州大学洛杉矶分校) ; Harvard University & Harvard Medical School(哈佛大学与哈佛医学院) ; TU Munich & Munich Center for Machine Learning(慕尼黑工业大学与慕尼黑机器学习中心) ; New York University(纽约大学) ; Medical University of South Carolina(南卡罗来纳医科大学) ; The LLM Data Company ; BenchFlow ; Independent Researcher(独立研究员) ; Northeastern University(东北大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of Washington(华盛顿大学) ; TU Darmstadt(达姆施塔特工业大学) ; University of Southern California(南加州大学) ; UC San Diego(加州大学圣地亚哥分校) ; Amazon(亚马逊) ; Microsoft(微软) ; Korea University(高丽大学) ; Cornell Tech(康奈尔科技) ; University of Michigan(密歇根大学)
AI总结 提出全开放数据筛选流水线,通过100多次消融实验研究任务来源与多样性,构建10万样本训练集,在7个智能体基准上平均44.8%准确率,较最强开源模型提升3.9个百分点。
基于多模态教材特征的情境感知学生测验表现预测
机构 * Stanford University(斯坦福大学)
AI总结 本研究通过提取CourseKata教材中复习题的文字和图像特征,结合学生历史表现,将章节测验预测准确率相对提升9.1%,表明情境感知模型能利用内容特征改进预测。
Comments 4 pages, 2 figures, 2 tables
修剪视觉世界建模评估的长尾
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学) ; Columbia University(哥伦比亚大学)
AI总结 针对视觉世界模型在罕见物理交互上泛化不足的问题,提出Tailor-Bench基准,通过常规、非常规和不可能三种场景模式系统评估模型推理能力,揭示长尾性能差距。
Agon:基于提示经济学的自主大规模全学科研究系统
机构 * University of Maryland, College Park(马里兰大学 College Park 分校) ; The Chinese University of Hong Kong(香港中文大学) ; Stanford University(斯坦福大学)
AI总结 提出Agon研究编排系统,通过提示经济学循环实现大规模自主研究,将可验证任务自动化,不可验证判断留给人类,并分类了系统失败类型。
BehaviorBench: 行为科学任务的基础模型基准测试
机构 * University of Michigan(密歇根大学) ; MobLab ; Stanford University(斯坦福大学) ; Santa Fe Institute(圣塔菲研究所)
AI总结 提出BehaviorBench基准,评估基础模型在行为预测、战略决策、特质推断和行为知识应用四类任务上的个体与分布级表现,发现通用模型个体预测强,而微调的行为模型分布对齐更优。
解读3D分子表面指纹以实现准确的表位预测
机构 * Stanford University(斯坦福大学) ; The University of Tokyo(东京大学) ; Amazon AWS(亚马逊AWS)
AI总结 提出SurfBind框架,直接基于分子表面表示,通过Transformer架构、补丁级表面建模、结合物感知交叉注意力和分层粗到细预测范式,实现表位预测,在SAbDab和DB5.5基准上达到最先进性能。
Journal ref KDD 2026 AI4Science
PanoVine: 软体生长藤蔓机器人的全身视觉运动控制
机构 * Stanford University(斯坦福大学)
AI总结 针对软体生长藤蔓机器人难以建模和控制的问题,提出基于全身视觉反馈的数据驱动控制框架,利用19个分布式相机和端到端策略实现复杂环境下的自主导航与操作。
SPIRAL: 学习搜索与聚合
机构 * Stanford University(斯坦福大学)
AI总结 提出SPIRAL框架,通过强化学习联合训练语言模型在推理时使用顺序推理、并行采样和聚合三种原语,实现端到端优化,显著提升推理计算扩展效率。
Comments Ongoing Work