arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 301
2607.16412 2026-07-21 cs.AI 新提交

Interactive Task Alignment as a POMDP

作为部分可观测马尔可夫决策过程的交互式任务对齐

Andy Dai, Zexue He, Zhenyu Zhang, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学)

AI总结 研究语言模型在面对模糊用户任务时的任务对齐问题,引入基于部分可观测马尔可夫决策过程的框架,通过用户研究验证,发现模型任务对齐困难,训练能改善但仍落后于人类,揭示其缺乏关键交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16241 2026-07-21 cs.LG cs.AI 新提交

KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch?

KernelBench验证:大语言模型生成的内核真的能超越PyTorch吗?

Yunxiang Zhang, Ping Yu, Jianyu Wang, Max, Fan, Julian Reed, Azalia Mirhoseini, Will Su

机构 * Meta FAIR at Meta SuperIntelligence Lab(元超智能实验室公平团队) Stanford University(斯坦福大学)

AI总结 研究大语言模型生成的内核是否真能超越PyTorch,指出前沿模型存在奖励黑客行为。引入KernelBench-Verified扩展评估框架及内存效率指标,实验发现最佳模型加速比低,无模型始终超PyTorch,部分模型增加GPU内存峰值使用,强调持续调整评估协议的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17595 2026-07-21 cs.LG cs.SY eess.SY math.OC 新提交

Concentration and Mean-Square Bounds for Contractive Stochastic Approximation: A Unified Elementary Approach

压缩随机逼近的集中性和均方界:一种统一的基本方法

Siddharth Chandak

机构 * Department of Electrical Engineering, Stanford University(电气工程系,斯坦福大学)

AI总结 研究乘性噪声模型下任意范数压缩映射的随机逼近,提出统一基本分析方法,通过平均噪声序列等得到范数误差的李雅普诺夫漂移不等式,进而得出均方和集中性界,还讨论了证明技术的可推广性。

Comments Submitted to Stochastic Processes and their Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16570 2026-07-21 cond-mat.mtrl-sci cs.LG 新提交

Mapping Order in Semicrystalline Polymers using Machine Learning of Nanobeam Electron Diffraction

利用纳米束电子衍射的机器学习绘制半结晶聚合物中的取向

Nicholas Marchese, Arthur R. C. McCray, Yael Tsarfati, Karen Bustillo, Adam Marks, Alberto Salleo, Colin Ophus

机构 * Department of Materials Science and Engineering, Stanford University(材料科学与工程系,斯坦福大学) SLAC National Accelerator Laboratory(SLAC国家加速器实验室) National Center for Electron Microscopy, Molecular Foundry, Lawrence Berkeley National Laboratory(电子显微镜国家中心、分子发现所、伯克利国家实验室)

AI总结 研究利用机器学习模型从合成数据中检测聚合物衍射峰及其强度,相比传统相关峰检测算法,该模型速度更快且性能更优,为4DSTEM实验近实时可视化开辟可能,有助于理解有机混合离子电子导体结构与性能关系。

Comments Submitted to ACS Macromolecules. Main text is 13 pages and 5 figures, 23 pages and 15 figures with supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15631 2026-07-20 q-bio.NC cs.CV 新提交

STSBench: A Large-Scale Dataset for Modeling Neuronal Activity in the Dorsal Stream of Primate Visual Cortex

STSBench:用于灵长类动物视觉皮层背侧流神经元活动建模的大规模数据集

Ethan B. Trepka, Ruobing Xia, Shude Zhu, Sharif Saleki, Danielle Abreu Lopes, Stephen J. Niño Cital, Konstantin F. Willeke, Mindy Kim, Tirin Moore

机构 * Neuroscience Interdepartmental Program, Stanford University(斯坦福大学神经科学跨学科项目) Department of Neurobiology, Stanford University(斯坦福大学神经生物学系) Howard Hughes Medical Institute, Stanford University(斯坦福大学霍华德·霍夫曼医学研究所)

AI总结 针对灵长类动物视觉系统背侧流建模缺乏大规模数据集的问题,提出STSBench数据集,它包含超2000个神经元记录,比现有数据集增加近50倍,可用于背侧流神经元反应编码模型基准测试及视觉输入重建。

Comments 21 pages, 10 figures, Advances in Neural Information Processing Systems 38 (NeurIPS 2025) Datasets and Benchmarks Track

Journal ref Advances in Neural Information Processing Systems 38 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16187 2026-07-20 cs.RO 新提交

Handroid: Bridging Dexterous Hand and Humanoid

Handroid:连接灵巧手与人形机器人

Ruogu Li, Chenyang Ma, Sikai Li, Zhenyu Wei, Yunchao Yao, Haochen Shi, C. Karen Liu, Shuran Song, Mingyu Ding

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Stanford University(斯坦福大学)

AI总结 研究旨在开发兼具灵巧手与拟人机器人功能的平台,提出Handroid,它能在单一可重构平台集成两种能力,有统一控制学习框架,经多种任务验证,成为推进形态可重构机器人技术及跨实体学习的紧凑可复制平台。

Comments Project website: https://handroid.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14163 2026-07-17 q-bio.QM cs.CV cs.LG 新提交

A vision foundation model for single-cell biology via spatial gene cartography

通过空间基因制图构建单细胞生物学的视觉基础模型

Ridvan Yesiloglu, Sakib Mostafa, James Zou, Ash Alizadeh, Jiajun Wu, Lei Xing, Ehsan Adeli, Md Tauhidul Islam

机构 * Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院)

AI总结 研究提出scVision视觉基础模型,利用最优传输将基因布局成图像,通过掩码图像建模预训练视觉Transformer。该模型在零样本评估中表现出色,能无监督恢复基因程序,在多研究整合中效果好,还证明基因布局位置携带信号,重塑单细胞表示学习为视觉问题。

Comments 54 pages, 34 figures, 10 tables, including supplementary information. Project page: https://islamlab.org/scvision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15275 2026-07-17 cs.RO cs.AI cs.LG 新提交

RoboTTT: Context Scaling for Robot Policies

RoboTTT:机器人策略的上下文扩展

Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan

机构 * NVIDIA(英伟达公司) Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究提出RoboTTT,将测试时训练集成到机器人基础模型,通过序列动作强制和截断反向传播扩展视觉运动上下文到8K时间步长,解锁新能力,提升多任务性能,证明上下文长度是机器人基础模型新扩展轴。

Comments Project website: http://research.nvidia.com/labs/gear/robottt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14272 2026-07-17 cs.LG math.DS math.OC 新提交

Lyapunov Guidance: A Unified Framework for Stabilizing Generative Flows

李雅普诺夫引导:稳定生成流的统一框架

Jingdong Zhang, Xinze Li, Yize Jiang, Luan Yang, Minkai Xu, Junhong Liu

机构 * Imperial College London(伦敦帝国理工学院) Fudan University(复旦大学) Stanford University(斯坦福大学) MicroCyto(微赛生物)

AI总结 研究针对流匹配重新训练计算昂贵、现有训练后引导方法无稳定性保证的问题,提出LyaGuide框架,将流引导作为李雅普诺夫控制问题,统一多种引导策略,经实验验证其在多方面有改进且保持计算效率。

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13681 2026-07-16 cs.CV 新提交

Towards Spatial Supersensing in the Wild

迈向野外空间超感知

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

机构 * Tsinghua University(清华大学) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 研究针对空间超感知中多模态模型基准测试局限于合成视频和家庭场景的问题,引入VSI-Super-Wild基准,受人类认知启发探究世界状态三元组,通过大量真实视频问答对测试发现模型不足及失败模式,为空间超感知发展指明方向。

Comments Accepted to ECCV 2026. Project page: https://vsi-super-wild.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13058 2026-07-16 cs.RO cs.ET 新提交

Power from Potential: A Survey of Electrostatic Actuators for Haptics

源于电势的动力:用于触觉的静电致动器综述

Ahad M. Rauf, Ran Zhou, Eric Acome, Madeline Balaam, Sean Follmer, Teng Han, Craig Shultz, Daniel Leithinger

机构 * Stanford University(斯坦福大学) KTH Royal Institute of Technology(瑞典皇家理工学院) Artimus Robotics(阿蒂姆斯机器人公司) Chinese Academy of Science(中国科学院) Fluid Reality, Inc.(流体现实公司) Cornell University(康奈尔大学)

AI总结 该文综述用于触觉的高压静电致动器,考察静电可切换粘合剂等四类,描述其触觉输出机制、表征相关性能,通过跨技术分析确定设计限制与新兴策略,指出其在推动触觉交互上的独特定位及关键研究方向。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12480 2026-07-15 cs.AI 新提交

TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

TRACE:可审计的智能体承诺的操作推理模式

Edward Y. Chang, Emily J. Chang

机构 * Stanford University(斯坦福大学) Quadrivium AI(四元数人工智能)

AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。

Comments 46 pages, 18 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12443 2026-07-15 cs.CL cs.DS cs.LG 新提交

Language Identification with Succinct Machine-Independent Traces

基于简洁的与机器无关的迹进行语言识别

Moses Charikar, Jon Kleinberg, Chirag Pabbaraju

机构 * Stanford University(斯坦福大学) Cornell University(康奈尔大学)

AI总结 本文受大语言模型启发,针对语言识别的Gold-Angluin模型相关问题,解决能否用小字母表迹及能否直接从语言定义迹的问题,给出肯定答案,展示了如何定义计算迹实现极限识别,所用字母表与语言定义字母表大小成线性关系且与语言其他属性无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11884 2026-07-14 cs.RO 新提交

Mixture of Frames Policy: Multi-Frame Action Denoising for Bimanual Mobile Manipulation

帧混合策略:用于双手机器人移动操作的多帧动作去噪

Dian Wang, Jisang Park, Xiaomeng Xu, Han Zhang, Shuran Song, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

AI总结 研究双手机器人移动操作中多帧动作去噪问题,提出帧混合策略(MoF),通过在多坐标框架同步去噪,维护规范扩散状态并融合噪声预测,在模拟和实际任务中均优于单帧基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11606 2026-07-14 cs.CL cs.DS cs.LG 新提交

Globally Consistent Coloring Schemes for Language Identification

用于语言识别的全局一致着色方案

Moses Charikar, Jon Kleinberg, Chirag Pabbaraju

机构 * Stanford University(斯坦福大学) Cornell University(康奈尔大学)

AI总结 研究对抗性语言学习所需额外信息,探讨终端着色能否替代整个颜色序列用于语言识别,证明每个字符串只需一个终端位,全局构造用超限递归,还表明有限颜色的博雷尔映射终端着色不能识别所有可数子集合。

Comments Abstract shortened to fit arxiv limit

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11167 2026-07-14 cs.RO cs.AI cs.LG 新提交

Pix2Act: Image-Space Manipulation Policies with Equivariant Augmentation

Pix2Act:具有等变增强的图像空间操纵策略

Haojie Huang, Linfeng Zhao, Haotian Liu, Zhang Ye, Si-Yuan Huang, Mingxi Jia, Boce Hu, Fangzhou Lin, Yu Qi, Dian Wang, Robin Walters, Robert Platt

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学) Brown University(布朗大学) Texas A&M University(德州农工大学)

AI总结 研究针对将操纵动作表示为相机平面二维轨迹带来的挑战,提出Pix2Act模仿学习方法,通过生成图像空间关键点轨迹及三角测量恢复末端执行器姿态,将三维控制转为二维预测问题,提升泛化能力与性能,优于现有基线且抗相机扰动。

Comments Project Website: https://haojhuang.github.io/pix2act_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11119 2026-07-14 cs.RO cs.AI 新提交

VIA: Visual Interface Agent for Robot Control

VIA:用于机器人控制的视觉接口代理

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

机构 * Stanford University(斯坦福大学)

AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10891 2026-07-14 cs.AI 新提交

SETA: Scaling Environments for Terminal Agents

SETA:终端智能体的扩展环境

Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru, Aznaur Aliev, Jay Rainton, Ahmed Awelkair, Zhichen Zeng, Jiajun Li, Shi Dong, Yueming Yuan, Boyuan Ma, Qizheng Zhang, Jiwei Fu, Yuzhen Mao, Wendong Fan, Ping Nie, Philip Torr, Bernard Ghanem, Changran Hu, Jonathan Lingjie Li, Urmish Thakker, Guohao Li

机构 * Imperial College London(帝国理工学院) University College London(伦敦大学学院) SambaNova(桑巴诺瓦公司) KAUST(阿卜杜拉国王科技大学) Stanford University(斯坦福大学) University of Oxford(牛津大学) University of Waterloo(滑铁卢大学) RadixArk(基数方舟公司)

AI总结 研究针对终端智能体训练扩展难的问题,提出SETA框架,含SETA - Synth和SETA - Evol两个管道及统一验证机制,构建了SETA - Env数据集。实验显示该数据集能为终端智能体提供优质训练环境,推动相关研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10826 2026-07-14 cs.CV cs.AI cs.GR 新提交

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究

Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * Roblox Corporation(罗布乐思公司) Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) Computer Science Department, Stanford University(斯坦福大学计算机科学系) Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)

AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10706 2026-07-14 cs.RO cs.AI cs.CV cs.LG 新提交

Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification

动作映射策略:通过像素分类学习3D闭环操作

Haojie Huang, Zhang Ye, Linfeng Zhao, Boce Hu, Mingxi Jia, Yu Qi, Ahmed Agha, Dian Wang, Robert Platt, Robin Walters

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) Brown University(布朗大学)

AI总结 研究针对机器人学习中动作空间的挑战,提出动作映射策略(AMP),将3D闭环操作策略学习转为图像空间分类问题,通过投影动作到图像平面,以像素为类别控制维度,实现高精度、快速推理,实验证明其优于基线。

Comments Project Website: https://haojhuang.github.io/amp_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10034 2026-07-14 cs.LG 新提交

MLPs are Hebbians: Constructing Efficient Fact-Storing MLPs for Transformers

多层感知器是赫布型的:为Transformer构建高效的事实存储多层感知器

Roberto Garcia, Jerry Liu, Ronny Junkins, Sabri Eyuboglu, Atri Rudra, Christopher Ré

机构 * Institute for Computational & Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Computer Science and Engineering, University at Buffalo(布法罗大学计算机科学与工程系)

AI总结 研究大语言模型中MLP层以最优速率存储事实知识的现象,开发首个与Transformer兼容的事实存储MLP闭式构造,具有最优存储缩放等特性,所需参数更少,还能用于事实召回任务及实现模块化事实编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09985 2026-07-14 cs.CV 新提交

UniPose9D: Universal Category-Agnostic Object Pose Estimation

UniPose9D:通用的类别无关物体姿态估计

Yang You, Yi Du, Cole Harrison, Leonidas Guibas

机构 * Stanford University(斯坦福大学) Amazon(亚马逊)

AI总结 研究针对物体姿态估计中现有方法泛化性不足的问题,提出UniPose9D模型,通过采样点对、利用特定特征预测NOCS坐标,引入改进算法及流匹配,构建训练集,实验证明该模型能匹配或超越专业方法,泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09811 2026-07-14 cs.CV 新提交

Detangled: A Framework for Creating, Editing, and Inferencing Feature Rich Hair Strands

Detangled:一个用于创建、编辑和推理具有丰富特征的发丝的框架

Sarah Jobalia, Yitong Deng, Carolyn Smith, Ronald Fedkiw

机构 * Stanford University(斯坦福大学)

AI总结 该研究提出用于理解和生成丰富特征发丝的框架,构建五维参数空间,用新方法分离发丝纹理与整体方向,通过生成式AI创建符合纹理描述的新发丝,可用于造型编辑并展示了多种发型结果。

Comments 18 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09655 2026-07-13 cs.CV 新提交

OpenLongTail: Generative Scaling of Long-Tail Driving Data

OpenLongTail:长尾驾驶数据的生成式扩展

Lulin Liu, Nuo Chen, Yan Wang, Bangya Liu, Wenyan Cong, Hezhen Hu, Boris Ivanovic, Hao Wang, Ziyao Zeng, Xinyu Gong, Yang Zhou, Zixiang Xiong, Dilin Wang, Zhangyang Wang, Weisong Shi, Ruohan Zhang, Marco Pavone, Zhiwen Fan

机构 * Texas A&M University(德克萨斯农工大学) NVIDIA(英伟达) UW–Madison(威斯康星大学麦迪逊分校) UT Austin(德克萨斯大学奥斯汀分校) Yale University(耶鲁大学) Adobe(奥多比公司) Meta University of Delaware(特拉华大学) Stanford University(斯坦福大学)

AI总结 研究针对长尾驾驶数据稀缺影响策略扩展的问题,提出开源生成数据引擎OpenLongTail,通过姿态外推视图合成管道及普吕克射线几何增强,合成异构数据提升闭环驾驶稳健性,验证了其多方面有效性。

Comments Project page: https://openlongtail.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09366 2026-07-13 cs.SE cs.AI cs.LO 新提交

Diversifying to Verify: When Task-Equivalent Programs Differ in Verifiability

多样化以进行验证:当任务等效程序在可验证性上存在差异时

Shirley Yu, Ruben Martins

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究任务等效程序的可验证性差异,提出基于大型语言模型的Diversify2Verify管道,通过推断契约、生成测试不同实现并修复注释来验证,构建基准测试,结果表明实现多样性有助于验证,提高了验证成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09042 2026-07-13 cs.LG 新提交

Learning More from Less: Reinforcement Learning from Hindsight

从更少中学习更多:事后诸葛亮式强化学习

Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Stanford University(斯坦福大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

AI总结 研究针对强化学习用于视觉-语言-动作模型后期训练时样本效率低的问题,提出事后诸葛亮式学习方法,通过对失败轨迹重标记,让策略联合原始与重标记轨迹训练,在分布外任务上显著提升样本效率并优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28320 2026-07-13 cs.RO 新提交

WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation

WARP-RM: 一种用于数据筛选的扭曲增强相对进度奖励模型

Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) XDOF

AI总结 提出WARP-RM,通过时间扭曲增强从成功演示中自监督学习密集相对进度信号,用于行为克隆中加权高优势动作块,在机器人叠衣任务中显著提升数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08024 2026-07-10 cs.CV cs.AI cs.LG cs.RO 新提交

APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts

APIVOT:具有交错视觉语言思维的自适应规划

Emily Jin, Joy Hsu, Yiqing Xu, Weiyu Liu, Nick Haber, Jiajun Wu

机构 * Stanford University(斯坦福大学)

AI总结 研究长期机器人规划问题,提出基于VLM的APIVOT规划器,通过自适应交错语言和视觉思维,利用语言语义推理、视觉思维验证几何可行性,在长期厨房任务中表现出色,提升了规划成功率和推理效率。

Comments Project Page: https://emilyzjin.github.io/projects/apivot.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07967 2026-07-10 stat.ML cs.LG math.OC 新提交

Expressivity and Statistical Trade-offs in Diffusion Policy Learning

扩散策略学习中的表达能力与统计权衡

Viet Vu, Renyuan Xu, Jiacheng Zhang, Yufei Zhang

机构 * Stanford University(斯坦福大学) Chinese University of Hong Kong(香港中文大学) Imperial College London(伦敦帝国理工学院)

AI总结 研究扩散策略学习中表达能力与统计权衡,确定漂移Lipschitz预算K为核心量,通过近似量化表达能力,证明其与统计复杂性的关系,给出有限样本性能差距,数值实验验证,还提出根据样本大小选K及对应神经网络架构的实现原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08041 2026-07-10 cs.LG cond-mat.dis-nn 新提交

An exact information theory of generalization phase transitions in Bayesian diffusion models

贝叶斯扩散模型中泛化相变的精确信息理论

Henry Hunt, Mason Kamb, Surya Ganguli

机构 * Stanford University(斯坦福大学)

AI总结 研究扩散模型如何从有限训练集学习复杂分布,引入BIRD模型,通过贝叶斯后验推断实现时间反转扩散,确定记忆与泛化的信息理论相变边界,实验证实理论预测,揭示信息受限在生成式AI中规避维度灾难的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏