arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-07-21 至 2026-07-21 共收录 10
2607.08986 2026-07-21 cs.AI cs.LO math-ph math.AP math.MP 版本更新

A Formalization of the Mean-Field Derivation of the Vlasov Equation

弗拉索夫方程平均场推导的形式化:作为策略游戏的人工智能辅助精益形式化

Joseph K. Miller

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究以数学家指导AI在Lean 4中形式化研究成果为案例,将其构建为形式化游戏。通过此方式对非线性弗拉索夫方程适定性完整形式化,展示了开发过程及成果,还介绍了最优传输机制的分离情况及开发时间等,为形式化研究提供了新方法。

Comments 26 pages, 4 figures. Lean 4 development, blueprint site, and agent logs: https://github.com/Hydrodynamical/Vlasov_Meanfield_Formalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04460 2026-07-21 cs.CR cs.AI cs.LG 版本更新

CyberGym-E2E: Scalable Real-World Benchmark for AI Agents' End-to-End Cybersecurity Capabilities

CyberGym-E2E:面向AI代理端到端网络安全能力的可扩展真实世界基准

Tianneng Shi, Robin Rheem, Dongwei Jiang, Mona Wang, Francisco De La Riega, Zhun Wang, Jingzhi Jiang, Alexander Cheung, Sean Tai, Jonah Cha, Jianhong Tu, Gabriel Han, Chenguang Wang, Jingxuan He, Wenbo Guo, Dawn Song

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

AI总结 提出CyberGym-E2E,一个大规模、真实的端到端网络安全基准,通过自动化流水线将开源漏洞数据转化为评估环境,全面评估AI代理在漏洞发现、PoC生成和补丁生成全生命周期中的能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22681 2026-07-21 cs.AI 版本更新

Scientific reasoning does not reliably translate into scientific forecasting in frontier AI

用人工智能预测科学进步

Sean Wu, Pan Lu, Yupeng Chen, Jonathan Bragg, Yutaro Yamada, Peter Clark, David Clifton, Philip Torr, James Zou, Junchi Yu

机构 * University of Oxford(牛津大学) Stanford University(斯坦福大学) Allen Institute for AI(人工智能研究所) Sakana AI

AI总结 本文研究了人工智能在预测科学进步中的能力,提出了一种基于时间的评估框架,并介绍了CUSP基准,通过可行性评估、机制推理、生成性解决方案设计和时间预测来评估AI系统的科学预测能力,发现当前前沿模型在不同领域存在系统性限制,且预测结果受事件发生时间影响较大,表明AI在科学预测中仍存在不足。

Comments 62 pages, 14 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21693 2026-07-21 cs.AI 版本更新

Deterministic Hallucination Detection in Medical VQA via Confidence-Evidence Bayesian Gain

医学VQA中通过置信度-证据贝叶斯增益实现确定性幻觉检测

Mohammad Asadi, Tahoura Nedaee, Jack W. O'Sullivan, Euan Ashley, Ehsan Adeli

机构 * Department of Electrical Engineering, Stanford University, CA, USA(电气工程系,斯坦福大学) Department of Biology, Stanford University, CA, USA(生物学系,斯坦福大学) Division of Cardiology, Department of Medicine, Stanford University, CA, USA(心脏病学部,医学系,斯坦福大学) Department of Biomedical Data Science, Stanford University, CA, USA(生物医学数据科学系,斯坦福大学) Department of Computer Science, Stanford University, CA, USA(计算机科学系,斯坦福大学) Department of Psychiatry and Behavioral Sciences, Stanford University, CA, USA(精神病学与行为科学系,斯坦福大学)

AI总结 本文提出CEBaG方法,利用模型自身log概率中的不一致置信度和弱视觉证据敏感性,实现无需随机采样和外部模型的确定性幻觉检测,在医疗MLLM和VQA基准测试中取得最佳AUC表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16842 2026-07-21 cs.LG cond-mat.dis-nn cond-mat.stat-mech cs.SY eess.SY physics.bio-ph 版本更新

Stochastic Resetting Accelerates Reinforcement Learning Beyond Random Search

随机重置加速强化学习中的策略收敛

Jello Zhou, David J. Schwab, Vudtiwat Ngampruetikorn

机构 * Biophysics Program, Stanford University(斯坦福大学生物物理项目) School of Physics, University of Sydney(悉尼大学物理学院) National Institute for Theory and Mathematics in Biology, Northwestern University(生物理论与数学国家研究所,西北大学) The University of Chicago(芝加哥大学) Princeton-CUNY Center for the Physics of Biological Function, The Graduate Center, CUNY(普林斯顿-纽约大学生物物理功能中心,纽约大学研究生中心)

AI总结 研究探讨随机重置与强化学习的交互,发现其能加速策略收敛,通过截断长轨迹提升价值传播,为强化学习提供新的优化机制。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06570 2026-07-21 cs.RO 版本更新

Unsupervised Discovery of Failure Taxonomies from Deployment Logs

无监督发现部署日志中的故障分类

Aryaman Gupta, Yusuf Umut Ciftci, Somil Bansal

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

AI总结 本文提出无监督发现部署日志中的故障分类方法,通过视觉-语言推理和语义聚类,提升机器人系统鲁棒性和故障监控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18436 2026-07-21 cs.CV 版本更新

When Generative Replay Meets Evolving Deepfakes: Dual Confusion-Aware Regularization for Incremental Face Forgery Detection

当生成式重放遇上不断演变的深度伪造:用于增量式人脸伪造检测的双混淆感知正则化

Hao Shen, Jikang Cheng, Renye Yan, Zhongyuan Wang, Wei Peng, Baojin Huang

机构 * Huazhong Agricultural University(华中农业大学) Peking University(北京大学) Wuhan University(武汉大学) Stanford University(斯坦福大学)

AI总结 研究人脸生成技术发展下的增量式深度伪造检测问题,提出双混淆感知正则化策略双CARE,通过引入域感知混淆分数量化域混淆,对重放生成器和检测器进行双调制,有效利用生成式重放改进检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11459 2026-07-21 cs.CL cs.CV 版本更新

Octopus v3: Technical Report for On-device Sub-billion Multimodal AI Agent

章鱼v3:用于设备端低于十亿参数的多模态人工智能代理的技术报告

Wei Chen, Zhiyuan Li

机构 * Stanford University(斯坦福大学)

AI总结 研究针对多模态人工智能代理将图像数据转化为可行动结果的挑战,引入含功能令牌概念的多模态模型,优化至小于10亿参数,能处理中英文,可在多种边缘设备高效运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01549 2026-07-21 cs.CL cs.SE 版本更新

Octopus: On-device language model for function calling of software APIs

章鱼:用于软件API函数调用的设备端语言模型

Wei Chen, Zhiyuan Li, Mingyuan Ma

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

AI总结 研究利用设备端大语言模型调用软件API,通过编译数据集微调不同参数模型,提升其API交互能力,提出条件掩码技术和新基准,经微调的Octopus模型在API调用上性能超GPT-4,推动自动化软件开发和API集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06025 2026-07-21 cs.CV cs.AI 版本更新

CarbonNet: How Computer Vision Plays a Role in Climate Change? Application: Learning Geomechanics from Subsurface Geometry of CCS to Mitigate Global Warming

CarbonNet:计算机视觉如何在气候变化中发挥作用?应用:从碳捕获与封存的地下几何结构学习地质力学以缓解全球变暖

Wei Chen, Yunan Li, Yuan Tian

机构 * Stanford University(斯坦福大学)

AI总结 研究利用计算机视觉从碳捕获与封存的地下几何图像预测地表位移,以应对相关挑战。实现多种模型用于静态和瞬态力学问题,实验表明ResNetUNet在静态问题中表现出色,LSTM在瞬态问题中与Transformer性能相当,为CCS项目决策提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏