arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 2246
2605.06619 2026-05-08 cs.CL cs.CY

Algospeak, Hiding in the Open: The Trade-off Between Legible Meaning and Detection Avoidance

算法语言:隐藏在开放中的平衡:可理解性与检测规避之间的权衡

Jan Fillies, Ronald E. Robertson, Jeffrey Hancock

机构 * Stanford University(斯坦福大学) Freie Universität Berlin(柏林自由大学)

AI总结 本文研究了算法语言在内容生成和审核中的平衡问题,提出了多数可理解调制概念,并通过实验验证了可理解性与检测规避之间的关系。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06206 2026-05-08 cs.LG

Federation of Experts: Communication Efficient Distributed Inference for Large Language Models

专家联邦:用于大型语言模型的通信高效的分布式推理

Muhammad Shahir Abdurrahman, Chun Deng, Azalia Mirhoseini, Philip Levis

机构 * Stanford University(斯坦福大学)

AI总结 本文提出FedEx架构,通过将MoE块分为多个集群,减少专家间通信开销,提升单节点和多节点下的推理吞吐量和延迟,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12805 2026-05-08 physics.med-ph cs.SD eess.IV

A Wavefield Correlation Approach to Improve Sound Speed Estimation in Ultrasound Autofocusing

一种基于波场相关的方法用于改进超声自聚焦中的声速估计

Louise Zhuang, Samuel Beuret, Ben Frey, Saachi Munot, Walter Simson, Dongwoon Hyun, Jeremy J. Dahl

机构 * Department of Electrical Engineering, Stanford University(电气工程系,斯坦福大学) Department of Radiology, School of Medicine, Stanford University(放射学系,医学院,斯坦福大学) Department of Applied Physics, Stanford University(应用物理学系,斯坦福大学) Department of Biomedical Engineering, Columbia University(生物医学工程系,哥伦比亚大学)

AI总结 本文提出利用波场相关技术优化声速估计,以提高超声自聚焦中图像质量,通过改进的波场相关成像方法减少杂波干扰,提升成像分辨率和对比度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05707 2026-05-08 cs.RO

On the Emergence of Pendular Structure in Multi-Contact Locomotion

多接触运动中摆动结构的出现

Lingxue Lyu, Zihui Liu

机构 * School of Engineering and Applied Science, University of Pennsylvania(宾夕法尼亚大学工程与应用科学学院) Department of Aeronautics & Astronautics, Stanford University(斯坦福大学航空航天系)

AI总结 本文探讨了多接触运动中摆动结构的形成机制,通过分析角动量变化率的优化问题,揭示了足部几何和摩擦锥对运动模式的影响,并验证了在点质量四足机器人和Unitree Go1上实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05386 2026-05-08 cs.AI cs.CL cs.LG

BALAR : A Bayesian Agentic Loop for Active Reasoning

BALAR:主动推理的贝叶斯代理循环

Aymen Echarghaoui, Dongxia Wu, Emily B. Fox

机构 * Department of Statistics, Stanford University(统计学系,斯坦福大学) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

AI总结 BALAR是一种无需微调的任务无关外环算法,通过维护潜在状态的结构信念,选择澄清问题以最大化预期互信息,并动态扩展状态表示,从而在三个基准测试中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05331 2026-05-08 cs.CV cs.AI cs.LG

ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters

ViTok-v2:将原生分辨率自编码器扩展到50亿参数

Philippe Hansen-Estruch, Jiahui Chen, Vivek Ramanujan, Orr Zohar, Yan Ping, Animesh Sinha, Markos Georgopoulos, Edgar Schoenfeld, Ji Hou, Felix Juefei-Xu, Sriram Vishwanath, Ali Thabet

机构 * University of Texas, Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Spellbrush Meta Superintelligence Labs(Meta超智能实验室) Georgia Institute of Technology(佐治亚理工学院)

AI总结 ViTok-v2通过NaFlex实现跨分辨率和宽高比泛化,引入新的DINOv3感知损失,提升重建性能并稳定训练,达到当前最佳水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05242 2026-05-08 cs.IR cs.AI

Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

超越语义相似性:通过直接语料交互重新思考代理搜索的检索

Zhuofeng Li, Haoxiang Zhang, Cong Wei, Pan Lu, Ping Nie, Yi Lu, Yuyang Bai, Shangbin Feng, Hangxiao Zhu, Ming Zhong, Yuyu Zhang, Jianwen Xie, Yejin Choi, James Zou, Jiawei Han, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(圣地亚哥大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Verdent AI Lambda

AI总结 本文提出直接语料交互(DCI)方法,通过通用终端工具直接搜索原始语料,无需嵌入模型或检索接口,有效提升代理搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03061 2026-05-08 stat.ML cs.LG q-bio.QM stat.ME

Dynamic Vine Copulas: Detecting and Quantifying Time-Varying Higher-Order Interactions

动态藤Copula:检测和量化时间变化的高阶相互作用

Houman Safaai, Alessandro Marin Vargas

机构 * Kempner Institute at Harvard University(哈佛大学凯普勒研究所) Stanford University(斯坦福大学)

AI总结 本文提出动态藤Copula模型,用于估计和诊断序列中非高斯依赖关系,通过比较完整藤与1截断版本区分灵活的首树成对依赖与更高树条件项的证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01120 2026-05-08 cs.AI math.CO

New Bounds for Zarankiewicz Numbers via Reinforced LLM Evolutionary Search

通过强化LLM进化搜索获得Zarankiewicz数的新界

Jay Bhan, Nicole Nobili, Patrick Langer

机构 * Massachusetts Institute of Technology(麻省理工学院) ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

AI总结 本文首次确定三个Zarankiewicz数的精确值,并通过强化LLM进化搜索方法为41个数建立下界,展示了LLM引导的进化搜索在数学研究中的潜力。

Comments *Jay Bhan and Nicole Nobili contributed equally to this work as first authors, and their order was determined via coin flip

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29552 2026-05-08 cs.CL cs.AI cs.LG

Bringing Up a Bilingual BabyLM: Investigating Multilingual Language Acquisition Using Small-Scale Models

双语婴儿语言模型的培养:利用小型模型研究多语言语言习得

Linda Zeng, Steven Y. Feng, Michael C. Frank

机构 * Stanford University(斯坦福大学)

AI总结 本文通过训练小型语言模型,研究多语言习得机制,发现双语模型在两种语言上均表现良好,表明多语言输入对统计学习者无实质挑战。

Comments Code and data at https://github.com/lindazeng979/bilingual-babyLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15827 2026-05-08 cs.RO cs.AI cs.LG cs.SY eess.SY

Perceptive Humanoid Parkour: Chaining Dynamic Human Skills via Motion Matching

感知型人形扑动:通过动作匹配链式动态人类技能

Zhen Wu, Xiaoyu Huang, Lujie Yang, Yuanhang Zhang, Xi Chen, Pieter Abbeel, Rocky Duan, Angjoo Kanazawa, Carmelo Sferrazza, Guanya Shi, C. Karen Liu

机构 * Amazon FAR(亚马逊FAR) UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学) Stanford University(斯坦福大学)

AI总结 本文提出感知型人形扑动框架,通过动作匹配和强化学习实现人形机器人在复杂环境中自主执行长时程视觉扑动任务,展示高动态扑动技能和多障碍物穿越能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18875 2026-05-08 cs.CV

Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation

稀疏视频生成2:通过语义感知排列加速视频生成

Shuo Yang, Haocheng Xi, Yilong Zhao, Muyang Li, Jintao Zhang, Han Cai, Yujun Lin, Xiuyu Li, Chenfeng Xu, Jianfei Chen, Song Han, Kurt Keutzer, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) MIT(麻省理工学院) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 本文提出SVG2框架,通过语义感知排列提升视频生成的准确性和效率,实现生成质量与效率的帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01172 2026-05-05 cs.LG stat.ML

A Theory of Generalization in Deep Learning

深度学习中泛化的理论

Elon Litman, Gabe Guo

机构 * Stanford University(斯坦福大学)

AI总结 本文提出深度学习中泛化的非渐近理论,通过经验神经切线核划分输出空间,在信号方向快速消散误差,而在噪声方向通过近零特征值捕获残余误差。该理论解释了良性过拟合、双下降等现象,并推导出一个精确的群体风险目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01148 2026-05-05 cs.AI cs.CL

Arithmetic in the Wild: Llama uses Base-10 Addition to Reason About Cyclic Concepts

野性算术:Llama使用十进制加法来推理循环概念

Sheridan Feucht, Tal Haklay, Usha Bhalla, Daniel Wurgaft, Can Rager, Raphaël Sarfati, Jack Merullo, Thomas McGrath, Owen Lewis, Ekdeep Singh Lubana, Thomas Fel, Atticus Geiger

机构 * Northeastern University(东北大学) Technion IIT(技术ion理工学院) Harvard University(哈佛大学) Stanford University(斯坦福大学)

AI总结 研究Llama-3.1-8B如何用十进制加法处理循环概念,发现其通过通用加法机制而非模运算实现,利用傅里叶特征进行计算,揭示了因果抽象与特征几何的交互对语言模型的理解作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06838 2026-05-05 cs.AR cs.LG

P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats

P3-LLM:一种用于边缘LLM推理的NPU-PIM集成加速器,采用混合数值格式

Yuzong Chen, Chao Fang, Xilai Dai, Yuheng Wu, Thierry Tambe, Marian Verhelst, Mohamed S. Abdelfattah

机构 * Department of Electrical and Computer Engineering, Cornell University(康奈尔大学电气与计算机工程系) EAST-MICAS, KU Leuven(KU莱顿大学EAST-MICAS) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

AI总结 本文提出P3-LLM,通过混合精度量化和PIM架构设计,提升边缘LLM推理效率,实现4.9倍以上的加速效果。

Comments Accepted to the 53rd IEEE/ACM International Symposium on Computer Architecture (ISCA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19227 2026-05-05 cs.CL cs.AI cs.HC

Generative Interfaces for Language Models

生成式接口用于语言模型

Jiaqi Chen, Yanzhe Zhang, Yutong Zhang, Yijia Shao, Diyi Yang

机构 * Stanford University(斯坦福大学) Georgia Tech(佐治亚理工学院)

AI总结 本文提出生成式接口,通过主动生成用户界面提升多轮交互效率,实验表明其在人类偏好上提升达72%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00658 2026-05-04 cs.CV

UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成

Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing Xiao, Yuwei Guo, Chongjie Ye, Lvmin Zhang, Hao Zhao, Anyi Rao

机构 * Beihang University(北京航空航天大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。

Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)

Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00634 2026-05-04 cs.RO cs.CV

Paired-CSLiDAR: Height-Stratified Registration for Cross-Source Aerial-Ground LiDAR Pose Refinement

Paired-CSLiDAR:基于高度分层的跨源空地LiDAR姿态精修

Montana Hoover, Jing Liang, Tianrui Guan, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Stanford University(斯坦福大学)

AI总结 本文提出Paired-CSLiDAR基准,通过高度分层ICP、反向注册方向和置信度门控选择,实现空地LiDAR姿态精修,优于现有方法,验证了RMSE基于姿态选择的有效性。

Comments 8 pages, 4 figures. Dataset and code are being prepared for public release

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00503 2026-05-04 cs.CV cs.LG

End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

端到端自回归图像生成与1D语义分词器

Wenda Chu, Bingliang Zhang, Jiaqi Han, Yizhuo Li, Linjie Yang, Yisong Yue, Qiushan Guo

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学)

AI总结 本文提出端到端训练 pipeline,结合重建与生成优化,改进1D分词器,实现自回归图像生成的高FID分数结果。

Comments In ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00497 2026-05-04 cs.HC cs.AI cs.CL

"What Are You Really Trying to Do?": Co-Creating Life Goals from Everyday Computer Use

你真正想做什么?

Shardul Sapkota, Matthew Jörke, Zane Sabbagh, Omar Shaikh, Grace Wang, James A. Landay

机构 * Stanford University(斯坦福大学)

AI总结 本文提出一种从日常计算机使用中推断更广泛生活目标的共创建过程,通过活动理论和Emmons的个人追求框架,构建分层表示,并支持编辑界面以增强用户对自身理解的控制。

Comments 20 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00080 2026-05-04 cs.RO cs.CV

World Model for Robot Learning: A Comprehensive Survey

机器人学习的世界模型:全面综述

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr, Oier Mees, Marc Pollefeys, Zhuang Liu, Jiajun Wu, Pieter Abbeel, Jitendra Malik, Yilun Du, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) The University of Tokyo(东京大学) University of Oxford(牛津大学) Microsoft(微软公司) ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

AI总结 综述从机器人学习角度系统回顾世界模型的快速发展,探讨其与机器人策略的耦合、作为强化学习模拟器的作用以及机器人视频世界模型的发展,总结关键范式与挑战。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00022 2026-05-04 cs.CL cs.AI cs.SD

Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment

让人类优先:高效LAM评估的人类偏好对齐

Woody Haosheng Gan, William Held, Diyi Yang

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学) OpenAthena

AI总结 本文研究了如何通过最小子集高效评估LAM,发现50个样本即可达到高相关性,并通过回归模型提升预测效果,提出HUMANS基准作为高效评估代理。

Comments Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07475 2026-05-04 cs.CL cs.AI cs.CY cs.LG

Laissez-Faire Harms: Algorithmic Biases in Generative Language Models

放任的伤害:生成语言模型中的算法偏见

Evan Shieh, Faye-Marie Vassel, Cassidy Sugimoto, Thema Monroe-White

机构 * Young Data Scientists League(年轻数据科学家联盟) Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) Schar School of Policy and Government & Department of Computer Science(政策与政府学院及计算机科学系) George Mason University(乔治·马歇尔大学)

AI总结 研究通过开放性提示分析生成语言模型的偏见,发现五种主流模型对少数族裔、性别和性取向群体存在排除、从属和刻板印象的伤害,强调需保护消费者免受语言模型歧视性影响。

Comments 16 pages (43 if including supplementals), 8 figures (23 if including supplementals)

Journal ref Nat Commun 17, 1243 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28119 2026-05-01 cs.LG cs.AI

Do Sparse Autoencoders Capture Concept Manifolds?

稀疏自编码器能否捕捉概念流形?

Usha Bhalla, Thomas Fel, Can Rager, Sheridan Feucht, Tal Haklay, Daniel Wurgaft, Siddharth Boppana, Matthew Kowal, Vasudev Shyam, Jack Merullo, Atticus Geiger, Ekdeep Singh Lubana

机构 * Harvard University(哈佛大学) Northeastern University(东北大学) Technion IIT(技术学院) Stanford University(斯坦福大学)

AI总结 本文探讨了稀疏自编码器捕捉流形的能力,指出现有方法在连续结构恢复上存在不足,并提出应以几何对象而非单个方向作为可解释性基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10702 2026-05-01 cs.CL cs.AI cs.IR

Grounding Agent Memory in Contextual Intent

在上下文意图中 grounding 代理记忆

Ruozhen Yang, Yucheng Jiang, Yueqi Jiang, Priyanka Kargupta, Yunyi Zhang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

AI总结 STITCH通过上下文意图索引提升长周期交互的记忆检索能力,有效减少歧义和干扰,实现在动态目标轨迹中的高效检索。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21804 2026-05-01 cs.CV cs.AI cs.CE

S&P 500 Stock's Movement Prediction using CNN

利用CNN预测S&P 500股票走势

Rahul Gupta

机构 * Stanford University(斯坦福大学)

AI总结 本文提出利用CNN处理多维股票数据预测S&P 500指数走势,采用真实市场数据而非工程化数据,通过将历史数据矩阵模拟为图像进行分类,实现股票、行业或投资组合的预测。

Comments 9 pages, 19 diagrams. Originally submitted as a part of my Stanford University program taught by Dr. Fei Fei Lee and Andrej Karpathy CS231N 2018

Journal ref ADaSci Lattice Journal, (October-December 2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10941 2026-05-01 cs.CV cs.AI

Mull-Tokens: Modality-Agnostic Latent Thinking

Mull-Tokens: 通用模态的潜在思考

Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu

机构 * Google(谷歌) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Boston University(波士顿大学)

AI总结 本文提出Mull-Tokens,一种无需模态切换的潜在令牌,用于空间、时间等多模态推理,通过预训练和微调在四个挑战性基准上实现3%-16%的提升。

Comments Project webpage: https://arijitray.com/multimodal_thinking/, Accepted to CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27637 2026-05-01 cs.AI

Optimization before Evaluation: Evaluation with Unoptimised Prompts Can be Misleading

优化优先于评估:未经优化的提示进行评估可能是误导的

Nicholas Sadjoli, Tim Siefken, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

机构 * SAP(SAP公司) Stanford University(斯坦福大学)

AI总结 本文研究了提示优化对大语言模型评估的影响,发现优化显著影响模型排名,强调在评估中应针对每个模型进行优化以选择最佳模型。

Comments Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27443 2026-05-01 cs.LG cs.AI

ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space

ABC:通过非马尔可夫扩散桥实现连续时间和空间中的任意子集自回归

Gabe Guo, Thanawat Sornwanee, Lutong Hao, Elon Litman, Stefano Ermon, Jose Blanchet

机构 * Stanford University(斯坦福大学)

AI总结 本文提出ABC模型,通过非马尔可夫扩散桥在连续时间和空间中实现任意子集的自回归,解决了传统方法在结构相似性捕捉、噪声注入和条件化任意子集方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27367 2026-05-01 cs.RO cs.CV cs.GR

DOT-Sim: Differentiable Optical Tactile Simulation with Precise Real-to-Sim Physical Calibration

DOT-Sim: 基于精确实-仿真物理校准的可微光学触觉仿真

Yang You, Won Kyung Do, Aiden Swann, Rika Antonova, Monroe Kennedy, Leonidas Guibas

机构 * Stanford University(斯坦福大学) University of Cambridge(剑桥大学) Toyota Research Institute University 2.0 Program(丰田研究院大学2.0计划) ARL grant W911NF-21-2-0104(ARL授予的W911NF-21-2-0104项目) Vannevar Bush Faculty Fellowship(范内var布什教职 fellowship) Flexiv corporation(Flexiv公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出DOT-Sim,通过材料点法建模软传感器为弹性材料,实现高精度光学触觉仿真,支持大变形和非线性模拟,并在实-仿真任务中验证了物理和视觉真实性。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏