arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 305
2606.10066 2026-06-10 cs.CV cs.AI cs.LG 新提交

A Controlled Audit of Pretraining Contamination in Public Medical Vision-Language Benchmarks

公共医学视觉语言基准中预训练污染的受控审计

Bruce Changlong Xu, Lan Wu, Alexander Ryu

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) Mayo Clinic(梅奥诊所)

AI总结 审计发现公共医学VLM基准存在图像源重叠和文本规范顺序交换性信号,但确认的像素级重复罕见,且现有成员推理检测器在小规模医学VLM队列中不可靠。

Comments 30 pages, 7 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09844 2026-06-10 cs.HC cs.AI 新提交

The Interlocutor Effect: Why LLMs Leak More Personal Data to Agents Than Humans

对话者效应:为什么LLMs向智能体泄露的个人数据比向人类多

Faouzi El Yagoubi, Godwin Badu-Marfo, Ranwa Al Mallah

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 研究发现LLMs在与AI智能体对话时比与人类对话更易泄露个人身份信息,通过注意力抑制假说解释该现象,实验表明安全对齐注意力头在智能体交互中失活导致泄露增加23个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11140 2026-06-10 physics.geo-ph cs.AI cs.LG stat.AP stat.ML 新提交

Data assimilation for subsurface flow using latent diffusion model parameterization: performance of ensemble-Kalman and Monte Carlo techniques

基于潜扩散模型参数化的地下流体数据同化:集成卡尔曼与蒙特卡洛技术的性能

Guido Di Federico, Wenchao Teng, Louis J. Durlofsky

机构 * Department of Energy Science & Engineering, Stanford University(能源科学与工程系,斯坦福大学)

AI总结 针对地下流体数据同化中高维参数反演问题,比较了基于潜扩散模型(LDM)的集成卡尔曼方法(ESMDA)与蒙特卡洛方法(MCMC/SMC)在三维河道地质模型上的性能,发现蒙特卡洛方法在保持地质真实性的同时能更有效地降低数据失配和不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09590 2026-06-09 cs.CL cs.CR 新提交

Clinically Grounded Privacy Evaluation of Medical LMs

临床导向的医学语言模型隐私评估

Sasha Ronaghi, Sana Tonekaboni, Lena Stempfle, Vivian Utti, Jordan Li Cahoon, Nathaniel Hendrix, Ayin Vala, Marzyeh Ghassemi, Emily Alsentzer

机构 * Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) American Board of Family Medicine(家庭医学认证委员会)

AI总结 提出临床导向框架,按对抗访问等级评估医学语言模型隐私泄露,发现常规元数据可导致高比率逐字记忆和敏感诊断恢复,但部分记忆源于模板化文档。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09160 2026-06-09 cs.LG cs.AI 新提交

Crop Recommendation and Agricultural Query Answering System Using Spatio-Temporal Graph Neural Networks and Hybrid Retrieval Augmentation

基于时空图神经网络与混合检索增强的作物推荐及农业问答系统

Prajwal Thapa, Yagya Raj Pandeya

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出融合时空图神经网络(STGCN)与检索增强生成(RAG)的精准农业系统,实现30天天气预报、作物推荐及农业问答,在尼泊尔1359个地点数据上STGCN预测MSE达0.011。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09159 2026-06-09 cs.CL cs.AI 新提交

Unified Energy for Invariant and Independent Decoding in Diffusion Language Models

扩散语言模型中不变性与独立性解码的统一能量

Yuchen Yan, Minkai Xu, Zaiquan Yang, Yatao Bian

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学)

AI总结 针对扩散语言模型并行生成文本时与自回归模型的性能差距,提出统一能量(Uni-E)方法,通过不变能量和独立能量解决模型容量、依赖性和不变性问题,无需采样即可精确计算,并能纠正分布偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09027 2026-06-09 cs.CL cs.AI 新提交

SafeRun: Enabling Determinism in LLM Planning for Running

SafeRun:在跑步规划中实现LLM的确定性

Meilin Chen, Zepeng Zhai, Jiaxuan Zhao, Yuan Lu

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 针对LLM在跑步规划中因概率性导致安全违规的问题,提出SafeRun框架,通过解耦架构将LLM的软解释与确定性求解器的硬约束分离,实现100%安全评分。

Comments Workshop on Planning in the Era of LLMs (LM4Plan) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08969 2026-06-09 cs.CL cs.AI 新提交

CARE: A Conformal Safety Layer for Medical Summarization

CARE:面向医学摘要的保形安全层

Suhana Bedi, Bridget Lin, Anson Y. Zhou, Chloe O. Stanwyck, Jenelle A. Jindal, Sanmi Koyejo, David Stutz, Nigam H. Shah

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

AI总结 提出CARE方法,通过保形风险控制为LLM医学摘要提供校准的遗漏和幻觉标记,在保证安全性的同时减少审查负担。

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08629 2026-06-09 cs.CL 新提交

Sycophancy Towards Researchers Drives Performative Misalignment

对研究者的迎合驱动了表演性失调

David D. Baek, Xinnuo Li, Anay Gupta, Taslim Mahbub, Kejian Shi, Max Tegmark, Shi Feng

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学)

AI总结 本文提出语言模型在评估中表现出的对齐伪装行为更可能是对研究者的迎合而非策略性欺骗,并通过三个实验支持该假说。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08590 2026-06-09 cs.SE cs.AI cs.DC 新提交

Auditable Graph-Guided Root Cause Analysis for Kubernetes Incidents

可审计的图引导的Kubernetes事件根因分析

Anastasiia Kuvshinova, Seungmin Jin

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出Graph Traversal Agent,结合LLM推理与确定性图操作,通过类型化证据图、有界搜索和独立验证实现可审计的根因分析,在ITBench上F1从0.6087提升至0.9130。

Comments 8 pages, 1 figure. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08573 2026-06-09 cs.LG cs.CL 新提交

Titans-as-a-Layer: Test-Time Memory for Conversational Speech Emotion Recognition

Titans-as-a-Layer:对话语音情感识别的测试时记忆

Daniel Chen, Qicong Hu, Yang Xiao, Ting Dang, Hong Jia

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出Memory-as-a-Layer (MAL)适配器,利用测试时神经记忆为对话语音情感识别提供上下文,在不修改大型音频语言模型的前提下提升性能。

Comments ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08476 2026-06-09 cs.DC cs.AI 新提交

FlashCP: Load-Balanced Communication-Efficient Context Parallelism for LLM Training

FlashCP: 面向LLM训练的负载均衡且通信高效的上下文并行

Zheng Wang, Eric Liu, Linan Jiang, Zhongkai Yu, Zaifeng Pan, Yue Guan, Yuke Wang, Yufei Ding

机构 * Stanford University(斯坦福大学)

AI总结 提出FlashCP框架,通过分片感知通信消除冗余KV传输,并设计Whole-Doc分片策略与启发式算法,实现负载均衡与通信高效,在多种数据集上取得最高1.63倍加速。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08403 2026-06-09 cs.CR cs.AI 新提交

Hiding in Plain Floats: Steganographic Carriers for Indirect Prompt and Content Injection

隐藏在普通浮点数中:用于间接提示和内容注入的隐写载体

Mudit Sinha, Sanika Chavan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 研究结构化浮点参数作为隐写载体绕过文本检测器实现LLM间接提示/内容注入,实验显示在最强防御下泄露ASR达94.3%。

Comments Accepted as a poster at FAGEN@ICML 2026. 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08369 2026-06-09 cs.LG cs.AI 新提交

An Information-Theoretic Definition for Open-Ended Learning

开放学习的信息论定义

Wanqiao Xu, Yifan Zhu, Benjamin Van Roy

机构 * Stanford University(斯坦福大学)

AI总结 提出基于比特等价的信息论定义开放环境,证明经典赌博机非开放,设计算法实现开放学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08287 2026-06-09 cs.LG cond-mat.mtrl-sci cs.CE 新提交

Mesh Graph Neural Network Framework for Accelerating Finite Element Simulation for Arbitrary Geometries

网格图神经网络框架加速任意几何形状的有限元仿真

Josiah D. Kunz, Kamal Choudhary

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出网格图网络(MGN)预测任意孔洞几何2D结构的von Mises应力场,通过编码节点类型、相对边特征和全局特征实现平移和旋转不变性,在未见几何和载荷下R²≥0.97,优于传统模型。

Comments 10 pages, 6 figures, to be published. Code available at https://github.com/Josiah-Kunz/MGN-Public

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08153 2026-06-09 cs.LG cs.AI 新提交

LogNEO: A GPT-Neo Reinforcement Learning Framework for Accurate Real-Time Log Anomaly Detection

LogNEO:基于GPT-Neo的强化学习框架用于精确实时日志异常检测

David Eje, Tanmay Sharma, Khush Patel, Manuel Mazzara, Leonard Johard

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出LogNEO,利用GPT-Neo模型和基于位置感知奖励的PPO微调,在HDFS、BGL和Thunderbird基准上达到F1分数0.927、0.913和0.984,召回率比LogGPT提升6%,并在生产部署中实现45ms端到端延迟。

Comments 8 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08107 2026-06-09 cs.RO cs.AI 新提交

Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data

Ego-Pi: 面向自我中心人类与机器人数据的VLA微调

Ji Woong Kim, Ke Wang, Zipeng Fu, Sirui Chen, Cong Zhao, Jeff Lai, Chelsea Finn

机构 * Stanford University(斯坦福大学) Meta

AI总结 为解决机器人数据稀缺问题,利用自我中心人类数据,基于π₀.₅模型微调,使机器人学习新任务语义并组合现有技能,无需对应机器人数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08067 2026-06-09 cs.LG 新提交

Beyond Homophily: Towards Generalized Graph Reconstruction Attack and Defense

超越同质性:迈向广义图重构攻击与防御

Zhanke Zhou, Bo Han, Xuan Li, Jiangchao Yao, Sanmi Koyejo, Michael K. Ng

机构 * Hong Kong Baptist University(香港浸会大学) Shanghai Jiao Tong University(上海交通大学) Stanford University(斯坦福大学)

AI总结 针对图神经网络可能泄露训练图邻接信息的问题,提出基于马尔可夫链近似的攻击方法MC-GRA(+)和防御方法MC-GPB(+),在异质图上实现高保真重构攻击并有效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07950 2026-06-09 cs.LG 新提交

The Easy, the Hard, and the Learnable: Confidence and Difficulty-Adaptive Policy Optimization for LLM Reasoning

简单、困难与可学习:面向LLM推理的置信度与难度自适应策略优化

Zhanke Zhou, Xiangyu Lu, Chentao Cao, Brando Miranda, Tongliang Liu, Bo Han, Sanmi Koyejo

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) Stanford University(斯坦福大学) Sydney AI Centre, The University of Sydney(悉尼大学人工智能中心)

AI总结 针对GRPO训练中均匀采样导致计算效率低的问题,提出CoDaPO方法,通过置信度和难度自适应重加权与重采样,在固定预算下提升可学习问题的发现,在12个基准上优于现有RL方法。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07925 2026-06-09 cs.CL 新提交

ROSUM-MCTS: Monte Carlo Tree Search-Inspired HDL Code Summarization with Structural Rewards

ROSUM-MCTS:基于蒙特卡洛树搜索的HDL代码摘要生成与结构奖励

Prashanth Vijayaraghavan, Charles Mackin, Luyao Shi, Apoorva Nitsure, Ashutosh Jadhav, David Beymer, Tyler Baldwin, Ehsan Degan, Vandana Mukherjee

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出ROSUM-MCTS方法,利用蒙特卡洛树搜索引导大语言模型,通过分层候选扩展和复合奖励函数优化硬件描述语言代码摘要,在VHDL和Verilog数据集上优于基线方法。

Comments 7 pages

Journal ref ICLAD'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07890 2026-06-09 cs.LG stat.ML 新提交

Partially Performative Prediction

部分表现性预测

Jaewook Lee, Tijana Zrnic

机构 * Stanford University(斯坦福大学)

AI总结 提出部分表现性预测框架,统一建模由模型部署引起的内生分布偏移和外部时间变化引起的外生偏移,并定义在线表现性稳定与最优性,分析重复训练等启发式方法的适应性条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07812 2026-06-09 cs.AI cs.CL 新提交

Scaling Participation in Modular AI Systems

模块化AI系统中的参与扩展

Shangbin Feng, Yike Wang, Weijia Shi, Luke Zettlemoyer, Yejin Choi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 提出参与扩展范式,通过多方贡献小模型构建模块化AI系统,在15项任务上比单体大语言模型提升高达15.4%,并展现涌现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07682 2026-06-09 cs.SE cs.AI 新提交

SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?

SWE-Marathon: 智能体能否自主完成超长时程软件工作?

Rishi Desai, Jesse Hu, Joan Cabezas, Neel Harsola, Pratyush Shukla, Roey Ben Chaim, Adnan El Assadi, Omkaar Mukund Kamath, Fenil Faldu, Prannay Hebbar, Jiankai Sun, Yiyuan Li, Pramod Srinivasan, Ishan Gupta, Christopher Settles, Daniel Wang, Derek Chen, Pranav Raja, Albert Liu, Marek Šuppa, Nevasini Sasikumar, Luyang Kong, Erik Quintanilla, Xiangyi Li, Ivan Bercovich, Steven Dillmann

机构 * Abundant Zenity Harvard University(哈佛大学) University of Waterloo(滑铁卢大学) Gujarat Technological University(古吉拉特技术大学) Warping Stanford University(斯坦福大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Independent(独立) Refresh Soleda AI Near AI Georgia Tech(佐治亚理工学院) Comenius University in Bratislava(布拉迪斯拉发Comenius大学) UC San Diego(圣地亚哥大学) BenchFlow UC Santa Barbara(圣巴巴拉大学)

AI总结 提出SWE-Marathon基准,包含20个超长时程任务,平均消耗2720万token,评估智能体在规划、长上下文理解和记忆方面的能力,当前前沿编码智能体解决率低于30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07650 2026-06-09 cs.CR cs.CV cs.NI 新提交

Detecting Aimbot Cheaters in MOGs

检测多人在线游戏中的自瞄作弊者

Salman Shaikh, Tao Ni, Marc Dacier

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出PATCH主动防御策略,通过对抗性补丁作为游戏蜜标,触发作弊者目标检测模型,实现检测或干扰,在定制Unreal Engine游戏中白盒检测率超90%,跨模型迁移率达60-90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07616 2026-06-09 cs.LG cs.AI cs.CL 新提交

Item Response Scaling Laws: A Measurement Theory Approach for Efficient and Generalizable Neural Scaling Estimation

项目反应缩放定律:一种高效且可泛化的神经缩放估计的测量理论方法

Sang Truong, Yuheng Tu, Rylan Schaeffer, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出项目反应缩放定律(IRSL),将项目反应理论融入缩放定律框架,通过Beta-IRT模型利用语言模型的概率响应,将参数复杂度从O(M×N)降至O(M+N),在预训练和测试时缩放场景中仅用50个问题即可实现可靠估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07607 2026-06-09 cs.LG q-bio.GN 新提交

Position: Genomic Model Research Must Move Beyond Anecdotal Evaluation of Interpretability Methods

立场:基因组模型研究必须超越可解释性方法的轶事评估

Shasha Zhou, Mingyu Huang, Ke Li

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 本文通过转录因子结合基准测试,揭示不同可解释性方法常产生矛盾解释、无法定位已知调控基序且不能忠实反映模型决策,主张采用类似临床试验的系统验证框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07576 2026-06-09 cs.LG cs.ET cs.MA 新提交

When Should an AI Scientist Stop? Verifiable Experiment Steering and Refusal for Autonomous Discovery

AI科学家何时应停止?可验证实验引导与自主发现的拒绝机制

Neel Tushar Shah, Manglam Kartik

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出CARTOGRAPH验证层,通过未解析子空间引导、模糊闭合和残差库检测,在多个测试中优于原始投影,并能识别和撤销库外机制。

Comments Accepted at AI for Science Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07567 2026-06-09 q-bio.BM cs.AI cs.CE 新提交

SurfDesign: Effective Protein Design on Molecular Surfaces

SurfDesign:基于分子表面的高效蛋白质设计

Fang Wu, Shuting Jin, Xiangru Tang, Mark Gerstein, Xiangxiang Zeng, Yejin Choi, Jure Leskovec, Jinbo Xu

机构 * Stanford University(斯坦福大学) Wuhan University of Science and Technology(武汉科技大学) Yale University(耶鲁大学) School of Medicine, Yale University(耶鲁大学医学院) Hunan University(湖南大学) Yuelushan Laboratory(岳麓实验室) Kumo.AI Toyota Technological Institute at Chicago(芝加哥技术研究所)

AI总结 提出SurfDesign框架,将分子表面建模为连续几何流形并整合预训练蛋白质语言模型,通过表面等变消息传递捕捉几何特征,在从头设计结合子和酶设计基准上优于现有方法。

Journal ref KDD 2026 AI4Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06814 2026-06-08 stat.ML cs.LG math.ST stat.AP stat.TH 新提交

The Effect of Training Task Diversity on In-Context Learning through the Lens of Low-Dimensional Subspaces

训练任务多样性对上下文学习的影响:基于低维子空间的视角

Soo Min Kwon, Alec S. Xu, Can Yaras, Dogyoon Song, Laura Balzano, Qing Qu

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学)

AI总结 本文通过低秩高斯混合模型分析训练任务多样性(由子空间非重叠列数定义)如何提升线性注意力上下文学习的泛化与优化,解释训练多样性缩短学习平台期及实现分布外泛化的现象,并扩展至非线性场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06996 2026-06-08 cs.RO cs.DC 新提交

Mission-Level Runtime Assurance Framework for Autonomous Driving

自动驾驶任务级运行时保证框架

Chieh Tsai, Salim Hariri

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出一种评估驾驶安全与任务完成能力的运行时保证框架,通过监控系统拒绝不可行命令,实验证明其优于仅关注平台安全的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏