arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 2237
2604.26102 2026-05-27 cs.SE cs.CL

SWE-Edit: Rethinking Code Editing for Efficient SWE-Agent

SWE-Edit:重新思考高效SWE智能体的代码编辑

Yikai Zhang, Jiaxin Pei, Kenan Li, Qirui Jin, Maoquan Wang, Jin Pan, Yu Kang, Shengyu Fu, Elsie Nallipogu, Junjie Hu, Yufan Huang, Zijian Jin

机构 * Microsoft(微软) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Stanford Institute for Human-Centered Artificial Intelligence (HAI), Stanford University(斯坦福大学人机交互研究所)

AI总结 提出SWE-Edit框架,通过将代码编辑分解为查看器和编辑器两个子智能体,解决上下文耦合问题,在SWE-Bench Verified上提升解决率2.1个百分点并降低推理成本17.9%,且通过GRPO训练小模型实现高效编辑格式选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21882 2026-05-27 cs.LG cs.AI

Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards

立场:具有可验证奖励的强化学习的隐藏成本与测量缺口

Fang Wu, Aaron Tu, Weihao Xuan, Heli Qi, Xu Huang, Qingcheng Zeng, Shayan Talaei, Yijia Xiao, Peng Xia, Xiangru Tang, Yuchen Zhuang, Yinxi Li, Bing Hu, Hanqun Cao, Wenqi Shi, Rui Yang, Nan Liu, Huaxiu Yao, Ge Liu, Li Erran Li, Amin Saberi, Naoto Yokoya, Jure Leskovec, Yejin Choi

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Georgia Tech(佐治亚理工学院) Northwestern University(西北大学) UCLA(加州大学洛杉矶分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Yale University(耶鲁大学) University of Waterloo(滑铁卢大学) Independent Researcher(独立研究者) CUHK(香港中文大学) UT Southwestern Medical Center(西南医学中心) National University of Singapore(新加坡国立大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Amazon AWS AI(亚马逊AWS人工智能)

AI总结 本文指出,具有可验证奖励的强化学习(RLVR)在提升大语言模型性能时,常因预算不匹配、尝试膨胀和基准数据污染等混淆因素导致收益被高估,并提出了预算匹配饱和曲线、校准跟踪、法官鲁棒性测试和污染筛查等最低标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23994 2026-05-27 cs.LG cs.AI

Understanding the Challenges in Iterative Generative Optimization with LLMs

理解大语言模型迭代生成优化中的挑战

Allen Nie, Xavier Daull, Zhiyi Kuang, Abhinav Akkiraju, Anish Chaudhuri, Max Piasevoli, Ryan Rong, YuCheng Yuan, Prerit Choudhary, Shannon Xiao, Rasool Fakoor, Adith Swaminathan, Ching-An Cheng

机构 * Google DeepMind(谷歌DeepMind) CNRS(国家科学研究中心) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) AWS(亚马逊AWS) Netflix Research(Netflix研究) Microsoft Research(微软研究院)

AI总结 本文通过案例研究,揭示了在基于大语言模型的迭代生成优化中,起始工件、信用分配和批处理等隐藏设计选择对优化成败的决定性影响,并指出缺乏跨领域的通用学习循环设置方法是生产化和采用的主要障碍。

Comments 39 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16654 2026-05-27 cs.CL cs.AI cs.LG

Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models

Omanic:迈向大语言模型多跳推理的逐步评估

Xiaojie Gu, Sherry T. Tong, Aosong Feng, Sophia Simeng Han, Jinghui Lu, Yingjian Chen, Yusuke Iwasawa, Yutaka Matsuo, Chanjun Park, Rex Ying, Irene Li

机构 * The University of Tokyo(东京大学) Yale University(耶鲁大学) Stanford University(斯坦福大学) Xiaomi EV(小米EV) Soongsil University(顺天大学)

AI总结 针对大语言模型在多跳问答中中间步骤推理失败难以诊断的问题,提出Omanic基准,通过分解为单跳子问题并分析步骤级错误,揭示后期跳数瓶颈、事实知识下限和错误传播,微调后提升多个推理基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25477 2026-05-26 cs.RO cs.AI

EXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action Models

EXPO-FT:面向视觉-语言-动作模型的样本高效强化学习微调

Perry Dong, Kuo-Han Hung, Tian Gao, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

AI总结 提出EXPO-FT系统,通过样本高效的强化学习微调预训练的VLA策略,在多种高精度操作任务中实现完美性能(30/30成功率),平均仅需19.1分钟在线机器人数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22894 2026-05-26 cs.GR cs.LG cs.RO

SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control

SCRIPT: 面向语言驱动的物理仿真人体控制的可扩展扩散策略与多阶段训练

Jingyan Zhang, Han Liang, Ruichi Zhang, Bin Li, Juze Zhang, Xin Chen, Jingya Wang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学)

AI总结 提出SCRIPT框架,通过联合动作-状态-文本扩散Transformer和多阶段训练(监督模仿预训练+混合奖励强化学习后训练),实现语言指令驱动的物理仿真人体控制,在文本对齐、运动质量和物理真实性上超越现有方法。

Comments Project page: https://zhanglele12138.github.io/SCRIPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18746 2026-05-26 cs.CV cs.AI cs.CL cs.LG cs.RO

ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop

ESI-Bench: 迈向闭环感知-动作的具身空间智能

Yining Hong, Jiageng Liu, Han Yin, Manling Li, Leonidas Guibas, Li Fei-Fei, Jiajun Wu, Yejin Choi

机构 * Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校) Northwestern University(西北大学)

AI总结 提出ESI-BENCH基准,通过主动探索(感知、移动、操作)在OmniGibson环境中评估具身空间智能,发现主动探索显著优于被动方法,失败主因是动作盲视而非感知弱,且模型存在元认知差距。

Comments https://esi-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18745 2026-05-26 stat.ML cs.LG cs.NA math.NA math.PR q-fin.MF stat.CO

SURGE: Approximation and Training Free Particle Filter for Diffusion Surrogate

SURGE: 扩散替代模型的近似与免训练粒子滤波

Lifu Wei, Yinuo Ren, Naichen Shi, Yiping Lu

机构 * Department of Mechanical Engineering, Northwestern University, Evanston, IL, United States Institute for Computational \& Mathematical Engineering, Stanford University, Stanford, CA, United States Department of Industrial Engineering \& Management Sciences, Northwestern University, Evanston, IL, United States

AI总结 提出一种基于扩散模型的无偏粒子滤波方法,通过序列蒙特卡洛对扩散轨迹进行重加权和重采样,融合观测数据与模型模拟,实现状态估计的连续校正。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17788 2026-05-26 cs.IR cs.LG

Uncertainty-Calibrated Recommendations for Low-Active Users

低活跃用户的不确定性校准推荐

Bob Junyi Zou, Sai Li, Tianyun Sun, Wentao Guo, Qinglei Wang

机构 * Stanford University(斯坦福大学) ByteDance Inc.(字节跳动公司)

AI总结 提出一个生产就绪的框架,通过校准模型不确定性来为低活跃用户实施风险规避的去增强策略,为高活跃用户采用风险寻求的UCB策略,从而平衡推荐可靠性与多样性。

Comments Accepted to the Applied Data Science (ADS) track at the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12964 2026-05-26 cs.CV

Asymmetric Flow Models

非对称流模型

Hansheng Chen, Jan Ackermann, Minseo Kim, Gordon Wetzstein, Leonidas Guibas

机构 * Stanford University(斯坦福大学)

AI总结 提出非对称流建模(AsymFlow),通过秩非对称速度参数化将噪声预测限制在低秩子空间,同时保持数据预测全维,从而在高维空间中实现高效的流生成,在ImageNet 256×256上取得领先的1.57 FID,并首次提供将预训练潜在流模型微调为像素空间模型的途径。

Comments Code: https://github.com/Lakonik/LakonLab Webpage: https://hanshengchen.com/asymflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21198 2026-05-26 cs.LG cs.AI cs.CL cs.CV cs.RO

Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs

从试错中学习:具身大语言模型的反思式测试时规划

Yining Hong, Huang Huang, Manling Li, Li Fei-Fei, Leonidas Guibas, Jiajun Wu, Yejin Choi

机构 * Stanford University(斯坦福大学) Northwestern University(西北大学)

AI总结 提出反思式测试时规划方法,通过行动中反思和行动后反思两种模式,结合回溯性反思,使具身智能体在测试时进行自我纠正和经验积累,显著提升长程任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17326 2026-05-26 cs.LG stat.AP stat.ML

CopulaSMOTE: A Copula-Based Oversampling Approach for Imbalanced Classification in Diabetes Prediction

CopulaSMOTE:基于Copula的过采样方法用于糖尿病预测中的不平衡分类

Agnideep Aich, Md Monzur Murshed, Bruce Wade, Sameera Hewage

机构 * Stanford University School of Medicine(斯坦福大学医学院) Minnesota State University(明尼苏达州立大学) University of Louisiana at Lafayette(路易斯安那大学拉斐特分校) Southern Utah University(犹他州南方大学)

AI总结 提出CopulaSMOTE方法,利用截断藤copula建模少数类联合依赖结构生成合成样本,在三个糖尿病数据集上结合多种分类器评估,显示能改善大表格数据集的少数类恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24993 2026-05-26 cs.AI cs.CV

NeurIPS: Neuro-anatomical Inductive Priors for Sphere-based Brain Decoding

NeurIPS: 基于球面的脑解码的神经解剖学归纳先验

Sijin Yu, Zijiao Chen, Zhenyu Yang, Zihao Tan, Jiakun Xu, Zhongliang Liu, Shengxian Chen, Wenxuan Wu, Xiangmin Xu, Xin Zhang

机构 * South China University of Technology(南方科技大学) Stanford University(斯坦福大学) King's College London(伦敦国王学院) Foshan University(佛山大学) Pazhou Lab(琶洲实验室)

AI总结 提出NeurIPS框架,通过选择性ROI球形分词器和结构引导专家混合模型,将解剖变异转化为归纳先验,在自然场景数据集上实现表面解码器最先进性能,并显著提升训练效率。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24977 2026-05-26 cs.CV cs.CL

Universal Boosts, Specific Suppressors: Sparse Autoencoder Steering of Medical Vision-Language Models

通用增强,特定抑制:基于稀疏自编码器引导的医学视觉语言模型

Farhad Nooralahzadeh, Benjamin Gundersen, Nicolas Deperrois, Hidetoshi Matsuom, Mizuho Nishio, Thomas Frauenfelder, Ahmed Allam, Christian Blüthgen, Michael Moor, Michael Krauthammer

机构 * University of Zurich and University Hospital of Zurich(苏黎世大学及苏黎世大学医院) Kobe University(Kobe大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Zurich University of Applied Sciences(苏黎世应用科学大学)

AI总结 本文提出一种无需权重更新的解码时残差引导方法,通过每token稀疏自编码器(SAE)对医学视觉语言模型进行干预,抑制幻觉并提升报告质量,在多个模型上取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24803 2026-05-26 cs.LG

Active Learning for Stochastic Contextual Linear Bandits

随机上下文线性老虎机的主动学习

Emma Brunskill, Ishani Karmarkar, Zhaoqi Li

机构 * Stanford University(斯坦福大学)

AI总结 提出一种通过主动采样上下文-动作对奖励来学习近最优策略的算法,理论上证明主动上下文采样可将最小最大率改进最多√d倍,并在华法林剂量预测和笑话推荐任务中验证了样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24771 2026-05-26 cs.CV cs.AI cs.LG

From Theory to Decision Rule: Calibrating the Noisy-Label Crossover for Vision-Language Model Weak Supervision Across Three Medical-Imaging Benchmarks

从理论到决策规则:校准视觉-语言模型弱监督的噪声标签交叉点——基于三个医学影像基准

Bruce Changlong Xu, Jose James, Alexander Ryu

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

AI总结 通过三个医学影像基准校准理论预测的噪声标签交叉点,提出基于少量金标标签的决策规则。

Comments 5 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20025 2026-05-26 cs.AI

AutoResearchClaw: Self-Reinforcing Autonomous Research with Human-AI Collaboration

AutoResearchClaw: 基于人机协作的自我强化自主研究

Jiaqi Liu, Shi Qiu, Mairui Li, Bingzhou Li, Haonian Ji, Siwei Han, Xinyu Ye, Peng Xia, Zihan Dong, Meng Chen, Congyu Zhang, Letian Zhang, Guiming Chen, Haoqin Tu, Xinyu Yang, Lu Feng, Xujiang Zhao, Haifeng Chen, Jiawei Zhou, Xiao Wang, Weitong Zhang, Hongtu Zhu, Yun Li, Jieru Mei, Hongliang Fei, Jiaheng Zhang, Linjie Li, Linjun Zhang, Yuyin Zhou, Sheng Wang, Caiming Xiong, James Zou, Zeyu Zheng, Cihang Xie, Mingyu Ding, Huaxiu Yao

机构 * Carnegie Mellon University(卡内基梅隆大学) Rutgers University(罗格斯大学) NEC Labs America(NEC美国实验室) Meta Stanford University(斯坦福大学) Google(谷歌公司) University of Washington(华盛顿大学)

AI总结 提出AutoResearchClaw多智能体自主研究系统,通过结构化辩论、自愈执行、可验证报告、七种人机协作模式和跨运行进化机制,在ARC-Bench基准上比AI Scientist v2提升54.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02843 2026-05-26 cs.CL

Act or Clarify? Modeling Sensitivity to Uncertainty and Cost in Communication

行动还是澄清?建模沟通中对不确定性和成本的敏感性

Polina Tsvilodub, Karl Mulligan, Todd Snider, Robert D. Hawkins, Michael Franke

机构 * Department of Linguistics, University of Tübingen(图宾根大学语言系) Department of Linguistics, Stanford University(斯坦福大学语言系)

AI总结 提出基于预期遗憾的计算模型,研究人类在不确定性下是否选择提问澄清,取决于不确定性和错误行动成本之间的理性权衡。

Comments 6 pages, 3 figures, accepted to CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05765 2026-05-26 cs.AI cs.LG

AGI Requires a Coordination Layer on Top of Pattern Repositories

AGI 需要在模式存储库之上建立协调层

Edward Y. Chang

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

AI总结 本文提出大型语言模型(LLM)并非AGI的死胡同,而是缺少系统2协调层,通过UCCT和RCA实现语义锚定与因果验证,并设计MACI多智能体协调栈,实验表明自适应控制优于静态提示。

Comments 15 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12378 2026-05-26 cs.AI

Learning to Trust: Bayesian Adaptation to Varying Suggester Reliability in Sequential Decision Making

学会信任:序列决策中针对不同建议者可靠性的贝叶斯自适应方法

Dylan M. Asmar, Mykel J. Kochenderfer

机构 * Stanford Intelligent Systems Laboratory(斯坦福智能系统实验室) Stanford University(斯坦福大学)

AI总结 提出一种贝叶斯框架,通过将建议者质量融入信念表示并引入显式“询问”动作,使智能体在部分可观测环境中动态学习和适应变化的建议者可靠性,平衡信息获取与成本。

Comments Repo: https://github.com/dylan-asmar/learning_to_trust

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26418 2026-05-26 cs.AI

Chain-of-Thought Hijacking

思维链劫持

Jianli Zhao, Tingchen Fu, Rylan Schaeffer, Mrinank Sharma, Fazl Barez

机构 * Independent(独立) University of Oxford(牛津大学) Stanford University(斯坦福大学) Anthropic Martian Core

AI总结 提出思维链劫持攻击,通过诱导大型推理模型进行长时间良性推理来削弱其拒绝有害请求的能力,实现高成功率越狱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24321 2026-05-26 cs.CV

Unified 3D Scene Understanding Through Physical World Modeling

统一3D场景理解:通过物理世界建模

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Honglin Chen, Khai Loong Aw, Daniel L. K. Yamins

机构 * Stanford University(斯坦福大学) OpenAI

AI总结 提出一个概率图模型3WM,将深度估计、新视角合成和物体操作等3D视觉任务统一为单一模型,通过不同推理路径实现零样本任务执行,无需微调即达到最先进性能。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24180 2026-05-26 physics.soc-ph cs.AI cs.DL cs.HC

Human-AI Collaboration in Science at Scale: A Global Large-scale Randomized Field Experiment

大规模人机协作科学:一项全球大规模随机现场实验

Binglu Wang, Weixin Liang, Jiahui Xue, Yuhui Zhang, Hancheng Cao, Dashun Wang, Yian Yin

机构 * Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) Center for Science of Science and Innovation, Northwestern University(西北大学科学与创新中心) Northwestern Institute on Complex Systems, Northwestern University(西北大学复杂系统研究所) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Goizueta Business School, Emory University(埃默里大学戈伊兹特亚商学院) Department of Information Science, Cornell University(康奈尔大学信息科学系)

AI总结 通过全球大规模随机现场实验,研究大型语言模型(LLMs)生成的定制化反馈能否提升科研人员的修订率并促进AI工具使用,尤其惠及资源受限的研究者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24162 2026-05-26 cs.LG cs.AI

Knowledge Graph Modulated Deep Learning for Limited-Sample Clinical Data Analysis

知识图谱调制的深度学习用于有限样本临床数据分析

Yuwei Xue, Sakib Mostafa, James Zou, Joseph Liao, Maximilian Diehn, Ash A. Alizadeh, Lei Xing, Md. Tauhidul Islam

机构 * Department of Radiation Oncology, Stanford University(放射肿瘤科,斯坦福大学) Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) Department of Electrical Engineering, Stanford University(电气工程系,斯坦福大学) Department of Biomedical Data Science, Stanford University School of Medicine(生物医学数据科学系,斯坦福大学医学院) Stanford Cancer Institute, Stanford University(斯坦福癌症研究所,斯坦福大学) Institute for Stem Cell Biology and Regenerative Medicine, Stanford University(干细胞生物学与再生医学研究所,斯坦福大学) Department of Medicine, Division of Oncology, Stanford University(医学系,肿瘤学分会,斯坦福大学) Institute of Computational and Mathematical Engineering, Stanford University(计算与数学工程研究所,斯坦福大学)

AI总结 提出Graph-in-Graph (GiG)框架,通过将患者表示为模块化图并整合生物知识图谱,在有限样本临床任务中显著提升预测性能。

Comments 17 pages, 4 figures, 12 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23924 2026-05-26 cs.CL cs.IR q-fin.GN

Improving the Completeness and Comparability of Segment Disclosures: A Large Language Model Approach

提高分部披露的完整性和可比性:一种大语言模型方法

Yue Liu, Zhiyuan Cheng, Longying Lai

机构 * Rutgers Business School(罗格斯商学院) Rutgers University - Newark(罗格斯大学-新布朗斯维尔回声分校) School of Engineering(工程学院) Stanford University(斯坦福大学) Simon Business School(西蒙商学院) University of Rochester(罗切斯特大学)

AI总结 本研究开发了一种基于大语言模型的框架,直接从10-K文件中提取分部披露信息,保留可报告和嵌套分部信息,并设计检索增强系统以支持跨公司和跨时间的可比性,从而解决结构化数据库中分部数据的完整性和可比性问题。

Comments 39 pages, 4 figures, submitted to Accounting Horizons

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01184 2026-05-26 cs.LG

Temporal Score Rescaling for Temperature Sampling in Diffusion and Flow Models

扩散与流模型中温度采样的时间分数重缩放

Yanbo Xu, Yu Wu, Sungjae Park, Zhizhuo Zhou, Shubham Tulsiani

机构 * School of Computer Science, Carnegie Mellon University, Pittsburgh, USA(计算机科学系,卡内基梅隆大学,匹兹堡,美国) Department of Computer Science, Stanford University, California, USA(计算机科学系,斯坦福大学,加利福尼亚,美国)

AI总结 提出一种无需微调或改变训练策略的方法,通过重缩放噪声数据的得分函数来调控扩散和流模型的采样多样性,实现局部温度控制,并在图像生成、姿态估计、深度预测、机器人操作和蛋白质设计等任务中验证了有效性。

Comments Accepted at ICML 2026. Project page: https://temporalscorerescaling.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12479 2026-05-26 math.OC cs.AI cs.GT cs.MA econ.GN q-fin.EC

EXOTIC: An Exact, Optimistic, Tree-Based Algorithm for Min-Max Optimization

EXOTIC: 一种用于极小极大优化的精确、乐观、基于树的算法

Chinmay Maheshwari, Chinmay Pimpalkhare, Debasish Chatterjee

机构 * Department of Electrical and Computer Engineering, and Data Science and AI Institute at Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系及数据科学与人工智能研究院) Institute for Computational and Mathematical Engineering at Stanford University(斯坦福大学计算与数学工程研究所) Center for Systems and Control, IIT Bombay(印度理工学院班加罗尔系统与控制中心)

AI总结 针对凸-非凹和非凸-凹极小极大优化问题,提出一种基于Sion极小极大定理扩展的重新表述,并设计EXOTIC算法结合迭代凸优化与乐观分层树搜索,以计算全局极小极大值,理论保证最优性间隙上界,实验优于梯度方法,并首次精确求解三人以上博弈的安全策略。

Comments 35 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24920 2026-05-25 cs.CR cs.AI

SUDP: Secret-Use Delegation Protocol for Agentic Systems

SUDP: 面向智能体系统的秘密使用委托协议

Xiaohang Yu, Hejia Geng, Xinmeng Zeng, William Knottenbelt

机构 * Imperial College London(伦敦帝国学院) University of Oxford(牛津大学) Stanford University(斯坦福大学)

AI总结 针对智能体系统中用户秘密被滥用的问题,提出秘密使用委托协议(SUDP),通过授权、委托和兑现机制实现一次性秘密使用,满足七项安全属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12534 2026-05-25 stat.ML cs.DS cs.LG math.ST stat.TH

Linear Regression with Unknown Truncation Beyond Gaussian Features

未知截断下的线性回归:超越高斯特征

Alexandros Kouridakis, Anay Mehrotra, Alkis Kalavasis, Constantine Caramanis

机构 * UT Austin(德克萨斯大学奥斯汀分校) Stanford University(斯坦福大学) Yale University(耶鲁大学)

AI总结 针对未知生存集的截断线性回归问题,提出首个多项式时间算法,仅要求特征向量为次高斯分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23271 2026-05-25 cs.CV cs.AI

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

EvalVerse:面向专业电影级视频生成的流水线感知与专家校准基准测试

Songlin Yang, Haobin Zhong, Ruilin Zhang, Xiaotong Zhao, Shuai Li, Kai Zheng, Xuyi Yang, Zhe Wang, Zhenchen Tang, Yang Li, Bohai Gu, Zhengwei Peng, Yidan Huang, Mengzhou Luo, Yihang Bo, Dalu Feng, Yujia Zhang, Juntao Ma, Ruiqi Wang, Lvmin Zhang, Yuwei Guo, Frank Guan, Maneesh Agrawala, Hongbo Fu, Alan Zhao, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent(腾讯) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Film Academy(北京电影学院) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学) Singapore Institute of Technology(新加坡理工学院)

AI总结 提出EvalVerse框架,通过将电影制作专业知识系统化为评估分类法、构建专家标注数据集并微调视觉语言模型进行链式推理,解决了现有基准忽视电影质量、缺乏领域特异性指标的问题,实现了对生成视频“正确性”与“优良性”的全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏