arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

共收录 290
2607.21354 2026-07-24 cs.AI 新提交

SPORD: A Simulation-Propose-then-OR-Dispose Approach for Supply Chain Planning

SPORD:一种用于供应链规划的模拟-提出-然后-优化-处置方法

Jiayin He, Yutong Pan, Sen Yang, Ningxuan Kang, Yongzhi Qi, Jianshen Zhang, Wei Qi, Zuo-Jun Max Shen

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) College of Engineering, UC Berkeley(加州大学伯克利分校工程学院) Faculty of Business and Economics, University of Hong Kong(香港大学经管学院)

AI总结 针对电商供应链规划中孤立项目及面临的难题,提出模拟-提出-然后-优化-处置方法(SPORD)及NetSim平台,通过解耦实现加速模拟与操作闭环,应用后提升服务质量、降低履约率并实现碳减排,推动模拟用于主动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20541 2026-07-24 cs.LG cs.AI 新提交

HypNO: A Graph-Based Neural Operator with Physics-Informed Message Passing for Hyperbolic Conservation Laws

HypNO:一种基于图的神经算子,用于双曲守恒律的物理信息消息传递

Dimitrije Ždrale, Cassie An Jeng, Katie Wang, Sonia Vanier, Alexandre Bayen, Hossein Nick Zinat Matin

机构 * Laboratory of Computer Science (LIX), École Polytechnique(计算机科学实验室(LIX),巴黎综合理工学院) Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(电气工程与计算机科学系,加利福尼亚大学伯克利分校)

AI总结 研究针对双曲守恒律,提出基于图的神经算子HypNO,通过邻接因子分解和物理信息消息传递,在时空图上运行,在LWR和ARZ交通流模型基准测试中,能准确预测解快照并捕捉激波和不连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20466 2026-07-24 cs.AI 新提交

JAXBench: Benchmarking Autonomous TPU Kernel Optimization

JAXBench:自主TPU内核优化基准测试

Arya Tschand, Charles Hong, Julian Walker, Nina Cai, Shangkun Wang, Suvinay Subramanian, Sundar Dev, Vijay Janapa Reddi, Amir Yazdanbakhsh, Sethu Sankaran

机构 * Harvard University(哈佛大学) Google(谷歌公司) UC Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind)

AI总结 该研究针对TPU缺乏内核优化基准测试的问题,提出JAXBench套件,包含多个工作负载和算子。通过评估四种反馈驱动方法,发现特定上下文对优化更关键,条件设定和搜索结构能提升性能,最后发布相关基准测试等支持开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19986 2026-07-23 cs.CV 新提交

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

STEREOFLOW:基于StereoDiT和过渡流匹配的渐进式立体匹配

Hao Wang, Haoran Geng, Xiaotong Yang, Jing Tang, Songlin Wei, Linlong Lang, Yeying Jin, Zheng Zhu, Zhaoxin Fan, Biao Leng

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Google(谷歌公司) State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) Tencent(腾讯公司) GigaAI(未知(可能是公司或组织,由于未找到确切对应中文名,按原文保留))

AI总结 研究针对立体匹配问题,提出先验引导的生成框架StereoFlow,通过两阶段渐进级联匹配网络、像素扩散变压器StereoDiT和过渡流匹配实现高效优化,在多基准测试中取得多个最新结果,提升了立体匹配效果。

Comments 10 pages, 6 figures, submitted to TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19595 2026-07-23 cs.CR cs.CL 新提交

Twin Agent: Context Residual Compression for Privilege Separated Agents

孪生智能体:用于特权分离智能体的上下文残差压缩

Zhanhao Hu, Dennis Jacob, Xiao Huang, Zhaorun Chen, Bo Li, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对大语言模型智能体易受安全风险问题,提出孪生智能体模式,由探索和安全智能体组成,通过探索智能体传递紧凑提示,减少信息需求,在保持高任务效用的同时防止提示注入攻击,优于其他基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18770 2026-07-22 cs.CR cs.CV 新提交

GLID: Gated Local Intrinsic Dimension Repairs the Blind Spots of Face-Forgery Detectors

GLID:门控局部内在维度修复面部伪造检测器的盲点

Guang Yang, Fengchen Liu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校)

AI总结 研究针对微调基础模型面部伪造检测器对训练外生成器家族有盲点的问题,提出GLID检测器,通过估计图像补丁令牌局部内在维度,经置信门进入微调检测器,在基准测试中表现出色,揭示相关经验法则并降低准确率跨种子传播。

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17601 2026-07-21 cs.LG cs.AI 新提交

Trustworthy Protein-Ligand Binding Affinity Prediction via Reliability-Aware Multi-Engine Fusion

通过可靠性感知多引擎融合实现可靠的蛋白质-配体结合亲和力预测

Yongchan Hong, Defu Cao, Wenjin Liu, Thomas Ku, Jordy Homing Lam, Emily Nguyen, Willie Neiswanger, Vsevolod Katritch, Yan Liu

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 研究针对蛋白质-配体结合亲和力预测中引擎结果不一致问题,提出RELIABLE-BA框架,通过三步实现多引擎预测,经实验验证其能提升预测竞争力和不确定性校准,可筛选高置信对减少误差,是首个结合证据融合与上下文可靠性的预测框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17329 2026-07-21 cs.CV 新提交

MIS-HCC: Hierarchical Channel Clustering for Efficient Medical Image Segmentation

MIS-HCC:用于高效医学图像分割的分层通道聚类

Bo Zhao, Haoran Yu, Lifei Liu, Zongcheng Chu, Yining Liu, Chang Liu, Szu-Yu Chen, Zequn Xie

机构 * Yale University(耶鲁大学) University of Florida(佛罗里达大学) Wichita State University(威奇托州立大学) Purdue University(普渡大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Stevens Institute of Technology(史蒂文斯理工学院) Zhejiang University(浙江大学)

AI总结 针对医学图像分割模型在资源受限平台部署的挑战,提出分层聚类压缩方法MIS-HCC,利用瓦瑟斯坦距离表示通道相似性形成矩阵指导聚类,融合通道生成压缩网络,实验证明其在精度和压缩效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17166 2026-07-21 cs.LG 新提交

Explaining and Tuning Transformer-based LLMs in Arithmetic Tasks with Human Strategies

用人类策略解释和调整基于Transformer的语言模型在算术任务中的表现

Luyu Qiu, Jianing Li, Hwanhee Kim, Xiaoyong Wei, Yueyuan Zheng, Janet Hsiao, Lei Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 研究基于Transformer的语言模型在算术任务中的表现,通过分解任务、分析损失收敛等,应用人类策略和方法提升其性能,并经多种验证展示有效性,探索其与人类学习者相似性以增强关键应用中的信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17058 2026-07-21 cs.RO cs.CV 新提交

DROID-ANCHOR: Odometry-Anchored Recurrent Metric Depth Estimation

DROID-ANCHOR:基于里程计锚定的循环度量深度估计

Yuxuan Chen, Brook Du

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 研究针对单目系统尺度问题,提出Metric-DROID架构,通过集成里程计,利用LSTM更新算子、不确定性感知度量后端及选择性残差微调策略,实现视觉SLAM与物理现实锚定,有效解决尺度模糊等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16555 2026-07-21 cs.AR cs.AI 新提交

Mitigating Compiler Fusion-Induced Power Bursts in Mobile NPU Inference as the Battery Depletes

在移动NPU推理中减轻随着电池电量耗尽由编译器融合引起的功率突发

Ryoga Yuzawa, Masayoshi Tomizuka

机构 * UC Berkeley(加州大学伯克利分校) Sony(索尼公司)

AI总结 研究移动设备低电压下NPU推理因编译器融合致功率突发问题,提出测量引导的预编译图重写方法,可减少峰值电流、降低延迟开销、保持稳定延迟并偏移DVFS裕度。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16239 2026-07-21 cs.LG stat.AP 新提交

BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges

BACON:用于多人工智能评判器建模与评估的预算人类校准

Lei Shi, Anlan Zhang, Rita Lyu, Zhengmian Hu, Tong Yu, David Arbour, Avi Feller, Saayan Mitra, Ritwik Sinha

机构 * Adobe Research(Adobe研究院) University of California, Berkeley(加州大学伯克利分校)

AI总结 研究针对人工智能评判器输出有偏差等问题,提出BACON四阶段流程,结合预算人类校准与多人工智能评判器输出。通过构建辅助特征、收集人类标签训练模型,实现总体指标估计和个体级替代评分,提高了预测准确性等,提供实用评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15693 2026-07-20 q-bio.NC cs.AI 新提交

Toward a mechanistic understanding of inference in visual cortex and diffusion models

迈向对视觉皮层和扩散模型中推理的机制性理解

Zeyu Yun, Alexander Belsten, Dasheng Bi, Zahra Kadkhodaie, Yubei Chen, Bruno A. Olshausen

机构 * Dept. of Electrical Engineering and Computer Science, UC Berkeley(加州大学伯克利分校电气工程与计算机科学系) Helen Wills Neuroscience Institute, UC Berkeley(加州大学伯克利分校海伦·威尔斯神经科学研究所) Herbert Wertheim School of Optometry and Vision Science, UC Berkeley(加州大学伯克利分校赫伯特·韦特海姆视觉科学学院) Redwood Center for Theoretical Neuroscience, UC Berkeley(加州大学伯克利分校红木理论神经科学中心) Flatiron Institute(Flatiron研究所) Dept. of Electrical and Computer Engineering, UC Davis(加州大学戴维斯分校电气与计算机工程系)

AI总结 研究旨在理解视觉皮层和扩散模型中推理,提出基于稀疏编码的模型,用去噪分数匹配等训练,其性能出色,能揭示递归动力学机制,还能断开部分潜在变量与视觉输入连接,连接神经科学与机器学习领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15863 2026-07-20 cs.RO 新提交

Minimum Time Dubins Airplane Paths with Asymmetric Climb Rates

具有不对称爬升率的最短时间杜宾斯飞机路径

Jaeyoung Lim, Giuseppe Loianno

机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加利福尼亚大学伯克利分校电气工程与计算机科学系)

AI总结 研究具有不对称爬升率的最短时间杜宾斯飞机路径问题,提出考虑不对称爬升率的路径,重新审视时间最优性条件,通过该方法可利用飞行器全部性能,减少最短时间并加快在复杂任务中找到中位数解的时间,还通过实际飞行证明了实用性。

Comments 7 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14635 2026-07-17 cs.AI cs.CV cs.RO 新提交

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造

Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li

机构 * Shanghai Qizhi Institute(上海期智研究院) The Chinese University of Hong Kong(香港中文大学) Hong Kong Embodied AI Lab(香港具身人工智能实验室) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13472 2026-07-16 cs.RO cs.CV 新提交

EgoHTR: Egocentric 4D Demonstrations of Human Terrain Traversal

EgoHTR:以自我为中心的人类地形穿越的4D演示

Alex Brandes, Haig Conti Georges Sajelian, Manthan Patel, Dominik Hollidt, Chenhao Li, Matthias Heyrman, Oliver Hausdoerfer, Manuel Kaufmann, Xi Wang, Jonas Frey, Angela P. Schoellig, Christian Holz, Marc Pollefeys, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford(斯坦福大学) UC Berkeley(加州大学伯克利分校) TU Munich(慕尼黑工业大学)

AI总结 研究针对非结构化地形部署人形机器人的问题,提出EgoHTR数据集,通过多传感器设置捕获人类运动序列,经评估有高准确性,还利用数据训练运动策略并实现硬件部署,助力构建上下文感知机器人。

Comments Project webpage: https://egohtr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13436 2026-07-16 cs.LG cs.SY eess.SY 新提交

Distributionally Robust and Safe Imitation Learning

分布鲁棒且安全的模仿学习

Ahmed Aboudonia, Naira Hovakimyan

机构 * University of California Berkeley(加利福尼亚大学伯克利分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究针对模仿学习对分布变化敏感及安全风险问题,提出分布鲁棒且安全的模仿学习框架,利用泰勒级数模仿学习和分布鲁棒自适应控制应对不同诱导变化,在无人机案例中验证了方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13241 2026-07-16 cs.LG cs.AI 新提交

EMAGN: Efficient Multi-Attention Graph Network via Learned Clustering for Scalable Traffic Forecasting

EMAGN:基于学习聚类的高效多注意力图网络用于可扩展交通流量预测

Mingxing Xu, Rakesh Chowdary Machineni, Ke Liu, Xi Cheng, Chengqi Lu, Xin Hu, Lyuhao Chen, Xiangyu Li, Junwei You, Oliver Gao

机构 * Shanghai Jiao Tong University(上海交通大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of California, Berkeley(加利福尼亚大学伯克利分校) Cornell University(康奈尔大学) Technische Universität Dresden(德累斯顿工业大学) Carnegie Mellon University(卡内基梅隆大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 针对交通流量预测中自注意力机制扩展性有限的问题,提出EMAGN,通过学习聚类矩阵将空间注意力机制线性化,降低复杂度,实验表明其在准确性和效率上优于其他模型,扩展了可行模型配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13239 2026-07-16 cs.AI 新提交

Cost-Optimal Foundation Model Deployment Portfolio for Transportation Management

用于交通管理的成本最优基础模型部署组合

Xi Cheng, Ke Liu, Siyuan Feng, Jane Lin, H. Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) The Hong Kong Polytechnic University(香港理工大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 研究交通管理中基础模型部署组合问题,提出FMDP混合整数规划,证明其NP难,给出多项式时间贪婪启发式算法,通过案例研究确定低成本组合,经盈亏平衡分析得出本地GPU投资合理的条件。

Comments Accepted at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13031 2026-07-15 cs.LG cs.CV 新提交

The Seriality Gap in Video Diffusion Models

视频扩散模型中的序列性差距

Jorge Diaz Chao, Konpat Preechakul, Yuxi Liu, Yutong Bai

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 研究视频扩散模型在多球动力学实验中的表现,发现其存在序列性差距,即任务所需串行计算与模型去噪循环不匹配,增加有效串行计算的方法可提升性能,还证明去噪步骤在串行推理和模拟任务上有结构障碍。

Comments Jorge Diaz Chao and Konpat Preechakul contributed equally. 24 pages, 12 figures, and 5 tables. Project page: https://seriality-gap.jdiazchao.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12114 2026-07-15 cs.RO cs.AI cs.CV 新提交

GaitSpan: Growing Humanoid Locomotion from Walking to Running

GaitSpan:将类人机器人的运动从行走扩展到跑步

Kwan-Yee Lin, Zilin Wang, Janelle J. Liu, Stella X. Yu

机构 * University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校)

AI总结 研究如何让类人机器人从行走扩展到跑步,提出GaitSpan框架,将预训练行走策略扩展,通过节奏生成、步幅塑造和残差适应三方面实现,能跨形态、跨地形零样本部署,相比基线学习更快且步态性能更强。

Comments Project Page: https://gaitspan2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11560 2026-07-14 cs.CV cs.AI 新提交

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10826 2026-07-14 cs.CV cs.AI cs.GR 新提交

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究

Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * Roblox Corporation(罗布乐思公司) Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) Computer Science Department, Stanford University(斯坦福大学计算机科学系) Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)

AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10628 2026-07-14 cs.CL cs.AI cs.HC 新提交

Anamnesis: An Open-Source Platform for Large-Scale Backstory-Conditioned Survey Simulation

记忆回溯:一个用于大规模背景条件调查模拟的开源平台

Song-Ze Yu, Joseph Suh, Serina Chang, David M. Chan

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

AI总结 介绍开源平台记忆回溯,用于大规模背景条件调查模拟。它运用大语言模型,基于文集和他性框架,支持多模态调查。通过案例研究评估,其产生的意见分布更接近真实数据,为专有模拟服务提供替代。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09739 2026-07-14 cs.AI cs.CL 新提交

Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks

分数集之前的核心集:用于大语言模型基准测试的评估无监督提示子集选择

Jihan Yao, Gantavya Bhatt, Arnav Das, Peter Jin, Ke Bao, Qiaolin Yu, Khushi Bhardwaj, Chang Su, Jialei Wang, Yikai Zhu, Sugam Devare, Damon Mosk-Aoyama, Zhen Dong, Venkat Krishna Srinivasan, Yineng Zhang, Oleksii Kuchaiev, Jiantao Jiao, Banghua Zhu, Jeff Bilmes

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Oracle(甲骨文公司) Together AI(Together AI公司) LMSYS NVIDIA(英伟达公司)

AI总结 研究大语言模型基准测试的核心集选择,采用评估无监督方法,利用次模子集选择,开发多种次模函数。在新大规模套件上实验发现设施选址函数效果好,该目标不限于特定模式,在相关排行榜上表现优且计算成本低,证明次模性对基准压缩有用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09692 2026-07-14 cs.LG cs.CL 新提交

Reference-Based Distillation Detection in LLMs

大语言模型中基于参考的蒸馏检测

Rajat Rawat, Sizhe Chen, Akshay Anand, Michael Duan, Bob Rotsted, Sewon Min

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校) University of Southern California(南加利福尼亚大学) OpenAI

AI总结 研究旨在检测大语言模型是否经蒸馏而来,提出基于参考的成员推理蒸馏检测方法,通过比较模型与不同候选教师输出的优先对齐程度识别教师及蒸馏证据,能处理未知管道,扩展到开放世界设置,应用于当代模型获潜在蒸馏关系新证据。

Comments 27 pages (14 main), 21 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11005 2026-07-14 math.OC cs.AI cs.LG stat.ML 新提交

Actor-Critic Learning for Extended Mean Field Control with Deterministic Policies

具有确定性策略的扩展平均场控制的演员-评论家学习

Ziheng Cheng, Xin Guo, Huyên Pham, Yufei Zhang

机构 * University of California, Berkeley(加州大学伯克利分校) Ecole Polytechnique, CMAP(巴黎政治经济学院(École Polytechnique)) Imperial College London(伦敦帝国学院)

AI总结 针对连续时间扩展平均场控制问题,提出无模型强化学习框架,采用确定性反馈策略,建立灵敏度公式并推导策略梯度公式,经细化后得到含相关导数项的策略梯度,结合多种方法形成算法,数值实验验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28320 2026-07-13 cs.RO 新提交

WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation

WARP-RM: 一种用于数据筛选的扭曲增强相对进度奖励模型

Justin Yu, Andrew Goldberg, Kavish Kondap, Karim El-Refai, Ethan Ransing, Qianzhong Chen, Mac Schwager, Fred Shentu, Philipp Wu, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) XDOF

AI总结 提出WARP-RM,通过时间扭曲增强从成功演示中自监督学习密集相对进度信号,用于行为克隆中加权高优势动作块,在机器人叠衣任务中显著提升数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08751 2026-07-10 cs.RO 新提交

DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation

DexVerse:用于多任务、多实体灵巧操作的模块化基准测试

Yunchao Yao, Zhuxiu Xu, Tianqi Zhang, Zixian Liu, Sikai Li, Zhenyu Wei, Feng Chen, Dihong Huang, Kechang Wan, Chenyang Ma, Shuqi Zhao, Shenghua Gao, Masayoshi Tomizuka, Yi Ma, Mingyu Ding

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) The University of Hong Kong(香港大学) UC Berkeley(加州大学伯克利分校)

AI总结 DexVerse是用于多任务、多实体灵巧操作的模块化基准测试,含100个任务,支持多种机器人手臂和手,可扩展且提供视觉变化等。通过对多种方法的基准测试,揭示任务泛化和视觉运动鲁棒性挑战,为通用灵巧操作提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08147 2026-07-10 cs.CR cs.AI 新提交

Prismata: Confining Cross-Site Prompt Injection in Web Agents

Prismata:限制Web代理中的跨站提示注入

Corban Villa, Alp Eren Ozdarendeli, Sijun Tan, Raluca Ada Popa

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 研究针对Web代理跨站提示注入问题,提出Prismata防御机制,通过动态信任推导生成权限标签,结合机械限制执行标签,无需开发者注释,能有效降低攻击成功率并保留良性任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏