arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

共收录 1884
2602.15029 2026-07-01 cs.LG cond-mat.dis-nn cs.CL 版本更新

Symmetry in language statistics shapes the geometry of model representations

语言统计中的对称性塑造了模型表示的几何结构

Dhruva Karkada, Daniel J. Korchinski, Andres Nava, Matthieu Wyart, Yasaman Bahri

机构 * UC Berkeley(加州大学伯克利分校) EPFL(瑞士联邦理工学院洛桑分校) Johns Hopkins(约翰斯·霍普金斯大学) Google DeepMind(谷歌DeepMind)

AI总结 本文证明语言统计中的平移对称性(如月份共现频率仅取决于时间间隔)决定了词嵌入模型的高维几何结构,并推导出表示流形的解析形式,该几何在统计扰动下仍保持鲁棒。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04008 2026-07-01 cs.LG cs.CR 版本更新

Efficient Public Verification of Private ML via Regularization

通过正则化实现私有ML的高效公开验证

Zoë Ruha Bell, Anvith Thudi, Olive Franzese-McLaughlin, Nicolas Papernot, Shafi Goldwasser

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 提出首个差分隐私算法,在接近最优隐私-效用权衡下,DP保证的验证成本低于训练成本,通过正则化目标最小化和标准DP组合界限实现。

Comments Proceedings of the 43rd International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18521 2026-07-01 cs.CV 版本更新

Improved Immiscible Diffusion: Accelerate Diffusion Training by Reducing Its Miscibility

改进的不可混扩散:通过降低可混性加速扩散训练

Yiheng Li, Feng Liang, Dan Kondratyuk, Masayoshi Tomizuka, Kurt Keutzer, Chenfeng Xu

机构 * UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 提出通过降低任意层级的可混性来加速扩散模型训练,实现多种实现方式(如KNN噪声选择和图像缩放),在多种任务上获得高达4倍以上的训练加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30645 2026-06-30 cs.RO cs.AI cs.GR cs.SY eess.SY

VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes

VLK:从重建场景中的合成交互学习人形机器人全身操控

Yen-Jen Wang, Jiaman Li, Sirui Chen, Takara E. Truong, Pei Xu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Angjoo Kanazawa, Carmelo Sferrazza, Guanya Shi, Karen Liu

机构 * Amazon FAR(亚马逊FAR) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出VLK方法,通过3D高斯泼溅重建室内场景并合成视觉-语言-运动学数据,训练人形机器人全身操控策略,实现从仿真到真实的迁移。

Comments 19 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30509 2026-06-30 cs.LG

Muon learns balanced solutions in matrix factorization without slow saddle-to-saddle dynamics

Muon学习矩阵分解中的平衡解而无缓慢鞍点间动力学

Mark Rhee, Jamie Simon, Dhruva Karkada

机构 * UC Berkeley(加州大学伯克利分校) Imbue(Imbue公司)

AI总结 研究Muon优化器在矩阵分解中与梯度下降的动力学差异:Muon避免慢鞍点间动力学,以相同速率学习所有主模式,且学习率不受条件数限制,通过指数退火快速收敛,并发现平衡解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30457 2026-06-30 cs.RO

Behavior Prompting Policy: Demonstrations as Prompts for Manipulation

行为提示策略:将演示作为操作提示

Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez, Shuran Song

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出行为提示策略(BPP),通过单次人类演示(行为提示)使机器人推理时执行新任务,结合手持操作接口iPhUMI收集多样化数据,在DrawAnything和LIBERO-Gen基准上验证零样本适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30445 2026-06-30 cs.LG

When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon

在线模仿学习何时有助于LLM后训练?(非)可实现性超越视界的作用

Huaqing Zhang, Jingchu Gai, Juno Kim, Bingbin Liu, Andrej Risteski

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校) Harvard University(哈佛大学)

AI总结 本文挑战误差累积是在线模仿学习优势主要来源的观点,证明在线交互的收益关键取决于设置是否可实现,并在非可实现情况下提出奖励相关的结构特征,使在线学习仍能取得高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30358 2026-06-30 quant-ph cs.DS cs.LG

Learning the structure of open quantum systems

学习开放量子系统的结构

Laura Lewis, Ewin Tang, John Wright

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 提出一种学习n量子比特常局部林德布拉德算符系数的算法,总演化时间O(g d^2 log(n) / ε^2),无需先验结构知识,支持准局域和幂律林德布拉德算符。

Comments 51 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29784 2026-06-30 stat.ME cs.AI econ.EM

HERO: Improving the Reliability and Sensitivity of Generative Model Evaluation Using Historical Data

HERO: 利用历史数据提升生成模型评估的可靠性与敏感性

Xinrui Ruan, Zhenyu Zhao, Waverly Wei, Yueshan Zhang, Zeyu Zheng, Sui Huang, Jingshen Wang

机构 * Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系) Roblox Corporation(Roblox公司) Department of Data Sciences and Operations, University of Southern California(南加州大学数据科学与运营系) School of Mathematical Sciences, Nankai University(南开大学数学科学学院) Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校工业工程与运筹学系)

AI总结 提出HERO框架,通过历史数据校准噪声标签并锚定协变量,降低模型评估的偏差和方差,提升可靠性与敏感性。

Comments 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29577 2026-06-30 cs.CV cs.AI

ReMAP-PET: Beyond Visual Understanding -- Learning Region-Guided Metabolic Alignment Semantics from Brain PET

ReMAP-PET:超越视觉理解——从脑PET学习区域引导的代谢对齐语义

Dasen Dai, Yanteng Zhang, Shuoqi Li, Yuxiang Wei, Hongjie Yu, Qingxin Zhang, Qizhen Lan, Jagath C. Rajapakse, Vince D. Calhoun

机构 * The Chinese University of Hong Kong, HKSAR(香港中文大学) TReNDS Center (Georgia State, Georgia Tech, Emory)(TReNDS中心(佐治亚州立大学、佐治亚理工学院、埃默里大学)) ShanghaiTech University, Shanghai, P.R.China(上海科技大学) University of California, Berkeley, USA(加州大学伯克利分校) University of Texas Health Science Center at Houston, USA(德克萨斯大学健康科学中心(休斯顿)) Nanyang Technological University, Singapore(南洋理工大学)

AI总结 提出ReMAP-PET框架,通过联合回归和对比学习监督3D ResNet-50学习脑PET的区域代谢语义,在SUVR预测和检索上显著优于基线,并实现与临床语言的对齐及报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29301 2026-06-30 cs.CV

Pointer-CAD v2: Plan-Then-Construct CAD Generation with Dimension-Aware Parametric Precision

Pointer-CAD v2: 先规划后构建的尺寸感知参数化CAD生成

Dacheng Qi, Chenyu Wang, Jingwei Xu, Yi Ma, Shenghua Gao

机构 * The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) TranscEngram Monash University(墨尔本大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Pointer-CAD v2,采用先规划后构建范式,通过指针机制直接预测连续参数值,消除量化误差,并在顶点、边和面层级引入层次化几何精度指标,显著提升CAD生成的几何精度。

Comments Accepted to ECCV 2026. Code is available at https://github.com/Snitro/Pointer-CAD-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29259 2026-06-30 cs.RO

PL-LIT: A LiDAR-Inertial-Thermal SLAM Using Point-Line Features and Thermographic Mapping

PL-LIT:一种使用点线特征和热成像的LiDAR-惯性-热SLAM系统

Jiawei Xia, Yixiao Feng, Yongliang Shi, Chao Gao, Renjing Xu, Weining Lu, Bin Liang

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of California, Berkeley(加州大学伯克利分校) Xinchen Qihang Co., Ltd.(新晨启航有限公司)

AI总结 提出PL-LIT系统,结合光度校准与点线特征提取网络,通过ESIKF紧耦合LiDAR、惯性和热数据,实现鲁棒的热SLAM,并构建概率热强度体素地图用于热异常检测。

Comments 8 pages,International Conference on Intelligent Robots and Systems 2026 (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29049 2026-06-30 cs.LG

MOSAIC: Orchestrating Collaborative Knowledge Tracing with Hierarchical Semantic Alignment

MOSAIC: 通过层次语义对齐编排协作知识追踪

Xinjin Li, Mengyue Wang, Yuzhen Lin, Pengbin Feng, Ziqi Sha, Yeyang Zhou, Yu Ma

机构 * Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) School of Information Systems and Management, Carnegie Mellon University(信息系统与管理学院,卡内基梅隆大学) Department of Mathematics, University of Southern California(数学系,南加州大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Computer Science Department, UC San Diego(计算机科学系,UCSD)

AI总结 提出MOSAIC框架,利用冻结LLM生成动态嵌入和层次预测提示,结合跨粒度一致性目标,在协作知识追踪中实现多粒度掌握估计,在多个数据集上取得SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28667 2026-06-30 cs.CL

Phonological Perception of Sign Language Models

手语模型的音系感知

Kayo Yin, Jessica Carter, Alex Xijie Lu, Annemarie Kocab

机构 * University of California, Berkeley(加州大学伯克利分校) Johns Hopkins University(约翰霍普金斯大学) Microsoft Research(微软研究院)

AI总结 本研究通过最小对测试和表征对齐评估手语识别模型的音系感知能力,发现模型具有涌现音系敏感性但存在架构权衡:姿态模型对手形敏感,像素模型对位置敏感。

Comments Accepted to CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28598 2026-06-30 stat.ME cs.LG stat.ML

Conformal Prediction with Macro-Coverage Guarantees

具有宏覆盖保证的共形预测

Aabesh Bhattacharyya, Tiffany Ding, Rina Foygel Barber

机构 * Department of Statistics, University of Chicago(芝加哥大学统计系) Department of Statistics, UC Berkeley(伯克利大学统计系)

AI总结 提出标签加权共形预测方法,在有限样本下保证宏覆盖(类覆盖率的未加权平均),并推广到广义宏覆盖目标,在长尾分类中平衡边缘覆盖与类条件覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28593 2026-06-30 cs.CV cs.AI cs.CL

Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

Animation2Code: 评估视频到代码生成中的时间视觉推理

Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Animation2Code基准,通过从视频重建可执行网页动画代码来评估视觉语言模型的时间视觉推理能力,发现现有模型在时间一致性上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04210 2026-06-30 eess.AS cs.LG cs.SD

Representation Matters in Randomized Smoothing for Audio Classification

表示在音频分类的随机平滑中至关重要

Jong-Ik Park, Shreyas Chaudhari, José M. F. Moura, Carlee Joe-Wong

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 研究随机平滑在音频分类中的表示问题,通过实验揭示预处理和表示选择对认证鲁棒性的影响,并提出报告规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01215 2026-06-30 cs.CV cs.AI cs.CL cs.MM

Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs

将神经符号程序蒸馏到3D多模态大语言模型中

Wentao Mo, Yang Liu

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出APEIRIA,通过三阶段课程学习将符号推理模式蒸馏到3D多模态大语言模型中,实现透明推理与开放词汇空间推理的统一。

Comments To appear in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02898 2026-06-30 cs.AI cs.CL

Aligning Language Model Benchmarks with Pairwise Preferences

将语言模型基准与成对偏好对齐

Marco Gutierrez, Xinyi Leng, Hannah Cyberey, Jonathan Richard Schwarz, Ahmed Alaa, Thomas Hartvigsen

机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院) Imperial College London(伦敦帝国理工学院) Thomson Reuters Foundational Research(汤姆森路透基础研究) Department of Electrical Engineering and Computer Science, UC Berkeley and UCSF(伯克利大学电气工程与计算机科学系及旧金山大学)

AI总结 提出BenchAlign方法,通过利用语言模型在问题级别的性能与模型成对排名,自动调整离线基准权重,使新基准能根据偏好准确排序未见模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22902 2026-06-29 cs.AI 新提交

Agent-as-a-Router: Agentic Model Routing for Coding Tasks

Agent-as-a-Router: 面向编码任务的智能体模型路由

Pengfei Zhou, Zhiwei Tang, Yixing Ma, Jiasheng Tang, Yizeng Han, Zhenglin Wan, Fanqing Meng, Wei Wang, Bohan Zhuang, Wangbo Zhao, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) University of California, Berkeley(加州大学伯克利分校) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

AI总结 提出Agent-as-a-Router框架,通过C-A-F循环积累执行经验,实现编码任务的动态模型路由,ACRouter在分布内任务上取得最低累积遗憾并泛化到分布外任务。

Comments 39 pages, 21 figures, a living technical report with a living benchmark that continuously updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18610 2026-06-29 cs.RO cs.CV 新提交

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03065 2026-06-29 cs.LG cs.RO 版本更新

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

OGPO:生成控制策略的样本高效全微调

Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal, Shashwat Saxena, Jesse Zhang, Giri Anantharaman, Cleah Winston, Chaoyi Pan, Douglas Chen, Nai-Chieh Huang, Zeynep Temel, Oliver Kroemer, Sergey Levine, Abhishek Gupta, Hongkai Dai, Paarth Shah, Max Simchowitz

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

AI总结 提出OGPO算法,通过离策略评论网络和修改的PPO目标,实现生成控制策略的样本高效微调,在多种操作任务上达到最优性能,并能在无专家数据下微调不良初始化的行为克隆策略。

Comments Website: https://simchowitzlabpublic.github.io/ogpo-site/ Code: https://github.com/simchowitzlabpublic/OGPO_public

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02597 2026-06-29 cs.LG cs.CR

Making Brain-Computer Interfaces More Secure

使脑机接口更安全

Md Fahimul Kabir Chowdhury, Gahangir Hossain

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 针对脑电图(EEG)脑机接口(BCI)易受对抗攻击的问题,提出轻量级卷积神经网络(CNN)架构,在梯度攻击下比EEGNet、DeepConvNet和SleepEEGNet等模型具有更好的分类鲁棒性。

Comments Accepted and presented at IEEE World AI IoT Congress 2026

Journal ref 2026 IEEE World AI IoT Congress (AIIoT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04862 2026-06-29 cs.SD 版本更新

Focus Then Listen: An Empirical Study of Plug-and-Play Audio Enhancer for Noise-Robust Large Audio Language Models

先聚焦后聆听:探索用于噪声鲁棒的大规模音频语言模型的即插即用音频增强器

Han Yin, Yang Xiao, Younghoo Kwon, Ting Dang, Jung-Woo Choi

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

AI总结 提出即插即用的音频增强器FTL,通过分离语音与非语音并利用模态路由器预测目标模态,生成任务自适应增强信号,无需微调即可提升LALMs在噪声环境下的性能。

Comments Accepted by ICML 2026 Workshop (Machine Learning for Audio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13139 2026-06-29 stat.ML cs.LG 版本更新

Random Matrix Theory for Deep Learning: Beyond Eigenvalues of Linear Models

深度学习中的随机矩阵理论:超越线性模型的特征值

Zhenyu Liao, Michael W. Mahoney

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology, Wuhan, China(电子信息与通信学院,华中科技大学,武汉,中国) ICSI, LBNL, and Department of Statistics University of California, Berkeley, USA(ICSI、LBNL 和加州大学伯克利分校统计系,美国)

AI总结 本文扩展了传统随机矩阵理论,以应对非线性深度学习模型在高维比例 regime 中的挑战,提出高维等价概念,统一并泛化确定性等价和线性等价,系统解决高维性、非线性和分析通用特征谱函数的难题。

Comments 30 pages, 6 figures; extended technical report version of the IEEE SPM article, with appendices, minor corrections, and clarified derivations

Journal ref IEEE Signal Processing Magazine (Volume: 43, Issue: 2, March 2026) 93 - 106

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03704 2026-06-29 cs.CV 版本更新

QuantV2X: A Fully Quantized Multi-Agent System for Cooperative Perception

QuantV2X:一种用于协同感知的全量化多智能体系统

Seth Z. Zhao, Huizhi Zhang, Zhaowei Li, Juntong Peng, Anthony Chui, Zewei Zhou, Zonglin Meng, Hao Xiang, Zhiyu Huang, Fujia Wang, Ran Tian, Chenfeng Xu, Bolei Zhou, Jiaqi Ma

机构 * UCLA(加州大学洛杉矶分校) UW-Madison(威斯康星大学麦迪逊分校) NCSU(北卡罗来纳州立大学) Purdue University(普渡大学) UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 提出首个全量化多智能体系统QuantV2X,通过端到端量化策略同时降低计算负载和传输带宽,在低比特约束下达到与全精度相当的精度,并显著降低延迟、提升mAP30。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27315 2026-06-26 cs.LG 新提交

Blackwell Approachability and Gradient Equilibrium are Equivalent

Blackwell可逼近性与梯度均衡等价

Brian W. Lee, Nika Haghtalab, Michael I. Jordan, Ryan J. Tibshirani

机构 * University of California, Berkeley(加州大学伯克利分校) Inria & École Normale Supérieure(法国国家信息与自动化研究所 & 巴黎高等师范学院)

AI总结 本文证明梯度均衡(GEQ)与Blackwell可逼近性在算法上等价,从而将GEQ纳入在线学习主流框架,并建立了与遗憾最小化、校准等框架的等价关系。

Comments 30 pages, 1 figure, accepted for presentation at COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26933 2026-06-26 cs.CR cs.AI 新提交

Chai: Agentic Discovery of Cryptographic Misuse Vulnerabilities

Chai:加密误用漏洞的智能发现

Corban Villa, Sohee Kim, Austin Chu, Alon Shakevsky, Raluca Ada Popa

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 提出Chai系统,利用AI改进差分测试,从库级缺陷出发沿依赖图传播,发现并验证加密误用漏洞,在X.509、JWT、SAML库中发现超100个漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26432 2026-06-26 cs.LG econ.EM 新提交

Embedding Foundation Model Predictions in Discrete-Choice Models with Structural Guarantees

具有结构保证的嵌入基础模型预测的离散选择模型

Yingshuo Wang, Xian Sun, Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * University of California, Berkeley(加州大学伯克利分校) Duke University(杜克大学) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

AI总结 提出两阶段适配器,将基础模型的预测嵌入多项Logit效用中,通过符号约束保持边际替代率,在三个数据集上平均提升6.4个百分点准确率,并保证成本单调性和合理时间价值。

Comments Extends arXiv:2605.26559 (ICML 2026 FMSD Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26429 2026-06-26 cs.LG cs.CL 新提交

DualEval: Joint Model-Item Calibration for Unified LLM Evaluation

DualEval: 联合模型-项目校准的统一LLM评估

Aaron J. Li, Hao Huang, Youngmin Park, Yitong Ma, Wei-Lin Chiang, Li Chen, Cho-Jui Hsieh, Bin Yu, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) Arena University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出DualEval框架,通过联合模型-项目校准统一静态基准和竞技场式评估,生成可靠模型排名并支持基准压缩和异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏