arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

共收录 1884
2605.26329 2026-05-27 cs.AI

JobBench: Aligning Agent Work With Human Will

JobBench:使智能体工作符合人类意愿

Yuetai Li, Yichen Feng, Zhangchen Xu, Zixian Ma, Kaiyuan Zheng, Fengqing Jiang, Xinghua Sun, Rulin Shao, Zichen Chen, Yue Huang, Xinyang Han, Brian Lee, Kayla Xu, Shenglai Zeng, Hang Hua, Xiangliang Zhang, Basel Alomair, Ranjay Krishna, Luke Zettlemoyer, Pang Wei Koh, Bhaskar Ramasubramanian, Luyao Niu, Xiang Yue, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of Notre Dame(圣母大学) University of California, Berkeley(加州大学伯克利分校) Michigan State University(密歇根州立大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Bake AI King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城) Western Washington University(西雅图华盛顿大学) University of Chicago(芝加哥大学)

AI总结 提出JobBench基准,通过专家识别的高优先级工作流程评估AI智能体,以人类需求为中心而非经济价值,覆盖35个职业的130个任务,使用事实锚定的评分链评估,最强模型仅达45.9%,旨在推动从替代到增强的劳动力市场影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26315 2026-05-27 cs.LG cs.AI

Curriculum Learning for Safety Alignment

用于安全对齐的课程学习

Sandeep Kumar, Virginia Smith, Chhavi Yadav

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

AI总结 提出基于课程学习的Staged-Competence框架,通过难度分级的偏好数据和渐进式参考模型更新,提升DPO安全对齐的鲁棒性,在三个模型族上平均降低16%的OOD有害响应率和20%的越狱攻击成功率。

Comments Accepted at the ICML 2026 GlobalSouthML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26176 2026-05-27 cs.SD cs.AI

PitchBench: Measuring Pitch Hearing in Audio-Language Models

PitchBench: 测量音频-语言模型中的音高听觉能力

Milan Liessens Dujardin, Song-Ze Yu, Craver Corbyn Thomas-Smith, David M. Chan, Karina Nguyen

机构 * University of California, Berkeley(加州大学伯克利分校) Thoughtful Lab

AI总结 提出PitchBench评估套件,通过28个实验系统测量音频-语言模型在绝对和相对音高感知上的表现,发现当前模型在不同声源、音长和格式下音高感知不可靠。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25353 2026-05-27 cs.LG cs.CV physics.comp-ph

PDEInvBench: A Comprehensive Dataset and Design Space Exploration of Neural Networks for PDE Inverse Problems

PDEInvBench:面向PDE逆问题的神经网络综合数据集与设计空间探索

Divyam Goel, Nithin Chalapathi, Sanjeev Raja, Aditi S. Krishnapriyan

机构 * Department of Computer Science, UC Berkeley(计算机科学系,加州大学伯克利分校) UC Berkeley(加州大学伯克利分校) Departments of Computer Science and Chemical Engineering UC Berkeley(计算机科学与化学工程系,加州大学伯克利分校;劳伦斯伯克利国家实验室) LBNL

AI总结 提出PDEInvBench基准数据集,通过数值模拟涵盖多种PDE,并沿优化、表示和缩放三个维度系统探索神经网络设计空间,发现两阶段训练、PDE导数输入和初始条件多样性等实用见解。

Comments 37 total pages, 13 main pages, 20 figures, 8 tables. Published in Transactions on Machine Learning Research (TMLR), 2026

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12827 2026-05-27 cs.CR cs.AI cs.LG

GraphIP-Bench: How Hard Is It to Steal a Graph Neural Network, and Can We Stop It?

GraphIP-Bench:窃取图神经网络有多难,我们能阻止吗?

Kaixiang Zhao, Bolin Shen, Yuyang Dai, Shayok Chakraborty, Yushun Dong

机构 * University of Notre Dame(诺特大学) Florida State University(佛罗里达州立大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出统一基准GraphIP-Bench,集成12种提取攻击和12种防御,评估图神经网络模型窃取的难易程度及防御有效性,发现中等查询预算下窃取容易且多数防御无效,异配图更难窃取。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02230 2026-05-27 cs.OS cs.AI cs.NI

Continuum: Efficient and Robust Multi-Turn LLM Agent Scheduling with KV Cache Time-to-Live

Continuum: 基于KV缓存生存时间的高效鲁棒多轮LLM智能体调度

Hanchen Li, Runyuan He, Qiuyang Mang, Qizheng Zhang, Huanzhi Mao, Xiaokun Chen, Hangrui Zhou, Alvin Cheung, Joseph Gonzalez, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Tensormesh(Tensormesh公司) Tsinghua University(清华大学)

AI总结 针对多轮智能体工作负载中工具调用导致KV缓存无法跨轮重用的问题,提出Continuum系统,通过引入KV缓存的生存时间(TTL)机制,在GPU内存中选择性固定缓存,权衡重算/重载成本与排队延迟,实现作业完成时间平均提升8倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21882 2026-05-27 cs.LG cs.AI

Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards

立场:具有可验证奖励的强化学习的隐藏成本与测量缺口

Fang Wu, Aaron Tu, Weihao Xuan, Heli Qi, Xu Huang, Qingcheng Zeng, Shayan Talaei, Yijia Xiao, Peng Xia, Xiangru Tang, Yuchen Zhuang, Yinxi Li, Bing Hu, Hanqun Cao, Wenqi Shi, Rui Yang, Nan Liu, Huaxiu Yao, Ge Liu, Li Erran Li, Amin Saberi, Naoto Yokoya, Jure Leskovec, Yejin Choi

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Georgia Tech(佐治亚理工学院) Northwestern University(西北大学) UCLA(加州大学洛杉矶分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Yale University(耶鲁大学) University of Waterloo(滑铁卢大学) Independent Researcher(独立研究者) CUHK(香港中文大学) UT Southwestern Medical Center(西南医学中心) National University of Singapore(新加坡国立大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Amazon AWS AI(亚马逊AWS人工智能)

AI总结 本文指出,具有可验证奖励的强化学习(RLVR)在提升大语言模型性能时,常因预算不匹配、尝试膨胀和基准数据污染等混淆因素导致收益被高估,并提出了预算匹配饱和曲线、校准跟踪、法官鲁棒性测试和污染筛查等最低标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01518 2026-05-27 cs.AI

Qrita: High-performance Top-k and Top-p using Pivot-based Truncation and Selection

Qrita:使用基于枢轴的截断和选择的高性能Top-k和Top-p

Jongseok Park, Sunga Kim, Alvin Cheung, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Qrita算法,通过基于高斯sigma截断和四元枢轴搜索的枢轴方法,高效实现Top-k和Top-p采样,在保持与排序算法相同输出的同时,将端到端服务吞吐量提升至1.4倍并减少一半内存使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00575 2026-05-27 cs.CL

InfoSynth: Information-Guided Benchmark Synthesis for LLMs

InfoSynth: 信息引导的大语言模型基准合成

Ishir Garg, Neel Kolhe, Xuandong Zhao, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 提出基于信息论(KL散度和熵)的InfoSynth框架,自动生成高难度、多样化的Python编程基准,97%的测试用例和解决方案准确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04533 2026-05-27 cs.CV

TAG: Tangential Amplifying Guidance for Hallucination-Resistant Sampling

TAG: 切向放大引导用于抗幻觉采样

Hyunmin Cho, Donghoon Ahn, Susung Hong, Jee Eun Kim, Seungryong Kim, Kyong Hwan Jin

机构 * Korea University(韩国大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

AI总结 提出一种无需训练、与架构无关的即插即用引导方法TAG,通过放大估计分数的切向分量来纠正采样轨迹,减少语义不一致性并提高保真度。

Comments Accepted to ICML 2026 (Regular)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26112 2026-05-26 cs.AI cs.LG

From Model Scaling to System Scaling: Scaling the Harness in Agentic AI

从模型扩展到系统扩展:扩展智能体AI中的“缰绳”

Shangding Gu

机构 * UC Berkeley(伯克利大学)

AI总结 本文提出智能体AI的下一个瓶颈是系统扩展而非仅模型扩展,通过设计可审计、持久、模块化和可验证的架构(称为“缰绳”),并研究上下文治理、可信记忆和动态技能路由三大瓶颈,以推动智能体行为从模型能力向长期任务执行转化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26106 2026-05-26 cs.LG

Looped Diffusion Language Models

循环扩散语言模型

Sanghyun Lee, Chunsan Hong, Seungryong Kim, Jonghyun Lee, Jongho Park, Dongmin Park

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出LoopMDM,通过选择性循环早期-中间Transformer层,在训练时实现深度缩放效果而不增加参数,在推理时通过调整循环次数灵活扩展计算量,从而提升掩码扩散模型的训练效率和性能。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25790 2026-05-26 cs.RO

HoLoArm: Deformable Arms for Collision-Tolerant Quadrotor Flight

HoLoArm: 用于碰撞容忍四旋翼飞行的可变形臂

Quang Ngoc Pham, Jonas Eschmann, Yang Zhou, Alejandro Ojeda Olarte, Giuseppe Loianno, Van Anh Ho

机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术研究所) University of California Berkeley(加州大学伯克利分校) New York University(纽约大学)

AI总结 受蜻蜓翅膀结脉结构启发,提出具有柔性臂的四旋翼HoLoArm,结合强化学习控制策略实现被动变形与快速恢复,在高达7.6 m/s碰撞速度下保持稳定飞行。

Comments 8 pages, 15 figures, 1 table, Accepted at the IEEE Robotics and Automation Letters (RA-L) and the IEEE International Conference on Robotics and Automation (ICRA), 2026

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 3, pp. 3582-3589, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25423 2026-05-26 cs.RO

OPAL: Omnidirectional Path-efficient Aerial 3D expLoration

OPAL: 全方位路径高效空中三维探索

Yoga Satwik Chappidi, Avideh Zakhor

机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系)

AI总结 提出OPAL框架,通过在歧义分支点进行360度偏航旋转替代计算密集的全局路径规划,实现计算简单、路径短且覆盖率高的自主探索。

Comments Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21602 2026-05-26 cs.AI cs.SE

Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs

基准测试与改进LLMs中的分布外对齐失败监控器

Dylan Feng, Pragya Srivastava, Anca Dragan, Cassidy Laidlaw

机构 * University of California, Berkeley, USA(加州大学伯克利分校) Haize Labs, New York, USA(Haize实验室) Google DeepMind, India(谷歌DeepMind)

AI总结 针对大语言模型在分布外情境下的安全与对齐失败问题,提出MOOD基准并证明结合守卫模型与OOD检测器可提升监控召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25210 2026-05-26 cs.LG cs.AI stat.ML

Multi-Objective Learning for Diffusion Models: A Statistical Theory under Semi-Supervised Learning

扩散模型的多目标学习:半监督学习下的统计理论

Ziheng Cheng, Yixiao Huang, Hanlin Zhu, Haoran Geng, Somayeh Sojoudi, Jitendra Malik, Pieter Abbeel, Xin Guo

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 针对扩散模型在多目标学习中因模型容量增大导致统计成本高的问题,提出半监督两阶段训练方法,利用未标记数据通过伪样本蒸馏,证明所需配对样本量仅取决于专家模型复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24805 2026-05-26 cs.CV

Fishbone: From One 3D Asset to a Million Controllable Edits

Fishbone: 从一个3D资产到百万可控编辑

Yumeng He, Xiaoying Wang, Peihao Li, Yanjia Huang, Joe Masterjohn, Jiajun Wu, Leonidas Guibas, Yin Yang, Ying Jiang, Chenfanfu Jiang

机构 * UCLA(加州大学洛杉矶分校) USC(南加州大学) UC Berkeley(加州大学伯克利分校) TRI(技术研究院) Stanford(斯坦福大学) Utah(犹他大学)

AI总结 提出一种统一的脊-肋表示方法Fishbone,支持通用网格的可控参数化变形、降阶动力学和动画,并构建了Fishbone-136K数据集,应用于可控3D生成、机器人学习数据增强等任务。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24630 2026-05-26 cs.CV

DexSIM: Real-time Dexterous Simulation with Unified Causal Video Diffusion

DexSIM: 具有统一因果视频扩散的实时灵巧仿真

Adam Lee

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 提出DexSIM框架,通过两阶段训练(双向视频扩散和自回归滚动训练)实现实时、长时一致的灵巧操作仿真,在像素相似度、运动保真度和手部投影精度上超越基线。

Comments World Model @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24548 2026-05-26 cs.LG math.PR

Deep ZakaiJ: Structured Filtering for Jump-Diffusion Time Series Forecasting

Deep ZakaiJ:用于跳跃扩散时间序列预测的结构化滤波

Yan Leng, Thibaut Mastrolia, Hao Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Deep ZakaiJ模型,将Zakai非线性滤波方程嵌入神经编码器-解码器架构,通过Strang分裂实现隐状态信念更新,用于部分观测的跳跃扩散系统,在合成、金融和海洋数据集上改进了分布预测并保持点精度竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24449 2026-05-26 cs.RO cs.LG

Vision-Guided Outdoor Flight and Obstacle Evasion via Reinforcement Learning

基于强化学习的视觉引导户外飞行与避障

Shiladitya Dutta, Aayush Gupta, Varun Saran, Avideh Zakhor

机构 * College of Engineering, Department of Electrical Engineering and Computer Science, University of California Berkeley(加州大学伯克利分校工程学院电气工程与计算机科学系)

AI总结 提出一种基于立体视觉深度和视觉惯性里程计的传感器运动策略,通过强化学习和特权学习在仿真中训练,实现零样本迁移到未知户外环境和无人机平台进行自主避障导航。

Comments Published in IEEE Robotics and Automation Letters, vol 11, no 2. Presented at the IEEE International Conference on Robotics and Automation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24096 2026-05-26 cs.DB cs.AI cs.DC cs.SE

The Time is Here for Just-in-Time Systems: Challenges and Opportunities

即时系统的时代已到来:挑战与机遇

Shu Liu, Alexander Krentsel, Shubham Agarwal, Mert Cemri, Ziming Mao, Soujanya Ponnapalli, Alexandros G. Dimakis, Sylvia Ratnasamy, Matei Zaharia, Aditya Parameswaran, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校) Bespoke Labs

AI总结 本文提出基于LLM的即时系统合成方法Jitskit,通过从零开始合成专用键值存储系统,在18个规格上性能超越现有系统最高达4.6倍。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18932 2026-05-26 cs.LG cs.AI

HypergraphFormer: Learning Hypergraphs from LLMs for Editable Floor Plan Generation

HypergraphFormer: 从大语言模型中学习超图以实现可编辑的楼层平面图生成

Nikita Klimenko, Hesam Salehipour, Parham Eftekhar, Amir Khasahmadi, Ramon Elias Weber

机构 * Autodesk Research(Autodesk研究院) York University(约克大学) UC Berkeley(加州大学伯克利分校)

AI总结 提出HypergraphFormer,利用大语言模型学习超图表示来生成楼层平面图,在RPLAN数据集上超越现有方法,并支持任意边界和高度可编辑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09458 2026-05-26 cs.RO

Stein Variational Ergodic Surface Coverage with SE(3) Constraints

Stein变分遍历曲面覆盖与SE(3)约束

Jiayun Li, Yufeng Jin, Sangli Teng, Dejian Gong, Georgia Chalvatzaki

机构 * Department of Computer Science, TU Darmstadt(图宾根大学计算机科学系) Honda Research Institute Europe GmbH(本田欧洲研究院) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出一种基于预条件SE(3) Stein变分梯度下降的采样即优化方法,用于生成满足SE(3)约束的遍历轨迹,实现复杂3D点云曲面的高质量覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10527 2026-05-26 cs.CY cs.AI

AI-PACE: A Framework for Integrating AI into Medical Education

AI-PACE:将人工智能融入医学教育的框架

Scott P. McGrath, Katherine K. Kim, Karnjit Johl, Haibo Wang, Nick Anderson

机构 * Center for Information Technology in the Interest of Society(信息科技促进社会中心) University of California, Berkeley(加州大学伯克利分校) School of Medicine, Department of Public Health Sciences(医学院公共卫生科学系) University of California, Davis(加州大学戴维斯分校) School of Medicine, Department of Internal Medicine(医学院内科医学系) Research Centre of Big Data and AI for Medicine(医学大数据与人工智能研究中心) First Affiliated Hospital of Sun Yat-Sen University(中山大学第一附属医院)

AI总结 本文通过文献综述,提出AI-PACE框架,旨在将人工智能教育系统性地整合到医学培训的各个阶段,强调纵向整合、跨学科合作以及技术与临床应用的平衡。

Comments Version 2: Revisions after round 1 of peer review. Paper under consideration at npj Digital Medicine. 12 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23901 2026-05-25 cs.LG cs.AI cs.IT math.IT

LLMs as Noisy Channels: A Shannon Perspective on Model Capacity and Scaling Laws

LLMs 作为噪声信道:香农视角下的模型容量与缩放定律

Xu Ouyang, Deyi Liu, Yuhang Cai, Jing Liu, Yuan Yang, Chen Zheng, Thomas Hartvigsen, Yiyuan Ma

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 针对现有缩放定律无法解释非单调性能退化的问题,提出基于香农-哈特利定理的香农缩放定律,将LLM训练建模为噪声信道上的信息传输,通过信号噪声比解释模型规模与数据量对性能的影响。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23878 2026-05-25 cs.CV

LaMo: Self-Supervised Latent Motion Priors for Physical Realism in Video Generation

LaMo: 视频生成中物理真实性的自监督潜在运动先验

Bo Jiang, Depu Meng, Yihan Hu, Yichen Xie, Tianshuo Xu, Wei Zhan

机构 * Applied Intuition University of California, Berkeley(加州大学伯克利分校)

AI总结 提出LaMo,通过自监督方式从无标签视频中提取运动先验,包括宏运动漂移损失和微运动场引导,无需外部监督即可提升视频扩散模型的物理一致性。

Comments Project Page: https://lamo-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28767 2026-05-25 cs.CV

Gen-Searcher: Reinforcing Agentic Search for Image Generation

Gen-Searcher: 强化搜索代理用于图像生成

Kaituo Feng, Manyuan Zhang, Shuang Chen, Yunlong Lin, Kaixuan Fan, Yilei Jiang, Hongyu Li, Dian Zheng, Chenyang Wang, Xiangyu Yue

机构 * MMLab, CUHK(CUHK的MMLab) UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) Meituan Home(美团家庭)

AI总结 提出Gen-Searcher,首个通过多跳推理和搜索收集文本知识与参考图像的搜索增强图像生成代理,结合SFT和强化学习训练,显著提升生成质量。

Comments Project page: https://gen-searcher.vercel.app Code: https://github.com/tulerfeng/Gen-Searcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23109 2026-05-25 cs.AI cs.DC cs.LO cs.PL

Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems

归纳演绎合成:使AI能够生成形式化验证的系统

Shubham Agarwal, Alexander Krentsel, Shu Liu, Mert Cemri, Audrey Cheng, Rui Meng, Tomas Pfister, Chun-Liang Li, Sylvia Ratnasamy, Aditya Parameswaran, Matei Zaharia, Ion Stoica, Mohsen Lesani

机构 * UC Berkeley(伯克利大学) Google(谷歌) UC Santa Cruz(圣克鲁兹大学)

AI总结 提出归纳演绎合成(IDS)方法,通过联合增量合成实现与证明,并利用失败尝试学习,使AI在分布式系统规范上实现100%验证成功率,成本和时间远低于专家和现有AI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18859 2026-05-25 cs.LG cs.AI

TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

TwinRouterBench:面向现实智能体LLM路由的快速静态与实时动态评估

Pei Yang, Wanyi Chen, Tongyun Yang, Pengbin Feng, Jiarong Xing, Wentao Guo, Yuhang Yao, Yuhang Han, Hanchen Li, Xu Wang, Zeyu Wang, Jie Xiao, Anjie Yang, Liang Tian, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Independent Researcher(独立研究者) University of Southern California(南加州大学) Rice University(Rice大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) University of the Chinese Academy of Sciences(中国科学院大学) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出TwinRouterBench基准,通过静态轨迹级前缀和动态智能体执行两轨,实现无需在线LLM评判的步骤级路由评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10067 2026-05-25 cs.LG cs.AI

HTMuon: Improving Muon via Heavy-Tailed Spectral Correction

HTMuon:通过重尾谱校正改进Muon

Tianyu Pang, Yujie Fang, Zihang Liu, Shenyang Deng, Lei Hsiung, Shuhua Yu, Yaoqing Yang

机构 * Dartmouth College(达特茅斯学院) Microsoft(微软) International Computer Science Institute(国际计算机科学研究所) University of California, Berkeley(加州大学伯克利分校) Meta

AI总结 针对Muon优化器正交化更新规则抑制重尾权重谱并过度强调噪声方向训练的问题,提出HTMuon方法,通过重尾自正则化理论产生更重尾的更新和权重谱,在LLM预训练和图像分类中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏