arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-06-23 至 2026-06-23 共收录 28
2606.23680 2026-06-23 cs.RO cs.AI cs.LG 新提交

CoorDex: Coordinating Body and Hand Priors for Continuous Dexterous Humanoid Loco-Manipulation

CoorDex: 协调身体与手部先验以实现连续灵巧类人运动操作

Sikai Li, Shuning Li, Zhenyu Wei, Yunchao Yao, Chenran Li, Mingyu Ding

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Berkeley(加利福尼亚大学伯克利分校)

AI总结 提出CoorDex学习框架,通过将高维身体和灵巧手控制转化为协调的潜在残差控制,实现类人机器人在运动中执行灵巧操作,如不停顿抓取瓶子、移动中开冰箱门等。

Comments Project page: https://skevinci.github.io/coordex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23640 2026-06-23 cs.LG cs.AI cs.RO stat.ML 新提交

Learning Process Rewards via Success Visitation Matching for Efficient RL

通过成功访问匹配学习过程奖励以实现高效强化学习

Raymond Tsao, Andrew Wagenmaker, Sergey Levine

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 针对稀疏奖励导致的信用分配难题,提出通过判别器区分成功/失败轨迹,生成密集过程奖励以匹配成功访问分布,在不改变最优策略下加速机器人控制策略微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22938 2026-06-23 cs.LG cs.AI 新提交

Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently

RLVR 相对于 SFT 在推理模型中的可证明优势:学习高效回溯

Stanley Wei, Juno Kim

机构 * Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文从理论上证明,在推理任务中,基于可验证奖励的强化学习(RLVR)相比监督微调(SFT)能学习高效回溯,从而在推理时计算上实现指数级优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22708 2026-06-23 cs.SD cs.AI 新提交

Libretto: Giving LLM Agents a Sense of Musical Structure

Libretto:赋予LLM智能体音乐结构感

Yichen Xu

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Libretto框架,通过LLM原生语法(显式起始槽、声部、小节组织)和基于语料库的统计评估(节奏、和声、旋律等),实现符号音乐的生成、诊断与迭代自修正,将符号音乐转化为可测量、可编辑的对象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22278 2026-06-23 cs.RO cs.LG cs.SY eess.SY 新提交

Any-Body Guard: Universal Safeguarding for Manipulation Policies via Action Masking

Any-Body Guard: 通过动作掩蔽实现操作策略的通用安全保障

Alex Beaudin, Hanna Krasowski, Kartik Nagpal, Sanjit A. Seshia, Murat Arcak, Negar Mehr

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出X-Safe方法,在机器人配置空间中直接推理,提供碰撞避免的形式化概率保证,无需额外数据或工程适配即可跨实体迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22263 2026-06-23 cs.CR cs.AI cs.MA cs.SE 新提交

Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases

Revelio: 面向仓库级代码库的高性价比智能体内存安全漏洞检测

Yiwei Hou, Hao Wang, Muxi Lyu, Marius Momeu, Eric Nguyen, Taige Yang, Koushik Sen, Dawn Song, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Revelio框架,通过生成可执行漏洞证明并用确定性消毒器验证,结合低成本LLM和轻量静态分析,在仓库级代码库中高效发现内存安全漏洞,7个项目中19个新漏洞,成本约300美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21830 2026-06-23 cs.LG 新提交

Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials

Mat-Pref: 可验证奖励训练提升无机材料中的组合推理能力

Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

机构 * University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

AI总结 提出Mat-Pref基准,通过可验证奖励强化学习(GRPO)提升无机材料组合推理,在结构泛化和属性迁移上超越大模型。

Comments 10 pages, 4 figures, Accepted at ICML AI4Physics 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21654 2026-06-23 cs.AI cs.CL 新提交

ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks

ChainWorld: 从原子OSWorld任务组合成长时桌面工作负载

Vincent Siu, Manasi Sharma, Dawn Song, Daniel Yue Zhang, Chenguang Wang

机构 * Scale AI University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克鲁兹分校)

AI总结 提出ChainWorld,通过方向兼容性搜索将原子OSWorld任务组合成长时桌面工作负载,包含347条长度为2-4的任务链,评估四种智能体,最高完成率31%,揭示单轮与多轮评估的不同失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21148 2026-06-23 cs.RO 新提交

Pose-Agnostic Robotic Functional Grasping via Observation-Action Canonicalization

通过观测-动作规范化实现姿态无关的机器人功能性抓取

Le Qiu, Cole Harrison, Jiankai Sun, Yao Liu, Suning Huang, Qianzhong Chen, Yang You, Marco Pavone

机构 * Tsinghua University(清华大学) Amazon(亚马逊) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出AnyMug框架,通过观测-动作规范化将深度观测和末端执行器动作转换到物体中心坐标系,训练单一闭环策略实现零样本迁移的功能性抓取,在模拟和真实机器人上均取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21023 2026-06-23 cs.LG 新提交

Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL

揭秘LLM推理中的数值不稳定性:使用HEAL实现关键任务的可复现推理

Zhenting Zhu, Lucas Thai, Shan Yu, Yicheng Liu, Yifan Qiao, Chenxi Wang, Harry Xu, Junyi Shu

机构 * UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 针对LLM在关键任务中因16位精度导致输出不一致的问题,提出HEAL方法,通过INT16量化和代数误差补偿,在保持FP32精度的同时减少性能开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20881 2026-06-23 cs.AI 新提交

When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study

内在奖励何时对代码推理有效?一项全面研究

Xiaolong Jin, Xuandong Zhao, Wenbo Guo, Xiangyu Zhang, Dawn Song

机构 * Purdue University(普渡大学) UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣塔芭芭拉分校)

AI总结 通过系统实验,发现基于确定性的内在奖励方法在代码生成中早期有效但最终导致模型崩溃,且作为RLVR预训练无显著优势,并给出实用建议。

Comments 18 pages, 45 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23257 2026-06-23 cs.LG cs.AI math.OC 新提交

Dynamic multi-agent deep reinforcement learning-based pricing and incentivization approach in multimodal transportation networks

基于动态多智能体深度强化学习的多模式交通网络定价与激励方法

Khadidja Kadem, Mostafa Ameli, Carlos Lima Azevedo, Mahdi Zargayouna, Latifa Oukhellou

机构 * University of California, Berkeley(加州大学伯克利分校) Technical University of Denmark(丹麦技术大学)

AI总结 提出多智能体深度强化学习框架,通过动态定价和激励策略协调公共交通与共享出行服务,平衡效率、公平与收益,实验表明可降低通勤成本20%、排放10%并提升公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22922 2026-06-23 cs.LG cs.AI math.AC math.CO 新提交

Hierarchical Reinforcement Learning for Sparse-Reward Search in Commutative Algebra

用于交换代数中稀疏奖励搜索的分层强化学习

Giorgi Butbaia, Paul Orland, Coco Huang, Davide Passaro, Lucas Fagan, Michele Tarquini, Hailong Dao, David Eisenbud, Ali Shehper, Sergei Gukov

机构 * California Institute of Technology(加州理工学院) Temple University(天普大学) University of Kansas(堪萨斯大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 针对数学猜想验证中的奖励稀疏问题,提出基于约束选项的分层强化学习框架,结合等变图神经网络策略,在交换代数问题中首次应用HRL并优于经典RL和贪心搜索。

Comments 21 pages, 15 figures, 3 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23051 2026-06-23 physics.app-ph cond-mat.mtrl-sci cs.AI 新提交

Physics-governed executable modelling of triboelectric nanogenerators

物理驱动的摩擦纳米发电机可执行建模

Hongfa Zhao, Baiqiao Wang, Tiancong Zhao, Chun Jin, Hanlin Zhou, Mingrui Shu, Minyi Xu, Liwei Lin, Wenbo Ding, Zhong Lin Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beijing Institute of Technology(北京理工大学) Beijing Institute of Nanoenergy and Nanosystems, Chinese Academy of Sciences(中国科学院北京纳米能源与系统研究所) Marine Engineering College, Dalian Maritime University(大连海事大学航海工程学院) University of California at Berkeley(加州大学伯克利分校)

AI总结 提出电荷定义建模框架并实现TENG-CLAW平台,统一解析理论、有限几何求解器与仿真工作流,实现可追溯的摩擦纳米发电机仿真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17055 2026-06-23 cs.RO 新提交

T-Rex: Tactile-Reactive Dexterous Manipulation

T-Rex: 触觉反应灵巧操作

Dantong Niu, Zhuoyang Liu, Zekai Wang, Boning Shao, Zhao-Heng Yin, Anirudh Pai, Yuvan Sharma, Stefano Saravalle, Ruijie Zheng, Jing Wang, Ryan Punamiya, Mengda Xu, Yuqi Xie, Yunfan Jiang, Letian Fu, Konstantinos Kallidromitis, Matteo Gioia, Junyi Zhang, Jiaxin Ge, Haiwen Feng, Fabio Galasso, Wei Zhan, David M. Chan, Yutong Bai, Roei Herzig, Jiahui Lei, Li Fei-Fei, Ken Goldberg, Jitendra Malik, Pieter Abbeel, Yuke Zhu, Danfei Xu, Linxi Fan, Trevor Darrell

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达) Stanford(斯坦福大学) Panasonic(松下) La Sapienza University(罗马大学) ItalAI

AI总结 提出大规模触觉数据集和可变速率混合Transformer架构,在12项精细操作任务上平均成功率提升超30%。

Comments Project page: https://tactile-rex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14970 2026-06-23 cs.LG 新提交

Zero-order Parameter-free Optimization for LMO-based Methods: Novel Approach for Efficient Fine-tuning

基于LMO方法的零阶无参数优化:高效微调的新方法

Dmitriy Bystrov, Daniil Medyakov, Dmitry Bylinkin, Aleksandr Beznosikov

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 针对大模型微调中反向传播内存开销大、零阶优化对步长和平滑参数敏感的问题,提出统一无梯度训练、自适应调参和非欧几里得更新几何的AdaNAGED方法,并在OPT-1.3B模型上验证有效性。

Comments 29 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13102 2026-06-23 cs.RO 新提交

FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation

FTP-1:一种跨触觉传感器的通用基础触觉策略,用于密集接触操作

Chengbo Yuan, Zicheng Zhang, Mingjie Zhou, Wendi Chen, Yi Wang, Zhuoyang Liu, Dantong Niu, Shuo Wang, Hui Zhang, Wenkang Zhang, Yingdong Hu, Yuanqing Gong, Wanli Xing, Chuan Wen, Cewu Lu, Kaifeng Zhang, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Sharpa Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出FTP-1,首个通用基础触觉策略,通过异构编码器和共享Transformer专家,跨21种传感器和3000小时数据预训练,实现触觉操作技能的跨传感器迁移,在未见传感器上成功率提升31%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09178 2026-06-23 cs.CL cs.AI 新提交

Culturally-Adapted Red-Teaming Across East and Southeast Asian Contexts: A Methodological and Comparative Analysis

跨东亚和东南亚语境的文化适应红队测试:方法论与比较分析

Hyeji Choi, Yongtaek Lim, Minwoo Kim

机构 * University of California, Berkeley(加州大学伯克利分校) Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 针对大语言模型的多语言安全评估,通过构建直接翻译与文化适应数据集,发现文化适应提示的攻击成功率平均提升9.3个百分点,直接翻译低估风险,且文化深度评分显著低于文化适应版本,表明适应文化语境对有效评估至关重要。

Comments Accepted to ICML 2026 Workshop on Culture X AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04329 2026-06-23 cs.CR cs.AI 版本更新

From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents

从不可信输入到可信内存:LLM智能体中内存投毒攻击的系统研究

Pritam Dash, Tongyu Ge, Aditi Jain, Tanmay Shah, Zhiwei Shang

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文系统研究了基于LLM的智能体中的内存投毒攻击,识别了四种内存写入通道和九种结构漏洞,提出了六类攻击的分类法,并设计了评估基准MPBench,发现更积极读写内存的智能体更易被利用,且现有提示注入防御无法覆盖内存投毒攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02982 2026-06-23 cs.PF cs.DC cs.LG 版本更新

DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference

DriftSched: 多租户GPU推理中运行时令牌漂移下的自适应QoS感知调度

Kathiravan Palaniappan

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出DriftSched框架,通过运行时反馈驱动的漂移补偿和自适应偏差校正,解决多租户LLM推理中令牌漂移导致的调度问题,在NVIDIA L4 GPU上实现平均38.8%的估计误差降低和42%的中位延迟改善。

Comments 19 pages, 34 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11453 2026-06-23 cs.IR cs.AI cs.LG 版本更新

From Noise to Order: Learning to Rank via Denoising Diffusion

从噪声到有序:通过去噪扩散学习排序

Sajad Ebrahimi, Bhaskar Mitra, Negar Arabzadeh, Ye Yuan, Haolun Wu, Fattane Zarrinkalam, Ebrahim Bagheri

机构 * University of Guelph(圭尔夫大学) Independent Researcher(独立研究者) University of California, Berkeley(加州大学伯克利分校) McGill University(麦吉尔大学) University of Toronto(多伦多大学)

AI总结 提出基于去噪扩散的生成式排序模型DiffusionRank,通过建模特征向量与相关性标签的联合分布,在四个标准LTR数据集上优于传统判别式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19756 2026-06-23 cs.LG stat.ML 版本更新

Provable Learning of Random Hierarchy Models and Hierarchical Shallow-to-Deep Chaining

随机层次模型与层次化浅到深链的可证明学习

Yunwei Ren, Yatin Dandi, Florent Krzakala, Jason D. Lee

机构 * Princeton University(普林斯顿大学) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑分校) University of California, Berkeley(加州大学伯克利分校)

AI总结 针对深度网络能否高效利用层次结构的问题,证明在温和条件下深度卷积网络可高效学习随机层次模型,并提出逐层训练策略。

Comments COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02469 2026-06-23 cs.RO cs.AI cs.CL cs.CV 版本更新

SIMSplat: Language-Aligned 4D Gaussian Splatting for Driving Scenario Generation

SIMSplat: 面向驾驶场景生成的语言对齐4D高斯泼溅

Sung-Yeon Park, Adam Lee, Juanwu Lu, Can Cui, Luyang Jiang, Rohit Gupta, Kyungtae Han, Ahmadreza Moradipari, Ziran Wang

机构 * Purdue University(普渡大学) University of California, Berkeley(加州大学伯克利分校) Toyota InfoTech Labs(丰田信息科技实验室)

AI总结 提出SIMSplat,一种基于场景图的4D高斯泼溅框架,通过嵌入语言对齐特征实现自由文本查询、对象级编辑和多智能体仿真,在驾驶场景生成中显著提升定位精度和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23340 2026-06-23 cs.SI cs.DC cs.LG 版本更新

CrediBench: Building Web-Scale Network Datasets for Information Integrity

CrediBench: 构建用于信息完整性的网络规模数据集

Emma Kondrup, Sebastian Sabry, Hussein Abdallah, Zachary Yang, Jiaqi Xiong, Kellin Pelrine, James Zhou, Zhijin Guo, Michael M. Bronstein, Jean-François Godbout, Reihaneh Rabbany, Shenyang Huang

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Oxford(牛津大学) University of California, Berkeley(加州大学伯克利分校) AITHYRA Research Institute(AITHYRA研究院) Université de Montréal(蒙特利尔大学)

AI总结 针对现有数据集忽略网络拓扑、时序和文本内容等关键模态的问题,提出包含八个月网络图数据的CrediBench数据集,支持回归和分类任务,多模态模型显著提升性能。

Comments 16 pages,4 figures

Journal ref KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11482 2026-06-23 cs.AI 版本更新

Illuminating the Three Dogmas of Reinforcement Learning under Evolutionary Light

在进化之光下揭示强化学习的三个教条

Mani Hamidi, Terrence W. Deacon

机构 * Department of Computer Science, University of Tübingen(图宾根大学计算机科学系) Department of Anthropology, University of California, Berkeley(加州大学伯克利分校人类学系)

AI总结 本文从人工生命视角批判强化学习的三个核心假设,提出将学习视为适应而非优化,并利用开放新颖性搜索和热力学理论构建更生物真实的智能体模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18276 2026-06-23 cs.RO cs.AI 版本更新

GAPartManip: A Large-scale Part-centric Dataset for Material-Agnostic Articulated Object Manipulation

GAPartManip:面向材料无关铰接物体操作的大规模部件中心数据集

Wenbo Cui, Chengyang Zhao, Songlin Wei, Jiazhao Zhang, Haoran Geng, Yaran Chen, Haoran Li, He Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CFCS, School of Computer Science, Peking University(北京大学计算机科学系) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Galbot

AI总结 提出大规模部件中心数据集GAPartManip,结合照片级材质随机化和部件级交互姿态标注,通过模块化框架提升深度估计与交互姿态预测,在仿真和真实场景中实现鲁棒的铰接物体操作。

Comments Accepted by ICRA 2025. Project page: https://pku-epic.github.io/GAPartManip/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10178 2026-06-23 cs.LG cs.AI cs.IT math.IT 版本更新

From Markov to Laplace: How Mamba In-Context Learns Markov Chains

从马尔可夫到拉普拉斯:Mamba如何通过上下文学习马尔可夫链

Marco Bondaschi, Nived Rajaraman, Xiuying Wei, Kannan Ramchandran, Razvan Pascanu, Caglar Gulcehre, Michael Gastpar, Ashok Vardhan Makkuva

机构 * EPFL(苏黎世联邦理工学院) UC Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Télécom Paris(巴黎电信学院)

AI总结 本文研究Mamba在马尔可夫链上的上下文学习能力,发现单层Mamba能高效学习最优的拉普拉斯平滑估计器,并理论上揭示了卷积在其中的关键作用。

Comments Oral presentation at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13550 2026-06-23 cs.CL cs.AI 版本更新

Are LLMs Effective Negotiators? Systematic Evaluation of the Multifaceted Capabilities of LLMs in Negotiation Dialogues

LLMs 是有效的谈判者吗?LLMs 在谈判对话中多方面能力的系统评估

Deuksin Kwon, Emily Weiss, Tara Kulshrestha, Kushal Chawla, Gale M. Lucas, Jonathan Gratch

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校) Capital One

AI总结 系统评估大型语言模型在谈判中的多方面能力,发现 GPT-4 表现优异,但在主观评估和生成策略性响应方面存在挑战。

Comments Accepted to Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏