arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-06-03 至 2026-06-03 共收录 41
2603.03480 2026-06-03 cs.LG stat.ML

Minimax Optimal Strategy for Delayed Observations in Online Reinforcement Learning

在线强化学习中延迟观测的极小化最优策略

Harin Lee, Kevin Jamieson

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

AI总结 针对延迟状态观测的强化学习问题,提出结合增广方法和上置信界算法的策略,在表格型MDP上达到极小化最优遗憾界。

Comments ICML camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16666 2026-06-03 cs.AI cs.CY cs.LG

Towards a Science of AI Agent Reliability

迈向AI代理可靠性的科学

Stephan Rabanser, Sayash Kapoor, Peter Kirgis, Kangheng Liu, Saiteja Utpala, Arvind Narayanan

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出十二个具体指标,从一致性、鲁棒性、可预测性和安全性四个维度分解AI代理的可靠性,并通过实验揭示能力提升仅带来可靠性小幅改进。

Comments Accepted at ICML 2026. Interactive dashboard available at: https://hal.cs.princeton.edu/reliability

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05302 2026-06-03 cs.AI

PieArena: Ranking and Profiling Language Agents in Realistic Negotiation Scenarios

PieArena:在真实谈判场景中对语言智能体进行排名与画像

Chris Zhu, Sasha Cui, Will Sanok Dufallo, Runzhi Jin, Zhen Xu, Linjun Zhang, Daylian Cain

机构 * Yale University(耶鲁大学) UC Berkeley(加州大学伯克利分校) BloomBerg(摩根大通) Rutgers University(罗格斯大学)

AI总结 本文提出PieArena基准,通过多智能体交互评估LLM的谈判能力,并开发排名模型与行为画像,发现联合意图框架对中低端模型提升显著,前沿模型(如GPT-5)在谈判中达到或超过人类基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01483 2026-06-03 cs.LG cs.AI stat.ME

Causal Preference Elicitation

因果偏好启发

Edwin V. Bonilla, He Zhao, Daniel M. Steinberg

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出一种贝叶斯框架,通过主动查询局部边关系来集中有向无环图的后验分布,实现专家参与的因果发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23169 2026-06-03 cs.LG cs.LO cs.SC

Names Don't Matter: Symbol-Invariant Transformer for Open-Vocabulary Learning

名称无关:面向开放词汇学习的符号不变Transformer

İlker Işık, Wenchao Li

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出一种符号不变Transformer机制,通过并行嵌入流和聚合注意力实现可互换令牌的重命名不变性,在开放词汇任务上取得显著性能提升。

Comments ICML 2026 Poster (Camera-Ready Version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22443 2026-06-03 cs.LG cs.CV stat.CO stat.ML

Weak Diffusion Priors Can Still Achieve Strong Inverse-Problem Performance

弱扩散先验仍能实现强逆问题性能

Jing Jia, Wei Yuan, Sifan Liu, Liyue Shen, Guanyang Wang

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 研究弱扩散先验在逆问题中的鲁棒性,通过贝叶斯一致性和局部相关性分析揭示其在信息丰富测量下仍有效的原因。

Comments 37 pages, ICML 2026 spotlight. Code: https://github.com/jjia131/weak-diffusion-priors-inverse-problem, Project Page: https://jjia131.github.io/weak-diffusion-priors-inverse-problem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20844 2026-06-03 cs.LG cs.AI cs.IR

$\mathbb{R}^{2k}$ is Theoretically Large Enough for Embedding-based Top-$k$ Retrieval

$\mathbb{R}^{2k}$ 理论上足够大,用于基于嵌入的 Top-$k$ 检索

Zihao Wang, Hang Yin, Lihui Liu, Hanghang Tong, Yangqiu Song, Ginny Wong, Simon See

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 研究最小可嵌入维度(MED),证明对于内积、欧氏距离和余弦相似度,MED 为 Θ(k),与 m 无关;进一步考虑鲁棒 MED(RMED),推导出可行性上限 ε_⋆(m,k),并通过实验验证理论结果。

Comments v2: fix broken citation. v3: ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12247 2026-06-03 cs.CL cs.AI cs.LG

Plan, Verify and Fill: A Structured Parallel Decoding Approach for Diffusion Language Models

规划、验证与填充:扩散语言模型的结构化并行解码方法

Miao Li, Hanyang Jiang, Sikai Cheng, Hengyu Fu, Yuhang Cai, Baihe Huang, Tinghan Ye, Xuanzhou Chen, Pascal Van Hentenryck

机构 * Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

AI总结 提出Plan-Verify-Fill (PVF)方法,通过定量验证进行分层骨架规划,并采用验证协议实现结构化停止,在保持准确性的同时将函数评估次数减少高达65%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03019 2026-06-03 cs.LG cs.AI

Distribution-Calibrated Inference Time Compute for Thinking LLM-as-a-Judge

分布校准的推理时间计算用于思考型LLM作为评判者

Hamid Dadkhahi, Firas Trabelsi, Parker Riley, Juraj Juraska, Mehdi Mirzazadeh

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深Mind) University of Cambridge(剑桥大学)

AI总结 针对思考型大语言模型作为评判者时单样本噪声和聚合不一致问题,提出基于Bradley-Terry-Davidson模型的分布校准聚合方案,利用极性(非平局边际)和决定性(非平局率)区分微弱多数与强共识,显著降低MAE并提高成对准确率,匹配或超越人类评判者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23216 2026-06-03 cs.AI cs.LG

Human-Like Goalkeeping in a Realistic Football Simulation: a Sample-Efficient Reinforcement Learning Approach

逼真足球模拟中的人性化守门:一种样本高效的强化学习方法

Alessandro Sestini, Joakim Bergdahl, Jean-Philippe Barrette-LaPierre, Florian Fuchs, Brady Chen, Fabio Zinno, Michael Jones, Linus Gisslén

机构 * University of Edinburgh(爱丁堡大学) KTH Royal Institute of Technology(皇家理工学院) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出一种样本高效的深度强化学习方法,通过利用预收集数据和增加网络可塑性,在EA SPORTS FC 25中训练出守门员智能体,其扑救率比内置AI高10%,训练速度比标准DRL快50%,且行为更接近人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02260 2026-06-03 cs.LG cs.CR

Position: Adversarial ML for LLMs Is Not Making Any Progress

立场:针对LLM的对抗性机器学习并未取得任何进展

Javier Rando, Jie Zhang, Nicholas Carlini, Florian Tramèr

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文认为,在大语言模型时代,对抗性机器学习研究的问题定义更模糊、更难解决且更难以评估,可能导致未来十年仍无法取得有意义进展。

Comments Accepted at ICML 2026 Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏