arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

共收录 272
2512.06343 2026-06-10 cs.LG cs.AI cs.CL 版本更新

When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models

当距离干扰:BT损失中表示距离偏差对奖励模型的影响

Tong Xie, Andrew Bai, Yuanhao Ban, Yunqi Hong, Haoyu Li, Cho-Jui Hsieh

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 分析BT损失中表示距离导致的梯度偏差,提出NormBT自适应归一化方案,提升奖励模型在细粒度区分上的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08379 2026-06-10 cs.LG cs.AI cs.CV 版本更新

MMD Guidance: Training-Free Distribution Adaptation for Diffusion Models via Maximum Mean Discrepancy Guidance

MMD Guidance: 基于最大均值差异引导的无训练分布适应扩散模型

Matina Mahdizadeh Sani, Nima Jamali, Mohammad Jalali, Farzan Farnia

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出MMD Guidance,一种无训练方法,通过最大均值差异梯度引导扩散模型采样,实现与参考数据分布对齐,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09801 2026-06-10 cs.AI 版本更新

How can we assess human-agent interactions? Case studies in software agent design

如何评估人机交互?软件代理设计案例研究

Valerie Chen, Rohit Malhotra, Xingyao Wang, Juan Michelini, Xuhui Zhou, Aditya Bharat Soni, Hoang H. Tran, Calvin Smith, Ameet Talwalkar, Graham Neubig

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出PULSE框架,通过用户反馈和模型预测结合评估人机交互,在15k用户实验中验证其能减少40%置信区间,并揭示基准测试与真实结果的差异。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25760 2026-06-10 cs.CL cs.AI cs.LG 版本更新

TruthRL: Incentivizing Truthful LLMs via Reinforcement Learning

TruthRL: 通过强化学习激励诚实的LLM

Zhepei Wei, Xiao Yang, Kai Sun, Jiaqi Wang, Rulin Shao, Jingxiang Chen, Mohammad Kachuee, Teja Gollapudi, Yiwei Liao, Nicolas Scheffer, Rakesh Wanga, Anuj Kumar, Yu Meng, Wen-tau Yih, Xin Luna Dong

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出TruthRL框架,使用GRPO和三值奖励直接优化LLM的诚实性,减少幻觉并允许不确定时弃权,在知识密集型基准上显著提升诚实性。

Comments ICML 2026. Code: https://github.com/facebookresearch/TruthRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14608 2026-06-10 cs.CL cs.AI cs.LG 版本更新

Attacks on Machine-Text Detectors Retain Stylistic Fingerprints

对机器文本检测器的攻击保留风格指纹

Rafael Rivera Soto, Barry Chen, Nicholas Andrews

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 研究机器文本检测器对抗攻击的局限性,提出一种同时优化不可检测性和特定人类风格的 paraphrasing 方法,发现单文档检测不可靠,需多文档分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17251 2026-06-10 stat.ML cs.LG 版本更新

Risk Comparisons in Linear Regression: Implicit Regularization Dominates Explicit Regularization

线性回归中的风险比较:隐式正则化主导显式正则化

Jingfeng Wu, Peter L. Bartlett, Sham M. Kakade, Jason D. Lee, Bin Yu

机构 * University of California, Berkeley(加州大学伯克利分校) Alphabetical order Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind)

AI总结 本文通过实例比较线性回归中梯度下降、岭回归和随机梯度下降的有限样本风险,发现梯度下降优于岭回归,但与随机梯度下降不可比,且在某些问题中梯度下降可能更差。

Comments Accepted for presentation at the Conference on Learning Theory (COLT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16518 2026-06-10 cs.CV cs.AR 版本更新

FG-Attn: Leveraging Fine-Grained Sparse Attention in Video Diffusion Models

FG-Attn:在视频扩散模型中利用细粒度稀疏注意力

Sankeerth Durvasula, Kavya Sreedhar, Zain Moustafa, Suraj Kothawade, Tianlei Pang, Ashish Gondimalla, Suvinay Subramanian, Narges Shahidi, Nandita Vijaykumar

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 针对视频扩散模型中注意力层计算开销大的问题,提出FG-Attn,一种低开销的细粒度稀疏注意力机制,在MxN块粒度上跳过分数计算,实现最高2.45倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13446 2026-06-10 cs.RO 版本更新

CAST: Counterfactual Labels Improve Instruction Following in Vision-Language-Action Models

CAST: 反事实标签提升视觉-语言-动作模型中的指令跟随能力

Catherine Glossop, William Chen, Arjun Bhorkar, Dhruv Shah, Sergey Levine

机构 * University of California Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学)

AI总结 针对VLA模型难以遵循细粒度指令的问题,提出利用视觉语言模型生成反事实标签增强数据集,提升语言基础多样性,实验表明该方法在导航和操作任务中显著提升指令跟随成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17080 2026-06-10 cs.RO cs.SY eess.SY 版本更新

Geometric Formulation of Unified Force-Impedance Control on SE(3) for Robotic Manipulators

基于SE(3)的机器人统一力-阻抗控制的几何公式化

Joohwan Seo, Nikhil Potu Surya Prakash, Soomi Lee, Arvind Kruthiventy, Megan Teng, Jongeun Choi, Roberto Horowitz

机构 * University of California, Berkeley, USA(加州大学伯克利分校)

AI总结 提出一种在SE(3)流形上的阻抗控制框架,通过能量罐增强实现力跟踪与无源性,并解决非因果实现问题,继承SE(3)不变性以提高学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08134 2026-06-10 cs.AI cs.CY 版本更新

Position: The ML Community Must Build an AI-Augmented Peer-Review Ecosystem

立场:机器学习社区必须构建AI增强的同行评审生态系统

Qiyao Wei, Samuel Holt, Jing Yang, Markus Wulfmeier, Mihaela van der Schaar

机构 * University of Amsterdam(阿姆斯特丹大学) University of Cambridge(剑桥大学) ETH Zurich(苏黎世联邦理工学院) University of California, Berkeley(加州大学伯克利分校)

AI总结 针对ML领域稿件激增导致同行评审危机,本文主张将AI辅助评审作为优先研究课题,提出利用大语言模型作为协作工具,增强事实核查、评审指导、作者改进和决策支持,并强调需要更细粒度的评审数据。

Comments 18 pages, 3 figures. Accepted (Oral) at the ICML 2026 Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08726 2026-06-10 cs.CL 版本更新

Standard Language Ideology in AI-Generated Language

AI生成语言中的标准语言意识形态

Genevieve Smith, Eve Fleisig, Ishita Rustagi, Xavier Yin

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出一个分类法,揭示大型语言模型如何强化标准语言意识形态,导致语言变体的边缘化,并讨论其社会影响及应对建议。

Comments To appear in the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03226 2026-06-09 cs.LG cs.AI cs.CR 版本更新

Self-Mined Hardness for Safety Fine-Tuning

自我挖掘的难度用于安全微调

Prakhar Gupta, Garv Shah, Donghua Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出通过模型自身生成结果评估提示难度,对最难的提示进行安全微调,在Llama-3模型上将攻击成功率降至1-3%,但增加了拒绝率,通过混合良性提示可平衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07047 2026-06-09 cs.AI 版本更新

Front-to-Attractors: Modifying the Front-to-Front Heuristic in Bidirectional Search

Front-to-Attractors:修改双向搜索中的Front-to-Front启发式

Alvin Zou, Muhammad Suhail Saleem, Maxim Likhachev

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出Front-to-Attractors (F2A)启发式类,通过动态维护吸引子集替代完整前沿,在保持Front-to-Front信息性的同时大幅降低计算开销,实验显示相比F2F减少最多11.2倍成对评估,平均节点扩展比F2E少4.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05797 2026-06-09 cs.LG stat.ML 版本更新

Causal Longitudinal Prior-Fitted Networks for Counterfactual Outcome Prediction

因果纵向先验拟合网络用于反事实结果预测

Amirhossein Zare, Amirhessam Zare, Herlock Rahimi, Reza Salarikia, Mohammad Kashkooli

机构 * Yale University(耶鲁大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出CausalLongPFN,一种基于先验拟合的上下文预测器,通过合成因果模型预训练实现无需梯度更新的纵向反事实结果预测,在多个基准上达到与领域训练模型竞争的性能。

Comments 31 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05363 2026-06-09 cs.GT cs.LG econ.TH math.OC 版本更新

Should Demand Models Incorporate Competitor Prices? Oblivious Learning and Algorithmic Collusion

需求模型是否应包含竞争对手价格?无知学习与算法合谋

Yuhang Wu, Assaf Zeevi

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

AI总结 研究在竞争市场中,定价算法是否应显式建模竞争对手价格,通过对比无知与知情学习策略,发现知情策略是纳什均衡且价格收敛至竞争结果,而合谋模式不稳健。

Comments Preliminary version "Oblivious Learning, Price Exploration and Collusive Dynamics" accepted at EC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04029 2026-06-09 cs.LG cs.AI 版本更新

Position: Deployed Reinforcement Learning should be Continual

立场:部署的强化学习应该是持续的

Parnian Behdin, Kevin Roice, Golnaz Mesbahi

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文主张部署的强化学习系统应持续学习,分析了部署后非平稳性的四个来源,并展示了持续RL的优势和实现方法。

Comments Accepted to the ICML 2026 Position Paper Track. See https://icml.cc/virtual/2026/poster/67195

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01619 2026-06-09 cs.AI cs.LG stat.ML 版本更新

ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL

ReSkill:在智能体强化学习中协调技能创建与策略优化

Zelin He, Haotian Lin, Boran Han, Wei Zhu, Haoyang Fang, Bernie Wang, Xuan Zhu, Runze Li, Matthew Reimherr

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出ReSkill框架,通过GRPO的组结构嵌入断言驱动技能创建、组内轨迹采样和自适应汤普森采样,实现技能与策略的协同进化,在多个领域超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01546 2026-06-09 cs.LG 版本更新

Flexible Online Representation Learning Based on Similarity Matching

基于相似性匹配的灵活在线表示学习

Shagesh Sridharan, Yanis Bahroun, Anirvan M. Sengupta

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出一种基于相似性匹配的在线生物合理学习算法,能够学习稀疏移位不变表示,适用于聚类、流形平铺或稀疏编码。

Comments 6 pages, 3 figures. Originally accepted to IJCNN 2023 but not presented owing to visa issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01379 2026-06-09 cs.LG 版本更新

Turning Back Without Forgetting: Selective Backward Refinement for Parameter-Efficient Continual Learning

在不遗忘的情况下回溯:面向参数高效持续学习的选择性反向精炼

Anushka Tiwari, Kaiyi Ji

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出SABER框架,通过基于提示梯度几何和损失分布相似性的任务相关性准则,在提示型参数高效持续学习中实现受控的正向反向知识迁移,无需重放。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26452 2026-06-09 cs.RO cs.LG cs.SY eess.SY 版本更新

Robust Koopman Control Barrier Filters for Safe Actor-Critic Reinforcement Learning

鲁棒Koopman控制屏障滤波器用于安全演员-评论家强化学习

Dhruv S. Kushwaha, Zoleikha A. Biron

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出鲁棒Koopman-CBF SAC框架,通过数据驱动学习Koopman预测器、构建提升空间中的仿射CBF约束并利用二次规划安全层实施,同时通过投影残差裕度处理近似误差,实现零约束违反或减少违规。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22863 2026-06-09 cs.LG 版本更新

Latent Cache Flow: Model-to-Model Communication Without Text

潜在缓存流:无需文本的模型间通信

Maximillian Rossi, Prajwal Raghunath, Eugene Wu

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出潜在缓存流(LCF)方法,通过联合翻译和压缩键值缓存实现高效模型间通信,在上下文不同场景下比基于文本的通信准确率提高23%、速度提升8.5倍。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14285 2026-06-09 eess.IV cs.LG 版本更新

ForcingDAS: Unified and Robust Data Assimilation via Diffusion Forcing

通过扩散强迫实现统一且稳健的数据同化:ForcingDAS

Yixuan Jia, Siyi Chen, Yida Pan, Xiao Li, Lianghe Shi, Chanyong Jung, Haijie Yuan, Ismail Alkhouri, Yue Cynthia Wu, Saiprasad Ravishankar, Jeffrey A Fessler, Qing Qu

机构 * University of Michigan(密歇根大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Massachusetts Institute of Technology(麻省理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出ForcingDAS,一种基于扩散强迫的统一数据同化框架,能够捕捉长时序依赖并减少误差积累,同时在推理时无需重新训练即可实现滤波到平滑的全谱应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23286 2026-06-09 cs.CV cs.AI cs.LG 版本更新

VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation

VideoGPA: 通过几何先验知识蒸馏实现3D一致的视频生成

Hongyang Du, Junjie Ye, Xiaoyan Cong, Runhao Li, Jingcheng Ni, Aman Agarwal, Zeqi Zhou, Zekun Li, Randall Balestriero, Yue Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 VideoGPA通过几何先验知识蒸馏提升视频生成的3D一致性,利用数据高效的自监督框架引导视频扩散模型,显著增强时间稳定性、几何合理性与运动一致性。

Comments 8 pages, 5 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00273 2026-06-09 cs.CV cs.AI 版本更新

When Do Diffusion Models learn to Generate Multiple Objects?

扩散模型何时学会生成多个物体?

Yujin Jeong, Arnas Uselis, Iro Laina, Seong Joon Oh, Anna Rohrbach

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

AI总结 研究探讨了扩散模型在多物体生成中的局限性,发现场景复杂度比概念不平衡更关键,且低数据条件下计数任务更难学习。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24474 2026-06-09 cs.LG 版本更新

Advancing Ligand-based Virtual Screening and Molecular Generation with Pretrained Molecular Embedding Distance

通过预训练分子嵌入距离推进基于配体的虚拟筛选和分子生成

Shiyun Wa, Yifei Wang, Simone Sciabola, Ye Wang

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 本文提出预训练嵌入距离作为高效替代方案,用于虚拟筛选和分子生成,展示其在结构信息捕捉和相似性测量方面的有效性。

Comments Accepted by ICML 2026 AI4Science (https://openreview.net/forum?id=HbfrCipfNl). Code and data are available

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18388 2026-06-09 cs.AI cs.MA 版本更新

Reflection in the Dark: Exposing and Escaping the Black Box in Reflective Prompt Optimization

暗箱中的反射:在反射提示优化中揭示并逃离黑箱

Shiyan Liu, Qifeng Xia, Qiyun Xia, Yisheng Liu, Xinyu Yu, Rui Qu

机构 * University of California, Berkeley(加州大学伯克利分校) Huazhong University of Science and Technology(华中科技大学) Hefei University of Technology(合肥工业大学)

AI总结 本文提出VISTA框架,通过解耦假设生成与提示重写,实现可解释的提示优化,有效解决GEPA在缺陷种子下的性能下降问题。

Comments Accepted at ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10823 2026-06-09 stat.ML cs.LG 版本更新

ReTabSyn: Realistic Tabular Data Synthesis via Reinforcement Learning

ReTabSyn:通过强化学习实现真实表格数据合成

Xiaofeng Lin, Seungbae Kim, Zhuoya Li, Zachary DeSoto, Charles Fleming, Guang Cheng

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 ReTabSyn通过强化学习优先学习条件分布,提升小数据下表格数据合成效率,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21149 2026-06-09 cs.LG cs.AI 版本更新

Mobility-Embedded POIs: Learning What A Place Is and How It Is Used from Human Movement

移动性嵌入的POI:从人类移动中学习场所身份与使用方式

Maria Despoina Siampou, Shushman Choudhury, Shang-Ling Hsu, Neha Arora, Cyrus Shahabi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 提出ME-POIs框架,通过对比学习将大规模人类移动数据与语言模型嵌入结合,学习场所功能,并在五个地图丰富任务上超越文本或移动性单独基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04177 2026-06-09 cs.SE cs.AI cs.LG 版本更新

CodeTaste: Can LLMs Generate Human-Level Code Refactorings?

CodeTaste:LLM能否生成人类级别的代码重构?

Alex Thillen, Niels Mündler, Veselin Raychev, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

AI总结 研究LLM代理在代码重构中的能力,通过CodeTaste基准测试发现,代理在详细指定重构时表现良好,但难以自主发现人类选择的重构,提出“先提议后实现”分解可改善对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21172 2026-06-09 cs.AI cs.CV 版本更新

NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning

NoRD: 一种无需推理的高数据效率视觉-语言-动作模型

Ishaan Rawal, Shubh Gupta, Yihan Hu, Wei Zhan

机构 * Applied Intuition Texas A&M University(德克萨斯大学A&M分校) UC Berkeley(伯克利加州大学)

AI总结 提出NoRD模型,通过无需推理标注和仅需<60%数据微调,结合Dr. GRPO算法克服难度偏差,实现与现有VLA模型相当的性能,显著降低数据与计算开销。

Comments Accepted to CVPR 2026. Code available at: https://github.com/Applied-Open-Source/nord

详情

展开后加载摘要…

URL PDF HTML 收藏