arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

共收录 1892
2601.07185 2026-01-13 cs.CR cs.AI

Defenses Against Prompt Attacks Learn Surface Heuristics

对抗提示攻击的防御学习表面启发式

Shawn Li, Chenxiao Yu, Zhiyu Ni, Hao Li, Charith Peris, Chaowei Xiao, Yue Zhao

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校) Washington University in St. Louis(圣路易斯华盛顿大学) Amazon(亚马逊公司) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文研究了对抗提示攻击防御中表面启发式的问题,发现现有方法易受表面模式影响,提出受控数据集和系统评估以揭示监督微调的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05558 2026-01-13 cs.CR cs.AI

AI Agent Smart Contract Exploit Generation

AI代理智能合约漏洞生成

Arthur Gervais, Liyi Zhou

机构 * University College London(伦敦大学学院) The University of Sydney(悉尼大学) Decentralized Intelligence AG(去中心化智能有限公司) UC Berkeley RDI(伯克利大学RDI)

AI总结 A1通过代理系统结合大语言模型,实现智能合约漏洞的高效生成与验证,成功率达63%,并揭示了攻击与防御在经济上的不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06400 2026-01-13 cs.CL

MITRA: A Large-Scale Parallel Corpus and Multilingual Pretrained Language Model for Machine Translation and Semantic Retrieval for Pāli, Sanskrit, Buddhist Chinese, and Tibetan

MITRA:一种大规模并行语料库和多语言预训练语言模型,用于机器翻译和语义检索(巴利语、梵语、佛教汉语和藏语)

Sebastian Nehrdich, Kurt Keutzer

机构 * Center for Integrated Japanese Studies, Tohoku University(东京东京大学综合日语研究机构) University of California, Berkeley(加州大学伯克利分校) Berkeley Artificial Intelligence Research (BAIR)(伯克利人工智能研究(BAIR))

AI总结 MITRA框架通过大规模并行语料库和预训练模型,实现了对梵语、巴利语、佛教汉语和藏语的机器翻译和语义检索,达到英语翻译的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06100 2026-01-13 cs.LG cs.CL cs.IT math.IT

Filtering Beats Fine Tuning: A Bayesian Kalman View of In Context Learning in LLMs

过滤胜过微调:一种贝叶斯卡尔曼视角下的大语言模型上下文学习

Andrew Kiruluta

机构 * UC Berkeley School of Information(伯克利大学信息学院)

AI总结 本文提出了一种基于贝叶斯卡尔曼滤波的理论框架,将大语言模型的上下文学习解释为在线状态估计,揭示了推理时学习的协方差塌陷机制,并提供了稳定性及样本效率的理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07785 2026-01-13 stat.ML cs.LG

The Interpolating Information Criterion for Overparameterized Models

插值信息准则用于过参数化模型

Liam Hodgkinson, Chris van der Heide, Robert Salomone, Fred Roosta, Michael W. Mahoney

机构 * School of Mathematics and Statistics, University of Melbourne(墨尔本大学数学与统计学学院) Department of Electrical and Electronic Engineering, University of Melbourne(墨尔本大学电子与电气工程系) CIRES and School of Mathematics and Physics, University of Queensland(昆士兰大学海洋研究所和数学与物理学院) ICSI, LBNL, and Department of Statistics, University of California, Berkeley(伯克利大学统计学系、伯克利国家安全研究所和劳伦斯伯克利国家实验室)

AI总结 本文提出插值信息准则,用于过参数化模型的选择,通过建立贝叶斯对偶性,结合先验信息和模型性质,提升模型选择的准确性。

Comments 23 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11741 2026-01-12 cs.AI cs.CL cs.LG

Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT?

攀登推理的阶梯:在SFT之后,大语言模型能解决什么问题?

Yiyou Sun, Georgia Zhou, Haoyue Bai, Hao Wang, Dacheng Li, Nouha Dziri, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of Wisconsin, Madison(威斯康星大学麦迪逊分校) Allen Institute for AI(人工智能研究院)

AI总结 本文通过分析AIME24数据集,揭示了大语言模型在数学推理任务中不同难度层级的进阶要求,发现SFT对提升推理能力有限,而扩大数据规模更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05666 2026-01-12 cs.HC cs.AI cs.CY

Advancing credit mobility through stakeholder-informed AI design and adoption

通过利益相关者导向的AI设计与采用推进信用流动性

Yerin Kwak, Siddharth Adelkar, Zachary A. Pardos

机构 * Berkeley School of Education, University of California, Berkeley, CA(伯克利教育学院,加州大学伯克利分校)

AI总结 本研究通过与纽约州立大学系统合作,利用AI提出课程衔接建议,提升学生学分流动性,减少人工审查成本,提高衔接效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05420 2026-01-12 cs.LG stat.AP stat.ME

Efficient Inference for Noisy LLM-as-a-Judge Evaluation

高效噪声LLM-as-a-Judge评估

Yiqun T Chen, Sizhu Lu, Sijia Li, Moran Guo, Shengyi Li

机构 * Departments of Biostatistics and Computer Science, Johns Hopkins University(生物统计学与计算机科学系,约翰霍普金斯大学) Department of Statistics, University of California, Berkeley(统计学系,加州大学伯克利分校) Department of Biostatistics, University of California, Los Angeles(生物统计学系,加州大学洛杉矶分校) Department of Biostatistics, Johns Hopkins University(生物统计学系,约翰霍普金斯大学)

AI总结 本文提出了一种高效方法,通过半参数效率理论统一了测量误差校正和预测驱动推断,以提高LLM-as-a-judge评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05254 2026-01-12 cs.CV cs.AI cs.LG

Explaining Low Perception Model Competency with High-Competency Counterfactuals

用高能力反事实解释低感知模型能力

Sara Pohland, Claire Tomlin

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出五种生成高能力反事实图像的方法,用于解释模型预测不确定性的原因,并通过实验验证了其在生成语言解释中的有效性。

Journal ref Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2580

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16715 2026-01-12 cs.CV cs.LG stat.ML

PaRCE: Probabilistic and Reconstruction-based Competency Estimation for CNN-based Image Classification

PaRCE:基于概率和重建的卷积神经网络图像分类中的能力估计

Sara Pohland, Claire Tomlin

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 PaRCE通过概率和重建方法提升CNN图像分类中的信心估计,有效区分正常、误分类和异常样本,提供可解释的置信度评分。

Comments arXiv admin note: text overlap with arXiv:2409.06111

Journal ref Artificial Neural Networks and Machine Learning - ICANN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06111 2026-01-12 cs.RO cs.AI cs.CV cs.SY eess.SY

Competency-Aware Planning for Probabilistically Safe Navigation Under Perception Uncertainty

具有能力感知的规划用于在感知不确定性下的概率安全导航

Sara Pohland, Claire Tomlin

机构 * Department of EECS, UC Berkeley(电子工程与计算机科学系,伯克利大学)

AI总结 本文提出PaRCE方法,通过估计模型对输入图像的整体和局部熟悉度,提升在感知不确定性下的导航安全性与效率。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04516 2026-01-09 cs.CL

LinguaGame: A Linguistically Grounded Game-Theoretic Paradigm for Multi-Agent Dialogue Generation

LinguaGame: 一种基于语言的多智能体对话生成博弈论范式

Yuxiao Ye, Yiming Zhang, Yiran Ma, Huiyuan Xie, Huining Zhu, Zhiyuan Liu

机构 * Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学) East China University of Political Science and Law(中国政法大学)

AI总结 LinguaGame通过博弈论范式提升多智能体对话生成的通信效率,利用语言感知推理实现意图和策略的高效沟通。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03132 2026-01-07 eess.SY cs.IT cs.LG cs.SY math.IT

Finite Memory Belief Approximation for Optimal Control in Partially Observable Markov Decision Processes

有限记忆信念近似在部分可观测马尔可夫决策过程中的最优控制中

Mintae Kim

机构 * Hybrid Robotics Lab , University of California, Berkeley(混合机器人实验室,加州大学伯克利分校)

AI总结 本文提出有限记忆信念近似在部分可观测马尔可夫决策过程中的应用,通过度量理论分析信息损失与控制性能的关系,并验证了在LQG系统中信念不匹配随记忆长度的指数衰减。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02906 2026-01-07 cs.CL

Linear Script Representations in Speech Foundation Models Enable Zero-Shot Transliteration

语音基础模型中的线性脚本表示可实现零样本转写

Ryan Soh-Eun Shim, Kwanghee Choi, Kalvin Chang, Ming-Hao Hsu, Florian Eichin, Zhizheng Wu, Alane Suhr, Michael A. Hedderich, David Harwath, David R. Mortensen, Barbara Plank

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Texas at Austin(德克萨斯大学奥斯汀分校) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 通过在语音基础模型中引入线性脚本表示,实现对语音识别输出脚本的零样本控制,提升多语言转写性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00970 2026-01-06 cs.LG

Zero-shot Forecasting by Simulation Alone

仅通过模拟进行零样本预测

Boris N. Oreshkin, Mayank Jauhari, Ravi Kiran Selvam, Malcolm Wolff, Wenhao Pan, Shankar Ramasubramanian, Kin G. Olivares, Tatiana Konstantinova, Andres Potapczynski, Mengfei Cao, Dmitry Efimov, Michael W. Mahoney, Andrew G. Wilson

机构 * Amazon(亚马逊公司) UC Berkeley(加州大学伯克利分校) New York University(纽约大学) University of Washington(华盛顿大学)

AI总结 SarSim0通过SARIMA模型生成模拟数据,实现高效的零样本时间序列预测,超越现有统计模型和基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06364 2026-01-05 cs.LG

Sketch to Adapt: Fine-Tunable Sketches for Efficient LLM Adaptation

草图以适应:用于高效大语言模型适应的可调节草图

Tianyi Zhang, Junda Su, Aditya Desai, Oscar Wu, Zhaozhuo Xu, Anshumali Shrivastava

机构 * Rice University, Houston, TX(里士满大学) University of California, Berkeley, Berkeley, CA(加州大学伯克利分校) Stevens Institute of Technology, Hoboken, NJ(史蒂文斯理工学院) ThirdAI Corp.(ThirdAI公司) Ken Kennedy Institute(肯尼迪研究所)

AI总结 SketchTune通过压缩和适应一体化的方法,实现更高效的大语言模型适应,优于现有PEFT方法。

Comments Published in ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05022 2026-01-05 cs.RO

Dynamic Gap: Safe Gap-based Navigation in Dynamic Environments

动态间隙:动态环境中的安全间隙导航

Max Asselmeier, Dhruv Ahuja, Abdel Zaro, Ahmad Abuaish, Ye Zhao, Patricio A. Vela

机构 * Institute for Robotics and Intelligent Machines, Georgia Institute of Technology(机器人与智能机器研究所,佐治亚理工学院) School of Electrical and Computer Engineering, Georgia Institute of Technology(电气与计算机工程学院,佐治亚理工学院) Department of Mechanical Engineering, University of California, Berkeley(机械工程系,加州大学伯克利分校)

AI总结 本文提出动态间隙规划器,通过生成可证明的无碰撞属性,提升动态环境中基于间隙的导航安全性与效率。

Comments Accepted to 2025 International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25072 2026-01-01 cs.RO cs.AI cs.LG

Coordinated Humanoid Manipulation with Choice Policies

协调的人形机器人操作与选择策略

Haozhi Qi, Yen-Jen Wang, Toru Lin, Brent Yi, Yi Ma, Koushil Sreenath, Jitendra Malik

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 本文提出选择策略,通过模块化遥控和模仿学习,实现人形机器人在无结构环境中的协调操作与高效学习。

Comments Code and Website: https://choice-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23675 2026-01-01 cs.LG

End-to-End Test-Time Training for Long Context

端到端的测试时间训练用于长上下文

Arnuv Tandon, Karan Dalal, Xinhao Li, Daniel Koceja, Marcel Rød, Sam Buchanan, Xiaolong Wang, Jure Leskovec, Sanmi Koyejo, Tatsunori Hashimoto, Carlos Guestrin, Jed McCaleb, Yejin Choi, Yu Sun

机构 * NVIDIA(NVIDIA公司) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) UC San Diego(圣地亚哥大学)

AI总结 本文提出了一种端到端的测试时间训练方法,通过在测试时进行token预测和训练时的元学习,实现长上下文处理,具有与完整注意力相同的扩展性但更高效的推理速度。

Comments Code: https://github.com/test-time-training/e2e

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17221 2026-01-01 cs.CV

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

DAVE: 一种用于文档理解与网络代理的视觉编码器

Brandon Huang, Hang Hua, Zhuoran Yu, Trevor Darrell, Rogerio Feris, Roei Herzig

机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) UC Berkeley(加州大学伯克利分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24386 2026-01-01 cs.CV cs.DC

RedunCut: Measurement-Driven Sampling and Accuracy Performance Modeling for Low-Cost Live Video Analytics

RedunCut: 用于低成本实时视频分析的测量驱动采样与精度性能建模

Gur-Eyal Sela, Kumar Krishna Agrawal, Bharathan Balaji, Joseph Gonzalez, Ion Stoica

机构 * UC Berkeley(伯克利大学)

AI总结 RedunCut通过测量驱动的采样和精度模型,有效降低实时视频分析的计算成本,提升系统在多样负载下的鲁棒性与准确性。

Comments 21 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24063 2026-01-01 cs.LG

How and Why LLMs Generalize: A Fine-Grained Analysis of LLM Reasoning from Cognitive Behaviors to Low-Level Patterns

LLMs如何泛化:从认知行为到低级模式的细粒度分析

Haoyue Bai, Yiyou Sun, Wenjie Hu, Shi Qiu, Maggie Ziyu Huan, Peiyang Song, Robert Nowak, Dawn Song

机构 * University of Wisconsin, Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校) University of Pennsylvania(宾夕法尼亚大学) California Institute of Technology(加州理工学院)

AI总结 本文通过细粒度分析揭示LLMs在SFT和RL微调下的泛化差异,提出基于核心技能的基准测试,揭示RL模型在推理稳定性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22489 2026-01-01 cs.CV

Tracking by Predicting 3-D Gaussians Over Time

通过时间预测三维高斯分布进行跟踪

Tanish Baranwal, Himanshu Gaurav Singh, Jathushan Rajasegaran, Jitendra Malik

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 Video-GMAE通过时间预测三维高斯分布实现自监督视频跟踪,显著提升了Kinetics和Kubric数据集的跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16881 2026-01-01 cs.RO cs.LG

PolaRiS: Scalable Real-to-Sim Evaluations for Generalist Robot Policies

PolaRiS:面向通用机器人策略的可扩展真实-仿真评估

Arhan Jain, Mingtong Zhang, Kanav Arora, William Chen, Marcel Torne, Muhammad Zubair Irshad, Sergey Zakharov, Yue Wang, Sergey Levine, Chelsea Finn, Wei-Chiu Ma, Dhruv Shah, Abhishek Gupta, Karl Pertsch

机构 * University of Washington(华盛顿大学) Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Toyota Research Institute(丰田研究中心) University of Southern California(南加州大学) Cornell University(康奈尔大学)

AI总结 PolaRiS通过神经重建和数据协同训练,实现高保真度的机器人策略真实-仿真评估,提升仿真与现实的关联性并简化环境构建。

Comments Website: https://polaris-evals.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03734 2026-01-01 cs.RO cs.CV

OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction

OTTER: 一种具有文本感知视觉特征提取的视觉-语言-动作模型

Huang Huang, Fangchen Liu, Letian Fu, Tingfan Wu, Mustafa Mukadam, Jitendra Malik, Ken Goldberg, Pieter Abbeel

机构 * University of California, Berkeley(加州大学伯克利分校) Meta AI

AI总结 OTTER通过文本感知的视觉特征提取,提升视觉-语言-动作模型的零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15241 2026-01-01 cs.CL cs.AI cs.IR

Quantifying Positional Biases in Text Embedding Models

量化文本嵌入模型中的位置偏差

Reagan J. Lee, Samarth Goel, Kannan Ramchandran

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本研究量化了文本嵌入模型中位置偏差的影响,发现模型倾向于优先处理输入开头部分,且位置越远离开头,句子重要性越低。

Comments 13 pages, 11 figures, NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06507 2026-01-01 cs.CV

Reconstructing Hand-Held Objects in 3D from Images and Videos

从图像和视频中重建手持物体的三维结构

Jane Wu, Georgios Pavlakos, Georgia Gkioxari, Jitendra Malik

机构 * UC Berkeley(伯克利大学) UT Austin(德克萨斯大学奥斯汀分校) Caltech(加州理工学院)

AI总结 本文提出了一种基于3D手和物体联合重建的方法,通过检索增强重建实现对视频中手持物体的高效三维重建。

Comments 3DV 2026, Project page: https://janehwu.github.io/mcc-ho

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23722 2026-01-01 cs.CL

Emergent World Beliefs: Exploring Transformers in Stochastic Games

涌现的世界信念:探索变换器在随机游戏中的应用

Adam Kamel, Tanish Rastogi, Michael Ma, Kailash Ranganathan, Kevin Zhu

机构 * University of Waterloo(多伦多大学) University of California, Berkeley(加州大学伯克利分校) Algoverse AI Research(Algoverse人工智能研究)

AI总结 本文研究了LLMs在扑克等信息不完全领域中学习随机环境表示的能力,通过预训练和内部激活探测,展示了模型能自主学习确定性和随机性特征。

Comments Accepted at NeurIPS 2025 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23928 2025-12-30 cs.RO cs.CV

Adaptive Keyframe Selection for Scalable 3D Scene Reconstruction in Dynamic Environments

动态环境中可扩展3D场景重建的自适应关键帧选择

Raman Jha, Yang Zhou, Giuseppe Loianno

机构 * Department of Electrical and Computer Engineering, New York University, Brooklyn, NY 11201, USA(电气与计算机工程系,纽约大学,布鲁克林,NY 11201, USA) Department of Electrical Engineering and Computer Sciences, University of California, Berkeley, CA 94720, USA(电气工程与计算机科学系,加州大学伯克利分校,CA 94720, USA)

AI总结 本文提出自适应关键帧选择方法,通过动态调整阈值提升动态环境中3D场景重建质量,实验验证其在Spann3r和CUT3R网络中的有效性。

Comments Accepted at ROBOVIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15965 2025-12-30 cs.LG cs.AI cs.DC

RLinf: Flexible and Efficient Large-scale Reinforcement Learning via Macro-to-Micro Flow Transformation

RLinf: 通过宏到微流转换实现灵活高效的大型强化学习

Chao Yu, Yuanqing Wang, Zhen Guo, Hao Lin, Si Xu, Hongzhi Zang, Quanlu Zhang, Yongji Wu, Chunyang Zhu, Junhao Hu, Zixiao Huang, Mingjie Wei, Yuqing Xie, Ke Yang, Bo Dai, Zhexuan Xu, Jiakun Du, Xiangyuan Wang, Xu Fu, Letong Shi, Zhihao Liu, Kang Chen, Weilin Liu, Gang Liu, Boxun Li, Jianlei Yang, Zhi Yang, Guohao Dai, Yu Wang

机构 * Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Infinigence AI Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Beihang University(北航) Shanghai Jiaotong University(上海交通大学)

AI总结 RLinf通过宏到微流转换范式,实现了高效灵活的大型强化学习训练系统,显著提升了训练吞吐量。

Comments GitHub Repo: https://github.com/RLinf/RLinf

详情

展开后加载摘要…

URL PDF HTML 收藏