From Model Scaling to System Scaling: Scaling the Harness in Agentic AI
从模型扩展到系统扩展:扩展智能体AI中的“缰绳”
机构 * UC Berkeley(伯克利大学)
AI总结 本文提出智能体AI的下一个瓶颈是系统扩展而非仅模型扩展,通过设计可审计、持久、模块化和可验证的架构(称为“缰绳”),并研究上下文治理、可信记忆和动态技能路由三大瓶颈,以推动智能体行为从模型能力向长期任务执行转化。
高校专区
从模型扩展到系统扩展:扩展智能体AI中的“缰绳”
机构 * UC Berkeley(伯克利大学)
AI总结 本文提出智能体AI的下一个瓶颈是系统扩展而非仅模型扩展,通过设计可审计、持久、模块化和可验证的架构(称为“缰绳”),并研究上下文治理、可信记忆和动态技能路由三大瓶颈,以推动智能体行为从模型能力向长期任务执行转化。
循环扩散语言模型
机构 * KAIST(韩国科学技术院) ; KRAFTON(KRAFTON公司) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出LoopMDM,通过选择性循环早期-中间Transformer层,在训练时实现深度缩放效果而不增加参数,在推理时通过调整循环次数灵活扩展计算量,从而提升掩码扩散模型的训练效率和性能。
Comments 23 pages
HoLoArm: 用于碰撞容忍四旋翼飞行的可变形臂
机构 * Japan Advanced Institute of Science and Technology(日本先进科学技术研究所) ; University of California Berkeley(加州大学伯克利分校) ; New York University(纽约大学)
AI总结 受蜻蜓翅膀结脉结构启发,提出具有柔性臂的四旋翼HoLoArm,结合强化学习控制策略实现被动变形与快速恢复,在高达7.6 m/s碰撞速度下保持稳定飞行。
Comments 8 pages, 15 figures, 1 table, Accepted at the IEEE Robotics and Automation Letters (RA-L) and the IEEE International Conference on Robotics and Automation (ICRA), 2026
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 3, pp. 3582-3589, March 2026
OPAL: 全方位路径高效空中三维探索
机构 * Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系)
AI总结 提出OPAL框架,通过在歧义分支点进行360度偏航旋转替代计算密集的全局路径规划,实现计算简单、路径短且覆盖率高的自主探索。
Comments Submitted to IEEE Robotics and Automation Letters (RA-L)
基准测试与改进LLMs中的分布外对齐失败监控器
机构 * University of California, Berkeley, USA(加州大学伯克利分校) ; Haize Labs, New York, USA(Haize实验室) ; Google DeepMind, India(谷歌DeepMind)
AI总结 针对大语言模型在分布外情境下的安全与对齐失败问题,提出MOOD基准并证明结合守卫模型与OOD检测器可提升监控召回率。
扩散模型的多目标学习:半监督学习下的统计理论
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 针对扩散模型在多目标学习中因模型容量增大导致统计成本高的问题,提出半监督两阶段训练方法,利用未标记数据通过伪样本蒸馏,证明所需配对样本量仅取决于专家模型复杂度。
Fishbone: 从一个3D资产到百万可控编辑
机构 * UCLA(加州大学洛杉矶分校) ; USC(南加州大学) ; UC Berkeley(加州大学伯克利分校) ; TRI(技术研究院) ; Stanford(斯坦福大学) ; Utah(犹他大学)
AI总结 提出一种统一的脊-肋表示方法Fishbone,支持通用网格的可控参数化变形、降阶动力学和动画,并构建了Fishbone-136K数据集,应用于可控3D生成、机器人学习数据增强等任务。
Comments 20 pages, 19 figures
DexSIM: 具有统一因果视频扩散的实时灵巧仿真
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 提出DexSIM框架,通过两阶段训练(双向视频扩散和自回归滚动训练)实现实时、长时一致的灵巧操作仿真,在像素相似度、运动保真度和手部投影精度上超越基线。
Comments World Model @ ICLR 2026
Deep ZakaiJ:用于跳跃扩散时间序列预测的结构化滤波
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出Deep ZakaiJ模型,将Zakai非线性滤波方程嵌入神经编码器-解码器架构,通过Strang分裂实现隐状态信念更新,用于部分观测的跳跃扩散系统,在合成、金融和海洋数据集上改进了分布预测并保持点精度竞争力。
基于强化学习的视觉引导户外飞行与避障
机构 * College of Engineering, Department of Electrical Engineering and Computer Science, University of California Berkeley(加州大学伯克利分校工程学院电气工程与计算机科学系)
AI总结 提出一种基于立体视觉深度和视觉惯性里程计的传感器运动策略,通过强化学习和特权学习在仿真中训练,实现零样本迁移到未知户外环境和无人机平台进行自主避障导航。
Comments Published in IEEE Robotics and Automation Letters, vol 11, no 2. Presented at the IEEE International Conference on Robotics and Automation 2026
即时系统的时代已到来:挑战与机遇
机构 * UC Berkeley(加州大学伯克利分校) ; Bespoke Labs
AI总结 本文提出基于LLM的即时系统合成方法Jitskit,通过从零开始合成专用键值存储系统,在18个规格上性能超越现有系统最高达4.6倍。
Comments preprint
HypergraphFormer: 从大语言模型中学习超图以实现可编辑的楼层平面图生成
机构 * Autodesk Research(Autodesk研究院) ; York University(约克大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 提出HypergraphFormer,利用大语言模型学习超图表示来生成楼层平面图,在RPLAN数据集上超越现有方法,并支持任意边界和高度可编辑性。
Stein变分遍历曲面覆盖与SE(3)约束
机构 * Department of Computer Science, TU Darmstadt(图宾根大学计算机科学系) ; Honda Research Institute Europe GmbH(本田欧洲研究院) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出一种基于预条件SE(3) Stein变分梯度下降的采样即优化方法,用于生成满足SE(3)约束的遍历轨迹,实现复杂3D点云曲面的高质量覆盖。
AI-PACE:将人工智能融入医学教育的框架
机构 * Center for Information Technology in the Interest of Society(信息科技促进社会中心) ; University of California, Berkeley(加州大学伯克利分校) ; School of Medicine, Department of Public Health Sciences(医学院公共卫生科学系) ; University of California, Davis(加州大学戴维斯分校) ; School of Medicine, Department of Internal Medicine(医学院内科医学系) ; Research Centre of Big Data and AI for Medicine(医学大数据与人工智能研究中心) ; First Affiliated Hospital of Sun Yat-Sen University(中山大学第一附属医院)
AI总结 本文通过文献综述,提出AI-PACE框架,旨在将人工智能教育系统性地整合到医学培训的各个阶段,强调纵向整合、跨学科合作以及技术与临床应用的平衡。
Comments Version 2: Revisions after round 1 of peer review. Paper under consideration at npj Digital Medicine. 12 pages, 2 figures, 2 tables