MAR:Multi-Agent Reflexion Improves Reasoning Abilities in LLMs
MAR:多智能体反思提升大语言模型的推理能力
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出多智能体反思框架,通过多角色辩论生成多样化反思,解决单模型反思中的思维退化问题,在HotPot QA和HumanEval上分别达到47% EM和82.7%准确率。
高校专区
MAR:多智能体反思提升大语言模型的推理能力
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出多智能体反思框架,通过多角色辩论生成多样化反思,解决单模型反思中的思维退化问题,在HotPot QA和HumanEval上分别达到47% EM和82.7%准确率。
SVRG及其后验校正扩展
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文揭示SVRG与后验校正方法的深层联系,证明SVRG是各向同性高斯后验校正的特例,并通过灵活指数族后验自动导出牛顿型和Adam型新变体。
Comments ICML 2026 (oral)
生理时间序列的自监督动力系统表示
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出PULSE框架,利用动力系统生成模型的信息结构,通过跨重建预训练目标提取共享系统参数信息,丢弃样本特异性噪声,提升生理时间序列的表示学习效果。
Comments Accepted to ICML 2026
线性函数逼近的无投影TD学习的鲁棒 $\widetilde{\mathcal{O}}(1/\sqrt{T})$ 收敛率
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文针对线性函数逼近的时序差分学习,在无投影条件下证明了期望收敛率为 $\widetilde{\mathcal{O}}(\\|\theta^*\\|^2_2/\sqrt{T})$,仅需对学习率进行轻微的对数修正,无需额外正则条件。
从语言反馈中学习的形式化与可证明保证
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学)
AI总结 本文形式化语言反馈学习问题,提出转移埃尔泽维度刻画学习难度,并开发无遗憾算法HELiX,证明其性能保证,展示丰富语言反馈可指数级加速学习。
Comments ICML 2026
ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。
Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3
文档数据提取的视觉模板推断
机构 * UC Berkeley(加州大学伯克利分校)
AI总结 提出TWIX工具,通过推断文档的视觉模板来高效、低成本地提取结构化数据,在精度和召回率上优于现有方法,并实现大规模数据集上的显著加速和降本。
BlendServe: 利用资源感知批处理优化自回归大模型的离线推理
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of California, Davis(加州大学戴维斯分校) ; Rice University(里士满大学)
AI总结 针对离线批处理中资源重叠与前缀共享的冲突,提出资源感知前缀树来最大化资源利用率,相比vLLM和SGLang吞吐量提升1.44倍。
使用分面Rasch项目反应理论和可解释性设计的深度学习测量仇恨言论谱系
机构 * Center for Precision Psychiatry, Mass General Hospital Department of Psychiatry, Harvard Medical School(精准精神病学中心,麻省总医院精神病科,哈佛医学院) ; D-Lab University of California, Berkeley(加州大学伯克利分校D实验室)
AI总结 提出结合监督深度学习与分面Rasch项目反应理论的方法,将仇恨言论分解为10个有序标签,通过IRT模型转化为区间测量值并调整标注者视角,在RoBERTa模型上提升准确性,实现连续谱系测量与可解释性。
Comments 7 pages, 6 figures